SSD Nodes Learn Hosting plans →
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-08-23

VPS पर Nemotron 3.5 Lightning कैसे चलाएं

अपने VPS पर Ollama के साथ Nemotron 3.5 Lightning चलाने का तरीका जानें। इसके लिए आवश्यक 24GB RAM, सही pull tag और CPU-only मोड की वास्तविक गति के बारे में सटीक जानकारी प्राप्त करें।

Nemotron 3.5 Lightning किस लिए है

Nemotron 3.5 Lightning, NVIDIA का 30B mixture-of-experts मॉडल है जिसे अगस्त 2026 में release किया गया था। इसे उन agents के लिए बनाया गया है जो एक chat window के बजाय घंटों तक चलते हैं। MoE (mixture of experts) का अर्थ है कि weights को कई expert sub-networks में विभाजित किया गया है, और प्रत्येक token को उनमें से केवल कुछ के माध्यम से ही route किया जाता है। NVIDIA का model card प्रति token 3 billion active parameters के साथ कुल 30 billion parameters बताता है। आप memory में बड़ी संख्या के लिए भुगतान करते हैं, और बदले में आपको छोटी संख्या के बराबर गति मिलती है।

यह trade ही वह कारण है कि आपको किराए के सर्वर के लिए इस मॉडल पर विचार करना चाहिए। वास्तविक काम करने वाला एक agent दिन भर में हजारों छोटे requests भेजता है, इसलिए प्रति डॉलर throughput यह तय करता है कि क्या वह आपके अपने box पर चल सकता है। जो मॉडल प्रति reply 40 seconds लेता है, वह एक सहायक के रूप में तो ठीक है लेकिन एक agent के रूप में खराब है, क्योंकि एक कार्य में बीस calls होती हैं और आपको हर एक के लिए प्रतीक्षा करनी पड़ती है।

NVIDIA इस architecture को hybrid बताता है: interleaved Mamba-2 और MoE layers के साथ चुनिंदा attention layers। Model card अधिकतम context length 1M tokens तक बताता है और इसमें OpenMDW-1.1 license है, जिसे व्यावसायिक उपयोग के लिए तैयार चिह्नित किया गया है। प्राथमिक भाषाएं English और code हैं, साथ ही Spanish, French, German, Italian और Japanese भी सूचीबद्ध हैं।

Artificial Analysis ने अगस्त 2026 में launch के measurements प्रकाशित किए, जिसमें NVFP4 weights को serve करने वाले pre-release DeepInfra endpoint पर लगभग 670 output tokens प्रति second की गति दिखाई गई। यह एक hosted GPU endpoint है। इसे इस रूप में पढ़ें कि architecture क्या करने में सक्षम है, न कि इस रूप में कि आपका VPS क्या प्रदर्शन करेगा।

कौन सा Ollama tag किस VPS के लिए उपयुक्त है

Ollama library एक ही weights के कई builds प्रकाशित करती है। इनके बीच मुख्य अंतर quantisation का होता है, यानी प्रत्येक weight को कितने bits में store किया जाता है, और इससे download size में काफी बदलाव आता है।

ChartDownload size by Ollama tag, GB (Ollama library, August 2026)
The data behind this chart
[
  {
    "label": "30b-a3b-q4_K_M",
    "size_gb": 25
  },
  {
    "label": "30b-a3b-q8_0",
    "size_gb": 35
  },
  {
    "label": "30b-a3b-bf16",
    "size_gb": 66
  },
  {
    "label": "30b-a3b-mlx",
    "size_gb": 23
  }
]

latest, 30b और 30b-a3b नाम के tags सभी 30b-a3b-q4_K_M के समान digest पर resolve होते हैं, इसलिए default download 25 GB का four-bit build है जिसमें 1M context मिलता है। Q8_0 का आकार 35 GB है और bf16 का आकार 66 GB है, दोनों ही 1M context पर उपलब्ध हैं। 23 GB वाले MLX builds Apple silicon के लिए हैं और इनमें 256K context की सीमा होती है, इसलिए Linux VPS पर इनका उपयोग करना गलत है।

ये download sizes हैं, न कि memory की आवश्यकता। NVIDIA Ollama builds के लिए न्यूनतम VRAM (video RAM) का आंकड़ा प्रकाशित नहीं करती है, इसलिए download size को केवल एक न्यूनतम आधार (floor) मानें। Weights को कहीं न कहीं resident होना पड़ता है; यदि GPU card में जगह है तो वहां, अन्यथा system RAM में, और इसके ऊपर KV cache (key/value cache, जो model की प्रति-token conversation memory है) को जोड़ा जाता है। आपके hardware के लिए वास्तविक संख्या किसी गणना से नहीं, बल्कि नीचे दिए गए command से प्राप्त होती है। यदि आपने अभी तक quantisation level तय नहीं किया है, तो Q4, Q8 और FP16 की लागत क्या है लेख में विस्तार से बताया गया है कि हर चरण पर आप क्या खोते हैं।

सटीक tag का उपयोग करें, latest का नहीं

latest एक बदलता हुआ पॉइंटर है। जब लाइब्रेरी इसे फिर से पब्लिश करती है, तो आपके एजेंट का व्यवहार अगले pull के साथ बदल जाता है, और आपके नोट्स में इसका कोई कारण नहीं होता। इसलिए tag का नाम स्पष्ट लिखें।

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull nemotron-3.5-lightning:30b-a3b-q4_K_M

इंस्टॉल स्क्रिप्ट एक systemd सर्विस सेट करती है जो ollama यूजर के रूप में चलती है और मॉडल्स को /usr/share/ollama/.ollama/models के अंतर्गत रखती है। अधिकांश VPS इमेजेस पर यह पाथ रूट फाइलसिस्टम पर होता है, इसलिए 25 GB की मांग करने से पहले जगह की जांच कर लें। यदि वह फाइलसिस्टम भरा हुआ है, तो pull करने से पहले Ollama मॉडल्स को कहाँ स्टोर करता है और उन्हें कैसे मूव करें पढ़ना, डिस्क भरने के बाद पढ़ने से बेहतर है।

df -h /usr/share/ollama

एक pull जो बीच में रुक जाता है और no space left on device रिपोर्ट करता है, उसका अर्थ बिल्कुल वही है, और आंशिक blobs तब तक डिस्क पर रहते हैं जब तक आप उन्हें डिलीट नहीं करते। उसके बाद पुष्टि करें कि क्या डाउनलोड हुआ:

ollama show nemotron-3.5-lightning:30b-a3b-q4_K_M

ollama show आर्किटेक्चर, पैरामीटर काउंट, कॉन्टेक्स्ट लेंथ और फाइल में मौजूद क्वांटाइजेशन को प्रिंट करता है। यदि इनमें से कोई भी लाइब्रेरी पेज से मेल नहीं खाता है, तो आपने उस tag के बजाय कोई दूसरा tag pull कर लिया है जिसे आप चाहते थे।

इसे सर्व करें, और जाँचें कि यह वास्तव में कहाँ चला

sudo systemctl enable --now ollama
ollama run nemotron-3.5-lightning:30b-a3b-q4_K_M "Reply with one word: ready"

जब मॉडल लोड हो रहा हो, तब एक दूसरे शेल में यह चलाएँ:

ollama ps

यह वह कमांड है जो आपकी मशीन के लिए मेमोरी संबंधी प्रश्न का उत्तर देती है। ollama ps लोड किए गए मॉडल, मेमोरी में उसके द्वारा घेरे गए आकार और एक PROCESSOR कॉलम को प्रिंट करता है। 100% GPU का अर्थ है कि पूरा मॉडल VRAM में है। 100% CPU का अर्थ है कि इसका कोई भी हिस्सा VRAM में नहीं है, और प्रत्येक टोकन सिस्टम RAM का उपयोग करके प्रोसेसर द्वारा कंप्यूट किया जा रहा है। 65%/35% CPU/GPU जैसा विभाजन यह दर्शाता है कि सभी लेयर्स फिट नहीं हुईं, और CPU शेयर आपकी गति निर्धारित करता है। आवश्यकता का अनुमान न लगाएँ। इसे लोड करें और इस लाइन को पढ़ें।

यदि यह बिल्कुल भी लोड नहीं हो पाता है, तो Ollama क्रैश होने के बजाय स्पष्ट रूप से मना कर देता है:

Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB)

क्या केवल CPU वाला VPS पर्याप्त तेज़ है?

एक सामान्य प्रयोजन वाले VPS में GPU नहीं होता है, इसलिए CPU ही सारा काम करता है और सिस्टम RAM से हर आवश्यक weight को पढ़ता है। यहाँ MoE (Mixture of Experts) सहायक होता है, क्योंकि 30 बिलियन पैरामीटर्स में से प्रति टोकन केवल लगभग 3 बिलियन पैरामीटर्स का ही उपयोग होता है, इसलिए प्रति टोकन गणितीय गणना एक सघन (dense) 30B मॉडल की तुलना में काफी कम होती है। मेमोरी पर इसका कोई प्रभाव नहीं पड़ता है। सभी 30 बिलियन पैरामीटर्स को RAM में रहना अनिवार्य है, क्योंकि राउटर किसी भी टोकन के लिए किसी भी expert को चुन सकता है।

इसलिए, इस मॉडल पर केवल CPU का उपयोग करके inference की गति core count के बजाय मेमोरी बैंडविड्थ द्वारा सीमित होती है। ऐसे प्लान में vCPU जोड़ने से बहुत कम अंतर पड़ता है जिसमें पहले से ही पर्याप्त संख्या में vCPU मौजूद हैं। आपको बस इतनी RAM की आवश्यकता है जो weights और आपके KV cache को समाहित कर सके, साथ ही प्लान में मिलने वाली सबसे तेज़ मेमोरी का उपयोग करें।

किसी एजेंट को उस पर तैनात करने से पहले, स्थानीय LLM के लिए टोकन प्रति सेकंड मापने की विधि का उपयोग करके इसकी गति मापें:

ollama run --verbose nemotron-3.5-lightning:30b-a3b-q4_K_M "Write a 200 word summary of TCP slow start."

अंत में प्रिंट होने वाली eval rate लाइन आपकी generation गति है, जिसे टोकन प्रति सेकंड में मापा जाता है। यह एकल संख्या ही निर्णय लेती है, क्योंकि एजेंट का वास्तविक समय (wall-clock time) मुख्य रूप से इसी पर निर्भर करता है। इसे अपने अपेक्षित उत्तर की लंबाई से गुणा करें, और यदि उत्तर आपके प्रतीक्षा करने की क्षमता से अधिक लंबा है, तो num_predict के साथ आउटपुट को सीमित करना वह एकमात्र विकल्प है जो हार्डवेयर बदले बिना एक कॉल की अवधि को नियंत्रित करता है।

ChartAverage seconds per Intelligence Index task (Artificial Analysis, published August 2026)
The data behind this chart
[
  {
    "label": "Nemotron 3.5 Lightning",
    "sec_per_task": 30
  },
  {
    "label": "gpt-oss-120b",
    "sec_per_task": 204
  },
  {
    "label": "Qwen3.6 35B",
    "sec_per_task": 210
  }
]

ये प्रकाशित तृतीय-पक्ष आंकड़े हैं, जिन्हें Artificial Analysis द्वारा लॉन्च के समय रिपोर्ट किए गए प्रति-कार्य मिनटों से परिवर्तित किया गया है, और इन्हें VPS के बजाय होस्ट किए गए GPU एंडपॉइंट्स पर मापा गया था। Nemotron 3.5 Lightning ने प्रति कार्य औसतन 30 सेकंड का समय लिया, जहाँ gpt-oss-120b में लगभग 204 और Qwen3.6 35B में लगभग 210 का समय लगा। इनका उपयोग अंतर के स्वरूप को समझने के लिए करें, न कि अपने हार्डवेयर के प्रदर्शन के वादे के रूप में।

ईमानदार सलाह इस बात पर निर्भर करती है कि प्रतीक्षा कौन कर रहा है। यदि कोई व्यक्ति एजेंट के उत्तर की प्रतीक्षा कर रहा है, या एजेंट लगातार लंबी कॉल की श्रृंखला बनाता है, तो GPU क्षमता किराए पर लें। यदि यह रात भर शेड्यूल पर चलता है और कोई इसे नहीं देख रहा है, तो अधिक RAM वाला CPU प्लान एक उचित विकल्प है। किसी भी स्थिति में सेटअप समान रहता है, और VPS पर Ollama चलाना प्लान के आकार और GPU इंस्टेंस की तुलना API प्रदाता को प्रति टोकन भुगतान करने से करने के बारे में जानकारी देता है। ब्रेक-ईवन (लाभ-हानि का संतुलन) उपयोग के प्रश्न पर निर्भर करता है: GPU इंस्टेंस हर घंटे का बिल बनाता है, जबकि API टोकन केवल उपयोग किए जाने पर बिल बनाते हैं। इसलिए, जो एजेंट दिन भर व्यस्त रहता है, उसके लिए अपना स्वयं का सर्वर बेहतर है, और जो एजेंट घंटे में दो बार चलता है, उसके लिए API बेहतर है।

1M context window मुफ्त नहीं है

1M tokens मॉडल की अधिकतम क्षमता है, और Ollama इसे डिफ़ॉल्ट रूप से आपको नहीं देता है। Ollama बहुत छोटी डिफ़ॉल्ट विंडो का उपयोग करता है और बातचीत के उस सीमा को पार करते ही सबसे पुराने tokens को हटा देता है। ऐसा होने पर कोई लॉग दर्ज नहीं होता है, इसलिए एक एजेंट के लिए ऐसा लगता है जैसे मॉडल अपने ही कार्य की शुरुआत को भूल गया है।

विंडो को जानबूझकर सेट करें। पूरे सर्वर के लिए, सर्विस को एडिट करें:

sudo systemctl edit ollama

इसे जोड़ें, फिर sudo systemctl restart ollama चलाएं:

[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"

प्रति अनुरोध, इसके बजाय options ऑब्जेक्ट में num_ctx भेजें:

curl http://localhost:11434/api/chat -d '{
  "model": "nemotron-3.5-lightning:30b-a3b-q4_K_M",
  "messages": [{"role": "user", "content": "Say ready"}],
  "options": {"num_ctx": 32768},
  "stream": false
}'

प्रत्येक वृद्धि मेमोरी की खपत बढ़ाती है, क्योंकि KV cache आपके द्वारा अनुमति दिए गए tokens की संख्या के साथ बढ़ता है। मान बढ़ाएं, रीस्टार्ट करें, फिर दोबारा ollama ps चलाएं और रिपोर्ट किए गए आकार को बढ़ते हुए देखें। यदि उस बदलाव के बाद PROCESSOR कॉलम 100% GPU से split में बदल जाता है, तो KV cache ने मॉडल लेयर्स को VRAM से बाहर धकेल दिया है और आपकी गति काफी कम हो जाएगी। Ollama में num_ctx चुनना इस ट्रेड-ऑफ पर विस्तार से चर्चा करता है। केवल इसलिए 1000000 सेट न करें क्योंकि मॉडल कार्ड इसकी अनुमति देता है, क्योंकि एलोकेशन पहले ही हो जाता है और लोड विफल हो जाता है।

इसे हमेशा चालू रहने वाले एजेंट से जोड़ना

Ollama के इस मॉडल के लॉन्च पोस्ट में एक शॉर्टकट दिया गया है जो एक समर्थित एजेंट को सीधे इस मॉडल पर पॉइंट करके शुरू करता है:

ollama launch claude --model nemotron-3.5-lightning

यह पोस्ट उस स्थान पर claude, opencode, openclaw और hermes का उल्लेख करती है। इस सब-कमांड के लिए Ollama का नवीनतम संस्करण आवश्यक है, इसलिए पहले ollama --version की जाँच करें। यदि यह उपलब्ध नहीं है, तो एजेंट को स्वयं API पर पॉइंट करें। Ollama एक OpenAI-संगत एंडपॉइंट प्रदान करता है, जिसे अधिकांश एजेंट हार्नेस स्वीकार कर लेते हैं:

export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama

Ollama इस की (key) को अनदेखा कर देता है, लेकिन अधिकांश क्लाइंट्स बिना की सेट किए शुरू होने से मना कर देते हैं। इस प्रक्रिया का हार्नेस पक्ष Ollama पर कोडिंग एजेंट को पॉइंट करना और अपना स्वयं का OpenClaw एजेंट बनाना में कवर किया गया है।

जब एजेंट बिना किसी निगरानी के चलता है, तो सर्वर की दो सेटिंग्स महत्वपूर्ण हो जाती हैं। OLLAMA_KEEP_ALIVE यह नियंत्रित करता है कि अंतिम अनुरोध के बाद मॉडल कितनी देर तक मेमोरी में रहेगा। डिफ़ॉल्ट रूप से यह इसे पांच मिनट बाद अनलोड कर देता है, जिससे अगली कॉल पर फिर से पूरा लोड समय लगता है। बिना GPU वाली 25 GB की फाइल पर यह विराम इतना लंबा होता है कि टाइमआउट हो सकता है। इसे मेमोरी में बनाए रखने के लिए OLLAMA_KEEP_ALIVE=-1 सेट करें। OLLAMA_HOST=0.0.0.0:11434 API को अन्य मशीनों से सुलभ बनाता है। इसमें किसी भी प्रकार का प्रमाणीकरण (authentication) नहीं होता है, इसलिए इसे केवल फायरवॉल नियम या प्राइवेट नेटवर्क के पीछे ही खोलें।

विफलता के प्रकार और दिखाई देने वाले संदेश

पुल (pull) तुरंत विफल हो जाता है। Error: pull model manifest: file does not exist का अर्थ है कि वह टैग मौजूद नहीं है। टैग के नाम सटीक स्ट्रिंग होते हैं, इसलिए अनुमान लगाने के बजाय लाइब्रेरी पेज से टैग को कॉपी करें।

मॉडल लोड नहीं होगा। Error: model requires more system memory (28.4 GiB) than is available (15.6 GiB) का अर्थ है कि कॉन्फ़िगरेशन के अनुसार टैग इस प्लान के लिए बहुत बड़ा है। छोटे क्वांटिज़ेशन (quantisation) का उपयोग करें या OLLAMA_CONTEXT_LENGTH को कम करें, क्योंकि KV कैश की गणना उस आवश्यकता के भीतर ही की जाती है।

पोर्ट 11434 पर कोई प्रतिक्रिया नहीं मिल रही है। curl: (7) Failed to connect to localhost port 11434 का अर्थ है कि सर्विस चल नहीं रही है, या जहाँ आप उम्मीद कर रहे हैं वहाँ लिसन (listen) नहीं कर रही है। systemctl status ollama और journalctl -u ollama -n 50 को पढ़ें। यदि आपने ollama serve को मैन्युअल रूप से भी शुरू किया है, तो दूसरी कॉपी Error: listen tcp 127.0.0.1:11434: bind: address already in use के साथ बंद हो जाएगी।

यह बहुत धीमी गति से उत्तर देता है। कुछ भी बदलने से पहले ollama ps की जाँच करें। GPU मशीन पर PROCESSOR कॉलम में CPU शेयर का मतलब है कि मॉडल का कुछ हिस्सा VRAM से बाहर चला गया है, इसलिए कॉन्टेक्स्ट को कम करें या छोटा क्वांटिज़ेशन चुनें। बिना GPU वाली मशीन पर, धीमी गति अपेक्षित परिणाम है और कोई भी सेटिंग इसे ठीक नहीं कर सकती।

एजेंट कार्य के बीच में ही अपने निर्देश भूल जाता है। बातचीत कॉन्टेक्स्ट विंडो से आगे निकल गई है और सबसे पुराने टोकन चुपचाप हटा दिए गए हैं। OLLAMA_CONTEXT_LENGTH को बढ़ाएं, ollama ps के साथ पुष्टि करें कि मॉडल अभी भी फिट बैठता है, और यदि अब ऐसा नहीं है, तो समाधान छोटी विंडो के बजाय बड़ी मशीन का उपयोग करना है।

यह मॉडल अन्य विकल्पों की तुलना में कहाँ स्थित है

30B MoE एक छोटे कार्य के लिए होस्ट करने हेतु बहुत बड़ा मॉडल है। यदि एक dense 8B मॉडल पहले से ही आपके कार्य को संभाल लेता है, तो उसे चलाना और लोड करना काफी सस्ता और तेज होगा, और VPS पर Qwen 3 के 8B और 27B मॉडल इस निर्णय के लिए सीधा तुलनात्मक अध्ययन है। किसी दिए गए प्लान में वास्तव में क्या समा सकता है, इसके व्यापक सर्वेक्षण के लिए, आप किन AI मॉडलों को स्वयं-होस्ट कर सकते हैं से शुरुआत करें। यदि आप एक के बजाय एक साथ कई agents को serve करने की योजना बना रहे हैं, तो पहले Ollama की vLLM के साथ तुलना पढ़ें, क्योंकि Ollama समवर्ती अनुरोधों (concurrent requests) को उस तरह से batch नहीं करता है जैसे एक production inference server करता है, और यहीं पर एक single-user सेटअप की स्केलिंग रुक जाती है।

FAQ

Linux VPS पर मुझे कौन सा Nemotron 3.5 Lightning tag pull करना चाहिए?

nemotron-3.5-lightning:30b-a3b-q4_K_M का उपयोग करें। यह 25 GB का है, इसमें पूर्ण 1M अधिकतम context उपलब्ध है, और अगस्त 2026 तक यह वही digest है जिस पर latest, 30b और 30b-a3b tags point करते हैं। latest को pull करने के बजाय इसे स्पष्ट रूप से नाम दें, ताकि उस pointer के भविष्य में republish होने पर आपके agent का व्यवहार आपकी जानकारी के बिना न बदले। mlx tags Apple silicon builds हैं और वे Linux पर काम नहीं करेंगे।

Nemotron 3.5 Lightning को कितनी RAM की आवश्यकता है?

NVIDIA ने Ollama builds के लिए न्यूनतम memory का कोई आंकड़ा जारी नहीं किया है, इसलिए अनुमान लगाने के बजाय मापें। Tag को pull करें, model को एक बार run करें, और load होने के दौरान ollama ps को पढ़ें: यह वास्तविक रूप से occupy की गई size को print करता है और यह भी बताता है कि model GPU पर load हुआ है या CPU पर। Download size, जो default tag के लिए 25 GB है, एक न्यूनतम सीमा है, क्योंकि KV cache इसके ऊपर जुड़ता है और आपके द्वारा set किए गए context window के साथ बढ़ता है। यदि plan बहुत छोटा है, तो Ollama model requires more system memory error के साथ मना कर देता है और दोनों numbers को दर्शाता है।

क्या मैं बिना GPU वाले VPS पर Nemotron 3.5 Lightning चला सकता हूँ?

हाँ, यदि plan में weights को hold करने के लिए पर्याप्त RAM है। MoE design इसमें मदद करता है क्योंकि 30 billion parameters में से प्रति token केवल 3 ही compute होते हैं। समस्या गति की है। GPU के बिना model memory bandwidth द्वारा सीमित रहता है, इसलिए vCPUs बढ़ाने से परिणाम में कोई खास सुधार नहीं होता। एक fixed prompt के साथ ollama run --verbose को run करें, eval rate line को पढ़ें, और उस संख्या की तुलना अपने agent की समय-सीमा से करें। रात भर चलने वाले batch job के लिए यह अक्सर ठीक रहता है। किसी ऐसे काम के लिए जिसका इंतज़ार कोई व्यक्ति कर रहा हो, यह आमतौर पर उपयुक्त नहीं है।

Ollama मुझे पूर्ण 1M context window क्यों नहीं देता है?

1M model की अधिकतम क्षमता है, Ollama का default नहीं। Ollama बहुत छोटा window apply करता है और conversation के उससे अधिक होने पर सबसे पुराने tokens को हटा देता है, बिना कोई error दिए, जिसे पढ़ने पर ऐसा लगता है कि agent अपने निर्देश भूल गया है। systemd service पर OLLAMA_CONTEXT_LENGTH set करें, या प्रति request num_ctx पास करें। इसे चरणों में बढ़ाएं और हर बार ollama ps को दोबारा जांचें, क्योंकि KV cache memory window के साथ scale होती है और model layers को GPU से बाहर धकेल सकती है।

क्या Nemotron 3.5 Lightning व्यावसायिक उपयोग के लिए निःशुल्क है?

NVIDIA का model card इस model को OpenMDW-1.1 license के अंतर्गत रखता है और इसे व्यावसायिक उपयोग के लिए तैयार बताता है। यह उन weights पर लागू होता है जिन्हें आप download करके स्वयं run करते हैं। यह आपके stack में मौजूद अन्य software के बारे में कुछ नहीं कहता, इसलिए agent harness और उससे जुड़े किसी भी tool के license को अलग से जांचें, और इस पर किसी भी अनुबंध संबंधी निर्णय लेने से पहले वर्तमान model card को पढ़ें।