SSD Nodes Learn Hosting plans →
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-08-24

VPS पर Ollama के साथ GLM 5.2 कैसे चलाएं

क्या आप VPS पर GLM 5.2 चला सकते हैं? Ollama लाइब्रेरी में यह मॉडल क्लाउड-ओनली है। जानें कि कौन सा GLM मॉडल आपके सर्वर पर चलेगा और प्रत्येक क्वांटाइजेशन के लिए कितनी RAM चाहिए।

क्या आप VPS पर GLM 5.2 चला सकते हैं?

नहीं, और कोई भी सर्वर किराए पर लेने से पहले इसका कारण जानना जरूरी है। 18 अगस्त 2026 तक, Ollama की लाइब्रेरी में GLM 5.2 में केवल एक टैग है, glm-5.2:cloud। :cloud टैग Ollama के सर्वर पर चलता है। आपका बॉक्स प्रॉम्प्ट भेजता है और टोकन प्राप्त करता है, इसलिए वेट्स (weights) कभी भी आपकी डिस्क तक नहीं पहुँचते हैं। यह मॉडल 756 बिलियन पैरामीटर्स का है। 756 बिलियन पैरामीटर्स पर प्रति पैरामीटर चार बिट्स का मतलब लगभग 378 GB वेट्स है, और यह कॉन्टेक्स्ट, एक्टिवेशन या ऑपरेटिंग सिस्टम से पहले की सामान्य गणना है। कोई भी मानक VPS प्लान इतनी मेमोरी नहीं देता है।

GLM मॉडल जो आपके द्वारा किराए पर लिए गए सर्वर पर चल सकता है, वह glm-4.7-flash है। इसे 4 टैग्स में डाउनलोड करने योग्य वेट्स के साथ प्रकाशित किया गया है। यह एक mixture-of-experts मॉडल है, जिसका अर्थ है कि प्रत्येक टोकन के लिए नेटवर्क का केवल एक छोटा हिस्सा चलता है, और Z.ai इसे 30B-A3B के रूप में वर्णित करता है: कुल 30 बिलियन पैरामीटर्स, प्रति टोकन लगभग 3 बिलियन सक्रिय। इसलिए यह गाइड उस प्रश्न का उत्तर देती है जिस पर आप कार्य कर सकते हैं। एक टैग पिन करें, बॉक्स का आकार निर्धारित करें, अपनी गति मापें और एंडपॉइंट को निजी रखें।

कोई भी कमांड कॉपी करने से पहले टैग को सत्यापित करें, जिसमें यहाँ दी गई कमांड्स भी शामिल हैं। Ollama की लाइब्रेरी बिना किसी सूचना के बदल जाती है। glm-4.7-flash टैग सूची खोलें और पुष्टि करें कि टैग अभी भी मौजूद है। यदि स्थानीय वेट्स के साथ कोई नया GLM रिलीज़ आया है, तो उसे प्राथमिकता दें, और रिकॉर्ड करें कि आपने वास्तव में किस टैग का परीक्षण किया है।

यदि आप फिर भी GLM 5.2 ही चाहते हैं, तो ollama signin के बाद ollama run glm-5.2:cloud काम करता है, और क्लाइंट की तरफ से यह किसी अन्य Ollama मॉडल की तरह ही व्यवहार करता है। समझें कि आप किस बात के लिए सहमति दे रहे हैं: प्रॉम्प्ट आपके सर्वर से बाहर जाता है। यदि आपका सेल्फ-होस्टिंग का कारण यह है कि डेटा आपकी मशीन पर ही रहना चाहिए, तो :cloud टैग उस आवश्यकता को पूरा नहीं करता है।

कौन से GLM tags मौजूद हैं, और किसे पिन (pin) करना चाहिए

यहाँ तीन आधिकारिक GLM entries मायने रखती हैं। glm-5.2 और glm-5.1 केवल cloud के लिए हैं। glm-4.7-flash local संस्करण है, और ये इसके प्रकाशित tags हैं, साथ ही Ollama द्वारा प्रत्येक के लिए सूचीबद्ध download size भी दी गई है।

Chartglm-4.7-flash tags in Ollama's library, checked 2026-08-18
The data behind this chart
[
  {
    "label": "q4_K_M",
    "download_gb": 19
  },
  {
    "label": "latest",
    "download_gb": 19
  },
  {
    "label": "q8_0",
    "download_gb": 32
  },
  {
    "label": "bf16",
    "download_gb": 60
  }
]

ये library page से लिए गए प्रकाशित आंकड़े हैं, न कि मापे गए मान। latest और q4_K_M दोनों 19 GB पर सूचीबद्ध हैं, इसलिए latest वर्तमान में Q4 build को दर्शाता है। किसी भी republish पर यह बदल सकता है, इसीलिए आपको कभी भी किसी script या Dockerfile में केवल ollama pull glm-4.7-flash नहीं लिखना चाहिए। Quantisation का नाम लिखें। सबसे बड़ा tag, bf16, एक 60 GB की download है जिसमें unquantised bfloat16 weights शामिल हैं।

Library पर खोज करने पर namespaced uploads भी मिलते हैं जिनके नाम में slash होता है, जैसे someuser/glm-5.2। Slash का अर्थ है कि इसे किसी user account द्वारा प्रकाशित किया गया है, इसलिए यह आधिकारिक entry के बजाय एक community re-upload है। कोई भी यह गारंटी नहीं देता कि अंदर कौन से weights हैं। किसी भी unsigned binary के साथ जैसा व्यवहार आप करते हैं, वैसा ही इनके साथ भी करें।

Ollama इंस्टॉल करें और सटीक tag pull करें

Ollama का Linux इंस्टॉलर एक ही कमांड है।

curl -fsSL https://ollama.com/install.sh | sh
ollama --version

इंस्टॉलर एक systemd सर्विस बनाता है जो ollama यूजर के रूप में चलती है। कुछ भी pull करने से पहले पुष्टि करें कि यह शुरू हो गई है।

systemctl status ollama --no-pager

Active: active (running) का मतलब है कि API पोर्ट 11434 पर लिसन (listen) कर रही है। यदि यूनिट मौजूद नहीं है, तो इंस्टॉलर एक साधारण बाइनरी इंस्टॉलेशन पर वापस चला गया है, और Ollama Linux documentation में सर्विस फाइल को मैन्युअल रूप से बनाने का तरीका दिया गया है।

glm-4.7-flash पेज पर Ollama का न्यूनतम वर्ज़न सूचीबद्ध है। पुराना बाइनरी मॉडल को धीमा नहीं चलाता, बल्कि उसे चलाने से ही मना कर देता है: pull इस संदेश के साथ विफल हो जाता है कि मॉडल को Ollama के नए वर्ज़न की आवश्यकता है। अपग्रेड करने के लिए इंस्टॉल स्क्रिप्ट को दोबारा चलाएं। 18 अगस्त 2026 तक वर्तमान रिलीज़ 0.32.14 है, जो उस न्यूनतम आवश्यकता से काफी आगे है।

अब नाम के आधार पर एक tag pull करें।

ollama pull glm-4.7-flash:q4_K_M
ollama ls

ollama ls को glm-4.7-flash:q4_K_M को सूचीबद्ध करना चाहिए, जिसका आकार प्रकाशित 19 GB के करीब हो। बीच में विफल हुआ pull कोई भी रन करने योग्य फाइल नहीं छोड़ता, इसलिए उसी कमांड को दोबारा चलाएं। छोटे प्लान पर विफल pull का सबसे सामान्य कारण नेटवर्क समस्या के बजाय डिस्क का फुल होना है, क्योंकि मॉडल को रूट फाइलसिस्टम पर /usr/share/ollama/.ollama/models में लिखा जाता है। शुरू करने से पहले df -h /usr/share/ollama के साथ जांच करें।

प्रत्येक quantisation के लिए कितनी RAM की आवश्यकता होती है?

डाउनलोड आकार को न्यूनतम आधार मानकर शुरुआत करें, फिर उसमें अतिरिक्त मेमोरी जोड़ें। weights का मेमोरी में लोड होना अनिवार्य है। इनके ऊपर KV cache (key/value cache) होता है, जो वह मेमोरी है जिसका उपयोग runtime बातचीत में पहले से मौजूद tokens को याद रखने के लिए करता है। इसके अतिरिक्त, compute buffers और operating system द्वारा उपयोग की जा रही मेमोरी भी शामिल होती है। यदि किसी मशीन में बिल्कुल 19 GB RAM है, तो वह 19 GB वाला tag नहीं चला पाएगी।

कोई एक निश्चित multiplier नहीं है जो सभी के लिए सही हो, क्योंकि KV cache आपके द्वारा अनुमति दी गई context length के साथ बढ़ता है और बाकी चीजें runtime versions के बीच बदलती रहती हैं। इसलिए अनुमान लगाने के बजाय मापें। एक सामान्य prompt के साथ model लोड करें, फिर देखें कि सर्वर ने कितनी मेमोरी reserve की है।

ollama run glm-4.7-flash:q4_K_M "Reply with the single word: ready"
ollama ps

ollama ps लोड किए गए model को SIZE column और PROCESSOR column के साथ print करता है। SIZE वह मात्रा है जिसे runtime ने वास्तव में reserve किया है, और यही वह संख्या है जिसकी तुलना आपको अपनी योजना से करनी चाहिए। PROCESSOR आपको बताता है कि कार्य कहाँ हो रहा है, इसलिए 100% CPU का अर्थ है कि इसमें GPU का बिल्कुल भी उपयोग नहीं हुआ है।

जब model फिट नहीं होता है, तो विफलता शांत होती है और इसके दो रूप होते हैं। यदि swap enabled है, तो load सफल दिखाई देता है और फिर generation बहुत धीमा हो जाता है, क्योंकि हर token के लिए pages को disk और RAM के बीच move करना पड़ता है। यदि swap नहीं है, तो process को तुरंत kill कर दिया जाता है, और journalctl -k | grep -i "out of memory" में kernel की Out of memory: Killed process line दिखाई देती है जिसमें ollama का उल्लेख होता है। दोनों की जाँच करें, क्योंकि इनमें से कोई भी उस terminal में कोई उपयोगी संदेश print नहीं करता जहाँ आप टाइप कर रहे थे।

19 GB Q4 tag से 32 GB Q8 tag तक का कदम वह मुख्य विकल्प है जो आपके पास इस संख्या को नियंत्रित करने के लिए होता है। Q4 में output quality का कुछ नुकसान होता है, और यह नुकसान कार्य पर निर्भर करता है; structured output और तर्क की लंबी श्रृंखलाओं में सामान्य बातचीत की तुलना में अधिक प्रभाव पड़ता है। Q4, Q8 और FP16 व्यवहार में कैसे भिन्न हैं को पढ़ना उपयोगी है, क्योंकि केवल CPU वाले VPS पर quantisation का चुनाव आमतौर पर यह तय करता है कि model चलेगा या नहीं।

CPU-only VPS पर क्या होता है

अधिकांश VPS plans में GPU नहीं होता है, और Ollama आपको चेतावनी दिए बिना CPU पर ही model चला देगा। परिणाम उपयोग करने योग्य है या नहीं, यह workload और आपके धैर्य पर निर्भर करता है।

Mixture-of-experts डिज़ाइन गति में मदद करता है। किसी भी token के लिए 30 billion parameters में से केवल 3 billion का ही उपयोग होता है, इसलिए प्रति token होने वाली गणना एक dense 30B model की तुलना में बहुत कम होती है। जो चीज़ कम नहीं होती, वह है memory। प्रत्येक expert को memory में resident रहना पड़ता है, क्योंकि router अगले token के लिए किसी भी expert को चुन सकता है। इसलिए, CPU-only box को भी Q4 tag के लिए पूरे 19 GB या उससे अधिक RAM की आवश्यकता होती है, और इसकी throughput मुख्य रूप से clock speed के बजाय memory bandwidth द्वारा नियंत्रित होती है।

इसका एक व्यावहारिक परिणाम यह है: समान core count और समान RAM वाले दो plans की generation speed में स्पष्ट अंतर हो सकता है क्योंकि उनके memory subsystems अलग-अलग होते हैं। एक shared plan एक दूसरा variable जोड़ देता है, क्योंकि noisy neighbour के कारण CPU steal time tokens-per-second के उस आंकड़े के रूप में दिखाई देता है जो हर घंटे बदलता रहता है। यही कारण है कि किसी और द्वारा प्रकाशित आंकड़े आपके प्रदर्शन का सटीक अनुमान नहीं दे सकते, और यही कारण है कि अगला section परिणामों की तालिका के बजाय मापन की एक विधि (measurement recipe) है।

अपने tokens per second को मापें

Ollama का generate endpoint अपने अंतिम JSON object में timing fields लौटाता है। उत्पन्न हुए token की संख्या को generation duration से विभाजित करें, और आपको अपने plan और prompt के आधार पर अपना परिणाम मिल जाएगा।

sudo apt install -y jq
curl -s http://localhost:11434/api/generate -d '{
  "model": "glm-4.7-flash:q4_K_M",
  "prompt": "Write a 200 word explanation of how TCP congestion control works.",
  "stream": false,
  "options": {"num_ctx": 8192}
}' | jq '{
  tokens: .eval_count,
  tokens_per_second: (.eval_count / .eval_duration * 1e9),
  prompt_seconds: (.prompt_eval_duration / 1e9),
  load_seconds: (.load_duration / 1e9)
}'

eval_count यह दर्शाता है कि कितने tokens उत्पन्न हुए और eval_duration generation में लगा समय nanoseconds में है, इसलिए eval_count / eval_duration * 1e9 tokens per second की दर है। prompt_eval_duration में आपके prompt को पढ़ने का समय शामिल है, जिसे एक उपयोगकर्ता पहले token के आने से पहले के प्रतीक्षा समय के रूप में अनुभव करता है। load_duration वह समय है जो model को disk से load करने में लगा है, इसलिए restart के बाद पहली call पर यह अधिक होता है और अगली बार लगभग शून्य हो जाता है।

इसे तीन बार चलाएं और दूसरे तथा तीसरे परिणाम को रखें, क्योंकि पहले परिणाम में वह load समय शामिल होता है। इसके बाद इसे एक बहुत लंबे prompt के साथ फिर से चलाएं, क्योंकि prompt processing input की लंबाई के साथ बढ़ती है जबकि generation की गति नहीं बदलती। इन संख्याओं को अपने plan के नाम और quantisation के साथ लिखें। यह रिकॉर्ड आपके द्वारा पढ़े गए किसी भी benchmark से अधिक मूल्यवान है, क्योंकि इसे उसी hardware पर मापा गया है जिसके लिए आप भुगतान कर रहे हैं।

Context length मेमोरी को कैसे बढ़ाता है

Ollama डिफ़ॉल्ट रूप से 4096-token का context उपयोग करता है। मॉडल इससे कहीं अधिक, glm-4.7-flash के लिए 198K tokens तक का समर्थन करता है, लेकिन यह डिफ़ॉल्ट रूप से उपलब्ध नहीं होता है और इसे सक्षम करने की एक लागत होती है।

KV cache प्रत्येक layer में, हर token के लिए एक key vector और एक value vector को सुरक्षित रखता है। इसका आकार आपके द्वारा अनुमति दिए गए tokens की संख्या के साथ linear रूप से बढ़ता है। 4096 से 32768 tokens तक जाने का अर्थ है आठ गुना अधिक context, जिसका मतलब है लगभग आठ गुना अधिक KV cache। यदि मशीन का आकार केवल weights को फिट करने के लिए है, तो यह अतिरिक्त allocation ही आपको swap में धकेल देता है। यही कारण है कि जो मशीन छोटे prompts का उत्तर ठीक से दे रही थी, वह लंबा दस्तावेज़ पेस्ट करने पर अचानक धीमी हो जाती है।

इसे ऊपर दिए गए curl command की तरह options object में num_ctx के साथ प्रति request सेट करें, या server डिफ़ॉल्ट को बदलें।

sudo install -d -m 755 /etc/systemd/system/ollama.service.d
printf '[Service]\nEnvironment="OLLAMA_CONTEXT_LENGTH=16384"\n' \
  | sudo tee /etc/systemd/system/ollama.service.d/override.conf
sudo systemctl daemon-reload
sudo systemctl restart ollama
systemctl show ollama --property=Environment

अंतिम command को आपके OLLAMA_CONTEXT_LENGTH मान को print करना चाहिए। यदि यह एक खाली Environment= print करता है, तो override file गलत directory में है या reload नहीं हुआ है। अगले model load के बाद, ollama ps को 4096 की तुलना में स्पष्ट रूप से बड़ा SIZE दिखाना चाहिए। मान को चरणों में बढ़ाएं और हर बार उस संख्या पर नज़र रखें। Ollama की context length को num_ctx के साथ सेट करना यह बताता है कि यह keep-alive और parallel requests के साथ कैसे इंटरैक्ट करता है, जो दोनों ही समान लागत को बढ़ाते हैं। यदि एक से अधिक client server का उपयोग करेंगे, तो context के साथ ही concurrency limits भी निर्धारित करें, क्योंकि प्रत्येक parallel slot का अपना KV cache होता है और queue setting यह तय करती है कि दूसरी request प्रतीक्षा करेगी या उसे सीधे अस्वीकार कर दिया जाएगा।

जब API, बॉक्स (हार्डवेयर) से सस्ता हो

Self-hosting हमेशा सस्ता नहीं होता है, और इस विशेष श्रेणी के लिए प्रकाशित कीमतें इस बात को स्पष्ट रूप से दर्शाती हैं।

ChartZ.ai published list prices per million tokens, checked 2026-08-18
The data behind this chart
[
  {
    "label": "GLM-5.2 input",
    "usd_per_million_tokens": 1.4
  },
  {
    "label": "GLM-5.2 output",
    "usd_per_million_tokens": 4.4
  },
  {
    "label": "GLM-4.7-Flash input",
    "usd_per_million_tokens": 0
  },
  {
    "label": "GLM-4.7-Flash output",
    "usd_per_million_tokens": 0
  }
]

18 अगस्त 2026 तक, Z.ai ने GLM-5.2 की कीमत $1.4 प्रति मिलियन इनपुट टोकन और $4.4 प्रति मिलियन आउटपुट टोकन निर्धारित की है। GLM-4.7-Flash, जो कि वह मॉडल है जिसे यह गाइड स्थानीय रूप से चलाती है, उसकी कीमत दोनों दिशाओं में $0 है। ये प्रकाशित कीमतें हैं और इनमें बदलाव हो सकता है, इसलिए किसी भी बजट की योजना बनाने से पहले वर्तमान पेज की जाँच अवश्य करें।

इसलिए, इस समय self-hosting के पक्ष में वित्तीय तर्क glm-4.7-flash कमजोर है। पर्याप्त RAM वाले VPS की मासिक लागत होती है, जबकि प्रकाशक वही मॉडल मुफ्त में उपलब्ध कराता है। आप इसे स्वयं चलाकर जो खरीदते हैं वह अलग है: आपके prompts आपके नियंत्रण वाली मशीन पर रहते हैं, और मॉडल का संस्करण तब तक नहीं बदलता जब तक आप उसे नहीं बदलते। ये self-hosting के अच्छे कारण हैं। इस मॉडल और इन कीमतों के लिए, लागत इनमें से एक कारण नहीं है।

जब आप जिस मॉडल का उपयोग करना चाहते हैं वह मुफ्त न हो, या जब आपका डेटा कानूनी रूप से आपके नेटवर्क से बाहर नहीं जा सकता हो, तब यह गणित बदल जाता है। GPU VPS और API टोकन के बीच ब्रेक-ईवन पॉइंट प्रत्येक वेरिएबल के साथ उस गणना को स्पष्ट करता है। यदि आप अभी भी मशीन का चयन कर रहे हैं, तो एक VPS की वास्तविक मासिक लागत इस गणना का दूसरा महत्वपूर्ण हिस्सा है।

Endpoint को localhost पर रखें

यह वह चरण है जिसे लोग छोड़ देते हैं, और यही सबसे महत्वपूर्ण है।

Ollama डिफ़ॉल्ट रूप से port 11434 पर 127.0.0.1 से bind होता है, इसलिए यह केवल सर्वर से ही पहुँच योग्य होता है। यह मान लेने के बजाय कि ऐसा ही है, अपने बॉक्स पर इसकी पुष्टि करें।

ss -ltnp | grep 11434

आप 127.0.0.1:11434 देखना चाहेंगे। 0.0.0.0:11434 या *:11434 देखने का अर्थ है कि API हर interface पर listen कर रहा है, जिसमें public interface भी शामिल है।

यह इसलिए मायने रखता है क्योंकि Ollama के API में कोई authentication नहीं है। इसमें कोई password, कोई token, या कोई allowlist नहीं है। जो कोई भी port 11434 तक पहुँच सकता है, वह आपके models की सूची देख सकता है, आपके द्वारा भुगतान किए गए hardware पर generation चला सकता है, आपकी disk भर जाने तक नए models pull कर सकता है, और आपके पास मौजूद models को delete कर सकता है। Port 11434 निश्चित और सर्वविदित है, इसलिए scanners खुले ports को जल्दी ढूँढ लेते हैं।

OLLAMA_HOST=0.0.0.0 को set न करें। कई tutorials इसे तब समाधान के रूप में सुझाते हैं जब आपके laptop का client connect नहीं हो पाता, और यह गलत समाधान है। इसके बजाय port को forward करें।

ssh -N -L 11434:127.0.0.1:11434 you@your-server

यह आपके laptop पर port 11434 को SSH के माध्यम से सर्वर के loopback address पर map करता है, इसलिए http://localhost:11434 के लिए configure किया गया कोई भी client बिना किसी बदलाव के काम करता है और कुछ भी नया expose नहीं होता। कई लोगों या कई मशीनों के लिए, सर्वर को एक private tunnel network पर रखें और Ollama को tunnel address से bind करें, कभी भी 0.0.0.0 से नहीं।

सर्वर के अलावा किसी अन्य स्थान से पुष्टि करें। अपने laptop से, SSH tunnel बंद होने पर:

curl -m 5 http://your-server-ip:11434/api/tags

curl: (28) Connection timed out या curl: (7) Failed to connect सही परिणाम है। आपके models की JSON सूची का मतलब है कि port internet के लिए खुला है, और इसे तुरंत ठीक करने की आवश्यकता है। आपके provider का network firewall बॉक्स पर चल रहे firewall से एक अलग नियंत्रण है, इसलिए दोनों की जाँच करें। क्या VPS hosting सुरक्षित है, इस व्यापक प्रश्न में उस मशीन के लिए बाकी बुनियादी सुरक्षा शामिल है जिसे आप चालू छोड़ते हैं।

यदि glm-4.7-flash अभी भी बहुत बड़ा है

जब Q4 टैग आपके प्लान में फिट नहीं होता है, तो इसका समाधान एक छोटा मॉडल है, न कि छोटा कॉन्टेक्स्ट। मॉडल को फिट करने के लिए कॉन्टेक्स्ट को कम करने से आपको ऐसा कुछ मिलता है जो लोड तो हो जाता है, लेकिन पहले लंबे प्रॉम्प्ट पर ही विफल हो जाता है। VPS पर Qwen 3 के 8B और 27B वर्ज़न उसी इंस्टॉलेशन पाथ का अनुसरण करते हैं जो छोटे सर्वर के लिए उपयुक्त हैं, और VPS पर Ollama के साथ LLM को सेल्फ-होस्ट करने के लिए सामान्य गाइड उन हिस्सों को कवर करती है जो आपके द्वारा चुने गए किसी भी मॉडल के लिए समान रहते हैं। आप चाहे जो भी चुनें, टैग को पिन करें, अपने प्लान पर मापें, और एंडपॉइंट को लूपबैक पर रखें।

FAQ

क्या GLM 5.2 को VPS पर स्थानीय रूप से चलाया जा सकता है?

नहीं। 18 अगस्त 2026 तक, GLM 5.2 Ollama की लाइब्रेरी में केवल glm-5.2:cloud के रूप में मौजूद है, जो एक ऐसा टैग है जो Ollama के अपने इंफ्रास्ट्रक्चर पर चलता है और काम करने के लिए ollama signin की आवश्यकता होती है। यह मॉडल 756 बिलियन पैरामीटर्स का है, इसलिए चार बिट्स प्रति पैरामीटर पर भी केवल वेट्स (weights) ही सैकड़ों गीगाबाइट के हो जाते हैं, जो किसी भी मानक VPS प्लान की क्षमता से कहीं अधिक है। डाउनलोड करने योग्य वेट्स वाला GLM मॉडल जो किराए के सर्वर पर फिट हो सकता है, वह glm-4.7-flash है।

glm-4.7-flash को कितनी RAM की आवश्यकता होती है?

टैग के डाउनलोड आकार को न्यूनतम मानकर चलें और उसके ऊपर KV cache तथा ऑपरेटिंग सिस्टम के लिए अतिरिक्त जगह जोड़ें। Ollama Q4 टैग को 19 GB, Q8 को 32 GB, और bfloat16 टैग को 60 GB पर सूचीबद्ध करता है। कोई भी निश्चित मल्टीप्लायर सभी के लिए सही नहीं है, क्योंकि KV cache आपके द्वारा सेट की गई कॉन्टेक्स्ट लेंथ (context length) के साथ बढ़ता है। मॉडल लोड करें, ollama ps चलाएं, और अपने सिस्टम पर वास्तविक आंकड़े के लिए SIZE कॉलम देखें।

मैं अपने VPS पर टोकन प्रति सेकंड (tokens per second) कैसे मापूँ?

"stream": false के साथ http://localhost:11434/api/generate पर एक रिक्वेस्ट भेजें, फिर रिस्पॉन्स से eval_count और eval_duration पढ़ें। टोकन प्रति सेकंड eval_count / eval_duration * 1e9 है, क्योंकि eval_duration नैनोसेकंड में रिपोर्ट किया जाता है। पहले रन को छोड़ दें, क्योंकि उसमें load_duration में डिस्क से वेट्स को पढ़ना शामिल होता है। एक लंबे प्रॉम्प्ट के साथ भी दोहराएं, क्योंकि prompt_eval_duration इनपुट लेंथ के साथ बढ़ता है जबकि जनरेशन की गति नहीं बढ़ती।

मुझे OLLAMA_HOST को 0.0.0.0 पर सेट क्यों नहीं करना चाहिए?

क्योंकि Ollama के API में कोई ऑथेंटिकेशन नहीं है, इसलिए इसे 0.0.0.0 पर बाइंड करने से एक बिना ऑथेंटिकेशन वाला एंडपॉइंट पब्लिक इंटरनेट पर आ जाता है। जो कोई भी पोर्ट 11434 तक पहुँचता है, वह आपके हार्डवेयर पर जनरेशन कर सकता है और यह बदल सकता है कि कौन से मॉडल इंस्टॉल हैं। डिफ़ॉल्ट 127.0.0.1 बाइंड रखें, इसे ss -ltnp | grep 11434 के साथ चेक करें, और अपने लैपटॉप से SSH टनल जैसे कि ssh -N -L 11434:127.0.0.1:11434 you@your-server के माध्यम से API तक पहुँचें।