SSD Nodes Learn 🎉 VPS $5.50/माह से
गाइड Matt Connorलेखक: Matt Connor · अपडेट किया गया: 2026-08-21

VPS पर GLM 5.2 कैसे चलाएं: पूरी जानकारी

Ollama पर GLM 5.2 क्लाउड आधारित है और VPS पर नहीं चलता। जानें कि कौन सा GLM मॉडल आपके सर्वर पर काम करेगा और विभिन्न क्वांटाइजेशन स्तरों के लिए कितनी RAM की आवश्यकता होती है।

क्या आप VPS पर GLM 5.2 चला सकते हैं?

नहीं, और कोई भी सर्वर किराए पर लेने से पहले इसका कारण जानना आवश्यक है। 18 अगस्त 2026 तक, Ollama की लाइब्रेरी में GLM 5.2 में केवल एक ही टैग है, glm-5.2:cloud। एक :cloud टैग Ollama के सर्वर पर चलता है। आपका बॉक्स प्रॉम्प्ट भेजता है और टोकन प्राप्त करता है, इसलिए वेट्स (weights) कभी भी आपकी डिस्क तक नहीं पहुँचते हैं। यह मॉडल 756 बिलियन पैरामीटर्स का है। 756 बिलियन पैरामीटर्स में प्रति पैरामीटर चार बिट्स का अर्थ लगभग 378 GB वेट्स है, और यह गणना कॉन्टेक्स्ट, एक्टिवेशन या ऑपरेटिंग सिस्टम से पहले की है। कोई भी मानक VPS प्लान इतनी मेमोरी नहीं देता है।

जो GLM मॉडल आपके द्वारा किराए पर लिए गए सर्वर पर चल सकता है, वह glm-4.7-flash है। इसे 4 टैग्स में डाउनलोड करने योग्य वेट्स के साथ प्रकाशित किया गया है। यह एक mixture-of-experts मॉडल है, जिसका अर्थ है कि प्रत्येक टोकन के लिए नेटवर्क का केवल एक छोटा हिस्सा ही चलता है, और Z.ai इसे 30B-A3B के रूप में वर्णित करता है: कुल 30 बिलियन पैरामीटर्स, प्रति टोकन लगभग 3 बिलियन सक्रिय। इसलिए यह गाइड उस प्रश्न का उत्तर देती है जिस पर आप कार्य कर सकते हैं। एक टैग पिन करें, बॉक्स का आकार निर्धारित करें, अपनी गति मापें और एंडपॉइंट को निजी रखें।

कोई भी कमांड कॉपी करने से पहले टैग को सत्यापित करें, जिसमें यहाँ दी गई कमांड्स भी शामिल हैं। Ollama की लाइब्रेरी बिना किसी सूचना के बदल जाती है। glm-4.7-flash टैग सूची खोलें और पुष्टि करें कि टैग अभी भी मौजूद है। यदि स्थानीय वेट्स के साथ कोई नया GLM रिलीज़ आया है, तो उसे प्राथमिकता दें, और रिकॉर्ड करें कि आपने वास्तव में किस टैग का परीक्षण किया है।

यदि आप फिर भी GLM 5.2 ही चाहते हैं, तो ollama signin के बाद ollama run glm-5.2:cloud काम करता है, और क्लाइंट की तरफ से यह किसी अन्य Ollama मॉडल की तरह ही व्यवहार करता है। समझें कि आप किस बात के लिए सहमति दे रहे हैं: प्रॉम्प्ट आपके सर्वर से बाहर जाता है। यदि आपका सेल्फ-होस्टिंग का कारण यह है कि डेटा आपकी मशीन पर ही रहना चाहिए, तो :cloud टैग उस आवश्यकता को पूरा नहीं करता है।

कौन से GLM tags मौजूद हैं, और किसे पिन करना चाहिए

यहाँ तीन आधिकारिक GLM entries मायने रखती हैं। glm-5.2 और glm-5.1 केवल cloud के लिए हैं। glm-4.7-flash local version है, और ये इसके प्रकाशित tags हैं, साथ ही Ollama द्वारा प्रत्येक के लिए सूचीबद्ध download size भी दी गई है।

Chartglm-4.7-flash tags in Ollama's library, checked 2026-08-18
The data behind this chart
[
  {
    "label": "q4_K_M",
    "download_gb": 19
  },
  {
    "label": "latest",
    "download_gb": 19
  },
  {
    "label": "q8_0",
    "download_gb": 32
  },
  {
    "label": "bf16",
    "download_gb": 60
  }
]

ये library page से लिए गए प्रकाशित आंकड़े हैं, न कि मापे गए मान। latest और q4_K_M दोनों 19 GB पर सूचीबद्ध हैं, इसलिए latest वर्तमान में Q4 build को दर्शाता है। किसी भी republish पर यह बदल सकता है, इसीलिए आपको कभी भी किसी script या Dockerfile में सीधे ollama pull glm-4.7-flash नहीं लिखना चाहिए। Quantisation का नाम लिखें। सबसे बड़ा tag, bf16, 60 GB का download है जिसमें unquantised bfloat16 weights शामिल हैं।

Library पर खोज करने पर ऐसे namespaced uploads भी मिलते हैं जिनके नाम में slash होता है, जैसे कि someuser/glm-5.2। Slash का अर्थ है कि इसे किसी user account ने प्रकाशित किया है, इसलिए यह आधिकारिक entry के बजाय community द्वारा re-upload किया गया है। कोई भी यह गारंटी नहीं देता कि इसके अंदर कौन से weights हैं। किसी ऐसे file के साथ वैसा ही व्यवहार करें जैसा आप online मिली किसी भी unsigned binary के साथ करते हैं।

Ollama इंस्टॉल करें और सटीक tag pull करें

Ollama का Linux इंस्टॉलर एक ही command है।

curl -fsSL https://ollama.com/install.sh | sh
ollama --version

इंस्टॉलर एक systemd service बनाता है जो ollama user के रूप में चलती है। कुछ भी pull करने से पहले पुष्टि करें कि यह start हो गई है।

systemctl status ollama --no-pager

Active: active (running) का अर्थ है कि API port 11434 पर listen कर रही है। यदि unit मौजूद नहीं है, तो इंस्टॉलर plain binary install पर वापस चला गया है, और Ollama Linux documentation में service file को मैन्युअल रूप से बनाने का तरीका दिया गया है।

glm-4.7-flash पेज पर न्यूनतम Ollama version की सूची दी गई है। पुराना binary model को धीमा नहीं चलाता, बल्कि उसे चलाने से मना कर देता है: pull यह संदेश देकर विफल हो जाता है कि model को Ollama के नए version की आवश्यकता है। अपग्रेड करने के लिए install script को फिर से चलाएँ। 18 August 2026 तक current release 0.32.14 है, जो उस न्यूनतम आवश्यकता से काफी आगे है।

अब नाम के आधार पर एक tag pull करें।

ollama pull glm-4.7-flash:q4_K_M
ollama ls

ollama ls को glm-4.7-flash:q4_K_M को 19 GB के करीब के आकार के साथ सूचीबद्ध करना चाहिए। बीच में रुक जाने वाला pull कोई भी runnable file नहीं छोड़ता है, इसलिए उसी command को फिर से चलाएँ। छोटे plan पर विफल pull का सबसे सामान्य कारण network समस्या के बजाय disk का भर जाना है, क्योंकि model को root filesystem पर /usr/share/ollama/.ollama/models में लिखा जाता है। शुरू करने से पहले df -h /usr/share/ollama के साथ जाँच करें।

प्रत्येक quantisation के लिए कितनी RAM की आवश्यकता होती है?

डाउनलोड आकार को आधार मानकर शुरुआत करें, फिर उसमें अतिरिक्त मेमोरी जोड़ें। weights का मेमोरी में होना अनिवार्य है। इनके ऊपर KV cache (key/value cache) होता है, जो वह मेमोरी है जिसका उपयोग runtime बातचीत में पहले से मौजूद tokens को याद रखने के लिए करता है, साथ ही compute buffers और operating system द्वारा उपयोग की जा रही अन्य मेमोरी भी इसमें शामिल होती है। यदि किसी मशीन में बिल्कुल 19 GB RAM है, तो वह 19 GB वाला tag नहीं चला पाएगी।

कोई एक निश्चित multiplier नहीं है जो सभी के लिए सही हो, क्योंकि KV cache आपके द्वारा अनुमति दी गई context length के साथ बढ़ता है और बाकी चीजें runtime versions के बीच बदलती रहती हैं। इसलिए अनुमान लगाने के बजाय मापें। एक साधारण prompt के साथ model load करें, फिर देखें कि server ने कितनी मेमोरी reserve की है।

ollama run glm-4.7-flash:q4_K_M "Reply with the single word: ready"
ollama ps

ollama ps लोड किए गए model को SIZE column और PROCESSOR column के साथ print करता है। SIZE वह है जो runtime ने वास्तव में reserve किया है, और यही वह संख्या है जिसकी तुलना आपको अपनी योजना से करनी चाहिए। PROCESSOR आपको बताता है कि काम कहाँ हो रहा है, इसलिए 100% CPU का अर्थ है कि इसमें GPU का बिल्कुल भी उपयोग नहीं हुआ।

जब model फिट नहीं होता है, तो failure शांत होता है और इसके दो रूप होते हैं। यदि swap enabled है, तो load सफल प्रतीत होता है और फिर generation बहुत धीमा हो जाता है, क्योंकि हर token के लिए pages को disk और RAM के बीच move करना पड़ता है। यदि swap नहीं है, तो process को तुरंत kill कर दिया जाता है, और journalctl -k | grep -i "out of memory" kernel की Out of memory: Killed process line दिखाता है जिसमें ollama का उल्लेख होता है। दोनों की जाँच करें, क्योंकि इनमें से कोई भी उस terminal में उपयोगी संदेश नहीं देता जहाँ आप टाइप कर रहे थे।

19 GB Q4 tag से 32 GB Q8 tag तक का कदम वह मुख्य तरीका है जिससे आप उस संख्या को नियंत्रित कर सकते हैं। Q4 में output quality का कुछ नुकसान होता है, और यह नुकसान कार्य पर निर्भर करता है; structured output और reasoning की लंबी chains सामान्य बातचीत की तुलना में अधिक प्रभावित होती हैं। निर्णय लेने से पहले Q4, Q8 और FP16 व्यवहार में कैसे भिन्न हैं पढ़ना उचित है, क्योंकि केवल CPU वाले VPS पर quantisation का चुनाव आमतौर पर यह तय करता है कि model चलेगा या नहीं।

CPU-only VPS पर क्या होता है

अधिकांश VPS plans में GPU नहीं होता है, और Ollama आपको चेतावनी दिए बिना model को CPU पर चला देगा। परिणाम उपयोग करने योग्य है या नहीं, यह workload और आपके धैर्य पर निर्भर करता है।

Mixture-of-experts डिज़ाइन गति में मदद करता है। किसी भी token के लिए 30 billion parameters में से केवल 3 billion का ही उपयोग होता है, इसलिए प्रति token होने वाली गणना एक dense 30B model की तुलना में बहुत कम होती है। जो कम नहीं होता, वह memory है। हर expert को resident रहना पड़ता है, क्योंकि router अगले token के लिए उनमें से किसी को भी चुन सकता है। इसलिए, एक CPU-only box को Q4 tag के लिए भी पूरे 19 GB या उससे अधिक RAM की आवश्यकता होती है, और इसकी throughput clock speed के बजाय मुख्य रूप से memory bandwidth द्वारा नियंत्रित होती है।

इसका एक व्यावहारिक परिणाम यह है: समान core count और समान RAM वाले दो plans की generation speed में स्पष्ट अंतर हो सकता है क्योंकि उनके memory subsystems अलग होते हैं। एक shared plan एक दूसरा variable जोड़ देता है, क्योंकि noisy neighbour से CPU steal time tokens-per-second के उस आंकड़े के रूप में दिखता है जो हर घंटे बदलता रहता है। यही कारण है कि किसी और द्वारा प्रकाशित आंकड़े आपके प्रदर्शन का सटीक अनुमान नहीं दे सकते, और यही कारण है कि अगला section परिणामों की तालिका के बजाय एक measurement recipe है।

अपने टोकन प्रति सेकंड (tokens per second) को मापें

Ollama का generate endpoint अपने अंतिम JSON ऑब्जेक्ट में टाइमिंग फील्ड्स देता है। उत्पन्न टोकन की संख्या को जनरेशन की अवधि से विभाजित करें, और आपको अपने प्लान और प्रॉम्प्ट के अनुसार अपना परिणाम मिल जाएगा।

sudo apt install -y jq
curl -s http://localhost:11434/api/generate -d '{
  "model": "glm-4.7-flash:q4_K_M",
  "prompt": "Write a 200 word explanation of how TCP congestion control works.",
  "stream": false,
  "options": {"num_ctx": 8192}
}' | jq '{
  tokens: .eval_count,
  tokens_per_second: (.eval_count / .eval_duration * 1e9),
  prompt_seconds: (.prompt_eval_duration / 1e9),
  load_seconds: (.load_duration / 1e9)
}'

eval_count यह दर्शाता है कि कितने टोकन उत्पन्न हुए और eval_duration उन्हें उत्पन्न करने में लगा समय नैनोसेकंड में है, इसलिए eval_count / eval_duration * 1e9 टोकन प्रति सेकंड की दर है। prompt_eval_duration आपके प्रॉम्प्ट को पढ़ने में लगा समय है, जिसे एक उपयोगकर्ता पहले टोकन के आने से पहले के प्रतीक्षा समय के रूप में अनुभव करता है। load_duration मॉडल को डिस्क से लोड करने में लगा समय है, इसलिए रीस्टार्ट के बाद पहली कॉल पर यह अधिक होता है और अगली बार लगभग शून्य हो जाता है।

इसे तीन बार चलाएं और दूसरे तथा तीसरे परिणाम को रखें, क्योंकि पहले परिणाम में लोडिंग का समय शामिल होता है। फिर इसे एक बहुत लंबे प्रॉम्प्ट के साथ दोबारा चलाएं, क्योंकि प्रॉम्प्ट प्रोसेसिंग इनपुट की लंबाई के साथ बढ़ती है जबकि जनरेशन की गति नहीं बदलती। इन संख्याओं को अपने प्लान के नाम और क्वांटाइजेशन (quantisation) के साथ लिखें। यह रिकॉर्ड आपके द्वारा पढ़े गए किसी भी बेंचमार्क से अधिक मूल्यवान है, क्योंकि इसे उसी हार्डवेयर पर मापा गया है जिसके लिए आप भुगतान कर रहे हैं।

Context length मेमोरी को कैसे बढ़ाता है

Ollama डिफ़ॉल्ट रूप से 4096-token का context उपयोग करता है। मॉडल इससे कहीं अधिक, glm-4.7-flash के लिए 198K tokens तक का विज्ञापन करता है, लेकिन यह डिफ़ॉल्ट रूप से नहीं मिलता है, और इसे चालू करना मुफ्त नहीं है।

KV cache हर layer में, हर token के लिए एक key vector और एक value vector रखता है। इसका आकार आपके द्वारा अनुमति दिए गए tokens की संख्या के साथ linear रूप से बढ़ता है। 4096 से 32768 tokens तक जाने का मतलब है आठ गुना context, इसलिए यह लगभग आठ गुना KV cache होता है। केवल weights के लिए बने सिस्टम पर, यह अतिरिक्त allocation ही आपको swap में धकेल देता है, यही कारण है कि जो मशीन छोटे prompts का जवाब ठीक से दे रही थी, वह लंबा document पेस्ट करने पर अचानक धीमी हो जाती है।

इसे ऊपर दिए गए curl command की तरह options object में num_ctx के साथ प्रति request सेट करें, या server डिफ़ॉल्ट को बदलें।

sudo install -d -m 755 /etc/systemd/system/ollama.service.d
printf '[Service]\nEnvironment="OLLAMA_CONTEXT_LENGTH=16384"\n' \
  | sudo tee /etc/systemd/system/ollama.service.d/override.conf
sudo systemctl daemon-reload
sudo systemctl restart ollama
systemctl show ollama --property=Environment

अंतिम command को आपका OLLAMA_CONTEXT_LENGTH मान प्रिंट करना चाहिए। यदि यह एक खाली Environment= प्रिंट करता है, तो override फ़ाइल गलत directory में है या reload छोड़ दिया गया था। अगले model load के बाद, ollama ps को 4096 की तुलना में स्पष्ट रूप से बड़ा SIZE दिखाना चाहिए। मान को चरणों में बढ़ाएं और हर बार उस संख्या पर नज़र रखें। num_ctx के साथ Ollama की context length सेट करना यह बताता है कि यह keep-alive और parallel requests के साथ कैसे interact करता है, जो दोनों ही इसी लागत को बढ़ाते हैं।

जब API, बॉक्स (hardware) से सस्ता हो

Self-hosting हमेशा सस्ता नहीं होता है, और इस परिवार के लिए प्रकाशित सूची मूल्य (list prices) इस बात को स्पष्ट रूप से दर्शाते हैं।

ChartZ.ai published list prices per million tokens, checked 2026-08-18
The data behind this chart
[
  {
    "label": "GLM-5.2 input",
    "usd_per_million_tokens": 1.4
  },
  {
    "label": "GLM-5.2 output",
    "usd_per_million_tokens": 4.4
  },
  {
    "label": "GLM-4.7-Flash input",
    "usd_per_million_tokens": 0
  },
  {
    "label": "GLM-4.7-Flash output",
    "usd_per_million_tokens": 0
  }
]

18 अगस्त 2026 तक, Z.ai ने GLM-5.2 की कीमत $1.4 प्रति दस लाख इनपुट टोकन और $4.4 प्रति दस लाख आउटपुट टोकन निर्धारित की है। यह GLM-4.7-Flash, जो कि वह मॉडल है जिसे यह गाइड स्थानीय रूप से चलाती है, की कीमत दोनों दिशाओं में $0 बताती है। ये प्रकाशित कीमतें हैं और इनमें बदलाव हो सकता है, इसलिए किसी भी विकल्प के आधार पर बजट बनाने से पहले वर्तमान पेज की जाँच अवश्य करें।

इसलिए, इस समय self-hosting glm-4.7-flash के लिए आर्थिक तर्क कमजोर है। पर्याप्त RAM वाले VPS की हर महीने वास्तविक लागत आती है, जबकि प्रकाशक वही मॉडल मुफ्त में प्रदान कर रहा है। आप इसे स्वयं चलाकर जो खरीदते हैं वह अलग है: आपके prompts आपके नियंत्रण वाली मशीन पर रहते हैं, और मॉडल का संस्करण तब तक नहीं बदलता जब तक आप उसे नहीं बदलते। ये self-hosting के अच्छे कारण हैं। इस मॉडल और इन कीमतों के लिए, लागत इनमें से एक कारण नहीं है।

जब आप जिस मॉडल को चाहते हैं वह मुफ्त न हो, या जब आपका डेटा कानूनी रूप से आपके अपने नेटवर्क से बाहर नहीं जा सकता हो, तो गणित बदल जाता है। GPU VPS और API टोकन के बीच break-even point प्रत्येक चर (variable) के साथ उस गणना को स्पष्ट करता है। यदि आप अभी भी मशीन का चयन कर रहे हैं, तो VPS की वास्तविक मासिक लागत इस गणना का दूसरा हिस्सा है।

Endpoint को localhost पर ही रखें

यह वह चरण है जिसे लोग अक्सर छोड़ देते हैं, और यही सबसे महत्वपूर्ण है।

Ollama डिफ़ॉल्ट रूप से port 11434 पर 127.0.0.1 से bind होता है, इसलिए यह केवल सर्वर से ही एक्सेस किया जा सकता है। यह मान लेने के बजाय कि ऐसा ही है, अपने सर्वर पर इसकी पुष्टि करें।

ss -ltnp | grep 11434

आप 127.0.0.1:11434 देखना चाहेंगे। 0.0.0.0:11434 या *:11434 देखने का मतलब है कि API हर interface पर listening मोड में है, जिसमें public interface भी शामिल है।

यह इसलिए मायने रखता है क्योंकि Ollama के API में कोई authentication नहीं है। इसमें कोई password, token या allowlist नहीं है। जो कोई भी port 11434 तक पहुँच सकता है, वह आपके models की सूची देख सकता है, आपके द्वारा भुगतान किए गए hardware पर generation चला सकता है, आपकी disk भर जाने तक नए models download कर सकता है, और आपके मौजूदा models को delete कर सकता है। Port 11434 fixed और सर्वविदित है, इसलिए scanners खुले ports को तुरंत ढूंढ लेते हैं।

OLLAMA_HOST=0.0.0.0 को set न करें। कई tutorials इसे तब समाधान के रूप में सुझाते हैं जब आपके laptop का client connect नहीं हो पाता, लेकिन यह गलत तरीका है। इसके बजाय port को forward करें।

ssh -N -L 11434:127.0.0.1:11434 you@your-server

यह आपके laptop के port 11434 को SSH के माध्यम से सर्वर के loopback address से map करता है, जिससे http://localhost:11434 के लिए कॉन्फ़िगर किया गया कोई भी client बिना किसी बदलाव के काम करता है और कुछ भी नया expose नहीं होता। कई लोगों या कई मशीनों के लिए, सर्वर को एक private tunnel network पर रखें और Ollama को tunnel address से bind करें, कभी भी 0.0.0.0 से नहीं।

सर्वर के अलावा किसी अन्य स्थान से इसकी पुष्टि करें। अपने laptop से, SSH tunnel बंद होने पर:

curl -m 5 http://your-server-ip:11434/api/tags

curl: (28) Connection timed out या curl: (7) Failed to connect सही परिणाम है। आपके models की JSON सूची मिलने का मतलब है कि port internet के लिए खुला है, और इसे तुरंत ठीक करने की आवश्यकता है। आपके provider का network firewall, सर्वर पर चल रहे firewall से अलग नियंत्रण है, इसलिए दोनों की जाँच करें। VPS hosting सुरक्षित है या नहीं, इस पर व्यापक चर्चा उस मशीन के लिए बुनियादी सुरक्षा के बाकी पहलुओं को कवर करती है जिसे आप चालू छोड़ते हैं।

यदि glm-4.7-flash अभी भी बहुत बड़ा है

जब Q4 टैग आपकी योजना के अनुसार फिट न हो, तो समाधान एक छोटा मॉडल है, न कि छोटा कॉन्टेक्स्ट। मॉडल को फिट करने के लिए कॉन्टेक्स्ट को कम करने से आपको ऐसा कुछ मिलता है जो लोड तो हो जाता है, लेकिन पहले लंबे प्रॉम्प्ट पर ही विफल हो जाता है। VPS पर Qwen 3 के 8B और 27B मॉडल उसी इंस्टॉलेशन प्रक्रिया को उन आकारों पर समझाता है जो छोटे सर्वर के लिए उपयुक्त हैं, और VPS पर Ollama के साथ LLM को self-host करने के लिए सामान्य गाइड उन हिस्सों को कवर करती है जो आपके द्वारा चुने गए किसी भी मॉडल के लिए समान रहते हैं। आप जो भी मॉडल चुनें, उसके टैग को पिन करें, अपनी योजना पर मापें, और एंडपॉइंट को लूपबैक पर रखें।

FAQ

क्या GLM 5.2 को VPS पर स्थानीय रूप से चलाया जा सकता है?

नहीं। 18 August 2026 तक, GLM 5.2 Ollama की लाइब्रेरी में केवल glm-5.2:cloud के रूप में मौजूद है, जो एक ऐसा टैग है जो Ollama के अपने इंफ्रास्ट्रक्चर पर चलता है और काम करने के लिए ollama signin की आवश्यकता होती है। यह मॉडल 756 बिलियन पैरामीटर्स का है, इसलिए चार बिट्स प्रति पैरामीटर पर भी केवल वेट्स (weights) ही सैकड़ों गीगाबाइट के हो जाते हैं, जो किसी भी मानक VPS प्लान की क्षमता से कहीं अधिक है। डाउनलोड करने योग्य वेट्स वाला GLM मॉडल जो किराए के सर्वर पर फिट हो सकता है, वह glm-4.7-flash है।

glm-4.7-flash को कितनी RAM की आवश्यकता होती है?

टैग के डाउनलोड आकार को न्यूनतम मानकर चलें और इसमें KV cache तथा ऑपरेटिंग सिस्टम के लिए अतिरिक्त जगह जोड़ें। Ollama Q4 टैग को 19 GB, Q8 को 32 GB, और bfloat16 टैग को 60 GB पर सूचीबद्ध करता है। कोई भी निश्चित मल्टीप्लायर सभी के लिए सही नहीं है, क्योंकि KV cache आपके द्वारा सेट की गई कॉन्टेक्स्ट लेंथ के साथ बढ़ता है। मॉडल लोड करें, ollama ps चलाएं, और अपने सिस्टम पर वास्तविक आंकड़े के लिए SIZE कॉलम देखें।

मैं अपने VPS पर टोकन प्रति सेकंड (tokens per second) कैसे मापूँ?

"stream": false के साथ http://localhost:11434/api/generate पर एक रिक्वेस्ट भेजें, फिर रिस्पॉन्स से eval_count और eval_duration पढ़ें। टोकन प्रति सेकंड eval_count / eval_duration * 1e9 है, क्योंकि eval_duration को नैनोसेकंड में रिपोर्ट किया जाता है। पहले रन को छोड़ दें, क्योंकि उसमें load_duration में डिस्क से वेट्स को पढ़ना भी शामिल होता है। एक लंबे प्रॉम्प्ट के साथ भी दोहराएं, क्योंकि prompt_eval_duration इनपुट लेंथ के साथ बढ़ता है जबकि जनरेशन की गति नहीं बढ़ती।

मुझे OLLAMA_HOST को 0.0.0.0 पर सेट क्यों नहीं करना चाहिए?

क्योंकि Ollama की API में कोई ऑथेंटिकेशन नहीं है, इसलिए इसे 0.0.0.0 पर बाइंड करने से एक बिना ऑथेंटिकेशन वाला एंडपॉइंट पब्लिक इंटरनेट पर खुल जाता है। कोई भी व्यक्ति जो पोर्ट 11434 तक पहुँच सकता है, वह आपके हार्डवेयर पर जनरेशन कर सकता है और इंस्टॉल किए गए मॉडल्स को बदल सकता है। डिफ़ॉल्ट 127.0.0.1 बाइंड रखें, ss -ltnp | grep 11434 के साथ इसकी जाँच करें, और अपने लैपटॉप से ssh -N -L 11434:127.0.0.1:11434 you@your-server जैसे SSH टनल के माध्यम से API तक पहुँचें।