Ollama में GGUF मॉडल कैसे इम्पोर्ट करें
Ollama में Hugging Face या लोकल GGUF फाइल को इम्पोर्ट करने का सही तरीका जानें। यदि आपका मॉडल गलत जवाब दे रहा है तो चैट टेम्पलेट मिसमैच को ठीक करने की पूरी प्रक्रिया यहाँ देखें।
Ollama में GGUF मॉडल इम्पोर्ट करने के दो तरीके
Ollama में GGUF मॉडल इम्पोर्ट करने के दो तरीके हैं, और सही तरीका इस बात पर निर्भर करता है कि फाइल अभी कहाँ स्थित है। यदि मॉडल Hugging Face रिपॉजिटरी में है, तो एक ollama run कमांड इसे पुल करके रन कर देता है, जिसमें किसी Modelfile की आवश्यकता नहीं होती। यदि .gguf फाइल पहले से ही आपके सर्वर की डिस्क पर मौजूद है, तो आप दो लाइन की Modelfile लिखें और ollama create रन करें।
दोनों रास्ते एक ही परिणाम पर समाप्त होते हैं: आपकी लोकल Ollama लाइब्रेरी में एक नामित मॉडल, जिसे ollama run और Ollama API सर्व कर सकते हैं। पहले रास्ते का उपयोग तब करें जब किसी और ने फाइल पब्लिश की हो। दूसरे का उपयोग तब करें जब आपने मॉडल को स्वयं क्वांटाइज़ किया हो, फाइल scp या rsync के माध्यम से प्राप्त हुई हो, या मशीन Hugging Face तक न पहुँच सकती हो।
GGUF फाइल एक बाइनरी है जिसमें वेट्स, टोकेनाइज़र और मॉडल मेटाडेटा एक साथ होते हैं। यह वह फॉर्मेट है जिसे llama.cpp पढ़ता है, और Ollama को llama.cpp पर बनाया गया है, यही कारण है कि लगभग हर ओपन मॉडल का कम्युनिटी GGUF कन्वर्जन उपलब्ध है। Ollama सीधे .safetensors वेट्स के फोल्डर को लोड नहीं करता है, इसलिए कन्वर्जन स्टेप का अपना महत्व है।
नीचे दी गई हर चीज़ यह मानकर चलती है कि Ollama पहले से इंस्टॉल है और इसकी सर्विस चल रही है। यदि ऐसा नहीं है, तो Ollama को VPS पर इंस्टॉल करने से शुरुआत करें और फिर वापस आएँ। सबसे पहले ollama list रन करें। यदि यह कनेक्शन एरर के बजाय एक टेबल (भले ही खाली हो) दिखाता है, तो सर्वर चालू है और यह गाइड काम करेगी।
विकल्प एक: Modelfile के बिना Hugging Face से GGUF चलाना
Ollama सीधे Hugging Face रिपॉजिटरी से GGUF फाइल पुल कर सकता है। कमांड में रिपॉजिटरी पाथ के साथ hf.co/ प्रीफिक्स का उपयोग होता है:
ollama run hf.co/{username}/{repository}hf.co और huggingface.co दोनों डोमेन नाम के रूप में काम करते हैं। Hugging Face डॉक्यूमेंटेशन का एक वास्तविक उदाहरण:
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUFपहली बार चलाने पर फाइल डाउनलोड होती है, इसलिए डाउनलोड पूरा होने तक चैट प्रॉम्प्ट दिखाई नहीं देता है। उसके बाद मॉडल आपकी लोकल लाइब्रेरी में आ जाता है और तेजी से शुरू होता है। एक दूसरा शेल खोलें और यह देखने के लिए कि इसे किस नाम से स्टोर किया गया है, ollama list चलाएं। वह नाम पूरा hf.co/... स्ट्रिंग और उसके टैग के साथ होता है, जिसे हर बार टाइप करना लंबा हो सकता है। इसे एक छोटा उपनाम (alias) दें:
ollama cp hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF my-llama
ollama run my-llamaयह तरीका केवल उन रिपॉजिटरी पर काम करता है जिनमें वास्तव में GGUF फाइलें मौजूद हैं। जो रिपॉजिटरी केवल .safetensors वेट्स प्रकाशित करती है, उसमें Ollama के लिए फेच करने हेतु कुछ नहीं होता है, और आपको नीचे बताए गए कन्वर्जन स्टेप की आवश्यकता होगी।
Ollama कौन सा क्वांटाइजेशन चुनता है?
Hugging Face का Ollama डॉक्यूमेंटेशन, जिसे 25 अगस्त 2026 को पढ़ा गया, डिफ़ॉल्ट के बारे में स्पष्ट है: "डिफ़ॉल्ट रूप से, Q4_K_M क्वांटाइजेशन स्कीम का उपयोग किया जाता है, जब यह मॉडल रिपो के अंदर मौजूद हो। यदि नहीं, तो हम रिपो में मौजूद किसी एक उचित क्वांट प्रकार को चुनने का डिफ़ॉल्ट विकल्प अपनाते हैं।" इसलिए, जो रिपॉजिटरी दस क्वांट प्रकाशित करती है, वह आपको Q4_K_M देती है, और Q4_K_M के बिना वाली रिपॉजिटरी आपको वह विकल्प देती है जो Ollama ने आपकी ओर से चुना है। उस पेज पर निर्भर होने से पहले उसे दोबारा पढ़ें, क्योंकि डिफ़ॉल्ट बदलते रहते हैं।
टैग के रूप में जोड़कर एक विशिष्ट क्वांट की मांग करें:
ollama run hf.co/{username}/{repository}:{quantization}ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Q8_0
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:iq3_m
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Llama-3.2-3B-Instruct-IQ3_M.ggufक्वांटाइजेशन नाम केस-इनसेंसिटिव है, इसलिए :iq3_m और :IQ3_M का मतलब एक ही है। आप टैग के रूप में सटीक फाइलनाम भी पास कर सकते हैं, जो तब सुरक्षित होता है जब रिपॉजिटरी में छोटे नाम अस्पष्ट हों। टैग में उस फाइल का नाम होना चाहिए जो उस रिपॉजिटरी में मौजूद है, इसलिए टाइप करने से पहले Files and versions टैब खोलें और वास्तविक फाइलनाम पढ़ें। आपको कौन सा क्वांट चाहिए, यह मेमोरी और क्वालिटी का प्रश्न है, और Q4, Q8 और FP16 के बीच का अंतर इस ट्रेड-ऑफ को ठीक से कवर करता है।
विकल्प दो: अपनी डिस्क से .gguf फ़ाइल इम्पोर्ट करना
जब फ़ाइल पहले से ही सर्वर पर मौजूद हो, तो आपको एक Modelfile की आवश्यकता होती है। यह केवल एक लाइन की हो सकती है। एक डायरेक्टरी बनाएँ, उसमें Modelfile रखें और FROM को फ़ाइल की ओर निर्देशित करें:
mkdir -p ~/models/my-model
cd ~/models/my-modelFROM /home/you/models/my-model-Q4_K_M.ggufइसे Modelfile के रूप में सेव करें, फिर मॉडल बिल्ड करें:
ollama create my-modelollama create डिफ़ॉल्ट रूप से वर्तमान डायरेक्टरी में Modelfile नामक फ़ाइल को पढ़ता है। जब आपकी फ़ाइल का नाम अलग हो या वह कहीं और स्थित हो, तो -f का उपयोग करें, जैसा कि ollama create my-model -f /home/you/models/my-model/Modelfile में दिखाया गया है। अपने बिल्ड पर फ्लैग और उसके डिफ़ॉल्ट मान को देखने के लिए ollama create --help चलाएँ। FROM में दिया गया पाथ एब्सोल्यूट हो सकता है, या Modelfile के सापेक्ष (relative) हो सकता है, इसलिए यदि दोनों एक ही डायरेक्टरी में हैं तो FROM ./my-model-Q4_K_M.gguf काम करता है। एक एब्सोल्यूट पाथ इस प्रश्न को पूरी तरह समाप्त कर देता है।
परिणाम पर भरोसा करने से पहले उसकी जाँच करें:
ollama list
ollama show my-model
ollama run my-model "Reply with one short sentence."ollama list में अब my-model शामिल होना चाहिए। ollama show my-model आर्किटेक्चर, पैरामीटर काउंट, कॉन्टेक्स्ट लेंथ और वह क्वांटाइज़ेशन प्रिंट करता है जिसे Ollama ने फ़ाइल के मेटाडेटा से पढ़ा है। फ़ाइल के नाम पर भरोसा करने के बजाय उन मानों को पढ़ें, क्योंकि फ़ाइल का नाम किसी व्यक्ति द्वारा हाथ से टाइप किया गया एक स्ट्रिंग होता है। यदि मॉडल आपके टेस्ट प्रॉम्प्ट का उत्तर सामान्य भाषा में देता है और फिर रुक जाता है, तो इम्पोर्ट सफल रहा। यदि ऐसा नहीं होता है, तो नीचे दिए गए टेम्पलेट सेक्शन पर जाएँ, क्योंकि लगभग हमेशा यही कारण होता है।
डिस्क स्पेस के बारे में एक बात ध्यान रखें: ollama create GGUF को Ollama के अपने मॉडल स्टोर में कॉपी करता है, न कि फ़ाइल को उसके मूल स्थान से रेफरेंस करता है। जब तक आप मूल फ़ाइल को हटा नहीं देते, तब तक वेट्स (weights) डिस्क पर दो बार मौजूद रहते हैं। एक बार जब ollama run my-model काम करने लगे, तो सोर्स फ़ाइल को डिलीट कर दें, या उसे ऐसी जगह रखें जहाँ आपको दो बार भुगतान न करना पड़े। Ollama अपने मॉडल्स को डिस्क पर कहाँ रखता है में लेआउट और उसे मूव करने का तरीका बताया गया है।
--quantize कब लागू होता है, और कब नहीं
ollama create में एक --quantize फ्लैग होता है, और यह केवल एक स्थिति के लिए मौजूद है: FP16 या FP32 में सोर्स मॉडल, जिसका अर्थ है फुल प्रिसिजन वेट्स। Ollama का इम्पोर्ट डॉक्यूमेंटेशन q8_0 और k-means वेरिएंट्स q4_K_S तथा q4_K_M को टारगेट के रूप में सूचीबद्ध करता है।
ollama create --quantize q4_K_M my-modelउस फ्लैग को ऐसी फ़ाइल पर न लगाएँ जो पहले से ही क्वांटाइज़्ड है। एक .gguf जिसके नाम में Q4_K_M या Q5_K_S है, वह इस चरण से पहले ही गुजर चुका है, और फ्लैग के पास करने के लिए कोई काम नहीं है। क्वांटाइज़ेशन उच्च प्रिसिजन से निम्न प्रिसिजन में एक तरफा रूपांतरण है, इसलिए Q4 से Q8 तक वापस जाने का कोई रास्ता नहीं है। यदि आपका सोर्स .safetensors फ़ाइलों की एक Hugging Face रिपॉजिटरी है, तो पहले उसे llama.cpp रिपॉजिटरी के convert_hf_to_gguf.py के साथ कन्वर्ट करें, जो कि वह टूल है जिसकी ओर Ollama का डॉक्यूमेंटेशन इशारा करता है, फिर उस GGUF को इम्पोर्ट करें जिसे वह स्क्रिप्ट लिखती है। Ollama और llama.cpp का संबंध बताता है कि कन्वर्जन स्क्रिप्ट दूसरे प्रोजेक्ट की क्यों है।
इंपोर्ट की गई GGUF फाइल अस्पष्ट उत्तर क्यों देती है या रुकती क्यों नहीं है?
यह वह विफलता है जिसे अधिकांश इंपोर्ट ट्यूटोरियल छोड़ देते हैं, और यही वह समस्या है जिसका सामना आपको करना पड़ेगा। इसके लक्षण ऐसे होते हैं जैसे मॉडल खराब हो गया हो। कंट्रोल टोकन उत्तर में दिखाई देने वाले टेक्स्ट के रूप में आते हैं, जैसे कि <|im_start|>assistant या <|end|> जैसी स्ट्रिंग्स। मॉडल उत्तर देता है, फिर एक नया उपयोगकर्ता प्रश्न लिखता है और उसका भी उत्तर दे देता है। जनरेशन तब तक चलती रहती है जब तक आप Ctrl+C नहीं दबाते।
मॉडल ठीक है। चैट टेम्पलेट गलत है। चैट टेम्पलेट वह रैपर है जो आपके संदेश को उस सटीक टोकन अनुक्रम में बदलता है जिस पर मॉडल को प्रशिक्षित किया गया था, जिसमें यह चिह्नित करने के लिए अपने स्वयं के मार्कर होते हैं कि सिस्टम प्रॉम्प्ट कहाँ समाप्त होता है और उपयोगकर्ता की बारी कहाँ शुरू होती है। Ollama आपके लिए एक चुनता है: दस्तावेज़ीकरण कहता है कि एक टेम्पलेट "आमतौर पर उपयोग किए जाने वाले टेम्पलेट्स की सूची से स्वचालित रूप से चुना जाएगा", जो GGUF फाइल के अंदर संग्रहीत इन-बिल्ट tokenizer.chat_template मेटाडेटा पर आधारित होता है। जब वह मेटाडेटा गायब होता है, या जब वह सूची में किसी से मेल नहीं खाता है, तो आपको एक सामान्य रैपर मिलता है। मॉडल तब एक ऐसा प्रॉम्प्ट देखता है जो उसके प्रशिक्षण से बिल्कुल अलग होता है, इसलिए उसे वह एंड-ऑफ-टर्न मार्कर कभी नहीं मिलता जिस पर उसे रुकना सीखना था।
Ollama ने वास्तव में क्या चुना है, इसे प्रिंट करें:
ollama show --template my-model
ollama show --modelfile my-modelएक खाली या स्पष्ट रूप से सामान्य टेम्पलेट इसकी पुष्टि करता है। Modelfile में टेम्पलेट स्वयं लिखें:
FROM /home/you/models/my-model-Q4_K_M.gguf
TEMPLATE """{{ if .System }}<|system|>
{{ .System }}<|end|>
{{ end }}{{ if .Prompt }}<|user|>
{{ .Prompt }}<|end|>
{{ end }}<|assistant|>
{{ .Response }}<|end|>"""
PARAMETER stop "<|end|>"ollama create my-model के साथ फिर से बिल्ड करें और वही टेस्ट प्रॉम्प्ट दोबारा भेजें। stop पैरामीटर आपका सुरक्षा कवच है: यह Ollama को बताता है कि जब वह स्ट्रिंग दिखाई दे तो जनरेशन को काट दें, जो कभी न रुकने वाले लक्षण को समाप्त कर देता है, भले ही आप अभी भी रैपर को ट्यून कर रहे हों। यदि उत्तर अभी भी चलता रहता है क्योंकि आपके द्वारा नामित कोई भी मार्कर दिखाई नहीं देता है, तो a num_predict ceiling इसे टेम्पलेट द्वारा उत्सर्जित किए जाने की परवाह किए बिना एक निश्चित टोकन गणना पर काट देता है।
टेम्पलेट एक Go टेम्पलेट होना चाहिए, Jinja टेम्पलेट नहीं। Hugging Face दस्तावेज़ीकरण इसे सीधे बताता है, और यह महत्वपूर्ण है क्योंकि मूल मॉडल रिपॉजिटरी में tokenizer.chat_template फ़ील्ड में Jinja होता है। उसे बिना बदले पेस्ट करने से काम नहीं चलता। Ollama के सिंटैक्स में तीन वेरिएबल होते हैं: सिस्टम प्रॉम्प्ट के लिए {{ .System }}, उपयोगकर्ता संदेश के लिए {{ .Prompt }}, और मॉडल के उत्तर के लिए {{ .Response }}। मॉडल के वास्तविक टर्न मार्करों को उसके मॉडल कार्ड या उसके tokenizer_config.json में खोजें, फिर उन्हें हाथ से उस Go सिंटैक्स में फिर से लिखें।
एक शॉर्टकट उस अधिकांश काम को बचा लेता है। कई मॉडल एक सामान्य प्रॉम्प्ट फॉर्मेट साझा करते हैं, इसलिए यदि आपकी लाइब्रेरी में कोई अन्य मॉडल उसी का उपयोग करता है, तो उसके विरुद्ध ollama show --template चलाएं और जो वह प्रिंट करता है उसे कॉपी करें।
Hugging Face रिपॉजिटरी में template, system और params फाइलें
Hugging Face रूट, Modelfile में दिए गए निर्देशों के बजाय रिपॉजिटरी में मौजूद फाइलों के समान ही नियंत्रण प्रदान करता है। यदि आप रिपॉजिटरी के स्वामी हैं, या आप अपना स्वयं का quant प्रकाशित कर रहे हैं, तो उन्हें वहां जोड़ें और प्रत्येक ollama run hf.co/... उन्हें स्वतः पिक कर लेगा।
templateनाम की फाइल में Go template होता है। नियम वही है: Jinja नहीं, Go का उपयोग करें।systemनाम की फाइल में system prompt होता है।paramsनाम की फाइल में sampling parameters होते हैं, और यह JSON प्रारूप में होनी चाहिए।
एक न्यूनतम params फाइल:
{
"stop": ["<|end|>"],
"temperature": 0.7
}जब आप रिपॉजिटरी के स्वामी नहीं होते हैं, तो आप उन फाइलों को नहीं जोड़ सकते। मॉडल को एक बार pull करें, आपको जो दिया गया है उसे dump करने के लिए ollama show --modelfile hf.co/... चलाएं, और उस आउटपुट को Modelfile के रूप में सेव करें। इसकी FROM लाइन उस blob की ओर इशारा करती है जिसे Ollama पहले ही डाउनलोड कर चुका है, इसलिए आप TEMPLATE और PARAMETER लाइनों को एडिट करें और बिना कुछ दोबारा डाउनलोड किए एक फिक्स्ड लोकल कॉपी बनाने के लिए ollama create चलाएं। किसी और के द्वारा बनाए गए खराब quant को ठीक करने का यह मानक तरीका है।
निजी GGUF रिपॉजिटरी को इम्पोर्ट कैसे करें
एक निजी रिपॉजिटरी के लिए आपके Hugging Face अकाउंट पर Ollama की SSH key की आवश्यकता होती है। इस प्रक्रिया के लिए प्रलेखित विधि API token के बजाय SSH key का उपयोग करती है, इसलिए आपके पास पहले से मौजूद token इसे नहीं खोल पाएगा।
Public key को प्रिंट करें। जिस Linux सर्वर पर Ollama को आधिकारिक स्क्रिप्ट के साथ इंस्टॉल किया गया है, वहां सर्विस ollama यूजर के रूप में चलती है, इसलिए key उस यूजर की होम डायरेक्टरी में स्थित होती है:
sudo cat /usr/share/ollama/.ollama/id_ed25519.pubयदि आप ollama serve को स्वयं अपने यूजर के रूप में शुरू करते हैं, तो पाथ इसके बजाय ~/.ollama/id_ed25519.pub होगा। पूरी लाइन को कॉपी करें, https://huggingface.co/settings/keys पर अपनी Hugging Face अकाउंट सेटिंग्स खोलें, और इसे एक नई SSH key के रूप में जोड़ें। इसके बाद सामान्य कमांड आपकी निजी रिपॉजिटरी पर काम करने लगेगी:
ollama run hf.co/{username}/{repository}यदि key जोड़ने के बाद भी pull विफल रहता है, तो संभवतः आपने गलत फाइल प्रिंट की है। सर्वर डाउनलोड निष्पादित करता है और अपनी स्वयं की key प्रस्तुत करता है, और systemd द्वारा शुरू किया गया सर्वर कभी भी आपके यूजर की ~/.ollama को नहीं पढ़ता है, इसलिए आपकी होम डायरेक्टरी के अंतर्गत मौजूद key वह नहीं है जिसे Hugging Face देखता है।
क्या मॉडल आपके VPS पर फिट होगा?
यह निर्णय इस बात पर निर्भर करता है कि डिस्क पर फाइल का आकार कितना है और आपके context window को कितनी मेमोरी की आवश्यकता है। weights मेमोरी में लगभग उसी आकार में लोड होते हैं जितना वे फाइल में घेरते हैं, और context allocation इसके ऊपर होता है, जो आपके द्वारा अनुमति दिए गए tokens की संख्या के साथ बढ़ता है। Ollama द्वारा मॉडल के लिए रिकॉर्ड किए गए आकार को पढ़ने के लिए ollama list चलाएँ, इसकी तुलना बॉक्स पर मौजूद free -h से करें, और ऑपरेटिंग सिस्टम तथा सर्वर पर चल रही अन्य चीजों के लिए पर्याप्त जगह (headroom) छोड़ें। यदि आप किसी वास्तविक मॉडल पर की गई गणना को देखना चाहते हैं, तो running Nemotron 3.5 Lightning on a VPS में पुल करने के लिए सटीक tag, आवश्यक RAM और यह जानकारी दी गई है कि क्या केवल CPU वाला बॉक्स इसे संभाल पाएगा।
Context वह हिस्सा है जिसे लोग अक्सर भूल जाते हैं। जो मॉडल default window पर लोड होता है, वह num_ctx बढ़ाने पर विफल हो सकता है, क्योंकि वह allocation आपके द्वारा मांगी गई window के अनुसार बढ़ता है। Setting num_ctx and what it costs in memory में इसका आकार निर्धारित करने की विधि दी गई है। जब कुल योग बहुत अधिक हो जाता है, तो इसका समाधान आमतौर पर उसी मॉडल का छोटा quant उपयोग करना होता है, जिसे the Q4 against Q8 comparison में कवर किया गया है।
विफलता स्पष्ट होती है। केवल CPU वाले VPS पर, kernel का out of memory killer प्रक्रिया को रोक देता है, और journalctl -u ollama -n 50 के साथ dmesg उस kill को दिखाता है। GPU वाले बॉक्स पर, ollama ps एक PROCESSOR कॉलम प्रिंट करता है जो बताता है कि लोड किया गया मॉडल GPU मेमोरी में गया है, सिस्टम मेमोरी में, या दोनों में विभाजित हुआ है। जो मॉडल सिस्टम मेमोरी में चला जाता है, वह भी उत्तर देता है, लेकिन धीरे। Measuring tokens per second "धीरे" को एक ऐसी संख्या में बदल देता है जिसकी तुलना आप विभिन्न quants के बीच कर सकते हैं।
आयात की गई सामग्री की जाँच करें
किसी भी import के बाद, इस क्रम में ये चार commands चलाएँ:
ollama list
ollama show my-model
ollama show --modelfile my-model
ollama run my-model "Reply with one short sentence."ollama list यह सिद्ध करता है कि model मौजूद है और Ollama द्वारा दर्ज किया गया उसका आकार दिखाता है। ollama show यह सिद्ध करता है कि Ollama ने GGUF से आवश्यक metadata पढ़ लिया है। ollama show --modelfile यह सिद्ध करता है कि वह वास्तव में किस template और parameters का उपयोग करेगा; यह वह जाँच है जो आपके उपयोगकर्ताओं द्वारा अनुभव किए जाने से पहले ही गलत output (garbage-output) वाली विफलता को पकड़ लेती है। test prompt पूरी प्रक्रिया का परीक्षण करता है, क्योंकि एक खराब template वाला model सबसे छोटे अनुरोध पर भी विफल हो जाता है। एक बार जब वह prompt सही परिणाम दे दे, तो जो नाम आपने model को दिया है, वही नाम आप Ollama API से बात करने वाली किसी भी अन्य चीज़ को देंगे, जिसमें आपके अपने सर्वर पर निर्देशित एक कोडिंग एजेंट भी शामिल है। एक खराब import को ollama rm my-model के साथ हटाएँ और उसे फिर से बनाएँ। वह command Ollama की copy को हटा देती है और आपके source .gguf को सुरक्षित रखती है।
FAQ
क्या मैं Modelfile लिखे बिना Ollama में GGUF import कर सकता हूँ?
हाँ, जब फाइल Hugging Face रिपॉजिटरी में मौजूद हो। ollama run hf.co/{username}/{repository} इसे सीधे पुल और रन करता है, और ollama run hf.co/{username}/{repository}:{quantization} एक विशिष्ट क्वांट (quant) का चयन करता है। Modelfile की आवश्यकता केवल तब होती है जब .gguf पहले से ही आपकी डिस्क पर हो, और उस स्थिति में यह केवल FROM /path/to/file.gguf के बाद ollama create my-model वाली एक लाइन हो सकती है।
जब मैं कोई क्वांट निर्दिष्ट नहीं करता, तो Ollama कौन सा क्वांट डाउनलोड करता है?
Hugging Face का डॉक्यूमेंटेशन, जिसे 25 अगस्त 2026 को पढ़ा गया, कहता है कि जब वह क्वांट रिपॉजिटरी में मौजूद होता है तो Q4_K_M का उपयोग किया जाता है, और अन्यथा Ollama रिपॉजिटरी में मौजूद किसी एक उचित क्वांट प्रकार को चुन लेता है। इसे नियंत्रित करने के लिए :Q8_0 जैसा टैग जोड़ें। ollama show <model> के साथ पुष्टि करें कि आपको वास्तव में क्या प्राप्त हुआ है, जो फाइल के नाम के बजाय उसके मेटाडेटा से क्वांटाइजेशन को प्रिंट करता है।
मेरा इम्पोर्ट किया गया मॉडल खुद को दोहराता क्यों है या जनरेट करना बंद क्यों नहीं करता?
चैट टेम्पलेट मॉडल से मेल नहीं खाता है। Ollama GGUF के अंदर मौजूद tokenizer.chat_template मेटाडेटा से स्वचालित रूप से एक टेम्पलेट चुनता है, और जब वह मेटाडेटा गायब या अपरिचित होता है तो आपको एक जेनेरिक रैपर मिलता है, इसलिए मॉडल को वह end-of-turn मार्कर नहीं दिखता जिस पर उसे प्रशिक्षित किया गया था। वर्तमान टेम्पलेट को ollama show --template <model> के साथ प्रिंट करें, फिर Modelfile में एक TEMPLATE ब्लॉक और एक PARAMETER stop लाइन जोड़ें और ollama create को फिर से चलाएँ। इसे Go टेम्पलेट के रूप में लिखें। मूल रिपॉजिटरी का Jinja टेम्पलेट काम नहीं करेगा।
क्या मुझे मेरे द्वारा डाउनलोड किए गए GGUF पर --quantize का उपयोग करना चाहिए?
नहीं। --quantize, ollama create के दौरान FP16 या FP32 स्रोत को परिवर्तित करता है, और जिस फाइल के नाम में पहले से ही Q4_K_M जैसा क्वांट मौजूद है, वह पहले ही परिवर्तित हो चुकी है। दोबारा क्वांटाइज करके प्रिसिजन (precision) को वापस नहीं पाया जा सकता है, और वापस ऊपर जाने का कोई रास्ता नहीं है। इस फ्लैग का उपयोग केवल तब करें जब आपने स्वयं safetensors को फुल प्रिसिजन GGUF में परिवर्तित किया हो और अब आप एक छोटा वर्जन चाहते हों।
मैं प्राइवेट GGUF रिपॉजिटरी को कैसे पुल करूँ?
Ollama की SSH पब्लिक की को अपने Hugging Face अकाउंट में जोड़ें। इसे स्टैंडर्ड Linux इंस्टॉलेशन पर sudo cat /usr/share/ollama/.ollama/id_ed25519.pub के साथ प्रिंट करें, या जब आप सर्वर को अपने यूजर के रूप में चलाते हैं तो ~/.ollama/id_ed25519.pub से प्रिंट करें, फिर इसे अपने अकाउंट के SSH की सेटिंग्स पेज पर जोड़ें। उसके बाद, ollama run hf.co/{username}/{repository} आपकी अपनी प्राइवेट रिपॉजिटरी और उन रिपॉजिटरी पर काम करता है जो उस ऑर्गनाइजेशन में हैं जिसके आप सदस्य हैं।