Ollama-এ GGUF মডেল import করার নিয়ম
Hugging Face বা local .gguf file Ollama-এ চালান, Modelfile ব্যবহারের ধাপ জানুন এবং chat template mismatch-এর কারণে garbage reply হলে সমাধান করুন।
Ollama-এ GGUF মডেল import করার দুটি উপায়
Ollama-এ GGUF মডেল import করার দুটি উপায় আছে। ফাইলটি বর্তমানে কোথায় আছে, তার ওপর সঠিক পদ্ধতি নির্ভর করে। মডেলটি যদি কোনো Hugging Face repository-তে থাকে, তাহলে একটি ollama run command সেটি pull করে চালাবে; এর জন্য Modelfile প্রয়োজন হয় না। .gguf file যদি ইতিমধ্যে আপনার server-এর disk-এ থাকে, তাহলে দুই লাইনের একটি Modelfile লিখে ollama create চালান।
দুই পদ্ধতির শেষ ফল একই: আপনার local Ollama library-তে একটি নামযুক্ত মডেল তৈরি হবে, যা ollama run এবং Ollama API serve করতে পারবে। অন্য কেউ file প্রকাশ করলে প্রথম পদ্ধতি ব্যবহার করুন। মডেলটি নিজে quantize করলে, file scp বা rsync-এর মাধ্যমে এলে, অথবা machine Hugging Face-এ পৌঁছাতে না পারলে দ্বিতীয় পদ্ধতি ব্যবহার করুন।
একটি GGUF file হলো একটি binary file, যাতে weights, tokenizer এবং model metadata একসঙ্গে থাকে। এটি llama.cpp যে format পড়ে, এবং Ollama llama.cpp-এর ওপর তৈরি। এ কারণেই প্রায় সব open model-এর community GGUF conversion পাওয়া যায়। Ollama সরাসরি .safetensors weights-এর কোনো folder load করে না। তাই conversion ধাপটি প্রয়োজনীয়।
নিচের সবকিছু ধরে নিচ্ছে যে Ollama ইতিমধ্যে installed এবং এর service চলছে। তা না হলে VPS-এ Ollama install করা দিয়ে শুরু করে এখানে ফিরে আসুন। প্রথমে ollama list চালান। Connection error-এর পরিবর্তে এটি যদি একটি table ফেরত দেয়, table-টি খালি হলেও, তাহলে server চালু আছে এবং এই guide-এর বাকি ধাপ কাজ করবে।
Hugging Face থেকে Modelfile ছাড়া GGUF চালানোর পদ্ধতি
Ollama সরাসরি কোনো Hugging Face repository থেকে GGUF আনতে পারে। কমান্ডটিতে repository path-এর আগে hf.co/ prefix ব্যবহার করা হয়:
ollama run hf.co/{username}/{repository}ডোমেইন নাম হিসেবে hf.co এবং huggingface.co—দুটিই কাজ করে। Hugging Face documentation থেকে একটি বাস্তব উদাহরণ:
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUFপ্রথমবার চালালে ফাইলটি download হয়। তাই download শেষ না হওয়া পর্যন্ত chat prompt দেখা যায় না। এরপর model-টি আপনার local library-তে থাকে এবং দ্রুত start হয়। দ্বিতীয় একটি shell খুলে ollama list চালান, যাতে এটি কোন নামে সংরক্ষিত হয়েছে তা দেখা যায়। সেই নামটি tag-সহ সম্পূর্ণ hf.co/... string। প্রতিবার এত দীর্ঘ নাম টাইপ করা অসুবিধাজনক। একটি ছোট alias দিন:
ollama cp hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF my-llama
ollama run my-llamaএই পদ্ধতি শুধু সেই repository-তে কাজ করে যেখানে সত্যিই GGUF file আছে। কোনো repository-তে যদি শুধু .safetensors weights প্রকাশ করা হয় এবং অন্য কিছু না থাকে, তাহলে Ollama fetch করার মতো কিছু পায় না। সে ক্ষেত্রে নিচে বর্ণিত conversion ধাপটি প্রয়োজন।
Ollama কোন quantization বেছে নেয়?
25 August 2026-এ পড়া Hugging Face-এর Ollama documentation-এ default সম্পর্কে স্পষ্টভাবে বলা আছে: "By default, the Q4_K_M quantization scheme is used, when it's present inside the model repo. If not, we default to picking one reasonable quant type present inside the repo." তাই কোনো repository-তে দশটি quant থাকলে আপনি Q4_K_M পাবেন। আর repository-তে Q4_K_M না থাকলে Ollama আপনার হয়ে একটি quant বেছে নেবে। এর ওপর নির্ভর করার আগে ওই page-টি আবার পড়ুন, কারণ default পরিবর্তিত হতে পারে।
tag হিসেবে নির্দিষ্ট quant যোগ করে সেটি চাওয়া যায়:
ollama run hf.co/{username}/{repository}:{quantization}ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Q8_0
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:iq3_m
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Llama-3.2-3B-Instruct-IQ3_M.ggufQuantization-এর নামের ক্ষেত্রে বড় হাতের ও ছোট হাতের অক্ষর বিবেচনা করা হয় না। তাই :iq3_m এবং :IQ3_M একই অর্থ বহন করে। tag হিসেবে সম্পূর্ণ filename-ও দেওয়া যায়। কোনো repository-তে সংক্ষিপ্ত নাম অস্পষ্ট হলে এটিই নিরাপদ পদ্ধতি। tag-এ ওই repository-তে থাকা একটি file-এর নাম দিতে হবে। তাই Files and versions tab খুলে আসল filename দেখে তারপর সেটি টাইপ করুন। কোন quant ব্যবহার করবেন, তা memory এবং quality-এর ওপর নির্ভর করে। Q4, Q8 এবং FP16-এর পার্থক্য এই trade-off সঠিকভাবে ব্যাখ্যা করে।
পদ্ধতি দুই: নিজের disk থেকে একটি .gguf file import করুন
Fileটি যদি ইতিমধ্যে server-এ থাকে, আপনার একটি Modelfile প্রয়োজন। এটি এক লাইনেরও হতে পারে। একটি directory তৈরি করুন, সেখানে Modelfile রাখুন, এবং FROM-কে fileটির দিকে নির্দেশ করুন:
mkdir -p ~/models/my-model
cd ~/models/my-modelFROM /home/you/models/my-model-Q4_K_M.ggufএটি Modelfile নামে save করুন, তারপর model build করুন:
ollama create my-modelollama create ডিফল্টভাবে বর্তমান directory-তে Modelfile নামের একটি file পড়ে। আপনার file-এর অন্য কোনো নাম থাকলে বা অন্য কোথাও থাকলে -f ব্যবহার করুন, যেমন ollama create my-model -f /home/you/models/my-model/Modelfile-এ দেখানো হয়েছে। আপনার build-এ flag এবং তার default দেখতে ollama create --help চালান। FROM-এর path absolute হতে পারে, অথবা Modelfile-এর relative path হতে পারে। তাই দুটিই একই directory-তে থাকলে FROM ./my-model-Q4_K_M.gguf কাজ করে। Absolute path ব্যবহার করলে এই অনিশ্চয়তা থাকে না।
বিশ্বাস করার আগে ফলাফল পরীক্ষা করুন:
ollama list
ollama show my-model
ollama run my-model "Reply with one short sentence."ollama list-এ এখন my-model অন্তর্ভুক্ত থাকা উচিত। ollama show my-model architecture, parameter count, context length এবং Ollama fileটির নিজস্ব metadata থেকে পড়া quantization দেখায়। Filename-এর ওপর নির্ভর না করে এই মানগুলো পরীক্ষা করুন, কারণ filename হাতে লেখা একটি string মাত্র। Modelটি আপনার test prompt-এর উত্তর স্বাভাবিক ভাষায় দিয়ে থেমে গেলে import সফল হয়েছে। তা না হলে নিচের template section-এ যান, কারণ প্রায় সব সময় এটিই কারণ।
Disk space সম্পর্কে একটি বিষয় জানা দরকার: ollama create GGUF-কে fileটি যেখানে আছে সেখান থেকে reference না করে Ollama-এর নিজস্ব model store-এ copy করে। Original fileটি সরানো পর্যন্ত weights disk-এ দুবার থাকে। ollama run my-model কাজ করছে নিশ্চিত হলে source file মুছে দিন, অথবা এমন জায়গায় রাখুন যেখানে একই data-এর জন্য দুবার storage খরচ হচ্ছে না। Ollama disk-এ তার model কোথায় রাখে-এ layout এবং এটি সরানোর পদ্ধতি আছে।
--quantize কখন প্রযোজ্য এবং কখন প্রযোজ্য নয়
ollama create-এ একটি --quantize flag আছে। এটি শুধু একটি ক্ষেত্রে ব্যবহৃত হয়: FP16 বা FP32-এ থাকা source model-এর জন্য, অর্থাৎ full precision weights-এর ক্ষেত্রে। Ollama-এর import documentation-এ q8_0 এবং k-means variant q4_K_S ও q4_K_M-কে target হিসেবে তালিকাভুক্ত করা হয়েছে।
ollama create --quantize q4_K_M my-modelইতিমধ্যে quantized file-এর ক্ষেত্রে এই flag ব্যবহার করবেন না। কোনো .gguf-এর নামে Q4_K_M বা Q5_K_S থাকলে সেটি ইতিমধ্যে এই ধাপের মধ্য দিয়ে গেছে, তাই flagটির আর কোনো কাজ নেই। Quantization হলো higher precision থেকে lower precision-এ একমুখী conversion। তাই Q4 থেকে Q8-এ ফেরার কোনো পথ নেই। আপনার source যদি .safetensors file-সমৃদ্ধ কোনো Hugging Face repository হয়, তাহলে প্রথমে llama.cpp repository-এর convert_hf_to_gguf.py দিয়ে এটি convert করুন। Ollama documentation এই toolটির দিকেই নির্দেশ করে। এরপর scriptটি যে GGUF লেখে, সেটি import করুন। Ollama এবং llama.cpp কীভাবে সম্পর্কিত অংশে ব্যাখ্যা করা হয়েছে কেন conversion scriptটি অন্য project-এর অন্তর্ভুক্ত।
কেন আমদানি করা GGUF থেকে এলোমেলো উত্তর আসে বা উত্তর কখনও শেষ হয় না?
এটি এমন একটি সমস্যা যা বেশিরভাগ import tutorial এড়িয়ে যায়, এবং আপনিও এর মুখোমুখি হবেন। লক্ষণগুলো দেখে মনে হয় মডেলটি নষ্ট। উত্তরে control token দৃশ্যমান text হিসেবে দেখা যায়, যেমন <|im_start|>assistant বা <|end|>। মডেল উত্তর দেওয়ার পর নতুন user question লিখে সেটিরও উত্তর দেয়। আপনি Ctrl+C চাপা পর্যন্ত generation চলতে থাকে।
মডেলটি ঠিক আছে। chat template ভুল। chat template হলো এমন একটি wrapper, যা আপনার message-কে মডেলটি যে exact token sequence দিয়ে training পেয়েছে তাতে রূপান্তর করে। এতে system prompt কোথায় শেষ হয় এবং user turn কোথায় শুরু হয়, তা বোঝানোর জন্য নিজস্ব marker থাকে। Ollama আপনার জন্য একটি template বেছে নেয়: documentation অনুযায়ী, GGUF file-এর ভেতরে থাকা built-in tokenizer.chat_template metadata-এর ভিত্তিতে "সাধারণভাবে ব্যবহৃত template-এর একটি তালিকা থেকে স্বয়ংক্রিয়ভাবে" template বেছে নেওয়া হয়। এই metadata অনুপস্থিত হলে, অথবা তালিকার কোনো template-এর সঙ্গে মিল না হলে, আপনি একটি generic wrapper পান। তখন মডেল এমন prompt দেখে যার গঠন training-এর কোনো prompt-এর মতো নয়। ফলে training-এ শেখা end-of-turn marker এটি আর খুঁজে পায় না, যেটি দেখে generation থামার কথা।
Ollama আসলে কোন template বেছে নিয়েছে তা দেখুন:
ollama show --template my-model
ollama show --modelfile my-modelTemplate খালি হলে বা স্পষ্টতই generic হলে বিষয়টি নিশ্চিত হয়। Modelfile-এ template নিজে লিখুন:
FROM /home/you/models/my-model-Q4_K_M.gguf
TEMPLATE """{{ if .System }}<|system|>
{{ .System }}<|end|>
{{ end }}{{ if .Prompt }}<|user|>
{{ .Prompt }}<|end|>
{{ end }}<|assistant|>
{{ .Response }}<|end|>"""
PARAMETER stop "<|end|>"ollama create my-model ব্যবহার করে rebuild করুন এবং একই test prompt আবার পাঠান। stop parameter আপনার safety net। এই string দেখা গেলে এটি Ollama-কে generation কেটে দিতে বলে। ফলে wrapper নিজে ঠিক করার কাজ চললেও never-stops সমস্যা বন্ধ হয়। আপনি উল্লেখ করা কোনো marker-ই যদি না আসে এবং উত্তর চলতেই থাকে, তাহলে একটি num_predict সীমা নির্দিষ্ট token count-এ উত্তর থামিয়ে দেয়, template যা-ই emit করুক না কেন।
Template অবশ্যই Go template হতে হবে, Jinja template নয়। Hugging Face documentation-এ বিষয়টি সরাসরি বলা আছে। এটি গুরুত্বপূর্ণ, কারণ মূল model repository-এর tokenizer.chat_template field-এ Jinja থাকে। সেটি অপরিবর্তিতভাবে paste করলে কাজ করবে না। Ollama-এর syntax-এ তিনটি variable আছে: system prompt-এর জন্য {{ .System }}, user message-এর জন্য {{ .Prompt }} এবং model-এর reply-এর জন্য {{ .Response }}। মডেলটির model card অথবা tokenizer_config.json-এ প্রকৃত turn marker খুঁজে বের করুন। এরপর সেগুলো হাতে করে ওই Go syntax-এ লিখুন।
একটি shortcut এই কাজের বেশিরভাগ বাঁচায়। অনেক মডেল একই prompt format ব্যবহার করে। আপনার library-তে থাকা অন্য কোনো মডেল একই format ব্যবহার করলে সেটির বিরুদ্ধে ollama show --template চালিয়ে output কপি করুন।
Hugging Face রিপোজিটরির template, system এবং params ফাইল
Hugging Face পদ্ধতিতে Modelfile-এর নির্দেশনার বদলে রিপোজিটরির ফাইল ব্যবহার করে একই নিয়ন্ত্রণ পাওয়া যায়। আপনি যদি রিপোজিটরিটির মালিক হন, অথবা নিজের quant প্রকাশ করেন, তাহলে ওই ফাইলগুলো সেখানে যোগ করুন। এরপর প্রতিটি ollama run hf.co/... সেগুলো ব্যবহার করবে।
templateনামের ফাইলে Go template থাকে। একই নিয়ম প্রযোজ্য: Jinja নয়, Go।systemনামের ফাইলে system prompt থাকে।paramsনামের ফাইলে sampling parameter থাকে এবং ফাইলটি অবশ্যই JSON হতে হবে।
একটি ন্যূনতম params ফাইল:
{
"stop": ["<|end|>"],
"temperature": 0.7
}রিপোজিটরিটির মালিক না হলে আপনি ওই ফাইলগুলো যোগ করতে পারবেন না। একবার model pull করুন। তারপর ollama show --modelfile hf.co/... চালিয়ে প্রাপ্ত configuration dump করুন এবং সেই output-কে Modelfile হিসেবে সংরক্ষণ করুন। এর FROM লাইনটি Ollama ইতিমধ্যে download করা blob-কে নির্দেশ করে। তাই TEMPLATE এবং PARAMETER লাইন সম্পাদনা করে ollama create চালিয়ে কোনো কিছু আবার download না করেই একটি স্থির local copy তৈরি করুন। অন্য কারও ভাঙা quant ঠিক করার এটিই standard পদ্ধতি।
একটি private GGUF repo কীভাবে import করবেন
একটি private repository-এর জন্য আপনার Hugging Face account-এ Ollama-এর SSH key প্রয়োজন। এই পদ্ধতিতে নথিভুক্তভাবে API token-এর বদলে SSH key ব্যবহার করা হয়। তাই আপনার কাছে থাকা token দিয়ে repository খুলবে না।
Public key দেখুন। Official script দিয়ে Ollama ইনস্টল করা Linux server-এ service-টি ollama user হিসেবে চলে। তাই key-টি ওই user-এর home directory-তে থাকে:
sudo cat /usr/share/ollama/.ollama/id_ed25519.pubআপনি যদি নিজের user হিসেবে নিজে ollama serve চালু করেন, তবে path হবে ~/.ollama/id_ed25519.pub। পুরো line-টি copy করুন। এরপর https://huggingface.co/settings/keys-এ Hugging Face account settings খুলে এটিকে নতুন SSH key হিসেবে যোগ করুন। তারপর private repository-তে স্বাভাবিক command কাজ করবে:
ollama run hf.co/{username}/{repository}Key যোগ করার পরও pull ব্যর্থ হলে, সম্ভবত আপনি ভুল file দেখেছেন। Server-ই download সম্পন্ন করে এবং নিজের key উপস্থাপন করে। systemd দিয়ে চালু করা server কখনো আপনার user-এর ~/.ollama পড়ে না। তাই আপনার home directory-র key-টি Hugging Face দেখতে পায় না।
আপনার VPS-এ কি মডেলটি চলবে?
এটি নির্ধারণ করে ডিস্কে ফাইলটির আকার এবং আপনার context window-এর জন্য প্রয়োজনীয় memory। weights ফাইলে যে পরিমাণ জায়গা দখল করে, প্রায় সেই আকারের কাছাকাছি memory-তে load হয়। এর ওপর context allocation যুক্ত হয় এবং আপনি যত বেশি token অনুমোদন করেন, এটি তত বাড়ে। মডেলের জন্য Ollama যে আকার রেকর্ড করেছে তা দেখতে ollama list চালান। সার্ভারে থাকা free -h-এর সঙ্গে সেটি তুলনা করুন। operating system এবং সার্ভারে চলা অন্যান্য কাজের জন্যও অতিরিক্ত memory রাখুন। বাস্তব কোনো মডেলে এই হিসাব আগে থেকে করা দেখতে চাইলে VPS-এ Nemotron 3.5 Lightning চালানো দেখুন। সেখানে pull করার সঠিক tag, প্রয়োজনীয় RAM এবং CPU-only box যথেষ্ট দ্রুত কাজ করে কি না, সব দেওয়া আছে।
Context এমন একটি বিষয় যা অনেকে ভুলে যান। default window-এ load হওয়া একটি মডেল num_ctx বাড়ালে ব্যর্থ হতে পারে, কারণ আপনি যে window চেয়েছেন, সেই অনুযায়ী allocation-এর আকারও বাড়ে। num_ctx সেট করা এবং memory-তে এর খরচ-এ sizing দেওয়া আছে। মোট memory প্রয়োজন খুব বেশি হলে সাধারণত একই মডেলের ছোট quant ব্যবহার করাই সমাধান। Q4 এবং Q8-এর তুলনা-এ এই trade-off ব্যাখ্যা করা হয়েছে।
ব্যর্থতার লক্ষণ স্পষ্ট। CPU-only VPS-এ kernel-এর out-of-memory killer process বন্ধ করে দেয়। journalctl -u ollama -n 50 এবং dmesg একসঙ্গে ব্যবহার করলে এই kill দেখা যায়। GPU-যুক্ত box-এ ollama ps একটি PROCESSOR column দেখায়। এতে বোঝা যায় loaded model GPU memory-তে, system memory-তে, নাকি উভয়ের মধ্যে ভাগ হয়ে আছে। system memory-তে spill হওয়া মডেলও উত্তর দেয়, তবে ধীরে। প্রতি সেকেন্ডে token মাপা এই “ধীরে” বিষয়টিকে এমন একটি সংখ্যায় পরিণত করে, যা বিভিন্ন quant-এর মধ্যে তুলনা করা যায়।
আমদানি করা মডেল পরীক্ষা করুন
যেকোনো মডেল আমদানির পরে, এই চারটি command এই ক্রমে চালান:
ollama list
ollama show my-model
ollama show --modelfile my-model
ollama run my-model "Reply with one short sentence."ollama list প্রমাণ করে যে model বিদ্যমান এবং Ollama যে size রেকর্ড করেছে তা দেখায়। ollama show প্রমাণ করে যে Ollama GGUF থেকে প্রয়োজনীয় metadata পড়েছে। ollama show --modelfile প্রমাণ করে যে এটি বাস্তবে কোন template এবং parameter ব্যবহার করবে। এই পরীক্ষাই আপনার ব্যবহারকারীরা দেখার আগে garbage output-এর সমস্যা শনাক্ত করে। Test prompt পুরো chain পরীক্ষা করে, কারণ template নষ্ট থাকলে model সবচেয়ে ছোট request-এও ব্যর্থ হয়। Prompt-এর উত্তর সঠিকভাবে এলে, model-কে দেওয়া নামটিই Ollama API-এর সঙ্গে যোগাযোগকারী অন্য যেকোনো কিছুকে দিতে হবে, যার মধ্যে আপনার নিজস্ব server-এ নির্দেশিত coding agent-ও রয়েছে। ollama rm my-model ব্যবহার করে ভুল import সরিয়ে আবার build করুন। এই command Ollama-এর copy মুছে দেয় এবং আপনার source .gguf অপরিবর্তিত রাখে।
FAQ
Ollama-তে Modelfile না লিখে কি GGUF import করা যায়?
হ্যাঁ, ফাইলটি যদি কোনো Hugging Face repository-তে থাকে। ollama run hf.co/{username}/{repository} এটি সরাসরি pull করে চালায়, আর ollama run hf.co/{username}/{repository}:{quantization} নির্দিষ্ট quant নির্বাচন করে। নিজের disk-এ থাকা .gguf-এর জন্যই শুধু Modelfile দরকার; সে ক্ষেত্রে এতে একটিমাত্র লাইন FROM /path/to/file.gguf থাকতে পারে, যার পরে ollama create my-model চালাতে হবে।
quantization নির্দিষ্ট না করলে Ollama কোনটি download করে?
25 August 2026-এ পড়া Hugging Face-এর documentation অনুযায়ী, repository-তে সেই quant থাকলে Q4_K_M ব্যবহার করা হয়। তা না থাকলে Ollama repository-তে থাকা একটি যুক্তিসঙ্গত quant type নির্বাচন করে। এটি নিয়ন্ত্রণ করতে :Q8_0-এর মতো একটি tag যোগ করুন। আসলে কোনটি পেয়েছেন তা ollama show <model> দিয়ে নিশ্চিত করুন। এটি ফাইলের নাম নয়, metadata থেকে quantization দেখায়।
আমার imported model কেন নিজেকে পুনরাবৃত্তি করে বা generation কখনও বন্ধ করে না?
Chat template মডেলের সঙ্গে মেলে না। Ollama GGUF-এর tokenizer.chat_template metadata থেকে স্বয়ংক্রিয়ভাবে template নির্বাচন করে। এই metadata অনুপস্থিত বা অচেনা হলে একটি generic wrapper ব্যবহৃত হয়। ফলে মডেল training-এর সময় ব্যবহৃত end-of-turn marker দেখতে পায় না। বর্তমান template ollama show --template <model> দিয়ে দেখুন। এরপর Modelfile-এ একটি TEMPLATE block এবং PARAMETER stop line যোগ করে আবার ollama create চালান। এটি Go template হিসেবে লিখুন। মূল repository-এর Jinja template কাজ করবে না।
Download করা GGUF-এ কি --quantize ব্যবহার করা উচিত?
না। --quantize, ollama create চলার সময় FP16 বা FP32 source convert করে। কোনো ফাইলের নামেই যদি Q4_K_M-এর মতো quant থাকে, তাহলে সেটি আগে থেকেই convert করা হয়েছে। আবার quantize করলে precision পুনরুদ্ধার করা যায় না। আগের precision-এ ফেরার কোনো পথও নেই। নিজে safetensors-কে full precision GGUF-এ convert করে পরে ছোট ফাইল তৈরি করতে চাইলে শুধু তখনই এই flag ব্যবহার করুন।
Private GGUF repository কীভাবে pull করব?
আপনার Hugging Face account-এ Ollama-এর SSH public key যোগ করুন। Standard Linux install-এ sudo cat /usr/share/ollama/.ollama/id_ed25519.pub দিয়ে এটি দেখুন। আপনি যদি নিজের user হিসেবে server চালান, তাহলে ~/.ollama/id_ed25519.pub ব্যবহার করুন। এরপর account-এর SSH key settings page-এ key-টি যোগ করুন। তারপর নিজের private repository এবং আপনি যে organisation-এর সদস্য সেই organisation-এর repository-তে ollama run hf.co/{username}/{repository} কাজ করবে।