MiMo-V2.6 Distill 9B'yi VPS'te MiMo Code ile kullanın
Xiaomi'nin MIT lisanslı 9B modelini llama.cpp ile kendi VPS'inizde sunun ve MiMo Code'u bağlayın. RAM hesabı, araç çağrısı testi, güvenli erişim ve dolar faturası karşılaştırması.
MiMo-V2.6 Distill 9B'yi VPS'te çalıştırmanın kısa yolu
MiMo-V2.6 Distill 9B'yi bir VPS (sanal özel sunucu) üzerinde çalıştırmak için llama.cpp'nin llama-server programını etiketli bir sürümden derleyin. Sonra modelin GGUF dosyasını indirin ve sunucuyu yalnızca 127.0.0.1 adresinde dinletin. MiMo Code, OpenAI uyumlu her uç noktayı kabul eder. Bu yüzden ona bir baseURL ve bir apiKey vermeniz yeterlidir. Uç noktaya dizüstü bilgisayarınızdan SSH tüneli veya Tailscale ile ulaşırsınız. Port hiçbir zaman internete açılmaz.
Kurulumun kendisi kısa. Asıl sorular başka yerde. Model kaç GB RAM ister? Araç çağrısı (tool calling) llama.cpp üzerinden gerçekten çalışıyor mu? CPU'lu bir sunucu bir ajan döngüsünde sizi ne kadar bekletir? Aşağıdaki bölümler bu soruları sırayla cevaplıyor. Tarihler ve sürümler 4 Ekim 2026 itibarıyladır.
Bu model ne, Xiaomi ne iddia ediyor?
MiMo-V2.6-Distill-Qwen-9B, Xiaomi MiMo ekibinin Qwen3.5-9B üzerine yaptığı bir SFT (supervised fine-tuning, denetimli ince ayar) sürümüdür. Eğitim verisini daha büyük MiMo-V2.6 modelleri üretmiş. Model kartına göre veri dört alandan geliyor: kodlama, genel ajan işleri, görsel kodlama ve siber güvenlik. Lisans MIT, yani ticari kullanım dahil serbest. Model aslında çok kipli (multimodal) ve görüntü de okuyabiliyor. Bu rehber yalnızca metin tarafını kullanıyor.
Model kartı, modeli temel aldığı Qwen3.5-9B ile karşılaştırıyor. Aşağıdaki sayılar Xiaomi'nin kendi ölçümüdür ve kendi test setlerinden gelir. Bağımsız bir doğrulama değildir, biz de tekrar etmedik.
The data behind this chart
[
{
"label": "Qwen3.5-9B (temel model)",
"mimo_code_mini": 19.5,
"swe_pro": 32.0
},
{
"label": "MiMo-V2.6 Distill 9B",
"mimo_code_mini": 51.6,
"swe_pro": 44.6
}
]Xiaomi'ye göre MiMo Code (mini) testinde puan 19.5 değerinden 51.6 değerine çıkıyor. SWE Pro puanı ise 32.0 iken 44.6 oluyor. Bu sayılar modelin MiMo Code ile birlikte düşünülerek eğitildiğini gösteriyor. Sizin kod tabanınızda nasıl davranacağını göstermiyor. MiMo Code aracını henüz tanımıyorsanız, önce MiMo Code yapay zekâ kodlama ajanı rehberimize bakın.
Üç parçayı adıyla sabitleyin
Bu kurulumda üç parça hareket ediyor ve her biri hızlı değişiyor. Hepsini adıyla sabitleyin:
- llama.cpp
b11392: 4 Ekim 2026 tarihli etiket. llama.cpp neredeyse her gün yeni birbNNNNNetiketi yayınlıyor. Sürüm adı yazmazsanız, aynı komut bir ay sonra başka bir program kurar. - GGUF:
bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUFdeposundakiMiMo-V2.6-Distill-Qwen-9B-Q4_K_M.ggufdosyası. Depo sayfası, dosyaların llama.cppb10964ile üretildiğini yazıyor. Bu yüzden ondan eski bir llama.cpp kullanmayın. - MiMo Code
0.1.15: npm paketi@mimo-ai/cli, 22 Eylül 2026 tarihli. Aşağıdaki yapılandırma bu etiketteki README dosyasından alındı.
Sürüm yükseltmeyi bilinçli bir işe dönüştürmek için llama.cpp sürümlerini sunucuda sabitleme rehberindeki düzeni kullanın. Yeni ikiliyi eskisinin yanına kurun, test edin, sonra systemd biriminde yolu değiştirin.
MiMo-V2.6 Distill 9B kaç GB RAM ister?
RAM ihtiyacı iki parçadan oluşur. Birincisi model ağırlıklarıdır. İkincisi KV önbelleğidir (key-value cache): modelin bağlamdaki her token için tuttuğu ara değerler. Ağırlıklar için doğru sayı, seçtiğiniz quant (niceleme) dosyasının boyutudur. Aşağıdaki boyutlar bartowski deposunun dosya listesinden alındı.
The data behind this chart
[
{
"label": "Q8_0",
"file_gb": 9.55
},
{
"label": "Q6_K",
"file_gb": 7.79
},
{
"label": "Q5_K_M",
"file_gb": 6.88
},
{
"label": "Q4_K_M",
"file_gb": 5.84
},
{
"label": "IQ4_XS",
"file_gb": 5.23
},
{
"label": "Q3_K_M",
"file_gb": 4.48
}
]Q4_K_M dosyası 5.84 GB. 9B bir model için kalite ile boyut arasında olağan başlangıç noktası budur. Q8_0 dosyası 9.55 GB tutar ve orijinal modele daha yakındır. Ama CPU'da her token için daha fazla bellek okur, bu yüzden daha yavaş üretir. Q3_K_M 4.48 GB'a iner. Düşük quant'larda kalite kaybı artar. Araç çağrısı gibi kesin biçim isteyen çıktılarda düşük bir quant'ı test etmeden kullanmayın.
KV önbelleği bu modelde alışılmadık derecede küçük. Sebebi mimaridir. config.json dosyasına göre modelin 32 katmanından yalnızca her dördüncüsü (full_attention_interval: 4) tam dikkat (full attention) kullanır. Diğer 24 katman doğrusal dikkat kullanır. Bu katmanlar bağlam uzadıkça büyümeyen, sabit boyutlu bir durum tutar. Tam dikkat katmanlarında 4 KV başı ve 256 baş boyutu var. f16 önbellekte bu, token başına yaklaşık 32 KiB eder. Aşağıdaki değerler bu hesaptan çıkıyor. Ölçülmüş değil, hesaplanmış değerlerdir.
The data behind this chart
[
{
"context_tokens": 8192,
"kv_cache_gib": 0.25
},
{
"context_tokens": 16384,
"kv_cache_gib": 0.5
},
{
"context_tokens": 32768,
"kv_cache_gib": 1
},
{
"context_tokens": 65536,
"kv_cache_gib": 2
},
{
"context_tokens": 131072,
"kv_cache_gib": 4
},
{
"context_tokens": 262144,
"kv_cache_gib": 8
}
]32768 tokenlik bağlam yaklaşık 1 GiB ister. 65536 token yaklaşık 2 GiB ister. Modelin tam bağlamı ise 8 GiB tutar. Hesabı kendi sunucunuzda doğrulayın: llama-server açılırken günlüğe KV buffer size içeren bir satır yazar ve gerçek değeri MiB olarak gösterir.
Bağlam uzunluğu için başka sitelere değil, config.json dosyasına bakın. Bazı model katalogları 32768 yazıyor, ama dosyanın kendisi farklı bir değer veriyor:
curl -s https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B/raw/main/config.json | grep max_position_embeddings4 Ekim 2026'da bu komut iki satırda da 262144 döndürüyor. Bu, modelin desteklediği üst sınırdır. Sizin kullanacağınız değer ise -c bayrağıyla verdiğiniz değerdir.
Pratik hesap şöyle: Q4_K_M ve 32768 bağlam birlikte yaklaşık 7 GB eder. Buna işletim sistemi ve llama.cpp'nin hesaplama tamponları eklenir. 8 GB'lık bir VPS sınırda kalır. 16 GB rahat çalışır ve bağlamı 65536'ya çıkarmaya yer bırakır. Genel yöntemi bir LLM'in RAM'inize sığıp sığmadığını hesaplama rehberinde adım adım anlattık.
llama.cpp'yi etiketli sürümden derleyin
Ubuntu 24.04 üzerinde statik bağlı tek bir llama-server ikilisi derleyin. Sürüm adını dosya adına yazın. Böylece hangi sürümün çalıştığı her zaman görünür.
sudo apt update
sudo apt install -y build-essential cmake git libssl-dev jq
git clone --depth 1 --branch b11392 https://github.com/ggml-org/llama.cpp
cmake -S llama.cpp -B llama.cpp/build -DCMAKE_BUILD_TYPE=Release -DBUILD_SHARED_LIBS=OFF
cmake --build llama.cpp/build --config Release -j"$(nproc)" --target llama-server
sudo install -m 755 llama.cpp/build/bin/llama-server /usr/local/bin/llama-server-b11392
/usr/local/bin/llama-server-b11392 --versionSon komut bir sürüm satırı ve bir commit karması yazmalıdır. Sığ klon (--depth 1) yüzünden oradaki numara etiketle aynı olmayabilir. Etiketi dosya adında tutmamızın sebebi budur. Daha ayrıntılı bir derleme ve sertleştirme anlatımı için llama.cpp sunucusunu VPS'te çalıştırma rehberine bakın. Ollama ile hangisini seçeceğinizi düşünüyorsanız, farkları Ollama ile llama.cpp karşılaştırmasında anlattık.
GGUF dosyasını indirin ve doğrulayın
Önce bir servis kullanıcısı ve model dizini oluşturun. Sonra boş diske bakın. Q4_K_M dosyası için en az 7 GB boş alan bırakın.
sudo useradd --system --no-create-home --shell /usr/sbin/nologin llama
sudo install -d -o llama -g llama -m 755 /srv/models
df -h /srv
sudo -u llama curl -L --output-dir /srv/models -O \
https://huggingface.co/bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF/resolve/main/MiMo-V2.6-Distill-Qwen-9B-Q4_K_M.gguf
sha256sum /srv/models/MiMo-V2.6-Distill-Qwen-9B-Q4_K_M.ggufsha256sum çıktısını Hugging Face'teki dosya sayfasında yazan SHA256 değeriyle karşılaştırın. Değerler aynı değilse indirme yarıda kesilmiştir. Dosyayı silip yeniden indirin. Yarım kalmış bir GGUF dosyası, sunucu açılırken yükleme hatası verir.
llama-server'ı localhost'ta systemd ile çalıştırın
Önce bir API anahtarı üretin. Sunucu zaten yalnızca localhost'ta dinleyecek, ama anahtar ikinci bir kilit olur. Bir gün portu yanlışlıkla açarsanız, anahtarsız istekler reddedilir.
sudo install -d -o root -g llama -m 750 /etc/llama
openssl rand -hex 32 | sudo tee /etc/llama/api-key > /dev/null
sudo chown root:llama /etc/llama/api-key
sudo chmod 640 /etc/llama/api-keySonra /etc/systemd/system/llama-server.service dosyasını yazın:
[Unit]
Description=llama.cpp server (MiMo-V2.6 Distill 9B)
After=network-online.target
Wants=network-online.target
[Service]
User=llama
Group=llama
ExecStart=/usr/local/bin/llama-server-b11392 \
-m /srv/models/MiMo-V2.6-Distill-Qwen-9B-Q4_K_M.gguf \
--alias mimo-9b \
--host 127.0.0.1 --port 8080 \
-c 32768 --jinja \
--temp 0.6 --top-k 20 --top-p 0.95 \
--api-key-file /etc/llama/api-key
Restart=on-failure
MemoryMax=10G
[Install]
WantedBy=multi-user.targetBayrakların görevleri şöyle:
--host 127.0.0.1: sunucu yalnızca makinenin kendisinden gelen bağlantıları kabul eder.--alias mimo-9b:/v1/modelscevabında görünen model adı. MiMo Code yapılandırmasında aynı adı kullanacaksınız.-c 32768: bağlam boyutu. Varsayılan değer 0'dır, yani değer modelden okunur. Bu modelde bu, 262144 token ve yaklaşık 8 GiB KV önbelleği demektir.--jinja: GGUF dosyasına gömülü sohbet şablonunu (chat template) kullanır. Araç çağrılarının ayrıştırılması bu şablona bağlıdır.--temp 0.6 --top-k 20 --top-p 0.95: modelingeneration_config.jsondosyasındaki örnekleme değerleri.MemoryMax=10G: 16 GB'lık bir VPS için bellek sınırı. Servis bu sınırı aşarsa systemd yalnızca bu servisi durdurur. SSH oturumunuz ayakta kalır.
Servisi başlatın ve kontrol edin:
sudo systemctl daemon-reload
sudo systemctl enable --now llama-server
journalctl -u llama-server -n 30 --no-pager
curl -s http://127.0.0.1:8080/health
ss -tlnp | grep 8080Model yüklenirken /health bir süre 503 döner. Yükleme bitince {"status":"ok"} yazmalıdır. ss çıktısında adres 127.0.0.1:8080 olmalıdır. 0.0.0.0:8080 görüyorsanız --host bayrağı uygulanmamıştır. Servisi durdurun ve birim dosyasını kontrol edin.
Kimlik doğrulamayı da deneyin:
curl -s http://127.0.0.1:8080/v1/models \
-H "Authorization: Bearer $(sudo cat /etc/llama/api-key)" | jq '.data[].id'Çıktı "mimo-9b" olmalıdır. Aynı isteği Authorization başlığı olmadan gönderirseniz 401 hatası alırsınız. Bu, anahtarın gerçekten kontrol edildiğini gösterir.
Araç çağrısı llama.cpp üzerinden çalışıyor mu?
Bir kodlama ajanı, modelin araç çağrısı yapabilmesine dayanır. MiMo Code bir dosyayı okumak veya bir komut çalıştırmak istediğinde model, düz metin değil yapılandırılmış bir tool_calls alanı döndürmelidir. Bu yüzden MiMo Code'u bağlamadan önce bunu test edin.
Bildiklerimiz şunlar. Modelin chat_template.jinja dosyası araç çağrılarını Qwen3.5 ailesinin XML biçiminde yazar: <tool_call> içinde <function=...> ve <parameter=...> etiketleri. Model kartı resmi sunucu olarak SGLang'i gösteriyor ve llama.cpp'den hiç bahsetmiyor. 4 Ekim 2026 itibarıyla bu modelle llama.cpp üzerinden uçtan uca bir araç çağrısını kendimiz doğrulamadık. Bu yüzden çalıştığını iddia etmiyoruz. Aşağıdaki test, sizin sürümünüz ve sizin dosyanız için kesin cevabı verir.
curl -s http://127.0.0.1:8080/v1/chat/completions \
-H "Authorization: Bearer $(sudo cat /etc/llama/api-key)" \
-H "Content-Type: application/json" \
-d '{
"model": "mimo-9b",
"messages": [{"role": "user", "content": "README.md dosyasını oku."}],
"tools": [{
"type": "function",
"function": {
"name": "read_file",
"description": "Bir dosyanın içeriğini okur",
"parameters": {
"type": "object",
"properties": {"path": {"type": "string"}},
"required": ["path"]
}
}
}]
}' | jq '.choices[0] | {finish_reason, tool_calls: .message.tool_calls, content: .message.content}'Sağlıklı sonuç: finish_reason değeri "tool_calls" olur. tool_calls dizisinde read_file adı ve {"path":"README.md"} benzeri bir argüman görünür. Model önce düşünürse, düşünme metni ayrı bir reasoning_content alanına gider. Bu normaldir.
Başarısız sonuç: finish_reason değeri "stop" olur, tool_calls boş kalır ve content alanında düz metin olarak <tool_call> etiketleri görünür. Bu, modelin çağrıyı ürettiği ama llama.cpp'nin onu ayrıştırmadığı anlamına gelir. Ayrıştırıcı biçimi tanımadığı için ham XML metin olarak kalır. Önce --jinja bayrağının birimde olduğunu kontrol edin. Sonra daha yeni bir llama.cpp etiketiyle tekrar deneyin. Model hiç <tool_call> üretmeden düz bir cevap veriyorsa, sorun ayrıştırıcıda değil modelin kendisindedir.
Test birkaç denemede de başarısız olursa, bu modeli llama.cpp üzerinden ajan olarak kullanmayın. Sohbet ve kod açıklaması için yine işe yarar. Ajan işi için iki seçenek kalır: bir GPU VPS'te model kartının önerdiği SGLang ile sunmak veya MiMo'nun kendi API'sini kullanmak.
Uç noktayı dışarı açmayın: SSH tüneli veya Tailscale
llama-server internete açılacak bir hizmet değildir. Anahtar olsa bile tek bir uzun istek CPU'nuzu dakikalarca meşgul edebilir. Bu yüzden portu açmayın, ona bir tünelle ulaşın.
VPS'te ufw kullanıyorsanız yalnızca SSH açık kalsın:
sudo ufw allow OpenSSH
sudo ufw enable
sudo ufw statusufw status çıktısında 8080 görünmemelidir. Sağlayıcınızın panelindeki ayrı ağ güvenlik duvarında da 8080 için bir kural olmasın.
En basit yol SSH tünelidir. Dizüstü bilgisayarınızda şunu çalıştırın:
ssh -N -L 8080:127.0.0.1:8080 kullanici@sunucu-ip-adresiBu komut açık kaldığı sürece dizüstündeki http://127.0.0.1:8080 adresi VPS'teki llama-server'a gider. Komutu kapatınca bağlantı da kapanır.
Sürekli bir bağlantı istiyorsanız Tailscale kullanın. VPS'te:
curl -fsSL https://tailscale.com/install.sh | sh
sudo tailscale up
sudo tailscale serve --bg 8080tailscale serve, yalnızca kendi tailnet'inizdeki cihazların ulaşabildiği bir HTTPS adresi yazdırır ve trafiği 127.0.0.1:8080 adresine iletir. llama-server yine localhost'ta kalır. Tailnet'inizde HTTPS sertifikaları kapalıysa komut, bu özelliği açmanız için sizi bir bağlantıya yönlendirir.
MiMo Code'u kendi uç noktanıza bağlayın
MiMo Code'u kodunuzun bulunduğu makineye sabit sürümle kurun:
npm install -g @mimo-ai/cli@0.1.15
npm ls -g @mimo-ai/cliİkinci komut @mimo-ai/cli@0.1.15 göstermelidir. README'deki curl kurulum betiği bir sürüm seçme yolu göstermiyor. Sürümü sabitlemek için npm yolunu kullanın.
Sonra ~/.config/mimocode/mimocode.jsonc dosyasını yazın. Yapı, v0.1.15 etiketindeki README'nin özel OpenAI uyumlu sağlayıcı örneğiyle birebir aynıdır. Yalnızca model adını, adresi ve anahtarı değiştirdik:
{
"model": "custom/mimo-9b",
"provider": {
"custom": {
"name": "Custom",
"npm": "@ai-sdk/openai-compatible",
"only_configured_models": true,
"models": {
"mimo-9b": {
"name": "mimo-9b"
}
},
"options": {
"baseURL": "http://127.0.0.1:8080/v1",
"apiKey": "VPS_ANAHTARINIZ"
}
}
}
}apiKey değerine VPS'teki /etc/llama/api-key dosyasının içeriğini yazın. Kopyalarken başına veya sonuna boşluk eklenmediğini kontrol edin. SSH tüneli kullanıyorsanız baseURL yukarıdaki gibi kalır. Tailscale kullanıyorsanız tailscale serve komutunun yazdığı adresin sonuna /v1 ekleyin. MiMo Code VPS'in kendisinde çalışıyorsa adres yine http://127.0.0.1:8080/v1 olur. README, /v1 ekini uç nokta gerektirmedikçe eklememenizi veya silmemenizi söylüyor. llama-server OpenAI uyumlu yollarını /v1 altında sunduğu için burada gereklidir.
Projenin dizininde mimo komutunu çalıştırın ve küçük bir görev verin. Aynı anda VPS'te günlüğü izleyin:
journalctl -u llama-server -fHer ajan adımında prompt eval time ve eval time satırları görmelisiniz. Hiç satır gelmiyorsa MiMo Code başka bir sağlayıcıya gidiyordur. Yapılandırmadaki "model" alanının custom/mimo-9b olduğunu kontrol edin. Unutmayın, ajan makinenizde komut çalıştırabilen bir programdır. Okuttuğunuz dosyalardaki gizli talimatlara karşı kodlama ajanlarında prompt injection rehberindeki önlemleri uygulayın.
CPU'lu VPS neden ajan döngüsünde yavaş hissettirir?
Bir LLM isteği iki aşamadan geçer. Prefill (ön doldurma) aşamasında model gelen istemin tamamını işler. Decode (çözme) aşamasında cevabı token token üretir. Sohbette istem kısadır ve beklediğiniz süre çoğunlukla decode'dur. Ajan döngüsünde durum terstir.
Bir kodlama ajanı her adımda modele uzun bir istem gönderir. İstemin içinde sistem talimatları, araç tanımları, okunan dosyalar ve önceki adımların çıktıları vardır. Model cevap olarak çoğu zaman kısa bir araç çağrısı yazar. Yani her adımda binlerce tokenlik prefill ve birkaç düzine tokenlik decode olur. CPU'da prefill hesaplama gücüyle sınırlıdır, çünkü istemin her tokeni modelin 32 katmanının hepsinden geçer. Bu yüzden bekleme süresinin büyük kısmı, model daha tek kelime yazmadan geçer.
Kendi sayılarınızı günlükten okuyun. Her istekten sonra llama-server şu biçimde iki satır yazar:
prompt eval time = ... ms / ... tokens (... ms per token, ... tokens per second)
eval time = ... ms / ... tokens (... ms per token, ... tokens per second)İlk satır prefill hızını, ikincisi decode hızını gösterir. Bir örnek hesap (ölçüm değil, yalnızca yöntem): günlük prefill için saniyede 50 token gösteriyorsa, 20.000 tokenlik bir istem 400 saniye bekletir. On adımlık bir görevde bu, dakikalarca bekleme demektir. llama-server önceki istemle ortak olan başlangıcı yeniden kullanabildiğinde, prompt eval satırındaki token sayısı küçük olur. Bu sayı her adımda istemin tamamına yakınsa, her adım tam prefill ödüyor demektir.
Bu iki aşamanın farkını prefill ve decode farkı rehberinde ayrıntılı anlattık. Çekirdek sayısı ve RAM seçimi için kodlama ajanı VPS'i için RAM ve CPU seçimi rehberine bakın.
Sabit VPS faturası mı, dolarla ödenen token mı?
Türkiye'den bakınca maliyet sorusu, iki farklı faturanın karşılaştırmasıdır. VPS her ay aynı tutardır. Modeli ne kadar kullanırsanız kullanın fatura değişmez. Fatura dolar cinsinden olsa bile tutar bellidir, yalnızca kur değişir.
API ise kullanım başına, token sayısına göre dolarla ücretlendirilir. Türk kartıyla ödenen yurt dışı dijital hizmetlerde iki ek kalem çıkabilir. Birincisi KDV (katma değer vergisi): bazı yabancı sağlayıcılar Türkiye'deki bireysel kullanıcıların faturasına KDV ekler. İkincisi bankanızın yurt dışı işlem veya kur dönüşüm komisyonudur. İkisi de sağlayıcıya ve bankaya göre değişir. Oranı tahmin etmek yerine son kart ekstrenize bakın.
Fiyat konusunda dikkatli olun. Ağustos 2026'daki MiMo Code sayfamız, MiMo API'si için milyon token başına girdi 1 dolar, çıktı 3 dolar fiyatını aktarmıştı. Ekim 2026'da üçüncü taraf fiyat siteleri MiMo-V2.6 modelleri için farklı ve daha düşük rakamlar listeliyor. Hesap yapmadan önce fiyatı MiMo'nun resmi fiyat sayfasından kontrol edin.
Karşılaştırmayı kendi sayılarınızla yapın:
- Aylık API maliyeti: (girdi tokeni × girdi fiyatı + çıktı tokeni × çıktı fiyatı) × kur, artı varsa KDV ve banka komisyonu.
- Aylık VPS maliyeti: sabit tutar × kur.
- Aylık token sayınız: birkaç gün boyunca
llama-servergünlüğündeki token sayılarını toplayıp aya yayın. - Zaman maliyeti: CPU'da beklediğiniz dakikalar da bir maliyettir.
CPU'lu VPS, gizliliğin önemli olduğu ve beklemeyi kabul ettiğiniz ara sıra yapılan işlerde mantıklıdır. Kodunuz sunucunuzdan dışarı çıkmaz. Ajanı gün boyu yoğun kullanıyorsanız, bir GPU VPS veya API daha iyi bir anlaşmadır. GPU prefill süresini büyük ölçüde kısaltır, ama aylık bedeli çok daha yüksektir. API'nin başlangıç maliyeti sıfırdır ve hızı sizin donanımınıza bağlı değildir. Bu kararın hesabını GPU VPS ile API tokenleri arasındaki başabaş noktası rehberinde kurduk.
Hangi hata ne anlama gelir?
Model açılmıyor ve günlükte unknown model architecture var. llama.cpp sürümünüz bu dosyadaki mimariyi tanımıyor. Qwen3.5 desteği eklenmeden önceki sürümler bu dosyayı yükleyemez. b11392 ile derlediyseniz, servis biriminin gerçekten /usr/local/bin/llama-server-b11392 dosyasını çalıştırdığını kontrol edin.
Servis kendi kendine kapanıyor. journalctl -u llama-server çıktısındaki Main process exited, code=killed, status=9/KILL satırı, sürecin bellek yetmediği için öldürüldüğünü gösterir. Bağlamı (-c) küçültün veya daha küçük bir quant seçin. MemoryMax değerini makinenin RAM'ine göre ayarlayın.
MiMo Code uzun bir oturumda hata veriyor. Ajanın istemi bağlam boyutunu aşarsa llama-server isteği reddeder. Hata mesajı istemin mevcut bağlamı aştığını söyler (exceeds the available context size). -c değerini 65536'ya çıkarın. Bunun KV önbelleğine yaklaşık 1 GiB daha eklediğini hesaba katın.
401 hatası alıyorsunuz. MiMo Code'daki apiKey değeri /etc/llama/api-key içeriğiyle aynı değil. Değeri yeniden kopyalayın.
Cevaplar çok yavaş geliyor. Önce free -h ile swap kullanımına bakın. Model RAM'e sığmayıp swap alanına taşınırsa, her token disk okumasına dönüşür ve hız çok düşer. Swap kullanılmıyorsa yavaşlığın sebebi büyük olasılıkla prefill'dir. Günlükteki prompt eval time satırına bakın.
FAQ
MiMo-V2.6 Distill 9B Ollama ile çalışır mı?
4 Ekim 2026 itibarıyla Ollama kütüphanesinde bu model için resmi bir kayıt yok. Bir GGUF dosyasını Ollama'ya kendiniz aktarabilirsiniz, ama Ollama'nın bu mimariyi yükleyip yüklemediğini biz doğrulamadık. Kontrol etmenin yolu, dosyayı bir Modelfile ile ollama create komutuna vermek ve modelin açılıp açılmadığına bakmaktır. Adımlar Ollama'ya GGUF modeli aktarma rehberinde. Model açılırsa araç çağrısını orada da ayrıca test edin.
MiMo-V2.6 Distill 9B'nin bağlam uzunluğu ne kadar?
Modelin config.json dosyasında max_position_embeddings değeri 4 Ekim 2026 itibarıyla 262144'tür. Bazı kataloglar 32768 gösteriyor, ama esas alınması gereken dosyanın kendisidir. Gerçekte kullandığınız bağlam, llama-server için -c ile verdiğiniz değerdir. Bu modelde f16 KV önbelleği token başına yaklaşık 32 KiB tutar, yani 32768 token yaklaşık 1 GiB eder.
Bu modeli MiMo Code ile kullanmak için hangi VPS boyutu yeterli?
Q4_K_M quant dosyası yaklaşık 6 GB'tır. 32768 bağlamla birlikte model yaklaşık 7 GB RAM kullanır. 16 GB RAM'li bir VPS rahat çalışır ve bağlamı büyütmeye yer bırakır. 8 GB sınırdadır. Hızı ise çekirdek sayısı belirler, çünkü CPU'da prefill hesaplama gücüyle sınırlıdır. Uzun istemli ajan adımlarında CPU'lu bir VPS sizi yine dakikalarca bekletebilir.
llama.cpp ile araç çağrısı bu modelde çalışıyor mu?
Modelin sohbet şablonu araç çağrılarını Qwen3.5 tarzı XML etiketleriyle yazar. llama-server bunları yalnızca --jinja ile ve bu biçimi tanıyan bir sürümde tool_calls alanına çevirir. 4 Ekim 2026 itibarıyla bunu bu modelle uçtan uca doğrulamadık. tools alanı olan bir /v1/chat/completions isteği gönderin. finish_reason değeri tool_calls ise çalışıyordur. Cevap metninde ham <tool_call> etiketleri görüyorsanız çalışmıyordur ve modeli ajan olarak kullanmamalısınız.
MiMo-V2.6 Distill 9B ticari projelerde kullanılabilir mi?
Xiaomi, modeli Hugging Face deposunda MIT lisansıyla yayınlıyor. MIT, telif bildirimini korumanız şartıyla ticari kullanıma izin verir. Modelin temeli Qwen3.5-9B'dir. Kurumsal bir projede kullanmadan önce depo sayfasındaki lisans bilgisini ve temel modelin lisansını kendiniz okuyun.