VPS üzerinde Ollama mı llama.cpp mi kullanılmalı?
Ollama ve llama.cpp arasındaki farkları ve CPU tabanlı VPS sunucularında performans optimizasyonu için hangi yöntemin daha verimli olduğunu teknik detaylarla inceleyin.
Ollama ve llama.cpp: hangi katmanda çalıştırmak istiyorsunuz?
Ollama ve llama.cpp, soruda ima edildiği gibi birbirinin rakibi değildir. llama.cpp bir çıkarım (inference) motorudur; bir model dosyasını yükler ve istemi (prompt) token'lara dönüştürür. Ollama ise bu motorun üzerinde çalışan bir model yöneticisi, arka plan servisi (daemon) ve HTTP API'sidir. Ollama'nın README dosyası, 2 Ağustos 2026 itibarıyla llama.cpp'yi hala çıkarım altyapısı olarak listelemektedir. Dolayısıyla asıl soru hangisinin daha hızlı olduğu değil, VPS üzerinde hangi katmanda işlem yapmak istediğinizdir.
Modelleri ismine göre getiren ve müdahale gerektirmeden çalışmaya devam eden bir servis istiyorsanız Ollama'yı çalıştırın. Sunucunuz küçükse ve tam olarak hangi model dosyasını, hangi bağlam (context) boyutunu ve kaç iş parçacığı (thread) kullanacağınızı seçmeniz gerekiyorsa llama.cpp'yi doğrudan çalıştırın; çünkü küçük bir VPS üzerinde bu ayarların her biri, sahip olmadığınız bellek miktarından harcar.
Her projenin gerçekte ne olduğu
llama.cpp, ggml kütüphanesi üzerine inşa edilmiş bir transformer çıkarım (inference) C ve C++ uygulamasıdır. GGUF dosyalarını okur. GGUF (GGML universal file format), modelin çalışması için gereken ağırlıkları, belirteçleyiciyi (tokenizer) ve meta verileri tutan tek dosyalık bir kapsayıcıdır. Proje, farklı işler için ayrı ikili dosyalar sunar. llama-server bir HTTP sunucusudur, llama-cli etkileşimli bir komut satırı arayüzüdür ve llama-bench iş hacmini (throughput) ölçer. Sürümler, anlamsal sürümleme yerine yapı numarasıyla etiketlenir. Mevcut etiket, 2 Ağustos 2026 tarihinde yayınlanan b10224'tür ve çoğu iş günü yeni bir etiket yayınlanır.
Ollama bir Go programıdır. ollama serve ile başlatılan bir arka plan servisi (daemon), modelleri yükler ve HTTP isteklerini yanıtlar; bir komut satırı istemcisi ise bu servis ile iletişim kurar. Her ikisinin arkasında, önceden paketlenmiş modelleri barındıran ollama.com adresindeki bir kayıt defteri bulunur. Ollama anlamsal sürümleme kullanır ve v0.32.5 sürümü 27 Temmuz 2026 tarihinde yayınlanmıştır. ollama pull, bir GGUF dosyasını bir istem şablonu ve bir dizi varsayılan parametre ile birlikte getirir, ardından Linux üzerinde /usr/share/ollama/.ollama/models dizininde saklar. Bu dosyalar kök diskte yer alır ve her biri birkaç gigabayt boyutuna ulaşabilir; bu nedenle 25 GB kök birime sahip bir VPS üzerinde, üçüncü indirme işlemi diski doldurmadan önce pull işleminin neleri geride bıraktığını ve model dizininin nasıl başka bir yere taşınacağını bilmek faydalıdır.
Bu paketleme, aradaki temel farktır. Ollama; nicemleme (quantisation), şablon ve bağlam uzunluğu (context length) kararlarını sizin yerinize verir ve hatırlamanız gereken tek bir isim sunar. llama.cpp ise hiçbir şeye karar vermez ve size bayraklar (flags) sunar.
Eksen 1: model ve nicemleme kontrolü
Nicemleme (quantisation), her ağırlığı 16 veya 32 bitten 4, 5 veya 8 bite düşürür. 8 milyar parametreli bir modelin sıradan bir VPS'in RAM'ine sığmasını sağlayan budur. GGUF isimlendirme düzeni anlaşıldığında okunabilir hale gelir: Q4_K_M, 4-bit K-nicemleme ve orta boyutu ifade eder. Daha yüksek bir sayı daha fazla hassasiyet korur ancak daha fazla bellek tüketir.
The data behind this chart
[
{
"label": "Q2_K",
"file_size_gib": 2.96
},
{
"label": "Q3_K_M",
"file_size_gib": 3.74
},
{
"label": "Q4_K_M",
"file_size_gib": 4.58
},
{
"label": "Q5_K_M",
"file_size_gib": 5.34
},
{
"label": "Q6_K",
"file_size_gib": 6.14
},
{
"label": "Q8_0",
"file_size_gib": 7.95
}
]Bunlar, 2 Ağustos 2026 tarihinde Hugging Face üzerindeki bartowski/Meta-Llama-3.1-8B-Instruct-GGUF deposundan okunan ve bayttan GiB'a dönüştürülen yayınlanmış dosya boyutlarıdır. Tek bir modelin 6 adet derlemesi mevcuttur; en küçüğü 2.96 GiB iken en büyüğü 7.95 GiB'dır. Yaygın varsayılan olan Q4_K_M ise 4.58 GiB'dır. 4 GiB'lık bir VPS üzerinde bu tek seçim, modelin yüklenip yüklenmeyeceğini belirler. Boyut, kararın yalnızca yarısıdır; çünkü karşılayabileceğiniz bir satır, otomatik olarak kullanmaya değer bir satır değildir ve Q4, Q8 ve fp16'nın yanıt kalitesinde size gerçek maliyeti, fazladan gigabaytların fark edebileceğiniz bir değer katıp katmadığını belirleyen şeydir.
llama.cpp ile dosya adını siz belirlersiniz, dolayısıyla o satırı kendiniz seçersiniz.
llama-server -m ~/models/Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf \
-c 4096 -t 4 --host 127.0.0.1 --port 8080-c token cinsinden bağlam boyutudur, -t iş parçacığı sayısıdır ve -ngl kaç katmanın GPU'ya taşınacağını ayarlar (yalnızca CPU olan bir sunucuda 0 olmalıdır). Hiçbir şey sizin yerinize tahmin edilmez.
Ollama'da nicemleme, çektiğiniz etiketle birlikte gelir ve ollama ls diskte halihazırda neye sahip olduğunuzu gösterir. Kayıt defterinde istediğiniz derleme yoksa, bir GGUF dosyasını kendiniz içe aktarın. Bir Modelfile oluşturun:
FROM ./Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf
PARAMETER num_ctx 4096Ardından derleyin ve sonucu kontrol edin:
ollama create llama31-q4 -f ./Modelfile
ollama lsBağlam uzunluğu (context length), kullanıcıları yanıltan ayardır. Ollama varsayılan değerini mevcut VRAM'e göre seçer ve GPU'su olmayan bir sunucu en küçük kategoriye düşer: 4096 token. Sisteme 20.000 token'lık bir belge gönderdiğinizde, fazladan token'lar model onları görmeden önce atılır; bu nedenle model, sadece yarısını okuduğu bir dosya hakkında kendinden emin bir şekilde yanlış yanıt verir. Bu değeri daemon üzerinde OLLAMA_CONTEXT_LENGTH ile veya bir Modelfile içinde PARAMETER num_ctx ile artırın. Eğer yalnızca tek bir iş daha büyük bir pencereye ihtiyaç duyuyorsa, num_ctx sunucu genelinde değil, istek bazında ayarlanabilir; bu, fazladan önbelleğin daemon'ın yaptığı diğer işleri etkilemesini önler. llama.cpp'nin de güvenilir bir varsayılan değeri yoktur. -c değerini açıkça ayarlayın ve neyi yapılandırdığınızı bilin.
Kimsenin göstermediği bellek hesabı
Model dosyası maliyetin tamamı değildir. KV cache (anahtar/değer önbelleği), bağlamın her bir belirteci (token) ve her katmanı için bir girdi tutar; bu önbellek, konuşma uzadıkça büyür.
Bunu Llama 3.1 8B için hesaplayalım. Model 32 katmana, 8 anahtar/değer başlığına ve 128'lik bir başlık boyutuna sahiptir. Her belirteç, f16 formatında 2 baytlık hem bir anahtar hem de bir değer saklar; yani katman başına 2 x 8 x 128 x 2 = 4096 bayt. 32 katman boyunca bu, belirteç başına 128 KiB eder. Dolayısıyla 4096 belirteçlik bir bağlam 512 MiB, 32,768 belirteçlik bir bağlam ise 4 GiB maliyet oluşturur.
Bu durumda, 4k bağlamlı bir Q4_K_M 8B modeli, ağırlıklar için yaklaşık 4.58 GiB, önbellek için yaklaşık 0.5 GiB ve çalışma zamanının kendisi için ek bellek gerektirir. Bu model 4 GiB RAM'e sığmaz. 8 GiB RAM'e ise çalışma payı bırakacak şekilde sığar. Aynı 8 GiB'lık sistemde bağlamı 32k'ya yükseltirseniz, sadece önbellek tüm boş alanı tüketir. Model yüklendiği sırada free -h ile durumu canlı izleyin ve bizzat ölçmediğiniz hiçbir tahmine güvenmeyin. Eğer 8B'den çok daha büyük bir model için boyutlandırma yapıyorsanız, sadece CPU kullanılan bir VPS üzerinde 27B model için yapılan aynı hesaplama, 8 GB'tan 64 GB'a kadar her kademenin gerçekte neyi barındırabileceğini gösterir.
Ollama bu durumu katlar. OLLAMA_NUM_PARALLEL varsayılan olarak 1 değerindedir ve bir modelin ihtiyaç duyduğu bellek, bu sayı ile bağlam uzunluğunun çarpımı oranında ölçeklenir. Her ikisini de aynı anda artırırsanız, daemon sessizce beklediğinizden birkaç kat daha fazla RAM talep eder. Aynı hesaplama, eşzamanlı kullanıcılar için üst sınırınızı belirler; çünkü her eşzamanlı istek kendi KV cache dilimini ister, bu da tek kişi için sorunsuz çalışan bir sunucunun neden beş kişide tıkandığının sebebidir.
Eksen 2: yönetmeniz gereken daemon
Ollama kurulum betiği bir systemd birimi yazar, bir ollama sistem kullanıcısı oluşturur ve servisi etkinleştirir. Bunların hiçbirini yazmanıza gerek kalmadan yaşam döngüsü yönetimine sahip olursunuz. Yapılandırma systemd üzerinden gerçekleştirilir:
sudo systemctl edit ollama[Service]
Environment="OLLAMA_CONTEXT_LENGTH=8192"
Environment="OLLAMA_KEEP_ALIVE=30m"sudo systemctl daemon-reload
sudo systemctl restart ollama
journalctl -e -u ollamaOLLAMA_KEEP_ALIVE, bir CPU VPS üzerinde diğer her yerden daha önemlidir. Modeller varsayılan olarak 5 dakika boyunca bellekte tutulur ve ardından bellekten boşaltılır. Bir sonraki istek, yanıt verebilmek için tüm dosyayı diskten geri okumak zorundadır; bu nedenle 4.58 GiB boyutundaki bir yeniden yükleme, yavaş depolama birimlerinde iki saniyelik bir yanıtı otuz saniyeye çıkarır. Uzun bir keep-alive süresi gecikmeyi düzeltir ve RAM'i kalıcı olarak kullanır. Her ikisi de gerçek maliyetlerdir. Hangisinin daha az zarar verdiğini seçin. Modelin bellekte kalması gerektiğine karar verirseniz, keep_alive ayarını boşta kalma sürelerinde ve yeniden başlatmalarda hayatta kalacak şekilde yapılandırmak birkaç satır sürer ve sunucu her yeniden başladığında modeli manuel olarak ısıtma zahmetinden sizi kurtarır.
llama.cpp size bir daemon sunmaz, bu yüzden birimi /etc/systemd/system/llama-server.service olarak kendiniz yazarsınız:
[Unit]
Description=llama.cpp server
After=network-online.target
[Service]
ExecStart=/usr/local/bin/llama-server -m /srv/models/model-Q4_K_M.gguf -c 4096 -t 4 --host 127.0.0.1 --port 8080
Restart=always
RestartSec=3
User=llama
[Install]
WantedBy=multi-user.targetBunu sudo systemctl enable --now llama-server ile etkinleştirin. Süreç, modelin tüm yaşam döngüsü boyunca bellekte kalmasını sağlar. Boşta kaldığında hiçbir şey bellekten boşaltılmaz; bu da yeniden yükleme sürprizi yaşanmayacağı ve servisi durdurmak dışında belleği geri kazanmanın bir yolu olmadığı anlamına gelir. Birim yazmak sizin için yeni bir konuysa, bu durum kendi servislerinizi bir VPS üzerinde systemd ile çalıştırmak ile aynı desene sahiptir.
Eksen 3: Uygulamanızın iletişim kuracağı API
Bu eksen oldukça daraldı. Her iki proje de artık OpenAI sohbet formatını desteklediğinden, çoğu istemci kütüphanesi yalnızca base URL değişikliği ile her iki projeyle de çalışabilmektedir.
Ollama, 127.0.0.1:11434 üzerinde dinleme yapar. OpenAI uyumlu rotası http://localhost:11434/v1/chat/completions adresindedir ve bunun yanı sıra /api/chat üzerinde yerel bir API sunmaya devam eder. Anthropic uyumlu bir rota da belgelenmiştir.
curl -X POST http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "llama31-q4", "messages": [{"role": "user", "content": "Say this is a test"}]}'llama-server, 127.0.0.1:8080 üzerinde dinleme yapar ve /v1/chat/completions, /v1/completions ve /v1/embeddings servislerinin yanı sıra kendi /completion uç noktasını ve yerleşik bir web arayüzünü sunar. Ayrıca Ollama'da bulunmayan operasyonel rotaları da dışa aktarır: hazır olma durumu kontrolü için /health, yüklenen modelin ayarları için /props, her bir istek yuvasının ne yaptığına dair /slots ve Prometheus formatında /metrics. Eğer bu servisi izlemeyi planlıyorsanız, kararınızı muhtemelen bu fark belirleyecektir.
Her iki sunucu da sizin yerinize kimlik doğrulamasını etkinleştirmez. Her ikisi de güvenlik gerekçesiyle varsayılan olarak loopback adresini kullanır. Bu servislere bir SSH tüneli üzerinden veya bir reverse proxy arkasından erişin; 11434 veya 8080 portlarını asla internete açmayın.
Sadece CPU içeren bir VPS'in gerçek kapasitesi
Sadece CPU içeren bir VPS, küçük modelleri yavaş çalıştırır. Dürüst özet budur; işe yarar kısım ise sınırın nerede olduğunu bilmektir. Herhangi bir tasarım yapmadan önce ölçüm yapın:
llama-bench -m ~/models/Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf -p 512 -n 128pp sütunu istem işleme hızını, tg sütunu ise saniyedeki token cinsinden token üretim hızını gösterir. Paylaşımlı bir vCPU planında, Q4_K_M seviyesindeki 8B bir model genellikle tg için düşük tek haneli değerler verir. İstem işleme kısmı en çok zorlayan bölümdür: tüm istem, ilk çıktı token'ı görünmeden önce işlenir; bu nedenle uzun bir sistem istemi, her isteğe bir bekleme süresi ekler. Yanıt uzunluğu, kontrol edebileceğiniz maliyetin yarısıdır; çünkü saniyede üç token hızında, 600 token boyunca konuşan bir model sunucuyu üç dakika boyunca meşgul eder. Bu yüzden num_predict ile çıktıyı sınırlamak, sohbeti uzatan bir yanıtın zaman aşımına uğramasını engellemenin en ucuz yoludur.
CPU üzerinde kullanılabilir olanlar: sınıflandırma, veri çıkarma, kısa özetler veya yönlendirme yapan 1B ile 4B arası modellerdir. Yanıtlar saniyeler içinde gelir ve bellek kullanımı standart bir plana uygundur. Bu boyutta bir örnek için, bir aralık yerine bir VPS üzerinde çekilip ölçülen Nemotron 3.5 Lightning çalışması; tam etiketi, ihtiyaç duyulan RAM miktarını ve GPU olmadan ulaşılan hızı gösterir. CPU üzerinde kullanılamayacak olanlar: okuma hızında interaktif sohbet, kodlama asistanları, uzun doküman işlemleri veya arka arkaya birçok çağrı yapan bir ajan döngüsü içeren işlemlerdir. Her biri dört saniye süren on iki çağrılık bir döngü, herhangi bir sonuç üretmeden önce bir dakika sürer. Eğer planınız zaten bir kodlama asistanı ise, bir ajanı kendi barındırdığınız bir modele yönlendirmek, küçük bir yerel modelin hangi işlerde gerçekten başarılı olduğunu ve hangilerinin barındırılan bir API üzerinde kalması gerektiğini belirler.
Rakamlar beklentiyi karşılamadığında iki çıkış yolu vardır. Sorun eşzamanlılık ise, yani birçok kullanıcı aynı anda tek bir modele erişiyorsa, motor tercihi değişir ve eşzamanlı sunum için Ollama ile vLLM karşılaştırması bu konuyu ele alır. Sorun ham hız ise, çözüm GPU içeren bir VPS kullanmaktır; burada -ngl bir anlam ifade etmeye başlar. Her ikisinden önce, donanımın kendisi için bir temel performans ölçümü yapın; çünkü disk ve bellek bant genişliği, yükleme süresini en az CPU kadar etkiler. Tekrarlanabilir bir VPS benchmark testi için ayıracağınız bir saate değer.
llama.cpp kurulumu ve belirli bir sürüme sabitleme
Her iki proje de haftalık olarak güncellendiği için dağıtımını yaptığınız sürümü not edin. Yukarı akış (upstream) tek satırlık komutu mevcut derlemeyi kurar:
curl -LsSf https://llama.app/install.sh | sh
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUFBelirli bir derlemeyi sabitlemek için bunun yerine releases sayfasından önceden derlenmiş tarball dosyasını alın. 2 Ağustos 2026 itibarıyla güncel etiket b10224 derlemesidir:
curl -LO https://github.com/ggml-org/llama.cpp/releases/download/b10224/llama-b10224-bin-ubuntu-x64.tar.gz
tar xf llama-b10224-bin-ubuntu-x64.tar.gz
find . -type f -name 'llama-server'Veya aynı etiketi kaynak koddan derleyin:
sudo apt update && sudo apt install -y build-essential cmake git libssl-dev
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git checkout b10224
cmake -B build
cmake --build build --config Release -j $(nproc)libssl-dev, HTTPS özellikleri için belgelenmiş bağımlılıktır. Derleme işlemi birkaç dakika sürer ve en küçük planların sunduğundan daha fazla RAM gerektirir; bu nedenle küçük sunucunuzda bellek yetersiz kalırsa daha büyük bir makinede derleyip ikili dosyaları (binaries) kopyalayın.
Ollama kurulumu ve belirli bir sürüme sabitleme
curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.32.5 sh
ollama -vBetik OLLAMA_VERSION dosyasını okur; bu sayede bugün yayınlanan sürümü almak yerine, bilinen ve sorunsuz çalışan bir sürümü sabitleyebilirsiniz. v0.32.5 sürümü 27 Temmuz 2026 tarihinde yayınlanmıştır. Bir betiği doğrudan shell ortamına yönlendirmek istemiyorsanız manuel kurulum yolu da mevcuttur:
sudo rm -rf /usr/lib/ollama
curl -fsSL https://ollama.com/download/ollama-linux-amd64.tar.zst | sudo tar x -C /usr
ollama -vManuel kurulum yöntemi systemd birimini veya servis kullanıcısını oluşturmaz; bu işlemleri kendiniz yapmanız gerekir. VPS üzerinde tam Ollama kurulumu rehberi, bu servis kurulumu adımını detaylıca açıklamaktadır.
Hata modları ve karşılaşacağınız dizgeler
Ollama modeli yüklemeyi reddediyor. ollama run şu biçimde bir satır döndürür:
Error: model requires more system memory (5.6 GiB) than is available (3.2 GiB)Ollama, yükleme öncesinde boyutu kontrol eder; bu nedenle işlem hızlıca başarısız olur ve nedenini belirtir. Bir alt kuantizasyon satırına geçin, bağlam uzunluğunu (context length) düşürün veya daha küçük bir model seçin.
llama.cpp başarısız olmuyor ancak çok yavaş çalışıyor. llama.cpp, GGUF dosyasını varsayılan olarak bellek eşlemeli (memory-map) kullanır; bu yüzden RAM'den daha büyük bir dosya bile başlatılabilir. Çekirdek, her token için ağırlıkları diskten belleğe alıp çıkarır (paging) ve disk kullanımı yüzde 100'e ulaştığında üretim hızı token başına saniyeler seviyesine düşer. Gerçek bir bellek tahsisini zorunlu kılmak ve performans düşüşü yerine işlemin hemen başarısız olmasını sağlamak için --no-mmap parametresini kullanın. Çekirdek müdahale ettiğinde, dmesg nedenini şu şekilde gösterir:
Out of memory: Killed process 1234 (llama-server)Model dosyası hiç yüklenmiyor. Motorunuzdan daha yeni bir model ailesi için oluşturulmuş bir GGUF dosyası, tanımadığı mimariyi belirten bir hata verir:
error loading model architecture: unknown model architecture: 'qwen3next'Çözüm, farklı bir dosya değil, motor yükseltmesidir. Bu, sürüm sabitlemenin (pinning) bedelidir ve yapı numarasını not etmenizin nedeni budur. Hangi sürümden yükseltme yaptığınızı bilmeniz gerekir.
API yerel olarak yanıt veriyor ancak uygulamanızdan yanıt alamıyorsunuz. Ollama, 127.0.0.1:11434 adresine bağlanır; bu nedenle başka bir ana makine "connection refused" hatası alır. OLLAMA_HOST=0.0.0.0:11434 değerini systemctl edit ollama üzerinden yalnızca port bir güvenlik duvarı veya özel ağ arkasında yer alıyorsa ayarlayın, çünkü API'nin önünde herhangi bir kimlik doğrulama mekanizması bulunmaz.
Bir duraksamadan sonraki ilk yanıt çok yavaş. 5 dakikalık boşta kalma süresi sonunda model bellekten atılmıştır ve tekrar diskten okunuyordur. İstekten hemen önce çalıştırılan ollama ps komutu hiçbir şeyin yüklü olmadığını gösterir ve bu durumu doğrular. OLLAMA_KEEP_ALIVE değerini yükseltin.
Peki hangisini çalıştırmalısınız?
Modellerin sizin yerinize yönetilmesini ve herhangi bir ek çaba harcamadan OpenAI uyumlu bir uç nokta (endpoint) kullanmak istiyorsanız Ollama çalıştırın. İlk dağıtım ve model seçiminin sürekli değişeceği durumlar için en uygun varsayılan budur.
Bellek kısıtlı olduğu için kuantizasyon (quantisation) satırını kendiniz seçmeniz gerektiğinde, izleme için /health, /slots ve /metrics özelliklerine ihtiyaç duyduğunuzda veya Ollama tarafından sunulmayan bir bayrağı (flag) kullanmanız gerektiğinde doğrudan llama.cpp çalıştırın. Modelin zar zor sığdığı bir VPS üzerinde en dürüst seçenek budur; çünkü modelin sığmasını sağlayan ayarlar, Ollama'nın sizin adınıza seçtiği ayarların aynısıdır.
Her ikisini de çalıştırmak normaldir. Denemeler için Ollama, üretime aldığınız ve bir daha değiştirmek istemediğiniz tek bir model için ise llama.cpp kullanın.
FAQ
Ollama sadece llama.cpp etrafında bir sarmalayıcı mıdır?
Yakın, ancak bu sarmalayıcı gerçek işlevler sunar. Ollama'nın README dosyası, llama.cpp'yi çıkarım (inference) altyapısı olarak listeler (2 Ağustos 2026 itibarıyla kontrol edilmiştir). Ollama bunun üzerine bir model kayıt defteri, sohbet mesajlarını bir isteme dönüştüren istem şablonu, varsayılan örnekleme parametreleri kümesi, boşta kaldığında bellekten boşaltma yapan bir daemon ve bir HTTP API ekler. Aynı ayarlarda saniye başına üretilen token sayısını karşılaştırdığınızda, aslında aynı motoru kendisiyle kıyaslıyorsunuz demektir. Seçim yapmanız gereken nokta yönetim katmanıdır.
Sadece CPU kullanılan bir VPS üzerinde hangisi daha hızlıdır?
Aynı motoru kullandıkları için; aynı model dosyası, kuantizasyon, bağlam boyutu ve iş parçacığı (thread) sayısında birbirlerine yakın sonuçlar verirler. İnsanların bildirdiği farklar genellikle motorun kendisinden değil, çoğunlukla bağlam uzunluğu ve iş parçacığı sayısı gibi farklı varsayılan ayarlardan kaynaklanır. Herhangi bir yayınlanmış veriye inanmadan önce, kendi sunucunuzda llama-bench -m <file> -p 512 -n 128 ile ölçüm yapın ve tg sütununu karşılaştırın.
Kendi GGUF dosyamı Ollama ile kullanabilir miyim?
Evet. Dosyayı sunucuya yükleyin, ilk satırı FROM ./your-model.gguf olan bir Modelfile oluşturun, num_ctx gibi ihtiyacınız olan tüm PARAMETER satırlarını ekleyin ve ardından ollama create your-name -f ./Modelfile komutunu çalıştırın. ollama ls, bu modeli kayıt defterinden çektiklerinizin yanında listeleyecektir. Kayıt defterinde bulunmayan bir kuantizasyonu bu şekilde kullanabilirsiniz.
8B bir model için ne kadar RAM gerekir?
Dosya boyutunu, KV önbelleğini ve çalışma zamanı gereksinimlerini hesaba katın. Llama 3.1 8B modelinin Q4_K_M sürümü diskte yaklaşık 4.58 GiB yer kaplar ve 4096 token'lık bağlam yaklaşık 512 MiB önbellek ekler; bu nedenle 8 GiB RAM rahat bir kullanım sağlar, 4 GiB ise yeterli değildir. Önbellek, bağlam boyutuyla birlikte ölçeklenir: aynı model 32,768 token'lık bağlamda tek başına yaklaşık 4 GiB önbelleğe ihtiyaç duyar. Ollama kullanırken, gereksinimin OLLAMA_NUM_PARALLEL ile de ölçeklendiğini unutmayın.