SSD Nodes Learn 🎉 VPS $5.50/aydan başlayan
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-13

Paritok token maliyetlerini nasıl düşürür?

Paritok proxy katmanı ile kodlama aracı isteklerini %74 oranında sıkıştırır. Qwen3-4B tabanlı bu çözümün çalışma mekanizmasını ve maliyet tasarrufu hesaplamasını inceleyin.

Paritok bir isteğe ne yapar

Paritok bir token ağ geçididir: kodlama aracınız ile model API'si arasında konumlanan ve her isteği iletmeden önce sıkıştıran bir proxy'dir. Aracınız sağlayıcı yerine http://127.0.0.1:8080 ile iletişim kurar. Proxy; araç şemalarını, dosya okumalarını, araç çıktılarını ve eski etkileşimleri yeniden yazar, daha küçük olan yükü yukarıya gönderir ve yanıtı hiçbir değişiklik yapmadan geri iletir.

Sağlayıcı sizi kendisine ulaşan veri üzerinden faturalandırır, dolayısıyla daha küçük bir yük daha düşük bir fatura anlamına gelir. Tüm mantık bunun üzerine kuruludur. Bu, "bağlamınız daha uzun süre dayanır" iddiasından farklıdır ve bu aracın sadece düzenli olmaktan öte ilgi çekici olmasının nedeni de budur.

Proje henüz yenidir. İlk herkese açık etiketleri Temmuz 2026 tarihlidir ve mevcut etiket, 5 Ağustos 2026 tarihli v1.3.0 sürümüdür. Ağırlıklar ve ağ geçidi kodu Apache 2.0 lisansına sahiptir. Sıkıştırma modeli, gerçek kodlama aracı yörüngelerinden alınan 45.000 öğretmen tarafından damıtılmış örnek üzerinde eğitilmiş, Qwen3-4B-Instruct-2507 üzerinde bir LoRA (düşük dereceli uyarlama) adaptörüdür.

Bunun neden bağlam kırpma olmadığı

Kırpma işlemi veriyi siler. Bir aracı bağlam sınırına yaklaştığında ve en eski etkileşimleri sildiğinde, 3. adımda okuduğu dosya artık mevcut değildir. Eğer 20. adımda o dosyaya ihtiyaç duyarsa, dosyayı tekrar okur; dolayısıyla bu token'lar için ikinci kez ödeme yaparsınız. Yapılan tasarruf aslında bir borçlanmadır.

Paritok, bir segmenti daha kısa bir biçim ve bir etiket ([REF:id]) ile değiştirir ve tam metni proxy üzerinde tutar. Model, read_original veya expand_context çağrısı yaparak segmenti geri yükler. Bu durum hata modunu değiştirir. Kırpma aracı unutarak başarısız olur ve bunu size asla bildirmez. Sıkıştırma aracı ise modele kayıplı bir özet sunarak başarısız olur; özet yeterli olmadığında model orijinal metni talep edebilir.

Araç filtresi de aynı şekilde davranır. Filtrelenmiş araç şemaları kaldırılmak yerine taslak haline getirilir ve model, gateway_search_tools çağrısı yaparak bunlardan birini geri yükleyebilir. Bu önemlidir çünkü bir aracı kalıcı olarak gizleyen filtre, aracınızın yapabileceklerini değiştirir ve bunu ancak sessizce başarısız olan bir görev aracılığıyla fark edebilirsiniz.

Üç kaldıraç ve hangisinin ücretsiz olduğu

Birinci kaldıraç, araç-şema filtresidir. Her istek, tüm tools dizisini taşır. Claude Code üzerinde birkaç MCP (model context protocol) sunucusu bağlıyken, proje bu bloğu yaklaşık 29.000 token olarak ölçer. Filtre, kullanıcının isteğini ve her bir araç açıklamasını 130 MB boyutundaki BAAI/bge-small-en-v1.5 gömme modeliyle gömer, eşleşen araçları tutar ve geri kalanları taslak haline getirir. Blok yaklaşık 8.000 tokene düşer. Bu gömme modeli CPU üzerinde çalışır.

İkinci kaldıraç içerik sıkıştırmadır ve GPU üzerinde 4B model gerektiren kısım budur. Dosya okumaları, araç çıktıları ve geçmiş, orijinal boyutlarının %25,7'sine kadar yeniden yazılır. %74'lük manşet buradan gelir. Dikkatli okuyun: %74, sıkıştırılan içerik üzerindeki sıkıştırma oranıdır, faturanızdaki indirim oranı değildir.

Üçüncü kaldıraç geçmiş özetlemedir. Bağlam bütçesi dolduğunda, yakın geçmiş penceresinin dışındaki turlar özetlenir; böylece uzun bir oturum sınıra takılmak yerine devam eder.

Yalnızca ikinci kaldıraç GPU gerektirir. Bu, sayfadaki en yararlı cümledir. pip install "paritok[toolselect]", standart bir CPU VPS üzerinde size araç filtresini sunar ve bu, ürünün aylık maliyeti olmayan yarısıdır. Bir kart kiralamadan önce bunu deneyin.

Projenin neyi ve hangi altyapı üzerinde ölçtüğü

ChartSWE-bench Lite: compression rate against solve quality retained (project's published figures)
The data behind this chart
[
  {
    "label": "Paritok-4B-v1",
    "compressed_to_pct": 25.7,
    "quality_retained_pct": 86.5
  },
  {
    "label": "gpt-4.1-mini",
    "compressed_to_pct": 50.2,
    "quality_retained_pct": 85.6
  },
  {
    "label": "gpt-5",
    "compressed_to_pct": 61.9,
    "quality_retained_pct": 93.6
  }
]

Bunlar, projenin kendi yayınladığı ve SWE-bench Lite üzerinde kendi altyapısıyla ölçtüğü rakamlardır. Paritok-4B-v1, içeriği orijinal boyutunun 25.7% oranına sıkıştırırken, sıkıştırılmamış çözüm oranının 86.5% kadarını korumaktadır. Sıkıştırıcı olarak gpt-5 kullanıldığında daha fazla kalite korunur (93.6%), ancak sıkıştırma oranı yalnızca 61.9% seviyesinde kalır; üstelik bu durumda, üst düzey maliyetlerden tasarruf etmek için yine üst düzey maliyetler ödemiş olursunuz.

Kalite sütununu dürüstçe değerlendirin. Çözüm oranının 86.5% kadarını korumak, sıkıştırılmış çalıştırmaların, sıkıştırılmamış olanların çözdüğü problemleri çözemediği anlamına gelir; bu da neredeyse her yedi çözümden birinin başarısız olması demektir. Bir benchmark testinde bu sadece tablodaki bir sayıdır. Kendi deponuzda ise bu, iki kez çalıştırmanız gereken bir görevdir.

ChartReported input-token saving as a session grows (project's own harness)
The data behind this chart
[
  {
    "label": "Turn 1",
    "saved_pct": 25
  },
  {
    "label": "Turn 5",
    "saved_pct": 39
  },
  {
    "label": "Turn 12",
    "saved_pct": 57
  },
  {
    "label": "Turn 20",
    "saved_pct": 63
  }
]

Uçtan uca tasarruf, oturum ilerledikçe artar; çünkü geçmiş birikir ve sıkıştırılan şey de bu geçmiş verisidir. Proje, tek bir turda yaklaşık 25%, 5. turda 39% ve 20. turda 63% oranında tasarruf bildirmektedir. Ayrıca bu artışın nerede durduğunu da belirtmektedir: 200.000 token bütçesinde mutlak tasarruf, 8. ile 12. turlar arasında, tur başına yaklaşık 48.000 token seviyesinde sabitlenir. Bunun nedeni, bağlam dolduğunda geçmişin büyümesinin durmasıdır. Sıkça alıntılanan "85% üzeri" rakamı, bağlamın doygunluğa ulaştığı oturumları tanımlar. Bu en iyi senaryodur, bu yüzden planlarınızı buna göre yapmayın.

24 GB bir GPU, Paritok için maliyetini karşılar mı?

24 GB kapasiteli bir kart, bu boyuttaki bir model için standart kiralama birimidir. 7 Ağustos 2026 itibarıyla, 24 GB belleğe sahip bir RTX 4090 için yayınlanan ortalama isteğe bağlı (on-demand) kiralama ücreti saatlik 0.44 USD civarındadır; en uygun fiyatlı listelemeler ise 0.20 USD seviyelerine yakındır. 0.44 USD üzerinden hesap yapalım. Ay boyunca sürekli çalıştırıldığında, 730 saatlik kullanım için toplam maliyet 321 USD olur. Yalnızca mesai saatlerinde, günde 8 saat ve ayda 22 gün çalıştırıldığında ise 176 saatlik kullanım için maliyet 77 USD'ye düşer.

Şimdi token tasarrufunu dolar bazlı tasarrufa dönüştürelim. İndirim, girdi tokenları için geçerlidir. Çıktı tokenları proxy üzerinden değişikliğe uğramadan geçtiği için maliyetlerinde bir değişim olmaz. Bir kodlama ajanı için normal kabul edilen girdi tokenlarının toplam maliyetin %80'ini oluşturduğunu varsayın ve bu varsayımı kendi faturanızla karşılaştırın. Dolar bazlı tasarrufunuz, token azaltma oranının 0.8 ile çarpımına eşittir.

ChartMonthly agent bill needed before a $0.44/hour 24GB card pays for itself
The data behind this chart
[
  {
    "label": "Turn 5 (39% saved)",
    "bill_always_on_usd": "1,030",
    "bill_workday_only_usd": 248
  },
  {
    "label": "Turn 20 (63% saved)",
    "bill_always_on_usd": 637,
    "bill_workday_only_usd": 154
  },
  {
    "label": "Saturated (85% saved)",
    "bill_always_on_usd": 472,
    "bill_workday_only_usd": 114
  }
]

Doygun oturum oranının %85 olduğu durumda faturanın %68'ini korursunuz; bu nedenle, kart sürekli açık bırakıldığında aylık ajan harcamanız yaklaşık 472 USD'yi, mesai saatleri dışında örneği durdurursanız yaklaşık 114 USD'yi aştığında kart kendi maliyetini karşılamış olur. %20'lik dönüş oranının %63 olduğu durumda bu rakamlar 637 USD ve 154 USD olur. Kısa oturumların gerçek durumu olan %5'lik dönüş oranında (%39), kartı kiralamanın mantıklı olması için aylık yaklaşık 1,030 USD harcıyor olmanız gerekir.

İki faktör bu durumu tablodakinden daha avantajlı kılar. Modelin 24 GB belleğe ihtiyacı yoktur: q4 sürümü yaklaşık 2.5 GB, bf16 sürümü ise yaklaşık 8 GB yer kaplar; dolayısıyla daha küçük bir kart veya halihazırda başka işler için çalıştırdığınız bir GPU kutusu, tablodaki tüm rakamları aşağı çeker. Ayrıca, kimse kodlama yapmadığında örneği durdurmak, kira maliyetini yaklaşık dörtte üç oranında düşürdüğü için buradaki en etkili yöntemdir.

Bir faktör ise durumu zorlaştırır. Sıkıştırma işlemi gerçek bir iş yüküdür. 4B modelinin sıkıştırdığı her token, okunması ve ardından yazılması gereken bir tokendır; bu da her ajan turuna gecikme ekler. Saatlik kiraladığınız bir kartta bu maliyet fatura üzerinde bir kalem olarak değil, bekleme süresi olarak görünür; bu yüzden hissedene kadar fark etmesi kolaydır.

Eğer kiralık GPU saatlerini genel olarak API tokenları ile kıyaslıyorsanız, bir GPU VPS ile API tokenları arasındaki başa baş noktası çıkarım işleminin kendisi için aynı aritmetiği uygular.

Paritok gateway'in bir VPS üzerinde çalıştırılması

Python 3.10 veya daha yeni bir sürüm gereklidir. Ubuntu 24.04, Python 3.12 ile gelir; bu nedenle sadece CPU kullanan kısım için standart bir VPS imajı yeterlidir.

sudo apt update && sudo apt install -y python3-venv curl
python3 -m venv /opt/paritok/venv
source /opt/paritok/venv/bin/activate
pip install "paritok[proxy]==1.3.0"
pip install "paritok[toolselect]==1.3.0"

Sürümü sabitleyin. Depo, 29 Temmuz 2026 tarihinde v1.2.8 ve 5 Ağustos 2026 tarihinde v1.3.0 sürümlerini etiketlemiştir; bu hızda ilerleyen bir projede yapılandırma anahtarları sürümler arasında yeniden adlandırılır. Çıplak bir pip install paritok veya main içeren bir git clone, gelecek hafta size farklı bir gateway sunar ve ölçtüğünüz verilerin hangi sürüm tarafından üretildiğine dair hiçbir kayıt bırakmaz.

Varsayılan arka uç Ollama'dır. Modeli çekin ve ardından proxy'nin aradığı kısa adı atayın.

ollama pull paritok/paritok-4b-v1
ollama cp paritok/paritok-4b-v1 paritok-4b-v1

Yanına paritok.yaml yazın. use_gpu_server: false, sıkıştırma işlemini kendi donanımınızda tutmanızı sağlar.

use_gpu_server: false
local_model:
  base_url: http://localhost:11434
paritok proxy --port 8080 --config-file paritok.yaml

paritok up, yukarıdakilerin tümü için kısayoldur: model eksikse çeker ve proxy'yi 8080 numaralı port üzerinde başlatır. Bir aracı (agent) yönlendirmeden önce proxy'yi kontrol edin.

curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/stats

/health, "status":"ok" ve bir sürüm dizgisi içeren küçük bir JSON nesnesi döndürür. /stats, sıkıştırma toplamlarını ve proxy'nin kendi tasarruf tahminini döndürür. Bu tahmini, proxy'nin kendi çalışmasını puanlaması olarak değerlendirin ve sağlayıcınızın kullanım sayfasıyla doğrulayın.

Kolaylıktan ziyade iş hacmi (throughput) için vLLM, adaptörü temel modelin üzerinde çalıştırır.

vllm serve Qwen/Qwen3-4B-Instruct-2507 \
  --enable-lora \
  --lora-modules paritok-4b-v1=paritok/paritok-4b-v1 \
  --port 8000

Ollama'nın kurulumu daha hızlıdır. vLLM, eşzamanlı istekleri çok daha iyi yönetir; bu durum, birden fazla aracı aynı sunucuyu paylaştığında önem kazanır. Ollama ve vLLM arasındaki pratik fark, bu konudaki kararınızı belirleyen unsurdur.

Temel URL ortam değişkenlerini kullanarak aracıları proxy'ye yönlendirin.

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
export OPENAI_BASE_URL=http://127.0.0.1:8080

Codex CLI, OPENAI_BASE_URL değerini görmezden gelir; bu nedenle paritok.yaml içinde codex.enabled: true ayarlandığında proje sizin için ~/.codex/config.toml yazar. Değişkeni tek başına dışa aktarmak, Codex'in doğrudan sağlayıcıyla konuşmasına neden olur; bunun belirtisi, siz çalışırken asla artmayan bir /stats sayacıdır.

Dinleyiciyi asla 0.0.0.0 üzerinde değil, 127.0.0.1 üzerinde tutun. Proxy, sağlayıcı API anahtarınızı yukarı yöne iletir; bu nedenle internetten erişilebilir bir proxy, anahtar için açık bir röle görevi görür: portu bulan kişi, anahtarı hiç görmeden paranızı harcayabilir. Portu dış dünyaya açmak yerine, bir SSH tüneli veya VPN üzerinden dizüstü bilgisayarınızla erişin.

Yeniden başlatma sonrasında çalışmaya devam etmesi için systemd altında çalıştırın. Yolları kendi kurulumunuza göre düzenleyin.

[Unit]
Description=Paritok compression proxy
After=network-online.target

[Service]
User=paritok
WorkingDirectory=/opt/paritok
ExecStart=/opt/paritok/venv/bin/paritok proxy --port 8080 --config-file /opt/paritok/paritok.yaml
Restart=on-failure

[Install]
WantedBy=multi-user.target

sudo systemctl enable --now paritok ile etkinleştirin, ardından /health adresine tekrar curl isteği gönderin. Başlayan ve hemen ardından kapanan bir birim genellikle yapılandırma dosyası yolunun yanlış olduğu anlamına gelir; journalctl -u paritok -n 50 komutu bunun nedenini yazdıracaktır.

Barındırılan seçenek ve maliyeti

Proje, sıkıştırma işlemini bir hizmet olarak da sunmaktadır. use_gpu_server: true ayarını bir API anahtarı ile yapılandırdığınızda, 4B modeli kendi donanımları üzerinde çalışır. Kendi belgelerine göre Ağustos 2026 sonuna kadar ücretsiz olan bu hizmetin fiyatı, işlenen her bir milyon token için 0.30 dolardır. Bu seçenek, GPU kiralama maliyetini ve yukarıda belirtilen tüm operasyonel iş yükünü ortadan kaldırır.

Bu durum aynı zamanda, istemlerinizin ve temsilcinizin okuduğu dosyaların, model sağlayıcınıza ulaşmadan önce makinenizden çıkıp üçüncü bir tarafa iletileceği anlamına gelir. Self-hosting (kendi kendine barındırma), tam olarak bu aracı adımı ortadan kaldırmak için tercih edilir. Bu bayrağı ayarlamadan önce hangisine öncelik verdiğinize karar verin; çünkü bayrağı değiştirmek tek satırlık bir işlem olsa da sonuçları o kadar basit değildir.

Kendi öncesi ve sonrası ölçümlerinizi nasıl yaparsınız

Yayınlanan rakamlar, projenin kendi test düzeneğinden ve SWE-bench Lite üzerinden elde edilen verilerdir. Sizin deponuz SWE-bench Lite değildir. Kendi ölçümlerinizi yapın.

  • Yol üzerinde proxy olmadan normal bir hafta geçirin. Giriş token'larını, önbellekten okunan (cache-read) token'ları ve çıkış token'larını sağlayıcınızın kullanım sayfasından tek bir dolar tutarı olarak değil, ayrı satırlar halinde kaydedin.
  • Bir sonraki haftayı, aynı tür işleri yaparak ve proxy'yi öne alarak geçirin.
  • Giriş ve önbellekten okuma satırlarını karşılaştırın. Çıkış token'ları yaklaşık olarak aynı kalmalıdır, çünkü hiçbir şey onu sıkıştırmaz. Eğer çıkış değerleri çok değiştiyse, proxy dışında bir şey değişmiş demektir.
  • Yeniden yapmak zorunda kaldığınız görevleri sayın. Bu, takasın kalite tarafıdır ve hiçbir kontrol paneli bunu raporlamaz.
  • Toplamları karşılaştırmadan önce ikinci haftaya GPU saatlerini ekleyin.

Giriş ve çıkış verilerini ayırmak önemlidir çünkü ikisi de çok farklı fiyatlandırılır ve bir sıkıştırıcı bunlardan yalnızca birine dokunur. Ağustos 2026 itibarıyla Claude Sonnet 4.6, milyon giriş token'ı başına 3 dolar ve milyon çıkış token'ı başına 15 dolar maliyete sahiptir; bir prompt-cache okuması ise giriş ücretinin %10'u olan milyon başına 0.30 dolardır. Giriş ve çıkış token maliyeti arasındaki fark, giriş tarafındaki bir sıkıştırıcının sizin için değerli olup olmadığına karar veren unsurdur. Claude Code token'larının gerçekte nereye gittiği, bağlamınızın hangi kısmının sıkıştırmaya değecek kadar büyük olduğunu size söyler.

Prompt önbelleğe alma, özellikle araç filtresi aritmetiğini karmaşıklaştırır. Araç bloğu isteğin en önünde yer alır, bu nedenle ilk turdan sonra genellikle giriş fiyatının %10'u üzerinden bir önbellek isabeti (cache hit) gerçekleşir. Önbelleğe alınmış bir bloktan 21.000 token kesmek, önbelleğe alınmamış oranın düşündüreceği 0.063 dolar yerine, milyon başına 0.30 dolar üzerinden 21.000 token tasarruf sağlar; bu da tur başına yaklaşık 0.006 dolar eder. Proje, filtrelenmiş bloğu oturum boyunca dondurulmuş halde tutar, böylece önbelleğe alınmış önek değişmez. Her turda araçları yeniden seçen bir filtre, bu öneki geçersiz kılar ve tasarruf ettiğinden daha fazlasına mal olur.

Henüz doğrulanmamış olanlar

Yukarıdaki tüm performans verileri projenin kendi kaynaklarından alınmıştır. SWE-bench Lite sonuçlarının bağımsız bir doğrulaması bulunmamaktadır ve Temmuz 2026 tarihli ilk etiketler göz önüne alındığında, kodun arkasında çok az operasyonel geçmiş vardır. Sıkıştırma oranı ve korunan kalite değerleri, bu sonuçların iyi görünmesinden çıkar sağlayan tarafça ölçülmüştür. Bu durum verilerin yanlış olduğu anlamına gelmez. Sadece doğrulanmamış olduklarını gösterir; bu nedenle bu verilere, kendi ürettiğiniz verilerden farklı bir gözle bakmalısınız.

Kurulumunuzu hatalı bulmadan önce belgelenmiş bir davranış biçimini bilmenizde fayda vardır. Araç filtresi tarafından kullanılan embedding modeli, başlangıçta değil ilk istekte yüklenir; bu nedenle proje, 10 ila 15 saniyelik bir ısınma süresi ve sonrasında çağrı başına yaklaşık 15 ms gecikme öngörmektedir. Proxy başladıktan sonra bir adet geçersiz istek gönderirseniz, ilk gerçek agent işleminiz donmuş gibi görünmeyecektir.

Bir öğleden sonra kendi başınıza test edebileceğiniz dört husus şunlardır: proxy'nin başlayıp çalışmaya devam edip etmediği, çalışırken /stats değerinin değişip değişmediği, sağlayıcınızın giriş token hattının gerçekten düşüp düşmediği ve agent'ın işi tamamlamaya devam edip etmediği. Bunlar, kurulumunuz için yayınlanmış herhangi bir benchmark testinden çok daha belirleyicidir.

Bu aracın diğer araçlarınızın yanında nerede durduğuna gelince: self-hosted bir LiteLLM gateway, isteklerin içeriğini değiştirmeden yönlendirir ve ölçümler; dolayısıyla bu iki araç farklı sorunları çözer ve Paritok'un doğrudan agent'a en yakın konumda çalışmasıyla birbirine zincirlenebilirler. Asıl hedefiniz bu özel araçtan ziyade faturayı düşürmekse, bir VPS üzerindeki agent için daha geniş maliyet kontrolü yöntemleri, denemesi ücretsiz olan birçok değişikliği içermektedir.

FAQ

Paritok API faturamı mı düşürür yoksa sadece bağlam (context) kullanımımı mı?

Faturayı düşürür; çünkü proxy, isteği sağlayıcıya ulaşmadan önce yeniden yazar ve sağlayıcı kendisine ulaşan veriyi faturalandırır. Bu düşüşün boyutu, manşetlerde belirtilenden daha azdır. %74'lük oran, sıkıştırılan içeriğin sıkıştırma oranıdır. Uçtan uca bakıldığında proje, tek bir turda yaklaşık %25, 20. turda ise %63 oranında tasarruf bildirmektedir ve sadece girdi token'ları etkilenir. Çıktı token'ları hiçbir değişikliğe uğramadan iletilir.

Sıkıştırma modelini kendi sunucumda barındırmak için ne kadar GPU gerekir?

q4 sürümü yaklaşık 2.5 GB, bf16 sürümü ise yaklaşık 8 GB yer kaplar; dolayısıyla model, 24 GB'lık bir karta fazlasıyla sığar. Daha küçük bir kart da iş görür ve bu durum maliyet dengesini sizin lehinize değiştirir. Araç şeması filtresi (tool-schema filter) hiç GPU gerektirmez; CPU üzerinde çalışan 130 MB'lık bir gömme (embedding) modeli olan BAAI/bge-small-en-v1.5 kullanır. paritok[toolselect] aracını standart bir VPS üzerine kurduğunuzda, sadece biraz RAM maliyetiyle araç bloğu sıkıştırmasından faydalanabilirsiniz.

Sıkıştırıcı, ajanın ihtiyaç duyduğu bir şeyi silerse ne olur?

Hiçbir şey silinmez. Sıkıştırılmış bölümler bir [REF:id] etiketi taşır ve model, read_original veya expand_context kullanarak tam metni geri yükler. Filtrelenmiş araç şemaları silinmek yerine taslak haline getirilir ve model, gateway_search_tools ile bunları geri yükleyebilir. Asıl risk, kayıp bir dosyadan daha sinsi bir durumdur: model, kayıplı bir özet üzerinden çalışır ve orijinal veriyi istemesi gerektiğini hiçbir zaman fark etmeyebilir. SWE-bench Lite üzerindeki %86.5'lik kalite koruma oranı, tam olarak bu durumu ölçmektedir.

İlk isteğim neden on beş saniye sürüyor?

Araç filtresinin arkasındaki gömme modeli, başlangıçta değil ilk istekte yüklenir. Proje belgelerinde 10 ila 15 saniyelik bir ısınma süresi, sonrasında ise çağrı başına yaklaşık 15 ms işlem süresi belirtilmiştir. Proxy'yi başlattıktan sonra curl ile bir adet geçersiz istek gönderirseniz, ilk gerçek ajan turu gecikmeyecektir.

Kendi sunucumda barındırmak yerine barındırılan (hosted) GPU sunucusunu mu kullanmalıyım?

Bu seçenek, GPU kiralama ve bakım yükünü ortadan kaldırır; Ağustos 2026 itibarıyla işlenen milyon token başına 0.30 dolar olarak fiyatlandırılır. Ayrıca, istemlerinizi ve ajanınızın okuduğu dosyaları, model sağlayıcınıza ulaşmadan önce üçüncü bir tarafa gönderir. Kodunuzu kontrolünüz altındaki altyapıda tutmak için kendi sunucunuzda barındırma yapıyorsanız, bu ayar yola çıkış amacınızı boşa çıkarır. Kendi sunucunuzda barındırma yapmak, hem bağlamı hem de sağlayıcı API anahtarını kendi makinenizde tutmanızı sağlar.