SSD Nodes Learn Hosting plans →
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-27

Paritok token tasarrufu sağlar mı?

Paritok proxy ile kodlama ajanı faturalarını %74 oranında düşürmek mümkün. Qwen3-4B tabanlı LoRA adaptörü ile dosya okumalarını nasıl sıkıştırdığını ve maliyet hesabını inceleyin.

Paritok bir isteğe ne yapar

Paritok bir token ağ geçididir: kodlama aracınız ile model API'si arasında konumlanan ve her isteği iletmeden önce sıkıştıran bir proxy'dir. Aracınız sağlayıcı yerine http://127.0.0.1:8080 ile iletişim kurar. Proxy; araç şemalarını, dosya okumalarını, araç çıktılarını ve eski konuşma döngülerini yeniden yazar, daha küçük olan yükü (payload) yukarı yöne gönderir ve yanıtı hiçbir değişiklik yapmadan geri iletir.

Sağlayıcı, kendisine ulaşan veri üzerinden faturalandırma yapar; dolayısıyla daha küçük bir yük, daha düşük bir fatura anlamına gelir. Tüm mantık bundan ibarettir. Bu, "bağlamınız daha uzun süre dayanır" iddiasından farklıdır ve bu aracın sadece düzenli olmaktan öte ilgi çekici olmasının nedeni de budur.

Proje henüz yenidir. İlk herkese açık etiketleri Temmuz 2026 tarihlidir ve mevcut etiket, 5 Ağustos 2026 tarihli v1.3.0 sürümüdür. Ağırlıklar ve ağ geçidi kodu Apache 2.0 lisansına sahiptir. Sıkıştırma modeli, gerçek kodlama aracı yörüngelerinden alınan 45.000 öğretmen damıtılmış örnek üzerinde eğitilmiş, Qwen3-4B-Instruct-2507 tabanlı bir LoRA (düşük dereceli uyarlama) adaptörüdür.

Neden bu işlem bağlam kırpma değildir

Kırpma işlemi veriyi siler. Bir aracı bağlam sınırına yaklaştığında ve en eski etkileşimleri sildiğinde, 3. adımda okuduğu dosya artık mevcut değildir. Eğer 20. adımda o dosyaya ihtiyaç duyarsa, dosyayı tekrar okur; dolayısıyla bu token'lar için ikinci kez ödeme yaparsınız. Yapılan tasarruf aslında bir borçlanmadır.

Paritok, bir segmenti daha kısa bir biçim ve bir etiketle ([REF:id]) değiştirir ve tam metni proxy üzerinde tutar. Model, read_original veya expand_context çağrısı yaparak segmenti geri yükler. Bu durum hata modunu değiştirir. Kırpma işlemi unutarak başarısız olur ve bunu size asla bildirmez. Sıkıştırma işlemi ise modele kayıplı bir özet sunarak başarısız olur; özet yeterli olmadığında model orijinal veriyi talep edebilir.

Araç filtresi de aynı şekilde davranır. Filtrelenmiş araç şemaları kaldırılmak yerine taslak haline getirilir ve model, gateway_search_tools çağrısı yaparak bunlardan birini geri yükleyebilir. Bu önemlidir çünkü bir aracı kalıcı olarak gizleyen filtre, aracınızın yapabileceklerini değiştirir ve bunu ancak sessizce başarısız olan bir görev aracılığıyla fark edebilirsiniz.

Üç kaldıraç ve hangisinin ücretsiz olduğu

Birinci kaldıraç, araç-şema filtresidir. Her istek, tüm tools dizisini taşır. Birkaç MCP (model context protocol) sunucusunun bağlı olduğu bir Claude Code oturumunda, proje bu bloğu yaklaşık 29.000 token olarak ölçer. Filtre, kullanıcının isteğini ve her bir araç açıklamasını 130 MB boyutundaki bir embedding modeli olan BAAI/bge-small-en-v1.5 ile gömer, eşleşen araçları tutar ve geri kalanını taslak (stub) haline getirir. Blok yaklaşık 8.000 tokene düşer. Bu embedding modeli CPU üzerinde çalışır.

İkinci kaldıraç içerik sıkıştırmadır ve GPU üzerinde 4B model gerektiren kısım burasıdır. Dosya okumaları, araç çıktıları ve geçmiş, orijinal boyutlarının %25,7'sine kadar yeniden yazılır. %74'lük manşet buradan gelmektedir. Dikkatli okuyun: %74, sıkıştırılan içerik üzerindeki sıkıştırma oranıdır, faturanızdaki indirim oranı değildir.

Üçüncü kaldıraç geçmiş özetlemedir. Bağlam bütçesi dolduğunda, yakın geçmiş penceresinin dışındaki turlar özetlenir; böylece uzun bir oturum sınıra takılmak yerine çalışmaya devam eder.

Sadece ikinci kaldıraç GPU gerektirir. Bu, sayfadaki en faydalı cümledir. pip install "paritok[toolselect]", standart bir CPU VPS üzerinde araç filtresini kullanmanızı sağlar ve ürünün aylık maliyet getirmeyen yarısıdır. Bir kart kiralamadan önce bunu deneyin.

Projenin neyi ve hangi altyapı üzerinde ölçtüğü

ChartSWE-bench Lite: compression rate against solve quality retained (project's published figures)
The data behind this chart
[
  {
    "label": "Paritok-4B-v1",
    "compressed_to_pct": 25.7,
    "quality_retained_pct": 86.5
  },
  {
    "label": "gpt-4.1-mini",
    "compressed_to_pct": 50.2,
    "quality_retained_pct": 85.6
  },
  {
    "label": "gpt-5",
    "compressed_to_pct": 61.9,
    "quality_retained_pct": 93.6
  }
]

Bunlar, projenin kendi yayınladığı ve SWE-bench Lite üzerinde kendi test altyapısıyla ölçtüğü verilerdir. Paritok-4B-v1, içeriği orijinal boyutunun 25.7% seviyesine sıkıştırırken, sıkıştırılmamış çözüm oranının 86.5% kadarını korumaktadır. Sıkıştırıcı olarak gpt-5 kullanıldığında daha fazla kalite korunur (93.6%), ancak sıkıştırma oranı yalnızca 61.9% seviyesinde kalır; bu durumda da yüksek maliyetli modellerden tasarruf etmek için yine yüksek maliyetli modellerin ücretini ödemiş olursunuz.

Kalite sütununu dürüstçe değerlendirin. Çözüm oranının 86.5% kadarını korumak, sıkıştırılmamış çalışmalarda çözülen ancak sıkıştırılmış çalışmalarda başarısız olunan problemler olduğu anlamına gelir; bu da yaklaşık her yedi çözümden birinin kaybedilmesi demektir. Bir benchmark testinde bu sadece tablodaki bir sayıdır. Kendi deponuzda ise bu, iki kez çalıştırmanız gereken bir görevdir.

ChartReported input-token saving as a session grows (project's own harness)
The data behind this chart
[
  {
    "label": "Turn 1",
    "saved_pct": 25
  },
  {
    "label": "Turn 5",
    "saved_pct": 39
  },
  {
    "label": "Turn 12",
    "saved_pct": 57
  },
  {
    "label": "Turn 20",
    "saved_pct": 63
  }
]

Uçtan uca tasarruf, oturum ilerledikçe artar; çünkü geçmiş birikir ve sıkıştırılan şey de bu geçmiş verisidir. Proje, tek bir turda yaklaşık 25%, 5. turda 39% ve 20. turda 63% tasarruf bildirmektedir. Ayrıca bu artışın nerede durduğunu da belirtir: 200,000 token bütçesinde mutlak tasarruf, 8. ile 12. turlar arasında tur başına yaklaşık 48,000 token seviyesinde sabitlenir; çünkü bağlam dolduğunda geçmiş verisi büyümeyi durdurur. Yaygın olarak alıntılanan "85% üzeri" rakamı, bağlamın doygunluğa ulaştığı oturumları tanımlar. Bu en iyi senaryodur, bu yüzden planlarınızı buna göre yapmayın.

24 GB GPU, Paritok maliyetini karşılar mı?

24 GB kapasiteli bir kart, bu boyuttaki bir model için standart kiralama birimidir. 7 Ağustos 2026 itibarıyla, 24 GB belleğe sahip bir RTX 4090 için yayınlanan ortalama isteğe bağlı (on-demand) saatlik ücret 0.44 dolar seviyesindedir; en ucuz listelemeler ise 0.20 dolar civarındadır. 0.44 dolar üzerinden hesap yapalım. Kartı tüm ay boyunca açık bırakırsanız, bu 730 saat eder ve toplam maliyet 321 dolar olur. Sadece mesai saatlerinde, günde 8 saat ve ayda 22 gün çalıştırırsanız, bu 176 saat eder ve maliyet 77 dolara düşer.

Şimdi token kesintisini dolar bazlı tasarrufa dönüştürelim. Bu indirim, girdi (input) tokenları için geçerlidir. Çıktı (output) tokenları proxy üzerinden değişmeden geçtiği için maliyetlerinde bir değişiklik olmaz. Bir kodlama ajanı için normal kabul edilen girdi tokenlarının toplam fatura tutarınızın %80'ini oluşturduğunu varsayın ve bu varsayımı kendi faturanızla karşılaştırın. Dolar bazlı tasarrufunuz, token indirim oranının 0.8 ile çarpımına eşittir.

ChartMonthly agent bill needed before a $0.44/hour 24GB card pays for itself
The data behind this chart
[
  {
    "label": "Turn 5 (39% saved)",
    "bill_always_on_usd": "1,030",
    "bill_workday_only_usd": 248
  },
  {
    "label": "Turn 20 (63% saved)",
    "bill_always_on_usd": 637,
    "bill_workday_only_usd": 154
  },
  {
    "label": "Saturated (85% saved)",
    "bill_always_on_usd": 472,
    "bill_workday_only_usd": 114
  }
]

Doygun oturum oranında %85'lik bir değerle faturanın %68'ini korursunuz. Bu durumda, aylık ajan harcamanız yaklaşık 472 doları geçtiğinde, sürekli açık kalan bir kart kendi maliyetini karşılamış olur. Eğer örneği mesai saatleri dışında durdurursanız, bu eşik yaklaşık 114 dolar seviyesine iner. %63'lük "turn-20" değerinde bu rakamlar 637 ve 154 dolar olur. Kısa oturumların gerçek durumu olan %39'luk "turn-5" değerinde ise, kart kiralamanın mantıklı olması için aylık harcamanızın yaklaşık 1,030 dolar olması gerekir.

İki faktör, durumu tablodakinden daha avantajlı hale getirir. Modelin 24 GB belleğe ihtiyacı yoktur: q4 sürümü yaklaşık 2.5 GB, bf16 sürümü ise yaklaşık 8 GB yer kaplar. Dolayısıyla daha küçük bir kart veya halihazırda başka işler için kullandığınız bir GPU sunucusu, tablodaki tüm rakamları aşağı çeker. Ayrıca, kimse kod yazmadığında örneği durdurmak, kira maliyetini yaklaşık dörtte üç oranında düşürdüğü için en etkili tasarruf yöntemidir.

Bir faktör ise durumu zorlaştırır. Sıkıştırma işlemi gerçek bir iş yüküdür. 4B modelin sıkıştırdığı her token, okunması ve ardından yazılması gereken bir tokendır; bu da her ajan turuna gecikme ekler. Saatlik kiraladığınız bir kartta bu maliyet, faturada bir kalem olarak değil, bekleme süresi olarak karşınıza çıkar; bu yüzden hissedene kadar fark etmesi kolaydır.

Eğer kiralık GPU saatlerini genel olarak API token maliyetleriyle kıyaslıyorsanız, GPU VPS ile API tokenları arasındaki başa baş noktası çıkarımı, çıkarım (inference) işleminin kendisi için aynı aritmetiği kullanır.

Paritok gateway'ini bir VPS üzerinde çalıştırma

Python 3.10 veya daha yeni bir sürüm gereklidir. Ubuntu 24.04, Python 3.12 ile gelir; bu nedenle yalnızca CPU kullanan kurulumlar için standart bir VPS imajı yeterlidir.

sudo apt update && sudo apt install -y python3-venv curl
python3 -m venv /opt/paritok/venv
source /opt/paritok/venv/bin/activate
pip install "paritok[proxy]==1.3.0"
pip install "paritok[toolselect]==1.3.0"

Sürümü sabitleyin. Depo, 29 Temmuz 2026 tarihinde v1.2.8 ve 5 Ağustos 2026 tarihinde v1.3.0 sürümlerini yayınladı; bu hızda ilerleyen bir projede yapılandırma anahtarları sürümler arasında yeniden adlandırılabilir. Doğrudan bir pip install paritok veya main üzerinden yapılan bir git clone, gelecek hafta size farklı bir gateway sunar ve ölçtüğünüz sayıların hangi sürüme ait olduğuna dair hiçbir kayıt bırakmaz.

Varsayılan arka uç Ollama'dır. Modeli çekin ve ardından proxy'nin aradığı kısa ismi atayın.

ollama pull paritok/paritok-4b-v1
ollama cp paritok/paritok-4b-v1 paritok-4b-v1

Yerel model, sıkıştırdığı her segment için bir yeniden yazım işlemi gerçekleştirdiğinden, uzun süren bir sıkıştırma geçişi ajan turunun takılmasına neden olur; Ollama'nın çıktı uzunluğu üzerindeki num_predict sınırı, bu süreci kısıtlayan ayardır.

Yanına paritok.yaml yazın. use_gpu_server: false, sıkıştırma işlemini kendi donanımınızda tutmanızı sağlayan ayardır.

use_gpu_server: false
local_model:
  base_url: http://localhost:11434
paritok proxy --port 8080 --config-file paritok.yaml

paritok up, yukarıdakilerin tümü için kısayoldur: model eksikse çeker ve proxy'yi 8080 numaralı port üzerinde başlatır. Bir ajanı yönlendirmeden önce proxy'yi kontrol edin.

curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/stats

/health, "status":"ok" ve bir sürüm dizgisi içeren küçük bir JSON nesnesi döndürür. /stats, sıkıştırma toplamlarını ve proxy'nin kendi tasarruf tahminini döndürür. Bu tahmini, proxy'nin kendi çalışmasını puanlaması olarak değerlendirin ve sağlayıcınızın kullanım sayfasıyla karşılaştırarak doğrulayın.

Kolaylıktan ziyade iş hacmi (throughput) için vLLM, adaptörü temel model üzerinde sunar.

vllm serve Qwen/Qwen3-4B-Instruct-2507 \
  --enable-lora \
  --lora-modules paritok-4b-v1=paritok/paritok-4b-v1 \
  --port 8000

Ollama'nın kurulumu daha hızlıdır. vLLM, eşzamanlı istekleri çok daha iyi yönetir; bu durum, birden fazla ajan aynı sunucuyu paylaştığında önem kazanır. Ollama ve vLLM arasındaki pratik fark, bu kararı sizin için belirleyen unsurdur.

Ajana, temel URL ortam değişkenlerini kullanarak proxy'yi işaret edin.

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
export OPENAI_BASE_URL=http://127.0.0.1:8080

Codex CLI, OPENAI_BASE_URL ayarını görmezden gelir; bu nedenle paritok.yaml içinde codex.enabled: true ayarlandığında proje sizin için ~/.codex/config.toml dosyasını yazar. Değişkeni tek başına dışa aktarmak, Codex'in doğrudan sağlayıcıyla konuşmasına neden olur; bunun işareti, siz çalışırken asla artmayan bir /stats sayacıdır.

Dinleyiciyi asla 0.0.0.0 üzerinde değil, 127.0.0.1 üzerinde tutun. Proxy, sağlayıcı API anahtarınızı yukarı yöne iletir; bu nedenle internete açık bir proxy, anahtarınız için açık bir röle görevi görür: portu bulan kişi, anahtarı hiç görmeden bakiyenizi harcayabilir. Portu dış dünyaya açmak yerine, bir SSH tüneli veya VPN üzerinden erişim sağlayın.

Yeniden başlatma sonrasında çalışmaya devam etmesi için systemd altında çalıştırın. Yolları kendi kurulumunuza göre düzenleyin.

[Unit]
Description=Paritok compression proxy
After=network-online.target

[Service]
User=paritok
WorkingDirectory=/opt/paritok
ExecStart=/opt/paritok/venv/bin/paritok proxy --port 8080 --config-file /opt/paritok/paritok.yaml
Restart=on-failure

[Install]
WantedBy=multi-user.target

sudo systemctl enable --now paritok ile etkinleştirin, ardından /health adresine tekrar curl isteği atın. Başlatılıp hemen kapanan bir birim, genellikle yapılandırma dosyası yolunun yanlış olduğu anlamına gelir; journalctl -u paritok -n 50 komutu bunun nedenini yazdırır.

Barındırılan seçenek ve maliyeti

Proje, sıkıştırma işlemini bir hizmet olarak da sunmaktadır. use_gpu_server: true ayarını bir API anahtarı ile yapılandırdığınızda, 4B modeli projenin kendi donanımı üzerinde çalışır. Kendi belgelerine göre Ağustos 2026 sonuna kadar ücretsiz olan bu hizmetin fiyatı, işlenen her bir milyon token başına 0.30 dolardır. Bu seçenek, GPU kiralama maliyetini ve yukarıda belirtilen tüm operasyonel iş yükünü ortadan kaldırır.

Bu durum aynı zamanda, istemlerinizin ve ajanınızın okuduğu dosyaların, model sağlayıcınıza ulaşmadan önce makinenizden çıkıp üçüncü bir tarafa iletileceği anlamına gelir. Self-hosting (kendi kendine barındırma) yöntemi, tam olarak bu ara adımı engellemek için vardır. Söz konusu bayrağı ayarlamadan önce hangi seçeneği optimize ettiğinize karar verin; çünkü bayrağı değiştirmek tek satırlık bir işlem olsa da sonuçları o kadar basit değildir.

Kendi öncesi ve sonrası ölçümlerinizi nasıl yaparsınız

Yayınlanan rakamlar, SWE-bench Lite üzerindeki proje test düzeneğinden elde edilen proje verileridir. Sizin deponuz SWE-bench Lite değildir. Kendi ölçümlerinizi yapın.

  • Yolda proxy olmadan normal bir hafta geçirin. Girdi token'larını, önbellekten okunan (cache-read) token'ları ve çıktı token'larını tek bir dolar toplamı olarak değil, sağlayıcınızın kullanım sayfasından ayrı satırlar halinde kaydedin.
  • Bir sonraki haftayı, aynı tür işleri yaparak ve proxy'yi ön tarafa koyarak geçirin.
  • Girdi ve önbellekten okunan satırları karşılaştırın. Çıktı miktarı kabaca aynı kalmalıdır, çünkü hiçbir şey onu sıkıştırmaz. Eğer çıktı miktarı çok değiştiyse, proxy dışında bir şey değişmiş demektir.
  • Yeniden yapmak zorunda kaldığınız görevleri sayın. Bu, takasın kalite tarafıdır ve hiçbir kontrol paneli bunu raporlamaz.
  • Toplamları karşılaştırmadan önce ikinci haftaya GPU saatlerini ekleyin.

Girdi ile çıktıyı ayırmak önemlidir çünkü ikisi çok farklı fiyatlandırılır ve bir sıkıştırıcı bunlardan yalnızca birine dokunur. Ağustos 2026 itibarıyla Claude Sonnet 4.6, milyon girdi token'ı başına 3 dolar ve milyon çıktı token'ı başına 15 dolar maliyete sahiptir; prompt-cache okuması ise girdi oranının %10'u kadardır, yani milyon başına 0,30 dolar. Girdi ve çıktı token maliyeti arasındaki fark, girdi tarafındaki bir sıkıştırıcının sizin için değerli olup olmadığına karar veren unsurdur. Claude Code token'larının gerçekte nereye gittiği, bağlamınızın hangi kısmının sıkıştırmaya değecek kadar büyük olduğunu size söyler.

Prompt önbelleğe alma, özellikle araç filtresi aritmetiğini karmaşıklaştırır. Araç bloğu isteğin ön kısmında yer alır, bu nedenle ilk turdan sonra normalde girdi fiyatının %10'u üzerinden önbellek isabeti (cache hit) gerçekleşir. Önbelleğe alınmış bir bloktan 21.000 token kesmek, önbelleğe alınmamış oranın düşündüreceği 0,063 dolar yerine, milyon başına 0,30 dolar üzerinden 21.000 token tasarruf sağlar; bu da tur başına yaklaşık 0,006 dolar eder. Proje, filtrelenmiş bloğu oturum boyunca dondurulmuş halde tutar, böylece önbelleğe alınmış önek değişmez. Her turda araçları yeniden seçen bir filtre, bu öneki geçersiz kılar ve tasarruf ettiğinden daha fazlasına mal olur.

Henüz doğrulanmamış olanlar

Yukarıdaki tüm performans verileri projenin kendi kaynaklarından alınmıştır. SWE-bench Lite sonuçlarının bağımsız bir doğrulaması bulunmamaktadır ve Temmuz 2026 tarihli ilk etiketler göz önüne alındığında, kodun arkasında çok az operasyonel geçmiş vardır. Sıkıştırma oranı ve korunan kalite rakamları, bu sonuçların iyi görünmesinden çıkar sağlayan tarafça ölçülmüştür. Bu durum verilerin yanlış olduğu anlamına gelmez. Sadece doğrulanmamış olduklarını gösterir; bu nedenle bu verilere kendi ürettiğiniz verilerden farklı bir gözle bakmalısınız.

Kurulumunuzu hatalı bulmadan önce belgelenmiş bir davranışa dikkat etmekte fayda vardır. Araç filtresi tarafından kullanılan embedding modeli, başlangıçta değil ilk istekte yüklenir; bu nedenle proje, 10 ila 15 saniyelik bir ısınma süresi ve sonrasında çağrı başına yaklaşık 15 ms yanıt süresi öngörmektedir. Proxy başladıktan sonra bir adet geçersiz istek gönderirseniz, ilk gerçek ajan işleminiz takılmış gibi görünmeyecektir.

Bir öğleden sonra kendi başınıza test edebileceğiniz dört husus şunlardır: proxy'nin başlayıp çalışmaya devam edip etmediği, çalışırken /stats değerinin değişip değişmediği, sağlayıcınızın giriş token hattının gerçekten düşüp düşmediği ve ajanın işi hala tamamlayıp tamamlamadığı. Bu kriterler, kurulumunuz için yayınlanmış herhangi bir benchmark testinden çok daha belirleyicidir.

Bu aracın diğer araçlarınızın yanında nerede durduğuna gelince: self-hosted bir LiteLLM gateway, içeriklerini değiştirmeden istekleri yönlendirir ve ölçümler; dolayısıyla bu iki araç farklı sorunları çözer ve Paritok ajana en yakın konumda olacak şekilde birbirine zincirlenebilir. Asıl hedefiniz bu özel araçtan ziyade faturayı düşürmekse, bir VPS üzerindeki ajan için daha geniş maliyet kontrol yöntemleri, denemesi ücretsiz olan birkaç değişikliği de içermektedir.

FAQ

Paritok API faturamı mı düşürür yoksa sadece bağlam kullanımımı mı?

Faturayı düşürür; çünkü proxy, isteği sağlayıcıya ulaşmadan önce yeniden yazar ve sağlayıcı kendisine ulaşan veri üzerinden ücretlendirme yapar. Bu düşüşün boyutu, manşetlerde belirtilenden daha azdır. %74 rakamı, sıkıştırılan içeriğin sıkıştırma oranıdır. Uçtan uca bakıldığında proje, tek bir turda yaklaşık %25, 20. turda ise %63 oranında tasarruf bildirmektedir ve sadece girdi belirteçleri (input tokens) etkilenir. Çıktı belirteçleri (output tokens) olduğu gibi iletilir.

Sıkıştırma modelini kendi sunucumda barındırmak için ne kadar GPU gerekir?

q4 sürümü yaklaşık 2.5 GB, bf16 sürümü ise yaklaşık 8 GB yer kaplar; dolayısıyla model, 24 GB kapasiteli bir kartta oldukça geniş bir boşluk bırakarak çalışır. Daha küçük bir kart da iş görür ve bu durum maliyet dengesini sizin lehinize değiştirir. Araç şeması filtresi (tool-schema filter) hiç GPU gerektirmez: CPU üzerinde çalışan 130 MB boyutundaki BAAI/bge-small-en-v1.5 gömme modelini (embedding model) kullanır. paritok[toolselect] kurulumunu standart bir VPS üzerinde yaparak, küçük bir miktar RAM maliyetiyle araç bloğu sıkıştırmasından faydalanabilirsiniz.

Sıkıştırıcı, ajanın ihtiyaç duyduğu bir şeyi silerse ne olur?

Hiçbir şey silinmez. Sıkıştırılmış bölümler bir [REF:id] etiketi taşır ve model, read_original veya expand_context ile tam metni geri yükler. Filtrelenmiş araç şemaları silinmek yerine taslak haline getirilir ve model, gateway_search_tools ile bunlardan birini geri yükleyebilir. Asıl risk, eksik bir dosyadan daha sinsi bir durumdur: model kayıplı bir özet üzerinden çalışır ve orijinal veriyi istemesi gerektiğini asla fark etmeyebilir. SWE-bench Lite üzerindeki %86.5 oranındaki kalite koruma değeri tam olarak bunu ölçmektedir.

İlk isteğim neden on beş saniye sürüyor?

Araç filtresinin arkasındaki gömme modeli, başlangıçta değil ilk istek sırasında yüklenir. Proje belgeleri 10 ila 15 saniyelik bir ısınma süresinden, sonrasında ise çağrı başına yaklaşık 15 ms işlem süresinden bahseder. Proxy'yi başlattıktan sonra curl ile bir adet önemsiz istek gönderirseniz, ilk gerçek ajan turu gecikmeyecektir.

Kendi sunucumda barındırmak yerine barındırılan GPU sunucusunu mu kullanmalıyım?

Bu seçenek, GPU kiralama ve bakım yükünü ortadan kaldırır; Ağustos 2026 itibarıyla işlenen milyon belirteç başına 0.30 dolar olarak fiyatlandırılır. Ayrıca istemlerinizi ve ajanınızın okuduğu dosyaları, model sağlayıcınıza ulaşmadan önce üçüncü bir tarafa gönderir. Eğer kodunuzu kontrolünüz altındaki altyapıda tutmak için kendi sunucunuzda barındırma yapıyorsanız, bu ayar başlangıç amacınızı geçersiz kılar. Kendi sunucunuzda barındırma yapmak, hem bağlamı hem de sağlayıcı API anahtarını kendi makinenizde tutmanızı sağlar.