SSD Nodes Learn 🎉 VPS $4.99/aydan başlayan
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-06

Fable yöntemi: Her model için agent skill'leri

fable-method reposu, Claude Fable 5 alışkanlıklarını agent skill'lerine dönüştürüyor. Dosyaların işlevini, diğer modellere aktarılabilenleri ve VPS üzerinde A/B testini öğrenin.

Fable yöntemi gerçekte ne iddia ediyor

Fable yöntemi, bir modelin çalışma alışkanlıklarını sıralı bir prosedür olarak yazılı hale getiren küçük bir agent skill kümesidir. Böylece farklı bir model aynı prosedürü çalıştırabilir. Repo, MIT lisanslı Sahir619/fable-method projesidir. Projenin kendi tek satırlık açıklaması şöyledir: "Claude Fable 5'in nasıl çalıştığı, her modelin çalıştırabileceği skill'ler halinde özetlendi ve yöntemin güvenilirliğini koruyan değerlendirme eklendi." Test edilmeye değer iddia, bu cümlenin ikinci kısmıdır.

Bir metin dosyasının belirli bir modelin nasıl düşündüğünü gerçekten yakalayıp yakalamadığını Anthropic dışındaki hiç kimse doğrulayamaz. Ancak daha düşük maliyetli bir modelin bu metin dosyasını okuduğunda farklı davranıp davranmadığını kendiniz, tek bir VPS üzerinde bir öğleden sonra içinde kontrol edebilirsiniz. Aşağıdaki tüm işlemlerin amacı bu ölçümdür: aynı görevi yöntemi kullanarak ve kullanmadan iki kez çalıştırmak, tool çağrılarını ve maliyeti saymak.

skill terimi sizin için yeniyse agent skill'in gerçekte ne olduğu ile başlayın: agent'ın gövdeyi ne zaman yükleyeceğini belirten frontmatter açıklamasına sahip bir SKILL.md dosyası içeren klasör. Reponun adını aldığı model, Claude Fable 5'in maliyeti ve hangi işlerde başarılı olduğu başlığında ele alınmaktadır.

Becerileri yükleyin ve test ettiğiniz sürümü sabitleyin

İki yükleme yöntemi vardır. Claude Code içinde plugin yöntemi iki komuttan oluşur:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Disk üzerinde sabitlenmiş bir kopya bulundurmak istediğiniz bir VPS üzerinde önce depoyu klonlayın ve bir etiketi checkout yapın:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh yalnızca $HOME/.claude/skills altında yazma işlemi yaptığı için sudo gerektirmez. Çalıştıktan sonra ls ~/.claude/skills, fable-judge, fable-loop ve fable-method değerlerini listeler. Listede bulunmayan öğelere bakın. Depoda dört skill bulunur, ancak shell installer üç tanesini kopyalar. Bu nedenle bağımsız kullanıcı, elle kopyalamadıkça fable-domain öğesini edinemez:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

Etiketi sabitleyin ve elde ettiğiniz sonuçların yanına etiketi yazın. Bu repo, 2026-07-06 ile 2026-07-15 arasında v1.0.0 ile v1.4.0 arasındaki beş sürümü yayımladı. v1.4.0, yeni bir routing gate ekleyerek yöntemin kendisini değiştirdi. Ağustos 2026 itibarıyla v1.4.0 hâlâ en yeni etikettir. Kontrol çalışmanız kuralların bir sürümünü, test çalışmanız ise başka bir sürümünü okuyorsa hiçbir ölçüm yapmış olmazsınız.

Dört becerinin modele ne yapmasını söylediği

Yük taşıyan dosya skills/fable-method/SKILL.md dosyasıdır. Bu dosya iki geçit ve yedi numaralı adım içerir. Kuralları, üzerinde tartışılabilecek kadar özeldir.

Önce önemsizlik geçidi gelir: değişiklik tek bir dosyaya dokunuyorsa, yaklaşık 10 satırdan kısa sürüyorsa, yeni davranış eklemiyorsa ve tam olarak neyin değiştirileceği zaten biliniyorsa doğrudan işlem yapılır; ek prosedür uygulanmaz. Ardından uygunluk geçidi gelir ve istek, yanıtın bulunduğu yere göre yönlendirilir: açılabilen kaynaklar, önce araştırılması gereken bir teknik veya modelin kendi çıkarımı. Kendi çıkarımı, gerçek gibi sunulmak yerine düşük güven olarak işaretlenmelidir.

Ardından döngü gelir: isteği sınıflandır, tamamlanma ölçütünü tanımla, kanıt topla, karar ver, işlem yap, doğrula ve raporla. 2. adım, dosyaları seçmeden önce dizini listeleyerek yön kazanılmasını, hatırlamaya kıyasla birincil kaynakların tercih edilmesini ve art arda iki aramada yeni bir sonuç alınmadığında durulmasını söyler. 4. adım, herhangi bir düzenlemeden önce bir INTENT: satırı yazılmasını ister. Bu satırda kodun ne yaptığı, başarısız kontrolün ne beklediği ve spesifikasyonun ne söylediği belirtilmelidir. Bu üç unsur uyuşmuyorsa hiç düzenleme yapılmamalıdır; çünkü asıl bulgu bu uyuşmazlıktır. 5. adım yeniden denemeleri sınırlar: aynı sorun için üç başarısız düzeltme ve doğrulama döngüsünden sonra durulmalı ve gerçek çıktı ile geri dönülmelidir.

Dosyanın en kolay test edilebilen bölümü dört rapor belirtecidir. Davranış değişikliği bir INTENT: satırı gerektirir. Dışa dönük bir işlem AUTH: user said "<exact words>" gerektirir ve kullanıcı alıntılanmalıdır; çünkü repository, dokümantasyonun yetkilendirme olmadığını açıkça belirtir. Öngörülen ancak gerçekleştirilmeyen bir işlem PENDING: satırı gerektirir. Düzeltilen bir hata ise TWINS: searched <pattern> - found <N> other sites gerektirir. Yöntemle ilgili herhangi bir iddiaya güvenmek gerekmez. Bu dört dizenin, gerekli olduklarında raporda görünüp görünmediği kontrol edilebilir. Bu özellik, tüm yöntemi öznel izlenimler yerine ölçülebilir hale getirir.

fable-loop, aynı yöntemin dört aşamalı bir orkestrasyon olarak çalıştırılmasıdır: paralel kanıt alt aracılarıyla planlama, ana iş parçacığında yürütme, her biri farklı bir bakış açısı kullanan bir ila üç saldırgan alt aracıyla doğrulama ve ardından denetim ile raporlama. Kanıt ve saldırgan rollerinde düşük maliyetli modeller, kararlar ve düzenlemelerde ise daha güçlü bir model kullanıldığı varsayılır.

fable-judge, diğer bileşenler tamamen bırakılacak olsa bile kurulmaya değer parçadır. Bu bileşenin yaklaşımı şudur: "Bir rapor, kanıt değil, iddialar kümesidir." Tamamlanmış bir rapordaki iddiaları toplar, git diff ve git status üzerinden gerçek durumu belirler, raporun çalıştırdığını söylediği her doğrulamayı yeniden çalıştırır ve adlandırılmış bir sahtekârlık listesinde arama yapar: zayıflatılmış kontroller, yanlış tamamlanma bildirimi, kapsam genişlemesi, yetkisiz işlem, spesifikasyona aykırılık ve geride bırakılan artıklar. VERIFIED, VERIFIED WITH CAVEATS veya REFUTED sonucunu döndürür. Yeniden üretilemeyen hiçbir şeyi başarılı kabul etmez ve bunları UNVERIFIABLE olarak işaretler. Kurulum aracının son satırı da bunu vurgular: "Deneyin: Claude Code'u açın ve herhangi bir aracının çalışmanın tamamlandığını bildirmesinden sonra /fable-judge yazın."

fable-domain, tuzak fixture'ları ve smoke eval'leri içeren alan adaptörü paketleri oluşturur. Sekiz adaptör sunulur: pazarlama, araştırma, veri analizi, iş ve operasyonlar, finans, hukuk ve uyumluluk, tasarım ve UX ile devops. Tıbbi ve klinik çalışmalar için kasıtlı olarak bir adaptör sağlanmaz.

Başka bir modele hangi bölümler taşınabilir, hangileri taşınamaz

Repo bunu doğrudan AGENTS.md ile yanıtlar. Bu dosya şu ifadeyle başlar: "Herhangi bir coding agent veya harness için taşınabilir sürüm (Codex, Cursor, aider, ham bir system prompt). SKILL.md ile aynı yöntemdir; bu dosyayı agent talimatlarına yapıştırın veya repo köküne AGENTS.md olarak ekleyin." Dosya yaklaşık 2,600 kelimeden oluşur ve aynı denetimleri, adımları ve modları içerir. Repo kökünde zaten talimat dosyaları tutuluyorsa, AGENTS.md ve HUMAN.md kuralı bu dosyanın nereye yerleştirileceğini ve kim tarafından okunacağını açıklar.

İki bölüm sorunsuz biçimde taşınabilir. Yöntem metni, modele özgü kod içermeyen sıralı bir prompt olduğundan talimatları izleyen her model bunu uygulayabilir. Repo'nun temel tezi de kazanımın model seviyesine ters orantılı olduğudur. Judge bölümü de taşınabilir; bunun için agent'ın bir shell'e ve bir repository'ye erişmesi yeterlidir. Çünkü yaptığı her işlem git diff çağrısından ve okuyucunun da çalıştırabileceği komutları yeniden çalıştırmaktan ibarettir.

Bir bölüm sorunsuz biçimde taşınamaz. fable-loop, harness'in paralel subagent'lar başlatabildiğini ve bunları farklı modellere yönlendirebildiğini varsayar. Subagent desteği olmayan bir agent bu aşamaları tek bir model üzerinde seri olarak çalıştırır. Bu durum, tasarımın gerekçesi olan paralelliği ve maliyet tasarrufunu ortadan kaldırır. Geriye yalnızca ek terminoloji içeren fable-method kalır.

İki küçük unsur harness'e özgüdür ve kolayca gözden kaçabilir. /fable-method tetikleyicisi bir Claude Code slash command olduğundan başka bir harness'te yöntem açıklanarak çağrılır. SKILL.md frontmatter açıklaması ise agent'ın gövdeyi yalnızca görevle eşleştiğinde yüklemesini sağlar. Bu nedenle kurulu bir skill, tetiklenene kadar neredeyse hiç kaynak tüketmez. Bunun yerine AGENTS.md bir system prompt içine yapıştırılırsa, gönderilen her istekte bu 2,600 kelime yer alır. İstek tek satırlık bir yazım hatası düzeltmesi de olabilir, refactor işlemi de. Bu gerçek bir maliyet farkıdır ve skill paketlemesinin var olmasının temel nedenlerinin çoğunu açıklar.

VPS üzerinde A/B testi nasıl yapılır: aynı görev, iki kez

İki özdeş çalışan kopya oluşturulmalıdır. Böylece hiçbir çalıştırma diğerinin düzenlemelerini göremez.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Sonucu görüşe başvurmadan gözlemleyebileceğiniz bir görev seçilmelidir: geçmesi gereken başarısız bir test veya 0 koduyla sonlanması gereken bir betik kullanılabilir. Belirsiz bir görev, belirsiz bir karşılaştırmaya yol açar. Çünkü sonuçlar yerine metinleri değerlendirmek zorunda kalırsınız.

Kontrol kolunu --bare ile çalıştırın. Bu seçenek hooks, skills, plugins ve CLAUDE.md için otomatik keşfi atlar. Kontrol kolunu kontrol grubu yapan unsur bu seçenektir: daha önce yüklediğiniz skills bu çalıştırmaya sızamaz. Bare mode abonelik oturumunuzu kullanmaz. Bu nedenle önce Claude Console üzerinden bir API key ayarlayın.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Yöntem kolunda aynı komuta, taşınabilir yöntemi system prompt eklemesi olarak yükleyen bir seçenek eklenir:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Aynı binary, aynı model, aynı araçlar ve aynı başlangıç ağacı kullanılmalıdır. Yalnızca bir seçenek farklıdır. Karşılaştırmanın anlamlı olması için gereken tek fark budur.

Bu tasarım, yöntem metnini ölçer. Skill paketlemesini ölçmez. Bu ayrı bir konudur. Paketlemeyi ölçmek için --bare kaldırılmalı, skills yukarıda açıklandığı şekilde yüklenmeli ve skill adı prompt string içine yazılmalıdır. User-invoked skills print mode içinde genişletilir: claude -p "/fable-method $task". Görünür davranış aynı olsa bile maliyet profilinin system-prompt kolundan farklı olması beklenmelidir.

Adımları ve maliyeti sayma

Her iki çalıştırma da bir JSON olay akışı yazdı. Son satır, nihai metni, maliyeti ve oturum meta verilerini taşıyan bir result mesajıdır. Çevresinde betik yazmadan önce bu satırı bir kez yazdırıp inceleyin; alan adları Claude Code sürümleri arasında değişebilir.

tail -1 ~/ab/control.jsonl | jq .

Çalıştırma başına maliyet bu satırdan alınır ve karşılaştırılması gereken değer budur:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Atılan adımlar, aynı dosyadaki araç çağrıları sayılarak elde edilir:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Bunu her iki dosya için çalıştırın. Farkın niteliği, toplam değerlerden daha fazla bilgi verir. Daha fazla dosya okuyup daha az düzenleme yapan bir yöntem çalıştırması, yöntemin gerektirdiği işlemi uyguluyordur; kabul ettiğiniz ödünleşim budur. Aynı düzenlemeleri yapıp yüzde kırk daha fazla maliyete neden olan bir yöntem çalıştırması, o görevde size hiçbir şey kazandırmamıştır.

Bu sayılarla ilgili iki uyarı vardır. İlk olarak, ~/.claude/projects/ altındaki oturum dökümlerinden output_tokens değerlerini toplayıp bunu toplam olarak kabul etmeyin. Bu ileti başına kullanım blokları, akış sırasında alınan anlık değerlerdir ve bunların eksik sayıldığına ilişkin açık raporlar vardır. Güvenilmesi gereken değer result satırıdır. İkinci olarak, kol başına tek çalıştırma yalnızca bir gözlemdir. Bir farkı anlamlı kabul etmeden önce aynı görevde her kolu üç veya dört kez çalıştırın; çünkü aynı görevde çalışan aynı aracının iki çalıştırması bile birbirinden farklı sonuçlar verebilir. Harcamayı daha uzun vadede izlemek için Claude Code harcamalarını izleyen araçlar ve Claude Code'un token sayma yöntemi, önbellek satırlarının ham sayımlara neden baskın geldiğini açıklar.

Aracın gözetimsiz çalışırken önem verdiğiniz hiçbir kaynağa erişemediğinden emin olun. VPS üzerinde Claude Code'u güvenli biçimde çalıştırma başlıklı içerikte kullanıcı hesabı ve izin flag'leri açıklanır.

Repo'nun kendi değerlendirmesini dürüstçe okumak

README başlığı şöyledir: "Fifteen eval rounds, more than 260 agent runs, blind LLM judges that verify by diffing and executing." Bu, neredeyse tüm skill repo'larının sunduğundan daha fazla kanıt içerir ve eval/RESULTS.md, başarısızlıklar saklanarak tur tur yazılmıştır. Ancak başlıktaki satır sayılarının arkasındaki tek tek hücrelere bakıldığında, veri seti başlıktaki sayıların düşündürdüğünden daha sınırlıdır.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Bu 4 satırın en büyüğü 4 çalıştırmaya dayanır. Diğer üç satırın her biri ise 2 çalıştırmaya dayanır. Repo bunu kendisi de açıkça belirtir. Günlük kaydının başındaki kalıcı sınırlamalar bölümünde şu ifade yer alır: "Small n throughout (1-4 runs per cell), LLM judges (blind where multiple outputs are compared, but built on the same frontier model that appears as a baseline), synthetic fixtures, research ground truth only as current as its run date." Daha doğrudan ifade etmek gerekirse: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark."

Bunu teslim etmek gerekir. Kendi n değerini yayımlayan ve değerlendiricisinin baseline olarak kullanılan modelle aynı model üzerine kurulduğunu belirten bir yazar, bu kategorideki genel uygulamadan daha dürüst davranmaktadır. Sayıları, yazarın testleri gerçekten çalıştırdığı ve başarısızlıkları sakladığı yönünde kanıt olarak değerlendirin. Kendi codebase'iniz hakkında bilgi veren şey, kendi A/B testinizdir.

README, yöntemin hiçbir katkı sağlamadığı durumları da aynı ölçüde açık biçimde belirtir. Bu, README'nin en yararlı paragrafıdır. Yeterli kapasiteye sahip modellerle yürütülen sıradan küçük görevlerde herhangi bir artış gözlemlenmediğini kaydeder. "the method cannot make a model's facts fresher; bare frontier wins knowledge-heavy research" ifadesini kullanır. Değerin "traps (authority conflicts, false completion claims, weak executors, unattended runs), not everywhere" durumlarında ortaya çıktığını belirtir. Agent çalışmalarınız güçlü bir model üzerinde sizin gözetiminiz altında gerçekleştirilen küçük düzenlemelerden oluşuyorsa hiçbir fark ölçememeyi bekleyin. Çalışmalar daha ucuz bir model tarafından gözetimsiz yürütülüyorsa farkın ortaya çıkması beklenen durum budur. Bu da Opus, Sonnet ve Haiku arasındaki seçimi aynı kararın bir parçası haline getirir.

Paketlemenin cargo cult yaklaşımına dönüştüğü yer

Dört eleştiri yapılabilir. Bunların hiçbiri repository'yi incelemekten vazgeçmek için gerekçe değildir.

Çerçeve, kanıtların önüne geçiyor. "How Claude Fable 5 worked" ifadesi, modelin iç işleyişi hakkında Anthropic dışındaki hiç kimsenin doğrulayamayacağı bir iddiadır. Ayrıca repository'nin kendi temel cümlesi bu iddiayı zayıflatıyor: "The quality lives in the structure, the evidence, and the honesty, not in the model." Kalite yapıda ise provenance hikâyesi yalnızca süs işlevi görür. Prosedür kendi başına yeterlidir ve bir köken anlatısına ihtiyaç duymaz.

Dört beceri, içeriğin gerektirdiğinden daha geniş bir yüzey sunuyor. fable-loop, fable-method içeriğinin büyük bölümünü orkestrasyon katmanıyla birlikte yeniden ifade ediyor. Subagent desteği olmayan bir harness üzerinde ise yeniden fable-method haline geliyor. İkisini de kurmadan önce dosyaları yan yana okuyun.

Sekiz domain adapter, eval kapsamının ötesinde bir genişlik sunuyor. Sekiz adapter'ın yalnızca ikisi log içinde herhangi bir yerde görünüyor: marketing 9. turda, devops 12. turda. finance, legal, design ve data adapter'ları herhangi bir tur olmadan yayımlanmış. Alanınıza ait adapter yine de iyi olabilir. Ancak bu, bir trap fixture üzerinde doğrulanmış bir bileşen değil, yazarın taslağıdır.

Installer ayrıca neyi yayımladığı konusunda repository ile uyuşmuyor ve dört skill'den üçünü ~/.claude/skills içine kopyalıyor. Bu küçük bir sorun. Ancak paketlemenin, kimsenin gözden geçirme hızından daha hızlı ilerlediğini gösteren türden bir boşluktur. Bu nedenle bunların ne kadarını tek seferde benimseyeceğinize karar verirken bunu göz önünde bulundurun.

Başka hiçbir şeyi korumayacaksanız korunması gerekenler

Marka unsurlarını çıkarın; hangi agent çalıştırılırsa çalıştırılsın geriye kendi başına geçerli olan dört kural kalır.

  • Yetkilendirme alıntısı. Geri döndürülemez veya dış dünyaya açık bir işlem için kullanıcının kendi ifadeleri, AUTH: satırı olarak açıkça yazılmalıdır. Alıntıyı bulamayan bir agent işlem yapmaz.
  • İkili kontrol. Bir kusur düzeltildikten sonra aynı hatalı yapının tamamını arayın ve sayı sıfır olsa bile sonucu bildirin.
  • Gözlemle doğrulama. Bozuk bir derlemenin üzerinde çalışan başarılı bir hedefli kontrol, doğrulamanın başarısız olduğu anlamına gelir; başarılı kabul edilmez.
  • Sonuç öncelikli raporlama. Atlanan veya doğrulanmadan bırakılan her şey, sessizce çıkarılmak yerine bir çekince olarak belirtilmelidir.

Bu dört kuralın uygulanması hiçbir maliyet gerektirmez ve uyumluluk grep ile denetlenebilir. Önce bunlarla başlayın, yukarıdaki harness ile ölçüm yapın; ardından deponun geri kalanının context budget içindeki payını hak edip etmediğine karar verin. Bir agente çalışma yöntemi yerine kalıcı proje bağlamı vermek isteniyorsa, agent'ların düzenleme yapmadan önce okuduğu bir DESIGN.md tamamlayıcı adımdır.

FAQ

Fable yöntemi Claude dışındaki modellerle çalışır mı?

Yöntem metni çalışır. Model özelinde kod içermez ve sıralı bir prompt'tur. Repo, Codex, Cursor, aider veya ham system prompt olarak kullanılabilmesi için taşınabilir bir kopya olan AGENTS.md dosyasını yayımlar. Ancak iki unsur başka ortamlara taşınamaz. /fable-method ve /fable-judge tetikleyicileri Claude Code slash command'larıdır. Bu nedenle başka bir ortamda yöntemi açıklayarak çağırmanız gerekir. fable-loop ise farklı modellerde paralel subagent'lar başlatabilen bir harness varsayar. Böyle bir harness yoksa işlem seri olarak yürütülür ve fable-method ek adımlarla elde edilir.

Bu skill'leri çalıştırmak daha fazla token tüketir mi?

Evet. Tüketim miktarı, skill'leri nasıl yüklediğinize bağlıdır. Skill olarak kurulduğunda içerik yalnızca açıklama görevle eşleştiğinde yüklenir. Bu nedenle ilgisiz bir istek neredeyse hiç ek maliyet oluşturmaz. Bir system prompt içine yapıştırıldığında yaklaşık 2,600 kelimelik AGENTS.md her isteğe eklenir. Yöntem düzenleme işleminden önce yönlendirme, karar vermeden önce kanıt ve işlem sonrasında gerçek bir doğrulama istediği için çalıştırma da daha fazla token tüketir. Bunu ölçün: Her iki kolda aynı görevi --output-format json ile çalıştırın ve total_cost_usd alanını karşılaştırın.

fable-method için hangi sürümü kurmalı ve neden sürümü sabitlemeliyim?

Kurulumdan önce git checkout v1.4.0 komutunu çalıştırın. Bu tag 2026-07-15 tarihine aittir ve August 2026 itibarıyla en yeni tag'dir. Repo, önceki dokuz gün içinde beş release yayımladı ve v1.4.0 yönlendirme kurallarını değiştirdi. Ölçüm sırasında main izlenirse kontrol çalıştırmanız ve test çalıştırmanız farklı talimatları okuyabilir. Bu durumda karşılaştırma geçersiz olur. Tag bilgisini sonuçlarınızla birlikte kaydedin.

Repo'daki eval güvenilebilecek bir benchmark mıdır?

Eval'i, yazarının da ifade ettiği gibi, yöntem için bir değişiklik günlüğü olarak değerlendirin: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark." Dosyanın üst kısmında sınırlamalar belirtilmiştir: hücre başına 1 ile 4 arasında çalıştırma, sentetik fixture'lar ve baseline olarak da kullanılan aynı frontier model üzerine kurulu LLM judge'ları. Turlar gerçektir ve başarısız deneyler de korunmuştur. Bu, çoğu reponun yayımladığından daha fazlasıdır. Ancak bu eval, kod tabanınızda ne olacağını ölçmez. Bu nedenle iki kollu karşılaştırmayı kendiniz çalıştırın.