SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-29

Metode Fable: Skill untuk Model Apa Pun

Pelajari isi repo fable-method, kebiasaan Claude Fable 5 yang dapat dipakai model lain, serta cara menguji perbedaan tool call dan biaya di VPS.

Klaim sebenarnya dari metode Fable

Metode Fable adalah sekumpulan kecil agent skill yang menuliskan kebiasaan kerja satu model sebagai prosedur berurutan, sehingga model lain dapat menjalankan prosedur yang sama. Repo tersebut adalah Sahir619/fable-method, berlisensi MIT, dan deskripsi satu barisnya sendiri adalah "how Claude Fable 5 worked, distilled into skills any model can run, with the eval that keeps it honest." Klaim yang layak diuji adalah bagian kedua dari kalimat tersebut.

Tidak ada pihak di luar Anthropic yang dapat memeriksa apakah sebuah file teks benar-benar menangkap cara berpikir model tertentu. Namun, Anda dapat memeriksa sendiri apakah model yang lebih murah berperilaku berbeda ketika membaca file teks tersebut, cukup dengan satu VPS dalam satu sore. Itulah tujuan pengukuran di bawah ini: menjalankan tugas yang sama dua kali, dengan dan tanpa metode tersebut, lalu menghitung tool call dan biayanya.

Jika istilah skill masih baru bagi Anda, mulai dari apa sebenarnya agent skill: folder yang berisi file SKILL.md, dengan deskripsi frontmatter yang memberi tahu agent kapan harus memuat isinya. Model yang menjadi asal nama repo tersebut dibahas dalam biaya Claude Fable 5 dan kegunaannya.

Instal skill, lalu kunci versi yang Anda uji

Ada dua metode instalasi. Di dalam Claude Code, metode plugin terdiri atas dua perintah:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Di VPS, jika Anda menginginkan salinan yang dikunci versinya di disk, lakukan clone lalu checkout tag terlebih dahulu:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh tidak memerlukan sudo karena hanya menulis di bawah $HOME/.claude/skills. Setelah selesai, ls ~/.claude/skills mencantumkan fable-judge, fable-loop, dan fable-method. Perhatikan yang tidak tercantum. Repo menyediakan empat skill, sedangkan installer shell menyalin tiga skill. Jadi, pengguna standalone tidak mendapatkan fable-domain kecuali menyalinnya secara manual:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

Kunci tag tersebut, lalu catat tag di samping hasil apa pun yang Anda dapatkan. Repo ini merilis lima versi antara 2026-07-06 dan 2026-07-15, yaitu v1.0.0 hingga v1.4.0. v1.4.0 mengubah metode itu sendiri dengan menambahkan gate routing baru. Per Agustus 2026, v1.4.0 masih merupakan tag terbaru. Jika pengujian kontrol membaca satu versi aturan, sedangkan pengujian Anda membaca versi lain, tidak ada yang dapat diukur.

Hal yang diperintahkan masing-masing dari empat skill kepada model

File utama adalah skills/fable-method/SKILL.md. File ini memuat dua gate dan tujuh langkah bernomor. Aturannya cukup spesifik untuk diperdebatkan.

Triviality gate berlaku lebih dahulu: lakukan perubahan secara langsung tanpa prosedur tambahan jika perubahan hanya menyentuh satu file, berjalan dalam sekitar 10 baris atau kurang, tidak menambahkan perilaku baru, dan Anda sudah mengetahui dengan pasti hal yang harus diubah. Satu skill terpisah dibangun hanya berdasarkan prinsip tersebut, yaitu Ponytail, yang mengarahkan agent untuk membuat perubahan sekecil mungkin tetapi tetap berfungsi, dan aturan intinya cukup singkat untuk disalin ke instruksi Anda sendiri tanpa menginstal apa pun. Berikutnya, fit gate mengarahkan permintaan berdasarkan lokasi jawabannya: sumber yang dapat Anda buka, teknik yang harus diteliti terlebih dahulu, atau inferensi Anda sendiri, yang harus ditandai sebagai berkredibilitas rendah dan bukan disajikan sebagai fakta. Cabang tengah ini hanya berfungsi jika agent benar-benar dapat mengakses web. Pada VPS yang dikunci, agent memerlukan search backend sendiri, misalnya instance SearXNG yang di-host sendiri dan diekspos sebagai JSON search tool.

Berikutnya adalah loop: klasifikasikan permintaan, tentukan kriteria selesai, kumpulkan bukti, ambil keputusan, lakukan tindakan, verifikasi, lalu laporkan. Langkah 2 menyatakan bahwa orientasi harus dimulai dengan mencantumkan direktori sebelum memilih file, mengutamakan sumber primer daripada mengandalkan ingatan, dan berhenti setelah dua lookup berturut-turut tidak menghasilkan informasi baru. Langkah 4 menyatakan bahwa Anda harus menulis baris INTENT: sebelum melakukan edit apa pun. Baris tersebut harus menyebutkan hal yang dilakukan kode, hal yang diharapkan oleh pemeriksaan yang gagal, dan isi spesifikasi. Jangan melakukan edit jika ketiga hal tersebut tidak sesuai, karena ketidaksesuaian itulah temuan yang sebenarnya. Langkah 5 membatasi percobaan ulang: setelah tiga siklus perbaikan dan verifikasi gagal untuk masalah yang sama, berhenti dan kembalikan hasilnya beserta output sebenarnya.

Bagian file yang paling mudah diuji adalah empat token laporan. Perubahan perilaku harus disertai baris INTENT:. Tindakan yang berdampak ke luar harus disertai AUTH: user said "<exact words>" dengan kutipan dari pengguna, karena repo menyatakan secara tegas bahwa dokumentasi bukan otorisasi. Tindakan yang diwajibkan tetapi tidak dilakukan harus disertai baris PENDING:. Defect yang telah diperbaiki harus disertai TWINS: searched <pattern> - found <N> other sites. Anda tidak perlu mempercayai metode tersebut untuk memeriksa apakah keempat string itu muncul saat diwajibkan. Hal inilah yang membuat seluruh metode dapat diukur, bukan sekadar berdasarkan kesan.

fable-loop adalah metode yang sama, tetapi dijalankan sebagai orkestrasi dalam empat tahap: membuat rencana dengan subagent bukti secara paralel, mengeksekusi pada thread utama, memverifikasi dengan satu hingga tiga subagent penyerang yang masing-masing menggunakan sudut pandang berbeda, lalu melakukan audit dan membuat laporan. Metode ini mengasumsikan model murah untuk peran bukti dan penyerang, serta model yang lebih kuat untuk pengambilan keputusan dan edit.

fable-judge adalah bagian yang layak diinstal meskipun bagian lainnya tidak digunakan. Prinsipnya adalah "laporan merupakan kumpulan klaim, bukan bukti." Skill ini mengumpulkan klaim dari laporan yang telah selesai, menetapkan ground truth dari git diff dan git status, menjalankan ulang setiap verifikasi yang menurut laporan telah dijalankan, lalu mencari daftar fraud yang disebutkan: pemeriksaan yang dilemahkan, penyelesaian palsu, perluasan scope, tindakan tanpa otorisasi, pengkhianatan terhadap spesifikasi, dan sisa pekerjaan yang tidak dibersihkan. Hasilnya adalah VERIFIED, VERIFIED WITH CAVEATS, atau REFUTED. Hal yang tidak dapat direproduksi ditandai sebagai UNVERIFIABLE, bukan dianggap berhasil. Baris penutup installer sendiri mengarah ke skill ini: "Coba: buka Claude Code, lalu ketik /fable-judge setelah agent mana pun mengklaim pekerjaannya selesai." Jika Anda lebih memilih memasukkan pemeriksaan tersebut ke dalam proses kerja daripada menjalankannya setelah pekerjaan selesai, skill Old Coder meminta agent menghasilkan SPEC yang Anda setujui dan laporan EVIDENCE yang dapat Anda jalankan ulang sendiri, dengan mutation testing sebagai pengganti coverage untuk membuktikan bahwa sebuah test benar-benar akan mendeteksi regresi.

fable-domain menghasilkan bundle adapter domain dengan trap fixture dan smoke eval. Delapan adapter disertakan: marketing, research, data analysis, business and ops, finance, legal and compliance, design and UX, serta devops. Pekerjaan medis dan klinis sengaja tidak diberi adapter.

Bagian mana yang dapat di-port ke model lain, dan mana yang tidak

Repo menjawab ini secara langsung melalui AGENTS.md, yang dibuka dengan: "Versi portabel untuk coding agent atau harness apa pun (Codex, Cursor, aider, raw system prompt). Metodenya identik dengan SKILL.md; tempelkan file ini ke instruksi agent Anda atau letakkan di root repo sebagai AGENTS.md." Isinya sekitar 2,600 kata dan memuat gate, langkah, serta mode yang sama. Jika Anda sudah menyimpan file instruksi di root repo, konvensi AGENTS.md dan HUMAN.md menjelaskan lokasi file tersebut dan pihak yang membacanya.

Dua bagian dapat di-port dengan mudah. Teks metode ini adalah prompt berurutan yang tidak berisi kode khusus model, sehingga model apa pun yang mengikuti instruksi dapat menjalankannya. Tesis repo juga menyatakan bahwa upaya yang diperlukan berbanding terbalik dengan tier model. Judge juga dapat di-port, selama agent memiliki shell dan repository, karena semua tindakannya adalah git diff ditambah menjalankan kembali perintah yang juga dapat dijalankan pembaca.

Satu bagian tidak dapat di-port dengan mudah. fable-loop mengasumsikan harness dapat menjalankan subagent secara paralel dan mengarahkannya ke model yang berbeda. Agent tanpa subagent menjalankan tahap-tahap tersebut secara serial pada satu model. Akibatnya, paralelisme dan penghematan biaya yang menjadi alasan desain ini hilang. Yang tersisa adalah fable-method dengan kosakata tambahan.

Dua hal kecil lainnya bersifat khusus untuk harness dan mudah terlewatkan. Pemicu /fable-method adalah slash command Claude Code, sehingga pada harness lain Anda menjalankan metode ini dengan mendeskripsikannya. Deskripsi frontmatter SKILL.md memungkinkan agent memuat isi hanya saat cocok dengan tugas. Artinya, skill yang terpasang hampir tidak menimbulkan biaya sampai dijalankan. Jika AGENTS.md ditempelkan ke system prompt, 2,600 kata tersebut akan ada dalam setiap request yang Anda kirim, baik tugasnya hanya memperbaiki typo satu baris maupun melakukan refactor. Ini adalah perbedaan biaya yang nyata dan merupakan sebagian besar alasan packaging skill dibuat.

Cara melakukan A/B pada VPS: tugas yang sama, dua kali

Siapkan dua salinan kerja yang identik agar tidak ada proses yang dapat melihat perubahan dari proses lainnya. Ganti YOUR_ORG/YOUR_REPO dengan repositori yang ingin Anda uji; kedua clone harus berasal dari commit yang sama.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Pilih tugas dengan hasil yang dapat diamati tanpa penilaian subjektif: pengujian yang gagal dan harus berhasil, atau skrip yang harus keluar dengan kode 0. Tugas yang tidak jelas menghasilkan perbandingan yang tidak jelas karena Anda akhirnya menilai teks, bukan hasil.

Jalankan kelompok kontrol dengan --bare. Opsi ini melewati auto-discovery hook, skill, plugin, dan CLAUDE.md. Opsi tersebut menjadikannya kontrol: skill yang sebelumnya Anda instal tidak dapat ikut digunakan. Bare mode tidak menggunakan login subscription Anda, jadi tetapkan API key dari Claude Console terlebih dahulu.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Kelompok metode menggunakan command yang sama dengan satu opsi tambahan. Opsi ini memuat metode portabel sebagai tambahan system prompt:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Binary, model, tool, dan pohon awalnya sama. Hanya satu opsi yang berbeda. Ini adalah satu-satunya cara agar perbandingan tersebut bermakna.

Rancangan ini mengukur teks metode. Rancangan ini tidak mengukur packaging skill, karena itu merupakan pertanyaan terpisah. Untuk mengukur packaging, hapus --bare, instal skill seperti di atas, lalu masukkan nama skill ke dalam string prompt karena skill yang dipanggil pengguna diperluas dalam print mode: claude -p "/fable-method $task". Perkirakan profil biaya yang berbeda dari arm system prompt meskipun perilaku yang terlihat sama.

Menghitung langkah dan biaya

Kedua eksekusi menulis aliran event JSON. Baris terakhir adalah pesan result yang memuat teks akhir, biaya, dan metadata sesi. Cetak baris ini satu kali dan baca isinya sebelum membuat skrip yang bergantung padanya, karena nama field dapat berubah antar-rilis Claude Code.

tail -1 ~/ab/control.jsonl | jq .

Biaya per eksekusi berasal dari baris tersebut. Nilai inilah yang harus dibandingkan:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Jumlah langkah berasal dari penghitungan pemanggilan tool dalam file yang sama:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Jalankan perintah tersebut untuk kedua file. Pola perbedaannya lebih bermakna daripada totalnya. Eksekusi metode yang membaca lebih banyak file dan melakukan lebih sedikit pengeditan berarti metode tersebut menjalankan sesuai tujuannya. Itulah trade-off yang Anda beli. Jika eksekusi metode menghasilkan pengeditan yang sama dengan biaya 40 persen lebih tinggi, Anda tidak mendapatkan manfaat apa pun dari tugas tersebut.

Perhatikan dua hal terkait angka-angka ini. Pertama, jangan menjumlahkan output_tokens dari transkrip sesi di bawah ~/.claude/projects/ lalu menganggapnya sebagai total. Blok penggunaan per pesan tersebut adalah snapshot yang diambil selama streaming, dan terdapat laporan bahwa nilainya bisa lebih rendah dari jumlah sebenarnya. Baris result adalah angka yang harus dipercaya. Kedua, satu eksekusi untuk setiap kelompok hanya merupakan anekdot. Jalankan setiap kelompok tiga atau empat kali pada tugas yang sama sebelum menyimpulkan adanya perbedaan, karena dua eksekusi agent yang sama pada tugas yang sama pun dapat menghasilkan hasil berbeda. Untuk gambaran pengeluaran dalam jangka lebih panjang, tool untuk melacak pengeluaran Claude Code dan cara Claude Code menghitung token menjelaskan alasan baris cache mendominasi penghitungan mentah.

Pastikan agent tidak dapat mengakses apa pun yang penting bagi Anda saat berjalan tanpa pengawasan. menjalankan Claude Code dengan aman pada VPS membahas akun pengguna dan flag izin.

Evaluasi dari repositori itu sendiri, dibaca secara jujur

Judul utama README adalah "Fifteen eval rounds, more than 260 agent runs, blind LLM judges that verify by diffing and executing." Itu merupakan bukti yang lebih banyak daripada yang disediakan hampir semua repositori skill, dan eval/RESULTS.md ditulis putaran demi putaran dengan kegagalan yang tetap dicantumkan. Namun, isinya lebih terbatas daripada yang tersirat dalam angka utama tersebut setelah Anda melihat sel individual di balik baris-baris utama itu.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Baris terbesar dari 4 baris tersebut didasarkan pada 4 run. Tiga baris lainnya masing-masing didasarkan pada 2 run. Repositori itu sendiri menyatakan hal tersebut dalam keterbatasan yang selalu ditampilkan di bagian atas log: "Small n throughout (1-4 runs per cell), LLM judges (blind where multiple outputs are compared, but built on the same frontier model that appears as a baseline), synthetic fixtures, research ground truth only as current as its run date." Pernyataan berikutnya bahkan lebih langsung: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark."

Hal itu patut diapresiasi. Penulis yang memublikasikan nilai n mereka sendiri dan menyebutkan masalah bahwa judge mereka dibangun di atas model yang sama dengan model yang digunakan sebagai baseline menunjukkan kejujuran yang lebih tinggi daripada standar umum dalam kategori ini. Baca angka-angka tersebut sebagai bukti bahwa penulis benar-benar menjalankan pengujian dan menyimpan kegagalannya. A/B Anda sendirilah yang memberi tahu Anda tentang codebase Anda.

README tersebut juga menjelaskan dengan tegas bagian yang tidak dipengaruhi metode ini, dan itulah paragrafnya yang paling berguna. README mencatat tidak ada peningkatan untuk task kecil biasa pada model yang mumpuni. README menyatakan bahwa "the method cannot make a model's facts fresher; bare frontier wins knowledge-heavy research". README juga menempatkan nilai metode ini pada "traps (authority conflicts, false completion claims, weak executors, unattended runs), not everywhere". Jika pekerjaan agent Anda hanya berupa pengeditan kecil pada model yang kuat dan Anda mengawasinya, jangan berharap dapat mengukur peningkatan apa pun. Jika pekerjaan tersebut dijalankan tanpa pengawasan oleh model yang lebih murah, di situlah perbedaan seharusnya terlihat. Hal itu juga menjadikan pilihan antara Opus, Sonnet, dan Haiku bagian dari keputusan yang sama.

Ketika packaging menjadi cargo cult

Empat kritik layak disampaikan, dan tidak satu pun menjadi alasan untuk melewati repo ini.

Kerangka penjelasannya melampaui bukti. “Cara kerja Claude Fable 5” adalah klaim tentang internal model yang tidak dapat diverifikasi oleh siapa pun di luar Anthropic, dan kalimat utama repo ini sendiri melemahkan klaim tersebut: “Kualitas terletak pada struktur, bukti, dan kejujuran, bukan pada model.” Jika kualitas terletak pada struktur, cerita tentang asal-usulnya hanya hiasan. Prosedurnya dapat berdiri sendiri dan tidak memerlukan mitos asal-usul.

Empat skill lebih banyak pada permukaan daripada yang diperlukan oleh isinya. fable-loop mengulang sebagian besar isi fable-method dengan orkestrasi yang ditambahkan di sekitarnya, dan pada harness tanpa subagent, isinya kembali menjadi fable-method. Baca kedua file tersebut berdampingan sebelum menginstal keduanya.

Delapan adapter domain menunjukkan cakupan yang tidak diuji oleh evaluasi. Hanya dua dari delapan adapter yang muncul di log: marketing pada putaran 9 dan devops pada putaran 12. Adapter finance, legal, design, dan data disertakan tanpa satu pun putaran yang mendukungnya. Adapter untuk bidang Anda mungkin tetap bagus. Namun, adapter tersebut masih berupa draf penulis, bukan sesuatu yang telah bertahan melalui fixture pengujian jebakan.

Installer juga tidak sejalan dengan repo mengenai apa yang disertakannya. Installer menyalin tiga dari empat skill ke ~/.claude/skills. Masalah ini kecil. Namun, celah seperti ini menunjukkan bahwa packaging bergerak lebih cepat daripada proses peninjauan. Hal itu perlu diingat saat Anda menentukan seberapa banyak komponen ini akan diadopsi sekaligus.

Yang perlu dipertahankan jika tidak ada hal lain

Hapus branding, dan empat aturan tetap berlaku sendiri, apa pun agent yang Anda jalankan.

  • Kutipan otorisasi. Tindakan yang tidak dapat dibatalkan atau berdampak ke luar memerlukan kata-kata pengguna sendiri, ditulis sebagai baris AUTH:. Agent yang tidak dapat menemukan kutipan tidak boleh bertindak.
  • Pemeriksaan kembar. Setelah memperbaiki cacat, cari seluruh project untuk menemukan konstruksi salah yang sama dan laporkan jumlahnya, termasuk jika jumlahnya nol.
  • Verifikasi melalui observasi. Pemeriksaan terarah yang berhasil, tetapi dijalankan di atas build yang rusak, merupakan verifikasi yang gagal, bukan lulus.
  • Pelaporan yang mengutamakan hasil, dengan menyatakan hal yang dilewati atau belum diverifikasi sebagai caveat, bukan menghapusnya secara diam-diam.

Keempat aturan tersebut tidak memerlukan biaya untuk diterapkan, dan Anda dapat menggunakan grep untuk memeriksa kepatuhannya. Mulailah dari sana, ukur dengan harness di atas, lalu tentukan apakah bagian repo lainnya layak menggunakan sebagian context budget Anda. Jika Anda ingin memberikan context project permanen kepada agent, bukan metode kerja, DESIGN.md yang dibaca agent sebelum melakukan perubahan adalah langkah pelengkapnya.

FAQ

Apakah metode Fable dapat digunakan dengan model selain Claude?

Teks metodenya dapat digunakan. Metode ini berupa prompt berurutan tanpa kode khusus model, dan repo menyediakan AGENTS.md sebagai salinan portabel untuk Codex, Cursor, aider, atau system prompt mentah. Ada dua hal yang tidak dapat dipindahkan. Trigger /fable-method dan /fable-judge adalah slash command Claude Code, sehingga pada lingkungan lain Anda menjalankan metode ini dengan mendeskripsikannya. Selain itu, fable-loop mengasumsikan adanya harness yang dapat menjalankan subagent secara paralel pada model yang berbeda. Tanpa harness tersebut, proses berjalan secara serial dan menghasilkan fable-method dengan langkah tambahan.

Apakah menjalankan skill ini membutuhkan lebih banyak token?

Ya. Jumlahnya bergantung pada cara Anda memuatnya. Jika diinstal sebagai skill, isi skill hanya dimuat ketika deskripsinya cocok dengan tugas, sehingga permintaan yang tidak terkait hampir tidak menambah biaya. Jika ditempelkan ke system prompt, sekitar 2,600 kata dari AGENTS.md ikut dikirim pada setiap permintaan. Proses eksekusinya juga membutuhkan lebih banyak biaya karena metode ini meminta orientasi sebelum pengeditan, bukti sebelum pengambilan keputusan, dan verifikasi nyata setelahnya. Ukur sendiri: jalankan tugas yang sama dengan --output-format json pada kedua sisi perbandingan, lalu bandingkan kolom total_cost_usd.

Versi fable-method mana yang harus saya instal, dan mengapa harus mengunci versinya?

Jalankan git checkout v1.4.0 sebelum melakukan instalasi. Tag tersebut bertanggal 2026-07-15 dan masih merupakan versi terbaru pada Agustus 2026. Repo menerbitkan lima rilis dalam sembilan hari sebelumnya, dan v1.4.0 mengubah aturan routing itu sendiri. Jika Anda mengikuti main selama pengukuran, proses kontrol dan proses pengujian dapat membaca instruksi yang berbeda, sehingga perbandingannya tidak valid. Catat tag tersebut bersama hasil Anda.

Apakah eval di repo merupakan benchmark yang dapat dipercaya?

Anggap eval tersebut sebagai log perubahan untuk metode ini, sesuai sebutan pembuatnya: "Log ini dibuat agar perubahan metode diuji, bukan agar siapa pun menganggapnya sebagai benchmark." Keterbatasannya dicantumkan di bagian atas file: 1 hingga 4 proses per sel, fixture sintetis, dan juri LLM yang dibangun di atas model frontier yang sama dengan model yang juga digunakan sebagai baseline. Putaran pengujiannya nyata dan eksperimen yang gagal tetap disertakan. Hal ini lebih baik daripada yang dipublikasikan oleh sebagian besar repo. Namun, eval tersebut tetap bukan pengukuran atas apa yang akan terjadi pada codebase Anda. Karena itu, jalankan sendiri perbandingan dua sisi tersebut.