SSD Nodes Learn 🎉 VPS mulai $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-13

Metode Fable: Skill Agen untuk Model Apa Pun

Pelajari isi repo fable-method, kebiasaan Claude Fable 5 yang dapat dipakai model lain, serta cara menguji A/B panggilan tool dan biaya di satu VPS.

Klaim sebenarnya dari metode Fable

Metode Fable adalah sekumpulan kecil skill agen yang menuliskan kebiasaan kerja satu model sebagai prosedur berurutan, sehingga model lain dapat menjalankan prosedur yang sama. Repo tersebut adalah Sahir619/fable-method, berlisensi MIT, dan deskripsi satu barisnya adalah "cara kerja Claude Fable 5, diringkas menjadi skill yang dapat dijalankan model apa pun, dengan evaluasi yang menjaganya tetap akurat." Klaim yang perlu diuji adalah bagian kedua dari kalimat tersebut.

Tidak ada pihak di luar Anthropic yang dapat memeriksa apakah sebuah file teks benar-benar merekam cara berpikir model tertentu. Namun, Anda dapat memeriksa sendiri apakah model yang lebih murah berperilaku berbeda saat membaca file teks tersebut, menggunakan satu VPS dalam satu sore. Itulah tujuan pengukuran di bawah ini: menjalankan tugas yang sama dua kali, dengan dan tanpa metode tersebut, lalu menghitung panggilan tool dan biayanya.

Jika istilah skill masih baru bagi Anda, mulai dari apa sebenarnya skill agen: folder yang berisi file SKILL.md dengan deskripsi frontmatter yang memberi tahu agen kapan harus memuat isinya. Model yang menjadi asal nama repo tersebut dibahas dalam biaya Claude Fable 5 dan kegunaannya.

Instal skill dan tetapkan versinya

Ada dua metode instalasi. Di dalam Claude Code, metode plugin menggunakan dua perintah:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Di VPS, jika Anda ingin salinan yang versinya ditetapkan pada disk, lakukan clone lalu checkout tag terlebih dahulu:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh tidak memerlukan sudo karena hanya menulis di bawah $HOME/.claude/skills. Setelah perintah tersebut selesai, ls ~/.claude/skills menampilkan fable-judge, fable-loop, dan fable-method. Perhatikan hal yang tidak tercantum. Repo ini menyediakan empat skill, sedangkan shell installer menyalin tiga skill. Karena itu, pengguna mandiri tidak memperoleh fable-domain kecuali menyalinnya secara manual:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

Tetapkan tag tersebut, lalu catat tag itu di samping hasil apa pun yang Anda dapatkan. Repo ini menerbitkan lima rilis antara 2026-07-06 dan 2026-07-15, yaitu v1.0.0 hingga v1.4.0. v1.4.0 mengubah metode itu sendiri dengan menambahkan routing gate baru. Per Agustus 2026, v1.4.0 masih merupakan tag terbaru. Jika control run membaca satu versi aturan, sedangkan test run membaca versi lain, pengukuran Anda tidak valid.

Hal yang diperintahkan masing-masing dari empat skill kepada model

File yang menjadi dasar utama adalah skills/fable-method/SKILL.md. File ini memuat dua gerbang dan tujuh langkah bernomor. Aturannya cukup spesifik untuk diperdebatkan.

Gerbang trivialitas diperiksa terlebih dahulu. Bertindaklah langsung tanpa basa-basi jika perubahan hanya menyentuh satu file, memerlukan sekitar 10 baris atau kurang, tidak menambahkan perilaku baru, dan Anda sudah mengetahui secara pasti hal yang harus diubah. Satu skill terpisah sepenuhnya dibangun berdasarkan naluri tersebut, Ponytail, yang mengarahkan agen untuk menerapkan perubahan sekecil mungkin yang tetap berfungsi, dan aturan intinya cukup singkat untuk disalin ke instruksi Anda sendiri tanpa memasang apa pun. Berikutnya adalah gerbang kecocokan. Gerbang ini mengarahkan permintaan berdasarkan lokasi jawabannya: sumber yang dapat Anda buka, teknik yang harus diteliti terlebih dahulu, atau inferensi Anda sendiri, yang harus ditandai sebagai berkeyakinan rendah dan bukan disajikan sebagai fakta. Cabang tengah ini hanya berfungsi jika agen benar-benar dapat mengakses web. Pada VPS yang dikunci, hal ini berarti agen harus diberi backend pencarian sendiri, misalnya instans SearXNG yang di-host sendiri dan diekspos sebagai alat pencarian JSON.

Berikutnya adalah loop: klasifikasikan permintaan, tentukan kriteria selesai, kumpulkan bukti, ambil keputusan, bertindak, verifikasi, lalu laporkan. Langkah 2 menyatakan bahwa Anda harus memahami konteks dengan mencantumkan isi direktori sebelum memilih file, mengutamakan sumber primer daripada ingatan, dan berhenti setelah dua pencarian berturut-turut tidak menghasilkan hal baru. Langkah 4 menyatakan bahwa sebelum melakukan pengeditan apa pun, tulis baris INTENT: yang menjelaskan hal yang dilakukan kode, hal yang diharapkan oleh pemeriksaan yang gagal, dan hal yang dinyatakan oleh spesifikasi. Jangan melakukan pengeditan jika ketiga hal tersebut tidak selaras, karena ketidakselarasan itu merupakan temuan sebenarnya. Langkah 5 membatasi percobaan ulang: setelah tiga siklus perbaikan dan verifikasi yang gagal pada masalah yang sama, berhenti dan kembalikan hasilnya dengan output aktual.

Bagian file yang paling mudah diuji adalah empat token laporannya. Perubahan perilaku harus menyertakan baris INTENT:. Tindakan yang berdampak ke luar harus menyertakan AUTH: user said "<exact words>" dan mengutip pengguna, karena repositori menyatakan dengan jelas bahwa dokumentasi bukanlah otorisasi. Tindakan yang diwajibkan tetapi tidak dilakukan harus menyertakan baris PENDING:. Defect yang diperbaiki harus menyertakan TWINS: searched <pattern> - found <N> other sites. Anda tidak perlu memercayai aspek apa pun dari metode ini untuk memeriksa apakah keempat string tersebut muncul saat memang diwajibkan. Hal inilah yang membuat seluruh metode dapat diukur, bukan sekadar berdasarkan kesan.

fable-loop menjalankan metode yang sama sebagai orkestrasi dalam empat tahap: merencanakan dengan subagen bukti yang berjalan secara paralel, mengeksekusi pada thread utama, memverifikasi dengan satu hingga tiga subagen penyerang yang masing-masing menggunakan sudut pandang berbeda, lalu mengaudit dan melaporkan. Metode ini mengasumsikan penggunaan model murah untuk peran bukti dan penyerang, serta model yang lebih kuat untuk pengambilan keputusan dan pengeditan.

fable-judge adalah bagian yang layak dipasang meskipun bagian lainnya tidak digunakan. Prinsipnya adalah bahwa "laporan merupakan kumpulan klaim, bukan bukti." Skill ini mengumpulkan klaim dari laporan yang telah selesai, menetapkan kebenaran dasar dari git diff dan git status, menjalankan ulang setiap verifikasi yang menurut laporan telah dijalankan, lalu mencari daftar penipuan yang telah ditentukan: pemeriksaan yang dilemahkan, penyelesaian palsu, perluasan cakupan, tindakan tanpa otorisasi, pengkhianatan spesifikasi, dan sisa pekerjaan. Skill ini mengembalikan VERIFIED, VERIFIED WITH CAVEATS, atau REFUTED, dan menandai hal yang tidak dapat direproduksi sebagai UNVERIFIABLE, bukan menganggapnya berhasil. Baris penutup installer sendiri mengarah ke skill ini: "Cobalah: buka Claude Code dan ketik /fable-judge setelah agen mana pun mengklaim bahwa pekerjaannya telah selesai."

fable-domain menghasilkan bundel adapter domain dengan fixture jebakan dan evaluasi smoke. Delapan adapter disertakan: pemasaran, riset, analisis data, bisnis dan operasi, keuangan, hukum dan kepatuhan, desain dan UX, serta devops. Pekerjaan medis dan klinis sengaja tidak memiliki adapter.

Bagian mana yang dapat di-port ke model lain, dan mana yang tidak

Repositori menjawabnya secara langsung melalui AGENTS.md, yang dibuka dengan: "Versi portabel untuk coding agent atau harness apa pun (Codex, Cursor, aider, system prompt mentah). Metodenya identik dengan SKILL.md; tempelkan file ini ke instruksi agent Anda atau letakkan di root repositori sebagai AGENTS.md." Isinya sekitar 2,600 kata dan memuat gate, langkah, serta mode yang sama. Jika Anda sudah menyimpan file instruksi di root repositori, konvensi AGENTS.md dan HUMAN.md menjelaskan lokasi file tersebut dan pihak yang membacanya.

Dua bagian dapat di-port dengan baik. Teks metode adalah prompt berurutan tanpa kode khusus model, sehingga model apa pun yang mengikuti instruksi dapat menjalankannya. Tesis yang dinyatakan repositori juga menyebutkan bahwa upaya yang diperlukan berbanding terbalik dengan tingkat model. Judge juga dapat di-port, selama agent memiliki shell dan repositori, karena semua yang dilakukannya adalah git diff ditambah menjalankan kembali perintah yang juga dapat dijalankan pembaca.

Satu bagian tidak dapat di-port dengan baik. fable-loop mengasumsikan harness dapat menjalankan subagent secara paralel dan mengarahkannya ke model yang berbeda. Agent tanpa subagent menjalankan tahap-tahap tersebut secara serial pada satu model. Akibatnya, paralelisme dan penghematan biaya yang menjadi alasan perancangan ini hilang. Yang tersisa adalah fable-method dengan kosakata tambahan.

Dua hal lain bergantung pada harness dan mudah terlewat. Pemicu /fable-method adalah perintah slash Claude Code. Pada harness lain, Anda menjalankan metode tersebut dengan mendeskripsikannya. Selain itu, deskripsi frontmatter SKILL.md memungkinkan agent memuat isi hanya jika sesuai dengan tugas. Dengan demikian, skill yang terpasang hampir tidak menimbulkan biaya sampai dipicu. Jika Anda menempelkan AGENTS.md ke dalam system prompt, 2,600 kata tersebut akan ada dalam setiap request yang Anda kirim, baik untuk perbaikan typo satu baris maupun refactor. Ini adalah perbedaan biaya yang nyata dan merupakan alasan utama packaging skill ini dibuat.

Cara melakukan A/B pada VPS: tugas yang sama, dua kali

Siapkan dua salinan kerja yang identik agar tidak ada eksekusi yang dapat melihat perubahan dari eksekusi lainnya. Ganti YOUR_ORG/YOUR_REPO dengan repository yang ingin Anda uji; kedua clone harus berasal dari commit yang sama.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Pilih tugas dengan hasil yang dapat diamati secara objektif: pengujian yang gagal dan harus berhasil, atau skrip yang harus keluar dengan kode 0. Tugas yang tidak jelas menghasilkan perbandingan yang tidak jelas, karena Anda akhirnya menilai teks, bukan hasil.

Jalankan arm kontrol dengan --bare. Opsi ini melewati penemuan otomatis terhadap hooks, skills, plugin, dan CLAUDE.md. Opsi tersebut menjadikannya kontrol: skills yang Anda instal sebelumnya tidak dapat ikut digunakan. Bare mode tidak menggunakan login subscription Anda, jadi tetapkan API key dari Claude Console terlebih dahulu.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Arm metode menggunakan perintah yang sama dengan tambahan satu opsi. Opsi tersebut memuat metode portabel sebagai tambahan system prompt:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Binary, model, tools, dan pohon awalnya sama. Hanya satu opsi yang berbeda. Dengan demikian, perbandingan dapat diinterpretasikan dengan benar.

Desain ini mengukur teks metode. Desain ini tidak mengukur packaging skill, yang merupakan pertanyaan terpisah. Untuk mengukur packaging, hapus --bare, instal skills seperti di atas, lalu masukkan nama skill ke dalam string prompt karena skills yang dipanggil pengguna diperluas dalam print mode: claude -p "/fable-method $task". Perkirakan profil biaya yang berbeda dari arm system prompt, meskipun perilaku yang terlihat tampak sama.

Menghitung langkah dan biaya

Kedua proses menulis aliran event JSON. Baris terakhir adalah pesan result yang memuat teks akhir, biaya, dan metadata sesi. Cetak baris ini satu kali dan baca isinya sebelum membuat skrip yang bergantung padanya, karena nama field dapat berubah antar-rilis Claude Code.

tail -1 ~/ab/control.jsonl | jq .

Biaya setiap proses berasal dari baris tersebut. Itulah angka yang harus dibandingkan:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Jumlah langkah diperoleh dengan menghitung pemanggilan tool dalam file yang sama:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Jalankan perintah tersebut untuk kedua file. Pola perbedaannya lebih bermakna daripada totalnya. Proses dengan suatu metode yang membaca lebih banyak file dan melakukan lebih sedikit pengeditan berarti metode tersebut bekerja sesuai tujuannya, dan itulah kompromi yang Anda pilih. Jika proses dengan suatu metode melakukan pengeditan yang sama tetapi biayanya 40 persen lebih tinggi, berarti tidak ada manfaat yang diperoleh untuk tugas tersebut.

Perhatikan dua hal terkait angka-angka ini. Pertama, jangan menjumlahkan output_tokens dari transkrip sesi di bawah ~/.claude/projects/ lalu menganggapnya sebagai total. Blok penggunaan per pesan tersebut adalah snapshot yang diambil selama proses streaming, dan sudah ada laporan bahwa nilainya dapat lebih rendah dari penggunaan sebenarnya. Baris result adalah angka yang harus dipercaya. Kedua, satu proses untuk setiap metode hanya merupakan anekdot. Jalankan setiap metode tiga atau empat kali pada tugas yang sama sebelum menyimpulkan adanya perbedaan, karena dua proses dari agent yang sama pada tugas yang sama saja sudah dapat menghasilkan hasil yang berbeda. Untuk melihat pengeluaran dalam jangka panjang, tool untuk melacak pengeluaran Claude Code dan cara Claude Code menghitung token menjelaskan alasan baris cache mendominasi hitungan mentah.

Pastikan agent tidak dapat mengakses apa pun yang penting bagi Anda saat berjalan tanpa pengawasan. menjalankan Claude Code dengan aman di VPS membahas akun pengguna dan flag permission.

Evaluasi dari repo sendiri, dibaca secara jujur

Judul utama README berbunyi, "Fifteen eval rounds, more than 260 agent runs, blind LLM judges that verify by diffing and executing." Ini merupakan bukti yang lebih kuat daripada yang disediakan hampir semua repo skill, dan eval/RESULTS.md ditulis putaran demi putaran dengan kegagalan yang tetap dicantumkan. Namun, hasilnya lebih tipis daripada kesan yang ditimbulkan angka pada judul setelah Anda melihat setiap sel di balik baris-baris judul tersebut.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Baris terbesar dari 4 baris tersebut hanya didasarkan pada 4 run. Tiga baris lainnya masing-masing didasarkan pada 2 run. Repo itu sendiri menyatakan hal tersebut dalam batasan yang selalu tercantum di bagian atas log: "Small n throughout (1-4 runs per cell), LLM judges (blind where multiple outputs are compared, but built on the same frontier model that appears as a baseline), synthetic fixtures, research ground truth only as current as its run date." Pernyataan berikut lebih langsung: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark."

Hal ini patut diapresiasi. Penulis yang memublikasikan n mereka sendiri dan menyebutkan masalah bahwa juri mereka dibangun di atas model yang sama dengan model yang digunakan sebagai baseline bersikap lebih jujur daripada kebanyakan pihak dalam kategori ini. Baca angka-angka tersebut sebagai bukti bahwa penulis benar-benar menjalankan pengujian dan menyimpan kegagalannya. A/B Anda sendiri yang akan memberi tahu Anda tentang codebase Anda.

README tersebut juga menjelaskan dengan tegas kondisi saat metode ini tidak memberikan manfaat, dan itulah paragraf yang paling berguna. README mencatat tidak adanya peningkatan untuk tugas kecil biasa pada model yang mumpuni. README menyatakan bahwa "the method cannot make a model's facts fresher; bare frontier wins knowledge-heavy research". README juga menempatkan manfaatnya pada "traps (authority conflicts, false completion claims, weak executors, unattended runs), not everywhere". Jika pekerjaan agent Anda hanya berupa pengeditan kecil pada model yang kuat dan Anda mengawasinya, jangan berharap dapat mengukur hasil apa pun. Jika pekerjaan tersebut dijalankan tanpa pengawasan oleh model yang lebih murah, di situlah perbedaan seharusnya terlihat. Hal ini juga menjadikan pilihan antara Opus, Sonnet, dan Haiku sebagai bagian dari keputusan yang sama.

Saat pengemasan menjadi cargo cult

Ada empat kritik yang perlu disampaikan, dan tidak satu pun menjadi alasan untuk melewatkan repo ini.

Pembingkaiannya melampaui bukti. "Cara kerja Claude Fable 5" adalah klaim tentang internal model yang tidak dapat diverifikasi oleh siapa pun di luar Anthropic, dan kalimat inti repo sendiri melemahkan klaim itu: "Kualitas terletak pada struktur, bukti, dan kejujuran, bukan pada model." Jika kualitas terletak pada struktur, cerita tentang asal-usulnya hanyalah hiasan. Prosedurnya sudah dapat berdiri sendiri dan tidak memerlukan mitos asal-usul.

Empat skill lebih banyak pada permukaan daripada yang diperlukan oleh isinya. fable-loop mengulangi sebagian besar isi fable-method dengan pembungkus orkestrasi, dan pada harness tanpa subagent, isinya kembali menjadi fable-method. Baca kedua file tersebut berdampingan sebelum memasang keduanya.

Delapan adapter domain memberikan cakupan yang tidak diuji oleh evaluasi. Hanya dua dari delapan yang muncul di log: marketing pada putaran 9 dan devops pada putaran 12. Adapter finance, legal, design, dan data disertakan tanpa satu pun putaran yang mendukungnya. Adapter untuk bidang Anda mungkin tetap bagus. Namun, itu adalah draf penulis, bukan sesuatu yang telah bertahan melalui fixture pengujian jebakan.

Installer juga tidak sependapat dengan repo tentang apa yang disertakannya, karena hanya menyalin tiga dari empat skill ke ~/.claude/skills. Masalah ini kecil. Namun, kesenjangan seperti ini menunjukkan bahwa pengemasan bergerak lebih cepat daripada proses peninjauan, dan hal itu perlu diingat ketika menentukan seberapa banyak komponen ini akan diadopsi sekaligus.

Hal yang harus dipertahankan jika tidak ada hal lain yang dipertahankan

Hapus branding-nya, dan empat aturan berikut tetap berlaku sendiri, apa pun agent yang Anda jalankan.

  • Kutipan otorisasi. Tindakan yang tidak dapat dibatalkan atau berdampak ke luar memerlukan kata-kata pengguna sendiri, yang ditulis sebagai baris AUTH:. Agent yang tidak dapat menemukan kutipan tidak boleh bertindak.
  • Pemeriksaan kembar. Setelah memperbaiki defect, telusuri seluruh project untuk mencari konstruksi salah yang sama dan laporkan jumlahnya, termasuk jika jumlahnya nol.
  • Verifikasi melalui observasi. Pemeriksaan terarah yang berhasil, tetapi dijalankan di atas build yang rusak, merupakan verifikasi yang gagal, bukan keberhasilan.
  • Pelaporan yang mengutamakan hasil. Nyatakan hal yang dilewati atau belum diverifikasi sebagai caveat, bukan menghilangkannya secara diam-diam.

Keempat aturan tersebut tidak memerlukan biaya untuk diterapkan, dan kepatuhannya dapat diperiksa dengan grep. Mulailah dari sana, ukur dengan harness di atas, lalu putuskan apakah bagian lain dari repo layak menggunakan sebagian context budget Anda. Jika Anda ingin memberikan context project yang tetap kepada agent, bukan metode kerja, DESIGN.md yang dibaca agent sebelum melakukan pengeditan adalah langkah pelengkapnya.

FAQ

Apakah metode Fable berfungsi dengan model selain Claude?

Teks metodenya berfungsi. Metode ini adalah prompt berurutan tanpa kode khusus model, dan repo menyediakan AGENTS.md sebagai salinan portabel untuk Codex, Cursor, aider, atau system prompt mentah. Ada dua hal yang tidak dapat dipindahkan. Pemicu /fable-method dan /fable-judge adalah slash command Claude Code, jadi di tempat lain Anda menjalankan metode ini dengan mendeskripsikannya. Selain itu, fable-loop mengasumsikan harness yang dapat menjalankan subagent secara paralel pada model yang berbeda. Tanpa kemampuan tersebut, proses berjalan secara serial dan menghasilkan fable-method dengan langkah tambahan.

Apakah menjalankan skill ini memerlukan lebih banyak token?

Ya, dan jumlahnya bergantung pada cara Anda memuatnya. Jika diinstal sebagai skill, isi skill hanya dimuat saat deskripsinya sesuai dengan tugas, sehingga permintaan yang tidak terkait hampir tidak menambah biaya. Jika ditempelkan ke system prompt, sekitar 2,600 kata AGENTS.md ikut dikirim pada setiap permintaan. Proses eksekusinya juga memerlukan biaya lebih besar karena metode ini meminta orientasi sebelum pengeditan, bukti sebelum pengambilan keputusan, dan verifikasi nyata setelahnya. Ukur sendiri: jalankan tugas yang sama dengan --output-format json pada kedua sisi, lalu bandingkan kolom total_cost_usd.

Versi fable-method mana yang harus saya instal, dan mengapa harus mengunci versinya?

Jalankan git checkout v1.4.0 sebelum menginstalnya. Tag tersebut bertanggal 2026-07-15 dan masih merupakan versi terbaru hingga Agustus 2026. Repo menerbitkan lima release dalam sembilan hari sebelumnya, dan v1.4.0 mengubah aturan routing itu sendiri. Jika Anda mengikuti main saat melakukan pengukuran, proses kontrol dan proses pengujian dapat membaca instruksi yang berbeda sehingga perbandingannya tidak valid. Catat tag tersebut bersama hasil Anda.

Apakah eval dalam repo merupakan benchmark yang dapat dipercaya?

Anggap eval tersebut sebagai changelog untuk metode ini, sesuai dengan sebutan pembuatnya: "Log ini dibuat agar perubahan metode diuji, bukan agar siapa pun menganggapnya sebagai benchmark." Keterbatasannya dijelaskan di bagian atas file: 1 hingga 4 proses per sel, fixture sintetis, dan evaluator LLM yang dibangun berdasarkan frontier model yang sama, yang juga digunakan sebagai baseline. Setiap putaran benar-benar dijalankan dan eksperimen yang gagal tetap disertakan. Hal ini lebih baik daripada yang dipublikasikan oleh sebagian besar repo. Namun, eval tersebut tetap bukan pengukuran tentang apa yang akan terjadi pada codebase Anda. Karena itu, jalankan sendiri perbandingan dua sisi tersebut.