SSD Nodes Learn 🎉 VPS dari $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-13

Cara Gunakan Kaedah Fable untuk Melatih Ejen AI

Ketahui cara menggunakan repositori Sahir619/fable-method untuk menukar tabiat Claude Fable 5 menjadi kemahiran ejen. Panduan ini merangkumi fungsi fail, porting model, dan ujian A/B.

Apa yang sebenarnya didakwa oleh kaedah Fable

Kaedah Fable ialah satu set kecil kemahiran ejen yang mencatatkan tabiat kerja sesuatu model sebagai prosedur berurutan, supaya model lain boleh menjalankan prosedur yang sama. Repositori tersebut berada di Sahir619/fable-method, dilesenkan di bawah MIT, dan penerangan satu barisnya ialah "bagaimana Claude Fable 5 berfungsi, disuling menjadi kemahiran yang boleh dijalankan oleh mana-mana model, dengan penilaian yang memastikan ia kekal jujur." Dakwaan yang perlu diuji ialah separuh kedua ayat tersebut.

Sama ada fail teks benar-benar merakam cara model tertentu berfikir bukanlah sesuatu yang boleh disemak oleh sesiapa di luar Anthropic. Sama ada model yang lebih murah berkelakuan berbeza apabila ia membaca fail teks tersebut adalah sesuatu yang boleh anda semak sendiri, pada satu VPS, dalam masa satu petang. Pengukuran itulah tujuan segala perkara di bawah: tugasan yang sama dilakukan dua kali, dengan dan tanpa kaedah tersebut, dengan mengira panggilan alat dan kos.

Jika perkataan kemahiran (skill) adalah baharu bagi anda, mulakan dengan apa itu kemahiran ejen sebenarnya: satu folder yang mengandungi fail SKILL.md yang mana penerangan frontmatter-nya memberitahu ejen bila untuk memuatkan badan fail tersebut. Model yang dinamakan sempena repositori ini dibincangkan dalam berapa kos Claude Fable 5 dan apakah kelebihannya.

Pasang kemahiran, dan sematkan versi yang anda uji

Terdapat dua laluan pemasangan. Di dalam Claude Code, laluan pemalam terdiri daripada dua arahan:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Pada VPS, di mana anda mahukan salinan yang disematkan pada cakera, lakukan klon dan semak keluar (checkout) tag terlebih dahulu:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh tidak memerlukan sudo kerana ia hanya menulis di bawah $HOME/.claude/skills. Selepas ia dijalankan, ls ~/.claude/skills menyenaraikan fable-judge, fable-loop dan fable-method. Perhatikan apa yang tiada di situ. Repositori ini membekalkan empat kemahiran dan pemasang shell menyalin tiga daripadanya, jadi pengguna kendiri tidak akan mendapat fable-domain melainkan mereka menyalinnya secara manual:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

Sematkan tag tersebut, dan catatkan tag itu bersebelahan dengan sebarang keputusan yang anda perolehi. Repositori ini menerbitkan lima keluaran antara 2026-07-06 dan 2026-07-15, iaitu v1.0.0 sehingga v1.4.0, dan v1.4.0 mengubah kaedah itu sendiri dengan menambah pintu penghalaan baharu. Sehingga Ogos 2026, v1.4.0 masih merupakan tag terbaharu. Jika larian kawalan anda membaca satu versi peraturan dan larian ujian anda membaca versi yang lain, anda tidak mengukur apa-apa.

Peranan setiap daripada empat kemahiran dalam mengarahkan model

Fail yang menjadi tunjang utama ialah skills/fable-method/SKILL.md. Ia mengandungi dua pintu kawalan dan tujuh langkah bernombor, dengan peraturan yang cukup spesifik untuk didebatkan.

Pintu kawalan trivialiti didahulukan: bertindak secara terus tanpa sebarang formaliti apabila perubahan melibatkan satu fail, kod di bawah 10 baris, tidak menambah tingkah laku baharu, dan anda sudah tahu dengan tepat apa yang perlu diubah. Satu kemahiran berasingan dibina berdasarkan naluri itu sahaja, Ponytail, yang mendorong ejen ke arah perubahan terkecil yang berkesan, dan peraturan terasnya cukup pendek untuk disalin ke dalam arahan anda sendiri tanpa perlu memasang apa-apa. Pintu kawalan kesesuaian menyusul dan menghalakan permintaan berdasarkan lokasi jawapan: sumber yang boleh anda buka, teknik yang perlu anda kaji terlebih dahulu, atau inferens anda sendiri, yang mesti ditandakan sebagai tahap keyakinan rendah dan bukannya dibentangkan sebagai fakta. Cabang tengah itu hanya berfungsi jika ejen benar-benar boleh mencapai web, yang pada VPS yang dikunci bermakna memberikannya backend carian sendiri, seperti instans SearXNG yang dihoskan sendiri dan didedahkan sebagai alat carian JSON.

Kemudian gelung tersebut: klasifikasikan permintaan, tentukan maksud selesai, kumpulkan bukti, buat keputusan, bertindak, sahkan, dan laporkan. Langkah 2 menyatakan untuk mengorientasikan diri dengan menyenaraikan direktori sebelum memilih fail, mengutamakan sumber utama berbanding ingatan, dan berhenti selepas dua carian berturut-turut yang tidak memberikan hasil baharu. Langkah 4 menyatakan untuk menulis baris INTENT: sebelum sebarang suntingan, menamakan perkara yang dilakukan oleh kod tersebut, perkara yang dijangkakan oleh semakan yang gagal, dan perkara yang dinyatakan oleh spesifikasi, serta tidak menyunting sama sekali apabila ketiga-tiga perkara tersebut bercanggah, kerana percanggahan itulah penemuan sebenar. Langkah 5 mengehadkan percubaan semula: selepas tiga kitaran baiki-dan-sahkan yang gagal pada isu yang sama, berhenti dan serahkan kembali dengan output sebenar.

Bahagian fail yang paling boleh diuji ialah empat token laporannya. Perubahan tingkah laku memerlukan baris INTENT:. Tindakan yang menghadap ke luar memerlukan AUTH: user said "<exact words>", dengan memetik pengguna, memandangkan repo menyatakan dengan jelas bahawa dokumentasi bukanlah kebenaran. Tindakan yang ditetapkan tetapi tidak diambil memerlukan baris PENDING:. Kecacatan yang dibaiki memerlukan TWINS: searched <pattern> - found <N> other sites. Anda tidak perlu mempercayai apa-apa tentang kaedah tersebut untuk menyemak sama ada empat rentetan itu muncul apabila ia diperlukan, yang menjadikannya boleh diukur dan bukannya sekadar andaian.

fable-loop ialah kaedah yang sama yang dijalankan sebagai orkestrasi dalam empat peringkat: merancang dengan sub-ejen bukti selari, melaksanakan pada thread utama, mengesahkan dengan satu hingga tiga sub-ejen penyerang yang masing-masing mengambil lensa berbeza, kemudian mengaudit dan melaporkan. Ia mengandaikan model kos rendah pada peranan bukti dan penyerang, serta model yang lebih kuat pada keputusan dan suntingan.

fable-judge ialah bahagian yang berbaloi untuk dipasang walaupun anda membuang bahagian yang lain. Pendiriannya ialah "laporan adalah satu set tuntutan, bukan bukti." Ia mengumpul tuntutan daripada laporan yang telah siap, menetapkan kebenaran asas daripada git diff dan git status, menjalankan semula setiap pengesahan yang dinyatakan dalam laporan, dan memburu senarai penipuan yang dinamakan: semakan yang dilemahkan, penyelesaian palsu, skop yang melampau, tindakan tanpa kebenaran, pengkhianatan spesifikasi, dan sisa yang tertinggal. Ia mengembalikan VERIFIED, VERIFIED WITH CAVEATS, atau REFUTED, dan menandakan apa-apa yang tidak dapat dihasilkan semula sebagai UNVERIFIABLE dan bukannya menganggap ia telah lulus. Baris penutup pemasang itu sendiri menunjuk ke arahnya: "Cubalah: buka Claude Code dan taip /fable-judge selepas mana-mana ejen mendakwa kerja telah selesai."

fable-domain menjana pakej penyesuai domain dengan lekapan perangkap dan penilaian asap. Lapan penyesuai disediakan: pemasaran, penyelidikan, analisis data, perniagaan dan operasi, kewangan, undang-undang dan pematuhan, reka bentuk dan UX, serta devops. Kerja perubatan dan klinikal sengaja ditinggalkan tanpa penyesuai.

Bahagian yang boleh dipindahkan ke model lain dan bahagian yang tidak boleh

Repositori ini menjawab soalan ini secara terus dengan AGENTS.md, yang menyatakan: "Versi mudah alih untuk mana-mana ejen pengekodan atau harness (Codex, Cursor, aider, prompt sistem mentah). Kaedah yang sama seperti SKILL.md; tampal fail ini ke dalam arahan ejen anda atau letakkan di root repositori anda sebagai AGENTS.md." Ia mengandungi kira-kira 2,600 patah perkataan dan membawa pintu kawalan, langkah serta mod yang sama. Jika anda sudah menyimpan fail arahan di root repositori, konvensyen AGENTS.md dan HUMAN.md menjelaskan di mana fail tersebut diletakkan dan siapa yang membacanya.

Dua bahagian boleh dipindahkan dengan lancar. Teks kaedah tersebut merupakan prompt berurutan tanpa kod khusus model, jadi mana-mana model yang mengikut arahan boleh melaksanakannya, dan tesis repositori ini menyatakan bahawa peningkatan prestasi adalah berkadar songsang dengan tahap model. Hakim (judge) juga boleh dipindahkan, selagi ejen mempunyai shell dan repositori, kerana semua tindakannya adalah git diff ditambah dengan menjalankan semula arahan yang boleh dijalankan oleh pembaca sendiri.

Satu bahagian tidak boleh dipindahkan dengan lancar. fable-loop mengandaikan harness boleh menjana subejen selari dan menghalakannya ke model yang berbeza. Ejen tanpa subejen akan menjalankan peringkat tersebut secara bersiri pada satu model, yang menghilangkan sifat selari dan penjimatan kos yang menjustifikasikan reka bentuk tersebut. Apa yang tinggal hanyalah fable-method dengan perbendaharaan kata tambahan.

Dua perkara kecil lain adalah khusus kepada harness dan mudah terlepas pandang. Pencetus /fable-method ialah arahan slash Claude Code, jadi pada harness lain, anda memanggil kaedah tersebut dengan menerangkannya. Dan deskripsi frontmatter SKILL.md adalah perkara yang membolehkan ejen memuatkan badan kandungan hanya apabila ia sepadan dengan tugasan, yang bermaksud kemahiran yang dipasang hampir tidak menelan kos sehingga ia diaktifkan. Tampal AGENTS.md ke dalam prompt sistem sebaliknya, dan 2,600 patah perkataan itu akan berada dalam setiap permintaan yang anda hantar, sama ada tugasan tersebut hanyalah pembetulan ralat taip satu baris atau penstrukturan semula kod. Itu adalah perbezaan kos yang nyata, dan ia merupakan sebab utama mengapa pembungkusan kemahiran itu wujud.

Cara melakukan A/B testing pada VPS: tugasan yang sama, dua kali

Sediakan dua salinan kerja yang serupa supaya tiada satu pun larian dapat melihat suntingan yang lain. Gantikan YOUR_ORG/YOUR_REPO dengan repositori yang ingin anda uji; kedua-dua klon mesti datang daripada commit yang sama.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Pilih tugasan dengan hasil yang boleh diperhatikan tanpa pendapat: ujian gagal yang perlu lulus, atau skrip yang perlu exit 0. Tugasan yang samar memberikan perbandingan yang samar, kerana anda akhirnya menilai prosa dan bukannya hasil.

Jalankan lengan kawalan dengan --bare, yang melangkau penemuan automatik bagi hooks, skills, plugins dan CLAUDE.md. Flag tersebut adalah perkara yang menjadikannya kawalan: skill yang anda pasang sebelum ini tidak boleh menyusup masuk. Mod bare tidak menggunakan log masuk langganan anda, jadi tetapkan API key daripada Claude Console terlebih dahulu.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Lengan kaedah adalah arahan yang sama dengan satu flag ditambah, yang memuatkan kaedah mudah alih sebagai tambahan prompt sistem:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Binary yang sama, model yang sama, alatan yang sama, pokok permulaan yang sama. Hanya satu flag yang berbeza, yang merupakan satu-satunya cara perbandingan itu membawa makna.

Reka bentuk itu mengukur teks kaedah. Ia tidak mengukur pembungkusan skill, yang merupakan persoalan berasingan. Untuk mengukur pembungkusan, gugurkan --bare, pasang skill seperti di atas, dan letakkan nama skill di dalam rentetan prompt, kerana skill yang dipanggil pengguna akan dikembangkan dalam mod cetakan: claude -p "/fable-method $task". Jangkakan profil kos berbeza daripada lengan prompt sistem walaupun tingkah laku yang kelihatan adalah sama.

Mengira langkah dan kos

Kedua-dua larian menulis aliran peristiwa JSON. Baris terakhir ialah mesej result yang membawa teks akhir, kos dan metadata sesi. Cetak baris tersebut sekali dan bacanya sebelum anda membuat sebarang skrip mengenainya, kerana nama medan berubah antara keluaran Claude Code.

tail -1 ~/ab/control.jsonl | jq .

Kos bagi setiap larian datang daripada baris tersebut, dan itulah angka untuk dibandingkan:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Langkah yang diambil datang daripada pengiraan panggilan alat dalam fail yang sama:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Jalankan arahan tersebut untuk kedua-dua fail. Bentuk perbezaan tersebut memberitahu anda lebih banyak daripada jumlah keseluruhan. Larian kaedah yang membaca lebih banyak fail dan menyunting lebih sedikit sedang melakukan apa yang diminta oleh kaedah tersebut, dan itulah pertukaran yang anda beli. Larian kaedah dengan suntingan yang sama tetapi kos empat puluh peratus lebih tinggi tidak memberikan sebarang nilai untuk tugasan tersebut.

Dua peringatan mengenai angka-angka ini. Pertama, jangan jumlahkan output_tokens daripada transkrip sesi di bawah ~/.claude/projects/ dan menganggapnya sebagai jumlah keseluruhan: blok penggunaan setiap mesej itu adalah syot kilat yang diambil semasa penstriman, dan terdapat laporan terbuka mengenai pengiraan yang kurang tepat. Baris result ialah angka yang boleh dipercayai. Kedua, satu larian bagi setiap cabang hanyalah anekdot, jadi jalankan setiap cabang tiga atau empat kali pada tugasan yang sama sebelum anda mempercayai sesuatu jurang, kerana dua larian ejen yang sama pada tugasan yang sama sudah pun berbeza antara satu sama lain. Untuk pandangan jangka panjang mengenai perbelanjaan, alat yang menjejaki perbelanjaan Claude Code dan bagaimana Claude Code mengira token menjelaskan sebab baris cache mendominasi kiraan mentah.

Pastikan ejen tidak dapat mencapai apa-apa yang anda pentingkan semasa ia berjalan tanpa pengawasan. menjalankan Claude Code dengan selamat pada VPS merangkumi akaun pengguna dan flag kebenaran.

Penilaian repositori itu sendiri, baca dengan jujur

Tajuk utama README ialah "Lima belas pusingan penilaian, lebih daripada 260 larian ejen, hakim LLM buta yang mengesahkan melalui perbezaan (diffing) dan pelaksanaan." Itu adalah bukti yang lebih banyak daripada hampir mana-mana repositori kemahiran yang dikeluarkan, dan eval/RESULTS.md ditulis pusingan demi pusingan dengan kegagalan yang dikekalkan. Ia juga lebih nipis daripada angka tajuk utama yang dicadangkan sebaik sahaja anda melihat sel individu di sebalik baris tajuk utama.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Baris yang paling besar daripada 4 baris tersebut bergantung pada 4 larian. Tiga baris yang lain terletak pada 2 larian setiap satu. Repositori itu sendiri menyatakan perkara yang sama, dalam had tetap di bahagian atas log: "n kecil di seluruh bahagian (1-4 larian setiap sel), hakim LLM (buta di mana berbilang output dibandingkan, tetapi dibina atas model sempadan yang sama yang muncul sebagai garis dasar), lekapan sintetik, kebenaran asas penyelidikan hanya setakat tarikh larinya." Dan secara lebih langsung: "Log ini wujud supaya suntingan kaedah diuji, bukan supaya sesiapa tersilap menganggapnya sebagai penanda aras."

Berikan kredit untuk itu. Seorang penulis yang menerbitkan n mereka sendiri, dan menamakan masalah bahawa hakim mereka dibina atas model yang sama yang berfungsi sebagai garis dasar, adalah lebih jujur daripada norma untuk kategori ini. Baca nombor tersebut sebagai bukti bahawa penulis sebenarnya menjalankan perkara tersebut dan mengekalkan kegagalannya. A/B anda sendiri adalah perkara yang memberitahu anda tentang pangkalan kod anda.

README tersebut juga jelas tentang di mana kaedah itu tidak melakukan apa-apa, dan itu adalah perenggan yang paling berguna. Ia merekodkan tiada peningkatan untuk tugas kecil biasa pada model yang berkebolehan. Ia menyatakan bahawa "kaedah ini tidak boleh menjadikan fakta model lebih segar; model sempadan kosong memenangi penyelidikan yang berat pengetahuan". Dan ia meletakkan nilai pada "perangkap (konflik autoriti, tuntutan penyiapan palsu, pelaksana lemah, larian tanpa pengawasan), bukan di mana-mana". Jika kerja ejen anda adalah suntingan kecil pada model yang kuat dengan anda memerhati, jangan jangkakan untuk mengukur apa-apa pun. Jika ia adalah model yang lebih murah yang berjalan tanpa pengawasan, di situlah jurang sepatutnya muncul, yang juga menjadikan pilihan antara Opus, Sonnet dan Haiku sebahagian daripada keputusan yang sama.

Di mana pembungkusan menjadi amalan ikut-ikutan

Terdapat empat kritikan yang wajar dikemukakan, dan tiada satu pun daripadanya menjadi alasan untuk mengabaikan repositori ini.

Kerangka yang dibina melangkaui bukti yang ada. "Bagaimana Claude Fable 5 berfungsi" adalah dakwaan mengenai bahagian dalaman model yang tidak dapat disahkan oleh sesiapa di luar Anthropic, dan ayat teras repositori itu sendiri melemahkannya: "Kualiti terletak pada struktur, bukti, dan kejujuran, bukan pada model." Jika kualiti terletak pada struktur, kisah asal-usul hanyalah hiasan. Prosedur tersebut mampu berdiri sendiri dan tidak memerlukan mitos asal-usul.

Empat kemahiran adalah lebih kepada permukaan berbanding apa yang diperlukan oleh kandungan tersebut. fable-loop menyatakan semula sebahagian besar daripada fable-method dengan orkestrasi yang menyelubunginya, dan pada sistem tanpa sub-ejen, ia kembali menjadi fable-method. Baca kedua-dua fail tersebut secara bersebelahan sebelum anda memasang kedua-duanya.

Lapan penyesuai domain (domain adapters) adalah keluasan yang tidak diliputi oleh penilaian (eval). Hanya dua daripada lapan muncul dalam log: pemasaran dalam pusingan 9, dan devops dalam pusingan 12. Penyesuai untuk kewangan, undang-undang, reka bentuk, dan data disertakan tanpa sebarang pusingan ujian di belakangnya. Penyesuai untuk bidang anda mungkin masih bagus. Walau bagaimanapun, ia hanyalah draf penulis, bukan sesuatu yang telah melepasi ujian ketat.

Selain itu, pemasang (installer) tidak selari dengan repositori mengenai apa yang disertakan, dengan menyalin tiga daripada empat kemahiran ke dalam ~/.claude/skills. Perkara itu kecil. Namun, ia adalah jenis jurang yang menunjukkan bahawa pembungkusan bergerak lebih pantas daripada proses semakan, sesuatu yang perlu diingat apabila anda memutuskan sejauh mana anda ingin mengguna pakai perkara ini sekaligus.

Perkara yang perlu dikekalkan jika tiada perkara lain yang dikekalkan

Buang penjenamaan dan empat peraturan ini akan kekal dengan sendirinya, tidak kira ejen apa yang anda jalankan.

  • Petikan kebenaran. Tindakan yang tidak boleh diterbalikkan atau menghadap ke luar memerlukan kata-kata pengguna sendiri, yang ditulis sebagai baris AUTH:. Ejen yang tidak dapat mencari petikan tidak akan bertindak.
  • Semakan berkembar. Selepas membaiki sesuatu kecacatan, cari keseluruhan projek untuk binaan salah yang sama dan laporkan jumlahnya, termasuk apabila jumlahnya sifar.
  • Pengesahan melalui pemerhatian. Semakan sasaran yang berwarna hijau tetapi berada di atas binaan yang rosak adalah pengesahan yang gagal, bukan lulus.
  • Pelaporan yang mengutamakan hasil, dengan menyatakan apa-apa yang dilangkau atau tidak disahkan sebagai peringatan dan bukannya dibuang begitu sahaja.

Empat perkara tersebut tidak memerlukan kos untuk diguna pakai dan anda boleh menggunakan grep untuk memastikan pematuhan. Mulakan di situ, ukur dengan rangka kerja di atas, kemudian tentukan sama ada bahagian repositori yang lain berbaloi dengan bajet konteks anda. Jika anda ingin memberikan ejen konteks projek yang tetap dan bukannya kaedah kerja, fail DESIGN.md yang dibaca oleh ejen sebelum mereka menyunting ialah langkah pelengkap yang sewajarnya.

FAQ

Adakah kaedah Fable berfungsi dengan model selain Claude?

Teks kaedah tersebut berfungsi. Ia merupakan prompt berurutan tanpa kod khusus model, dan repositori tersebut mengeluarkan AGENTS.md sebagai salinan mudah alih untuk Codex, Cursor, aider atau prompt sistem mentah. Dua perkara tidak boleh dipindahkan. Pencetus /fable-method dan /fable-judge adalah arahan slash Claude Code, jadi di tempat lain anda perlu menggunakan kaedah tersebut dengan menerangkannya. Selain itu, fable-loop mengandaikan adanya harness yang boleh menjana subejen selari pada model yang berbeza; tanpa itu, ia berjalan secara bersiri dan memberikan anda fable-method dengan langkah tambahan.

Adakah menjalankan kemahiran ini menggunakan lebih banyak token?

Ya, dan jumlahnya bergantung pada cara anda memuatkannya. Jika dipasang sebagai kemahiran, badan utama hanya dimuatkan apabila deskripsi sepadan dengan tugasan, jadi permintaan yang tidak berkaitan hampir tidak menelan kos. Jika ditampal ke dalam prompt sistem, kira-kira 2,600 perkataan AGENTS.md akan disertakan dalam setiap permintaan. Pelaksanaan itu sendiri juga menelan kos lebih tinggi, kerana kaedah ini meminta orientasi sebelum menyunting, bukti sebelum membuat keputusan, dan pengesahan sebenar selepasnya. Ukur kos tersebut: jalankan tugasan yang sama dengan --output-format json pada kedua-dua bahagian dan bandingkan medan total_cost_usd.

Versi fable-method yang manakah perlu saya pasang, dan mengapa perlu menetapkannya (pin)?

Jalankan git checkout v1.4.0 sebelum anda memasang. Tag tersebut bertarikh 2026-07-15 dan masih merupakan versi terbaharu setakat Ogos 2026. Repositori tersebut menerbitkan lima keluaran dalam tempoh sembilan hari sebelumnya, dan v1.4.0 mengubah peraturan penghalaan itu sendiri. Menjejaki main semasa anda membuat pengukuran bermakna larian kawalan dan larian ujian anda mungkin membaca arahan yang berbeza, yang menjadikan perbandingan tersebut tidak bernilai. Rekodkan tag tersebut bersama-sama dengan keputusan anda.

Adakah eval dalam repositori merupakan penanda aras yang boleh saya percayai?

Anggap ia sebagai log perubahan untuk kaedah tersebut, iaitu apa yang disebut oleh penulisnya: "Log ini wujud supaya suntingan kaedah diuji, bukan supaya sesiapa tersilap menganggapnya sebagai penanda aras." Hadnya dinyatakan di bahagian atas fail: 1 hingga 4 larian bagi setiap sel, lekapan sintetik, dan hakim LLM yang dibina berdasarkan model sempadan yang sama yang juga berfungsi sebagai garis dasar. Pusingan tersebut adalah benar dan eksperimen yang gagal tetap disimpan, yang mana lebih banyak daripada apa yang diterbitkan oleh kebanyakan repositori lain. Ia masih bukan ukuran bagi apa yang akan berlaku pada pangkalan kod anda, jadi lakukan perbandingan dua bahagian itu sendiri.