SSD Nodes Learn Hosting plans →
Panduan Matt ConnorOleh Matt Connor · Dikemas kini 2026-08-29

Cara guna kaedah Fable untuk melatih ejen AI

Ketahui cara menggunakan repositori Fable-method untuk menukar tabiat Claude Fable 5 menjadi kemahiran ejen. Dapatkan panduan A/B testing pada VPS dan kos model.

Apa yang sebenarnya didakwa oleh kaedah Fable

Kaedah Fable ialah satu set kecil kemahiran ejen yang mencatatkan tabiat kerja sesuatu model sebagai prosedur berurutan, supaya model lain boleh menjalankan prosedur yang sama. Repositori tersebut berada di Sahir619/fable-method, dilesenkan di bawah MIT, dan penerangan satu barisnya ialah "bagaimana Claude Fable 5 berfungsi, disuling menjadi kemahiran yang boleh dijalankan oleh mana-mana model, dengan penilaian yang memastikan ia kekal jujur." Dakwaan yang wajar diuji ialah separuh kedua ayat tersebut.

Sama ada fail teks benar-benar menangkap cara model tertentu berfikir bukanlah sesuatu yang boleh disemak oleh sesiapa di luar Anthropic. Sama ada model yang lebih murah berkelakuan berbeza apabila ia membaca fail teks tersebut adalah sesuatu yang boleh anda semak sendiri, pada satu VPS, dalam satu petang. Pengukuran tersebut adalah tujuan bagi segala perkara di bawah: tugasan yang sama dilakukan dua kali, dengan dan tanpa kaedah tersebut, sambil mengira panggilan alat dan kos.

Jika perkataan kemahiran (skill) adalah baharu bagi anda, mulakan dengan apa itu kemahiran ejen sebenarnya: satu folder yang menyimpan fail SKILL.md yang mana penerangan frontmatter-nya memberitahu ejen bila untuk memuatkan badan (body) fail tersebut. Model yang dinamakan sempena repositori ini diliputi dalam berapa kos Claude Fable 5 dan apakah kelebihannya.

Pasang kemahiran, dan tetapkan versi yang anda uji

Terdapat dua laluan pemasangan. Di dalam Claude Code, laluan pemalam terdiri daripada dua arahan:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Pada VPS, di mana anda mahukan salinan tetap pada cakera, lakukan klon dan semak keluar (check out) tag terlebih dahulu:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh tidak memerlukan sudo kerana ia hanya menulis di bawah $HOME/.claude/skills. Selepas ia dijalankan, ls ~/.claude/skills menyenaraikan fable-judge, fable-loop dan fable-method. Perhatikan apa yang tiada di situ. Repositori ini membekalkan empat kemahiran dan pemasang shell menyalin tiga daripadanya, jadi pengguna kendiri tidak akan mendapat fable-domain melainkan mereka menyalinnya secara manual:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

Tetapkan tag tersebut, dan catatkan tag itu bersebelahan dengan sebarang keputusan yang anda peroleh. Repositori ini menerbitkan lima keluaran antara 2026-07-06 dan 2026-07-15, v1.0.0 sehingga v1.4.0, dan v1.4.0 mengubah kaedah itu sendiri dengan menambah pintu penghalaan baharu. Sehingga Ogos 2026, v1.4.0 masih merupakan tag terbaharu. Jika larian kawalan anda membaca satu versi peraturan dan larian ujian anda membaca versi yang lain, anda tidak mengukur apa-apa.

Perkara yang diarahkan oleh keempat-empat kemahiran kepada model

Fail utama yang menjadi rujukan ialah skills/fable-method/SKILL.md. Fail ini mengandungi dua pintu kawalan dan tujuh langkah bernombor, dengan peraturan yang cukup spesifik untuk didebatkan.

Pintu kawalan trivialiti didahulukan: bertindak secara terus tanpa sebarang formaliti apabila perubahan hanya melibatkan satu fail, kod di bawah 10 baris, tidak menambah fungsi baharu, dan anda sudah tahu dengan tepat apa yang perlu diubah. Satu kemahiran berasingan dibina berdasarkan naluri tersebut sahaja, Ponytail, yang mendorong ejen ke arah perubahan terkecil yang berkesan, dan peraturan terasnya cukup pendek untuk disalin ke dalam arahan anda sendiri tanpa perlu memasang apa-apa. Pintu kawalan kesesuaian menyusul dan menghalakan permintaan berdasarkan lokasi jawapan: sumber yang boleh anda buka, teknik yang perlu anda kaji terlebih dahulu, atau inferens anda sendiri, yang mesti ditandakan sebagai tahap keyakinan rendah dan bukannya dibentangkan sebagai fakta. Cabang tengah itu hanya berfungsi jika ejen benar-benar boleh mencapai web, yang pada VPS dengan sekatan bermakna anda perlu memberikannya backend carian sendiri, seperti instans SearXNG yang dihoskan sendiri dan didedahkan sebagai alat carian JSON.

Seterusnya ialah gelung: klasifikasikan permintaan, takrifkan maksud selesai, kumpulkan bukti, buat keputusan, bertindak, sahkan, dan laporkan. Langkah 2 mengarahkan untuk berorientasi dengan menyenaraikan direktori sebelum memilih fail, mengutamakan sumber utama berbanding ingatan, dan berhenti selepas dua carian berturut-turut yang tidak memberikan hasil baharu. Langkah 4 mengarahkan untuk menulis baris INTENT: sebelum sebarang suntingan, menamakan fungsi kod tersebut, apa yang dijangkakan oleh semakan yang gagal, dan apa yang dinyatakan oleh spesifikasi, serta tidak menyunting sama sekali apabila ketiga-tiga perkara tersebut bercanggah, kerana percanggahan itulah penemuan sebenar. Langkah 5 mengehadkan percubaan semula: selepas tiga kitaran baiki-dan-sahkan yang gagal pada isu yang sama, berhenti dan serahkan kembali dengan output sebenar.

Bahagian fail yang paling boleh diuji ialah empat token laporannya. Perubahan tingkah laku memerlukan baris INTENT:. Tindakan yang menghala ke luar memerlukan AUTH: user said "<exact words>", dengan memetik kata pengguna, memandangkan repositori menyatakan dengan jelas bahawa dokumentasi bukanlah kebenaran. Tindakan yang ditetapkan tetapi tidak diambil memerlukan baris PENDING:. Kecacatan yang dibaiki memerlukan TWINS: searched <pattern> - found <N> other sites. Anda tidak perlu mempercayai apa-apa tentang kaedah tersebut untuk menyemak sama ada keempat-empat rentetan itu muncul apabila diperlukan, itulah yang menjadikan keseluruhan proses ini boleh diukur dan bukannya sekadar andaian.

fable-loop ialah kaedah yang sama yang dijalankan sebagai orkestrasi dalam empat peringkat: merancang dengan sub-ejen bukti selari, melaksanakan pada thread utama, mengesahkan dengan satu hingga tiga sub-ejen penyerang yang masing-masing menggunakan lensa berbeza, kemudian mengaudit dan melaporkan. Ia mengandaikan penggunaan model kos rendah pada peranan bukti dan penyerang, serta model yang lebih kuat pada keputusan dan suntingan.

fable-judge ialah bahagian yang berbaloi untuk dipasang walaupun anda membuang bahagian yang lain. Pendiriannya ialah "laporan adalah sekumpulan tuntutan, bukan bukti." Ia mengumpul tuntutan daripada laporan yang telah siap, menetapkan kebenaran asas daripada git diff dan git status, menjalankan semula setiap pengesahan yang dinyatakan dalam laporan, dan memburu senarai penipuan yang dinamakan: semakan yang dilemahkan, penyelesaian palsu, skop yang melampau, tindakan tanpa kebenaran, pengkhianatan spesifikasi, dan sisa yang tertinggal. Ia mengembalikan VERIFIED, VERIFIED WITH CAVEATS, atau REFUTED, dan menandakan apa-apa yang tidak dapat dihasilkan semula sebagai UNVERIFIABLE dan bukannya menganggap ia telah lulus. Baris penutup pemasang itu sendiri merujuk kepadanya: "Cuba ia: buka Claude Code dan taip /fable-judge selepas mana-mana ejen mendakwa kerja telah selesai." Jika anda lebih suka membina semakan itu ke dalam kerja tersebut daripada menjalankannya selepas itu, kemahiran Old Coder mempunyai ejen yang menghasilkan SPEC yang anda luluskan dan laporan EVIDENCE yang anda boleh jalankan semula sendiri, dengan ujian mutasi menggantikan liputan sebagai bukti bahawa ujian akan benar-benar menangkap regresi.

fable-domain menjana bundle penyesuai domain dengan lekapan perangkap dan penilaian asap. Lapan penyesuai disertakan: pemasaran, penyelidikan, analisis data, perniagaan dan operasi, kewangan, undang-undang dan pematuhan, reka bentuk dan UX, serta devops. Kerja perubatan dan klinikal sengaja ditinggalkan tanpa penyesuai.

Bahagian yang boleh dipindahkan ke model lain, dan bahagian yang tidak boleh

Repositori ini menjawab soalan ini secara terus dengan AGENTS.md, yang menyatakan: "Versi boleh pindah untuk mana-mana ejen pengekodan atau harness (Codex, Cursor, aider, atau prompt sistem mentah). Kaedah yang serupa dengan SKILL.md; tampal fail ini ke dalam arahan ejen anda atau letakkan di punca repositori anda sebagai AGENTS.md." Ia mengandungi kira-kira 2,600 perkataan dan membawa pintu kawalan, langkah, dan mod yang sama. Jika anda sudah menyimpan fail arahan di punca repositori, konvensyen AGENTS.md dan HUMAN.md menjelaskan di mana fail tersebut diletakkan dan siapa yang membacanya.

Dua bahagian boleh dipindahkan dengan mudah. Teks kaedah tersebut merupakan prompt berurutan tanpa kod khusus untuk model tertentu, jadi mana-mana model yang mengikut arahan boleh melaksanakannya. Tesis repositori ini menyatakan bahawa peningkatan prestasi adalah berkadar songsang dengan tahap model. Hakim (judge) juga boleh dipindahkan, selagi ejen tersebut mempunyai shell dan repositori, kerana semua tindakannya adalah git diff ditambah dengan menjalankan semula arahan yang boleh dijalankan oleh pembaca sendiri.

Satu bahagian tidak boleh dipindahkan dengan mudah. fable-loop mengandaikan harness boleh menjana sub-ejen selari dan menghalakannya ke model yang berbeza. Ejen tanpa sub-ejen akan menjalankan peringkat tersebut secara bersiri pada satu model, yang menghilangkan sifat selari dan penjimatan kos yang menjadi asas reka bentuk tersebut. Apa yang tinggal hanyalah fable-method dengan perbendaharaan kata tambahan.

Dua perkara kecil lain adalah khusus untuk harness dan mudah terlepas pandang. Pencetus /fable-method ialah arahan slash Claude Code, jadi pada harness lain anda perlu memanggil kaedah tersebut dengan menerangkannya. Selain itu, deskripsi frontmatter SKILL.md adalah perkara yang membolehkan ejen memuatkan badan teks hanya apabila ia sepadan dengan tugasan, yang bermaksud kemahiran yang dipasang hampir tidak menelan kos sehingga ia diaktifkan. Jika anda menampal AGENTS.md ke dalam prompt sistem, 2,600 perkataan tersebut akan disertakan dalam setiap permintaan yang anda hantar, tidak kira sama ada tugasan tersebut hanyalah pembetulan ralat taip satu baris atau penstrukturan semula kod. Ini merupakan perbezaan kos yang sebenar, dan ia adalah sebab utama mengapa pembungkusan kemahiran ini wujud.

Cara melakukan A/B pada VPS: tugasan yang sama, dua kali

Sediakan dua salinan kerja yang serupa supaya tiada satu pun larian dapat melihat suntingan yang lain. Gantikan YOUR_ORG/YOUR_REPO dengan repositori yang ingin anda uji; kedua-dua klon mesti datang daripada commit yang sama.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Pilih tugasan dengan hasil yang boleh anda perhatikan tanpa pendapat: ujian gagal yang perlu lulus, atau skrip yang perlu exit 0. Tugasan yang samar memberikan perbandingan yang samar, kerana anda akhirnya menilai prosa dan bukannya keputusan.

Jalankan lengan kawalan dengan --bare, yang melangkau penemuan automatik bagi hooks, skills, plugins dan CLAUDE.md. Flag tersebut adalah perkara yang menjadikannya kawalan: skill yang anda pasang sebelum ini tidak boleh menyelinap masuk. Mod bare tidak menggunakan log masuk langganan anda, jadi tetapkan API key daripada Claude Console terlebih dahulu.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Lengan kaedah adalah arahan yang sama dengan satu flag ditambah, yang memuatkan kaedah mudah alih sebagai tambahan prompt sistem:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Binari yang sama, model yang sama, alatan yang sama, pokok permulaan yang sama. Hanya satu flag yang berbeza, yang merupakan satu-satunya cara perbandingan itu membawa makna.

Reka bentuk itu mengukur teks kaedah. Ia tidak mengukur pembungkusan skill, yang merupakan persoalan berasingan. Untuk mengukur pembungkusan, gugurkan --bare, pasang skill seperti di atas, dan letakkan nama skill di dalam rentetan prompt, kerana skill yang dipanggil pengguna akan dikembangkan dalam mod cetak: claude -p "/fable-method $task". Jangkakan profil kos berbeza daripada lengan prompt sistem walaupun tingkah laku yang kelihatan adalah sama.

Mengira langkah dan kos

Kedua-dua larian menulis aliran peristiwa JSON. Baris terakhir ialah mesej result yang membawa teks akhir, kos, dan metadata sesi. Cetak baris tersebut sekali dan baca sebelum anda membuat sebarang skrip mengenainya, kerana nama medan berubah antara keluaran Claude Code.

tail -1 ~/ab/control.jsonl | jq .

Kos bagi setiap larian datang daripada baris tersebut, dan ia merupakan angka untuk dibandingkan:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Langkah yang diambil datang daripada pengiraan panggilan alat dalam fail yang sama:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Jalankan arahan tersebut untuk kedua-dua fail. Bentuk perbezaan tersebut memberitahu anda lebih banyak daripada jumlah keseluruhan. Larian kaedah yang membaca lebih banyak fail dan menyunting lebih sedikit fail sedang melakukan apa yang diminta oleh kaedah tersebut, dan itulah pertukaran yang anda beli. Larian kaedah dengan suntingan yang sama tetapi kos empat puluh peratus lebih tinggi tidak memberikan sebarang nilai tambahan untuk tugasan tersebut.

Dua peringatan mengenai angka-angka ini. Pertama, jangan jumlahkan output_tokens daripada transkrip sesi di bawah ~/.claude/projects/ dan menganggapnya sebagai jumlah keseluruhan: blok penggunaan setiap mesej tersebut adalah syot kilat yang diambil semasa penstriman, dan terdapat laporan terbuka mengenai pengiraan yang kurang tepat. Baris result ialah angka yang boleh dipercayai. Kedua, satu larian bagi setiap cabang hanyalah anekdot, jadi jalankan setiap cabang tiga atau empat kali pada tugasan yang sama sebelum anda mempercayai sesuatu jurang, kerana dua larian ejen yang sama pada tugasan yang sama sudah pun berbeza antara satu sama lain. Untuk pandangan jangka panjang mengenai perbelanjaan, alat yang menjejaki perbelanjaan Claude Code dan bagaimana Claude Code mengira token menjelaskan mengapa baris cache mendominasi kiraan mentah.

Pastikan ejen tidak boleh mencapai apa-apa yang penting bagi anda semasa ia berjalan tanpa pengawasan. menjalankan Claude Code dengan selamat pada VPS merangkumi akaun pengguna dan flag keizinan.

Penilaian repositori itu sendiri, baca dengan jujur

Tajuk utama README menyatakan "Lima belas pusingan penilaian, lebih daripada 260 larian ejen, hakim LLM buta yang mengesahkan melalui perbandingan diff dan pelaksanaan." Ini adalah bukti yang lebih kukuh daripada kebanyakan repositori kemahiran yang dikeluarkan, dan eval/RESULTS.md ditulis pusingan demi pusingan dengan kegagalan yang turut disertakan. Ia juga lebih nipis daripada angka tajuk utama yang dicadangkan sebaik sahaja anda melihat sel individu di sebalik baris tajuk utama tersebut.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Baris yang paling besar daripada 4 baris tersebut bergantung pada 4 larian. Tiga baris yang lain masing-masing terletak pada 2 larian. Repositori itu sendiri menyatakan perkara yang sama dalam had sedia ada di bahagian atas log: "Nilai n yang kecil secara keseluruhan (1-4 larian setiap sel), hakim LLM (buta di mana berbilang output dibandingkan, tetapi dibina atas model sempadan yang sama yang muncul sebagai garis dasar), lekapan sintetik, kebenaran asas penyelidikan hanya setakat tarikh lariannya." Dan secara lebih langsung: "Log ini wujud supaya suntingan kaedah diuji, bukan supaya sesiapa tersilap menganggapnya sebagai penanda aras."

Berikan kredit untuk itu. Penulis yang menerbitkan nilai n mereka sendiri, dan menamakan masalah bahawa hakim mereka dibina atas model yang sama yang berfungsi sebagai garis dasar, adalah lebih jujur daripada norma untuk kategori ini. Baca angka-angka tersebut sebagai bukti bahawa penulis benar-benar menjalankan perkara tersebut dan mengekalkan kegagalannya. Ujian A/B anda sendirilah yang memberitahu anda tentang pangkalan kod anda.

README tersebut juga jelas tentang di mana kaedah itu tidak memberikan kesan, dan itu adalah perenggan yang paling berguna. Ia merekodkan tiada peningkatan untuk tugas kecil biasa pada model yang berkebolehan. Ia menyatakan bahawa "kaedah ini tidak dapat menjadikan fakta model lebih segar; model sempadan kosong memenangi penyelidikan yang berat dengan pengetahuan". Dan ia meletakkan nilainya pada "perangkap (konflik autoriti, tuntutan penyiapan palsu, pelaksana lemah, larian tanpa pengawasan), bukan di mana-mana". Jika kerja ejen anda adalah suntingan kecil pada model yang kuat dengan pengawasan anda, jangan jangkakan untuk mengukur apa-apa pun. Jika ia adalah model yang lebih murah yang berjalan tanpa pengawasan, di situlah jurang sepatutnya muncul, yang juga menjadikan pilihan antara Opus, Sonnet dan Haiku sebahagian daripada keputusan yang sama.

Apabila pembungkusan menjadi amalan ikut-ikutan

Terdapat empat kritikan yang wajar dikemukakan, namun tiada satu pun daripadanya menjadi alasan untuk mengabaikan repositori ini.

Kerangka yang dibina melangkaui bukti yang ada. "Bagaimana Claude Fable 5 berfungsi" merupakan dakwaan mengenai bahagian dalaman model yang tidak dapat disahkan oleh sesiapa di luar Anthropic, dan ayat teras repositori itu sendiri melemahkannya: "Kualiti terletak pada struktur, bukti, dan kejujuran, bukan pada model." Jika kualiti terletak pada struktur, maka cerita asal-usul hanyalah hiasan. Prosedur tersebut mampu berdiri sendiri dan tidak memerlukan mitos asal-usul.

Empat kemahiran adalah lebih kepada permukaan berbanding apa yang diperlukan oleh kandungan tersebut. fable-loop menyatakan semula sebahagian besar daripada fable-method dengan orkestrasi di sekelilingnya, dan pada sistem tanpa sub-ejen, ia kembali menjadi fable-method. Baca kedua-dua fail tersebut secara bersebelahan sebelum anda memasang kedua-duanya.

Lapan penyesuai domain (domain adapters) adalah keluasan yang tidak diliputi oleh penilaian (eval). Hanya dua daripada lapan yang muncul dalam log: pemasaran dalam pusingan 9, dan devops dalam pusingan 12. Penyesuai untuk kewangan, perundangan, reka bentuk, dan data disertakan tanpa sebarang pusingan ujian di belakangnya. Penyesuai untuk bidang anda mungkin masih bagus. Walau bagaimanapun, ia hanyalah draf penulis, bukan sesuatu yang telah melepasi ujian ketat.

Selain itu, pemasang (installer) tidak selari dengan repositori mengenai apa yang dibekalkannya, dengan menyalin tiga daripada empat kemahiran ke dalam ~/.claude/skills. Perkara itu kecil. Namun, ia adalah jenis jurang yang menunjukkan bahawa pembungkusan bergerak lebih pantas daripada proses semakan, sesuatu yang perlu diingat apabila anda memutuskan sejauh mana anda ingin mengguna pakai sistem ini sekaligus.

Perkara yang perlu dikekalkan jika tiada perkara lain yang disimpan

Buang penjenamaan dan empat peraturan ini akan kekal dengan sendirinya, tidak kira ejen apa yang anda jalankan.

  • Petikan kebenaran. Tindakan yang tidak boleh diterbalikkan atau menghadap ke luar memerlukan kata-kata pengguna sendiri, yang ditulis sebagai baris AUTH:. Ejen yang tidak dapat mencari petikan tidak akan bertindak.
  • Semakan berkembar. Selepas membaiki kecacatan, cari keseluruhan projek untuk binaan salah yang sama dan laporkan bilangannya, termasuk apabila bilangannya sifar.
  • Pengesahan melalui pemerhatian. Semakan sasaran yang hijau tetapi berada di atas binaan yang rosak adalah pengesahan yang gagal, bukan lulus.
  • Pelaporan mengutamakan hasil, dengan apa sahaja yang dilangkau atau dibiarkan tidak disahkan dinyatakan sebagai kaveat dan bukannya digugurkan secara senyap.

Empat perkara tersebut tidak memerlukan kos untuk diguna pakai dan anda boleh menggunakan grep untuk pematuhan. Mulakan di situ, ukur dengan harness di atas, kemudian tentukan sama ada bahagian repositori yang lain berbaloi dengan bajet konteks anda. Jika anda ingin memberikan ejen konteks projek yang tetap dan bukannya kaedah kerja, satu DESIGN.md yang dibaca oleh ejen sebelum mereka menyunting adalah langkah pelengkapnya.

FAQ

Adakah kaedah Fable berfungsi dengan model selain Claude?

Teks kaedah tersebut berfungsi. Ia merupakan prompt berurutan tanpa kod khusus model, dan repositori tersebut mengeluarkan AGENTS.md sebagai salinan mudah alih untuk Codex, Cursor, aider atau prompt sistem mentah. Dua perkara tidak boleh dipindahkan. Pencetus /fable-method dan /fable-judge adalah arahan slash Claude Code, jadi di tempat lain anda perlu menggunakan kaedah tersebut dengan menghuraikannya. Selain itu, fable-loop mengandaikan adanya sistem yang boleh menjana sub-ejen selari pada model yang berbeza; tanpa sistem tersebut, ia berjalan secara bersiri dan memberikan anda fable-method dengan langkah tambahan.

Adakah menjalankan kemahiran ini menggunakan lebih banyak token?

Ya, dan jumlahnya bergantung pada cara anda memuatkannya. Apabila dipasang sebagai kemahiran, badan utama hanya dimuatkan apabila huraian sepadan dengan tugasan, jadi permintaan yang tidak berkaitan hampir tidak menggunakan kos. Jika ditampal ke dalam prompt sistem, kira-kira 2,600 perkataan AGENTS.md akan disertakan dalam setiap permintaan. Proses itu sendiri juga lebih mahal, kerana kaedah ini meminta orientasi sebelum menyunting, bukti sebelum membuat keputusan, dan pengesahan sebenar selepas itu. Ukur kosnya: jalankan tugasan yang sama dengan --output-format json pada kedua-dua bahagian dan bandingkan medan total_cost_usd.

Versi fable-method yang manakah perlu saya pasang, dan mengapa perlu menetapkannya (pin)?

Jalankan git checkout v1.4.0 sebelum anda memasang. Tag tersebut bertarikh 2026-07-15 dan masih merupakan versi terbaharu setakat Ogos 2026. Repositori tersebut mengeluarkan lima versi (releases) dalam tempoh sembilan hari sebelumnya, dan v1.4.0 mengubah peraturan penghalaan itu sendiri. Menjejaki main semasa anda membuat pengukuran bermakna larian kawalan dan larian ujian anda mungkin membaca arahan yang berbeza, yang menjadikan perbandingan tersebut tidak bernilai. Rekodkan tag tersebut bersama-sama dengan keputusan anda.

Adakah eval dalam repositori tersebut merupakan penanda aras (benchmark) yang boleh saya percayai?

Anggap ia sebagai log perubahan untuk kaedah tersebut, seperti yang dinyatakan oleh penulisnya: "Log ini wujud supaya suntingan kaedah diuji, bukan untuk disalah anggap sebagai penanda aras." Hadnya dinyatakan di bahagian atas fail: 1 hingga 4 larian bagi setiap sel, lekapan sintetik, dan hakim LLM yang dibina berdasarkan model sempadan (frontier model) yang sama yang juga berfungsi sebagai garis dasar. Pusingan tersebut adalah benar dan eksperimen yang gagal tetap disertakan, yang mana lebih daripada apa yang diterbitkan oleh kebanyakan repositori lain. Ia masih bukan ukuran bagi apa yang akan berlaku pada pangkalan kod anda, jadi lakukan perbandingan dua bahagian itu sendiri.