SSD Nodes Learn Hosting plans →
Mga Gabay Matt ConnorNi Matt Connor · Na-update 2026-08-31

Fable method: agent skills para sa kahit anong model

Tingnan kung paano ginagawang agent skills ang habits ni Claude Fable 5, ano ang puwedeng ilipat sa ibang model, at paano mag-A/B test sa VPS gamit ang tool calls at cost.

Ano talaga ang sinasabi ng Fable method

Ang Fable method ay maliit na set ng agent skills na nagtatala ng mga working habit ng isang model bilang nakaayos na procedure, para maisagawa ng ibang model ang parehong procedure. Ang repo ay Sahir619/fable-method, may MIT license, at ang sarili nitong one-line description ay "kung paano nagtrabaho si Claude Fable 5, na isinapinal bilang skills na maaaring patakbuhin ng anumang model, kasama ang eval na nagpapanatili rito na tumpak." Ang bahaging sulit subukan ay ang ikalawang hati ng pangungusap na iyon.

Hindi mabe-verify ng sinuman sa labas ng Anthropic kung talagang nakukuha ng isang text file kung paano nag-isip ang isang partikular na model. Pero maaari mong suriin mismo kung naiiba ang pagkilos ng isang mas murang model kapag binasa nito ang text file na iyon—sa isang VPS, sa loob ng isang hapon. Iyan ang layunin ng lahat ng sumusunod: patakbuhin nang dalawang beses ang parehong task, mayroon at walang method, habang binibilang ang tool calls at cost.

Kung bago sa iyo ang salitang skill, magsimula sa kung ano talaga ang agent skill: isang folder na naglalaman ng SKILL.md file na ang frontmatter description ay nagsasabi sa agent kung kailan ilo-load ang body. Ang model na pinagmulan ng pangalan ng repo ay tinatalakay sa magkano ang Claude Fable 5 at saan ito mahusay.

I-install ang skills, at i-pin ang version na ite-test

May dalawang paraan ng pag-install. Sa loob ng Claude Code, dalawang command ang kailangan para sa plugin route:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Sa isang VPS, kung kailangan mo ng naka-pin na kopya sa disk, i-clone ang repository at mag-check out muna ng tag:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

Hindi kailangan ng sudo ang install.sh dahil sa ilalim lamang ng $HOME/.claude/skills ito nagsusulat. Pagkatapos nitong tumakbo, inililista ng ls ~/.claude/skills ang fable-judge, fable-loop, at fable-method. Tingnan kung ano ang wala roon. May apat na skill ang repository, pero tatlo lamang ang kinokopya ng shell installer. Kaya hindi nakukuha ng standalone user ang fable-domain maliban kung manu-mano niya itong kokopyahin:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

I-pin ang tag, at isulat ang tag sa tabi ng anumang resultang makuha mo. Naglabas ang repository na ito ng limang release mula 2026-07-06 hanggang 2026-07-15, mula v1.0.0 hanggang v1.4.0. Binago ng v1.4.0 ang mismong method sa pagdaragdag ng bagong routing gate. Noong August 2026, ang v1.4.0 pa rin ang pinakabagong tag. Kung ibang version ng rules ang binabasa ng control run at ng test run, wala kang nasukat.

Ano ang itinuturo ng bawat isa sa apat na skill sa modelo

Ang pangunahing file ay skills/fable-method/SKILL.md. Naglalaman ito ng dalawang gate at pitong may bilang na hakbang. Tiyak ang mga panuntunan nito at sapat ang detalye para masuri at kuwestiyunin ang mga ito.

Una ang triviality gate: kumilos agad at walang seremonya kapag isang file lang ang binabago, humigit-kumulang 10 linya lang ang kailangang patakbuhin, walang bagong behavior na idinaragdag, at alam mo na kung ano mismo ang babaguhin. Isang hiwalay na skill ang nakabatay sa instinct na ito, ang Ponytail, na nagtutulak sa agent na piliin ang pinakamaliit na pagbabagong gumagana, at sapat na maikli ang pangunahing panuntunan nito para makopya sa sarili mong instructions nang walang kailangang i-install. Kasunod ang fit gate. Iniruruta nito ang request batay sa kung saan matatagpuan ang sagot: sa mga source na maaari mong buksan, sa technique na kailangan mo munang saliksikin, o sa sarili mong inference, na dapat markahan bilang low confidence sa halip na iharap bilang katotohanan. Gumagana lamang ang middle branch na ito kung aktuwal na maaabot ng agent ang web. Sa isang locked-down VPS, nangangahulugan itong kailangan itong bigyan ng sarili nitong search backend, gaya ng self-hosted na SearXNG instance na inilantad bilang JSON search tool.

Kasunod nito ang loop: i-classify ang request, tukuyin kung ano ang ibig sabihin ng done, mangalap ng ebidensiya, magpasya, kumilos, mag-verify, at mag-report. Sinasabi ng Step 2 na mag-orient muna sa pamamagitan ng paglista ng directory bago pumili ng mga file, unahin ang primary sources kaysa recall, at huminto pagkatapos ng dalawang magkasunod na lookup na walang bagong ibinalik. Sinasabi ng Step 4 na magsulat ng INTENT: line bago ang anumang edit. Dapat nitong pangalanan kung ano ang ginagawa ng code, kung ano ang inaasahan ng failing check, at kung ano ang sinasabi ng spec. Huwag mag-edit kapag hindi nagtutugma ang tatlong ito, dahil ang hindi pagtutugma ang mismong mahalagang finding. Nililimitahan ng Step 5 ang mga retry: pagkatapos ng tatlong nabigong fix-and-verify cycle para sa parehong issue, huminto at ibalik ang aktuwal na output.

Ang pinakamadaling i-test na bahagi ng file ay ang apat nitong report token. Ang pagbabago sa behavior ay nangangailangan ng INTENT: line. Ang action na nakaaapekto sa labas ay nangangailangan ng AUTH: user said "<exact words>" at dapat nitong sipiin ang user, dahil malinaw na sinasabi ng repo na hindi authorization ang documentation. Ang inireseta ngunit hindi isinagawang action ay nangangailangan ng PENDING: line. Ang naayos na defect ay nangangailangan ng TWINS: searched <pattern> - found <N> other sites. Hindi mo kailangang magtiwala sa alinmang bahagi ng method para masuri kung lumilitaw ang apat na string kapag kinakailangan ang mga ito. Dahil dito, nasusukat ang buong proseso at hindi nakabatay sa pakiramdam lamang.

Ang fable-loop ay ang parehong method na pinapatakbo bilang orchestration sa apat na stage: magplano gamit ang parallel evidence subagent, magsagawa sa main thread, mag-verify gamit ang isa hanggang tatlong attacker subagent na magkakaibang lens ang ginagamit, at pagkatapos ay mag-audit at mag-report. Ipinapalagay nito na murang models ang gagamitin sa evidence at attacker roles, at mas malakas na model ang gagamitin sa mga desisyon at edit.

Ang fable-judge ang bahaging sulit i-install kahit itapon mo ang iba. Ang paninindigan nito ay, “ang report ay koleksiyon ng mga claim, hindi ebidensiya.” Kinokolekta nito ang mga claim mula sa natapos na report, itinatakda ang ground truth mula sa git diff at git status, muling pinapatakbo ang bawat verification na sinasabing isinagawa ng report, at hinahanap ang pinangalanang fraud list: pinahina ang mga check, maling pagkumpleto, scope creep, unauthorized action, pagtataksil sa spec, at natirang debris. Ibinabalik nito ang VERIFIED, VERIFIED WITH CAVEATS, o REFUTED. Anumang hindi nito ma-reproduce ay minamarkahan bilang UNVERIFIABLE sa halip na awtomatikong ipagpalagay na pumasa. Itinuturo rito ang sariling closing line ng installer: “Subukan ito: buksan ang Claude Code at i-type ang /fable-judge pagkatapos sabihin ng anumang agent na tapos na ang trabaho.” Kung mas gusto mong isama ang check na ito sa mismong trabaho kaysa patakbuhin pagkatapos, ang Old Coder skill ay nagpapagawa sa agent ng SPEC na aaprubahan mo at EVIDENCE report na maaari mong patakbuhing muli, kung saan ginagamit ang mutation testing sa halip na coverage bilang patunay na aktuwal na makakahuli ng regression ang isang test.

Gumagawa ang fable-domain ng mga domain adapter bundle na may trap fixture at smoke eval. Walong adapter ang kasama: marketing, research, data analysis, business at ops, finance, legal at compliance, design at UX, at devops. Sadyang walang adapter para sa medical at clinical na trabaho.

Aling bahagi ang madaling ilipat sa ibang model, at alin ang hindi

Direktang sinasagot ito ng repo sa AGENTS.md, na nagsisimula sa: “Portable version for any coding agent or harness (Codex, Cursor, aider, a raw system prompt). Identical method to SKILL.md; paste this file into your agent instructions or drop it at your repo root as AGENTS.md.” Humigit-kumulang 2,600 salita ito at dala nito ang parehong gates, hakbang, at mode. Kung gumagamit ka na ng mga instruction file sa repo root, ipinapaliwanag ng convention ng AGENTS.md at HUMAN.md kung saan ilalagay ang file at kung sino ang babasa nito.

Dalawang bahagi ang madaling ilipat. Ang method text ay isang nakaayos na prompt na walang code na partikular sa isang model, kaya masusunod ito ng anumang model na sumusunod sa mga instruction. Nakasaad din sa thesis ng repo na inversely proportional sa model tier ang kinakailangang effort. Madali ring ilipat ang judge, basta may shell at repository ang agent, dahil ang lahat ng ginagawa nito ay git diff at muling pagpapatakbo ng mga command na maaari ring patakbuhin ng reader.

May isang bahaging hindi madaling ilipat. Ipinapalagay ng fable-loop na kayang mag-spawn ng parallel subagents ang harness at i-route ang mga ito sa magkakaibang model. Kung walang subagents ang agent, sunod-sunod nitong pinapatakbo ang mga stage gamit ang iisang model. Inaalis nito ang parallelism at cost saving na dahilan ng disenyo. Ang natitira ay fable-method na may dagdag na vocabulary.

May dalawa pang mas maliliit na bagay na partikular sa harness at madaling hindi mapansin. Ang trigger na /fable-method ay isang Claude Code slash command, kaya sa ibang harness, pinapagana mo ang method sa pamamagitan ng paglalarawan dito. Ang description sa frontmatter na SKILL.md ang nagbibigay-daan sa agent na i-load lamang ang body kapag tumutugma ito sa task. Dahil dito, halos walang gastos ang isang naka-install na skill hanggang sa ma-trigger ito. Sa halip, kung i-paste mo ang AGENTS.md sa isang system prompt, kasama ang 2,600 salitang iyon sa bawat request na ipinapadala mo, kahit one-line typo fix lang o refactor ang task. Totoong may malaking pagkakaiba sa gastos, at ito ang pangunahing dahilan kung bakit umiiral ang skill packaging.

Paano ito i-A/B sa isang VPS: iisang task, dalawang beses

Mag-set up ng dalawang magkaparehong working copy upang hindi makita ng alinmang run ang mga edit ng isa pa. Palitan ang YOUR_ORG/YOUR_REPO ng repository na gusto mong gamitin sa test; dapat mula sa iisang commit ang dalawang clone.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Pumili ng task na may resultang maobserbahan nang walang opinyon: isang failing test na kailangang pumasa, o isang script na kailangang mag-exit sa 0. Nagbibigay ng malabong comparison ang malabong task dahil prose ang nagiging batayan ng grading sa halip na mga resulta.

Patakbuhin ang control arm gamit ang --bare, na naglaktaw sa auto-discovery ng hooks, skills, plugins, at CLAUDE.md. Ang flag na iyon ang gumagawa rito bilang control: hindi makakapasok ang mga skill na na-install mo kanina. Hindi ginagamit ng bare mode ang iyong subscription login, kaya mag-set muna ng API key mula sa Claude Console.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Ang method arm ay kaparehong command na may idinagdag na isang flag. nilo-load nito ang portable method bilang dagdag sa system prompt:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Parehong binary, parehong model, parehong tools, at parehong panimulang tree. Isang flag lang ang naiiba. Ito lamang ang paraan upang magkaroon ng saysay ang comparison.

Sinusukat ng disenyong ito ang method text. Hindi nito sinusukat ang skill packaging, na hiwalay na tanong. Para sukatin ang packaging, alisin ang --bare, i-install ang skills gaya sa itaas, at ilagay ang pangalan ng skill sa loob ng prompt string dahil nag-e-expand ang user-invoked skills sa print mode: claude -p "/fable-method $task". Asahang magkaiba ang cost profile nito sa system-prompt arm kahit pareho ang nakikitang behavior.

Mga hakbang at gastos

Parehong nag-write ng stream ng JSON events ang dalawang run. Ang huling linya ay isang result message na naglalaman ng final text, gastos, at session metadata. I-print ito nang isang beses at basahin bago ka mag-script ng anuman batay rito, dahil nagbabago ang mga field name sa bawat Claude Code release.

tail -1 ~/ab/control.jsonl | jq .

Makukuha sa linyang iyon ang cost per run. Ito ang numerong dapat ihambing:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Makukuha ang mga hakbang sa pamamagitan ng pagbibilang ng mga tool call sa parehong file:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Patakbuhin ito para sa parehong file. Mas maraming ipinapakita ng hugis ng pagkakaiba kaysa sa mga total. Kung mas maraming file ang binabasa at mas kaunti ang ine-edit ng method run, ginagawa nito ang hinihingi ng method. Iyan ang tradeoff na binabayaran mo. Kung pareho ang mga edit ngunit 40 percent na mas mataas ang gastos ng method run, wala itong naidagdag sa task na iyon.

Dalawang paalala tungkol sa mga numero. Una, huwag pagsama-samahin ang output_tokens mula sa session transcripts sa ilalim ng ~/.claude/projects/ at ituring itong total. Ang mga per-message usage block na iyon ay mga snapshot na kinukuha habang nagso-stream, at may mga ulat na minamaliit ng mga ito ang aktuwal na bilang. Ang result line ang dapat pagkatiwalaan. Ikalawa, anecdote lamang ang isang run bawat arm. Patakbuhin ang bawat arm nang tatlo o apat na beses sa parehong task bago ka maniwala sa isang agwat, dahil nagkakaiba na agad ang dalawang run ng parehong agent sa parehong task. Para sa mas pangmatagalang pagtingin sa gastos, ipinapaliwanag ng mga tool na sumusubaybay sa gastos ng Claude Code at kung paano nagbibilang ng tokens ang Claude Code kung bakit nangingibabaw ang mga cache line sa mga raw count.

Tiyaking walang access ang agent sa anumang mahalaga sa iyo habang unattended itong tumatakbo. Saklaw ng ligtas na pagpapatakbo ng Claude Code sa isang VPS ang user account at mga permission flag.

Tapat na pagbasa sa sariling eval ng repo

Ang headline ng README ay "Fifteen eval rounds, more than 260 agent runs, blind LLM judges that verify by diffing and executing." Mas marami itong ebidensiya kaysa sa halos anumang skill repo na nire-release, at ang eval/RESULTS.md ay isinulat kada round nang hindi inaalis ang mga failure. Gayunman, mas kaunti ang lalim nito kaysa sa ipinahihiwatig ng headline kapag tiningnan mo ang mga indibidwal na cell sa likod ng mga row ng headline.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Ang pinakamalaki sa 4 row na iyon ay nakabatay sa 4 run. Ang tatlo pa ay nakabatay sa tig-2 run. Malinaw itong sinasabi mismo ng repo sa mga palagiang limitasyon sa itaas ng log: "Maliit ang n sa kabuuan (1-4 run bawat cell), LLM judge (blind kapag maraming output ang ikinukumpara, pero nakabatay sa parehong frontier model na ginagamit bilang baseline), synthetic fixture, at research ground truth na kasing-bago lamang ng petsa ng run nito." Mas tuwiran pa: "Umiiral ang log na ito upang masubukan ang mga pagbabago sa method, hindi upang mapagkamalan ito ng sinuman na benchmark."

Bigyan ito ng nararapat na pagkilala. Ang author na naglalathala ng sariling n at tinutukoy ang problema na ang judge nito ay nakabatay sa parehong model na nagsisilbing baseline ay mas tapat kaysa sa karaniwang pamantayan sa kategoryang ito. Basahin ang mga numero bilang ebidensiyang aktuwal na nagpatakbo ng mga test ang author at itinago ang mga failure. Ang sarili mong A/B ang magsasabi sa iyo tungkol sa codebase mo.

Parehong malinaw ang README tungkol sa mga sitwasyong walang naitutulong ang method, at iyon ang pinakakapaki-pakinabang nitong talata. Wala itong naitalang pagtaas para sa karaniwang maliliit na task sa mga mahusay na model. Sinasabi nitong "hindi mapapabago ng method ang pagiging bago ng mga impormasyon ng model; nangingibabaw ang bare frontier sa mga research na nangangailangan ng maraming kaalaman." Itinuturo rin nito na nasa "mga bitag (mga conflict sa authority, maling pahayag ng completion, mahihinang executor, at mga unattended run), hindi sa lahat ng sitwasyon" ang halaga nito. Kung ang agent work mo ay maliliit na edit sa isang mahusay na model habang mino-monitor mo, asahang wala kang masusukat na pagbabago. Kung mas murang model ang nagpapatakbo nang unattended, doon dapat lumitaw ang agwat, kaya bahagi rin ng parehong desisyon ang pagpili sa pagitan ng Opus, Sonnet at Haiku.

Kapag cargo cult ang packaging

May apat na mahalagang puna, at wala sa mga ito ang dahilan para laktawan ang repo.

Mas nauuna ang framing kaysa sa ebidensya. Ang “How Claude Fable 5 worked” ay pahayag tungkol sa internal na paggana ng isang model na walang sinuman sa labas ng Anthropic ang makapagbeberipika. Pinahihina rin ito ng mismong pangunahing pahayag ng repo: “The quality lives in the structure, the evidence, and the honesty, not in the model.” Kung nasa structure ang kalidad, dekorasyon lamang ang kuwento tungkol sa pinagmulan. Sapat na ang procedure sa sarili nito at hindi nito kailangan ng alamat tungkol sa pinagmulan.

Mas marami ang ipinapakitang surface area ng four skills kaysa sa kailangan ng content. fable-loop inuulit ang malaking bahagi ng fable-method, na binalutan lamang ng orchestration, at sa harness na walang subagents ay bumabalik ito sa fable-method. Basahin muna nang magkatabi ang dalawang file bago mo i-install ang pareho.

Ang eight domain adapters ay lawak na hindi sinusuri ng eval. Dalawa lamang sa walo ang lumilitaw kahit saan sa log: marketing sa round 9 at devops sa round 12. Kasama sa release ang finance, legal, design, at data adapters, pero walang round na sumubok sa mga ito. Maaaring mahusay pa rin ang adapter para sa field mo. Draft pa rin ito ng author, gayunman, at hindi pa ito nakalampas sa isang trap fixture.

Hindi rin nagtutugma ang installer at ang repo tungkol sa mga kasama sa release nito. Kumokopya ang installer ng tatlo sa apat na skills papunta sa ~/.claude/skills. Maliit lamang ang puwang na iyon. Ganito rin ang uri ng puwang na nagpapakitang mas mabilis umusad ang packaging kaysa sa review, kaya dapat mo itong tandaan kapag nagpapasya kung gaano kalaki ang gagamitin mo rito nang sabay-sabay.

Mga dapat panatilihin kung wala nang iba

Alisin ang branding, at apat na panuntunan ang mananatiling kapaki-pakinabang anuman ang agent na gamitin mo.

  • Ang authorization quote. Ang isang hindi na maibabalik o nakaharap sa labas na action ay nangangailangan ng mismong mga salita ng user, na nakasulat bilang isang AUTH: line. Ang agent na hindi makahanap ng quote ay hindi kikilos.
  • Ang twin check. Pagkatapos ayusin ang isang depekto, hanapin sa buong project ang kaparehong maling construct at i-report ang count, pati na kapag zero ang count.
  • Verification sa pamamagitan ng observation. Kapag may green targeted check ngunit sira ang build na pinapatungan nito, failed verification iyon, hindi pass.
  • Outcome-first reporting, kasama ang malinaw na caveat tungkol sa anumang nilaktawan o nanatiling hindi na-verify sa halip na tahimik itong alisin sa report.

Walang gastos ang pag-adopt sa apat na ito, at maaari mong gamitin ang grep para i-check ang compliance. Magsimula roon, sukatin gamit ang harness sa itaas, at saka magpasya kung karapat-dapat sa bahagi ng iyong context budget ang natitirang repo. Kung gusto mong bigyan ang agent ng permanenteng project context sa halip na working method, isang DESIGN.md na binabasa ng mga agent bago sila mag-edit ang katambal na hakbang.

FAQ

Gumagana ba ang Fable method sa mga model maliban sa Claude?

Gumagana ang method text. Isa itong nakaayos na prompt na walang code na partikular sa isang model, at kasama sa repo ang AGENTS.md bilang portable na kopya para sa Codex, Cursor, aider, o raw system prompt. May dalawang bagay na hindi naililipat. Ang /fable-method at /fable-judge ay Claude Code slash command, kaya sa ibang environment, gamitin ang method sa pamamagitan ng paglalarawan dito. Ipinapalagay naman ng fable-loop na may harness na kayang magpatakbo ng parallel subagent sa magkakaibang model; kung wala nito, serial itong tumatakbo at ibinibigay sa iyo ang fable-method gamit ang karagdagang hakbang.

Mas maraming token ba ang nagagamit kapag pinapatakbo ang mga skill na ito?

Oo, at nakadepende ang dami sa paraan ng pag-load mo sa mga ito. Kapag naka-install bilang skill, nilo-load lamang ang body kapag tumutugma ang description sa task, kaya halos walang dagdag na gastos ang hindi kaugnay na request. Kapag inilagay sa system prompt, kasama sa bawat request ang humigit-kumulang 2,600 salita ng AGENTS.md. Mas malaki rin ang gastos sa mismong run dahil humihingi ang method ng orientation bago mag-edit, ebidensiya bago magpasya, at aktuwal na verification pagkatapos. Sukatin ito: patakbuhin ang parehong task gamit ang --output-format json sa dalawang arm at ikumpara ang total_cost_usd field.

Aling version ng fable-method ang dapat kong i-install, at bakit kailangan itong i-pin?

Patakbuhin ang git checkout v1.4.0 bago mag-install. Ang tag na iyon ay may petsang 2026-07-15 at ito pa rin ang pinakabago noong August 2026. Nag-publish ang repo ng limang release sa siyam na araw bago nito, at binago ng v1.4.0 ang mismong mga routing rule. Kapag sinusubaybayan mo ang main habang nagsusukat, maaaring magbasa ang control run at test run mo ng magkaibang instruction, kaya walang saysay ang paghahambing. Itala ang tag kasama ng mga resulta mo.

Benchmark ba ang eval sa repo na mapagkakatiwalaan ko?

Ituring ito bilang change log para sa method, gaya ng tawag dito ng author nito: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark." Nakasaad sa itaas ng file ang mga limitasyon: 1 hanggang 4 na run bawat cell, synthetic fixture, at LLM judge na binuo gamit ang parehong frontier model na nagsisilbi ring baseline. Totoo ang mga round at isinama ang mga nabigong experiment, na higit sa karaniwang inilalathala ng karamihan sa repo. Hindi pa rin ito pagsukat ng mangyayari sa codebase mo, kaya patakbuhin mo mismo ang two-arm comparison.