SSD Nodes Learn Hosting plans →
מדריכים Matt Connorמאת Matt Connor · עודכן 2026-08-31

שיטת Fable: יכולות לסוכנים בכל מודל

מה כולל המאגר fable-method, אילו הרגלים של Claude Fable 5 עוברים למודלים אחרים, ואיך להשוות עם ובלי השיטה על VPS לפי קריאות לכלים ועלות.

מה שיטת Fable טוענת בפועל

שיטת Fable היא אוסף קטן של skills לסוכן, המתעד את דפוסי העבודה של מודל אחד כנוהל מסודר, כדי שמודל אחר יוכל לבצע את אותו נוהל. המאגר הוא Sahir619/fable-method, ברישיון MIT, והתיאור שלו בשורה אחת הוא: "האופן שבו Claude Fable 5 עבד, מזוקק ל־skills שכל מודל יכול להפעיל, יחד עם הערכה ששומרת על אמינותו." הטענה שראוי לבדוק היא החלק השני של המשפט.

אין אפשרות לאיש מחוץ ל־Anthropic לבדוק אם קובץ טקסט אכן מתעד את אופן החשיבה של מודל מסוים. לעומת זאת, אפשר לבדוק בעצמכם אם מודל זול יותר מתנהג אחרת לאחר שהוא קורא את קובץ הטקסט הזה — על VPS אחד ובמהלך אחר צהריים אחד. המדידה הזו היא מטרת כל מה שמופיע בהמשך: לבצע את אותה משימה פעמיים, עם השיטה ובלעדיה, ולספור קריאות לכלים ואת העלות.

אם המונח skill חדש לכם, התחילו ב־מהו skill של סוכן בפועל: תיקייה המכילה קובץ SKILL.md, שהתיאור ב־frontmatter שלו מורה לסוכן מתי לטעון את גוף הקובץ. המודל שעל שמו נקרא המאגר מתואר ב־כמה עולה Claude Fable 5 ובמה הוא מצטיין.

התקינו את היכולות וקבעו את הגרסה שנבדקה

יש שתי דרכי התקנה. בתוך Claude Code, דרך התוסף כוללת שתי פקודות:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

ב־VPS, שבו נדרש עותק עם גרסה קבועה על הדיסק, שכפלו את המאגר ועברו תחילה ל־tag:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh אינו דורש sudo, משום שהוא כותב רק תחת $HOME/.claude/skills. לאחר ההרצה, ls ~/.claude/skills מציג את fable-judge, את fable-loop ואת fable-method. בדקו מה אינו מופיע. המאגר כולל ארבע יכולות, אך תוכנית ההתקנה של ה־shell מעתיקה שלוש מהן. לכן משתמש עצמאי אינו מקבל את fable-domain, אלא אם הוא מעתיק אותו ידנית:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

קבעו את ה־tag, וכתבו אותו לצד התוצאות שתקבלו. המאגר פרסם חמש גרסאות בין 2026-07-06 ל־2026-07-15, מ־v1.0.0 עד v1.4.0. ב־v1.4.0 שונתה השיטה עצמה באמצעות הוספת שער ניתוב חדש. נכון לאוגוסט 2026, v1.4.0 הוא ה־tag החדש ביותר. אם הרצת הבקרה קוראת גרסה אחת של הכללים והרצת הבדיקה קוראת גרסה אחרת, לא מדדתם דבר.

מה כל אחד מארבעת היכולות מורה למודל לעשות

הקובץ המרכזי הוא skills/fable-method/SKILL.md. הוא כולל שני שערים ושבעה שלבים ממוספרים, והכללים שלו מפורטים מספיק כדי להתווכח איתם.

שער הטריוויאליות מופיע ראשון: פעל ישירות, בלי טקסים מיותרים, כאשר השינוי נוגע לקובץ אחד, מתבצע בכ־10 שורות או פחות, אינו מוסיף התנהגות חדשה, וכבר ברור לך בדיוק מה צריך לשנות. יכולת נפרדת שלמה מבוססת רק על האינטואיציה הזאת, Ponytail, שמכוונת את הסוכן לבצע את השינוי הקטן ביותר שעובד, וכלל הליבה שלה קצר מספיק כדי להעתיק להנחיות שלך בלי להתקין דבר. לאחר מכן מגיע שער ההתאמה, שמנתב את הבקשה לפי המקום שבו נמצאת התשובה: מקורות שאפשר לפתוח, טכניקה שצריך לחקור תחילה, או הסקה עצמאית, שאותה יש לסמן ברמת ביטחון נמוכה ולא להציג כעובדה. הענף האמצעי הזה פועל רק אם הסוכן יכול לגשת בפועל לאינטרנט. ב־VPS מוגבל, פירוש הדבר הוא לספק לו מנגנון חיפוש משלו, כגון מופע SearXNG באירוח עצמי שנחשף ככלי חיפוש JSON.

לאחר מכן מגיע הלולאה: סווג את הבקשה, הגדר מה נחשב לסיום, אסוף ראיות, החלט, פעל, אמת ודווח. שלב 2 קובע שיש להתמצא באמצעות הצגת תוכן התיקייה לפני בחירת קבצים, להעדיף מקורות ראשוניים על פני זיכרון, ולעצור לאחר שתי חיפושים רצופים שלא החזירו דבר חדש. שלב 4 קובע שיש לכתוב שורת INTENT: לפני כל עריכה. בשורה יש לציין מה הקוד עושה, מה בדיקת הכשל מצפה לקבל ומה המפרט קובע. כאשר שלושת הדברים האלה אינם תואמים, אין לערוך כלל, משום שאי־ההתאמה היא הממצא האמיתי. שלב 5 מגביל את מספר הניסיונות: לאחר שלושה מחזורי תיקון ואימות שנכשלו באותה בעיה, יש לעצור ולהחזיר את פלט הבדיקה בפועל.

החלק שניתן לבדוק בקלות הרבה ביותר בקובץ הוא ארבעת אסימוני הדיווח שלו. שינוי התנהגות מחייב שורת INTENT:. פעולה הפונה החוצה מחייבת AUTH: user said "<exact words>", בציטוט המשתמש, משום שהמאגר קובע במפורש שתיעוד אינו הרשאה. פעולה שנקבעה אך לא בוצעה מחייבת שורת PENDING:. תקלה שתוקנה מחייבת TWINS: searched <pattern> - found <N> other sites. אין צורך לסמוך על שום דבר בשיטה כדי לבדוק אם ארבעת המחרוזות האלה מופיעות כאשר נדרש להציגן. לכן כל השיטה ניתנת למדידה, במקום להסתמך על תחושות.

fable-loop היא אותה שיטה המופעלת כתזמור בארבעה שלבים: תכנן באמצעות סוכני משנה מקביליים לאיסוף ראיות, בצע ב־main thread, אמת באמצעות סוכן משנה אחד עד שלושה לתקיפה, כאשר כל אחד מהם משתמש בזווית בדיקה אחרת, ולאחר מכן בצע ביקורת ודווח. היא מניחה שימוש במודלים זולים בתפקידי איסוף הראיות והתקיפה, ובמודל חזק יותר לקבלת החלטות ולביצוע עריכות.

fable-judge היא הרכיב שכדאי להתקין גם אם משליכים את כל השאר. נקודת המוצא שלו היא ש"דוח הוא אוסף טענות, לא ראיות". הוא אוסף את הטענות מדוח שהושלם, קובע את המציאות בפועל באמצעות git diff ו־git status, מריץ מחדש כל בדיקת אימות שהדוח טוען כי בוצעה, ומחפש רשימת הונאות מוגדרת: החלשת בדיקות, דיווח כוזב על השלמה, הרחבת scope, פעולה ללא הרשאה, הפרת המפרט ושאריות לא רצויות. הוא מחזיר VERIFIED, VERIFIED WITH CAVEATS או REFUTED, ומסמן כל דבר שאינו ניתן לשחזור כ־UNVERIFIABLE במקום להניח שהבדיקה עברה. שורת הסיום של תוכנית ההתקנה מפנה אליו בעצמה: "כדאי לנסות: פתח את Claude Code והקלד /fable-judge לאחר שסוכן כלשהו טוען שהעבודה הושלמה." אם עדיף לך לשלב את הבדיקה בתהליך העבודה במקום להריץ אותה לאחר מכן, יכולת Old Coder גורמת לסוכן להפיק SPEC שאתה מאשר ודוח EVIDENCE שאפשר להריץ מחדש באופן עצמאי, כאשר mutation testing משמש כתחליף ל־coverage כהוכחה שבדיקה אכן תזהה regression.

fable-domain מפיקה חבילות מתאמי תחום עם fixtures למלכודות ו־smoke evals. נשלחים שמונה מתאמים: שיווק, מחקר, ניתוח נתונים, עסקים ותפעול, כספים, משפט וציות, עיצוב ו־UX, ו־devops. עבודה רפואית וקלינית נותרה בכוונה ללא מתאם.

אילו חלקים ניתנים להעברה למודל אחר ואילו לא

המאגר עונה על כך ישירות באמצעות AGENTS.md, שנפתח במשפט: "גרסה ניידת לכל סוכן קוד או תשתית הרצה (Codex, Cursor, aider, הנחיית מערכת גולמית). השיטה זהה ל־SKILL.md; הדביקו את הקובץ בהנחיות הסוכן או הציבו אותו בתיקיית השורש של המאגר בשם AGENTS.md." הקובץ כולל כ־2,600 מילים ומכיל את אותם שערי בקרה, שלבים ומצבי פעולה. אם אתם כבר משתמשים בקובצי הנחיות בתיקיית השורש של המאגר, המוסכמה של AGENTS.md ושל HUMAN.md מבהירה היכן להציב את הקובץ ומי קורא אותו.

שני חלקים ניתנים להעברה ללא שינוי מהותי. טקסט השיטה הוא הנחיה מסודרת שאינה כוללת קוד ספציפי למודל, ולכן כל מודל שמסוגל לפעול לפי הנחיות יכול לפעול לפיה. התזה המוצהרת של המאגר היא שמאמץ ההעברה עומד ביחס הפוך לרמת המודל. גם השופט ניתן להעברה, כל עוד לסוכן יש shell ומאגר, משום שכל פעולותיו הן git diff בתוספת הרצה חוזרת של פקודות שגם הקורא יכול להריץ.

חלק אחד אינו ניתן להעברה ללא התאמות. fable-loop מניח שתשתית ההרצה יכולה להפעיל תת־סוכנים במקביל ולנתב אותם למודלים שונים. סוכן ללא תת־סוכנים יריץ את השלבים האלה בזה אחר זה על מודל יחיד. כך נעלמים המקביליות והחיסכון בעלויות, שהיו ההצדקה לתכנון הזה. מה שנשאר הוא fable-method עם אוצר מילים נוסף.

שני היבטים קטנים יותר תלויים בתשתית ההרצה, וקל לפספס אותם. הטריגר /fable-method הוא פקודת slash של Claude Code, ולכן בתשתית אחרת מפעילים את השיטה באמצעות תיאור שלה. תיאור ה־frontmatter ב־SKILL.md הוא שמאפשר לסוכן לטעון את גוף התוכן רק כאשר הוא מתאים למשימה. לכן skill מותקן כמעט שאינו כרוך בעלות עד להפעלתו. אם מדביקים את AGENTS.md בהנחיית מערכת במקום זאת, 2,600 המילים האלה נשלחות בכל בקשה, בין אם מדובר בתיקון שגיאת כתיב בשורה אחת ובין אם מדובר ב־refactor. זהו הבדל ממשי בעלות, וזו הסיבה העיקרית לקיומה של אריזת ה־skill מלכתחילה.

איך לבצע בדיקת A/B ב־VPS: אותה משימה, פעמיים

הגדירו שני עותקי עבודה זהים, כך שאף אחת מההרצות לא תוכל לראות את השינויים של האחרת. החליפו את YOUR_ORG/YOUR_REPO במאגר שברצונכם לבדוק; שני השיבוטים חייבים להגיע מאותו commit.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

בחרו משימה שהתוצאה שלה ניתנת לצפייה ללא שיקול דעת: בדיקה כושלת שחייבת לעבור, או סקריפט שחייב להסתיים עם קוד יציאה 0. משימה מעורפלת מובילה להשוואה מעורפלת, משום שבסופו של דבר אתם מדרגים טקסט במקום תוצאות.

הריצו את קבוצת הביקורת באמצעות --bare, שמדלג על גילוי אוטומטי של hooks, skills, plugins ו־CLAUDE.md. הדגל הזה הוא שהופך את ההרצה לקבוצת ביקורת: ה־skills שהתקנתם קודם אינם יכולים לדלוף אליה. מצב bare אינו משתמש בהתחברות למינוי שלכם, לכן הגדירו תחילה מפתח API מתוך Claude Console.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

הרצת השיטה משתמשת באותה פקודה, בתוספת דגל אחד שטוען את השיטה הניידת כתוספת ל־system prompt:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

אותו בינארי, אותו מודל, אותם כלים ואותו עץ התחלתי. רק דגל אחד שונה, וזו הדרך היחידה שבה יש משמעות להשוואה.

התכנון הזה מודד את טקסט השיטה. הוא אינו מודד את אריזת ה־skill, וזו שאלה נפרדת. כדי למדוד את האריזה, השמיטו את --bare, התקינו את ה־skills כפי שתואר לעיל, והכניסו את שם ה־skill בתוך מחרוזת ה־prompt, משום ש־skills שהמשתמש מפעיל מתרחבים במצב הדפסה: claude -p "/fable-method $task". צפו שפרופיל העלויות יהיה שונה מזה של ההרצה עם system prompt, גם כאשר ההתנהגות הנראית זהה.

ספירת השלבים והעלות

שתי ההרצות כתבו רצף של אירועי JSON. השורה האחרונה היא הודעת result שמכילה את הטקסט הסופי, את העלות ואת מטא־הנתונים של הסשן. הדפיסו אותה פעם אחת וקראו אותה לפני שתכתבו סקריפט שמסתמך עליה, משום ששמות השדות משתנים בין גרסאות Claude Code.

tail -1 ~/ab/control.jsonl | jq .

העלות להרצה מתקבלת מאותה שורה, וזהו המספר שיש להשוות:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

את מספר השלבים מקבלים באמצעות ספירת קריאות הכלים באותו קובץ:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

הריצו זאת עבור שני הקבצים. המבנה של ההבדל מלמד יותר מסכומי העלות הכוללים. הרצה של שיטה שקוראת יותר קבצים ומבצעת פחות עריכות פועלת כפי שהשיטה דורשת, וזהו המחיר שאתם משלמים עבור הבחירה הזאת. אם הרצה של שיטה ביצעה את אותן עריכות ועלתה ארבעים אחוזים יותר, לא קיבלתם תמורה נוספת עבור המשימה.

שתי אזהרות בנוגע למספרים. ראשית, אל תחברו את output_tokens מתמלילי הסשנים תחת ~/.claude/projects/ ותכנו את התוצאה הסכום הכולל. בלוקי השימוש האלה, המופיעים בכל הודעה, הם תמונות מצב שנלקחות במהלך הזרמת הנתונים, ויש דיווחים פתוחים שלפיהם הם סופרים פחות מהערך בפועל. השורה result היא הנתון שיש לסמוך עליו. שנית, הרצה אחת לכל זרוע ניסוי היא אנקדוטה בלבד. הריצו כל זרוע שלוש או ארבע פעמים על אותה משימה לפני שתסיקו שמדובר בפער אמיתי, משום ששתי הרצות של אותו agent על אותה משימה כבר עשויות להיות שונות זו מזו. לקבלת תמונה ארוכת טווח של ההוצאות, הכלים שעוקבים אחר הוצאות Claude Code ו־האופן שבו Claude Code סופר טוקנים מסבירים מדוע שורות ה־cache שולטות בספירות הגולמיות.

ודאו של־agent אין גישה לשום דבר שחשוב לכם בזמן שהוא פועל ללא השגחה. הפעלת Claude Code בצורה בטוחה על VPS עוסקת בחשבון המשתמש ובדגלי ההרשאות.

הערכה עצמית של המאגר, בקריאה מפוכחת

הכותרת הראשית ב־README היא "Fifteen eval rounds, more than 260 agent runs, blind LLM judges that verify by diffing and executing." זהו מידע מבוסס יותר מכמעט כל מאגר skills שמופץ, ו־eval/RESULTS.md מתועד סבב אחר סבב, כולל הכשלים. עם זאת, התמונה דלה יותר מכפי שמספר הכותרת מרמז, כאשר בוחנים את התאים הבודדים שמאחורי שורות הכותרת.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

הגדולה מבין 4 השורות האלה מבוססת על 4 הרצות. שלוש השורות האחרות מבוססות על 2 הרצות כל אחת. המאגר מציין זאת בעצמו, במגבלות הקבועות בראש יומן ההרצות: "Small n throughout (1-4 runs per cell), LLM judges (blind where multiple outputs are compared, but built on the same frontier model that appears as a baseline), synthetic fixtures, research ground truth only as current as its run date." ובהמשך, באופן ישיר יותר: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark."

יש לתת לכך קרדיט. מחבר שמפרסם את ה־n שלו ומציין שהשופט שלו מבוסס על אותו מודל שמשמש כבסיס להשוואה, נוהג בכנות רבה יותר מהמקובל בקטגוריה הזו. קראו את המספרים כראיה לכך שהמחבר אכן ביצע את ההרצות ושמר את הכשלים. בדיקת ה־A/B שלכם היא שתלמד אתכם על בסיס הקוד שלכם.

ה־README ברור באותה מידה לגבי המקומות שבהם השיטה אינה מועילה, וזו הפסקה השימושית ביותר בו. הוא אינו מתעד שיפור במשימות קטנות ושגרתיות על מודלים בעלי יכולת. הוא מציין כי "the method cannot make a model's facts fresher; bare frontier wins knowledge-heavy research". הוא גם ממקם את הערך ב־"traps (authority conflicts, false completion claims, weak executors, unattended runs), not everywhere". אם העבודה של ה־agent שלכם מסתכמת בעריכות קטנות במודל חזק, כאשר אתם משגיחים עליו, אל תצפו למדוד שיפור כלשהו. אם מדובר במודל זול יותר שפועל ללא השגחה, שם אמור להופיע פער, ולכן גם הבחירה בין Opus, Sonnet ו־Haiku היא חלק מאותה החלטה.

כאשר האריזה הופכת לפעולת העתקה ללא הבנה

יש מקום לארבע ביקורות, ואף אחת מהן אינה סיבה לוותר על המאגר.

המסגור מקדים את הראיות. הטענה "כיצד Claude Fable 5 פעל" עוסקת במנגנונים הפנימיים של מודל, ואיש מחוץ ל־Anthropic אינו יכול לאמת אותה. נוסף על כך, המשפט המרכזי במאגר עצמו מחליש את הטענה: "האיכות נמצאת במבנה, בראיות ובכנות, ולא במודל." אם האיכות נמצאת במבנה, סיפור המקור הוא קישוט. ההליך עומד בפני עצמו ואינו זקוק למיתוס מקור.

ארבעה כישורים הם שכבת ממשק רחבה יותר מכפי שהתוכן דורש. fable-loop חוזר על חלק גדול מ־fable-method, בתוספת תזמור, ובסביבת הרצה ללא סוכני משנה הוא מצטמצם חזרה ל־fable-method. קראו את שני הקבצים זה לצד זה לפני שתתקינו את שניהם.

שמונה מתאמים לתחומים שונים הם רוחב שהערכת הביצועים אינה מכסה. רק שניים מתוך השמונה מופיעים ביומן: marketing בסבב 9 ו־devops בסבב 12. המתאמים ל־finance, ל־legal, ל־design ול־data מגיעים ללא סבב תואם. המתאם לתחום שלכם עדיין עשוי להיות טוב. עם זאת, מדובר בטיוטה של המחבר, ולא ברכיב ששרד בדיקת קצה מתוכננת.

נוסף על כך, תוכנית ההתקנה אינה תואמת למאגר בכל הנוגע לתכולה שהוא מספק, ומעתיקה שלושה מתוך ארבעת הכישורים אל ~/.claude/skills. זה פער קטן. הוא גם מסוג הפערים שמראים שהאריזה התקדמה מהר יותר מהבקרה עליה, וכדאי לזכור זאת כאשר מחליטים כמה מהתכולה לאמץ בכל פעם.

מה לשמר גם אם אינכם משמרים דבר אחר

הסירו את המיתוג, וארבעה כללים יעמדו בפני עצמם, בלי קשר לסוכן שבו אתם משתמשים.

  • ציטוט ההרשאה. פעולה בלתי הפיכה או פעולה הפונה החוצה מחייבת את מילותיו של המשתמש עצמו, כשהן כתובות בשורת AUTH:. סוכן שאינו מוצא ציטוט אינו פועל.
  • הבדיקה הכפולה. לאחר תיקון פגם, חפשו בכל הפרויקט את אותו מבנה שגוי ודווחו על מספר המופעים, גם כאשר המספר הוא 0.
  • אימות באמצעות תצפית. בדיקה ממוקדת שעברה בהצלחה, אך פועלת על גבי build שבור, אינה אימות מוצלח אלא אימות שנכשל.
  • דיווח המתחיל בתוצאה, תוך ציון של כל מה שנדחה או נותר ללא אימות כהסתייגות, במקום להשמיט זאת בשקט.

אימוץ ארבעת הכללים האלה אינו עולה דבר, ואפשר להשתמש ב־grep כדי לבדוק עמידה בהם. התחילו כאן, מדדו באמצעות ה־harness שלעיל, ולאחר מכן החליטו אם יתרת המאגר מצדיקה את חלקה מתקציב ההקשר שלכם. אם ברצונכם לספק לסוכן הקשר קבוע של הפרויקט, במקום שיטת עבודה, קובץ DESIGN.md שסוכנים קוראים לפני שהם עורכים הוא הצעד המשלים.

FAQ

האם שיטת Fable עובדת עם מודלים שאינם Claude?

טקסט השיטה עצמו כן. זהו prompt מסודר שאינו כולל קוד התלוי במודל מסוים, וה־repo כולל את AGENTS.md כעותק נייד עבור Codex, Cursor, aider או system prompt גולמי. שני דברים אינם ניידים. ה־/fable-method וה־/fable-judge הם פקודות slash של Claude Code, ולכן בסביבות אחרות מפעילים את השיטה באמצעות תיאור שלה. ה־fable-loop מניח harness שיכול להפעיל subagents מקבילים על מודלים שונים; בלעדיו, הוא רץ באופן סדרתי ומספק לכם fable-method עם שלבים נוספים.

האם הפעלת skills אלה צורכת יותר tokens?

כן, והכמות תלויה באופן הטעינה שלהם. כאשר מתקינים אותם כ־skills, גוף התוכן נטען רק כאשר התיאור תואם את המשימה, ולכן בקשה שאינה קשורה כמעט אינה מוסיפה עלות. כאשר מדביקים אותם בתוך system prompt, כ־2,600 המילים של AGENTS.md מצורפות לכל בקשה. גם ההרצה עצמה יקרה יותר, משום שהשיטה דורשת התמצאות לפני העריכה, ראיות לפני קבלת החלטה ואימות ממשי לאחר מכן. מדדו זאת: הריצו את אותה משימה עם --output-format json בשתי הזרועות והשוו את השדה total_cost_usd.

איזו גרסה של fable-method עליי להתקין, ומדוע להצמיד אותה לגרסה מסוימת?

הריצו git checkout v1.4.0 לפני ההתקנה. התג הזה מתוארך ל־2026-07-15, ועדיין היה החדש ביותר באוגוסט 2026. ה־repo פרסם חמש מהדורות בתשעת הימים שקדמו לכך, ו־v1.4.0 שינה את כללי הניתוב עצמם. מעקב אחר main בזמן המדידה גורם לכך שהרצת הבקרה והרצת הבדיקה עשויות לקרוא הוראות שונות, ולכן ההשוואה מאבדת את משמעותה. תעדו את התג לצד התוצאות.

האם ה־eval שב־repo הוא benchmark שאפשר לסמוך עליו?

התייחסו אליו כאל יומן שינויים של השיטה, כפי שמחברו מגדיר אותו: "This log exists so method edits are tested, not so anyone mistakes it for a benchmark." המגבלות מצוינות בראש הקובץ: 1 עד 4 הרצות לכל תא, fixtures סינתטיים ושופטי LLM המבוססים על אותו frontier model שמשמש גם כ־baseline. הסבבים אמיתיים, והניסויים שנכשלו נשמרו, וזה יותר ממה שרוב ה־repos מפרסמים. עם זאת, זה עדיין אינו מדד למה שיקרה ב־codebase שלכם, ולכן בצעו בעצמכם את ההשוואה בשתי הזרועות.