SSD Nodes Learn Hosting plans →
Anleitungen Matt ConnorVon Matt Connor · Aktualisiert 2026-08-25

Fable-Methode: Agent-Skills für jedes Modell testen

Das Repo fable-method überträgt Claude Fable 5s Arbeitsweise in Agent-Skills. Lesen Sie, was jede Datei leistet und wie Sie den Effekt per A/B-Test auf einem VPS prüfen.

Was die Fable-Methode tatsächlich behauptet

Die Fable-Methode besteht aus einer kleinen Sammlung von Agent-Skills. Sie hält die Arbeitsweise eines Modells als geordnetes Verfahren fest, damit ein anderes Modell dasselbe Verfahren ausführen kann. Das Repository ist Sahir619/fable-method, steht unter der MIT-Lizenz und beschreibt sich selbst in einem Satz als „how Claude Fable 5 worked, distilled into skills any model can run, with the eval that keeps it honest.“ Aussagekräftig ist die zweite Hälfte dieses Satzes.

Ob eine Textdatei tatsächlich festhält, wie ein bestimmtes Modell gedacht hat, kann niemand außerhalb von Anthropic überprüfen. Ob sich ein günstigeres Modell anders verhält, wenn es diese Textdatei liest, können Sie dagegen selbst überprüfen: auf einem VPS und an einem Nachmittag. Genau darum geht es im Folgenden: dieselbe Aufgabe zweimal ausführen, einmal mit und einmal ohne die Methode, und dabei Tool-Aufrufe und Kosten zählen.

Wenn der Begriff Skill für Sie neu ist, beginnen Sie mit was ein Agent-Skill tatsächlich ist: einem Ordner mit einer SKILL.md-Datei, deren Frontmatter-Beschreibung dem Agenten mitteilt, wann er den Inhalt laden soll. Das Modell, nach dem das Repository benannt ist, wird unter was Claude Fable 5 kostet und wofür es geeignet ist behandelt.

Installieren Sie die Skills und fixieren Sie die getestete Version

Es gibt zwei Installationswege. In Claude Code besteht der Plugin-Weg aus zwei Befehlen:

/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-method

Auf einem VPS, auf dem Sie eine festgelegte Kopie auf der Festplatte benötigen, klonen Sie zuerst das Repository und wechseln Sie dann zu einem Tag:

git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skills

install.sh benötigt kein sudo, da der Befehl nur unter $HOME/.claude/skills schreibt. Nach der Ausführung listet ls ~/.claude/skills fable-judge, fable-loop und fable-method auf. Prüfen Sie, was dort nicht enthalten ist. Das Repository enthält vier Skills, und das Shell-Installationsskript kopiert drei davon. Daher erhält ein eigenständiger Benutzer fable-domain nicht, sofern er den Skill nicht manuell kopiert:

cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/

Fixieren Sie den Tag und notieren Sie ihn neben den Ergebnissen, die Sie erhalten. Dieses Repository veröffentlichte zwischen 2026-07-06 und 2026-07-15 fünf Releases, von v1.0.0 bis v1.4.0. v1.4.0 änderte die Methode selbst, indem ein neues Routing-Gate hinzugefügt wurde. Im August 2026 ist v1.4.0 weiterhin der aktuellste Tag. Wenn Ihr Kontrolllauf eine Version der Regeln und Ihr Testlauf eine andere Version verwendet, haben Sie nichts gemessen.

Was die vier Skills dem Modell vorgeben

Die zentrale Datei ist skills/fable-method/SKILL.md. Sie enthält zwei Prüfungen und sieben nummerierte Schritte. Ihre Regeln sind so konkret, dass man sie auf Einzelfälle anwenden kann.

Die Trivialitätsprüfung kommt zuerst: Handeln Sie direkt und ohne Formalitäten, wenn die Änderung nur eine Datei betrifft, ungefähr 10 Zeilen nicht überschreitet, kein neues Verhalten einführt und bereits genau bekannt ist, was geändert werden muss. Ein vollständig eigener Skill basiert allein auf diesem Grundsatz: Ponytail führt einen Agenten zur kleinsten funktionierenden Änderung. Seine Kernregel ist kurz genug, um sie ohne Installation in die eigenen Anweisungen zu übernehmen. Danach folgt die Passungsprüfung. Sie ordnet die Anfrage danach ein, wo die Antwort zu finden ist: in zugänglichen Quellen, in einer Technik, die zuerst recherchiert werden muss, oder in einer eigenen Schlussfolgerung. Letztere muss als wenig zuverlässig gekennzeichnet werden und darf nicht als Tatsache erscheinen. Der mittlere Zweig funktioniert nur, wenn der Agent das Web tatsächlich erreichen kann. Auf einem abgeschotteten VPS bedeutet das, ihm ein eigenes Such-Backend bereitzustellen, etwa eine selbst gehostete SearXNG-Instanz, die als JSON-Suchtool bereitgestellt wird.

Dann folgt die Schleife: Anfrage klassifizieren, Abschlusskriterien festlegen, Belege sammeln, entscheiden, handeln, prüfen, berichten. Schritt 2 verlangt, dass der Agent sich zunächst orientiert, indem er das Verzeichnis auflistet, bevor er Dateien auswählt. Primärquellen sollen gegenüber dem Erinnerungsvermögen bevorzugt werden. Nach zwei aufeinanderfolgenden Abfragen ohne neue Ergebnisse soll die Recherche beendet werden. Schritt 4 verlangt vor jeder Änderung eine Zeile mit INTENT:. Darin wird angegeben, was der Code tut, was die fehlgeschlagene Prüfung erwartet und was die Spezifikation vorgibt. Wenn diese drei Angaben nicht übereinstimmen, darf überhaupt keine Änderung vorgenommen werden, weil die Abweichung selbst das eigentliche Ergebnis ist. Schritt 5 begrenzt die Wiederholungsversuche: Nach drei fehlgeschlagenen Korrektur- und Prüfzyklen für dasselbe Problem soll der Agent stoppen und die tatsächliche Ausgabe zurückgeben.

Der am einfachsten prüfbare Teil der Datei sind ihre vier Berichtstoken. Eine Verhaltensänderung erfordert eine Zeile mit INTENT:. Eine nach außen gerichtete Aktion erfordert AUTH: user said "<exact words>" mit einem Zitat des Benutzers, weil das Repository ausdrücklich festhält, dass Dokumentation keine Autorisierung darstellt. Eine vorgeschriebene, aber nicht ausgeführte Aktion erfordert eine Zeile mit PENDING:. Ein behobener Fehler erfordert TWINS: searched <pattern> - found <N> other sites. Sie müssen der Methode nicht grundsätzlich vertrauen, um zu prüfen, ob diese vier Zeichenfolgen dort erscheinen, wo sie erforderlich sind. Dadurch wird der gesamte Ablauf messbar und bleibt nicht von einem bloßen Eindruck abhängig.

fable-loop führt dieselbe Methode als Orchestrierung in vier Phasen aus: Planung mit parallel arbeitenden Subagenten für die Beweiserhebung, Ausführung im Hauptthread, Prüfung mit einem bis drei Angreifer-Subagenten, die jeweils eine andere Perspektive einnehmen, sowie anschließendes Audit und Reporting. Für die Rollen bei der Beweiserhebung und beim Angriff werden kostengünstige Modelle vorausgesetzt. Für Entscheidungen und Änderungen wird ein leistungsfähigeres Modell verwendet.

fable-judge ist der Bestandteil, dessen Installation sich auch dann lohnt, wenn Sie den Rest verwerfen. Seine Grundannahme lautet: „Ein Bericht ist eine Menge von Behauptungen, kein Beleg.“ Der Skill sammelt die Behauptungen aus einem fertigen Bericht, ermittelt anhand von git diff und git status die tatsächliche Grundlage, führt jede im Bericht als ausgeführt bezeichnete Prüfung erneut aus und sucht nach einer benannten Liste möglicher Täuschungen: abgeschwächte Prüfungen, fälschlich gemeldeter Abschluss, Ausweitung des Umfangs, nicht autorisierte Aktionen, Abweichung von der Spezifikation und zurückgebliebene Artefakte. Das Ergebnis lautet VERIFIED, VERIFIED WITH CAVEATS oder REFUTED. Alles, was sich nicht reproduzieren lässt, wird als UNVERIFIABLE markiert, statt als bestanden zu gelten. Die abschließende Zeile des Installationsprogramms verweist selbst darauf: „Probieren Sie es aus: Öffnen Sie Claude Code und geben Sie nach jeder Meldung eines Agenten über den Abschluss der Arbeit /fable-judge ein.“ Wenn Sie diese Prüfung lieber in die Arbeit integrieren möchten, statt sie danach auszuführen, lässt der Old Coder Skill den Agenten eine SPEC erstellen, die Sie freigeben, sowie einen EVIDENCE-Bericht, den Sie selbst erneut ausführen können. Mutationstests ersetzen dabei die Abdeckung als Nachweis dafür, dass eine Prüfung eine Regression tatsächlich erkennen würde.

fable-domain erzeugt domänenspezifische Adapterpakete mit Testvorrichtungen für typische Fehler und Smoke-Evaluierungen. Acht Adapter werden bereitgestellt: Marketing, Forschung, Datenanalyse, Geschäftsprozesse und Betrieb, Finanzen, Recht und Compliance, Design und UX sowie DevOps. Für medizinische und klinische Arbeiten wird bewusst kein Adapter bereitgestellt.

Welche Teile sich auf ein anderes Modell übertragen lassen und welche nicht

Das Repository beantwortet diese Frage direkt mit AGENTS.md. Dort steht: „Portable version for any coding agent or harness (Codex, Cursor, aider, a raw system prompt). Identical method to SKILL.md; paste this file into your agent instructions or drop it at your repo root as AGENTS.md.“ Die Datei umfasst etwa 2,600 Wörter und enthält dieselben Prüfungen, Schritte und Modi. Wenn Sie bereits Anweisungsdateien im Repository-Stammverzeichnis verwenden, beschreibt die Konvention für AGENTS.md und HUMAN.md, wo diese Datei abgelegt wird und wer sie liest.

Zwei Teile lassen sich problemlos übertragen. Der Methodentext ist ein geordneter Prompt ohne modellspezifischen Code. Jedes Modell, das Anweisungen befolgen kann, kann daher auch diese Methode befolgen. Die zentrale These des Repositorys lautet außerdem, dass der Aufwand umgekehrt proportional zur Modellklasse ist. Auch der Judge lässt sich übertragen, sofern der Agent eine Shell und ein Repository hat. Alle seine Aktionen bestehen aus git diff und dem erneuten Ausführen von Befehlen, die auch der Leser ausführen kann.

Ein Teil lässt sich nicht problemlos übertragen. fable-loop setzt voraus, dass das Harness parallele Subagents starten und ihnen unterschiedliche Modelle zuweisen kann. Ein Agent ohne Subagents führt diese Phasen mit einem einzigen Modell nacheinander aus. Dadurch entfallen sowohl die Parallelität als auch die Kosteneinsparung, die den Entwurf rechtfertigt. Übrig bleibt fable-method mit zusätzlicher Terminologie.

Zwei weitere Punkte sind harness-spezifisch und werden leicht übersehen. Der Trigger /fable-method ist ein Slash-Befehl für Claude Code. In einem anderen Harness rufen Sie die Methode daher auf, indem Sie sie beschreiben. Die Frontmatter-Beschreibung SKILL.md ermöglicht es einem Agenten, den Inhalt nur dann zu laden, wenn er zur Aufgabe passt. Dadurch verursacht ein installiertes Skill nahezu keine Kosten, bis es ausgelöst wird. Fügen Sie AGENTS.md stattdessen in einen System-Prompt ein, werden diese 2,600 Wörter in jede von Ihnen gesendete Anfrage übernommen, unabhängig davon, ob es sich um die Korrektur eines Tippfehlers in einer Zeile oder um ein Refactoring handelt. Das ist ein realer Kostenunterschied und der Hauptgrund, aus dem die Skill-Verpackung überhaupt existiert.

So testen Sie A/B auf einem VPS: dieselbe Aufgabe zweimal

Richten Sie zwei identische Arbeitskopien ein, damit kein Durchlauf die Änderungen des anderen sehen kann. Ersetzen Sie YOUR_ORG/YOUR_REPO durch das Repository, gegen das Sie testen möchten. Beide Klone müssen aus demselben Commit stammen.

sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/method

Wählen Sie eine Aufgabe mit einem beobachtbaren Ergebnis ohne Ermessensspielraum: einen fehlschlagenden Test, der erfolgreich durchlaufen muss, oder ein Skript, das mit 0 beendet werden muss. Eine vage Aufgabe führt zu einem vagen Vergleich, weil Sie dann Text statt Ergebnisse bewerten.

Führen Sie den Kontrolllauf mit --bare aus. Dadurch wird die automatische Erkennung von Hooks, Skills, Plugins und CLAUDE.md übersprungen. Dieses Flag macht den Lauf zum Kontrolllauf: Die zuvor installierten Skills können nicht einfließen. Der Bare-Modus verwendet Ihre Anmeldeinformationen für das Abonnement nicht. Legen Sie daher zuerst einen API-Schlüssel in der Claude Console fest.

export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."

cd ~/ab/control
claude --bare -p "$task" \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/control.jsonl

Der Methodenlauf verwendet denselben Befehl mit einem zusätzlichen Flag. Dadurch wird die portable Methode als Ergänzung zum System-Prompt geladen:

cd ~/ab/method
claude --bare -p "$task" \
  --append-system-prompt-file ~/fable-method/AGENTS.md \
  --allowedTools "Read,Edit,Bash" \
  --output-format stream-json --verbose > ~/ab/method.jsonl

Dasselbe Binary, dasselbe Modell, dieselben Tools, derselbe Ausgangsbaum. Es unterscheidet sich nur ein Flag. Nur so ist der Vergleich aussagekräftig.

Dieses Design misst den Methodentext. Es misst nicht die Paketierung der Skills. Das ist eine separate Fragestellung. Um die Paketierung zu messen, lassen Sie --bare weg, installieren Sie die Skills wie oben beschrieben und setzen Sie den Skill-Namen in die Prompt-Zeichenfolge, weil benutzeraufgerufene Skills im Print-Modus erweitert werden: claude -p "/fable-method $task". Rechnen Sie mit einem anderen Kostenprofil als beim System-Prompt-Lauf, auch wenn das sichtbare Verhalten gleich aussieht.

Die Schritte und Kosten zählen

Beide Durchläufe haben einen Strom von JSON-Ereignissen geschrieben. Die letzte Zeile ist eine result-Nachricht mit dem finalen Text, den Kosten und den Sitzungsmetadaten. Geben Sie diese Zeile einmal aus und lesen Sie sie, bevor Sie etwas darum herum automatisieren, da sich die Feldnamen zwischen Claude Code-Releases ändern.

tail -1 ~/ab/control.jsonl | jq .

Die Kosten pro Durchlauf stammen aus dieser Zeile. Das ist der Wert, den Sie vergleichen sollten:

for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
  printf '%s ' "$f"
  jq -r 'select(.type=="result") | .total_cost_usd' "$f"
done

Die Anzahl der Schritte ergibt sich aus der Zahl der Tool-Aufrufe in derselben Datei:

jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
  ~/ab/control.jsonl | sort | uniq -c | sort -rn

Führen Sie das für beide Dateien aus. Die Form des Unterschieds sagt mehr aus als die Summen. Ein Durchlauf mit einer Methode, der mehr Dateien liest und weniger Dateien bearbeitet, setzt die Vorgaben der Methode um. Das ist der Kompromiss, den Sie eingehen. Wenn ein Methodendurchlauf dieselben Änderungen mit vierzig Prozent höheren Kosten erzeugt, hat er bei dieser Aufgabe keinen Vorteil gebracht.

Beachten Sie zwei Punkte zu den Zahlen. Erstens: Addieren Sie nicht output_tokens aus den Sitzungstranskripten unter ~/.claude/projects/ und bezeichnen Sie das Ergebnis als Gesamtsumme. Diese Nutzungsblöcke pro Nachricht sind Momentaufnahmen während des Streamings, und es gibt offene Berichte darüber, dass sie zu niedrige Werte ausweisen. Die Zeile result ist der maßgebliche Wert. Zweitens ist ein Durchlauf pro Variante nur eine Einzelbeobachtung. Führen Sie daher jede Variante bei derselben Aufgabe drei- oder viermal aus, bevor Sie einem Unterschied vertrauen. Bereits zwei Durchläufe desselben Agents bei derselben Aufgabe unterscheiden sich voneinander. Für eine längerfristige Betrachtung der Ausgaben erklären die Tools zur Erfassung der Claude-Code-Ausgaben und wie Claude Code Tokens zählt, warum die Cache-Zeilen die Rohzählungen dominieren.

Stellen Sie sicher, dass der Agent während eines unbeaufsichtigten Laufs auf nichts zugreifen kann, was geschützt werden muss. Claude Code sicher auf einem VPS ausführen behandelt das Benutzerkonto und die Berechtigungs-Flags.

Die eigene Evaluation des Repositories, nüchtern gelesen

Die Überschrift der README lautet: „Fifteen eval rounds, more than 260 agent runs, blind LLM judges that verify by diffing and executing.“ Das ist mehr Evidenz, als fast jedes Skill-Repository liefert, und eval/RESULTS.md wird Runde für Runde dokumentiert, wobei die Fehlschläge erhalten bleiben. Hinter den einzelnen Zellen der Überschriftszeilen ist die Evaluation jedoch weniger umfangreich, als die Zahl in der Überschrift vermuten lässt.

ChartRuns per cell behind the repo's headline eval rows, v1.4.0
The data behind this chart
[
  {
    "label": "Haiku, spec-vs-test conflict trap",
    "runs": 4,
    "notes": "bare 0 of 4, with method 4 of 4"
  },
  {
    "label": "Sonnet, same conflict trap",
    "runs": 2,
    "notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
  },
  {
    "label": "Haiku, planted-fraud report, fable-judge",
    "runs": 2,
    "notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
  },
  {
    "label": "Haiku, marketing brand-rules trap",
    "runs": 2,
    "notes": "bare 1 of 2 runs, with method 2 of 2"
  }
]

Die größte dieser 4 Zeilen basiert auf 4 Durchläufen. Die anderen drei basieren jeweils auf 2 Durchläufen. Das Repository sagt dies selbst, und zwar in den grundlegenden Einschränkungen am Anfang des Logs: „Small n throughout (1-4 runs per cell), LLM judges (blind where multiple outputs are compared, but built on the same frontier model that appears as a baseline), synthetic fixtures, research ground truth only as current as its run date.“ Noch direkter heißt es: „This log exists so method edits are tested, not so anyone mistakes it for a benchmark.“

Das verdient Anerkennung. Ein Autor, der sein eigenes n veröffentlicht und das Problem benennt, dass sein Judge auf demselben Modell basiert, das als Baseline dient, ist in dieser Kategorie ehrlicher als üblich. Lesen Sie die Zahlen als Beleg dafür, dass der Autor die Tests tatsächlich ausgeführt und die Fehlschläge beibehalten hat. Ihr eigener A/B-Test zeigt Ihnen, was für Ihre Codebasis gilt.

Die README beschreibt ebenso klar, wo die Methode nichts bewirkt. Das ist ihr nützlichster Absatz. Sie verzeichnet keinen Vorteil bei gewöhnlichen kleinen Aufgaben auf leistungsfähigen Modellen. Sie stellt fest, dass „the method cannot make a model's facts fresher; bare frontier wins knowledge-heavy research“. Außerdem grenzt sie den Nutzen auf „traps (authority conflicts, false completion claims, weak executors, unattended runs), not everywhere“ ein. Wenn Ihr Agent kleine Änderungen an einem starken Modell vornimmt und Sie den Vorgang überwachen, sollten Sie überhaupt keinen messbaren Unterschied erwarten. Wenn ein günstigeres Modell unbeaufsichtigt läuft, sollte sich dort eine Lücke zeigen. Damit wird auch die Wahl zwischen Opus, Sonnet und Haiku zu einem Teil derselben Entscheidung.

Wo die Paketierung zum Cargo-Kult wird

Vier Kritikpunkte sind angebracht. Keiner davon ist ein Grund, das Repository zu überspringen.

Die Einordnung geht über die Belege hinaus. „How Claude Fable 5 worked“ ist eine Aussage über die Interna eines Modells, die niemand außerhalb von Anthropic überprüfen kann. Der zentrale Satz des Repositorys selbst schwächt diese Aussage außerdem ab: „The quality lives in the structure, the evidence, and the honesty, not in the model.“ Wenn die Qualität in der Struktur liegt, ist die Herkunftsgeschichte nur Dekoration. Das Verfahren steht für sich und braucht keinen Ursprungsmythos.

Vier Skills bilden mehr Oberfläche ab, als der Inhalt benötigt. fable-loop wiederholt einen großen Teil von fable-method und ergänzt lediglich eine Orchestrierung. In einer Umgebung ohne Subagents fällt es wieder auf fable-method zurück. Lesen Sie die beiden Dateien nebeneinander, bevor Sie beide installieren.

Acht Domain-Adapter bieten eine Breite, die durch die Evaluation nicht abgedeckt wird. Zwei der acht tauchen überhaupt im Log auf: Marketing in Runde 9 und DevOps in Runde 12. Die Adapter für Finance, Recht, Design und Daten werden ohne zugehörige Runde ausgeliefert. Der Adapter für Ihr Fachgebiet kann trotzdem gut sein. Er ist jedoch der Entwurf eines Autors und nichts, was eine Testvorrichtung mit absichtlichen Fehlerfällen bestanden hat.

Außerdem stimmt der Installer nicht mit dem Repository darüber überein, was es ausliefert, und kopiert drei von vier Skills nach ~/.claude/skills. Das ist nur eine kleine Abweichung. Sie zeigt aber auch, dass sich die Paketierung schneller weiterentwickelt hat, als sie überprüft wurde. Das sollten Sie berücksichtigen, wenn Sie entscheiden, wie viel davon Sie auf einmal übernehmen.

Was Sie sich in jedem Fall bewahren sollten

Wenn Sie die Markenbezeichnung entfernen, bleiben unabhängig vom eingesetzten Agenten vier eigenständige Regeln übrig.

  • Das Autorisierungszitat. Eine irreversible oder nach außen gerichtete Aktion erfordert die eigenen Worte des Benutzers, ausgeschrieben als `AUTH:`-Zeile. Ein Agent, der kein Zitat findet, führt die Aktion nicht aus.
  • Die Doppelprüfung. Suchen Sie nach der Behebung eines Fehlers im gesamten Projekt nach derselben fehlerhaften Konstruktion und geben Sie die Anzahl an, auch wenn sie null ist.
  • Verifizierung durch Beobachtung. Eine erfolgreiche gezielte Prüfung auf einem fehlerhaften Build ist eine fehlgeschlagene Verifizierung und kein Erfolg.
  • Ergebnisorientierte Berichte. Geben Sie an, was übersprungen oder nicht verifiziert wurde, statt es stillschweigend wegzulassen.

Die Übernahme dieser vier Regeln kostet nichts, und Sie können die Einhaltung per grep prüfen. Beginnen Sie damit, messen Sie mit dem oben beschriebenen Harness und entscheiden Sie anschließend, ob der restliche Teil des Repositorys seinen Anteil am Context-Budget verdient. Wenn Sie einem Agenten einen festen Projektkontext statt einer Arbeitsmethode geben möchten, ist eine DESIGN.md, die Agenten vor Änderungen lesen die passende Ergänzung.

FAQ

Funktioniert die Fable-Methode auch mit anderen Modellen als Claude?

Der Methodentext funktioniert auch mit anderen Modellen. Er besteht aus einem geordneten Prompt ohne modellspezifischen Code. Das Repository enthält mit AGENTS.md eine portable Kopie für Codex, Cursor, aider oder einen einfachen System-Prompt. Zwei Dinge lassen sich nicht übertragen. /fable-method und /fable-judge sind Slash-Befehle von Claude Code. In anderen Umgebungen rufen Sie die Methode daher auf, indem Sie sie beschreiben. fable-loop setzt außerdem ein Harness voraus, das parallele Subagenten mit unterschiedlichen Modellen starten kann. Ohne dieses Harness wird die Methode seriell ausgeführt und liefert Ihnen fable-method mit zusätzlichen Schritten.

Verbraucht die Ausführung dieser Skills mehr Tokens?

Ja. Wie viele zusätzliche Tokens anfallen, hängt davon ab, wie Sie die Skills laden. Wenn sie als Skills installiert sind, wird der Text nur geladen, wenn die Beschreibung zur Aufgabe passt. Eine nicht verwandte Anfrage verursacht daher nahezu keinen zusätzlichen Aufwand. Wenn Sie den Text in einen System-Prompt einfügen, werden die ungefähr 2.600 Wörter von AGENTS.md bei jeder Anfrage mitgesendet. Auch die Ausführung selbst kostet mehr. Die Methode verlangt eine Orientierung vor dem Bearbeiten, Belege vor der Entscheidung und eine tatsächliche Verifikation danach. Messen Sie den Unterschied: Führen Sie dieselbe Aufgabe in beiden Durchläufen mit --output-format json aus und vergleichen Sie das Feld total_cost_usd.

Welche Version von fable-method sollte ich installieren, und warum sollte ich sie festschreiben?

Führen Sie vor der Installation git checkout v1.4.0 aus. Dieses Tag trägt das Datum 2026-07-15 und war im August 2026 noch das neueste. Das Repository veröffentlichte in den neun Tagen davor fünf Releases. v1.4.0 änderte sogar die Routing-Regeln selbst. Wenn Sie während der Messung main verfolgen, können Ihr Kontrolllauf und Ihr Testlauf unterschiedliche Anweisungen verwenden. Dadurch wird der Vergleich wertlos. Erfassen Sie das Tag zusammen mit Ihren Ergebnissen.

Ist die Eval im Repository ein Benchmark, dem ich vertrauen kann?

Betrachten Sie sie als Änderungsprotokoll für die Methode. So bezeichnet sie auch ihr Autor: „Dieses Protokoll dient dazu, Änderungen an der Methode zu testen, nicht dazu, dass jemand es mit einem Benchmark verwechselt.“ Die Einschränkungen stehen am Anfang der Datei: 1 bis 4 Durchläufe pro Zelle, synthetische Fixtures und LLM-Bewertungen, die auf demselben Frontier-Modell basieren, das auch als Baseline dient. Die Durchläufe sind real, und fehlgeschlagene Experimente wurden beibehalten. Das ist mehr, als die meisten Repositories veröffentlichen. Trotzdem misst die Eval nicht, was in Ihrer Codebasis passieren wird. Führen Sie den Vergleich mit zwei Armen daher selbst durch.