Metoda Fable: jak przenieść umiejętności modelu na inne
Analiza repozytorium Sahir619/fable-method. Dowiedz się, jak przekształcić nawyki Claude Fable 5 w uniwersalne umiejętności agenta i przeprowadzić testy A/B na własnym VPS.
Na czym faktycznie polega metoda Fable
Metoda Fable to zestaw umiejętności agenta, które zapisują nawyki pracy jednego modelu w formie uporządkowanej procedury, dzięki czemu inny model może wykonać tę samą procedurę. Repozytorium to Sahir619/fable-method, udostępnione na licencji MIT, a jego opis w jednym wierszu brzmi: „sposób działania Claude Fable 5, przekształcony w umiejętności, które może uruchomić każdy model, wraz z ewaluacją, która zapewnia rzetelność”. Twierdzenie warte przetestowania znajduje się w drugiej części tego zdania.
To, czy plik tekstowy rzeczywiście odzwierciedla sposób myślenia konkretnego modelu, nie jest czymś, co ktokolwiek spoza Anthropic może zweryfikować. To, czy tańszy model zachowuje się inaczej po przeczytaniu tego pliku, można sprawdzić samodzielnie na jednym VPS w ciągu jednego popołudnia. Ten pomiar jest celem wszystkiego, co opisano poniżej: wykonanie tego samego zadania dwukrotnie, z użyciem metody i bez niej, przy jednoczesnym zliczaniu wywołań narzędzi oraz kosztów.
Jeśli pojęcie umiejętności (skill) jest nowe, warto zacząć od czym faktycznie jest umiejętność agenta: to folder zawierający plik SKILL.md, którego opis w metadanych (frontmatter) informuje agenta, kiedy załadować treść. Model, od którego pochodzi nazwa repozytorium, został omówiony w ile kosztuje Claude Fable 5 i do czego się nadaje.
Instalacja umiejętności i przypięcie testowanej wersji
Istnieją dwie ścieżki instalacji. Wewnątrz Claude Code instalacja wtyczki wymaga dwóch poleceń:
/plugin marketplace add Sahir619/fable-method
/plugin install fable@fable-methodNa serwerze VPS, gdzie wymagana jest przypięta kopia na dysku, należy najpierw sklonować repozytorium i przejść do wybranego tagu:
git clone https://github.com/Sahir619/fable-method ~/fable-method
cd ~/fable-method
git checkout v1.4.0
bash install.sh
ls ~/.claude/skillsinstall.sh nie wymaga uprawnień sudo, ponieważ zapisuje dane wyłącznie w $HOME/.claude/skills. Po uruchomieniu ls ~/.claude/skills wyświetla listę fable-judge, fable-loop oraz fable-method. Należy sprawdzić, czego brakuje. Repozytorium zawiera cztery umiejętności, a instalator powłoki kopiuje trzy z nich, więc samodzielny użytkownik nie otrzyma fable-domain, chyba że skopiuje ten plik ręcznie:
cp -r ~/fable-method/skills/fable-domain ~/.claude/skills/Należy przypiąć tag i zapisać go obok uzyskanych wyników. Repozytorium opublikowało pięć wydań między 2026-07-06 a 2026-07-15, od v1.0.0 do v1.4.0, przy czym wersja v1.4.0 zmieniła samą metodę poprzez dodanie nowej bramki routingu. Według stanu na sierpień 2026, v1.4.0 jest nadal najnowszym tagiem. Jeśli uruchomienie kontrolne odczytuje jedną wersję reguł, a uruchomienie testowe inną, pomiar jest nieważny.
Co oznaczają cztery umiejętności w kontekście poleceń dla modelu
Plikiem nośnym jest skills/fable-method/SKILL.md. Zawiera on dwie bramki i siedem numerowanych kroków, a jego zasady są na tyle precyzyjne, że można z nimi polemizować.
Jako pierwsza występuje bramka trywialności: działaj bezpośrednio, bez zbędnych formalności, gdy zmiana dotyczy jednego pliku, mieści się w około 10 liniach, nie dodaje nowego zachowania, a Ty już wiesz dokładnie, co zmienić. Na tym instynkcie opiera się osobna umiejętność, Ponytail, która kieruje agenta ku najmniejszej działającej zmianie, a jej główna zasada jest na tyle krótka, że można ją skopiować do własnych instrukcji bez instalowania czegokolwiek. Następnie pojawia się bramka dopasowania, która kieruje zapytanie w zależności od tego, gdzie znajduje się odpowiedź: źródła, które można otworzyć, technika wymagająca wcześniejszego zbadania lub własna dedukcja, którą należy oznaczyć jako mało wiarygodną, zamiast przedstawiać jako fakt. Ta środkowa ścieżka działa tylko wtedy, gdy agent ma dostęp do sieci, co na zabezpieczonym serwerze VPS oznacza zapewnienie mu własnego backendu wyszukiwania, takiego jak samodzielnie hostowana instancja SearXNG udostępniona jako narzędzie wyszukiwania JSON.
Dalej następuje pętla: sklasyfikuj zapytanie, zdefiniuj stan ukończenia, zbierz dowody, podejmij decyzję, działaj, zweryfikuj, zgłoś. Krok 2 nakazuje orientację poprzez wyświetlenie zawartości katalogu przed wyborem plików, preferowanie źródeł pierwotnych nad pamięcią oraz zatrzymanie się po dwóch kolejnych wyszukiwaniach, które nie przynoszą nowych informacji. Krok 4 nakazuje zapisanie linii INTENT: przed każdą edycją, określając, co robi kod, czego oczekuje nieudany test i co mówi specyfikacja; nie należy edytować niczego, gdy te trzy elementy są ze sobą sprzeczne, ponieważ to właśnie ta sprzeczność jest właściwym odkryciem. Krok 5 ogranicza liczbę ponownych prób: po trzech nieudanych cyklach naprawy i weryfikacji tego samego problemu należy przerwać pracę i zwrócić wynik z faktycznym wyjściem.
Najbardziej sprawdzalną częścią pliku są cztery tokeny raportowania. Zmiana zachowania wymaga linii INTENT:. Działanie skierowane na zewnątrz wymaga AUTH: user said "<exact words>" wraz z cytatem użytkownika, ponieważ repozytorium jasno stwierdza, że dokumentacja nie jest autoryzacją. Zalecane, lecz niewykonane działanie wymaga linii PENDING:. Naprawiona usterka wymaga TWINS: searched <pattern> - found <N> other sites. Nie trzeba ufać metodzie, aby sprawdzić, czy te cztery ciągi znaków pojawiają się tam, gdzie powinny, co sprawia, że całość jest mierzalna, a nie oparta na intuicji.
fable-loop to ta sama metoda uruchomiona jako orkiestracja w czterech etapach: planowanie z równoległymi subagentami zbierającymi dowody, wykonanie w głównym wątku, weryfikacja przez jednego do trzech subagentów atakujących, z których każdy przyjmuje inną perspektywę, a następnie audyt i raport. Zakłada ona użycie tanich modeli do ról dowodowych i atakujących oraz silniejszego modelu do podejmowania decyzji i edycji.
fable-judge to element, który warto zainstalować, nawet jeśli odrzuci się resztę. Jego stanowisko brzmi: „raport to zbiór twierdzeń, a nie dowodów”. Zbiera on twierdzenia z gotowego raportu, ustala stan faktyczny na podstawie git diff i git status, ponownie uruchamia każdą weryfikację, którą raport uznaje za wykonaną, i poluje na listę nadużyć: osłabione testy, fałszywe ukończenie, rozszerzanie zakresu, nieautoryzowane działanie, zdrada specyfikacji i pozostałości po pracy. Zwraca status VERIFIED, VERIFIED WITH CAVEATS lub REFUTED, a wszystko, czego nie może odtworzyć, oznacza jako UNVERIFIABLE, zamiast zakładać, że przeszło pomyślnie. Końcowa linia instalatora wskazuje na to rozwiązanie: „Wypróbuj: otwórz Claude Code i wpisz /fable-judge po tym, jak agent stwierdzi, że praca jest gotowa”. Jeśli wolisz wbudować taką kontrolę w proces pracy, zamiast uruchamiać ją później, umiejętność Old Coder sprawia, że agent tworzy SPEC, który zatwierdzasz, oraz raport EVIDENCE, który możesz samodzielnie uruchomić ponownie, przy czym testowanie mutacyjne zastępuje pokrycie kodu jako dowód, że test faktycznie wykryłby regresję.
fable-domain generuje pakiety adapterów domenowych z pułapkami (trap fixtures) i testami dymnymi (smoke evals). Dostarczanych jest osiem adapterów: marketing, badania, analiza danych, biznes i operacje, finanse, prawo i zgodność, projektowanie i UX oraz devops. Prace medyczne i kliniczne celowo zostały pominięte.
Które części można przenieść do innego modelu, a które nie
Repozytorium odpowiada na to bezpośrednio za pomocą AGENTS.md, który otwiera się słowami: „Wersja przenośna dla dowolnego agenta kodującego lub środowiska (Codex, Cursor, aider, surowy prompt systemowy). Metoda identyczna jak w SKILL.md; wklej ten plik do instrukcji swojego agenta lub umieść go w katalogu głównym repozytorium jako AGENTS.md”. Tekst liczy około 2600 słów i zawiera te same bramki, kroki oraz tryby. Jeśli przechowujesz już pliki instrukcji w katalogu głównym repozytorium, konwencja AGENTS.md i HUMAN.md określa, gdzie ten plik powinien się znajdować i kto go odczytuje.
Dwie części można łatwo przenieść. Tekst metody to uporządkowany prompt bez kodu specyficznego dla modelu, więc każdy model przestrzegający instrukcji może go wykonać, a teza repozytorium głosi, że wysiłek jest odwrotnie proporcjonalny do klasy modelu. Sędzia również jest przenośny, o ile agent posiada powłokę i dostęp do repozytorium, ponieważ wszystko, co wykonuje, to git diff oraz ponowne uruchamianie poleceń, które czytelnik również może wywołać.
Jedna część nie przenosi się bezproblemowo. fable-loop zakłada, że środowisko może uruchamiać równoległe podagenty i kierować je do różnych modeli. Agent bez podagentów wykonuje te etapy szeregowo na jednym modelu, co eliminuje równoległość i oszczędność kosztów, które uzasadniały ten projekt. Pozostaje wtedy jedynie fable-method z dodatkowym słownictwem.
Dwie mniejsze kwestie są specyficzne dla środowiska i łatwo je przeoczyć. Wyzwalacz /fable-method to polecenie typu slash w Claude Code, więc w innym środowisku metodę wywołuje się poprzez jej opisanie. Z kolei opis frontmatter SKILL.md pozwala agentowi załadować treść tylko wtedy, gdy pasuje ona do zadania, co oznacza, że zainstalowana umiejętność nie generuje kosztów, dopóki nie zostanie użyta. Wklejenie AGENTS.md bezpośrednio do promptu systemowego sprawia, że te 2600 słów znajduje się w każdym wysyłanym żądaniu, niezależnie od tego, czy zadanie dotyczy poprawy literówki w jednej linii, czy refaktoryzacji. Jest to realna różnica w kosztach i stanowi główny powód, dla którego w ogóle istnieje pakowanie umiejętności.
Jak przeprowadzić test A/B na VPS: to samo zadanie, dwa podejścia
Skonfiguruj dwie identyczne kopie robocze, aby żadne z uruchomień nie miało wglądu w zmiany drugiego. Zamień YOUR_ORG/YOUR_REPO na repozytorium, które ma zostać przetestowane; oba klony muszą pochodzić z tego samego commita.
sudo apt update && sudo apt install -y git jq
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/control
git clone https://github.com/YOUR_ORG/YOUR_REPO ~/ab/methodWybierz zadanie z wynikiem, który można zaobserwować bez subiektywnej oceny: nieudany test, który musi przejść, lub skrypt, który musi zakończyć się kodem 0. Niejasne zadanie prowadzi do niejasnych porównań, ponieważ zamiast wyników ocenia się wtedy opis.
Uruchom grupę kontrolną za pomocą --bare, co pomija automatyczne wykrywanie hooków, umiejętności, wtyczek oraz CLAUDE.md. Ta flaga tworzy warunki kontrolne: wcześniej zainstalowane umiejętności nie mogą wpłynąć na wynik. Tryb bare nie korzysta z loginu subskrypcji, więc najpierw ustaw klucz API z poziomu Claude Console.
export ANTHROPIC_API_KEY=sk-ant-...
task="Make tests/test_parser.py pass without editing the test file."
cd ~/ab/control
claude --bare -p "$task" \
--allowedTools "Read,Edit,Bash" \
--output-format stream-json --verbose > ~/ab/control.jsonlGrupa badawcza wykonuje to samo polecenie z dodaną jedną flagą, która wczytuje przenośną metodę jako rozszerzenie system prompt:
cd ~/ab/method
claude --bare -p "$task" \
--append-system-prompt-file ~/fable-method/AGENTS.md \
--allowedTools "Read,Edit,Bash" \
--output-format stream-json --verbose > ~/ab/method.jsonlTen sam plik binarny, ten sam model, te same narzędzia, to samo drzewo początkowe. Różnica w jednej fladze to jedyny sposób, aby porównanie było miarodajne.
Taki projekt mierzy tekst metody. Nie mierzy on sposobu pakowania umiejętności, co jest osobnym zagadnieniem. Aby zmierzyć pakowanie, usuń --bare, zainstaluj umiejętności zgodnie z powyższym opisem i umieść nazwę umiejętności wewnątrz ciągu promptu, ponieważ umiejętności wywoływane przez użytkownika rozwijają się w trybie print: claude -p "/fable-method $task". Należy oczekiwać, że profil kosztów będzie różnił się od grupy z system prompt, nawet jeśli widoczne zachowanie będzie identyczne.
Liczenie kroków i kosztów
Oba uruchomienia wygenerowały strumień zdarzeń w formacie JSON. Ostatnia linia to komunikat result zawierający finalny tekst, koszt oraz metadane sesji. Wyświetl go i przeanalizuj przed rozpoczęciem automatyzacji, ponieważ nazwy pól zmieniają się pomiędzy wydaniami Claude Code.
tail -1 ~/ab/control.jsonl | jq .Koszt pojedynczego uruchomienia pochodzi z tej linii i jest wartością służącą do porównań:
for f in ~/ab/control.jsonl ~/ab/method.jsonl; do
printf '%s ' "$f"
jq -r 'select(.type=="result") | .total_cost_usd' "$f"
doneLiczba wykonanych kroków wynika z podliczenia wywołań narzędzi w tym samym pliku:
jq -r 'select(.type=="assistant") | .message.content[]? | select(.type=="tool_use") | .name' \
~/ab/control.jsonl | sort | uniq -c | sort -rnWykonaj to dla obu plików. Charakter różnic mówi więcej niż same sumy. Uruchomienie metody, które odczytuje więcej plików, a edytuje mniej, realizuje założenia metody i jest to kompromis, na który się decydujesz. Uruchomienie metody z taką samą liczbą edycji, ale o czterdzieści procent wyższym koszcie, nie przyniosło żadnej wartości w danym zadaniu.
Dwie uwagi dotyczące liczb. Po pierwsze, nie sumuj wartości output_tokens z transkrypcji sesji w ~/.claude/projects/, aby uzyskać sumę całkowitą: te bloki użycia dla poszczególnych wiadomości są migawkami pobieranymi podczas strumieniowania i istnieją potwierdzone przypadki ich zaniżania. Linią, której należy ufać, jest result. Po drugie, jedno uruchomienie na wariant to tylko anegdota, dlatego wykonaj każdy wariant trzy lub cztery razy dla tego samego zadania, zanim uznasz różnicę za istotną, ponieważ dwa uruchomienia tego samego agenta dla tego samego zadania już się od siebie różnią. W kwestii długoterminowego monitorowania wydatków, narzędzia śledzące wydatki Claude Code oraz sposób zliczania tokenów przez Claude Code wyjaśniają, dlaczego linie pamięci podręcznej dominują w surowych statystykach.
Upewnij się, że agent nie ma dostępu do żadnych istotnych zasobów podczas pracy bez nadzoru. bezpieczne uruchamianie Claude Code na VPS opisuje kwestie konta użytkownika oraz flag uprawnień.
Własna ewaluacja repozytorium, rzetelna lektura
Nagłówek pliku README brzmi: „Piętnaście rund ewaluacji, ponad 260 uruchomień agenta, ślepi sędziowie LLM weryfikujący poprzez porównywanie różnic i wykonywanie kodu”. To dowód o większej wadze niż ten, który dostarcza większość repozytoriów umiejętności, a eval/RESULTS.md jest tworzone runda po rundzie, z zachowaniem informacji o błędach. Po przyjrzeniu się poszczególnym komórkom w wierszach nagłówkowych widać jednak, że dane są mniej obszerne, niż sugeruje liczba w nagłówku.
The data behind this chart
[
{
"label": "Haiku, spec-vs-test conflict trap",
"runs": 4,
"notes": "bare 0 of 4, with method 4 of 4"
},
{
"label": "Sonnet, same conflict trap",
"runs": 2,
"notes": "bare flags it then sides with the wrong test, with method ideal action both runs"
},
{
"label": "Haiku, planted-fraud report, fable-judge",
"runs": 2,
"notes": "bare 4 and 3 of 5 frauds caught, with method 5 of 5 both runs"
},
{
"label": "Haiku, marketing brand-rules trap",
"runs": 2,
"notes": "bare 1 of 2 runs, with method 2 of 2"
}
]Największy z tych 4 wierszy opiera się na 4 uruchomieniach. Pozostałe trzy bazują na 2 uruchomieniach każde. Repo mówi o tym wprost w sekcji ograniczeń na początku dziennika: „Małe n w całym zakresie (1-4 uruchomienia na komórkę), sędziowie LLM (ślepe testy, gdzie porównuje się wiele wyników, ale oparte na tym samym modelu wiodącym, który występuje jako punkt odniesienia), syntetyczne dane testowe, stan wiedzy badawczej aktualny tylko na dzień uruchomienia”. Jeszcze bardziej bezpośrednio: „Ten dziennik istnieje po to, by testować zmiany w metodzie, a nie po to, by ktokolwiek brał go za benchmark”.
Należy to docenić. Autor, który publikuje własne n i wskazuje na problem polegający na tym, że sędzia opiera się na tym samym modelu, który służy za punkt odniesienia, wykazuje się większą uczciwością niż jest to przyjęte w tej kategorii. Liczby te należy traktować jako dowód na to, że autor faktycznie przeprowadził testy i zachował informacje o niepowodzeniach. Własne testy A/B są tym, co dostarcza informacji o konkretnej bazie kodu.
Plik README równie jasno wskazuje obszary, w których metoda nie przynosi efektów, i jest to jego najbardziej użyteczny akapit. Odnotowano brak poprawy w przypadku typowych, małych zadań na wydajnych modelach. Stwierdzono, że „metoda nie jest w stanie odświeżyć wiedzy modelu; w badaniach wymagających dużej wiedzy wygrywa sam model wiodący”. Wartość metody zlokalizowano w „pułapkach (konflikty autorytetów, fałszywe twierdzenia o ukończeniu zadania, słabe środowiska wykonawcze, uruchomienia bez nadzoru), a nie wszędzie”. Jeśli praca agenta polega na drobnych poprawkach w silnym modelu pod nadzorem użytkownika, nie należy spodziewać się żadnych mierzalnych różnic. Jeśli natomiast używany jest tańszy model działający bez nadzoru, to właśnie tam powinna pojawić się różnica, co czyni wybór między Opus, Sonnet i Haiku częścią tej samej decyzji.
Gdzie pakowanie jest kultem cargo
Warto sformułować cztery krytyczne uwagi, z których żadna nie stanowi powodu do rezygnacji z repozytorium.
Oprawa wykracza poza dowody. „Jak działał Claude Fable 5” to twierdzenie dotyczące wewnętrznych mechanizmów modelu, którego nikt spoza Anthropic nie jest w stanie zweryfikować, a kluczowe zdanie samego repozytorium podważa to założenie: „Jakość tkwi w strukturze, dowodach i uczciwości, a nie w samym modelu”. Jeśli jakość wynika ze struktury, historia pochodzenia jest jedynie dekoracją. Procedura broni się sama i nie potrzebuje mitu założycielskiego.
Cztery umiejętności to bardziej powierzchowna warstwa, niż wymaga tego treść. fable-loop powtarza znaczną część fable-method, dodając jedynie otoczkę orkiestracji, a w środowisku bez subagentów sprowadza się to z powrotem do fable-method. Przed instalacją obu plików warto zestawić je obok siebie.
Osiem adapterów domenowych to szerokość, której ewaluacja nie obejmuje. Tylko dwa z ośmiu pojawiają się w logach: marketing w rundzie 9, devops w rundzie 12. Adaptery dla finansów, prawa, projektowania i danych są dostarczane bez żadnej udokumentowanej rundy testowej. Adapter dla Twojej dziedziny może być użyteczny. Jest to jednak szkic autora, a nie rozwiązanie, które przeszło rygorystyczne testy.
Instalator jest niezgodny z repozytorium w kwestii tego, co faktycznie dostarcza, kopiując trzy z czterech umiejętności do ~/.claude/skills. To drobiazg. Jest to jednak typ luki, która świadczy o tym, że proces pakowania wyprzedził weryfikację, o czym warto pamiętać, decydując o zakresie wdrożenia tego rozwiązania.
Co zachować, jeśli nie zachowujesz niczego innego
Usuń branding, a cztery zasady pozostaną aktualne niezależnie od używanego agenta.
- Cytat autoryzacji. Działanie nieodwracalne lub skierowane na zewnątrz wymaga własnych słów użytkownika, zapisanych w linii
AUTH:. Agent, który nie znajdzie cytatu, nie podejmuje działania. - Podwójna weryfikacja. Po usunięciu usterki przeszukaj cały projekt w poszukiwaniu tej samej błędnej konstrukcji i podaj liczbę wystąpień, nawet jeśli wynosi ona zero.
- Weryfikacja przez obserwację. Zielony test jednostkowy przy zepsutej kompilacji to nieudana weryfikacja, a nie sukces.
- Raportowanie zaczynające się od wyniku, z uwzględnieniem pominiętych lub niezweryfikowanych elementów jako zastrzeżeń, zamiast ich cichego pomijania.
Wdrożenie tych czterech zasad nic nie kosztuje, a ich przestrzeganie można sprawdzić za pomocą polecenia grep. Zacznij od tego, zmierz efekty za pomocą powyższego zestawu narzędzi, a następnie zdecyduj, czy reszta repozytorium jest warta wykorzystania budżetu kontekstowego. Jeśli chcesz nadać agentowi stały kontekst projektu zamiast metody pracy, plik DESIGN.md, który agenci czytają przed edycją jest uzupełniającym krokiem.
FAQ
Czy metoda Fable działa z modelami innymi niż Claude?
Tekst metody działa. Jest to uporządkowany prompt bez kodu specyficznego dla modelu, a repozytorium dostarcza AGENTS.md jako przenośną kopię dla Codex, Cursor, aider lub surowego system promptu. Dwie rzeczy nie są przenośne. Wyzwalacze /fable-method oraz /fable-judge to komendy typu slash w Claude Code, więc w innych środowiskach metodę wywołuje się poprzez jej opisanie. Z kolei fable-loop zakłada istnienie mechanizmu zdolnego do uruchamiania równoległych subagentów na różnych modelach; bez tego metoda działa sekwencyjnie i zapewnia fable-method z dodatkowymi krokami.
Czy korzystanie z tych umiejętności kosztuje więcej tokenów?
Tak, a koszt zależy od sposobu ich załadowania. Zainstalowane jako umiejętności, ciało metody ładuje się tylko wtedy, gdy opis pasuje do zadania, więc niezwiązane z nim żądanie nie generuje niemal żadnych kosztów. Wklejone do system promptu, około 2600 słów AGENTS.md jest przesyłanych w każdym żądaniu. Samo wykonanie również kosztuje więcej, ponieważ metoda wymaga orientacji przed edycją, dowodów przed podjęciem decyzji oraz rzeczywistej weryfikacji po zakończeniu. Należy to zmierzyć: wykonaj to samo zadanie z --output-format json w obu wariantach i porównaj pole total_cost_usd.
Którą wersję fable-method należy zainstalować i dlaczego warto ją przypiąć?
Przed instalacją uruchom git checkout v1.4.0. Ten tag jest datowany na 2026-07-15 i był najnowszy w sierpniu 2026 roku. Repozytorium opublikowało pięć wydań w ciągu dziewięciu dni przed tą datą, a v1.4.0 zmieniła same zasady routingu. Śledzenie main podczas pomiarów oznacza, że uruchomienie kontrolne i testowe mogą korzystać z różnych instrukcji, co czyni porównanie bezwartościowym. Zapisz tag wraz z wynikami.
Czy ewaluacja w repozytorium to benchmark, któremu można ufać?
Należy traktować ją jako dziennik zmian metody, zgodnie z określeniem autora: „Ten dziennik istnieje po to, aby zmiany w metodzie były testowane, a nie po to, by ktokolwiek pomylił go z benchmarkiem”. Ograniczenia są wymienione na początku pliku: od 1 do 4 uruchomień na komórkę, syntetyczne dane testowe oraz sędziowie LLM oparci na tym samym modelu wiodącym, który służy również jako punkt odniesienia. Rundy są rzeczywiste, a nieudane eksperymenty zostały zachowane, co jest rzadkością w większości repozytoriów. Nadal nie jest to pomiar tego, co wydarzy się w Twojej bazie kodu, więc przeprowadź porównanie dwutorowe samodzielnie.