Claude Fable 5 cena i zastosowanie modelu
Model Claude Fable 5 kosztuje 10 USD za milion tokenów wejściowych oraz 50 USD za milion wyjściowych. Sprawdź opłacalność wdrożenia w porównaniu do modeli Sonnet oraz Opus.
FAQ
Ile kosztuje Claude Fable 5?
Claude Fable 5 kosztuje $10 za milion tokenów wejściowych oraz $50 za milion tokenów wyjściowych w ramach Claude API. Są to oficjalne stawki publikowane przez Anthropic, odczytane ze strony cennika w dniu 3 sierpnia 2026. Identyfikator modelu w API to claude-fable-5. Model stał się ogólnie dostępny 9 czerwca 2026 w Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud oraz Microsoft Foundry.
The data behind this chart
[
{
"label": "Claude Fable 5",
"input": "10",
"output": "50",
"cache_read": "1",
"batch_input": "5",
"batch_output": "25"
},
{
"label": "Claude Opus 5",
"input": "5",
"output": "25",
"cache_read": "0.50",
"batch_input": "2.50",
"batch_output": "12.50"
},
{
"label": "Claude Sonnet 5 (intro rate)",
"input": "2",
"output": "10",
"cache_read": "0.20",
"batch_input": "1",
"batch_output": "5"
},
{
"label": "Claude Sonnet 5 (from 1 Sep)",
"input": "3",
"output": "15",
"cache_read": "0.30",
"batch_input": "1.50",
"batch_output": "7.50"
},
{
"label": "Claude Haiku 4.5",
"input": "1",
"output": "5",
"cache_read": "0.10",
"batch_input": "0.50",
"batch_output": "2.50"
}
]Należy traktować to zestawienie jako hierarchię. Fable 5 jest wyceniany dwukrotnie drożej niż Claude Opus 5, pięciokrotnie drożej niż obecna stawka Claude Sonnet 5 i dziesięciokrotnie drożej niż Claude Haiku 4.5. Stosunek cen jest identyczny po obu stronach rozliczenia, ponieważ każdy model w tym zestawieniu wycenia tokeny wyjściowe dokładnie pięciokrotnie drożej niż wejściowe. Znając podział na tokeny wejściowe i wyjściowe dla danego zadania, można przeliczyć jedną cenę na drugą za pomocą mnożnika.
Jedna data zmienia kalkulację. Sonnet 5 jest objęty ceną promocyjną w wysokości $2 oraz $10 za milion tokenów do 31 sierpnia 2026. Od 1 września 2026 stawka ta wyniesie $3 oraz $15. Cena Fable 5 pozostaje bez zmian, więc różnica między tymi modelami zmniejszy się tego dnia z pięciokrotności do nieco ponad trzykrotności. Przy planowaniu budżetu na jesień należy uwzględnić późniejsze stawki dla modelu Sonnet.
Rabaty oraz mnożnik zwiększający koszty
Prompt caching stanowi najskuteczniejszy mechanizm optymalizacji kosztów. Odczyt z pamięci podręcznej kosztuje jedną dziesiątą ceny podstawowej wejścia, co dla modelu Fable 5 wynosi $1 za milion tokenów. Zapis do pamięci podręcznej jest droższy niż standardowy token wejściowy: 1,25 raza ceny podstawowej w przypadku pamięci pięciominutowej oraz 2 razy ceny podstawowej dla pamięci godzinnej. Pamięć pięciominutowa zwraca się po jednym odczycie, a godzinna po dwóch. Ta kalkulacja stanowi główny argument za obliczeniem progu opłacalności prompt caching przed włączeniem tej funkcji w całym systemie.
Batch API oferuje 50% zniżki na obie strony, dzięki czemu koszt przetworzenia wsadowego w modelu Fable 5 wynosi $5 oraz $25 za milion tokenów. Żądania wsadowe są asynchroniczne, więc rozwiązanie to sprawdza się wyłącznie w zadaniach, które nie wymagają natychmiastowej odpowiedzi. Oba rabaty sumują się, co sprawia, że zadania korzystające z pamięci podręcznej i przetwarzania wsadowego są tanie w obu wymiarach.
Okno kontekstowe o rozmiarze 1M tokenów jest dostępne w standardowych cenach w modelu Claude 4.6 i nowszych. Brak jest dodatkowych opłat za długi kontekst, więc żądanie o rozmiarze 900k tokenów jest rozliczane według tej samej stawki za token, co żądanie o rozmiarze 9k.
Mnożnikiem zwiększającym rachunek jest rezydencja danych. Ustawienie inference_geo: "us" w celu utrzymania wnioskowania wewnątrz Stanów Zjednoczonych nakłada mnożnik 1,1 na każdą kategorię tokenów, w tym na odczyty i zapisy do pamięci podręcznej. Należy pozostawić domyślne globalne routowanie, chyba że umowa wymaga inaczej.
Jedna zasada rozliczeniowa dotyczy specyficznie tego modelu. Fable 5 zawiera klasyfikatory bezpieczeństwa, które mogą odrzucić żądanie. W takim przypadku Messages API zwraca stop_reason: "refusal" jako udaną odpowiedź HTTP 200, a nie błąd, i użytkownik nie jest obciążany kosztami za żądanie odrzucone przed wygenerowaniem jakiejkolwiek odpowiedzi. W przypadku ponowienia tego samego promptu w innym modelu Claude, kredyt awaryjny zwraca koszt prompt cache poniesiony przy przełączeniu, dzięki czemu użytkownik nie płaci dwukrotnie za rozgrzanie tej samej pamięci podręcznej.
Które plany obejmują Claude Fable 5?
Według stanu na 3 sierpnia 2026 r. strona Anthropic dotycząca Claude Fable wskazuje, że model jest dostępny dla użytkowników planów Pro, Max, Team oraz Enterprise. Plan darmowy nie został wymieniony. Pro jest najtańszym stanowiskiem na tej liście, więc koszt planu Pro i limity jego użycia wyznaczają dolną granicę kosztów subskrypcji umożliwiającej dostęp do Fable. Dla programistów model jest ogólnie dostępny poprzez Claude API oraz wymienione powyżej platformy chmurowe. W tym modelu nie przewidziano darmowego poziomu, więc niewielki kredyt przyznawany przez Anthropic przy rejestracji jest jedynym dostępnym zasobem przed rozpoczęciem naliczania opłat.
Dostępność w ramach planu nie jest równoznaczna z nielimitowanym użyciem. Tabela porównawcza planów na stronie cennika Anthropic ogranicza dostęp do Fable poprzez limity tygodniowe w przypadku niektórych stanowisk oraz kredyty użycia w innych, a zasady te zmieniały się kilkukrotnie w lipcu 2026 r. Oficjalne oświadczenie Anthropic dotyczące wdrożenia Fable 5 obejmowało dostęp do modelu w ramach 50% tygodniowych limitów użycia do 7 lipca 2026 r. dla planów Pro, Max, Team oraz wybranych planów Enterprise, z przejściem na kredyty użycia po tej dacie. Raporty z pozostałej części lipca wskazywały na dalsze rozszerzenia oraz zróżnicowanie w zależności od typu stanowiska.
Niniejsza strona nie będzie zatem publikować limitów dla poszczególnych planów. Żadna wartość opublikowana w tamtym miesiącu nie utrzymała się przez dwa tygodnie, a nieaktualna liczba byłaby bardziej szkodliwa niż jej brak. Należy otworzyć wiersz oznaczony jako Fable w tabeli porównawczej planów w dniu podejmowania decyzji i traktować każdą liczbę podaną w artykułach prasowych jako nieaktualną. Jeśli wykupisz stanowisko w celu uzyskania dostępu do Fable, a limit okaże się mniejszy, niż wynikało to z tabeli, rezygnacja przed kolejnym odnowieniem pozwoli zachować opłacony już miesiąc.
Stałą wartością jest stawka API. W każdym przypadku, po wyczerpaniu limitu, dalsze użycie Fable 5 jest rozliczane według cen podanych w powyższej tabeli. W planie Enterprise struktura ta jest wyraźna, ponieważ opłata za stanowisko Enterprise zapewnia dostęp, podczas gdy same tokeny są rozliczane według stawek API. Sprawia to, że cennik jest wartością, na której należy się opierać w obu przypadkach, co prowadzi do tych samych wniosków, co porównanie rozliczeń API z subskrypcją dla każdego innego modelu Claude. Jeśli nie wybrano jeszcze poziomu, należy zacząć od dopasowania planu Claude do własnego użycia. Jeśli dane stanowisko ma służyć również jako codzienny asystent, a nie tylko jako sposób dostępu do Fable, warto sprawdzić porównanie cen planów Claude z ofertą ChatGPT przed podjęciem decyzji.
Dlaczego rachunek jest wyższy, niż wynikałoby to ze stosunku cen
Dwa udokumentowane mechanizmy sprawiają, że Fable 5 kosztuje więcej, niż sugeruje bezpośrednie porównanie cen.
Pierwszym z nich jest tokenizator. Fable 5 korzysta z tokenizatora wprowadzonego wraz z Claude Opus 4.7. W porównaniu z modelami wydanymi przed Opus 4.7, ten sam tekst generuje o około 30% więcej tokenów, a dokładny wzrost zależy od treści. Haiku 4.5 poprzedza ten tokenizator, więc dziesięciokrotna różnica w cenniku jest bliższa trzynastokrotnej, gdy poda się obu modelom ten sam blok tekstu. Sonnet 5 używa nowszego tokenizatora, więc porównanie Fable do Sonnet pod kątem kosztu za token jest sprawiedliwe. Porównanie Fable do Haiku – nie.
Drugim mechanizmem jest proces myślowy. Adaptacyjne myślenie jest w Fable 5 zawsze włączone, a thinking: {"type": "disabled"} nie jest wspierane. Tokeny myślowe są rozliczane jako tokeny wyjściowe, według pełnej stawki za wyjście. Surowy ciąg rozumowania nigdy nie jest zwracany w tym modelu, a thinking.display domyślnie przyjmuje wartość "omitted", co oznacza, że krótka widoczna odpowiedź może wiązać się z dużą liczbą rozliczanych tokenów wyjściowych. Dokumentacja Anthropic stwierdza to wprost: liczba rozliczanych tokenów wyjściowych nie odpowiada liczbie tokenów widocznych w odpowiedzi.
Zamiast zgadywać, należy przeanalizować zestawienie. Pole usage.output_tokens_details.thinking_tokens informuje, ile rozliczanych tokenów wyjściowych zostało przeznaczonych na rozumowanie:
{
"usage": {
"input_tokens": 25,
"output_tokens": 348,
"output_tokens_details": {
"thinking_tokens": 312
}
}
}W tym przykładzie, zaczerpniętym z dokumentacji Anthropic dotyczącej myślenia, 312 z 348 rozliczanych tokenów wyjściowych stanowiło rozumowanie, którego nikt nie widział. Podczas strumieniowania to zestawienie dociera dopiero w ostatnim zdarzeniu message_delta, więc klient, który przestaje czytać po ostatnim fragmencie tekstu, nigdy go nie zarejestruje.
Kontrolę stanowi effort, ustawione na output_config.effort, z poziomami low, medium, high (domyślny), xhigh oraz max.
{
"model": "claude-fable-5",
"max_tokens": 32000,
"output_config": { "effort": "medium" },
"messages": [{ "role": "user", "content": "..." }]
}Zalecenia Anthropic dla tego modelu sugerują rozpoczęcie od high, przejście na xhigh tylko w przypadku zadań wymagających najwyższych możliwości oraz obniżenie poziomu do medium lub low przy rutynowych pracach, z uwagi na to, że mniejszy wysiłek w Fable 5 często przewyższa xhigh w starszych modelach. Wiążą się z tym dwie pułapki. Zmiana wysiłku między żądaniami unieważnia prompt cache, ponieważ wartość rozdzielonego wysiłku jest renderowana w prompcie, dlatego należy wybrać poziom dla danego obciążenia i utrzymywać go na stałym poziomie. Ponadto max_tokens stanowi twardy limit całkowitego wyjścia, obejmujący zarówno myślenie, jak i tekst odpowiedzi, więc limit dobrany pod kątem odpowiedzi bez myślenia spowoduje ucięcie treści. Zobaczenie stop_reason: "max_tokens" oznacza, że należy albo zwiększyć limit, albo obniżyć poziom wysiłku.
Koszt wykonanego zadania, a nie koszt tokena
The data behind this chart
[
{
"label": "Short answer (5k in, 1k out)",
"fable_5": "0.10",
"opus_5": "0.05",
"sonnet_5": "0.02",
"haiku_4_5": "0.01"
},
{
"label": "Coding session (300k in, 40k out)",
"fable_5": "5.00",
"opus_5": "2.50",
"sonnet_5": "1.00",
"haiku_4_5": "0.50"
},
{
"label": "Long agent run (2M in, 400k out)",
"fable_5": "40.00",
"opus_5": "20.00",
"sonnet_5": "8.00",
"haiku_4_5": "4.00"
}
]Wiersze 3 to wynik działań arytmetycznych, a nie benchmark. Stawki są publicznie dostępne. Wolumeny tokenów to założenia, które należy zastąpić wartościami pochodzącymi z własnych danych o użyciu. Sesja programistyczna o charakterystyce środkowego wiersza kosztuje $5.00 w modelu Fable 5 w porównaniu do $1.00 w modelu Sonnet 5. Długotrwałe zadanie kosztuje $40.00 w porównaniu do $8.00. Kolumna Haiku w ostatnim wierszu jest czysto teoretyczna: Haiku 4.5 posiada okno kontekstowe o wielkości 200k tokenów, więc w ogóle nie jest w stanie obsłużyć tego zadania.
Koszt za token jest niewłaściwą jednostką przy podejmowaniu decyzji. Koszt wykonanego zadania to koszt jednej próby pomnożony przez liczbę prób. Przy obecnych stawkach jedna próba Fable 5 kosztuje tyle samo, co pięć prób Sonnet 5, więc sama liczba ponownych prób niemal nigdy nie uzasadnia przejścia na droższy model. Sonnet musiałby zawieść częściej niż cztery razy na pięć, aby tańsza ścieżka stała się nieopłacalna pod kątem zużycia tokenów.
Uzasadnieniem są czynniki, których rachunek za tokeny nie uwzględnia. Różnica między dwoma długimi zadaniami w tabeli jest mniejsza niż koszt jednej godziny pracy inżyniera na większości rynków. Jeśli droższy model zaoszczędzi godzinę przeglądu kodu lub pozwoli uniknąć jednej błędnej migracji, którą trzeba byłoby wycofywać, koszt modelu zwraca się w rachunku, który nie wykazuje tych oszczędności. Porównanie należy przeprowadzać w oparciu o pieniądze za zaakceptowany rezultat, uwzględniając własny czas w całkowitym rozrachunku. Zrozumienie, co faktycznie kupuje milion tokenów sprawia, że szacunki te stają się znacznie mniej abstrakcyjne.
Trzy zastosowania, w których Claude Fable 5 uzasadnia swoją cenę
Długotrwałe zadania agentowe, w których błędna decyzja generuje wysokie koszty. Model Fable 5 zaprojektowano do pracy mierzonej w godzinach: okno kontekstowe o rozmiarze 1M tokenów, do 128k tokenów wyjściowych na żądanie oraz poziom wysiłku xhigh ukierunkowany na zadania trwające ponad trzydzieści minut z budżetami liczonymi w milionach tokenów. Należy zestawić koszt uruchomienia z kosztami naprawy błędów, gdy agent obierze niewłaściwą ścieżkę w kroku 40, a błąd zostanie zauważony dopiero w kroku 300.
Migracja lub audyt wykonywany jednorazowo w dużej bazie kodu. Praca jednorazowa nie pozwala na amortyzację kosztów, więc wyższa cena za token obciąża pojedynczą fakturę, a całe zadanie może zmieścić się w jednym oknie kontekstowym. Jeśli zadanie może być wykonane asynchronicznie, Batch API obniża koszt o połowę do poziomu $25 za milion tokenów wyjściowych.
Zadanie, z którym tańszy model nie poradził sobie dwukrotnie. Dwie nieudane próby oraz czas poświęcony na debugowanie kosztują więcej niż jedna próba z użyciem Fable przy wolumenach wskazanych w powyższej tabeli. Eskalacja jest tańszym rozwiązaniem i właśnie do tego służy drabinka modeli. Jeśli nadal wybierasz między poziomami wydajności, porównanie możliwości modeli Claude odpowiada na inne pytanie niż ta strona.
Trzy zadania, w których Sonnet 5 lub Haiku 4.5 stanowią uczciwą odpowiedź
Klasyfikacja i ekstrakcja danych o dużej skali. Zadania te ocenia się pod kątem przepustowości i kosztu jednostkowego, a próg jakości jest na tyle niski, że tani model go osiąga. Przy dziesięciokrotnie wyższej cenie za zadanie, które Haiku 4.5 wykonuje poprawnie, Fable 5 nie oferuje żadnej mierzalnej wartości dodanej.
Praca interaktywna, w której produktem jest niska latencja. Tabela modeli Anthropic wskazuje na wyższą latencję Fable 5, a procesu myślowego nie można wyłączyć. Okno czatu lub autouzupełnianie w edytorze sprawiają wrażenie wolniejszych przy użyciu bardziej zaawansowanego modelu, ponieważ użytkownicy odczuwają czas oczekiwania szybciej niż różnicę w jakości.
Wszystko, co zależy od zdarzeń po styczniu 2026 roku. Wiarygodna data odcięcia wiedzy dla Fable 5 to styczeń 2026 roku. Dla Opus 5 jest to maj 2026 roku. Droższy model jest mniej aktualny, więc w pytaniach o bieżące wydarzenia płaci się podwójnie za starszą wiedzę, chyba że udostępni się modelowi narzędzia do wyszukiwania lub pobierania danych.
Jedno ograniczenie wykracza całkowicie poza kwestie kosztów. Fable 5 objęty jest 30-dniowym okresem retencji danych i nie jest dostępny w trybie zerowej retencji, ponieważ został sklasyfikowany jako Covered Model. Jeśli umowa wymaga zerowej retencji, Fable 5 nie jest opcją niezależnie od ceny i żadne rabaty tego nie zmienią.
Co pokazują repozytoria metody fable i czego nie pokazują
Praktycy opublikowali repozytoria, które destylują sposób działania podejścia Fable 5 do umiejętności, które może naśladować tańszy model. Repozytorium fable-method opisuje umiejętność myślenia, pętlę orkiestracji oraz weryfikator kontradyktoryjny, który ponownie wykonuje każde zadeklarowane sprawdzenie, zamiast polegać na raporcie agenta. Plik README stwierdza to wprost: „To jest destylacja społecznościowa, a nie artefakt firmy Anthropic”.
Należy traktować to dokładnie w ten sposób. Jest to dowód na to, w jaki sposób ludzie sterują modelem, a nie dokumentacja techniczna jego działania. Nic w tym materiale nie zostało zweryfikowane przez Anthropic, a istnieje kilka niemal identycznych forków z różnym sformułowaniami, co jest typowe dla przekazów ustnych, a nie dla specyfikacji.
Sygnałem wartym uwagi przy podejmowaniu decyzji o kosztach jest to, że elementy, które ludzie uznali za warte skopiowania, mają charakter proceduralny. Należy sklasyfikować zadanie, nazwać sprawdzenie potwierdzające jego wykonanie, zebrać dowody przed podjęciem decyzji, a następnie zweryfikować wynik poprzez obserwację, zamiast czytać podsumowanie. Tańszy model, któremu przekazano wyraźną listę kontrolną i krok weryfikacyjny, częściowo niweluje różnicę w wydajności, dlatego warto przeprowadzić taki eksperyment na własnym zbiorze ewaluacyjnym przed standaryzacją na droższym modelu. Wynik zależy od konkretnych zadań, dlatego cudze wyniki nie mają dla Ciebie większej wartości.
Sprawdź własne wyliczenia przed zatwierdzeniem budżetu
- Czytaj
usageprzy każdej odpowiedzi i logujoutput_tokens_details.thinking_tokensoddzielnie od widocznych danych wyjściowych. Rozumowanie, którego nie widzisz, jest pozycją kosztową, która zaskakuje użytkowników. - Ustaw
effortjawnie zamiast akceptować wartość domyślną i utrzymuj ją na stałym poziomie w każdej konwersji, która polega na cache'owaniu promptów. - Umieść stabilny prefiks za punktem przerwania cache'u. Odczyt z cache'u przy jednej dziesiątej ceny bazowej wejścia przynosi większe oszczędności niż większość zmian modelu na słabszy.
- Przenieś wszystko, co nie wymaga natychmiastowej odpowiedzi, do Batch API.
- Wyceniaj alternatywy uczciwie. Porównanie cen API Claude i ChatGPT dla własnego obciążenia jest warte poświęcenia popołudnia przed podjęciem długoterminowych zobowiązań.
Jeśli obciążenie stanowi agent działający na własnym serwerze, kontrolki o największym znaczeniu znajdują się poza wyborem modelu. Kontrola kosztów agenta na VPS omawia limity pętli oraz limity wydatków, które zatrzymują niekontrolowaną sesję, a gdzie Claude Code faktycznie zużywa tokeny wyjaśnia liczby widoczne w panelu użycia.
FAQ
Ile kosztuje Claude Fable 5 za milion tokenów?
Model Claude Fable 5 jest wyceniony na $10 za milion tokenów wejściowych oraz $50 za milion tokenów wyjściowych w API Claude, zgodnie z cennikiem Anthropic sprawdzonym 3 sierpnia 2026 roku. Odczyt z pamięci podręcznej (cache read) kosztuje $1 za milion tokenów, co stanowi jedną dziesiątą podstawowej stawki wejściowej. API Batch oferuje 50% zniżki na obie strony, co daje odpowiednio $5 oraz $25 za milion tokenów w przypadku zadań asynchronicznych. Utrzymywanie wnioskowania wewnątrz Stanów Zjednoczonych przy użyciu parametru inference_geo nakłada mnożnik 1,1 na każdą kategorię.
Czy Claude Fable 5 jest zawarty w subskrypcji Claude Pro?
Strona Anthropic dotycząca Claude Fable wskazuje, że model jest dostępny dla użytkowników planów Pro, Max, Team oraz Enterprise; plan darmowy nie został wymieniony. Dostęp w ramach subskrypcji nie jest nieograniczony. W niektórych przypadkach dostęp do Fable jest częścią tygodniowych limitów użycia, w innych odbywa się poprzez kredyty, a zasady te zmieniały się kilkukrotnie w lipcu 2026 roku. Należy sprawdzić wiersz oznaczony jako Fable w tabeli porównawczej planów na stronie cennika Anthropic w dniu podejmowania decyzji, zamiast polegać na danych z artykułów. Po wyczerpaniu limitu w ramach planu, dalsze użycie jest rozliczane według stawek API.
Dlaczego mój rachunek za Claude Fable 5 jest wyższy, niż sugeruje widoczny wynik?
Funkcja Adaptive thinking jest zawsze aktywna w modelu Claude Fable 5. Tokeny procesu myślowego są rozliczane jako tokeny wyjściowe, a surowy zapis toku rozumowania nie jest zwracany. Przy parametrze thinking.display ustawionym na wartość domyślną omitted, użytkownik widzi puste pole myślenia, płacąc jednocześnie za każdy token rozumowania wygenerowany w tle. Należy odczytać usage.output_tokens_details.thinking_tokens w odpowiedzi, aby zobaczyć podział, pamiętając, że podczas strumieniowania dane te docierają dopiero w ostatnim zdarzeniu message_delta. Należy obniżyć poziom effort, jeśli stosunek rozumowania do odpowiedzi jest wyższy, niż wymaga tego zadanie.
Czy powinienem używać Claude Fable 5 czy Claude Opus 5?
Model Claude Opus 5 kosztuje połowę mniej za token i posiada nowszą, wiarygodną datę odcięcia wiedzy: maj 2026 w porównaniu do stycznia 2026 dla Fable 5. Należy rozpocząć od Opus 5 i przejść na wyższy model, gdy zadanie tam zawiedzie lub gdy koszt błędnej odpowiedzi przewyższy różnicę w cenie. Fable 5 jest właściwym wyborem do długofalowych zadań typu agentowego, gdzie jedna błędna ścieżka generuje godziny pracy przy poprawkach, oraz do jednorazowych zadań, których wyższy koszt obciąża pojedynczą fakturę, zamiast być doliczanym do każdego zapytania na stałe.