Który model Claude wybrać? Porównanie kosztów
Analiza stawek Claude API na lipiec 2026. Porównanie kosztów Opus 4.8, Sonnet 5 oraz Haiku 4.5 przy 100 000 operacjach. Sprawdź cennik za 1 MTok.
Który model Claude należy wybrać?
Krótka odpowiedź na pytanie o wybór modelu Claude: należy zacząć od Claude Opus 4.8 i zmienić model tylko w przypadku wystąpienia konkretnego powodu. Wytyczne firmy Anthropic są zgodne: „Jeśli nie masz pewności, którego modelu użyć, wybierz Claude Opus 4.8 do złożonego programowania agentowego oraz zadań korporacyjnych”. Przejdź na Claude Sonnet 5, gdy zadanie jest precyzyjnie określone i jest wykonywane wielokrotnie w ciągu dnia. Przejdź na Claude Haiku 4.5 do powtarzalnych zadań o dużej objętości, gdzie oczekiwany poprawny wynik jest już znany. Claude Fable 5 jest przeznaczony do pracy długotrwałych agentów.
Wybór wiąże się z kosztami. Poniżej znajdują się stawki Claude API (application programming interface) według stanu na 23 lipca 2026 roku, za milion tokenów (w dokumentacji oznaczonych jako MTok).
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): $2 in, $10 out w ramach oferty wprowadzającej do 31 sierpnia 2026. Standardowa stawka $3 in, $15 out obowiązuje od 1 września 2026. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
Powyższe identyfikatory są kompletne. Nie należy dodawać do nich żadnych znaków.
W przypadku modeli o kontekście 1M nie obowiązują dodatkowe opłaty za rozmiar: „Zapytanie o rozmiarze 900k tokenów jest rozliczane według tej samej stawki za token, co zapytanie o rozmiarze 9k tokenów”.
Przeznaczenie poszczególnych modeli
Anthropic opisuje linię produktów za pomocą jednego zdania na model. Opisy te są bardziej wiarygodne niż rankingi typu leaderboard.
- Claude Fable 5: „Inteligencja nowej generacji dla długotrwałych agentów”. Model o najwyższym opóźnieniu spośród czterech dostępnych wersji.
- Claude Opus 4.8: „Do złożonego programowania agentowego i zadań korporacyjnych”. Umiarkowane opóźnienie.
- Claude Sonnet 5: „Najlepsze połączenie szybkości i inteligencji”. Wysoka szybkość działania.
- Claude Haiku 4.5: „Najszybszy model o inteligencji zbliżonej do modeli typu frontier”.
Model Haiku 4.5 posiada ograniczenia, które determinują przydatność do zadań przed analizą kosztów. Okno kontekstowe wynosi 200K tokens zamiast 1M tokens, co uniemożliwia przetworzenie dużych repozytoriów lub długich transkrypcji agentów. Maksymalna długość odpowiedzi w synchronous Messages API wynosi 64K tokens, podczas gdy pozostałe modele oferują 128K tokens. Data odcięcia wiedzy (knowledge cutoff) dla tego modelu to luty 2025, natomiast dla pozostałych trzech modeli jest to styczeń 2026.
Jaki koszt generuje wybór modelu przy rzeczywistym obciążeniu?
Wszystkie modele w tej linii rozliczeniowej wyceniają output na poziomie pięciokrotności stawki za input. Opus 4.8 kosztuje 5 $ za input i 25 $ za output. Haiku 4.5 kosztuje 1 $ za input i 5 $ za output. Stosunek ten pozostaje stały w całym zakresie, zatem wybór modelu ma kluczowe znaczenie w zadaniach generujących dużą ilość outputu.
Praca agentowa (agentic work) należy do tego rodzaju zadań, ponieważ tokeny myślowe (thinking tokens) są fakturowane jako tokeny output i wliczane w max_tokens, nawet jeśli tekst nie jest przesyłany do użytkownika. W modelach Fable 5, Opus 4.8, Opus 4.7 oraz Sonnet 5 podsumowanie rozumowania (reasoning summary) jest domyślnie pomijane, przez co pole thinking zwraca wartość pustą. Rozliczenie pozostaje bez zmian: "W obu przypadkach blok jest fakturowany w ten sam sposób i przekazywany w ten sam sposób w rozmowach wieloturowych". Co faktycznie generuje koszty tokenów Claude szczegółowo analizuje ten mechanizm.
Możliwość uruchomienia procesu myślowego (thinking) różni się między porównywanymi modelami, co może zafałszować test kosztów, jeśli zostanie to pominięte. W modelach Sonnet 5 oraz Fable 5 funkcja thinking jest włączona domyślnie i nie wymaga konfiguracji. W modelach Opus 4.8 oraz Opus 4.7 funkcja ta jest wyłączona, dopóki nie zostanie ustawiony parametr thinking: {type: "adaptive"} w żądaniu. Należy ujednolicić konfigurację po obu stronach przed analizą wyników liczbowych.
Dlaczego najtańszy model może okazać się najdroższy
Rozważmy pojedyncze zadanie programistyczne. Zapytanie zawiera 60,000 tokenów kontekstu, a model generuje 8,000 tokenów wyjścia, wliczając proces myślowy. Brak mechanizmu caching sprawia, że koszt obliczeń jest w pełni widoczny.
W modelu Opus 4.8: 0.06 MTok wejścia przy stawce $5 kosztuje $0.30, a 0.008 MTok wyjścia przy stawce $25 kosztuje $0.20. Koszt jednej próby wynosi $0.50. W modelu Haiku 4.5 ta sama próba kosztuje $0.06 plus $0.04, czyli łącznie $0.10.
Model Haiku jest pięciokrotnie tańszy w pojedynczej próbie. Sugeruje to dużą oszczędność, dopóki nie uwzględni się skutków nieudanej próby. Błędna odpowiedź wymaga czasu na jej analizę. Podczas ponownej próby błędna odpowiedź jest przesyłana jako kontekst, przez co każda kolejna próba jest większa od poprzedniej. Jeśli trzecia próba nadal jest błędna, następuje eskalacja do droższego modelu: $0.30 za Haiku plus $0.50 za Opus daje $0.80, czyli o 60% więcej niż pojedyncze uruchomienie Opus.
Kluczowym czynnikiem jest koszt weryfikacji odpowiedzi. Gdy błędna odpowiedź jest widoczna natychmiast, mały model jest opłacalny. Gdy wykrycie błędu wymaga dokładnej analizy diff, mały model generuje koszty czasowe, które nie są widoczne na fakturze.
Kiedy mniejszy model jest bezkonkurencyjny
Haiku 4.5 jest właściwym wyborem w następujących przypadkach:
- Mechaniczne zadania podagentów. Podagent zmieniający nazwy plików lub zbierający wyniki wyszukiwania nie wymaga zaawansowanego rozumowania. Jest to standardowy wzorzec po zbudowaniu agenta AI za pomocą Claude i przydzieleniu mu narzędzi pomocniczych.
- Triage logów. Decyzja, czy dana linia jest szumem, czy wymaga uwagi człowieka, to wąskie kryterium o łatwo definiowalnych błędach.
- Klasyfikacja względem stałego zestawu etykiet. Wynik jest krótki, a dokładność można zmierzyć na próbce danych.
- Masowe wywołania produkcyjne. Przy 100,000 uruchomieniach dziennie różnica w kosztach za token przestaje być pomijalna. Tak charakteryzują się workflowy AI zintegrowane z n8n.
- Każdy przypadek, gdzie szybkość odpowiedzi jest istotna dla użytkownika. Haiku 4.5 jest najszybszym modelem w zestawieniu.
Haiku posiada jedno specyficzne ograniczenie. Minimalna wielkość promptu podlegającego cache'owaniu wynosi 4,096 tokens, podczas gdy dla Opus 4.8 i Sonnet 5 wynosi ona 1,024. Poniżej tej wartości "wszystkie zapytania zawierające mniej niż tę liczbę tokens będą przetwarzane bez cache'owania i nie zostanie zwrócony żaden błąd". Blok instrukcji o długości 1,500 tokens, który jest cache'owany w Sonnet 5, nie zostanie cache'owany w Haiku 4.5. Objawem jest wartość cache_creation_input_tokens oraz cache_read_input_tokens wynosząca zero, co pozwala obniżyć koszty agenta działającego w trybie ciągłym obok innych przyczyn braku cache'owania.
Parametry wpływające na wynik
Każdy z poniższych czynników ma większy wpływ na koszty niż sama nazwa modelu.
Effort. output_config.effort określa, ile operacji wykonuje model przed udzieleniem odpowiedzi. Dostępne poziomy to low, medium, high, xhigh oraz max, przy czym domyślnym ustawieniem jest high: "Ustawienie effort na high daje dokładnie taki sam efekt, jak całkowite pominięcie parametru effort." Parametr ten jest zagnieżdżony wewnątrz output_config, a nie znajduje się na najwyższym poziomie żądania:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Parametr effort wpływa na każdy token w odpowiedzi: "Może on wpływać na całkowitą liczbę zużytych tokenów, w tym wywołania narzędzi (tool calls). Na przykład niższy poziom effort oznacza, że Claude wykonuje mniej wywołań narzędzi". Skutkuje to kumulacją kosztów w pętli agentycznej. Nie jest to limit tokenów: "Effort jest sygnałem behawioralnym, a nie sztywnym budżetem tokenów". Anthropic nie podaje mnożnika kosztów dla poszczególnych poziomów i zaleca testowanie własnych przypadków użycia, zatem porównanie działania Sonnet 5 przy high z Opus 4.8 przy low jest możliwe do przeprowadzenia natychmiast. Model Haiku 4.5 nie znajduje się na liście modeli obsługujących parametr effort.
Prompt caching. Odczyt z pamięci cache kosztuje 0.1x stawki podstawowej za input. Wartość ta decyduje o wyborze modelu w zależności od tieru. Cache hit w modelu Opus 4.8 kosztuje $0.50 / MTok, natomiast niecache'owany input w modelu Haiku 4.5 kosztuje $1 / MTok. Oznacza to, że dobrze cache'owany prefiks w modelu Opus jest tańszy w przeliczeniu na token wejściowy niż zimny prompt w modelu Haiku. Optymalizacja sesji (session hygiene) jest ważniejsza niż wybór modelu w każdym obciążeniu, które wielokrotnie przesyła duży, stabilny prefiks.
Batches. Jeśli odpowiedź nie musi być udzielona natychmiast, Message Batches API przetwarza te same modele z "50% zniżką na tokeny wejściowe i wyjściowe". Powoduje to zmniejszenie kosztów o połowę w każdym wierszu poniższego zestawienia. Funkcja działa we wszystkich tierach: zadanie typu batched w modelu Opus 4.8 kosztuje mniej niż synchroniczne zadanie w modelu Sonnet 5 przy standardowej cenie od 1 września 2026 roku, co pozwala zamienić opóźnienie (latency) na większe możliwości przy tym samym budżecie.
Porównanie kosztów pojedynczego zadania
Obciążenie: klasyfikacja 100,000 wiadomości e-mail, jedno wywołanie na wiadomość, 2,000 tokenów wejściowych i 300 tokenów wyjściowych na wywołanie. Łącznie 200 MTok wejściowych i 30 MTok wyjściowych.
- Haiku 4.5: 200 x $1 = $200 wejściowych, 30 x $5 = $150 wyjściowych. Suma $350.
- Sonnet 5, stawka wstępna: 200 x $2 = $400 wejściowych, 30 x $10 = $300 wyjściowych. Suma $700.
- Sonnet 5, od 1 września 2026: 200 x $3 = $600 wejściowych, 30 x $15 = $450 wyjściowych. Suma $1,050.
- Opus 4.8: 200 x $5 = $1,000 wejściowych, 30 x $25 = $750 wyjściowych. Suma $1,750.
Można zmienić cztery wartości, aby przeliczyć dane przy użyciu przyszłych cen. Poniższe modyfikacje zmieniają wynik bardziej niż nazwa modelu:
- Batching redukuje koszt o połowę w każdej linii: $175, $350, $525 i $875. Proces klasyfikacji nocnej nie wymaga oczekiwania, więc nie ma powodu, aby z niego rezygnować.
- Cache dla wspólnego prefiksu. Przyjmijmy, że 1,200 z 2,000 tokenów wejściowych to zawsze ten sam blok instrukcji. W modelu Sonnet 5 przy stawce wstępnej koszt cache hit wynosi $0.20 / MTok zamiast $2 / MTok, zatem 120 MTok kosztuje $24 zamiast $240. Dodając 80 MTok nowych danych wejściowych po $2 (czyli $160) oraz $300 za dane wyjściowe, koszt Sonnet 5 wynosi około $484 zamiast $700. Ta metoda nie działa w modelu Haiku 4.5, ponieważ 1,200 tokenów to mniej niż wymagane minimum 4,096 tokenów.
- Ponowne próby (Retries). Przyjmijmy, że 8% odpowiedzi modelu Haiku zostaje odrzuconych i są one ponownie przetwarzane przez model Opus 4.8. Należy dodać 0.08 x $1,750 = $140 do kwoty $350, co daje $490. Należy mierzyć własny współczynnik odrzuceń zamiast korzystać z podanych wartości.
- Definicje narzędzi (Tool definitions), jeśli zadanie ich wymaga. System prompt generowany przez nie zajmuje 290 tokenów w modelu Opus 4.8 przy ustawieniu
tool_choicenaauto, 354 tokeny w Sonnet 5 oraz 496 tokeny w Haiku 4.5. Najtańszy model generuje największy narzut stały.
Haiku z ścieżką eskalacji za $490 oraz Sonnet 5 z cache za $484 mają taki sam koszt, przy czym jeden z nich wykonuje zadanie w jednym przebiegu. Wybór modelu nie jest jedynym czynnikiem decydującym.
Czy zmiana modelu w trakcie sesji pozwala zaoszczędzić pieniądze?
Oszczędności są mniejsze, niż sugerują ceny katalogowe, ponieważ oszczędność dotyczy pojedynczych tokenów, natomiast ryzyku podlega cały skasowany prefix.
Dokumentacja Anthropic określa warunki unieważniające cache. Prefiksy są budowane w kolejności tools, następnie system, a następnie messages, a „zmiany na każdym poziomie unieważniają ten poziom oraz wszystkie kolejne poziomy”. Na liście znajdują się również dwa ustawienia żądania: „konfiguracja thinking oraz rozwiązany poziom effort są renderowane bezpośrednio w prompcie, więc zmiana któregokolwiek z nich inicjuje nowy prefix cache”. Dokumentacja zawiera również dodatkową wskazówkę: „zmieniaj poziom effort pomiędzy różnymi zadaniami, a nie wewnątrz jednej konwersacji, która polega na trafieniach w cache (cache hits)”.
Model nie znajduje się na powyższej liście, więc nie należy zakładać żadnego wyniku. Należy sprawdzić cache_read_input_tokens przy pierwszym żądaniu po zmianie modelu, aby zweryfikować koszt. Dla prefixu Opus 4.8 o długości 150,000 tokenów koszt odczytu cache wynosi około $0.08, natomiast koszt nowego zapisu to około $0.94. Jest to kwota wyższa niż oszczędności wynikające z różnicy stawek za token w kilku kolejnych turach.
Należy zatem zmieniać te parametry pomiędzy zadaniami, a nie w ich trakcie. W Claude Code oznacza to najpierw /clear, gdy cache i tak jest usuwany, a następnie /model lub /effort.
Jak przetestować odpowiedź na własnym obciążeniu roboczym
Nie należy dobierać rozmiaru promptu na podstawie liczby tokenów wygenerowanej przez inny model. Endpoint do liczenia tokenów jest bezpłatny i używa tokenizera modelu wskazanego w zapytaniu, dlatego należy wskazać model, który będzie faktycznie wywoływany. Modele Opus 4.7 i nowsze oraz Fable 5 i Sonnet 5 używają nowszego tokenizera, który „generuje około 30% więcej tokenów dla tego samego tekstu”. Oznacza to, że budżet wyliczony dla starszego modelu będzie zaniżony w przypadku nowszego modelu przy zachowaniu tej samej stawki za token.
Następnie należy przeanalizować otrzymane dane. input_tokens zawiera jedynie pozostałość spoza pamięci cache, zatem rzeczywisty rozmiar promptu to wartość z tego pola plus cache_creation_input_tokens plus cache_read_input_tokens. Pierwsza aplikacja Claude API na VPS to najprostsza metoda na przeprowadzenie takiego pomiaru, natomiast Który plan Claude pasuje do Twojego użytkowania to odrębna decyzja dotycząca zasad płatności za tokeny.
FAQ
Który model Claude jest najlepszy do programowania?
Claude Opus 4.8 jest dokumentowanym punktem wyjścia dla złożonego programowania agentowego. Według stanu na lipiec 2026 roku koszt wynosi 5 USD za milion tokenów wejściowych i 25 USD za milion tokenów wyjściowych. Claude Sonnet 5 stanowi optymalne połączenie szybkości i inteligencji. W okresie do 31 sierpnia 2026 roku koszt wynosi 2 USD / 10 USD, czyli mniej niż połowę ceny Opus. Należy uruchomić to samo zadanie na obu modelach, zachowując stałą konfigurację thinking, a następnie porównać całkowite wydatki na tokeny na podstawie response.usage.
Czy Claude Haiku 4.5 jest wystarczająco tani, aby zastąpić Sonnet 5?
W przeliczeniu na token: tak. Cena wynosi 1 USD / 5 USD w porównaniu do 2 USD / 10 USD dla Sonnet 5 w cenie promocyjnej, lub 3 USD / 15 USD od 1 września 2026 roku. Decydujące są limity. Haiku 4.5 posiada okno kontekstowe 200K tokenów zamiast 1M. Maksymalny output w synchronous Messages API wynosi 64K. Data odcięcia wiedzy (knowledge cutoff) to luty 2025. Model nie posiada wsparcia dla output_config.effort. Minimalny prompt podlegający cache ma 4,096 tokenów, co przy krótkich system promptach wyłącza funkcję cache.
Czy zmiana modelu Claude na tańszy w trakcie sesji generuje oszczędności?
Rzadziej, niż się wydaje. Anthropic definiuje invalidatory cache jako zmiany w prefix tools, system lub messages, zmiany w konfiguracji thinking oraz zmiany w output_config.effort. Wpływ zmiany modelu na istniejący cache nie jest udokumentowany, dlatego należy traktować go jako nieznany i sprawdzić cache_read_input_tokens przy pierwszym zapytaniu po zmianie. Skala oszczędności jest istotna: przy prefixie Opus 4.8 o długości 150,000 tokenów, odczyt z cache kosztuje około 0.08 USD, natomiast ponowny zapis około 0.94 USD. Koszt ten przewyższa oszczędności wynikające z niższej ceny za token w kilku kolejnych krokach. Należy dokonywać zmian między zadaniami, po /clear w Claude Code, gdy cache i tak jest usuwany.
Jak output_config.effort wpływa na rachunek?
Parametr ten zmienia liczbę tokenów zużywanych na tekst, wywołania narzędzi (tool calls) oraz proces thinking. Niższy poziom effort skutkuje mniejszą liczbą wywołań narzędzi. Powoduje to kumulację kosztów w pętlach agentowych, ponieważ każdy wynik narzędzia jest ponownie przesyłany w kolejnych krokach. Dostępne poziomy to low, medium, high, xhigh oraz max, przy czym domyślnym jest high. Anthropic nie podaje mnożnika kosztów dla poszczególnych poziomów. Parametr effort jest traktowany jako sygnał behawioralny, a nie budżet tokenów, dlatego należy samodzielnie zmierzyć jego wpływ na konkretne zadanie.
Ile oszczędza Claude Batches API?
Generuje 50% oszczędności zarówno na tokenach wejściowych, jak i wyjściowych, w zamian za asynchroniczne dostarczanie wyników. Według stanu na lipiec 2026 roku ceny wynoszą: Opus 4.8 to 2.50 USD (in) / 12.50 USD (out), Sonnet 5 to 1 USD / 5 USD w cenie promocyjnej, a Haiku 4.5 to 0.50 USD / 2.50 USD. Porównanie między tierami jest istotne: zadanie batchowe Opus 4.8 kosztuje mniej niż zadanie synchroniczne Sonnet 5 w standardowej stawce od 1 września 2026 roku. Batching pozwala uzyskać dostęp do silniejszego modelu w tej samej cenie.