Dlaczego API Claude jest tak drogie? Analiza kosztów
Tokeny wyjściowe kosztują pięć razy więcej niż wejściowe, a każda kolejna tura przesyła całą historię rozmowy. Sprawdź wyliczenia dla sesji i cztery metody optymalizacji zużycia.
Dlaczego Claude jest kosztowny? Krótka odpowiedź
Claude jest kosztowny z czterech nakładających się na siebie powodów. Tokeny wyjściowe są wyceniane pięciokrotnie wyżej niż tokeny wejściowe. API nie przechowuje pamięci konwersacji, więc cała historia jest przesyłana ponownie i rozliczana przy każdej kolejnej turze. Agent zamienia jedno pytanie w dziesiątki wywołań API, a każde z nich zawiera rosnącą historię. Ponadto model klasy frontier jest wyceniany w oparciu o stopień trudności wykonywanej pracy, a nie o koszt uruchomienia niewielkiego modelu.
Token to fragment tekstu. W przybliżeniu jeden token to około cztery znaki lub około 0,75 słowa w języku angielskim. Stawki są podawane za milion tokenów, zapisywane jako MTok (million tokens). Każda stawka poniżej jest opublikowaną stawką API Claude według stanu na sierpień 2026.
Większość nieoczekiw
Opublikowane stawki, czyli uzgodnienie liczb
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5,
"cache_read_usd": "0.10"
},
{
"label": "Sonnet 5, to Aug 31 2026",
"input_usd": 2,
"output_usd": 10,
"cache_read_usd": "0.20"
},
{
"label": "Sonnet 5, from Sep 1 2026",
"input_usd": 3,
"output_usd": 15,
"cache_read_usd": "0.30"
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25,
"cache_read_usd": "0.50"
}
]Należy zwrócić uwagę na proporcje, a nie na wartości bezwzględne. Każdy model kosztuje dokładnie pięć razy więcej za wyjście niż za wejście. Opus 5 kosztuje 5 dolarów za milion tokenów wejściowych oraz 25 dolarów za milion tokenów wyjściowych. Haiku 4.5 kosztuje 1 oraz 5. Zatem różnica między najtańszym a najdroższym modelem wynosi pięciokrotność, podobnie jak różnica między odczytem a zapisem.
Sonnet 5 jest objęty ceną promocyjną wynoszącą 2 oraz 10 dolarów za milion do 31 sierpnia 2026 roku. Od 1 września 2026 roku stawka zmieni się na 3 oraz 15. Stawki zmieniają się wraz z wydaniami nowych modeli, dlatego przed zaplanowaniem budżetu należy sprawdzić aktualne wartości. Poniżej tej tabeli nie ma darmowego poziomu dostępu, choć nowe konta otrzymują niewielki kredyt na start, a niektóre elementy API są całkowicie bezpłatne.
Ostatnia kolumna zawiera stawkę za odczyt z pamięci podręcznej (cache). To ona decyduje o większości kosztów. Należy do niej wrócić po wykonaniu obliczeń.
Dlaczego tokeny wyjściowe kosztują pięć razy więcej niż wejściowe?
Odczyt i zapis wymagają różnego nakładu pracy. Tokeny wejściowe są przetwarzane w jednym przebiegu. Model odczytuje cały prompt jednocześnie, a praca przebiega równolegle, dlatego odczyt promptu o długości 60 000 tokenów nie trwa 60 000 razy dłużej niż odczyt promptu o długości 1 000 tokenów.
Tokeny wyjściowe są generowane pojedynczo. Każdy nowy token wymaga osobnego przebiegu przez model i wykorzystuje wszystkie poprzednie tokeny jako kontekst. Zapisanie 1 000 tokenów oznacza 1 000 przebiegów, jeden po drugim. Ta praca szeregowa nie może być rozproszona tak jak odczyt, dlatego każdy token wyjściowy zajmuje zasoby sprzętowe przez dłuższy czas.
Dlatego polecenie „skróć odpowiedź” ma mniejszy wpływ na koszty, niż oczekują użytkownicy. Działa ono na mniejszą część rachunku za działanie agenta.
Dlaczego cała konwersacja jest ponownie rozliczana przy każdym kroku?
API Claude jest bezstanowe. Po stronie Anthropic nie istnieje żadna konwersacja, do której dopisywana jest kolejna wiadomość. Każde żądanie zawiera pełną historię wiadomości, a model odczytuje ją w całości przed wygenerowaniem jakiejkolwiek odpowiedzi. Z tego powodu krok 30 jest rozliczany również za kroki od 1 do 29.
Oznacza to, że koszt konwersacji rośnie szybciej niż jej długość. Krok 1 rozlicza niewielki kontekst. Krok 40 rozlicza kontekst o dużym rozmiarze. Po zsumowaniu wszystkich czterdziestu kroków opłata obejmuje wielokrotność liczby tokenów, które zostały faktycznie wygenerowane.
The data behind this chart
[
{
"turn": 1,
"context_tokens": "20,000"
},
{
"turn": 5,
"context_tokens": "32,000"
},
{
"turn": 10,
"context_tokens": "45,000"
},
{
"turn": 15,
"context_tokens": "55,000"
},
{
"turn": 20,
"context_tokens": "64,000"
},
{
"turn": 25,
"context_tokens": "74,000"
},
{
"turn": 30,
"context_tokens": "84,000"
},
{
"turn": 35,
"context_tokens": "92,000"
},
{
"turn": 40,
"context_tokens": "100,000"
}
]Powyższa sesja rozpoczyna się od 20,000 tokenów, na które składa się prompt systemowy, definicje narzędzi oraz pierwsze pliki otwarte przez agenta. Do kroku 40 kontekst zawiera 100,000 tokenów. Uśredniając tę wartość dla wszystkich czterdziestu kroków, otrzymuje się około 60 000 tokenów odczytywanych w ramach każdego żądania.
Dlaczego agent kosztuje znacznie więcej niż czat?
Czat to jedno żądanie na pytanie. Agent to jedno żądanie na każdy krok. Odczytanie pliku to krok. Uruchomienie testu to krok. Odczytanie wyniku testu to krok. Edycja pliku to krok. Czterdzieści kroków do wykonania jednego zadania to standard dla agenta programistycznego.
Z użyciem narzędzi wiążą się dwa dodatkowe koszty. Definicje narzędzi stanowią tokeny wejściowe w każdym żądaniu, ponieważ model musi być za każdym razem informowany o dostępnych narzędziach. Anthropic publikuje informacje o narzucie: systemowy prompt użycia narzędzi to 286 tokenów w modelu Opus 5 przy ustawieniu tool_choice na auto, plus tokeny własnych schematów narzędzi. Niektóre narzędzia po stronie serwera również wiążą się z osobną opłatą. Wyszukiwanie w sieci jest rozliczane w kwocie 10 USD za 1000 wyszukiwań, poza tokenami zużywanymi przez wyniki.
Każdy wynik działania narzędzia staje się również stałym kontekstem. Polecenie, które wypisuje 3000 linii, umieszcza te 3000 linii w każdym kolejnym żądaniu do końca sesji. Zużycie tokenów na sesję raportowane przez Claude Code czyni to widocznym: należy obserwować, jak liczba tokenów wejściowych rośnie tuż po wykonaniu "głośnego" polecenia.
Arytmetyka pojedynczej rzeczywistej sesji
Oto realistyczna godzina pracy agenta kodującego na modelu Opus 5. Czterdzieści żądań API. Kontekst rośnie z 20 000 do 100 000 tokenów, co daje średnio około 60 000 tokenów na żądanie. Model generuje około 700 tokenów na żądanie, co stanowi mieszankę krótkich wywołań narzędzi oraz kilku dłuższych bloków kodu.
Requests in the session: 40
Average context per request: 60,000 tokens
Total input tokens billed: 40 x 60,000 = 2,400,000
Input cost on Opus 5: 2,400,000 x $5 / 1,000,000 = $12.00
Total output tokens: 40 x 700 = 28,000
Output cost on Opus 5: 28,000 x $25 / 1,000,000 = $0.70
Session total = $12.70The data behind this chart
[
{
"label": "Input, context re-read",
"billed_tokens": "2,400,000",
"cost_usd": "12.00"
},
{
"label": "Output, code and tool calls",
"billed_tokens": "28,000",
"cost_usd": "0.70"
}
]Należy zwrócić uwagę na podział kosztów. Koszt odczytu wyniósł 12.00 dolarów, a koszt zapisu 0.70 dolarów, zatem dane wyjściowe, które faktycznie zostały odczytane, stanowią około pięciu procent rachunku. Model zapisał 28,000 tokenów i został obciążony za odczyt 2,400,000 tokenów. Nikt nie wpisał 2,4 miliona tokenów. Te same 100 000 tokenów było odczytywanych wielokrotnie.
Dźwignia 1: prompt caching, czyli najważniejszy czynnik
Prompt caching przechowuje przetworzoną postać stałego prefiksu promptu. Przy kolejnym żądaniu prefiks ten jest odczytywany z pamięci podręcznej zamiast ponownego przetwarzania. Zapis do pamięci podręcznej kosztuje 1,25 raza więcej niż standardowa stawka wejściowa w przypadku pamięci pięciominutowej lub 2 razy więcej w przypadku pamięci godzinnej. Odczyt kosztuje 0,1 stawki wejściowej. W modelu Opus 5 oznacza to 0.50 dolarów za milion tokenów zamiast 5 dolarów.
Zastosuj to do powyższej sesji. Każdy ze 100 000 tokenów jest zapisywany do pamięci podręcznej jednokrotnie w miarę rozwoju konwersacji. Pozostałe 2 300 000 tokenów wejściowych staje się odczytami z pamięci podręcznej.
Tokens written to cache: 100,000
Cache write at 1.25x input: 100,000 x $6.25 / 1,000,000 = $0.63
Tokens read from cache: 2,300,000
Cache read at 0.1x input: 2,300,000 x $0.50 / 1,000,000 = $1.15
Output cost, unchanged = $0.70
Session total = $2.48Część podlegającą buforowaniu oznacza się polem cache_control. Umieść punkt przerwania (breakpoint) po treści, która nie zmienia się między turami: po prompcie systemowym i definicjach narzędzi. Długi dokument, do którego często się odwołujesz, również powinien znaleźć się w tym samym stałym bloku.
{
"model": "claude-opus-5",
"system": [
{
"type": "text",
"text": "<long, stable instructions>",
"cache_control": {"type": "ephemeral"}
}
],
"messages": [{"role": "user", "content": "..."}]
}Kolejność elementów w prompcie decyduje teraz o kosztach. Trafienie w pamięć podręczną (cache hit) wymaga dokładnego dopasowania od samego początku promptu, więc wszystko, co zmienia się przy każdym żądaniu, musi znajdować się za elementami stałymi. Umieszczenie znacznika czasu na początku promptu systemowego spowoduje utratę trafienia w każdej turze: cały prefiks stanie się chybieniem (miss), a użytkownik zapłaci 1,25 stawki wejściowej za ponowny zapis.
Odpowiedź informuje, czy operacja zakończyła się powodzeniem. Wyślij żądanie i odczytaj blok użycia (usage block).
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Hello"}]
}'Każda odpowiedź zawiera obiekt usage, taki jak ten poniżej:
{
"usage": {
"input_tokens": 105,
"cache_creation_input_tokens": 7345,
"cache_read_input_tokens": 7123,
"output_tokens": 239
}
}Powtórne żądanie, które nadal wykazuje 0 w polu cache_read_input_tokens, oznacza brak trafienia w pamięć podręczną. Najczęstszą przyczyną jest zmiana elementu znajdującego się przed punktem przerwania. Pamięć pięciominutowa również wygasa, więc żądanie wysłane po sześciu minutach będzie chybieniem, po którym nastąpi nowy zapis.
Poziom 2: przekierowywanie prostych zadań do mniejszego modelu
Większość tur w sesji agenta nie jest skomplikowana. Otwarcie pliku, uruchomienie formatera, odczytanie diffa. Te operacje nie wymagają modelu klasy frontier. Przekierowanie ich do Haiku 4.5 obniża koszt wejściowy z 5 dolarów za milion tokenów do 1.
The data behind this chart
[
{
"label": "Opus 5, no caching",
"session_cost_usd": "12.70"
},
{
"label": "Opus 5, cached",
"session_cost_usd": "2.48"
},
{
"label": "Sonnet 5, cached",
"session_cost_usd": "0.99"
},
{
"label": "Haiku 4.5, cached",
"session_cost_usd": "0.50"
}
]Ta sama sesja kosztuje 12.70 dolarów przy użyciu Opus 5 bez cache'owania, 2.48 z cache'owaniem, 0.99 na Sonnet 5 z cache'owaniem oraz 0.50 na Haiku 4.5 z cache'owaniem. Samo cache'owanie redukuje rachunek o około osiemdziesiąt procent. Wybór modelu eliminuje większość pozostałych kosztów.
Należy jednak zachować ostrożność. Tańszy model, który udzieli błędnej odpowiedzi, generuje koszt powtórzenia całej sesji oraz stratę czasu użytkownika. Decyzje o routingu należy podejmować w oparciu o stopień trudności zadania, a nie cenę. Zasada ta działa również w drugą stronę: Claude Fable 5 jest droższy od Opus 5, kosztując odpowiednio 10 i 50 dolarów za milion tokenów, dlatego przed wysłaniem tam zapytania warto sprawdzić co oferują te stawki. Artykuł Wybór między Opus, Sonnet i Haiku szczegółowo omawia zastosowania każdego z nich.
Poziom 3: higiena kontekstu
Każdy token pozostawiony w kontekście jest rozliczany w każdej kolejnej turze, dlatego wczesne usunięcie zbędnych danych jest znacznie bardziej opłacalne niż późne. Plik o rozmiarze 5000 tokenów wklejony w 5. turze sesji trwającej 40 tur zostanie odczytany jeszcze 35 razy. Generuje to 175 000 dodatkowych tokenów wejściowych, co w przypadku modelu Opus 5 oznacza koszt bliski jednego dolara za jedno nieprzemyślane wklejenie.
Cztery nawyki, które pozwalają zredukować zużycie:
- Rozpoczynaj nową sesję dla każdego nowego zadania zamiast kontynuować pracę z poprzedniego dnia.
- Filtruj zbędne dane wyjściowe poleceń przed przekazaniem ich do modelu, używając narzędzi takich jak
head -50, zamiast robić to później. - Proś o konkretną funkcję, która jest przedmiotem zainteresowania, a nie o cały plik.
- Gdy długa sesja przestaje przynosić postępy, poproś o podsumowanie i rozpocznij nową sesję na jego podstawie. Podsumowanie zajmuje kilkaset tokenów, podczas gdy pełny zapis sesji może liczyć sto tysięcy.
Poziom 4: przetwarzanie wsadowe dla zadań nieinteraktywnych
Batch API przetwarza żądania asynchronicznie i obniża koszty wejścia oraz wyjścia o 50 procent. Jeśli zadanie nie wymaga odpowiedzi w czasie krótszym niż sekunda, należy je przetworzyć wsadowo. Dotyczy to klasyfikacji, ekstrakcji, podsumowywania zaległych danych oraz uruchomień ewaluacyjnych. Rabat za przetwarzanie wsadowe łączy się z mechanizmem prompt caching. Nie ma on zastosowania w sesjach interaktywnych, ponieważ w takim przypadku nie występuje oczekiwanie na wynik.
Czy przepłacam?
To jest właściwe pytanie kryjące się pod hasłem „dlaczego Claude jest drogi”, więc oto bezpośrednia odpowiedź. Stawki są publikowane, jednakowe dla wszystkich w standardowych planach i naliczane za token. Wyjątek stanowią wynegocjowane umowy, ale nawet w nich Claude Enterprise pricing wprowadza opłatę za stanowisko obok tych samych rozliczanych tokenów, zamiast je zastępować. Żaden element rachunku nie jest uznaniowy. Cennik nie informuje, czy otrzymujesz wartość, ponieważ wycenia tokeny, a Ciebie interesują rezultaty.
Dlatego wyceniaj rezultat. Powyższa sesja kosztowała 12.70 dolarów bez użycia cache. Jeśli dzięki niej wdrożono funkcję, której stworzenie zajęłoby godzinę, jest to tanie. Jeśli model wykonał czterdzieści tur, kręcąc się w kółko, te same 12.70 dolarów nie przyniosły żadnej wartości, a problemem nigdy nie była stawka.
O tym należy pamiętać. Rachunek skaluje się wraz z liczbą tokenów, a nie z wartością. Produktywna sesja i zmarnowana sesja o tej samej długości kosztują tyle samo. Dlatego cztery dźwignie znaczą więcej niż cennik: nie można negocjować ceny za token, ale to Ty decydujesz, ile tokenów wymaga zadanie.
Śledź więc dolary na wykonane zadanie, a nie dolary na miesiąc. Jeśli ta liczba spada podczas optymalizacji cache i routingu, konfiguracja poprawia się, nawet gdy miesięczna suma rośnie, ponieważ wzrost wynika z wykonania większej ilości pracy.
Co nie obniża rachunku
Niektóre popularne porady przynoszą znikome efekty. Polecenie modelowi, aby był „zwięzły”, skraca odpowiedź, a dane wyjściowe stanowiły pięć procent przykładowego rachunku. Skrócenie własnego pytania pozwala zaoszczędzić kilkaset tokenów w kontekście liczącym 60 000 tokenów. Wyłączenie rozszerzonego myślenia pomaga tylko wtedy, gdy tokeny myślowe stanowiły istotną część danych wyjściowych, a blok użycia informuje o tym bezpośrednio, zamiast pozostawiać pole do domysłów.
Większe okno kontekstowe samo w sobie również nie generuje kosztów. W modelu Claude 4.6 i nowszych, pełne okno miliona tokenów jest rozliczane według standardowej stawki za token, więc żądanie o wielkości 900 000 tokenów kosztuje tyle samo za token, co żądanie o wielkości 9 000 tokenów. Rozmiar okna nie ustala ceny. Ustala ją to, co zdecydujesz się w nim umieścić.
Dwie kolejne kwestie powinny być częścią planowania, a nie pojedynczej sesji. Jeśli korzystasz z narzędzia codziennie i w sposób interaktywny, porównaj płatność za token z planem ryczałtowym: porównanie kosztów API i subskrypcji wykonuje to obliczenie. Jeśli plan ryczałtowy jest korzystniejszy, a rozważasz jednocześnie ofertę innego dostawcy, porównanie cen planów Claude i ChatGPT przeprowadza to samo zestawienie dla obu usług. Jeśli agent działa bez nadzoru na serwerze, ustaw twardy limit wydatków, zanim zaczniesz optymalizować cokolwiek innego; kwestię tę omawia kontrola kosztów agenta AI na VPS. Aby uzyskać ogólne wyobrażenie o skali, co faktycznie można kupić za milion tokenów Claude przekłada cennik na strony tekstu.
FAQ
Dlaczego mój rachunek za Claude wzrósł po rozpoczęciu korzystania z agenta?
Ponieważ agent wysyła wiele żądań na każde pytanie, a każde żądanie zawiera całą dotychczasową historię konwersacji. Czat wysyła jedno żądanie na pytanie. Agent programistyczny wysyła jedno żądanie na każdy krok, a czterdzieści kroków dla jednego zadania to standard. Każde z tych żądań jest rozliczane za pełny kontekst, więc sesja kończąca się na 100 000 tokenów może zostać rozliczona łącznie za ponad dwa miliony tokenów wejściowych. Sprawdź input_tokens oraz cache_read_input_tokens w odpowiedzi API, aby zobaczyć to bezpośrednio.
Czy prompt caching faktycznie tak bardzo obniża rachunki?
W przedstawionym przykładzie koszt sesji spadł z 12.70 dolarów do 2.48 dolara, ponieważ odczyt z pamięci podręcznej kosztuje jedną dziesiątą stawki za dane wejściowe. Oszczędność zależy całkowicie od współczynnika trafień. Przy pięciominutowym buforze pamięci podręcznej koszt zwraca się po pojedynczym odczycie, ponieważ zapis kosztuje 1,25 raza więcej niż dane wejściowe, a odczyt 0,1 raza. Jeśli prompt zmienia się blisko początku przy każdym żądaniu, nie uzyskasz żadnych trafień i zapłacisz premię za zapis bez żadnej korzyści. Potwierdź działanie za pomocą cache_read_input_tokens, zanim założysz, że mechanizm działa poprawnie.
Czy powinienem używać Haiku do wszystkiego?
Nie. Haiku 4.5 kosztuje 1 dolara za milion tokenów wejściowych w porównaniu do 5 dla Opus 5, więc oszczędność jest realna w przypadku prostych zadań o dużej skali, takich jak klasyfikacja czy routing. Błędna odpowiedź w trudnym zadaniu kosztuje więcej niż oszczędności wynikające z wyboru modelu, ponieważ płacisz za ponowne wykonanie zadania oraz za własny czas. Sprawdza się model mieszany: mały model do zadań mechanicznych, model klasy frontier do zadań wymagających oceny.
Czy API jest tańsze niż subskrypcja Claude?
Zależy to od regularności użytkowania. Subskrypcja to stała miesięczna opłata z przypisanymi limitami użycia. API jest rozliczane za token bez górnego limitu, co jest tańsze przy niewielkim lub skokowym użyciu, a droższe przy intensywnym korzystaniu każdego dnia roboczego. Oblicz średnią liczbę tokenów dziennie na podstawie bloku użycia, wyceń je według stawki wybranego modelu, a następnie porównaj tę kwotę z ceną planu, która dla poziomu podstawowego została opisana w ile kosztuje Claude Pro i gdzie kończą się jego limity użycia. Jeśli suma przemawia na korzyść API, rezygnacja z planu lub przejście na niższy poziom nie powoduje utraty opłaconego miesiąca, ponieważ dostęp jest aktywny do końca bieżącego okresu rozliczeniowego.