Ile kosztuje 1M tokenów w Claude? Cennik API
Sprawdź aktualne stawki za 1 milion tokenów wejściowych i wyjściowych w modelach Claude Haiku, Sonnet oraz Opus. Dowiedz się, jak obliczyć koszt API dla swojego projektu.
Ile kosztuje 1M tokenów w Claude?
1M tokenów oznacza milion tokenów i jest to jednostka, w której podawany jest każdy cennik API (application programming interface) Claude. Nie istnieje jedna cena dla tej jednostki, ponieważ dane wejściowe i wyjściowe są rozliczane według różnych stawek, a każdy model posiada własną parę cen. Według stanu na sierpień 2026, milion tokenów wejściowych kosztuje $1 w modelu Claude Haiku 4.5, $2 w Claude Sonnet 5 oraz $5 w Claude Opus 5.
Dane wyjściowe stanowią droższą część rozliczenia. W każdym obecnym modelu stawka za wyjście jest pięciokrotnie wyższa niż stawka za wejście, dlatego podział między tymi dwoma wartościami wpływa na wysokość rachunku bardziej niż główna liczba. Aplikacja, która przesyła długie dokumenty i zwraca krótkie odpowiedzi, zachowuje się zupełnie inaczej niż taka, która generuje długie odpowiedzi na podstawie krótkiego promptu.
Ta strona dotyczy ekonomii jednostkowej: ile kosztuje token i jak oszacować rachunek przed rozpoczęciem budowy rozwiązania. Informacje o tym, gdzie faktycznie trafiają tokeny podczas pracy, znajdują się w gdzie trafiają tokeny w sesji Claude Code.
Jak wygląda 1M tokenów
Token to fragment tekstu, który model odczytuje lub zapisuje. Przybliżony przelicznik Anthropic to jeden token na 4 znaki, czyli około 0,75 słowa w języku angielskim. Milion tokenów to zatem około 750 000 słów lub w przybliżeniu 4 MB czystego tekstu.
Opublikowane szacunki dla typowych danych wejściowych pozwalają lepiej zrozumieć tę skalę.
The data behind this chart
[
{
"label": "Average web page (10 kB)",
"tokens": "2,500"
},
{
"label": "Documentation page (100 kB)",
"tokens": "25,000"
},
{
"label": "Research paper PDF (500 kB)",
"tokens": "125,000"
}
]Przy takich założeniach 1M tokenów to około 400 przeciętnych stron internetowych przeczytanych jednokrotnie lub osiem artykułów naukowych o tej objętości. Jest to jeden pełny odczyt średniej wielkości bazy kodu lub miesiąc lekkiego korzystania z czatu przez jedną osobę.
Wszystkie te wartości należy traktować jako szacunkowe. Kod, pliki JSON oraz teksty w językach innych niż angielski zawierają mniej słów w jednym tokenie, więc stosunek 0,75 jest wartością optymistyczną. Istnieje jeszcze jeden czynnik wpływający na liczebność: Claude Opus 4.7 i nowsze wersje, w tym Opus 5 oraz Sonnet 5, korzystają z nowszego tokenizera, który generuje o około 30 procent więcej tokenów dla tego samego tekstu niż Sonnet 4.6 i starsze. Claude Haiku 4.5 używa starszego tokenizera. Z tego powodu liczba zmierzona dla Haiku 4.5 zaniża wynik dla modelu Sonnet 5 przy identycznych danych wejściowych, co oznacza, że bezpośrednie porównanie ceny za milion tokenów pomiędzy tymi modelami nie jest miarodajne. Przed podjęciem decyzji należy przeliczyć ten sam prompt dla obu modeli.
Opłaty za milion tokenów w Claude
The data behind this chart
[
{
"label": "Haiku 4.5",
"input_usd": 1,
"output_usd": 5
},
{
"label": "Sonnet 5 (to 31 Aug 2026)",
"input_usd": 2,
"output_usd": 10
},
{
"label": "Sonnet 5 (from 1 Sep 2026)",
"input_usd": 3,
"output_usd": 15
},
{
"label": "Opus 5",
"input_usd": 5,
"output_usd": 25
}
]Model Claude Sonnet 5 jest objęty ceną promocyjną wynoszącą $2 za wejście oraz $10 za wyjście do 31 sierpnia 2026. Od 1 września 2026 obowiązuje stawka standardowa: $3 za wejście oraz $15 za wyjście. Model Claude Opus 5 kosztuje $5 oraz $25. Jeden model znajduje się całkowicie poza tym zestawieniem: Claude Fable 5 wyceniono na $10 za wejście i $50 za wyjście, więc to, czy te stawki są opłacalne, zależy od zadań, do których zostanie wykorzystany.
Stawki ulegają zmianom. Każda liczba na tej stronie powinna być traktowana jako przykład obliczeniowy z sierpnia 2026 roku. Przed zatwierdzeniem budżetu należy zweryfikować aktualne wartości na oficjalnej stronie z cennikiem.
Stawka nie zmienia się w zależności od długości kontekstu. W modelu Claude 4.6 i nowszych pełne okno kontekstowe o rozmiarze 1M tokenów jest rozliczane według standardowego cennika. Oznacza to, że żądanie o długości 900 000 tokenów kosztuje tyle samo za token, co żądanie o długości 9 000 tokenów. Długi prompt kosztuje więcej tylko dlatego, że zawiera więcej tokenów; nie stosuje się żadnych odrębnych stawek za długi kontekst.
Arytmetyka po zmianie cennika
Każdy rachunek składa się z dwóch mnożeń i jednego dodawania.
cost = (input_tokens / 1,000,000) * input_rate
+ (output_tokens / 1,000,000) * output_rateZapis w formie kodu, który można uruchomić:
INPUT_RATE = 2.00 # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00 # USD per million output tokens
def cost(input_tokens, output_tokens):
return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000
print(f"{cost(4300, 400):.4f}")Wynik to 0.0126. Żądanie wysyłające 4,300 tokenów wejściowych i otrzymujące 400 tokenów wyjściowych kosztuje około 1.3 centa w modelu Sonnet 5. Należy przechowywać obie stawki w jednym miejscu w kodzie. W przypadku zmiany ceny edytuje się tylko dwie linie, co automatycznie aktualizuje wszystkie szacunki w systemie.
Oszacowanie kosztów dla rzeczywistej aplikacji
Przyjmijmy asystenta wsparcia technicznego. Jego prompt systemowy oraz dokumentacja produktu zajmują 4000 tokenów. Są one wysyłane w każdym zapytaniu, ponieważ API Messages jest bezstanowe, a model nie przechowuje żadnych informacji między wywołaniami. Pytanie użytkownika dodaje około 300 tokenów. Odpowiedź generuje około 400 tokenów. Daje to 4300 tokenów wejściowych i 400 wyjściowych na jedno żądanie.
Jeden milion tokenów wejściowych pozwala na wykonanie około 232 zapytań o takiej charakterystyce. Przy 1000 zapytań dziennie aplikacja zużywa 4,3 miliona tokenów wejściowych na dobę, co oznacza, że "1M tokenów" wystarcza na niespełna sześć godzin ruchu.
The data behind this chart
[
{
"label": "Opus 5, list rates",
"cost_per_1k_usd": "31.50"
},
{
"label": "Sonnet 5, list rates",
"cost_per_1k_usd": "12.60"
},
{
"label": "Sonnet 5, Batch API",
"cost_per_1k_usd": "6.30"
},
{
"label": "Haiku 4.5, list rates",
"cost_per_1k_usd": "6.30"
},
{
"label": "Sonnet 5, warm prompt cache",
"cost_per_1k_usd": "5.40"
}
]W przypadku modelu Claude Opus 5 taki ruch kosztuje $31.50 za każde 1000 zapytań. Dla modelu Sonnet 5 koszt ten wynosi $12.60. Przejście na Claude Haiku 4.5 obniża koszt do $6.30, a zastosowanie aktywnego prompt cache w modelu Sonnet 5 pozwala na dalszą redukcję do $5.40.
Pomnóż te wartości przez 30, aby uzyskać miesięczny koszt obsługi takiego ruchu. Używając modelu Sonnet 5 według stawek cennikowych, koszt wynosi około 378 USD miesięcznie. Ta sama aplikacja z aktywnym cache kosztuje około 162 USD. Wybór modelu oraz decyzja o wdrożeniu cache mają większy wpływ na koszty niż jakakolwiek stawka wynegocjowana przy tym wolumenie. Wybór odpowiedniego modelu jest odrębną kwestią, w której wygrywa najtańsza opcja spełniająca wymagania testów: wybór między Opus, Sonnet i Haiku zawiera szczegółowe informacje na temat poprawnej weryfikacji modeli.
Buforowanie promptów redukuje powtarzalne części
Ten 4000-tokenowy prefiks jest identyczny w każdym żądaniu, a za każdym razem płacisz pełną stawkę za wejście. Buforowanie promptów przechowuje przetworzony prefiks i nalicza obniżoną opłatę za jego ponowne użycie.
Odczyt z pamięci podręcznej kosztuje 0,1 podstawowej stawki wejściowej. Zapis do pamięci podręcznej kosztuje 1,25 stawki podstawowej przy czasie życia 5 minut lub 2 razy więcej przy czasie życia 1 godziny. Zatem 5-minutowy bufor zwraca się po jednym odczycie, ponieważ zapis kosztuje dodatkowe 0,25, podczas gdy każdy odczyt oszczędza 0,9. Bufor 1-godzinny wymaga dwóch odczytów, aby osiągnąć próg rentowności.
Najprostszym sposobem na włączenie tej funkcji jest dodanie pojedynczego pola najwyższego poziomu:
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "You are a helpful assistant.",
"messages": [
{"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
]
}'Następnie należy odczytać blok usage, który zostanie zwrócony:
{
"usage": {
"cache_creation_input_tokens": 5120,
"cache_read_input_tokens": 1800,
"input_tokens": 50,
"output_tokens": 503
}
}Te trzy liczniki wejściowe są rozliczane według trzech różnych stawek, a ich suma stanowi rzeczywisty wolumen wejściowy: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Szacunek kosztów, który uwzględnia tylko input_tokens, będzie wysoce niedokładny po włączeniu buforowania.
Dwie przyczyny sprawiają, że buforowanie przestaje być opłacalne, a obie kończą się niepowodzeniem bez komunikatu o błędzie.
Prefiks musi być identyczny bajt po bajcie. Wyszukiwanie w pamięci podręcznej opiera się na dopasowaniu prefiksu, więc znacznik czasu lub imię użytkownika na początku promptu systemowego zmienia go w każdym żądaniu. W takim przypadku płacisz 1,25 stawki podstawowej za każdym razem i nigdy nie wykonujesz odczytu. Objawem jest wysoka wartość cache_creation_input_tokens przy zerowej wartości cache_read_input_tokens. Umieść cache_control w ostatnim bloku, którego zawartość jest stała we wszystkich żądaniach, a wszystko, co ulega zmianie, umieść za nim. Zmiana definicji tools unieważnia całą pamięć podręczną poniżej, ponieważ unieważnienie przebiega w kolejności: narzędzia, następnie system, a na końcu wiadomości.
Prefiks musi być wystarczająco długi. Minimalna długość podlegająca buforowaniu wynosi 512 tokenów dla Opus 5, 1024 dla Sonnet 5 oraz 4096 dla Haiku 4.5. Krótszy prompt nie jest buforowany i nie jest zwracany żaden błąd. 4000-tokenowy prefiks z powyższego przykładu buforuje się w Sonnet 5, ale nie w Haiku 4.5, ponieważ 4000 to wartość poniżej progu tego modelu. Gdy oba liczniki wskazują 0, oznacza to, że nic nie zostało zbuforowane.
Przetwarzanie wsadowe obniża koszt o połowę
Batch API przetwarza żądania asynchronicznie, oferując 50-procentową zniżkę na dane wejściowe i wyjściowe. W powyższym przykładzie zmienia to koszt z $12.60 na $6.30 za każde 1000 żądań. Zniżka łączy się z mechanizmem prompt caching, co sprawia, że zadania wsadowe z wykorzystaniem pamięci podręcznej są najtańszym sposobem na realizację masowych operacji.
Ceną za to rozwiązanie jest wyższe opóźnienie, co wyklucza Batch API w scenariuszach wymagających interakcji użytkownika w czasie rzeczywistym. Metoda ta sprawdza się w zadaniach takich jak nocna klasyfikacja danych czy uzupełnianie dokumentacji.
Dlaczego koszty czatu rosną w ramach jednej konwersacji
Ponieważ API nie przechowuje stanu, klient przesyła całą historię konwersacji przy każdej kolejnej wiadomości. Zużycie tokenów w ramach jednego czatu rośnie zatem kwadratowo względem jego długości, a nie liniowo.
Przyjmijmy, że średnia długość wiadomości wynosi 500 tokenów. Wymiana 1 przesyła 500 tokenów wejściowych. Wymiana 2 przesyła 1000. Wymiana 20 przesyła 10 000. Sumując to zgodnie ze wzorem n(n+1)/2, konwersacja składająca się z 20 wymian wygenerowała około 105 000 tokenów wejściowych, mimo że sam zapis rozmowy ma długość zaledwie 10 000 tokenów.
Dlatego funkcja czatu generuje wyższe koszty, niż wynikałoby to z długości zapisu, oraz dlatego buforowanie stabilnego prefiksu lub podsumowywanie starszych fragmentów rozmowy jest opłacalne w długich wątkach. Agent, który wykonuje pętlę wywołań narzędzi (tool calls), wykazuje ten sam schemat wzrostu, a nawet gorszy: każdy wynik narzędzia pozostaje w historii i jest przesyłany ponownie w każdej kolejnej turze. W tym przypadku kluczowe znaczenie ma ustawienie twardego limitu wydatków dla samodzielnie uruchamianego agenta, ponieważ wzrost ten następuje automatycznie i często pozostaje bez nadzoru.
Zliczanie tokenów przed wykonaniem zapytania
Należy przestać szacować liczbę tokenów na podstawie liczby słów. API wykonuje to obliczenie automatycznie, bez dodatkowych kosztów i w ramach osobnego limitu zapytań, niezależnego od tworzenia wiadomości.
curl https://api.anthropic.com/v1/messages/count_tokens \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "content-type: application/json" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-5",
"system": "You are a scientist",
"messages": [{
"role": "user",
"content": "Hello, Claude"
}]
}'Odpowiedź zawiera jedno pole:
{ "input_tokens": 14 }Należy przekazać do niego właściwy system prompt oraz definicje narzędzi wraz z reprezentatywną wiadomością użytkownika, a następnie podstawić otrzymaną liczbę do powyższej funkcji kosztu. Endpoint przyjmuje ten sam format treści co żądanie wiadomości, dzięki czemu obrazy oraz pliki PDF są zliczane poprawnie. Należy uwzględnić dwa zastrzeżenia. Wynik jest szacunkowy i może nieznacznie różnić się od wartości podlegającej rozliczeniu. Pomiar jest również dokonywany przy użyciu tokenizera właściwego dla wybranego modelu, dlatego należy przekazać model, który faktycznie będzie używany.
Liczby tokenów wyjściowych nie można określić z wyprzedzeniem, ponieważ jeszcze nie istnieją. Należy ograniczyć je za pomocą max_tokens, a następnie zmierzyć rzeczywisty rozkład przy użyciu usage.output_tokens na podstawie ruchu produkcyjnego.
Co jeszcze wpływa na wysokość rachunku
Tokeny stanowią większość kosztów. Kilka pozycji nie jest tokenami, co często zaskakuje użytkowników.
- Definicje narzędzi stają się tokenami wejściowymi przy każdym żądaniu. Sam systemowy prompt dotyczący użycia narzędzi dodaje od 286 do 406 tokenów w modelu Opus 5, jeszcze przed uwzględnieniem własnych schematów. Dziesięć rozbudowanych opisów narzędzi może podwoić rozmiar krótkiego promptu.
- Wyszukiwanie w sieci jest rozliczane w stawce 10 USD za 1000 wyszukiwań, niezależnie od tokenów, które zużywają wyniki po wprowadzeniu ich do kontekstu.
- Pobieranie stron internetowych nie wiąże się z dodatkową opłatą, jednak pobrana zawartość staje się tokenami wejściowymi. Strona dokumentacji o rozmiarze 100 kB to w przybliżeniu 25,000 tokenów.
- Żądanie wnioskowania ograniczonego do USA za pomocą
inference_geow modelu Claude 4.6 i nowszych nakłada mnożnik 1.1 na każdą kategorię tokenów, w tym odczyty i zapisy z pamięci podręcznej.
To, czy zakup dostępu do API jest opłacalny, zależy od skali wykorzystania. Osiągnięcie limitu użycia w ramach planu zazwyczaj skłania do zadania tego pytania, a sposoby na obejście limitów obejmują zarówno oczekiwanie na odnowienie okna czasowego, jak i przeniesienie zadań na płatne wywołania API. Poniżej pewnego poziomu wykorzystania plan miesięczny ze stałą opłatą jest bardziej korzystny, a porównanie API z subskrypcją Claude przedstawia to zestawienie w oparciu o rzeczywiste liczby.
FAQ
Ile kosztuje 1M tokenów w Claude?
Zależy to od modelu oraz od tego, czy są to tokeny wejściowe, czy wyjściowe. Według stanu na sierpień 2026 r. milion tokenów wejściowych kosztuje $1 w modelu Claude Haiku 4.5, $2 w modelu Claude Sonnet 5 w cenie promocyjnej oraz $5 w modelu Claude Opus 5. Koszt wyjścia jest pięciokrotnie wyższy niż stawka wejściowa dla każdego z tych modeli. Od 1 września 2026 r. model Sonnet 5 przechodzi na stawkę $3 za wejście i $15 za wyjście. Stawki ulegają zmianie, dlatego należy potwierdzić je na oficjalnej stronie z cennikiem przed uwzględnieniem kwoty w budżecie.
Czy 1M tokenów to to samo co 1M słów?
Nie. Jeden token to w przybliżeniu 4 znaki w języku angielskim lub około 0,75 słowa, więc milion tokenów to około 750 000 słów. Ten przelicznik jest jedynie wskazówką. Kod, format JSON oraz języki inne niż angielski zużywają więcej tokenów na słowo. Modele Claude Opus 4.7 i nowsze używają również nowszego tokenizatora, który generuje o około 30 procent więcej tokenów dla tego samego tekstu niż Claude Sonnet 4.6 i starsze, dlatego liczby te nie są przenośne między generacjami modeli. Pomiary należy wykonywać za pomocą bezpłatnego punktu końcowego /v1/messages/count_tokens, przekazując model, który planuje się uruchomić.
Czy buforowanie promptów zawsze pozwala zaoszczędzić pieniądze?
Nie. Zapis 5-minutowego bufora kosztuje 1,25 raza więcej niż podstawowa stawka wejściowa, więc prefiks, który jest zapisywany, a nigdy nieodczytywany, kosztuje o 25 procent więcej niż wysłanie go w zwykły sposób. Zwraca się on od pierwszego odczytu. Mechanizm ten zawodzi na dwa sposoby, oba bez zgłaszania błędów. Jeśli buforowany prefiks zmienia się między żądaniami, wyszukiwanie nigdy nie znajdzie dopasowania, ponieważ wymagana jest zgodność prefiksu co do znaku. Jeśli prefiks jest krótszy niż minimalna długość buforowania dla danego modelu, która wynosi 1024 tokeny dla Sonnet 5 i 4096 dla Haiku 4.5, nic nie jest buforowane i nie jest zwracany żaden błąd. Gdy cache_creation_input_tokens oraz cache_read_input_tokens zwracają wartość 0, bufor nie wykonuje żadnej pracy.
Dlaczego rachunek wzrósł szybciej niż liczba wiadomości?
Ponieważ cała konwersacja jest przesyłana ponownie przy każdej turze. Interfejs Messages API nie przechowuje stanu, więc 20. tura czatu zawiera ponownie wszystkie 19 wcześniejszych tur jako dane wejściowe. Przy średniej długości tury wynoszącej 500 tokenów, 20-turowa konwersacja wysyła około 105 000 tokenów wejściowych, mimo że zapis rozmowy ma tylko 10 000 tokenów długości. Pętle agentów zachowują się w ten sam sposób, ponieważ każdy wynik narzędzia pozostaje w historii. Należy buforować stabilny prefiks lub podsumowywać starsze tury i usuwać je z żądania.