SSD Nodes Learn Hosting plans →
Przewodniki Matt ConnorAutor: Matt Connor · Zaktualizowano 2026-08-28

Ile kosztuje 1 milion tokenów w Claude? Cennik API

Sprawdź aktualne stawki za 1 milion tokenów wejściowych i wyjściowych w modelach Claude Haiku, Sonnet oraz Opus. Poznaj metodę obliczania kosztów API przed budową aplikacji.

Ile kosztuje 1M tokenów w Claude?

1M tokenów oznacza milion tokenów i jest to jednostka, w której podawana jest każda cena API (application programming interface) Claude. Nie istnieje jedna cena dla tej jednostki, ponieważ dane wejściowe i wyjściowe są rozliczane według różnych stawek, a każdy model posiada własną parę cenową. Według stanu na sierpień 2026 r., milion tokenów wejściowych kosztuje $1 w modelu Claude Haiku 4.5, $2 w Claude Sonnet 5 oraz $5 w Claude Opus 5.

Dane wyjściowe stanowią droższą część rozliczenia. W każdym obecnym modelu stawka za dane wyjściowe jest pięciokrotnie wyższa niż stawka za dane wejściowe, dlatego proporcja między nimi wpływa na wysokość rachunku bardziej niż sama kwota bazowa. Aplikacja, która przesyła długie dokumenty i zwraca krótkie odpowiedzi, zachowuje się zupełnie inaczej niż taka, która generuje długie odpowiedzi na podstawie krótkiego promptu.

Ta strona dotyczy ekonomii jednostkowej: kosztu tokena oraz sposobu szacowania rachunku przed rozpoczęciem budowy rozwiązania. Informacje o tym, gdzie faktycznie trafiają tokeny podczas pracy, znajdują się w sekcji gdzie trafiają tokeny w sesji Claude Code.

Jak wygląda 1M tokenów

Token to fragment tekstu, który model odczytuje lub generuje. Przybliżony przelicznik Anthropic to jeden token na 4 znaki, czyli około 0,75 słowa w języku angielskim. Milion tokenów to zatem około 750 000 słów lub w przybliżeniu 4 MB zwykłego tekstu.

Opublikowane szacunki dla typowych danych wejściowych pozwalają lepiej zrozumieć tę skalę.

ChartApproximate input token counts for common content, published estimates
The data behind this chart
[
  {
    "label": "Average web page (10 kB)",
    "tokens": "2,500"
  },
  {
    "label": "Documentation page (100 kB)",
    "tokens": "25,000"
  },
  {
    "label": "Research paper PDF (500 kB)",
    "tokens": "125,000"
  }
]

Przy takich założeniach 1M tokenów odpowiada około 400 przeciętnym stronom internetowym przeczytanym jednokrotnie lub ośmiu pracom naukowym o podobnej objętości. Jest to jednokrotne przetworzenie średniej wielkości bazy kodu lub miesiąc lekkiego korzystania z czatu przez jedną osobę.

Powyższe dane należy traktować jako szacunkowe. Kod, JSON oraz teksty w językach innych niż angielski zawierają mniej słów na token, więc współczynnik 0,75 jest wartością optymistyczną. Istnieje jeszcze jeden czynnik wpływający na liczebność: modele Claude Opus 4.7 i nowsze, w tym Opus 5 oraz Sonnet 5, wykorzystują nowszy tokenizator, który generuje o około 30 procent więcej tokenów dla tego samego tekstu niż Sonnet 4.6 i starsze wersje. Claude Haiku 4.5 korzysta ze starszego tokenizatora. Z tego powodu liczba zmierzona dla Haiku 4.5 będzie zaniżona w porównaniu do Sonnet 5 dla identycznych danych wejściowych, co oznacza, że bezpośrednie porównanie ceny za milion tokenów między tymi modelami nie jest miarodajne. Przed podjęciem decyzji należy przetestować ten sam prompt na obu modelach.

Opłaty za milion tokenów w Claude

ChartClaude API list price in USD per million tokens, August 2026
The data behind this chart
[
  {
    "label": "Haiku 4.5",
    "input_usd": 1,
    "output_usd": 5
  },
  {
    "label": "Sonnet 5 (to 31 Aug 2026)",
    "input_usd": 2,
    "output_usd": 10
  },
  {
    "label": "Sonnet 5 (from 1 Sep 2026)",
    "input_usd": 3,
    "output_usd": 15
  },
  {
    "label": "Opus 5",
    "input_usd": 5,
    "output_usd": 25
  }
]

Model Claude Sonnet 5 jest objęty ceną promocyjną wynoszącą 2 za wejście oraz 10 za wyjście do 31 sierpnia 2026 roku. Od 1 września 2026 roku obowiązuje stawka standardowa: 3 za wejście oraz 15 za wyjście. Model Claude Opus 5 kosztuje 5 oraz 25. Jeden model znajduje się całkowicie poza tym zestawieniem: Claude Fable 5 wyceniono na 10 USD za wejście i 50 USD za wyjście, zatem czy te stawki są opłacalne zależy od zadań, do których zostanie wykorzystany.

Stawki ulegają zmianom. Każda liczba na tej stronie stanowi przykład obliczeniowy aktualny na sierpień 2026 roku; przed zatwierdzeniem budżetu należy zweryfikować bieżące wartości na oficjalnej stronie z cennikiem.

Powyższe stawki określają koszt korzystania z Claude, ale nie wskazują, czy jest to tańsza opcja dla danego obciążenia; zestawienie trzech zadań wycenionych zarówno dla Claude, jak i ChatGPT pokazuje, które API wypada korzystniej w konkretnych przypadkach.

Długość kontekstu nie wpływa na zmianę stawki. W modelu Claude 4.6 i nowszych pełne okno kontekstowe o rozmiarze 1M tokenów jest rozliczane według standardowego cennika, więc zapytanie o długości 900 000 tokenów kosztuje tyle samo za token, co zapytanie o długości 9 000 tokenów. Długi prompt generuje wyższy koszt wyłącznie ze względu na większą liczbę tokenów; nie stosuje się odrębnych stawek za długi kontekst.

Arytmetyka po zmianie cennika

Każdy rachunek składa się z dwóch mnożeń i jednego dodawania.

cost = (input_tokens  / 1,000,000) * input_rate
     + (output_tokens / 1,000,000) * output_rate

Zapis w formie kodu, który można uruchomić:

INPUT_RATE = 2.00    # USD per million input tokens, Sonnet 5, August 2026
OUTPUT_RATE = 10.00  # USD per million output tokens

def cost(input_tokens, output_tokens):
    return (input_tokens * INPUT_RATE + output_tokens * OUTPUT_RATE) / 1_000_000

print(f"{cost(4300, 400):.4f}")

Wynikiem jest 0.0126. Żądanie wysyłające 4,300 tokenów wejściowych i otrzymujące 400 tokenów wyjściowych kosztuje około 1.3 centa w modelu Sonnet 5. Należy przechowywać obie stawki w jednym miejscu w kodzie. W przypadku zmiany ceny wystarczy edytować dwie linie, a wszystkie szacunki w systemie zostaną automatycznie zaktualizowane.

Oszacowanie kosztów dla rzeczywistej aplikacji

Przyjmijmy asystenta wsparcia. Jego prompt systemowy oraz dokumentacja produktu zajmują 4000 tokenów. Są one wysyłane w każdym zapytaniu, ponieważ API Messages jest bezstanowe, a model nie przechowuje żadnych informacji między wywołaniami. Pytanie użytkownika dodaje około 300 tokenów. Odpowiedź generuje około 400 tokenów. Daje to 4300 tokenów wejściowych i 400 wyjściowych na każde żądanie.

Jeden milion tokenów wejściowych pozwala na wykonanie około 232 żądań o takiej charakterystyce. Przy 1000 żądań dziennie aplikacja zużywa 4,3 miliona tokenów wejściowych na dobę, więc "1 mln tokenów" wystarcza na niespełna sześć godzin ruchu.

ChartEstimated cost per 1,000 requests at 4,300 input and 400 output tokens
The data behind this chart
[
  {
    "label": "Opus 5, list rates",
    "cost_per_1k_usd": "31.50"
  },
  {
    "label": "Sonnet 5, list rates",
    "cost_per_1k_usd": "12.60"
  },
  {
    "label": "Sonnet 5, Batch API",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Haiku 4.5, list rates",
    "cost_per_1k_usd": "6.30"
  },
  {
    "label": "Sonnet 5, warm prompt cache",
    "cost_per_1k_usd": "5.40"
  }
]

W przypadku Claude Opus 5 taki ruch kosztuje $31.50 za każde 1000 żądań. W modelu Sonnet 5 jest to $12.60. Przejście na Claude Haiku 4.5 obniża koszt do $6.30, a użycie aktywnej pamięci podręcznej promptów (prompt cache) w Sonnet 5 pozwala uzyskać jeszcze niższą stawkę: $5.40.

Pomnóż te wartości przez 30, aby uzyskać miesięczny koszt obsługi takiego ruchu. Sonnet 5 w cenach cennikowych kosztuje około 378 USD miesięcznie. Ta sama aplikacja z aktywną pamięcią podręczną kosztuje około 162 USD. Wybór modelu oraz decyzja o buforowaniu mają większy wpływ na koszty niż jakakolwiek stawka wynegocjowana przy tym wolumenie. Wybór modelu jest odrębną kwestią; wygrywa najtańszy model, który przechodzi pomyślnie testy ewaluacyjne: wybór między Opus, Sonnet i Haiku zawiera opis poprawnego przeprowadzania takich testów.

Buforowanie promptów redukuje powtarzalne fragmenty

Prefiks o długości 4000 tokenów jest identyczny w każdym żądaniu, a za każdym razem płacisz pełną stawkę za wejście. Buforowanie promptów przechowuje przetworzony prefiks i nalicza obniżoną opłatę za jego ponowne wykorzystanie.

Odczyt z pamięci podręcznej kosztuje 0,1 stawki podstawowej wejścia. Zapis do pamięci podręcznej kosztuje 1,25 stawki podstawowej przy czasie życia 5 minut lub 2 razy więcej przy czasie życia 1 godziny. Zatem bufor 5-minutowy zwraca się po jednym odczycie, ponieważ koszt zapisu jest wyższy o 0,25, podczas gdy każdy odczyt oszczędza 0,9. Bufor 1-godzinny wymaga dwóch odczytów, aby osiągnąć próg rentowności.

Najprostszym sposobem na włączenie tej funkcji jest dodanie pojedynczego pola najwyższego poziomu:

curl https://api.anthropic.com/v1/messages \
  -H "content-type: application/json" \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "You are a helpful assistant.",
    "messages": [
      {"role": "user", "content": "What are the key themes in Pride and Prejudice?"}
    ]
  }'

Następnie należy odczytać blok usage, który zostanie zwrócony:

{
  "usage": {
    "cache_creation_input_tokens": 5120,
    "cache_read_input_tokens": 1800,
    "input_tokens": 50,
    "output_tokens": 503
  }
}

Te trzy liczniki wejścia są rozliczane według trzech różnych stawek, a ich suma stanowi rzeczywisty wolumen wejściowy: total_input_tokens = cache_read_input_tokens + cache_creation_input_tokens + input_tokens. Szacunkowy koszt, który uwzględnia tylko input_tokens, będzie wysoce niedokładny po włączeniu buforowania.

Dwie przyczyny sprawiają, że buforowanie przestaje być opłacalne, a obie kończą się niepowodzeniem bez komunikatu o błędzie.

Prefiks musi być identyczny na poziomie bajtów. Wyszukiwanie w pamięci podręcznej opiera się na dopasowaniu prefiksu, więc znacznik czasu lub imię użytkownika na początku promptu systemowego zmienia go w każdym żądaniu. W takim przypadku za każdym razem płacisz 1,25 stawki podstawowej i nigdy nie wykonujesz odczytu. Objawem jest wysoka wartość cache_creation_input_tokens przy zerowej wartości cache_read_input_tokens. Umieść cache_control w ostatnim bloku, którego zawartość jest stała dla wszystkich żądań, a wszystko, co ulega zmianie, umieść za nim. Zmiana definicji tools unieważnia całą pamięć podręczną poniżej, ponieważ unieważnienie przebiega w kolejności: narzędzia, system, a następnie wiadomości.

Prefiks musi być wystarczająco długi. Minimalna długość podlegająca buforowaniu wynosi 512 tokenów dla Opus 5, 1024 dla Sonnet 5 oraz 4096 dla Haiku 4.5. Krótszy prompt nie jest buforowany i nie jest zwracany żaden błąd. Prefiks o długości 4000 tokenów z powyższego przykładu jest buforowany w modelu Sonnet 5, ale nie w Haiku 4.5, ponieważ 4000 to wartość poniżej progu tego modelu. Gdy oba liczniki wskazują 0, oznacza to, że nic nie zostało zbuforowane.

Przetwarzanie wsadowe obniża stawkę o połowę

Batch API przetwarza żądania asynchronicznie, oferując 50 procent zniżki na wejście i wyjście. W powyższym przykładzie zmienia to koszt z $12.60 za 1000 żądań na $6.30. Rabat łączy się z mechanizmem prompt caching, dzięki czemu zadania wsadowe z wykorzystaniem pamięci podręcznej są najtańszym sposobem wykonywania operacji masowych.

Ceną za to jest opóźnienie, co sprawia, że przetwarzanie wsadowe nie nadaje się do zadań, w których użytkownik oczekuje na natychmiastową odpowiedź. Rozwiązanie to sprawdza się w przypadku klasyfikacji wykonywanej w nocy oraz uzupełniania danych w dokumentach.

Dlaczego koszty czatu rosną w ramach jednej konwersacji

Ponieważ API nie przechowuje stanu, klient przesyła całą historię konwersacji przy każdej kolejnej wiadomości. Zużycie tokenów w ramach jednego czatu rośnie zatem proporcjonalnie do kwadratu jego długości, a nie liniowo.

Przyjmijmy, że średnia długość wiadomości wynosi 500 tokenów. W pierwszej turze przesyłanych jest 500 tokenów wejściowych. W drugiej turze przesyłanych jest 1000. W dwudziestej turze przesyłanych jest 10 000. Sumując to zgodnie ze wzorem n(n+1)/2, konwersacja składająca się z 20 tur wygenerowała około 105 000 tokenów wejściowych, podczas gdy sama treść rozmowy ma długość zaledwie 10 000 tokenów.

Dlatego funkcja czatu generuje wyższe koszty, niż wynikałoby to z długości zapisu rozmowy, i dlatego buforowanie stabilnego prefiksu lub podsumowywanie starszych fragmentów konwersacji jest opłacalne w przypadku długich wątków. Agent, który wykonuje pętle wywołań narzędzi (tool calls), wykazuje ten sam wzorzec, a nawet gorszy: każdy wynik działania narzędzia pozostaje w historii i jest przesyłany ponownie w każdej kolejnej turze. Ustawienie twardego limitu wydatków dla samodzielnie uruchamianego agenta jest w tym przypadku kluczowe, ponieważ ten wzrost następuje automatycznie i często pozostaje bez nadzoru.

Obliczanie tokenów przed dokonaniem szacunków

Należy zaprzestać wyznaczania liczby tokenów na podstawie liczby słów. API wykonuje to obliczenie automatycznie, bez dodatkowych opłat, w ramach limitu niezależnego od tworzenia wiadomości.

curl https://api.anthropic.com/v1/messages/count_tokens \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-5",
    "system": "You are a scientist",
    "messages": [{
      "role": "user",
      "content": "Hello, Claude"
    }]
  }'

Odpowiedź zawiera jedno pole:

{ "input_tokens": 14 }

Należy przekazać do niego rzeczywisty prompt systemowy oraz definicje narzędzi wraz z reprezentatywną wiadomością użytkownika, a następnie wprowadzić uzyskaną liczbę do powyższej funkcji kosztu. Punkt końcowy przyjmuje ten sam korpus danych co żądanie wiadomości, dzięki czemu obrazy oraz pliki PDF są również poprawnie zliczane. Należy uwzględnić dwa zastrzeżenia. Wynik jest szacunkowy i może nieznacznie różnić się od wartości podlegającej rozliczeniu. Pomiar odbywa się przy użyciu tokenizatora modelu, który zostanie przekazany, dlatego należy wskazać model, który będzie faktycznie używany.

Liczby tokenów wyjściowych nie można obliczyć z wyprzedzeniem, ponieważ jeszcze nie istnieją. Należy ograniczyć je za pomocą max_tokens, a następnie zmierzyć rzeczywisty rozkład na podstawie usage.output_tokens w ramach bieżącego ruchu.

Co jeszcze składa się na rachunek

Tokeny stanowią większość kosztów. Kilka pozycji nie jest tokenami i często zaskakuje użytkowników.

  • Definicje narzędzi stają się tokenami wejściowymi przy każdym żądaniu. Sam systemowy prompt dotyczący użycia narzędzi dodaje od 286 do 406 tokenów w modelu Opus 5, jeszcze przed uwzględnieniem własnych schematów. Dziesięć rozbudowanych opisów narzędzi może podwoić rozmiar krótkiego promptu.
  • Wyszukiwanie w sieci jest rozliczane w stawce 10 USD za 1000 wyszukiwań, niezależnie od kosztu tokenów, które generują wyniki po wprowadzeniu ich do kontekstu.
  • Pobieranie stron internetowych nie wiąże się z dodatkową opłatą, jednak pobrana zawartość staje się tokenami wejściowymi. Strona dokumentacji o rozmiarze 100 kB to w przybliżeniu 25,000 tokenów.
  • Wymuszenie przetwarzania wyłącznie na terenie USA za pomocą inference_geo w modelu Claude 4.6 i nowszych nakłada mnożnik 1.1 na każdą kategorię tokenów, w tym na odczyty i zapisy z pamięci podręcznej.

To, czy zakup API jest opłacalny, zależy od wolumenu użycia. Osiągnięcie limitu w ramach planu zazwyczaj skłania do zadania tego pytania, a sposoby na obejście limitów obejmują zarówno oczekiwanie na odnowienie okna czasowego, jak i przeniesienie zadań na płatne wywołania API. Poniżej pewnego poziomu wykorzystania plan miesięczny ze stałą opłatą jest korzystniejszy, a porównanie API z subskrypcją Claude przedstawia to zestawienie przy użyciu rzeczywistych liczb.

FAQ

Ile kosztuje 1M tokenów w Claude?

Zależy to od modelu oraz od tego, czy są to tokeny wejściowe, czy wyjściowe. Według stanu na sierpień 2026 r. milion tokenów wejściowych kosztuje $1 w modelu Claude Haiku 4.5, $2 w modelu Claude Sonnet 5 w ramach cen promocyjnych oraz $5 w modelu Claude Opus 5. Koszt wyjścia jest pięciokrotnie wyższy od stawki wejściowej dla każdego z tych modeli. Od 1 września 2026 r. model Sonnet 5 przechodzi na stawkę $3 za wejście oraz $15 za wyjście. Stawki ulegają zmianie, dlatego należy potwierdzić je na oficjalnej stronie cennika przed uwzględnieniem kwoty w budżecie.

Czy 1M tokenów to to samo co 1M słów?

Nie. Jeden token to w przybliżeniu 4 znaki w języku angielskim lub około 0,75 słowa, więc milion tokenów to około 750 000 słów. Ten stosunek jest jedynie wskazówką. Kod, format JSON oraz języki inne niż angielski zużywają więcej tokenów na słowo. Modele Claude Opus 4.7 i nowsze używają również nowszego tokenizera, który generuje o około 30 procent więcej tokenów dla tego samego tekstu niż Claude Sonnet 4.6 i starsze, więc liczby te nie są przenośne między generacjami modeli. Należy dokonywać pomiarów za pomocą bezpłatnego punktu końcowego /v1/messages/count_tokens, przekazując model, który planuje się uruchomić.

Czy buforowanie promptów zawsze przynosi oszczędności?

Nie. Zapis 5-minutowego bufora kosztuje 1,25 razy więcej niż podstawowa stawka wejściowa, więc prefiks, który jest zapisywany, a nigdy nieodczytywany, kosztuje o 25 procent więcej niż wysłanie go w zwykły sposób. Zwraca się on od pierwszego odczytu. Zawodzi na dwa sposoby, oba bezgłośnie. Jeśli buforowany prefiks zmienia się między żądaniami, wyszukiwanie nigdy nie pasuje, ponieważ wymagane jest dokładne dopasowanie prefiksu. Jeśli prefiks jest krótszy niż minimalna długość buforowania modelu, która wynosi 1 024 tokeny dla Sonnet 5 i 4 096 dla Haiku 4.5, nic nie jest buforowane i nie jest zwracany żaden błąd. Gdy cache_creation_input_tokens oraz cache_read_input_tokens wskazują 0, bufor nie wykonuje żadnej pracy.

Dlaczego rachunek wzrósł szybciej niż liczba wiadomości?

Ponieważ cała konwersacja jest przesyłana ponownie przy każdym kroku. API Messages nie przechowuje stanu, więc 20. tura czatu ponownie przenosi wszystkie 19 wcześniejszych tur jako dane wejściowe. Przy średniej długości tur wynoszącej 500 tokenów, 20-turowa konwersacja wysyła około 105 000 tokenów wejściowych, podczas gdy zapis rozmowy ma tylko 10 000 tokenów długości. Pętle agentów zachowują się w ten sam sposób, ponieważ każdy wynik narzędzia pozostaje w historii. Należy buforować stabilny prefiks lub podsumowywać starsze tury i usuwać je z żądania.