Ile tokenów ma Claude Pro? Wyjaśnienie limitów
Subskrypcja Claude Pro nie posiada sztywnego limitu tokenów. Użytkowanie jest rozliczane poprzez liczbę wiadomości w oknie czasowym. Sprawdź, jak działają limity Anthropic.
Ile tokenów zawiera subskrypcja Claude Pro?
Claude Pro nie posiada limitu tokenów, a według stanu na wrzesień 2026 roku firma Anthropic nie publikuje takiej wartości. Subskrypcja Claude jest rozliczana na podstawie liczby wiadomości w przesuwnym oknie czasowym, a nie tokenów pobieranych z salda. Długość tego okna zależy od wybranego modelu, długości prowadzonej konwersacji oraz ilości tekstu zawartego w każdej wiadomości.
Jest to odpowiedź, którą rzadko można usłyszeć, ponieważ użytkownicy oczekują, że plan będzie działał jak klucz API. Klucz API zużywa saldo liczone w tokenach, co pozwala na samodzielne obliczenie kosztów. Subskrypcja zapewnia dostęp do limitu, który Anthropic ustala i dostosowuje, a limit ten jest wyrażony w liczbie wiadomości, więc nie istnieje stała liczba tokenów, którą można podać. Każdy, kto podaje taką liczbę, wymyśla ją.
Należy zatem zadać inne pytanie. Co sprawia, że moje wiadomości są kosztowne? Na to pytanie istnieje konkretna odpowiedź, na podstawie której można podjąć działania już dziś.
Dlaczego subskrypcja nie może wycenić liczby tokenów
API nalicza opłaty za każde żądanie na podstawie liczby tokenów. Tokeny wejściowe obejmują wszystko, co wysyłasz, a tokeny wyjściowe wszystko, co model generuje w odpowiedzi. Obie wartości mają różne stawki, dlatego tokeny wejściowe i wyjściowe kosztują inaczej przed przystąpieniem do jakichkolwiek szacunków.
Plany konsumenckie nie posiadają salda do wykorzystania. Anthropic ogranicza liczbę wiadomości, które można wysłać w ramach kroczącego okna czasowego, które otwiera się wraz z pierwszą wiadomością i zamyka po określonej liczbie godzin. Plany płatne posiadają drugi, dłuższy limit mierzony w skali tygodnia. Wiadomość nie ma stałego rozmiaru, więc ta sama liczba wiadomości oznacza zupełnie inny nakład pracy dla dwóch różnych użytkowników. Strony pomocy Anthropic opisują limity w przybliżonej liczbie wiadomości dla krótkiej konwersacji, a następnie ostrzegają, że długie rozmowy i duże załączniki szybciej wyczerpują dostępny limit. To ostrzeżenie wyczerpuje temat, a mechanizm, który za nim stoi, niemal nigdy nie jest wyjaśniany.
Dlaczego 20. tura czatu kosztuje znacznie więcej niż pierwsza
Model nie przechowuje pamięci między żądaniami. Jest bezstanowy, więc każda tura przesyła ponownie całą konwersację: prompt systemowy, każdą wcześniejszą wiadomość użytkownika, każdą wcześniejszą odpowiedź Claude oraz każdy załączony plik. Nowe pytanie może składać się z dwudziestu słów, ale żądanie, które je przenosi, zawiera cały zapis rozmowy.
Koszt tury rośnie zatem wraz z długością czatu w sposób liniowy. Poniższe wiersze przedstawiają tę arytmetykę przy założeniu pewnego zestawu danych: prompt systemowy o długości około 1000 tokenów, wiadomości użytkownika po około 1000 tokenów każda oraz odpowiedzi po około 1200 tokenów każda. Ilustrują one mechanizm działania, a nie pomiar zużycia konkretnego konta.
The data behind this chart
[
{
"label": "Turn 1",
"sent_this_turn": "2,000",
"cumulative_input": "2,000"
},
{
"label": "Turn 5",
"sent_this_turn": "10,800",
"cumulative_input": "32,000"
},
{
"label": "Turn 10",
"sent_this_turn": "21,800",
"cumulative_input": "119,000"
},
{
"label": "Turn 20",
"sent_this_turn": "43,800",
"cumulative_input": "458,000"
}
]Pierwsza tura przesyła 2,000 tokenów wejściowych. W 20. turze to samo krótkie pytanie przesyła 43,800, czyli ponad dwudziestokrotnie więcej przy tym samym nakładzie pracy użytkownika. W trakcie całej konwersacji przesłano łącznie 458,000 tokenów wejściowych, z czego większość stanowi ten sam tekst wysyłany wielokrotnie.
Dwadzieścia oddzielnych czatów jednostronicowych wygenerowałoby dwudziestokrotność kosztu pierwszego wiersza i nic więcej. Te same pytania, ułamek obciążenia. Załączniki zwiększają tę różnicę, ponieważ plik PDF załączony w drugiej turze jest przesyłany ponownie w trzeciej, czwartej i każdej kolejnej turze, niezależnie od tego, czy konwersacja nadal go dotyczy.
Dlatego dwie osoby korzystające z tego samego planu mogą raportować zupełnie inne zużycie limitów. Jedna osoba utrzymuje jeden wątek otwarty przez cały tydzień i osiąga limit w środę. Druga otwiera nowy czat dla każdego zadania i rzadko napotyka ograniczenia. Żadna z nich nie postępuje niewłaściwie. Ich zużycie tokenów różni się o rząd wielkości, ponieważ różnią się ich nawyki.
W API można ograniczyć koszt powtórzeń za pomocą prompt caching, który przechowuje niezmienioną początkową część żądania, dzięki czemu późniejsze wywołania są rozliczane według obniżonej stawki za tę część. W ramach subskrypcji użytkownik nie zarządza cache'owaniem, więc długość konwersacji jest jedynym dostępnym narzędziem kontroli. Ten sam mechanizm dominuje w sesjach programistycznych, gdzie zawartość plików i definicje narzędzi są przesyłane w każdej turze, dlatego utrzymywanie małego kontekstu sesji programistycznej ma większy wpływ na limity niż jakiekolwiek ustawienia, a lektura artykułu na co faktycznie zużywane są tokeny w sesji Claude Code jest zalecana przed przypisaniem winy planowi subskrypcyjnemu.
Co oferuje każdy poziom planu w ujęciu relatywnym
Żaden poziom nie publikuje bezwzględnego limitu użycia. Publikowane dane mają charakter relatywny, co jest wystarczające do podjęcia decyzji. Plan Free znajduje się na dole zestawienia, a jego wydajność może ulec ograniczeniu przy dużym obciążeniu usługi. Plan Pro znajduje się powyżej. Plan Max jest sprzedawany w dwóch wariantach, określanych jako wielokrotność użycia planu Pro, odpowiednio około pięć razy oraz około dwadzieścia razy większe. Plany Team oraz Enterprise są wyceniane za stanowisko i posiadają własne limity.
Należy traktować te mnożniki jako deklarację intencji, a nie jako wiążącą umowę. Anthropic dostosowuje limity, a zmiany te nie są ogłaszane z wyprzedzeniem, co stanowi kolejny powód, dla którego żadna rzetelna strona nie poda konkretnej liczby tokenów. W kwestii finansowej tego porównania, koszty planu Pro i jego limity oraz różnica między dwoma wariantami planu Max wyjaśniają szczegóły, natomiast rzeczywiste limity planu Free określają podstawowy zakres.
Wybór modelu jest drugim mnożnikiem wpływającym na poziom planu. To samo zapytanie zużywa większą część dostępnego limitu w przypadku największego modelu niż w przypadku najmniejszego, ponieważ uruchomienie bardziej złożonego modelu jest droższe w przeliczeniu na token. Przeniesienie rutynowych zadań z modelu Opus na Sonnet lub Haiku często pozwala na dłuższą pracę niż aktualizacja planu, dlatego dopasowanie modelu do zadania jest pierwszą czynnością, którą należy wykonać w przypadku częstego wyczerpywania limitów.
Jak sprawdzić własne zużycie zamiast zgadywać
Własne konto stanowi jedyne wiarygodne źródło informacji i dostęp do niego wymaga zaledwie dwóch kliknięć. W serwisie claude.ai należy otworzyć Settings, a następnie Usage. Wyświetla ono dane o zużyciu w bieżącym oknie oraz czas jego resetu. Warto sprawdzić te dane raz, gdy odpowiedzi zaczynają być odrzucane, oraz drugi raz po długiej sesji. Pozwoli to poznać własny wzorzec użytkowania szybciej niż jakiekolwiek opublikowane dane.
W Claude Code dwie komendy ukośnikowe wykonują to samo zadanie z poziomu terminala. /usage raportuje zużycie w ramach planu oraz czas resetu. /context przedstawia szczegółowy podział tego, co aktualnie wypełnia okno kontekstowe, rozdzielając prompt systemowy, definicje narzędzi, pliki oraz historię konwersacji. Gdy /context wskazuje, że dominującym elementem jest stara konwersacja, /clear pozwala rozpocząć nową sesję, co sprawia, że koszt za turę spada do poziomu z pierwszego wiersza powyższej tabeli.
W przypadku API licznik jest precyzyjny i można o niego zapytać przed wysłaniem jakichkolwiek danych:
curl https://api.anthropic.com/v1/messages/count_tokens \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-sonnet-5",
"messages": [{"role": "user", "content": "Summarise the attached report."}]
}'Prawidłowa odpowiedź zawiera pojedyncze pole, które stanowi wartość używaną do rozliczeń:
{"input_tokens": 14}Każde zakończone żądanie raportuje to samo rozliczenie w momencie zakończenia:
{"usage": {"input_tokens": 21430, "output_tokens": 512}}Należy wysłać jedno krótkie pytanie jako nowe żądanie, następnie wysłać to samo pytanie na końcu długiego wątku i porównać obie wartości input_tokens. Różnica stanowi dokładny efekt, który jest mierzony w ramach subskrypcji, wyrażony w postaci liczbowej.
Co zrobić, gdy limit zostanie osiągnięty w trakcie zadania
- Poczekaj na otwarcie okna. Aplikacja wyświetla czas resetu, a oczekiwanie jest często krótsze niż stosowanie obejść. Jest to właściwe rozwiązanie, gdy nie ma pilnych terminów.
- Przejdź na lżejszy model. Mniejszy model jest tańszy w przeliczeniu na turę w każdym planie, a w niektórych planach korzysta z oddzielnego limitu, dzięki czemu praca może być kontynuowana, podczas gdy cięższy model odpoczywa.
- Rozpocznij nową rozmowę, przenosząc tylko to, co jest niezbędne do kolejnego kroku. Wklej wnioski, a nie cały zapis rozmowy. Koszt na turę natychmiast spada, a odpowiedzi zazwyczaj stają się lepsze, ponieważ model nie musi przetwarzać tysięcy tokenów z zakończonej dyskusji.
- Przenieś zadanie do API, gdzie tokeny są liczone dla każdego żądania i rozliczane za każdy token. Nie ma okna czasowego, na które trzeba czekać, a koszt każdego wywołania można sprawdzić przed jego wykonaniem i po nim.
Wybór odpowiedniej opcji zależy od tego, czy problemem jest czas, czy obciążenie. Jednorazowe spiętrzenie pracy to problem z harmonogramem. Ściana, na którą trafiasz w każdą środę, to problem z obciążeniem, który wymaga przejścia na API lub wyższy plan, a nie lepszego zarządzania czasem. pełna lista kontrolna dla limitu osiągniętego w trakcie zadania przeprowadza przez proces odzyskiwania krok po kroku, a sposób otwierania i resetowania okien kroczących wyjaśnia, dlaczego zegar zachowuje się w określony sposób. Jeśli planujesz przejście na API, najpierw sprawdź koszty: porównanie API z subskrypcją dla tego samego obciążenia oraz ile faktycznie kosztuje milion tokenów dostarczają obliczeń niezbędnych przed podjęciem decyzji.
FAQ
Ile tokenów zawiera subskrypcja Claude Pro?
Firma Anthropic nie publikuje limitu tokenów dla planu Pro i na wrzesień 2026 roku nie istnieje żadna konkretna liczba, którą można podać. Plan Pro jest rozliczany na podstawie liczby wiadomości w przesuwnym oknie czasowym, z dodatkowym limitem tygodniowym. Liczba dostępnych wiadomości zależy od wybranego modelu oraz długości prowadzonej konwersacji. Każda strona podająca konkretną miesięczną liczbę tokenów dla planu Pro opiera się na domysłach. Należy otworzyć Settings, a następnie Usage w serwisie claude.ai, aby sprawdzić własne zużycie oraz czas resetowania limitu.
Czy rozpoczęcie nowego czatu resetuje zużycie?
Nie. Zużycie jest zliczane dla całego konta w ramach okna czasowego, więc nowy czat nie przywraca już wykorzystanych zasobów. Zmienia się natomiast koszt każdej kolejnej wymiany zdań. Nowy czat nie zawiera historii do ponownego przesłania, więc zaczyna się od niskiego poziomu kosztów, zamiast kontynuować wzrost. Rozpoczynanie nowego czatu przy zmianie tematu jest najbardziej efektywnym kosztowo nawykiem w każdym planie.
Dlaczego limit został osiągnięty dzisiaj szybciej niż wczoraj?
Zazwyczaj wynika to z faktu, że dzisiejsza praca odbywała się w ramach jednego długiego wątku. Każda kolejna wiadomość przesyła ponownie całą historię konwersacji wraz z załączonymi plikami, więc koszt pojedynczej wiadomości stale rośnie, mimo że liczba wysłanych komunikatów wydaje się taka sama. Inną częstą przyczyną jest wybór modelu: bardziej zaawansowane modele szybciej wyczerpują limit na jedną wiadomość, dlatego praca z największym modelem kończy się szybciej niż praca z mniejszym modelem.
Czy należy przejść na API, aby uzyskać dokładne zliczanie tokenów?
Przejście na API jest zalecane, jeśli wymagana jest precyzja lub przewidywalność kosztów. API zlicza tokeny wejściowe i wyjściowe przy każdym wywołaniu, udostępnia punkt końcowy do zliczania tokenów przed wysłaniem zapytania i nie posiada okna czasowego, na które trzeba czekać. Rozliczenie odbywa się za każdy token, więc intensywne użytkowanie kosztuje więcej niż stała subskrypcja, a sporadyczne użytkowanie kosztuje znacznie mniej. Przed zmianą należy porównać rzeczywiste obciążenie z obecnym planem, ponieważ opłacalność zależy od liczby przesyłanych tokenów.