Intro: tydzień, który się skrócił
Tygodniowy limit Claude Code spadł o 17% w połowie września 2026, gdy skończyła się letnia promocja. Osoby z największymi planami zgłaszają teraz pusty tydzień już w środę. Oficjalny komunikat Anthropic mówi, że limity zostały na stałe podniesione o 25%, a kolejny wpis zaraz po nim nazywa tę samą zmianę obniżką o 17%.
Każda lista porad, jak rozciągnąć limit, nie podaje ani jednej liczby. Ten artykuł przypisuje każdej poprawce pomiar i układa je w ranking. Dwa wyniki rzucają się w oczy: prawie połowa tokenów z miesiąca poszła na subagenty, a jedna długa przerwa sprawia, że następna wiadomość przepisuje większość sesji.
Co się zmieniło i jak liczyć
Pomiary pochodzą z jednego miesiąca logów Claude Code jednego programisty: 455 sesji i 63 398 zapytań, od 3 września do 3 października.
Promocja trwała od maja do 13 września i podnosiła tygodniowy limit o 50%. Limit każdego okna pięciogodzinnego nigdy się nie zmienił. Pod koniec sierpnia konto deweloperskie Anthropic ogłosiło stałą podwyżkę o 25%, a jeden wpis dalej ten sam wątek mówi, że w praktyce to obniżka o 17%. Obie wypowiedzi są prawdziwe:
| Okres | Limit tygodniowy (stary limit = 100) |
|---|---|
| Przed promocją | 100 |
| W trakcie promocji (od maja do 13 września) | 150 |
| Stały poziom od 14 września | 125 |
Spadek ze 150 do 125 to te 17%, które ludzie odczuwają. Jeden użytkownik z dwoma największymi planami napisał, że 100% w środę nigdy wcześniej mu się nie zdarzyło. Inny, na tym samym planie, miał 86% we wtorek rano. Obniżka nie jest jedyną przyczyną: na początku września pojawił się bardziej żarłoczny model, więc nie każdy pusty tydzień wynika z tej zmiany.
Z twojej strony widać procent. Ekran /usage dzieli ostatnie zużycie między skille, subagenty, pluginy i każdy podłączony serwer MCP, a także oznacza chybienia cache. Jeden klawisz przełącza widok między ostatnim dniem a ostatnimi siedmioma. Nie widać za to rozmiaru limitu w tokenach: Anthropic publikuje procenty i mnożniki, nigdy liczby tokenów. Wszystko, co zmierzono poniżej, jest więc w tokenach, z jednego zestawu pracy, a nie jako udział twojego tygodnia.
Liczenie tokenów z logów ma pułapkę. Log zapisuje tę samą odpowiedź kilka razy, więc zsumowanie wszystkich linii daje 18,6 miliarda tokenów. Policzone raz, to 9,3 miliarda. Naiwne liczenie prawie podwaja wszystko.
Subagenty: prawie połowa rachunku
Subagent to kolejny Claude, którego twoja sesja uruchamia do pobocznego zadania i który zdaje raport po skończeniu. W zmierzonym miesiącu subagenty zużyły 48,1% wszystkich tokenów w 2631 uruchomieniach.
| Miara | Udział subagentów |
|---|---|
| Wszystkie tokeny | 48,1% |
| Tokeny wyjściowe | 63,9% |
| Ważone tak, jak publiczny cennik waży output i zapisy do cache | 55,3% |
Każdy subagent płaci też cenę wejścia. Zanim cokolwiek zrobi, jego pierwsze zapytanie niesie już medianę 47 117 tokenów: instrukcje, listę narzędzi i listę skilli, wszystko wysłane od nowa. Ktoś inny zmierzył to na innej maszynie i dostał od 16 000 do 21 000 tokenów na uruchomienie dla agentów, których własny prompt jest malutki. Jak ujmuje to ten artykuł, plik agenta to błąd zaokrąglenia w koszcie jego własnego uruchomienia.
Drugą połową jest model. Domyślnie subagent dziedziczy model głównej rozmowy, więc przełączenie sesji na największy model stawia na nim także każdego pomocnika. W zmierzonych logach najmniejszy model obsłużył mniej niż 1% zapytań subagentów. Poprawka to jedna linia w pliku agenta: pole model ustawione na mniejszy model dla zadań takich jak uruchamianie testów czy szukanie plików.
Z tego wynikają dwa nawyki. Pomiń subagenta przy małym zadaniu, które możesz zrobić na miejscu, a tym, które zostawiasz, przypnij mały model.
Ograniczenie tego wyniku: nikt nie zmierzył, ile przypinanie oszczędza jako udział tygodnia, a mały model, który potrzebuje więcej tur, może kosztować więcej. Te 48% pochodzą z pracy, która mocno się rozgałęzia. Twój własny udział jest na ekranie /usage.
Pięciominutowy cache, którego nikt nie wymienia
Claude Code trzyma twoją rozmowę w cache promptów na serwerze, a odczyt z niego kosztuje ułamek ceny ponownego wysłania. Dla głównej sesji ten cache żyje godzinę. Dla subagenta żyje pięć minut.
Dokumentacja mówi to wprost: subagenty dostają pięć minut, nawet w subskrypcji, dopóki nie wybierzesz dłuższego czasu. To samo dotyczy wszystkiego poza główną rozmową, w tym pracy w tle i kompaktowania. Zmierzone logi się zgadzają: każdy zapis do cache od subagenta trafił na poziom pięciominutowy, a każdy od głównej sesji na poziom jednogodzinny.
Pewien programista z Reddita zauważył, co to powoduje: jeden z jego subagentów przepisał cały swój kontekst osiem razy w ciągu jednego dnia. Poprawka to jedna linia w pliku ustawień, "subagentPromptCacheTtl": "1h".
| Jego pomiar | Przed | Po |
|---|---|---|
| Zapisy do cache | 12,2 miliona tokenów | 3,0 miliony tokenów |
| Okno pięciogodzinne z czterema subagentami | z 2% do 100% | z 0% do 22% |
To jeden użytkownik porównujący dwa różne dni, a nie kontrolowany test. W zmierzonych tu logach prawie nie ma to znaczenia: tylko 95 z 41 790 kolejnych zapytań subagentów (około dwa na tysiąc) przyszło po czekaniu dłuższym niż pięć minut, choć każde z nich przepisało około 75 000 tokenów.
Wszystko zależy więc od tego, jak pracują twoje subagenty. Jeśli czekają na długi build, na review albo na ciebie, włącz to. Jeśli pracują krótkimi seriami, zostaw, bo cache trwający godzinę kosztuje więcej przy zapisie.
Przerwa, która przepisuje całą sesję
Cache głównej sesji trwa godzinę. Po dłuższej przerwie znika, a następna wiadomość nie ma z czego czytać. Dokumentacja opisuje to wprost: wiadomość wysłana po przerwie chybia cache i przetwarza cały twój kontekst od nowa.
| Pauza przed wiadomością | Zapytania | Przepisany cache (mediana) |
|---|---|---|
| Poniżej 5 minut | 18 029 | 1176 tokenów |
| Od 5 do 60 minut | 414 | 1327 tokenów |
| Ponad 60 minut | 79 | 130 332 tokeny |
Typowa sesja w tym momencie miała 175 523 tokeny, więc większość została zapisana ponownie. Licznik nie traktuje też zapisu jak odczytu. Pewien programista postawił przed Claude Code proxy z logowaniem i obserwował swoje okno pięciogodzinne: według jego proporcji token zapisany do cache waży około czterdzieści razy tyle, co token z niego odczytany.
Claude Code o tym wie. Gdy wznawiasz dużą sesję po długiej przerwie, proponuje wznowienie z podsumowania. Skorzystaj z tego.
Tańszy nawyk przychodzi wcześniej. Gdy zadanie jest skończone, wyczyść sesję, póki cache jest jeszcze ciepły. Czyszczenie nic nie kosztuje, a następne zadanie zaczyna od małego kontekstu. Kompaktowanie też działa, ale kompaktowanie ogromnej sesji samo jest ogromnym zapytaniem.
Przerwa nie jest jedynym sposobem na utratę cache. Zmiana modelu w środku sesji go opróżnia, bo każdy model trzyma własny. Na najnowszych modelach zmiana effort tego nie robi. Claude Code prosi o potwierdzenie zmiany modelu, gdy cache jest ciepły, i ten komunikat to ostrzeżenie.
Ograniczenia: 79 zimnych powrotów to mała próba, a część z nich następuje po kompaktowaniu. Podsumowanie gubi też szczegóły, więc ta poprawka kosztuje trochę ciągłości.
Effort: poprawka, która może kosztować jakość
Effort to czas, jaki model może myśleć przed odpowiedzią. Jest pięć poziomów, od low do max, a myślenie jest rozliczane jako output. Domyślnym poziomem jest high w większości modeli i medium w dwóch najnowszych.
Dokumentacja mówi, że budżet myślenia może sięgać dziesiątek tysięcy tokenów na zapytanie, a najwyższy poziom skłania do nadmiernego główkowania. W najnowszych modelach myślenia nie da się wyłączyć wcale, więc poziom to jedyna kontrola.
Jeden programista puścił te same 29 prawdziwych zadań na wszystkich pięciu poziomach:
| Poziom effort | Średni koszt zadania | Zaliczone zadania (z 29) |
|---|---|---|
| low | 2,50 $ | 23 |
| medium | 3,15 $ | 28 |
| high | 5,01 $ | 26 |
| xhigh | 6,51 $ | 25 |
| max | 8,84 $ | 27 |
Jakość nie szła za kosztem. Medium zaliczył więcej zadań niż jakikolwiek wyższy poziom, a w przeliczeniu na dolara dał też najwięcej zaliczeń. Jego słowami, krzywa zdaje się osiągać szczyt przy medium. Zespół Claude Code pracuje podobnie: jeden z jego inżynierów buduje na low lub medium, robi review i uruchamia weryfikację dopiero na high.
Haczyk wyjaśnia, dlaczego ta poprawka może kosztować jakość. Na trudnych problemach, które wybrał, low zaliczył zero razy na pięć, a high pięć razy na pięć. Podejście na low trwało dwie minuty, na high trzydzieści trzy.
Dopasuj więc effort do kroku: medium do budowania, high gdy błąd jest drogi (bug w starym kodzie, migracja, końcowa kontrola), max prawie nigdy. Logi sesji zapisują effort każdego zapytania, więc możesz sprawdzić, co naprawdę uruchamiałeś.
Te koszty są w dolarach na starszym modelu, a nie jako udział tygodnia, bo nikt tego nie opublikował. A tanie podejście, które zawodzi i trzeba je powtórzyć, kosztuje więcej niż jedno, które działa.
Porady, które ważą mniej, niż się reklamuje
Niektóre poprawki są na każdej liście i prawie nic nie zmieniają. Można je wypróbować za darmo. Po prostu nie tam poszedł twój tydzień.
Prawdziwą pozycją w tej grupie jest to, co ładuje się na starcie. Jeden artykuł zmierzył pierwsze zapytanie z pustego folderu na 29 061 tokenów, a w prawdziwym projekcie na prawie 39 000. W zmierzonych tu logach mediana pierwszego zapytania to 55 989 tokenów, w zakresie od 15 764 do 105 020, zależnie od projektu. Polecenie /context pokazuje, co tam jest (pliki pamięci, skille, listy narzędzi) i wymienia każdy załadowany plik pamięci. Wytnij to, czego nigdy nie używasz. Zysk jest skromny, bo ten blok jest zapisywany raz i czytany z cache przy każdej kolejnej turze. Boli przy zimnym starcie i przy każdym uruchomieniu subagenta.
| Popularna porada | Zmierzone |
|---|---|
| Usuwanie serwerów MCP | 1350 tokenów na 51 narzędzi w trzech serwerach; 18 tokenów na jeden serwer z jednym narzędziem |
| Wyłączenie sugestii promptów | 3 do 4% u jednego użytkownika; twierdzenie "do 10%" pochodziło z jednego konta z ogromnymi kontekstami |
| Filtrowanie outputu powłoki | około 0,1% całkowitego wolumenu, zmierzone przez autora jednego z tych filtrów |
Definicje narzędzi są teraz domyślnie odroczone, dlatego serwery MCP ważą tak mało. Dokumentacja nazywa koszt sugestii promptów małym. Wszystkie trzy rosną wraz z rozmiarem kontekstu, a serwery kosztują więcej na starszych modelach, gdzie odroczenie jest wyłączone. Wyłącz je, jeśli chcesz, ale nie oczekuj, że odzyskasz tydzień.
Tabela rankingowa
Ranking według tego, co zmierzono:
| Pozycja | Poprawka | Zmierzone | Haczyk |
|---|---|---|---|
| 1 | Mniej i tańsze subagenty | 48,1% tokenów; 47 117 na uruchomienie | Mniej równoległości |
| 2 | Nie wznawiaj zimnej sesji | 130 332 tokeny przepisane wobec 1176 | Podsumowanie gubi szczegóły |
| 3 | Effort: medium do budowania | 3,15 $ wobec 5,01 $ za zadanie; 28 z 29 zaliczonych | Low zawodzi na trudnych problemach |
| 4 | Cache subagenta na godzinę | z 12,2 miliona do 3,0 milionów tokenów zapisów do cache | Opłaca się tylko, gdy subagenty czekają |
| 5 | Wytnij to, co ładuje się na starcie | +9744 tokeny na bazie 29 061 | Płacone raz na sesję |
Trzy popularne porady (serwery MCP, sugestie promptów, output powłoki) nie są tym, gdzie poszedł tydzień.
Ograniczenia, wprost: ten ranking jest w tokenach, z jednego miesiąca pracy jednej osoby, plus pomiary innych osób. Anthropic nie publikuje rozmiaru limitu w tokenach, więc nikt z zewnątrz nie przeliczy tego na udział twojego tygodnia. Twoja kolejność może być inna, a ekran /usage ci ją pokaże.
Dwie największe poprawki to nawyki, a nie ustawienia, i są darmowe: uruchamiaj mniej subagentów i nigdy nie wznawiaj w całości zimnej sesji.
AIDive