TL;DR
- Das wöchentliche Limit von Claude Code ging von einer Basis von 100 auf ein Promo-Niveau von 150 und pendelte sich am 14. September 2026 dauerhaft bei 125 ein. Gegenüber dem Promo-Niveau ist das eine Kürzung um 17 %, gegenüber der alten Basis eine Erhöhung um 25 %. Beides stimmt gleichzeitig.
- In einem Monat lokaler Logs verbrauchten Subagents 48,1 % aller Tokens und 55,3 % der gewichteten Kosten. Der größte einzelne Hebel: weniger Subagents starten und den verbleibenden ein kleines Modell fest zuweisen.
- Subagents schreiben einen 5-Minuten-Cache, die Hauptsession schreibt einen 1-Stunden-Cache. Eine Folgeanfrage nach einer kalten Pause schreibt etwa 19-mal mehr Cache neu als eine warme.
- Eine Pause von mehr als 60 Minuten in einer Hauptsession kostet bei der nächsten Anfrage im Median 130.332 Tokens Cache-Neuschreibung, gegenüber 1.176 bei einer Pause unter 5 Minuten.
- Weniger Effort senkte in diesen Logs den Output pro Anfrage nicht (Mittel 778 Tokens bei high gegenüber 837 bei medium in Hauptsessions). Sieh es als Qualitätsabwägung, nicht als kostenlose Ersparnis.
- Prompt-Vorschläge abschalten und Shell-Output filtern sind echte, aber kleine Hebel. Zähl sie zuletzt.
Was die Messungen zeigen
Die Rechnung hinter der Schlagzeile: Basis 100, Promo-Niveau 150, dauerhaftes Niveau 125. 125 / 150 = 0,8333, die Kürzung beträgt also 16,67 % und rundet auf 17 %. Falsch ist, die Zuwächse zu subtrahieren (50 % runter auf 25 %) und das als 25 % Kürzung zu bezeichnen. s2
Die Aktion lief vom 13. Mai 2026 bis zum 13. September 2026, erhöhte die Wochenlimits nur in Claude Code um 50 % und ließ die 5-Stunden-Limits unberührt. Sie galt für Pro, Max, Team und platzbasierte Enterprise-Pläne. s1
Die folgenden Messungen stammen aus den Claude-Code-Logs einer einzigen Maschine: 455 Hauptsessions, 2.631 Subagent-Läufe, 63.398 deduplizierte Anfragen zwischen dem 03.09.2026 und dem 03.10.2026. Der erste Befund betrifft das Zählen selbst: Jede Anfrage taucht im Schnitt auf 1,96 Logzeilen auf, wer also jede Zeile summiert, überschätzt die Gesamt-Tokens um 99,3 %. Jedes Skript, das diese Logs liest, muss zuerst nach (message.id, requestId) deduplizieren. s11
Subagents sind der größte Posten. Dedupliziert machen sie 48,1 % der Gesamt-Tokens, 63,9 % der Output-Tokens und 55,3 % der gewichteten Kosten aus. Die erste Anfrage eines Subagent-Laufs trägt einen Median-Prompt von 47.117 Tokens, bevor überhaupt etwas passiert; das p90 liegt bei 52.681, das Maximum bei 126.769. Agents mit eingeschränkten Tool-Sets starten deutlich niedriger (Minimum 5.295). s8
Die Modellwahl verstärkt das. Subagents erben das Modell der Hauptkonversation, sofern nicht ein model-Frontmatter, ein model-Parameter pro Aufruf oder CLAUDE_CODE_SUBAGENT_MODEL etwas anderes festlegt. Seit v2.1.251 überschreibt die Umgebungsvariable allein das Frontmatter nicht mehr: Du brauchst CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. In den Logs entfielen auf claude-opus-5 allein 31,5 % aller Tokens und 35,8 % der gewichteten Kosten, davon 63,2 % innerhalb von Subagents. s3
Die Cache-Stufe hängt davon ab, wo die Anfrage läuft. In diesen Daten waren 100,0 % der Cache-Schreibvorgänge von Subagents 5-Minuten-Schreibvorgänge und 100,0 % der Schreibvorgänge der Hauptsessions 1-Stunden-Schreibvorgänge; keine Anfrage hatte eine gemischte Aufteilung. Innerhalb von Subagent-Läufen kamen nur 95 von 41.790 Folgeanfragen (0,2 %) nach einer Pause über 5 Minuten, doch sie schrieben im Mittel 74.582 cache_creation-Tokens gegenüber 3.886 bei warmen Anfragen. Die Einstellung subagentPromptCacheTtl und die Umgebungsvariable CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL akzeptieren 5m oder 1h und erfordern Claude Code v2.1.242 oder neuer. s4
Ein unabhängiger Lauf sah dieselbe Aufteilung: jede Subagent-Anfrage unter ephemeral_5m_input_tokens geschrieben, während der Parent ephemeral_1h_input_tokens nutzte, und ein Agent, der bei einer Anfrage nach Ablauf des Fünf-Minuten-Fensters alle 20.971 Tokens seines Präfix neu schrieb. s6
Das Gegenstück in der Hauptsession ist die lange Pause. Anfragen, die weniger als 5 Minuten nach der vorherigen kamen, schrieben im Median 1.176 cache_creation-Tokens (n = 18.029). Zwischen 5 und 60 Minuten: 1.327 (n = 414). Über 60 Minuten: 130.332 (n = 79), bei einem Median-Prompt von 175.523 Tokens und einem p90 von 674.348. Die Doku bestätigt, dass die Abrechnung über Overage die Hauptkonversation ebenfalls auf die Fünf-Minuten-Stufe zurückstuft. s3
Der Sessionstart ist der Fixkostenblock: Die erste Anfrage einer Hauptsession trug im Median 55.989 Tokens (p90 72.000), mit einer Streuung pro Projekt von 15.764 bis 105.020, je nach Größe von CLAUDE.md und Memory. Eine frühere öffentliche Messung setzte die Untergrenze bei etwa 29k in einem leeren Verzeichnis, 30,4k mit 3 MCP-Servern und 38,8k in einem echten Repo. s9
Effort ist der hier von der Doku empfohlene Hebel, den die Logs nicht belohnen. In Hauptsessions erzeugten high-Anfragen im Mittel 778 Output-Tokens gegenüber 837 bei medium; Subagents bei high erzeugten 323 gegenüber 642. Der Vergleich ist verzerrt (andere Aufgaben, Modelle, Projekte), also ein Grund zur Skepsis, kein Beweis. Die Richtlinie des Claude-Code-Teams versteht Effort als Frage, wo man Denkaufwand investiert, nicht als Budgetregler. s10
Zwei beliebte Tipps maßen sich klein. Prompt-Vorschläge kosten zusätzliche Anfragen, und die oft geteilte Zahl „spart ca. 10 %“ ist eine Obergrenze, kein typischer Wert; die Einstellung heißt promptSuggestionEnabled: false oder CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Das Filtern der Shell-Ausgabe drückte über zwanzig Tage 66,7 Millionen Output-Tokens auf 24,1 Millionen, doch diese 66,7 Millionen entsprachen 7,4 % der im selben Zeitraum verbrauchten neuen Tokens. s11
Messwerte
Startkosten eines Subagents, Prompt der ersten Anfrage in Tokens, nach Modell:
| Modell | n | min | Median | p90 | max |
|---|---|---|---|---|---|
| Alle | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
Cache-Neuschreibung beim Fortsetzen, Hauptsessions, nach Pause vor der Anfrage:
| Pause | n | cache_creation Median | Mittel | cache_read Median | Prompt Median |
|---|---|---|---|---|---|
| < 5 Min. | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| 5 bis 60 Min. | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 Min. | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
Protokoll: Lies jede Hauptsession ~/.claude/projects/*/<uuid>.jsonl und jeden Subagent-Lauf */<uuid>/subagents/agent-*.jsonl, Anfragen ab dem 01.09.2026. Dedupliziere Assistant-Zeilen nach (message.id, requestId) und behalte einen Usage-Eintrag pro Anfrage. Gesamt-Tokens = input + output + cache_read + cache_creation; Prompt-Größe = input + cache_read + cache_creation. Pause = Zeit von der letzten Logzeile der vorherigen Anfrage bis zur ersten Zeile dieser Anfrage, innerhalb einer Session oder eines Laufs. Gewichtete Kosten nutzen relative Gewichte: input 1, Cache-Schreiben 5m 1,25, Cache-Schreiben 1h 2, cache_read 0,1, output 5; diese Gewichte sind eine Annahme, kein veröffentlichter Tarif.
Das machst du am Montag
- Führe
/usagein deinem Plan aus und lies die Aufschlüsselung nach Skill, Subagent, Plugin und MCP sowie die Verhaltens-Flags ab 10 % der jüngsten Nutzung. - Liste deine Subagent-Definitionen auf und ergänze
model: haikuodermodel: sonnetals Frontmatter bei jeder, die nur sucht, prüft oder zusammenfasst. - Wenn du ein Modell für alle Subagents unabhängig vom Frontmatter willst, setze
CLAUDE_CODE_SUBAGENT_MODELundCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Prüfe, ob deine Claude-Code-Version 2.1.242 oder neuer ist, und entscheide dann pro Workflow, ob sich
subagentPromptCacheTtl: "1h"lohnt: Es hilft Subagents, die zwischen Tool-Aufrufen pausieren, nicht kurzen. - Beende vor einer Pause von mehr als einer Stunde die Aufgabe in der aktuellen Session und schreibe eine Übergabedatei; öffne danach eine frische Session, statt einen 175k-Token-Prompt fortzusetzen.
- Schreibe ein rein lesendes Skript über deine eigenen Logs, dedupliziert nach (message.id, requestId), und vergleiche den Anteil von Hauptsession und Subagents, bevor du etwas anderes änderst.
- Setze
promptSuggestionEnabled: false, wenn du die Vorschläge nie nutzt, und rechne höchstens mit wenigen Prozent Ersparnis.
Weiterlesen
- Max 5x gegenüber Max 20x: das Kapazitätsverhältnis, das Nutzer nach der Kürzung gemessen haben, ist eine Frage der Plan-Wahl, die das Video ausgelassen hat. s7
- Die vollständige Vorrangkette für die Cache-TTL (Force-Env, Bucket-Env, Bucket-Einstellung, Subagent-
experimental.cacheTtl) und was sich bei Overage-Abrechnung ändert. s4 - Warum ein Effort-Wechsel mitten in der Session bei den meisten Modellen die gesamte Historie ohne Cache-Treffer lesen kann und welche Modelle ausgenommen sind. s3
- Wie du
usage-Felder und Cache-Stufen in deinen eigenen Session-Logs liest, und der ccboard-Ansatz für eine Tagesbudget-Ansicht. s11 - Drei Subagent-Dateien mit drei Modellen und was jeder Start tatsächlich in den Cache schrieb, mit den Korrekturen des Autors am Ende. s8
- Zurückgestellte MCP-Tool-Definitionen und
ENABLE_TOOL_SEARCH=auto:N, um zu steuern, wann Tool-Schemas in den Kontext geladen werden. s3
Quellen
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Warum lesen: die genauen Daten, Pläne und der Umfang der 50-%-Aktion, in Anthropics eigenen Worten.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Warum lesen: die 25-%-Erhöhung und die 17-%-Kürzung nebeneinander, mit der zitierten Ankündigung.
- Manage costs effectively, Claude Code docs. Warum lesen: die
/usage-Aufschlüsselung, die Modellvererbung bei Subagents und die Cache-Regeln für Effort und MCP. - How Claude Code uses prompt caching, Claude Code docs. Warum lesen: die einzige verbindliche Beschreibung der 5m- und 1h-Stufen und der TTL-Einstellungen.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Warum lesen: der Thread, der den 5-Minuten-Cache der Subagents aufgedeckt hat, samt der Einstellung, die ihn umstellt.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Warum lesen: ein Kapazitätsvergleich der beiden Max-Stufen aus Nutzersicht nach der Kürzung.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Warum lesen: ein reproduzierbares Experiment zu den Startkosten mit rohen Usage-Feldern und ehrlichen Korrekturen.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Warum lesen: eine Messung des Start-Overheads in einem leeren Verzeichnis, mit MCP-Servern und in einem echten Repo.
- Using Claude Code: Spending your effort, X, Claude Code team. Warum lesen: wie das Team über Effort-Stufen denkt; es enthält keine Token-Zahlen, und das ist der Punkt.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Warum lesen: eine Log-Studie über zwanzig Tage, die das Filtern der Shell-Ausgabe im Verhältnis zum Gesamtverbrauch einordnet.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Warum lesen: die ursprüngliche Behauptung und der Thread, der die 10 % zu einer Obergrenze eingrenzt.
FAQ
Ist es eine Kürzung um 17 % oder eine Erhöhung um 25 %?
Beides, gemessen von unterschiedlichen Basen. Gegenüber der Basis von 100 vor der Aktion ist das dauerhafte Niveau von 125 eine Erhöhung um 25 %. Gegenüber dem Promo-Niveau von 150, das Nutzer vom 13. Mai bis 13. September 2026 hatten, ist es eine Kürzung um 17 %.
Sollte ich subagentPromptCacheTtl überall auf 1h setzen?
Nur wenn deine Subagents zwischen Anfragen mehr als fünf Minuten pausieren. In den Logs traf das auf 0,2 % der Folgeanfragen zu, eine pauschale 1h-Stufe zahlt also meist einen höheren Schreibpreis für nichts. Miss zuerst deine eigene Pausenverteilung.
Spart weniger Effort Tokens?
In diesen Logs nicht sichtbar: Hauptsession-Anfragen bei high erzeugten im Mittel 778 Output-Tokens gegenüber 837 bei medium. Die Daten sind verzerrt, die ehrliche Antwort lautet also: Effort ist ein Qualitätsregler, dessen Ersparnis du an deinen eigenen Aufgaben messen musst.
Warum kostet mein erster Prompt nach der Mittagspause so viel?
Die Hauptsession schreibt einen 1-Stunden-Cache. Nach einer Pause über 60 Minuten schreibt die nächste Anfrage das Präfix neu: in den Logs im Median 130.332 cache_creation-Tokens gegenüber 1.176 bei einer warmen Anfrage. Schließe Aufgaben vor langen Pausen ab und starte danach frisch.
AIDive