AIDive

Video-Paket

Kürzung des Claude-Code-Wochenlimits: gemessene Hebel, Cache-Tabellen, Montags-Checkliste

10 Min. Lesezeit

TL;DR

  • Das wöchentliche Limit von Claude Code ging von einer Basis von 100 auf ein Promo-Niveau von 150 und pendelte sich am 14. September 2026 dauerhaft bei 125 ein. Gegenüber dem Promo-Niveau ist das eine Kürzung um 17 %, gegenüber der alten Basis eine Erhöhung um 25 %. Beides stimmt gleichzeitig.
  • In einem Monat lokaler Logs verbrauchten Subagents 48,1 % aller Tokens und 55,3 % der gewichteten Kosten. Der größte einzelne Hebel: weniger Subagents starten und den verbleibenden ein kleines Modell fest zuweisen.
  • Subagents schreiben einen 5-Minuten-Cache, die Hauptsession schreibt einen 1-Stunden-Cache. Eine Folgeanfrage nach einer kalten Pause schreibt etwa 19-mal mehr Cache neu als eine warme.
  • Eine Pause von mehr als 60 Minuten in einer Hauptsession kostet bei der nächsten Anfrage im Median 130.332 Tokens Cache-Neuschreibung, gegenüber 1.176 bei einer Pause unter 5 Minuten.
  • Weniger Effort senkte in diesen Logs den Output pro Anfrage nicht (Mittel 778 Tokens bei high gegenüber 837 bei medium in Hauptsessions). Sieh es als Qualitätsabwägung, nicht als kostenlose Ersparnis.
  • Prompt-Vorschläge abschalten und Shell-Output filtern sind echte, aber kleine Hebel. Zähl sie zuletzt.

Was die Messungen zeigen

Die Rechnung hinter der Schlagzeile: Basis 100, Promo-Niveau 150, dauerhaftes Niveau 125. 125 / 150 = 0,8333, die Kürzung beträgt also 16,67 % und rundet auf 17 %. Falsch ist, die Zuwächse zu subtrahieren (50 % runter auf 25 %) und das als 25 % Kürzung zu bezeichnen. s2

Die Aktion lief vom 13. Mai 2026 bis zum 13. September 2026, erhöhte die Wochenlimits nur in Claude Code um 50 % und ließ die 5-Stunden-Limits unberührt. Sie galt für Pro, Max, Team und platzbasierte Enterprise-Pläne. s1

Die folgenden Messungen stammen aus den Claude-Code-Logs einer einzigen Maschine: 455 Hauptsessions, 2.631 Subagent-Läufe, 63.398 deduplizierte Anfragen zwischen dem 03.09.2026 und dem 03.10.2026. Der erste Befund betrifft das Zählen selbst: Jede Anfrage taucht im Schnitt auf 1,96 Logzeilen auf, wer also jede Zeile summiert, überschätzt die Gesamt-Tokens um 99,3 %. Jedes Skript, das diese Logs liest, muss zuerst nach (message.id, requestId) deduplizieren. s11

Subagents sind der größte Posten. Dedupliziert machen sie 48,1 % der Gesamt-Tokens, 63,9 % der Output-Tokens und 55,3 % der gewichteten Kosten aus. Die erste Anfrage eines Subagent-Laufs trägt einen Median-Prompt von 47.117 Tokens, bevor überhaupt etwas passiert; das p90 liegt bei 52.681, das Maximum bei 126.769. Agents mit eingeschränkten Tool-Sets starten deutlich niedriger (Minimum 5.295). s8

Die Modellwahl verstärkt das. Subagents erben das Modell der Hauptkonversation, sofern nicht ein model-Frontmatter, ein model-Parameter pro Aufruf oder CLAUDE_CODE_SUBAGENT_MODEL etwas anderes festlegt. Seit v2.1.251 überschreibt die Umgebungsvariable allein das Frontmatter nicht mehr: Du brauchst CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. In den Logs entfielen auf claude-opus-5 allein 31,5 % aller Tokens und 35,8 % der gewichteten Kosten, davon 63,2 % innerhalb von Subagents. s3

Die Cache-Stufe hängt davon ab, wo die Anfrage läuft. In diesen Daten waren 100,0 % der Cache-Schreibvorgänge von Subagents 5-Minuten-Schreibvorgänge und 100,0 % der Schreibvorgänge der Hauptsessions 1-Stunden-Schreibvorgänge; keine Anfrage hatte eine gemischte Aufteilung. Innerhalb von Subagent-Läufen kamen nur 95 von 41.790 Folgeanfragen (0,2 %) nach einer Pause über 5 Minuten, doch sie schrieben im Mittel 74.582 cache_creation-Tokens gegenüber 3.886 bei warmen Anfragen. Die Einstellung subagentPromptCacheTtl und die Umgebungsvariable CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL akzeptieren 5m oder 1h und erfordern Claude Code v2.1.242 oder neuer. s4

Ein unabhängiger Lauf sah dieselbe Aufteilung: jede Subagent-Anfrage unter ephemeral_5m_input_tokens geschrieben, während der Parent ephemeral_1h_input_tokens nutzte, und ein Agent, der bei einer Anfrage nach Ablauf des Fünf-Minuten-Fensters alle 20.971 Tokens seines Präfix neu schrieb. s6

Das Gegenstück in der Hauptsession ist die lange Pause. Anfragen, die weniger als 5 Minuten nach der vorherigen kamen, schrieben im Median 1.176 cache_creation-Tokens (n = 18.029). Zwischen 5 und 60 Minuten: 1.327 (n = 414). Über 60 Minuten: 130.332 (n = 79), bei einem Median-Prompt von 175.523 Tokens und einem p90 von 674.348. Die Doku bestätigt, dass die Abrechnung über Overage die Hauptkonversation ebenfalls auf die Fünf-Minuten-Stufe zurückstuft. s3

Der Sessionstart ist der Fixkostenblock: Die erste Anfrage einer Hauptsession trug im Median 55.989 Tokens (p90 72.000), mit einer Streuung pro Projekt von 15.764 bis 105.020, je nach Größe von CLAUDE.md und Memory. Eine frühere öffentliche Messung setzte die Untergrenze bei etwa 29k in einem leeren Verzeichnis, 30,4k mit 3 MCP-Servern und 38,8k in einem echten Repo. s9

Effort ist der hier von der Doku empfohlene Hebel, den die Logs nicht belohnen. In Hauptsessions erzeugten high-Anfragen im Mittel 778 Output-Tokens gegenüber 837 bei medium; Subagents bei high erzeugten 323 gegenüber 642. Der Vergleich ist verzerrt (andere Aufgaben, Modelle, Projekte), also ein Grund zur Skepsis, kein Beweis. Die Richtlinie des Claude-Code-Teams versteht Effort als Frage, wo man Denkaufwand investiert, nicht als Budgetregler. s10

Zwei beliebte Tipps maßen sich klein. Prompt-Vorschläge kosten zusätzliche Anfragen, und die oft geteilte Zahl „spart ca. 10 %“ ist eine Obergrenze, kein typischer Wert; die Einstellung heißt promptSuggestionEnabled: false oder CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Das Filtern der Shell-Ausgabe drückte über zwanzig Tage 66,7 Millionen Output-Tokens auf 24,1 Millionen, doch diese 66,7 Millionen entsprachen 7,4 % der im selben Zeitraum verbrauchten neuen Tokens. s11

Messwerte

Startkosten eines Subagents, Prompt der ersten Anfrage in Tokens, nach Modell:

Modell n min Median p90 max
Alle 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

Cache-Neuschreibung beim Fortsetzen, Hauptsessions, nach Pause vor der Anfrage:

Pause n cache_creation Median Mittel cache_read Median Prompt Median
< 5 Min. 18,029 1,176 2,391 184,169 186,412
5 bis 60 Min. 414 1,327 5,575 221,857 225,168
> 60 Min. 79 130,332 241,499 25,264 175,523

Protokoll: Lies jede Hauptsession ~/.claude/projects/*/<uuid>.jsonl und jeden Subagent-Lauf */<uuid>/subagents/agent-*.jsonl, Anfragen ab dem 01.09.2026. Dedupliziere Assistant-Zeilen nach (message.id, requestId) und behalte einen Usage-Eintrag pro Anfrage. Gesamt-Tokens = input + output + cache_read + cache_creation; Prompt-Größe = input + cache_read + cache_creation. Pause = Zeit von der letzten Logzeile der vorherigen Anfrage bis zur ersten Zeile dieser Anfrage, innerhalb einer Session oder eines Laufs. Gewichtete Kosten nutzen relative Gewichte: input 1, Cache-Schreiben 5m 1,25, Cache-Schreiben 1h 2, cache_read 0,1, output 5; diese Gewichte sind eine Annahme, kein veröffentlichter Tarif.

Das machst du am Montag

  • Führe /usage in deinem Plan aus und lies die Aufschlüsselung nach Skill, Subagent, Plugin und MCP sowie die Verhaltens-Flags ab 10 % der jüngsten Nutzung.
  • Liste deine Subagent-Definitionen auf und ergänze model: haiku oder model: sonnet als Frontmatter bei jeder, die nur sucht, prüft oder zusammenfasst.
  • Wenn du ein Modell für alle Subagents unabhängig vom Frontmatter willst, setze CLAUDE_CODE_SUBAGENT_MODEL und CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Prüfe, ob deine Claude-Code-Version 2.1.242 oder neuer ist, und entscheide dann pro Workflow, ob sich subagentPromptCacheTtl: "1h" lohnt: Es hilft Subagents, die zwischen Tool-Aufrufen pausieren, nicht kurzen.
  • Beende vor einer Pause von mehr als einer Stunde die Aufgabe in der aktuellen Session und schreibe eine Übergabedatei; öffne danach eine frische Session, statt einen 175k-Token-Prompt fortzusetzen.
  • Schreibe ein rein lesendes Skript über deine eigenen Logs, dedupliziert nach (message.id, requestId), und vergleiche den Anteil von Hauptsession und Subagents, bevor du etwas anderes änderst.
  • Setze promptSuggestionEnabled: false, wenn du die Vorschläge nie nutzt, und rechne höchstens mit wenigen Prozent Ersparnis.

Weiterlesen

  • Max 5x gegenüber Max 20x: das Kapazitätsverhältnis, das Nutzer nach der Kürzung gemessen haben, ist eine Frage der Plan-Wahl, die das Video ausgelassen hat. s7
  • Die vollständige Vorrangkette für die Cache-TTL (Force-Env, Bucket-Env, Bucket-Einstellung, Subagent-experimental.cacheTtl) und was sich bei Overage-Abrechnung ändert. s4
  • Warum ein Effort-Wechsel mitten in der Session bei den meisten Modellen die gesamte Historie ohne Cache-Treffer lesen kann und welche Modelle ausgenommen sind. s3
  • Wie du usage-Felder und Cache-Stufen in deinen eigenen Session-Logs liest, und der ccboard-Ansatz für eine Tagesbudget-Ansicht. s11
  • Drei Subagent-Dateien mit drei Modellen und was jeder Start tatsächlich in den Cache schrieb, mit den Korrekturen des Autors am Ende. s8
  • Zurückgestellte MCP-Tool-Definitionen und ENABLE_TOOL_SEARCH=auto:N, um zu steuern, wann Tool-Schemas in den Kontext geladen werden. s3

Quellen

FAQ

Ist es eine Kürzung um 17 % oder eine Erhöhung um 25 %?

Beides, gemessen von unterschiedlichen Basen. Gegenüber der Basis von 100 vor der Aktion ist das dauerhafte Niveau von 125 eine Erhöhung um 25 %. Gegenüber dem Promo-Niveau von 150, das Nutzer vom 13. Mai bis 13. September 2026 hatten, ist es eine Kürzung um 17 %.

Sollte ich subagentPromptCacheTtl überall auf 1h setzen?

Nur wenn deine Subagents zwischen Anfragen mehr als fünf Minuten pausieren. In den Logs traf das auf 0,2 % der Folgeanfragen zu, eine pauschale 1h-Stufe zahlt also meist einen höheren Schreibpreis für nichts. Miss zuerst deine eigene Pausenverteilung.

Spart weniger Effort Tokens?

In diesen Logs nicht sichtbar: Hauptsession-Anfragen bei high erzeugten im Mittel 778 Output-Tokens gegenüber 837 bei medium. Die Daten sind verzerrt, die ehrliche Antwort lautet also: Effort ist ein Qualitätsregler, dessen Ersparnis du an deinen eigenen Aufgaben messen musst.

Warum kostet mein erster Prompt nach der Mittagspause so viel?

Die Hauptsession schreibt einen 1-Stunden-Cache. Nach einer Pause über 60 Minuten schreibt die nächste Anfrage das Präfix neu: in den Logs im Median 130.332 cache_creation-Tokens gegenüber 1.176 bei einer warmen Anfrage. Schließe Aufgaben vor langen Pausen ab und starte danach frisch.