Коротко
- Недельный лимит Claude Code вырос с базы 100 до промо-уровня 150, а 14 сентября 2026 года закрепился на постоянных 125. Относительно промо это снижение на 17%, относительно старой базы рост на 25%. Верны обе формулировки сразу.
- За месяц локальных логов субагенты съели 48,1% всех токенов и 55,3% взвешенной стоимости. Главный рычаг: запускать меньше субагентов и закреплять маленькую модель за теми, что остались.
- Субагенты пишут 5-минутный кэш, основная сессия пишет 1-часовой. Запрос после холодной паузы перезаписывает примерно в 19 раз больше кэша, чем тёплый.
- Перерыв дольше 60 минут в основной сессии стоит медианно 130 332 токена перезаписи кэша на следующем запросе, против 1 176 при паузе до 5 минут.
- Снижение effort не уменьшило вывод на запрос в этих логах (в основных сессиях в среднем 778 токенов на high против 837 на medium), так что это компромисс по качеству, а не бесплатная экономия.
- Отключение подсказок промпта и фильтрация вывода shell дают реальный, но небольшой эффект. Считайте их в последнюю очередь.
Что говорят измерения
Арифметика заголовка: база 100, промо-уровень 150, постоянный уровень 125. 125 / 150 = 0,8333, значит снижение 16,67%, округляется до 17%. Неверно вычитать приросты (с 50% до 25%) и называть это снижением на 25%. s2
Промо шло с 13 мая 2026 по 13 сентября 2026, подняло недельные лимиты на 50% только в Claude Code и не тронуло 5-часовые лимиты. Оно действовало для планов Pro, Max, Team и Enterprise с местами. s1
Измерения ниже взяты из логов Claude Code на одной машине: 455 основных сессий, 2 631 запуск субагентов, 63 398 запросов после дедупликации, с 2026-09-03 по 2026-10-03. Первая находка касается самого подсчёта: каждый запрос встречается в среднем на 1,96 строки лога, поэтому суммирование всех строк завышает общее число токенов на 99,3%. Любой скрипт, читающий эти логи, должен сначала дедуплицировать по (message.id, requestId). s11
Субагенты: самая крупная статья. После дедупликации на них приходится 48,1% всех токенов, 63,9% выходных токенов и 55,3% взвешенной стоимости. Первый запрос запуска субагента несёт медианный промпт в 47 117 токенов ещё до начала работы; p90 равен 52 681, максимум 126 769. Агенты с урезанным набором инструментов стартуют гораздо ниже (минимум 5 295). s8
Выбор модели усиливает эффект. Субагенты наследуют модель основного диалога, пока это не изменит frontmatter model, параметр model при вызове или CLAUDE_CODE_SUBAGENT_MODEL, а начиная с v2.1.251 одна только переменная окружения больше не перекрывает frontmatter: нужен CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. В логах один claude-opus-5 дал 31,5% всех токенов и 35,8% взвешенной стоимости, причём 63,2% из этого потрачено внутри субагентов. s3
Уровень кэша определяется тем, где выполняется запрос. В этих данных 100,0% записей кэша субагентов были 5-минутными, а 100,0% записей основной сессии 1-часовыми; смешанных запросов не было. Внутри запусков субагентов лишь 95 из 41 790 последующих запросов (0,2%) пришли после паузы дольше 5 минут, но они записали в среднем 74 582 токена cache_creation против 3 886 у тёплых. Настройка subagentPromptCacheTtl и переменная CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL принимают 5m или 1h и требуют Claude Code v2.1.242 или новее. s4
Независимый прогон показал то же разделение: каждый запрос субагента писался в ephemeral_5m_input_tokens, а родитель использовал ephemeral_1h_input_tokens, и один агент перезаписал все 20 971 токен своего префикса на запросе, пришедшем после пятиминутного окна. s6
Аналог в основной сессии: долгий перерыв. Запросы, пришедшие меньше чем через 5 минут после предыдущего, писали медианно 1 176 токенов cache_creation (n = 18 029). От 5 до 60 минут: 1 327 (n = 414). Свыше 60 минут: 130 332 (n = 79), с медианным промптом 175 523 токена и p90 674 348. Документация подтверждает, что при перерасходе тоже основной диалог переходит на пятиминутный уровень. s3
Старт сессии это фиксированная цена: первый запрос основной сессии нёс медианно 55 989 токенов (p90 72 000), с разбросом по проектам от 15 764 до 105 020 в зависимости от размера CLAUDE.md и памяти. Более раннее публичное измерение дало нижнюю границу около 29k в пустом каталоге, 30,4k с 3 MCP-серверами и 38,8k в реальном репозитории. s9
Effort это рычаг, который продвигает документация и который логи не подтверждают. В основных сессиях запросы на high выдавали в среднем 778 токенов вывода против 837 на medium; субагенты на high выдавали 323 против 642. Сравнение смешано (разные задачи, модели, проекты), так что это повод для скепсиса, а не доказательство. Рекомендации самой команды Claude Code подают effort как место, куда тратить рассуждение, а не как регулятор бюджета. s10
Два популярных совета оказались малыми. Подсказки промпта стоят дополнительных запросов, а широко цитируемое «экономия ~10%» это потолок, а не типичный результат; настройка: promptSuggestionEnabled: false или CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Фильтрация вывода shell за двадцать дней сократила вывод с 66,7 млн токенов до 24,1 млн, но эти 66,7 млн составляли 7,4% новых токенов, потреблённых за то же окно. s11
Измерения
Стоимость запуска субагента, промпт первого запроса в токенах, по моделям:
| Модель | n | min | median | p90 | max |
|---|---|---|---|---|---|
| All | 2 631 | 5 295 | 47 117 | 52 681 | 126 769 |
| claude-opus-5 | 1 262 | 36 864 | 43 905 | 48 032 | 50 398 |
| claude-sonnet-5 | 633 | 5 916 | 52 409 | 53 961 | 126 769 |
| claude-opus-5-5 | 426 | 39 408 | 47 189 | 48 362 | 48 883 |
| claude-sonnet-5-5 | 165 | 44 471 | 47 348 | 50 197 | 50 863 |
| claude-fable-5-1 | 102 | 36 551 | 42 593 | 44 286 | 47 385 |
| claude-haiku-4-5 | 42 | 5 295 | 29 636 | 36 714 | 79 190 |
Перезапись кэша при возобновлении, основные сессии, по паузе перед запросом:
| Пауза | n | cache_creation median | mean | cache_read median | prompt median |
|---|---|---|---|---|---|
| < 5 min | 18 029 | 1 176 | 2 391 | 184 169 | 186 412 |
| 5 to 60 min | 414 | 1 327 | 5 575 | 221 857 | 225 168 |
| > 60 min | 79 | 130 332 | 241 499 | 25 264 | 175 523 |
Протокол: читать каждую основную сессию ~/.claude/projects/*/<uuid>.jsonl и каждый запуск */<uuid>/subagents/agent-*.jsonl, запросы с 2026-09-01. Дедуплицировать строки assistant по (message.id, requestId) и оставлять одну запись usage на запрос. Всего токенов = input + output + cache_read + cache_creation; размер промпта = input + cache_read + cache_creation. Пауза = время от последней строки лога предыдущего запроса до первой строки этого, внутри одной сессии или запуска. Взвешенная стоимость использует относительные веса: input 1, запись кэша 5m 1,25, запись кэша 1h 2, чтение кэша 0,1, output 5; эти веса являются допущением, а не опубликованный тариф.
Сделайте в понедельник
- Запустите
/usageна своём плане и прочитайте разбивку по skill, субагентам, плагинам и MCP, а также флаги поведения, поднятые при 10% и более недавнего использования. - Составьте список определений своих субагентов и добавьте frontmatter
model: haikuилиmodel: sonnetкаждому, кто только ищет, проверяет или резюмирует. - Если нужна одна модель на всех субагентах независимо от frontmatter, задайте
CLAUDE_CODE_SUBAGENT_MODELиCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Проверьте, что версия Claude Code 2.1.242 или новее, затем для каждого процесса решите, окупается ли
subagentPromptCacheTtl: "1h": он помогает субагентам, простаивающим между вызовами инструментов, но не коротким. - Перед перерывом дольше часа закончите задачу в текущей сессии и напишите файл передачи; вернувшись, откройте новую сессию вместо возобновления промпта в 175k токенов.
- Напишите скрипт только для чтения по своим логам с дедупликацией по (message.id, requestId) и сравните долю основной сессии и субагентов, прежде чем менять что-то ещё.
- Задайте
promptSuggestionEnabled: false, если никогда не пользуетесь подсказками, и считайте экономию в лучшем случае несколькими процентами.
Читать дальше
- Max 5x против Max 20x: соотношение ёмкости, которое пользователи измерили после снижения, это вопрос выбора плана, оставшийся за рамками видео. s7
- Полная цепочка приоритетов для TTL кэша (force-переменная, переменная bucket, настройка bucket,
experimental.cacheTtlсубагента) и что меняется при перерасходе. s4 - Почему смена effort в середине сессии может заставить прочитать всю историю без попаданий в кэш на большинстве моделей, и какие модели исключены. s3
- Как читать поля
usageи уровни кэша в собственных логах сессий, и подход ccboard к дневному бюджету. s11 - Три файла субагентов с тремя моделями и что каждый запуск реально записал в кэш, с собственными поправками автора. s8
- Отложенные определения MCP-инструментов и
ENABLE_TOOL_SEARCH=auto:Nдля управления тем, когда схемы инструментов попадают в контекст. s3
Источники
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Зачем читать: точные даты, планы и охват промо на 50% в формулировке Anthropic.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Зачем читать: рост на 25% и снижение на 17% рядом, с цитатой из объявления.
- Manage costs effectively, Claude Code docs. Зачем читать: разбивка
/usage, наследование модели субагентами, правила кэша для effort и MCP. - How Claude Code uses prompt caching, Claude Code docs. Зачем читать: единственное авторитетное описание уровней 5m и 1h и настроек TTL.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Зачем читать: ветка, где всплыл 5-минутный кэш субагентов, с настройкой, которая его переключает.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Зачем читать: сравнение ёмкости двух уровней Max глазами пользователей после снижения.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Зачем читать: воспроизводимый эксперимент по стоимости запуска с сырыми полями usage и честными поправками.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Зачем читать: замер стартовых накладных расходов в пустом каталоге, с MCP-серверами и в реальном репозитории.
- Using Claude Code: Spending your effort, X, Claude Code team. Зачем читать: как команда думает об уровнях effort; в нём нет чисел по токенам, в этом и смысл.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Зачем читать: двадцатидневное исследование логов, ставящее фильтрацию вывода shell в пропорцию к общему потреблению.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Зачем читать: исходное утверждение и ветка, сужающая 10% до потолка.
FAQ
Это снижение на 17% или рост на 25%?
И то и другое, от разных баз. Относительно доакционной базы 100 постоянный уровень 125 это рост на 25%. Относительно промо-уровня 150, который был у пользователей с 13 мая по 13 сентября 2026 года, это снижение на 17%.
Стоит ли везде ставить subagentPromptCacheTtl в 1h?
Только если ваши субагенты простаивают больше пяти минут между запросами. В логах такой случай составил 0,2% последующих запросов, так что сплошной уровень 1h в основном переплачивает за запись впустую. Сначала измерьте собственное распределение пауз.
Экономит ли токены снижение effort?
В этих логах заметно нет: запросы основной сессии на high выдавали в среднем 778 токенов вывода против 837 на medium. Данные смешаны, так что честный ответ: effort это ручка качества, экономию которой нужно мерить на своих задачах.
Почему мой первый промпт после обеда стоит так дорого?
Основная сессия пишет 1-часовой кэш. После паузы дольше 60 минут следующий запрос перезаписывает префикс: в логах медианно 130 332 токена cache_creation против 1 176 у тёплого запроса. Заканчивайте задачи перед долгими перерывами и начинайте заново после них.
AIDive