AIDive

Пакет к видео

Снижение недельного лимита Claude Code: рычаги, таблицы кэша и чек-лист на понедельник

10 мин чтения

Коротко

  • Недельный лимит Claude Code вырос с базы 100 до промо-уровня 150, а 14 сентября 2026 года закрепился на постоянных 125. Относительно промо это снижение на 17%, относительно старой базы рост на 25%. Верны обе формулировки сразу.
  • За месяц локальных логов субагенты съели 48,1% всех токенов и 55,3% взвешенной стоимости. Главный рычаг: запускать меньше субагентов и закреплять маленькую модель за теми, что остались.
  • Субагенты пишут 5-минутный кэш, основная сессия пишет 1-часовой. Запрос после холодной паузы перезаписывает примерно в 19 раз больше кэша, чем тёплый.
  • Перерыв дольше 60 минут в основной сессии стоит медианно 130 332 токена перезаписи кэша на следующем запросе, против 1 176 при паузе до 5 минут.
  • Снижение effort не уменьшило вывод на запрос в этих логах (в основных сессиях в среднем 778 токенов на high против 837 на medium), так что это компромисс по качеству, а не бесплатная экономия.
  • Отключение подсказок промпта и фильтрация вывода shell дают реальный, но небольшой эффект. Считайте их в последнюю очередь.

Что говорят измерения

Арифметика заголовка: база 100, промо-уровень 150, постоянный уровень 125. 125 / 150 = 0,8333, значит снижение 16,67%, округляется до 17%. Неверно вычитать приросты (с 50% до 25%) и называть это снижением на 25%. s2

Промо шло с 13 мая 2026 по 13 сентября 2026, подняло недельные лимиты на 50% только в Claude Code и не тронуло 5-часовые лимиты. Оно действовало для планов Pro, Max, Team и Enterprise с местами. s1

Измерения ниже взяты из логов Claude Code на одной машине: 455 основных сессий, 2 631 запуск субагентов, 63 398 запросов после дедупликации, с 2026-09-03 по 2026-10-03. Первая находка касается самого подсчёта: каждый запрос встречается в среднем на 1,96 строки лога, поэтому суммирование всех строк завышает общее число токенов на 99,3%. Любой скрипт, читающий эти логи, должен сначала дедуплицировать по (message.id, requestId). s11

Субагенты: самая крупная статья. После дедупликации на них приходится 48,1% всех токенов, 63,9% выходных токенов и 55,3% взвешенной стоимости. Первый запрос запуска субагента несёт медианный промпт в 47 117 токенов ещё до начала работы; p90 равен 52 681, максимум 126 769. Агенты с урезанным набором инструментов стартуют гораздо ниже (минимум 5 295). s8

Выбор модели усиливает эффект. Субагенты наследуют модель основного диалога, пока это не изменит frontmatter model, параметр model при вызове или CLAUDE_CODE_SUBAGENT_MODEL, а начиная с v2.1.251 одна только переменная окружения больше не перекрывает frontmatter: нужен CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. В логах один claude-opus-5 дал 31,5% всех токенов и 35,8% взвешенной стоимости, причём 63,2% из этого потрачено внутри субагентов. s3

Уровень кэша определяется тем, где выполняется запрос. В этих данных 100,0% записей кэша субагентов были 5-минутными, а 100,0% записей основной сессии 1-часовыми; смешанных запросов не было. Внутри запусков субагентов лишь 95 из 41 790 последующих запросов (0,2%) пришли после паузы дольше 5 минут, но они записали в среднем 74 582 токена cache_creation против 3 886 у тёплых. Настройка subagentPromptCacheTtl и переменная CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL принимают 5m или 1h и требуют Claude Code v2.1.242 или новее. s4

Независимый прогон показал то же разделение: каждый запрос субагента писался в ephemeral_5m_input_tokens, а родитель использовал ephemeral_1h_input_tokens, и один агент перезаписал все 20 971 токен своего префикса на запросе, пришедшем после пятиминутного окна. s6

Аналог в основной сессии: долгий перерыв. Запросы, пришедшие меньше чем через 5 минут после предыдущего, писали медианно 1 176 токенов cache_creation (n = 18 029). От 5 до 60 минут: 1 327 (n = 414). Свыше 60 минут: 130 332 (n = 79), с медианным промптом 175 523 токена и p90 674 348. Документация подтверждает, что при перерасходе тоже основной диалог переходит на пятиминутный уровень. s3

Старт сессии это фиксированная цена: первый запрос основной сессии нёс медианно 55 989 токенов (p90 72 000), с разбросом по проектам от 15 764 до 105 020 в зависимости от размера CLAUDE.md и памяти. Более раннее публичное измерение дало нижнюю границу около 29k в пустом каталоге, 30,4k с 3 MCP-серверами и 38,8k в реальном репозитории. s9

Effort это рычаг, который продвигает документация и который логи не подтверждают. В основных сессиях запросы на high выдавали в среднем 778 токенов вывода против 837 на medium; субагенты на high выдавали 323 против 642. Сравнение смешано (разные задачи, модели, проекты), так что это повод для скепсиса, а не доказательство. Рекомендации самой команды Claude Code подают effort как место, куда тратить рассуждение, а не как регулятор бюджета. s10

Два популярных совета оказались малыми. Подсказки промпта стоят дополнительных запросов, а широко цитируемое «экономия ~10%» это потолок, а не типичный результат; настройка: promptSuggestionEnabled: false или CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Фильтрация вывода shell за двадцать дней сократила вывод с 66,7 млн токенов до 24,1 млн, но эти 66,7 млн составляли 7,4% новых токенов, потреблённых за то же окно. s11

Измерения

Стоимость запуска субагента, промпт первого запроса в токенах, по моделям:

Модель n min median p90 max
All 2 631 5 295 47 117 52 681 126 769
claude-opus-5 1 262 36 864 43 905 48 032 50 398
claude-sonnet-5 633 5 916 52 409 53 961 126 769
claude-opus-5-5 426 39 408 47 189 48 362 48 883
claude-sonnet-5-5 165 44 471 47 348 50 197 50 863
claude-fable-5-1 102 36 551 42 593 44 286 47 385
claude-haiku-4-5 42 5 295 29 636 36 714 79 190

Перезапись кэша при возобновлении, основные сессии, по паузе перед запросом:

Пауза n cache_creation median mean cache_read median prompt median
< 5 min 18 029 1 176 2 391 184 169 186 412
5 to 60 min 414 1 327 5 575 221 857 225 168
> 60 min 79 130 332 241 499 25 264 175 523

Протокол: читать каждую основную сессию ~/.claude/projects/*/<uuid>.jsonl и каждый запуск */<uuid>/subagents/agent-*.jsonl, запросы с 2026-09-01. Дедуплицировать строки assistant по (message.id, requestId) и оставлять одну запись usage на запрос. Всего токенов = input + output + cache_read + cache_creation; размер промпта = input + cache_read + cache_creation. Пауза = время от последней строки лога предыдущего запроса до первой строки этого, внутри одной сессии или запуска. Взвешенная стоимость использует относительные веса: input 1, запись кэша 5m 1,25, запись кэша 1h 2, чтение кэша 0,1, output 5; эти веса являются допущением, а не опубликованный тариф.

Сделайте в понедельник

  • Запустите /usage на своём плане и прочитайте разбивку по skill, субагентам, плагинам и MCP, а также флаги поведения, поднятые при 10% и более недавнего использования.
  • Составьте список определений своих субагентов и добавьте frontmatter model: haiku или model: sonnet каждому, кто только ищет, проверяет или резюмирует.
  • Если нужна одна модель на всех субагентах независимо от frontmatter, задайте CLAUDE_CODE_SUBAGENT_MODEL и CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Проверьте, что версия Claude Code 2.1.242 или новее, затем для каждого процесса решите, окупается ли subagentPromptCacheTtl: "1h": он помогает субагентам, простаивающим между вызовами инструментов, но не коротким.
  • Перед перерывом дольше часа закончите задачу в текущей сессии и напишите файл передачи; вернувшись, откройте новую сессию вместо возобновления промпта в 175k токенов.
  • Напишите скрипт только для чтения по своим логам с дедупликацией по (message.id, requestId) и сравните долю основной сессии и субагентов, прежде чем менять что-то ещё.
  • Задайте promptSuggestionEnabled: false, если никогда не пользуетесь подсказками, и считайте экономию в лучшем случае несколькими процентами.

Читать дальше

  • Max 5x против Max 20x: соотношение ёмкости, которое пользователи измерили после снижения, это вопрос выбора плана, оставшийся за рамками видео. s7
  • Полная цепочка приоритетов для TTL кэша (force-переменная, переменная bucket, настройка bucket, experimental.cacheTtl субагента) и что меняется при перерасходе. s4
  • Почему смена effort в середине сессии может заставить прочитать всю историю без попаданий в кэш на большинстве моделей, и какие модели исключены. s3
  • Как читать поля usage и уровни кэша в собственных логах сессий, и подход ccboard к дневному бюджету. s11
  • Три файла субагентов с тремя моделями и что каждый запуск реально записал в кэш, с собственными поправками автора. s8
  • Отложенные определения MCP-инструментов и ENABLE_TOOL_SEARCH=auto:N для управления тем, когда схемы инструментов попадают в контекст. s3

Источники

FAQ

Это снижение на 17% или рост на 25%?

И то и другое, от разных баз. Относительно доакционной базы 100 постоянный уровень 125 это рост на 25%. Относительно промо-уровня 150, который был у пользователей с 13 мая по 13 сентября 2026 года, это снижение на 17%.

Стоит ли везде ставить subagentPromptCacheTtl в 1h?

Только если ваши субагенты простаивают больше пяти минут между запросами. В логах такой случай составил 0,2% последующих запросов, так что сплошной уровень 1h в основном переплачивает за запись впустую. Сначала измерьте собственное распределение пауз.

Экономит ли токены снижение effort?

В этих логах заметно нет: запросы основной сессии на high выдавали в среднем 778 токенов вывода против 837 на medium. Данные смешаны, так что честный ответ: effort это ручка качества, экономию которой нужно мерить на своих задачах.

Почему мой первый промпт после обеда стоит так дорого?

Основная сессия пишет 1-часовой кэш. После паузы дольше 60 минут следующий запрос перезаписывает префикс: в логах медианно 130 332 токена cache_creation против 1 176 у тёплого запроса. Заканчивайте задачи перед долгими перерывами и начинайте заново после них.