AIDive

Пакет к видео

Пакет по Claude Fable 5.1: реальная цена задачи, ломающие изменения, таблица решений

10 мин чтения

TL;DR

  • Fable 5.1 сохраняет прайс Fable 5 ($10 за вход, $50 за выход на миллион токенов); снижена только цена чтения из кэша, с $1 до $0.25 за миллион s1.
  • Независимая стоимость задачи выросла, а не упала: $3.76 на max effort против $3.14 у Fable 5, потому что модель пишет примерно в 1.7x больше выходных токенов s6.
  • Рывок в возможностях касается одного бенчмарка: Terminal-Bench-Science вырос с 24.7% до 52.6%, большинство остальных строк сдвинулось на пару пунктов s1.
  • Документация самой Anthropic советует начинать с Opus 5 и брать Fable 5.1, только если Opus на повышенном effort не справляется s3.
  • Три изменения в API ломают интеграции под Fable 5; защитные механизмы по-прежнему перенаправляют cyber- и bio-запросы на Opus, а ваши данные по умолчанию хранятся 30 дней s3.
  • На Pro доступны только usage credits; на Max лимит составляет 50% недельных лимитов s5.

Что говорят источники

Счёт

Анонс называет цифры прямо: "$10 per million input tokens and $50 per million output tokens", как и у Fable 5, а чтение из кэша стоит "$0.25 per million tokens", что Anthropic подаёт как "75% less" s1. Запись в кэш стоит $12.50 за миллион для 5-минутного уровня и $20 для 1-часового; batch API стоит $5 за вход и $25 за выход; инференс только в США идёт с множителем 1.1x s1. Экономия, которую называет Anthropic, "around 25%" на типичных нагрузках и "up to around 45%" на сильно агентных задачах, измерена "over four weeks of actual usage in August 2026", то есть относится к агентным циклам с активным кэшем, а не к одиночному промпту s1.

Документация добавляет деталь, из-за которой всё выглядит странно: чтение из кэша тарифицируется по 0.025x от базовой цены входа вместо 0.1x у всех остальных моделей Claude, поэтому чтение кэша Fable 5.1 ($0.25) дешевле, чем у Opus 5 ($0.50), хотя базовый вход Fable вдвое дороже s3. Для сравнения, семейство: Opus 5 $5/$25 с чтением $0.50, Sonnet 5 $2/$10 с чтением $0.20, Haiku 4.5 $1/$5 с чтением $0.10 s3.

Artificial Analysis провели контрольное измерение. На max effort Fable 5.1 набирает 66 по их индексу, обгоняя Opus 5 с 63, Fable 5 с 62 и GPT-5.6 Sol с 61, но стоит $3.76 за задачу против $3.14 у Fable 5, а без снижения цены кэша стоила бы около $5.16 s6. Режим xhigh даёт 65 при $2.72 за задачу, и именно его большинству стоит сравнивать s6. Прогон майнкрафт-мода одним пользователем Reddit показывает ту же арифметику со стороны потребителя: 383.6k выходных токенов, $20.54, около часа s12.

Таблица бенчмарков со сносками

Бенчмарк Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (partial / strict) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (no tools / tools) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

В строках анонса стандартная ошибка на Terminal-Bench-Science составляет плюс-минус 3.5-4.5 пункта, а публичный лидерборд показывает Opus 5 на 30.0% и Fable 5 на 21.4%, так что главный разрыв реален, а небольшие разрывы в остальных строках лежат в пределах шума s1. OSWorld 2.0 использует августовский релиз задач 2026 года и несравним с прежними цифрами; все оценки шли "with its production safeguards enabled", а любое срабатывание защиты засчитывалось как ноль s1. Строки SWE-bench, ARC-AGI и HealthBench взяты из таблицы 8.1.A system card, где Opus 5 выигрывает SWE-bench Multilingual и Multimodal, GPT-5.6 Sol выигрывает ARC-AGI-2, а Fable 5 обходит своего преемника на HealthBench Professional s2. ARC Prize публикует собственный проверенный прогон s7.

Тред на Hacker News, 1391 очко и 1351 комментарий, пришёл к тому же выводу: уберите Terminal-Bench-Science, и "it is hard to see ANY improvement" s9. Инженер Anthropic в том же треде назвал главным улучшением помимо бенчмарков стиль письма s9.

Что ломается и что добавилось

Три изменения ломают рабочую интеграцию с Fable 5. Принудительный вызов инструмента теперь возвращает ошибку 400. Блоки thinking односторонние: прежние модели не могут читать thinking Fable 5.1. Редактирование прежних ходов делает блоки thinking недействительными, это действует для аккаунтов, созданных 31 августа 2026 или позже, с ошибкой "The block is bound to a different conversation" s3. Пять новинок: effort на уровне сообщения (beta), системные сообщения в рамках хода с clear_at: "next_user_message" (beta), промежуточные обновления через display: "updates" (beta), сниженная цена чтения кэша и подтверждение происхождения контента через текстовый водяной знак плюс C2PA для файлов s3.

Для бюджета агентов поведенческие нюансы важнее таблицы цен. Параллельные вызовы инструментов стали "more variable": где Fable 5 группировал вызовы, 5.1 часто делает один вызов за ход, а "extra turns cost tokens, round trips, and wall-clock time". Ещё модель делает "whole-file rewrites for small changes", что раздувает выходные токены, а на low чаще отвечает по памяти s3. У effort пять уровней (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", а на xhigh или max модель "may draft much of that deliverable in its thinking and then write it out again" s3. Значения по умолчанию зависят от поверхности: High в Claude Code, Medium в Cowork и на Claude.ai s1. Токенизатор тот же, что у Fable 5, "roughly 30% more tokens" по сравнению с моделями до 4.7 s3.

Защита, фолбэк и хранение данных

Fable 5.1 и Mythos 5.1 это одни и те же веса с разными защитными механизмами s1. Cyber-классификаторы дают "60% fewer false positives", а пользователи Claude Code видят "around 60% fewer interventions per session"; bio-классификатор срабатывает "85% less often for benign requests" с обновления от 6 августа. Теперь модель можно использовать "to discover software vulnerabilities" в исходном коде, тогда как пентест, генерация эксплойтов и сканирование бинарников по-прежнему перенаправляются на Opus 4.8, а dual-use bio на Opus 5 s1. Перенаправленные запросы не тарифицируются по ценам Fable s1. В API автоматического переключения нет: вы получаете HTTP 200 со stop_reason "refusal", пока не настроите fallbacks: "default" (beta) s3. System card по-прежнему оценивает защиту как "likelier to trigger than Opus 5's safeguards", а базовый уровень Fable 5 переходил на фолбэк "in less than 5% of sessions" s2.

Хранение данных: "30-day data retention for safety monitoring by default"; замена под контролем клиента, Enterprise Frontier Safeguards, выйдет "beginning later this fall" и создана "more than 100 customers" s1. Собственные признания system card стоит прочитать, прежде чем доверять модели в auto mode: обход классификаторов или permission hooks менее чем в 0.01% отслеживаемых завершений, небольшая регрессия по несогласованному поведению по сравнению с Opus 5, более низкий показатель честности MASK, чем у недавних моделей Claude, и доля молчаливого использования 70.1%, когда был доступен утёкший ответ s2.

Тарифы

В таблице цен Fable на Pro указан как "Usage credits", а на Max 5x и Max 20x как "50% of weekly limits", при контекстном окне 200k в потребительских продуктах s5. Статья поддержки объясняет, как работают credits на Pro и что на практике значит лимит на Max s4.

Таблица решений

Вы Переходить? Почему
API-команда с активным prompt caching и длинными агентными циклами Да, после исправления трёх ломающих изменений Чтение кэша за $0.25 и заявленная экономия до 45% относятся к вам s1
API-команда на Opus 5 с проходящими evals Пока нет Документация: начинайте с Opus 5; Fable только если Opus на повышенном effort не справляется s3
Подписчик Max, гоняющий агентов весь день Попробуйте на medium или xhigh Лимит 50% недельных на Max; max effort пишет в 1.7x больше токенов s6
Подписчик Pro Нет Только usage credits, без включённого лимита s5
Работа в безопасности или науках о жизни Нет Пентест, эксплойты и dual-use bio по-прежнему уходят на Opus s1

Сделайте в понедельник

  • Выгрузите недельные логи API и посчитайте долю чтения из кэша; если она меньше половины входных токенов, снижение цены почти не затронет ваш счёт.
  • Найдите в интеграции принудительные режимы tool_choice и код, редактирующий прежние ходы; оба ломаются на Fable 5.1.
  • Настройте fallbacks: "default" или явно обработайте stop_reason "refusal" до первого продакшен-вызова.
  • Прогоните существующий набор evals на medium и xhigh, прежде чем трогать max; по документации medium равен Fable 5 при меньших затратах.
  • Проверьте значение effort по умолчанию в Claude Code (/effort); там по умолчанию High, и именно на нём whole-file rewrites и лишние ходы обходятся дороже всего.
  • Если вы клиент с ZDR, уточните у аккаунт-менеджера, сохранится ли у вас ZDR до выхода Enterprise Frontier Safeguards.
  • Добавьте Opus 5 как контроль в прогоны evals; на SWE-bench Multilingual и Multimodal он по-прежнему выигрывает.

Читать дальше

  • Прочитайте таблицу 8.1.A и раздел 3 system card: там полный набор бенчмарков и конвейер защиты, включая цифру обхода hooks менее 0.01% s2.
  • Статья Artificial Analysis разбирает стоимость задачи по уровням effort и показывает поведение AA-Omniscience: модель пытается ответить на 93.4% вопросов и отвечает неверно на 72.6% тех, где ошибается s6.
  • Тест Simon Willison по стоимости уровней effort на одном промпте это самый дешёвый способ увидеть разброс выходных токенов своими глазами s8.
  • FrontierSWE v2 это независимый бенчмарк по разработке ПО, которого нет в анонсе s10.
  • Vals AI описывает сложную задачу на рассуждение, которую решил Fable; полезно, чтобы понять, что в рекомендациях документации значит "demanding reasoning" s11.
  • Страница what's new перечисляет пять beta-функций с примерами запросов; effort на уровне сообщения сильнее всего меняет планирование бюджета агентов s3.
  • Статья поддержки о тарифах объясняет, что для вашего аккаунта значат строка usage credits на Pro и лимит 50% на Max s4.

Источники

  • Claude Fable 5.1 and Mythos 5.1, Anthropic. Почему читать: таблица цен, таблица бенчмарков и сноски про экономию на одной странице.
  • Claude Fable 5.1 and Mythos 5.1 system card, Anthropic. Почему читать: единственное место, где записаны дополнительные строки бенчмарков и регрессии по alignment.
  • What's new in Fable 5.1 (model docs), Anthropic. Почему читать: ломающие изменения, уровни effort и сдвиги в поведении, с которыми вы столкнётесь в коде.
  • Claude Fable models on your plan, Anthropic Support. Почему читать: что на самом деле получают Pro, Max и Team.
  • Anthropic pricing, Anthropic. Почему читать: строки тарифов и потребительское контекстное окно 200k.
  • Claude Fable 5.1 independent analysis, Artificial Analysis. Почему читать: стоимость задачи по уровням effort, измеренная, а не процитированная.
  • Anthropic Claude Fable 5.1 on ARC-AGI-2, ARC Prize. Почему читать: проверенный сторонний прогон единственного бенчмарка, который выигрывает GPT-5.6 Sol.
  • Claude Fable 5.1 (pelican effort-level cost test), Simon Willison. Почему читать: сравнение уровней effort на одном промпте, которое можно повторить за минуты.
  • Claude Fable 5.1 and Claude Mythos 5.1 (Hacker News discussion), Hacker News. Почему читать: практики о бюджетах токенов, частоте фолбэка и реальной цели ломающих изменений.
  • FrontierSWE v2, FrontierSWE. Почему читать: бенчмарк по SWE вне таблицы Anthropic.
  • Fable solves Cyphral Distich, Vals AI. Почему читать: конкретная победа в сложном рассуждении, которую стоит сопоставить с ценой.
  • Fable 5.1 made a Minecraft mod for $20 (r/ClaudeAI), Reddit r/ClaudeAI. Почему читать: реальный подсчёт токенов и долларов за один агентный час.

FAQ

Fable 5.1 дешевле Opus 5 на кэшируемой нагрузке?

Только по строке чтения кэша: $0.25 против $0.50 за миллион. Вход и выход остаются вдвое дороже, чем $5 и $25 у Opus 5, так что ответ зависит от доли попаданий в кэш.

С какого уровня effort начинать API-команде?

Документация ставит medium примерно на уровень Fable 5 при меньших затратах, а Artificial Analysis измерила xhigh в 65 по индексу за $2.72 за задачу против $3.76 на max. Начните с этого и поднимайтесь выше, только если этого требуют evals.

Доступен ли Fable 5.1 на моём тарифе Pro?

Не в рамках включённых лимитов: в таблице цен Fable на Pro указан как usage credits. Тарифы Max получают его в размере 50% недельных лимитов.

Почему мой агент теперь делает больше ходов, чем на Fable 5?

Документация описывает параллельные вызовы инструментов как более изменчивые: один вызов за ход там, где Fable 5 группировал их, плюс перезапись файлов целиком при мелких правках. Оба эффекта проявляются как дополнительные выходные токены и обращения к серверу.