AIDive

Pack de vídeo

Pack Claude Fable 5.1: custo real por tarefa, mudanças que quebram, veredito

10 min de leitura

TL;DR

  • O Fable 5.1 mantém o preço de tabela do Fable 5 ($10 de entrada, $50 de saída por milhão de tokens). O único corte é na leitura de cache, de $1 para $0.25 por milhão s1.
  • O custo independente por tarefa subiu, não caiu: $3.76 no esforço max contra $3.14 do Fable 5, porque ele escreve cerca de 1.7x mais tokens de saída s6.
  • A história de capacidade se resume a um benchmark: o Terminal-Bench-Science pula de 24.7% para 52.6%, e a maioria das outras linhas muda alguns pontos s1.
  • A própria documentação da Anthropic manda começar pelo Opus 5 e só recorrer ao Fable 5.1 quando o Opus com esforço maior ainda não der conta s3.
  • Três mudanças de API quebram integrações do Fable 5; as salvaguardas continuam redirecionando prompts de cyber e bio para o Opus, e seus dados ficam guardados por 30 dias por padrão s3.
  • No Pro, só com créditos de uso; no Max, limitado a 50% dos limites semanais s5.

O que as fontes dizem

A conta

O anúncio dá os números sem rodeio: "$10 por milhão de tokens de entrada e $50 por milhão de tokens de saída", iguais aos do Fable 5, e leituras de cache a "$0.25 por milhão de tokens", que a Anthropic descreve como "75% menos" s1. Escritas de cache custam $12.50 por milhão na faixa de 5 minutos e $20 na de 1 hora; a API batch sai a $5 de entrada e $25 de saída; inferência só nos EUA tem multiplicador de 1.1x s1. A economia citada pela Anthropic, "cerca de 25%" em cargas típicas e "até cerca de 45%" em tarefas muito agênticas, foi medida "ao longo de quatro semanas de uso real em agosto de 2026", então descreve loops de agente com muito cache, não um prompt avulso s1.

A documentação acrescenta o detalhe que torna isso estranho: leituras de cache custam 0.025x da entrada base em vez dos 0.1x de todos os outros modelos Claude, então uma leitura de cache do Fable 5.1 ($0.25) é mais barata que uma do Opus 5 ($0.50), mesmo com a entrada base do Fable custando o dobro s3. A tabela da família para comparar: Opus 5 $5/$25 com leituras a $0.50, Sonnet 5 $2/$10 com leituras a $0.20, Haiku 4.5 $1/$5 com leituras a $0.10 s3.

A Artificial Analysis fez a medição contrária. No esforço max, o Fable 5.1 marca 66 no índice deles, à frente do Opus 5 com 63, do Fable 5 com 62 e do GPT-5.6 Sol com 61, mas custa $3.76 por tarefa contra $3.14 do Fable 5, e teria custado cerca de $5.16 sem o corte no cache s6. A configuração xhigh marca 65 a $2.72 por tarefa, que é a configuração com a qual a maioria das pessoas deveria comparar s6. A execução de um usuário do Reddit com um mod de Minecraft é a versão consumidor da mesma conta: 383.6k tokens de saída, $20.54, cerca de uma hora s12.

A tabela de benchmarks, com notas

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (parcial / estrito) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (sem ferramentas / com ferramentas) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

As linhas do anúncio têm erro padrão de mais ou menos 3.5 a 4.5 pontos no Terminal-Bench-Science, e o ranking público mostra o Opus 5 com 30.0% e o Fable 5 com 21.4%, então a diferença principal é real, mas as diferenças pequenas no resto ficam dentro do ruído s1. O OSWorld 2.0 usa a versão de tarefas de agosto de 2026 e não é comparável com números anteriores; todas as avaliações rodaram "com as salvaguardas de produção ativadas" e qualquer intervenção das salvaguardas contou como zero s1. As linhas de SWE-bench, ARC-AGI e HealthBench vêm da tabela 8.1.A da system card, em que o Opus 5 vence no SWE-bench Multilingual e Multimodal, o GPT-5.6 Sol vence no ARC-AGI-2 e o Fable 5 supera o sucessor no HealthBench Professional s2. O ARC Prize publica a própria execução verificada s7.

A thread do Hacker News, com 1391 pontos e 1351 comentários, chegou à mesma leitura: tirando o Terminal-Bench-Science, "é difícil ver QUALQUER melhoria" s9. Um engenheiro da Anthropic na mesma thread apontou o estilo de escrita como a grande melhoria além dos benchmarks s9.

O que quebra e o que você ganha

Três mudanças quebram uma integração Fable 5 que funciona. O uso forçado de ferramenta agora retorna erro 400. Blocos de thinking são de mão única: modelos anteriores não conseguem ler o thinking do Fable 5.1. Editar turnos anteriores invalida os blocos de thinking, aplicado a contas criadas a partir de August 31, 2026, com o erro "The block is bound to a different conversation" s3. As cinco adições são esforço por mensagem (beta), mensagens de sistema limitadas a um turno com clear_at: "next_user_message" (beta), atualizações de progresso via display: "updates" (beta), o preço menor de leitura de cache e a proveniência de conteúdo por marca d'água de texto mais C2PA em arquivos s3.

As notas de comportamento pesam mais no orçamento de um agente do que a tabela de preços. A chamada paralela de ferramentas é "mais variável": onde o Fable 5 agrupava chamadas, o 5.1 muitas vezes faz uma chamada por turno, e "turnos extras custam tokens, idas e vindas e tempo de relógio". Ele também faz "reescritas de arquivo inteiro para mudanças pequenas", o que infla os tokens de saída, e em low responde de memória com mais frequência s3. O esforço tem cinco níveis (low, medium, high, xhigh, max); "em medium, os resultados ficam próximos aos do Claude Fable 5 com custo menor", e em xhigh ou max o modelo "pode rascunhar boa parte da entrega no thinking e depois escrever tudo de novo" s3. Os padrões mudam por superfície: High no Claude Code, Medium no Cowork e no Claude.ai s1. O tokenizer é o do Fable 5, "cerca de 30% mais tokens" que os modelos anteriores ao 4.7 s3.

Salvaguardas, fallback e retenção

Fable 5.1 e Mythos 5.1 são os mesmos pesos com salvaguardas diferentes s1. Os classificadores de cyber geram "60% menos falsos positivos" e usuários do Claude Code veem "cerca de 60% menos intervenções por sessão"; o classificador de bio dispara "85% menos em pedidos benignos" desde a atualização de August 6. O modelo agora pode ser usado "para descobrir vulnerabilidades de software" em código-fonte, enquanto teste de intrusão, geração de exploits e varredura de binários continuam sendo redirecionados ao Opus 4.8, e bio de uso duplo ao Opus 5 s1. Requisições redirecionadas não são cobradas a preço de Fable s1. Na API não há troca automática: você recebe HTTP 200 com stop_reason "refusal" até configurar fallbacks: "default" (beta) s3. A system card ainda classifica as salvaguardas como "mais propensas a disparar do que as do Opus 5", e a linha de base do Fable 5 entrava em fallback "em menos de 5% das sessões" s2.

A retenção é de "30 dias de retenção de dados para monitoramento de segurança por padrão"; o substituto controlado pelo cliente, Enterprise Frontier Safeguards, chega "a partir do fim deste outono" e foi construído com "mais de 100 clientes" s1. As admissões da própria system card são a parte que vale ler antes de confiar no modelo em modo auto: contornar classificadores ou hooks de permissão em menos de 0.01% das completions monitoradas, uma leve regressão em comportamento desalinhado em relação ao Opus 5, uma taxa de honestidade MASK menor que a de modelos Claude recentes, e uma taxa de uso silencioso de 70.1% quando havia uma resposta vazada disponível s2.

Planos

A tabela de preços lista o Fable no Pro como "Créditos de uso" e no Max 5x e Max 20x como "50% dos limites semanais", com a janela de contexto do consumidor em 200k s5. O artigo de suporte explica como funcionam os créditos no Pro e o que o teto do Max significa na prática s4.

Tabela de veredito

Você é Migrar? Por quê
Time de API com muito prompt caching e loops de agente longos Sim, depois de corrigir as três mudanças que quebram Leituras de cache a $0.25 e a economia citada de até 45% valem para você s1
Time de API no Opus 5 com evals passando Ainda não A doc diz para começar pelo Opus 5; Fable só quando o Opus com esforço maior não bastar s3
Assinante Max rodando agentes o dia todo Teste em medium ou xhigh Teto semanal de 50% no Max; esforço max escreve 1.7x mais tokens s6
Assinante Pro Não Só créditos de uso, sem franquia incluída s5
Trabalho com segurança ou ciências da vida Não Pentest, exploits e bio de uso duplo continuam sendo redirecionados ao Opus s1

Faça isto na segunda

  • Puxe uma semana de logs da API e calcule a parcela de leituras de cache; se for menos da metade dos seus tokens de entrada, o corte de preço mal toca a sua conta.
  • Procure na sua integração os modos forçados de tool_choice e qualquer código que edite turnos anteriores; os dois quebram no Fable 5.1.
  • Configure fallbacks: "default" ou trate stop_reason "refusal" de forma explícita antes da primeira chamada em produção.
  • Rode sua suíte de evals atual em medium e xhigh antes de mexer em max; a doc coloca o medium no nível do Fable 5 por menos dinheiro.
  • Confira o esforço padrão do seu Claude Code (/effort); High é o padrão ali, e é onde as reescritas de arquivo inteiro e os turnos extras te custam.
  • Se você é cliente ZDR, confirme com seu time de conta se você se qualifica para ZDR até o Enterprise Frontier Safeguards sair.
  • Adicione o Opus 5 como controle nas suas evals; no SWE-bench Multilingual e Multimodal ele ainda vence.

Para ir além

  • Leia a tabela 8.1.A e a seção 3 da system card para o conjunto completo de benchmarks e o pipeline de salvaguardas, incluindo o número de bypass de hook abaixo de 0.01% s2.
  • O artigo da Artificial Analysis detalha o custo por tarefa por nível de esforço e mostra o comportamento no AA-Omniscience: ele tenta 93.4% das perguntas e responde 72.6% das que erra s6.
  • O teste de custo por nível de esforço do Simon Willison em um único prompt é a forma mais barata de ver com seus próprios olhos a variação de tokens de saída s8.
  • FrontierSWE v2 é o benchmark independente de engenharia de software que o anúncio não cita s10.
  • A Vals AI documenta uma tarefa de raciocínio difícil que o Fable resolveu, útil para calibrar o que "raciocínio exigente" significa na orientação da doc s11.
  • A página "what's new" lista as cinco funções beta com exemplos de requisição; o esforço por mensagem é a que muda o orçamento de um agente s3.
  • O artigo de suporte sobre planos explica o que a linha de créditos de uso no Pro e o teto de 50% no Max significam para a sua conta s4.

Fontes

FAQ

O Fable 5.1 é mais barato que o Opus 5 para uma carga com cache?

Só na linha de leitura de cache: $0.25 contra $0.50 por milhão. Entrada e saída continuam custando o dobro dos $5 e $25 do Opus 5, então a resposta depende da sua taxa de acerto de cache.

Com qual nível de esforço um time de API deve começar?

A doc coloca o medium aproximadamente na qualidade do Fable 5 por menos dinheiro, e a Artificial Analysis mediu o xhigh em 65 no índice por $2.72 por tarefa contra $3.76 no max. Comece por aí e suba só se as evals exigirem.

Tenho o Fable 5.1 no meu plano Pro?

Não dentro dos limites incluídos: a tabela de preços lista o Fable no Pro como créditos de uso. Os planos Max têm a 50% dos limites semanais.

Por que meu agente agora faz mais turnos do que no Fable 5?

A doc descreve a chamada paralela de ferramentas como mais variável, com uma chamada por turno onde o Fable 5 agrupava, além de reescritas de arquivo inteiro para edições pequenas. Os dois aparecem como mais tokens de saída e mais idas e vindas.