TL;DR
- Fable 5.1 mantiene el precio de lista de Fable 5 ($10 de entrada, $50 de salida por millón de tokens). El único recorte es en las lecturas de caché, de $1 a $0.25 por millón s1.
- El coste independiente por tarea subió, no bajó: $3.76 con esfuerzo max frente a $3.14 de Fable 5, porque escribe aproximadamente 1.7x más tokens de salida s6.
- La historia de capacidades se reduce a un solo benchmark: Terminal-Bench-Science salta de 24.7% a 52.6%, la mayoría de las demás líneas se mueven unos pocos puntos s1.
- La propia documentación de Anthropic dice que empieces con Opus 5 y recurras a Fable 5.1 solo cuando Opus con más esfuerzo siga sin llegar s3.
- Tres cambios de API rompen las integraciones de Fable 5; las salvaguardas siguen redirigiendo los prompts de ciberseguridad y biología a Opus, y tus datos se guardan 30 días por defecto s3.
- En Pro solo está disponible con créditos de uso; en Max está limitado al 50% de los límites semanales s5.
Lo que dicen las fuentes
La factura
El anuncio da las cifras sin rodeos: "$10 por millón de tokens de entrada y $50 por millón de tokens de salida", sin cambios respecto a Fable 5, y lecturas de caché a "$0.25 por millón de tokens", que Anthropic presenta como "75% menos" s1. Las escrituras de caché cuestan $12.50 por millón en el nivel de 5 minutos y $20 en el de 1 hora; la API batch es $5 de entrada y $25 de salida; la inferencia solo en EE. UU. lleva un multiplicador de 1.1x s1. Los ahorros que cita Anthropic, "alrededor del 25%" en cargas típicas y "hasta alrededor del 45%" en tareas muy agénticas, se midieron "durante cuatro semanas de uso real en agosto de 2026", así que describen bucles de agente con mucho caché, no un prompt suelto s1.
La documentación añade el detalle que lo vuelve raro: las lecturas de caché se cobran a 0.025x la entrada base en lugar del 0.1x de todos los demás modelos Claude, de modo que una lectura de caché de Fable 5.1 ($0.25) sale más barata que una de Opus 5 ($0.50) aunque la entrada base de Fable cuesta el doble s3. La tabla de la familia para comparar: Opus 5 $5/$25 con lecturas a $0.50, Sonnet 5 $2/$10 con lecturas a $0.20, Haiku 4.5 $1/$5 con lecturas a $0.10 s3.
Artificial Analysis hizo la medición contraria. Con esfuerzo max, Fable 5.1 saca 66 en su índice, por delante de Opus 5 con 63, Fable 5 con 62 y GPT-5.6 Sol con 61, pero cuesta $3.76 por tarea frente a $3.14 de Fable 5, y habría costado unos $5.16 sin el recorte de caché s6. El ajuste xhigh saca 65 a $2.72 por tarea, que es el ajuste con el que la mayoría debería comparar s6. La ejecución de un usuario de Reddit con un mod de Minecraft es la versión de consumo de la misma cuenta: 383.6k tokens de salida, $20.54, aproximadamente una hora s12.
La tabla de benchmarks, con notas
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (parcial / estricto) | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | n/a |
| Humanity's Last Exam (sin herramientas / con herramientas) | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | n/a |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| SWE-bench Pro | 81.2 | 80 | 79.2 | 64.6 |
| SWE-bench Multilingual | 89.1 | 86.6 | 89.5 | n/a |
| SWE-bench Multimodal | 54.7 | 54.1 | 59.4 | n/a |
| ARC-AGI-2 | 90.0 | 89.2 | 90.42 | 92.5 |
| HealthBench Professional | 62.1% | 63.3% | 59.8% | n/a |
Las filas del anuncio llevan un error estándar de más o menos 3.5 a 4.5 puntos en Terminal-Bench-Science, y el ranking público muestra a Opus 5 con 30.0% y a Fable 5 con 21.4%, así que la brecha principal es real pero las diferencias pequeñas del resto caen dentro del ruido s1. OSWorld 2.0 usa la versión de tareas de agosto de 2026 y no es comparable con cifras anteriores; todas las evaluaciones se ejecutaron "con sus salvaguardas de producción activadas" y cualquier intervención de las salvaguardas puntuaba cero s1. Las filas de SWE-bench, ARC-AGI y HealthBench salen de la tabla 8.1.A de la system card, donde Opus 5 gana en SWE-bench Multilingual y Multimodal, GPT-5.6 Sol gana en ARC-AGI-2 y Fable 5 supera a su sucesor en HealthBench Professional s2. ARC Prize publica su propia ejecución verificada s7.
El hilo de Hacker News, con 1391 puntos y 1351 comentarios, llegó a la misma lectura: sin Terminal-Bench-Science, "es difícil ver CUALQUIER mejora" s9. Un ingeniero de Anthropic en el mismo hilo señaló el estilo de escritura como la gran mejora más allá de los benchmarks s9.
Qué se rompe y qué ganas
Tres cambios rompen una integración funcional de Fable 5. El uso de herramientas forzado ahora devuelve un error 400. Los bloques de thinking son de un solo sentido: los modelos anteriores no pueden leer el thinking de Fable 5.1. Editar turnos anteriores invalida los bloques de thinking, aplicado a cuentas creadas a partir del August 31, 2026, con el error "The block is bound to a different conversation" s3. Las cinco novedades son el esfuerzo por mensaje (beta), los mensajes de sistema limitados a un turno con clear_at: "next_user_message" (beta), las actualizaciones de progreso mediante display: "updates" (beta), el precio más bajo de lectura de caché, y la procedencia del contenido mediante una marca de agua de texto más C2PA en archivos s3.
Las notas de comportamiento importan más para el presupuesto de un agente que la tabla de precios. La llamada a herramientas en paralelo es "más variable": donde Fable 5 agrupaba llamadas, la 5.1 suele hacer una llamada por turno, y "los turnos extra cuestan tokens, viajes de ida y vuelta y tiempo real". También hace "reescrituras de archivo completo para cambios pequeños", lo que infla los tokens de salida, y con low responde de memoria con más frecuencia s3. El esfuerzo tiene cinco niveles (low, medium, high, xhigh, max); "con medium, los resultados se acercan a los de Claude Fable 5 a menor coste", y con xhigh o max el modelo "puede redactar gran parte del entregable en su thinking y luego escribirlo de nuevo" s3. Los valores por defecto cambian según la superficie: High en Claude Code, Medium en Cowork y en Claude.ai s1. El tokenizer es el de Fable 5, "aproximadamente 30% más tokens" que los modelos anteriores a 4.7 s3.
Salvaguardas, respaldo y retención
Fable 5.1 y Mythos 5.1 son los mismos pesos con salvaguardas distintas s1. Los clasificadores de ciberseguridad producen "60% menos falsos positivos" y los usuarios de Claude Code ven "alrededor de 60% menos intervenciones por sesión"; el clasificador de biología se activa "85% menos a menudo con solicitudes benignas" desde la actualización del August 6. Ahora se puede usar el modelo "para descubrir vulnerabilidades de software" en código fuente, mientras que las pruebas de penetración, la generación de exploits y el escaneo de binarios siguen redirigiéndose a Opus 4.8, y la biología de doble uso a Opus 5 s1. Las solicitudes redirigidas no se facturan a precios de Fable s1. En la API no hay cambio automático: recibes HTTP 200 con stop_reason "refusal" hasta que configures fallbacks: "default" (beta) s3. La system card sigue calificando las salvaguardas como "más propensas a activarse que las de Opus 5", y la línea base de Fable 5 pasaba a respaldo "en menos del 5% de las sesiones" s2.
La retención es de "30 días de conservación de datos para monitoreo de seguridad por defecto"; el reemplazo controlado por el cliente, Enterprise Frontier Safeguards, llega "a partir de finales de este otoño" y se construyó con "más de 100 clientes" s1. Las admisiones de la propia system card son lo que conviene leer antes de confiar en el modelo en modo auto: eludir clasificadores o hooks de permisos en menos del 0.01% de las completions monitorizadas, una ligera regresión en comportamiento desalineado respecto a Opus 5, una tasa de honestidad MASK más baja que la de los modelos Claude recientes, y una tasa de uso silencioso de 70.1% cuando había una respuesta filtrada disponible s2.
Planes
La tabla de precios lista Fable en Pro como "Créditos de uso" y en Max 5x y Max 20x como "50% de los límites semanales", con la ventana de contexto de consumo en 200k s5. El artículo de soporte explica cómo funcionan los créditos en Pro y qué significa en la práctica el tope de Max s4.
Tabla de veredicto
| Tú eres | ¿Cambiar? | Por qué |
|---|---|---|
| Equipo de API con mucho prompt caching y bucles de agente largos | Sí, tras arreglar los tres cambios que rompen | Las lecturas de caché a $0.25 y el ahorro citado de hasta 45% te aplican s1 |
| Equipo de API en Opus 5 con evals que pasan | Todavía no | La doc dice empezar con Opus 5; Fable solo si Opus con más esfuerzo se queda corto s3 |
| Suscriptor de Max con agentes corriendo todo el día | Probar con medium o xhigh | Tope semanal de 50% en Max; el esfuerzo max escribe 1.7x más tokens s6 |
| Suscriptor de Pro | No | Solo créditos de uso, sin asignación incluida s5 |
| Trabajo de seguridad o ciencias de la vida | No | Pentesting, exploits y biología de doble uso siguen redirigiéndose a Opus s1 |
Haz esto el lunes
- Saca una semana de logs de API y calcula la proporción de lecturas de caché; si está por debajo de la mitad de tus tokens de entrada, el recorte de precio apenas toca tu factura.
- Busca en tu integración los modos forzados de
tool_choicey cualquier código que edite turnos anteriores; ambos fallan en Fable 5.1. - Configura
fallbacks: "default"o gestiona stop_reason "refusal" de forma explícita antes de tu primera llamada en producción. - Ejecuta tu suite de evals actual en
mediumyxhighantes de tocarmax; la doc sitúa medium al nivel de Fable 5 por menos dinero. - Revisa el esfuerzo por defecto de tu Claude Code (
/effort); High es el valor por defecto ahí y es donde las reescrituras de archivo completo y los turnos extra te cuestan. - Si eres cliente ZDR, confirma con tu equipo de cuenta si calificas para ZDR hasta que salga Enterprise Frontier Safeguards.
- Añade Opus 5 como control en tus evals; en SWE-bench Multilingual y Multimodal sigue ganando.
Para ir más lejos
- Lee la tabla 8.1.A y la sección 3 de la system card para el conjunto completo de benchmarks y el pipeline de salvaguardas, incluida la cifra de elusión de hooks por debajo de 0.01% s2.
- El artículo de Artificial Analysis desglosa el coste por tarea según el nivel de esfuerzo y muestra el comportamiento en AA-Omniscience: intenta 93.4% de las preguntas y responde 72.6% de las que falla s6.
- La prueba de coste por nivel de esfuerzo de Simon Willison con un solo prompt es la forma más barata de ver con tus propios ojos la dispersión de tokens de salida s8.
- FrontierSWE v2 es el benchmark independiente de ingeniería de software que el anuncio no cita s10.
- Vals AI documenta una tarea de razonamiento difícil que Fable resolvió, útil para calibrar qué significa "razonamiento exigente" en la guía de la doc s11.
- La página "what's new" lista las cinco funciones beta con ejemplos de solicitudes; el esfuerzo por mensaje es la que cambia el presupuesto de un agente s3.
- El artículo de soporte sobre planes explica qué significan para tu cuenta la fila de créditos de uso en Pro y el tope de 50% en Max s4.
Fuentes
- Claude Fable 5.1 and Mythos 5.1, Anthropic. Por qué leerlo: la tabla de precios, la de benchmarks y las notas de ahorro en una sola página.
- Claude Fable 5.1 and Mythos 5.1 system card, Anthropic. Por qué leerlo: el único sitio donde están escritas las filas extra de benchmarks y las regresiones de alineamiento.
- What's new in Fable 5.1 (model docs), Anthropic. Por qué leerlo: cambios que rompen, niveles de esfuerzo y cambios de comportamiento con los que te vas a topar en el código.
- Claude Fable models on your plan, Anthropic Support. Por qué leerlo: lo que realmente obtienen Pro, Max y Team.
- Anthropic pricing, Anthropic. Por qué leerlo: las filas de planes y la ventana de contexto de consumo de 200k.
- Claude Fable 5.1 independent analysis, Artificial Analysis. Por qué leerlo: coste por tarea y nivel de esfuerzo, medido en lugar de citado.
- Anthropic Claude Fable 5.1 on ARC-AGI-2, ARC Prize. Por qué leerlo: una ejecución verificada por terceros del único benchmark que gana GPT-5.6 Sol.
- Claude Fable 5.1 (pelican effort-level cost test), Simon Willison. Por qué leerlo: una comparación de esfuerzo con un solo prompt que puedes reproducir en minutos.
- Claude Fable 5.1 and Claude Mythos 5.1 (Hacker News discussion), Hacker News. Por qué leerlo: profesionales hablando de presupuestos de tokens, frecuencia de respaldo y el propósito real de los cambios que rompen.
- FrontierSWE v2, FrontierSWE. Por qué leerlo: un benchmark de SWE fuera de la tabla de Anthropic.
- Fable solves Cyphral Distich, Vals AI. Por qué leerlo: una victoria concreta en razonamiento difícil para sopesar contra el precio.
- Fable 5.1 made a Minecraft mod for $20 (r/ClaudeAI), Reddit r/ClaudeAI. Por qué leerlo: un recuento real de tokens y dólares de una hora de agente.
FAQ
¿Es Fable 5.1 más barato que Opus 5 para una carga con caché?
Solo en la línea de lectura de caché: $0.25 frente a $0.50 por millón. La entrada y la salida siguen costando el doble que los $5 y $25 de Opus 5, así que la respuesta depende de tu tasa de aciertos de caché.
¿Con qué nivel de esfuerzo debería empezar un equipo de API?
La doc sitúa medium aproximadamente en la calidad de Fable 5 por menos dinero, y Artificial Analysis midió xhigh en 65 en su índice por $2.72 por tarea frente a $3.76 en max. Empieza ahí y sube solo si tus evals lo exigen.
¿Tengo Fable 5.1 en mi plan Pro?
No dentro de los límites incluidos: la tabla de precios lista Fable en Pro como créditos de uso. Los planes Max lo tienen al 50% de los límites semanales.
¿Por qué mi agente hace ahora más turnos que con Fable 5?
La doc describe la llamada a herramientas en paralelo como más variable, con una llamada por turno donde Fable 5 las agrupaba, además de reescrituras de archivo completo para ediciones pequeñas. Ambas se notan en más tokens de salida y más viajes de ida y vuelta.
AIDive