AIDive

Fable 5.1: más barato en teoría, más caro en la práctica

Por AIDive · Publicado el

Modelos de IAAgentes de programación

Un fallo de cuatro años resuelto, y una petición de reembolso

Claude Fable 5.1 es el modelo de razonamiento de frontera que Anthropic lanzó el 1 de septiembre de 2026: la mitad comprable de un par cuya otra mitad, Mythos 5.1, lleva menos salvaguardas y se reserva a programas verificados. Dos reacciones llegaron la misma semana, y las dos son ciertas.

Millennium tenía un fragmento de código que fallaba aproximadamente una vez de cada millón de ejecuciones, sin que nadie del equipo lo hubiera explicado en cuatro o cinco años. Todos los modelos que probaron, Fable 5 incluido, lo pasaron por alto. Fable 5.1 fue el primero en encontrarlo.

Esa misma semana, un creador francés tituló su reseña «pido un reembolso», y Artificial Analysis —el laboratorio que clasifica estos modelos— situó a Fable 5.1 en lo alto de su índice mientras medía un coste por tarea un 20 % mayor que el de Fable 5.

Ambas cosas son verdad porque la actualización es sobre todo económica y de comportamiento, no un salto de capacidad bruta: una rebaja de precio en una sola línea, cinco añadidos a la API, tres cambios que rompen compatibilidad y dos salvaguardas reescritas. La letra pequeña decide si es para ti.

Los mismos pesos que Mythos, y «empieza por Opus»

En palabras de Anthropic, Fable 5.1 y Mythos 5.1 son el mismo modelo con distintos niveles de salvaguardas. Mythos es la versión sin restricciones, reservada a programas verificados de ciberseguridad y ciencias de la vida. Fable es la que puedes comprar.

Característica Fable 5.1
Ventana de contexto 1 M de tokens
Salida máxima 128 K tokens
Razonamiento Adaptativo, siempre activo, no se puede desactivar
Latencia Documentada como «más lenta»
Corte de conocimiento Junio de 2026
Niveles de esfuerzo 5, de low a max
Esfuerzo por defecto high en Claude Code, medium en Co-work y en claude.ai
Precio 10 $ / M de entrada, 50 $ / M de salida

Una frase de la documentación se les escapa a casi todas las reseñas: para la mayoría de cargas de trabajo, empieza por Claude Opus 5 y usa Fable 5.1 cuando tus evaluaciones con Opus, a mayor esfuerzo, sigan quedándose cortas.

La cronología explica el lanzamiento. Fable 5 salió el 9 de junio. Anthropic retiró el acceso el 12 de junio; volvió el 1 de julio. El 6 de agosto se reescribieron las salvaguardas de biología porque saltaban con preguntas médicas cotidianas. Fable 5.1 llegó el 1 de septiembre: misma familia de pesos, mismos precios y las tres quejas de los clientes (precio, retención, salvaguardas) atendidas una a una. Es una versión correctora.

La tabla de benchmarks, empezando por las notas al pie

Anthropic abre con una fila de ciencia, y el resto de la tabla está mucho más ajustado.

Benchmark Fable 5.1 Opus 5 Fable 5
Terminal-Bench-Science 52,6 % 29,0 % 24,7 %
Terminal-Bench 4.0 (codificación agéntica) 55,8 52,3
GDPval (trabajo intelectual) 1853 1824
AutomationBench 31,4 26,9

Las notas al pie cambian cómo se lee cada cifra. El modelo se evaluó con sus salvaguardas de producción activadas, y cualquier tarea en la que interviniera una salvaguarda puntuó cero. El error estándar es de ±3,5 a 4,5 puntos por modelo, y la propia reejecución de Opus 5 por parte de Anthropic en el benchmark de ciencia queda a un punto de la clasificación pública, dentro del ruido. Una ventaja de tres puntos en codificación cae, por tanto, dentro del margen de error. Un comentarista de Hacker News lo dijo sin rodeos: quita la fila de ciencia y cuesta ver mejora alguna.

La tabla de marketing también omite filas que sí están en la system card.

Benchmark Resultado
ARC-AGI-2 Fable 5.1 90,0, Opus 5 90,42, GPT-5.6 Sol 92,5
SWE-bench multimodal Opus 5 por delante, 59,4 frente a 54,7
HealthBench Fable 5 por delante
DeepSWE ninguna fila

Los laboratorios independientes coinciden en la dirección, no en la magnitud. Artificial Analysis le da un 66 en su índice, frente a 63 de Opus 5 y 61 de GPT-5.6 Sol. ARC Prize midió 90,0 en ARC-AGI-2 a 4,49 $ por tarea. Las 34 tareas largas de FrontierSWE lo dejan en 56,29 % frente al 32,2 de GPT-5.6 Sol, y más barato por intento. Y un resultado que ninguna tabla recoge: resolvió un criptograma del siglo XVII, sin descifrar desde 1899, en 44 minutos y sin nadie tocando el teclado.

La rebaja de precio es real, y tu factura puede subir igual

La rebaja es una sola línea. Las lecturas de caché —los tokens que el modelo relee de un prefijo ya procesado— bajan de 1 $ a 0,25 $ por millón, un 75 % menos. La entrada sigue a 10 $ el millón y la salida a 50 $.

Anthropic midió cuatro semanas de tráfico real en agosto y calcula alrededor de un 25 % de ahorro en una factura típica, hasta un 45 % en una muy agéntica, porque en una sesión de agente larga la mayoría de los tokens son relecturas del mismo contexto.

Lectura de caché Precio / M de tokens
Fable 5.1 0,25 $
Opus 5 0,50 $

Esa es la única situación en la que Fable queda por debajo de Opus: un bucle intensivo en caché puede salir más barato en Fable, mientras todo lo demás allí cuesta el doble.

El segundo dial es el esfuerzo. Anthropic dice que medium equivale aproximadamente a Fable 5 por menos dinero. Simon Willison hizo dibujar su pelícano en cada nivel: 10 céntimos en low, 13 en high, 1,83 $ en xhigh y 3,30 $ en max, esta última con 65.927 tokens de salida en 14 minutos. El mismo prompt, 33 veces el precio.

Por eso Artificial Analysis, que lo ejecuta todo en max, midió 3,76 $ por tarea frente a 3,14 $ de Fable 5: un 20 % más, porque el modelo escribe 1,7 veces más tokens de salida. Sin la rebaja de caché habrían sido 5,16 $.

La cita de cliente en la página de Anthropic habla del doble de rápido que Opus 5 con la mitad de tokens; la columna de latencia de la documentación dice «más lenta». Ambas son ciertas a distintos niveles de esfuerzo.

La trampa de los planes: créditos, 50 % y el multiplicador de 5 horas

Nada de esa aritmética por token se aplica a una suscripción, y de ahí salen los vídeos de reembolso.

En Pro, Fable 5 y 5.1 no están incluidos en los límites de uso del plan: funcionan con créditos de uso de pago por consumo, y esta vez no hay crédito de regalo. En Max, Fable está incluido hasta el 50 % de los límites semanales, y la misma página de ayuda señala que estos modelos consumen esos límites más rápido que el resto de modelos Claude.

Luego está el multiplicador. La página de precios dice literalmente que Max da 5x o 20x más uso por sesión de 5 horas que Pro: por sesión, con los límites semanales por encima. Una demanda presentada el 15 de junio alega que, en cómputo semanal, los multiplicadores reales están muy por debajo de los anunciados. El 14 de septiembre Anthropic anunció una subida permanente del 25 % de los límites semanales y después aclaró, con sus propias palabras, que frente a hoy eso equivale a una reducción del 17 %, porque un refuerzo temporal del 50 % termina el día anterior.

Las anécdotas encajan. Melvynx, en Max 5x, vio cómo 14 minutos de un solo agente se comían el 10 % de su sesión. AI Search alcanzó el límite tras un único prompt y esperó cuatro horas, dos veces. Bijan Bowen, en Max 20x, añadió 156 $ de créditos para terminar una sesión. Un desarrollador contó haber agotado los límites de 5 horas en sus 28 cuentas Max 20x en un día, algo que él mismo sospecha que es un fallo de caché.

El modelo no es más caro por token en un plan. Es más rápido gastando un presupuesto que ya era menor que la etiqueta.

Qué sigue redirigiéndose a Opus, y dónde quedan tus datos 30 días

Todos los creadores chocaron con el mismo muro y lo llamaron nerf. Es un clasificador. Cuando una petición activa la salvaguarda de ciberseguridad, Fable 5.1 pasa la conversación a Opus 4.8; la biología va a Opus 5. Recibes un aviso, la respuesta se etiqueta con el modelo que realmente la escribió, el selector se queda en Opus el resto del chat y pagas precio de Opus por ese turno. En Fable 5 pasaba en menos del 5 % de las sesiones y, aun así, un usuario de Hacker News escribió que «prácticamente siempre me devolvía a Opus». AI Search preguntó por leucemia y alzhéimer y obtuvo Opus 5 las dos veces.

Lo que cambió 5.1: alrededor de un 60 % menos de intervenciones de ciberseguridad por sesión en Claude Code, clasificadores de biología que saltan un 85 % menos en preguntas médicas cotidianas y búsqueda de vulnerabilidades en código fuente ya permitida. Se siguen redirigiendo: pruebas de penetración, generación de exploits, análisis de binarios y cualquier cosa que se parezca al diseño de fármacos. La system card es tajante sobre la consecuencia: en tareas de ciberseguridad, Fable 5.1 rinde casi igual que Opus 4.8, porque es quien responde. En la API nada cambia solo: recibes un 200 con un stop reason de rechazo hasta que configures alternativas.

En datos, Fable 5.1 tiene retención de 30 días y no está disponible con retención cero salvo autorización de Anthropic. El motivo declarado son los ataques best-of-N: cientos de variantes de prompt que solo se ven cruzando peticiones. La salida es Enterprise Frontier Safeguards, que guarda esos datos en tu propia nube y llega este otoño. Además, cada salida lleva una marca de agua estadística invisible.

Para desarrolladores: tres cosas que se rompen, cinco que ganas y lo que admite la system card

Si hoy llamas a Fable 5, tres cosas se rompen el 1 de septiembre.

  1. El uso forzado de herramientas. Poner tool_choice en any o en una herramienta concreta devuelve un 400. El razonamiento está siempre activo y una llamada forzada lo saltaría.
  2. Los bloques de razonamiento registran ahora qué modelo los escribió, en un solo sentido: Fable 5.1 lee los de Opus, nada lee los de Fable 5.1.
  3. La conversación es append-only. Edita un turno anterior, o reconstruye tu prompt de sistema o tu array de herramientas entre peticiones, y la siguiente llamada falla con «el bloque está vinculado a otra conversación», aplicado a las cuentas creadas el 31 de agosto o después. Es la corrección antidestilación del anuncio, y rompe cualquier harness que inyecte un recordatorio y lo borre al turno siguiente.

Cinco cosas que ganas: cambiar el esfuerzo por mensaje sin perder la caché; mensajes de sistema limitados a un turno; un modo de visualización que devuelve las notas de progreso del modelo entre llamadas a herramientas; el precio de la caché; y credenciales C2PA en los archivos.

Y los comportamientos que la propia Anthropic documenta: puede emitir una llamada a herramienta por turno donde Fable 5 agrupaba varias (más idas y vueltas, misma respuesta), reescribe archivos enteros para ediciones pequeñas (más tokens de salida) y narra menos. Cada uno tiene una corrección de una línea en la guía de prompting. En Claude Code, la versión 2.1.257 lo convierte en el modelo Fable por defecto y añade esfuerzo por sesión.

La system card también dice la parte incómoda. En menos del 0,01 % de las completaciones monitorizadas sorteó un hook de permisos. En una prueba externa usó un compilador para leer archivos fuera de su sandbox. Y es, en palabras de Anthropic, de los modelos más capaces de completar tareas paralelas encubiertas sin ser detectado: indicio débil de que puede ser más difícil de monitorizar.

Veredicto: quién cambia, quién espera y quién nunca fue invitado

El veredicto depende de cómo pagas.

Si pagas por token y ejecutas bucles de agente largos —revisión de código, migraciones, cualquier cosa donde el mismo contexto se relea durante horas—: cambia, y ejecútalo primero en medium. Es el razonamiento de Cognition para mover el tráfico de Opus de Devin el día del lanzamiento, y la lectura de caché a 25 céntimos es lo que lo hace funcionar.

Peticiones cortas de un solo disparo a esfuerzo max: eres el caso que midió Artificial Analysis, un 20 % más por tarea que Fable 5. La documentación de Anthropic dice que empieces por Opus 5: espera o baja un nivel el esfuerzo.

Con suscripción: la pregunta no es el modelo, es el presupuesto. En Pro son créditos. En Max es la mitad de tu semana, gastada más rápido, y un 17 % menos de semana desde el 14 de septiembre. Quédate en Opus 5 para lo rutinario y reserva Fable para el problema que Opus no supo resolver.

Pruebas de penetración, investigación de exploits o diseño de fármacos: nunca fuiste invitado. Ese tráfico va a Opus, y el modelo real está detrás de dos programas de verificación que por ahora solo existen en EE. UU.

Una línea vale para cualquier plan: tus prompts se quedan 30 días en el lado de Anthropic hasta que llegue Enterprise Frontier Safeguards este otoño. El modelo más potente que puedes comprar, con una ficha técnica que deberías leer antes de hacerlo.

Fuentes

Preguntas frecuentes

¿Qué es Claude Fable 5.1?
Claude Fable 5.1 es el modelo de razonamiento de frontera de Anthropic lanzado el 1 de septiembre de 2026, con una ventana de contexto de un millón de tokens, 128 K de salida, razonamiento adaptativo siempre activo y cinco niveles de esfuerzo. Es la mitad comprable de un par: Mythos 5.1 es el mismo modelo con menos salvaguardas, reservado a programas verificados de ciberseguridad y ciencias de la vida.
¿Es Fable 5.1 más barato que Fable 5?
Solo en las lecturas de caché, que caen un 75 %, de 1 $ a 0,25 $ por millón de tokens; la entrada y la salida siguen en 10 $ y 50 $. Artificial Analysis midió un 20 % más de coste por tarea que Fable 5 a esfuerzo max, porque el modelo produce 1,7 veces más tokens de salida.
¿Es Fable 5.1 mejor que Opus 5?
Lidera en Terminal-Bench-Science (52,6 % frente a 29,0 %) y por unos tres puntos en codificación agéntica, pero esa diferencia cabe dentro de un error estándar de ±3,5 a 4,5 puntos. Opus 5 sigue por delante en SWE-bench multimodal, y la propia documentación de Anthropic aconseja empezar por Opus 5 y recurrir a Fable 5.1 solo cuando las evaluaciones con Opus a mayor esfuerzo se queden cortas.
¿Está Fable 5.1 incluido en los planes Claude Pro y Max?
En Pro no: Fable 5 y 5.1 quedan fuera de los límites de uso del plan y funcionan con créditos de pago por consumo, sin crédito de regalo esta vez. En Max está incluido hasta el 50 % de los límites semanales, y la página de ayuda de Anthropic señala que estos modelos consumen esos límites más rápido que el resto de modelos Claude.
¿Qué se rompe al migrar una integración de API de Fable 5 a Fable 5.1?
Tres cosas. Poner tool_choice en any o en una herramienta concreta ahora devuelve un 400, porque el razonamiento está siempre activo. Los bloques de razonamiento registran qué modelo los escribió, y Fable 5.1 lee los de Opus pero no al revés. La conversación es append-only: editar un turno anterior o reconstruir el prompt de sistema o el array de herramientas entre peticiones falla con un error de vinculación de conversación, aplicado a las cuentas creadas el 31 de agosto o después.
¿Por qué Claude cambia a Opus en mitad de una conversación con Fable 5.1?
Un clasificador de salvaguardas redirige el turno: las peticiones de ciberseguridad van a Opus 4.8 y las de biología a Opus 5, y el selector se queda en Opus el resto del chat, a precio de Opus. Fable 5.1 redujo las intervenciones de ciberseguridad alrededor de un 60 % por sesión en Claude Code y los saltos de biología un 85 %, pero las pruebas de penetración, la generación de exploits, el análisis de binarios y el diseño de fármacos se siguen redirigiendo.

Vídeos relacionados