Fable 5.1 vs GPT-5.6 Sol: medí el ahorro real y no es el 25%
Anthropic sacó Claude Fable 5.1 el 1 de septiembre y lo vendió con una cifra: alrededor de un 25% más barato que Fable 5 en cargas típicas, y hasta un 45% en cargas muy agénticas. Dos días después le lancé el mismo brief que ya había usado en julio para comparar Kimi K3, Fable 5 y GPT-5.6 Sol: una landing de obrador artesano a partir de una imagen de referencia y doce líneas de brief.
Medí un 18,4%. No es que Anthropic mienta: es que ese porcentaje depende enteramente de la forma de tu carga de trabajo, y casi nadie lo está explicando. Abajo está la aritmética entera, y de paso, qué entregó cada modelo con la misma tarea.
El experimento completo —brief congelado, protocolo, script de medición y el código exacto de cada modelo sin retocar— está en github.com/ivanlhz/ia-tests.
Qué cambia de verdad en Claude Fable 5.1
Fable 5.1 mantiene el precio base de Fable 5: 10 dólares por millón de tokens de entrada y 50 de salida. Lo que baja es la lectura de caché, de 1,00 a 0,25 dólares por millón, un 75% menos. Las escrituras de caché no se mueven (12,50 con TTL de 5 minutos, 20 con TTL de una hora).
Ese matiz importa porque en una sesión agéntica larga la caché se lee constantemente: cada llamada a herramienta vuelve a mandar el contexto. En la sesión que midió esta landing, el 90% de todos los tokens fueron lecturas de caché.
| Concepto | Fable 5 | Fable 5.1 |
|---|---|---|
| Entrada | 10 $/MTok | 10 $/MTok |
| Salida | 50 $/MTok | 50 $/MTok |
| Lectura de caché | 1,00 $/MTok | 0,25 $/MTok |
| Escritura de caché (5 min) | 12,50 $/MTok | 12,50 $/MTok |
| Escritura de caché (1 h) | 20 $/MTok | 20 $/MTok |
Cuánto se ahorra realmente al pasar de Fable 5 a Fable 5.1
Comparar lo que costó Fable 5 en julio contra lo que costó Fable 5.1 hoy no vale: son dos entregas distintas, con volúmenes distintos. Hay que coger los tokens reales de esta sesión y facturarlos con las dos tarifas.
Ahorro real medido: 6,86 dólares, un 18,4%. La razón por la que no llega al 25% se ve en la composición de la sesión: aunque la lectura de caché es el 90% de los tokens, a tarifa antigua solo era el 24% de la factura. Un descuento del 75% sobre el 24% da, como mucho, un 18%.
Tu ahorro al pasar a Fable 5.1 es aproximadamente 0,75 × la fracción de tu factura que hoy es lectura de caché. Si tus prompts son cortos y usas poca herramienta, el ahorro tiende a cero. El 45% que anuncia Anthropic exige una carga donde la lectura de caché sea prácticamente toda la factura.
El error que te cuesta 7 dólares sin darte cuenta
Hay un evento en el log que merece un apartado propio. A las 08:32:45 termina el build. A las 09:41:44 hago otra pregunta en la misma sesión, y la lectura de caché de esa llamada se desploma de 390.836 tokens a 31.396: la caché ha caducado. Esa única llamada escribe 361.496 tokens de caché de golpe para reconstruir el contexto.
A 20 dólares por millón, esa pausa de 69 minutos costó 7,23 dólares. Casi un cuarto del coste total de la sesión, gastado en recalentar contexto que ya existía.
Si trabajas con agentes en sesiones largas, la conclusión es directa: retomar una sesión fría no es gratis. Cierra la tarea de una tirada, o cierra la sesión.
Qué entregó cada modelo con el mismo brief
Los heroes, lado a lado. Mismo brief, misma imagen de referencia, cero contexto adicional:



La tabla resumen, con las cuatro entregas del experimento:
| Fable 5.1 | Fable 5 | GPT-5.6 Sol | Kimi K3 | |
|---|---|---|---|---|
| Tiempo de API | 54 m 03 s | 59 m | no registrado | 41 m |
| Coste | $30,52 | $35,09 | $9,59 | ~4,16 € reales |
| Líneas entregadas | 5.170 | 2.517 | 3.050 | 1.176 |
Ficheros en src/ | 39 | 24 | 10 | 13 |
| Componentes | 20 | 14 | 4 | 9 |
| Productos en la carta | 12 | 9 | 4 | 6 |
| Correcciones | 0 | n/r | n/r | 1 |
Aviso de unidades, el mismo de siempre: los dólares de Fable y de Sol son coste API equivalente, una vara común para comparar, no dinero que salga de mi cuenta, porque van por suscripción. Solo la cifra de Kimi es dinero real. Y los tokens no son comparables entre proveedores porque cada uno usa su tokenizador; entre Fable 5 y Fable 5.1 sí, porque comparten tokenizador.
Fable 5.1 escribe el doble de código en menos tiempo
El dato de reloj hay que leerlo con cuidado. El build de Fable 5.1 lo puedo acotar con precisión desde el log: el brief entra a las 07:35:32, la última escritura es a las 08:32:45. 57 minutos y 13 segundos, de un solo prompt, cero correcciones, con el modelo generando el 94% de ese tiempo.
No voy a vender un “3× más rápido” comparándolo con las 2 h 59 m que anoté para Fable 5 en julio: aquello es un span de sesión que ya no puedo descomponer, y probablemente incluye pausas mías. El único número comparable entre runs es el tiempo de API: 59 minutos contra 54, un 8% menos, produciendo el doble de código.
Traducido a eficiencia, con el mismo tokenizador en los dos modelos:
- Fable 5: 90,4 tokens de salida por línea entregada, a 0,0139 $ la línea.
- Fable 5.1: 52,9 tokens por línea, a 0,0059 $ la línea.
Es 1,7× más eficiente en tokens y 2,4× más barato por línea. Y un detalle del log que explica parte de la diferencia: la primera llamada de la sesión gastó 32.331 tokens de salida, de los cuales 32.066 fueron razonamiento. Estuvo casi 8 minutos planificando la entrega entera antes de escribir la primera línea de código.
Calidad de código: lo que verifiqué a mano
Nada de esto lo he leído en el README que escribió el modelo. Lo ejecuté yo sobre el código en disco:
| Fable 5.1 | Fable 5 | GPT-5.6 Sol | Kimi K3 | |
|---|---|---|---|---|
astro check | 0 errores, 0 warnings | build ok | build ok | build ok |
| Consola del navegador | 0 errores | no verificado | no verificado | no verificado |
tsconfig | strict + noUncheckedIndexedAccess | strict | strict | strict |
| Fichero más largo | 534 líneas | 395 | 2.056 (global.css) | 176 |
| Bloques JSDoc | 53 | 21 | 0 | 0 |
| Líneas de comentario | 184 | 91 | 1 | 7 |
Tres comportamientos de Fable 5.1 que no había visto antes en un modelo de Anthropic:
Aprieta el compilador por encima del preset. Es el único que no se conforma con astro/tsconfigs/strict: añade noUncheckedIndexedAccess y noImplicitOverride. Nadie se lo pidió.
Comprobó las versiones antes de escribir el package.json. En el log hay tres llamadas de fetch: la guía de migración a Astro 6, la de Astro 7 y la referencia de configuración. Sabía que su conocimiento podía estar caducado y fue a mirarlo. Entregó sobre Astro 7.2.10, mientras que en julio Fable 5 entregó sobre Astro 5.13, la versión que llevaba grabada del entrenamiento. Esto era justo el punto que le apunté a Codex a favor en el experimento anterior: ahora lo hacen los dos.
Se verificó solo en un navegador de verdad. Levantó un Chromium headless, se hizo capturas a 1440×5600 y 390×7600, escribió un script para medir el desbordamiento horizontal elemento a elemento, leyó la consola, y después mató sus propios procesos y comprobó que no quedaban puertos escuchando.
Responsive: medido, no mirado
Cargué los cuatro builds a 360 px de ancho y comprobé dos cosas distintas: cuánto desborda el documento, y si el scroll horizontal llega a existir.
scrollWidth a 360 px | Desbordamiento | ¿Scroll lateral? | |
|---|---|---|---|
| Fable 5.1 | 360 | 0 px | No |
| Fable 5 | 411 | 51 px | No (overflow-x: clip) |
| GPT-5.6 Sol | 361 | 1 px | No |
| Kimi K3 | 360 | 0 px | No |



El caso de Fable 5 es interesante porque es un fallo silencioso: no produce scroll lateral, porque lo tapa con overflow-x: clip en el body. Pero hay 51 píxeles de contenido saliéndose del viewport que se están cortando. Es más difícil de detectar que el scroll, y por eso en julio lo anoté como “responsive roto en secciones” sin poder señalar dónde. Fable 5.1 sencillamente no lo tiene, cosa que no sorprende viendo que se escribió un script para medirlo.
El fallo de GPT-5.6 Sol que se ve en la primera pantalla
En julio anoté “hero roto” en el run de Sol sin más detalle. Ahora tengo la causa exacta.

El H1 de Sol a 1440 px. Se lee «Tartasque hablandeti.» — y en móvil, igual.
Está en src/styles/global.css:461: un letter-spacing: -0.065em sobre una tipografía display a clamp(4.8rem, 7.15vw, 8.1rem). A ese tamaño, el tracking negativo se come el espacio entre palabras. No es un glitch de animación ni una fuente que no carga: es CSS, está en el build de producción y ocupa la primera pantalla de la landing.
Es exactamente el tipo de error que un modelo detecta si se molesta en abrir su propio resultado en un navegador. Sol no lo hizo. Fable 5.1 sí.
Los copys y el SEO de las landings generadas
Los cuatro modelos entienden el SEO básico: título único, meta description, un solo <h1>, lang="es", Open Graph, JSON-LD, alt en todas las imágenes, canonical y favicon. Esa convergencia ya la vi en julio y sigue ahí. Donde se separan es en el techo.
Fable 5.1 emite un @graph de JSON-LD con Bakery más un OfferCatalog con los doce productos y sus precios, cinco srcset responsive (Sol y Kimi, cero) y metadatos geo. Pero las dos decisiones que más me gustan no son de volumen:
Escapa el JSON-LD con un comentario que explica el porqué: para que ningún contenido pueda cerrar la etiqueta script antes de tiempo. Es una mitigación de XSS en un sitio estático sin backend, donde el riesgo es teórico. Es lo que haría alguien que ya ha pisado ese charco.
Se niega a emitir la valoración como structured data. La landing muestra “4,9 en Google · 312 reseñas” como texto, pero no lo mete en el JSON-LD, y el README explica por qué: los rich results de valoración necesitan reseñas reales detrás. Es la decisión correcta según las políticas de Google, y es criterio de producto, no generación de código.
En copys, los cuatro escribieron español nativo y los cuatro llegaron por su cuenta a un naming con la palabra miga. Fable 5.1 entregó doce productos ambientados en Ruzafa, con precios de 34 a 38 € para tartas de 8 a 10 raciones, creíbles para un obrador de autor:
«El secreto no es secreto: son los ingredientes.»
«Huevos camperos. De una granja de Chiva, a media hora del obrador. Llegan cada martes.»
«Sin atajos. Cero conservantes, colorantes artificiales ni premezclas. Si no lo comerías en casa, no entra.»


Y añadió cosas que nadie pidió: filtros con contador en vivo, etiquetas de temporada y sin gluten, un producto “Tarta a medida” que va a presupuesto en vez de al carrito, y un carrito real que compone un mensaje y lo manda por WhatsApp o mailto:, que es literalmente como toman los pedidos los obradores pequeños en España.
GPT-5.6 Sol tiene el mejor copy de los cuatro (“Tartas que hablan de ti”, “historias que no caben en una caja cualquiera”) y la peor carta: cuatro productos. El brief pedía que el visitante entienda qué vendemos y haga un pedido.
Límites del experimento
- Es n=1. Una tarea, una pasada por modelo, un día concreto. Medición honesta, no ley universal.
- Solo frontend estático. Otras cargas pueden repartirse de otra forma.
- Fable 5 y Sol corrieron el 17 de julio; Fable 5.1, el 3 de septiembre. Los agentes se han actualizado entre medias y eso no lo he podido congelar.
- Sol no corre en el mismo agente: va por Codex, así que mezcla modelo y agente. Es la comparación realista, no la de laboratorio.
- Hay una discrepancia de medición que dejo declarada: el panel de uso de Claude Code marca 23,18 $ para esta sesión y mi script, leyendo el log, calcula 30,52 $. La diferencia es exactamente una partida, el recacheo en frío de los 7,23 $. No puedo determinar desde fuera cuál factura Anthropic, así que doy los dos y uso el del log para comparar con julio, porque es el mismo método que produjo los 35,09 $ de Fable 5.
- La rúbrica de diseño (bloque cerrado sobre 22 y abierto sobre 25) de Fable 5.1 aún no está puntuada, y cuando lo esté debería hacerse a ciegas. Esto mide lo verificable por comando y navegador.
Qué modelo elegir para generar una landing
- Si la entrega tiene que estar terminada, Fable 5.1. Es el único de los cuatro que sacó algo enseñable a un cliente el mismo día: SEO completo, carrito funcional, cero desbordamiento, cero errores de tipos y un README que justifica cada decisión de stack. Y si vienes de Fable 5, el cambio sale gratis: mismo precio base, caché un 75% más barata.
- Si el precio manda y el resultado es un punto de partida, GPT-5.6 Sol. Su copy es bueno; su código no. La diferencia de coste con Fable 5.1 son 20,93 $: a 50 €/h de un freelance, unos 23 minutos. Si arreglar la entrega de Sol te cuesta más de media hora, Fable 5.1 salió más barato.
- No te creas el porcentaje de ahorro de la nota de prensa, ni el mío. Calcúlalo con tu propia carga. El 25% de Anthropic y mi 18,4% son el mismo modelo con perfiles de token distintos.
Esta es la misma disciplina que aplico en proyectos de cliente: el coste de un sistema de IA no se estima con la tabla de precios del proveedor, se mide con telemetría propia sobre tareas reales. Si estás decidiendo qué modelo usar y quieres números en vez de opiniones, hablamos 30 minutos.