Saltar al contenido
Fable 5.1 vs GPT-5.6 Sol: medí el ahorro real y no es el 25%

Fable 5.1 vs GPT-5.6 Sol: medí el ahorro real y no es el 25%

Inteligencia Artificial Claude GPT Costes Astro Benchmark
10 min de lectura

Anthropic sacó Claude Fable 5.1 el 1 de septiembre y lo vendió con una cifra: alrededor de un 25% más barato que Fable 5 en cargas típicas, y hasta un 45% en cargas muy agénticas. Dos días después le lancé el mismo brief que ya había usado en julio para comparar Kimi K3, Fable 5 y GPT-5.6 Sol: una landing de obrador artesano a partir de una imagen de referencia y doce líneas de brief.

Medí un 18,4%. No es que Anthropic mienta: es que ese porcentaje depende enteramente de la forma de tu carga de trabajo, y casi nadie lo está explicando. Abajo está la aritmética entera, y de paso, qué entregó cada modelo con la misma tarea.

El experimento completo —brief congelado, protocolo, script de medición y el código exacto de cada modelo sin retocar— está en github.com/ivanlhz/ia-tests.

Qué cambia de verdad en Claude Fable 5.1

Fable 5.1 mantiene el precio base de Fable 5: 10 dólares por millón de tokens de entrada y 50 de salida. Lo que baja es la lectura de caché, de 1,00 a 0,25 dólares por millón, un 75% menos. Las escrituras de caché no se mueven (12,50 con TTL de 5 minutos, 20 con TTL de una hora).

Ese matiz importa porque en una sesión agéntica larga la caché se lee constantemente: cada llamada a herramienta vuelve a mandar el contexto. En la sesión que midió esta landing, el 90% de todos los tokens fueron lecturas de caché.

ConceptoFable 5Fable 5.1
Entrada10 $/MTok10 $/MTok
Salida50 $/MTok50 $/MTok
Lectura de caché1,00 $/MTok0,25 $/MTok
Escritura de caché (5 min)12,50 $/MTok12,50 $/MTok
Escritura de caché (1 h)20 $/MTok20 $/MTok

Cuánto se ahorra realmente al pasar de Fable 5 a Fable 5.1

Comparar lo que costó Fable 5 en julio contra lo que costó Fable 5.1 hoy no vale: son dos entregas distintas, con volúmenes distintos. Hay que coger los tokens reales de esta sesión y facturarlos con las dos tarifas.

La misma sesión, las dos tarifas $0 $10 $20 $30 $40 Tarifa Fable 5 Tarifa Fable 5.1 $1,00 / MTok $0,25 / MTok $13,75 $14,47 $9,15 $37,38 $13,75 $14,47 $2,29 $30,52 −$6,86 · −18,4 % Entrada + salida Escritura de caché Lectura de caché
Coste de los 10,15 M de tokens que consumió el build de Fable 5.1, con las dos listas de precios. Lo único que cambia entre las dos barras es el precio de la lectura de caché.

Ahorro real medido: 6,86 dólares, un 18,4%. La razón por la que no llega al 25% se ve en la composición de la sesión: aunque la lectura de caché es el 90% de los tokens, a tarifa antigua solo era el 24% de la factura. Un descuento del 75% sobre el 24% da, como mucho, un 18%.

Por qué el descuento no llega al 25% Composición de los 10.154.443 tokens de la sesión Lectura de caché · 90,1 % escritura de caché 7,1 % entrada + salida 2,8 %
El 90% de los tokens de una sesión agéntica larga son relecturas del contexto, pero pesan poco en la factura porque la caché ya era la partida barata.

Tu ahorro al pasar a Fable 5.1 es aproximadamente 0,75 × la fracción de tu factura que hoy es lectura de caché. Si tus prompts son cortos y usas poca herramienta, el ahorro tiende a cero. El 45% que anuncia Anthropic exige una carga donde la lectura de caché sea prácticamente toda la factura.

El error que te cuesta 7 dólares sin darte cuenta

Hay un evento en el log que merece un apartado propio. A las 08:32:45 termina el build. A las 09:41:44 hago otra pregunta en la misma sesión, y la lectura de caché de esa llamada se desploma de 390.836 tokens a 31.396: la caché ha caducado. Esa única llamada escribe 361.496 tokens de caché de golpe para reconstruir el contexto.

A 20 dólares por millón, esa pausa de 69 minutos costó 7,23 dólares. Casi un cuarto del coste total de la sesión, gastado en recalentar contexto que ya existía.

Si trabajas con agentes en sesiones largas, la conclusión es directa: retomar una sesión fría no es gratis. Cierra la tarea de una tirada, o cierra la sesión.

Qué entregó cada modelo con el mismo brief

Los heroes, lado a lado. Mismo brief, misma imagen de referencia, cero contexto adicional:

Hero de la landing generada por Claude Fable 5.1, marca Miga, obrador en Ruzafa
Fable 5.1, Miga (València)
Hero de la landing generada por Claude Fable 5, marca Migaja, obrador en La Latina
Fable 5, Migaja (Madrid)
Hero de la landing generada por GPT-5.6 Sol, marca Miga Mía, con el titular roto
GPT-5.6 Sol, Miga Mía (Madrid)

La tabla resumen, con las cuatro entregas del experimento:

Fable 5.1Fable 5GPT-5.6 SolKimi K3
Tiempo de API54 m 03 s59 mno registrado41 m
Coste$30,52$35,09$9,59~4,16 € reales
Líneas entregadas5.1702.5173.0501.176
Ficheros en src/39241013
Componentes201449
Productos en la carta12946
Correcciones0n/rn/r1

Aviso de unidades, el mismo de siempre: los dólares de Fable y de Sol son coste API equivalente, una vara común para comparar, no dinero que salga de mi cuenta, porque van por suscripción. Solo la cifra de Kimi es dinero real. Y los tokens no son comparables entre proveedores porque cada uno usa su tokenizador; entre Fable 5 y Fable 5.1 sí, porque comparten tokenizador.

Fable 5.1 escribe el doble de código en menos tiempo

El dato de reloj hay que leerlo con cuidado. El build de Fable 5.1 lo puedo acotar con precisión desde el log: el brief entra a las 07:35:32, la última escritura es a las 08:32:45. 57 minutos y 13 segundos, de un solo prompt, cero correcciones, con el modelo generando el 94% de ese tiempo.

No voy a vender un “3× más rápido” comparándolo con las 2 h 59 m que anoté para Fable 5 en julio: aquello es un span de sesión que ya no puedo descomponer, y probablemente incluye pausas mías. El único número comparable entre runs es el tiempo de API: 59 minutos contra 54, un 8% menos, produciendo el doble de código.

Traducido a eficiencia, con el mismo tokenizador en los dos modelos:

  • Fable 5: 90,4 tokens de salida por línea entregada, a 0,0139 $ la línea.
  • Fable 5.1: 52,9 tokens por línea, a 0,0059 $ la línea.

Es 1,7× más eficiente en tokens y 2,4× más barato por línea. Y un detalle del log que explica parte de la diferencia: la primera llamada de la sesión gastó 32.331 tokens de salida, de los cuales 32.066 fueron razonamiento. Estuvo casi 8 minutos planificando la entrega entera antes de escribir la primera línea de código.

Calidad de código: lo que verifiqué a mano

Nada de esto lo he leído en el README que escribió el modelo. Lo ejecuté yo sobre el código en disco:

Fable 5.1Fable 5GPT-5.6 SolKimi K3
astro check0 errores, 0 warningsbuild okbuild okbuild ok
Consola del navegador0 erroresno verificadono verificadono verificado
tsconfigstrict + noUncheckedIndexedAccessstrictstrictstrict
Fichero más largo534 líneas3952.056 (global.css)176
Bloques JSDoc532100
Líneas de comentario1849117

Tres comportamientos de Fable 5.1 que no había visto antes en un modelo de Anthropic:

Aprieta el compilador por encima del preset. Es el único que no se conforma con astro/tsconfigs/strict: añade noUncheckedIndexedAccess y noImplicitOverride. Nadie se lo pidió.

Comprobó las versiones antes de escribir el package.json. En el log hay tres llamadas de fetch: la guía de migración a Astro 6, la de Astro 7 y la referencia de configuración. Sabía que su conocimiento podía estar caducado y fue a mirarlo. Entregó sobre Astro 7.2.10, mientras que en julio Fable 5 entregó sobre Astro 5.13, la versión que llevaba grabada del entrenamiento. Esto era justo el punto que le apunté a Codex a favor en el experimento anterior: ahora lo hacen los dos.

Se verificó solo en un navegador de verdad. Levantó un Chromium headless, se hizo capturas a 1440×5600 y 390×7600, escribió un script para medir el desbordamiento horizontal elemento a elemento, leyó la consola, y después mató sus propios procesos y comprobó que no quedaban puertos escuchando.

Responsive: medido, no mirado

Cargué los cuatro builds a 360 px de ancho y comprobé dos cosas distintas: cuánto desborda el documento, y si el scroll horizontal llega a existir.

scrollWidth a 360 pxDesbordamiento¿Scroll lateral?
Fable 5.13600 pxNo
Fable 541151 pxNo (overflow-x: clip)
GPT-5.6 Sol3611 pxNo
Kimi K33600 pxNo
Vista móvil de la landing de Fable 5.1 a 360 píxeles
Fable 5.1
Vista móvil de la landing de Fable 5 a 360 píxeles
Fable 5
Vista móvil de la landing de GPT-5.6 Sol a 360 píxeles, con el titular roto
GPT-5.6 Sol

El caso de Fable 5 es interesante porque es un fallo silencioso: no produce scroll lateral, porque lo tapa con overflow-x: clip en el body. Pero hay 51 píxeles de contenido saliéndose del viewport que se están cortando. Es más difícil de detectar que el scroll, y por eso en julio lo anoté como “responsive roto en secciones” sin poder señalar dónde. Fable 5.1 sencillamente no lo tiene, cosa que no sorprende viendo que se escribió un script para medirlo.

El fallo de GPT-5.6 Sol que se ve en la primera pantalla

En julio anoté “hero roto” en el run de Sol sin más detalle. Ahora tengo la causa exacta.

Detalle del titular de la landing de GPT-5.6 Sol: se lee Tartasque hablandeti porque los espacios entre palabras han colapsado

El H1 de Sol a 1440 px. Se lee «Tartasque hablandeti.» — y en móvil, igual.

Está en src/styles/global.css:461: un letter-spacing: -0.065em sobre una tipografía display a clamp(4.8rem, 7.15vw, 8.1rem). A ese tamaño, el tracking negativo se come el espacio entre palabras. No es un glitch de animación ni una fuente que no carga: es CSS, está en el build de producción y ocupa la primera pantalla de la landing.

Es exactamente el tipo de error que un modelo detecta si se molesta en abrir su propio resultado en un navegador. Sol no lo hizo. Fable 5.1 sí.

Los copys y el SEO de las landings generadas

Los cuatro modelos entienden el SEO básico: título único, meta description, un solo <h1>, lang="es", Open Graph, JSON-LD, alt en todas las imágenes, canonical y favicon. Esa convergencia ya la vi en julio y sigue ahí. Donde se separan es en el techo.

Fable 5.1 emite un @graph de JSON-LD con Bakery más un OfferCatalog con los doce productos y sus precios, cinco srcset responsive (Sol y Kimi, cero) y metadatos geo. Pero las dos decisiones que más me gustan no son de volumen:

Escapa el JSON-LD con un comentario que explica el porqué: para que ningún contenido pueda cerrar la etiqueta script antes de tiempo. Es una mitigación de XSS en un sitio estático sin backend, donde el riesgo es teórico. Es lo que haría alguien que ya ha pisado ese charco.

Se niega a emitir la valoración como structured data. La landing muestra “4,9 en Google · 312 reseñas” como texto, pero no lo mete en el JSON-LD, y el README explica por qué: los rich results de valoración necesitan reseñas reales detrás. Es la decisión correcta según las políticas de Google, y es criterio de producto, no generación de código.

En copys, los cuatro escribieron español nativo y los cuatro llegaron por su cuenta a un naming con la palabra miga. Fable 5.1 entregó doce productos ambientados en Ruzafa, con precios de 34 a 38 € para tartas de 8 a 10 raciones, creíbles para un obrador de autor:

«El secreto no es secreto: son los ingredientes.»

«Huevos camperos. De una granja de Chiva, a media hora del obrador. Llegan cada martes.»

«Sin atajos. Cero conservantes, colorantes artificiales ni premezclas. Si no lo comerías en casa, no entra.»

Catálogo de la landing de Fable 5.1 con filtros, etiquetas, precios y botón de añadir al pedido
Filtros con contador, etiquetas y carrito
Sección de ingredientes de la landing de Fable 5.1, con la tarta centrada y llamadas radiales
La sección «nuestro secreto» de la referencia

Y añadió cosas que nadie pidió: filtros con contador en vivo, etiquetas de temporada y sin gluten, un producto “Tarta a medida” que va a presupuesto en vez de al carrito, y un carrito real que compone un mensaje y lo manda por WhatsApp o mailto:, que es literalmente como toman los pedidos los obradores pequeños en España.

GPT-5.6 Sol tiene el mejor copy de los cuatro (“Tartas que hablan de ti”, “historias que no caben en una caja cualquiera”) y la peor carta: cuatro productos. El brief pedía que el visitante entienda qué vendemos y haga un pedido.

Límites del experimento

  • Es n=1. Una tarea, una pasada por modelo, un día concreto. Medición honesta, no ley universal.
  • Solo frontend estático. Otras cargas pueden repartirse de otra forma.
  • Fable 5 y Sol corrieron el 17 de julio; Fable 5.1, el 3 de septiembre. Los agentes se han actualizado entre medias y eso no lo he podido congelar.
  • Sol no corre en el mismo agente: va por Codex, así que mezcla modelo y agente. Es la comparación realista, no la de laboratorio.
  • Hay una discrepancia de medición que dejo declarada: el panel de uso de Claude Code marca 23,18 $ para esta sesión y mi script, leyendo el log, calcula 30,52 $. La diferencia es exactamente una partida, el recacheo en frío de los 7,23 $. No puedo determinar desde fuera cuál factura Anthropic, así que doy los dos y uso el del log para comparar con julio, porque es el mismo método que produjo los 35,09 $ de Fable 5.
  • La rúbrica de diseño (bloque cerrado sobre 22 y abierto sobre 25) de Fable 5.1 aún no está puntuada, y cuando lo esté debería hacerse a ciegas. Esto mide lo verificable por comando y navegador.

Qué modelo elegir para generar una landing

  1. Si la entrega tiene que estar terminada, Fable 5.1. Es el único de los cuatro que sacó algo enseñable a un cliente el mismo día: SEO completo, carrito funcional, cero desbordamiento, cero errores de tipos y un README que justifica cada decisión de stack. Y si vienes de Fable 5, el cambio sale gratis: mismo precio base, caché un 75% más barata.
  2. Si el precio manda y el resultado es un punto de partida, GPT-5.6 Sol. Su copy es bueno; su código no. La diferencia de coste con Fable 5.1 son 20,93 $: a 50 €/h de un freelance, unos 23 minutos. Si arreglar la entrega de Sol te cuesta más de media hora, Fable 5.1 salió más barato.
  3. No te creas el porcentaje de ahorro de la nota de prensa, ni el mío. Calcúlalo con tu propia carga. El 25% de Anthropic y mi 18,4% son el mismo modelo con perfiles de token distintos.

Esta es la misma disciplina que aplico en proyectos de cliente: el coste de un sistema de IA no se estima con la tabla de precios del proveedor, se mide con telemetría propia sobre tareas reales. Si estás decidiendo qué modelo usar y quieres números en vez de opiniones, hablamos 30 minutos.