
GPT-6 Astra vs Claude Fable 5.1: qué muestran las primeras pruebas
Arena sitúa a Fable primero; una prueba en Paint favorece a Astra. Contrastamos los tweets, los benchmarks y los costes para entender qué demuestra cada resultado.
Arena pone a Fable primero. Conviene leer la letra pequeña
El tweet de Arena parece resolver la comparación: Max entra en Agent Arena en primera posición. La publicación habla de más de 6.700 sesiones reales, una mejora neta del 15,8% y un coste mediano de 4,14 dólares por tarea. Es un buen punto de partida para comparar y , siempre que sepamos qué se está midiendo.
La tabla de Agent Arena consultada el 6 de septiembre recoge 6.796 sesiones y 4,19 dólares por tarea para . El tweet conserva otra captura de esos datos. no figura en esa tabla: el primer puesto de no demuestra una victoria directa frente a él.
Tampoco significa que complete un 15,8% más de tareas que . La metodología de Agent Arena combina señales de uso, como éxito confirmado, respuesta a correcciones y recuperación de errores. Su mejora neta es una medida propia. Leerla como porcentaje de aciertos cambia el significado del resultado.
La comparación se vuelve más interesante cuando miramos qué hace cada modelo con una tarea concreta. Ahí entra una prueba bastante menos solemne: dibujar a alguien en Paint.
La prueba de Paint: aquí Astra deja mejor impresión
Alexey Fateev, @superalesha, cuenta que dio la misma foto a ambos modelos y les pidió que lo dibujaran en Paint mediante uso del ordenador. El vídeo muestra a construyendo un retrato angular con sombras y proporciones más próximas a la fotografía; termina con una versión más esquemática, de aspecto caricaturesco.
Nuestra lectura visual favorece a en este ejemplo. La diferencia se entiende sin mirar una puntuación: basta comparar los retratos con la referencia. Además del parecido, interesa el procedimiento. Según la prueba publicada, los modelos usan una aplicación de dibujo; no estamos comparando dos generadores de imágenes a partir de texto.
El vídeo no basta para saber cuántos intentos hizo el autor, si igualó el tiempo disponible o qué ajustes exactos utilizó. Sirve para detectar una capacidad prometedora y proponer una prueba propia. No permite concluir que siempre dibuje mejor ni que sea peor programando. LetBrand ha revisado el material publicado; no ha reproducido esta comparación en ambos modelos.
Astra gana en WebDev; los demás resultados cambian
En Code Arena WebDev, la tabla fechada el 5 de septiembre coloca a Max por delante de Max: 1.797 frente a 1.762 puntos. Ambos conservan un rango estimado de posición entre el primero y el segundo. Hay una ventaja en esa clasificación, con incertidumbre todavía visible.
WebDev y Agent Arena responden a preguntas distintas. En la evaluación de desarrollo web, los usuarios comparan aplicaciones generadas y votan. Una preferencia por el resultado de una web no equivale a demostrar que un modelo resuelve mejor cualquier trabajo con herramientas.
El ejemplo compartido por @MSchwaibold aporta otra muestra visual: una tarjeta de interfaz con imágenes y una retícula que señala sus dimensiones. El autor destaca la generación de UI de . Nos sirve para valorar el acabado que enseña; el vídeo no verifica accesibilidad, mantenimiento ni ausencia de errores en el código.
Otros resultados ayudan a poner esa ventaja en contexto:
- El Intelligence Index v4.2 de Artificial Analysis, publicado el 4 de septiembre, sitúa a primero y a segundo. Esta versión cambia pruebas y pesos; las puntuaciones de versiones anteriores no son intercambiables.
- En Terminal-Bench 2.1 evaluado por Artificial Analysis, Max obtiene un 91,4% y High un 89,9%. La evaluación utiliza Terminus 2, 89 tareas y tres repeticiones por tarea. Las configuraciones de esfuerzo tampoco son idénticas.
- La tabla de lanzamiento de OpenAI da a un 57,9% y a un 55,8% en . Son otra versión y resultados publicados por el fabricante.
Por eso, decir «Astra gana Terminal-Bench» sin indicar versión y evaluador induce a error. La aplicación que coordina al modelo, las herramientas disponibles y los ajustes también forman parte del resultado.
Dos lanzamientos cercanos, costes que hay que separar
Anthropic lanzó Fable 5.1 el 1 de septiembre. OpenAI anunció Astra el 3 de septiembre. Las primeras impresiones llegan mientras los usuarios todavía descubren cómo trabajan y qué acceso tienen en sus cuentas.
En API, las fichas de Fable y Astra muestran el mismo precio base por millón de : 10 dólares de entrada y 50 de salida. La cuesta 0,25 dólares en y 1 dólar en . Esa diferencia afecta al texto reutilizado; no convierte toda una tarea en cuatro veces más barata. también especifica recargos para entradas de más de 272.000 tokens y tarifas según modalidad.
anuncia una reducción del 75% en lectura de caché respecto a Fable 5. La referencia es su versión anterior. Conviene distinguir ese ahorro del coste total y de la cuota mensual de o .
Si utilizas una suscripción, revisa el acceso y los límites de tu cuenta antes de decidir. Un coste de API o el coste mediano de Agent Arena no dice cuántas tareas podrás hacer con tu plan.
Lo que todavía no podemos afirmar
La afirmación de que alucina menos que necesita una comparación específica. El lanzamiento de muestra mejoras frente a , pero no aporta un resultado de para esa medida. No usaremos esa tabla para dar por ganada una comparación que no contiene.
Algo parecido ocurre con «los usuarios prefieren Fable para programar». Los testimonios pueden describir experiencias útiles; los tweets de este artículo no constituyen una encuesta representativa. Para tu trabajo importa qué sucede con tus archivos, tus herramientas y tus criterios de aceptación.
Qué probar antes de cambiar de modelo
Si lo que te interesa es crear una interfaz o manejar una aplicación visual, los resultados de WebDev y el ejemplo de Paint dan motivos para empezar probando . Si ya programas con , su posición en los índices revisados justifica compararlo con calma antes de sustituirlo. Son puntos de partida, no garantías.
Una prueba pequeña puede resultar más útil que otra tarde leyendo rankings:
- Entrega a ambos el mismo fallo reproducible, con un test que deba pasar. Comprueba también si introducen cambios innecesarios.
- Pide la misma pantalla y revísala en móvil: navegación, texto, estados vacíos y errores. Una captura bonita no verifica el funcionamiento.
- Dales el mismo documento y exige que cada conclusión señale dónde se sostiene. Anota datos inventados, omisiones y correcciones necesarias.
Mantén iguales las instrucciones, los archivos y el tiempo disponible. Guarda la versión, la aplicación utilizada y el nivel de esfuerzo. Repite los casos que más te importen y registra cuánto trabajo de revisión queda. Así podrás distinguir un resultado vistoso de una herramienta que te ayuda de forma consistente.
Para consultar las fichas de ambos modelos juntas, abre nuestra comparativa de Claude Fable 5.1 vs GPT-6 Astra. Complementa los ejemplos de este artículo con los datos disponibles en el catálogo.
Puedes usar el comparador de precios de IA de LetBrand para explorar costes de API y contrastarlos con las fichas oficiales. Después, elige con una tarea real delante: el modelo que merece quedarse es el que te entrega trabajo aprovechable con una revisión razonable.
Explora los modelos del artículo
Compara lo que te importa
USD por millón de tokens · tarifas del catálogo
| Característica | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Entrada | $10 | $10 |
| Salida | $50 | $50 |
| Caché | $1 | $0,25 |
GPT-6 Astra · Fuente: openrouter.ai ↗ · Consultado 5 sept 2026
Claude Fable 5.1 · Fuente: openrouter.ai ↗ · Consultado 5 sept 2026
Ver comparación completa →Listo para empezar tu proyecto?
Hablemos de cómo podemos ayudar a tu marca a crecer con una estrategia digital personalizada.
Contáctanos