IA · 10 MIN

GPT-6 Astra frente a Claude Fable 5.1: una comparación honesta

La mayoría de las tablas comparativas sobre estos dos modelos no resisten un examen. Este artículo explica por qué y señala el pequeño conjunto de cifras que sí se sostiene.

GPT-6 Astra frente a Claude Fable 5.1: una comparación honesta
UBICACIÓN
Alemania
AUTOR
Aashwin Shrivastava
PUBLICADO
10 sept 2026
IMAGEN
GENERADO CON IA

Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.

Desde principios de septiembre de 2026 hay dos modelos de frontera que una empresa alemana puede sopesar en serio uno frente a otro: Claude Fable 5.1 de Anthropic, publicado el 1 de septiembre, y GPT-6 Astra de OpenAI, en vista previa limitada desde el 3 de septiembre y de disponibilidad general desde el 4 de septiembre. Buena parte de las tablas comparativas que circulan desde entonces no es rigurosa, y no por mala fe, sino porque cifras procedentes de marcos de medición distintos acaban en la misma columna. Este artículo procede al revés: primero descarta las comparaciones que no se sostienen y luego nombra las pocas que sí. Al final queda la columna que realmente decide una cuestión de arquitectura en Alemania, y no es una fila de benchmark.

01. La tabla que casi todo el mundo publica está rota

La frase más frecuente en la cobertura actual viene a decir esto: los propios benchmarks de Anthropic situarían a Claude Fable 5.1 por delante de GPT-6 Astra. Esa frase es falsa, y basta un calendario para refutarla.

Anthropic publicó su tabla de benchmarks el 1 de septiembre de 2026. La columna de comparación lleva ahí la denominación GPT-5.6 Sol. GPT-6 Astra pasó a vista previa limitada el 3 de septiembre y a disponibilidad general el 4 de septiembre. Anthropic, por tanto, no solo no midió Astra: no podía medirlo, porque el modelo no era público en la fecha de publicación.

Quien lee la fila de Terminal-Bench 4.0, donde 55,8 % para Fable 5.1 se enfrenta a 37,3 %, y toma ese 37,3 % por Astra, está comparando el modelo actual de Anthropic con el predecesor del competidor. No es un error de redondeo, es otra afirmación. Y es justamente la lectura errónea que hoy se propaga más rápido por agregadores y resúmenes.

El valor de este artículo reside, pues, menos en las cifras que en la clasificación: qué comparaciones se sostienen, cuáles no y en qué se reconoce la diferencia.

02. Lo que realmente se compara de igual a igual

Queda un núcleo pequeño pero limpio. Todas las filas de la tabla siguiente proceden de la documentación de modelo de Anthropic, de la página de precios de Anthropic y de la documentación para desarrolladores de OpenAI sobre gpt-6-astra, consultadas el 10 de septiembre de 2026. Son declaraciones de cada proveedor sobre su propio producto, en la misma unidad y sin marco de medición de por medio.

CaracterísticaClaude Fable 5.1GPT-6 Astra
Publicación1 de septiembre de 20263 de septiembre de 2026 (vista previa), 4 de septiembre de 2026 (general)
Identificador de APIclaude-fable-5-1gpt-6-astra
Entrada / salida por millón de tokens10 / 50 USD10 / 50 USD
Lectura de caché por millón de tokens0,25 USD1,00 USD
Escritura de caché por millón de tokens12,50 USD (5 min) / 20 USD (1 h)12,50 USD
Salida máxima128K tokens128K tokens
Modalidadtexto e imagen de entrada, texto de salidatexto e imagen de entrada, texto de salida
Fecha de corte de conocimientojunio de 202630 de abril de 2026

Una salvedad corresponde a la fila de escritura de caché: Anthropic vende dos duraciones de retención, cinco minutos y una hora, mientras que OpenAI no publica ningún tramo equivalente. Los dos importes de 12,50 USD están próximos, pero no son perfectamente paralelos.

La fila económicamente interesante es la lectura de caché. Un factor cuatro a favor de Anthropic suena a partida menor, pero en el trabajo agéntico no lo es: allí el mismo contexto, repositorio, instrucción de sistema y descripciones de herramientas se relee una y otra vez a lo largo de cientos de pasos. El propio Anthropic cifra el ahorro resultante en alrededor del 25 % frente a Fable 5 en cargas típicas y hasta alrededor del 45 % en cargas muy agénticas. Esa cifra es un cálculo de modelo del proveedor, no una bajada de precio: los precios de lista de entrada y salida no han cambiado, y una carga con pocos aciertos de caché no ahorra prácticamente nada.

Dos partidas más pertenecen a cualquier cálculo. La API Batch de Anthropic reduce a la mitad ambos sentidos, a 5 USD de entrada y 25 USD de salida por millón de tokens. Y fijar la inferencia en Estados Unidos en Anthropic aplica, según la documentación de Anthropic sobre residencia de datos, un multiplicador de 1,1 sobre entrada, salida, escrituras y lecturas de caché.

03. Terminal-Bench 4.0: la única cifra con una verificación cruzada real

Una fila de benchmark merece aquí una confianza particular, por un motivo que rara vez se explica.

El 1 de septiembre de 2026, Anthropic indica para Claude Fable 5.1 en Terminal-Bench 4.0 un 55,8 %. En los resultados que OpenAI comunica para GPT-6 Astra, recogidos por DataCamp el 3 de septiembre de 2026 y etiquetados allí expresamente como cifras del proveedor, Astra aparece con 57,7 % y Fable 5.1 figura con un 55,8 % inalterado.

Ambos proveedores llegan, pues, de forma independiente a la misma cifra para el modelo del otro bando. Es la verificación individual más sólida disponible en toda esta comparación. Un proveedor tiene poco incentivo para puntuar al alza a un competidor, y cuando dos partes con intereses opuestos comunican la misma cifra, eso apunta a que la cifra sobrevive al montaje en lugar de ser una medición doméstica.

Aun así quedan dos limitaciones. Primera: ninguna de las dos publicaciones indica con qué harness, qué scaffold y qué nivel de esfuerzo se midió. Segunda: la distancia de 1,9 puntos porcentuales es lo bastante pequeña como para proceder exactamente de esos factores. La lectura defendible es, por tanto: en Terminal-Bench 4.0 ambos modelos están próximos según los datos de los dos proveedores, con una ligera ventaja de Astra según la medición de OpenAI.

04. Lo que no es comparable, y por qué

La mayor parte de las cifras publicadas no pertenece a una tabla común. No es formalismo, es la diferencia entre una base de decisión y un muro de números.

  • OSWorld 2.0. Anthropic da dos valores para Fable 5.1, 77,9 % con crédito parcial y 41,7 % con puntuación estricta. Del lado de OpenAI figura para Astra un valor único de 72,6 %, sin indicación del modo de puntuación. Enfrentar 72,6 a 77,9 es tan infundado como enfrentarlo a 41,7. Mientras el modo de puntuación no coincida, aquí no hay comparación, solo selección.
  • Ventana de contexto. Anthropic indica 1.000.000 de tokens, OpenAI 1.050.000 con una entrada máxima de 922.000 tokens. Estas cifras no son una medida de capacidad en la misma escala, porque un token significa algo distinto según el tokenizador. Anthropic escribe él mismo que su tokenizador actual produce alrededor de un 30 % más de tokens para el mismo texto que el suyo anterior. No hay públicamente ninguna cifra de tokens por palabra entre proveedores, de modo que la pregunta de qué modelo alberga más texto no puede responderse desde fuentes abiertas.
  • AutomationBench. Anthropic publica un 31,4 % para Fable 5.1. En su propia publicación de anuncio, OpenAI reclama el primer puesto en el mismo benchmark pero no da allí ninguna cifra. Sencillamente no hay nada que comparar.
  • Filas en las que la cifra de Claude no procede de Anthropic. Para ScreenSpot-Pro, FrontierMath Tier 4 v2, ExploitBench, ARC-AGI-3, GPQA Diamond y FrontierCode 1.1 solo existen valores del lado de OpenAI. La cifra de Claude en esas filas es la medición de Claude realizada por OpenAI y, en varios casos, una medición de Claude Fable 5 o Claude Opus 5, no de Fable 5.1. Atribuirla a Anthropic supone citar la fuente equivocada y, en parte, el modelo equivocado.
  • Niveles de esfuerzo. Ambos proveedores permiten un cómputo variable por petición. En Anthropic incluso el valor por defecto difiere según la superficie: high en Claude Code, medium en claude.ai y Claude Cowork. Artificial Analysis mide en los niveles «max» y «xhigh». Una cifra de benchmark sin nivel de esfuerzo declarado no es comparable con una cifra obtenida en otro nivel. No es una sutileza: es la razón más probable de que una misma clasificación muestre tres resultados en tres sitios web.

Un caso particular merece una advertencia: el 99,9 % que circula para Astra en ARC-AGI-3 lleva en la fuente la coletilla «harness adaptador» y aparece junto a un 7,8 % del modelo anterior. Un salto de unos 92 puntos a través de un cambio de harness describe primero el harness y solo después el modelo. Esa cifra no pertenece a ningún titular.

05. Las clasificaciones de terceros se contradicen abiertamente

Quien desconfía de las cifras del proveedor recurre a clasificaciones independientes. En este caso no ayuda, porque las clasificaciones se contradicen entre sí, y sobre un único y mismo índice.

Artificial Analysis, en su propio artículo del 3 de septiembre de 2026, da para el Intelligence Index: GPT-6 Astra 61, GPT-5.6 Sol 61, Claude Fable 5.1 66, este último en el nivel de esfuerzo máximo con una configuración de reserva que no es el valor por defecto de la API. BenchLM recoge el mismo índice de otra forma en septiembre de 2026: GPT-5.6 Sol encabeza con 58,9 % y Fable 5.1 queda en 53,7 %. llm-stats, consultado el 10 de septiembre de 2026, sitúa a Fable 5.1 en 56,8, a Astra en 54,7 y a Claude Opus 5 en 54,1.

Tres fuentes, un índice, tres ordenaciones. No pueden estar todas al día. Como causas plausibles cabe pensar en fechas de corte distintas, ajustes de esfuerzo distintos y la mezcla de puntos con porcentajes. La consecuencia práctica es sencilla: un valor del Intelligence Index sin mención del sitio, la fecha y el nivel de esfuerzo no es información. Artificial Analysis, por lo demás, señala resultados dispares, entre ellos una caída de unos 80 puntos Elo en GDPval-AA v2.

Queda la arena. Tampoco allí hay nada que obtener: ni Claude Fable 5.1 ni GPT-6 Astra tienen una posición clasificada en LMArena en las instantáneas de septiembre de 2026 accesibles aquí, porque el Elo de arena necesita volumen de votos y va semanas por detrás de los lanzamientos de frontera. Aun si existieran esos valores, serían el instrumento equivocado para esta decisión. La preferencia humana por comparación ciega mide la calidad percibida de las respuestas sobre indicaciones elegidas por quien vota, reacciona con fuerza al formato y a la extensión y dice poco del trabajo agéntico a lo largo de plazos amplios. Para un agente de programación o una plataforma de trabajo del conocimiento, no es la vara de medir con la que alinear una compra.

06. FrontierCode 1.1: la cifra que juega en contra de quien la publica

Hay en esta comparación una fila que pesa más que las demás, por un motivo metodológico. En FrontierCode 1.1, GPT-6 Astra queda según los resultados comunicados por la propia OpenAI en 53,3 %, es decir, por detrás de Claude Fable 5 con 53,5 %.

Dos precisiones son aquí obligadas. El valor de comparación corresponde a Claude Fable 5, no a Fable 5.1, y Anthropic no ha publicado ninguna cifra propia para Fable 5.1 en este benchmark. La distancia es de 0,2 puntos porcentuales y queda, por tanto, dentro de cualquier dispersión de medición plausible.

Aun así, es el tipo de cifra más digno de confianza que puede contener un anuncio de producto. Un proveedor que publica una fila en la que su nuevo buque insignia queda por detrás de un modelo ajeno no tiene ningún incentivo comercial para hacerlo. Quien quiera valorar cuánto sostiene una tabla de benchmarks debería mirar primero si en ella aparecen filas así. Una tabla en la que el proveedor que la publica gana todas y cada una de las filas no es una medición, es una selección.

07. El sentido se invierte: residencia de datos en la UE y retención cero

Hasta aquí Anthropic va por delante en precio y economía de caché y está aproximadamente a la par en los benchmarks. En gobernanza de datos la imagen se invierte por completo, y para una empresa alemana esa es la columna que cambia una arquitectura.

CaracterísticaClaude Fable 5.1GPT-6 Astra
Inferencia en región UENo, solo us y globalSí, mediante eu.api.openai.com para el EEE y Suiza
Región de almacenamientoSolo Estados UnidosEuropa seleccionable por proyecto
Retención cero de datosNo disponible, Covered Model con retención obligatoria de 30 díasDocumentada para los principales puntos finales de inferencia, sujeta a aprobación
Entrenamiento con datos de API del clienteNo, no sin permiso expresoNo, no sin consentimiento explícito

Del lado de Anthropic, esto figura en su propia documentación. El parámetro inference_geo acepta exactamente dos valores, global y us, y como región de almacenamiento de un espacio de trabajo solo puede elegirse us, fijada en el momento de crearlo. El lado de la retención es aún más explícito: Anthropic designa a Fable 5.1 y Mythos 5.1 (así como a Fable 5 y Mythos 5) como Covered Models que exigen una retención de datos de 30 días y no están disponibles bajo retención cero salvo autorización expresa de Anthropic. Una organización con ZDR debe activar la retención de 30 días para un espacio de trabajo concreto, o la petición se rechaza.

Del lado de OpenAI, la documentación para desarrolladores sobre el tratamiento de datos indica que Europa (EEE y Suiza) admite tanto almacenamiento regional como procesamiento regional a través de eu.api.openai.com, configurado por proyecto, y que las regiones fuera de Estados Unidos requieren aprobación para los controles de supervisión de abusos y una adenda de retención modificada. La misma página enumera los puntos finales aptos para ZDR, entre ellos /v1/chat/completions y /v1/responses, y excluye expresamente Assistants, Threads, Vector Stores, el ajuste fino y Batches.

Aquí la precisión importa más que una formulación redonda: ninguna fuente encontrada afirma positivamente que GPT-6 Astra sea apto para ZDR. Lo documentado es que esos puntos finales admiten ZDR y que para gpt-6-astra no se publica ninguna exclusión específica de modelo. Pero la ausencia de una restricción no es un permiso. Quien base en ello una arquitectura debería hacer que se lo confirmen contractualmente en lugar de deducirlo de un vacío documental. En Anthropic la situación es inequívoca en sentido contrario, porque la exclusión está escrita.

También conviene corregir una frase muy repetida: «Claude tiene residencia de datos en la UE porque se ejecuta en AWS Fráncfort». Eso es cierto precisamente cuando se obtiene Claude a través de una nube asociada como Amazon Bedrock o Google Cloud, donde el proveedor de nube fija la región y actúa como encargado del tratamiento. No vale para la API propia de Anthropic. Para un enrutamiento regional garantizado, Anthropic remite él mismo a los puntos finales regionales de las nubes asociadas, con un recargo del 10 % frente a los puntos finales globales. Para una revisión del RGPD esa distinción es el punto central, porque determina con quién se firma el contrato de encargo de tratamiento.

08. Artículo 50: una diferencia que solo puede probarse a medias

Desde el 2 de agosto de 2026 se aplican las obligaciones de transparencia del artículo 50 del Reglamento de IA, que exigen un marcado legible por máquina de los contenidos sintéticos. Anthropic señala que Fable 5.1 y Mythos 5.1 llevan desde el primer día una marca de agua invisible en el texto, y aplica ese marcado en todo el mundo y no solo en la UE. Hasta donde alcanzan las fuentes disponibles, es una diferencia real.

Esa frase necesita, sin embargo, sus dos mitades. No se ha encontrado ninguna fuente que indique si la salida de texto de GPT-6 Astra está marcada. El enfoque de procedencia documentado de OpenAI, los Content Credentials de C2PA junto con SynthID, se refiere a imagen y audio; las páginas accesibles no dicen nada sobre el texto. De ese vacío no se sigue que OpenAI no marque el texto. Por eso no lo afirmamos. OpenAI publica por separado orientaciones para clientes sobre el Reglamento de IA.

Y la marca de agua de Anthropic sostiene menos de lo que el término sugiere. Anthropic escribe en su propia ayuda que una marca detectada indica que un contenido puede haber sido procesado por Claude, que no es plenamente concluyente y que por sí sola no confirma la procedencia del contenido. La API de detección correspondiente se encuentra además en vista previa privada para organizaciones seleccionadas. Como pieza de una argumentación de cumplimiento, la marca de agua es utilizable; como medio de prueba, no.

09. Qué significa esto para una decisión en Alemania

Si de esta comparación se lleva usted una sola regla, que sea esta: con dos modelos de frontera próximos en las cifras defendibles y con precios de lista idénticos, rara vez decide una fila de benchmark. La distancia en Terminal-Bench 4.0 es de 1,9 puntos porcentuales sin harness declarado. En FrontierCode 1.1 son 0,2 puntos en sentido contrario, frente a un modelo Claude anterior. Distancias así se desplazan con el siguiente lanzamiento y no cambian ninguna arquitectura.

Lo que sí cambia una arquitectura está en la columna de gobernanza. Una organización obligada a la retención cero no puede emplear Claude Fable 5.1 a través de la API propia de Anthropic sin autorización expresa, por bueno que sea el modelo. Una organización que exija inferencia dentro de la UE encuentra esa vía en Anthropic solo a través de una nube asociada, con el recargo correspondiente y otro encargado del tratamiento en el contrato. A la inversa, la ventaja de Anthropic en la lectura de caché es real y crece con la proporción de trabajo agéntico en el que el mismo contexto se lee cientos de veces.

En la práctica: aclare primero las obligaciones, después los costes y al final los benchmarks. En el orden inverso construirá un sistema que mide bien y fracasa en la conversación sobre protección de datos. Y de cada cifra que le muestren, compruebe tres cosas: quién la comunicó, cuándo y con qué nivel de esfuerzo.

Lo que el lanzamiento en sí cambió para una empresa alemana lo tratamos en nuestro artículo sobre Claude Fable 5.1. Cómo se comporta el modelo en el trabajo de proyecto en curso lo tratamos en capacidades en la práctica. Y si la respuesta a la pregunta de gobernanza es que los datos no pueden salir de casa, el camino pasa por la ponderación entre on-premise y nube, no por una clasificación.

← Signals

Wayne Dyer

“Si cambias la forma en que miras las cosas, las cosas que miras cambian.”