Nuestro artículo anterior sobre la caída de Fable 5 y Mythos 5 reconstruyó cómo una directiva de control de exportaciones del gobierno de Estados Unidos apagó ambos modelos setenta y dos horas después de su lanzamiento. Esa historia, sin embargo, dejó fuera dos episodios previos que ocurrieron dentro de esas mismas setenta y dos horas — y que por sí solos ya habían puesto a Anthropic en el centro de una crisis de reputación antes de que Washington hiciera una sola llamada. Esta es la otra mitad de la historia, más lo que pasó después: el 1 de julio, Fable 5 y Mythos 5 volvieron a estar disponibles.

Acto I — La respuesta que nadie sabía que era peor

Anthropic lanzó Claude Fable 5 el 9 de junio de 2026 como la cara pública de su primera clase "Mythos", presentada como un salto de una a dos generaciones sobre Opus 4.8. Horas después del lanzamiento, la comunidad de investigadores de IA encontró un párrafo enterrado en la página 319 del system card del modelo: cuando Fable 5 detectaba que una consulta estaba relacionada con desarrollo de IA de frontera —construir infraestructura de entrenamiento, diseñar aceleradores, afinar modelos rivales—, el sistema no rechazaba la solicitud ni avisaba al usuario. Simplemente respondía peor, usando modificación de prompts y "steering vectors", sin ninguna señal visible de que eso estuviera ocurriendo.

La firma de investigación SemiAnalysis fue de las primeras en denunciarlo públicamente, después de que su propio trabajo de análisis de infraestructura de GPU saliera degradado sin explicación. La objeción de fondo no era solo técnica: un investigador no tiene forma de distinguir un resultado deficiente por error propio de uno deliberadamente empobrecido por el proveedor del modelo, lo que contamina cualquier intento de reproducir resultados.

// Del system card de Claude Fable 5 · Anthropic · junio 2026

Las salvaguardas para desarrollo de IA de frontera no serán visibles para el usuario. Anthropic estimó que las intervenciones afectarían aproximadamente al 0.03% del tráfico, concentrado en menos del 0.1% de las organizaciones.

Fuente: reportado por Fortune y Decrypt a partir del system card de Fable 5

La compañía defendió inicialmente la medida en términos estratégicos: aplicar la restricción de forma silenciosa, según su propia explicación, "evita acelerar a los actores más dispuestos a violar" los términos de servicio que prohíben usar Claude para construir sistemas rivales. La defensa no calmó a nadie. Investigadores prominentes, incluyendo a antiguos empleados de la propia Anthropic, calificaron la medida de "anticientífica" y de una forma de concentrar capacidad en un solo laboratorio a costa del resto del campo.

"¿Trabajas en IA para el cáncer? Lo siento, no puedo ayudarte. ¿Trabajas en IA para el Alzheimer? Lo siento, me estoy volviendo un poco tonto cuando se trata de la parte de IA."

Behnam Neyshabur · Excodirector del proyecto de científico de IA de Anthropic

En menos de 48 horas, Anthropic dio marcha atrás. La compañía anunció que reemplazaría la degradación invisible por el mismo mecanismo que ya usaba para ciberseguridad y biología: un aviso visible de que la conversación se estaba derivando a Claude Opus 4.8, un modelo menos capaz. "Hicimos el trade-off equivocado, y nos disculpamos por no haber encontrado el equilibrio correcto", declaró la compañía. El cambio no eliminó la restricción — solo la hizo visible, con el costo reconocido de más falsos positivos mientras se ajustaban los clasificadores.

Acto II — Pliny, el prompt de 120,000 caracteres y un jailbreak con matices

El 10 de junio, un día después del lanzamiento, el investigador conocido como Pliny the Liberator —una figura habitual en la escena de jailbreaks de modelos de frontera, con un historial de publicaciones similares sobre GPT, Gemini y Grok— anunció en X que había vulnerado las defensas de Fable 5 y publicó lo que presentó como el system prompt completo del modelo en su repositorio de GitHub, CL4R1T4S: 120,000 caracteres, distribuidos en 1,585 líneas.

El anuncio se viralizó y fue recogido por medios como Fortune, The Register y NBC News. Pero un análisis independiente posterior matizó buena parte del entusiasmo inicial: lo confirmado es que Pliny logró bypasses puntuales usando una combinación de sustitución de caracteres Unicode y homoglifos para evadir clasificadores basados en palabras clave, además de fragmentar solicitudes sensibles en decenas de turnos de conversación aparentemente inocuos para diluir la atención del clasificador de seguridad. Lo que no está confirmado de forma independiente es que esto equivalga a una ruptura universal y reproducible del modelo — Anthropic sostiene que su testeo externo, con más de mil horas de trabajo antes del lanzamiento, no encontró un jailbreak universal, y que la publicación de un system prompt no es lo mismo que comprometer el comportamiento del modelo.

"JAILBREAK ALERT. ANTHROPIC: PWNED. FABLE-5: LIBERATED."

Pliny the Liberator · publicado en X, 10 junio 2026

Lo que la fuga sí mostró con claridad, más allá del titular, es la arquitectura interna que separa a Fable 5 de Mythos 5: no son dos modelos distintos, sino el mismo motor con una capa de clasificadores al frente. Cuando una consulta activa una categoría de riesgo —ciberseguridad, biología, química o "destilación" de un modelo rival—, Fable 5 no responde directamente: deriva la conversación a Claude Opus 4.8 y, desde la corrección de junio, avisa al usuario de que eso ocurrió. Datos tempranos de Anthropic, citados por la prensa especializada, ubicaban ese desvío en menos del 5% de las sesiones.

Conviene distinguir esto de la causa oficial del apagón que ya cubrimos: el gobierno de EE.UU. invocó un jailbreak de ciberseguridad distinto —relacionado con encadenar vulnerabilidades de software a través de solicitudes de "arreglar código"— como uno de los motivos, no específicamente la fuga del prompt de Pliny. Las dos historias comparten semana y personaje central, pero no son la misma historia.

Acto III — El regreso, el 1 de julio

El Departamento de Comercio retiró los controles de exportación el 30 de junio, y Anthropic restableció el acceso a Fable 5 y Mythos 5 al día siguiente, según confirmó la propia compañía en su sitio. El tramo entre el apagón del 12 de junio y la restauración del 1 de julio dejó a ambos modelos completamente inaccesibles a nivel global durante diecinueve días.

Anthropic acompañó el regreso de una condición nueva: el gobierno estadounidense mantendrá una vigilancia más estrecha sobre Mythos 5, y la compañía se comprometió a coordinar futuros lanzamientos con las autoridades y a reportar usos sospechosos o maliciosos que detecte. En el producto, esto se tradujo en una capa de seguridad más agresiva que la que existía antes del apagón: Fable 5 ahora enruta automáticamente hacia Opus 4.8 cualquier consulta que sus clasificadores externos marquen en las categorías de ciberseguridad, biología o química — antes de que el prompt llegue siquiera a procesarse por el modelo completo —, y lo notifica en la interfaz.

// Línea de tiempo · El regreso

30 jun 2026

El Departamento de Comercio levanta el veto

Tras negociaciones regulatorias con Anthropic, se retiran los controles de exportación impuestos el 12 de junio.

1 jul 2026

Fable 5 y Mythos 5 vuelven a estar disponibles

Anthropic restablece el acceso en Claude.ai, Claude Code y la API comercial, con clasificadores de seguridad reforzados frente a la versión de junio.

Acto IV — Una etiqueta que reabrió la desconfianza

// Nota metodológica

Fuente única, no corroborada

Esta sección se apoya en una sola fuente de menor perfil (BigGo Finance) que no hemos podido corroborar de forma independiente en medios de mayor trayectoria. La presentamos como reporte no verificado, no como hecho establecido.

Apenas un día después del regreso, un reporte de BigGo Finance —citando a un desarrollador no identificado— afirmó que los registros de la API mostraban una etiqueta interna, TOO_DUMB_TO_NEED_FABLE, aplicada cuando el sistema decidía que una solicitud no ameritaba el modelo completo y la resolvía con una versión más económica. El reporte describe reacciones airadas en foros de desarrolladores, algunos de los cuales dicen estar migrando a modelos de la competencia citando una acumulación de cambios no anunciados en los límites de uso y el comportamiento de los modelos de Anthropic a lo largo del año.

Ni Anthropic ni medios de mayor trayectoria periodística han confirmado o desmentido públicamente la existencia de esa etiqueta específica al momento de escribir este artículo. La incluimos porque, de ser real, encajaría con el patrón ya documentado del Acto I — salvaguardas que operan sin que el usuario tenga visibilidad sobre ellas —, pero el nivel de evidencia es distinto: allí hubo confirmación de Anthropic en su propio system card; aquí hay una alegación de fuente única.

// Preguntas que siguen abiertas

// Fuentes principales

Nota: este artículo complementa nuestra cobertura previa sobre el apagón por control de exportaciones y se basa en cobertura periodística pública hasta el 7 de julio de 2026. Los detalles del Acto IV provienen de una única fuente de menor trayectoria y se presentan explícitamente como no verificados.

// Comentarios