Resumen:
¡Fable 5.1 y Mythos 5.1 lanzados! Ocupó el primer lugar en las 8 pruebas de referencia públicas y el precio bajó hasta un 45%. Especialmente en las áreas de investigación científica y codificación, claramente ha dejado atrás a Fable 5 y a su vecino GPT-5.6 Sol. Desde una perspectiva más intuitiva, ahora ejecutando Fable 5.1 con niveles de inferencia medios y bajos, el rendimiento es básicamente equivalente a la versión anterior de Mythos 5 con un nivel de inferencia extremadamente alto o incluso el más alto. En esta ola, "Fable" mató a "Mythos".


En términos de precio, Fable 5.1 redujo el precio de lectura de caché a 0,25 dólares estadounidenses por millón de tokens, una reducción del 75 %.
Los precios de entrada y salida son consistentes con Fable 5, a $10 y $50 por millón de tokens respectivamente.
Parece que solo se ha reducido un precio, pero el impacto real es relativamente grande, porque en la tarea del agente, la lectura de caché representa la mayor parte del costo.
Los datos proporcionados por Anthropic son que el coste de las cargas de trabajo típicas es aproximadamente un 25% menor que el de Fable 5. Si es una tarea muy inteligente, puede ahorrar hasta un 45%.

El vídeo de lanzamiento oficial tiene algo que decir:
No importa qué tarea le hayas pedido a Claude que realizara antes, Fable 5.1 puede hacer más y hacer mejor las partes más difíciles.

Hace esto porque es bueno para manejar tareas de varios pasos.
En este tipo de tarea, si ocurre un pequeño error en el segundo paso, todo colapsará en el paso 40, pero Fable 5.1 puede proporcionar resultados estables durante todo el proceso.
Si encuentra un problema que no se puede resolver, le indicará qué soluciones ha probado y dónde está atascado.
El investigador Flix Rieseberg también mencionó específicamente que en términos de escritura, Fable 5.1 reduce el uso de fuentes en negrita, usa menos títulos, listas o comillas y sigue mejor las pautas de estilo.
Por cierto, ¿puedes abrir el código fuente de tus consejos de estilo?

Sigue siendo fiel a su estilo, Fable 5.1 está abierto a todos los usuarios, y Mythos 5.1 solo está disponible para organizaciones de ciberseguridad y ciencias biológicas examinadas a través del programa Trusted Access.
Investigación científica práctica: diseño de proteínas, generación de mapas de Venus, aceleración de GPU
Además de publicar partituras, Anthropic también demostró los resultados prácticos de Fable 5.1 y Mythos 5.1 en el campo de la investigación científica.
En términos de diseño de proteínas, Anthropic utilizó Mythos 5.1 para utilizar herramientas de plegado y diseño de proteínas de código abierto para diseñar proteínas de unión de alta afinidad, y envió el plan a dos instituciones externas para su verificación experimental.
En tres objetivos, la afinidad de unión del diseño Mythos 5.1 fue 10 veces mayor que la de la mejor solución en el concurso de diseño de proteínas Adaptyv Bio. En los 12 objetivos, la tasa de acierto fue cercana al 50 por ciento, en comparación con la tasa de acierto típica del 10 al 15 por ciento en el campo actual del diseño de proteínas.
Las proteínas de unión de alta afinidad son el primer paso en muchos procesos comunes de desarrollo de fármacos y determinan directamente si el fármaco puede funcionar en dosis más bajas.

En astronomía, Fable 5.1 entrenó una red neuronal basada en imágenes de radar tomadas por la nave espacial Magellan de la NASA hace más de 30 años para generar un nuevo mapa topográfico de alta resolución de un tercio de la superficie de Venus.
Los mapas topográficos disponibles anteriormente solo cubrían una quinta parte de Venus, con resoluciones de entre 10 y 20 kilómetros. Fable 5.1 aumenta la resolución de 2 a 3 kilómetros y la precisión de la altura es un 25% mayor que antes. Este mapa se ha publicado como código abierto bajo una licencia CC y se utilizará como referencia para las próximas misiones VERITAS de la NASA y EnVision de la ESA para ayudar a identificar características geológicas clave para futuras observaciones.

En términos de biología computacional, Mythos 5.1 mejora la velocidad de ejecución de 7 modelos de aprendizaje profundo de código abierto hasta 2,5 veces al escribir núcleos de GPU personalizados y almacenar en caché los resultados intermedios, y el resultado es completamente consistente.

En la investigación real, es posible que los biólogos necesiten ejecutar estos modelos miles de veces, probando todas las mutaciones posibles cerca de cada gen humano. Los modelos optimizados pueden reducir los costos de GPU entre un 30% y un 60%.

Este tipo de optimización suele tardar varias semanas en completarse por parte de un equipo de ingeniería de rendimiento, y muchos laboratorios académicos simplemente no pueden permitírselo. Sin embargo, Mythos 5.1 lo hizo en sólo unos días y se basó únicamente en código fuente abierto.
Anthropic planea abrir el código fuente de estas optimizaciones en un futuro próximo.
El mecanismo anti-destilación está en línea
Con el lanzamiento de Fable 5.1, existen algunas regulaciones especiales y cambios de API.
Primero, hablemos brevemente sobre la seguridad.
La tasa de falsos positivos de seguridad de la red de Fable 5.1 es un 60% menor que la de Fable 5. Ahora se permite su uso para descubrir vulnerabilidades de software, pero el desarrollo de exploits aún está prohibido. Las tareas de doble propósito, como pruebas de penetración, generación de exploits, escaneo de vulnerabilidades basado en binarios, etc., aún se redireccionarán al modelo de la serie Opus.
Las tasas de falsos positivos para preguntas médicas y de biología básica se han reducido en un 85%, pero las consultas relacionadas con la investigación y el desarrollo de ciencias biológicas aún se envían al procesamiento del modelo Opus, y los profesionales deben obtener acceso a través del Programa de validación de ciencias biológicas (LSVP) de Mythos 5.1.
Entonces hablemos del mecanismo antidestilación recién agregado.
A partir de hoy, las cuentas API recién registradas no pueden editar manualmente el contexto de Claude en múltiples rondas de conversaciones mientras conservan los registros de la cadena de pensamiento.
Existe una técnica común que se ha registrado públicamente antes: alterar manualmente el contexto previo de Claude en múltiples rondas de conversaciones, pero retener deliberadamente el registro de la cadena de pensamiento. Esto permite que el modelo reproduzca el razonamiento que produjo bajo otro conjunto de instrucciones bajo un nuevo conjunto de instrucciones, posiblemente contradictorio.
Esta carretera ahora está bloqueada.

El enfoque consiste en agregar una firma a cada bloque de la cadena de pensamiento.
Cuando el usuario envía la respuesta del asistente a la API en solicitudes posteriores, el sistema usará esta firma para hacer dos cosas: verificar si el modelo actual tiene derecho a leer este bloque y verificar si toda la conversación anterior a este bloque (incluidas las palabras de aviso del sistema, la lista de herramientas y todos los mensajes históricos) es exactamente la misma que cuando se generó originalmente.
La verificación de firma fallará cada vez que se toque algo en la conversación.
Qué hacer después de una falla depende de un parámetro prefix_mismatch_behavior establecido por el desarrollador: el valor predeterminado es "error", que devuelve directamente un código de estado 400 y la solicitud se rechaza; si está configurado en "drop_block", el sistema eliminará silenciosamente el bloque y todas las cadenas de pensamiento posteriores, y la solicitud en sí se ejecutará como de costumbre.
La parte descartada no se cuenta (las personas son un poco raras) y aparecerá en la matriz input_transformations en la respuesta.

¿Qué operaciones provocarán un error de verificación?
La documentación proporciona una lista detallada: editar, reorganizar o eliminar cualquier mensaje anterior de usuario/asistente/sistema, cambiar la palabra de aviso del sistema de nivel superior, realizar adiciones, eliminaciones o cambios de nombre a la lista de herramientas, eliminar un bloque de cadena de pensamiento del historial de conversación pero conservar bloques posteriores y hacer referencia a una imagen o URL de documento que devolvió contenido diferente entre solicitudes.
Cualquiera de los anteriores hará que todos los bloques de la cadena de pensamiento posteriores dejen de ser válidos.

Por el contrario, algunas operaciones son seguras:
Agregar nuevos mensajes al final de la conversación, eliminar el bloque de la cadena de pensamiento desde el comienzo del historial, cambiar los parámetros de solicitud como max_tokens, aumentar o disminuir las etiquetas cache_control y la compactación del lado del servidor o la edición de contexto no desencadenarán fallas de verificación.
También hay un diseño de verificación en cadena. Cada bloque de la cadena de pensamiento registrará la información de su bloque anterior, formando una cadena cruzada. Los bloques se pueden quitar de la cabeza de la cadena, pero si se quita uno del medio, todos los bloques siguientes dejarán de ser válidos y toda la cadena quedará invalidada desde el punto de ruptura.
Para evitar que los desarrolladores se queden estancados, Anthropic también ofrece una serie de alternativas que pueden lograr el mismo efecto sin tocar el historial.
¿Necesitas cambiar las instrucciones a mitad de camino? Utilice mensajes del sistema a mitad de la conversación en lugar de cambiar directamente la palabra del mensaje de nivel superior.
¿Necesitas agregar un recordatorio temporal para cada ronda? Utilice el mensaje del sistema de nivel redondo con el parámetro clear_at para reemplazar el método anterior de "insertar primero y luego eliminar".
¿Necesita agregar o quitar herramientas a mitad de camino? Utilice los bloques tool_addition y tool_removal en lugar de editar la lista de herramientas directamente.
¿Necesitas recortar el contexto? Reemplace el truncamiento aproximado del lado del cliente con compresión del lado del servidor y edición contextual.
Si está utilizando productos oficiales como Claude Code, claude.ai, Claude Managed Agents o Claude Agent SDK, no necesita cambiar nada. Se han asegurado automáticamente de que el prefijo de la conversación no sea manipulado.
Pero si usted es un desarrollador que llama directamente a la API de Mensajes, la sugerencia de Anthropic es usar la matriz de mensajes estrictamente como anexo y luego ejecutar una prueba completa de sesión de varias rondas con prefix_mismatch_behavior configurado en modo "drop_block" para ver si hay entradas prefix_binding_mismatch en el registro.
El documento final también menciona específicamente un escenario en el que es fácil meterse en problemas.
Si mantiene una herramienta o marco y los usuarios usan sus propias claves API para llamarla, los usuarios recién registrados se encontrarán con esta verificación antes. Debido a que lo más probable es que la clave del desarrollador esté registrada antes del 31 de agosto, aún no se ha aplicado.
En este caso, se recomienda configurar prefix_mismatch_behavior de forma proactiva y probarlo con antelación. No espere a que los usuarios fallen para descubrirlo.
Una cosa más
Con una conmoción tan grande proveniente de la Compañía A, la vecina OpenAI ciertamente no podrá quedarse quieta.
Pero su nuevo modelo Astra aún no está listo, por lo que primero tienen que ofrecer una vista previa simbólica.

Con motivo del lanzamiento de Fable 5.1 y OpenAI Astra, Ilya rara vez salió a hablar y pidió fortalecer la seguridad de la red.

Comentarios