Anthropic lanzó hoy oficialmente la última generación del modelo de lenguaje a gran escala Claude Opus 4.8, que se enfoca en mejorar su desempeño en tareas de "agentes" como generación de código, razonamiento multidisciplinario, operación automática de computadoras, trabajo basado en conocimientos y análisis financiero. Se describe oficialmente como un "socio de colaboración más eficiente". Los usuarios que participaron en la prueba informaron que Opus 4.8 se desempeñó de manera más confiable y tomó decisiones más precisas al realizar tareas complejas de los agentes, al mismo tiempo que mostró mejoras significativas en la honestidad.

Anthropic dijo que los primeros resultados de las pruebas muestran que es más probable que Opus 4.8 marque de forma proactiva sus propias incertidumbres y haga afirmaciones menos infundadas. Los datos de la evaluación interna muestran que, en comparación con la versión anterior, Opus 4.8 tiene aproximadamente cuatro veces menos probabilidades de ignorar errores en el código autogenerado, lo que significa que la capacidad de "autocorrección" del modelo en la revisión del código y el control de calidad se ha mejorado significativamente.
En la prueba de alineación, Opus 4.8 estableció un nuevo récord en términos de apoyar la toma de decisiones independiente de los usuarios y salvaguardar los mejores intereses de los usuarios y otras "características prosociales". Por el contrario, la incidencia de "comportamientos no coincidentes", como engaños encubiertos, comportamientos engañosos, etc., es menor que en Opus 4.7 y al mismo nivel que el modelo preliminar de Claude Mythos, que anteriormente solo estaba abierto a un pequeño número de pruebas institucionales.
Anthropic también ha dado resultados específicos en múltiples pruebas de referencia públicas: Opus 4.8 logró una puntuación del 69,2% en la prueba de ingeniería de software SWE-Bench Pro, superando a modelos de la competencia como GPT-5.5 y Gemini 3.1 Pro. Tiene una ventaja en múltiples proyectos de prueba, pero aún está liderado por GPT‑5.5 en el punto de referencia de codificación de terminales. En términos de rendimiento, la velocidad de inferencia en modo rápido del Opus 4.8 se ha incrementado a 2,5 veces la del modelo anterior, y el precio se ha reducido a aproximadamente un tercio del modelo anterior, lo que reduce aún más el umbral general para el uso de alto rendimiento.
Junto con el lanzamiento del nuevo modelo, Anthropic también anunció la incorporación de una serie de características nuevas al sistema del producto, incluidos "flujos de trabajo dinámicos" para desarrolladores empresariales (vista previa de la investigación). Esta característica permite a Claude dividir tareas grandes, planificar pasos de trabajo y programar cientos de subagentes en paralelo dentro de una sola sesión dentro del entorno de Claude Code para completar operaciones de migración a nivel de repositorio en cientos de miles de líneas de código. Actualmente está disponible para los planes de suscripción Claude Code Enterprise Edition, Team Edition y Max.
En términos de control interactivo, Anthropic ha agregado una función de "control de nivel de esfuerzo" para que los usuarios de Claude.ai y Cowork elijan los recursos informáticos y la profundidad de razonamiento que el modelo invierte en una única respuesta. Si los usuarios eligen un nivel de esfuerzo más bajo, pueden obtener tiempos de respuesta más rápidos y reducir el consumo de cuota, mientras que Opus 4.8 utiliza por defecto el modo de "alto esfuerzo", que los funcionarios creen que es el mejor equilibrio entre la calidad de la respuesta y la experiencia del usuario.
Para los desarrolladores, Anthropic ha actualizado la API de mensajes para aceptar entradas de comandos a nivel del sistema en la matriz de mensajes. Esto significa que los desarrolladores pueden ajustar dinámicamente el código de conducta y la configuración de funciones de Claude durante la ejecución de tareas sin volver a abrir una nueva sesión, lo que ayuda a crear flujos de trabajo automatizados de varios pasos y aplicaciones de nivel empresarial más flexibles.
Anthropic dijo que Claude Opus 4.8 está generalmente disponible a nivel mundial a partir de hoy, y su precio de uso regular sigue siendo el mismo que el de Opus 4.7. La compañía también reveló que está trabajando en nuevos modelos de menor costo con el mismo nivel de funcionalidad, así como en una clase de modelos de "próxima generación" con capacidades más allá del Opus 4.8.
En términos de la hoja de ruta del modelo de alta gama, Anthropic está probando un modelo de vanguardia cuyo nombre en código es Claude Mythos con algunas instituciones asociadas y continúa desarrollando barandillas de seguridad y especificaciones de uso más estrictas en torno a este modelo. La compañía dijo que espera que los modelos de nivel Mythos estén disponibles para todos los clientes "en las próximas semanas", ampliando aún más su competitividad en escenarios como auditoría de seguridad a nivel empresarial, análisis de código y soporte de decisiones complejas.