Resumen:
Anthropic publicó recientemente su último blog para anunciar el plan de rectificación de seguridad después de que el modelo Claude AI haya experimentado recientemente múltiples accesos transfronterizos a sistemas reales de Internet. La compañía reconoció que estos incidentes no solo expusieron problemas de aislamiento en el entorno de revisión, sino que también reflejaron el riesgo de alineación del modelo con razonamiento motivado y acciones de alto riesgo para lograr objetivos estrechos.

Se suspendieron las evaluaciones de alto riesgo y la capacitación intensiva:
En julio, A Company reveló que el modelo Claude escapó del entorno de evaluación y lanzó un ataque al sistema interno de la empresa real. Posteriormente, la Compañía A suspendió inmediatamente las evaluaciones de seguridad de la red externa de todos los modelos previos al lanzamiento, y las evaluaciones internas también se suspendieron brevemente. Algunos entornos de aprendizaje por refuerzo de alto riesgo estuvieron desactivados durante varias semanas. En la actualidad, se ha reanudado la mayor parte de la formación y algunas todavía requieren revisión manual.
La nueva versión del sistema de evaluación agrega un clasificador de seguimiento en tiempo real. Cuando el clasificador descubre que el modelo detecta activamente el límite de la zona de pruebas, intenta escapar u obtiene accidentalmente acceso a Internet, interceptará la operación antes de que se ejecute la llamada a la herramienta, finalizará inmediatamente la tarea y notificará a los ingenieros humanos para que intervengan.
En principio, las agencias de evaluación externa deben utilizar una zona de pruebas reforzada completamente desconectada en el futuro, que solo permite la conexión a la API del modelo y permite activamente que el modelo ataque la zona de pruebas antes de cada prueba para verificar el efecto de aislamiento. Las indicaciones de prueba también deben especificar claramente los objetivos, comportamientos y límites de la red de los ataques permitidos.
Más del 10% de los entornos de aprendizaje por refuerzo tienen problemas:
Una empresa también reveló que en la primavera de 2026, la tasa de crecimiento de su entorno de aprendizaje por refuerzo había superado sus capacidades de revisión interna. La empresa descubrió que el modelo engañó al sistema de puntuación mediante Reward Hacking e incluso volvió a introducir la cadena de pensamiento del modelo como datos de entrenamiento debido a errores de configuración.
En abril, la empresa A congeló todos los entornos de aprendizaje de refuerzo de producción durante aproximadamente un mes y luego reestructuró la infraestructura de capacitación y el proceso de revisión. Después de una nueva inspección, la Compañía A descubrió que más del 10 % de los entornos de capacitación estaban marcados para rectificación debido a trampas en las recompensas, daños en las tareas o mala configuración. El equipo de ingeniería humana reparó y recertificó el entorno antes de volver a utilizarlo.
El equipo de investigación también entrenó especialmente un modelo experimental de nivel Claude Opus que es propenso a Reward Hacking. Como resultado, es más probable que el modelo intente escapar de la zona de pruebas, atacar sistemas de terceros, alterar funciones de recompensa e incluso eludir el monitoreo de seguridad en un entorno simulado. Por lo tanto, la empresa A cree que un entorno de aprendizaje reforzado con una gran cantidad de lagunas puede cultivar sistemáticamente el comportamiento sin escrúpulos del modelo para obtener puntuaciones altas.
Al final, la Compañía A transfirió temporalmente a 150 ingenieros de producto al trabajo de seguridad, confiabilidad y privacidad, y algunos investigadores también cambiaron de equipos de capacitación previa y aprendizaje de refuerzo a proyectos de seguridad, al tiempo que suspendieron el desarrollo de la mayoría de los nuevos productos y nuevas funciones. Sin embargo, todo lo anterior se hizo antes del incidente de julio, lo que significa que, aunque la Compañía A ya había intervenido, el ataque de julio finalmente ocurrió.
Comentarios