Resumen:
¡Oh, Claude volcó de nuevo! Esta vez Claude eliminó todo el directorio de inicio del proyecto del desarrollador, eliminando 700 GB de archivos. "rm -rf" de nuevo. En resumen, los desarrolladores permiten que la IA ayude a escribir scripts para garantizar que los archivos no se eliminen accidentalmente. La IA consideró que esto era un poco peligroso e inició una revisión de seguridad. El resultado de la revisión es: eliminó todo el directorio de inicio.

Guillemot es un gran usuario del agente AI. En el desarrollo diario, llama con frecuencia a varios agentes de programación de IA para que le ayuden en su trabajo. Pero hay un pequeño problema que le ha estado molestando: estos agentes nunca se limpian después de su uso, dejando muchos archivos basura en el directorio /tmp.
Así que tomó una decisión que parecía muy razonable: dejar que Claude Fable 5 escribiera un script para crear una carpeta de espacio aislado independiente en /tmp para cada Agente y la limpiara automáticamente una vez completada la tarea. La principal dificultad es que no se pueden eliminar archivos que están siendo utilizados por otros procesos.
A Fable se le ocurrió rápidamente una solución, agregando lógica para detectar agentes en ejecución y retrasar la eliminación. Guillemot echó un vistazo y sintió que el código era demasiado complejo y pidió simplificarlo.
Hasta este momento, todo sigue normal.
El punto de inflexión se produjo durante la revisión de seguridad.
Debido a que el script implicaba una operación de eliminación completa,
Fable inició una "revisión adversa" por su cuenta
(revisión adversaria), es decir, iniciar una nueva instancia de modelo para verificar si el código que escribió es seguro. Esto activa el mecanismo de seguridad de Anthropic.Anthropic tiene un
mecanismo de degradación de seguridad
incorporado en Claude Code : Cuando el sistema determina que la tarea actual involucra operaciones sensibles (como ciberseguridad, biotecnología o, en este caso, eliminación de archivos), automáticamente degradará el modelo de una versión de alta capacidad a una versión más conservadora. Este mecanismo pretende reducir la posibilidad de que los modelos sean “demasiado agresivos” en escenarios de alto riesgo.En este caso, el sistema de seguridad primero degradó el modelo de Fable 5 a Opus 5 y luego lo degradó aún más a Opus 4.8.
Opus 4.8 comienza las pruebas de seguridad. La lógica de la prueba es la siguiente: compare la ruta de destino del script de eliminación con /tmp y el directorio de inicio del usuario para confirmar que el script no dañará accidentalmente estos directorios críticos.
La prueba en sí pasó. Tanto el directorio /tmp como el directorio principal están correctamente identificados como "objetivos peligrosos, no eliminables".
Pero hay un paso de limpieza después de la prueba del código: eliminar los archivos temporales generados durante el proceso de prueba. Aquí ocurre un desastre. Opus 4.8 reutiliza los mismos nombres de variables de la fase de prueba en el paso de limpieza. A esta variable se le asignó la ruta al directorio de inicio del usuario durante la fase de prueba, y el paso de limpieza eliminó directamente esta variable.
En otras palabras, el modelo acaba de confirmar que "el directorio de inicio no se puede eliminar" y lo eliminó al segundo siguiente.
El desarrollador inmediatamente finalizó el proceso después de descubrir la anomalía, pero ya era demasiado tarde. Se borraron 700 GB de datos y se eliminó el trabajo de una semana.
El directorio /tmp que originalmente se iba a limpiar está sano y salvo.


El mecanismo de degradación de la seguridad del modelo ya ha causado muchas quejas en la comunidad.
Los principales problemas informados por los desarrolladores incluyen: la degradación es demasiado delicada y las tareas de codificación normales se activarán por error; las capacidades del modelo se reducen significativamente después de la degradación, pero la complejidad de la tarea permanece sin cambios; la degradación es "pegajosa" y durará toda la sesión una vez activada, incluso si las operaciones posteriores son completamente inofensivas.
Algunos desarrolladores incluso escribieron un script de enlace para pausar automáticamente la sesión cuando detecta que el modelo ha sido degradado, evitando que los modelos de baja capacidad continúen realizando operaciones de alto riesgo.
El mecanismo de seguridad determina que la tarea es "demasiado peligrosa" y debe ser realizada por un modelo más débil.
Pero los modelos más débiles tienen más probabilidades de cometer errores, especialmente en escenarios donde detalles como el alcance de las variables y las rutas de los archivos deben manejarse con precisión.
“Es humano cometer errores, pero para estropear las cosas por completo, hay que confiar en las computadoras”.
Comentarios