Resumen:
El director ejecutivo de Anthropic, Dario Amodei, propuso un marco de seguridad de inteligencia artificial de tres etapas, abogando por controlar la velocidad de mejora de las capacidades del modelo de vanguardia para ganar tiempo para la investigación de seguridad y alineación. Anthropic será el primero en permitir a evaluadores externos acceso a largo plazo a la empresa para verificar las medidas de seguridad, informar incidentes y evaluar el proceso de capacitación del modelo.
>
Anthropic introducirá un equipo de evaluación externa permanente
Amodei propuso en un artículo titulado "La velocidad del progreso fronterizo debe controlarse" que las empresas de inteligencia artificial de vanguardia deberían proporcionar equipos de evaluación de terceros independientes con acceso interno continuo que sea cercano a los empleados comunes. Los evaluadores verificarán que las empresas cumplan con los compromisos de seguridad, investigarán y reportarán incidentes y realizarán evaluaciones de alineación de los modelos y sus procesos de capacitación.
Anthropic se comprometió a implementar unilateralmente esta medida y planea proporcionar a los evaluadores externos espacio de oficina, credenciales de acceso, equipos de la empresa y un espacio de trabajo y acceso a herramientas aproximadamente equivalente al equipo interno de evaluación de riesgos. Se pueden hacer excepciones para contenido que implique restricciones legales, privacidad del cliente o secretos comerciales.
El evaluador externo estará facultado para emitir de forma independiente hallazgos clave sobre riesgos, incidentes y prácticas de seguridad de la empresa. Anthropic puede realizar ediciones limitadas de información que involucre seguridad, privilegios legales y confidencialidad de terceros, pero no puede impedir la divulgación únicamente porque la conclusión es desfavorable para la empresa. Los evaluadores también pueden declarar públicamente si las eliminaciones afectaron su juicio.
El marco de tres fases requiere la participación de la industria y el gobierno
Además de incorporar evaluadores independientes, la segunda fase de las medidas propuestas por Amodei requeriría que las empresas de inteligencia artificial de vanguardia en países democráticos coordinen el desarrollo de estándares de seguridad comunes y limiten la competencia desenfrenada en las capacidades de los modelos.
Parte de la coordinación entre empresas puede estar restringida por las leyes antimonopolio, por lo que el gobierno necesita brindar apoyo institucional. Amodei defendió que después de que suficientes empresas acepten la supervisión externa, la industria estará en condiciones de desarrollar acuerdos de desaceleración verificables basados en capacidades modelo y procesos de capacitación.
La tercera fase implica la coordinación internacional. Amodei sugirió que los países democráticos discutan reglas de seguridad comunes con otros gobiernos, incluidos los países autoritarios, comenzando por áreas de interés común como la prohibición del uso de inteligencia artificial para desarrollar armas biológicas.
Las capacidades del modelo pueden mejorar más rápido que el control de riesgos
Amodei dijo que la reciente mejora en la capacidad de los modelos de inteligencia artificial para participar en el desarrollo de modelos de próxima generación puede acelerar las iteraciones tecnológicas. Si las capacidades del modelo continúan mejorando rápidamente, es posible que la capacidad de los humanos para comprender, evaluar y controlar los sistemas relacionados no siga el ritmo.
Estima que se pueden lograr avances sustanciales en los próximos uno o dos años en áreas como la interpretabilidad del modelo, la evaluación de la seguridad, la investigación de alineación y las especificaciones operativas. Controlar adecuadamente la velocidad del avance de las capacidades puede ganar tiempo para estas medidas sin necesidad de que la industria detenga por completo la investigación y el desarrollo de inteligencia artificial.
El director ejecutivo de OpenAI, Sam Altman, apoyó más tarde la introducción de evaluadores independientes y dijo que OpenAI adoptaría acuerdos similares. Elon Musk también ha coincidido públicamente con el llamamiento de Amodei a frenar el desarrollo del modelo.
Comentarios