Resumen:
El director ejecutivo de Anthropic, Dario Amodei, pidió controlar la velocidad de mejora de las capacidades de los modelos de inteligencia artificial de vanguardia para ganar tiempo para evaluaciones de seguridad y medidas de protección. Propuso introducir evaluadores independientes permanentes, coordinar los estándares de seguridad de los principales desarrolladores y promover la gestión de riesgos transfronterizos y la cooperación en control.

Evaluadores independientes obtienen acceso interno
Amodei propuso que las empresas de IA de vanguardia deberían proporcionar acceso continuo, casi al nivel de los empleados, a equipos de evaluación independientes calificados para que puedan revisar las pruebas de modelos, los informes de riesgos, los marcos de seguridad y los procesos de manejo de incidentes.
Anthropic se compromete a ser el primero en implementar esta medida. El personal externo tendrá un acceso similar al del equipo de evaluación de riesgos de la empresa y podrá publicar conclusiones sin el control editorial de Anthropic.
Este acuerdo aún debe resolver cuestiones como la selección de evaluadores, las fuentes de financiación y las obligaciones de confidencialidad. Los pesos de los modelos, la infraestructura de capacitación y las vulnerabilidades de seguridad son información altamente confidencial, y la ampliación de los derechos de acceso también aumentará los requisitos de seguridad de la información.
La coordinación del sector limita la competencia por competencias desprotegidas
La segunda recomendación exige que los principales laboratorios de IA desarrollen estándares comunes para pruebas de riesgo, umbrales de seguridad y condiciones de lanzamiento de modelos. Amodei cree que la presión competitiva puede llevar a las empresas a acelerar el ritmo de capacitación y liberación, lo que dificulta que las medidas de protección se mantengan al día con las capacidades del modelo de manera oportuna.
La Política de Escalamiento Responsable de Anthropic ha adoptado un mecanismo escalonado. Cuando los modelos cruzan umbrales de riesgo biológico, cibernético, de I+D automatizado o de pérdida de control, las empresas necesitan aumentar la protección de su implementación y los niveles de seguridad de la información.
La cooperación entre empresas puede implicar límites antimonopolio. Existe un interés público en trabajar juntos para desarrollar estándares de pruebas de seguridad, pero los acuerdos aún pueden estar sujetos a escrutinio regulatorio si restringen la entrada al mercado de actores más pequeños, coordinan lanzamientos de productos o reducen la competencia.
La cooperación internacional cubre los riesgos transfronterizos
La tercera recomendación implica la cooperación intergubernamental, incluido el establecimiento de acuerdos mínimos de seguridad con competidores estratégicos como China. Amodei cree que los modelos y las tecnologías pueden fluir a través de las fronteras, y desacelerar la velocidad de desarrollo de un solo país o empresa puede conducir a la transferencia de I+D de alto riesgo a regiones con regulaciones más débiles.
Los riesgos potenciales enumerados por Anthropic incluyen el uso de modelos para ayudar en actividades de armas biológicas, el descubrimiento a gran escala de vulnerabilidades de software, ataques a infraestructuras críticas y sistemas de inteligencia artificial que escapan al control de los desarrolladores. La IA participa automáticamente en el desarrollo de modelos de próxima generación, lo que también puede acelerar aún más las mejoras de capacidades.
La empresa propone que los desarrolladores de vanguardia publiquen tarjetas del sistema e informes de riesgo periódicos, acepten revisiones independientes y proporcionen la información necesaria a las agencias gubernamentales designadas. Los gobiernos deberían tener poderes limitados para prevenir o retrasar el despliegue de modelos que podrían causar daños catastróficos, con umbrales claros y mecanismos de apelación establecidos.
El apoyo de la industria aún no se ha traducido en un acuerdo
El director ejecutivo de OpenAI, Sam Altman, apoya dar acceso interno a los evaluadores independientes y dijo que OpenAI adoptará acuerdos similares. El director ejecutivo de Google DeepMind, Demis Hassabis, y el director de xAI, Elon Musk, también han apoyado públicamente la dirección general de Amodei.
Las declaraciones relevantes aún no han formado un acuerdo industrial vinculante. Las empresas y los gobiernos aún deben determinar qué indicadores de capacidad desencadenarán desaceleraciones o suspensiones, si las revisiones independientes tendrán efecto obligatorio y cómo se aplicarán los acuerdos transfronterizos.
Comentarios