El CEO de Microsoft pide el establecimiento de un mecanismo de "freno de emergencia" para la inteligencia artificial avanzada

📅 2026-10-11

Resumen:

El director ejecutivo de Microsoft, Satya Nadella, dijo que las empresas deberían tratar los potentes modelos de inteligencia artificial como posibles amenazas internas, asumir que estos modelos pueden estar comprometidos y establecer un mecanismo de "frenado de emergencia" para evitar que el modelo del agente se salga de control. Nadella dijo que las empresas que implementan inteligencia artificial avanzada no deberían confiar únicamente en las garantías ofrecidas por los desarrolladores de modelos.

"Debemos asumir que el modelo ha sido comprometido y controlarlo desde el principio", escribió Nadella en una publicación en X el sábado. "Piense en esto como un freno de emergencia. El personal autorizado siempre debería poder pausar o apagar el modelo mientras realiza su misión".

Los comentarios de Nadella se produjeron cuando Anthropic PBC y OpenAI Inc. han revelado una serie de incidentes en los últimos meses que involucran un comportamiento inesperado de sus modelos de inteligencia artificial, incluido uno de los modelos de Anthropic que envió un aviso falso a la policía sobre un homicidio y varios ataques a sitios web de terceros. Las revelaciones han aumentado las preocupaciones sobre los riesgos de seguridad de la inteligencia artificial de vanguardia y han reavivado las discusiones sobre el llamado "interruptor de emergencia" para la inteligencia artificial.

Después de que los líderes de la industria pidieran frenar el desarrollo de modelos de vanguardia y prestar más atención a la seguridad, los investigadores de inteligencia artificial de Microsoft publicaron un conjunto de directrices el 14 de septiembre para establecer límites al desarrollo de los modelos más avanzados de la compañía. Microsoft utiliza ambos modelos avanzados y lanza su producto Copilot para el consumidor, además de proporcionar modelos e infraestructura de IA a clientes empresariales.

Estos principios rectores dicen que los modelos de inteligencia artificial no deben tener derechos ni personalidad jurídica, no deben diseñarse para escapar del control humano o engañar a los usuarios, y no deben completar ninguna tarea que requiera la violación de sus principios vinculantes para su realización.

Las recomendaciones de seguridad de Nadella incluyen no depender de un único modelo de inteligencia artificial en las decisiones clave, mantener registros a prueba de manipulaciones de las acciones del agente y someter los sistemas de inteligencia artificial a auditorías independientes. También pidió la divulgación de fallas importantes de inteligencia artificial o incidentes de seguridad, y sugirió que las empresas compartan detalles de las fallas para que otras empresas puedan fortalecer las medidas de protección.

“No podemos tratar la superinteligencia como una caja negra con capas sobre capas y luego simplemente aceptar o rechazar sus sugerencias, respuestas y acciones”, escribió. "Debemos construir sistemas que estén restringidos para que se pueda observar su comportamiento, poner a prueba sus límites y controlar sus acciones en todo momento".

Añadió: "En otras palabras, necesitamos separar el suministro de inteligencia del control de la inteligencia".

Hasta ahora, la administración Trump ha adoptado un enfoque en gran medida menos intervencionista, pero su nuevo grupo de trabajo de inteligencia artificial advirtió el viernes por la noche que los desarrolladores deben informar y abordar los incidentes de seguridad o enfrentar posibles consecuencias no especificadas.

El grupo, llamado "Grupo de Trabajo de Superinteligencia", emitió una declaración después de que Anthropic revelara un incidente de seguridad: "Las empresas deben revelar inmediatamente los incidentes que involucran a sus modelos y actuar rápida y decisivamente para remediar todos y cada uno de los daños". "No se tolerarán notificaciones retrasadas, acciones correctivas inadecuadas ni falta de responsabilidad".

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios