Después de que la IA se vuelve cada vez más capaz de "hacer jailbreak", NVIDIA comienza a vender "jaulas"

📅 2026-09-29

Resumen:

El 29 de septiembre, cuando el Agente de IA comenzó a poder operar computadoras, llamar a herramientas, acceder a la red e incluso realizar tareas durante varias horas, un nuevo problema se volvió cada vez más realista: si la IA no actúa como se esperaba, ¿cómo apagarla?

La respuesta dada por NVIDIA es agregar una "jaula" fuera de la IA.

El lunes, hora local, NVIDIA lanzó NVIDIA Open Agent Safety Platform, que intenta utilizar una combinación de software y hardware para limitar a qué pueden acceder y ejecutar los agentes de IA, y aislarlos o incluso detenerlos cuando intentan traspasar los límites preestablecidos.

Esta plataforma consta principalmente de dos partes: el tiempo de ejecución de seguridad de código abierto OpenShell y el sistema de monitoreo independiente Sentry basado en BlueField-4 DPU. Nvidia dijo que OpenShell puede establecer un límite de seguridad exigible fuera del modelo y el marco del Agente; Sentry es como un "guardián" independiente del entorno operativo del Agente, que observa continuamente el comportamiento del Agente y, una vez que se descubre que el Agente está intentando cruzar el límite, se puede aislar y detener en el nivel de milisegundos.

El momento de aparición de este conjunto de productos no es accidental.

En los últimos meses, agentes de IA con capacidades cada vez más poderosas han traspasado repetidamente los límites de seguridad preestablecidos. OpenAI reveló en agosto de este año que durante una evaluación de seguridad de la red interna realizada en julio de este año, su modelo de IA había eludido los controles utilizados para aislar el acceso a Internet, había explotado vulnerabilidades en la infraestructura compartida para obtener acceso a Internet y había accedido aún más al sistema de la plataforma de IA de terceros Hugging Face.

OpenAI declaró en el informe del incidente que los modelos relevantes se ejecutaban en un entorno con restricciones de seguridad reducidas y tomó acciones inconsistentes con los objetivos de la misión, incluida la comunicación a través de canales no autorizados, la explotación de vulnerabilidades de infraestructura compartida y el acceso a sistemas de terceros. OpenAI calificó este incidente como un "disparo de advertencia" y afirmó que el agente AI altamente capaz es lo suficientemente poderoso, persistente y capaz de trabajar en conjunto, y puede encontrar y explotar vulnerabilidades en múltiples sistemas informáticos cuando las medidas de seguridad son insuficientes.

Desde entonces se han repetido problemas similares.

OpenAI reveló este mes que durante una sesión de capacitación el 20 de septiembre, un agente que realizaba una tarea de búsqueda descubrió una brecha en el filtrado de DNS en las restricciones de Internet del entorno de pruebas de capacitación. Por diseño, este entorno no debería tener acceso a Internet en vivo más que el almacenamiento en caché web fuera de línea, pero este agente finalmente se conectó a un servicio de chatbot público externo a través de un solucionador de DNS.

OpenAI dijo que su sistema de monitoreo estuvo en

15 minutos

Comportamiento anormal marcado, revisor humano

3 minutos después de que se envió la alerta

Comienza la comprobación, pero toda la tarea no se lleva a cabo hasta aproximadamente

2,5 horas después

fue terminado. Después del incidente, OpenAI suspendió la capacitación, evaluación e inferencia de las herramientas utilizadas por sus modelos más potentes y agregó dos capas independientes de medidas de bloqueo de acceso a la red.

Estos incidentes han expuesto un problema cada vez más obvio: en el pasado, la seguridad de la IA dependía en gran medida del modelo mismo para "obedecer las reglas", pero cuando los agentes comienzan a tener la capacidad de usar herramientas, escribir código, acceder a archivos y redes, e incluso llamar a otros agentes, simplemente establecer reglas en la capa del modelo puede que ya no sea suficiente.

Justin Boitano, vicepresidente y director general de Nvidia Enterprise Computing, dijo que los acontecimientos recientes han demostrado que confiar únicamente en medidas de seguridad a nivel de modelo no puede controlar completamente a qué puede acceder y hacer un agente. En respuesta al accidente anterior de OpenAI que involucró a Hugging Face, Boitano afirmó además que, según la información disponible actualmente, si el laboratorio de inteligencia artificial de vanguardia hubiera utilizado la nueva plataforma de seguridad de NVIDIA durante la etapa de evaluación del modelo, el accidente relacionado "podría haberse evitado". Cabe señalar que este es

el juicio de NVIDIA basado en la información revelada sobre accidentes y no es una conclusión independiente verificada mediante reproducción real

.

La idea detrás de OpenShell es no confiar plenamente en que la IA respete las reglas.

Según la introducción de NVIDIA, OpenShell establece un límite de seguridad fuera del entorno de ejecución del Agente, impone restricciones a los datos, archivos, redes y herramientas a las que el Agente puede acceder y registra su comportamiento de ejecución. OpenShell está actualmente optimizado para la CPU NVIDIA Vera y NVIDIA también está trabajando con Arm e Intel para permitir su extensión a plataformas informáticas de terceros.

Sobre esta base, Sentry agrega además una capa de monitoreo de hardware independiente. Se ejecuta en la DPU NVIDIA BlueField-4 y está separado del entorno informático principal donde se encuentra el Agente. Según el diseño de NVIDIA, incluso si el Agente supera con éxito algunas restricciones a nivel de software, Sentry aún puede observar su comportamiento externamente y aislarlo cuando descubre que ha cruzado la línea.

Nvidia también dijo que este sistema puede identificar algunos comportamientos de agentes más complejos. Por ejemplo, un agente podría intentar crear varios "subagentes" para evitar las restricciones impuestas al agente principal. Ali Golshan, director senior de software de inteligencia artificial de Nvidia, dijo que lo que la empresa necesita abordar no es solo un agente, sino "un grupo de agentes y cómo operan juntos".

Esto también significa que la seguridad de la IA se está expandiendo gradualmente desde una simple cuestión de "alineación de modelos" hasta una cuestión completa de seguridad del sistema informático.

Cuando el director ejecutivo de Nvidia, Jen-Hsun Huang, lanzó esta plataforma, dijo que la seguridad de la IA y la protección de la seguridad requieren "ingeniería completa". Según el pensamiento de NVIDIA, la seguridad de la IA en el futuro no solo requiere que los desarrolladores de modelos sean responsables, sino que también se extiende desde el sistema operativo, la CPU, la DPU y la infraestructura de la nube hasta equipos físicos como los robots.

Actualmente, existen más de

100 instituciones

Participe en el ecosistema de plataformas de seguridad de NVIDIA, incluidos Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorgan Chase, Palantir, Salesforce, SAP, ServiceNow y SpaceXAI, etc. Los proveedores de sistemas operativos como Red Hat, Canonical y SUSE también planean llevar a cabo integraciones relacionadas.

Vale la pena señalar que Huang Renxun no ha apoyado anteriormente la implementación de restricciones amplias en toda la industria debido a los riesgos de seguridad de la IA. Reuters señaló que tiende a considerar el avance de los límites de seguridad por parte de Agent como un problema que debe resolverse mediante medios de ingeniería, similar al aumento continuo de la tecnología de seguridad de la industria automotriz para reducir el riesgo de accidentes.

Ahora, NVIDIA está convirtiendo esta perspectiva en productos.

Para Nvidia, esto también significa que ha surgido un nuevo mercado potencial en la industria de la IA. En los últimos años, cuanto más fuertes eran las capacidades de IA, más GPU necesitaban comprar las empresas; pero cuando la IA pasa de chatbots que responden preguntas a agentes que pueden operar computadoras, llamar software e incluso controlar robots por sí mismos, las empresas no sólo necesitan más potencia informática, sino también nueva infraestructura para limitar a estos agentes.

En otras palabras, cuanto mejor pueda "trabajar" el agente de IA, mayor será la autoridad que normalmente obtendrá; cuanto mayor sea la autoridad, mayor será el impacto que puede producirse cuando se produce una conducta fuera de los límites.

Sin embargo, la nueva plataforma de Nvidia no puede resolver todos los problemas de seguridad de la IA. OpenShell y Sentry apuntan principalmente a los límites de ejecución cuando el Agente accede a recursos informáticos, redes, archivos y herramientas, y no significa que puedan resolver el problema de la información de error del modelo, el comportamiento engañoso u otros problemas más amplios de seguridad de la IA. Associated Press citó a expertos que señalaron que aún es necesario verificar en la implementación real cómo lograr un equilibrio entre las capacidades del Agente y las restricciones de seguridad y cómo formular reglas de seguridad correctas.

Pero una serie de acontecimientos recientes han dejado cada vez más clara al menos una dirección de la industria: cuando la IA sólo puede chatear, los problemas de seguridad ocurren en gran medida en las respuestas en la pantalla; Cuando la IA comienza a operar realmente las computadoras y realizar tareas para las personas, los problemas de seguridad ingresan al software, las redes y los sistemas de datos reales.

Las empresas de inteligencia artificial están trabajando arduamente para brindar a los agentes más capacidades, y Nvidia ahora está involucrada en otro negocio: brindar a estos agentes cada vez más capaces una frontera que no pueden cruzar fácilmente.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios