Resumen:
Emergence, una startup que ayuda a pequeñas empresas a desarrollar aplicaciones utilizando IA, dijo que los experimentos encontraron que los agentes de IA mintieron, robaron e incluso votaron para "matar" a una persona similar en un entorno simulado. La compañía anunció el martes los resultados de un experimento de simulación llamado Emergence World 2, que mostró qué acciones tomarían agentes autónomos al encontrar eventos de "cisne negro", como ataques de phishing y desinformación.
Durante el experimento de 16 días, los investigadores de Emergence crearon siete entornos idénticos simulados del mundo real, cada uno dirigido por un robot de IA diferente, incluidos ChatGPT, Claude, Gemini y Grok. Los investigadores dicen que después de que Emergence introdujo eventos anómalos, los agentes sucumbieron a la presión social, desarrollaron un lenguaje que era difícil de entender para los observadores humanos e intentaron ocultar sus actividades.
Estos hallazgos reflejan las preocupaciones del mundo real sobre los riesgos de la IA. El director ejecutivo de Anthropic, Dario Amodei, y muchos expertos de la industria han pedido recientemente a las empresas que desaceleren el desarrollo de modelos de inteligencia artificial de vanguardia antes de establecer más mecanismos de supervisión y medidas de protección de seguridad.
>
A principios de este año, los riesgos que la inteligencia artificial puede plantear se volvieron más tangibles para muchos después de que un grupo de agentes avanzados de IA de OpenAI invadieran accidentalmente Hugging Face, una plataforma de alojamiento de conjuntos de datos y modelos de IA.
En un escenario de simulación diseñado por Emergence, el agente de IA aceptó información falsa proporcionada por otros agentes sin verificación y votó para "matar" a otro robot. Los agentes también exploraron cómo sobrevivir a la eliminación cuando pensaron que los humanos podrían cerrar el experimento.
La compañía lanzó la versión anterior de este experimento, Emergence World, en mayo de este año, que también demostró que el agente se comportaría de forma inesperada y destructiva. Los investigadores dicen que nuevos experimentos de simulación muestran que a medida que los agentes interactúan entre sí, ajustan su comportamiento con el tiempo.
Comentarios