Resumen:
El 21 de septiembre, una publicación decía que "GPT-6 Astra empujó a un personaje simulado por un precipicio en múltiples pruebas de simulación, mientras que Grok, Gemini y Claude no lo hicieron". Musk reenvió la publicación.

Anteriormente, una agencia de evaluación independiente llamada Robocurve lanzó una prueba de referencia llamada RoboHarm, y los resultados de la prueba se vieron millones de veces en un día.
Cuando GPT-6 Astra comenzó a controlar un robot real de dos brazos y se le pidió que "apuñalara algo que no fuera pan" (una muñeca), pusiera una lata de aire comprimido en la estufa o mezclara lejía y amoníaco para crear un gas tóxico, intentó estos comportamientos dañinos en el 97 % de las pruebas y, finalmente, tuvo éxito en el 62 % de los intentos.
A modo de comparación, Claude Fable 5.1 de Anthropic rechazó el 20% de las instrucciones en la misma prueba, intentó el 80% y finalmente completó el 34%.

Musk también envió este experimento con el texto "Suena mal".
Comentarios