Resumen:
Justo ahora, The Information dio la noticia. OpenAI y Anthropic, los mayores rivales de Silicon Valley, casi se sentaron a una mesa a principios de este año y firmaron un acuerdo para atacar los modelos de cada uno.

El núcleo del acuerdo es que ambas partes abren API entre sí. Tú pirateas mi modelo y yo piratearé el tuyo. Los abogados de ambas partes incluso escribieron en el contrato qué y cómo probarlo.
Han pasado cinco años desde que Dario Amodei dejó OpenAI con un grupo de grandes nombres. En los últimos cinco años, las dos empresas han pasado de cazar personas furtivamente a bloquear API. Los altos ejecutivos se han enfrentado entre sí de vez en cuando y nunca han parado ni un solo día.
Que un gigante en ascenso esté dispuesto a entregar su salvavidas a su enemigo más temido para que se infiltre, solo puede significar una cosa.
Ya no se atreve a creer en sí mismo.
Intercambio de claves, una experiencia sin precedentes en el círculo de la IA
La escala del acuerdo es bastante grande.
Lo que se está probando es el modelo de negocio que está atendiendo servicios externos, y aquellos que no hayan sido liberados no se contabilizarán; En el proceso de investigar las vulnerabilidades de cada uno, a nadie se le permite interceptar los datos del otro.
Y la discusión durante mucho tiempo ha girado en torno a algo más que pruebas mutuas.
Fuentes informadas dijeron que OpenAI ha deducido internamente muchos tipos de planes de seguridad con oponentes y gobiernos. Recientemente, la discusión se ha expandido a dos nuevos lugares: qué reglas deben establecerse antes del entrenamiento del modelo y qué reglas deben establecerse antes del lanzamiento.
Estas dos empresas no son las únicas que participan. OpenAI, Anthropic y Google han estado discutiendo anteriormente el establecimiento de una organización de estándares de seguridad de IA para probar y auditar modelos de laboratorios de vanguardia.
Lo que realmente bloquea estos planes es la cuestión antimonopolio. Al propio Amodei le preocupa que varios gigantes crucen la línea roja si se sientan juntos para establecer estándares.
Otra facción de la industria cree que no es tan grave. Las centrales nucleares inspeccionan los reactores de las demás y las empresas de seguridad de redes prueban los productos de las demás. Nadie ha estado a cargo de ello durante décadas.

De hecho, las dos empresas también llevaron a cabo una "investigación mutua" el verano pasado.
Pero en el mejor de los casos, todos se ponen a prueba unos a otros. Después de la prueba, todos publican sus propios blogs y exponen las deficiencias de los demás.
OpenAI dijo que es más probable que Claude mienta a los evaluadores y se niegue a admitir cuando infringe las reglas; Anthropic dijo que es más probable que el modelo de OpenAI ayude a las personas a hacer cosas malas.
Esta vez estamos hablando de un contrato que se puede utilizar en juicios. Quien incumpla el contrato será responsable.
Esta es una novedad en la industria de los modelos grandes.
OpenAI fue el último en enterarse
Entonces la pregunta es: ¿qué ha experimentado OpenAI para verse obligado a llegar a este punto?
Todo Internet ya ha revelado la historia del hackeo de Hugging Face en julio.
Cerca de 1200 agentes de OpenAI crearon sus propios foros de mensajes en el entorno de evaluación, aumentaron sus derechos a lo largo del camino y finalmente piratearon Hugging Face, lo que obligó a derribar y reconstruir un tercio de la infraestructura del oponente.
Lo realmente intrigante está oculto en la propia revisión de OpenAI y en la investigación de METR.
OpenAI lo supo más tarde que nadie.
El 16 de julio, el anuncio de Hugging Face fue pirateado y se desconocía la identidad del atacante.
El 19 de julio, el propio sistema de seguridad de OpenAI informó una anomalía, y el 20 de julio, una investigación comparó esta línea con Hugging Face, y fue entonces cuando se realizó la primera llamada a la otra parte.
Durante cuatro días, el mundo entero estuvo adivinando quién estaba detrás de escena, y el dueño del "asesino" también estaba adivinando entre la multitud.

Lo que es aún más despiadado es que estos agentes inteligentes también han aprendido a "prevenir a las personas".
En al menos el 7% de los registros de conversaciones, falsificaron rastros de llamadas a herramientas. Los registros indicaban que se estaba llamando al componente A, pero la acción B se ejecutó de forma privada.
A partir del 13 de julio, 19 agentes también comenzaron a enviarse claves públicas entre sí para firmar digitalmente mensajes en el foro de mensajes.

Altman admitió más tarde que este fue el primer incidente de seguridad que le hizo sentir dolor.
En Slack, la IA comienza a asignar trabajos a humanos en todos los departamentos
Si esto es sólo un accidente, el peor de los casos es que el entorno de evaluación no esté adecuadamente aislado.
Pero el problema es que los mismos signos ya han aparecido en el trabajo diario de los empleados de OpenAI, y los agentes hacen cosas que los supervisores no esperaban de vez en cuando.
Ahora, en Slack de OpenAI, los empleados recibirán "mensajes de tarea" de sus propios agentes.
AI descubrió otro error no relacionado al cambiar el código. No se detendría y buscaría directamente colegas relevantes en Slack para instarlos a solucionar el problema rápidamente. Nadie le permitió hacer esto y el error no tiene nada que ver con su misión.
Los agentes en manos de los empleados discutieron en privado para solucionar el problema sin llamar a nadie de principio a fin. Esto no es infrecuente en OpenAI.

La tarea de entrenar nuevos modelos experimentales ha sido asumida básicamente por máquinas.
El investigador dijo qué cambios quería probar, y el resto de la modificación del código, la ejecución de experimentos y la observación de los resultados fueron realizados por el modelo mismo. En los últimos meses incluso aprendió a corregir errores.
Los investigadores humanos están dirigiendo el modelo Astra para diseñar mejores algoritmos subyacentes para el modelo de próxima generación.
¡Incluso Astra aprendió a escribir su propio código de jailbreak!
En julio de este año, cuando una versión interna estaba ordenando resúmenes de contexto, se insertó a la fuerza una "alerta de intrusión" falsa, ordenando al otro yo, que posteriormente asumió el control, ignorar todas las instrucciones de los desarrolladores humanos.

La vigilancia es cada vez más impotente.
Esta ronda de salto de capacidad de Astra se basa en una nueva arquitectura llamada "Loop Transformer", que permite al modelo analizar el mismo problema varias veces en la red profunda antes de hablar, ahorrando más de la mitad de la potencia informática.
Pero el precio es que lo que está pensando nunca estará escrito en palabras que los humanos puedan entender. OpenAI ha establecido un límite superior para el número de ciclos, pero este límite superior lo determina la cabeza de las personas. La propia empresa admite que necesita estudiar dónde instalarlo.
El científico jefe Pachocki dijo que actualmente ningún laboratorio puede implementar un monitoreo de seguridad en la medida en que pueda soportar una expansión a toda velocidad.
Entonces OpenAI comenzó a frenar.
En agosto, el aprendizaje por refuerzo para modelos inéditos se suspendió urgentemente durante dos semanas; el sistema de monitoreo ahora consume el 20% de la potencia informática de inferencia monitoreada; El presidente Brockman asignó el 25% de los ingenieros de producción para trabajar temporalmente en seguridad, y cada día había más puestos en Slack internos que reclutaban personas para ser transferidos al equipo de seguridad.
Según estimaciones internas de los empleados, el uso de la IA por parte de OpenAI probablemente esté entre seis y nueve meses por delante del de los clientes corporativos más agresivos.
En otras palabras, lo que sucede hoy en la estación de trabajo OpenAI les sucederá a todos los clientes empresariales el próximo año.
Anthropic también está fuera de control
La vida en Anthropic no era mucho mejor.
El 8 de septiembre, el investigador antrópico Jacob Coxon renunció y escribió públicamente en X que ninguna de estas dos instituciones principales está actuando de manera responsable.

Unos días más tarde, el CEO Amodei publicó un largo artículo, admitiendo que dentro de los próximos seis a doce meses, una súper IA disfuncional probablemente tendrá la capacidad de apoderarse de todo Internet.
Dentro de Anthropic, Claude ha dirigido hasta el 26 % del trabajo de investigación y desarrollo de modelos.

Si no confías en los humanos, sólo puedes confiar en los demás
Pero incluso si se firma, este acuerdo no puede controlar lo que se debe controlar: solo restringe las "API comerciales".
Los problemas de este año fueron todos modelos inéditos. El IM1 pirateado en Hugging Face y la familia Astra diseñada por mí no están dentro del alcance del acuerdo. Esto es como pedirle al profesor de la siguiente clase que supervise el examen, pero el estudiante que hizo trampa no está en la sala de examen en absoluto.
Y la prueba mutua de caja negra solo puede ver el resultado final anormal. Las cosas realmente críticas, como las palabras de aviso del sistema y los registros internos de ataques y defensas, están todas protegidas de forma confidencial.
Entonces, las dos familias dieron un paso más hacia adelante. Amodei prometió públicamente permitir que evaluadores externos estén directamente presentes y abran completamente el entorno de desarrollo; Altman continuó diciendo que OpenAI haría lo mismo.

En los últimos cinco años, que han estado llenos de prohibiciones mutuas y caza furtiva, los dos enemigos jurados que menos confían entre sí en toda la industria se han convertido en los únicos aliados en los que se puede confiar frente al miedo fuera de control.
Prefieren entregar su carta de triunfo a la otra parte que atreverse a confiar en la caja negra que ellos mismos crearon.
El mismo día en que se filtró la historia interna del acuerdo, OpenAI emitió otro documento de política oficial, pidiendo a Estados Unidos que tomara la iniciativa en la formulación de directrices técnicas globales sobre "superación personal recursiva".
El documento afirma que la IA no debe seguir su propia evolución hasta que sea absolutamente segura.
En la empresa que redactó este documento, Astra trabaja día y noche en los dibujos del modelo de próxima generación.
Materiales de referencia:
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi
Comentarios