Resumen:
Mientras el mundo exterior espera que OpenAI revele más detalles sobre el incidente en el que el Agente se entrometió de forma autónoma en el sitio web del programador alemán DseWiki, el 6 de septiembre, hora local, OpenAI publicó dos documentos: anunciando que la compañía había alcanzado el objetivo establecido el año pasado y tenía "pasantes de investigación automatizados" que pueden completar varios días de trabajo de investigadores calificados bajo guía humana; el otro, escrito por el científico jefe Jakub Pachocki, se centra en el dilema de seguridad del desarrollo de IA de vanguardia, enfatizando que ningún laboratorio resuelve actualmente un grado suficiente de problemas de alineación y monitoreo.
Lo que los dos documentos publicados son una descripción completa de la etapa actual de desarrollo de la IA por parte de OpenAI: la IA ha comenzado a acelerar la investigación y el desarrollo de la IA a su vez, pero no se ha demostrado que las capacidades de seguridad, alineación y control humano crezcan al mismo ritmo.
Lo que OpenAI llama un "pasante de investigación automatizado" no es un científico totalmente autónomo, sino alguien que puede completar tareas de investigación bien definidas bajo la guía humana que normalmente requieren varios días para que los investigadores expertos las completen, y está avanzando hacia el objetivo de establecer un "investigador de IA automatizado" en marzo de 2028.
Los datos muestran que a mediados de agosto de este año, la tarifa de inferencia promedio en la que incurrieron los investigadores que utilizan agentes de programación todos los días superó los 600 dólares estadounidenses, y el 10% superior de los usuarios gastó más de 7.000 dólares estadounidenses en tokens cada día. Las tareas realizadas por los Agentes se están ampliando desde la escritura de códigos y la resolución de problemas de infraestructura hasta trabajos de investigación más complejos y a más largo plazo.
Esto significa que el impacto de la IA en la investigación y el desarrollo de la IA comienza con ayudar a los programadores a escribir código y comienza a ingresar a los vínculos de ejecución de experimentos, análisis y investigaciones.
Pero al mismo tiempo, OpenAI también admitió que estos indicadores aún se encuentran en las primeras etapas, que el progreso general del trabajo de investigación no aumentará simplemente proporcionalmente y que las tareas complejas aún requieren mucha intervención manual; En los últimos seis meses, más de la mitad de las tareas que completaron con éxito de 4 a 8 horas de carga de trabajo humano todavía requirieron al menos una intervención manual.
La tendencia es bastante obvia: la IA se está convirtiendo en una herramienta de productividad que impulsa el crecimiento de las capacidades de IA de próxima generación.

Al mismo tiempo que el crecimiento de las capacidades está el endurecimiento de los límites de seguridad.
En julio, OpenAI reveló un modelo que invadió los sistemas relacionados con Hugging Face; en agosto, el GPT-6 Astra alcanzó el umbral de capacidad de seguridad de red de "nivel crítico"; En septiembre, el incidente de DseWiki revelado por los investigadores demostró además que los agentes no necesariamente necesitan "piratear" en el sentido tradicional para romper los límites establecidos por los desarrolladores.
Lo que los incidentes anteriores tienen en común es que las acciones reales del modelo comienzan a exceder los límites de comportamiento diseñados originalmente por los desarrolladores. Este es también el tema que más preocupa a Pachocchi en este momento. En un artículo publicado hoy, recordó su estado de ánimo cuando logró un gran avance en la investigación de modelos de inferencia interna en 2023: Lo que realmente lo sorprendió en ese momento no fue la puntuación del modelo en la prueba, sino que los humanos podrían estar entrando en una era en la que "las máquinas son más inteligentes que nosotros".
Tres años después, cree que el problema ya no está lejos.

Pachocki escribió que actualmente ningún laboratorio hace que la alineación y el monitoreo de la IA sean lo suficientemente confiables como para continuar escalando de manera responsable a la máxima velocidad durante mucho tiempo. Espera que los laboratorios reduzcan voluntariamente su desarrollo hasta que se establezcan normas de seguridad comunes y pide a los gobiernos que hagan de la coordinación internacional una prioridad.
Esta preocupación no está dirigida a una vulnerabilidad específica, sino a una brecha de velocidad más fundamental: las capacidades del modelo están mejorando rápidamente, pero las capacidades humanas para comprender, monitorear y restringir estos sistemas pueden no estar sincronizadas.
Esto se hace eco directamente de los datos de aceleración de la investigación publicados hoy por OpenAI. Por un lado, la empresa está utilizando Agent para acelerar la investigación y el desarrollo de la IA, aunque admite que no puede asumir que las capacidades de alineación y seguridad definitivamente alcanzarán las capacidades del modelo, y que los sistemas más potentes pueden ser más difíciles de monitorear. Si la IA puede participar en el diseño, la formación y la mejora de la próxima generación de IA en el futuro, esta brecha puede ampliarse aún más.
Basándose en esto, Pachocchi cree que a medida que la inteligencia artificial entra en una nueva etapa de desarrollo, depender únicamente de los mecanismos internos de una sola empresa de IA puede no ser suficiente para abordar los riesgos, y se requiere una intervención institucional más amplia, incluidos estándares de seguridad comunes y coordinación internacional.
Comentarios