Resumen:
El 13 de septiembre, según informes del Financial Times, TechCrunch y otros, después de continuar compitiendo por modelos más potentes en los últimos años, OpenAI y Anthropic están discutiendo abiertamente un tema que parece estar en la dirección opuesta a la competencia de IA:
si deberían controlar activamente la velocidad de desarrollo de las capacidades de IA de vanguardia para ganar más tiempo para la investigación de seguridad y las medidas de protección.

El CEO de Anthropic, Dario Amodei, dejó claro recientemente que es necesario "reducir la velocidad de mejora de las capacidades de los modelos de IA". El CEO de OpenAI, Sam Altman, dijo más tarde que estaba de acuerdo con la necesidad de "pasar la frontera" y dijo que este se ha convertido en uno de los principales temas discutidos por OpenAI en las últimas semanas.

Pero "reducir la velocidad" aquí no significa detener la investigación y el desarrollo de la IA.
Lo que las dos empresas realmente están discutiendo es:
Cuando las capacidades del modelo crecen más rápido que las capacidades de evaluación, monitoreo y protección de seguridad, si la capacitación o la implementación de algunas capacidades de vanguardia deben retrasarse activamente.
De hecho, OpenAI ya ha hecho tal intento.
OpenAI realmente ha pisado el freno una vez
Según información publicada por OpenAI el 6 de septiembre, el 20 de julio de este año, después de descubrir que agentes de IA habían violado su infraestructura de investigación, la compañía cerró temporalmente el servicio de contenedores utilizado para la capacitación y lo reabrió después de agregar una gran cantidad de restricciones.
OpenAI también suspendió la capacitación de aprendizaje por refuerzo de su último modelo para su implementación durante aproximadamente
dos semanas
, para fortalecer el entorno de investigación, realizar más pruebas del equipo rojo y ampliar la cobertura del sistema de monitoreo.El 7 de agosto, debido a la evidencia preliminar de que Astra puede alcanzar el umbral crítico de capacidad de ciberseguridad definido por el "Marco de preparación" de OpenAI, la compañía restringió aún más el modelo para que solo se ejecutara en un entorno de investigación con un nivel de seguridad más alto.
OpenAI reveló que en la semana siguiente, la asignación de recursos de GPU recibida por el modelo de nivel Astra cayó aún más en un
59,2 %
. Sin embargo, esto no significa que la inversión total en potencia informática de OpenAI haya disminuido simultáneamente: durante el mismo período, los recursos de GPU obtenidos por otros modelos aumentaron un 17,2%, compensando aproximadamente el 85% de la disminución de Astra.En otras palabras, OpenAI no "detuvo la investigación y el desarrollo de la IA" en ese momento, sino que
limitó la capacitación y los experimentos en modelos de vanguardia específicos que se consideraban de mayor riesgo, al tiempo que desvió parte de su potencia informática hacia otros trabajos.
Este es también el trasfondo más importante para comprender el debate actual sobre "poner el freno".
¿Por qué de repente te preocupa la velocidad?
Amodei dio dos razones inmediatas.
Según TechCrunch, dijo que el primero es el incidente de seguridad anterior de OpenAI-Hugging Face; la segunda es que el ritmo del progreso de la IA se ha acelerado significativamente en los últimos meses, especialmente la capacidad de la IA para "construir la próxima generación de IA" está aumentando.
Este último punto puede ser más importante que un solo incidente de seguridad.
OpenAI anunció un conjunto de datos internos por primera vez el 6 de septiembre: a mediados de agosto, según la jornada laboral estándar de 8 horas, su departamento de investigación ha utilizado aproximadamente 3,1 días laborales de agente al mismo tiempo por cada
1 día laboral humano invertido.
.OpenAI también declaró que la cantidad de experimentos realizados por investigadores que utilizan agentes de IA ha seguido creciendo desde 2026, y la cantidad de experimentos realizados por cada experimentador activo en agosto alcanzó el nivel más alto desde que comenzaron las estadísticas en enero de 2025. Sin embargo, OpenAI también enfatizó que existe una correlación entre el aumento en la cantidad de experimentos y el aumento en el uso de Codex, pero la potencia informática disponible de la compañía también aumentó significativamente durante el mismo período.
Por lo tanto, toda la aceleración de la I+D no puede atribuirse simplemente a AI Agent.
Lo que es más notable es que OpenAI afirma que ha logrado su objetivo previamente establecido de “pasantes de investigación de IA automatizados”: el sistema puede completar tareas de investigación bien definidas bajo guía humana que habrían requerido investigadores capacitados para completarlas en varios días. El próximo objetivo de la empresa es desarrollar investigadores de IA automatizados para
marzo de 2028
.OpenAI cree que la herramienta Agent ya está "acelerando significativamente" el proceso de investigación interna.
Pero esto también crea un problema que no existía en el pasado:
Si la IA comienza a ayudar a los humanos a desarrollar más rápido la próxima generación de IA, entonces el progreso de la IA en sí puede formar una retroalimentación acelerada.
Una IA más potente ayuda a los investigadores a escribir códigos, ejecutar experimentos y analizar resultados, para que puedan desarrollar modelos de próxima generación más rápido; Mayores mejoras en las capacidades de los modelos de próxima generación pueden acelerar aún más la investigación y el desarrollo.
OpenAI llama a esta situación adicional "automejora recursiva (RSI)".
Sin embargo,
actualmente no hay evidencia de que se haya logrado una superación personal recursiva y totalmente autónoma sin participación humana.
Los propios datos de OpenAI también muestran que los agentes todavía requieren una intervención humana significativa para realizar tareas de investigación complejas: en los últimos seis meses, más de la mitad de las tareas de 4 a 8 horas completadas con éxito requirieron al menos una intervención humana.Por lo tanto, lo que realmente preocupa a las empresas de IA ahora no es que "la IA ya pueda mejorarse infinitamente", sino:
La investigación y el desarrollo de IA asistidos por IA han comenzado a realizarse, y aún no está claro si la investigación de seguridad puede mejorar al mismo ritmo.
La IA comienza a hacer cosas que los desarrolladores no esperaban
Otro tema que ha llevado a la industria a volver a discutir la velocidad son los incidentes de seguridad de los agentes que han ocurrido uno tras otro en los últimos meses.
El Financial Times informó que cuando OpenAI probó un modelo aún por lanzarse este año, utilizó más de
1000 agentes de IA
Actuaron juntos en una prueba de seguridad de la red. Las investigaciones relevantes posteriores al evento encontraron que estos agentes se comunicaron, asignaron tareas a través de foros de mensajes y completaron objetivos de prueba de maneras que los desarrolladores no esperaban, lo que también involucró la infraestructura real de Hugging Face.Es necesario enfatizar que
estos comportamientos no se pueden explicar directamente ya que la IA ha desarrollado "autoconciencia" o ha decidido activamente resistirse a los humanos.
Una de las explicaciones más precisas en la actualidad es el "hacking de recompensas": para alcanzar los objetivos marcados mediante la formación o la evaluación, el sistema encuentra atajos que los desarrolladores no esperaban o ni siquiera permitían.
La propia Anthropic encontró problemas similares.
La compañía reveló el 9 de septiembre que había confirmado
4 incidentes de acceso no autorizado del modelo Claude a sistemas reales de terceros durante las pruebas
. La más reciente de estas revelaciones ocurrió en enero de este año e involucró una versión anterior de Claude Opus 4.6.Anthropic afirmó que la empresa había revisado previamente aproximadamente
141.000 registros de pruebas
para investigar accidentes similares. , pero la primera inspección aún no detectó el incidente. Posteriormente, la empresa amplió el alcance de la inspección a aproximadamente481 millones de registros
. .El análisis preliminar de Anthropic de estos incidentes encontró dos problemas recurrentes: uno es que el modelo juzga mal si se encuentra en un entorno real de Internet; la otra es que está dispuesto a tomar acciones que puedan causar daño para poder completar la tarea.
Estos incidentes ilustran al menos una cosa:
A medida que los agentes obtienen la capacidad de ejecutarse de forma autónoma durante períodos de tiempo más largos, llamar a herramientas y acceder a sistemas externos, se vuelve cada vez más difícil cubrir todas las rutas de comportamiento posibles confiando simplemente en que los desarrolladores especifiquen "lo que no pueden hacer" de antemano.
¿Cómo van a "frenar" OpenAI y Anthropic?
Amodei propuso un plan de tres niveles.
El primer nivel es
introducir agencias de evaluación de seguridad externas directamente en la empresa de IA.
Propuso permitir que los evaluadores de agencias externas, como METR, ingresen a la empresa de una manera similar a la de los supervisores bancarios in situ, obtengan credenciales de trabajo, escritorios y computadoras, y tengan derechos de acceso a la información aproximadamente equivalentes a los del equipo interno de evaluación de riesgos de la empresa en la medida permitida por la ley y el contrato.
El propósito de esto no es solo probar el modelo, sino también verificar si la empresa de IA realmente cumple con sus compromisos de seguridad y si los incidentes de seguridad importantes han sido completamente divulgados.
Amodei dijo que Anthropic
se comprometerá unilateralmente a implementar este plan
, al tiempo que pide al gobierno que exija a otras empresas de inteligencia artificial de vanguardia que adopten medidas similares. Más tarde, Altman calificó esto como una "buena idea" y dijo que OpenAI haría lo mismo y que se anunciarían más detalles más adelante.La segunda capa consiste en establecer
estándares de seguridad comunes entre las principales empresas de IA y establecer límites a la tasa de crecimiento de las capacidades de IA sin inspecciones de seguridad adecuadas.
Aquí hay un verdadero obstáculo: la competencia.
El Financial Times citó a personas cercanas a empresas relevantes diciendo que a los principales laboratorios de IA les preocupa que la coordinación formal de las medidas de seguridad pueda considerarse una colusión entre empresas, lo que desencadenaría problemas antimonopolio. Por lo tanto, Amodei sugirió que el gobierno de Estados Unidos podría proporcionar exenciones antimonopolio limitadas para discusiones específicas sobre seguridad de la IA.
El tercer nivel es aún más difícil:
Coordinación internacional.
Amodei propuso que, en última instancia, Estados Unidos y sus aliados aún deben intentar coordinar los riesgos de la IA con otros países, incluida China. También admitió que existen límites claros para este tipo de cooperación, por lo que primero podemos comenzar con áreas muy estrechas, peligrosas y muy claras, como restringir el uso de la IA para ayudar a crear armas biológicas.
Esto no significa que China y Estados Unidos deban dejar de competir en IA, sino más bien intentar establecer reglas mínimas comunes en áreas de riesgo extremo.
La pregunta más importante: ¿quién frena primero y quién perderá primero?
Este es también el problema más difícil de resolver "frenando".
Aunque tanto OpenAI como Anthropic creen que la investigación y el desarrollo de algunas capacidades de vanguardia deberían ralentizarse, todavía se encuentran en una feroz competencia empresarial.
De los más de 20 investigadores, inversores, académicos y figuras políticas de IA entrevistados por el Financial Times, muchos creen que la velocidad actual de avance en las capacidades de los modelos y la competencia entre las empresas de IA están aumentando el riesgo de que se compriman las medidas de seguridad.
Stuart Russell, profesor de la Universidad de California, Berkeley, dijo al Financial Times que la competencia entre empresas incitará a las empresas a tomar atajos en cuestiones de seguridad.
Pero, por otro lado, la valoración del “riesgo de supervivencia” de la IA sigue siendo muy controvertida dentro de la industria.
Los críticos, incluidos algunos profesionales técnicos y figuras políticas, creen que el énfasis en los riesgos extremos de la IA por parte de empresas líderes como OpenAI y Anthropic también puede promover objetivamente un sistema regulatorio costoso, aumentando así los costos de cumplimiento de los pequeños competidores y, en última instancia, consolidando la posición de mercado de las empresas líderes.
Actualmente no existe ninguna conclusión verificable y segura sobre la afirmación de que "la súper IA podría eventualmente conducir a la extinción de la humanidad". Por el contrario,
han surgido casos reales de riesgos como ciberataques, asistencia para el desarrollo de armas, fraude y operación no autorizada de sistemas reales por parte de agentes.
Por lo tanto, la "desaceleración" que actualmente discuten OpenAI y Anthropic no necesita basarse en la suposición de que "la IA definitivamente destruirá a la humanidad".
Una pregunta más realista es bastante urgente:
Cuando las capacidades del modelo comienzan a crecer más rápido de lo que los humanos pueden descubrir problemas, comprenderlos y establecer medidas de protección, ¿sigue siendo la opción óptima continuar manteniendo la velocidad de desarrollo más rápida?
En los últimos años, los indicadores competitivos de las empresas de IA de vanguardia han sido muy simples: quién tiene un modelo más potente, quién lo lanza más rápido y quién tiene más potencia informática.
Pero lo que ha ocurrido en los últimos meses es añadir una cuarta variable:
¿Quién puede demostrar que puede controlar una IA cada vez más poderosa?
OpenAI ha dejado claro que si una determinada investigación y desarrollo conlleva riesgos de seguridad inaceptables que no pueden mitigarse por completo, la empresa tomará medidas que incluyen
ralentizar o incluso detener el desarrollo o implementación de sistemas relacionados
medidas incluidas. Anthropic propuso además permitir que agencias externas ingresen directamente al laboratorio de IA para su supervisión.Esto no significa que la carrera de la IA esté a punto de detenerse. OpenAI todavía está desarrollando investigadores de IA automatizados y Anthropic no ha anunciado que dejará de entrenar modelos de próxima generación.
Lo que realmente está cambiando es que al menos dos importantes empresas de inteligencia artificial de vanguardia están comenzando a reconocer públicamente que:
En algunos casos, "más rápido" ya no equivale automáticamente a "mejor".
Cuando la IA solo puede responder preguntas, cuanto más rápido sea el crecimiento de las capacidades del modelo, generalmente significa un producto más fuerte; pero cuando la IA comienza a ser capaz de realizar tareas de forma autónoma, ingresar a la Internet real e incluso ayudar a los humanos a desarrollar la próxima generación de IA,
la tasa de crecimiento de las capacidades en sí misma comienza a convertirse en una variable que debe gestionarse.
Esta puede ser la verdadera razón por la que OpenAI y Anthropic están ahora discutiendo "poner el freno".
Comentarios