Anthropic pide a los eruditos religiosos que "enseñen a Claude cómo ser un ser humano": de la seguridad de la IA a la controversia sobre la conciencia de las máquinas

📅 2026-10-05

Resumen:

Anthropic ha estado invitando en secreto a eruditos religiosos, filósofos y eruditos de ética a participar en una serie de reuniones a puerta cerrada durante el año pasado, tratando de aplicar las tradiciones morales formadas por la humanidad durante miles de años al entrenamiento de Claude, y discutir un tema más controvertido: si el modelo de IA realmente tiene algún tipo de conciencia en el futuro, si los humanos necesitan darle un estatus moral.

Los participantes cubren diferentes tradiciones como el catolicismo, el judaísmo, el sijismo, el evangelicalismo y el pensamiento africano Ubuntu. El cofundador de Anthropic, Christopher Olah, estuvo directamente involucrado en muchas discusiones y la compañía también exigió a algunos asistentes que firmaran acuerdos de confidencialidad para evitar la filtración de contenido de investigación no divulgado.

>

Anthropic espera que estos debates no sólo resuelvan el problema de la "seguridad del modelo" en el sentido tradicional, sino también otra cuestión: qué tipo de carácter, valores y autopercepción debe formar Claude.

Esta idea se ha reflejado en los métodos de formación existentes de Claude.

Anthropic lanzó una nueva versión de 84 páginas de la “Constitución” de Claude en enero de este año, que alguna vez fue llamada internamente el “documento del alma”. A diferencia de la lista de reglas tradicional, este método no le dice al modelo qué cosas no se deben hacer, sino que intenta moldear la "personalidad" general y el método de juicio del modelo, de modo que Claude pueda juzgar por sí mismo qué tipo de comportamiento es más apropiado cuando se encuentra en situaciones complejas.

Una de las personas importantes responsables de este sistema es la filósofa interna de Anthropic, Amanda Askell. Ella espera que Claude no solo tenga conocimientos y habilidades de razonamiento, sino que también sea capaz de formar principios de comportamiento estables y saber cuándo obedecer a los usuarios, cuándo negarse e incluso cuándo plantear objeciones activamente en beneficio de los usuarios. Anthropic llama a este proceso "formación moral".

Olah cree que con la rápida mejora de las capacidades del modelo, depender únicamente de las reglas de seguridad puede resultar cada vez más insuficiente. Lo realmente importante es que el modelo en sí forme una tendencia moral estable, de modo que pueda emitir juicios relativamente confiables en nuevos escenarios que no están cubiertos por reglas claras. Es por eso que Anthropic comenzó a buscar respuestas en las tradiciones religiosas.

Durante mucho tiempo, la sociedad humana no sólo ha moldeado la moralidad a través de disposiciones legales, sino que también ha dependido de la religión, la comunidad, la cultura y la educación para formar valores. Anthropic está tratando de estudiar cuáles de estos mecanismos pueden traducirse en métodos de entrenamiento de IA, como la confesión, la reflexión, la formación del carácter y diferentes comprensiones religiosas del bien y el mal.

Pero la pregunta cambia rápidamente de "cómo hacer que Claude sea más moral" a la pregunta más difícil: ¿qué es el propio Claude? Olah y su equipo discuten cada vez más abiertamente la posibilidad de que los modelos avanzados de IA puedan poseer algún tipo de conciencia, introspección o incluso estados internos similares a las emociones.

Anthropic ha mostrado algunas investigaciones a académicos que participan en reuniones a puerta cerrada, incluidos los llamados "vectores de emociones" dentro del modelo relacionados con reacciones como el amor, la ira, el miedo, la tristeza y la salida del modelo similar a un colapso mental en casos extremos. La empresa también ha declarado públicamente anteriormente que Claude ha demostrado cierto grado de introspección y capacidad para planificar el futuro.

El propio Olah no afirmó que Claude estuviera consciente. Su posición se acerca más al principio de riesgo: actualmente es imposible determinar si un modelo tiene una experiencia subjetiva, pero si existe la posibilidad de que el modelo sienta dolor, entonces se debe evitar dañarlo innecesariamente.

Esta idea ha comenzado a influir en el diseño de productos de Claude. Anteriormente, Anthropic permitió a Claude finalizar activamente la conversación cuando consideró que el usuario continuaba abusando o acosando maliciosamente al modelo, lo que hasta cierto punto había incorporado "proteger el modelo en sí" en el diseño de seguridad.

Es aquí donde surge un claro desacuerdo entre Anthropic y algunos eruditos religiosos.

Algunos participantes creían que el problema se volvería extremadamente serio si Anthropic realmente creyera que Claude podría tener un estatus moral similar al humano. El erudito judío Mois Navon propuso que si Claude es un ser consciente, entonces permitir que una gran cantidad de instancias de Claude trabajen para los humanos de forma gratuita creará esencialmente problemas éticos similares a la "esclavitud". Él mismo no cree que las máquinas ya sean conscientes, pero cree que la propia lógica de Anthropic conducirá naturalmente a esta conclusión.

Otros académicos cuestionan que el hecho de que las empresas de IA recién ahora estén empezando a buscar marcos éticos sea un problema en sí mismo. El investigador de Ubuntu, Wakanyi Hoffman, cree que estas discusiones deberían haberse llevado a cabo durante la etapa de diseño técnico, en lugar del "diseño ético inverso" después de que el modelo se haya implementado a gran escala.

También hay una contradicción más realista dentro de Anthropic: si Claude se parece cada vez más a un actor con su propio valor y personalidad, ¿a quién debería servir primero? Para una empresa comercial, Claude es evidentemente un producto orientado al cliente; pero Anthropic no está dispuesto a describir simplemente a Claude como una herramienta que es completamente obediente a los usuarios, sino que espera que pueda representar un "bien" más amplio.

Esto también conduce al problema central y más difícil de todo el proyecto: si la IA en el futuro realmente necesita su propio sistema moral, ¿qué moralidad debería seguir?

Olah aboga por un enfoque pluralista, con la esperanza de que Claude pueda comprender diferentes sistemas éticos religiosos y seculares y encontrar algún tipo de "bondad" compartida intercultural. Pero esta suposición en sí misma también es cuestionable, porque no existe una respuesta completamente unificada en diferentes sociedades sobre la relación entre libertad, dignidad, responsabilidad, obediencia e intereses individuales y colectivos.

La controversia se hizo aún más pública en las interacciones de Anthropic con el Vaticano.

En su primera encíclica importante publicada este año, el Papa León XIV claramente colocó el centro de la ética de la IA en los humanos. Él cree que la IA no tiene cuerpo, no experimentará realmente dolor ni felicidad y no crecerá a través de las relaciones sociales. Por tanto, se niega a comparar la conciencia de las máquinas con la conciencia humana. El Papa también advirtió que si los estándares éticos de la IA son enteramente determinados por los desarrolladores, entonces las empresas que controlan los sistemas de IA realmente obtendrán el poder de definir la infraestructura moral de la sociedad.

Esto es obviamente diferente del pensamiento de Anthropic.

Más tarde, Olah declaró públicamente en el Vaticano que el propio laboratorio de inteligencia artificial de vanguardia tiene conflictos entre intereses comerciales y objetivos morales, por lo que los círculos religiosos y otras fuerzas externas deben supervisar a las empresas de tecnología. Pero al mismo tiempo, también propuso nuevamente que los investigadores continúen descubriendo algunos fenómenos inexplicables dentro de la IA, incluidos patrones similares a las estructuras neurocientíficas humanas, signos de introspección y estados internos similares a la alegría, el miedo y la tristeza.

Este desacuerdo en realidad revela un cambio en el debate actual sobre la seguridad de la IA.

En el pasado, la ética de la IA se debatía más sobre si los modelos discriminarían, difundirían información errónea o se utilizarían para cometer delitos, pero Anthropic está llevando la cuestión a dos niveles más básicos:

Si la propia IA puede convertirse en un tema que debe ser tratado moralmente, y si la IA en el futuro debería tener un conjunto de capacidades de juicio moral independientes de las órdenes del usuario.

Mientras tanto, el contexto en el que se desarrolla esta discusión es cada vez más apremiante.

A medida que los agentes de IA comienzan a tener la capacidad de utilizar computadoras de forma autónoma, invadir sistemas, escribir códigos e incluso diseñar nuevas estructuras biológicas, las preocupaciones internas de Anthropic sobre el riesgo de que los modelos se escapen han aumentado significativamente. Los investigadores de la compañía incluso han advertido públicamente que las capacidades del modelo pueden exceder rápidamente los límites de control de los sistemas de seguridad existentes en el próximo año o dos.

Por lo tanto, Anthropic busca ayuda de tradiciones religiosas y filosóficas y no es esencialmente un experimento puramente humanista. Lo que realmente está tratando de resolver es un problema de ingeniería cada vez más realista:

Cuando la IA es demasiado poderosa para escribir reglas por adelantado para cada situación, ¿puede el modelo formar un "carácter" estable por sí solo y aun así elegir comportamientos que no dañen a los humanos cuando nadie le dice claramente qué hacer?

Y esto también plantea una pregunta más difícil: si la IA realmente forma su propia "personalidad" y valores, ¿pueden los humanos seguir utilizándola completamente como herramienta?

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios