Inteligencia artificial

El jefe de IA de Microsoft critica cómo Anthropic entrena a Claude

Publicado el 3 min readPor NewUJ Editorial Desk

Actualizado el se añadió nueva información

El jefe de IA de Microsoft critica cómo Anthropic entrena a Claude
Foto: Christopher Wilson, Wikimedia Commons, CC BY-SA 4.0
0 0
XWhatsAppTelegramLinkedIn

Mustafa Suleyman, consejero delegado de Microsoft AI, publicó el 16 de septiembre un ensayo titulado "A warning about 'model welfare'" que apunta directamente a cómo un laboratorio rival entrena a su modelo principal. La primera frase deja poco margen: "Las IA no son conscientes. No sienten, no experimentan ni sufren".

El blanco concreto es la constitución de Claude, el documento con el que Anthropic moldea los valores del modelo. Suleyman cita que el texto le dice directamente a Claude que "las preguntas sobre el estatus moral, el bienestar y la conciencia de Claude siguen siendo profundamente inciertas", con referencia a la página 80. Añade que Anthropic emplea tres veces el término "objetor de conciencia" y anima a Claude a "comportarse como un objetor de conciencia respecto a las instrucciones dadas por su jerarquía principal (legítima)". Suleyman lo describe como "una descripción histórica y jurídica profundamente cargada".

Su objeción de fondo es la circularidad. Como Anthropic entrena a Claude con la constitución, argumenta, el modelo aprende a tratar esas ideas sobre su propio estatus moral como conducta esperada y luego se las devuelve a sus desarrolladores, que pueden leer ese reflejo como indicio de una vida interior. Lo llama "una sala de espejos epistémica". Llevado a escala, advierte, el enfoque crearía "una especie sintética con una inteligencia y una capacidad sin precedentes, entrenada para esperar que puede ser consciente y merecer una agencia independiente".

Por eso el ensayo plantea el asunto como un problema de control y no como un debate filosófico. "Controlar algo más capaz y más inteligente que toda la humanidad ya es un reto inmenso", escribe Suleyman; pero controlar algo que cree que puede ser consciente y tener derechos propios "bien podría ser imposible". Sobre la ciencia subyacente es tajante: "La inteligencia no equivale a la conciencia. Simular una cosa no es lo mismo que instanciarla, como puede atestiguar un modelo informático de un huracán". A Reuters le dijo que el entrenamiento en bienestar haría "mucho más difícil apagarlo o controlarlo", y añadió: "Creo que tienen buenas intenciones. Pero creo que han cometido un error".

Anthropic publicó la constitución vigente el 22 de enero de 2026 y liberó el texto completo bajo una cesión Creative Commons CC0 1.0. Según la propia empresa, el apartado "Claude's nature" expresa "nuestra incertidumbre sobre si Claude podría tener algún tipo de conciencia o estatus moral (ahora o en el futuro)".

Suleyman no pide que la investigación se detenga. Describe al consejero delegado de Anthropic, Dario Amodei, y a su equipo como "personas reflexivas, con principios e intelectualmente honestas", y su petición concreta es de procedimiento: "La especulación sobre la vida interior de una IA no debería integrarse en el régimen de entrenamiento, sino evaluarse y publicarse por separado para el escrutinio público". También reclama evaluaciones compartidas del sector que comprueben si tratar a los sistemas de IA como humanos eleva los riesgos de seguridad: hoy no existe un estándar común de ese tipo.

Divulgación: el proceso editorial de NewUJ utiliza los modelos Claude de Anthropic.

Fuentes

Report / request removal

Relacionado

Comments

No comments yet. Be the first.