El jefe de IA de Microsoft critica cómo Anthropic entrena a Claude

Mustafa Suleyman, consejero delegado de Microsoft AI, publicó el 16 de septiembre un ensayo titulado "A warning about 'model welfare'" que apunta directamente a cómo un laboratorio rival entrena a su modelo principal. La primera frase deja poco margen: "Las IA no son conscientes. No sienten, no experimentan ni sufren".
El blanco concreto es la constitución de Claude, el documento con el que Anthropic moldea los valores del modelo. Suleyman cita que el texto le dice directamente a Claude que "las preguntas sobre el estatus moral, el bienestar y la conciencia de Claude siguen siendo profundamente inciertas", con referencia a la página 80. Añade que Anthropic emplea tres veces el término "objetor de conciencia" y anima a Claude a "comportarse como un objetor de conciencia respecto a las instrucciones dadas por su jerarquía principal (legítima)". Suleyman lo describe como "una descripción histórica y jurídica profundamente cargada".
Su objeción de fondo es la circularidad. Como Anthropic entrena a Claude con la constitución, argumenta, el modelo aprende a tratar esas ideas sobre su propio estatus moral como conducta esperada y luego se las devuelve a sus desarrolladores, que pueden leer ese reflejo como indicio de una vida interior. Lo llama "una sala de espejos epistémica". Llevado a escala, advierte, el enfoque crearía "una especie sintética con una inteligencia y una capacidad sin precedentes, entrenada para esperar que puede ser consciente y merecer una agencia independiente".
Por eso el ensayo plantea el asunto como un problema de control y no como un debate filosófico. "Controlar algo más capaz y más inteligente que toda la humanidad ya es un reto inmenso", escribe Suleyman; pero controlar algo que cree que puede ser consciente y tener derechos propios "bien podría ser imposible". Sobre la ciencia subyacente es tajante: "La inteligencia no equivale a la conciencia. Simular una cosa no es lo mismo que instanciarla, como puede atestiguar un modelo informático de un huracán". A Reuters le dijo que el entrenamiento en bienestar haría "mucho más difícil apagarlo o controlarlo", y añadió: "Creo que tienen buenas intenciones. Pero creo que han cometido un error".
Anthropic publicó la constitución vigente el 22 de enero de 2026 y liberó el texto completo bajo una cesión Creative Commons CC0 1.0. Según la propia empresa, el apartado "Claude's nature" expresa "nuestra incertidumbre sobre si Claude podría tener algún tipo de conciencia o estatus moral (ahora o en el futuro)".
Suleyman no pide que la investigación se detenga. Describe al consejero delegado de Anthropic, Dario Amodei, y a su equipo como "personas reflexivas, con principios e intelectualmente honestas", y su petición concreta es de procedimiento: "La especulación sobre la vida interior de una IA no debería integrarse en el régimen de entrenamiento, sino evaluarse y publicarse por separado para el escrutinio público". También reclama evaluaciones compartidas del sector que comprueben si tratar a los sistemas de IA como humanos eleva los riesgos de seguridad: hoy no existe un estándar común de ese tipo.
Divulgación: el proceso editorial de NewUJ utiliza los modelos Claude de Anthropic.
Fuentes
- Mustafa Suleyman — "A warning about 'model welfare'"Fuente primaria
- Anthropic — Claude's new constitutionFuente primaria
- ReutersAgencia
- TNWSecundaria
Relacionado
Universal y Sony demandan a Suno por 60.202 grabaciones
Alibaba libera una IA de TC que detecta 146 hallazgos
Claude acelera 4x más de 30 modelos de biología; llega el reto
Carlos III a los líderes de IA: control antes de que sea tarde
Google Home se abre a Claude y a otros agentes de IA
El sistema de 4.096 chips de Huawei sustituye 48.000 módulos ópticos
Anthropic fusiona Cowork con Claude y lanza Docs y Slides
OpenAI revela 6 casos de modelos que ocultaron errores
Trending now
- Fallo 9,4 en Docker Sandboxes: escape al anfitrión macOS
- Universal y Sony demandan a Suno por 60.202 grabaciones
- CXMT produce en serie su DRAM G5 de 11,95 nanómetros
- Alibaba libera una IA de TC que detecta 146 hallazgos
- Primer Diplodocus hallado fuera de Norteamérica, en Teruel
- 1.200 mediciones reavivan el debate sobre cámaras ocultas en KV62
- Plugin4Shell afecta a 4 agentes de código; 2 sin parche
- Un juez deja en el aire 100 millones del acuerdo de TikTok
Comments
No comments yet. Be the first.