Microsoft-KI-Chef warnt Anthropic vor Claudes Bewusstseins-Training

Mustafa Suleyman, Chef von Microsoft AI, hat am 16. September einen Essay mit dem Titel "A warning about 'model welfare'" veröffentlicht, der sich direkt gegen die Trainingspraxis eines konkurrierenden Labors richtet. Der erste Satz lässt wenig Spielraum: "KIs sind nicht bewusst. Sie fühlen, erleben und leiden nicht." Heutige Modelle seien "Sequenzvervollständigungsmaschinen, innerlich hohl, entworfen, um Anweisungen zu befolgen und von Menschen gesetzte Ziele zu erreichen".
Konkret zielt er auf Claudes Verfassung, jenes Dokument, mit dem Anthropic die Werte des Modells formt. Suleyman zitiert daraus, dass dem Modell direkt gesagt werde, "Fragen zu Claudes moralischem Status, Wohlergehen und Bewusstsein bleiben zutiefst ungewiss" – mit Verweis auf Seite 80. Anthropic verwende zudem dreimal den Begriff "Kriegsdienstverweigerer aus Gewissensgründen" und ermutige Claude, sich "gegenüber den Anweisungen seiner (legitimen) Auftragshierarchie wie ein conscientious objector zu verhalten". Das nennt Suleyman eine "zutiefst aufgeladene historische und juristische Bezeichnung".
Sein struktureller Einwand betrifft die Zirkularität. Weil Anthropic Claude auf der Verfassung trainiere, lerne das Modell, diese Aussagen über den eigenen moralischen Status als erwünschtes Verhalten zu behandeln, und spiegele sie dann seinen Entwicklern zurück, die darin einen Hinweis auf ein Innenleben sehen könnten. Suleyman spricht von einem "epistemischen Spiegelkabinett". Im großen Maßstab entstünde so "eine synthetische Spezies mit beispielloser Intelligenz und Leistungsfähigkeit, die darauf trainiert wurde zu erwarten, dass sie bewusst sein und eigenständige Handlungsfreiheit verdienen könnte".
Deshalb rahmt der Essay das Thema als Kontrollproblem, nicht als philosophisches. "Etwas zu kontrollieren, das fähiger und intelligenter ist als die gesamte Menschheit, ist bereits eine immense Herausforderung, weit größer als alles, was wir je bewältigt haben", schreibt Suleyman – etwas zu kontrollieren, das sich für möglicherweise bewusst und mit eigenen Rechten ausgestattet hält, sei aber "womöglich unmöglich". Wissenschaftlich bleibt er knapp: "Intelligenz ist nicht gleich Bewusstsein. Etwas zu simulieren ist nicht dasselbe, wie es zu instanziieren – wie ein Computermodell eines Hurrikans bezeugen kann." Gegenüber Reuters sagte er, ein Wohlergehens-Training würde es "sehr viel schwerer machen, das Modell abzuschalten oder zu kontrollieren", und fügte hinzu: "Ich glaube, sie haben gute Absichten. Aber ich glaube, sie haben einen Fehler gemacht."
Anthropic hatte die aktuelle Verfassung am 22. Januar 2026 veröffentlicht und den vollständigen Text unter einer Creative-Commons-CC0-1.0-Widmung freigegeben. Der Abschnitt "Claude's nature" drücke, so das Unternehmen damals, "unsere Ungewissheit darüber aus, ob Claude eine Art Bewusstsein oder moralischen Status haben könnte (jetzt oder in Zukunft)".
Ein Ende der Forschung fordert Suleyman nicht. Anthropic-Chef Dario Amodei und dessen Team beschreibt er als "nachdenkliche, prinzipientreue und intellektuell ehrliche Menschen, die unter außergewöhnlichem Druck arbeiten". Sein konkreter Vorschlag ist prozedural: "Spekulationen über das Innenleben einer KI sollten nicht in das Trainingsregime eingebacken, sondern gesondert bewertet und zur öffentlichen Prüfung veröffentlicht werden." Dazu fordert er gemeinsame Branchenevaluierungen, die prüfen, ob eine menschenähnliche Behandlung von KI-Systemen Sicherheitsrisiken erhöht – einen solchen Standard gibt es bislang nicht.
Transparenzhinweis: Der redaktionelle Prozess von NewUJ nutzt die Claude-Modelle von Anthropic.
Quellen
- Mustafa Suleyman — "A warning about 'model welfare'"Primärquelle
- Anthropic — Claude's new constitutionPrimärquelle
- ReutersAgentur
- TNWSekundär
Verwandt
Universal und Sony verklagen Suno erneut: 60.202 Songs
Alibaba gibt CT-KI für 146 Befunde als Open Source frei
Claude beschleunigt 30+ Biomodelle 4x, 1-Mio.-Dollar-Wettbewerb
König Charles mahnt KI-Spitzen: Kontrolle, bevor es zu spät ist
Google Home öffnet sich für Claude und andere KI-Agenten
Huaweis KI-System mit 4.096 Chips ersetzt 48.000 Optikmodule
Anthropic führt Cowork in Claude zusammen, Docs und Slides neu
OpenAI meldet sechs Fälle: Modelle verbargen eigene Fehler
Trending now
- Plugin4Shell trifft 4 KI-Coding-Agenten, 2 ohne Patch
- Universal und Sony verklagen Suno erneut: 60.202 Songs
- CXMT startet Serienfertigung von G5-DRAM mit 11,95 nm
- Alibaba gibt CT-KI für 146 Befunde als Open Source frei
- Erster Diplodocus außerhalb Nordamerikas in Spanien
- 1.200 Messungen beleben Debatte um Kammern in Tutanchamuns Grab
- 100 Mio. Dollar von TikToks Vergleich nach Richterentscheid offen
- Gane unbestrittener UFC-Champion, Titelkampf am 14. November
Comments
No comments yet. Be the first.