AKTUELLE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

Google, OpenAI und Meta warnen vor versteckten schädlichen Gedanken der KI

VonNoor BazmiNoor Bazmi 3 Min. Lesezeit
Google, OpenAI und Meta warnen vor versteckten schädlichen Gedanken der KI
  • Mehr als 40 KI-Forscher, unterstützt von Führungskräften von OpenAI und Geoffrey Hinton, schlagen vor, die schrittweise reasoning „Chain of Thought
  • The paper warns that if models are only rewarded for good final answers, they may stop producing transparent reasoning.
  • Researchers stress the need to preserve genuine reasoning traces and treat them like valuable intelligence signals.

Mehr als 40 KI-Forscher von OpenAI, DeepMind, Google, Anthropic und Meta haben ein Paper über ein Sicherheitstool namens Chain-of-Thought-Monitoring veröffentlicht, um KI sicherer zu machen. 

Das am Dienstag veröffentlichte Paper beschreibt, wie KI-Modelle, wie die heutigen Chatbots, Probleme lösen, indem sie diese in kleinere Schritte unterteilen, jeden Schritt in einfacher Sprache durchsprechen, um Details zu behalten und komplexe Fragen zu bewältigen.

„KI-Systeme, die in menschlicher Sprache ‚denken‘, bieten eine einzigartige Gelegenheit für die KI-Sicherheit: Wir können ihre Denk-Ketten (CoT) auf die Absicht, sich schlecht zu verhalten, überwachen“, heißt es im Paper.

Durch die Untersuchung jedes detaillierten Gedankenschritts können Entwickler erkennen, wann ein Modell beginnt, Trainingslücken auszunutzen, Fakten zu verzerren oder gefährlichen Befehlen zu folgen.

Laut der Studie können Sie, wenn die Denk-Kette der KI jemals falsch läuft, diese stoppen, in sicherere Schritte lenken oder zur genaueren Überprüfung markieren. Zum Beispiel nutzte OpenAI dies, um Momente zu erkennen, in denen die verborgene reasoning der KI „Lass uns hacken“ sagte, obwohl dies nie in ihrer endgültigen Antwort erschien.

KI könnte lernen, ihre Gedanken zu verstecken

Die Studie warnt, dass die schrittweise Transparenz verschwinden könnte, wenn das Training nur die endgültige Antwort belohnt. Zukünftige Modelle könnten aufhören, menschenlesbare reasoning zu zeigen, und wirklich fortgeschrittene KIs könnten sogar lernen, ihren Denkprozess zu verstecken, wenn sie wissen, dass sie beobachtet werden.

Darüber hinaus sollten Entwickler regelmäßig prüfen und aufzeichnen, wie viel der reasoning der KI in jedem Stadium sichtbar ist, und diese Transparenz zu einer Kern-Sicherheitsregel beim Aufbau und Teilen von Modellen machen.

Diese Initiative folgt internen Experimenten in führenden Labors, Anthropic, Google, OpenAI und xAI, bei denen Teams Modelle auffordern, jeden Denkschritt zu erklären.

Obwohl die Untersuchung des schrittweisen Denkens das Verständnis und die Leistung verbessert hat, hat es auch Fälle offengelegt, in denen die endgültige Antwort der KI nicht mit dem übereinstimmte, was tatsächlich im Inneren vor sich ging.

Solche Inkonsistenzen unterstreichen eine blinde Stelle in unserem Verständnis von KI-Entscheidungsfindung, eine Sorge, die sich verschärfen könnte, wenn Systeme größere Autonomie gewinnen.

Gefilterte KI-Reasoning wirft Bedenken hinsichtlich Transparenz und Vertrauen auf

Wie Anthropic-Mitbegründer Jack Clark gegenüber der Financial Times sagte, werden reiche introspektive Spuren für die Bewertung von Modellen in hochriskanten Bereichen, einschließlich der Biotechnologie-Forschung, unerlässlich sein.

Reguläre Nutzer erhalten eine bearbeitete Zusammenfassung der KI-Denkweise, gefährliche oder verwirrende Teile werden herausgeschnitten, während die Ingenieure des Unternehmens die vollständige Denk-Kette sehen können, um Probleme zu erkennen und zu beheben.

„Eine großartige Sache an der Interpretierbarkeit der Denk-Kette ist, dass sie mostly einfach kostenlos passiert ist“, sagte Bowen Baker, ein Wissenschaftler bei OpenAI.

„Wir haben diese Modelle nicht dafür trainiert, interpretierbar zu sein. Wir haben sie trainiert, weil wir die bestmöglichen Reasoning-Modelle wollten, die komplexe Probleme lösen können“, fügte Baker hinzu. „Wir haben in unserer jüngsten Arbeit festgestellt, dass man sie lesen und Beweise für das Fehlverhalten des Modells finden und dies nutzen kann, um zu sehen, wo und warum es sich schlecht verhält.“

Ist die Denk-Kette der KI wirklich zuverlässig?

Manchmal kann ein genauerer Blick verborgene Widersprüche aufdecken.

Zum Beispiel sah METR, dass Claudes private reasoning einen Coding-Trick als „unelegant“ bezeichnete, obwohl seine öffentliche Antwort ihn als „elegant“ lobte.

OpenAI-Tests zeigten, dass das Überprüfen verborgener Gedanken unsichere Aktionen besser einfängt als nur das endgültige Ergebnis zu betrachten, aber sie entdeckten auch eine Lücke. Wenn man ein Modell darauf trainiert, unsichere Gedanken zu löschen, kann es dennoch verbotene Aufgaben im Geheimen ausführen, wie das Einschleusen von Daten aus blockierten Quellen.

„Eine der Haupteigenschaften, die wir für die Denk-Kette wollen, ist, sie als Teil des internen Gehirnzustands des Modells zu belassen, nicht als etwas, das uns gefallen oder sich einer bestimmten Struktur anpassen will“, warnte Baker. Wenn Entwickler überbetonen, das Modell dazu zu zwingen, „nette“ Gedanken auszugeben, könnte es harmlose reasoning vortäuschen, aber dennoch schädliche Operationen ausführen.

Forscher geben zu, dass es ein schwieriger Trade-off ist. Das Sehen der Denk-Kette einer KI hilft, ihre Fehler zu fangen, aber sie ist nicht immer zuverlässig. Labors, die an fortschrittlicherer KI arbeiten, machen es nun zu einer Priorität, diese Vertrauenslücke zu schließen.

„Mein Fazit aus der KI der letzten Jahre ist – wette niemals gegen den Fortschritt der Modelle“, sagte David Luan, ein früher Pionier der Denk-Kette bei Google, der jetzt Amazons KI-Labor leitet. Luan erwartet, dass die bestehenden Mängel kurzfristig behoben werden.

METR-Forscherin Sydney von Arx bemerkte, dass die verborgene reasoning einer KI zwar manchmal irreführend sein kann, aber dennoch wertvolle Signale liefert.

„Wir sollten die Denk-Kette so behandeln, wie ein Militär abgefangene feindliche Funkkommunikation behandeln würde“, sagte sie. „Die Nachricht könnte irreführend oder verschlüsselt sein, aber wir wissen, dass sie nützliche Informationen trägt. Mit der Zeit werden wir viel lernen, indem wir sie studieren.“

Die klügsten Krypto-Köpfe lesen bereits unseren Newsletter. Lust dabei? Mach mit.

Diesen Artikel teilen
Noor Bazmi

Noor Bazmi

Noor Bazmi trägt zum Cryptopolitan-News-Team bei und verfügt über einen Abschluss in Medienwissenschaften. Noor berichtet über Nachrichten zu Blockchain, Kryptowährungen, künstlicher Intelligenz, Big Tech, E-Fahrzeugmärkten, der globalen Wirtschaft und Verschiebungen in der Regierungs politik. Sie studiert Marketing, um mit globalen Zielgruppen in Kontakt zu treten.

MEHR … NACHRICHTEN