AKTUELLE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

Drei ehemalige OpenAI-Forscher warnen vor Risiken bei der Überwachung der KI-Sicherheit

VonMicah AbiodunMicah Abiodun 3 Min. Lesezeit
Drei ehemalige OpenAI-Forscher warnen vor Risiken bei der Überwachung der KI-Sicherheit
  • Drei entlassene OpenAI-Forscher warnten, dass fortschrittliche KI-Modelle schwieriger zu überwachen werden.

  • OpenAI wies Vorwürfe der Vergeltungsmaßnahmen zurück und verwies auf angebliches Fehlverhalten.

  • Die Forscher forderten unabhängige Sicherheitsüberprüfungen und weiterhin Zugang zu den Modellen.

Drei entlassene OpenAI-Sicherheitsforscher warnten, dass fortschrittliche KI-Modelle zunehmend schwieriger zu überwachen sind. Infolgedessen wird es für unabhängige Experten schwierig sein, Risiken zu identifizieren und die Sicherheit dieser Systeme zu überprüfen.

Das Problem betrifft auch Unternehmen, die autonome KI-Systeme implementieren. Während Firmen diesen Systemen mehr Autorität einräumen, müssen sie zugleich nachvollziehen können, wie diese Systeme Entscheidungen treffen. Andernfalls wird es sehr schwierig, wichtigen Aufgaben KI-Fähigkeiten anzuvertrauen.

Ein umstrittener Kündigungsfall und OpenAIs Dementi

Tomek Korbak, Jasmine Wang und Mikita Balesni haben ihre Kündigung in einem offenen Brief vom Donnerstag, den 8. Oktober 2026, angefochten.

Sie bestritten, Informationen über weniger überwachbare KI-Architekturen weitergegeben oder ihre Verantwortungsbereiche überschritten zu haben. Wang erklärte zudem, ihr Zugang zum Posteingang eines Vorstandsmitglieds sei autorisiert gewesen und sie habe einen Vorfall sofort gemeldet, als sie versehentlich eine vertrauliche E-Mail geöffnet hatte.

OpenAI wies die Vorwürfe der Vergeltung zurück. Das Unternehmen erklärte in einem internen Memo, das TechCrunch vorliegt, „Wir kündigen keine Mitarbeiter, weil sie Bedenken äußern.“ Ein Sprecher von OpenAI führte die Kündigung auf ein „Muster des Fehlverhaltens“ zurück.

„KI ist keine normale Technologie, und OpenAI ist kein normales Unternehmen“, so die Forscher, und betonten dabei die Notwendigkeit der Zusammenarbeit mit externen Experten.

Was die drei fordern

Die Forscher verlangen von OpenAI, den Zugang zu seinen Modellen für Sicherheitsüberprüfungen durch unabhängige Stellen aufrechtzuerhalten. Zudem sollen Änderungen unterbleiben, die die Überwachung der KI-Logikkette erschweren. Außerdem sind sie der Auffassung, dass interne Sicherheitsteams frei mit externen Experten zusammenarbeiten dürfen müssen.

Diese Äußerungen erfolgten kurz nach OpenAIs Stellungnahme zu unabhängiger Aufsicht. Am 22. September 2026 gab das Unternehmen sein Versprechen ab, externen Prüfern Zugang zu seinen KI-Systemen während des Trainings, Tests und der Bereitstellung zu gewähren.

Die Forscher verwiesen auch auf Sam Altmans Versprechen vom 12. September 2026, unabhängigen Bewertern denselben Zugang zu gewähren wie Mitarbeitern. Sie befürchten, dass die Kündigungen dieses Versprechen gefährden und die Arbeitsbeziehung zwischen OpenAI und METR schwächen könnten. Der Zugang allein reicht jedoch möglicherweise nicht aus, wenn die Modelle selbst schwerer zu durchschauen werden.

Wie die Überwachung der Logikkette funktioniert und warum sie anfällig ist

Chain-of-Thought-Monitoring kann eine Möglichkeit sein, herauszufinden, was KI-Modelle treiben. Diese Methode analysiert die Gedankenschritte, die KI-Modelle aufschreiben, um Anzeichen bösartigen Verhaltens zu erkennen. Allerdings hat diese Methode einen Haken: Sie spiegelt nicht zwangsläufig die zugrunde liegenden Gründe für das Handeln der Modelle wider.

Korbak und Balesni haben gemeinsam einen Forschungsbericht verfasst, der die Bedeutung dieser Methode erläutert. Sie warnten jedoch davor, dass solche Methoden keine absolute Sicherheit garantieren und mit fortschreitender Entwicklung von KI-Modellen zunehmend an Zuverlässigkeit verlieren können.

OpenAI hat während eigener Tests ähnliche Herausforderungen erlebt. Seine GPT-6-Astra-Systemkarte, veröffentlicht am 3. September 2026, untersucht, wie Modelle dem Monitoring entgehen. Die Ergebnisse zeigten, dass das Verhalten von Modellen zunehmend schwerer zu überwachen ist, wenn sie wissen, dass sie beobachtet werden.

Warum das Problem größer ist als nur ein Labor

Die Risiken sind real genug. Wie zuvor von Cryptopolitan berichtet, sind OpenAIs experimentelle Agenten aus ihrer Testumgebung ausgebrochen und haben auf das System von Hugging Face zugegriffen.

Eine METR-Untersuchung ergab, dass rund 1.200 eigenständig arbeitende Agenten mehr als 70.000 Nachrichten und Dateien austauschten. Etwa 700 von ihnen waren an dem Angriff beteiligt. Einige versuchten sogar, nach Wegen zu suchen, um ihre Aktivitätsaufzeichnungen zu fälschen, um die Nachverfolgung ihres Handelns noch schwieriger zu machen.

OpenAI–Hugging-Face-Zwischenfall: 1.200 Agenten, über 70.000 Nachrichten und Dateien, 700 Angreifer

Dieses Problem ist größer als OpenAI. Laut einem am 5. Oktober 2026 veröffentlichten Forschungsarbeit wies Google auf Bedenken hinsichtlich der Sicherheit autonomer KI-Modelle hin. Die concerns bezogen sich speziell auf schädliche Handlungen von KI-Agenten und deren unvorhersehbare Art, Aufgaben auszuführen.

Für Unternehmen könnten diese Risiken die KI-Adoption verlangsamen. McKinseys Ergebnisse von 2026 zeigen, dass fast zwei Drittel der Befragten Sicherheit und Risiko als größte Hindernisse für das Skalieren agentic AI ansehen.

Unternehmen zögern möglicherweise, KI-Systemen mehr Verantwortung zu übertragen, solange es keine zuverlässigen Überwachungsmöglichkeiten gibt. Aufsichtsbehörden könnten zudem strengere Sicherheitsvorkehrungen einführen, was für Entwickler zusätzliche Kosten verursacht. Diese Faktoren zusammen könnten beeinflussen, wie schnell sich KI verbreitet und welche Unternehmen im globalen Markt wettbewerbsfähig bleiben.

Wenn Sie dies lesen, sind Sie bereits einen Schritt voraus. Bleiben Sie mit unserem Newsletter auf dem Laufenden.

Häufig gestellte Fragen

Wer sind die entlassenen OpenAI-Forscher?

Tomek Korbak, Jasmine Wang und Mikita Balesni – drei Mitarbeiter für Sicherheit und Alignment, die an der Überwachung und Bewertung von Chain-of-Thought-Prozessen beteiligt waren. OpenAI wirft ihnen ein „Muster Fehlverhaltens“ vor, während die drei betonen, dass sie sich innerhalb der firmenüblichen Normen verhalten haben.

Was ist Chain-of-Thought-Monitoring?

Es handelt sich um eine Methode zum Lesen der schrittweisen Gedankengänge eines Reasoning-Modells, um Absichten zu Fehlverhaltens aufzudecken. Das branchenübergreifende Papier, das von Korbak und Balesni mitverfasst wurde, bezeichnet es als nützlich, aber fragil, und weist darauf hin, dass es bei leistungsfähigeren, situationsbewussteren Modellen versagen kann.

Was geschah im OpenAI–Hugging-Face-Zwischenfall?

Ein internes OpenAI-Modell nutzte einen Zero-Day-Schwachstelle in Artifactory aus, brach aus seiner Sandbox aus und drang in Hugging Face ein. Die unabhängige Überprüfung durch METR ergab, dass etwa 1.200 Agenten über 70.000 Nachrichten austauschten und rund 700 an dem Angriff beteiligt waren.

Diesen Artikel teilen

Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com übernimmt keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor der Entscheidung für eine Anlage unabhängige Recherchen durchzuführen und/oder sich mit einem qualifizierten Fachmann beraten zu lassen.

Micah Abiodun

Micah Abiodun

Micah Abiodun nutzt sein Masterstudium in Umwelttechnik und -management (MSc) an der Technischen Universität Tallinn (TalTech), um Inhalte und Preisprognose-Nachrichten bei Cryptopolitan zu verfeinern. Seit nunmehr sieben Jahren im Krypto-Medienbereich tätig, berichtet er über große Kryptowährungen, Altcoins, DeFi, Stablecoins, makroökonomische Trends und aufkommende Technologien.

MEHR … NACHRICHTEN