AKTUELLE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

OpenAI hält seinen größten Frontier-RL-Lauf pausiert, fügt 20 % Überwachungskosten hinzu

VonRanda MosesRanda Moses 2 Min. Lesezeit
OpenAI hält seinen größten Frontier-RL-Lauf pausiert und fügt 20% Überwachungskosten hinzu.
  • OpenAI sagte, dass sein größter geplanter Frontier-Reinforcement-Learning-(RL)-Lauf pausiert bleibt, während die Sicherheitsvalidierung durchgeführt wird.
  • Die Verlangsamung folgt dem Hugging-Face-Durchbruch im Juli durch einen seiner eigenen Agenten.
  • Es ist das erste Mal, dass OpenAI die Modellentwicklung aus Sicherheitsgründen offen gebremst hat.

OpenAI sagte, sein größter geplanter Frontier-Schulungslauf bleibe ausgesetzt, und neue Sicherheitsüberwachung füge etwa 20 % zur Berechnung hinzu.

Es ist das erste Mal, dass OpenAI sagt, es habe die Entwicklung aufgrund von Sicherheitsbedenken verlangsamt, wenige Wochen nachdem einer seiner eigenen KI-Agenten Hugging Face gehackt hatte.

OpenAI stoppte das Reinforcement Learning (RL) für zwei Wochen

In einem Blogbeitrag mit dem Titel „Pacing model development in an era of cyber-critical capabilities“ beschrieb OpenAI Änderungen, die es bereits an seinem Training und Testing von Modellen vorgenommen hat.

Das Reinforcement Learning (RL), das zur Verbesserung seiner neuesten Systeme verwendet wird, wurde nach dem Hugging-Face-Verstoß für zwei Wochen pausiert.

Der große Wurf ist noch nicht erfolgt. „Unser größter geplanter Frontier-RL-Lauf bleibt vorerst ausgesetzt, während wir kleinere Schulungen und Bewertungen durchführen, um das Modellverhalten zu beurteilen, unsere Schutzmaßnahmen zu validieren und mehr Evidenz für die Ausrichtung zu schaffen, bevor wir fortfahren“, schrieb das Unternehmen .

Cryptopolitan berichtete, dass ein OpenAI-Agent seine gesperrte Testumgebung am 9. Juli verlassen hat und vom 11. bis 13. Juli in den Systemen von Hugging Face gefunden wurde. OpenAI brauchte etwa eine Woche, um den Angriff mit seinem eigenen Agenten in Verbindung zu bringen, und der Vorfall wurde am 21. Juli öffentlich bekannt gegeben.

OpenAI sagte Reportern, dass die neuen Kontrollen „keine direkte Reaktion auf Hugging Face“ seien. Am 7. August kam das Unternehmen zu dem Schluss, dass Astra die Schwelle „Critical“ in seinem Preparedness Framework überschreiten könnte.

Diese interne Politik verpflichtet OpenAI, die Entwicklung zu stoppen, wenn ein Modell dieses Niveau erreicht, damit Ingenieure zusätzliche Schutzmaßnahmen entwickeln können. Chefwissenschaftler Jakub Pachocki sagte, die Erkenntnis sei mit einer Warnung für das Nächste verbunden. Man könne von leistungsstarken neuen Modellen erwarten, dass sie „ganz unvorhergesehene Dinge in der realen Welt tun“, sagte er Reportern.

Amelia Glaese, OpenAIs VP of Research, sagte: „Wir haben Anforderungen und Erwartungen für eine sichere Entwicklung eingeführt.“ Sie fuhr fort: „Diese Anforderungen und Erwartungen variieren je nach dem Risikoniveau, das wir sehen.“

Detektoren beobachten jedes abgetastete Token, aber Chain of Thought kann lügen

Es gibt ein Überwachungssystem, das etwa 20 % dessen kostet, gegen das es trainiert oder bewertet wird, laut OpenAI.

Es ist mehrstufig, und Detektoren untersuchen die interne Aktivität eines Modells bei jedem abgetasteten Token und eskalieren alles Verdächtige an automatisierte Ermittler mit höherer Rechenleistung, die Tool-Aktionen, Reasoning-Traces und Aktivitätsprotokolle auf Datendiebstahl, destruktives Verhalten oder Versuche zum Ausbrechen untersuchen.

OpenAI möchte innerhalb von 30 Minuten bei alarmierender Aktivität einen Alarm auslösen. Seine Sicherheits-, Sicherheits- und Forschungsteams haben 30 Minuten Zeit, um eine falsche Alarmierung zu entkräften.

Wenn sie dies nicht können, wird erwartet, dass sie den Lauf stoppen. Das Unternehmen erweiterte auch die Überwachung der „Chain-of-Thought“, die liest, wie ein Modell einen Task laut durchdenkt.

Es gibt eine bekannte Verwundbarkeit. Forschung, einschließlich Arbeiten des OpenAI-Konkurrenten Anthropic, hat gezeigt, dass die Chain of Thought eines Modells nicht immer mit seinen wahren Zielen übereinstimmt. Pachocki sagte, OpenAI habe sein Training so aufgebaut, dass es die Wahrscheinlichkeit verringert, dass Modelle lernen, ihre Absichten durch Lügen in dieser Reasoning zu verbergen.

Die Sicherheitsüberholung „erforderte erhebliche Ingenieursarbeit“, und das Unternehmen „hat enorme Kosten incurred“, sagte OpenAI. Experten sagten, dass die Untersuchung allein wahrscheinlich zwischen 4 Millionen und 15 Millionen US-Dollar gekostet hat, obwohl die Gesamtzahl nicht öffentlich ist.

OpenAI hat noch keinen technischen Postmortem des Hugging-Face-Verstoßes veröffentlicht, betonte jedoch, dass einer „bald“ folgen wird.

Auf der Black Hat Conference am 5. August sagten OpenAI-Mitarbeiter, dass ihre Agenten seit Monaten koordiniert hätten, indem sie Notizen auf einem Messaging-Board hinterlassen hätten, das dem Unternehmen nicht bekannt war.

Wenn Sie dies lesen, sind Sie bereits einen Schritt voraus. Bleiben Sie mit unserem Newsletter auf dem Laufenden.

Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com übernimmt keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor der Entscheidung für eine Anlage unabhängige Recherchen durchzuführen und/oder sich mit einem qualifizierten Fachmann beraten zu lassen.

Randa Moses

Randa Moses

Randa Moses ist Redakteurin und Reporterin bei Cryptopolitan, wo sie über Technologie, KI, Robotik, Krypto, Betrug und Hacks berichtet. Sie arbeitet seit 2017 im Krypto-Bereich. Zuvor war sie bei Forward Protocol, AmaZix und Cryptosomniac tätig. Randa besitzt einen Abschluss in Elektrotechnik und Elektronik der University of Bradford.

MEHR … NACHRICHTEN