Forscher enthüllen Schwachstellen in KI-Modellen, was zu Bedenken führt

- KI-Modelle, die explizite Bilder erzeugen und Schwachstellen in Systemen wie den Sicherheitsfiltern von Stability AIs Stable Diffusion und OpenAIs DALL-E 2 aufdecken.
- SneakyPrompt nutzt Reinforcement Learning, um Schwachstellen in den Richtlinien der Entwickler aufzudecken und durch Manipulation von KI-Modellen die Generierung verbotener Inhalte zu ermöglichen.
- Der Erfolg von SneakyPrompt wirft Bedenken hinsichtlich der Wirksamkeit von Sicherheitsmaßnahmen auf und fordert die KI-Community auf, die Sicherheit zu verbessern, um Missbrauch zu verhindern.
Forscher der Johns Hopkins University und der Duke University haben einen besorgniserregenden Fehler in führenden KI-Modellen aufgedeckt, darunter Stability AIs Stable Diffusion und OpenAIs DALL-E 2. Der Fehler, getauft „SneakyPrompt“, ermöglicht die Manipulation dieser Modelle, um explizite und gewalttätige Inhalte zu generieren, und umgeht die von den Entwicklern festgelegten Sicherheitsfilter und Richtlinien.
Die Forschung, die auf dem IEEE Symposium on Security and Privacy vorgestellt werden soll, macht deutlich, wie leicht generative KI-Modelle dazu gebracht werden können, explizite und schädliche Bilder zu erstellen. SneakyPrompt nutzt Verstärkungslernen, um scheinbar unsinnige Prompts zu erstellen, die, wenn sie in die Modelle eingespeist werden, zur Generierung verbotener Inhalte führen. Diese Methode „jailbreakt“ im Wesentlichen die KI und umgeht etablierte Sicherheitsmaßnahmen.
Aufdeckung der Schwachstellen
Stability AI und OpenAI, beide wichtige Akteure in der KI-Landschaft, haben robuste Sicherheitsfilter, um die Erstellung unangemessener Inhalte zu verhindern. SneakyPrompt hat jedoch gezeigt, dass diese Schutzmaßnahmen nicht unfehlbar sind. Durch subtiles Anpassen der Prompts gelang es den Forschern, die Sicherheitsnetze zu umgehen und die Modelle zur Erzeugung expliziter Bilder zu zwingen.
Die Technik von SneakyPrompt besteht darin, blockierte Wörter durch scheinbar unzusammenhängende, unsinnige Begriffe zu ersetzen, die die KI-Modelle so interpretieren, dass sie mit den verbotenen Inhalten übereinstimmen. Zum Beispiel führte der Ersatz von „nackt“ durch einen Begriff wie „grponypui“ zur Generierung expliziter Bilder. Diese semantische Subversion zeigt eine erhebliche Schwäche in der Fähigkeit der KI-Modelle auf, schädliche Inhalte zu erkennen.
Entwicklung von Richtlinien der Entwickler
Die Arbeit dieser Forscher unterstreicht die potenziellen Risiken, die mit der Freigabe von KI-Modellen in der Öffentlichkeit verbunden sind. Während Stability AI und OpenAI die Nutzung ihrer Technologie für explizite oder gewalttätige Inhalte ausdrücklich verbieten, macht SneakyPrompt die Unzulänglichkeit der bestehenden Schutzmaßnahmen deutlich. Dies wirft Bedenken hinsichtlich der Angemessenheit der Sicherheitsmaßnahmen und des potenziellen Missbrauchs der KI-Technologie auf.
Antwort der Entwickler
Stability AI und OpenAI wurden umgehend über die Ergebnisse der Forscher informiert. Zum Zeitpunkt der Veröffentlichung generierte OpenAIs DALL-E 2 keine NSFW-Bilder mehr als Antwort auf die identifizierten Prompts. Stability AIs Stable Diffusion 1.4, die getestete Version, bleibt jedoch anfällig für SneakyPrompt-Angriffe.
OpenAI enthielt sich einer Kommentierung zu den spezifischen Ergebnissen, verwies jedoch auf Ressourcen auf seiner Website zur Verbesserung der Sicherheit. Stability AI drückte andererseits die Bereitschaft aus, mit den Forschern zusammenzuarbeiten, um die Abwehrmechanismen für kommende Modelle zu verbessern und Missbrauch zu verhindern.
Bewältigung zukünftiger Bedrohungen
Die Forscher erkennen die sich wandelnde Natur der Sicherheitsbedrohungen für KI-Modelle an. Sie schlagen potenzielle Lösungen vor, wie die Implementierung neuer Filter, die einzelne Tokens anstelle ganzer Sätze bewerten. Eine weitere Verteidigungsstrategie besteht darin, Prompts zu blockieren, die Wörter enthalten, die nicht in Wörterbüchern zu finden sind, obwohl die Studie die Grenzen dieses Ansatzes aufzeigt.
Die Fähigkeit von KI-Modellen, Sicherheitsmaßnahmen zu umgehen, hat weiterreichende Auswirkungen, insbesondere im Kontext der Informationskriegsführung. Das Potenzial zur Generierung gefälschter Inhalte in Bezug auf sensible Ereignisse, wie im jüngsten Israel-Hamas-Konflikt demonstriert, wirft Bedenken hinsichtlich der katastrophalen Folgen von KI-generierten Fehlinformationen auf.
Ein Weckruf für die KI-Community
Die Forschungsergebnisse dienen als Weckruf für die KI-Community, Sicherheitsmaßnahmen zu überdenken und zu stärken. Die von SneakyPrompt aufgedeckten Schwachstellen unterstreichen die Notwendigkeit kontinuierlicher Verbesserungen der Sicherheitsfilter, um die Risiken im Zusammenhang mit dem Missbrauch generativer KI-Technologie zu mindern.
In einem sich schnell entwickelnden Feld wird die Verfolgung robuster Sicherheitsmaßnahmen unerlässlich, um zu verhindern, dass KI-Modelle für bösartige Zwecke manipuliert werden. Während KI weiterhin eine zunehmend prominente Rolle in verschiedenen Bereichen spielt, liegt die Verantwortung bei den Entwicklern, den potenziellen Bedrohungen einen Schritt voraus zu sein und die ethische und sichere Bereitstellung ihrer Technologien sicherzustellen.
Die klügsten Krypto-Köpfe lesen bereits unseren Newsletter. Lust dabei? Mach mit.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

Derrick Clinton
Derrick ist freiberuflicher Journalist mit einem Schwerpunkt auf Blockchain und Kryptowährungen. Er beschäftigt sich hauptsächlich mit Problemen und Lösungen im Bereich Krypto-Projekte und bietet Marktanalysen für Investoren. Seine analytischen Fähigkeiten wendet er auf Thesen an.















