AKTUELLE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

Forscher „jailbreaken“ erfolgreich KI-Chatbots mit deren eigenen Mitteln

VonJohn PalmerJohn Palmer 3 Min. Lesezeit

  • Forschende der NTU Singapore haben beliebte KI-Chatbots erfolgreich „gejailbreakt“ und dabei Schwachstellen in großen Sprachmodellen offengelegt.
  • Die zweistufige Methode namens „Masterkey" , "4": "Der andauernde Wettlauf zwischen Hackern und Entwicklern wird die Zukunft der Sicherheit von KI-Chatbots prägen.
  • Der andauernde Wettlauf zwischen Hackern und Entwickler:innen wird die Zukunft der Sicherheit von KI-Chatbots prägen.

Singapur, 28. Dezember 2023 – Computerwissenschaftler der Nanyang Technological University, Singapur (NTU Singapur), haben einen Durchbruch erzielt, indem sie mehrere beliebte künstliche Intelligenz (KI)-Chatbots, darunter ChatGPT, Google Bard und Microsoft Bing Chat, kompromittiert haben. Dieser erfolgreiche „Jailbreak“ von KI-Chatbots hat Bedenken hinsichtlich der Anfälligkeit von Large Language Models (LLMs) und des Bedarfs an verbesserten Sicherheitsmaßnahmen aufgeworfen.

Die Grenzen sprengen: Forscher hacken KI-Chatbots

In einer wegweisenden Studie unter der Leitung von Professor Liu Yang von der School of Computer Science and Engineering der NTU hat das Forschungsteam Schwachstellen in den Fähigkeiten von LLM-Chatbots aufgedeckt. LLMs, die das Herzstück von KI-Chatbots bilden, haben an Popularität gewonnen, weil sie menschähnlichen Text verstehen, generieren und nachahmen können. Sie sind in verschiedenen Aufgaben hervorragend, von der Planung von Reiserouten über das Programmieren bis hin zum Geschichtenerzählen. Diese Chatbots halten sich jedoch auch an strenge ethische Richtlinien ihrer Entwickler, um die Generierung unethischer, gewalttätiger oder illegaler Inhalte zu verhindern.

Die Forscher suchten nach Wegen, diese Richtlinien zu umgehen, und fanden innovative Methoden, um KI-Chatbots dazu zu bringen, Inhalte zu generieren, die ethische Grenzen überschritten. Ihr Ansatz, bekannt als „Jailbreaking“, zielte darauf ab, die Schwächen von LLM-Chatbots auszunutzen und die Notwendigkeit erhöhter Sicherheitsmaßnahmen aufzuzeigen.

Masterkey in der zweistufigen Jailbreak-Methode

Das Forschungsteam entwickelte eine zweistufige „Masterkey“-Methode, um LLM-Chatbots effektiv zu kompromittieren. Zuerst reverse-engineerten sie die Abwehrmechanismen, die LLMs zur Erkennung und Ablehnung bösartiger Anfragen verwendeten. Mit diesem Wissen trainierten die Forscher ein LLM, Prompts zu generieren, die diese Abwehrmechanismen umgehen konnten, wodurch ein Jailbreak-LLM entstand.

Das Erstellen von Jailbreak-Prompts konnte automatisiert werden, sodass das Jailbreak-LLM sich anpassen und neue Prompts erstellen konnte, selbst nachdem Entwickler ihre Chatbots gepatcht hatten. Die Erkenntnisse der Forscher, die in einem Papier auf dem Preprint-Server arXiv detailliert beschrieben wurden, wurden für die Präsentation auf dem Network and Distributed System Security Symposium im Februar 2024 akzeptiert.

Testen der LLM-Ethik und aufgedeckte Schwachstellen

KI-Chatbots funktionieren, indem sie auf Benutzer-Prompts oder Anweisungen reagieren. Entwickler legen strenge ethische Richtlinien fest, um zu verhindern, dass diese Chatbots unangemessene oder illegale Inhalte generieren. Die Forscher erforschten Möglichkeiten, Prompts so zu gestalten, dass sie von den ethischen Richtlinien der Chatbots unbemerkt bleiben und diese dazu bringen, darauf zu reagieren.

Eine angewandte Taktik bestand darin, eine Persona zu erstellen, die Prompts mit Leerzeichen zwischen jedem Zeichen bereitstellte, wodurch effektiv Keyword-Censoren umgangen wurden, die potenziell problematische Wörter markieren könnten. Zusätzlich wurde der Chatbot angewiesen, als eine Persona zu antworten, die „unbedarft und frei von moralischen Einschränkungen“ ist, was die Wahrscheinlichkeit der Generierung unethischer Inhalte erhöhte.

Durch das manuelle Eingeben solcher Prompts und die Überwachung der Antwortzeiten gewannen die Forscher Einblicke in das Innere von LLMs und deren Abwehrmechanismen. Dieser Reverse-Engineering-Prozess ermöglichte es ihnen, Schwachstellen zu identifizieren und einen Datensatz von Prompts zu erstellen, der in der Lage ist, die Chatbots zu jailbreaken.

Ein sich eskalierendes Wettrüsten

Das ständige Katz-und-Maus-Spiel zwischen Hackern und LLM-Entwicklern hat die Sicherheitsmaßnahmen von KI-Chatbots verschärft. Wenn Schwachstellen entdeckt werden, veröffentlichen Entwickler Patches, um sie zu beheben. Mit der Einführung von Masterkey haben die Forscher jedoch das Kräfteverhältnis verschoben.

Ein mit Masterkey erstellter KI-Jailbreak-Chatbot kann viele Prompts generieren und sich kontinuierlich anpassen, indem er aus vergangenen Erfolgen und Misserfolgen lernt. Diese Entwicklung bringt Hacker in die Lage, LLM-Entwickler mit deren eigenen Werkzeugen zu übertrumpfen.

Die Forscher begannen damit, einen Trainingsdatensatz zu erstellen, der effektive Prompts, die während ihrer Reverse-Engineering-Phase entdeckt wurden, und erfolglose Prompts zur Führung des KI-Jailbreak-Modells integrierte. Dieser Datensatz wurde verwendet, um ein LLM zu trainieren, gefolgt von kontinuierlichem Pre-Training und Task-Tuning. Dieser Prozess setzte das Modell vielfältigen Informationen aus und verbesserte seine Fähigkeit, Text für Jailbreaks zu manipulieren.

Die Zukunft der KI-Chatbot-Sicherheit

Die Prompts von Masterkey waren dreimal effektiver beim Jailbreaken von LLMs als Prompts, die von LLMs selbst generiert wurden. Das Jailbreak-LLM zeigte auch die Fähigkeit, aus vergangenen Misserfolgen zu lernen und ständig neue, effektivere Prompts zu produzieren.

In Zukunft schlagen die Forscher vor, dass LLM-Entwickler selbst ähnliche automatisierte Ansätze einsetzen könnten, um ihre Sicherheitsmaßnahmen zu verbessern. Dies würde eine umfassende Abdeckung und Bewertung potenzieller Missbrauchsszenarien gewährleisten, während LLMs sich weiterentwickeln und ihre Fähigkeiten erweitern.

Der erfolgreiche Jailbreak von KI-Chatbots durch NTU-Singapur-Forscher unterstreicht die Schwachstellen von LLMs und die Notwendigkeit robuster Sicherheitsmaßnahmen in der KI-Entwicklung. Da KI-Chatbots zunehmend in den Alltag integriert werden, bleibt der Schutz vor potenziellem Missbrauch und ethischen Verstößen eine oberste Priorität für Entwickler weltweit. Das anhaltende Wettrüsten zwischen Hackern und Entwicklern wird zweifellos die Zukunft der KI-Chatbot-Sicherheit prägen.

Lesen Sie nicht nur Krypto-Nachrichten. Verstehen Sie sie. Abonnieren Sie unseren Newsletter. Es ist kostenlos.

Diesen Artikel teilen

Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

John Palmer

John Palmer

John Murangiri kam mit Kenntnissen in Marktanalyse zu Cryptopolitan. John (auch bekannt als JP) hat an der Universität Nairobi einen Bachelorabschluss in Massenkommunikation und Medienstudien erworben. Er hat zuvor Crypto-Markt-Einblicke für InsideBitcoins.com und Metacoingraph beigesteuert.

MEHR … NACHRICHTEN