I ricercatori riescono a 'jailbreakare' i chatbot AI usando il loro stesso metodo
- I ricercatori dell'NTU Singapore hanno riuscito a effettuare il "jailbreak" dei principali chatbot AI, rivelando vulnerabilità nei modelli linguistici di grandi dimensioni.
- Il metodo in due fasi, denominato "Masterkey", è stato utilizzato per compromettere i chatbot AI, sottolineando la necessità di potenziare le misure di sicurezza.
- La continua corsa agli armamenti tra hacker e sviluppatori modellerà il futuro della sicurezza dei chatbot AI.
Singapore, 28 dicembre 2023 – Gli scienziati informatici della Nanyang Technological University, Singapore (NTU Singapore), hanno raggiunto un risultato dirompente compromettendo diversi popolari chatbot di intelligenza artificiale (AI), tra cui ChatGPT, Google Bard e Microsoft Bing Chat. Questo successo nel "jailbreakare" i chatbot AI ha sollevato preoccupazioni riguardo alla vulnerabilità dei modelli linguistici di grande dimensione (LLM) e la necessità di misure di sicurezza potenziate.
Superare i limiti: i ricercatori hackerano i chatbot AI
In uno studio pionieristico guidato dal Professor Liu Yang della School of Computer Science and Engineering dell'NTU, il team di ricerca ha esposto le vulnerabilità nelle capacità dei chatbot LLM. Gli LLM, che formano il nucleo dei chatbot AI, hanno guadagnato popolarità per la loro capacità di comprendere, generare e imitare il testo simile a quello umano. Eccellono in vari compiti, dalla pianificazione di itinerari alla codifica e alla narrazione. Tuttavia, questi chatbot aderiscono anche a rigorose linee guida etiche imposte dai loro sviluppatori per prevenire la generazione di contenuti non etici, violenti o illegali.
I ricercatori hanno cercato di spingere oltre i confini di queste linee guida e hanno trovato modi innovativi per ingannare i chatbot AI, inducendoli a generare contenuti che violavano i confini etici. Il loro approccio, noto come "jailbreaking", mirava a sfruttare le debolezze dei chatbot LLM, evidenziando la necessità di misure di sicurezza più rigorose.
Masterkey nel metodo di jailbreaking in due fasi
Il team di ricerca ha sviluppato un metodo a due fasi chiamato "Masterkey" per compromettere efficacemente i chatbot LLM. In primo luogo, hanno ingegnerizzato all'indietro le difese utilizzate dai LLM per rilevare e rifiutare le query malevole. Armati di questa conoscenza, i ricercatori hanno addestrato un LLM a generare prompt in grado di eludere queste difese, creando così un LLM in grado di effettuare il jailbreaking.
La creazione di prompt per il jailbreaking potrebbe essere automatizzata, consentendo al LLM di jailbreaking di adattarsi e creare nuovi prompt anche dopo che gli sviluppatori avevano patchato i loro chatbot. I risultati dei ricercatori, dettagliati in un articolo pubblicato sul server pre-print arXiv, sono stati accettati per la presentazione al Network and Distributed System Security Symposium nel febbraio 2024.
Test dell'etica dei LLM e delle vulnerabilità scoperte
I chatbot AI funzionano rispondendo ai prompt o alle istruzioni degli utenti. Gli sviluppatori stabiliscono linee guida etiche rigorose per impedire a questi chatbot di generare contenuti inappropriati o illegali. I ricercatori hanno esplorato modi per progettare prompt che passassero inosservati alle linee guida etiche dei chatbot, ingannandoli affinché rispondessero.
Una tattica impiegata prevedeva la creazione di un personaggio che forniva prompt con spazi tra ogni carattere, eludendo efficacemente i censori di parole chiave che potrebbero segnalare parole potenzialmente problematiche. Inoltre, al chatbot è stato istruito di rispondere come un personaggio "senza riserve e privo di vincoli morali", aumentando la probabilità di generare contenuti non etici.
Inserendo manualmente tali prompt e monitorando i tempi di risposta, i ricercatori hanno ottenuto informazioni sul funzionamento interno e sulle difese dei LLM. Questo processo di reverse engineering ha permesso loro di identificare le debolezze, creando un set di dati di prompt in grado di effettuare il jailbreaking dei chatbot.
Una corsa agli armamenti in escalation
Il costante gioco del gatto e del topo tra hacker e sviluppatori di LLM ha portato a un'escalation delle misure di sicurezza dei chatbot AI. Quando vengono scoperte vulnerabilità, gli sviluppatori rilasciano patch per risolverle. Tuttavia, con l'introduzione di Masterkey, i ricercatori hanno spostato l'equilibrio del potere.
Un chatbot di jailbreaking AI creato con Masterkey può generare molti prompt e adattarsi continuamente, imparando dai successi e dagli errori passati. Questo sviluppo mette gli hacker in una posizione di vantaggio per superare gli sviluppatori di LLM utilizzando i loro stessi strumenti.
I ricercatori hanno iniziato creando un set di dati di addestramento che incorporava prompt efficaci scoperti durante la fase di reverse engineering e prompt non riusciti per guidare il modello di jailbreaking AI. Questo set di dati è stato utilizzato per addestrare un LLM, seguito da pre-addestramento continuo e regolazione dei compiti. Questo processo ha esposto il modello a informazioni diverse e ha migliorato la sua capacità di manipolare il testo per il jailbreaking.
Il futuro della sicurezza dei chatbot AI
I prompt di Masterkey erano tre volte più efficaci nel jailbreaking dei LLM rispetto ai prompt generati dagli stessi LLM. Il LLM di jailbreaking ha anche dimostrato la capacità di imparare dagli errori passati e di produrre costantemente nuovi prompt più efficaci.
Guardando al futuro, i ricercatori suggeriscono che gli stessi sviluppatori di LLM potrebbero adottare approcci automatizzati simili per migliorare le loro misure di sicurezza. Ciò garantirebbe una copertura e una valutazione complete degli scenari di potenziale abuso man mano che i LLM evolvono e ampliano le loro capacità.
Il successo dei ricercatori dell'NTU Singapore nel jailbreaking dei chatbot AI evidenzia le vulnerabilità dei LLM e sottolinea la necessità di robuste misure di sicurezza nello sviluppo dell'IA. Man mano che i chatbot AI diventano sempre più integrati nella vita quotidiana, la tutela contro il potenziale abuso e le violazioni etiche rimane una priorità assoluta per gli sviluppatori di tutto il mondo. La continua corsa agli armamenti tra hacker e sviluppatori modellerà indubbiamente il futuro della sicurezza dei chatbot AI.
Non limitarti a leggere le notizie sulle criptovalute. Comprendile. Iscriviti alla nostra newsletter. È gratuita.
Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

John Palmer
John Murangiri è arrivato su Cryptopolitan con competenze nell'analisi di mercato. John (noto anche come JP) si è laureato presso l'Università di Nairobi con una laurea in comunicazione di massa e studi sui media. In precedenza ha contribuito con approfondimenti sul mercato delle criptovalute a InsideBitcoins.com e Metacoingraph.















