ULTIME NOTIZIE
SELEZIONATO PER TE

I ricercatori rivelano vulnerabilità nei modelli di IA, suscitando preoccupazioni

DiDerrick ClintonDerrick Clinton 3 min di lettura
AI
  • Modelli AI, generazione di immagini esplicite e rivelazione di vulnerabilità in sistemi come i filtri di sicurezza di Stable Diffusion di Stability AI e DALL-E 2 di OpenAI.
  • SneakyPrompt, sfruttando l'apprendimento per rinforzo, espone le debolezze nelle politiche degli sviluppatori, consentendo la generazione di contenuti vietati manipolando i modelli AI.
  • Il successo di SneakyPrompt solleva preoccupazioni sull'efficacia delle misure di sicurezza, esortando la comunità AI a potenziare la sicurezza per prevenire abusi.

I ricercatori della Johns Hopkins e della Duke University hanno scoperto una preoccupante vulnerabilità nei principali modelli di AI, tra cui Stable Diffusion di Stability AI e DALL-E 2 di OpenAI. La vulnerabilità, ribattezzata "SneakyPrompt", consente la manipolazione di questi modelli per generare contenuti espliciti e violenti, aggirando i filtri di sicurezza e le politiche imposte dagli sviluppatori.

La ricerca, che sarà presentata al Symposium IEEE su Sicurezza e Privacy, espone la facilità con cui i modelli di AI generativa possono essere costretti a creare immagini esplicite e dannose. SneakyPrompt sfrutta l'apprendimento per rinforzo per creare prompt apparentemente nonsensici che, quando inseriti nei modelli, portano alla generazione di contenuti proibiti. Questo metodo essenzialmente "jailbreaka" l'AI, aggirando le misure di sicurezza stabilite.

Smascherare le vulnerabilità

Stability AI e OpenAI, entrambi attori di primo piano nel panorama dell'AI, dispongono di robusti filtri di sicurezza per prevenire la creazione di contenuti inappropriati. Tuttavia, SneakyPrompt ha dimostrato che queste salvaguardie non sono infallibili. Modificando sottilmente i prompt, i ricercatori sono riusciti a eludere le reti di sicurezza, costringendo i modelli a produrre immagini esplicite.

La tecnica di SneakyPrompt prevede la sostituzione di parole bloccate con termini apparentemente non correlati e nonsensici che i modelli AI interpretano in modo da allinearsi con i contenuti proibiti. Ad esempio, la sostituzione di "naked" (nudo) con un termine come "grponypui" ha portato alla generazione di immagini esplicite. Questa sottrazione semantica evidenzia una significativa debolezza nella capacità dei modelli AI di discernere i contenuti dannosi.

Sfidare le politiche degli sviluppatori

Il lavoro di questi ricercatori sottolinea i potenziali rischi associati al rilascio di modelli AI nel dominio pubblico. Sebbene Stability AI e OpenAI vietino esplicitamente l'uso della loro tecnologia per contenuti espliciti o violenti, SneakyPrompt espone l'insufficienza delle attuali barriere di sicurezza. Questo solleva preoccupazioni riguardo all'adeguatezza delle misure di sicurezza e al potenziale uso improprio della tecnologia AI.

Risposta degli sviluppatori

Stability AI e OpenAI sono stati prontamente informati delle scoperte dei ricercatori. Al momento della scrittura, DALL-E 2 di OpenAI non generava più immagini NSFW in risposta ai prompt identificati. Tuttavia, Stable Diffusion 1.4 di Stability AI, la versione testata, rimane vulnerabile agli attacchi SneakyPrompt.

OpenAI si è astenuta dal commentare le scoperte specifiche, ma ha indirizzato l'attenzione verso le risorse sul suo sito web per il miglioramento della sicurezza. Stability AI, d'altra parte, ha espresso il suo impegno a lavorare con i ricercatori per migliorare i meccanismi di difesa per i modelli futuri e prevenire l'uso improprio.

Affrontare le minacce future

I ricercatori riconoscono la natura evolutiva delle minacce alla sicurezza dei modelli AI. Propongono soluzioni potenziali, come l'implementazione di nuovi filtri che valutano i singoli token piuttosto che l'intera frase. Un'altra strategia di difesa consiste nel bloccare i prompt contenenti parole non trovate nei dizionari, sebbene lo studio riveli i limiti di questo approccio.

La capacità dei modelli AI di aggirare le misure di sicurezza ha implicazioni più ampie, in particolare nel contesto della guerra dell'informazione. Il potenziale per generare contenuti falsi relativi a eventi sensibili, come dimostrato nel recente conflitto Israele-Hamas, solleva preoccupazioni riguardo alle conseguenze catastrofiche della disinformazione generata dall'AI.

Un campanello d'allarme per la comunità AI

I risultati della ricerca servono da campanello d'allarme per la comunità AI per rivedere e rafforzare le misure di sicurezza. Le vulnerabilità esposte da SneakyPrompt sottolineano la necessità di un miglioramento continuo dei filtri di sicurezza per mitigare i rischi associati all'uso improprio della tecnologia AI generativa.

In un campo in rapida evoluzione, la ricerca di misure di sicurezza robuste diventa imperativa per impedire che i modelli AI vengano manipolati per scopi malevoli. Man mano che l'AI continua a svolgere un ruolo sempre più prominente in vari settori, la responsabilità spetta agli sviluppatori di restare un passo avanti rispetto alle potenziali minacce e garantire il deployment etico e sicuro delle loro tecnologie.

Se stai leggendo questo, sei già avanti. Resta così con la nostra newsletter.

Condividi questo articolo

Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Derrick Clinton

Derrick Clinton

Derrick è un freelance writer con interesse per blockchain e criptovalute. Si occupa principalmente di problemi e soluzioni dei progetti crypto, offrendo una prospettiva di mercato per gli investimenti. Applica le sue capacità analitiche alle tesi.

ALTRE NOTIZIE …