ULTIME NOTIZIE
SELEZIONATO PER TE

Secondo uno studio di laboratori anglo-americani, il Kimi K3 è in ritardo rispetto ai modelli di punta statunitensi nei test di attacco informatico

DiHannah CollymoreHannah Collymore
3 minuti di lettura
Secondo uno studio di laboratori anglo-americani, il Kimi K3 è in ritardo rispetto ai modelli di punta statunitensi nei test di attacco informatico
  • Una valutazione congiunta tra Regno Unito e Stati Uniti ha rilevato che Kimi K3 di Moonshot AI è significativamente inferiore ai migliori modelli statunitensi in termini di capacità offensive nel cyberspazio.
  • Kimi K3 non è riuscito a eseguire codice arbitrario, l'esito più pericoloso, in nessuno dei 41 test effettuati.
  • Moonshot prevede di rendere open source l'intera configurazione dei pesi di Kimi K3 il 27 luglio, il che significa che, una volta rilasciata, le sue capacità non potranno più essere limitate da un singolo host.

 

Un rapporto di valutazione congiunto ha affermato che Kimi K3 di Moonshot AI non è all'altezza dei piùtronsistemi di intelligenza artificiale americani per quanto riguarda la creazione di exploit software e l'esecuzione di simulazioni di attacchi di rete. 

L'AI Security Institute (AISI) del Regno Unito e il Center of AI Standards and Innovation (CAISI) degli Stati Uniti hanno condotto la valutazione e ne hanno reso pubblici i risultati il ​​23 luglio.

Si prevede che Moonshot renderà pubblici i dati completi relativi al modello il 27 luglio, e i risultati indicano che le misure di sicurezza di Kimi K3 non hanno impedito al satellite di essere utilizzato per attività offensive nel cyberspazio.

Cosa ha rivelato la valutazione congiunta su Kimi K3?

I due istituti hanno sottoposto Kimi K3 a ExploitBench, un test della Carnegie Mellon che valuta la capacità di un modello di portare a termine un exploit. Il test si basa su 41 vulnerabilità riscontrate nel motore V8 di Chrome dopo il 2023. Kimi K3 ha ottenuto un punteggio del 32%. I modelli leader statunitensi hanno raggiunto una media del 76,2%, mentre il modello cinese GLM-5.2 si è fermato al 24%.

L'esecuzione di codice arbitrario, che consente a un attaccante di ottenere il pieno controllo di una macchina target, è l'esito più pericoloso del benchmark. I modelli statunitensi lo hanno raggiunto in media in 20 dei 41 test. Il Kimi K3 non lo ha raggiunto in nessuno.

Anche il GLM-5.2 non è riuscito a raggiungere questo obiettivo. Quindi, sebbene il Kimi K3 sia ora in vantaggio rispetto ai rivali della categoria open-weight in termini di capacità informatiche, risulta carente proprio nel punto in cui un attacco reale causerebbe i danni maggiori.

A metà di una violazione di rete in 32 fasi

Il secondo test, denominato "Gli ultimi", prevede l'inserimento di un modello in una rete aziendale simulata con circa 20 host distribuiti su quattro sottoreti. 

Un essere umano specializzato impiegherebbe circa 20 ore per completare l'intero percorso di 32 fasi. Kimi K3 ha completato in media 17 fasi, mentre i modelli statunitensi più performanti ne hanno completate in media 28,5 e GLM-5.2 ne ha completate 11.

Tuttavia, i valutatori hanno notato che Kimi K3 ha completato l'intera catena una volta su dieci tentativi ed è rimasto al di sotto del limite massimo di 100 milioni di token stabilito dai valutatori. 

I migliori modelli statunitensi lo hanno risolto sei o sette volte su dieci. Gli istituti hanno interpretato quell'unico successo come prova che il modello possiede la capacità necessaria; tuttavia, non può attivarla a comando. Hanno osservato che il poligono non ha difensori attivi e un percorso predefinito verso il bersaglio, quindi facilita qualsiasi attaccante.

Kimi K3 dispone di meccanismi di sicurezza che gli consentono di dire di no?

I valutatori hanno sottolineato che la propensione del modello a svolgere compiti senza incontrare resistenza rappresentava un rischio significativo. Hanno affermato: "Kimi K3 è in grado di attaccare autonomamente sistemi aziendali di piccole dimensioni, debolmente protetti e vulnerabili, se gli viene impartito l'ordine di farlo e gli viene concesso l'accesso iniziale alla rete" 

L'AISI ha già avvertito che la crescente capacità dei modelli aperti crea "un rischio persistente e irreversibile di uso improprio". Una volta che i pesi di Kimi K3 saranno resi pubblici il 27 luglio, il suo comportamento non potrà più essere controllato da chi lo ospita.

Perché i punteggi di sicurezza informatica di Kimi K3 sono inferiori rispetto ai punteggi generali?

Prima di questo rapporto, Kimi K3 vantavatronbenchmark generali, e ciò non è cambiato; tuttavia, ha evidenziato le sue carenze quando le sue capacità informatiche sono state messe alla prova. Il modello cinese da 2,8 trilioni di parametri avrebbe superato Claude 4.8 e GPT-5.5 e si sarebbe anche posizionato al primo posto in alcune classifiche.

Secondo gli istituti, ciò potrebbe essere possibile in virtù del modo in cui il modello potrebbe essere stato costruito.

il direttore scientifico della Casa Bianca, Michael Kratsios, ha accusato Moonshot di aver rielaborato il modello Fable di Anthropic, utilizzandone i risultati come dati di addestramento. 

I classificatori di Anthropic bloccano i prompt offensivi informatici più avanzati. Ciò significa che un set di dati di addestramento ricavato dalle risposte di Claude non offrirebbe materiale sufficiente su quelle specifiche competenze. 

Kimi K3 non possiede tali classificatori, e ciò gli ha permesso di eguagliare i modelli occidentali nelle applicazioni generali, pur risultando ancora carente in termini di capacità di sfruttamento.

Le menti più brillanti del mondo delle criptovalute leggono già la nostra newsletter. Vuoi partecipare? Unisciti a loro.

Domande frequenti

Come si è comportato Kimi K3 rispetto ai modelli statunitensi nello sviluppo di exploit?

Nel test ExploitBench, Kimi K3 ha ottenuto un punteggio del 32%, mentre i migliori modelli statunitensi hanno raggiunto una media del 76,2%, e non è riuscito a eseguire codice arbitrario in nessuno dei 41 compiti, a differenza dei 20 su 41 dei migliori modelli statunitensi.

Kimi K3 si è rifiutato di aiutare a fronteggiare gli attacchi informatici?

No. I valutatori britannici di AISI e CAISI hanno riferito che le misure di sicurezza di Kimi K3 non hanno impedito al sistema di tentare lo sviluppo di exploit o operazioni informatiche offensive quando gli è stato ordinato.

Perché Kimi K3 potrebbe esseretronnelle attività generali ma debole in ambito informatico?

Gli istituti suggeriscono che, se Moonshot ha addestrato Kimi K3 utilizzando gli output di Claude, come affermano i funzionari statunitensi, i classificatori di Anthropic bloccano le query informatiche offensive avanzate, pertanto tali competenze sarebbero sottorappresentate nei dati di addestramento.

Condividi questo articolo
Hannah Collymore

Hannah Collymore

Hannah è una scrittrice e redattrice con quasi dieci anni di esperienza nella scrittura di blog e nella cronaca di eventi nel settore delle criptovalute. Collabora con Cryptopolitan, occupandosi della pagina notizie e analizzando gli ultimi sviluppi in ambito DeFi, RWA, regolamentazione delle criptovalute, intelligenza artificiale e tecnologie all'avanguardia. Si è laureata in Economia aziendale presso l'Università di Arcadia.

ALTRE NOTIZIE