Qwen3 di Alibaba spodesta R1 di DeepSeek, ora guida i modelli AI open-source

- La famiglia di modelli AI Qwen3 di Alibaba ha superato R1 di DeepSeek, diventando il miglior modello open-source al mondo in ambiti come istruzione linguistica, matematica, programmazione e analisi dei dati.
- Qwen3 è economico da utilizzare: costa solo 0,55 $ per 1 milione di token per l'esecuzione.
- I produttori statunitensi di chip Nvidia e Intel hanno iniziato a supportare Qwen3.
La nuova famiglia di modelli AI Qwen3 di Alibaba ha superato R1 di DeepSeek per diventare il miglior modello open-source al mondo. Secondo i rapporti, Qwen3 ha ottenuto risultati migliori di R1 nei test che misurano le capacità dei modelli AI open-source in aree come l'istruzione linguistica, la matematica, la programmazione e l'analisi dei dati.
La famiglia Qwen3 è stata lanciata la scorsa settimana dall'unità di cloud computing di Alibaba. Comprende otto modelli migliorati con un numero di parametri compreso tra 600 milioni e 235 miliardi. Nel machine learning, i parametri sono le variabili in un sistema AI mentre viene addestrato.
Secondo La piattaforma LiveBench, una piattaforma indipendente che testa i modelli linguistici di grandi dimensioni, prima di questi nuovi test, R1 di DeepSeek era stato il miglior modello AI open-source al mondo da quando era uscito a gennaio. Ma non più.
Sia aziende statunitensi che cinesi si affrettano ad adottare Qwen 3
L'ascesa di Qwen3 nelle classifiche LiveBench mostra quanto rapidamente l'IA si stia sviluppando in Cina. L'industria tecnologica cinese è cresciuta molto grazie agli strumenti open-source. Il codice open-source di Alibaba ha permesso ad altri sviluppatori di software di terze parti di condividere il design, correggere i collegamenti rotti o rendere il programma più potente.
Tuttavia, i risultati complessivi di LiveBench hanno mostrato che Qwen3 non era all'altezza di o3 di OpenAI, Gemini Pro 2.5 di Google e Claude 3.7 di Anthropic, che sono i migliori modelli AI closed-source al mondo. LiveBench afferma che o3-mini, il modello AI più popolare di OpenAI, era il migliore al mondo in generale. Microsoft sostiene OpenAI.
Per ogni 1 milione di token, costano $10 per eseguire o3. D'altra parte, Qwen3 è più economico da usare perché costa solo $0,55 per 1 milione di token per l'esecuzione. Poiché Qwen3 è più economico e funziona meglio, molte aziende hanno dichiarato che avrebbero sostenuto il più recente modello AI di Alibaba non appena è uscito.
Huawei Technologies, Moore Threads, Cambricon Technologies e Hygon Information Technology sono tutte aziende di chip che hanno dichiarato di supportare Qwen3.
Cambricon ha detto lo scorso martedì di aver ottimizzato con successo Qwen3 per l'esecuzione rapida sulle sue unità di elaborazione grafica. Questo è stato fatto perché gli sviluppatori AI nelle Filippine volevano chip prodotti in Cina.
Qwen3 è anche utilizzato sui servizi di cloud computing di Hyperbolic e Fireworks.ai, due aziende di infrastrutture AI. I produttori di chip americani Nvidia e Intel hanno iniziato a supportare Qwen3.
Molti grandi data center in Cina, come quelli a Pechino, Shanghai, Hangzhou e nelle province di Hubei, Jilin e Shaanxi Nord-Ovest, hanno anche dichiarato che utilizzeranno i modelli AI Qwen di terza generazione di Alibaba. La Supercomputing Network in Cina ha anche adottato Qwen3. Questa rete collega oltre 20 data center in 20 città attraverso 14 province.
Il CEO di Anthropic dice che DeepSeek era "un po' sopravvalutato"
A un evento aziendale, un co-fondatore di Anthropic, l'azienda che ha creato i modelli AI Claude, ha detto che DeepSeek è ancora "sei-due mesi indietro rispetto a dove si trovano le aziende frontiere statunitensi." Ha anche detto che il recente clamore intorno alla startup cinese era "forse un po' sopravvalutato."
DeepSeek ha attirato l'attenzione in tutto il mondo alla fine di dicembre 2024 e all'inizio di gennaio 2025 condividendo due avanzati modelli AI open-source, V3 e R1. Questi modelli sono stati realizzati per una frazione minima del costo e della potenza di calcolo che le grandi aziende tecnologiche di solito necessitano per i progetti LLM.
Non è chiaro quando DeepSeek rilascerà la prossima generazione dei suoi modelli. L'azienda con sede a Hangzhou ha rilasciato in modo discreto il suo Prover-V2 da 671 miliardi di parametri alla fine di aprile. Questo era un aggiornamento del suo modello specializzato per la gestione delle dimostrazioni matematiche. Tuttavia, non ha detto nulla sui progressi del suo tanto atteso modello di ragionamento R2.
Se stai leggendo questo, sei già avanti. Resta così con la nostra newsletter.
Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Florence Muchai
Florence si occupa di notizie relative a criptovalute, gaming, tecnologia e AI da oltre 6 anni. I suoi studi in Informatica presso l'Università Meru di Scienze e Tecnologia e in Gestione delle Emergenze e Diplomazia Internazionale presso il MMUST le hanno fornito eccellenti competenze linguistiche, osservative e tecniche. Florence ha lavorato al VAP Group e come editor per diverse testate specializzate in criptovalute.
















