Mistral lancia Robostral Navigate, il suo primo modello di robotica

- Mistral AI ha rilasciato Robostral Navigate, un modello da 8 miliardi di parametri che permette ai robot di navigare in spazi complessi utilizzando una singola telecamera RGB e istruzioni in linguaggio naturale, senza necessità di LiDAR o sensori di profondità.
- Ha ottenuto il 76,6% nel benchmark R2R-CE non visto, superando sia i rivali a singola telecamera che quelli multi-sensore, sebbene i risultati provengano da simulazioni e non da robot effettivamente implementati.
- Il nuovo sviluppo è importante per gli operatori di magazzini, fabbriche e logistica, poiché un sistema basato solo su telecamere potrebbe ridurre drasticamente i costi dell'hardware robotico.
L'azienda AI Mistral AI ha presentato mercoledì un modello da 8 miliardi di parametri, chiamato Robostral Navigate, che guida i robot con una singola fotocamera, segnando il primo passo dell'azienda francese nella robotica fisica.
Il lancio ha l'intento di sfidare i sistemi di navigazione basati su molti sensori utilizzati in magazzini e fabbriche.
Mistral AI costruisce un nuovo sistema di navigazione con AI
La startup con sede a Parigi, valutata 11,7 miliardi di euro (circa 13,4 miliardi di dollari) nel suo round Series C di settembre, ha passato la maggior parte della sua esistenza a competere con OpenAI su testo e codice. Il suo nuovo modello, Robostral Navigate, tuttavia, inserisce l'azienda in una categoria tecnologica completamente diversa.
Secondo un comunicato stampa di Mistral, il modello gestisce la "navigazione incarnata" (embodied navigation), che permette a un robot di muoversi attraverso uffici, case, edifici commerciali e spazi esterni senza input esterni.
Tuttavia, a differenza dei normali modelli di navigazione autonoma che si affidano a LiDAR, sensori di profondità o diverse fotocamere che lavorano insieme, Robostral Navigate funziona su una singola fotocamera RGB. Tutto ciò che il modello richiede è un'istruzione in linguaggio naturale, proprio come un prompt di testo AI, dopodiché produce i comandi di movimento per eseguirla.
Numeri di prova di Mistral AI
Mistral AI afferma che il modello robotico AI ha ottenuto il 76,6% nella validazione R2R-CE non vista, un benchmark che misura quanto bene un robot segue le istruzioni in ambienti su cui non è stato addestrato. Questa figura ha superato i migliori punteggi precedenti a singola fotocamera di 9,7 punti, secondo The News International.
AI Weekly ha riportato che il modello ha anche superato i sistemi multi-sensore basati su LiDAR e profondità di 4,5 punti, con un punteggio di validazione "visto" del 79,4%.
Se questi divari si mantenessero in situazioni reali, sarebbe di massima importanza per coloro che sono interessati ai robot industriali. Naturalmente, l'assunzione generale nella robotica mobile è stata che le fotocamere da sole siano troppo fragili, quindi un intero stack di sensori è obbligatorio. Una configurazione con una sola fotocamera che eguaglia o supera i sistemi a stack completo ridurrebbe il costo dei componenti per le macchine di magazzini e strutture.
Scetticismo sull'uso nella vita reale
Va notato che questi punteggi provengono da situazioni simulate e non dalla vita reale. Mistral afferma di aver addestrato il modello su circa 400.000 traiettorie attraverso 6.000 scene, utilizzando un metodo che la società afferma ha ridotto i token di addestramento di un fattore 22, accorciando al contempo le esecuzioni che in precedenza richiedevano mesi a soli giorni.
Ma come ha notato AI Weekly, la società non ha pubblicato alcun risultato effettivo di utilizzo del robot né figure relative alla latenza sul dispositivo. Gli ingegneri hanno anche messo in dubbio se un tasso di successo del 76,6% sia sufficiente per il dispiegamento nella vita reale.
Mistral è anche riportato essere in trattative per raccogliere circa 3 miliardi di euro (circa 3,42 miliardi di dollari) con una valutazione vicina ai 20 miliardi di euro (circa 23 miliardi di dollari).
Se stai leggendo questo, sei già avanti. Resta così con la nostra newsletter.

Opeyemi Olanrewaju
Opeyemi è specializzato nella creazione e nel perfezionamento di contenuti di alta qualità focalizzati su criptovalute, mercati finanziari globali ed economia. Si è laureato presso l'Università di Ibadan con una laurea in Medicina (MBBS). Ha lavorato come Caporedattore della pubblicazione editoriale del suo Ateneo e precedentemente presso CFA. Da oltre sei anni, si occupa di salvaguardare l'unicità dei contenuti in qualità di redattore capo per Cryptopolitan.
















