I giganti della tecnologia spingono i confini per nutrire l'appetito di dati dell'IA

- I giganti della tecnologia ricorrono a metodi controversi per raccogliere dati per l'IA.
- OpenAI trascrive video di YouTube, mentre Google e Meta stanno valutando l'acquisto di contenuti protetti da copyright.
- Sorgono dibattiti legali ed etici sull'uso da parte dell'IA di vasti set di dati.
Che si tratti del lavoro di OpenAI, Google e Meta, l'IA che finanzia il settore industriale, che comprende vari mezzi come la raccolta o l'accumulo di enormi volumi di dati digitali in modi diversi, creativi ma controversi, è chiaro che le capacità di automazione stanno aumentando. In particolare, gli sforzi che comportano azioni come prendere le misure delineate sopra (cioè, tenere conto dei limiti legali e delle politiche aziendali) sono equivalenti alla notevole quantità di dati utilizzata per addestrare i sistemi di IA.
L'iniziativa Whisper di OpenAI: minare le conversazioni di YouTube
La nostra storia su Whisper è iniziata proprio l'anno scorso. C'è una carenza schiacciante di testi inglesi di prima classe che causa ritardi nella consegna dell'istruzione. Whisper è stato il passo successivo di Google. Ha compreso l'oceano di dialoghi di YouTube ed è stato sviluppato come testo, un'applicazione da testo a voce. Lo strumento basato sull'IA, che consiste in oltre un milione di ore di video di YouTube analizzati dall'IA per generare nuovi testi (essenzialmente, una nuova conversazione), è stato utilizzato per addestrare modelli di IA prodotti dallo stato dell'arte fino a GPT-4, l'ultima versione del chatbot ChatGPT.
Anche se alcuni dipendenti hanno sostenuto che i filmati di Microsoft di OpenAI avrebbero plagiato YouTube in modo generalizzato, l'etica del plagio era ancora dibattuta; inoltre, alcuni lavoratori hanno ammesso che sarebbe stato impossibile allinearsi precisamente alle intenzioni di YouTube. Allo stesso modo, l'acquisizione di obiezioni nel processare algoritmicamente i video per estrarre i contenuti testuali da alimentare nei modelli di IA potrebbe essere stata considerata una minaccia al copyright dei creatori di video, causando indignazione.
Meta, la società madre di Facebook e Instagram, era anche preoccupata per l'uso di elementi protetti da copyright da case editrici come Simon & Schuster, tra le altre. Allo stesso tempo, ha discusso l'acquisizione di contenuti web generali, potenzialmente per finire in una violazione del copyright.
La crisi dei dati: guidare approcci non convenzionali
La raccolta di dati, piena di competizione, aiuta a notare la posizione cruciale dei dati e a identificarla nello sviluppo della tecnologia IA. Il linguaggio comanda set di dati di addestramento sempre più ampi, inclusi il Commonwealth, che sono manipolati fino a Wikipedia e Reddit al di fuori di queste fonti oggi. Per le aziende tecnologiche, specialmente quelle che hanno difficoltà ad accedere a fonti di dati molto comuni come gli archivi di dati tradizionali, la creazione di modelli basati sull'IA può essere una soluzione alternativa che potrebbe essere desiderabile in tali casi.
Le aziende tecnologiche indicano che la raccolta di dati è necessaria per l'addestramento dell'IA, mentre lo stesso processo è messo in discussione legalmente in tribunale. In loro difesa, OpenAI e Microsoft hanno vinto un'accusa riguardo all'uso illegale di materiale protetto da copyright. Tuttavia, hanno affermato che le loro azioni rientravano nel principio legale di fair use. Negli ultimi anni, il numero di domande presentate all'Ufficio del Copyright degli Stati Uniti da parte dei titolari del copyright ha superato le 10.000, il che mostra chiaramente che la legge sul copyright nell'era dell'IA è unica e nuova. Di conseguenza, i principali attori affrontano sempre pericoli legati alla violazione di molte opere sotto la pretesa che non esistano scopi autorizzati per i modelli che utilizzano l'IA su questa base.
L'imperativo per set di dati massicci
Nel complesso, il lavoro di Kaipan de Jared, scienziato della scala, è stato involontariamente epico nello sviluppo dell'IA. I contenuti basati sui dati sono uno dei componenti dell'IA necessari per il processo di addestramento, ma non possono funzionare bene senza i modelli che sono stati addestrati bene e operano efficacemente. Con l'aumento della tecnologia di intelligenza artificiale, la domanda di dati per avere successo sul mercato aumenta a un tasso elevato, lasciando le aziende con domande relative alla legge, all'etica e alla privacy. Pertanto, gli algoritmi di intelligenza artificiale devono utilizzare questi set di dati per avere successo sul mercato.
Il comportamento di raccolta dati dei VIP sta venendo distorto per il miglioramento dell'IA; il tipico giuramento metodologico sta diventando più grezzo. Che sia attraverso uno dei loro discorsi su YouTube o la creazione di dati sintetici generativi, queste aziende sono leader in una missione per scoprire quali siano realmente le questioni legali, etiche e sulla privacy.
Potrebbero diventare una battuta sulla spiaggia in seguito. A causa dell'emergere di enormi set di dati necessari per guidare il processo di innovazione, i leader della società sono tenuti a partecipare attivamente a un dialogo costruttivo per sviluppare le regole e gli standard in cui gli sforzi di innovazione sono bilanciati con i principi etici dei diritti di proprietà intellettuale e della privacy.
Storia originale da: https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html
I cervelli più intelligenti del crypto leggono già la nostra newsletter. Vuoi unirti a loro? Unisciti a loro.
Dichiarazione di responsabilità. Le informazioni fornite non costituiscono consigli di trading. Cryptopolitan.com non si assume alcuna responsabilità per eventuali investimenti effettuati sulla base delle informazioni fornite in questa pagina. Si consiglia vivamente di effettuare ricerche indipendenti e/o consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

James Kinoti
Appassionato di criptovalute, James trae piacere nel condividere conoscenze su fintech, criptovalute, blockchain e tecnologie all'avanguardia. Le ultime innovazioni nel settore crypto, il gaming crypto, l'intelligenza artificiale, la tecnologia blockchain e altre tecnologie sono i suoi principali interessi. La sua missione: rimanere aggiornato sulle applicazioni trasformative in vari settori.















