Tech-Giganten schieben Grenzen voran, um den Datenhunger von KI zu stillen

- Tech-Giganten greifen zu umstrittenen Methoden zur Beschaffung von KI-Daten.
- OpenAI transkribiert YouTube-Videos, während Google und Meta erwägen, urheberrechtlich geschützte Inhalte zu erwerben.
- Rechtliche und ethische Debatten entstehen über die Nutzung riesiger Datensätze durch KI.
Ob es sich um die Arbeit von OpenAI, Google und Meta handelt, oder um die KI-Finanzierung des Industriesektors, der verschiedene Mittel umfasst, wie das Sammeln oder Ansammeln enormer Mengen digitaler Daten auf unterschiedliche kreative, aber umstrittene Weise, ist klar, dass die Automatisierungsfähigkeiten und -kapazitäten zunehmen. Bemerkenswerterweise sind die Bemühungen, die Maßnahmen wie die oben skizzierten (d. h. die Berücksichtigung gesetzlicher Grenzen und Unternehmensrichtlinien) umfassen, gleichbedeutend mit der beträchtlichen Menge an Daten, die zur Schulung der KI-Systeme verwendet werden.
OpenAIs Whisper-Initiative: YouTube-Gespräche abbauen
Unsere Whisper-Geschichte begann erst letztes Jahr. Es herrscht ein überwältigender Mangel an erstklassigen englischen Texten, der zu Verzögerungen in der Bildungslieferung führt. Whisper war der nächste Schritt von Google. Es verstand den Ozean der Dialoge auf YouTube und wurde als Text, eine Text-zu-Sprache-Anwendung, entwickelt. Das KI-gestützte Tool selbst, das aus mehr als einer Million Stunden von KI überprüften YouTube-Videos besteht, um neue Texte (im Wesentlichen neue Gespräche) zu generieren, wurde zur Schulung von KI-Modellen verwendet, die von der State-of-the-Art bis hin zu GPT-4, der neuesten Version des ChatGPT-Chatbots, reichen.
Obwohl einige Mitarbeiter argumentierten, dass OpenAIs Microsoft-Aufnahmen YouTube in jeder Hinsicht plagiieren würden, waren die Ethik des Plagiats weiterhin umstritten; außerdem gaben einige Mitarbeiter zu, dass es unmöglich sei, sich genau an die Absichten von YouTube anzupassen. Ebenso könnte die Erlangung von Einspruch bei der algorithmischen Verarbeitung der Videos zur Extraktion des Textinhalts zur Fütterung der KI-Modelle als Bedrohung für das Urheberrecht der Videoersteller angesehen worden sein, was Empörung auslöste.
Meta, die Muttergesellschaft von Facebook und Instagram, war ebenfalls besorgt über die Verwendung urheberrechtlich geschützter Elemente von Verlagen wie Simon & Schuster und anderen. Gleichzeitig diskutierte es auch die Beschaffung von allgemeinem Webinhalt, möglicherweise um in Urheberrechtsverletzungen verwickelt zu werden.
Der Daten Crunch: Treibt unkonventionelle Ansätze voran
Die wettbewerbsintensive Datenerhebung hilft, die zentrale Position der Daten zu bemerken und sie in der Entwicklung der KI-Technologie zu identifizieren. Sprache in eine KI befiehlt immer mehr Trainingsdatensätze, einschließlich des Commonwealth, die heute von außerhalb dieser Quellen bis hin zu Wikipedia und Reddit manipuliert werden. Für Technologieunternehmen – insbesondere diejenigen, die Schwierigkeiten haben, sehr gängige Datenquellen wie traditionelle Datenspeicher zu erreichen – kann die Erstellung KI-gestützter Modelle eine alternative Lösung sein, die in solchen Fällen wünschenswert genug sein kann.
Technologieunternehmen weisen darauf hin, dass Datensammlung für das KI-Training notwendig ist, während derselbe Prozess vor Gericht rechtlich in Frage gestellt wird. Zu ihrer Verteidigung gewannen OpenAI und Microsoft einen Prozess wegen des Vorwurfs der illegalen Verwendung urheberrechtlich geschützten Materials. Sie gaben jedoch an, dass ihre Handlungen unter das rechtliche Prinzip der „fair use“ (fairer Nutzung) fielen. In den letzten Jahren hat die Anzahl der beim US Copyright Office von Inhabern von Urheberreichen eingereichten Anträge die Zahl von 10.000 überschritten, was deutlich zeigt, dass das Urheberrecht im KI-Zeitalter einzigartig und brandneu ist. Folglich stehen die Hauptakteure immer vor Gefahren im Zusammenhang mit der Verletzung vieler Werke unter dem Vorwand, dass es keine lizenzierten Zwecke für die Modelle gibt, die auf dieser Basis KI nutzen.
Die Notwendigkeit massiver Datensätze
Insgesamt war Kaipans Arbeit von Jared, dem Wissenschaftler der Skala, unbeabsichtigt episch in der KI-Entwicklung. Datengesteuerter Inhalt ist eine der Komponenten der KI, die für den Trainingsprozess benötigt wird, aber er kann nicht gut funktionieren, ohne die Modelle, die gut trainiert sind und effektiv arbeiten. Mit dem Anstieg der künstlichen Intelligenz-Technologie steigt die Nachfrage nach Daten, um auf dem Markt erfolgreich zu sein, in hohem Maße, was Unternehmen mit Fragen im Zusammenhang mit Gesetz, Ethik und Datenschutz zurücklässt. Daher müssen künstliche Intelligenz-Algorithmen diese Datensätze nutzen, um auf dem Markt erfolgreich zu sein.
Das Datensammelverhalten von V.IPs wird für KI-Verbesserungen entstellt; der typische methodische Eid wird grob gemacht. Ob durch einen ihrer YouTube-Vorträge oder die Erstellung synthetischer datengenerierender Inhalte, diese Unternehmen sind auf einer Mission, herauszufinden, was die rechtlichen, ethischen und Datenschutzfragen wirklich sind.
Sie könnten später zu einem Witz auf dem Meer werden. Aufgrund des Auftretens der enormen Datensätze, die für den Innovationsprozess benötigt werden, sind gesellschaftliche Führer gefordert, aktiv an einem konstruktiven Dialog teilzunehmen, um die Regeln und Standards zu entwickeln, in denen Innovationsbemühungen mit ethischen Prinzipien des geistigen Eigentums und des Datenschutzes im Gleichgewicht stehen.
Ursprüngliche Geschichte von: https://www.nytimes.com/2024/04/06/technology/tech-giants-harvest-data-artificial-intelligence.html
Die klügsten Krypto-Köpfe lesen bereits unseren Newsletter. Lust dabei? Mach mit.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

James Kinoti
James ist ein Krypto-Enthusiast, der es liebt, Wissen über Fintech, Kryptowährungen sowie Blockchain und Zukunftstechnologien zu teilen. Die neuesten Innovationen in der Krypto-Branche, Crypto-Gaming, KI, Blockchain-Technologie und weitere Technologien sind seine Leidenschaft. Seine Mission: stets auf dem Laufenden zu bleiben bei transformativen Anwendungen in verschiedenen Branchen.















