تستخدم عمالقة التكنولوجيا ترجمات يوتيوب لتدريب الذكاء الاصطناعي دون إذن

- تم القبض على أبل وشركات أخرى مطورة للذكاء الاصطناعي، مثل أنثروبيك ونفيديا، وهي تستخدم ترجمات YouTube الفرعية دون إذن لتدريب أنظمة الذكاء الاصطناعي الخاصة بها.
- تم تطوير مجموعة بيانات "ترجمات YouTube الفرعية" بواسطة EleutherAI ونُشرت في عام 2020.
- استخدمت OpenAI مليون ساعة من مقاطع فيديو YouTube لتدريب نموذج GPT-4 الخاص بها.
تم العثور على أن Apple وNvidia وAnthropic يستخدمان ترجمات YouTube الفرعية لتدريب نماذج الذكاء الاصطناعي، وهو ما يتعارض مع سياسات YouTube. أظهر تقرير من Proof News وWired أن مثل هذه الشركات استخدمت مجموعة بيانات من نصوص آلاف فيديوهات YouTube دون الحصول على الترخيص المناسب للقيام بذلك.
اقرأ أيضًا: هيئة الرقابة البريطانية تطلق تحقيقاً في اكتساب Microsoft للمواهب في مجال الذكاء الاصطناعي
كشف الدراسة أن Apple وNvidia وAnthropic استخدموا مجموعة بيانات ترجمات YouTube الفرعية. تتكون هذه المجموعة البيانات من نصوص من 173,536 فيديو على YouTube من 48,000 قناة. تشمل الفيديوهات قنوات تعليمية مثل Khan Academy وMIT، وقنوات أخبار مثل The Wall Street Journal، ومبدعين رائدين مثل MrBeast وMarques Brownlee.
ردود فعل يوتيوبرز مشهورين على استغلال البيانات
ماركس براونلي، يوتيوبر شهير، علّق على القضية على منصة X. وقال، “جمعت Apple بيانات للذكاء الاصطناعي من شركات أخرى. جمعت إحدى هذه الشركات الكثير من البيانات/النصوص من فيديوهات YouTube، بما في ذلك فيديوهاتي. ” بينما قد لا تكون Apple قد جمعت البيانات مباشرة، وأشار براونلي إلى أن هذه المشكلة ستستمر.
تم تطوير مجموعة بيانات “ترجمات YouTube الفرعية” بواسطة EleutherAI ونشرها في عام 2020. تحتوي على 5.7 جيجابايت من البيانات، والتي تشمل ترجمات من فيديوهات YouTube التي تم إزالتها من المنصة.
وفقاً لشروط وأحكام YouTube، يُحظر الوصول إلى الفيديوهات بـ “وسائل آلية”. وجود ترجمات من الفيديوهات المحذوفة يضيف فقط إلى المشكلة، مما يثير تساؤلات حول الخصوصية وانتهاك حقوق النشر.
Salesforce، وهي منظمة متورطة أيضاً في التحقيق، اعترفت أيضاً باستخدامها لمجموعة البيانات المذكورة.
“تم تدريب مجموعة بيانات The Pile المشار إليها في ورقة البحث في عام 2021 لأغراض أكاديمية وبحثية. كانت مجموعة البيانات متاحة للعامة وأُصدرت بموجب ترخيص مريح.”
متحدث باسم Salesforce
ومع ذلك، لا يزال استخدام محتوى YouTube دون إذن مثيراً للجدل حتى تاريخه. في أبريل، قال الرئيس التنفيذي لـ YouTube، نيل موهان، إن استخدام فيديوهات YouTube أو نصوصها أو مقاطعها لتدريب الذكاء الاصطناعي هو “انتهاك واضح” للسياسات. ومع ذلك، وفقاً لـ New York Times، استخدمت OpenAI مليون ساعة من فيديوهات YouTube لتدريب نموذج GPT-4.
اندلاع معارك قانونية حول استخدام شركات الذكاء الاصطناعي لمحتوى الإنترنت
زادت قضية استخدام شركات الذكاء الاصطناعي لمحتوى من الإنترنت دون تفويض بعد إطلاق ChatGPT. بالإضافة إلى ذلك، يرفع صناع المحتوى دعاوى قضائية ضد Stability AI وMidjourney بزعم كشط أعمال محمية بحقوق النشر دون إذن. واجه مالك YouTube، Google، دعاوى جماعية تتعلق بمطالبات مماثلة، قائلاً إن الإجراءات القانونية من هذا النوع تهدد أساس الذكاء الاصطناعي التوليدي.
في مقابلة مع The Wall Street Journal، لم توضح الرئيسة التقنية لشركة OpenAI، ميرا موراتي، ما إذا كانت الشركة استخدمت فيديوهات من منصات التواصل الاجتماعي لتدريب هذا النموذج الجديد. صرح الرئيس التنفيذي لـ Microsoft AI، مصطفى سليمان، أن المحتوى على الويب المفتوح كان يُعتبر استخداماً عادلاً منذ التسعينيات بناءً على ما أسماه بـ “العقد الاجتماعي.”
أذكى العقول في عالم العملات الرقمية يقرأون بالفعل نشرتنا الإخبارية. هل تريد الانضمام؟ انضم إليهم.
إخلاء مسؤولية. المعلومات المقدمة ليست نصيحة تداول. Cryptopolitan.com لا تتحمل أي مسؤولية عن أي استثمارات تتم بناءً على المعلومات المقدمة في هذه الصفحة. نوصي بشدة بإجراء بحث مستقل و/أو الاستعانة بمستشار مؤهل قبل اتخاذ أي قرارات استثمارية.

بريندا كانانا
تمتلك بريندا أكثر من 4 سنوات من الخبرة المتخصصة في العملات الرقمية والذكاء الاصطناعي والتقنيات الناشئة. عملت في Zycrypto وBlockchain Reporter وThe Coin Republic، وهي الآن جعلت Cryptopolitan منزلها. يحافظ شهادتها في علم الاجتماع من جامعة مومباسا التقنية على تواصلها مع نبض قرائها.
















