يمكن لـ VASA-1 من مايكروسوفت توليد وجوه متحركة واقعية من صورة واحدة فقط

- قدّمت ورقة بحثية من شركة مايكروسوفت مشروعًا لتوليد رؤوس تتحدث.
- يمكن للنموذج الجديد للذكاء الاصطناعي توليد وجه أو رأس يتحدث عن طريق رفع صورة واحدة وملاحظة صوتية.
- يتمتع الوجه المتحرك بتعبيرات وجه وحركات شفاه واقعية لمطابقة الصوت مع حركات الرأس في الحياة الواقعية.
في ورقة بيضاء حديثة، قدمت مايكروسوفت نموذج ذكاء اصطناعي جديد ينتج رأساً متحدثاً يبدو ويبدو واقعياً، ويتم إنشاؤه فقط عن طريق رفع صورة ثابتة وعينة صوتية.
النموذج الجديد يسمى VASA-1، ويتطلب فقط صورة واحدة بأسلوب بورتريه وملف صوتي للصوت ودمجهما معاً لصنع فيديو قصير لرأس متحرك مع تعابير الوجه، ومزامنة الشفاه، وحركات الرأس. يمكن للرأس المنتج حتى غناء الأغاني، وذلك بالصوت الذي تم رفعه أثناء الإنشاء.
مايكروسوفت VASA-1 هي قفزة نوعية للرسوم المتحركة
وفقاً لمايكروسوفت، لا يزال نموذج الذكاء الاصطناعي الجديد في مرحلة البحث، ولا توجد خطط لإطلاقه للجمهور العام، ولا يتوفر إلا لباحثي مايكروسوفت. ومع ذلك، شاركت الشركة عدداً قليلاً من عينات العروض التوضيحية، التي تظهر واقعية مذهلة وحركات شفاه تبدو حية للغاية.

تظهر العرض التوضيحي أشخاصاً يبدو أنهم حقيقيون، وكأنهم يجلسون أمام كاميرا ويتم تصويرهم. حركات الرأس واقعية وتبدو طبيعية جداً، ومزامنة الشفاه مع الصوت بارزة للغاية، مع ملاحظة أن هناك القليل جداً مما يمكن ملاحظته بأنه غير طبيعي. مزامنة الفم الإجمالية مذهلة.
قالت مايكروسوفت إن النموذج تم تطويره لتحريك الشخصيات الافتراضية، وزعمت أن جميع الأشخاص المعروضين في العرض التوضيحي اصطناعيون، كما قالوا إن النماذج تم إنشاؤها من DALL-E، وهو مولد الصور من OpenAI. لذلك نعتقد أنه إذا كان بإمكانه تحريك نموذج تم إنشاؤه بواسطة الذكاء الاصطناعي، فمن الواضح أن هناك إمكانات أكبر في تحريك صور أي شخص حقيقي، مما يجب أن يكون أكثر واقعية وأسهل بكثير للتعامل معه.
حالات استخدام Vasa-1 وسوء استخدامها المحتمل

إذا نظرنا إلى إمكانات VASA-1 للاستخدام العملي، فإن الأساس يمكن استخدامه لتحريك الشخصيات في الأفلام المتحركة، مما سيعطي الشخصيات شعوراً أكثر واقعية مع تعابير الوجه الطبيعية وحركات الرأس. يمكن أن يكون استخدام آخر في ألعاب الفيديو، لنفس السبب، فكر في Grand Theft Auto وما شابه. في المستقبل قد يتم استخدامه لأفلام أو مسلسلات سينمائية فائقة الواقعية التي تم إنشاؤها بواسطة الذكاء الاصطناعي حيث يمكن توليد الشخصيات من مولدات الصور وتحريكها بواسطة VASA-1، وقد لا يشعر الجمهور حتى أن الشخصيات ليست بشرية.
بالإضافة إلى الاستخدام الإبداعي للأداة، يمكن أيضاً الاستفادة منها لإنشاء محتوى لأغراض خبيثة. يمكن أن يكون سوء الاستخدام المحتمل لـ VASA-1 هو استخدامه للديب فريك (التزييف العميق)، حيث سيجعل من السهل على أي شخص يشارك في إنشاء الديب فريك توسيع تكتيكاته السيئة وإنشاء محتوى مضلل أكثر واقعية. تذكر فضيحة المكالمات الآلية التي تضمنت صوت بايدن للامتناع عن التصويت قبل الانتخابات التمهيدية؟ الآن يمكن أن يكون فيديو روبوت بعد المكالمة الصوتية، وذلك مع تعابير بشرية واقعية للغاية.
قد يكون الخطر المحتمل لسوء الاستخدام هو السبب في أن مايكروسوفت قيدت اختباراتها على باحثيها فقط. وفقاًلباحثي مايكروسوفت، يمكن استخدام الأداة لإنشاء محتوى مضلل وخادع للتظاهر بالبشر، مثل بعضالأدوات الأخرى، لكنهم يهدفون إلى تطبيقات إيجابية. أصدرت إنفيديا ورونواي AI أيضاً نماذجهما لنفس الوظيفة، لكن VASA-1 يبدو أكثر واقعية ومرشحاً واعداً.
إذا كنت تقرأ هذا، فأنت متقدّم بالفعل. ابق هناك مع نشرتنا الإخبارية.
إخلاء مسؤولية: المعلومات المقدمة ليست نصيحة تداول. لا تتحمل Cryptopolitan.com أي مسؤولية عن أي استثمارات تتم بناءً على المعلومات المتاحة في هذه الصفحة. نوصي بشدة بإجراء بحث مستقل و/أو استشارة مختص مؤهل قبل اتخاذ أي قرار استثماري.

عامر شيخ
عامر صحفي تقني يتمتع بخبرة تزيد عن ست سنوات في مجالي العملات المشفرة والتقنية. تخرج من جامعة ماج بشهادة ماجستير في إدارة الأعمال بتخصص التمويل والتسويق. يعمل حاليًا مع موقع كربتوبوليتان، حيث يتناول أحدث التطورات في أسواق العملات المشفرة وتوقعات الأسعار.
















