Microsofts VASA-1 kann realistische sprechende Gesichter aus nur einem Bild generieren

- Ein Forschungsbericht von Microsoft stellte ein Projekt zur Generierung sprechender Köpfe vor.
- Das neue KI-Modell kann ein sprechendes Gesicht oder einen Kopf erzeugen, indem ein einzelnes Foto und eine Sprachaufnahme hochgeladen werden.
- Das animierte Gesicht zeigt realistische Gesichtsausdrücke und Lippenbewegungen, die sich an die Stimme anpassen und echte Kopfbewegungen nachahmen.
In einem kürzlich veröffentlichten White Paper stellte Microsoft ein neues KI-Modell vor, das einen realistisch aussehenden und klingenden sprechenden Kopf erzeugt, der durch das Hochladen eines Standfotos und einer Sprachprobe generiert wird.
Das neue Modell heißt VASA-1 und benötigt nur ein Porträtfoto und eine Audiodatei der Stimme, um sie zu einem kurzen Video eines sprechenden Kopfes mit Gesichtsausdrücken, Lippenbewegungen und Kopfdrehungen zu verschmelzen. Der erzeugte Kopf kann sogar Lieder singen, und zwar in der Stimme, die bei der Erstellung hochgeladen wurde.
Microsoft VASA-1 ist ein Durchbruch für die Animation
Laut Microsoft befindet sich das neue KI-Modell noch in der Forschungsphase, und es gibt keine Pläne, es der Allgemeinheit freizugeben; nur Microsoft-Forscher haben Zugang dazu. Das Unternehmen teilte jedoch einige Demonstrationsproben mit, die eine beeindruckende Realismus und Lippenbewegungen zeigen, die zu lebensecht wirken.

Die Demo zeigt Menschen, die echt aussehen, als säßen sie vor einer Kamera und würden gefilmt. Die Kopfbewegungen sind realistisch und wirken recht natürlich, und die Lippenbewegungen zur Abstimmung mit dem Audio sind herausragend, wobei kaum etwas zu bemerken ist, das unnatürlich wirkt. Die gesamte Mundsynchronisation ist phänomenal.
Microsoft sagte, das Modell wurde entwickelt, um virtuelle Charaktere zu animieren, und behauptete, alle in der Demo gezeigten Personen seien synthetisch, da sie sagten, die Modelle seien von DALL-E, dem Bildgenerator von OpenAI, generiert worden. Daher denken wir, wenn es ein KI-generiertes Modell animieren kann, gibt es offensichtlich viel mehr Potenzial darin, Fotos von echten Personen zu animieren, was realistischer wäre und für es viel einfacher zu handhaben wäre.
Anwendungsfälle von Vasa-1 und sein potenzieller Missbrauch

Wenn wir das Potenzial von VASA-1 für praktische Nutzungen betrachten, kann es auf Basisebene zur Animation von Charakteren in Animationsfilmen verwendet werden, was den Charakteren ein realistischeres Gefühl mit natürlichen Gesichtsausdrücken und Kopfbewegungen verleiht. Ein weiterer Anwendungsfall könnte in Videospielen liegen, aus demselben Grund, denken Sie an Grand Theft Auto und dergleichen. In der Zukunft könnte es für hyperrealistische, KI-generierte Filme oder Serien verwendet werden, bei denen Charaktere aus Bildgeneratoren generiert und von VASA-1 animiert werden könnten, und das Publikum könnte nicht einmal spüren, dass die Charaktere keine Menschen sind.
Neben der kreativen Nutzung des Tools kann es auch zur Erstellung von Inhalten für bösartige Zwecke genutzt werden. Der potenzielle Missbrauch von VASA-1 könnte seine Nutzung für Deepfakes sein, da es jedem, der an Deepfake-Erstellungen beteiligt ist, erleichtern würde, seine schlechten Taktiken zu skalieren und realistischere irreführende Inhalte zu generieren. Erinnern Sie sich an den Robocall-Skandal, der die Stimme von Biden beinhaltete, um Menschen davon abzuhalten, vor einer Primary-Wahl abzustimmen? Jetzt könnte es ein Robovideo nach dem Robocall geben, und das mit sehr realistischen menschlichen Ausdrücken.
Das potenzielle Risiko des Missbrauchs könnte der Grund sein, dass Microsoft seine Tests auf seine Forscher beschränkt hat. Laut Microsoft-Forschern kann das Tool zur Erstellung irreführender und täuschender Inhalte zur Identitätsnachahmung verwendet werden, wie bei einigen anderen Tools, aber sie zielen auf positive Anwendungsbereiche ab. Nvidia und Runway AI haben ebenfalls ihre Modelle für dieselbe Funktion veröffentlicht, aber VASA-1 scheint weitaus realistischer und ein vielversprechender Kandidat zu sein.
Die klügsten Krypto-Köpfe lesen bereits unseren Newsletter. Lust dabei? Mach mit.
Haftungsausschluss: Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com übernimmt keine Haftung für Investitionen, die auf der Grundlage der auf dieser Seite bereitgestellten Informationen getätigt werden. Wir empfehlen dringend, vor jeder Anlageentscheidung unabhängige Recherchen durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

Aamir Sheikh
Aamir ist Tech-Journalist mit fast sechs Jahren Erfahrung in der Krypto- und Technologiebranche. Er absolvierte sein Studium an der MAJ University mit einem MBA in Finanzen und Marketing. Heute arbeitet er für Cryptopolitan, wo er über die neuesten Entwicklungen in den Kryptowährungsmärkten und Preisprognosen berichtet.
















