O VASA-1 da Microsoft pode gerar rostos falantes realistas a partir de apenas uma imagem

- Um artigo de pesquisa da Microsoft apresentou um projeto para gerar cabeças falantes.
- O novo modelo de IA pode gerar um rosto ou cabeça falante ao fazer o upload de uma única foto e de uma nota de voz.
- O rosto animado possui expressões faciais e movimentos labiais realistas para sincronizar a voz com os movimentos naturais da cabeça.
Em um recente white paper, a Microsoft apresentou um novo modelo de IA que produz uma cabeça falante que parece e soa realista, gerada apenas pelo upload de uma fotografia estática e uma amostra de voz.
O novo modelo é chamado VASA-1 e requer apenas uma foto de retrato e um arquivo de áudio de voz, fundindo-os para criar um vídeo curto de uma cabeça falante com expressões faciais, sincronização labial e movimentos da cabeça. A cabeça produzida até pode cantar músicas, na voz carregada no momento da criação.
Microsoft VASA-1 é um avanço para a animação
De acordo com a Microsoft, o novo modelo de IA ainda está na fase de pesquisa e não há planos de lançá-lo ao público em geral, e apenas os pesquisadores da Microsoft têm acesso a ele. No entanto, a empresa compartilhou algumas amostras das demonstrações, que mostram um realismo impressionante e movimentos labiais que parecem demasiado realistas.

A demonstração mostra pessoas que parecem reais, como se estivessem sentadas na frente de uma câmera sendo filmadas. Os movimentos da cabeça são realistas e parecem bastante naturais, e o movimento labial para corresponder ao áudio é bastante notável, desde que pareça muito pouco a ser observado como não natural. A sincronização geral da boca é fenomenal.
A Microsoft disse que o modelo foi desenvolvido para animar personagens virtuais e afirmou que todas as pessoas mostradas na demonstração são sintéticas, pois disseram que os modelos foram gerados a partir do DALL-E, que é o gerador de imagens da OpenAI. Então, achamos que, se pode animar um modelo gerado por IA, então obviamente há muito mais potencial para animar fotos de qualquer pessoa real, o que deve ser mais realista e muito mais fácil de lidar para ela.
Casos de uso do Vasa-1 e seu potencial uso indevido

Se olharmos para o potencial do VASA-1 para uso prático, então, na linha de base, ele pode ser usado para animar personagens em filmes animados, o que dará aos personagens uma sensação mais realista com expressões faciais e movimentos de cabeça naturais. Outro uso poderia ser em videogames, pela mesma razão, pense em Grand Theft Auto e similares. No futuro, pode ser usado para filmes ou séries gerados por IA hiper-realistas, onde os personagens podem ser gerados a partir de geradores de imagem e animados pelo VASA-1, e o público pode nem sentir que os personagens não são humanos.
Junto com o uso criativo da ferramenta, ela também pode ser aproveitada para criar conteúdo para fins maliciosos. O uso indevido potencial do VASA-1 poderia ser sua utilização para deepfakes, pois tornará mais fácil para qualquer pessoa envolvida na criação de deepfakes escalar suas táticas ruins e gerar conteúdo enganoso mais realista. Lembra-se do escândalo de robocalls envolvendo a voz de Biden para impedir as pessoas de votar antes de uma eleição primária? Agora pode ser um robovídeo após o robocall, e isso com expressões humanas muito realistas.
O risco potencial de uso indevido pode ser a razão pela qual a Microsoft limitou seus testes apenas aos seus pesquisadores. De acordo com os pesquisadores da Microsoft, a ferramenta pode ser usada para criar conteúdo enganoso e ilusório para se passar por humanos, como algumas outras ferramentas, mas eles estão mirando em aplicações de uso positivo. A Nvidia e a Runway AI também lançaram seus modelos para a mesma função, mas o VASA-1 parece muito mais realista e um candidato promissor.
Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.
Aviso Legal: As informações fornecidas não constituem aconselhamento de negociação. A Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações disponibilizadas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar qualquer decisão de investimento.

Aamir Sheikh
Aamir é um jornalista de tecnologia com quase seis anos de experiência nos setores de criptomoedas e tecnologia. Formou-se na MAJ University com um MBA em Finanças e Marketing. Atualmente trabalha na Cryptopolitan, onde relata os últimos desenvolvimentos nos mercados de criptomoedas e previsões de preços.
















