Microsoft presentó una nueva herramienta de inteligencia artificial de sincronización de labios que transforma una imagen fija del rostro de una persona en un clip animado de ella hablando o cantando.
VASA-1 no sólo es capaz de producir movimientos de labios que están «exquisitamente sincronizados» con el audio, sino que también puede capturar un «amplio espectro» de matices faciales y movimientos naturales de la cabeza que contribuyen a la percepción de autenticidad y vivacidad.
¿Cómo funciona?
Microsoft desarrolló una “dinámica facial holística” y un modelo de generación de movimientos de la cabeza que funciona en un espacio latente del rostro. La empresa afirma que «supera significativamente a los métodos anteriores en términos generales».
VASA es actualmente solo una demostración de investigación sin planes de lanzar el producto o permitir que otros utilicen la API; básicamente, Microsoft sólo quiere mostrar su modelo de sincronización de labios.
La compañía dice que VASA aceptará solicitudes como hacia dónde debe mirar el personaje, el corte en la cabeza del sujeto y sus emociones mientras habla, que incluyen neutral, feliz, enojado o sorprendido.
Microsoft demostró la utilidad de esta IA utilizando DALL-E 3 o StyleGAN2 para generar imágenes de personas, pero se podrían utilizar fotografías reales. El presidente de los Estados Unidos, por ejemplo, podría verse obligado a hacer algo que no dijo: plantear cuestiones éticas en torno a los deepfakes y la desinformación.
«Nuestra investigación se centra en generar habilidades afectivas visuales para avatares virtuales de IA, con el objetivo de aplicaciones positivas», dice Microsoft en la página de investigación VASA-1. “No se pretende crear contenido que se utilice para inducir a error o engañar. Sin embargo, al igual que otras técnicas de generación de contenido relacionadas, aún podría utilizarse indebidamente para hacerse pasar por humanos.






