#180·vid2vid

伟大的英伟达,转眼间已经过去了六年,英伟达栽下的树,后人可在其下凉爽身心。

作者: stone100010创建于 2024年4月25日更新于 2024年4月25日

VASA-1 是由一组研究人员推出的先进框架,旨在通过单个静态图像和附带的语音音频片段实时生成逼真的说话面孔。该模型名为 VASA-1,擅长生成与音频高度同步的唇部运动,同时还能捕捉各种面部表情和自然的头部运动,从而增强生成面孔的真实感和生动感。这项创新的核心是面部动态和头部运动的整体模型,该模型在由视频数据制作的独特潜在空间内运行。