首页 > 科技周边 > 人工智能

真假难辨！阿里升级AI人像视频生成，表情动作直逼专业水准

时间：2025-02-18 20:25:21 347浏览收藏

在IT行业这个发展更新速度很快的行业，只有不停止的学习，才不会被行业所淘汰。如果你是科技周边学习者，那么本文《真假难辨！阿里升级AI人像视频生成，表情动作直逼专业水准》就很适合你！本篇内容主要包括##content_title##，希望对大家的知识积累有所帮助，助力实战开发！

阿里巴巴通义实验室的最新研究成果EMO2，实现了仅需一张肖像照片和任意长度音频，即可生成高度逼真、感染力十足的AI人像视频。该技术突破了以往音频驱动人像视频生成在动作流畅度和表现力上的局限，为虚拟主播、数字人等领域带来革新。

AIxiv专栏持续报道全球顶尖AI实验室的学术技术成果，至今已发布2000余篇高质量文章。欢迎投稿分享您的研究成果！投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com

EMO2的核心创新在于其“末端执行器”引导的生成策略。研究者巧妙地借鉴机器人控制系统中的“末端执行器”（例如机械手）概念，将手部动作作为关键驱动因素。由于手部动作与人类意图关联紧密，且与音频信号的相关性显著，因此优先生成手部动作，再利用逆向运动学和像素先验知识，生成其他身体部位的自然动作，从而避免了传统方法中容易出现的动作僵硬、不协调等问题。