阿里开源Wan-S2V:用一张照片和一段音频生成电影级数字人视频
阿里发布Wan-S2V开源模型,通过单张照片和音频即可生成带表情和动作的数字人视频,技术架构解析与潜在应用场景探讨。
阿里这次确实在玩真的。
Wan-S2V这个开源模型直接把数字人视频生成的门槛踩到了地板下——只需要一张照片加一段音频,就能输出带微表情、唇语同步的电影级视频。技术上看,它是在Wan-14B视频生成器上加了个音频通道,用声波控制面部肌肉运动和肢体语言。
有意思的是它的分工逻辑:文本指令负责宏观叙事(镜头运动、构图关系),音频波形处理微观细节(嘴角弧度、眉毛抬起的时机)。这种双层控制让生成的视频既不会像早期AI那样机械,又避免了纯音频驱动导致的动作泛滥。
技术上有几个反常识的设计:
1. 通过音素特征解耦,模型能区分「愤怒的高音」和「喜悦的高音」对面部肌肉的不同影响
2. 多人场景里会做主动说话者检测,确保只有发声者的嘴唇在动
3. 训练时用视觉语言模型自动生成运动描述标签,既保留文本控制力又让音频补充细节
最实用的可能是它的「唇语编辑模式」——单独圈出嘴部区域重新生成帧序列,适合影视行业的后期配音修改。不过目前生成的肢体动作还带着点「AI特有的优雅」,那种过于完美的关节转动会暴露非人类属性。
开源策略很阿里:先放基础模型占领开发者心智,等数字人直播带货的客户上门求定制。现在唯一的问题是,当任何人都能低成本生成CEO演讲视频时,我们该怎么定义「真实」?
(配图说明:因原文未提供Wan-S2V示例图片,此处建议补充实际生成效果对比图)
发布时间: 2025-08-28 12:34