2024年8月26日,阿里云正式发布其最新多模态视频生成模型——通义万相Wan2.2-S2V,并宣布该模型已开源。
这款新模型极大地简化了视频制作流程。用户只需提供一张静态图片和一段音频,即可生成面部表情自然、口型与音频高度同步、肢体动作流畅的高质量数字人视频,达到电影级视觉效果。
值得一提的是,Wan2.2-S2V支持分钟级长视频的稳定生成。不仅能够实现精准的嘴部动作匹配,还能同步驱动手势、表情和姿态,使人物表现更加生动真实。
此外,该模型在训练过程中充分挖掘了跨域泛化能力,能够自然地驱动多种类型的形象,包括卡通人物、动物、二次元角色以及风格化艺术人像,不再局限于真人肖像。无论是让萌宠“开口说话”,还是让动漫角色“对口型唱歌”,Wan2.2-S2V都能实现精准的音画同步效果。
在输出方面,模型提供480P和720P两种分辨率选项,兼顾生成效率与画面质量,适用于短视频制作、数字人应用、以及轻量级影视内容创作等多种场景。

文章内容来源于网络,不代表本站立场,若侵犯到您的权益,可联系多特删除。(联系邮箱:[email protected])
相关阅读











近期热点
最新资讯