在杭州的云栖大会现场,最震撼的一幕不是“阿里发布了7款大模型”的新闻标题,而是现场大屏上突然播放的一个视频:画面里的人物一边说话,一边做着流畅的动作,声音和嘴型严丝合缝,仿佛就是一段真人实拍。观众们的第一反应是——这真的是AI生成的吗?

图片

是的。阿里刚刚亮出的通义万相 Wan2.5-preview,第一次把“声音”和“画面”真正揉到了一起,让国产视频生成模型跨进了一个全新的台阶。

过去大家看AI视频,总觉得像在看“哑剧”:画面是画面,声音要单独配。现在,阿里直接解决了这个最大短板。输入一段文字,模型就能一次性生成带对白、配乐和环境音的视频。更夸张的是,你给它一段Rap,它能让虚拟人物嘴型对得滴水不漏。

如果说Sora在去年让全球第一次感受到“文本生成视频”的魔力,那今天,阿里的Wan2.5-preview则让我们看到了国产AI视频正在加速逼近的姿态。

图片

视频生成的新范式:从“静音片段”到“全感官叙事”

这次阿里没有只停留在“画面更清晰”“时长更长”这些常规升级上,而是把视频生成的四个关键痛点,一口气补齐了:

  • 更长的时长:从5秒拉长到10秒,能撑起一个小剧情。

  • 更高的画质:24帧/秒、1080P,电影级别的流畅度。

  • 更强的操控:能听懂运镜、变身这种复杂指令。

  • 音画同步:人物嘴型、环境音、音乐同时生成。

最核心的突破在于架构。Wan2.5-preview采用了“原生多模态”方式训练,也就是说声音、图像、文本在一开始就是一套模型里互相理解和学习的,不再是后期拼接。这让它具备了更强的跨模态推理能力,理解力和创造力都上了一个新高度。

比如,你输入一句抽象的诗句,它不仅能画出意境对应的画面,还能自动配上一段契合氛围的音乐。

这背后意味着一个重要信号:AI生成视频,正在从“有画面”迈向“有氛围”,甚至是“有叙事感”。

惊艳的案例:电影级效果、Rap嘴型、深海声效

在体验环节,几个案例让人印象极深:

  • 温馨场景:一位女孩拆礼物,光影、表情都细腻得像电影,背景里还能听到圣诞钢琴曲和柴火声。

  • 婚礼片段:新郎为新娘戴戒指,伴随着婚礼进行曲,细节到“头纱被风掀起”的瞬间都没错过。

  • Rap表演:输入一句极快的说唱歌词,AI生成的角色嘴型完全对得上,节奏感甚至比真人还稳。

  • 深海探险:潜水员下潜时,除了画面里的鲨鱼背鳍,还能听到声呐、水流、气泡爆裂的声音,逼真得让人背后发凉。

这不是“简单的拟声”,而是真正基于语义和场景的推理生成。换句话说,它理解你描述的场景,并把声音当作叙事的一部分加入进来。

如果说之前的AI视频像“没有声音的电影剧照”,那现在的Wan2.5-preview,就是一部能看的、能听的短片。

低估的阿里:从通义千问到通义万相

很多人提到阿里大模型时,第一反应是通义千问。但事实上,通义万相这条视觉多模态路线,可能更值得关注。

过去两年,阿里在视频生成模型上的节奏非常快:

  • Wan2.1(2025年2月)开源,被称为国产版“Sora”。

  • Wan2.2(2025年5月)全球首个MoE架构的视频生成模型,算力省一半,效果依旧电影级。

  • Wan2.5-preview(这次发布)真正实现了音画同步,往“全模态大一统”再进一步。

阿里公布的数字也很亮眼:通义万相已经累计生成 3.9亿张图片、7000万个视频,是中国调用量最大的视觉生成模型之一。同时,它也是全球下载量最高的开源视频模型之一。

这背后的逻辑很清晰:阿里并不是要单点突破,而是想把“视频生成”打造成下一代操作系统。正如吴泳铭所说,大模型是新的操作系统,而视频模型的尽头,可能就是“世界模型”。

过去一年,所有人都在盯着OpenAI的Sora。今天看完阿里的Wan2.5-preview,感觉国产AI已经不再只是“追赶者”。它不是单纯模仿,而是走出了属于自己的路径:开源、全模态、操作系统化。

通义万相或许就是阿里真正的AI“杀手锏”。

当生成式AI从文字到图像,再到视频、声音一步步补齐,我们正在接近一个全感官的叙事时代。未来的短视频、电影、甚至教育和游戏,可能都会因为这一波国产模型的崛起,而彻底改写。

了解更多AI资讯,职场思考,科技资讯,扫码加入群聊,解锁更多精彩内容

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐