牛,阿里的7款大模型
在杭州的云栖大会现场,最震撼的一幕不是“阿里发布了7款大模型”的新闻标题,而是现场大屏上突然播放的一个视频:画面里的人物一边说话,一边做着流畅的动作,声音和嘴型严丝合缝,仿佛就是一段真人实拍。观众们的第一反应是——这真的是AI生成的吗?
是的。阿里刚刚亮出的通义万相 Wan2.5-preview,第一次把“声音”和“画面”真正揉到了一起,让国产视频生成模型跨进了一个全新的台阶。
过去大家看AI视频,总觉得像在看“哑剧”:画面是画面,声音要单独配。现在,阿里直接解决了这个最大短板。输入一段文字,模型就能一次性生成带对白、配乐和环境音的视频。更夸张的是,你给它一段Rap,它能让虚拟人物嘴型对得滴水不漏。
如果说Sora在去年让全球第一次感受到“文本生成视频”的魔力,那今天,阿里的Wan2.5-preview则让我们看到了国产AI视频正在加速逼近的姿态。

视频生成的新范式:从“静音片段”到“全感官叙事”
这次阿里没有只停留在“画面更清晰”“时长更长”这些常规升级上,而是把视频生成的四个关键痛点,一口气补齐了:
更长的时长:从5秒拉长到10秒,能撑起一个小剧情。
更高的画质:24帧/秒、1080P,电影级别的流畅度。
更强的操控:能听懂运镜、变身这种复杂指令。
音画同步:人物嘴型、环境音、音乐同时生成。
最核心的突破在于架构。Wan2.5-preview采用了“原生多模态”方式训练,也就是说声音、图像、文本在一开始就是一套模型里互相理解和学习的,不再是后期拼接。这让它具备了更强的跨模态推理能力,理解力和创造力都上了一个新高度。
比如,你输入一句抽象的诗句,它不仅能画出意境对应的画面,还能自动配上一段契合氛围的音乐。
这背后意味着一个重要信号:AI生成视频,正在从“有画面”迈向“有氛围”,甚至是“有叙事感”。
惊艳的案例:电影级效果、Rap嘴型、深海声效
在体验环节,几个案例让人印象极深:
温馨场景:一位女孩拆礼物,光影、表情都细腻得像电影,背景里还能听到圣诞钢琴曲和柴火声。
婚礼片段:新郎为新娘戴戒指,伴随着婚礼进行曲,细节到“头纱被风掀起”的瞬间都没错过。
Rap表演:输入一句极快的说唱歌词,AI生成的角色嘴型完全对得上,节奏感甚至比真人还稳。
深海探险:潜水员下潜时,除了画面里的鲨鱼背鳍,还能听到声呐、水流、气泡爆裂的声音,逼真得让人背后发凉。
这不是“简单的拟声”,而是真正基于语义和场景的推理生成。换句话说,它理解你描述的场景,并把声音当作叙事的一部分加入进来。
如果说之前的AI视频像“没有声音的电影剧照”,那现在的Wan2.5-preview,就是一部能看的、能听的短片。
低估的阿里:从通义千问到通义万相
很多人提到阿里大模型时,第一反应是通义千问。但事实上,通义万相这条视觉多模态路线,可能更值得关注。
过去两年,阿里在视频生成模型上的节奏非常快:
Wan2.1(2025年2月)开源,被称为国产版“Sora”。
Wan2.2(2025年5月)全球首个MoE架构的视频生成模型,算力省一半,效果依旧电影级。
Wan2.5-preview(这次发布)真正实现了音画同步,往“全模态大一统”再进一步。
阿里公布的数字也很亮眼:通义万相已经累计生成 3.9亿张图片、7000万个视频,是中国调用量最大的视觉生成模型之一。同时,它也是全球下载量最高的开源视频模型之一。
这背后的逻辑很清晰:阿里并不是要单点突破,而是想把“视频生成”打造成下一代操作系统。正如吴泳铭所说,大模型是新的操作系统,而视频模型的尽头,可能就是“世界模型”。
过去一年,所有人都在盯着OpenAI的Sora。今天看完阿里的Wan2.5-preview,感觉国产AI已经不再只是“追赶者”。它不是单纯模仿,而是走出了属于自己的路径:开源、全模态、操作系统化。
通义万相或许就是阿里真正的AI“杀手锏”。
当生成式AI从文字到图像,再到视频、声音一步步补齐,我们正在接近一个全感官的叙事时代。未来的短视频、电影、甚至教育和游戏,可能都会因为这一波国产模型的崛起,而彻底改写。
了解更多AI资讯,职场思考,科技资讯,扫码加入群聊,解锁更多精彩内容

更多推荐




所有评论(0)