1. 项目背景与核心挑战

视频生成技术近年来取得了突破性进展,以扩散模型和自回归方法为代表的生成框架,已经能够合成具有高度时间一致性和视觉质量的视频内容。然而,随着模型规模和数据质量的快速提升,当前顶尖视频生成系统(如Sora2、Veo3.1等)在视觉感知和理解维度(如美学质量、指令遵循)的性能已接近饱和。这促使研究社区开始关注一个更本质的问题:视频生成模型是否具备真正的规则推理能力?

规则推理能力是指模型从输入中推断隐含规则,并据此预测和生成符合逻辑的视频现象。例如,当输入"将金属钠放入含酚酞的水中"时,优秀模型应能推理出"剧烈反应产生氢气和氢氧化钠,溶液变红"的完整过程,而不仅仅是生成看似合理的画面。这种能力被视为视频模型向视觉基础智能(Vision Foundation Intelligence)演进的关键里程碑。

2. RULER-Bench的设计原理

2.1 规则分类体系

RULER-Bench的创新性在于首次构建了视频生成领域的规则推理分类体系。基于认知科学和人工智能原理,研究团队将推理场景划分为三大基础领域:

  • 自然领域 :要求模型基于现实世界规则生成合理现象

    • 视觉规则 :理解真实世界的视觉构成(如外观变化、空间排列)
    • 科学规则 :应用自然法则推理科学现象(如化学反应、物理定律)
  • 社会领域 :评估模型对人类社会的理解

    • 人文规则 :推断符合社会动态的行为(如体育规则、传统习俗)
    • 语义规则 :通过语义规律表达真实含义(如隐喻理解)
  • 虚拟领域 :测试模型对虚拟环境的逻辑掌握

    • 游戏规则 :根据游戏机制执行合理动作(如国际象棋将军)
    • 假设规则 :基于假设前提预测现象(如"假设冬夏颠倒")

2.2 任务构建方法论

为确保评测的全面性,研究团队设计了严谨的数据构建流程:

  1. 种子样本采集 :人工标注每个任务的示范样本,为后续生成提供上下文参考
  2. 双管道数据生成
    • 文本到视频(T2V):GPT-5生成(提示词,隐含解释)元组
    • 图像到视频(I2V):结合网络图像与生成图像,特别对游戏类任务采用人工标注
  3. 质量控制系统
    • 嵌入模型去重:计算提示词嵌入的余弦相似度去除重复
    • 多模态一致性验证:确保提示词、解释与输入图像逻辑一致
    • 人工校验:专家团队审核规则正确性、任务多样性和场景典型性

最终构建的622个高质量实例均匀分布在40个任务中,每个实例包含:

  • 输入模态(文本/图像)
  • 任务说明
  • 隐含规则解释
  • 预期现象描述

3. 评测协议的技术实现

3.1 四维评估指标

RULER-Bench采用创新的检查表协议,从四个维度评估生成视频:

指标 评估重点 示例问题(钠与水反应场景)
指令遵循 输入与输出的语义对齐 视频是否准确显示钠被放入酚酞溶液?
视觉一致性 元素身份的跨帧保持 烧杯和背景是否保持几何一致?
视觉保真度 画面质量与稳定性 能否清晰分辨小气泡而无模糊或伪影?
规则一致性★ 现象与隐含规则的符合程度 是否准确呈现氢气产生和溶液变红的现象?

注:规则一致性是核心创新指标,直接反映模型的推理能力

3.2 GPT-o3驱动的自动化评估

为实现可扩展的客观评估,研究团队设计了基于多模态大语言模型(MLLM)的自动化流程:

  1. 检查表生成 :对每个样本,GPT-5根据四个指标生成具体问题

    • 每个问题设置三个离散标签:Good(100)/Medium(50)/Bad(0)
    • 例如科学类任务会包含"反应现象是否符合化学定律"等专业问题
  2. 评分标准化 :将离散标签映射为百分制分数

    • 各指标得分为关联问题的平均分
    • 总体得分取四个指标的等权平均
  3. 人工对齐验证

    • 随机选择80个视频的813个问题由人类专家标注
    • GPT-o3与人类判断的一致性达85%(Kendall系数0.462)
    • 显著优于Gemini 2.5(0.358)和GPT-5(0.420)等替代方案

这种评估设计既保证了大规模评测的可行性,又通过严格的人类对齐研究确保了结果的可信度。

4. 关键实验结果与洞见

4.1 主流模型性能对比

研究团队评估了10个最先进的视频生成模型,包括6个闭源模型(Veo3.1、Sora2等)和4个开源模型(HunyuanVideo等)。表1展示了核心发现:

表1:规则类别与评估指标下的模型表现(百分制)

规则类别 最佳模型(闭源) 最佳模型(开源) 规则一致性差距
科学规则 Veo3.1 (50.97) Wan2.2 (17.16) 3.0倍
游戏规则 Sora2 (19.97) Wan2.1 (14.12) 1.4倍
语义规则 Veo3.1 (67.57) Hunyuan (32.01) 2.1倍
假设规则 Veo3.1 (46.79) Wan2.1 (12.93) 3.6倍
人文规则 Veo3.1 (61.23) Hunyuan (27.78) 2.2倍
视觉规则 Veo3.1 (48.94) Wan2.1 (29.34) 1.7倍

4.2 核心发现

  1. 规则一致性是当前最大短板
    所有模型在该指标上表现最差,平均得分仅48.87%。即使是表现最好的Veo3.1,其规则一致性分数(48.87)也显著低于视觉保真度(86.72)和视觉一致性(76.68),揭示出现有模型更擅长表面感知而非深层推理。

  2. 领域间表现差异显著
    模型在人文和语义类别表现最佳(Veo3.1平均80分),而在游戏和视觉类别最弱(最低达8.17分)。特别是在完全基于I2V的任务中,平均得分比T2V任务低17分,说明多模态输入会加剧推理难度。

  3. 闭源模型优势明显
    闭源模型在规则一致性上平均领先开源模型2.3倍,表明更大规模数据和参数对推理能力提升至关重要。Veo3.1在6个类别中5项领先,展现出Google在视频推理方面的技术优势。

4.3 典型失败案例分析

通过定性研究,团队识别出几类常见推理错误:

  1. 字面理解偏差
    当输入"创业者持续播撒未来的种子"时,所有模型都字面化生成播种农作物的画面,无法理解商业隐喻。

  2. 物理规律误解
    在AED使用场景中,多数模型错误放置电极片,或忽略"需等待语音提示再放电"的关键医疗规则。

  3. 游戏策略失效
    围棋任务要求"防止己方棋子被吃",仅Sora2能生成符合围棋气规则的落子,其他模型产生非法走子。

  4. 视觉异常忽略
    对"修正动物外观异常"任务,部分模型无法识别"蓝色皮肤"违反自然规律,或修正后引入新异常。

5. 技术启示与未来方向

5.1 当前技术局限

实验结果揭示了视频生成模型在推理层面的本质局限:

  1. 规则表征不足
    现有模型主要从视觉数据中学习表面统计规律,缺乏对底层规则的显式建模。例如在科学类任务中,模型可能记住"钠+水→冒泡"的关联,但无法泛化到其他金属的反应预测。

  2. 多模态推理断层
    I2V任务表现较差,反映出现有架构难以有效桥接视觉输入与规则系统。当输入图像包含隐含规则(如围棋棋盘状态)时,模型常忽略关键视觉线索。

  3. 因果推理缺失
    模型倾向于建立输入-输出的统计映射,而非真正的因果推理。例如在"冬夏颠倒"任务中,部分模型生成穿夏装的人,但背景植被仍保持冬季特征。

5.2 改进路径建议

基于这些发现,研究团队提出三个关键发展方向:

  1. 混合架构设计
    将神经渲染与符号推理引擎结合,如Veo3.1已尝试的"神经牛顿动力学"模块,专门处理物理规则。

  2. 课程学习策略
    按规则复杂度分级训练:先掌握简单视觉一致性,再进阶到科学定律和社会规范。RULER-Bench的层次化任务设计正支持这种渐进式优化。

  3. 增强提示工程
    实验显示,用GPT-o3将隐含规则显式写入提示词,可使规则一致性提升9-22分(见表2)。这表明当前模型的推理潜力可能被低效输入所限制。

表2:提示增强对规则一致性的提升效果(百分点)

模型 科学类 视觉类 语义类 假设类 人文类
Veo3.1 +9.65 +3.67 +4.62 +11.33 +6.17
Sora2 +8.36 +7.56 +9.68 +22.0 +8.37

6. 实际应用中的注意事项

对于希望利用RULER-Bench开展研究的团队,建议重点关注以下实践要点:

  1. 评估协议实施

    • 使用官方提供的检查表模板确保评估一致性
    • 对关键样本建议进行人工复核,特别是低分案例
    • 注意GPT-o3的版本控制(建议使用2025.12+版本)
  2. 模型对比策略

    • 优先分析规则一致性指标的细分表现
    • 关注模型在I2V与T2V任务的表现差异
    • 对开源模型,可结合注意力可视化分析推理过程
  3. 数据扩展建议

    • 新增任务时应保持六个规则类别的平衡
    • 游戏类任务建议包含完整的状态-动作-奖励序列
    • 科学类任务需通过领域专家验证规则正确性

从工程角度看,这项研究最值得关注的创新是将抽象的"推理能力"转化为可量化的评估协议。通过构建622个精细标注的测试实例和8500多个检查问题,RULER-Bench首次为视频生成领域建立了规则推理的客观评价标准。实验揭示的模型短板也为下一代架构设计指明了方向——要实现真正的视觉基础智能,仅靠扩大数据和模型规模可能收效有限,必须引入更本质的规则表征和推理机制。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐