1. 认知模型前沿:OLMo 3与qTTT的技术突破

1.1 OLMo 3:完全开放的语言模型新范式

艾伦人工智能研究所(AI2)联合多所顶尖高校发布的OLMo 3系列模型,标志着语言模型开发从"开放权重"到"完全开放"的范式转变。这个7B和32B参数规模的模型家族不仅公开了最终模型权重,更史无前例地开放了完整的训练流程:

  • 全流程透明 :包含预训练(5.9T tokens)、中期训练(100B tokens)、长上下文扩展(50-100B tokens)三个阶段的所有数据、代码和检查点
  • 创新训练方法
    • 滑动窗口注意力机制:在3/4层使用4096 token窗口,最后一层保持完全注意力
    • 质量感知上采样:对数据质量进行差异化处理,顶部5%数据重复7次,底部40%被过滤
    • Delta Learning偏好调优:构建高对比度偏好数据提升模型性能

技术细节上,OLMo 3的Dolma 3数据集系统包含9T预训练池、2T中期训练池和640B长上下文池。特别值得注意的是其olmOCR科学PDF处理工具,专门处理了2.38亿PDF文档,其中包含22.3M个超8K tokens的长文档,为长上下文训练提供了最大规模的开放数据集。

提示:OLMo 3的完全开放策略使研究者能够在任何训练阶段进行干预和定制,这种透明度对AI安全研究和模型可解释性具有重要意义。

1.2 qTTT:测试时训练突破长文本瓶颈

Meta、OpenAI与哈佛大学联合提出的查询专属测试时训练(qTTT)方法,解决了大模型处理长文本时的根本性难题。研究发现,随着上下文长度增加,静态自注意力机制会出现"分数稀释"现象——关键信息的注意力权重被大量无关内容分散。

qTTT的核心创新在于:

  1. 单次前向传播缓存键值对
  2. 仅对查询投影矩阵进行少量梯度更新
  3. 每步更新在短文本片段上计算损失,保持KV缓存不变

这种方法在LongBench-v2和ZeroScrolls基准上,使Qwen3-4B模型分别获得12.6%和14.1%的平均性能提升。特别是在需要多跳推理和检索的任务上表现突出,如在MuSiQue任务上Qwen3-8B从22.5%提升至48.9%。

技术实现上,qTTT通过数学证明:为保证目标获得足够注意力权重,目标与干扰token的最小logit差距必须达到log((T-1)(1-ε)/ε)级别。这一理论突破解释了为何传统方法在长文本中效果有限。

2. 多模态模型进展:从理解到生成

2.1 VL-JEPA:非生成式视觉语言模型

Meta FAIR和Yann LeCun团队提出的VL-JEPA架构,颠覆了传统视觉语言模型的生成范式。与逐token预测不同,VL-JEPA在连续嵌入空间进行语义预测,实现了:

  • 参数量减少50%的同时性能提升
  • 原生支持选择性解码机制,解码操作减少2.85倍
  • 在8个视频分类和8个视频检索数据集上超越CLIP、SigLIP2等模型

模型采用四组件架构:

  1. X-Encoder处理视觉输入
  2. Predictor预测目标嵌入
  3. Y-Encoder编码文本目标
  4. Y-Decoder(仅在推理时使用)将预测嵌入转为文本

这种设计使模型无需重建token空间的每个细节,而只需预测抽象语义表示,大大提高了学习效率。

2.2 MetaCanvas:MLLM与扩散模型的深度协作

Meta的MetaCanvas框架通过"画布令牌"实现了多模态大语言模型与扩散模型的高效信息传递。关键技术包括:

  • 可学习的多维画布令牌(图像任务用2D布局,视频任务用3D关键帧设计)
  • 多模态RoPE编码处理空间-时间位置信息
  • 轻量级连接器(标准Transformer块+DiT块)对齐不同模态

在图像编辑任务中,结合FLUX.1-Kontext-Dev后,MetaCanvas在GEdit-Bench上的分数从6.00提升至7.67。视频生成方面,在保持VBench质量分数97.50的同时,语义分数达到7.91(基线6.61)。

3. 具身智能与基准测试新进展

3.1 DexWM:从人类视频学习的灵巧操作模型

Meta和NYU团队开发的DexWM世界模型,通过观看900小时人类和机器人视频,学会了预测手部动作对物体的影响。关键技术突破:

  • 使用DINOv2编码器提取图像特征
  • 将手部动作表示为3D关键点差异(双手各21个关键点)
  • 引入手部一致性损失强化学习

在真实世界测试中,配备Allegro夹爪的Franka Panda机械臂实现了83%的抓取成功率(12次试验成功10次),且完全零样本(无任何真实世界训练数据)。

3.2 FrontierCS:开放性计算机科学基准

纽约大学谢赛宁团队等发布的FrontierCS基准包含156道开放性计算机科学问题,特点包括:

  • 无已知最优解,但解决方案质量可客观评估
  • 每道题配备专家参考解、自动评估器和基准实现
  • 支持三种演化机制保持挑战性

实验结果凸显了当前AI的局限:Gemini 3.0 Pro在算法问题上的Score@1仅为29.37分,远低于人类专家的95.41分。模型常陷入"微观优化陷阱",生成可运行但未充分优化的代码。

4. 模型优化与系统创新

4.1 T5Gemma 2:轻量级编码器-解码器架构

Google DeepMind的T5Gemma 2是首个支持长上下文的多模态编码器-解码器模型家族,关键创新:

  • 绑定词嵌入:减少10.5%参数量
  • 合并注意力:节省6.5%参数
  • UL2预训练目标:五种去噪任务混合训练

尽管仅在16K序列上预训练,模型在128K长度的RULER和MRCR基准中表现出色,平均得分57.1,显著超越Gemma 3的17.2分。

4.2 SonicMoE:细粒度混合专家训练加速

普林斯顿Tri Dao团队提出的SonicMoE通过三层优化实现了细粒度MoE模型的高效训练:

  1. 算法层:重构计算路径,激活内存减少45%
  2. 内核层:利用GPU异步能力,计算吞吐达理论上限88%
  3. 路由层:token rounding算法消除GEMM padding浪费

在7B参数模型上,64个H100 GPU达到213B tokens/day的训练吞吐量,与ScatterMoE在96个H100上的225B tokens/day相当,节省了1/3 GPU资源。

5. 音频-视觉联合生成突破

字节跳动的Seedance 1.5 pro是首个原生音视频联合生成的基础模型,特点包括:

  • 双分支Diffusion Transformer架构同步处理视觉和听觉流
  • 多阶段数据管理确保视频-音频连贯性
  • 多维度奖励模型RLHF提升生成质量

在SeedVideoBench 1.5测试中,模型在指令遵循维度领先,并能生成细腻的面部表情和身体动作。音频方面,在中文语音生成上持续优于Veo 3.1,支持多种方言场景。

6. 图像压缩新范式:VLIC

斯坦福李飞飞团队与谷歌提出的VLIC方法,创新性地使用视觉-语言模型作为感知裁判:

  • Gemini 2.5-Flash零样本复制人类视觉相似性判断,准确率83.80%
  • Diffusion DPO直接利用VLM的二元偏好判断训练模型
  • 在MS-COCO上人类Elo评分1112(0.21 bpp),优于HiFiC的900

这种方法标志着"利用基础模型通用能力"正成为替代"训练任务专用网络"的新范式。随着VLM能力提升,这类方法将自动受益而无需额外人类标注数据。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐