OLMo 3与qTTT:语言模型与长文本处理的技术突破
1. 认知模型前沿:OLMo 3与qTTT的技术突破
1.1 OLMo 3:完全开放的语言模型新范式
艾伦人工智能研究所(AI2)联合多所顶尖高校发布的OLMo 3系列模型,标志着语言模型开发从"开放权重"到"完全开放"的范式转变。这个7B和32B参数规模的模型家族不仅公开了最终模型权重,更史无前例地开放了完整的训练流程:
- 全流程透明 :包含预训练(5.9T tokens)、中期训练(100B tokens)、长上下文扩展(50-100B tokens)三个阶段的所有数据、代码和检查点
- 创新训练方法 :
- 滑动窗口注意力机制:在3/4层使用4096 token窗口,最后一层保持完全注意力
- 质量感知上采样:对数据质量进行差异化处理,顶部5%数据重复7次,底部40%被过滤
- Delta Learning偏好调优:构建高对比度偏好数据提升模型性能
技术细节上,OLMo 3的Dolma 3数据集系统包含9T预训练池、2T中期训练池和640B长上下文池。特别值得注意的是其olmOCR科学PDF处理工具,专门处理了2.38亿PDF文档,其中包含22.3M个超8K tokens的长文档,为长上下文训练提供了最大规模的开放数据集。
提示:OLMo 3的完全开放策略使研究者能够在任何训练阶段进行干预和定制,这种透明度对AI安全研究和模型可解释性具有重要意义。
1.2 qTTT:测试时训练突破长文本瓶颈
Meta、OpenAI与哈佛大学联合提出的查询专属测试时训练(qTTT)方法,解决了大模型处理长文本时的根本性难题。研究发现,随着上下文长度增加,静态自注意力机制会出现"分数稀释"现象——关键信息的注意力权重被大量无关内容分散。
qTTT的核心创新在于:
- 单次前向传播缓存键值对
- 仅对查询投影矩阵进行少量梯度更新
- 每步更新在短文本片段上计算损失,保持KV缓存不变
这种方法在LongBench-v2和ZeroScrolls基准上,使Qwen3-4B模型分别获得12.6%和14.1%的平均性能提升。特别是在需要多跳推理和检索的任务上表现突出,如在MuSiQue任务上Qwen3-8B从22.5%提升至48.9%。
技术实现上,qTTT通过数学证明:为保证目标获得足够注意力权重,目标与干扰token的最小logit差距必须达到log((T-1)(1-ε)/ε)级别。这一理论突破解释了为何传统方法在长文本中效果有限。
2. 多模态模型进展:从理解到生成
2.1 VL-JEPA:非生成式视觉语言模型
Meta FAIR和Yann LeCun团队提出的VL-JEPA架构,颠覆了传统视觉语言模型的生成范式。与逐token预测不同,VL-JEPA在连续嵌入空间进行语义预测,实现了:
- 参数量减少50%的同时性能提升
- 原生支持选择性解码机制,解码操作减少2.85倍
- 在8个视频分类和8个视频检索数据集上超越CLIP、SigLIP2等模型
模型采用四组件架构:
- X-Encoder处理视觉输入
- Predictor预测目标嵌入
- Y-Encoder编码文本目标
- Y-Decoder(仅在推理时使用)将预测嵌入转为文本
这种设计使模型无需重建token空间的每个细节,而只需预测抽象语义表示,大大提高了学习效率。
2.2 MetaCanvas:MLLM与扩散模型的深度协作
Meta的MetaCanvas框架通过"画布令牌"实现了多模态大语言模型与扩散模型的高效信息传递。关键技术包括:
- 可学习的多维画布令牌(图像任务用2D布局,视频任务用3D关键帧设计)
- 多模态RoPE编码处理空间-时间位置信息
- 轻量级连接器(标准Transformer块+DiT块)对齐不同模态
在图像编辑任务中,结合FLUX.1-Kontext-Dev后,MetaCanvas在GEdit-Bench上的分数从6.00提升至7.67。视频生成方面,在保持VBench质量分数97.50的同时,语义分数达到7.91(基线6.61)。
3. 具身智能与基准测试新进展
3.1 DexWM:从人类视频学习的灵巧操作模型
Meta和NYU团队开发的DexWM世界模型,通过观看900小时人类和机器人视频,学会了预测手部动作对物体的影响。关键技术突破:
- 使用DINOv2编码器提取图像特征
- 将手部动作表示为3D关键点差异(双手各21个关键点)
- 引入手部一致性损失强化学习
在真实世界测试中,配备Allegro夹爪的Franka Panda机械臂实现了83%的抓取成功率(12次试验成功10次),且完全零样本(无任何真实世界训练数据)。
3.2 FrontierCS:开放性计算机科学基准
纽约大学谢赛宁团队等发布的FrontierCS基准包含156道开放性计算机科学问题,特点包括:
- 无已知最优解,但解决方案质量可客观评估
- 每道题配备专家参考解、自动评估器和基准实现
- 支持三种演化机制保持挑战性
实验结果凸显了当前AI的局限:Gemini 3.0 Pro在算法问题上的Score@1仅为29.37分,远低于人类专家的95.41分。模型常陷入"微观优化陷阱",生成可运行但未充分优化的代码。
4. 模型优化与系统创新
4.1 T5Gemma 2:轻量级编码器-解码器架构
Google DeepMind的T5Gemma 2是首个支持长上下文的多模态编码器-解码器模型家族,关键创新:
- 绑定词嵌入:减少10.5%参数量
- 合并注意力:节省6.5%参数
- UL2预训练目标:五种去噪任务混合训练
尽管仅在16K序列上预训练,模型在128K长度的RULER和MRCR基准中表现出色,平均得分57.1,显著超越Gemma 3的17.2分。
4.2 SonicMoE:细粒度混合专家训练加速
普林斯顿Tri Dao团队提出的SonicMoE通过三层优化实现了细粒度MoE模型的高效训练:
- 算法层:重构计算路径,激活内存减少45%
- 内核层:利用GPU异步能力,计算吞吐达理论上限88%
- 路由层:token rounding算法消除GEMM padding浪费
在7B参数模型上,64个H100 GPU达到213B tokens/day的训练吞吐量,与ScatterMoE在96个H100上的225B tokens/day相当,节省了1/3 GPU资源。
5. 音频-视觉联合生成突破
字节跳动的Seedance 1.5 pro是首个原生音视频联合生成的基础模型,特点包括:
- 双分支Diffusion Transformer架构同步处理视觉和听觉流
- 多阶段数据管理确保视频-音频连贯性
- 多维度奖励模型RLHF提升生成质量
在SeedVideoBench 1.5测试中,模型在指令遵循维度领先,并能生成细腻的面部表情和身体动作。音频方面,在中文语音生成上持续优于Veo 3.1,支持多种方言场景。
6. 图像压缩新范式:VLIC
斯坦福李飞飞团队与谷歌提出的VLIC方法,创新性地使用视觉-语言模型作为感知裁判:
- Gemini 2.5-Flash零样本复制人类视觉相似性判断,准确率83.80%
- Diffusion DPO直接利用VLM的二元偏好判断训练模型
- 在MS-COCO上人类Elo评分1112(0.21 bpp),优于HiFiC的900
这种方法标志着"利用基础模型通用能力"正成为替代"训练任务专用网络"的新范式。随着VLM能力提升,这类方法将自动受益而无需额外人类标注数据。
更多推荐


所有评论(0)