[Agent最新论文] 少即是多:78 条轨迹,让大模型学会“工作”
少即是多:78 条轨迹,让大模型学会“工作”
Not data abundance, but strategic curation of high-quality agentic demonstrations.
最近,一篇名为《LIMI: Less is More for Agency》的论文在 AI 社区引发热议。它用一个看似反直觉的结论,挑战了当前智能体训练的主流范式:
Using only 78 carefully designed training samples, LIMI achieves 73.5% on AgencyBench, dramatically outperforming state-of-the-art models… Most strikingly, LIMI demonstrates 53.7% improvement over models trained on 10,000 samples—achieving superior agentic intelligence with 128 times fewer samples.
仅用 78 条精心设计的专家工作轨迹,就能训练出在“自主性”(Agency)上大幅超越 SOTA 模型的 AI 智能体——这不仅是工程奇迹,更是一次范式跃迁:AI 正从“会思考”走向“会工作”。

什么是“Agency”?
论文开篇即给出明确定义:
We define “Agency” as the emergent capacity of AI systems to function as autonomous agents—actively discovering problems, formulating hypotheses, and executing solutions through self-directed engagement with environments and tools.
换句话说,Agency 不是被动回答问题,而是主动完成任务:
- 开发一个完整的五子棋游戏(含 UI、规则、AI 对战、回放)
- 执行科研流程:下载数据 → 调用 API → 分析结果 → 生成报告
- 构建并发聊天系统,支持登录、好友、消息持久化、多用户同步
这些任务需要 规划、工具调用、错误恢复、状态跟踪、人机协作——这正是“工作型 AI”的核心。
为什么“Less is More”?
当前主流假设是:more data yields better agency, following traditional scaling laws。
但 LIMI fundamentally challenges this paradigm,证明:自主性不靠数据量,而靠数据质。
关键在于 “trajectory”(轨迹)——不是简单的问答对,而是完整的工作日志,包含三要素循环:
- Model reasoning(推理):AI 的思考过程(“我先实现前端,再加 AI 逻辑”)
- Model tool calling(工具调用):执行代码、调 API、读写文件
- Environment observation(观察):工具返回结果、错误信息、用户反馈
一条轨迹平均长达 42.4k tokens,最长 152k tokens,相当于一次完整的“人机协作开发过程”。
💡 78 条轨迹 ≈ 330 万 tokens,远少于常规 SFT 数据集,但每一条都富含高阶自主性信号。
轨迹如何构建?
LIMI 的数据构建流程极具启发性:
-
Query 合成:
- 60 条来自真实开发者/研究员的协作场景
- 18 条从 GitHub 高星 PR 中用 GPT-5 合成(“systematic GitHub pull request-based query synthesis”)
-
轨迹采集:
- 4 名博士生与 GPT-5 在 SII CLI 环境中协作完成任务
- 全程记录 reasoning → tool → observation 的闭环交互
- 每条轨迹以“任务成功”为终点(“until successful completion is achieved”)
⚠️ 注意:GPT-5 仅用于生成高质量示范,最终模型是微调后的 GLM-4.5(开源),完全可复现。

为什么这能成功?
LIMI 的成功依赖三大前提:
-
任务可分解、可交互、可验证
每一步都有明确输入、动作、反馈(如“运行代码 → 报错 → 修正”) -
专家思考被显式外化
轨迹中包含“why”,而非仅“what”——这是隐性知识显性化的关键 -
基座模型足够强
微调的是 GLM-4.5(355B),具备理解复杂规划与工具语义的能力
✅ 这不是“用规则替代 AI”,而是“用高质量示范教会 AI 工作”。

这意味着什么?
如果 LIMI 范式可复制,将带来深远影响:
-
垂直领域智能体开发门槛大幅降低
金融、医疗、芯片、科研等领域,只需记录几十次专家工作轨迹,即可微调出专用智能体。 -
从“thinking AI”迈向“working AI”
企业不再需要海量标注数据,而是构建“可编程工作台” + “专家协作记录系统”。 -
AI 成为专家的“数字协作者”
专家专注高层判断,AI 执行认知体力劳动(写代码、跑实验、查文献)。
但也有边界
LIMI 并非万能:
- 不适合高度依赖隐性直觉的任务(如临床诊断、法律裁量)
- 需要结构化执行环境(如 CLI、Jupyter、自定义工具链)
- 任务必须能形成闭环反馈
它最适合“工具密集型、流程结构化、结果可验证”的知识工作场景。
结语:理解“Agency”的本质,比堆数据更重要
LIMI 提出了一个新原则:the Agency Efficiency Principle:
Machine autonomy emerges not from data abundance but from strategic curation of high-quality agentic demonstrations.
这不仅是技术突破,更是认知升级:AI 的未来不在“更多数据”,而在“更好示范”。
当每个专家都能轻松录制自己的“工作轨迹”,当每个企业都能用百条示范训练专属智能体——
“人人拥有工作型 AI”的时代,或许比我们想象的更近。
论文链接:arXiv:2509.17567
代码与数据:已开源(见论文)
基准测试:AgencyBench、SII CLI 均开放

Less is more—but only when what you give is the essence.
更多推荐



所有评论(0)