少即是多:78 条轨迹,让大模型学会“工作”

Not data abundance, but strategic curation of high-quality agentic demonstrations.

最近,一篇名为《LIMI: Less is More for Agency》的论文在 AI 社区引发热议。它用一个看似反直觉的结论,挑战了当前智能体训练的主流范式:

Using only 78 carefully designed training samples, LIMI achieves 73.5% on AgencyBench, dramatically outperforming state-of-the-art models… Most strikingly, LIMI demonstrates 53.7% improvement over models trained on 10,000 samples—achieving superior agentic intelligence with 128 times fewer samples.

仅用 78 条精心设计的专家工作轨迹,就能训练出在“自主性”(Agency)上大幅超越 SOTA 模型的 AI 智能体——这不仅是工程奇迹,更是一次范式跃迁:AI 正从“会思考”走向“会工作”

在这里插入图片描述


什么是“Agency”?

论文开篇即给出明确定义:

We define “Agency” as the emergent capacity of AI systems to function as autonomous agents—actively discovering problems, formulating hypotheses, and executing solutions through self-directed engagement with environments and tools.

换句话说,Agency 不是被动回答问题,而是主动完成任务

  • 开发一个完整的五子棋游戏(含 UI、规则、AI 对战、回放)
  • 执行科研流程:下载数据 → 调用 API → 分析结果 → 生成报告
  • 构建并发聊天系统,支持登录、好友、消息持久化、多用户同步

这些任务需要 规划、工具调用、错误恢复、状态跟踪、人机协作——这正是“工作型 AI”的核心。


为什么“Less is More”?

当前主流假设是:more data yields better agency, following traditional scaling laws
但 LIMI fundamentally challenges this paradigm,证明:自主性不靠数据量,而靠数据质

关键在于 “trajectory”(轨迹)——不是简单的问答对,而是完整的工作日志,包含三要素循环:

  1. Model reasoning(推理):AI 的思考过程(“我先实现前端,再加 AI 逻辑”)
  2. Model tool calling(工具调用):执行代码、调 API、读写文件
  3. Environment observation(观察):工具返回结果、错误信息、用户反馈

一条轨迹平均长达 42.4k tokens,最长 152k tokens,相当于一次完整的“人机协作开发过程”。

💡 78 条轨迹 ≈ 330 万 tokens,远少于常规 SFT 数据集,但每一条都富含高阶自主性信号。


轨迹如何构建?

LIMI 的数据构建流程极具启发性:

  1. Query 合成

    • 60 条来自真实开发者/研究员的协作场景
    • 18 条从 GitHub 高星 PR 中用 GPT-5 合成(“systematic GitHub pull request-based query synthesis”)
  2. 轨迹采集

    • 4 名博士生与 GPT-5 在 SII CLI 环境中协作完成任务
    • 全程记录 reasoning → tool → observation 的闭环交互
    • 每条轨迹以“任务成功”为终点(“until successful completion is achieved”)

⚠️ 注意:GPT-5 仅用于生成高质量示范最终模型是微调后的 GLM-4.5(开源),完全可复现。

在这里插入图片描述


为什么这能成功?

LIMI 的成功依赖三大前提:

  1. 任务可分解、可交互、可验证
    每一步都有明确输入、动作、反馈(如“运行代码 → 报错 → 修正”)

  2. 专家思考被显式外化
    轨迹中包含“why”,而非仅“what”——这是隐性知识显性化的关键

  3. 基座模型足够强
    微调的是 GLM-4.5(355B),具备理解复杂规划与工具语义的能力

这不是“用规则替代 AI”,而是“用高质量示范教会 AI 工作”

在这里插入图片描述


这意味着什么?

如果 LIMI 范式可复制,将带来深远影响:

  • 垂直领域智能体开发门槛大幅降低
    金融、医疗、芯片、科研等领域,只需记录几十次专家工作轨迹,即可微调出专用智能体。

  • 从“thinking AI”迈向“working AI”
    企业不再需要海量标注数据,而是构建“可编程工作台” + “专家协作记录系统”。

  • AI 成为专家的“数字协作者”
    专家专注高层判断,AI 执行认知体力劳动(写代码、跑实验、查文献)。


但也有边界

LIMI 并非万能:

  • 不适合高度依赖隐性直觉的任务(如临床诊断、法律裁量)
  • 需要结构化执行环境(如 CLI、Jupyter、自定义工具链)
  • 任务必须能形成闭环反馈

它最适合“工具密集型、流程结构化、结果可验证”的知识工作场景


结语:理解“Agency”的本质,比堆数据更重要

LIMI 提出了一个新原则:the Agency Efficiency Principle

Machine autonomy emerges not from data abundance but from strategic curation of high-quality agentic demonstrations.

这不仅是技术突破,更是认知升级:AI 的未来不在“更多数据”,而在“更好示范”

当每个专家都能轻松录制自己的“工作轨迹”,当每个企业都能用百条示范训练专属智能体——
“人人拥有工作型 AI”的时代,或许比我们想象的更近


论文链接arXiv:2509.17567
代码与数据:已开源(见论文)
基准测试:AgencyBench、SII CLI 均开放

在这里插入图片描述

Less is more—but only when what you give is the essence.


Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐