Claude Fable 5.1 深夜上线:跑分断层第一,缓存读取降价75%,还用30年前的数据给金星画了张新地图

今天凌晨,Anthropic 一口气发布了两款新模型:Claude Fable 5.1 和 Claude Mythos 5.1。

同一个底层模型,区别只在护栏松紧。Fable 5.1 面向所有用户,claude.ai、Claude Code、API 以及 AWS、Google Cloud、Azure 今天已经全部可用,API 模型名是 claude-fable-5-1;Mythos 5.1 则只对通过审核的网络安全和生命科学机构开放,护栏更松,目前仅限美国机构,普通用户暂时接触不到。

Fable 5.1 发布

价格最高降 45%,基准测试成绩断层式领先,直接把 Fable 5、Opus 5 和 GPT-5.6 Sol 甩开一截。但真正让我停下来的,是发布页拉到底部时一张金星的图——这个放到最后说。

跑分:不是涨几个点,是翻倍

跑分大家都看麻了,这次只挑几个有代表性的数字。

Terminal-Bench-Science 0.1(终端环境下的科研任务能力):Fable 5 是 24.7%,Fable 5.1 直接到 52.6%,翻了一倍还多。同一张表上,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。

Terminal-Bench-Science 对比

Terminal-Bench 4.0(真实终端写代码):Fable 5.1 拿到 55.8%,上一代是 42.0%,GPT-5.6 Sol 为 37.3%。护栏更松的 Mythos 5.1 跑到了 60.9%。

Terminal-Bench 4.0 对比

其余项目不再逐个念:GDPval-AA v2(模拟白领工作)1853 分,OSWorld 2.0(电脑操作)、Humanity’s Last Exam、AutomationBench(业务流程)、CursorBench 3.2.0——表上列出的项目,Fable 5.1 全部第一。

但有两个细节比分数本身更值得注意。

第一,官方明确表示:Fable 5.1 开到低档或中档推理强度,效果就已经和 Fable 5 开高档差不多,成本还低很多。Claude Code 默认高档,claude.ai 和 Cowork 默认中档——换句话说,你在网页端随手用的中档 Fable 5.1,体验约等于上一代拉满在跑。

第二,藏在表格脚注里:这次所有跑分都是开着生产环境护栏测的。护栏拦下的题目,OSWorld 直接算零分,网络安全类题目转交 Opus 4.8 完成,生物类转交 Opus 5。官方自己承认,这大概率拉低了 Fable 5.1 的分数。

价格:输入输出没动,缓存读取暴降75%

输入输出价格维持不变:每百万 token 输入 10 美元、输出 50 美元,和 Fable 5 持平。真正大降的是缓存读取价格,下调 75%,现在每百万 token 只要 0.25 美元

成本对比

解释一下为什么这个数字对 agent 场景意义重大。

你让一个 agent 改代码库,它不是看一遍就完事——每走一步,都要回头把整个代码库、历史对话、工具返回结果重新读一遍。这些内容已经处理过、存着,再次读取就叫缓存读取。agent 任务里绝大部分 token,恰恰花在这种反复读取上。

官方拿八月份四周的真实使用量测算:典型工作负载整体成本比 Fable 5 低 25% 左右;上下文超长、工具调用频繁的重度 agent 任务,最多能省 45%。

实际体验层面,早期用户的反馈也相当夸张。MongoDB 的工程师让它做一个复杂原型:它先把相关服务的代码和文档全部翻了一遍,给出可扩展的设计,然后带着验证循环连续跑了几个小时自行实现。整个项目大约三天,工程师的原话是"每天早上醒来,下一个阶段已经做完了,还附了完整的可视化说明和成功证据"。社区里还有人用它几小时复刻出 ARC Survival 风格游戏、生成马里奥赛车游戏、用代码直接产出室内设计视频效果,游戏开发能力的提升尤其明显。

科研:这次最硬核的部分

发布里最让人兴奋的不是游戏和 demo,而是科研领域的两个突破。

GPU 内核优化。 计算生物学经常要跑各种专用深度学习模型,GPU 速度就是科研进度的瓶颈。Mythos 5.1 给 ChromBPNet、Enformer、Evo 2 等七个开源蛋白质和基因组模型编写了定制 GPU 内核,缓存中间结果,最快提速 2.5 倍,输出完全一致。

GPU 内核提速

2.5 倍听着不算惊天动地,但背后的含义很现实:一个普通高校生物实验室的博三学生,要测试每个人类基因附近所有可能的突变,这类分析要跑成千上万次模型。学术圈雇不起性能工程师团队花几周优化代码,这种优化过去基本是奢侈品。现在 GPU 成本能省 30% 到 60%——省下来的钱,可能就是毕业前能不能多跑一轮实验的区别。Anthropic 表示这些优化很快会开源。

蛋白质设计。 很多药物的原理是与体内靶点结合,亲和力越高,所需剂量越低,所以设计高亲和力结合蛋白是药物研发的第一步。Anthropic 让 Mythos 5.1 用开源蛋白质设计和折叠工具完成设计,再送到两家外部机构做实验验证。结果:三个靶点上,设计方案的结合亲和力达到 Adaptyv Bio 蛋白质设计竞赛最佳方案的 10 倍;12 个靶点总命中率接近 50%,而行业典型水平只有 10% 到 15%。

蛋白质设计实验结果

注意,这不是模拟跑分,是送进实验室真实验证过的数据。

最后,金星

发布页最底部有一张图,让我盯着看了很久。

Fable 5.1 用 NASA 麦哲伦号三十多年前拍摄的雷达图像,加上一张仅覆盖金星五分之一表面的现有地图,训练了一个神经网络,给金星三分之一的表面绘制了全新的高程图。旧地图只能分辨 10 到 20 公里尺度的地貌,新地图能看清 2 到 3 公里,高度精度最多提升 25%。

金星新高程图

这张地图将以 CC 协议开源,留给 NASA 的 VERITAS 和欧空局的 EnVision——两个即将前往金星的探测任务,帮它们锁定该重点考察的地质特征。

麦哲伦号 1989 年发射,1990 年抵达金星,用雷达扫完了整个金星表面。1994 年任务结束时,它被指令主动坠入金星大气层烧毁。而那些雷达数据,在硬盘里躺了三十多年。

三十多年。造它的那批工程师,很多人早已退休。他们当年不会想到,这些数据有朝一日会被一个 2026 年的语言模型重新翻出来,读出新的细节,画成一张更清楚的地图,交给下一批奔赴金星的探测器。

人类攒了三十年的数据,从此多了一双新的眼睛。


本文基于 Anthropic 官方发布信息及公开报道整理改写。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐