Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

工具4天前更新 小智
64 0

三个月前,Anthropic发布Fable 5时,试图回答一个问题:当模型需要连续工作数小时甚至数天,它能否一直记住目标、调用工具、检查结果,并在无人监督的情况下把任务做完?

现在,Anthropic带着Fable 5.1回来了。

Fable 5.1 和 Mythos 5.1 正式发布

当地时间9月1日,Anthropic 正式发布 Claude Fable 5.1 和 Claude Mythos 5.1。

按照官方定义,两者使用相同的底层模型,区别不在“智力”,而在安全保护级别:Fable 5.1 面向普通用户和企业全面开放,Mythos 5.1 则只通过受信任访问计划,向部分网络安全和生命科学机构提供。

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

从版本号看,这只是一次“.1”升级。但从实际变化看,Anthropic显然不只是在修补 Fable 5。新模型在智能体科学研究测试中的成绩超过前代两倍,在编程、知识工作、电脑操作和长时间任务中全面提升;与此同时,Agent工作负载的实际调用成本最高下降约 45%。

更重要的是,Anthropic这一次没有只谈模型跑分。价格、缓存、数据留存、安全误判、漏洞研究权限和企业部署架构,几乎占据了发布内容的一半。

Fable 5.1 和 Mythos 5.1 之间的关系,是理解这次发布的第一把钥匙,它们是同一个模型的两种部署形式。

Fable 5.1 加入了面向公众和企业环境的网络安全、生物安全保护机制。当请求触发风险规则时,一部分任务会被阻止,另一部分则会被路由到能力相对较弱的 Opus 模型。Mythos 5.1 则保留了更多原始能力,但只能由经过审核的机构访问。

换句话说,Anthropic正在尝试将“模型能力”和“模型开放程度”拆开管理:不再为了降低风险,直接削弱整个模型,而是根据用户身份、任务类型和使用环境,提供不同层级的能力。

核心亮点是啥?

那这两款“神级”模型,亮点是什么?

事实上,Fable 5.1 的核心变化,可以概括为:能力上限更高、缓存读取更便宜,但把推理强度拉满,完成一次任务仍可能比前代更贵。

在Terminal-Bench 4.0上,Fable 5.1 得分为55.8%,而关闭部分限制的 Mythos 5.1达到60.9%。两者的能力差距,很大程度上并不是底层模型造成的,而是 Fable 的安全系统在部分网络安全任务中介入的结果。

在Anthropic公布的几组数据中,变化最显著的是智能体科学研究。

在Terminal-Bench-Science 0.1上,Fable 5.1取得52.6%的成绩,Fable 5只有24.7%,Opus 5为29.0%,GPT-5.6 Sol为22.4%。相较前代,Fable 5.1的成绩不只是小幅提高,而是达到原来的两倍以上。

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

Terminal-Bench-Science 0.1:每个模型的标准误差为±3.5–4.5分。公开排行榜(每个任务3次试验,使用Claude Code框架)显示Claude Opus 5的准确率为30.0%,Claude Fable 5的准确率为21.4%;我们的实验设置分别复现了这两个结果,准确率分别为29.0%和24.7%,均在噪声范围内。

这些数字表明,Fable 5.1的提升并不局限于代码生成。它在操作电脑、跨领域推理、研究任务和知识工作中,均超过了前代,也在多数官方测试中超过成本更低的Opus 5。

知识工作的成绩同样登顶,但 与Opus 5的差距并不明显。Fable 5.1 在 GDPval-AA v2 和 AA-Briefcase中的Elo评分分别达到1853和1694,较前代提高130分和122分。

不过,它在前者相对Opus 5的领先仍处于置信区间内,后者则与Opus 5的1685分基本持平。具体来看,它的优势主要集中在分析质量和评分标准符合度,呈现效果并未同步领先。

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

价格调整则主要针对Agent反复读取上下文的成本。Fable 5.1的缓存读取价格从每百万Token 1美元降至0.25美元,降幅75%;标准输入、输出价格仍为每百万Token 10美元和50美元,缓存写入价格维持12.5美元。上下文窗口保持100万Token,支持文本和图像输入。

但缓存降价,并不意味着所有任务都更省钱。在最高推理强度下,Fable 5.1完成一项智能指数测试任务平均花费3.76美元,比Fable 5高出约20%,原因是输出Token用量约为前代的1.7倍。即便缓存降价已为每项任务节省约1.40美元,也没有完全抵消输出增加带来的费用。

降低推理强度后,性价比会有所改善:xhigh 档位的智能指数为65分,单项任务成本降至2.72美元,但仍高于Opus 5最高档位的2.34美元,后者得分为63分。Fable 5.1同时占据了智能水平与输出Token效率的高端帕累托前沿,意味着它在高能力区间更有效率,但这不等于美元成本最低。

这次升级的价值由此变得清晰:Fable 5.1抬高了复杂任务的能力上限,却没有消除能力、推理用量与成本之间的取舍。对于开发者,真正需要判断的仍是,多花的钱,能否换来原本做不成的任务。

不再满足于“修代码”,而是追查根因

Anthropic在发布材料中反复强调,Fable 5.1会减少看似快捷、实际降低质量的“走捷径”行为,更倾向于寻找问题的根本原因。

投资机构Millennium提供了一个颇具代表性的案例。

该机构的一段内部代码存在一个约百万次运行才出现一次的崩溃问题。工程师花了四五年时间,也没有解释清楚原因,包括Fable 5在内的其他模型同样未能解决。

下图是 Fable 5.1 在各项基准测试中的对比情况:

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

Fable 5.1 在启用其生产安全防护措施的情况下进行了评估。在这些安全防护措施介入的任务中,Fable 5.1 和 Fable 5 在 OSWorld 2.0 测试中得分均为零,Fable 5 在 AutomationBench 测试中得分也为零。在所有其他安全防护措施介入的情况下,网络安全任务由 Claude Opus 4.8 完成,生物学任务由 Claude Opus 5 完成。这很可能导致 Fable 5.1 和 Fable 5 在这些基准测试中的性能下降。

Fable 5.1分析了外部供应商提供的程序库,将反汇编结果与核心转储文件进行比对,最终把问题定位到该外部程序库中的一个缺陷。

这个案例当然来自Anthropic的早期合作伙伴,不能代替独立测试,但它说明了Fable 5.1试图建立的差异:不是更快地生成更多代码,而是能否像高级工程师一样,在复杂系统中逐层排除假设,最终找到真正的故障来源。

外部代码评审平台 CodeRabbit 的测试提供了相对冷静的观察。

在45项评审任务、105个已知问题点上,Fable 5.1找出了 64个,Fable 5找出 65个,两者召回率几乎没有变化。但Fable 5.1 最终生成的评论从 253 条减少到 166 条,琐碎意见从 265 条降至 79 条,精确率则由 32.8% 升至 37.3%。

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

也就是说,它没有发现更多问题,却减少了大量无效和挑剔式评论,输出变得更克制。

代价是速度。Fable 5.1完成一次评审平均需要18分38秒,Fable 5为12分32秒,耗时增加接近49%。而且在这组测试中,提高推理强度并未带来更好结果:High模式比Low模式更慢,召回率反而更低。

这意味着Fable 5.1并不是适用于所有编程任务的默认选择。对于日常、小规模的Pull Request,它可能过于昂贵和缓慢;但面对跨越多个文件、需要理解整个代码库的复杂任务时,更长的分析过程才可能体现价值。

单价没有下降,Agent为什么能便宜45%?

Fable 5.1的标准API价格并没有变化,仍为每百万输入Token 10美元、每百万输出Token 50美元。

真正发生大幅调整的是提示缓存读取价格:从每百万Token 1美元下降至0.25美元,降幅达到75%。

Anthropic估算,普通工作负载的综合成本将比Fable 5低约25%;对于高度Agent化的任务,成本降幅最高约45%。

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

一个长时间工作的编程Agent,可能反复读取同一套代码、系统提示、工具定义、项目规范和任务历史。如果每一次工具调用都重新按照标准输入价格计算,任务运行得越久,重复上下文带来的成本就越高。

提示缓存则允许系统保存已经处理过的上下文,后续只支付较低的读取费用。对于需要调用工具数十次、连续工作数小时的Agent而言,缓存读取可能占据输入量的大部分。

因此,Fable 5.1此次价格调整并不是普遍降价,而是针对Agent工作负载进行的定向改造。

这也解释了为什么 Cognition 决定在 Devin 中,将部分原本交给Opus 5的流量迁移至Fable 5.1。此前,Fable级模型虽然能力更高,但很难在代码评审等高频任务中证明经济性;缓存降价后,企业衡量的已经不再是单个Token的价格,而是完成一次任务所需的总成本。

模型竞争由此开始从“每百万Token多少钱”,转向“完成一个合格任务多少钱”。

真正的大招,可能不是编程,而是科学研究

如果只看 Claude Code,Fable 5.1 很容易被理解成又一次编程模型升级。但 Anthropic 在这次发布中用了相当大的篇幅展示科学研究能力。

在分子设计实验中,Anthropic 让 Mythos 5.1 调用开源蛋白质设计和折叠工具,生成蛋白质结合剂,再将结果交给两家外部机构进行实验验证。

官方数据显示,在三个靶点上,Mythos 5.1设计的结合剂亲和力,比Adaptyv Bio蛋白质设计竞赛中的最佳方案高出10倍;在12个靶点上的有效结合剂命中率接近50%,而Anthropic给出的行业典型水平为10%至15%。

在另一个项目中,Fable 5.1使用30多年前NASA麦哲伦号探测器采集的雷达数据,训练神经网络,重新绘制了约三分之一金星表面的高分辨率高程图。

此前的地图只能呈现约10至20公里尺度的细节,新地图将分辨能力提高至2至3公里,并将高程测量准确度提高最多25%。Anthropic已经以Creative Commons许可公开这份地图,希望它能为NASA VERITAS和欧洲航天局EnVision任务选择观测目标提供参考。

Mythos 5.1还为七个开源蛋白质和基因组深度学习模型编写了定制GPU Kernel,并缓存中间结果,在保持输出完全相同的情况下,将推理速度最高提高2.5倍。在部分全基因组分析任务中,预计可减少30%至60%的GPU成本。

这些案例与普通问答最大的不同,是模型的输出已经离开文本环境,开始接受真实世界验证:蛋白质必须在实验室中真正结合,GPU Kernel必须产生完全一致的结果,金星地图也需要与现有观测资料交叉验证。

当然,这距离“AI独立完成科学发现”还有很远。模型使用的是人类提供的开源工具、数据、评价方法和实验验证体系,最终结论仍需要科学家审核。

但角色变化已经很明显:模型不再只负责搜索论文和总结知识,而是开始进入“提出方案—调用工具—运行计算—生成候选结果—接受实验验证”的研究闭环。

Claude Fable 5.1 正式发布:Anthropic 把 AI 再次推向“长周期 Agent”时代

数据到底留不留?Anthropic换了一种解法

Fable 5此前默认要求保留30天使用数据,以便Anthropic跨时间、跨账号识别模型滥用。这项政策对安全监测有帮助,却成为金融、医疗、法律等受监管行业采用模型的障碍。

Fable 5.1同时推出Enterprise Frontier Safeguards,试图在安全监测和零数据留存之间找到折中方案。

在这一架构下,日志保存在客户自己的AWS、Azure或Google Cloud环境中,使用客户管理的密钥、访问策略和审计系统。Anthropic提供自动化风险检测,但风险标记直接交给客户,默认不需要Anthropic员工进行人工查看。

从技术上说,数据仍然被保留一段时间,以便识别跨会话、跨账号发生的异常行为;但数据的实际控制权和人工审查权留在企业手中。

Anthropic称,这套系统与100多家企业共同设计,参与者覆盖金融、医疗、制造、通信、法律、零售和公共部门,并包括多家美国系统重要性银行。

这可能是Fable 5.1比跑分更具现实意义的一项变化。

当Agent只能回答问题时,30天数据留存或许只是隐私条款中的一行文字;当Agent开始接触代码仓库、财务资料、客户信息和生产系统凭证时,数据存放在哪里、谁能查看、如何审计,就会直接决定模型能否部署。

Fable 5.1真正争夺的是“高价值任务”

Fable 5.1 并没有试图成为最便宜、最快的通用模型。

每百万输出Token 50美元的定价,决定了它很难被用于大量低价值问答。CodeRabbit的测试也说明,它在复杂任务上愿意花更长时间,并不适合作为所有代码评审的默认模型。

Anthropic争夺的是另一类市场:一次任务可能运行数小时,涉及多个应用、文件和工具,人工完成需要数天甚至数周,但任务本身又足够昂贵,能够覆盖模型费用。

软件故障根因分析、复杂合同修改、金融研究、跨代码库重构、科研计算和长时间浏览器操作,都属于这一范围。

因此,Fable 5.1最重要的变化,是 Anthropic 正在同时补齐三块长期被忽视的基础设施:让缓存价格适合长任务,让安全系统减少误伤,让敏感数据留在客户控制的环境中。

这是一场从“模型能力”走向“模型可部署性”的竞争。

© 版权声明

相关文章

暂无评论

none
暂无评论...