这是我的第491篇Ai笔记,本篇3165、累计笔记8475573
彩蛋:文末给大家准备了一份《Claude Fable 5.1 高价值场景实战手册》,不讲基础操作,直接告诉你哪些任务最值得交给它,以及长任务、复杂代码、Agent 场景到底应该怎么用。
今天早上,Anthropic 又更新了。
Claude Fable 5.1 正式发布,同时亮相的还有 Claude Mythos 5.1。Fable 5.1 已经向普通用户和企业开放,并登陆 Claude、Claude Code、API,以及 AWS、Google Cloud、Microsoft Azure 等平台;Mythos 5.1 则继续采用审核制,主要提供给特定的网络安全和生命科学团队。
单看成绩单,这次确实很猛。科研任务 Terminal-Bench-Science 0.1,Fable 5.1 做到了 52.6%,上一代 Fable 5 是 24.7%;代码工程 Terminal-Bench 4.0 则从 42.0% 提升到了 55.8%,Mythos 5.1 更进一步冲到了 60.9%。
价格也有变化,不过得先说准确一点:Fable 5.1 没有直接降低 API 基础价格。 输入依然是每百万 Token 10 美元,输出 50 美元,真正大砍的是 Cache Read,也就是缓存读取,从 1 美元降到了 0.25 美元,降幅 75%。Anthropic 估算,普通任务整体成本约下降 25%,重度 Agent 任务最高能省约 45%。
很强,也确实更省钱了。但看完这次更新,我更在意另一件事:
Fable 5.1 正在把 AI 从“给你答案”,继续推向“把一件复杂工作接过去,自己干几个小时甚至更久”。
这就有意思了。
过去我们说一个模型“很聪明”,大部分时候测的还是单次能力:给它一个问题,它回答得好不好;给它一段代码,它能不能写对;给它一份资料,它能不能分析出来。
但真正把 AI 放进工作里以后,更难的是一件任务跑了几个小时,它还能不能记住目标。工具报错了会不会自己定位,前面的判断错了能不能重新规划,改完代码以后会不会主动测试,测试挂了还能不能接着追。
这才是 Agent 真正难的地方。
而 Fable 5.1 这次明显强化的,正是这种长链路工作能力:读取文档、理解任务、执行修改、运行测试、检查结果,发现问题以后继续下一轮。
从 Anthropic 和企业用户公开的案例来看,它已经开始能够连续数小时甚至更久自主运行,中间自己记录进度、处理异常、调整优先级。
所以我觉得这次真正值得盯住的变化,是 AI 的使用方式正在变。
以前我们一直在训练人“怎么跟 AI 聊”,接下来越来越像是:你把任务交出去,然后回来验收。
跑分先放一边,咱们直接看三个更实际的变化。
01|Claude 开始真的能“放在那里自己干”
Anthropic 这次放出的企业案例里,有一个很有代表性。投资机构 Millennium 内部有一个程序 Bug,大约运行 100 万次才会崩一次,公司工程师查了四五年,包括 Fable 5 在内的其他模型也没定位到。
Fable 5.1 最后直接反汇编第三方供应商代码,再结合 Core Dump 一路排查,最终把问题定位到了外部代码库。
真正厉害的地方,不只是“会 Debug”。这种问题要求模型持续完成读代码、建立假设、排查、换方向、调工具和验证结果,中间任何一步跑偏,整个任务都可能废掉。
另一个案例来自 Ramp。在一个机器学习任务中,Fable 5.1 连续自主运行了 38 个小时,先发现此前实验存在标签问题,修正后并行启动 6 组实验,跑了一整夜,之后继续分析结果并提出下一步建议。
MongoDB 的工程师也让它基于内部代码和文档完成跨服务研究,再连续运行数小时完成原型开发和验证;Shopify 则提到,新版本在长时间无人值守任务中更容易保持上下文,并根据条件变化重新调整优先级。
所以以后评价 Claude Code 这类产品,真正该问的可能已经不是“代码一次写对率有多高”。
而是:我敢不敢晚上把任务扔给它,第二天早上回来收结果?
这两个问题,完全不是一个级别。
02|缓存降价75%,真正便宜的是“长时间干活”
第二个变化看起来只是价格调整,我反而觉得很关键。Fable 5.1 的输入和输出价格没变:每百万 Token 10 美元和 50 美元,但缓存读取从 1 美元直接砍到了 0.25 美元。
为什么偏偏砍这个?因为 Agent 太吃上下文了。
普通聊天任务问完就结束,但一个跑几小时的 Agent,会不断重新读取项目文件、历史记录、工具结果和任务状态。时间越长,Cache Read 的成本就越明显。
所以 Anthropic 给出的估算是:典型工作负载整体成本下降约 25%;大量读取历史上下文、频繁调用工具的 Agent 任务,最高能下降约 45%。
Cognition 联合创始人 Walden Yan 也表示,Fable 5.1 在测试中达到或超过 Fable 5 的水平,同时单任务成本更低,因此准备把 Devin 的部分 Opus 5 流量迁过去。
所以这次降价瞄得很准:就是让 Fable 5.1 更适合一直干活。
模型能坚持跑很久是一回事,跑得起,才有商业价值。
03|同一个大脑,开始按“权限”卖给不同的人
第三个变化,很容易被跑分盖过去。Fable 5.1 和 Mythos 5.1,按照 Anthropic 的说法采用的是同一个模型,真正不同的是安全权限。
普通用户和企业使用 Fable 5.1;经过审核的机构,则可以通过 Mythos 5.1 获得更宽松的网络安全和生命科学能力。比如 Fable 5.1 现在已经允许开发者进行防御性质的软件漏洞分析,但渗透测试、Exploit 生成以及部分高风险任务依然会受到限制。
这个设计挺有意思。以前大家习惯的是能力强的模型卖贵一点,能力弱的卖便宜一点;Anthropic 现在又加了一层:模型可以一样强,但不同用户能调用的能力范围不同。
以后企业采购 AI,可能不能只问一句“这个模型有多强”。
还得问:这些能力,我到底拿得到多少?
夸了这么多,该泼的冷水还是得泼。
第一,依然很贵。 缓存虽然降了 75%,但基础 API 价格没动。第三方测试中,同样生成五个连续 Three.js 场景,Fable 5.1 花了 5.69 美元,GPT-5.6 Sol 只有 0.88 美元,所以它依然属于“性能猛,油耗也不低”的那一档。
第二,无人值守还不等于完全放心。 长任务跑得越久,错误累积的机会越多,所以代码测试、数据校验、关键权限和最终人工验收依然不能省。
第三,开发者还得留意反蒸馏限制。 新 API 账户对历史上下文和思考记录的修改被进一步收紧,一些依赖修改历史消息或动态调整上下文的 Agent 集成方式,升级前最好先做兼容性测试。
最后,老规矩,用三句话总结今天这次 Fable 5.1:
1. Fable 5.1 最大的变化,已经不只是模型更聪明,而是它开始能够连续数小时甚至更久接管一整段复杂工作,长周期 Agent 正在变得更实用。
2. 它的基础价格依然很高,长任务可靠性也还需要验证,但缓存读取降价75%,确实降低了长时间 Agent 的使用成本。
3. 对普通人来说,不需要什么任务都硬上 Fable 5.1;真正该关注的,是 AI 的使用方式正在从“我问一句,你答一句”,慢慢变成“这件事交给你,干完回来告诉我”。
这个变化,比榜单上多几个百分点重要得多。
Fable 5.1 真正有价值的地方,是把那些耗时长、步骤多、需要自己查资料、调工具、反复修改和验证的任务交给它。所以这次我给大家整理了一份 《Claude Fable 5.1 高价值场景实战手册》。
里面不讲基础操作,直接整理了最值得使用 Fable 5.1 的任务场景、长周期 Agent 提示词模板、复杂代码任务模板、无人值守执行方法、成本控制技巧和结果验收清单。简单说,就是告诉你:什么活值得交给它,以及怎么交,才能真正把这台“贵但能干”的模型用值。
点赞+在看,回复关键词【51】即可领取。

