大数跨境

Claude Fable 5.1深夜空降!8项霸榜,缓存降价75%,奥尔特曼急了

Claude Fable 5.1深夜空降!8项霸榜,缓存降价75%,奥尔特曼急了 智东西
2026-09-02
2
导读:网友玩疯了,实测强过GPT-5.6 Sol。

实测性能超越 GPT-5.6 Sol,网友热议新模型表现。
作者 |  程茜
编辑 |  心缘

智东西 9 月 2 日消息,Anthropic 今日正式发布新一代旗舰模型Claude Fable 5.1 与 Claude Mythos 5.1。两款模型共享同一底座,主要区别在于安全护栏配置的不同。

Fable 5.1 在编程、知识工作及长周期任务场景中表现卓越。Anthropic 官方数据显示,该模型在全部 8 项基准测试中均位列第一,大幅领先 Fable 5、Opus 5 及 GPT-5.6 Sol。第三方机构 Artificial Analysis 发布的 AI 分析指数榜显示,Fable 5.1 以66 分位居榜首,高于 Claude Opus 5(63 分)、GPT-5.6 Sol(61 分)等竞品。

Fable 5.1 发布后不久,OpenAI CEO 萨姆·奥尔特曼在社交平台 X 上回应称,OpenAI 也将很快推出新产品,并强调此前公司专注于安全优先事项。

定价策略方面,得益于缓存读取资费下调 75%,Fable 5.1 综合成本较 Fable 5 降低25%;针对智能体类复杂任务,成本降幅最高可达45%

具体而言,Fable 5.1 的缓存读取成本降至每百万 Token 0.25 美元(约合人民币 1.68 元)。在常规业务负载下,成本节约约 25%;而在复杂代码开发及高智能体属性任务中,成本最高可节省 45%。

除缓存读取外,Fable 5.1 其他定价维持不变:输入 Token 为每百万 10 美元,输出 Token 为每百万 50 美元。

▲Claude Fable 5.1 价格详情(图源:Anthropic)

值得注意的是,尽管缓存资费大幅下调,但由于 Fable 5.1 输出 Token 消耗量约为前代的 1.7 倍,其单任务实际成本仍较 Fable 5 高出约20%

目前,Claude Fable 5.1 已正式上线,兼容 AWS、谷歌云及微软 Azure 平台。开发者可通过 Claude API 调用模型,模型标识符为 claude‑fable‑5‑1。

Anthropic 高级技术专家 Lance Martin 透露,在 CursorBench 3.2.0 测试中,低推理档位(low‑effort)的 Fable 5.1 性能与前代高版本相当,但成本仅为后者的三分之一。
此外,部分用户发现 Anthropic 在新模型发布后重置了其账户额度。

对比 GPT‑5.6 Sol 与 Kimi K3:生成效果更优,成本相对较高

社交媒体上,开发者纷纷分享 Fable 5.1 的实测案例,并将其与 GPT-5.6 Sol、Kimi K3 进行对比。
在一项 3D 场景生成测试中,开发者要求模型构建私人岛屿未来豪宅等复杂场景。结果显示,Fable 5.1 虽画面细节更丰富,但完成任务的成本是 GPT‑5.6 Sol 的6 倍
在游戏生成能力对比中,Fable 5.1 在用户界面流畅度及交互体验上优于 Kimi K3。成本方面,Kimi K3 为 11 美元,Fable 5.1 为 18 美元。
另有开发者利用 Fable 5.1 设计了房屋渲染图及动画,其光影反射效果逼真,引发网友热议。还有用户成功使用该模型开发了《马里奥卡丁车》游戏,对开发效率表示满意。

8 项测试全面霸榜,科研智能体性能显著提升

基准测试显示,Fable 5.1 在低或中等难度设置下,不仅能达到甚至超越 Fable 5 的效果,且成本更具优势。

▲主动性科学研究、终端编程、跨学科思维及自主编程测试结果

Fable 5.1 在全部 8 项基准测试中排名第一,特别是在科学研究和业务工作流等“长程智能体”测试中,与其他模型拉开显著差距。
在 Terminal-Bench-Science 科学研究智能体测试中,Fable 5.1 得分高达 52.6%,远超其他三款得分在 22%–29% 之间的模型。

此外,Fable 5.1 具备精准定位软件问题根源的能力。投资机构 Millennium 测试显示,该模型成功找出了一处困扰工程师数年、其他大模型未能解决的罕见系统崩溃故障。


Mythos 5.1 专注科研领域,助力分子设计与行星测绘

Anthropic 展示了 Mythos 5.1 在多个科研场景中的应用成果。

分子设计:结合开源蛋白质设计工具,Mythos 5.1 设计的结合剂亲和力显著优于行业水平。针对 3 个靶点,其效果比竞赛最佳成果高出 10 倍;在 12 个靶点测试中,整体命中率近 50%,远超行业常规的 10‑15%。

计算分析与建模:基于 NASA 麦哲伦探测器数据,Claude Fable 5.1 生成了覆盖金星 1/3 地表的高分辨率高程图,分辨率从 10‑20 公里提升至 2‑3 公里,测高精度最高提升 25%。

计算生物学:通过自动编写定制 GPU 算子并缓存中间结果,Mythos 5.1 使七套开源深度学习模型的性能最高提升 2.5 倍,有效突破了运算速度瓶颈。


沿用严格安全管控,推出零数据留存企业策略

Mythos 5.1 延续了前代对生物研究能力的访问限制。测试表明,其在恶意编程及操作请求上的拒绝率与前代持平,且在多数对齐指标上表现更优。

针对企业客户,Anthropic 推出了全新企业安全防护体系(EFS),实现零数据留存,数据将完全存储于客户管控的云设施中。该功能将于今年秋末分阶段上线。

安全机制方面,新版策略误报率下降 60%。Anthropic 还将联合美国政府启动专项计划,通过以下两个可信通道开放高阶能力:

生命科学验证计划(LSVP):面向生命科学研究人员,在保持安全防护的前提下启用专业研发策略。

网络安全验证计划(CVP):面向防御性安全研究,放宽相关防护限制,近期将纳入 Mythos 系列模型。

合规方面,为满足《欧盟人工智能法案》要求,8 月 2 日后发布的模型输出将添加水印。该水印不影响内容质量,也不包含用户隐私信息。


结语:赋予开发者更多成本与能力的选择权

Fable 5.1 虽在各项测试中领跑,但因输出 Token 消耗增加,若无缓存优惠,单任务成本反而上升。不过,通过下调缓存资费和引入多档位推理,Anthropic 将成本与能力的权衡权交给了开发者。
这表明,对于 Agent 及自动化工作流,Token 单价已非唯一成本标尺,真实单任务开销、缓存命中率及推理档位调优变得更为关键。
来源:Anthropic

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11802
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读221.3k
粉丝0
内容11.8k