大数跨境

Claude Fable 5.1发布!8项屠榜,这3个能力绝了

Claude Fable 5.1发布!8项屠榜,这3个能力绝了 刀哥聊AI
2026-09-02
3
导读:科学能力超Fable 5一倍,长程任务超强,可以做房屋3D设计,做涂鸦军团游戏,一张图完成马里奥赛车,写万字小说。。。

DAO GE TALKS AI • PREMIUM TECH REPORT

Claude Fable 5.1发布!世界上最先进的编码和知识工作模型?

来自:刀哥聊AI  |  发布于 2026年9月2日  |  深度硬核解构

各位刀友,我是刀哥!


Claude官微凌晨宣布,推出 Claude Fable 5.1 和 Claude Mythos 5.1 版本。宣称它们是目前世界上最先进的编码和知识工作模型。


(Fable 5.1宣传片)


那么,到底Fable 5.1强在哪里?价格怎么样?值不值得用,一文带你看懂。    



能力分析

首先,各项能力增强,科研能力比Fable 5强一倍!

Benchmark table comparing Claude Fable 5.1 with Fable 5, Opus 5, and GPT-5.6 Sol across seven evaluations. Fable 5.1 leads on every row, including 52.6% on Terminal-Bench-Science 0.1 and 55.8% on Terminal-Bench 4.0.

在 Terminal-Bench-Science 0.1 测试中的得分是 52.6%,比 Fable 5 高出一倍多。在 Terminal-Bench 4.0 测试中,它的得分是 55.8%,而 Fable 5 的得分是 42.0%。


Terminal-Bench-Science 0.1 是一个专门用于评估 AI 智能体在科学研究工作流中表现 的基准测试。它由斯坦福大学的研究人员主导,联合 Terminal-Bench 团队以及来自全球多个科研机构的领域专家共同开发。这个基准由真正的科学家用自己的日常工作来定义标准。


它包括70 个专家级任务,覆盖五大科学领域:生命科学(19项)、物理科学(17项)、数学科学(17项)、地球科学(8项)和工程科学(9项),总共 70 个任务。任务来源是科研人员实际工作中的真实流程。


其次,前端能力超越了Kimi。

有用户评论说,FABLE-5.1 实际上可能是这个星球上最适合作为前端程序的模型 


他尝试使用 Fable-5.1 和 Kimi K3 来重新制作完全相同的游戏。


任务要求:“制作一款以经典游戏《Mini Militia》或《Doodle Army 2》为灵感的精美网页游戏。”

(@aditya 实测)


可以看出,Fable-5.1 在用户界面和游戏体验方面都优于 Kimi K3。其机制更加流畅,交互体验也更出色,整体表现也明显更精致。


总体亮点总结:

1. 六大能力重点方向

官方文档指出 Fable 5.1 在 Fable 5 基础上的提升,在高 effort 档位下差距最大,主要集中在:长时间 agentic coding(多文件功能、大型重构与迁移、调试、跨小时会话的代码审查);文档/表格/幻灯片类知识工作(从一个问题出发直到产出成稿文档、带活公式的表格或从空白页做出的 slide deck);以及多步网页研究和深度研究任务的准确率。 


2. 找根因而不是打补丁

Fable 5.1 会避免导致低质量结果的捷径,能够修复软件问题的根本原因。例如在投资公司 Millennium 的测试中,它找出了一个多年来其工程师和其他模型都无法解释的内部系统罕见崩溃的原因。


3. Benchmark 数据

Terminal-Bench 4.0 从 42% 提升到 55.8%,CursorBench 3.2.0 从 70.5% 到 73.4%,Terminal-Bench-Science 更是翻倍以上,从 24.7% 到 52.6%。在多项基准上超过 Fable 5、Opus 5 和 OpenAI 的 GPT-5.6 Sol。 NeowinMacRumors


4. 性价比:同样效果、更低成本

在低或中等 effort 下,Fable 5.1 能以低得多的成本达到与 Fable 5 相当或更好的效果。cache read 价格砍了 75%(原来 $0.25/百万 token),常规定价不变:输入 $10、输出 $50 每百万 token。 对反复读同一仓库和指令的 coding agent 长任务影响很大。 


5. 安全护栏更少误伤

Fable 5.1 现在允许识别软件漏洞,更适合防御性安全工作;平均一次 Claude Code 会话中的安全干预比 Fable 5 初期减少约 60%。


6. API 层面的变化

如果你已经在调用 Fable 5,有三项破坏性变更:强制 tool use 会报错、早期模型无法读取它的 thinking blocks、编辑早期轮次会使 thinking blocks 失效。另有新增功能:按消息设置 effort(beta)、turn 级 system message(beta)、tool call 之间可读的进度更新。 


7. 关于 Mythos 5.1

Fable 5.1 和 Mythos 5.1 是同一个模型,只是护栏级别不同;Mythos 5.1 仅限参与 Anthropic 可信访问计划的美国企业和个人。


实测

AnthropicAI研究员Alex Albert展示了使用 Blender 的无任务模式,给一张图片,生成一座房子

这个难点在于,仅凭单张 2D 照片推理三维场地并完成建筑设计;headless 模式下盲写Blender 脚本,几何、材质、灯光任何一步出错全盘崩坏;依赖 渲染—观察—修复 的自闭环自行纠错;上百步长链任务需全程无人干预;最终还要具备运镜与光影的电影感审美判断。


理论上,Kimi-K3也能做,但大概率需要更多的人工介入和试错轮次,最终成片的运镜流畅度和光影质感可能打折扣。


Alex Albert 演示的这条照片到设计,到渲染,到电影感漫游链路,对应的是现实中一个成熟且昂贵的行业:建筑可视化(ArchViz)。传统上每个环节都是一门独立的手艺。


过去这需要一个 3~5 人的小型专业团队协作,耗费1-4周完成:建筑设计师出方案、建筑可视化艺术家建模渲染、动画师做运镜、后期人员剪辑调色——整个流程按周计,市场报价通常在数千到数万美元。


过去的门槛是软件操作技能和专业知识,你得会 Blender、懂建筑、懂镜头语言;现在这些被模型打包吸收了,剩下的门槛变成了审美判断力——知道什么样的房子适合这块地、什么样的镜头算电影感。工具平权之后,品味成了稀缺资源。


文本能力,Fable 5.1更细腻更说人话。

故事连贯性和完整性进步巨大,可以写出能读下去的万字小说了。

提示词:“写一部10000字左右的fable,并用3D的形式展示出来”


(@WY 实测)


仅凭一张截图就完成的马里奥赛车:


游艇游戏:

像是真的大制作,就差一台高配置电脑了。。。


成本上,在 Fable 5.1 中,读取缓存数据的成本比 Fable 5 要低 75%。


这样实际上可以将模型的成本降低约 25%,对于常规工作负载来说如此;而对于那些需要大量代理服务器的高负载工作负载,成本降低幅度则可达到 45%


但是实际总成本呢?Claude藏着不说,虽然标价没涨,但用户体感消耗巨大,额度一两个任务就到上限,因为模型变得更爱思考、更啰嗦、更彻底,输出 token 暴增,所以账单体感变贵。


想控制成本的话,可以主动把 effort 调到 medium 或 low(在很多任务上质量仍然不错),或者尽量用好 prompt caching。

六、 后记

可以看出,Fable 5.1的科学、工程和文本能力都很出色,可以说是顶级了。


如果你做的是高价值、长周期的编码任务或知识工作(大型代码库重构、科研、深度研究、自动化流水线),Fable 5.1 的代际优势是实打实的,它能在几天内干完传统团队几周的活,能力翻倍、成本可控。要不要用,取决于你的任务体量和质量要求。


Fable 5.1这么霸道,有没有能跟它抗衡的模型呢?有,OpenAI 即将推出的 Astra 模型,该模型具备了关键级的网络安全能力,能够发现未知的漏洞并构建攻击链。预计该模型将在本周或下周正式发布。


御三家已经变成双雄时代,谷歌的模型,大家测都懒得测了。

当 Anthropic 和 OpenAI 在基准测试上交替领跑,国内的 DeepSeek、Mimo、Kimi 也在以月为单位疯狂追赶。说句实在话,顶级模型之间的代差也就是几个月的事——今天 Fable 5.1 是王,明天 Astra 来了呢?后天国产模型追上来了呢?


对于我们用AI来说,真正拉开差距的,是谁比谁更早想清楚一件事:我该用这个模型去解决谁的什么真实问题,然后拿到商业回报。 


工具永远在迭代,但发现客户需求的眼光、解决实际问题的能力、把技术转化成利润的闭环,这些才是时间拿不走的东西。


追模型是永远追不完的,用模型去赢,才是一劳永逸的事。刀哥聊AI,不追参数,只追实效,我们下期见!

本文由 刀哥聊AI 深度原创出品

【声明】内容源于网络
0
0
刀哥聊AI
大厂经历,出海视野,深耕AI圈。新鲜新闻、实用工具、硬核技术解读,有深度有实践,带你玩转AI。
内容 189
粉丝 0
刀哥聊AI 大厂经历,出海视野,深耕AI圈。新鲜新闻、实用工具、硬核技术解读,有深度有实践,带你玩转AI。
总阅读13.1k
粉丝0
内容189