大数跨境

Claude Fable 5 发布:AI 竞争从“智商”转向“耐力”!

Claude Fable 5 发布:AI 竞争从“智商”转向“耐力”! MaxMindAI
2026-06-10
3
导读:GPT-5.5 被甩开 20 个百分点,Claude Fable 5 到底强在哪?

过去两年,AI 模型的竞争焦点一直是「谁更聪明」——单轮问答的跑分、基准测试的排名。但一个长期被忽略的问题是:一旦任务被拉长到几十步、几百步,绝大多数模型开始掉链子。忘记上一步做了什么、漏掉关键约束、中途跑偏。

这些问题跟模型大小没关系,跟「耐力」有关系。

Anthropic 今天凌晨发布的 Claude Fable 5,比的不只是「我比你聪明」,而是 「我能把一整件事做完」


01 编程:【5000 万行】代码,一天搞定

SWE-bench Pro 是目前最硬核的软件工程基准测试。它不给选择题,不给简答题,而是把真实开源项目的 bug 报告扔给模型,要求模型写出能通过项目原生测试的补丁。

Fable 5 得分 【80.3%】。作为对比:Claude Opus 4.8 为 【69.2%】,GPT-5.5 约 【58-60%】。差距不是 5 个点、10 个点,是十几到二十个百分点。

比分数更有说服力的是一个实际案例。支付公司 Stripe 在一个包含 5000 万行 Ruby 代码的代码库里测试 Fable 5,任务是完成一次大规模框架迁移。Fable 5 独立完成,耗时一天。Stripe 内部预估,交给工程师团队手工迁移需要两个多月。

两个多月 → 一天。不只是因为写代码比人快 60 倍,而是整个过程中不需要人参与讨论

迁移的本质不是敲键盘,而是理解旧代码为什么那样写、新框架 API 有什么差异、改了一处会不会在其他模块引发连锁反应。这些判断原先需要团队反复对齐,现在模型一次性完成。


02 视觉:只看截图,就能通关《宝可梦》

多模态模型并不新鲜,但 Fable 5 的视觉能力与过去的路数明显不同。

Anthropic 给 Fable 5 玩了一款 Game Boy 游戏《精灵宝可梦火红》。没有地图,没有攻略,没有任何辅助信息。Fable 5 能看到的,只有游戏运行时的一张张截图。它花了 50 个小时,从第一战到通关动画,零人工干预。 换成之前的模型,到第三个路口就会迷失方向。

给出一张科研散点图。以前的模型会输出:「这是一个图表,横轴是时间,纵轴是浓度。」猜对了类型,说不出内容。Fable 5 的输出是:「第三组数据在第 14 天达到浓度峰值 【2.7μg/mL】,之后持续下降。」这不是 OCR 识别文字,而是从视觉上理解图表的含义。

更极端的测试:给 Fable 5 一个网页的截图,让它写出能还原该页面的代码。不是「描述页面结构」,而是写出可运行的 HTML、CSS、JS。截图进去,可运行源码输出。

打游戏、读图表、逆向网页——底层的逻辑是同一件事。


03 科研:AI 开始自己设计实验了

这部分可能是 Fable 5 最值钱的能力,也是最容易被忽略的。

Anthropic 邀请了分子生物学家,将相同的实验数据同时交给 Fable 5 和人类科学家,要求双方各自提出下一步研究方向和实验设计。由不知情的评审进行盲选。评审更偏好 AI 方案的频率显著高于人类方案。 这意味着至少在部分环节,AI 提出科研想法的质量已经能与世界顶尖的研究员比肩。

在蛋白设计领域,Mythos 5(Fable 5 的无限制版)将某些设计流程提速约 10 倍,14 个目标蛋白中 【9 个】 产出了可推进验证的候选分子。从靶点到候选分子,传统周期按年计算。

10 倍提速不是快了一点,是把一门耐力生意变成了抢跑生意。

不是 AI 能回答问题,而是 AI 开始能提出有价值的问题了。


04 代价:强到离谱,但不免费

API 价格: 输入 【$10/百万 token】,输出 【$50/百万 token】。大约是 Opus 4.8 的两倍,但不到此前 Mythos 预览版定价的一半。

订阅规则: 6 月 22 日前,Pro 和 Max 订阅用户可以免费使用 Fable 5。6 月 23 日后转为按量付费,用多少充多少。 恢复免费时间尚未确定。Anthropic 表示等资源扩容——实质上在等竞争对手拿出能正面打长程任务的模型。

安全限制: Fable 5 面向公众开放,内置了安全分类器。Mythos 5 是无限制的完整版,仅限 Project Glasswing 合作伙伴使用。两者共享同一底层模型。检测到网络安全、生物化学等敏感领域时自动切换到 Opus 4.8 处理。但官方数据:超过 【95%】 的日常会话不受此限制。 不是「残血版」,而是「有一个分区锁了门,其他楼层随便逛。」


总结

Fable 5 将竞争从「谁单次答得更好」推向了「谁能一口气干完一整件事」。

编程不再是能写几行正确代码——它开始能完成需要数月工时的工程任务
视觉不再是看懂一张图——它能理解一段连续的画面并做出决策
科研不再是辅助人类——它在某些环节开始替代世界顶级专家的判断

赛制已经变了。而这场「耐力赛」的发令枪,已经打响。



Max Mind

你的AI加油站

【声明】内容源于网络
0
0
MaxMindAI
1234
内容 41
粉丝 0
MaxMindAI 1234
总阅读24
粉丝0
内容41