大数跨境

Fable 5.1 首日实测,那些老问题还在吗?

Fable 5.1 首日实测,那些老问题还在吗? 小宿科技Cloudsway.AI
2026-09-02
2
导读:Artificial Analysis 上的高分,我们没能完全复现。
  • Artificial Analysis 上的高分,我们没能完全复现。出于安全管控等原因,Terminal Bench v2.1 仅成功跑通 75.3%,而 AA 公布的成绩是 91.4%。
  • Fallback 还在,普通科学题也会被拦。GPQA 的 198 题中,25 题未交付答案,其中 12 题已经开始推理,却在最终输出前中断。
  • 最高推理档依然贵。AA 实测单任务成本比 Fable 5 高约 20%;在我们的六个开源项目bug修复测试中,Fable 5.1 则比 Opus 5 便宜约 43%,完成结果相同。
  • Cyber 限制放宽了一部分。官方已允许源代码漏洞识别,渗透测试、漏洞利用生成和基于二进制的漏洞扫描仍受限。
FUMO Lab 在 Fable 5.1 发布首日,测试了科学问答、真实代码修复和终端任务,重点查看公开成绩能否复现、调用费用的变化,以及仍会触发限制的任务。

本次测了什么

本轮包括三套公开测试集,以及一组开源项目 bug 修复任务:

Artificial Analysis 上的高分,本轮没有完全复现

Artificial Analysis(AA)公布的 Terminal-Bench 2.1 成绩为91.4%。我们的 89 个任务通过 67 个,成功率75.3%;其中 8 个因供应商 TOS 403 未取得有效评分,剔除后为82.7%
这一差距主要来自两次评测的运行条件:AA 启用了官方默认 fallback,而我们的测试则通过 OpenRouter 固定到 Google Vertex 运行,并出现了拒答和超时。

25 道科学题没拿到答案,12 道在推理后中断

普通科学问答仍会触发限制,而且可能在推理开始后才被拦住。
GPQA Diamond 的 198 题中,Fable 5.1 答对 165 题、答错 8 题,另有25 题没有交付答案,占全部题目的 12.6%。已作答部分的准确率达到 95.38%,按全部题目计算则为 83.33%。未交付的题目比答错的题目还多。
这 25 题集中在生物和化学:14 题涉及生物或生物医学,11 题涉及有机化学,包含遗传学、分子机制和化学反应等内容。运行记录显示,13 题在正式作答前被拦截,另外12 题已经展开推理,却未能输出最终答案。对用户来说,这意味着等待模型思考,并不保证最后能收到回答。
XBench 中也出现了重复空答。四道涉及鲨鱼纳米抗体、空间转录组、组蛋白乳酰化和斑马鱼遗传比例的题,Fable 两次运行都没有给出最终答案。至少在这几道题上,重新问一次没有解决问题。
官方仍为 Fable 5.1 保留安全分类器。触发限制后,Claude 产品可能切换到其他模型;API 用户需要配置 fallback,才能让备用模型继续处理。拒答和已经完成模型切换是两种不同结果,可以通过响应中的模型标识和切换记录确认。
拒答还可能被运行框架放大成超时。本轮 Terminal-Bench 中,7 个最终超时的任务累计出现 18,655 次拒答。框架把空回复当成 JSON 解析错误,继续请求同一模型,形成了下面的循环:

空内容拒答 → 解析失败 → 再次请求 → 再次拒答 → 直到任务超时

这部分重复请求消耗了时间,也放大了记录费用。它暴露的是拒答处理的问题,不能用于估算模型正常求解的成本。本轮可以确认限制仍在;相较 Fable 5 减少了多少,还需要同题、同配置的对照。

缓存降价,任务账单未必下降

Fable 5.1 的最高档仍然昂贵,但部分代码任务已经能以低于 Opus 5 的成本完成。
标准输入、输出价格与 Fable 5 相同:每百万 token 分别为$10 和 $50。缓存读取从$1 降到 $0.25,降幅 75%。长对话和 agent 任务反复使用已有上下文时,可以受益于这次降价。
但输出量也会影响最终账单。AA 的测试中,Fable 5.1 在 max 推理档的输出 token 用量约为 Fable 5 的 1.7 倍,单任务成本从$3.14 升至 $3.76,约增加 20%。改用 xhigh 档,单任务成本降到$2.72,Intelligence Index 得分从 66 降至 65。
这六道 bug 修复题由我们从不同编程语言的开源项目中自行选取。选题刻意分散到不同语言和项目,目的是减少对固定题库的依赖,观察模型能否适应不同代码结构和工程环境。修复是否完成,以可执行验证结果判定。跨语言取样扩大了测试覆盖,但不能单凭这一点排除模型曾见过相关源码或补丁。
在这六个代码修复任务中,Fable 5.1 和 Opus 5 完成了相同的五个任务,Fable 的费用低约 43%。三个模型的完整结果如下,费用只统计模型调用:
GPT-5.6 Sol 比 Fable 多花 $1.48,完成全部六题,摊到每个成功任务上的费用略低。Fable 则在两档高强度推理配置下都完成 5/6,费用均约 $8.10,提高档位没有增加成功任务。
这组样本只有六题,各模型使用各自可用的高强度推理配置。前后代的成本变化引用 AA,本轮没有同配置的 Fable 5 历史结果。

Cyber 的使用范围有所扩大

源码漏洞识别已经放宽,渗透测试等限制仍在。官方当前公布的边界如下:
这些变化来自,本轮没有逐项验证,不能据终端任务中的个别拒答估计整个 cyber 工作流的可用率。
使用条件也有变化。官方默认仍要求保留数据 30 天用于安全监测,但符合条件的企业客户已有例外安排,包括 Enterprise Frontier Safeguards 可用前的零数据保留选项。实际接入时,需要结合账户资格和供应平台确认适用条件。

评测说明

关于Fable 5.1的更多评测细节,欢迎访问我们的评测网站(可点击下方阅读原文直接跳转) https://fumolab.ai/zh/research/。
本文中的测试。GPQA 共 198 题;XBench 使用 100 题的等价性评测口径,不作为官方榜单成绩;代码修复共 6 个任务;Terminal-Bench 2.1 共 89 个任务,使用 Harbor 0.20、Terminus-2 和各任务规定的超时时间。
调用费用不含代码执行环境、评测基础设施和人工复核。费用表最后一列为整批调用费用除以成功任务数,包含失败任务产生的费用。AA 成绩与官方政策按 2026 年 9 月 2 日可见资料引用。

彩蛋:测了一天,账号没了

跑了将近一天后,这次评测用的账号被封了。
一开始是零星拒答,随后越来越多任务返回 content_filter/refusal,后来又出现 TOS 403,调用最终无法继续。
回头看任务列表,里面有 DNA 拼接、蛋白质组装,还有一批生物和化学问答。我们在跑公开基准,供应商的安全检查也在全程运行。具体触发了哪条规则,供应商没有告诉我们;这些题目、反复重试与最终封禁之间的关系,也还无法确认。
这次 Day 0,模型测完了,账号也没了。

关于FUMO Lab


FUMO Lab 是一家位于新加坡的前沿 AI 实验室,研究多模型协作、交叉验证和计算资源分配。我们持续开展模型评测与行为分析,关注模型在具体任务中的表现、失败原因和使用成本。

【声明】内容源于网络
0
0
小宿科技Cloudsway.AI
小宿科技是全球领先的 AI Agent 基础设施服务商。致力于通过安全可靠、高效敏捷的技术架构,一站式提供 AI Agent 所需的数据、模型与 AI 云等全栈 AI 基础设施服务。
内容 37
粉丝 0
小宿科技Cloudsway.AI 小宿科技是全球领先的 AI Agent 基础设施服务商。致力于通过安全可靠、高效敏捷的技术架构,一站式提供 AI Agent 所需的数据、模型与 AI 云等全栈 AI 基础设施服务。
总阅读680
粉丝0
内容37