大数跨境

刚刚,Claude Opus 5 突袭上线!半价硬刚 Fable 5,推理四倍碾压 GPT-5.6 Sol

刚刚,Claude Opus 5 突袭上线!半价硬刚 Fable 5,推理四倍碾压 GPT-5.6 Sol AI信息Gap
2026-07-25
5
导读:Claude Opus 5,刚刚上线了。

Claude Fable 5性能虽强,但高昂的成本限制了其全天候使用。为此,Anthropic 正式推出了Claude Opus 5

基准测试断档领先,性价比成最大卖点

在备受关注的ARC-AGI-3测试中,该模型展现了惊人的泛化推理能力。面对从未见过的新题,Claude Opus 5取得了30.2%的准确率,是上一代Claude Opus 4.8(1.5%)的 20 倍,更是此前领跑者GPT-5.6 Sol(7.8%)的四倍,实现了断档式领先。

更关键的是,Claude Opus 5在性能逼近旗舰Claude Fable 5的同时,定价策略保持不变:API 输入 5 美元/百万 token,输出 25 美元/百万 token,仅为旗舰模型的一半。

第三方评测平台 Vals AI 数据显示,Claude Opus 5在 27 项基准测试中斩获 14 项第一,综合得分 74.82%,与Claude Fable 5(75.14%)的差距不足 0.4 个百分点。这意味着用户仅需支付一半费用,即可获得旗舰模型 99.6% 的性能表现。

编程与自动化能力全面超越旗舰

代码生成与故障修复

Frontier-Bench v0.1命令行代码任务中,Claude Opus 5准确率达到 43.3%,不仅远超Claude Opus 4.8的 21.1%,甚至反超Claude Fable 5(33.7%)近十个百分点。

测试案例显示,面对图纸接口被切断的极端情况,Claude Opus 5能自主编写图像识别程序,从像素中提取几何信息并成功重建 3D 模型,而其他模型均告失败。这种“自我修复题目”的能力展现了极强的工程落地性。

实际应用中,该模型已能独立搭建交易所市场数据接入及测试工具,并在开源社区中发现了连人类开发者都遗漏的边界条件漏洞。

知识工作与业务自动化

在知识工作综合评分(GDPval-AA v2)和电脑操作能力(OSWorld 2.0)两项指标上,Claude Opus 5分别以 1861 分和 70.6% 的成绩,反超Claude Fable 5,确立了新的领先地位。

AutomationBench业务自动化测试中,Claude Opus 5即使在最低推理档位,其 26% 的通过率也超过了其他模型开启最高档位的表现。

值得注意的是,Anthropic 官方对比图中曾出现标注错误,将Claude Fable 5略高的FrontierCode分数高亮给了Claude Opus 5,引发网友调侃。

专业领域短板与安全对齐

特定领域表现待提升

尽管综合能力强悍,Claude Opus 5在部分垂直领域仍有不足。在DeepSWE v1.1编码测试中落后于GPT-5.6 Sol;在法律(Legal Agent Benchmark)和医疗(HealthBench Professional)任务中,得分亦低于自家的Claude Fable 5Claude Mythos 5

安全防御与合规控制

在安全性方面,Claude Opus 5在自动化行为审计中获得 2.30 分(越低越好),优于近期发布的所有 Anthropic 模型,显示出更强的指令遵循度和抗欺骗能力。

网络安全测试显示,虽然模型找漏洞的能力自动提升至接近Claude Mythos 5的水平,但在生成可利用的攻击代码方面受到严格限制(成功 4 个 vs 13 个)。新的安全分类器允许扫描源码漏洞,但严禁渗透测试和漏洞利用,坚守“只找问题不搞破坏”的底线。

上线信息与使用建议

目前存在关于 Token 消耗速度的争议,有反馈称其消耗快于Claude Fable 5,可能抵消单价优势,实际成本效益尚需观察。此外,部分用户对 Opus 分支的稳定性持保留态度。

Claude Opus 5现已向所有付费用户开放:Claude Max默认切换为该模型,Claude Pro用户可用,Fast 模式同步上线(速度提升 2.5 倍,价格翻倍)。对于正在使用Claude Opus 4.8的用户,鉴于价格不变且性能大幅跃升,升级值得考虑。

【声明】内容源于网络
0
0
AI信息Gap
各类跨境出海行业相关资讯
内容 1015
粉丝 0
AI信息Gap 各类跨境出海行业相关资讯
总阅读100.5k
粉丝0
内容1.0k