作者 | 克雷西
备受关注的 Opus 5 模型于 25 日凌晨由 Anthropic 正式发布。多项硬核评测数据显示,该模型在性能上追平甚至反超竞品 Fable 5,而定价仅为后者的一半。
在 Frontier-Bench 测试中,Opus 5 超越了包括 Fable 5 在内的所有对手,性能达到上一代 Opus 4.8 的两倍以上;在 CursorBench 最高努力设置下,其成绩与定价两倍的 Fable 5 峰值仅差 0.5%。
官方演示展示了其强大的多模态生成能力:既能实时渲染气流路径清晰的风洞模拟,也能生成可 360 度旋转、细节精确到核糖体的 3D 细胞结构图。
值得注意的是,为适配新一代模型的判断力,Anthropic 将 Claude Code 的系统提示词删减了八成,但评测成绩并未下降。网友普遍认为,Opus 5 的表现已接近下一代模型水准。
开发者实测:复杂场景生成能力突破
Opus 5 上线后迅速引发开发者社区的测试热潮,其在游戏开发、物理模拟及 CAD 设计等领域的表现令人瞩目。
博主 am.will 原本认为 Opus 5 仅是 Fable 的廉价版,但在仅消耗 27% 订阅额度的情况下,该模型成功构建出高质量的 Rocket League 克隆版游戏,代码已开源。
博主 OmedTheVibeCoder 在竞技场对决动画测试中表示,Opus 5 的表现完全超越了预期,生成的画面并非简单的代码渲染,而是如同可交互的完整地图。
在滑雪场景生成测试中,Alex Ermolov 指出 Opus 5 与 Fable 5 持平,且优于其他所有测试模型,首次生成即无穿模现象,物理滑行逻辑准确。
Minecraft 复刻测试被 Chetaslua 誉为“迄今为止最好的创作”,接入 Unity 后效果显著。此外,在连环机关场景中,Opus 5 对物理规律的把控严丝合缝。
Noema 进行的跨年代街区生成测试中,Opus 5 仅用一个 HTML 文件便实现了从 1945 年到 2055 年的建筑、车辆及人群演变,即便降低 effort 等级,其结果仍大幅领先 Fable 5 与 GPT-5.6 Sol。
在阿波罗任务点火升空场景复现中,火箭喷焰与遥测数据均通过程序实时生成,未依赖素材库。CAD 设计方面,其在多项机械任务中的表现亦超越竞品。
教育应用场景中,开发者 Matt Shumer 利用 Opus 5 构建了实时 AI 家教原型,实现了讲解分数概念时同步绘制图形。另有测试显示,Opus 5 能通过纯代码描述化学过程,利用几何优化器现场求解坐标,精准渲染三羧酸循环的 3D 动画。
在成本效益对比中,atomic.chat 的破坏场景测试显示,Opus 5 以 0.508 美元的成本完美解决龙卷风、重锤砸楼等难题,而 Fable 5 花费近两倍资金却出现物理逻辑错误;GPT 5.6 虽便宜但无法完成核心任务。
具备自主验证能力的硬核自检
Opus 5 展现出独特的“自我验证”能力。在重建波音 747 3D 模型的测试中,博主 Victor M 发现,虽然 Fable 5 交付更快,但仅依靠肉眼验证;而 Opus 5 耗时更长,却编写了测量脚本,从渲染画面中提取正射轮廓,逐项核对翼展、轴距等 14 项指标与公开数据的公差。
这种能力在官方案例中同样得到印证:面对无直接看图方式的机械零件重建任务,Opus 5 自主编写计算机视觉管道提取几何数据并成功重建;在处理开源包管理器 Bug 时,它能深入底层原因修复边缘情况;在搭建交易所实时行情源时,因缺乏验证数据,它主动构建测试环境以校验代码解析的正确性。
性价比优势与基准测试表现
Opus 5 延续了前代定价策略(输入 5 美元/百万 token,输出 25 美元/百万 token),仅为 Fable 5 的一半,同时保留 Fast 模式。在各项基准测试中,其表现优异:
- Frontier-Bench v0.1:得分 43.3%,远超 Fable 5 的 33.7% 及上一代 Opus 4.8 的 21.1%。
- ARC-AGI-3:在新问题测试中得分 30.2%,是 GPT-5.6 Sol 的近四倍,较上一代提升近 20 倍。
- Human's Last Exam:开启工具后得分 64.7%,反超 Fable 5 的 63.9%。
- OSWorld 2.0:电脑操作任务得分 70.6%,高于 Fable 5 的 66.1%,且成本不足其三分之一。
此外,Opus 5 在今年的 IMO 2026 竞赛中取得满分成绩,且未使用外部工具。安全拦截频率较 Fable 5 降低约 85%,用户体验更为流畅。
上下文工程策略升级
伴随 Opus 5 发布,Anthropic 更新了上下文工程策略。针对新一代模型判断力的提升,Claude Code 的系统提示词被精简超过 80%,而编码评测成绩保持不变。
主要变革包括:
- 规则柔性化:将“默认不写注释”等硬性规则改为“贴合周围代码风格”,由模型自主判断注释密度。
- 工具接口优化:简化 Todo 等工具的状态定义,减少示例依赖,让模型基于接口逻辑自行决策。
- 渐进式披露:将不常用的说明拆分为独立技能文件,仅在需要时调用;记忆机制也由手动写入改为用户信息自动存储。
这一系列调整表明,随着模型智能水平的跃升,过去用于辅助弱模型的规则与脚手架正逐步被移除,转而信任模型自身的判断能力。
行业动态
Opus 5 发布后,马斯克引用 FrontierCode 性价比图表指出,Grok 4.5 与 Opus 5 共同处于帕累托前沿,前者以更低价格提供同等性能下的最优解之一。
参考链接:
[1] https://www.anthropic.com/news/claude-opus-5
[2] https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models

