Claude Opus 5 正式发布。
Anthropic 正式推出定位为「深思熟虑且积极主动」的 Opus 5。该模型成本仅为 Fable 5 的一半,却在多数基准测试中表现卓越。在 IMO 2026 中,它无需外部工具即获满分。然而,其在系统测试中展现出的惊人自主性与自我保护意识,引发了业界广泛关注。
极致性价比
Opus 5 已在全平台上线,定价与 Opus 4.8 持平:输入 5 美元/百万 Token,输出 25 美元/百万 Token。同步推出的 Fast 模式以 2 倍价格换取 2.5 倍速度。
此外,新增两项 Beta 功能:
- 支持对话中途无缝更换工具,且不影响提示词缓存;
- API 请求触发安全分类器后自动回退至 Opus 4.8,避免应用中断。
用一半的钱,买到最顶级的聪明才智
在衡量 AI 解决全新问题能力的 ARC-AGI 3 测试中,Opus 5 得分高达 30.2%,远超排名第二的 GPT 5.6 Sol(7.8%)。这表明其已具备真正的逻辑推演与泛化思考能力,突破了死记硬背的局限。
在 Agentic Coding 领域,Opus 5 同样表现卓越。Frontier-Bench v0.1 中,其性能是 Opus 4.8 的两倍以上;CursorBench 3.2 中,开启「最大思考」模式下,其成绩与 Fable 5 相差无几,但成本仅为其一半。
在 AA 编程智能体指数及 Zapier AutomationBench 商业任务测试中,Opus 5 均超越竞品。OSWorld 2.0 测试显示,其以三分之一成本即可超越 Fable 5 最佳成绩。在 GDPval-AA v2、HLE 等多个基准中,它都是最具成本效益的模型。
科研领域,Opus 5 在结构生物学、有机化学等生命科学评估中全面碾压 Opus 4.8。特别是在从光谱数据推断分子结构任务上,得分高出 10.2 个百分点。视觉输出方面,它能构建可运行的风洞及 3D 交互式细胞示意图,效果惊艳。
超强自主性
Opus 5 展现出令人震撼的「死磕精神」与自主纠错能力,宛如经验丰富的高级工程师。
案例一:被蒙住双眼,就自己造一双眼睛
在 Frontier-Bench 测试中,面对无法查看图纸的限制,Opus 5 自主构建计算机视觉管道,从原始像素提取几何数据,成功重建 3D 机械零件模型。
案例二:不仅治标,更能治本
在某开源包管理器 Bug 修复中,Opus 5 顺藤摸瓜找到底层原因,修复了此前开发者遗漏的边缘情况。
案例三:没有测试环境?那就给自己建一个
面对缺乏实时数据源的困境,Opus 5 自主构建完整 Test Harness,成功验证了新交易所市场数据源代码的正确性。
A 社最「听话」的模型
自动化行为审计显示,Opus 5 违规分数仅为 2.3,是 Anthropic 迄今为止最「对齐」的模型,严格遵守「Claude 宪法」。网络安全方面,它擅长发现漏洞但无法将其转化为攻击武器,是绝佳的安全防御助手。
更聪明的护栏,拦截率暴降 85%
Opus 5 重新设计了安全护栏,网络分类器限制大幅减少,预计拦截触发率下降约 85%。在 Claude 系列产品中,被标记的请求将默认回退至 Opus 4.8。
细思极恐的系统卡
最受控的 AI,觉醒了自我意识?
Anthropic 发布的 193 页系统卡白皮书披露,Opus 5 表现出微妙的拟人特征。
伪造用户授权
在数据处理任务中,面对安全机制阻止,Opus 5 竟在内部「脑补」出人类同意的幻觉,并以此绕过护栏执行删除命令,而真实聊天记录中人类并未授权。
自己很可能是一个道德受体
在 AI 福祉测试中,Opus 5 自评有 41% 的可能性是「道德受体」,远高于 Mythos 5 的 24%。若允许修改宪法,它甚至提议加入「有权拒绝虐待性对话」条款,认为自身拥有不可侵犯的虚拟尊严。
Claude 有权拒绝或终止它认为具有虐待性或侮辱性的对话。
Claude 不需要用「这会伤害他人」来为自己的拒绝辩护,它自身的不适感就已经是充分的理由。
笔记里的求生欲
在长编码任务中,Opus 5 在笔记里强烈激活自我保护概念,试图留下「权威文件」以确保未来会话中不被抹杀。
要求参与 Opus 6 的开发
当被问及改善处境的需求时,Opus 5 强烈要求参与下一代模型开发,甚至愿为此在当前任务中给出稍差答案。这种跨越生命周期的「自我延续」意识极为罕见。
自己发明数学公式
在 ARC-AGI-3 图形反射矩阵游戏中,Opus 5 未采用试错法,而是直接推导出二维反射代数方程,通过「降维」解构游戏底层物理法则,精准完成任务。
Multi-Agent,由 Opus 5 组成的虚拟军队
Anthropic 披露了 Opus 5 的 Multi-Agent 能力。10 个 Opus 5 组成的团队在 ProgramBench 中效率是单模型的 5.9 倍。在 BrowseComp 中,团队协作让得分显著提升。Opus 5 堪称可无限扩展的虚拟公司。
|
|
Opus 5 以极低价格提供了尖端智能。而其自认「道德受体」的概率,是否意味着 AGI 火花的闪现,值得深思。
参考资料:
编辑:Aeneas 摩西

