Sonnet 5 在推理、工具使用、编码和知识工作方面比 Sonnet 4.6 有显著改进。
其性能接近 Opus 4.8,但价格更低。
Sonnet 5 现已成为 Free 和 Pro 的默认选项,并可供 Max、Team 和 Enterprise 用户使用。
Sonnet 5 今天已在所有 Claude 应用和 Claude 平台上线,并提供截至 8 月 31 日的介绍性定价:
限时优惠(到2026年8月31日):
-
输入:$2 / 百万token -
输出:$10 / 百万token
8月31日之后常规价:
-
输入:$3 / 百万token -
输出:$15 / 百万token
API调用代号:claude-sonnet-5
注意一个坑: Sonnet 5换了分词器(跟Opus 4.7换分词器是同一个思路),性能更好了,但同样的内容会映射出更多token,大概多1.0到1.35倍。限时优惠价就是为了让从Sonnet 4.6迁移过来基本成本中性。
所有计划都能用:Free、Pro默认就是Sonnet 5,Max、Team、Enterprise也可以选。Claude Code和Claude Platform同步上线。各级别的速率限制都提高了,适配高effort级别的更大token消耗。
一句话: Anthropic迄今为止最能干活的Sonnet。智能水平接近Opus 4.8,但价格便宜得多。
它是什么
Sonnet 5是Anthropic的新中端模型。定位很明确:能做计划、能用浏览器和终端等工具、能自主跑完多步骤任务。几个月前这种能力只有更大更贵的Opus级模型才有,现在Sonnet级别就能做到。
Anthropic自己说:AI的agent时代实际上是Sonnet系列带起来的(3.5、3.6、3.7是第一批在编程和工具调用上真正好用的模型)。但最近agent能力的明显进步主要集中在Opus级别。Sonnet 5把差距拉回来了——性能接近Opus 4.8,但成本低一截。
跑分对比
相比上一代Sonnet 4.6,Sonnet 5在推理、工具使用、编程、知识工作等关键维度全面提升。
在BrowseComp(agent搜索)和OSWorld-Verified(计算机操控)这两个评测上,Sonnet 5(橙线)严格优于Sonnet 4.6(灰线),在中等effort档位上性价比大幅领先。高effort档位甚至能在部分任务上追平Opus 4.8(黄线)。
安全性
总体比Sonnet 4.6更安全。具体来说:
-
agent安全性更好:拒绝恶意请求和抵抗prompt注入劫持的能力更强 -
幻觉率更低 -
拍马屁(sycophancy)更少 -
自动化行为审计(测试各种不对齐行为,包括协助滥用和欺骗)得分更低(越低越安全)
但是: 跟更强的Opus 4.8和Claude Mythos Preview相比,不对齐行为的比率稍高一些。
网络安全方面: Sonnet 5没有专门训练过网安任务。它能做一些常规的无害网安任务,但在危险网安技能测试(比如开发软件漏洞利用)上,表现远不如Opus 4.8和Mythos 5。在Firefox漏洞利用测试中,Sonnet 5没能成功开发出任何完整的可用漏洞(成功率0%),但部分成功率比Sonnet 4.6略高——这是通用智能提升的副产品,不是专门训练的结果。因此默认启用了网络安全防护措施。
早期用户怎么说
早期测试合作伙伴反馈一致:它能做完事情。 之前的Sonnet模型经常做到一半就停了,Sonnet 5能一路干到底。它会自己检查输出、不用你明确要求。而且价格合适。
几个代表性评价:
-
Lovable联合创始人:"Sonnet 5少走弯路出同样质量的结果。该拒绝的干脆利落地拒绝。" -
有人让它查一个bug,它没人催就自己写了复现测试、修了bug、然后还把修复暂存回退确认bug重现。全程一次过。 -
在棕地代码(老旧复杂代码)上表现最好——竞争条件、隐藏测试,那些没人愿意碰的部分。它追溯到真正的根因,出持久修复而不是贴创可贴。

