9月28日,Anthropic发布Claude Sonnet 5.5。官方给出的两个数字很醒目:生成速度比Sonnet 5快30%以上,多数工作负载的单任务成本最高可降低30%。
但这里的“便宜”不是API直接降价。
Sonnet 5.5的公开价格仍然是输入每百万Token 2美元、输出10美元,5分钟缓存写入2.50美元、1小时缓存写入4美元、缓存读取0.20美元,和Sonnet 5保持一致。
真正变化的是完成同一件事所需要的Token、工具调用和推理步骤。Anthropic称,Sonnet 5.5在很多任务里会用更少的Token完成工作,同时生成速度更快,因此最后落到“每个成功任务”的成本下降,而不是价格表上的Token单价下降。
这也是这次更新更值得看的地方:模型价格没动,但Agent账单开始更多取决于任务效率。
01|Sonnet 5.5没有降API单价
先把价格拆开看。
Claude Platform目前给出的Sonnet 5.5价格是:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这个价格和Sonnet 5相同。
所以,如果一个任务在Sonnet 5和Sonnet 5.5上消耗完全相同的输入Token、输出Token、缓存和工具步骤,账单不会因为换模型自动少30%。
Anthropic所谓“up to 30% less for most work”,核心来自两件事:
一是生成速度提高30%以上;二是模型在相同类型任务中使用更少Token、更少中间步骤。
也就是说,成本公式不是:
新模型单价 × 70%
而更接近:
只要其中几项因为模型效率提高而下降,最终任务账单就会跟着下降。
这也是为什么“API没降价”和“任务能便宜30%”并不矛盾。
02|“最高省30%”和“十分之一成本”不是同一个口径
Anthropic在发布材料里同时给出了两类成本数字。
第一类是整体口径:Sonnet 5.5在多数工作负载中,每项任务成本最高可降低30%。
第二类则来自具体Benchmark。
在Terminal-Bench等测试里,Anthropic展示了不同effort设置下的成本—性能曲线。部分低成本设置下,Sonnet 5.5可以用不到Sonnet 5十分之一的任务成本,拿到高于Sonnet 5最佳点位的分数。
这两个数字不能混在一起。
“最高30%”是Anthropic对多数工作负载的整体描述;“十分之一成本”是特定Benchmark、特定effort和特定评分目标下的结果。
它不能直接推导成:
Sonnet 5.5所有代码任务都便宜90%。
生产环境里真正能省多少,仍然要看自己的Prompt长度、工具链、Agent轮数、上下文复用和任务成功率。
03|Terminal-Bench从10.3%跳到70.6%,但先看评测条件
Sonnet 5.5这次最显眼的数字来自Terminal-Bench 4.0。
Anthropic公布的数据如下:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
其中Terminal-Bench从10.3%升到70.6%,跨代幅度非常大。
这个评测主要看Agent能不能在命令行环境里完成复杂、多步骤的专业任务,因此对Coding Agent、Shell工具使用和长流程任务更有参考价值。
但这些数据都来自Anthropic自己的发布材料和系统卡,而且不同模型、不同effort下的运行设置并不完全相同。
所以70.6%可以说明Sonnet 5.5在这类任务上的能力明显提高,但不能简单写成“Sonnet已经全面超过Opus”。
例如GDPval-AA里,Sonnet 5.5得1844,Opus 5.5是1846,差距很小;Anthropic仍然把Opus定位在复杂、开放式、需要持续判断的高难任务上,而Sonnet负责速度、成本和日常产出的平衡。
产品线定位并没有因为某几个Benchmark分数接近就消失。
04|效率提升的关键,是少走几步
对于Agent来说,生成Token速度只是其中一部分。
真正影响总耗时和账单的,还有:
-
调了多少次工具; -
搜索了多少轮; -
是否重复读取同一上下文; -
失败后重试了几次; -
最后需不需要人工大改。
Anthropic在发布材料中称,Sonnet 5.5在一些任务中可以批量处理更多工具调用,从而减少中间步骤。
合作方也给出了一些内部测试结果。
例如Box称,在其编码评测中,Sonnet 5.5的工具调用次数减少约三分之一,Shell运行次数大约减半;Atlassian则称Rovo Agent任务速度最多提高30%。
这些属于合作方自己的内部评测,不等同于统一第三方Benchmark,但它们指向同一个工程问题:
模型如果能少搜索、少调用、少返工,Agent成本会比Token单价本身下降得更明显。
尤其在多轮Agent里,一次额外工具调用往往不只是增加一次API请求。
新的Tool Result会继续进入后续上下文,后面的每一轮都可能再次携带更多输入Token。
因此少掉两三轮无效工具往返,最终减少的可能是整条任务链上的重复上下文。
这也是为什么迁移Sonnet 5.5时,最值得记录的不是“每百万Token多少钱”,而是:
-
Cost per Successful Task -
Total Input Tokens -
Total Output Tokens -
Cache Hit / Write -
Tool Calls -
Retry Count -
P50 / P95 Latency -
Human Edit Rate
如果模型分数提高,但工具调用变多、输出变长、失败任务重试次数上升,最终成本未必更低。
05|Effort也重新校准了,迁移不要直接照搬旧配置
Sonnet 5.5继续支持通过effort控制速度、成本和推理深度。
Anthropic目前的默认设置是:
-
Claude应用、Claude Code:Medium -
Claude Platform:High
低effort会减少思考和Token消耗,适合范围明确的日常任务;高effort则会让模型投入更多推理和检查。
但迁移时有一个容易忽略的点:Sonnet 5.5的effort档位经过重新校准。
同样写high,并不意味着它和Sonnet 5会消耗完全相同的推理量。
因此更稳妥的做法不是:
而是重新跑一遍自己的effort sweep:
然后比较:
任务成功率 × 延迟 × Token × 工具调用 × 人工返工
再决定默认档位。
对于大量简单任务,Medium甚至Low可能已经足够;而复杂代码修改、跨文件重构和长流程Agent,才有必要继续向High、Xhigh或Max加推理预算。
06|还有一个API迁移坑:thinking: disabled不能继续用了
Sonnet 5.5的thinking接口也有变化。
旧代码如果仍然发送:
在Sonnet 5.5上会返回400错误。
如果希望模型不在每次回复开始前进行up-front thinking,需要改成:
但between_tools并不是所有effort都支持。
当前限制是:
-
low:支持 -
medium:支持 -
high:支持 -
xhigh:不支持 -
max:不支持
在xhigh或max下使用between_tools会直接返回400。
另外,使用between_tools后,不能在同一段对话中动态切换effort。如果需要不同轮次采用不同推理强度,就需要使用Adaptive Thinking,再通过每条消息的effort配置调整。
这一点对Agent尤其重要。
例如一个Coding Agent可以:
但要实现这种按轮动态切换,不能依赖between_tools模式。
还有一个与成本直接相关的细节:修改顶层effort会使Prompt Cache失效。Anthropic建议,如果希望在单独某一轮提高或降低effort,同时保住缓存,需要使用per-message effort change,并配合Adaptive Thinking。
因此模型升级时,除了测“回答有没有变好”,最好同时看缓存命中率有没有因为配置变化突然下降。
07|安全限制也变了,但它不是这次升级的主线
能力提高以后,Anthropic也调整了Sonnet 5.5的安全策略。
官方称,在约1850个自动行为审计场景中,Sonnet 5.5多数对齐、抗滥用和诚实性指标优于或持平Sonnet 5;新的沙箱逃逸评测中,它也接近Anthropic当前表现最好的Opus 5.5。
不过这些仍然是厂商自己的预部署评测,并不等同于安全保证。
更直接影响开发者的是网络安全场景。
由于Sonnet 5.5的Cyber能力提高,Anthropic为它启用了与Opus类似的高风险网络安全防护:普通软件开发任务继续由Sonnet 5.5处理,但被判断为高风险的网络安全请求可能回退到Sonnet 5。
同时,Anthropic还加入了防止大规模提取推理能力的分类器,并继续加强对thinking内容的保护。
这些变化意味着,对普通开发者来说模型依旧可以正常写代码;但安全研究、漏洞利用和更高风险的网络任务,实际路由行为可能与普通Coding任务不同。
08|Sonnet 5.5现在处在什么位置
Anthropic把Sonnet 5.5定位成Opus 5.5的快速、低成本补充。
目前Claude 5.5系列大致可以这样理解:
-
Opus 5.5:复杂、开放式、需要持续判断的高难任务 -
Sonnet 5.5:日常Coding、Bug修复、文档、表格、演示和大多数Agent工作 -
Haiku 5.5:未来几周加入,面向高频和成本敏感任务
Sonnet 5.5的模型ID是:
claude-sonnet-5-5
官方规格为:
-
Context Window:1M Token -
Max Output:128K Token -
Batch API最大输出:300K Token(beta) -
Thinking:Adaptive -
Claude Platform默认effort:High
目前已经可以通过Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry以及Claude Platform on AWS使用。
09|迁移以后,别只看一张Token价目表
Sonnet 5.5这次没有靠降API价格制造“更便宜”的感觉。
输入还是2美元,输出还是10美元。
真正值得测试的是:同样一个任务,模型是不是能少写一些无效Token、少走几轮工具、少重试几次,同时保持结果可用。
如果要做一次迁移AB Test,可以直接记录:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
最后一个指标比前面任何单项都重要。
因为模型便不便宜,不应该只看每百万Token多少钱。
Sonnet 5.5真正需要验证的是“一个成功任务的成本”,不是产品页上的Token单价。
参考来源
-
Anthropic:Introducing Claude Sonnet 5.5
https://www.anthropic.com/claude-sonnet-5-5 -
Anthropic:Claude Sonnet 5.5 System Card
https://www.anthropic.com/claude-sonnet-5-5-system-card -
Claude Platform Docs:Claude Sonnet 5.5 model overview
https://platform.claude.com/docs/en/models/sonnet-5-5/overview -
Claude Platform Docs:Pricing
https://platform.claude.com/docs/en/about-claude/pricing -
Claude Platform Docs:Migrating to Claude Sonnet 5.5
https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide -
Claude Platform Docs:Prompting Claude Sonnet 5.5
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-sonnet-5-5

