大数跨境

Claude Sonnet 5.5提速30%:API没降价,官方称单任务成本最高少三成

Claude Sonnet 5.5提速30%:API没降价,官方称单任务成本最高少三成 ElephantMind.AIGC
2026-09-29
9
导读:9月28日,Anthropic发布Claude Sonnet 5.5。

9月28日,Anthropic发布Claude Sonnet 5.5。官方给出的两个数字很醒目:生成速度比Sonnet 5快30%以上,多数工作负载的单任务成本最高可降低30%。

但这里的“便宜”不是API直接降价。

Sonnet 5.5的公开价格仍然是输入每百万Token 2美元、输出10美元,5分钟缓存写入2.50美元、1小时缓存写入4美元、缓存读取0.20美元,和Sonnet 5保持一致。

真正变化的是完成同一件事所需要的Token、工具调用和推理步骤。Anthropic称,Sonnet 5.5在很多任务里会用更少的Token完成工作,同时生成速度更快,因此最后落到“每个成功任务”的成本下降,而不是价格表上的Token单价下降。

这也是这次更新更值得看的地方:模型价格没动,但Agent账单开始更多取决于任务效率。

01|Sonnet 5.5没有降API单价

先把价格拆开看。

Claude Platform目前给出的Sonnet 5.5价格是:

计费项
Sonnet 5.5
Input
$2 / MTok
5分钟Cache Write
$2.50 / MTok
1小时Cache Write
$4 / MTok
Cache Read
$0.20 / MTok
Output
$10 / MTok

这个价格和Sonnet 5相同。

所以,如果一个任务在Sonnet 5和Sonnet 5.5上消耗完全相同的输入Token、输出Token、缓存和工具步骤,账单不会因为换模型自动少30%。

Anthropic所谓“up to 30% less for most work”,核心来自两件事:

一是生成速度提高30%以上;二是模型在相同类型任务中使用更少Token、更少中间步骤。

也就是说,成本公式不是:

新模型单价 × 70%

而更接近:

单任务成本
=
输入Token
+ 输出Token
+ Cache Write / Read
+ 工具调用
+ 重试
+ 多轮上下文累积

只要其中几项因为模型效率提高而下降,最终任务账单就会跟着下降。

这也是为什么“API没降价”和“任务能便宜30%”并不矛盾。

02|“最高省30%”和“十分之一成本”不是同一个口径

Anthropic在发布材料里同时给出了两类成本数字。

第一类是整体口径:Sonnet 5.5在多数工作负载中,每项任务成本最高可降低30%。

第二类则来自具体Benchmark。

在Terminal-Bench等测试里,Anthropic展示了不同effort设置下的成本—性能曲线。部分低成本设置下,Sonnet 5.5可以用不到Sonnet 5十分之一的任务成本,拿到高于Sonnet 5最佳点位的分数。

这两个数字不能混在一起。

“最高30%”是Anthropic对多数工作负载的整体描述;“十分之一成本”是特定Benchmark、特定effort和特定评分目标下的结果。

它不能直接推导成:

Sonnet 5.5所有代码任务都便宜90%。

生产环境里真正能省多少,仍然要看自己的Prompt长度、工具链、Agent轮数、上下文复用和任务成功率。

03|Terminal-Bench从10.3%跳到70.6%,但先看评测条件

Sonnet 5.5这次最显眼的数字来自Terminal-Bench 4.0。

Anthropic公布的数据如下:

评测
Sonnet 5.5
Sonnet 5
Opus 5.5
Terminal-Bench 4.0
70.6%
10.3%
66.4%
FrontierCode 1.1 Main
46.2% Max / 52.1% Xhigh
42.4%
54.4%
CursorBench 4.0
55.5%
34.1%
57.8%
GDPval-AA v2.1
1844
1449
1846
OSWorld 2.1
80.1% partial
57.0% partial
81.8% partial

其中Terminal-Bench从10.3%升到70.6%,跨代幅度非常大。

这个评测主要看Agent能不能在命令行环境里完成复杂、多步骤的专业任务,因此对Coding Agent、Shell工具使用和长流程任务更有参考价值。

但这些数据都来自Anthropic自己的发布材料和系统卡,而且不同模型、不同effort下的运行设置并不完全相同。

所以70.6%可以说明Sonnet 5.5在这类任务上的能力明显提高,但不能简单写成“Sonnet已经全面超过Opus”。

例如GDPval-AA里,Sonnet 5.5得1844,Opus 5.5是1846,差距很小;Anthropic仍然把Opus定位在复杂、开放式、需要持续判断的高难任务上,而Sonnet负责速度、成本和日常产出的平衡。

产品线定位并没有因为某几个Benchmark分数接近就消失。

04|效率提升的关键,是少走几步

对于Agent来说,生成Token速度只是其中一部分。

真正影响总耗时和账单的,还有:

  • 调了多少次工具;
  • 搜索了多少轮;
  • 是否重复读取同一上下文;
  • 失败后重试了几次;
  • 最后需不需要人工大改。

Anthropic在发布材料中称,Sonnet 5.5在一些任务中可以批量处理更多工具调用,从而减少中间步骤。

合作方也给出了一些内部测试结果。

例如Box称,在其编码评测中,Sonnet 5.5的工具调用次数减少约三分之一,Shell运行次数大约减半;Atlassian则称Rovo Agent任务速度最多提高30%。

这些属于合作方自己的内部评测,不等同于统一第三方Benchmark,但它们指向同一个工程问题:

模型如果能少搜索、少调用、少返工,Agent成本会比Token单价本身下降得更明显。

尤其在多轮Agent里,一次额外工具调用往往不只是增加一次API请求。

新的Tool Result会继续进入后续上下文,后面的每一轮都可能再次携带更多输入Token。

因此少掉两三轮无效工具往返,最终减少的可能是整条任务链上的重复上下文。

这也是为什么迁移Sonnet 5.5时,最值得记录的不是“每百万Token多少钱”,而是:

  • Cost per Successful Task
  • Total Input Tokens
  • Total Output Tokens
  • Cache Hit / Write
  • Tool Calls
  • Retry Count
  • P50 / P95 Latency
  • Human Edit Rate

如果模型分数提高,但工具调用变多、输出变长、失败任务重试次数上升,最终成本未必更低。

05|Effort也重新校准了,迁移不要直接照搬旧配置

Sonnet 5.5继续支持通过effort控制速度、成本和推理深度。

Anthropic目前的默认设置是:

  • Claude应用、Claude Code:Medium
  • Claude Platform:High

低effort会减少思考和Token消耗,适合范围明确的日常任务;高effort则会让模型投入更多推理和检查。

但迁移时有一个容易忽略的点:Sonnet 5.5的effort档位经过重新校准。

同样写high,并不意味着它和Sonnet 5会消耗完全相同的推理量。

因此更稳妥的做法不是:

Sonnet 5 high
↓
直接替换
Sonnet 5.5 high

而是重新跑一遍自己的effort sweep:

low
↓
medium
↓
high
↓
xhigh
↓
max

然后比较:

任务成功率 × 延迟 × Token × 工具调用 × 人工返工

再决定默认档位。

对于大量简单任务,Medium甚至Low可能已经足够;而复杂代码修改、跨文件重构和长流程Agent,才有必要继续向High、Xhigh或Max加推理预算。

06|还有一个API迁移坑:thinking: disabled不能继续用了

Sonnet 5.5的thinking接口也有变化。

旧代码如果仍然发送:

{
  "thinking": {
    "type": "disabled"
  }
}

在Sonnet 5.5上会返回400错误。

如果希望模型不在每次回复开始前进行up-front thinking,需要改成:

{
  "thinking": {
    "type": "between_tools"
  }
}

但between_tools并不是所有effort都支持。

当前限制是:

  • low:支持
  • medium:支持
  • high:支持
  • xhigh:不支持
  • max:不支持

在xhigh或max下使用between_tools会直接返回400。

另外,使用between_tools后,不能在同一段对话中动态切换effort。如果需要不同轮次采用不同推理强度,就需要使用Adaptive Thinking,再通过每条消息的effort配置调整。

这一点对Agent尤其重要。

例如一个Coding Agent可以:

普通检索 → low
复杂定位 → high
代码修改 → high
最后格式化 → low

但要实现这种按轮动态切换,不能依赖between_tools模式。

还有一个与成本直接相关的细节:修改顶层effort会使Prompt Cache失效。Anthropic建议,如果希望在单独某一轮提高或降低effort,同时保住缓存,需要使用per-message effort change,并配合Adaptive Thinking。

因此模型升级时,除了测“回答有没有变好”,最好同时看缓存命中率有没有因为配置变化突然下降。

07|安全限制也变了,但它不是这次升级的主线

能力提高以后,Anthropic也调整了Sonnet 5.5的安全策略。

官方称,在约1850个自动行为审计场景中,Sonnet 5.5多数对齐、抗滥用和诚实性指标优于或持平Sonnet 5;新的沙箱逃逸评测中,它也接近Anthropic当前表现最好的Opus 5.5。

不过这些仍然是厂商自己的预部署评测,并不等同于安全保证。

更直接影响开发者的是网络安全场景。

由于Sonnet 5.5的Cyber能力提高,Anthropic为它启用了与Opus类似的高风险网络安全防护:普通软件开发任务继续由Sonnet 5.5处理,但被判断为高风险的网络安全请求可能回退到Sonnet 5。

同时,Anthropic还加入了防止大规模提取推理能力的分类器,并继续加强对thinking内容的保护。

这些变化意味着,对普通开发者来说模型依旧可以正常写代码;但安全研究、漏洞利用和更高风险的网络任务,实际路由行为可能与普通Coding任务不同。

08|Sonnet 5.5现在处在什么位置

Anthropic把Sonnet 5.5定位成Opus 5.5的快速、低成本补充。

目前Claude 5.5系列大致可以这样理解:

  • Opus 5.5:复杂、开放式、需要持续判断的高难任务
  • Sonnet 5.5:日常Coding、Bug修复、文档、表格、演示和大多数Agent工作
  • Haiku 5.5:未来几周加入,面向高频和成本敏感任务

Sonnet 5.5的模型ID是:

claude-sonnet-5-5

官方规格为:

  • Context Window:1M Token
  • Max Output:128K Token
  • Batch API最大输出:300K Token(beta)
  • Thinking:Adaptive
  • Claude Platform默认effort:High

目前已经可以通过Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry以及Claude Platform on AWS使用。

09|迁移以后,别只看一张Token价目表

Sonnet 5.5这次没有靠降API价格制造“更便宜”的感觉。

输入还是2美元,输出还是10美元。

真正值得测试的是:同样一个任务,模型是不是能少写一些无效Token、少走几轮工具、少重试几次,同时保持结果可用。

如果要做一次迁移AB Test,可以直接记录:

指标
Sonnet 5
Sonnet 5.5
Task Success Rate


Input Tokens


Output Tokens


Cache Read / Write


Tool Calls


Retry


P50 Latency


P95 Latency


Human Edit Time


Cost / Successful Task


最后一个指标比前面任何单项都重要。

因为模型便不便宜,不应该只看每百万Token多少钱。

Sonnet 5.5真正需要验证的是“一个成功任务的成本”,不是产品页上的Token单价。

参考来源

  • Anthropic:Introducing Claude Sonnet 5.5
    https://www.anthropic.com/claude-sonnet-5-5

  • Anthropic:Claude Sonnet 5.5 System Card
    https://www.anthropic.com/claude-sonnet-5-5-system-card

  • Claude Platform Docs:Claude Sonnet 5.5 model overview
    https://platform.claude.com/docs/en/models/sonnet-5-5/overview

  • Claude Platform Docs:Pricing
    https://platform.claude.com/docs/en/about-claude/pricing

  • Claude Platform Docs:Migrating to Claude Sonnet 5.5
    https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide

  • Claude Platform Docs:Prompting Claude Sonnet 5.5
    https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-sonnet-5-5

【声明】内容源于网络
0
0
ElephantMind.AIGC
深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
内容 76
粉丝 0
ElephantMind.AIGC 深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
总阅读1.7k
粉丝0
内容76