彩蛋:结尾扫描二维码,领取《Claude 5.5 任务分流与场景使用指南》。
Claude Sonnet 5.5 终于来了。
前脚 Anthropic 刚把旗舰 Opus 5.5 推出来,后脚就上了一个更适合日常使用的 Sonnet 5.5:API 输入 2 美元/百万 Token、输出 10 美元/百万 Token,价格只有 Opus 5.5 的一半,同时和上一代 Sonnet 5 保持一致。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
更关键的是,它并没有因为便宜就明显缩水。
从官方公布的数据来看,代码、知识工作、电脑操控几个核心指标已经非常接近 Opus 5.5,部分测试甚至还更高。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
看到这里,我觉得这次真正值得关注的,不是哪一个 Benchmark 又涨了几分。
而是 Claude 的模型分工,终于开始清晰了。
以前用 AI,最省脑子的办法就是:
有钱就上最强模型。
但问题也很明显——大量工作根本不需要旗舰模型全程参与。
Anthropic 这次给两款模型划的边界就很有意思:Opus 5.5 更适合需要长时间判断、任务边界模糊的复杂工作;Sonnet 5.5 则更适合目标已经明确的执行任务,比如改代码、修 Bug、做文档、PPT 和表格。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
这意味着以后更合理的用法可能是:
复杂问题让 Opus 想清楚,明确任务交给 Sonnet 干完。
模型越来越强之后,真正影响成本的,开始变成你会不会分配任务。
01|代码:已经非常接近旗舰
先看最猛的一组。
在 Terminal-Bench 4.0 上,Sonnet 5.5 达到 70.6%,官方表格中甚至高于 Opus 5.5 的 66.4%;CursorBench 4.0 里,Sonnet 5.5 是 55.5%,距离 Opus 5.5 的 57.8% 也只有一点差距。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
这对于 Claude Code 的日常使用很关键。
项目目标已经确定以后,让它定位问题、改文件、跑测试、继续修,很多任务已经没必要全程烧 Opus。
02|办公:真正的“打工模型”
知识工作这一块更有意思。
GDPval-AA 里,Sonnet 5.5 是 1844,Opus 5.5 是 1846;电脑操控 OSWorld 2.1 里,两者也已经非常接近。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
也就是说,写文档、整理资料、做 PPT、处理表格,包括大量已经定义清楚的办公任务,Sonnet 5.5 很可能才是更适合长期挂着用的那个。
它不一定负责想最难的问题,但特别适合狠狠干活。
03|价格:这才是最狠的地方
Sonnet 5.5 的价格只有 Opus 5.5 的一半,而且和上一代 Sonnet 5 一样。
官方还表示,完成同类任务时,它可以少消耗约 30% Token,生成速度也能提升约 30%。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
所以它真正的竞争力并不是单纯“便宜”。
而是:
性能已经贴近旗舰,成本却开始适合大规模日常使用。
这对于天天跑 Claude Code、Agent,或者企业里需要大量调用模型的人,意义比跑分本身大得多。
夸完了,该泼的冷水还是得泼。
第一,接近 Opus,不等于能完全替代 Opus。 任务边界模糊、需要长期规划和不断做判断的时候,Anthropic 自己仍然把 Opus 5.5 放在更高的位置。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
第二,别一上来就把推理档位拉满。 Claude Code 和 Claude App 默认都是 Medium,推理等级越高,时间和 Token 消耗都会增加,应该根据任务难度往上加。 Claude Sonnet 5.5:性能逼近 Opus 5.5…
第三,Benchmark 终究不是你的真实工作流。 Sonnet 5.5 到底能不能完全接住现有任务,还是要放进自己的代码库、文档和 Agent 流程里跑一轮再判断。
最后,老规矩,用三句话总结:
Sonnet 5.5 最大的变化,是第一次把大量接近旗舰的代码和办公能力,压到了更适合日常调用的价格。
它很适合明确任务的执行,但复杂规划、开放式研究和长时间判断,Opus 5.5 依然有存在价值。
接下来真正高效的玩法,不是永远选最强模型,而是学会“按任务分模型”——该让 Opus 想的时候让它想,该让 Sonnet 干活的时候狠狠干。
这次我更建议大家别只收藏一堆 Benchmark。
我整理了一份更实用的 《Claude 5.5 任务分流与场景使用指南》,核心就解决一个问题:手里的任务,到底该用 Sonnet 5.5 还是 Opus 5.5?
里面会直接按 写代码、修 Bug、做方案、资料研究、文档整理、PPT、表格、Agent 长任务 等常见场景给出模型选择,同时整理 Medium / High / Xhigh 等推理档位怎么开、什么时候该升级模型、什么时候没必要浪费 Token。
基本就是一张可以直接照着用的“模型使用说明书”。老规矩,扫码回复关键词【55】,直接拿走。

