四月的 AI 圈,七天内两颗炸弹。Anthropic 先扔,OpenAI 接着扔。一场王座争夺战,打得比任何时候都激烈。
七天,两颗炸弹
4 月 16 日,Anthropic 发布 Claude Opus 4.7。
7 天后,4 月 23 日,OpenAI 发布 GPT-5.5。
这是 2026 年 AI 旗舰模型发布节奏最密集的一周——两个实验室各自拿出了当前最强的"可用"大模型,正面列阵。
先说结论,不绕弯:
代码能力,Claude Opus 4.7 在 GPT-5.5 发布前的窗口期里,确实拿到了 SOTA。但 GPT-5.5 上线后,局面更复杂——每个模型都有自己赢的战场。
这篇文章不捧任何一家,只讲数字。
Claude Opus 4.7:代码评测的真实成绩
Claude Opus 4.7 于 2026 年 4 月 16 日正式发布,Anthropic 将其定位为当前面向所有用户开放的最强模型,在代码、Agent、视觉推理三条线上全面升级。
先看最核心的代码评测。
SWE-bench Pro——衡量模型能否真实解决 GitHub Issue 并生成能跑通测试的 PR,这是业内公认最接近真实软件工程场景的 coding 基准:
|
|
|
|---|---|
| Claude Opus 4.7 | 64.3% |
|
|
|
|
|
|
|
|
|
4.7 领先 GPT-5.4 整整 6.6 个百分点,领先 Gemini 3.1 Pro 超过 10 个百分点。
SWE-bench Verified(标准版):Opus 4.7 从 4.6 的 80.8% 跳升到 87.6%,提升了 6.8 个百分点。
CursorBench,Cursor 团队自测的真实代码场景评测:Opus 4.7 从 58% 提升到 70%,这是 Cursor 发布以来同款评测单次最大涨幅,Cursor 官方用"our strongest generally available coding/agentic model"来描述它。
其他亮点评测:
-
• GPQA Diamond(科学推理):94.2%,超越 Opus 4.6 的 91.3% -
• Finance Agent:64.4%,发布时为行业 SOTA -
• OSWorld-Verified(计算机操作):78.0%,高于 Opus 4.6 的 72.7%
GPT-5.5 来了,王座换人了吗?
7 天后 GPT-5.5 上线,形势发生了变化。
直接看数字对比(来源:各平台公开评测及官方文档):
Claude Opus 4.7 赢的战场:
|
|
|
|
|---|---|---|
|
|
64.3% |
|
|
|
94.2% |
|
|
|
|
|
|
|
|
|
GPT-5.5 赢的战场:
|
|
|
|
|---|---|---|
|
|
82.7% |
|
|
|
73.1% |
|
|
|
89.3% |
|
|
|
78.7% |
|
说人话:Claude 4.7 在纯代码生成和 Agent 工具调用上领先;GPT-5.5 在终端操作、联网搜索和复杂指令执行上反超。
两个模型没有谁是全面压制对方的绝对王者。这一点,不管是哪边的粉丝,都要接受这个现实。
Opus 4.7 真正升级了什么?
除了评测数字,Anthropic 这次在能力层面做了几处值得关注的变化:
① 视觉能力提升 3 倍
图像分辨率上限从 1568px(1.15MP)升级到 2576px(3.75MP),像素数增加超过 3 倍。
高分辨率视觉评测 Visual Navigation(无工具模式):Opus 4.7 得 79.5%,Opus 4.6 只有 57.7%。
实际意义是:设计稿、密集型文档、截图分析,模型看到的信息密度大了很多;计算机操作 Agent 里,坐标输出现在直接映射到实际像素位置,消除了 4.6 时代的坐标偏移 bug。
② 新增 xhigh 推理强度
旧版 extended thinking 的 budget_tokens 参数已经被废弃(传这个参数现在直接返回 400 错误),代替它的是新的 adaptive thinking 系统,支持四个推理强度等级,最高是新加的 xhigh。
xhigh 模式下以 10 万 token 思考配额测试,SWE-bench 得分 71%,已经超过了 Opus 4.6 在最高配额下的成绩。
③ 自我验证能力
这是 Anthropic 在发布材料里特别强调的一个行为变化:Opus 4.7 会在完成任务之前主动验证自己的输出——写完代码先跑测试,确认结果正确再上报,而不是像 4.6 那样输出完就算结束。
Vercel 在测试时报告了一个新行为:“在开始写系统代码之前,会先做正确性证明”——这是 4.6 里完全没有观察到过的。对于多步骤 Agent 任务,这个机制减少了"看起来很有把握、实际结果错了"的情况。
④ Task Budgets(Beta)
新增 Beta 特性 task-budgets-2026-03-13,允许为整个 Agent 循环设置 token 预算,最低 2 万 token,模型会在规划时主动控制步骤数量,防止长任务无限跑偏。
有一件事你需要知道:价格没涨,但账单可能变了
官方标价没变:
但有个陷阱:Opus 4.7 更换了 tokenizer,同样的文本内容,新 tokenizer 会生成约 1.0 到 1.35 倍的 token 数量。
这意味着,以同样的 prompt 调用 4.7,实际消耗的 token 可能比 4.6 多 35%,账单也相应上涨。不同内容类型影响不同——代码类内容影响最明显,纯文本影响相对小。
GitHub Copilot 接入时,曾短暂将 Opus 4.7 标注为 7.5 倍 premium 请求乘数,这也引发了一波吐槽。
迁移建议:切换到 4.7 前,用真实流量做 A/B 测试,别光看官方定价做预算。
另外,temperature、top_p、top_k 等参数传非默认值现在会直接返回 400 错误,Anthropic 把采样策略完全收回了,旧有 prompt 里有这些参数的需要清理。
还有一个没开放的模型
说 Opus 4.7 是 Anthropic"最强"模型并不完全准确。
更准确的说法是:Opus 4.7 是 Anthropic 目前面向所有用户开放的最强模型。
Anthropic 在 4 月 7 日已经悄悄宣布了一个叫 Claude Mythos Preview 的模型,属于 Project Glasswing 计划,仅对受邀合作方开放,没有公开 API,也没有明确的开放时间表。
从 Anthropic 自己公布的数字来看,Mythos Preview 在几乎所有评测上都超过了 Opus 4.7:SWE-bench Pro 得 77.8%,OSWorld-Verified 得 79.6%,高过 GPT-5.5。但你现在用不到它。
这场王座争夺,往哪儿看?
拉开来看,2026 年 4 月的这两次发布,让我们看清楚了一件事:
没有哪个模型能在全部赛道上碾压对手了。
代码生成首选 Claude 4.7,终端操作和联网搜索 GPT-5.5 更强,多模态视觉 Gemini 还在争;定价策略上 DeepSeek 继续把每百万 token 的价格往地板打……
这反而是个好消息:开发者终于可以按场景选模型了,不用再押注"一个通吃一切"的赌注。
至于 OpenAI 的王座稳不稳——看你定义的"王座"是哪条赛道。
Claude Opus 4.7 现在在哪里用:
-
• Claude.ai(Pro/Max/Team/Enterprise) -
• Anthropic API: claude-opus-4-7 -
• Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry -
• GitHub Copilot -
• Cursor(已验证 CursorBench 从 58% → 70%)
本文数据来源:Anthropic 官方发布页(anthropic.com/news/claude-opus-4-7)、GitHub Changelog(2026-04-16)、Cursor 官方 CursorBench 报告、Digital Applied GPT-5.5 vs Opus 4.7 对比、Nerd Level Tech 独立评测,发布于 2026 年 4 月 25 日

