大数跨境

Claude Opus 4.7 突袭!代码能力登顶 SOTA,OpenAI 的"王座"还稳吗?

Claude Opus 4.7 突袭!代码能力登顶 SOTA,OpenAI 的"王座"还稳吗? 老班长聊电商
2026-04-27
3
导读:四月的 AI 圈,七天内两颗炸弹。Anthropic 先扔,OpenAI 接着扔。一场王座争夺战,打得比任何时候都激烈。


四月的 AI 圈,七天内两颗炸弹。Anthropic 先扔,OpenAI 接着扔。一场王座争夺战,打得比任何时候都激烈。


七天,两颗炸弹

4 月 16 日,Anthropic 发布 Claude Opus 4.7。

7 天后,4 月 23 日,OpenAI 发布 GPT-5.5。

这是 2026 年 AI 旗舰模型发布节奏最密集的一周——两个实验室各自拿出了当前最强的"可用"大模型,正面列阵。

先说结论,不绕弯:

代码能力,Claude Opus 4.7 在 GPT-5.5 发布前的窗口期里,确实拿到了 SOTA。但 GPT-5.5 上线后,局面更复杂——每个模型都有自己赢的战场。

这篇文章不捧任何一家,只讲数字。


Claude Opus 4.7:代码评测的真实成绩

Claude Opus 4.7 于 2026 年 4 月 16 日正式发布,Anthropic 将其定位为当前面向所有用户开放的最强模型,在代码、Agent、视觉推理三条线上全面升级。

先看最核心的代码评测。

SWE-bench Pro——衡量模型能否真实解决 GitHub Issue 并生成能跑通测试的 PR,这是业内公认最接近真实软件工程场景的 coding 基准:

模型
SWE-bench Pro 得分
Claude Opus 4.7 64.3%
GPT-5.4
57.7%
Gemini 3.1 Pro
54.2%
Claude Opus 4.6
53.4%

4.7 领先 GPT-5.4 整整 6.6 个百分点,领先 Gemini 3.1 Pro 超过 10 个百分点。

SWE-bench Verified(标准版):Opus 4.7 从 4.6 的 80.8% 跳升到 87.6%,提升了 6.8 个百分点。

CursorBench,Cursor 团队自测的真实代码场景评测:Opus 4.7 从 58% 提升到 70%,这是 Cursor 发布以来同款评测单次最大涨幅,Cursor 官方用"our strongest generally available coding/agentic model"来描述它。

其他亮点评测:

  • • GPQA Diamond(科学推理):94.2%,超越 Opus 4.6 的 91.3%
  • • Finance Agent:64.4%,发布时为行业 SOTA
  • • OSWorld-Verified(计算机操作):78.0%,高于 Opus 4.6 的 72.7%

GPT-5.5 来了,王座换人了吗?

7 天后 GPT-5.5 上线,形势发生了变化。

直接看数字对比(来源:各平台公开评测及官方文档):

Claude Opus 4.7 赢的战场:

评测
Claude 4.7
GPT-5.5
SWE-bench Pro
64.3%
未公布对标数据
GPQA Diamond
94.2%
—
OSWorld-Verified
78.0%
78.7% ▸ GPT-5.5
MCP-Atlas 工具调用
领先 GPT-5.4 约 9.2%
—

GPT-5.5 赢的战场:

评测
GPT-5.5
Claude 4.7
Terminal-Bench 2.0
82.7%
69.4%
Expert-SWE
73.1%
—
BrowseComp(联网搜索)
89.3%
79.3%
OSWorld-Verified
78.7%
78.0%

说人话:Claude 4.7 在纯代码生成和 Agent 工具调用上领先;GPT-5.5 在终端操作、联网搜索和复杂指令执行上反超。

两个模型没有谁是全面压制对方的绝对王者。这一点,不管是哪边的粉丝,都要接受这个现实。


Opus 4.7 真正升级了什么?

除了评测数字,Anthropic 这次在能力层面做了几处值得关注的变化:

① 视觉能力提升 3 倍

图像分辨率上限从 1568px(1.15MP)升级到 2576px(3.75MP),像素数增加超过 3 倍。

高分辨率视觉评测 Visual Navigation(无工具模式):Opus 4.7 得 79.5%,Opus 4.6 只有 57.7%。

实际意义是:设计稿、密集型文档、截图分析,模型看到的信息密度大了很多;计算机操作 Agent 里,坐标输出现在直接映射到实际像素位置,消除了 4.6 时代的坐标偏移 bug。

② 新增 xhigh 推理强度

旧版 extended thinking 的 budget_tokens 参数已经被废弃(传这个参数现在直接返回 400 错误),代替它的是新的 adaptive thinking 系统,支持四个推理强度等级,最高是新加的 xhigh。

xhigh 模式下以 10 万 token 思考配额测试,SWE-bench 得分 71%,已经超过了 Opus 4.6 在最高配额下的成绩。

③ 自我验证能力

这是 Anthropic 在发布材料里特别强调的一个行为变化:Opus 4.7 会在完成任务之前主动验证自己的输出——写完代码先跑测试,确认结果正确再上报,而不是像 4.6 那样输出完就算结束。

Vercel 在测试时报告了一个新行为:“在开始写系统代码之前,会先做正确性证明”——这是 4.6 里完全没有观察到过的。对于多步骤 Agent 任务,这个机制减少了"看起来很有把握、实际结果错了"的情况。

④ Task Budgets(Beta)

新增 Beta 特性 task-budgets-2026-03-13,允许为整个 Agent 循环设置 token 预算,最低 2 万 token,模型会在规划时主动控制步骤数量,防止长任务无限跑偏。


有一件事你需要知道:价格没涨,但账单可能变了

官方标价没变: 5 / 百万 i n p u t t o k e n s , 5 / 百万 input tokens,25 / 百万 output tokens。

但有个陷阱:Opus 4.7 更换了 tokenizer,同样的文本内容,新 tokenizer 会生成约 1.0 到 1.35 倍的 token 数量。

这意味着,以同样的 prompt 调用 4.7,实际消耗的 token 可能比 4.6 多 35%,账单也相应上涨。不同内容类型影响不同——代码类内容影响最明显,纯文本影响相对小。

GitHub Copilot 接入时,曾短暂将 Opus 4.7 标注为 7.5 倍 premium 请求乘数,这也引发了一波吐槽。

迁移建议:切换到 4.7 前,用真实流量做 A/B 测试,别光看官方定价做预算。

另外,temperature、top_p、top_k 等参数传非默认值现在会直接返回 400 错误,Anthropic 把采样策略完全收回了,旧有 prompt 里有这些参数的需要清理。


还有一个没开放的模型

说 Opus 4.7 是 Anthropic"最强"模型并不完全准确。

更准确的说法是:Opus 4.7 是 Anthropic 目前面向所有用户开放的最强模型。

Anthropic 在 4 月 7 日已经悄悄宣布了一个叫 Claude Mythos Preview 的模型,属于 Project Glasswing 计划,仅对受邀合作方开放,没有公开 API,也没有明确的开放时间表。

从 Anthropic 自己公布的数字来看,Mythos Preview 在几乎所有评测上都超过了 Opus 4.7:SWE-bench Pro 得 77.8%,OSWorld-Verified 得 79.6%,高过 GPT-5.5。但你现在用不到它。


这场王座争夺,往哪儿看?

拉开来看,2026 年 4 月的这两次发布,让我们看清楚了一件事:

没有哪个模型能在全部赛道上碾压对手了。

代码生成首选 Claude 4.7,终端操作和联网搜索 GPT-5.5 更强,多模态视觉 Gemini 还在争;定价策略上 DeepSeek 继续把每百万 token 的价格往地板打……

这反而是个好消息:开发者终于可以按场景选模型了,不用再押注"一个通吃一切"的赌注。

至于 OpenAI 的王座稳不稳——看你定义的"王座"是哪条赛道。


Claude Opus 4.7 现在在哪里用:

  • • Claude.ai(Pro/Max/Team/Enterprise)
  • • Anthropic API:claude-opus-4-7
  • • Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry
  • • GitHub Copilot
  • • Cursor(已验证 CursorBench 从 58% → 70%)

本文数据来源:Anthropic 官方发布页(anthropic.com/news/claude-opus-4-7)、GitHub Changelog(2026-04-16)、Cursor 官方 CursorBench 报告、Digital Applied GPT-5.5 vs Opus 4.7 对比、Nerd Level Tech 独立评测,发布于 2026 年 4 月 25 日


【声明】内容源于网络
0
0
老班长聊电商
1234
内容 50
粉丝 0
老班长聊电商 1234
总阅读5
粉丝0
内容50