大数跨境

突发,OpenAI GPT-6跑分作弊被抓包了!

突发,OpenAI GPT-6跑分作弊被抓包了! 新智元
2026-09-06
13

新智元报道


GPT-6 Astra 的跑分数据引发争议。外媒发现,OpenAI 官方博客上线前后,多项评测数据出现异常波动:Astra 的幻觉率曾从 4.2% 降至 2.0% 后恢复;竞品 Anthropic Claude 的数学成绩曾被调低近 10 个百分点;ARC-AGI-3 得分则从媒体预热稿中的 98.6% 跃升至官宣的 99.99%。

面对“作弊”质疑,OpenAI 未予正面回应,内部仍视 GPT-6 Astra 为首个真正的 AGI。知情人士透露,在全面开放前,Astra 是公司的核心底牌,其内部应用已显著提升研发效率,推动部分产品计划提前半年。业界普遍期待其在 9 月 29 日 DevDay 上的进一步发布。

GPT-6 跑分异常与数据修正争议

事件源于 9 月 4 日 OpenAI 原定发布的 GPT-6 Astra 博文罕见推迟两小时,链接一度显示 404。奥特曼随后在社交平台解释为“小插曲”。然而后续发现,博客上线后多项基准测试数据经历了多次调整。

具体而言,Astra 的幻觉率在美东时间下午 2:23 的快照中为 4.2%,三小时后变为 2.0%,经外界质疑后又恢复原值。竞品 Fable 5.1 在 FrontierMath Tier 4 (v2) 上的成绩也从 87.8% 先降至 78%,再回调至 83%,客观上突显了 Astra 的优势。此外,ARC-AGI-3 得分从预热阶段的 98.6% 提升至正式发布的 99.99%。

OpenAI 发言人辩称,此为“消除噪点的常态修正”,指出同一模型在不同配套系统下表现差异巨大。这引发了关于"Benchmaxxing"(通过反复调整条件追求最高分)的讨论:若只展示最佳配置下的成绩而不披露前提条件,极易误导公众将上限视为默认水平。

Astra 模型特性与官方提示词优化

官方发布的 GPT-6 Astra 提示词指南揭示了模型的一些特性及应对策略,并未回避其不足之处。

过度追问与行动力不足

Astra 倾向于在指令模糊时停止并反问,导致长流程任务中断。官方建议开发者在 System Prompt 中加入“行动偏好指令”,明确要求模型直接输出可复查的最终成果,避免提出计划、询问确认或提供折中方案。

当用户的提示词表达了行动诉求时(如“你能否……"、“我想……"、“帮我……"等类似表述),应将其视作开展工作并采取行动的明确指令。不要仅停留在确认自身能力、提出计划或询问是否继续。如果一项任务需要持续推进,请完成全部必要的工作,直到达成预期的最终成果。

上下文与技能文件冲突

模型对AGENTS.md等外部 Skill 指令高度敏感,指令冲突可能导致停滞。为此,OpenAI 提供了调试 Prompt,要求模型在卡顿时明确指出引发中断的具体文件及行号。

如果某个技能导致你请求许可或确认、暂停、未完成所要求的工作、或偏离了用户的意图,请指明并链接到你所阅读的具体 SKILL.md 文件,引用相关指令,并简要解释其如何适用。

流程冗余与协作割裂

在执行代码任务时存在“过度测试”现象,消耗大量 Token;子 Agent 间缺乏有效联动。为解决此问题,OpenAI 列出了“AI 泔水词”黑名单,旨在去除机械化的表达方式。

  • 高频行话:禁用 delve into、foster、leverage 等典型"AI 味”词汇。
  • 机械句式:封杀“值得注意的是……"、“这不是 A 而是 B"等反差句式。
  • 套板反应:剔除“总结/结论”等标签化套话。
避免在结论中使用如"Bottom Line:"这类套话,或"delve"、"foster"、"leverage"、"it's worth noting"、"importantly"、自问自答句式、"This isn't about X. It's about Y."等表达。不要使用总结性的收尾陈述,如"In short:.."、"The simplest mental model is:..."。直接陈述拟执行的操作,避免提及不会做什么或将如何分类结果。不使用对比式结构(如"X, not Y"),不使用自创的复合标签及含糊的限定词。

这些措施表明,当前大模型的榜单成绩已不仅是“裸模型能力”的体现,提示词工程、Agent 编排、工具调用及检查点选择等因素均能显著影响最终结果。

递归自我改进与未来演进路线

跑分风波背后,折射出 OpenAI 在技术竞争中的紧迫局势。据技术博主@imjustnewatai 披露,OpenAI 数月前已进入递归自我改进(RSI)的早期阶段:Sol 协助训练 Astra,Astra 进而辅助训练 Doug 和 Bel,Doug 再参与下一代模型研发。

内部消息称,作为更大规模基座的 Doug 正接管下一代模型的训练。Astra 之后的重大发布将不再是常规迭代,而是直接冠名"AGI"的新版本,预计于 11 月中旬亮相。该版本将具备人类级通用理解力、全领域专家表现及更高维度的递归迭代能力。而全面超越人类任务处理上限的“终极版”已排期至 2027 年中下旬。

与此同时,Anthropic 也在筹备代号"Model 2"及基于 RSI 的新模型,下半年大模型领域的竞争将愈发激烈。

新智元"ASI 坐标系”即将上线

鉴于榜单数据的易变性,持续追踪技术动态显得尤为重要。新智元将于成立十一周年之际,正式发布全新的"ASI 坐标系”。

该体系将每日值得关注的模型、公司、技术突破及热点事件纳入持续更新的评估框架。模型评估被拆解为七个维度:智能、推理、知识、编码、Agent、生态、经济。下设 29 项二级指标,数据源自 LMArena、MathArena、Terminal-Bench、SWE-bench、Mercor APEX、OpenRouter、GitHub 等公开渠道,经统一处理后生成周总榜。

智能、推理、知识、编码、Agent、生态、经济。

周总榜采用的七维权重分别为:智能 12、推理 15、知识 14、编码 14、Agent 15、生态 20、经济 10。同一套底层数据支持针对编程、Agent、性价比等不同场景进行重新加权,无需重复构建数据集。

"ASI 坐标系”是新网站的核心组成部分。面对 AI 技术的极速迭代,新智元推出了三大功能模块:

  • 秒追 ASI:实时跟踪最新快讯。
  • ASI 爆点:串联重大事件的相关脉络。
  • 图追 ASI:可视化呈现长期技术变迁。

随着递归自我改进技术的落地,模型迭代周期将进一步缩短,传统半年更新一次的榜单将难以适应现状。新智元旨在打造一张随前沿技术同步移动的“地图”,记录谁在崛起、谁在掉队,以及下一个技术拐点的诞生。

参考资料:

https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement/

https://developers.openai.com/api/docs/guides/latest-model

编辑:桃子

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16521
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读381.3k
粉丝0
内容16.5k