516。
不是什么神秘代码,不是彩蛋。这是GPT-5.5推理Token的死亡线——一到这个数,思考就断,答案就错。开发者翻遍后台数据,越看越心凉。
署名:蓝核科技
39万条记录翻出来的精准卡死
Codex开发者@vguptaa45干了件狠事:翻遍后台元数据,39万条token记录、865个session,一个一个数。推理Token精准卡在516上的事件,发生了3363次。
不是"大约516",不是"接近516"。是精确等于516,3363次。这个精度本身就不正常——自然推理的token分布该是连续的、随机的,不会扎堆撞同一个整数。就像抛一万次硬币,不可能每次正面朝上。
📌 截图转发给你司用GPT-5.5的同事——答案可能都是错的。
33.6倍:不是波动,是硬限制
更炸裂的对比:GPT-5.5只占全部响应量19.3%,却包揽82.0%的"精准516"事件。每5次响应里只有1次是GPT-5.5给的,但每5次"卡在516"里,有4次都是它干的。
再看比例:GPT-5.5的"精准516/≥516"比例44.0%,GPT-5.2只有0.34%。差33.6倍。这不是随机波动能解释的——33.6倍,是系统性硬限制。
一把梳子:518步长的截断序列
还不止516。@vguptaa45发现了一整把"梳子":1034、1552、2070、2588、3106……步长518,每隔518一档,精准聚集。
这种等差数列式的聚集,几乎可以确定是某种硬编码的推理预算上限——推理引擎跑到阈值就强制截断,不管想没想完。516是最小档位,也是最常命中的那个。
📌 把518步长这事转给AI基础设施团队——这不是bug,是架构决策留下的痕迹。
516越扎堆,推理越缩水
最诡异的数据来了:516聚集变强的同时,整体推理强度反而在缩水。
5月516比例冲到53.30%,但平均推理token只有106.9。一半响应卡在516,平均才107——说明大量响应根本没认真推理就到了上限被掐了。这不是"推理能力波动",这是推理管道被拧小了。
糖果题:516截断=100%错误率
拿一道经典糖果分配题实测。正确答案21。GPT-5.5跑到516 token就截断,答29——错。同一个题跑够几千token,答21——对。
10次运行,4次触发516截断,每次都输出错误答案,100%错误率。推理不够就硬截,硬截就出错,出错还不知道自己出错了。模型不知道自己没想完——这才是最可怕的。
📌 转发给每个给GPT-5.5付钱的人——你买的深度推理,可能在静默降级。
开发者社区全面炸锅
GitHub Issue #30364评论区100多条,多人独立复现。Reddit同步炸锅。
开发者的质疑很直接:推理预算被限?路由问题?截断?fallback?还是调度器在搞鬼?每种猜测都指向同一个事实——GPT-5.5的推理过程存在系统性干预,不是偶发bug。
暗线:你以为在深度推理,实际在跑快出模式
还有一条更阴的暗线。有用户发现选了GPT-5.5 Extended Thinking模式,系统实际执行的却是Instant版本。界面标签不变——你以为在深度推理,实际跑的是快出模式。
Plus用户每3小时160条用完后,自动切到mini模型,无提示,无告知,静默降级。付了Plus的钱,以为在用最强的脑,实际在跑最弱的版本,标签还是"GPT-5.5"。
这已经不是技术问题了。
OpenAI:一句话没有
Issue开了,Reddit炸了,39万条数据摆了,OpenAI至今未官方回应。516的事,一句话没有。
516截断到底是bug还是feature?推理预算硬限算不算对付费用户的欺骗?Extended Thinking偷换Instant又该算什么?评论区聊聊。

