AI REASONING · 技术解读 2026.07
推理档位只是多生成几句话?
同一颗大脑, 为什么能切换
六档思考力
推理模型 · RLVR · SFT · 推理预算
Sebastian Raschka 技术博客解读
📦 6 Parts + Conclusion
👉 滑动
PART 01
档位真相
思考是什么
PART 03
训练机制
SFT 与 RLVR
PART 04
六家配方
开源模型实证
PART ///
写在最后
会停才聪明
这不是一个提示词技巧
模型先在训练中学会“怎么少想”和“怎么多想”,系统指令才有用。
今天的模型已经不只有“思考”和“不思考”两个按钮,而是出现了低、中、高乃至连续数值等多个档位。
表面看,这只是菜单里多了几个选项。真正值得追问的是:权重没有变化,同一个模型为什么会因为一个档位指令,就改变思考长度、回答质量、速度和价格?答案藏在监督微调、可验证奖励强化学习和推理预算三套机制里。
01
PART
“思考”到底是什么
REASONING · DEFINITION
先拆掉一个最常见的误解。所谓“推理模型”,并不是机器突然拥有了人类式思维,而是模型会在最终答案之前,生成一段中间推理轨迹。它可能尝试、回退、自我检查,再给出最后结论。
很多开源模型用<think>和</think>包住这段过程。但这两个标记本身没有魔法,它们只是告诉训练系统和界面:哪里是推理轨迹,哪里是最终答案。真正让模型学会推理的,是背后的训练信号。
— 普通大模型直接作答,推理模型会先生成中间推理轨迹
在 RLVR 训练中,系统通常只需判断最终答案对不对、格式合不合规,并不逐句教模型应该怎样思考。模型在反复试错中,自己找到更容易拿到奖励的推理路径。
02
PART
六档不是六个模型
EFFORT · INFERENCE SCALING
理解推理强度,首先要分清两根完全不同的旋钮。第一根是选择哪个模型,它会切换到另一套已经训练好的权重;第二根是给同一个模型多少推理预算,权重不变,只允许它在回答前花更多或更少计算。
— 同一个模型可以暴露多个推理强度档位
换模型
切换权重与能力上限
调强度
分配推理时计算
找甜点位
平衡质量、价格与速度
模型大小和推理强度,是两条独立的扩展轴
这会带来一个反直觉结果:在某些基准上,较小模型配高推理强度,可能接近较大模型配低推理强度的表现。当然,这不是普遍定律,曲线会随任务、计价方式和评测集变化。
— 沿同一条曲线移动是调推理强度,跨曲线移动是换模型
03
PART
推理强度怎么训练出来
TRAINING · SFT + RLVR
一个普通模型不会天然理解“低强度”和“高强度”。想让这几个标签真正控制行为,通常要在后训练阶段,把档位信号和不同长度、不同质量的回答配对。公开资料显示,主流方法大致有三种,而且经常混合使用。
监督微调:给模型看成对样本。低档位对应短而直接的答案,高档位对应更长的推理轨迹,让模型学会“标签—行为”映射。
带长度成本的 RLVR:答案正确会加分,每生成一个 Token 付出成本。低档位的单位成本更高,高档位的单位成本更低。
硬推理预算:服务端给出最大 Token 上限,到点就要求模型结束推理并转入最终回答。有些模型还会专门训练“被截断后如何收尾”。
这里的公式只是概念化表达,不代表某家公司的真实奖励函数。关键思想是:同一个正确答案,在不同档位下要支付不同的长度成本。
— 两种常见实现:在 SFT 中配对不同长度样本,或在 RLVR 中改变 Token 成本
因此,界面里的档位最终可能只被转换成一句系统指令,但这句指令之所以有效,是因为模型早已在训练中见过它,并为它形成了稳定行为。把同样指令塞给一个没受过这种训练的模型,不会凭空得到同样效果。
— 随档位升高,输出 Token 和准确率通常一起上升,但增益并不均匀
04
PART
六家模型,六种配方
RECIPES · OPEN WEIGHTS
厂商很少公开闭源模型的完整训练细节,但近年的开放权重模型已经留下足够多证据。它们没有统一答案,而是把模式学习、长度惩罚、硬预算和蒸馏拼成不同组合。
DeepSeek V4:先训专家,再蒸馏进一个模型
不同档位使用不同上下文窗口和长度惩罚,再通过在线蒸馏合并成统一检查点。看似一句系统指令,背后其实对应不同的后训练策略。
Nemotron 3 Ultra:学习模式,再叠加硬预算
它不仅学习常规和中等强度,还用随机截断的推理轨迹训练“提前结束后如何作答”,让服务端的 Token 上限不至于把答案直接切坏。
Kimi K2.5:在短约束和自由推理之间切换
Toggle 方法交替进行预算阶段和无约束阶段。公开报告显示,它把生成 Token 减少约 25% 至 30%,同时尽量保住长推理能力与总体表现。
— Kimi K2.5 的 Toggle:预算训练与无约束训练交替进行
Qwen3 与 GLM-5:把“想”和“不想”混进训练数据
Qwen3 用思考与非思考样本做模式融合;GLM-5 进一步支持按轮次开关、工具调用前思考,以及跨轮保留推理状态。控制粒度从一次回答走向整个 Agent 流程。
Inkling:把档位变成 0 到 1 的连续旋钮
它在大规模异步强化学习中加入连续 effort 数值,并随数值调整 Token 成本。相比“低、中、高”,连续控制更像真正的资源调度接口。
— 六种开放权重模型的训练机制与推理控制对比
05
PART
想得越久,未必越聪明
TRADEOFF · COST + QUALITY
更高推理强度通常意味着更多 Token、更高延迟和更高价格,准确率也往往上升。但收益会逐渐变平,甚至出现过度思考、绕远路和反复自我怀疑。如果一道题本来一步就能解决,强行写满几千 Token 不是能力,而是浪费。
推理档位不是“质量按钮”,而是一份计算预算。高档位提高的是解决难题的机会,不保证每次都更正确。
普通用户怎么选
低强度
提取、分类、改格式
中强度
写作、总结、一般分析
高强度
复杂代码、证明、长程 Agent
更稳妥的原则是按任务难度、错误代价和时间预算来选。面对医疗、法律、财务等高风险问题,档位再高也不能替代专业核验;面对简单重复任务,也没必要每次都把推理拉满。
06
PART
下一步,是让系统自己分配
ROUTING · AUTO EFFORT
手动选择只是第一阶段。更理想的系统会先用一个便宜的路由器判断任务:它有多难、出错有多贵、还剩多少时间、已经调用了哪些工具,再自动决定用哪个模型和多少推理预算。
识别任务
难度与类型
估算风险
错误代价与置信度
动态分配
模型、Token 与工具
未来的推理强度,更像 Agent 系统里的实时资源调度
这也是近年自适应推理研究的方向:用户不必提前知道一道题需要多少 Token,模型根据当前问题难度自行调节。真正成熟的 AI,不应该所有问题都“想满”,而应该把有限计算花在最值得的地方。
///
LAST
写在最后
CONCLUSION · KNOW WHEN TO STOP
推理强度的意义,不是给产品再加一个参数,而是把过去藏在模型内部的计算预算,变成一个可以控制、评估和调度的工程接口。
最聪明的模型,不一定永远想得最久,而是知道什么时候该继续,什么时候该停。
从这个角度看,低、中、高档位只是过渡形态。终点不是让用户学会调旋钮,而是让模型和 Agent 在质量、延迟与成本之间,自动找到每个任务的最佳落点。
✦ 资料说明
本文参考 Sebastian Raschka 的技术长文,以及 Qwen3、Kimi K2.5、L1、Control-R、e1 等公开论文与技术报告。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING








