大数跨境

大模型的 思考档位 到底是怎么训练出来的

大模型的 思考档位 到底是怎么训练出来的 AIGC 深一度
2026-07-27
8

AI REASONING · 技术解读

2026.07

推理档位只是多生成几句话?

同一颗大脑, 为什么能切换

六档思考力


推理模型 · RLVR · SFT · 推理预算

Sebastian Raschka 技术博客解读

训练机制工程取舍

📦 6 Parts + Conclusion

👉 滑动

PART 01

档位真相

思考是什么

 

PART 03

训练机制

SFT 与 RLVR

 

PART 04

六家配方

开源模型实证

 

PART ///

写在最后

会停才聪明

这不是一个提示词技巧

模型先在训练中学会“怎么少想”和“怎么多想”,系统指令才有用。

今天的模型已经不只有“思考”和“不思考”两个按钮,而是出现了低、中、高乃至连续数值等多个档位。

表面看,这只是菜单里多了几个选项。真正值得追问的是:权重没有变化,同一个模型为什么会因为一个档位指令,就改变思考长度、回答质量速度和价格?答案藏在监督微调、可验证奖励强化学习和推理预算三套机制里。

01

PART


“思考”到底是什么

REASONING · DEFINITION

先拆掉一个最常见的误解。所谓“推理模型”,并不是机器突然拥有了人类式思维,而是模型会在最终答案之前,生成一段中间推理轨迹。它可能尝试、回退、自我检查,再给出最后结论。

很多开源模型用<think></think>包住这段过程。但这两个标记本身没有魔法,它们只是告诉训练系统和界面:哪里是推理轨迹,哪里是最终答案。真正让模型学会推理的,是背后的训练信号。

— 普通大模型直接作答,推理模型会先生成中间推理轨迹

在 RLVR 训练中,系统通常只需判断最终答案对不对、格式合不合规,并不逐句教模型应该怎样思考。模型在反复试错中,自己找到更容易拿到奖励的推理路径。

02

PART


六档不是六个模型

EFFORT · INFERENCE SCALING

理解推理强度,首先要分清两根完全不同的旋钮。第一根是选择哪个模型,它会切换到另一套已经训练好的权重;第二根是给同一个模型多少推理预算,权重不变,只允许它在回答前花更多或更少计算。

— 同一个模型可以暴露多个推理强度档位

换模型

切换权重与能力上限

×

调强度

分配推理时计算

找甜点位

平衡质量、价格与速度

模型大小和推理强度,是两条独立的扩展轴

这会带来一个反直觉结果:在某些基准上,较小模型配高推理强度,可能接近较大模型配低推理强度的表现。当然,这不是普遍定律,曲线会随任务、计价方式和评测集变化。

— 沿同一条曲线移动是调推理强度,跨曲线移动是换模型

03

PART


推理强度怎么训练出来

TRAINING · SFT + RLVR

一个普通模型不会天然理解“低强度”和“高强度”。想让这几个标签真正控制行为,通常要在后训练阶段,把档位信号和不同长度、不同质量的回答配对。公开资料显示,主流方法大致有三种,而且经常混合使用。

1

监督微调:给模型看成对样本。低档位对应短而直接的答案,高档位对应更长的推理轨迹,让模型学会“标签—行为”映射。

2

带长度成本的 RLVR:答案正确会加分,每生成一个 Token 付出成本。低档位的单位成本更高,高档位的单位成本更低。

3

硬推理预算服务端给出最大 Token 上限,到点就要求模型结束推理并转入最终回答。有些模型还会专门训练“被截断后如何收尾”。

...concept

R(e) = R_task − λ(e) × N_tokens

low effort:λ 更大,鼓励更短回答

high effort:λ 更小,允许更长推理

这里的公式只是概念化表达,不代表某家公司的真实奖励函数。关键思想是:同一个正确答案,在不同档位下要支付不同的长度成本。

— 两种常见实现:在 SFT 中配对不同长度样本,或在 RLVR 中改变 Token 成本

因此,界面里的档位最终可能只被转换成一句系统指令,但这句指令之所以有效,是因为模型早已在训练中见过它,并为它形成了稳定行为。把同样指令塞给一个没受过这种训练的模型,不会凭空得到同样效果。

— 随档位升高,输出 Token 和准确率通常一起上升,但增益并不均匀

04

PART


六家模型,六种配方

RECIPES · OPEN WEIGHTS

厂商很少公开闭源模型的完整训练细节,但近年的开放权重模型已经留下足够多证据。它们没有统一答案,而是把模式学习、长度惩罚、硬预算和蒸馏拼成不同组合。


DeepSeek V4:先训专家,再蒸馏进一个模型

不同档位使用不同上下文窗口和长度惩罚,再通过在线蒸馏合并成统一检查点。看似一句系统指令,背后其实对应不同的后训练策略。


Nemotron 3 Ultra:学习模式,再叠加硬预算

它不仅学习常规和中等强度,还用随机截断的推理轨迹训练“提前结束后如何作答”,让服务端的 Token 上限不至于把答案直接切坏。


Kimi K2.5:在短约束和自由推理之间切换

Toggle 方法交替进行预算阶段和无约束阶段。公开报告显示,它把生成 Token 减少约 25% 至 30%,同时尽量保住长推理能力与总体表现。

— Kimi K2.5 的 Toggle:预算训练与无约束训练交替进行


Qwen3 与 GLM-5:把“想”和“不想”混进训练数据

Qwen3 用思考与非思考样本做模式融合;GLM-5 进一步支持按轮次开关、工具调用前思考,以及跨轮保留推理状态。控制粒度从一次回答走向整个 Agent 流程。


Inkling:把档位变成 0 到 1 的连续旋钮

它在大规模异步强化学习中加入连续 effort 数值,并随数值调整 Token 成本。相比“低、中、高”,连续控制更像真正的资源调度接口。

— 六种开放权重模型的训练机制与推理控制对比

05

PART


想得越久,未必越聪明

TRADEOFF · COST + QUALITY

更高推理强度通常意味着更多 Token、更高延迟和更高价格,准确率也往往上升。但收益会逐渐变平,甚至出现过度思考、绕远路和反复自我怀疑。如果一道题本来一步就能解决,强行写满几千 Token 不是能力,而是浪费。

推理档位不是“质量按钮”,而是一份计算预算。高档位提高的是解决难题的机会,不保证每次都更正确。

普通用户怎么选

低强度

提取、分类、改格式

中强度

写作、总结、一般分析

高强度

复杂代码、证明、长程 Agent

更稳妥的原则是按任务难度、错误代价和时间预算来选。面对医疗、法律、财务等高风险问题,档位再高也不能替代专业核验;面对简单重复任务,也没必要每次都把推理拉满。

06

PART


下一步,是让系统自己分配

ROUTING · AUTO EFFORT

手动选择只是第一阶段。更理想的系统会先用一个便宜的路由器判断任务:它有多难、出错有多贵、还剩多少时间、已经调用了哪些工具,再自动决定用哪个模型和多少推理预算。

识别任务

难度与类型

估算风险

错误代价与置信度

动态分配

模型、Token 与工具

未来的推理强度,更像 Agent 系统里的实时资源调度

这也是近年自适应推理研究的方向:用户不必提前知道一道题需要多少 Token,模型根据当前问题难度自行调节。真正成熟的 AI,不应该所有问题都“想满”,而应该把有限计算花在最值得的地方

///

LAST


写在最后

CONCLUSION · KNOW WHEN TO STOP

推理强度的意义,不是给产品再加一个参数,而是把过去藏在模型内部的计算预算,变成一个可以控制、评估和调度的工程接口。

最聪明的模型,不一定永远想得最久,而是知道什么时候该继续,什么时候该停。

从这个角度看,低、中、高档位只是过渡形态。终点不是让用户学会调旋钮,而是让模型和 Agent 在质量、延迟与成本之间,自动找到每个任务的最佳落点。

✦ 资料说明

本文参考 Sebastian Raschka 的技术长文,以及 Qwen3、Kimi K2.5、L1、Control-R、e1 等公开论文与技术报告。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

👍
点赞
👀
在看
转发

THANKS FOR READING


【声明】内容源于网络
0
0
AIGC 深一度
专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
内容 588
粉丝 0
AIGC 深一度 专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
总阅读6.7k
粉丝0
内容588