大数跨境

一文梳理2026大模型后训练:5条路径、22篇必读论文

一文梳理2026大模型后训练:5条路径、22篇必读论文 魔方AI空间
2026-09-15
3
导读:过去半年,大模型后训练领域的变化,比之前三年加起来还大。我花了整整两周,把最近半年后训练方向的新论文几乎翻了一遍。
过去半年,大模型后训练领域的变化,比之前三年加起来还大。

我花了整整两周,把最近半年后训练方向的新论文几乎翻了一遍。翻完之后最大的感受是:配方变了,而且不是小修小补,是范式级别的更换。

最典型的信号是——现在你问一个做后训练的人「你们怎么训的」,答案不再是「一个大模型 + 一套 RL pipeline」,而是「先训 N 个领域专家,再蒸馏合并回一个通用模型」。

这句话在 2025 年底说出来,会被认为是奇技淫巧。在 2026 年说出来,是标准答案。

下面我把这半年的变化,梳理成 5 条路径。每条路径我都附上了必读论文。

如果你不想一篇篇找这些论文,也可以用我这个可交互的在线学习资料

·22 篇论文,全部核验过 arXiv 编号和开源仓库

·5 条路径拆解,每篇配一句话核心贡献

·可勾选的学习进度表,读完一篇打一个勾

·按依赖关系排好的推荐阅读顺序

图片


需要的朋友,加小助理微信,发送「后训练」获取

图片

变化 01

从一个模型,到一群专家

过去我们默认:后训练就是拿一个基座模型,数学 RL、代码 RL、agent 能力 RL 全都塞进同一个 run 里一起训。

问题在于,这三种能力会互相打架

数学要求模型严谨收敛,代码希望它多探索不同实现,agentic 任务又需要它长程规划——放在一起训,就是典型的跷跷板:这边涨了那边掉,成本还高得离谱。

2026 年的解法很反直觉:别放在一起训了,分开训。

这个范式的提出者是小米的 MiMo-V2-Flash 技术报告,叫 MOPD(Multi-Teacher On-Policy Distillation)。它的做法是:领域专家作为教师,学生模型采样自己的轨迹,用逐 token 的反向 KL 加上结果奖励联合优化。

图片

变化 02

在线蒸馏,正在成为 RL 的"廉价替代"

RL 的问题是奖励太稀疏——模型吭哧吭哧写 2000 个 token,最后只拿到一个"对/错"的信号。中间那么多步推理,哪些走对了、哪些走偏了,全都没反馈。

在线蒸馏不一样:教师模型对学生的每一个 token 都给出密集反馈。

一次 RL run 大概 17,920 GPU 时,而在线蒸馏只需约 1,800 GPU 时。差不多是 10 倍的差距。

图片

变化 03

RLVR 进入"精细化"阶段

如果说 2025 年 RLVR 的关键词是"堆算力",2026 年上半年就换成了三个字:更聪明

具体聪明在哪?六个小方向,一个一个说。

熵坍缩——模型越训越窄

训着训着,模型的输出越来越同质化,多样性掉光,最后只会一种解法。这是 RLVR 最普遍的病。

主流做法是"把熵拉高",但粗暴拉高会让模型开始胡说。STEER 换了个思路:推导出 token 级别的熵变解析式,只对"熵变剧烈"的那些 token 做重加权限速。

Qwen2.5-Math-7B 上,平均分从 44.2 提到 48.6。这篇拿了 ACL 2026 杰出论文

图片

探索不够——轨迹都长一个样

同一个 prompt 采样 16 次,16 条轨迹几乎一模一样,等于白采样。

I²B-LPO 的做法很有意思:找到推理中的"高熵犹豫节点"(模型真正纠结的地方),在那里注入潜变量,逼推理分叉;再用信息瓶颈给自己发奖励,把无效轨迹过滤掉。

准确率 +5.3%,多样性 +7.4%。

图片

选题——哪些题值得花算力

rollout 太贵,但大部分题对模型来说要么太简单(学不到)、要么太难(学不会)。

GPS 训了一个只有 20M 的小模型,跨 prompt 共享"难度知识",按"中等难度优先 + 多样性"选题。最多省 69% 的 rollout。

图片

能力边界坍缩——pass@1 涨了,pass@256 反而降

你在训练集上 pass@1 一直涨,很开心。但去看 pass@256,可能反而比基座模型还低。模型没变强,只是把已经会的东西概率调高了,原来有希望做对的难题,现在彻底不会了。

Boundary-Aware Curriculum RL 用 pass@256 定位模型真正的能力边界,对"边界上的题"做定向引导。pass@256 平均 +9.8 个百分点

图片

遗忘——推理涨了,通用能力掉了

推理能力上去了,但写文案、做翻译、日常对话都变笨了。

RECAP 的做法是回放通用数据,再按"目标收敛度"和"不稳定性"动态重加权。通用能力保住了,推理还更好。

图片

参数效率——0.5% 参数干全参的活

GeoRA 有个很漂亮的观察:RLVR 带来的参数更新是稀疏的,而且系统性地避开预训练已经学好的主方向。

于是它先用几何先验定位这个子空间,再用 SVD 压成低秩稠密适配器。0.5% 的参数,接近全参效果。这篇同样是 ACL 2026 杰出论文

图片

变化 04

SFT 不再是"无害的热身"

以前我们默认:SFT 就是把模型调到"能听懂人话",然后 RL 接管,SFT 只是个热身,好坏无所谓。

现在这个假设被推翻了。

PEAR 这篇工作证明了一件反直觉的事:一个"更强的 SFT 检查点",在做完同样的 RL 之后,可能反而更差。

原因是分布错配——SFT 是离线数据训练,RL 是在线采样,两者分布对不上。SFT 阶段学得越"深",偏离 RL 需要的分布就越远。

它的解法是用重要性采样重加权 SFT 损失,AIME-2025 的 pass@8 最高 +14.6%

BRIDGE 更进一步,直接用双层优化让 SFT 阶段"学会监督 RL"——只把对奖励优化有用的知识传下去,没用的别塞。Qwen2.5-3B 上训得快 44%,性能 +13%。

图片

变化 05

数据质量,是绕不过去的硬约束

这条我放在最后,因为它是这半年最"打脸"的一篇。

此前有工作声称:即使数据 100% 是噪声,RLVR 依然鲁棒,模型照样能学。

2026 年的这篇工作把那些数据集重新严格核验了一遍,发现——所谓"纯噪声"数据集里,至少混进了 16% 的干净数据。

在真正错误的标注上训练,结果是什么?数学基准掉 8–10%,Text2SQL 掉 5–12%

Dr.GRPO、DAPO、TIS、SAPO、PGFC……这些 SOTA 级别的算法改进,一个都补不回来

结论很朴素,算法再花哨,也补不回数据质量。高质量数据依然是硬约束。

图片

这半年的变化,本质上是这个领域从"堆资源"走向"拼理解"。


以前是「谁的卡多谁赢」,现在是「谁更理解训练动态谁赢」。

熵怎么变、边界在哪、分布对不对得上、数据干不干净——这些以前没人细看的细节,现在成了胜负手。

对从业者来说,这其实是好消息:理解力的杠杆,第一次超过算力的杠杆。

【声明】内容源于网络
0
0
魔方AI空间
AI技术从业者与深耕者,专注于视觉大模型、多模态内容理解与生成、具身智能、Agent、RAG等AGI时代前沿科技成果的研究和技术分享!!
内容 197
粉丝 0
魔方AI空间 AI技术从业者与深耕者,专注于视觉大模型、多模态内容理解与生成、具身智能、Agent、RAG等AGI时代前沿科技成果的研究和技术分享!!
总阅读627
粉丝0
内容197