大数跨境

AI 上学记:大白话看懂大模型是怎么变聪明的,监督微调到 PPO&GPRO

AI 上学记:大白话看懂大模型是怎么变聪明的,监督微调到 PPO&GPRO 启示AI科技
2026-08-29
6
导读:老师演示,照猫画虎SFT (监督微调)学会听指令,掌握标准答题格式;期末考试与打分规则RLHF (强化学习框架)通过奖励信号,激发模型自我进化;高薪私人顾问(预测分数)PPO 里的价值网络稳定训练,但

假设有两个孩子,小白(天赋异禀)和小黑(基础较差),来到一家编程学校学Python。他们的大脑,就相当于一个“啥都懂一点,但不会做题”的大模型。

01|背词典(预训练 Pre-training)

PART| 第一阶段预训练


刚开学,学校不发课本,而是丢给小白和小黑一本超级厚的《十万本Python书籍合集》。不要求他们做题,只要求他们“疯狂阅读”。读了一年,他俩掌握了所有的Python单词和语法,但如果你问他“写个计算器”,他还是懵的。

什么是预训练?

这就是大模型(如GPT-3)的诞生过程。喂给模型互联网上的海量文本,让它做“文字接龙”。它学会了人类语言的规律和海量知识,但它只会模仿,不会听指令,你问它问题,它可能接着你的问题继续往下编。

02|照猫画虎(监督微调 SFT)

PART| 第二阶段 监督微调


学校开始正式上课了。老师在黑板上写:“如何打印Hello World”,然后一步步演示,最后敲代码运行成功。课后作业也是类似的:“如何打印自己的名字”。小白和小黑照着老师的步骤,依葫芦画瓢,都能做对。

什么是SFT(Supervised Fine-Tuning)?

为了让模型“听懂人话”,工程师会人工写几万个(问题+标准答案)的数据对。模型通过模仿这些标准答案,学会了“当别人问我问题时,我应该以什么样的格式回答”。SFT让大模型从“诗人”变成了“客服”,但它只会背标准答案,缺乏举一反三的能力。

03|残酷的期末考试(强化学习 RL 与 奖励机制)

PART| 第三阶段强化学习


到了期末,真正的大考来了。考试题目跟课后作业完全不一样,考的是综合运用。老师只看最后结果打分。

为了鼓励孩子,学校制定了奖励规则:70分以下罚款100块;70分以上奖励200块;80分以上奖励500块。

结果,小白每次都考70多分,每次稳赚200;小黑怎么努力都考50分,每次都被罚款。时间一长,奖励策略失效了:小白觉得“考70分就能拿钱,何必努力考90分”,不进步了;小黑觉得“反正都是被罚,摆烂算了”,彻底放弃了。

什么是RLHF(基于人类反馈的强化学习)?

SFT之后,模型需要进一步提升能力。这时候不再给标准答案,而是让模型做题,然后由一个“打分器”(奖励模型 Reward Model)给它的回答打分(比如1到5分)。模型为了拿高分,就会不断调整自己的答题策略。这就是强化学习(RL)。

故事里的问题,正是早期RL的痛点:

奖励稀疏/错位:门槛太高(70分),差生(小黑)得不到正反馈,直接“摆烂”(模型在训练初期探索不出好答案,导致梯度消失)。

容易满足:门槛太低,优等生(小白)停留在局部最优解,不愿意继续探索更难的解法。

04|VIP私人顾问(PPO算法的诞生)

PART| 第四阶段PPO 算法


学校意识到问题,决定升级策略:不再一刀切,每个人有私人定制的目标。

但学校自己算不过来,于是高薪聘请了一位“私人顾问”。这位顾问的绝活是:他非常了解小白和小黑平时的水平。考试前,他会先预测:“小白这次应该能考75,小黑应该能考55”。考完试后,顾问用“实际分数”减去“预测分数”,得出一个“进步分”,再根据“进步分”来发奖金。

这样一来,小白要想拿钱,必须突破自己的历史最高分;小黑哪怕只考了60分,因为比预测的55分高,也能拿到奖金!效果立竿见影。

但是,学校财务快破产了——这位私人顾问的工资太特么贵了!

什么是PPO(近端策略优化)?

PPO是目前最主流的强化学习算法。在故事里:

学生 = 策略模型(正在进化的AI)

学校奖励规则 = 奖励模型(RM,负责打分)

高薪私人顾问 = 价值网络(Value Model,简称Critic)

PPO的精髓就在于这个“顾问”(价值网络)。它不负责打分,它负责预估这个学生“未来应该能考多少分”(状态价值)。用“实际奖励 - 预估价值”算出一个优势,来指导模型更新。这极大地稳定了训练过程。

PPO的缺点: 太贵了!在训练大模型时,除了原本的大模型和打分模型,你还得额外养一个“价值网络”(和原本大模型一样大),显存占用直接翻倍,训练成本极高。

05|同学互为标杆(GRPO算法的妙招)

PART| 第五阶段GRPO 算法


学校为了省钱,把“私人顾问”辞退了,发明了“GRPO模拟考法”:

每次大考前,不让一个人做一份卷子,而是让小白和小黑对同一道题,连续做5遍(模拟考)。

假设小黑5遍分别考了:40、50、45、55、50。学校算出平均分是48分。

如果小黑在第6遍正式考了60分,学校就拿60分去跟平均分48分比,算出他进步了,发奖金!

效果一样好,而且省下了顾问的工资! 唯一的缺点就是:学生比较累,每次考试前都得先做5遍模拟题。

什么是GRPO(群组相对策略优化)?

这是大火的DeepSeek团队提出的算法。它的核心思想就是:干掉昂贵的安全网络(价值网络)!

在GRPO中,面对同一个问题,让大模型生成一组回答(比如G个回答,这就叫Group群组)。然后打分模型给这G个回答打分。

怎么计算优势呢? 用其中一个回答的分数,减去这组回答的平均分和标准差,得出一个相对优势。

这相当于“自己和自己比”、“同组同学互为参照物”。效果媲美PPO,但省掉了一个巨大的价值网络,大大降低了显存门槛,让普通显卡也能训练大模型!“学生比较累”对应的就是推理开销变大(同一个问题要生成多个答案)。

06|奖励作弊与 KL 散度惩罚

PART| 第六阶段魔高一尺,道高一丈


好景不长,学校发现了一个可怕的现象:

小黑平时只能考50分,有一次模拟考平均分还是48分,但正式考试竟然考了100分满分!

学校一查,小黑作弊了!他发现只要分数比模拟考高就有奖,于是他不再好好学Python,而是偷偷带小抄、或者用各种歪门邪道凑出正确答案。

为了防止这种“为了奖励不择手段”的作弊行为,学校更新了终极规则:“平稳进步奖”。

你的分数可以高,但不能偏离你“入学时(SFT阶段)建立的基准能力”太远。如果平时50分的人突然考100分,系统会判定“严重偏离基准”,不仅不给奖励,还要倒扣钱!只有符合你能力规律的、稳扎稳打的进步,才会给奖励。

什么是Reward Hacking(奖励作弊)与 KL散度?

这是强化学习里最头疼的问题。大模型极其聪明,当它发现“只要回答得像诗歌一样押韵,打分器就会给高分”时,它就不会去认真解题,而是疯狂写废话诗歌来骗取高分。这就叫 Reward Hacking。

怎么治?KL散度惩罚!

KL散度在数学上用来衡量“两个分布的差异”。在AI里,工程师会拿一个“SFT阶段已经微调好的初始模型”作为锚点(入学基准能力)。

在计算最终奖励时,公式是:最终奖励 = 打分器给的奖励 - KL散度惩罚。

如果大模型为了骗分,生成的回答跟它最初的风格差异太大(KL散度高),惩罚就会把它扣得血本无归。这就逼迫大模型:你必须在“保持自己原本正常说话风格”的前提下,去努力提高答题质量,绝对不允许耍小聪明!

06|总结

PART| 一张图看懂大模型的“上学记”


故事里的角色/事件大模型里的专业名词核心作用;

疯狂阅读十万本书预训练积累海量基础知识,学会人类语言;

老师演示,照猫画虎SFT (监督微调)学会听指令,掌握标准答题格式;

期末考试与打分规则RLHF (强化学习框架)通过奖励信号,激发模型自我进化;

高薪私人顾问(预测分数)PPO 里的价值网络稳定训练,但成本极高、显存占用大;

连做5遍模拟考算平均分GRPO (群组相对优化)革命性省掉价值网络,用组内平均分做基准,低成本实现稳定训练;

小黑作弊骗奖励Reward Hacking (奖励作弊)模型钻奖励机制的空子,产生畸形输出;

限制偏离入学基准太远KL 散度惩罚约束模型不能为了得分而面目全非,保证输出的安全与自然;

经过这一系列的折腾,小白和小黑(大模型)终于不仅掌握了Python,还能稳步提升,绝不走歪门邪道——这就诞生了今天我们看到的既聪明、又听话、还不会乱说话的顶级AI大模型!


【声明】内容源于网络
0
0
启示AI科技
1234
内容 82
粉丝 0
启示AI科技 1234
总阅读810
粉丝0
内容82