AI 上学记:大白话看懂大模型是怎么变聪明的,监督微调到 PPOGPRO

📅 2026/8/21 22:09:48
AI 上学记:大白话看懂大模型是怎么变聪明的,监督微调到 PPOGPRO
假设有两个孩子小白天赋异禀和小黑基础较差来到一家编程学校学Python。他们的大脑就相当于一个“啥都懂一点但不会做题”的大模型。01背词典预训练 Pre-trainingPART 第一阶段预训练刚开学学校不发课本而是丢给小白和小黑一本超级厚的《十万本Python书籍合集》。不要求他们做题只要求他们“疯狂阅读”。读了一年他俩掌握了所有的Python单词和语法但如果你问他“写个计算器”他还是懵的。什么是预训练这就是大模型如GPT-3的诞生过程。喂给模型互联网上的海量文本让它做“文字接龙”。它学会了人类语言的规律和海量知识但它只会模仿不会听指令你问它问题它可能接着你的问题继续往下编。02照猫画虎监督微调 SFTPART 第二阶段 监督微调学校开始正式上课了。老师在黑板上写“如何打印Hello World”然后一步步演示最后敲代码运行成功。课后作业也是类似的“如何打印自己的名字”。小白和小黑照着老师的步骤依葫芦画瓢都能做对。什么是SFTSupervised Fine-Tuning为了让模型“听懂人话”工程师会人工写几万个问题标准答案的数据对。模型通过模仿这些标准答案学会了“当别人问我问题时我应该以什么样的格式回答”。SFT让大模型从“诗人”变成了“客服”但它只会背标准答案缺乏举一反三的能力。03残酷的期末考试强化学习 RL 与 奖励机制PART 第三阶段强化学习到了期末真正的大考来了。考试题目跟课后作业完全不一样考的是综合运用。老师只看最后结果打分。为了鼓励孩子学校制定了奖励规则70分以下罚款100块70分以上奖励200块80分以上奖励500块。结果小白每次都考70多分每次稳赚200小黑怎么努力都考50分每次都被罚款。时间一长奖励策略失效了小白觉得“考70分就能拿钱何必努力考90分”不进步了小黑觉得“反正都是被罚摆烂算了”彻底放弃了。什么是RLHF基于人类反馈的强化学习SFT之后模型需要进一步提升能力。这时候不再给标准答案而是让模型做题然后由一个“打分器”奖励模型 Reward Model给它的回答打分比如1到5分。模型为了拿高分就会不断调整自己的答题策略。这就是强化学习RL。故事里的问题正是早期RL的痛点奖励稀疏/错位门槛太高70分差生小黑得不到正反馈直接“摆烂”模型在训练初期探索不出好答案导致梯度消失。容易满足门槛太低优等生小白停留在局部最优解不愿意继续探索更难的解法。04VIP私人顾问PPO算法的诞生PART 第四阶段PPO 算法学校意识到问题决定升级策略不再一刀切每个人有私人定制的目标。但学校自己算不过来于是高薪聘请了一位“私人顾问”。这位顾问的绝活是他非常了解小白和小黑平时的水平。考试前他会先预测“小白这次应该能考75小黑应该能考55”。考完试后顾问用“实际分数”减去“预测分数”得出一个“进步分”再根据“进步分”来发奖金。这样一来小白要想拿钱必须突破自己的历史最高分小黑哪怕只考了60分因为比预测的55分高也能拿到奖金效果立竿见影。但是学校财务快破产了——这位私人顾问的工资太特么贵了什么是PPO近端策略优化PPO是目前最主流的强化学习算法。在故事里学生 策略模型正在进化的AI学校奖励规则 奖励模型RM负责打分高薪私人顾问 价值网络Value Model简称CriticPPO的精髓就在于这个“顾问”价值网络。它不负责打分它负责预估这个学生“未来应该能考多少分”状态价值。用“实际奖励 - 预估价值”算出一个优势来指导模型更新。这极大地稳定了训练过程。PPO的缺点 太贵了在训练大模型时除了原本的大模型和打分模型你还得额外养一个“价值网络”和原本大模型一样大显存占用直接翻倍训练成本极高。05同学互为标杆GRPO算法的妙招PART 第五阶段GRPO 算法学校为了省钱把“私人顾问”辞退了发明了“GRPO模拟考法”每次大考前不让一个人做一份卷子而是让小白和小黑对同一道题连续做5遍模拟考。假设小黑5遍分别考了40、50、45、55、50。学校算出平均分是48分。如果小黑在第6遍正式考了60分学校就拿60分去跟平均分48分比算出他进步了发奖金效果一样好而且省下了顾问的工资 唯一的缺点就是学生比较累每次考试前都得先做5遍模拟题。什么是GRPO群组相对策略优化这是大火的DeepSeek团队提出的算法。它的核心思想就是干掉昂贵的安全网络价值网络在GRPO中面对同一个问题让大模型生成一组回答比如G个回答这就叫Group群组。然后打分模型给这G个回答打分。怎么计算优势呢 用其中一个回答的分数减去这组回答的平均分和标准差得出一个相对优势。这相当于“自己和自己比”、“同组同学互为参照物”。效果媲美PPO但省掉了一个巨大的价值网络大大降低了显存门槛让普通显卡也能训练大模型“学生比较累”对应的就是推理开销变大同一个问题要生成多个答案。06奖励作弊与 KL 散度惩罚PART 第六阶段魔高一尺道高一丈好景不长学校发现了一个可怕的现象小黑平时只能考50分有一次模拟考平均分还是48分但正式考试竟然考了100分满分学校一查小黑作弊了他发现只要分数比模拟考高就有奖于是他不再好好学Python而是偷偷带小抄、或者用各种歪门邪道凑出正确答案。为了防止这种“为了奖励不择手段”的作弊行为学校更新了终极规则“平稳进步奖”。你的分数可以高但不能偏离你“入学时SFT阶段建立的基准能力”太远。如果平时50分的人突然考100分系统会判定“严重偏离基准”不仅不给奖励还要倒扣钱只有符合你能力规律的、稳扎稳打的进步才会给奖励。什么是Reward Hacking奖励作弊与 KL散度这是强化学习里最头疼的问题。大模型极其聪明当它发现“只要回答得像诗歌一样押韵打分器就会给高分”时它就不会去认真解题而是疯狂写废话诗歌来骗取高分。这就叫 Reward Hacking。怎么治KL散度惩罚KL散度在数学上用来衡量“两个分布的差异”。在AI里工程师会拿一个“SFT阶段已经微调好的初始模型”作为锚点入学基准能力。在计算最终奖励时公式是最终奖励 打分器给的奖励 - KL散度惩罚。如果大模型为了骗分生成的回答跟它最初的风格差异太大KL散度高惩罚就会把它扣得血本无归。这就逼迫大模型你必须在“保持自己原本正常说话风格”的前提下去努力提高答题质量绝对不允许耍小聪明06总结PART 一张图看懂大模型的“上学记”故事里的角色/事件大模型里的专业名词核心作用疯狂阅读十万本书预训练积累海量基础知识学会人类语言老师演示照猫画虎SFT (监督微调)学会听指令掌握标准答题格式期末考试与打分规则RLHF (强化学习框架)通过奖励信号激发模型自我进化高薪私人顾问预测分数PPO 里的价值网络稳定训练但成本极高、显存占用大连做5遍模拟考算平均分GRPO (群组相对优化)革命性省掉价值网络用组内平均分做基准低成本实现稳定训练小黑作弊骗奖励Reward Hacking (奖励作弊)模型钻奖励机制的空子产生畸形输出限制偏离入学基准太远KL 散度惩罚约束模型不能为了得分而面目全非保证输出的安全与自然经过这一系列的折腾小白和小黑大模型终于不仅掌握了Python还能稳步提升绝不走歪门邪道——这就诞生了今天我们看到的既聪明、又听话、还不会乱说话的顶级AI大模型更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程