港科大(广州)与微软联手破解AI“老师太强学生跟不上“的世纪难题

📅 2026/7/22 17:57:55
港科大(广州)与微软联手破解AI“老师太强学生跟不上“的世纪难题
这项由香港科技大学广州、星云智力科技与微软研究院联合完成的研究于2026年7月6日以预印本形式发布于arXiv平台编号为arXiv:2607.04751。感兴趣的读者可通过该编号在arXiv上查阅完整论文。**一、当AI学生遇到高不可攀的老师**教育界有一个朴素的道理当老师和学生的水平差距太悬殊时直接照搬老师的解法往往会让学生彻底懵圈效果反而不如循序渐进地学习。这个道理放在人工智能的世界里同样成立甚至会引发更严重的问题。当前训练大型语言模型也就是像ChatGPT这类能对话、能推理的AI有一种非常流行的方法叫做在线策略蒸馏英文缩写为OPD。这个方法的核心思想很朴素找一个更聪明的AI老师让学生AI不断照着老师的方式来生成文本哪里偏差就在哪里纠正久而久之学生AI就会越来越接近老师的水平。OPD相比两种主流方法都有明显优势。一种叫监督微调这类方法的问题是AI训练完容易好了伤疤忘了疼把之前学到的东西遗忘掉另一种叫强化学习这类方法虽然不容易遗忘但奖励信号非常稀疏——就像期末才给成绩的老师学生平时完全不知道自己做得对不对导致学习效率低且不稳定。OPD则兼具两者的优点既像强化学习一样让AI自己生成答案然后反思又像监督微调一样给出密集、细致的指导信号。然而在实际训练中OPD有一个致命的软肋这正是这篇论文要解决的核心问题。**二、老师打了零分OPD为什么会崩溃**要理解OPD的症结所在需要先了解它是怎么运作的。在训练过程中学生AI会自己生成一段文字然后逐个词地与老师AI进行比较老师觉得这个词出现在这里的概率有多大学生自己给这个词多大的概率两者相除取对数后就得到一个即时奖励信号告诉学生你选这个词选得对不对。问题就出在这个比较上。当学生AI生成了一个老师认为完全不应该出现的词时老师给这个词的概率趋近于零而学生自己给了它一个不小的概率。一旦用极小的数去除一个较大的数再取对数结果就会趋向负无穷——用大白话说就是惩罚信号无限大。以一个具体场景来理解假设学生正在解一道数学题老师认为解题的第三步应该写所以概率高达99%但学生却写了因此老师认为写因此的概率只有0.001%。于是惩罚信号就变成了log(0.001%) -6.9这已经是一个很大的负数。现在假设老师认为某个词出现的概率是0.000001%惩罚就变成了log(0.000001%) -13.8。如果老师几乎完全不可能用某个词惩罚就会趋向负无穷大。这就好比一位学生在考试中偶然写错了一个字老师不是扣一两分而是直接判定这份试卷作废、罚学生从头开始学ABC。这种一刀切的极端惩罚会让整个训练过程变得极度不稳定梯度可以理解为告诉AI往哪个方向调整参数的指南针会发生剧烈抖动模型参数会乱跳最终导致AI学得一塌糊涂。研究者们之前也尝试过一些补救措施比如把老师和学生混在一起采样、给奖励信号加个上限截断、调整采样参数、先用离线数据预热模型等。但这些方法都是治标不治本的经验性技巧没有从根本上解释和解决惩罚信号无界这个数学本质也缺乏理论保证。**三、渐进式家教TOP-D的核心思想**这篇论文提出的解决方案叫做信任域策略蒸馏英文缩写为TOP-D。它的灵感来自一个非常朴素的教育智慧如果学生跟不上顶尖老师不要直接让学生对标顶尖老师而是先给学生安排一个稍微比他强一点的辅导老师等学生进步了辅导老师的标准也随之提高如此循环渐进。TOP-D将这个思想转化为一个精确的数学操作称为构建近端老师。具体来说不再直接用真正的老师AI称为目标老师给出的概率分布来指导学生而是把目标老师的概率分布和当前学生的概率分布按一定比例混合得到一个中间态的近端老师。用公式表达就是近端老师在某个词上的概率 α × 目标老师的概率 (1-α) × 学生当前的概率。这里α是一个0到1之间的参数控制混合的比例。这个操作的神奇效果立刻体现在奖励信号上。原来的OPD奖励是log(目标老师概率/学生概率)当目标老师概率趋近于零时会爆炸而TOP-D的奖励变成了log(α×目标老师概率/学生概率 1-α)。数学上可以严格证明无论学生给某个词的概率多高无论目标老师给这个词的概率多低这个新的奖励永远不会低于log(1-α)。当α0.1时最低惩罚是log(0.9) ≈ -0.105完全可控。论文中有一张非常直观的图横轴是目标老师概率/学生概率的比值纵轴是奖励值。OPD的奖励曲线在比值趋近于零时直接掉向负无穷像一条断崖而TOP-D的奖励曲线在底部被一条水平线兜住像给悬崖底部铺了一张安全网。不同的α值对应不同高度的安全网α越小安全网越高训练越稳定。这里有一个非常重要的细节构建近端老师只是一个概念上的操作实际计算时并不需要真的把两个模型的概率混合起来再计算奖励。数学推导表明最终的奖励公式可以直接从目标老师的对数概率和学生的对数概率算出来没有任何额外的计算步骤也没有任何额外的计算量。这意味着TOP-D是真正意义上的零额外成本改进。**四、反复练习内部信任域迭代**解决了奖励信号不稳定的问题后TOP-D还顺手解决了OPD的另一个痼疾数据利用率极低。标准OPD采用严格的在线模式学生生成一批答案用来更新一次参数然后这批答案就永远丢弃了再生成新一批答案再更新一次参数……这就像学生做完一套练习题就立刻扔掉永远不会回头复习每次都要现场临时做题来学习效率非常低。TOP-D借鉴了强化学习中已经被广泛验证的信任域技术具体是类似PPO算法的思想允许用同一批数据更新多次参数。关键在于引入了一个重要性采样比每次用旧数据更新参数时计算一下如果是当前的学生来生成这道题的答案概率会与生成这批数据时的旧学生相差多少然后用这个比值来补偿数据过时带来的误差同时用截断clip操作防止这个补偿比值偏离太远导致不稳定。具体实现上每次从题库里抽一批题目让当前学生暂时冻结参数称为行为策略生成8个回答然后这批数据会被分成多个小批次模型参数在这些小批次上反复更新多轮才进行下一次数据采样。全局批次大小为512道题4096个样本小批次大小为32道题256个样本也就是同一批数据被循环使用了16次。在计算每个词的优势即这个词选得好还是不好的量化评分时TOP-D还引入了一个精心设计的词级别奖励。对于回答中第k个词它的奖励不仅包含该词本身的即时奖励还加上后续所有词的奖励取平均经过长度归一化。这个设计让模型既不会偏向生成极短的答案因为短答案后续奖励少也不会无限拉长答案因为奖励会被平均稀释。最后一组回答中所有词的奖励统一做标准化处理减均值除标准差让不同难度题目之间的信号更具可比性。**五、理论保证为什么这样设计一定有效**研究团队不满足于仅凭经验展示效果而是从数学层面严格证明了TOP-D的三重保证形成一个完整的理论闭环。第一重保证是梯度方差有界。在标准OPD中当奖励信号可以趋向负无穷时梯度的方差也会趋向无穷大——用一个形象的比喻来说指南针的抖动幅度可以大到无法使用。论文证明引入近端老师后TOP-D的梯度方差被严格控制在一个有限的上界以内Var(梯度) ≤ M?×词汇量×max{(log(1-α))?, C*α}其中M是模型参数梯度的上界C*是一个由数学推导确定的常数。当α趋近于0时方差趋近于0稳定性极高当α等于1时这个界退化为无穷大正好对应标准OPD的不稳定性。α在这里扮演了一个精确的方差调节旋钮的角色。第二重保证是全局收敛性。论文把近端老师的构建过程抽象为一个数学算子TT(π) α×目标老师 (1-α)×当前学生。每一步迭代中学生尝试逼近近端老师但不可能完全做到存在优化误差ε。论文证明在这个框架下经过k步迭代后学生与目标老师的距离满足d(π_{k1}, π*) ≤ (1-α)^{k1} × d(π_0, π*) Σ(1-α)^{k-i} × ||ε_i||。这个不等式有两层含义其一初始的差距会以指数速度衰减就像早期的错误会被自然遗忘其二长期来看学生与目标老师的距离上界是ε∞/α其中ε∞是优化误差的长期水平。这意味着只要能把每一步的优化误差控制得足够小最终就能无限逼近目标老师。正是这个ε∞/α的结论在理论上点明了引入内部信任域迭代的必要性如果能通过多步迭代把每步的优化误差压得更小整个算法就能更接近理想效果。第三重保证是单调改进。这部分论文证明内部信任域迭代能够保证每一步更新后真实目标值期望累积奖励是单调不下降的。具体来说论文推导出一个下界η(π) ≥ ζπ(π) - 2ξT_max l_π × E[DTV(π, π)]其中ζπ(π)是代理目标用当前学生的状态分布来估算新策略的期望回报DTV是两个策略在每个状态下动作分布的全变差距离可以理解为两个策略的选择有多不同ξ是期望优势的最大绝对值T_max是最大生成长度l_π是平均回答长度。由于η(π) Mπ(π)当新策略就是旧策略时下界等于真实值任何能提升下界的更新必然也能提升真实目标从而保证单调改进。结合Pinsker不等式一个连接KL散度与全变差距离的数学工具可以进一步证明只要把每步的KL散度两个策略差异程度的另一种度量控制得足够小优化误差就能被严格控制在预设范围内从而紧密闭合了ε∞/α这个收敛上界。这三重保证形成了一个完整的理论闭环近端老师控制方差→梯度稳定→收敛分析指出需要控制每步误差→内部信任域迭代保证单调改进并压缩每步误差→最终整个算法收敛。**六、实验数据在最难的数学题上的表现**理论固然重要但实验结果才是最有说服力的成绩单。研究团队在数学推理这个被业界公认为极具挑战性的领域进行了系统性测试。训练数据使用了一个叫做DAPO-Math-17k的高质量数学推理数据集包含17000道数学题。评测基准主要使用了AIME系列竞赛题美国数学邀请赛这是高中数学竞赛中难度相当高的一类以及AMC美国数学竞赛和其他数学基准。评测指标采用avg32即模型对每道题生成32个答案取平均正确率这种方式能比较准确地反映模型的真实数学能力。学生模型使用了两个版本一个是参数规模较大的Qwen3-8B-Base约80亿参数一个是较小的Qwen3-1.7B-Base约17亿参数。老师模型主要使用Qwen3-30B-A3B-Instruct-2507这是一个混合专家架构的大模型总参数30B激活参数3B数学能力显著强于学生。以8B学生配合这位顶尖老师为例结果相当令人印象深刻。在AIME24这个基准上原始未训练的学生模型得分9.38%经过强化学习GRPO方法训练后提升到30.10%经过更先进的强化学习DAPO方法训练后达到32.92%而标准OPD方法训练的结果却只有24.58%不仅低于两种强化学习方法甚至还输给了简单的GRPO——这充分说明了标准OPD的不稳定性问题有多严重。TOP-D方法训练后得分达到50.42%比标准OPD高出整整25.84个百分点比最强的强化学习基准DAPO也高出约17.5个百分点。在AIME25和AIME26这两个更新、题目没有在训练数据中出现过的基准上TOP-D同样保持了明显的领先AIME25上34.06% vs OPD的23.33%AIME26上44.06% vs OPD的25.42%。在AMC23和MATH-500等相对容易一些的基准上TOP-D也分别达到88.13%和91.23%的avg8准确率均优于所有对比方法。当换成更小的1.7B学生时差距体现得更为明显。小模型与顶尖老师之间的能力鸿沟更大标准OPD在AIME24上只能得到8.96%甚至低于原始模型训练前的GRPO基线10.52%说明大能力差距下OPD的不稳定性更加致命。TOP-D则以20.31%的成绩相比标准OPD高出11.35个百分点而且还超越了两种强化学习基准。换成能力稍弱一些的Qwen3-14B作为老师时TOP-D同样明显优于标准OPD12.81% vs 7.81% on AIME24。**七、拆开看每个设计选择为什么重要**为了验证TOP-D的每个组成部分都是必要的研究团队对1.7B学生做了一系列对照实验。第一组对照把α设为1.0也就是去掉近端老师直接退化为标准OPD。训练曲线显示高度不稳定剧烈抖动最终性能远低于TOP-D。这验证了近端老师对稳定训练至关重要。第二组对照保留近端老师但去掉内部信任域迭代标注为w/o off-policy每次采样的数据只用一次就丢弃回到严格的在线训练模式。结果是训练收敛速度明显变慢需要更多步骤才能达到相同的性能水平体现出数据重复利用对样本效率的重要贡献。第三组敏感性分析保持其他设置不变分别测试α0.1、0.2、0.3三个值。结果显示三条学习曲线非常接近最终性能差异很小说明TOP-D对这个关键超参数的选择不敏感不需要精细调参就能稳定工作。论文最终选择α0.1或0.2作为默认设置。在计算资源方面所有实验在配备NVIDIA H200 GPU的服务器上进行标准配置是4个节点共32张GPU。不过论文特别说明单个8张GPU的节点就可以完整复现所有结果具有较好的可访问性。**八、留白与展望这项研究还没回答的问题**论文也坦诚地承认了当前工作的局限性。目前所有实验的学生模型都在8B参数以内更大规模比如30B以上的学生模型是否同样受益尚未验证。不过研究团队基于理论分析对此持乐观态度。另一个局限是训练步数相对较少8B学生只训练了约200-400步1.7B学生同样如此RLVR基线训练了更多步。令人期待的是在这个训练窗口内完全没有看到性能饱和的迹象意味着继续训练可能还有相当大的提升空间。当然训练数据也目前只用了数学推理这一个领域是否在代码、科学推理、通用对话等其他领域同样有效也是值得探索的方向。说到底TOP-D做的事情用一句话就能概括它给AI学生和顶尖AI老师之间搭了一个临时辅导老师的中间层让学生不再直面过于悬殊的差距训练过程因此从高度不稳定变得平滑可靠。这个做法不引入任何额外的计算开销只需要一行数学变换就能实现却在最难的数学推理任务上带来了高达25.84%的绝对精度提升。它既有完整的理论支撑三重数学保证形成闭环又有扎实的实验验证跨模型规模、跨老师能力、跨基准集均表现稳定是一个理论与实践都颇为完整的研究工作。对于AI大模型的训练来说找到一种既稳定又高效、既有理论保证又没有额外成本的改进方法是非常有价值的贡献。随着基础模型能力持续快速提升蒸馏训练面临的老师太强学生跟不上的问题只会越来越突出TOP-D这类解决方案的重要性也会随之提升。有兴趣深入了解数学推导细节的读者可以通过arXiv:2607.04751查阅完整论文及附录中的详细证明过程。---QAQ1TOP-D和普通OPD蒸馏方法的本质区别是什么A普通OPD让学生AI直接对标顶尖老师AI当两者差距太大时惩罚信号会趋向负无穷导致训练崩溃。TOP-D通过将目标老师的概率分布和学生当前概率分布按比例混合构建一个近端老师把惩罚信号的下界严格锁定在log(1-α)彻底避免了信号爆炸。实际计算时这只是一个简单的数学变换不增加任何计算量。Q2TOP-D在AIME数学竞赛题上能提升多少准确率A在AIME24基准上用Qwen3-8B模型配合Qwen3-30B-A3B-Instruct-2507作为老师标准OPD方法的avg32准确率只有24.58%TOP-D达到了50.42%绝对提升25.84个百分点。在AIME25和AIME26上TOP-D分别达到34.06%和44.06%同样大幅领先标准OPD的23.33%和25.42%。Q3TOP-D训练AI需要多少计算资源A论文中的实验使用了配备NVIDIA H200 GPU的服务器标准分布式训练用4个节点共32张GPU来加速实验迭代。但研究团队特别强调单个8张GPU的标准服务器节点就可以完整复现所有训练结果具有较好的可及性不需要超大规模的计算集群。