大模型蒸馏不是简单抄作业,OPD凭什么碾压传统RL
文章目录1. 先说这桩大新闻7 家公司被点名偷师1.1 报告里的数字一个比一个刺激1.2 先说清楚这全是 Anthropic 单方面的指控2. 蒸馏是啥让小学生抄学霸的作业2.1 致命缺陷学生一犯错就没人管了3. 换思路RL 让学生自己练但打分太慢4. OPD学生自己答老师逐字批改5. 进阶为什么偏偏是逆向KL5.1 画画教学论正向 vs 逆向5.2 数学长这样5.3 逆向 KL 的两个大招6. 黑盒模型做不了 OPD6.1 先把公式摆出来6.2 黑盒只能退化成 SFT偷答案7. 回到那 7 家公司P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。1. 先说这桩大新闻7 家公司被点名偷师2026 年 9 月Anthropic 发了一份报告点名 7 家中国 AI 公司——阿里、DeepSeek、月之暗面、智谱、小米、商汤、MiniMax指控它们用各种姿势蒸馏Claude 的能力。翻译成人话就是老师刚发完讲义底下 7 个学生同时被举报抄作业还抄出了 100 多种花样。1.1 报告里的数字一个比一个刺激阿里被指在 5 到 7 月之间产生了 1.5 亿次交互。1.5 亿次什么概念大概等于全班同学轮流借学霸作业借出了春运抢票的气势。DeepSeek 被指在 14 天内把 1200 万次用户请求转发给 Claude。14 天 1200 万日均 85 万以上这已经不是抄作业是给学霸开了个 24 小时营业的代写店铺。月之暗面被指把近 30 万真实用户的问题直接转给 Claude 代答。用户以为对面是 AI其实对面是 AI 转包给 AI。套娃套到这份上中间商赚差价赚得比二房东还狠。1.2 先说清楚这全是 Anthropic 单方面的指控被点名的公司大多没回应所以这篇不站队只聊一个技术问题——蒸馏到底是啥大厂为啥一提它就炸毛正规的蒸馏又是怎么做的毕竟就算作业抄了你也得先搞清楚答案是怎么写出来的对吧。2. 蒸馏是啥让小学生抄学霸的作业蒸馏Distillation的思路朴素得像你小学同桌小模型想变聪明但大模型太贵跑一次要烧一堆 GPU。怎么办让大模型当老师小模型当学生。老师做 100 万道题把答案连思考过程记下来学生照着学。经典流程长这样老师模型 → 生成大量标准答案 → 学生模型 → 对着答案做监督学习听起来很美好对吧但这个流程有一个致命缺陷藏得比班主任的监控还深。2.1 致命缺陷学生一犯错就没人管了想象一下学生做一道数学题老师的标准答案是先配方再求根。学生没学会配方自己走了一条歪路“先两边同时乘 x”——这步错了后面全错。问题是学霸的作业本里从来没有出现过两边同时乘 x这个错误。学霸不做错题所以标准答案里没有错误路径的教学案例。学生拿着标准答案练只能学到正确路径长什么样。可一旦自己生成时走偏就进入了老师从未示范过的无人区——之后的每个 token 都越来越歪一路错到底。这玩意儿有个学名叫暴露偏差exposure bias训练时学生只见过标准答案生成时却要面对自己的错误这两者的分布完全不同。打个比方教练只给你看世界冠军的滑冰录像就是不告诉你起跳姿势错了会怎样。结果你一上冰第一个动作就劈叉后面的动作全部变形。录像里没有劈叉了该怎么办这一章你只能现场发挥然后摔得更惨。3. 换思路RL 让学生自己练但打分太慢强化学习RL一拍桌子不看录像了让学生自己生成答案然后给个奖励——答案对不对这确实解决了犯错没人管学生自己生成的内容哪怕是错的也会被打分模型能从自己的错误里学。但新问题来了奖励太稀疏了。一道题做 100 个 token最后只给一个对/错信号。中间 99 个 token 哪个走对了、哪个走错了模型完全不知道。就像考试只告诉你总分不告诉你哪道题错了——这不是老师这是监考机器冷酷无情学习效率低到令人发指。RL 的代价有多夸张Qwen3 用 RL 训练花了 17920 个 GPU 小时AIME 数学竞赛成绩才 67.6%。17920 个小时够一个高三学生复读八辈子了。4. OPD学生自己答老师逐字批改2025 年底到 2026 年一种叫 OPDOn-Policy Distillation在线策略蒸馏的方法火了。Qwen3 技术报告里它只花了 1800 个 GPU 小时就把成绩刷到 74.4%——比 RL 快了近 10 倍。它的做法巧妙在哪一句话把蒸馏和 RL 的优点各拿一半。学生自己生成答案RL 的做法——训练学生自己的分布 老师逐 token 打分蒸馏的做法——每个 token 都有密集信号 学生根据逐 token 的分数改进关键在第二步。老师不再是生成标准答案的复读机而是变成了一台逐字批改机学生每写一个 token老师就在旁边点评——“这个字写得好”“这个字写得像鸡刨的”。注意是逐字不是逐题。全班 100 个人交卷老师一个人批 100 万道题还逐字批——这老师要么是神要么是个隐藏的 GPU 集群。效果惊人到什么程度有个实验从 60% 成绩的检查点出发OPD 只用了 150 步就刷到 70%。还有个更离谱的在单个 prompt 上连续训 20 步模型直接恢复到了老师水平——而 RL 在同样情况下只会死记硬背背得像个复读机成精。5. 进阶为什么偏偏是逆向KL先讲直觉再上数学。KL 散度用来衡量两个分布的差距。但注意KL 是不对称的KL(P‖Q) ≠ KL(Q‖P)。方向不一样含义完全不同。就像你欠我钱和我欠你钱差的不是钱是命。5.1 画画教学论正向 vs 逆向想象老师在教学生画画老师会画 10 种动物其中猫画得最好。正向 KL均值寻求学生必须学会全部 10 种动物。哪怕老师只在 1% 的情况下画蛇学生也得把蛇画得跟老师一样好。结果就是学生什么都会一点什么都不精——典型的全面发展全面平庸。逆向 KL模式寻求学生只需要把猫画得跟老师一样好。老师很少画的蛇可以不学。学生专注打磨老师最擅长的几个模式——这是一招鲜吃遍天。这个区别在数学图像上一眼可见一个双峰分布正向 KL 拟合出来是两头都顾、中间模糊哪个峰都没抓住逆向 KL 锁定左边那个峰尖锐而专注代价是完全放弃右边的峰。翻译成人话正向 KL 是想面面俱到的好学生逆向 KL 是只想把一门课考到满分的偏科生。后者在考场上往往更能打。5.2 数学长这样正向 KLKL(老师‖学生) Σ 老师(x) · log( 老师(x) / 学生(x) ) 逆向 KLKL(学生‖老师) Σ 学生(x) · log( 学生(x) / 老师(x) )注意求和前面的权重正向 KL 用老师的概率加权逆向 KL 用学生的概率加权。谁出题谁说了算这就是差别。5.3 逆向 KL 的两个大招大招一当学生在老师概率低的地方自嗨时惩罚直接爆炸。学生写了一个错误 token 老师概率 0.001学生概率 0.5 → 0.5 × log(0.5 / 0.001) 0.5 × 6.2 3.1罚到肉疼 学生乖乖跟着老师 老师概率 0.7学生概率 0.7 → 0.7 × log(0.7 / 0.7) 0满分相当于你交了一篇满分作文里面藏了一句老师是猪老师当场血压拉满——这就是 3.1 分的代价。逆向 KL 会狠狠惩罚学生自信地犯错但不惩罚学生紧跟老师。这就解决了暴露偏差学生一旦走偏立刻被拽回来比妈妈喊你回家吃饭还快。大招二逆向 KL 没法刷分。正向 KL 下学生有个作弊技巧把概率摊平成均匀分布loss 就能压下去——反正老师的分布也不尖锐。这就像考试全选 C虽然全错但至少分布很均匀阅卷老师看着舒心。逆向 KL 下你敢全选 C摊平概率反而会被罚得更狠——因为你在老师高概率的地方给了低概率。想拿低 loss唯一的路就是真的学得像老师。这就是论文里说的 unhackable——不可作弊。一句话正向 KL 能糊弄逆向 KL 只能硬学。6. 黑盒模型做不了 OPD看到这儿你可能想问那 GPT、Claude 这种闭源模型别人能对它们做 OPD 吗答案是做不了。卡在一个具体的数学细节上。6.1 先把公式摆出来L_OPD E_{x~πθ} [ log πθ(xₜ₊₁ | x₁..ₜ) − log π_teacher(xₜ₊₁ | x₁..ₜ) ]πθ 是学生π_teacher 是老师。意思是学生每生成一个 token就算一次学生认为这个 token 的概率减去老师认为这个 token 的概率然后最小化它。注意关键项log π_teacher——老师对学生生成的每一个 token 给出的概率值logprob。要拿到这个值老师必须是可以查询概率的模型。而 GPT-4o、Claude 这些闭源 APIOpenAI 从 GPT-4 起就移除了 logprobs 参数GPT-4o/5 系列完全不支持 Claude API 从来就没有提供过 logprobs 你只能拿到生成的文本拿不到模型内部的概率分布说白了你去饭店点菜只能吃到菜拿不到后厨的菜谱。OpenAI 当年移除 logprobs大概也是发现太多人拿它去偷师了——菜可以给你吃祖传秘方不行。6.2 黑盒只能退化成 SFT偷答案拿不到老师的 logprob逆向 KL 就无从算起。黑盒模型能做什么只有一条退路——拿输出文本做 SFTL_SFT E_{x~π_teacher} [ −log πθ(x) ]注意这个式子和 OPD 的差别采样的分布从学生自己的 πθ退化成了老师的输出 π_teacher。这就是 off-policy 蒸馏——偷答案。它有暴露偏差的天花板。两个式子放一起差异一目了然SFT最小化 KL(老师‖学生) —— 正向 KLoff-policy均值寻求 OPD最小化 KL(学生‖老师) —— 逆向 KLon-policy模式寻求开源权重模型之间可以做完整的 OPD——权重开放logprob 随便算所以开源生态里蒸馏的提升非常显著。闭源黑盒只能被降级蒸馏学得到措辞风格学不到真正的分布。翻译成人话抄得到口音抄不到脑子。网红仿妆能仿出八分像但脸还是那张脸。7. 回到那 7 家公司现在回头看 Anthropic 的指控就明白蒸馏为啥让大厂紧张了。如果指控属实被点名的公司做的根本不是 OPD 这种正规蒸馏。它们有的是转发真实用户请求给 Claude 代答月之暗面有的是抓取推理轨迹阿里有的是买第三方数据商汤。好家伙连偷答案都要找中间商了这年头产业链比想象中完整。这些手法的共同点获取大量老师的高质量答案然后做监督学习。这正好是经典蒸馏的 off-policy 版本——见效快但有暴露偏差的天花板。而正规军的最新方向恰恰相反OPD 让 Qwen3 用十分之一的算力超越了 RL它依赖的不是更多老师的答案而是让学生自己生成老师只负责打分。所以最后总结一句话偷老师的答案短期有效但天花板低。让老师当批改员才是长久之计。抄作业一时爽一直抄一直爽直到考试翻车你才发现——学霸的作业本里从来没有翻车了该怎么办这一章。P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →