【AI黑话日日新】Day 049|MoE(混合专家)
一句话说清:混合专家(Mixture of Experts)就是给模型安排许多个各有所长的小分块,再配一个调度员,每处理一个词只叫最相关的几个上场,而不是每次都让全体一起算。1. 它到底在说什么混合专家(Mixture of Experts,常简写为 MoE)是一种把“大网络”拆成“很多小专家 + 一个调度员”的结构。它的核心直觉是:别让模型里每一个参数都对每句话生效,而是让一个叫路由(routing)的小部件判断“这句话该交给哪几个专家处理”,只激活被选中的那几个,其余原地待命。打个比方:一家大医院里有上千名专科医生,但每个病人就诊时,分诊台只把他领到最对口的两三位那里,而不是让全体医生都围过来会诊。医院总的“知识储备”很庞大,但每个病人实际消耗的医疗资源却很少。MoE 里,那本“医生名册”就是总参数,而每位病人实际见到的医生就是激活参数——这两个数字可以差出十几倍甚至几十倍。2. 为什么现在这个词很热1991 年,Jacobs 等人就提出“Adaptive Mixtures of Local Experts”的原始设想,但受限于算力,长期只是理论。2017 年,Google Brain 的 Shazeer
上一篇/下一篇内容由系统自动关联
返回资讯列表 →