MoE 混合专家模型全解析
[LATEXPAGE] 传统密集模型(Dense Model)在推理时需要激活全部参数,导致计算成本随模型规模线性增长。当一个模型拥有万亿参数,但每次推理只激活其中 5%——这不是天方夜谭,而是 Mixture of Experts 正在做…
[LATEXPAGE] 传统密集模型(Dense Model)在推理时需要激活全部参数,导致计算成本随模型规模线性增长。当一个模型拥有万亿参数,但每次推理只激活其中 5%——这不是天方夜谭,而是 Mixture of Experts 正在做…