news 2026/5/25 9:24:57

MoE架构

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MoE架构

🍋🍋AI学习🍋🍋

🔥系列专栏: 👑哲学语录: 用力所能及,改变世界。
💖如果觉得博主的文章还不错的话,请点赞👍+收藏⭐️+留言📝支持一下博主哦🤞


一、Decoder-only原始架构

在MoE中,decoder-only就是改造的前馈神经网络层。

二、MoE图解

三、前向传播过程

Top-k (k=1 或 2)为例:

1、计算路由权重

2、选择专家

  • 取权重最大的 k 个专家,得到索引集合 S(x)。

3、专家前向

  • 对选中的每个专家 e:

4、加权合并

五、MoE的优势

1、参数量大,计算量可控

(1)普通 Transformer:每次前向传播都要用到所有参数,想增加容量就必须增加计算量。

(2)MoE:可以把参数拆分成 N 个“专家”,每个 token 只激活Top-k个专家(常见 k=1 或 2)。

(3)计算量 ≈ k/N × 总参数量,总参数可以做到数百亿甚至上万亿,而实际每步计算只相当于几十亿

2、表达能力更强

不同专家可以学习不同的子任务/语义模式(例如语法、数学、代码、图像描述等)。

通过 gating 机制,每个 token 动态选择专家 →条件计算 (conditional computation), 类似于“如果输入属于某类特征,就让某些专家专门处理”

3、训练与扩展灵活

易于扩展:只需增加专家数量即可增加模型容量,而计算成本几乎不变。

模块化训练:专家可以并行分布到不同 GPU/节点,方便大规模分布式训练。

局部更新:理论上可以只更新某些专家以实现增量学习或领域适配。

4、更好的多样性与鲁棒性

由于专家学习到不同的特征空间,模型在面对分布外数据时往往更有鲁棒性。

对长尾任务更友好:稀有任务可能被特定专家捕获,而不会被主流任务“淹没”。

六、常见变体

  • Switch Transformer:Top-1 路由,最简单高效。

  • GShard:Top-2 路由 + 负载均衡 loss。

  • Mixtral、DeepSeek-MoE:更大规模专家、改进 gating、共享路由策略。

  • Shared MoE / Residual MoE:增加共享专家或残差,稳定训练。

七、总结

MoE 的前馈网络内部仍然是“升维→激活→降维”的 FFN, 区别在于:

不止一个 FFN,而是多个专家并存,由门控网络为每个 token 动态选择少数专家执行, 这样可以在保持计算成本可控的同时显著扩大模型容量与表示能力。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/5/26 6:15:06

【Android酒店预订系统App】(免费领源码+演示录像)|可做计算机毕设Java、Python、PHP、小程序APP、C#、爬虫大数据、单片机、文案

摘 要 基于Android平台的酒店预订系统App是一款专为移动用户设计的应用程序,它允许用户通过智能手机或平板电脑方便快捷地进行酒店搜索、预订及管理。这款App拥有一个直观的用户界面,为用户提供了广泛的功能,包括浏览酒店信息、查看房间价格…

作者头像 李华
网站建设 2026/5/26 6:13:49

CD-II-DBU动态制动装置

CD-II-DBU 动态制动装置应用领域详解起重与搬运设备电梯、升降机、起重机、葫芦、自动堆垛机输送机、滚筒输送线快速停止或防止负载下滑,保障安全机床及金属加工行业数控机床、车床、铣床、磨床、冲床激光切割机、折弯机、剪板机实现高精度停机,防止工件…

作者头像 李华
网站建设 2026/5/26 6:15:26

UVa 10654 The Uxuhul Voting System

题目分析 本题描述了一个古代文明的投票系统,我们需要根据每位祭司的偏好顺序,推算出最终三个议题的投票结果。这个问题的核心在于每位祭司都会基于后续祭司的最优选择来做出自己的最优决策,因此我们需要逆向推理 整个投票过程。 问题重述 …

作者头像 李华
网站建设 2026/5/26 6:13:53

UVa 10663 Non-Powerful Subsets

题目描述 我们定义一个自然数子集为“非幂集”,如果该子集中不存在任何子集(可以是它本身)使得其元素之和等于某个幂数。这里的幂数定义为:对于所有 NNN 和 M≥2M \geq 2M≥2 ,形如 NMN^MNM 的数。注意, 11…

作者头像 李华
网站建设 2026/5/26 7:32:57

从能量阻滞到流动:解码厌学行为背后的家庭动能修复模型

现象透视:被遮蔽的求救信号广州越秀区的初三女生奕奕把课本藏在床底的第三个月,母亲在厨房发现了被撕碎的试卷碎片。这个曾经会分享学校趣事的孩子,如今每天抱着手机到凌晨,家长说一句就摔门——在多数教育叙事里,这被…

作者头像 李华