当你把“什么是专家混合(MoE)?现代大语言模型背后的架构”与实际决策联系起来理解,而不是把它当作又一个 AI 流行词时,这个概念会更容易使用。本篇 AI Tools Radar 指南聚焦其运作原理、重要取舍,以及在采用工具或工作流前值得提出的问题。

专家混合(MoE)AI 是一种神经网络架构,它将计算分配给多个称为“专家”的专用子网络。轻量级门控网络会选择哪些专家处理每个输入词元。任一时刻只有一小部分专家被激活。这种选择性路由使 MoE 有别于每个词元都使用全部参数的传统稠密模型。

这一设计受到关注,是因为它能将总参数量扩展到数千亿,而推理成本仍可与小得多的模型相当。Mixtral 8x7B 和若干版本的 GPT-4 都采用了这种模式。理解其机制有助于评估有关模型规模和效率的说法。

要点。 • 专家混合(MoE)AI 用许多较小的专家网络和一个负责选择合适子集的路由器,替代单个大型前馈网络。 • 稀疏激活意味着每个词元只由固定数量的专家处理,因此即使总参数增长,每词元的计算量也大致保持不变。 • Mixtral 8x7B 等模型表明,MoE 版本可在基准测试中达到或超过稠密基线,同时在推理期间使用相近数量的活跃参数。 • 由于需要额外技术来平衡专家负载并保持路由器稳定,训练仍比稠密训练更复杂。 • 这一架构同时出现在开放模型和专有系统中,表明它已从研究进入生产级大语言模型。

专家混合模型由一组专家子网络和一个门控函数组成。门控函数接收与专家相同的输入,并输出专家池上的概率分布。得分最高的前 k 个专家才会接收输入并参与输出,其余专家对该词元保持不活跃。

其核心属性包括模块化、稀疏性和条件计算。模块化体现在每个专家可专注于不同的数据模式或任务类型;稀疏性体现在每个词元的活跃参数比例很低;条件计算则体现在活跃集合会随每个词元而变化。

这些属性将 MoE 模型与稠密 Transformer 区分开来。在稠密模型中,每个权重都参与每一次前向传播;在 MoE 模型中,对任一词元而言,大部分权重都处于闲置状态。因此,总容量更高,而每词元计算量大致不变。

该架构可分解为三层:路由器、专家池,以及输出组合步骤。

路由器通常是一个小型线性层或浅层 MLP,它将输入隐藏状态映射为专家得分向量。softmax 会把得分转换为概率,系统再根据这些概率选择前 k 个专家。即使专家总数达到八个或更多,k 的典型取值仍是 1 或 2。

每个专家通常都是前馈网络,其结构与标准 Transformer 块中按位置计算的 FFN 相同。由于专家比单个大型 FFN 更小,模型可维持许多专家而不在训练时超出内存预算。随着不同专家从不同数据分布接收梯度,专门化会在训练中逐渐形成。

被选中专家的输出会乘以各自的路由概率后求和,形成 MoE 层的最终贡献。包括注意力机制在内的 Transformer 块其余部分保持不变。

稀疏激活使活跃参数量保持较低。若模型有 8 个专家,每个专家的规模与一个 70 亿参数 FFN 相当,当 k 等于 1 时,实际激活的计算量仍大致相当于一个 70 亿参数模型。其余专家保留在内存中,但不会参与该词元的矩阵乘法。

Mixtral 8x7B 每层包含八个专家,每个词元激活其中两个。因此,它在推理时的活跃参数量与一个 120 至 130 亿参数的稠密模型相近,但总参数量超过 460 亿。在标准基准测试中,该模型在多个类别上优于 Llama 2 70B,同时生成时使用更少的内存带宽。

据广泛报道,GPT-4 采用了拥有更多专家和更高总参数量的 MoE 设计。公开细节仍然有限,但高总容量与受控推理成本相结合的模式符合相同原则。Google 的 Switch Transformer、GLaM 等生产系统也以更大规模采用了相同结构。

这些模型的共同模式是,路由器学习将不同类型的词元发送给不同专家。代码词元可能被路由到一组专家,自然语言词元则被路由到另一组。这种隐式专门化能提高训练时的样本效率。

在开放权重聊天模型中,这种设计以可管理的成本支持更长上下文。由于活跃内存使用量接近稠密 130 亿参数模型,用户可以在本地或配置适中的云端 GPU 上运行 Mixtral 8x7B。部署内部助手的企业则可在不按比例增加服务硬件的前提下提高输出质量。

研究扩展定律的团队会利用 MoE 检验:当总参数超过稠密训练变得不切实际的临界点后,性能是否仍会提升。关于 Switch Transformer 的论文显示,当结合辅助负载均衡损失时,拥有超过万亿参数的 MoE 模型可以稳定训练。

关于专家混合(MoE)AI 的常见问题。

问:与总规模相同的稠密模型相比,专家混合(MoE)AI 如何降低推理成本?

答:只有被选中的专家会执行矩阵乘法。路由器成本很小,内存带宽由活跃权重而非全部权重决定。因此,生成速度会随活跃专家的规模变化。

问:专家混合(MoE)AI 是否需要专用硬件?

答:标准 GPU 即可。高效推理仍受益于能够跳过零贡献专家的内核,但只要加载模型权重,该架构本身便可在现有 Transformer 运行时上运行。

问:训练与稠密 Transformer 有何不同?

答:路由器必须与专家一起训练。辅助损失用于保持专家使用率平衡;没有这些项时,一些专家几乎收不到词元,也就无法学到有用的表征。

问:专家混合(MoE)AI 能像稠密模型一样微调吗?

答:可以。同样适用监督微调和偏好优化流程。每个样本只有路由器和活跃专家接收梯度,这实际上还能降低反向传播时的内存用量。

问:如果路由器将所有词元都发送给同一位专家,会发生什么?

答:该专家会接收不成比例的梯度,而其他专家仍训练不足。预训练期间会加入负载均衡损失和路由器抖动,以避免坍缩到单一专家。

实际检验标准是:这种方法能否改善某项可重复的工作,同时不掩盖其来源、成本或失效模式。先从一项有代表性的任务开始;在错误影响重大的地方保留人工检查点;并随着模型和产品变化重新评估结果。

我们的编辑方法

我们会结合一手资料、产品文档与实际使用场景,帮助你更清楚地判断工具是否适合你的工作流。

浏览工具目录