专家混合模型(MoE)减轻了本地人工智能的计算负担:但内存方面却并非如此。

作者 | 2026 年 7 月 16 日 | 人工智能, 全部, 精选

混合专家架构能够处理更大规模的模型,同时每个令牌仅激活模型的一小部分参数。这使其非常适合本地人工智能,但完整的模型仍然需要驻留在内存中。本文将解释这一点的重要性,以及如何在不升级到更高内存系统的情况下运行更大规模的混合专家模型。.

不久前,在自有硬件上运行人工智能模型意味着只能得到一个功能尚可但较为简单的聊天机器人。它可以回答问题和总结文本,但真正重要的工作——推理、编码、智能体构建——仍然由云端完成。.  

这种情况正在迅速改变。如今的本地模型能够处理多步骤问题、编写和调试代码、调用外部工具、理解图像和文档,并驱动代表你工作的自主代理。数据中心运行的系统与工作站运行的系统之间的差距正在迅速缩小。. 

这种转变很大程度上要归功于一种名为“专家混合模型”(Mixture of Experts,简称 MoE)的架构,它通过减轻计算负担,使这些功能更强大的模型能够在 GPU 资源有限的台式机和工作站上运行。.

 

 

为什么教育部模型天然适合本地人工智能

传统模型是密集型的,这意味着模型中的每个参数都会参与生成每个输出标记。由于每次请求都需要整个模型进行计算,因此计算成本与模型规模直接相关。这对桌面系统来说是一个棘手的问题,因为它们很少拥有数据中心级别的GPU算力。. 

MoE模型采用了一种不同的方法。在这种模型中,一个较大的模型被划分成若干个称为“专家”的专门子网络。每个专家在训练过程中都会发展出自己的专注领域,并根据接收到的数据学习不同的内部模式和表示。一个小型路由网络决定由哪个专家处理每个词元,并且只有这部分专家会被激活。模型的其余部分在这一步骤中处于空闲状态。. 

其结果是,无需每次都计算所有参数,即可实现更强大的模型能力。换句话说,MoE 模型可以承载大型模型的知识和技能,而每次调用时仅激活其部分参数。这对于计算能力可能有限的本地 AI 而言是理想之选。.   

 

专为当前人工智能的使用方式而设计

新的 MoE 模型展示了这一发展方向。以谷歌的 Gemma 4 26B A4B 为例。根据…… 谷歌的文档, 该模型总共包含 260 亿个参数,但每个 token 仅激活 40 亿个参数,因此其每个 token 的计算负担远低于规模相近的密集模型。谷歌将其定位为面向消费级 GPU 和工作站,并内置推理模式、最大 25.6 万个 token 的上下文窗口、图像理解功能、更强的编码性能以及原生函数调用(能够调用外部工具和应用程序),从而为自主代理提供支持。. 

换句话说,过去需要云端 API 才能实现的功能,现在都打包到了桌面端。而且,这些功能直接对应着人们实际希望本地 AI 实现的功能:例如 OpenClaw 和 Hermes 等个人 AI 代理、编码助手、对个人文件进行私有 RAG 管理、文档分析、研究和规划任务以及工作流程自动化。. 

在本地运行这类工作负载有很多优势。您的数据保留在本地硬件上,这对于隐私和合规性至关重要。由于无需通过互联网传输数据,延迟是可预测的。无需支付每个令牌的 API 费用。而且,您可以完全掌控模型、版本和堆栈。. 

 

但问题在于:MoE 型号的体积并没有缩小。

人们很容易认为,一个只激活 40 亿个参数的模型只需要相当于 40 亿个参数的内存。事实并非如此。. 

该模型的路由网络会为不同的令牌选择不同的专家,因此必须始终提供完整的专家集。谷歌自己的 文档 这清楚地表明:虽然 Gemma 4 26B A4B 每个令牌仅激活 40 亿个参数,但为了保持路由和推理速度快,所有 260 亿个参数都必须加载到内存中。. 

因此,虽然 MoE 减少了活跃计算量,但并没有缩小内存占用。在 Phison 的测试配置中,运行 Gemma 4 26B A4B 且不进行任何内存卸载,大约需要 23.5GB 的系统内存——这轻松超过了 16GB 系统的内存容量。随着 MoE 型号性能的不断提升,它们的体积也会不断增大,最终超过它们原本要支持的本地机器的 GPU 和系统内存容量。. 

随着教育部的介入,本地人工智能面临的新瓶颈是内存。. 

 


 

Pascari aiDAPTIV™ 如何帮助教育部

Pascari aiDAPTIV™ 是群联电子的 AI 内存管理技术。它将可用的 AI 内存扩展到三个层级:GPU 内存、系统 DRAM 和基于 NVMe SSD 的 aiDAPTIV 缓存内存。. 

其动态混合模型 (MoE) 功能将该架构直接应用于专家混合模型。aiDAPTIV 并非要求每个专家永久驻留在 GPU 或系统内存中,而是将专家视为动态缓存单元。路由网络所需的专家保存在 GPU 内存中进行计算,而其余专家可以缓存在系统 DRAM 中,或卸载到 aiDAPTIV 缓存中,并根据模型路由决策的变化按需加载。. 

例如,运行 Gemma 4 26B A4B 通常需要 23.GB 内存——其中 15GB 用于模型权重,8.5GB 用于键值缓存、运行时、操作系统和应用程序。而 aiDAPTIV 将部分模型数据卸载到缓存中,系统内存占用降至 15.9GB。卸载的专家数据现在存储在 SSD 上,仅在路由网络需要时才加载。这使得原本 16GB 系统无法处理的工作负载现在也能轻松应对。. 

然而,我们必须承认,这其中存在着权衡。在不同内存层级之间移动专家模型可能会增加延迟并降低吞吐量。具体影响程度取决于工作负载。重复查询(即重用相同的专家模型)通常性能更佳,而跨域任务则会更加依赖缓存。但是,对于当今驱动本地 AI 的工作负载——例如智能体工作流、编码助手、私有 RAG(红黄绿蓝绿)、文档分析以及研究和规划任务——模型的功能比峰值令牌速度更为重要。群联电子的 aiDAPTIV 技术能够让您在现有硬件上运行功能更强大的模型。. 

 

 

 

深入了解:动态 MoE 的实际运作方式

本文介绍了动态 MoE 的功能。我们的技术团队开发了 白皮书 它会解释它的工作原理以及运行它时会发生什么,包括: 

      • 专家数据如何分布在GPU内存、系统DRAM和缓存中,以及它们在推理过程中如何在不同层级之间移动。
      • 当路由网络需要调用不在 GPU 内存中的专家时会发生什么?这会造成多大的延迟?
      • 缓存和驱逐策略如何使常用专家保持与计算的紧密联系
      • 哪些工作负载模式性能最佳?其优缺点是什么? 

内存是决定系统能够运行哪些模型的瓶颈。这份白皮书详细阐述了GPU内存、系统DRAM和SSD吞吐量各自贡献的资源,以便您可以根据所需的模型来配置系统,而不仅仅是选择一个勉强能运行的模型。.  

想了解更多? 

下载 aiDAPTIV 动态 MoE:用更少的内存运行更大的 MoE 模型 深入了解 MoE 架构、智能内存分层,以及 aiDAPTIV Dynamic MoE 如何使更大的 AI 模型能够在 GPU 内存有限的系统上运行。.  

 

 

常见问题 (FAQ):

什么是专家混合模型(MoE)?

专家混合(教育部该模型是一种神经网络架构,它针对每个推理请求仅激活一小部分专业模型,从而在降低计算量的同时,支持更大的整体模型容量。它无需处理每个词元的每个参数,, 教育部 有选择地将工作负载路由给最相关的专家。这提高了计算效率,并支持更大规模的 AI 模型,而无需成比例地增加资源。 计算 资源,尽管所有专家都必须 仍然存在 可通过系统内存架构访问。. 

为什么混合专家模型需要如此多的内存?

专家混合模型需要大量内存,因为所有专家都必须保持可用,即使在每次推理请求期间只有少数专家处于活动状态。虽然由于不活跃的专家不会被执行,计算需求有所降低,但内存使用量却很高。 遗迹 自……以来一直处于高位 全部收藏 人工智能系统必须存储专家信息。随着模型规模的增大,可用内存往往成为本地人工智能部署的主要限制因素。.

对于大型人工智能模型而言,GPU内存比GPU计算能力更重要吗?

对于许多现代人工智能工作负载而言,可用内存的重要性已经与GPU不相上下。 计算. 大型语言模型 频繁地 在达到 GPU 内存限制之前,完全 利用 可用处理能力。随着模型架构的不断扩展,组织对高效内存的需求也日益增长。 利用率 除了高性能加速器外,还需要成功部署更大的模型。.

内存分层能否帮助在现有硬件上运行更大型的 AI 模型?

是的。内存分层技术允许 AI 模型同时使用 GPU 内存、系统内存和高性能 SSD 缓存,而不是仅仅依赖 GPU 内存。它通过动态地将活动数据放置在速度更快的内存中来实现这一点。 搬迁 较少的 频繁地 通过使用较低层级的数据,组织可以执行更大的人工智能模型,而无需 立即地 升级到更高显存的GPU。.

企业应该购买容量更大的GPU,还是应该改进AI内存管理?

改进人工智能内存管理通常 提供 比其他方式更具成本效益地扩展本地人工智能规模。 购买 GPU尺寸越来越大。GPU容量越来越大。 保持 智能内存架构对许多工作负载都很有价值,但它可以通过更好地利用现有的 GPU 内存、系统内存和存储资源,同时平衡性能、可扩展性和基础设施成本,从而显著扩展可用模型容量。.

Pascari aiDAPTIV™ 如何改进混合专家模型部署?

帕斯卡里 爱达普替夫™ 通过将可用 AI 内存扩展到 GPU 内存、系统内存和基于 SSD 的缓存内存,同时动态管理专家的位置,从而改进了混合专家部署。 居住 在推理过程中,无需将每个专家模型永久加载到GPU内存中,, 爱达普替夫 在保持活跃专家随时可用的情况下,将不活跃的专家模型在不同内存层级之间迁移。这种控制器感知内存架构使组织能够在现有基础设施上运行更大的 AI 模型,同时 维护 高效资源 利用率.

为什么智能内存管理对企业人工智能至关重要?

智能内存管理正变得至关重要,因为企业人工智能越来越依赖于内存效率,而不是…… 计算 仅靠硬件提升成本会越来越高,而且随着模型规模的不断扩大,这种做法也变得越来越不切实际。能够动态协调GPU内存、系统内存和基于SSD的缓存的解决方案,可以帮助企业最大限度地利用现有硬件投资,同时支持更大规模、更强大的AI工作负载,并实现可预测的性能。.

动态 MoE 与传统的 GPU 内存管理有何不同?

动态的 教育部 它与传统的GPU内存管理不同,它将AI内存视为一个灵活的层级结构,而不是要求整个模型永久驻留在GPU内存中。帕斯卡里 爱达普替夫™持续评估哪些专家是当前急需的,并且 搬迁 跨内存层级的非活跃专家。这种动态方法在平衡延迟、内存效率和推理性能的同时,提高了可用模型容量。.

为什么控制器级优化对人工智能内存架构至关重要?

控制器级优化能够高效地在 GPU 内存、系统内存和闪存之间移动 AI 模型数据,同时最大限度地减少降低推理效率的瓶颈。通过协调固件、存储控制器和内存管理,诸如 Pascari 之类的平台可以实现这一目标。 爱达普替夫 能够智能地对活跃模型组件进行优先级排序,提高资源利用率 利用率, 并且支持可扩展的 AI 部署,而无需仅仅依赖于更大的 GPU 内存占用。.

Pascari aiDAPTIV™ 如何帮助企业最大限度地利用现有的 AI 基础设施?

帕斯卡里 爱达普替夫™ 通过协调管理 GPU 内存、系统内存和基于 SSD 的缓存,扩展可用 AI 内存,帮助组织最大限度地利用现有 AI 基础设施。这种架构支持更大规模的混合专家模型。 操作 这使得硬件能够摆脱以往仅受限于GPU内存容量的限制。其结果是,无需立即投资高端GPU,即可实现更灵活的部署、更高的基础设施效率,并为企业级AI提供更具可扩展性的路径。.

加速创新的基础™

zh_CN简体中文