專家混合模型(MoE)減輕了本地人工智慧的運算負擔:但記憶體方面卻並非如此。

作者 | 2026 年 7 月 16 日 | 人工智慧, 全部, 精選

混合專家架構能夠處理更大規模的模型,同時每個令牌僅啟動模型的一小部分參數。這使其非常適合本地人工智慧,但完整的模型仍然需要駐留在記憶體中。本文將解釋這一點的重要性,以及如何在不升級到更高記憶體系統的情況下運行更大規模的混合專家模型。.

不久前,在自有硬體上運行人工智慧模型意味著只能得到一個功能尚可但較為簡單的聊天機器人。它可以回答問題和總結文本,但真正重要的工作——推理、編碼、智能體建構——仍然由雲端完成。.  

這種情況正在迅速改變。如今的本地模型能夠處理多步驟問題、編寫和調試程式碼、調用外部工具、理解圖像和文檔,並驅動代表你工作的自主代理。資料中心運作的系統與工作站運作的系統之間的差距正在迅速縮小。. 

這種轉變很大程度上要歸功於一種名為「專家混合模型」(Mixture of Experts,簡稱 MoE)的架構,它透過減輕運算負擔,使這些更強大的模型能夠在 GPU 資源有限的桌上型電腦和工作站上運行。.

 

 

為什麼教育部模型天然適合本地人工智慧

傳統模型是密集型的,這意味著模型中的每個參數都會參與產生每個輸出標記。由於每次請求都需要整個模型進行計算,因此計算成本與模型規模有直接關係。這對桌面系統來說是一個棘手的問題,因為它們很少擁有資料中心層級的GPU算力。. 

MoE模型採用了不同的方法。在這種模型中,一個較大的模型被劃分成若干個稱為「專家」的專門子網路。每個專家在訓練過程中都會發展出自己的專注領域,並根據接收的資料學習不同的內部模式和表示。一個小型路由網路決定由哪個專家處理每個詞元,只有這部分專家會被啟動。模型的其餘部分在這一步驟中處於空閒狀態。. 

其結果是,無需每次都計算所有參數,即可實現更強大的模型能力。換句話說,MoE 模型可以承載大型模型的知識和技能,而每次呼叫時僅啟動其部分參數。這對於運算能力可能有限的本地 AI 而言是理想之選。.   

 

專為目前人工智慧的使用方式而設計

新的 MoE 模型展示了這一發展方向。以Google的 Gemma 4 26B A4B 為例。根據… 谷歌的文檔, 該模型總共包含 260 億個參數,但每個 token 僅啟動 40 億個參數,因此其每個 token 的計算負擔遠低於規模相近的密集模型。谷歌將其定位為面向消費級 GPU 和工作站,並內建推理模式、最大 25.6 萬個 token 的上下文視窗、圖像理解功能、更強的編碼性能以及原生函數呼叫(能夠調用外部工具和應用程式),從而為自主代理提供支援。. 

換句話說,過去需要雲端 API 才能實現的功能,現在都打包到了桌面端。而且,這些功能直接對應著人們實際希望本地 AI 實現的功能:例如 OpenClaw 和 Hermes 等個人 AI 代理、編碼助理、對個人文件進行私人 RAG 管理、文件分析、研究和規劃任務以及工作流程自動化。. 

在本地運行這類工作負載有很多優點。您的資料保留在本地硬體上,這對於隱私和合規性至關重要。由於無需透過互聯網傳輸數據,延遲是可預測的。無需支付每個令牌的 API 費用。而且,您可以完全掌控模型、版本和堆疊。. 

 

但問題在於:MoE 型號的體積並沒有縮小。

人們很容易認為,一個只啟動 40 億個參數的模型只需要相當於 40 億個參數的記憶體。事實並非如此。. 

此模型的路由網路會為不同的令牌選擇不同的專家,因此必須始終提供完整的專家集。谷歌自己的 文件 這清楚地表明:雖然 Gemma 4 26B A4B 每個令牌僅啟動 40 億個參數,但為了保持路由和推理速度快,所有 260 億個參數都必須載入到記憶體中。. 

因此,雖然 MoE 減少了活躍運算量,但並沒有縮小記憶體佔用。在 Phison 的測試配置中,運行 Gemma 4 26B A4B 且不進行任何記憶體卸載,大約需要 23.5GB 的系統記憶體——這輕鬆超過了 16GB 系統的記憶體容量。隨著 MoE 型號性能的不斷提升,它們的體積也會不斷增大,最終超過它們原本要支援的本地機器的 GPU 和系統記憶體容量。. 

隨著教育部的介入,本地人工智慧面臨的新瓶頸是記憶體。. 

 


 

Pascari aiDAPTIV™ 如何幫助教育部

Pascari aiDAPTIV™ 是群聯電子的AI記憶體管理技術。它將可用的AI記憶體擴展到三個層級:GPU記憶體、系統DRAM和基於NVMe SSD的aiDAPTIV快取記憶體。. 

其動態混合模型 (MoE) 功能將該架構直接應用於專家混合模型。 aiDAPTIV 並非要求每個專家永久駐留在 GPU 或系統記憶體中,而是將專家視為動態快取單元。路由網路所需的專家保存在 GPU 記憶體中進行運算,而其餘專家可以快取在系統 DRAM 中,或卸載到 aiDAPTIV 快取中,並根據模型路由決策的變化按需載入。. 

例如,運行 Gemma 4 26B A4B 通常需要 23.GB 記憶體——其中 15GB 用於模型權重,8.5GB 用於鍵值快取、運行時、作業系統和應用程式。而 aiDAPTIV 將部分模型資料卸載到快取中,系統記憶體佔用量降至 15.9GB。卸載的專家資料現在儲存在 SSD 上,僅在路由網路需要時才載入。這使得原本 16GB 系統無法處理的工作負載現在也能輕鬆應付。. 

然而,我們必須承認,這其中存在著權衡。在不同記憶體層級之間移動專家模型可能會增加延遲並降低吞吐量。具體影響程度取決於工作負載。重複查詢(即重複使用相同的專家模型)通常效能較佳,而跨域任務則會更依賴快取。但是,對於當今驅動本地 AI 的工作負載——例如智慧體工作流程、編碼助理、私人 RAG(紅黃綠藍綠)、文件分析以及研究和規劃任務——模型的功能比峰值令牌速度更為重要。群聯電子的 aiDAPTIV 技術能夠讓您在現有硬體上運行更強大的模型。. 

 

 

 

深入了解:動態 MoE 的實際運作方式

本文介紹了動態 MoE 的功能。我們的技術團隊開發了 白皮書 它會解釋它的工作原理以及運行它時會發生什麼,包括: 

      • 專家資料如何分佈在GPU記憶體、系統DRAM和快取中,以及它們在推理過程中如何在不同層級之間移動。
      • 當路由網路需要呼叫不在 GPU 記憶體中的專家時會發生什麼事?這會造成多大的延遲?
      • 快取和驅逐策略如何使常用專家保持與計算的緊密聯繫
      • 哪些工作負載模式效能最佳?其優缺點是什麼? 

記憶體是決定係統能夠運行哪些模型的瓶頸。這份白皮書詳細闡述了GPU記憶體、系統DRAM和SSD吞吐量各自貢獻的資源,以便您可以根據所需的模型來配置系統,而不僅僅是選擇一個勉強能運行的模型。.  

想了解更多? 

下載 aiDAPTIV 動態 MoE:用更少的記憶體運行更大的 MoE 模型 深入了解 MoE 架構、智慧記憶體分層,以及 aiDAPTIV Dynamic MoE 如何讓更大的 AI 模型能夠在 GPU 記憶體有限的系統上運作。.  

 

 

常見問題 (FAQ):

什麼是專家混合模型(MoE)?

專家混合(教育部該模型是一種神經網路架構,它針對每個推理請求僅啟動一小部分專業模型,在降低運算量的同時,支援更大的整體模型容量。它無需處理每個詞元的每個參數,, 教育部 選擇性地將工作負載路由給最相關的專家。這提高了計算效率,並支援更大規模的 AI 模型,而無需成比例地增加資源。 計算 資源,儘管所有專家都必須 仍然存在 可透過系統記憶體架構存取。. 

為什麼混合專家模型需要這麼多的記憶體?

專家混合模型需要大量內存,因為所有專家都必須保持可用,即使在每次推理請求期間只有少數專家處於活動狀態。雖然由於不活躍的專家不會被執行,計算需求降低,但記憶體使用量卻很高。 遺跡 自從…以來一直處於高位 全部收藏 人工智慧系統必須儲存專家資訊。隨著模型規模的增大,可用記憶體往往成為本地人工智慧部署的主要限制因素。.

對於大型人工智慧模型而言,GPU記憶體比GPU運算能力更重要嗎?

對於許多現代人工智慧工作負載而言,可用記憶體的重要性已經與GPU不相上下。 計算. 大型語言模型 頻繁地 在達到 GPU 記憶體限制之前,完全 利用 可用處理能力。隨著模型架構的不斷擴展,組織對高效能記憶體的需求也日益增長。 使用率 除了高效能加速器外,還需要成功部署更大的模式。.

記憶體分層能否幫助在現有硬體上運行更大型的 AI 模型?

是的。記憶體分層技術允許 AI 模型同時使用 GPU 記憶體、系統記憶體和高效能 SSD 緩存,而不是僅僅依賴 GPU 記憶體。它透過動態地將活動資料放置在速度更快的記憶體中來實現這一點。 搬遷 較少的 頻繁地 透過使用較低層級的數據,組織可以執行更大的人工智慧模型,而無需 立即地 升級到更高顯存的GPU。.

企業應該購買容量更大的GPU,還是應該改進AI記憶體管理?

改進人工智慧記憶體管理通常 提供 比其他方式更具成本效益地擴展本地人工智慧規模。 購買 GPU尺寸越來越大。 GPU容量越來越大。 保持 智慧記憶體架構對許多工作負載都很有價值,但它可以透過更好地利用現有的 GPU 記憶體、系統記憶體和儲存資源,同時平衡效能、可擴展性和基礎設施成本,從而顯著擴展可用模型容量。.

Pascari aiDAPTIV™ 如何改善混合專家模型部署?

帕斯卡里 愛達普替夫™ 透過將可用 AI 記憶體擴展到 GPU 記憶體、系統記憶體和基於 SSD 的快取內存,同時動態管理專家的位置,從而改進了混合專家部署。 居住 在推理過程中,無需將每個專家模型永久載入到GPU記憶體中,, 愛達普替夫 在保持活躍專家隨時可用的情況下,將不活躍的專家模型在不同記憶體層級之間遷移。這種控制器感知記憶體架構使組織能夠在現有基礎設施上運行更大的 AI 模型,同時 維護 高效率資源 使用率.

為什麼智慧記憶體管理對企業人工智慧至關重要?

智慧記憶體管理正變得至關重要,因為企業人工智慧越來越依賴記憶體效率,而不是… 計算 僅靠硬體提升成本會越來越高,而且隨著模型規模的不斷擴大,這種做法也變得越來越不切實際。能夠動態協調GPU記憶體、系統記憶體和基於SSD的快取的解決方案,可以幫助企業最大限度地利用現有硬體投資,同時支援更大規模、更強大的AI工作負載,並實現可預測的效能。.

動態 MoE 與傳統的 GPU 記憶體管理有何不同?

動態的 教育部 它與傳統的GPU記憶體管理不同,它將AI記憶體視為一個靈活的層級結構,而不是要求整個模型永久駐留在GPU記憶體中。帕斯卡里 愛達普替夫™持續評估哪些專家是目前急需的,並且 搬遷 跨記憶體層級的非活躍專家。這種動態方法在平衡延遲、記憶體效率和推理效能的同時,提高了可用模型容量。.

為什麼控制器級優化對人工智慧記憶體架構至關重要?

控制器級優化能夠有效地在 GPU 記憶體、系統記憶體和快閃記憶體之間移動 AI 模型數據,同時最大限度地減少降低推理效率的瓶頸。透過協調韌體、儲存控制器和記憶體管理,諸如 Pascari 之類的平台可以實現這一目標。 愛達普替夫 能夠智慧地對活躍模型元件進行優先排序,提高資源利用率 使用率, 並且支援可擴展的 AI 部署,而無需僅依賴更大的 GPU 記憶體佔用。.

Pascari aiDAPTIV™ 如何幫助企業最大限度地利用現有的 AI 基礎設施?

帕斯卡里 愛達普替夫™ 透過協調管理 GPU 記憶體、系統記憶體和基於 SSD 的緩存,擴展可用 AI 內存,幫助組織最大限度地利用現有 AI 基礎設施。這種架構支援更大規模的混合專家模型。 操作 這使得硬體能夠擺脫以往僅受限於GPU記憶體容量的限制。結果是,無需立即投資高階GPU,即可實現更靈活的部署、更高的基礎設施效率,並為企業級AI提供更具可擴展性的路徑。.

加速創新的基礎™

zh_TW繁體中文