Mixture of Expertsアーキテクチャは、トークンごとにモデルのパラメータのごく一部のみをアクティブ化することで、より大規模なモデル処理能力を実現します。そのため、ローカルAIに最適ですが、モデル全体はメモリ上でアクセス可能な状態にしておく必要があります。ここでは、それがなぜ重要なのか、そしてより大容量のメモリシステムに移行せずに大規模なMoEモデルを実行する方法について説明します。.
少し前までは、自社ハードウェア上でAIモデルを実行するということは、高性能ではあるものの機能が限定されたチャットボットで満足することを意味していた。チャットボットは質問に答えたり、テキストを要約したりすることはできたが、本格的な推論、コーディング、エージェントといった機能はクラウド上でしか実行できなかった。.
しかし、状況は急速に変化しています。今日のローカルモデルは、複数のステップからなる問題を処理したり、コードを記述・デバッグしたり、外部ツールを呼び出したり、画像やドキュメントを理解したり、ユーザーに代わって作業を行う自律型エージェントを駆動したりすることができます。データセンターで動作するものとワークステーションで動作するものの差は、急速に縮まっています。.
この変化の大きな要因の一つは、エキスパート混合(MoE)と呼ばれるアーキテクチャのおかげであり、これにより、計算負荷を軽減することで、GPUリソースが限られたデスクトップやワークステーションでも、より高性能なモデルを実行できるようになります。.
MoEモデルがローカルAIに最適な理由
従来のモデルは高密度であり、すべてのパラメータがすべての出力トークンの生成に関与します。モデル全体がすべてのリクエストに対して動作するため、計算コストはモデルのサイズに比例して増加します。これは、データセンターレベルのGPU処理能力をほとんど備えていないデスクトップシステムにとっては、非常に難しい問題です。.
MoEモデルは異なるアプローチを採用しています。ここでは、より大きなモデルがエキスパートと呼ばれる専門的なサブネットワークに分割されます。各エキスパートは、トレーニング中に独自の専門分野を開発し、自身にルーティングされたデータに基づいて異なる内部パターンと表現を学習します。小さなルーティングネットワークが、各トークンをどのエキスパートが処理すべきかを決定し、そのサブセットのみがアクティブになります。モデルの残りの部分は、このステップでは待機状態となります。.
その結果、毎回すべてのパラメータを計算する必要なく、より高度なモデル機能を実現できます。言い換えれば、MoEモデルは、大規模モデルの知識とスキルを保持しながら、各トークンに対してそのパラメータのごく一部だけをアクティブ化することができます。これは、計算能力が限られている可能性のあるローカルAIにとって理想的です。.
現在のAIの利用方法に合わせて構築されています
新しいMoEモデルは、これがどこに向かっているかを示している。例えば、GoogleのGemma 4 26B A4Bを見てみよう。 Googleのドキュメント, このモデルは合計260億個のパラメータを持ちますが、トークンごとにアクティブ化するのはわずか40億個であるため、同様の総サイズを持つ高密度モデルよりもトークンあたりの計算負荷が大幅に低くなっています。Googleは、このモデルをコンシューマー向けGPUおよびワークステーション向けに位置付けており、組み込みの推論モード、最大256Kトークンのコンテキストウィンドウ、画像理解、より強力なコーディング性能、およびネイティブ関数呼び出し(外部ツールやアプリを呼び出す機能)を備え、自律エージェントを駆動します。.
言い換えれば、これまでクラウドAPIを必要としていた機能が、今ではデスクトップ向けにパッケージ化されている。そして、それらは人々がローカルAIに実際に求めている機能、つまりOpenClawやHermesのようなパーソナルAIエージェント、コーディングアシスタント、個人ファイルに対するプライベートなRAG、文書分析、調査・計画タスク、ワークフロー自動化などに直接対応している。.
こうしたワークロードをローカルで実行することには多くの利点があります。データはハードウェア上に保持されるため、プライバシーとコンプライアンスの面で重要です。インターネットを介さないため、レイテンシは予測可能です。トークンごとのAPI料金は発生しません。そして、モデル、バージョン、スタックを完全に制御できます。.
落とし穴:MoEモデルは小型化されない
40億個のパラメータしか使用しないモデルには、40億個のパラメータ分のメモリしか必要ないと簡単に考えてしまいがちですが、そうではありません。.
このモデルのルーティングネットワークはトークンごとに異なるエキスパートを選択するため、エキスパートの全セットが常に利用可能である必要があります。 ドキュメント これは明白です。Gemma 4 26B A4B はトークンごとに 40 億個のパラメータしかアクティブ化しませんが、ルーティングと推論を高速に保つためには、260 億個すべてをメモリにロードする必要があります。.
つまり、MoEはアクティブな演算処理を削減するものの、メモリ使用量を削減するわけではありません。Phisonがテストした構成では、メモリオフロードなしでGemma 4 26B A4Bを実行するには、約23.5GBのシステムメモリが必要となり、16GBシステムの能力をはるかに超えていました。MoEモデルは機能が向上し続けるにつれてサイズも大きくなり、本来MoEによって強化されるはずだったローカルマシンのGPUやシステムメモリの容量を超えてしまうでしょう。.
MoEでは、ローカルAIの新たなボトルネックはメモリとなる。.
Pascari aiDAPTIV™がMoEをどのように支援するか
Pascari aiDAPTIV™ は、PhisonのAIメモリ管理技術です。GPUメモリ、システムDRAM、NVMe SSDベースのaiDAPTIVキャッシュメモリという3つの階層にわたって、使用可能なAIメモリを拡張します。.
aiDAPTIVのDynamic MoE機能は、そのアーキテクチャをMixture of Expertsモデルに直接適用します。すべてのエキスパートをGPUまたはシステムメモリに常時保持する必要はなく、aiDAPTIVはエキスパートを動的にキャッシュされたユニットとして扱います。ルーティングネットワークが必要とするエキスパートは計算のためにGPUメモリに保持され、残りのエキスパートはシステムDRAMにキャッシュするか、aiDAPTIVキャッシュメモリにオフロードして、モデルのルーティング決定が変更されるたびにオンデマンドでロードできます。.
例えば、Gemma 4 26B A4B を実行するには通常 23.GB のメモリが必要で、内訳はモデルの重みに 15GB、KV キャッシュ、ランタイム、OS、アプリケーションに 8.5GB です。aiDAPTIV がモデルの一部をキャッシュメモリにオフロードすると、システムメモリの使用量は 15.9GB に減少します。オフロードされたエキスパートは SSD 上に保存され、ルーティングネットワークが必要としたときにのみロードされます。これにより、16GB システムでは処理できなかったワークロードも処理可能になります。.
しかし、正直に言って、トレードオフは存在します。エキスパートをメモリ階層間で移動させると、レイテンシが増加し、スループットが低下する可能性があります。その程度はワークロードによって異なります。同じエキスパートを再利用する反復クエリは一般的にパフォーマンスが向上しますが、ドメイン間を移動するタスクはキャッシュへの依存度が高くなります。しかし、今日のローカルAIを支えるワークロード(エージェントワークフロー、コーディングアシスタント、プライベートRAG、ドキュメント分析、調査・計画タスクなど)においては、ピーク時のトークン速度よりも、モデルが何ができるかが重要になります。PhisonのaiDAPTIVテクノロジーは、既存のハードウェア上で、より高性能なモデルを実現します。.
さらに詳しく:Dynamic MoEの実際の仕組み
この記事では、Dynamic MoE の機能について説明します。当社の技術チームは、 ホワイトペーパー これは、その仕組みと実行時に期待できることを説明するもので、以下の内容が含まれます。
-
-
- エキスパートがGPUメモリ、システムDRAM、キャッシュメモリにどのように配置されるか、また推論中にティア間をどのように移動するか
- ルーティングネットワークがGPUメモリに存在しないエキスパートを要求した場合、何が起こるのか、そしてその場合、レイテンシはどれくらい増加するのか。
- キャッシュと削除ポリシーが、頻繁に使用されるエキスパートをコンピューティングの近くに維持する方法
- どのワークロードパターンが最も優れたパフォーマンスを発揮し、どのようなトレードオフがあるのか
-
メモリ容量は、システムで実行できるモデルを決定する制約要因です。このホワイトペーパーでは、GPUメモリ、システムDRAM、SSDスループットがそれぞれどの程度貢献するかを詳しく説明しているので、単に適合するモデルだけでなく、希望するモデルに合わせてシステムをサイジングできます。.
もっと詳しく知りたいですか?
ダウンロード aiDAPTIV Dynamic MoE: より少ないメモリでより大規模な MoE モデルを実行する MoEアーキテクチャ、インテリジェントなメモリ階層化、そしてaiDAPTIV Dynamic MoEがどのようにしてGPUメモリが限られたシステム上で大規模なAIモデルを実行できるようにするのかについて、より詳しく知りたい場合は、こちらをご覧ください。.
よくある質問(FAQ):
エキスパート混合モデル(MoEモデル)とは何ですか?
専門家の混合(教育省)モデルは、推論要求ごとに専門のエキスパートのごく一部だけを活性化するニューラルネットワークアーキテクチャであり、計算量を削減しながら、モデル全体の容量を大幅に拡大します。トークンごとにすべてのパラメーターを処理する代わりに、, 教育省 ワークロードを最も関連性の高い専門家に選択的にルーティングします。これにより、計算効率が向上し、比例的な増加を必要とせずに、より大規模な AI モデルが可能になります。 計算する すべての専門家は 依然として残っている システムのメモリアーキテクチャを通じてアクセス可能。.
エキスパート混合モデルはなぜそんなに多くのメモリを必要とするのでしょうか?
エキスパート混合モデルでは、推論要求ごとにアクティブになるエキスパートはごく少数であるにもかかわらず、すべてのエキスパートが常に利用可能である必要があるため、相当量のメモリが必要となります。非アクティブなエキスパートは実行されないため計算要件は減少しますが、メモリ使用量は増加します。 遺体 以来高い 全コレクション 専門家のデータはAIシステム全体にわたって保存されなければならない。モデルのサイズが大きくなるにつれて、利用可能なメモリがローカルAI展開における主要な制約となることが多い。.
大規模なAIモデルにおいて、GPUの演算能力よりもGPUメモリの方が重要なのでしょうか?
多くの最新のAIワークロードにおいて、利用可能なメモリはGPUと同じくらい重要になっている。 計算する. 大規模言語モデル 頻繁に 完全にGPUメモリ制限に達する前に 利用 利用可能な処理能力。モデルアーキテクチャが拡大し続けるにつれて、組織は効率的なメモリをますます必要とするようになる。 利用 さらに、より大規模なモデルを正常に展開するためには、高性能アクセラレータも必要となる。.
メモリ階層化は、既存のハードウェア上でより大規模なAIモデルを実行するのに役立つだろうか?
はい。メモリ階層化により、AI モデルは GPU メモリのみに依存するのではなく、GPU メモリ、システム メモリ、および高性能 SSD ベースのキャッシュ メモリを一緒に使用できます。アクティブなデータをより高速なメモリに動的に配置することで、 移転する 少ない 頻繁に 下位層にデータを使用することで、組織はより大規模なAIモデルを実行できます。 すぐに メモリ容量の大きいGPUにアップグレードする。.
組織はより高性能なGPUを購入すべきか、それともAIのメモリ管理を改善すべきか?
AIのメモリ管理を改善する 提供する ローカルAIを拡張するためのより費用対効果の高い方法 購入 ますます大型化するGPU。より大容量のGPU 残る 多くのワークロードにとって価値のあるものですが、インテリジェントなメモリアーキテクチャは、既存のGPUメモリ、システムメモリ、ストレージリソースをより有効活用することで、パフォーマンス、拡張性、インフラストラクチャコストのバランスを取りながら、使用可能なモデル容量を大幅に拡大できます。.
Pascari aiDAPTIV™は、専門家混合分析(Mixture of Experts)の導入をどのように改善するのでしょうか?
パスカリ aiDAPTIV™ は、GPU メモリ、システム メモリ、および SSD ベースのキャッシュ メモリにわたって使用可能な AI メモリを拡張し、エキスパートがどこに配置されるかを動的に管理することで、Mixture of Experts の展開を改善します。 居住する 推論中。すべてのエキスパートをGPUメモリに永続的にロードしておくのではなく、, aiDAPTIV 非アクティブなエキスパートをメモリ階層間で移動させながら、アクティブなエキスパートをすぐに利用できる状態に保ちます。このコントローラー対応メモリアーキテクチャにより、組織は既存のインフラストラクチャ上でより大規模なAIモデルを実行できます。 維持する 効率的な資源 利用.
なぜインテリジェントなメモリ管理が企業向けAIにとって不可欠になりつつあるのか?
インテリジェントなメモリ管理は、企業AIがメモリ効率にますます依存するようになるにつれて不可欠になりつつあります。 計算する 単独では対応できません。モデルサイズが拡大し続けるにつれて、より大型のGPUを追加するだけではコストがかさみ、実用的ではなくなっていきます。GPUメモリ、システムメモリ、SSDベースのキャッシュを動的に連携させるソリューションは、企業が既存のハードウェア投資を最大限に活用しながら、より大規模で高性能なAIワークロードを予測可能なパフォーマンスでサポートするのに役立ちます。.
Dynamic MoEは、従来のGPUメモリ管理とどのように異なるのでしょうか?
動的 教育省 従来のGPUメモリ管理とは異なり、AIメモリを柔軟な階層構造として扱い、モデル全体をGPUメモリに永続的に保持する必要がない。 aiDAPTIV™は、どの専門家が積極的に必要とされているかを継続的に評価し、 移転する メモリ階層全体にわたって、非アクティブなエキスパートを活用します。この動的なアプローチにより、レイテンシ、メモリ効率、推論パフォーマンスのバランスを取りながら、使用可能なモデル容量が増加します。.
AIメモリアーキテクチャにおいて、コントローラレベルの最適化が重要なのはなぜですか?
コントローラレベルの最適化により、AI モデル データを GPU メモリ、システム メモリ、フラッシュ間で効率的に移動させることができ、推論効率を低下させるボトルネックを最小限に抑えることができます。ファームウェア、ストレージ コントローラ、メモリ管理を連携させることで、Pascari などのプラットフォームは、 aiDAPTIV アクティブなモデルコンポーネントをインテリジェントに優先順位付けし、リソースを改善できます 利用, また、より大きなGPUメモリ容量にのみ依存することなく、スケーラブルなAI展開をサポートします。.
Pascari aiDAPTIV™は、組織が既存のAIインフラストラクチャを最大限に活用するためにどのように役立つのでしょうか?
パスカリ aiDAPTIV™は、GPUメモリ、システムメモリ、SSDベースのキャッシュメモリの協調管理により使用可能なAIメモリを拡張することで、組織が既存のAIインフラストラクチャを最大限に活用できるよう支援します。このアーキテクチャにより、より大規模なエキスパート混合モデルが 操作する 従来であればGPUメモリ容量のみによって制約されていたハードウェア上で、より高いパフォーマンスを実現します。その結果、導入の柔軟性が向上し、インフラ効率が改善され、高性能GPUへの即時投資を必要とせずに、エンタープライズAIの拡張性を高めることができます。.











