전문가 혼합(MoE)은 로컬 AI의 컴퓨팅 부하를 줄여주지만, 메모리 사용량에는 같은 효과를 기대하기 어렵습니다.

작가 | 2026년 7월 16일 | 일체 포함, 모두, 추천

전문가 혼합(Mixture of Experts, MoE) 아키텍처는 토큰당 모델 매개변수의 일부만 활성화하면서 더 큰 모델의 기능을 제공합니다. 따라서 로컬 AI에 매우 적합하지만, 전체 모델은 여전히 메모리에 상시 접근 가능해야 합니다. 왜 이것이 중요한지, 그리고 더 큰 메모리 시스템으로 업그레이드하지 않고도 더 큰 MoE 모델을 실행하는 방법을 알아보겠습니다.

얼마 전까지만 해도 자체 하드웨어에서 AI 모델을 실행한다는 것은 성능은 좋지만 기능이 제한적인 챗봇에 만족해야 한다는 것을 의미했습니다. 질문에 답하고 텍스트를 요약할 수는 있었지만, 추론, 코딩, 에이전트 처리와 같은 핵심 작업은 클라우드에 남아 있었습니다.  

하지만 상황은 빠르게 변화하고 있습니다. 오늘날의 로컬 모델은 여러 단계를 거치는 문제를 분석하고, 코드를 작성 및 디버깅하고, 외부 도구를 호출하고, 이미지와 문서를 이해하고, 사용자를 대신하여 작동하는 자율 에이전트를 구동할 수 있습니다. 데이터 센터에서 실행되는 것과 워크스테이션에서 실행되는 것 사이의 격차가 빠르게 좁혀지고 있습니다. 

이러한 변화의 상당 부분은 MoE(Mixture of Experts)라는 아키텍처 덕분인데, 이 아키텍처는 컴퓨팅 부담을 줄여 GPU 리소스가 제한된 데스크톱 및 워크스테이션에서도 이러한 고성능 모델을 실행할 수 있도록 해줍니다.

 

 

MoE 모델이 로컬 AI에 적합한 이유는 무엇일까요?

기존 모델은 밀집형 모델로, 모든 매개변수가 모든 출력 토큰 생성에 관여합니다. 전체 모델이 모든 요청에 대해 작동하기 때문에 컴퓨팅 비용은 모델 크기에 비례하여 증가합니다. 이는 데이터 센터 수준의 GPU 처리 능력을 갖추지 못한 데스크톱 시스템에는 큰 부담이 됩니다. 

MoE 모델은 다른 접근 방식을 취합니다. 이 모델에서는 더 큰 모델이 전문가라고 불리는 특화된 하위 네트워크로 나뉩니다. 각 전문가는 훈련 과정에서 고유한 집중 영역을 개발하고, 자신에게 전달되는 데이터를 기반으로 다양한 내부 패턴과 표현 방식을 학습합니다. 작은 라우팅 네트워크는 각 토큰을 어떤 전문가가 처리해야 하는지 결정하고, 해당 전문가 그룹만 활성화됩니다. 나머지 모델은 이 단계 동안 유휴 상태를 유지합니다. 

그 결과, 모든 매개변수를 매번 계산할 필요 없이 더 큰 모델 기능을 구현할 수 있습니다. 다시 말해, MoE 모델은 대규모 모델의 지식과 기술을 보유하면서도 각 토큰에 대해 일부 매개변수만 활성화할 수 있습니다. 이는 컴퓨팅 성능이 제한적일 수 있는 로컬 AI 환경에 이상적입니다.   

 

현재 AI 사용 방식에 맞춰 설계되었습니다.

새로운 MoE 모델은 이러한 추세가 어디로 향하고 있는지 보여줍니다. 예를 들어 구글의 Gemma 4 26B A4B를 살펴보겠습니다. 구글 문서, 이 모델은 총 260억 개의 매개변수를 가지고 있지만 토큰당 40억 개만 활성화하므로, 비슷한 전체 크기의 밀집 모델보다 토큰당 연산 부담이 훨씬 적습니다. 구글은 이 모델을 소비자용 GPU와 워크스테이션에 적합하게 설계했으며, 내장된 추론 모드, 최대 25만 6천 개의 토큰을 처리하는 컨텍스트 윈도우, 이미지 이해 기능, 향상된 코딩 성능, 그리고 자율 에이전트를 구동하기 위한 네이티브 함수 호출(외부 도구 및 앱을 호출하는 기능)을 제공합니다. 

다시 말해, 과거에는 클라우드 API가 필요했던 기능들이 이제 데스크톱용으로 패키지화되었습니다. 그리고 이러한 기능들은 사람들이 로컬 AI에 실제로 원하는 기능, 즉 OpenClaw나 Hermes 같은 개인 AI 에이전트, 코딩 도우미, 개인 파일에 대한 비공개 RAG(Research Application Group), 문서 분석, 연구 및 계획 작업, 워크플로 자동화와 직접적으로 연결됩니다. 

이러한 유형의 워크로드를 로컬에서 실행하면 여러 가지 이점이 있습니다. 데이터가 하드웨어에 저장되므로 개인 정보 보호 및 규정 준수에 유리합니다. 인터넷을 거치지 않으므로 지연 시간을 예측할 수 있습니다. 토큰별 API 사용료가 발생하지 않습니다. 또한 모델, 버전 및 스택을 완벽하게 제어할 수 있습니다. 

 

문제는 MoE 모델이 더 작지 않다는 점입니다.

40억 개의 매개변수만 활성화하는 모델이라면 40억 개의 매개변수에 해당하는 메모리만 필요할 거라고 쉽게 생각할 수 있지만, 그렇지 않습니다. 

모델의 라우팅 네트워크는 토큰마다 다른 전문가를 선택하므로 모든 전문가가 항상 사용 가능해야 합니다. 구글 자체의 선적 서류 비치 이를 명확히 설명하자면, Gemma 4 26B A4B는 토큰당 40억 개의 매개변수만 활성화하지만, 라우팅과 추론 속도를 빠르게 유지하려면 260억 개의 매개변수 모두를 메모리에 로드해야 합니다. 

따라서 MoE는 활성 컴퓨팅 작업을 줄여주지만 메모리 사용량은 줄이지 않습니다. Phison에서 테스트한 구성에서 메모리 오프로드 없이 Gemma 4 26B A4B를 실행하려면 약 23.5GB의 시스템 메모리가 필요했는데, 이는 16GB 시스템의 용량을 훨씬 초과하는 수치입니다. MoE 모델의 기능이 계속 향상됨에 따라 크기도 계속 커져서, 원래 지원하도록 설계된 로컬 머신의 GPU 및 시스템 메모리 용량을 넘어서게 될 것입니다. 

MoE로 인해 로컬 AI의 새로운 병목 현상은 메모리가 되었습니다. 

 


 

Pascari aiDAPTIV™가 교육부를 지원하는 방법

파스카리 아이답티브™ Phison의 AI 메모리 관리 기술입니다. 이 기술은 GPU 메모리, 시스템 DRAM, NVMe SSD 기반 aiDAPTIV 캐시 메모리의 세 가지 계층에 걸쳐 사용 가능한 AI 메모리를 확장합니다. 

aiDAPTIV의 동적 MoE(Mixture of Experts) 기능은 해당 아키텍처를 전문가 혼합 모델에 직접 적용합니다. 모든 전문가가 GPU 또는 시스템 메모리에 영구적으로 상주해야 하는 대신, aiDAPTIV는 전문가를 동적으로 캐시되는 단위로 처리합니다. 라우팅 네트워크에 필요한 전문가는 계산을 위해 GPU 메모리에 유지되고, 나머지는 시스템 DRAM에 캐시되거나 aiDAPTIV 캐시 메모리로 오프로드되어 모델의 라우팅 결정이 변경될 때 필요에 따라 로드됩니다. 

예를 들어, Gemma 4 26B A4B를 실행하는 데 일반적으로 23GB의 메모리가 필요합니다. 이 중 15GB는 모델 가중치에, 8.5GB는 KV 캐시, 런타임, 운영 체제 및 애플리케이션에 사용됩니다. aiDAPTIV는 모델의 일부를 캐시 메모리로 오프로드하여 시스템 메모리 사용량을 15.9GB로 줄입니다. 오프로드된 전문가들은 이제 SSD에 저장되며 라우팅 네트워크에서 요청할 때만 로드됩니다. 따라서 16GB 시스템에서는 처리할 수 없었던 워크로드도 이제 실행 가능하게 됩니다. 

하지만 인정해야 할 절충점이 있습니다. 메모리 계층 간에 전문가를 이동하면 지연 시간이 증가하고 처리량이 감소할 수 있습니다. 그 정도는 워크로드에 따라 다릅니다. 동일한 전문가를 재사용하는 반복적인 쿼리는 일반적으로 성능이 더 좋지만, 여러 도메인을 넘나드는 작업은 캐시에 더 많은 부담을 줍니다. 그러나 오늘날 로컬 AI를 주도하는 워크로드, 즉 에이전트 워크플로, 코딩 도우미, 개인 RAG, 문서 분석, 연구 및 계획 작업의 경우 모델의 성능이 최고 토큰 처리 속도보다 더 중요합니다. Phison의 aiDAPTIV 기술은 이미 보유하고 있는 하드웨어에서 더욱 강력한 모델을 구현할 수 있도록 해줍니다. 

 

 

 

더 자세히 알아보기: Dynamic MoE는 실제로 어떻게 작동할까요?

이 글에서는 Dynamic MoE의 기능에 대해 설명합니다. 저희 기술팀은 Dynamic MoE를 개발했습니다. 백서 이 문서에서는 작동 방식과 실행 시 예상되는 결과를 설명합니다. 여기에는 다음 내용이 포함됩니다. 

      • 전문가들이 GPU 메모리, 시스템 DRAM, 캐시 메모리에 어떻게 배치되고, 추론 과정에서 계층 간에 어떻게 이동하는지
      • 라우팅 네트워크가 GPU 메모리에 없는 전문가를 요청할 때 어떤 일이 발생하며, 이로 인한 지연 시간은 어떻게 될까요?
      • 캐싱 및 제거 정책을 통해 자주 사용되는 전문가를 컴퓨팅 환경 가까이에 유지하는 방법
      • 어떤 워크로드 패턴이 가장 좋은 성능을 보이며, 그에 따른 장단점은 무엇일까요? 

메모리는 시스템에서 실행할 수 있는 모델을 결정하는 제약 조건입니다. 백서에서는 GPU 메모리, 시스템 DRAM, SSD 처리량이 각각 얼마나 기여하는지 자세히 설명하므로, 단순히 시스템에 맞는 모델이 아닌 원하는 모델에 맞춰 시스템을 구성할 수 있습니다.  

더 자세히 알아볼 준비가 되셨나요? 

다운로드 aiDAPTIV Dynamic MoE: 더 적은 메모리로 더 큰 MoE 모델 실행 MoE 아키텍처, 지능형 메모리 계층화, 그리고 aiDAPTIV Dynamic MoE가 GPU 메모리가 제한된 시스템에서 더 큰 AI 모델을 실행할 수 있도록 하는 방법에 대한 자세한 내용은 다음을 참조하십시오.  

 

 

자주 묻는 질문(FAQ) :

전문가 혼합 모델(MoE)이란 무엇인가요?

다양한 전문가들의 조합 (교육부이 모델은 각 추론 요청에 대해 소수의 전문 전문가만 활성화하는 신경망 아키텍처로, 계산량을 줄이면서 전체 모델 용량을 훨씬 더 크게 지원합니다. 모든 토큰에 대해 모든 매개변수를 처리하는 대신, 교육부 가장 관련성이 높은 전문가에게 선택적으로 작업 부하를 배정합니다. 이를 통해 계산 효율성이 향상되고, 비례적인 부하 증가 없이 더 큰 AI 모델을 구현할 수 있습니다. 계산하다 모든 전문가가 자원을 활용해야 하지만 여전히 남아 있습니다 시스템의 메모리 아키텍처를 통해 접근 가능합니다. 

전문가 혼합 모델은 왜 그렇게 많은 메모리를 필요로 할까요?

전문가 혼합 모델은 모든 전문가가 항상 사용 가능한 상태를 유지해야 하므로 상당한 메모리를 필요로 합니다. 비록 각 추론 요청 시 일부 전문가만 활성화되더라도 말입니다. 비활성화된 전문가는 실행되지 않으므로 컴퓨팅 요구 사항은 감소하지만, 메모리 사용량은 증가합니다. 유적 높은 전체 컬렉션 전문가 데이터는 AI 시스템 전체에 저장되어야 합니다. 모델 크기가 커짐에 따라 사용 가능한 메모리가 로컬 AI 배포의 주요 제약 조건이 되는 경우가 많습니다.

대규모 AI 모델에서 GPU 메모리가 GPU 연산 능력보다 더 중요한가요?

많은 최신 AI 워크로드에서 사용 가능한 메모리는 GPU만큼이나 중요해졌습니다. 계산하다. 대규모 언어 모델 자주 GPU 메모리 한계에 도달하기 전에 완전히 활용 사용 가능한 처리 능력. 모델 아키텍처가 계속 확장됨에 따라 조직은 효율적인 메모리가 점점 더 필요해지고 있습니다. 이용 더 나아가, 더 큰 규모의 모델을 성공적으로 배포하기 위한 고성능 가속기도 필요합니다.

메모리 계층화는 기존 하드웨어에서 더 큰 AI 모델을 실행하는 데 도움이 될 수 있을까요?

네. 메모리 계층화는 AI 모델이 GPU 메모리에만 의존하는 대신 GPU 메모리, 시스템 메모리 및 고성능 SSD 기반 캐시 메모리를 함께 사용할 수 있도록 합니다. 활성 데이터를 더 빠른 메모리에 동적으로 배치하는 방식으로 작동합니다. 이사 더 적은 자주 데이터를 하위 계층으로 전송함으로써 조직은 더 큰 AI 모델을 실행할 수 있습니다. 즉시 더 높은 메모리 용량의 GPU로 업그레이드.

기업은 더 큰 GPU를 구매해야 할까요, 아니면 AI 메모리 관리를 개선해야 할까요?

AI 메모리 관리 개선은 종종 제공합니다 로컬 AI를 확장하는 데 있어 보다 비용 효율적인 방법 구매 점점 더 커지는 GPU. 더 높은 용량의 GPU 유지하다 많은 워크로드에 유용하지만, 지능형 메모리 아키텍처는 기존 GPU 메모리, 시스템 메모리 및 스토리지 리소스를 더 효율적으로 활용하면서 성능, 확장성 및 인프라 비용의 균형을 유지함으로써 사용 가능한 모델 용량을 크게 확장할 수 있습니다.

Pascari aiDAPTIV™는 전문가 혼합형 배포를 어떻게 개선합니까?

파스카리 aiDAPTIV™는 GPU 메모리, 시스템 메모리 및 SSD 기반 캐시 메모리 전반에 걸쳐 사용 가능한 AI 메모리를 확장하고 전문가의 위치를 동적으로 관리함으로써 전문가 혼합 배포를 개선합니다. 살다 추론 과정에서. 모든 전문가가 GPU 메모리에 영구적으로 로드된 상태를 유지하도록 요구하는 대신, aiDAPTIV 비활성 전문가를 메모리 계층 간에 이동시키면서 활성 전문가는 항상 즉시 사용할 수 있도록 유지합니다. 이러한 컨트롤러 인식 메모리 아키텍처를 통해 조직은 기존 인프라에서 더 큰 AI 모델을 실행할 수 있습니다. 유지하다 효율적인 자원 이용.

기업용 AI에서 지능형 메모리 관리가 필수적인 이유는 무엇일까요?

기업 AI가 점점 더 메모리 효율성에 의존하게 되면서 지능형 메모리 관리가 필수적이 되고 있습니다. 계산하다 모델 크기가 계속 커짐에 따라 단순히 더 큰 GPU를 추가하는 것만으로는 비용과 실용성이 떨어집니다. GPU 메모리, 시스템 메모리 및 SSD 기반 캐시를 동적으로 조정하는 솔루션은 기업이 기존 하드웨어 투자를 극대화하는 동시에 예측 가능한 성능으로 더 크고 강력한 AI 워크로드를 지원할 수 있도록 합니다.

Dynamic MoE는 기존 GPU 메모리 관리 방식과 어떻게 다른가요?

동적 교육부 파스카리는 기존 GPU 메모리 관리 방식과 달리 AI 메모리를 유연한 계층 구조로 처리하여 전체 모델이 GPU 메모리에 영구적으로 상주해야 하는 기존 방식과 차별화됩니다. aiDAPTIV™는 어떤 전문가가 현재 가장 필요한지 지속적으로 평가합니다. 이사하다 메모리 계층 전반에 걸쳐 비활성화된 전문가를 관리합니다. 이러한 동적 접근 방식은 지연 시간, 메모리 효율성 및 추론 성능의 균형을 유지하면서 사용 가능한 모델 용량을 증가시킵니다.

AI 메모리 아키텍처에서 컨트롤러 수준 최적화가 중요한 이유는 무엇일까요?

컨트롤러 수준 최적화는 AI 모델 데이터가 GPU 메모리, 시스템 메모리 및 플래시 메모리 간에 효율적으로 이동하도록 지원하는 동시에 추론 효율성을 저해하는 병목 현상을 최소화합니다. 펌웨어, 스토리지 컨트롤러 및 메모리 관리를 통합함으로써 Pascari와 같은 플랫폼은 이러한 최적화를 구현할 수 있습니다. aiDAPTIV 활성 모델 구성 요소의 우선순위를 지능적으로 지정하고 리소스 사용량을 개선할 수 있습니다. 이용, 또한 더 큰 GPU 메모리 용량에만 의존하지 않고 확장 가능한 AI 배포를 지원합니다.

Pascari aiDAPTIV™는 조직이 기존 AI 인프라를 최대한 활용할 수 있도록 어떻게 지원합니까?

파스카리 aiDAPTIV™는 GPU 메모리, 시스템 메모리 및 SSD 기반 캐시 메모리의 통합 관리를 통해 사용 가능한 AI 메모리를 확장함으로써 조직이 기존 AI 인프라를 최대한 활용할 수 있도록 지원합니다. 이러한 아키텍처를 통해 더 큰 규모의 전문가 혼합 모델을 구현할 수 있습니다. 작동하다 이를 통해 기존에는 GPU 메모리 용량만으로 제약받던 하드웨어에서도 안정적인 성능을 구현할 수 있습니다. 결과적으로 배포 유연성이 향상되고 인프라 효율성이 개선되며, 고가의 GPU에 즉시 투자하지 않고도 기업 AI를 위한 확장 가능한 경로를 제공합니다.

혁신을 가속화하는 기반™

ko_KR한국어