최근 업계에서 보낸 서한에서 다음과 같이 밝혔습니다.“오픈 웨이트와 미국의 AI 리더십,"경쟁력 있고 폭넓게 접근 가능한 환경을 위해서는 다운로드 가능한 학습된 AI 모델인 오픈웨이트 모델이 필수적이라고 주장한다." AI 생태계.
이 서한은 설득력 있는 주장을 펼칩니다. 개방형 가중치 모델은 조직이 모델을 처음부터 구축하거나 독점 클라우드 서비스에 전적으로 의존하지 않고도 고급 AI에 접근할 수 있도록 해줍니다. 이를 통해 기업, 대학, 개발자 및 공공 기관은 AI 사용 방식에 있어 더 큰 선택권을 갖게 되며, AI를 기반으로 구축하는 데이터와 전문 지식에 대한 더 큰 통제권을 확보할 수 있습니다.
하지만 모델에 접근할 수 있다고 해서 조직이 해당 모델을 실행하는 데 필요한 인프라를 갖추고 있다는 의미는 아닙니다.
그것이 바로 인공지능이 극복해야 할 다음 장벽입니다.
개방형 가중치는 AI 접근성을 확대합니다.
오픈웨이트 모델은 학습된 파라미터, 즉 가중치를 다운로드할 수 있는 모델입니다. 모델과 라이선스에 따라 자체 인프라에 배포하거나 특정 작업에 맞게 사용자 정의하거나 미세 조정 자신의 데이터를 사용해서 그렇게 하세요.
이는 오픈 소스 소프트웨어와 완전히 동일한 것은 아닙니다. 오픈 웨이트 모델은 학습 데이터, 소스 코드 또는 개발 과정의 모든 부분을 공개하지 않고도 다운로드 가능한 가중치를 제공할 수 있습니다. 하지만 오픈 웨이트는 여전히 매우 중요한 한 가지를 제공하는데, 바로 배포 방식에 대한 선택권을 제공한다는 점입니다.
요구 사항에 맞는 모델을 선택하고 로컬에서 실행하여 애플리케이션과 데이터를 더욱 효과적으로 제어할 수 있습니다. 모든 프롬프트, 문서 또는 독점 데이터 세트를 외부 서비스로 전송해야 하는 제약에서 벗어날 수 있습니다.
그렇기 때문에 개방형 가중치는 AI의 개인정보 보호, 주권, 경쟁, 연구 및 혁신에 중요합니다.
하지만 올바른 모델을 선택하는 것은 문제 해결의 절반에 불과합니다. 나머지 절반은 모델을 실행하는 것이며, 많은 조직이 예상치 못한 난관에 부딪히는 지점이 바로 여기입니다.
다운로드 가능하다고 해서 항상 배포 가능한 것은 아닙니다.
모델의 가중치는 무료로 다운로드할 수 있지만, 배포 후에는 어딘가에 저장되어야 합니다. 모델은 오픈 소스이지만 시스템 메모리는 무제한이 아니며, 바로 이 사실이 실제로 실행할 수 있는 모델에 영향을 미칩니다.
AI 모델의 기능이 향상됨에 따라 메모리 요구 사항도 증가합니다. 모델 가중치는 애플리케이션 데이터, 임시 작업 메모리 및 기타 메모리와 공간을 놓고 경쟁해야 합니다. KV 캐시 추론 과정에서 문맥을 유지하는 데 사용됩니다. 전문가 혼합 모델(MoE) 각 토큰에 대해 일부 전문가만 활성화되더라도 여러 전문 전문가를 포함할 수 있습니다.
결국 GPU 메모리와 시스템 메모리가 가득 차게 됩니다.
그 시점에서 여러분이 선택할 수 있는 옵션은 제한적입니다.
- 더 작거나 양자화가 더 강하게 적용된 모델을 사용하십시오.
- 사용 가능한 컨텍스트를 단축합니다
- 동시 접속 사용자 또는 상담원 수를 줄이세요
- 훨씬 더 비싼 하드웨어를 구입하세요.
- 워크로드를 클라우드로 이전하세요
- 원하는 작업 부하를 실행할 수 없다는 점을 받아들이세요.
이는 첨단 AI에 대한 접근성과 이를 활용할 수 있는 자원 사이에 인프라 격차를 초래합니다.
개방형 접근 방식은 여전히 모델 평가, 보안 제어 및 책임 있는 거버넌스와 함께 이루어져야 합니다. 인프라는 더 큰 배포 제어 기능을 제공할 수 있지만, 모델 자체를 본질적으로 안전하게 만드는 것은 아닙니다.
플래시 메모리를 활용하여 AI 메모리 효율을 확장합니다.
Pascari aiDAPTIV™는 이러한 메모리 격차를 해소하도록 설계되었습니다.
이 솔루션은 aiDAPTIV 캐시 메모리와 aiDAPTIV 미들웨어를 결합하여 GPU 및 시스템 메모리를 추가 플래시 계층으로 확장합니다. 미들웨어는 GPU 메모리, 시스템 메모리 및 플래시 메모리 전반에 걸쳐 데이터를 관리하여 자주 사용되는 데이터는 컴퓨팅 리소스 가까이에 유지하고 사용 빈도가 낮은 데이터는 aiDAPTIV 캐시 메모리로 이동시킵니다.
이를 통해 실제 로컬 시스템에서 사용 가능한 GPU 메모리 및 DRAM이 일반적으로 지원하는 것보다 더 크고 까다로운 AI 워크로드를 실행할 수 있습니다.
MoE 모델의 경우, aiDAPTIV는 자주 선택되는 전문가를 GPU 또는 시스템 메모리에 유지하면서 필요에 따라 플래시 메모리에서 다른 전문가를 불러올 수 있습니다. 장시간 실행되는 대화 및 에이전트 기반 워크플로의 경우, 플래시 메모리를 사용하여 KV 캐시에 사용할 수 있는 용량을 확장함으로써 더 많은 컨텍스트를 유지하고 더 많은 동시 작업을 지원할 수 있습니다.
목적은 플래시 메모리가 DRAM이나 GPU 메모리만큼 빠르다고 주장하려는 것이 아닙니다. 실제로 그렇지 않기 때문입니다.
핵심은 바로 이러한 장단점의 차이입니다. 일부 워크로드는 모든 작업을 처리할 수 있을 만큼 충분한 메모리를 갖춘 시스템에서보다 실행 속도가 느릴 수 있지만, 그렇지 않았다면 아예 실행할 수 없었을 하드웨어에서도 실행이 가능해집니다. 이는 최대 규모의 GPU 인프라를 구축하지 않고도 실행할 수 있는 AI 워크로드의 범위를 넓혀줍니다.
더 강력한 통제를 위해서는 보다 실용적인 인프라가 필요합니다.
오픈웨이트 AI는 모델 선택, 맞춤 설정, 배포 및 데이터에 대한 더 큰 제어 권한을 제공합니다. 로컬 인프라를 통해 이러한 제어 권한을 행사할 수 있습니다.
그들이 함께라면 도움을 줄 수 있습니다:
- 기밀 데이터는 로컬 시스템에 보관하십시오.
- 단일 모델 또는 서비스 제공업체에 대한 의존도를 줄이십시오.
- 특수 용도에 맞게 모델을 맞춤 설정하세요
- 교실, 연구실 및 소규모 기업에서 AI 개발을 지원합니다.
- 랩톱, 워크스테이션, 엣지 시스템 및 온프레미스 서버에서 더욱 강력한 모델을 실행하세요.
- 인프라 투자액을 실제 워크로드 요구 사항에 맞춰 조정하십시오.
이 모든 것이 클라우드 AI나 최첨단 규모의 인프라가 필요 없다는 것을 의미하는 것은 아닙니다. 다양한 워크로드에는 다양한 접근 방식이 필요합니다. 하지만 폐쇄형 클라우드 서비스와 기존 메모리 용량에 맞는 소규모 로컬 모델 중에서 하나를 선택해야 하는 상황은 발생하지 않아야 합니다.
이제 선택지가 더 많아졌습니다.
AI 실행 능력의 민주화
개방형 가중치는 고급 모델에 대한 접근성을 넓혀줍니다. 하지만 진정한 개방형 AI 생태계는 다운로드 가능한 파일 그 이상을 요구합니다. 막대한 예산이 없더라도 모델을 배포할 수 있도록 런타임, 애플리케이션 및 인프라도 필요합니다.
바로 그 점에서 aiDAPTIV가 중요한 역할을 합니다.
오픈 웨이트는 AI에 대한 접근성을 민주화합니다. aiDAPTIV는 AI를 실행할 수 있는 능력을 민주화합니다.
더 알아보기 파스카리 아이답티브™.
자주 묻는 질문(FAQ) :
개방형 가중치 AI 모델이란 무엇인가요?
오픈 웨이트 AI 모델은 학습된 매개변수 또는 가중치를 사용자가 다운로드할 수 있도록 공개하는 학습 모델입니다. 이를 통해 조직은 자체 인프라에 모델을 배포하고 필요에 따라 맞춤 설정할 수 있습니다. 라이선스 조건에 따라 사용자는 자체 데이터를 사용하여 모델을 미세 조정할 수도 있습니다. 오픈 웨이트는 모델의 전체 학습 데이터, 소스 코드 또는 개발 프로세스를 공개하지 않고도 더 폭넓은 배포 선택권을 제공합니다.
개방형 가중치 AI 모델이 프라이빗 및 로컬 AI에 중요한 이유는 무엇일까요?
개방형 가중치 AI 모델을 통해 조직은 자체적으로 제어하는 인프라에서 AI를 실행할 수 있으므로, 독점적인 프롬프트, 문서 및 데이터 세트를 외부 AI 서비스로 전송할 필요성을 줄일 수 있습니다. 로컬 배포는 데이터 주권, 개인정보 보호, 모델 맞춤화 및 공급자 독립성을 강화하는 동시에 조직이 AI 애플리케이션을 더욱 효과적으로 제어할 수 있도록 해줍니다. 하지만 개방형 접근 방식에서도 적절한 모델 평가, 보안 제어 및 거버넌스가 필수적입니다.
대규모 AI 모델은 추론 과정에서 왜 그렇게 많은 메모리를 필요로 할까요?
대규모 AI 모델은 모델 가중치, 애플리케이션 데이터, 임시 작업 메모리, 추론 중 컨텍스트를 유지하는 KV 캐시 등에 메모리를 소비하므로 전체 메모리 요구량은 모델 가중치 크기만을 훨씬 초과할 수 있습니다. MoE 아키텍처는 각 토큰이 하위 집합만 활성화하는 경우에도 시스템이 여러 전문 전문가를 저장하고 액세스해야 하므로 또 다른 고려 사항을 추가합니다.
조직은 더 작은 AI 모델을 사용해야 할까요, 아니면 인프라 용량을 늘려야 할까요?
조직은 모델 기능, 컨텍스트 길이, 동시성, 성능, 비용 및 배포 제어에 대한 워크로드 요구 사항을 기반으로 더 작은 모델을 선택할지 또는 추가 인프라 용량을 확보할지 결정해야 합니다. 더 작거나 양자화된 모델을 적극적으로 사용하면 메모리 요구량은 줄어들지만, 몇 가지 타협점이 필요할 수 있습니다. 인프라를 확장하면 더 큰 모델과 워크로드에 대한 접근성을 유지할 수 있지만, 기존 GPU 및 시스템 메모리를 추가하면 하드웨어 비용이 크게 증가할 수 있습니다.
개방형 가중치 모델을 실행하는 데 있어 로컬 AI가 클라우드 AI보다 더 나은 성능을 보일까요?
로컬 AI는 모델과 데이터에 대한 더 큰 제어권을 제공하는 반면, 클라우드 AI는 기업이 직접 구매하거나 운영하고 싶지 않을 수 있는 인프라에 대한 접근성을 제공하므로 적절한 아키텍처는 워크로드와 비즈니스 요구 사항에 따라 달라집니다. 개방형 가중치 모델 덕분에 로컬 배포가 실용적이지만, 이 글에서는 로컬 인프라를 클라우드 또는 최첨단 시스템을 완전히 대체할 수 있는 것으로 제시하지는 않습니다.
Pascari aiDAPTIV™는 기업이 더 큰 규모의 AI 모델을 로컬에서 실행할 수 있도록 어떻게 지원합니까?
Pascari aiDAPTIV™는 GPU 메모리 및 시스템 메모리와 함께 플래시 메모리 계층을 추가하여 AI 메모리 용량을 효과적으로 확장합니다. 이를 통해 로컬 시스템은 기존에는 사용 가능한 GPU 메모리 및 DRAM 용량을 초과했던 AI 워크로드를 실행할 수 있습니다. aiDAPTIV 캐시 메모리와 aiDAPTIV 메모리 관리 미들웨어는 이러한 계층 전반에 걸쳐 데이터를 관리하여 자주 사용되는 데이터는 컴퓨팅 환경에 더 가깝게 유지하고 사용 빈도가 낮은 데이터는 플래시 메모리로 이동시킵니다.
aiDAPTIV는 전문가 혼합형 AI 모델을 어떻게 지원합니까?
aiDAPTIV는 자주 선택되는 전문가를 GPU 또는 시스템 메모리에 유지하고 필요에 따라 플래시 메모리에서 다른 전문가를 불러오는 방식으로 전문가 혼합 모델(Mixture-of-Experts, MoE)을 지원하여 대규모 MoE 배포에 사용 가능한 유효 용량을 늘릴 수 있습니다. 이러한 계층형 접근 방식은 플래시 메모리를 DRAM이나 GPU 메모리와 동등하게 만드는 것은 아니지만, 기존 메모리 한계를 초과하는 모델을 구현할 수 있도록 해줍니다.
aiDAPTIV는 AI 시스템이 더 긴 컨텍스트 창과 더 많은 동시 사용자를 지원하는 데 도움이 될 수 있을까요?
aiDAPTIV는 플래시 메모리를 사용하여 KV 캐시의 용량을 확장함으로써 GPU 메모리와 시스템 메모리 용량이 부족해질 때 AI 시스템이 더 많은 컨텍스트를 유지하고 더 많은 동시 작업을 지원할 수 있도록 합니다. 이 접근 방식은 KV 캐시 요구 사항이 증가함에 따라 추론 중에 사용 가능한 메모리에 상당한 부담을 줄 수 있는 장시간 실행되는 대화 및 에이전트 워크플로를 대상으로 합니다.
AI 메모리로 플래시 메모리를 사용하면 추론 성능이 저하되나요?
플래시 메모리를 추가적인 AI 메모리 계층으로 사용하는 것은 DRAM이나 GPU 메모리보다 지연 시간이 길기 때문에 성능 저하를 초래할 수 있지만, 메모리 제약이 있는 워크로드를 배포 가능하게 만들 수 있습니다. Phison은 이러한 용량-성능 균형을 고려하여 aiDAPTIV를 설계했습니다. 즉, 모든 워크로드를 저장할 수 있을 만큼 충분한 고속 메모리가 있는 시스템보다 일부 워크로드가 느리게 실행될 수 있지만, 보다 실용적인 로컬 인프라에서 실행할 수 있다는 장점을 제공합니다.
Phison은 오픈웨이트 AI 인프라를 더욱 쉽게 이용할 수 있도록 어떻게 도울 수 있을까요?
Phison은 Pascari aiDAPTIV™를 통해 개방형 AI 인프라의 핵심 제약 조건을 해결합니다. 이 기술은 플래시 메모리를 활용하여 유효 메모리 용량을 확장함으로써 기업이 최첨단 GPU 인프라에만 의존하지 않고도 더 크고 까다로운 워크로드를 실행할 수 있도록 지원합니다. 이 아키텍처는 노트북, 워크스테이션, 엣지 시스템 및 온프레미스 서버 전반에 걸쳐 배포 유연성을 확대하는 동시에 기업이 인프라 투자 비용을 워크로드 요구 사항에 맞춰 조정할 수 있도록 돕습니다.








