最近一封產業信函寫道:「“公開重量級和美國人工智慧領導力,文章指出,開放權重模型(即可供下載的已訓練人工智慧模型)對於建立具有競爭力和廣泛可及性的人工智慧系統至關重要。 人工智慧生態系統.
這封信的論點令人信服。開源模型使組織能夠使用先進的人工智慧,而無需從頭開始建立模型或完全依賴專有雲端服務。它們為企業、大學、開發人員和公共機構提供了更大的人工智慧使用選擇權,以及對圍繞人工智慧建構的數據和專業知識的更大控制權。.
但是,獲得某個模型並不一定意味著組織擁有運行該模型所需的基礎設施。.
這是人工智慧必須克服的下一個障礙。.
開放權重擴大了人工智慧的取得途徑
開放權重模型是指其學習到的參數(或權重)可供下載的模型。根據模型及其授權協議,您可以將其部署到自己的基礎架構上,或針對特定任務進行自訂。 微調 使用您自己的數據。.
這與開源軟體並不完全相同。開放權重模型可能提供可下載的權重,但不一定公開其訓練資料、原始碼或開發過程的全部內容。不過,開放權重仍提供了一項至關重要的優勢,那就是部署選擇的彈性。.
您可以選擇符合您需求的模型,在本地運行,從而更好地控制您的應用程式和資料。您不必將所有提示、文件或專有資料集都傳送到外部服務。.
這使得開放權重對於人工智慧的隱私、主權、競爭、研究和創新至關重要。.
但選擇合適的模型只是成功的一半,運行模型是另一半,而這正是許多組織遇到意想不到的瓶頸所在。.
可下載並不總是意味著可部署。
模型的權重檔案或許可以免費下載,但部署後它們仍然需要儲存在某個地方。雖然模型是開源的,但係統記憶體並非無限,這個簡單的現實決定了你實際能夠運行的模型數量。.
隨著人工智慧模型能力的提升,其記憶體需求也隨之成長。模型權重必須與應用程式資料、臨時工作記憶體以及其他資源爭奪空間。 KV快取 用於在推理過程中保留上下文。. 專家混合模型(MoE模型) 即使每個代幣只有一部分專家處於活躍狀態,也可能包含許多專業領域的專家。.
最終,GPU 記憶體和系統記憶體都會被填滿。.
這時,你的選擇就非常有限了:
- 使用較小或量化程度較高的模型
- 縮短可用上下文
- 減少同時在線用戶或代理的數量
- 購買價格較高的硬體
- 將工作負載遷移到雲端
- 接受所需工作負載無法運作的事實
這造成了在獲取先進人工智慧技術和擁有使用人工智慧的資源之間存在基礎設施差距。.
開放取用仍需與模型評估、安全控制和負責任的治理結合。基礎架構可以提供更強大的部署控制,但這並不能使模型本身就安全。.
利用快閃記憶體擴展有效人工智慧內存
Pascari aiDAPTIV™旨在彌合這一記憶差距。.
該解決方案結合了 aiDAPTIV 快取和 aiDAPTIV 中間件,透過額外的快閃記憶體層擴展了 GPU 和系統記憶體。中間件負責管理 GPU 記憶體、系統記憶體和快閃記憶體中的數據,將常用資料保留在靠近運算節點的位置,同時將不常用資料移至 aiDAPTIV 快取。.
這使得實際的本地系統能夠運行比其可用 GPU 記憶體和 DRAM 通常所能支援的更大、更苛刻的 AI 工作負載。.
對於 MoE 模型,aiDAPTIV 可以將常用的專家資訊保存在 GPU 或系統記憶體中,並根據需要從快閃記憶體載入其他專家資訊。對於長時間運行的對話和代理工作流程,快閃記憶體可以擴展鍵值快取的可用容量,從而有助於保留更多上下文資訊並支援更多並發活動。.
目的並非假裝快閃記憶體的速度與 DRAM 或 GPU 記憶體一樣快,因為它的速度並不快。.
價值在於權衡。某些工作負載的運行速度可能比在記憶體足以容納所有工作負載的系統上慢,但它們可以在原本根本無法運行的硬體上運行。這拓寬了您可以運行的 AI 工作負載範圍,而無需使用最大的可用 GPU 基礎架構。.
更強的控制力需要更實用的基礎設施
開放式人工智慧讓您可以更好地控制模型選擇、客製化、部署和資料。本地基礎設施使您能夠行使這種控制權。.
他們攜手合作,就能提供協助:
- 將專有資料保存在本機系統上
- 減少對單一模式或服務提供者的依賴
- 針對特定應用客製化模型
- 支援在課堂、實驗室和小型企業中進行人工智慧開發。
- 在筆記型電腦、工作站、邊緣系統和本機伺服器上運行功能更強大的模型
- 基礎設施支出應與實際工作負載需求相符。
但這並不能取代對雲端人工智慧或前沿規模基礎設施的需求。不同的工作負載需要不同的方法。但你不應該被迫在封閉的雲端服務和小到足以適應傳統記憶體限制的本地模型之間做出選擇。.
現在你有了更多選擇。.
讓每個人都能平等地使用人工智慧
開放權重拓寬了對高階模型的存取。但一個真正開放的人工智慧生態系統需要的不僅僅是可下載的檔案。它還需要運行時環境、應用程式和基礎設施,以便即使預算有限,也能部署這些模型。.
這就是 aiDAPTIV 的用武之地。.
開放權重使人工智慧的取得更加民主化。 aiDAPTIV 使運行人工智慧的能力更加民主化。.
詳細了解 Pascari aiDAPTIV™.
常見問題 (FAQ):
什麼是開放權重人工智慧模型?
開放權重人工智慧模型是指已訓練好的模型,其學習到的參數(或權重)可供使用者下載,從而使組織能夠在其控制的基礎架構上部署並可能自訂該模型。根據許可條款,使用者還可以使用自己的資料對模型進行微調。開放權重提供了更大的部署選擇,而無需公開模型的完整訓練資料、原始碼或開發過程。.
為什麼開源人工智慧模型對私有和本地人工智慧很重要?
開源人工智慧模型使組織能夠在自身控制的基礎架構上運行人工智慧,從而減少向外部人工智慧服務發送專有提示、文件和資料集的需求。本地部署可以增強資料主權、隱私、模型客製化和供應商獨立性,同時賦予組織對其人工智慧應用更大的控制權。開放存取仍然需要適當的模型評估、安全控制和治理。.
為什麼大型人工智慧模型在推理過程中需要如此多的記憶體?
大型人工智慧模型會消耗大量內存,用於存儲模型權重、應用程式資料、臨時工作內存以及在推理過程中保留上下文資訊的鍵值緩存,因此總內存需求可能遠超模型權重本身的大小。多屬性架構還增加了另一個需要考慮的因素,因為系統必須儲存和存取多個專業專家,即使每個令牌僅啟動其中的一部分。.
企業應該使用規模較小的AI模型,還是增加基礎設施容量?
組織應根據工作負載對模型能力、上下文長度、並發性、效能、成本和部署控制等方面的需求,在較小的模型和額外的基礎設施容量之間做出選擇。較小或量化程度較高的模型可以降低記憶體需求,但可能需要做出一些妥協。擴展基礎設施可以保持對更大模型和工作負載的訪問,但傳統的 GPU 和系統記憶體會顯著增加硬體成本。.
對於運行開放權重模型而言,本地 AI 是否比雲端 AI 更勝一籌?
本地人工智慧能夠更好地控制模型和數據,而雲端人工智慧則可以提供企業可能不願自行購買或營運的基礎設施,因此合適的架構取決於工作負載和業務需求。開放權重模型使本地部署切實可行,但本文並未將本地基礎設施定位為雲端或前沿規模系統的通用替代方案。.
Pascari aiDAPTIV™ 如何幫助組織在本地運行更大規模的 AI 模型?
Pascari aiDAPTIV™ 透過在 GPU 記憶體和系統記憶體之外添加快閃記憶體層,擴展了有效 AI 記憶體容量,讓本機系統能夠運行原本會超出可用 GPU 記憶體和 DRAM 容量的 AI 工作負載。 aiDAPTIV 快取和 aiDAPTIV 記憶體管理中介軟體負責管理這些層級的數據,將常用資料保留在靠近運算的位置,同時將不常用資料移至快閃記憶體。.
aiDAPTIV 如何支援混合專家人工智慧模型?
aiDAPTIV 可透過將常用專家保存在 GPU 或系統記憶體中,並根據需要從快閃記憶體載入其他專家,從而支援混合專家模型,並提高可用於更大規模混合專家部署的有效容量。這種分層方法並不能使快閃記憶體等同於 DRAM 或 GPU 內存,但它可以支援那些原本會超出傳統記憶體限制的模型。.
aiDAPTIV能否幫助人工智慧系統支援更長的上下文視窗和更多並髮用戶?
aiDAPTIV 可以利用快閃記憶體擴充鍵值快取的可用容量,幫助 AI 系統在 GPU 記憶體和系統記憶體容量受限時保留更多上下文資訊並支援更多並發活動。這種方法主要針對長時間運行的對話和智能體工作流程,在這些場景中,不斷增長的鍵值快取需求會在推理過程中對可用記憶體造成顯著壓力。.
使用閃存作為AI內存是否會降低推理性能?
使用快閃記憶體作為額外的 AI 記憶體層可能會帶來效能上的權衡,因為快閃記憶體的延遲高於 DRAM 或 GPU 內存,但它可以使原本受記憶體限制的工作負載得以部署。群聯電子 (Phison) 的 aiDAPTIV 正是圍繞著這種容量-性能權衡而設計的:某些工作負載的運行速度可能比在擁有足夠高速內存的系統上運行要慢,但同時也獲得了在更實用的本地基礎設施上運行的能力。.
Phison 如何幫助提高開源 AI 基礎設施的可近性?
群聯電子透過 Pascari aiDAPTIV™ 解決了開放式 AI 基礎設施的關鍵瓶頸,該方案利用快閃記憶體擴展了有效記憶體容量,使企業能夠運行更大規模、更苛刻的工作負載,而無需完全依賴前沿規模的 GPU 基礎設施。該架構增強了在筆記型電腦、工作站、邊緣系統和本地伺服器等各種設備上的部署靈活性,同時幫助企業使基礎設施支出與工作負載需求相符。.








