在運算能力耗盡之前,對大型 AI 模型進行微調往往會受到 GPU 記憶體的限制。本文解釋了權重、優化器狀態、梯度和激活值為何會驅動記憶體需求,為何添加 GPU 可能是一種成本高昂的權宜之計,以及 Pascari aiDAPTIV™ 如何將有效 AI 記憶體擴展到 GPU 記憶體、DRAM 和快閃記憶體之間。.
深入了解是什麼因素真正驅動了 GPU 微調方面的支出,以及不同的解決方案。.
隨著組織進行微調 更大型號, 一個熟悉的模式不斷出現:任務所需的 GPU 數量似乎成長得比任務實際所需的運算量更快。團隊評估微調運行的規模,研究如何使其滿足需求,最終發現瓶頸根本不是處理能力,而是記憶體。.
為什麼微調需要這麼多內存
微調模型不僅需要空間來存放模型的權重。訓練狀態還會佔用更多空間,因此有必要詳細分析這些空間都用在了哪裡。.
優化器狀態通常是最大的附加元件。 Adam 及其變體(大多數微調任務的預設選擇)會持續更新模型中每個參數梯度的一階矩和二階矩的估計值。實際上,這意味著僅優化器本身就可能需要模型權重兩到四倍的記憶體佔用,具體取決於精度以及優化器狀態是否在模型以混合精度運行時也保持全精度。.
梯度會增加參數數量的完整副本。激活值(即前向傳播過程中計算並保留以便在反向傳播中使用的中間輸出)的大小取決於批次大小和序列長度,而不僅僅是模型大小。這就是為什麼在小批次大小下運行良好的任務,一旦批次大小或上下文長度增加,就會突然耗盡記憶體的原因。.
將這些因素——權重、優化器狀態、梯度和激活值——疊加起來,微調模型所需的總記憶體佔用量可能是模型檢查點在磁碟上大小的五到十倍。對於較小的模型,這種開銷很容易承受。但隨著參數數量攀升至數百億,總記憶體需求很快就會超過單一GPU(無論其效能多強大)的容量。 記憶壓力, 這不是計算能力不足的問題,而是在訓練運行開始之前就出現了問題。.
預設的解決方法是增加GPU數量。
當組織遇到這種瓶頸時,本能的反應是增加GPU數量。利用張量並行、管線並行或完全分片資料並行(FSDP)訓練等技術,將模型、優化器狀態和啟動值分佈到多個GPU上,叢集的總記憶體就能彌補單一GPU的不足。這是一個合乎邏輯且易於實現的方案,因為大多數現代訓練框架都基於這樣的假設:記憶體限制可以透過增加設備來解決。.
這種方法行之有效,這也是為什麼用於微調的GPU叢集會隨著訓練模型的規模而同步成長的原因。需要微調300億或700億參數模型的團隊會使用8個甚至16個GPU,這主要是因為需要這麼多GPU才能達到足夠的總內存,而不是因為計算本身需要如此多的平行運算能力。.
不過,值得停下來思考一下這種方式究竟解決了什麼問題。增加GPU的主要目的並非是提高運算吞吐量,而是因為GPU記憶體恰好是擴展容量的唯一途徑,而且在大多數硬體上,記憶體和運算能力都是捆綁銷售的。想要更多內存?無論你是否需要,你都會獲得更多運算能力。.
這種方法的局限性
這種捆綁式配置會產生實際且可衡量的成本。當微調作業受限於記憶體而非運算能力時(這種情況很常見,尤其是在批次大小適中或序列長度較長的作業中),為解決記憶體問題而引入的額外 GPU 所承載的運算能力卻大部分處於閒置狀態。使用率儀錶板上的資料看起來不錯,但實際上叢集中相當一部分實際處理能力處於閒置狀態,遠低於作業理論上可以使用的運算能力,因為作業最初就不是運算能力受限的。.
這點體現在整個成本結構中,而不僅僅是GPU的採購價格。每增加一塊GPU,都會增加部署的功耗和散熱負荷,無論其運算能力是否充分利用。它還會增加機架空間和網路架構的需求。此外,還需要額外配置、監控和維護一台設備。雖然這些支出並非完全浪費,因為實際任務確實需要這些內存,但其中相當一部分費用實際上是為原本並非實際需求的計算能力買單。.
這是一個結構性問題,而不是規劃或採購方式的問題。只要記憶體和運算在硬體層面上捆綁在一起,團隊就無法解決這些問題。 內存容量 他們將繼續為他們不需要的運算能力付費,而且隨著模型規模的增大和訓練狀態記憶體與原始模型大小的比率的增加,這種差距往往會擴大。.
另一種思考記憶容量的方式
正是在這裡,將記憶體與 GPU 硬體分離成為一種真正不同的方法,這也是 Pascari aiDAPTIV 背後的理念。.
該解決方案並非將 GPU 記憶體作為微調任務的唯一可用資源,而是結合了 aiDAPTIV 中間件和 aiDAPTIV 緩存,將有效 AI 記憶體擴展到三個層級:GPU 記憶體、系統 DRAM 和專用的基於快閃記憶體的快取層。中間件位於訓練框架和這個擴展的記憶體池之間,即時決定哪些資料需要立即保留在高速 GPU 記憶體中,哪些資料可以移動到 DRAM 或閃存,並在需要時立即恢復。原本需要額外 GPU 才能儲存的模型權重、優化器狀態和啟動值,現在可以分佈在這個更大的有效記憶體池中,並透過協調機制確保 GPU 仍然擁有所需的資源以繼續運算。.
實際效果是,微調作業的記憶體佔用不再僅僅受限於GPU的實體記憶體。以前需要增加GPU數量才能達到足夠總記憶體的工作負載,現在只需一小部分硬體即可運行,因為記憶體上限不再由GPU硬體單獨決定,而是由GPU記憶體、DRAM和快取的綜合容量決定。.
這種轉變會產生一些值得逐一提及的具體後續影響:
降低基礎設施成本
GPU 數量越少,意味著前期硬體採購或租賃規模越小,連接它們的網路架構越少,以及在專案生命週期內需要配置和維護的部署規模越小。.
降低峰值功率和冷卻需求
由於任何給定時刻處於活動狀態的 GPU 數量較少,峰值 功耗和冷卻負荷 部署規模也隨之縮小。這一點需要明確說明,因為它與降低作業的總能耗是不同的概念。尖峰負載,即設施在任何特定時間點必須支援的最大功率,會降低。完成作業所消耗的總能耗是單獨計算的,而且由於運行時間更長,總能耗並不一定更低。 aiDAPTIV 改變的是您需要預留的空間大小,而不是特定微調運行的總能耗。.
坦白說,這的確是一種權衡。
由於實際執行計算的GPU數量較少,且在DRAM和快閃記憶體層之間移動資料需要時間(而完全在GPU記憶體中運行的作業則無需如此),因此這些運行的完成時間比在記憶體充足的大型GPU叢集上要長。這並非權宜之計或隱藏成本,而是直接的資源交換。對於那些GPU資本成本、可用性或實體空間佔用是主要限制因素,且可以接受更長完成時間的企業而言,這是一個簡單的權衡,它允許對工作負載進行微調,而這些工作負載原本需要更大的硬體投資。對於那些需要在嚴格的截止日期前完成任務,而GPU數量從未成為瓶頸的團隊而言,在進行切換之前,值得仔細權衡這種利弊。.
無需增加成本即可對更大的模型進行微調
用 GPU 擴充來解決記憶體問題是可以理解的。這是最常見的方法,並且有成熟的工具支援。但值得注意的是,這種做法通常只是針對記憶體限制(而非計算限制)的一種昂貴的權宜之計,其成本增長速度遠超工作負載的實際計算需求。像 aiDAPTIV 這樣的方法指明了一條不同的道路:直接解決記憶體容量問題,根據實際運算需求來調整 GPU 數量,並在完成時間方面做出明確的權衡,從而降低基礎設施成本。.
詳細了解 Pascari aiDAPTIV 或者 請聯絡 Pascari 銷售代表 今天。.
常見問題 (FAQ):
為什麼微調大型 AI 模型需要如此多的 GPU 記憶體?
微調需要 數量多得多 相比推理,記憶體佔用更高,因為系統必須在整個訓練過程中儲存模型權重、優化器狀態、梯度和激活值,從而產生總記憶體佔用,其大小可達模型檢查點大小的 5 到 10 倍。僅優化器狀態就可能佔用大量記憶體。 要求 權重的記憶體佔用量是其兩到四倍,而梯度則需要額外分配一個參數大小的記憶體。隨著批次大小和序列長度的增加,激活函數的記憶體需求也會進一步增加。.
AI模型微調過程中,什麼原因會導致GPU記憶體瓶頸?
當權重、最佳化器狀態、梯度和啟動值超過可用裝置記憶體時,即使GPU的運算能力足以應付工作負載,也會出現GPU記憶體瓶頸。隨著參數的增加,這種限制會變得更加明顯。 計數,, 批次大小和序列長度都會增加。這種區別很重要,因為添加 計算 並未直接解決根本需求: 額外的 內存容量。.
多GPU如何解決大型模型微調中的記憶體限制?
多GPU透過張量並行、管線並行和完全分片資料並行訓練等技術,將模型權重、優化器狀態、啟動值和其他訓練資料分佈到多個裝置上,從而提高總記憶體容量。這種方法可以實現大型模型的微調,但它也帶來了一些問題。 額外的 記憶體 額外的 即使硬體需求主要取決於記憶體而非處理吞吐量,運算能力仍然至關重要。.
增加 GPU 數量是否總是微調大型 AI 模型的最佳方法?
當工作負載既需要GPU又需要CPU時,增加GPU的效果很好。 額外的 記憶體和並行計算,但當記憶體容量而非計算吞吐量成為瓶頸時,效率可能會很低。 決定 所需的GPU數量。在記憶體密集型工作負載中,, 額外的 GPU可能造成運算能力利用率不足,同時增加硬體、網路、機架空間、電力、散熱、資源調配和維護方面的需求。合適的架構取決於完成時間和基礎設施佔用空間哪個更重要。 代表 更重要的限制因素。.
使用更多 GPU 和使用快閃記憶體擴展 AI 記憶體之間有什麼權衡取捨?
當訓練資料能夠容納在總 GPU 記憶體中時,更大的 GPU 叢集可以更快地完成微調;而將有效記憶體擴展到 DRAM 和快閃記憶體的分層架構可以降低 GPU 需求,但代價是更長的完成時間。在記憶體層之間移動資料會引入延遲,而較少的 GPU 提供的平行運算能力也較弱。因此,企業需要權衡完成時間要求與 GPU 的購買成本、可用性、電力容量、散熱和實體空間佔用等因素。.
Pascari aiDAPTIV 如何減少 AI 微調所需的 GPU 數量?
帕斯卡里 愛達普替夫™ 可以透過將有效 AI 記憶體擴展到 GPU 記憶體、系統 DRAM 和專用閃存,來降低記憶體密集型微調對 GPU 的需求。 愛達普替夫 使用快取內存,而不是完全依賴聚合的GPU記憶體。. 愛達普替夫 記憶體管理中間件負責協調這些層級之間的資料放置,以便模型權重、最佳化器狀態和啟動值可以… 居住 在需要之前,GPU 記憶體中儲存的資源將使用外部資源。這種方法允許組織根據運算需求更緊密地調整 GPU 資源的大小,而不是使用外部資源。 額外的 GPU 主要用作昂貴的記憶體容量。.
aiDAPTIV 記憶體管理中間件如何跨記憶體層管理 AI 訓練資料?
aiDAPTIV 記憶體管理中介軟體動態 決定 哪些訓練資料必須保留在高速GPU中 記憶 哪些資料可以移到系統DRAM或 愛達普替夫 將快取記憶體保留到工作負載再次需要時。這種編排方式擴展了可用於微調工作負載的有效內存,同時確保GPU在計算過程中始終能夠存取所需資料。此架構直接針對記憶體容量限制問題,否則此限制可能會迫使企業增加GPU數量。.
群聯電子的快閃記憶體技術如何提升AI基礎設施的效率?
群聯 應用其儲存和快閃記憶體 專業知識 透過使用專用的基於快閃記憶體的快取記憶體作為分層記憶體架構的一部分,為人工智慧基礎設施提供支持,從而解決記憶體密集型微調問題,而無需 GPU 記憶體來承載整個訓練資料。在 Pascari 中 愛達普替夫, 快閃記憶體與GPU記憶體、系統DRAM和記憶體管理軟體協同工作,以擴展AI的有效記憶體容量。這種設計可以減少主要用於記憶體而非計算的GPU數量。.
企業何時應該考慮使用 Pascari aiDAPTIV 而不是擴展其 GPU 叢集?
組織應考慮帕斯卡里 愛達普替夫當GPU記憶體容量、硬體成本、GPU可用性、峰值功耗、散熱或實體空間佔用等因素對模型微調的限制大於運行時間時,擴展DRAM和快閃記憶體可以支援更大的模型佔用空間,但與在足夠大的純GPU叢集上運行相同任務相比,工作負載的運行時間會更長。對於對截止日期要求嚴格且GPU容量充足的工作負載,擴展GPU叢集可能仍然是更好的選擇。.
Pascari aiDAPTIV 如何影響 AI 資料中心的電力和冷卻需求?
帕斯卡里 愛達普替夫™ 可透過啟用記憶體密集型微調工作負載來降低 AI 基礎架構的尖峰功耗和散熱需求。 操作 使用更少的活躍 GPU,會降低 最大限度 資料中心必須同時應對的負載。這種優勢不一定能轉化為更低的總體能耗,因為減少GPU數量和分層資料傳輸可能會延長作業完成時間。主要的基礎設施優勢在於減少了GPU、電力、冷卻、網路和實體空間的配置。.








