在计算能力耗尽之前,对大型 AI 模型进行微调往往会受到 GPU 内存的限制。本文解释了权重、优化器状态、梯度和激活值为何会驱动内存需求,为何添加 GPU 可能是一种成本高昂的权宜之计,以及 Pascari aiDAPTIV™ 如何将有效 AI 内存扩展到 GPU 内存、DRAM 和闪存之间。.
深入了解是什么因素真正驱动了 GPU 微调方面的支出,以及一种不同的解决方案。.
随着组织进行微调 更大型号, 一个熟悉的模式不断出现:任务所需的 GPU 数量似乎增长得比任务实际所需的计算量更快。团队评估微调运行的规模,研究如何使其满足需求,最终发现瓶颈根本不是处理能力,而是内存。.
为什么微调需要这么多内存
微调模型不仅仅需要空间来存放模型的权重。训练状态还会占用更多空间,因此有必要详细分析这些空间都用在了哪里。.
优化器状态通常是最大的附加组件。Adam 及其变体(大多数微调任务的默认选择)会持续更新模型中每个参数梯度的一阶矩和二阶矩的估计值。实际上,这意味着仅优化器本身就可能需要模型权重两到四倍的内存占用,具体取决于精度以及优化器状态是否在模型以混合精度运行时也保持全精度。.
梯度会增加参数数量的完整副本。激活值(即前向传播过程中计算并保留下来以便在反向传播中使用的中间输出)的大小取决于批大小和序列长度,而不仅仅是模型大小。这就是为什么在小批大小下运行良好的任务,一旦批大小或上下文长度增加,就会突然耗尽内存的原因。.
将这些因素——权重、优化器状态、梯度和激活值——叠加起来,微调模型所需的总内存占用量可能是模型检查点在磁盘上大小的五到十倍。对于较小的模型,这种开销很容易承受。但随着参数数量攀升至数百亿,总内存需求很快就会超过单个GPU(无论其性能多么强大)的容量。 记忆压力, 这不是计算能力不足的问题,而是在训练运行开始之前就出现了问题。.
默认的解决方法是增加GPU数量。
当组织遇到这种瓶颈时,本能的反应是增加GPU数量。利用张量并行、流水线并行或完全分片数据并行(FSDP)训练等技术,将模型、优化器状态和激活值分布到多个GPU上,集群的总内存就能弥补单个GPU的不足。这是一个合乎逻辑且易于实现的方案,因为大多数现代训练框架都基于这样的假设:内存限制可以通过增加设备来解决。.
这种方法行之有效,这也是为什么用于微调的GPU集群随着训练模型的规模而同步增长的原因。需要微调300亿或700亿参数模型的团队会使用8个甚至16个GPU,这主要是因为需要这么多GPU才能达到足够的总内存,而不是因为计算本身需要如此多的并行计算能力。.
不过,值得停下来思考一下这种方式究竟解决了什么问题。增加GPU的主要目的并非是提高计算吞吐量,而是因为GPU内存恰好是扩展容量的唯一途径,而且在大多数硬件上,内存和计算能力都是捆绑销售的。想要更多内存?无论你是否需要,你都会获得更多计算能力。.
这种方法的局限性
这种捆绑式配置会产生实际且可衡量的成本。当微调作业受限于内存而非计算能力时(这种情况很常见,尤其是在批处理大小适中或序列长度较长的作业中),为解决内存问题而引入的额外 GPU 所承载的计算能力却大部分处于闲置状态。利用率仪表盘上的数据可能看起来不错,但实际上集群中相当一部分实际处理能力处于闲置状态,远低于作业理论上可以使用的计算能力,因为作业最初就不是计算能力受限的。.
这一点体现在整个成本结构中,而不仅仅是GPU的采购价格。每增加一块GPU,都会增加部署的功耗和散热负荷,无论其计算能力是否被充分利用。它还会增加机架空间和网络架构的需求。此外,还需要额外配置、监控和维护一台设备。虽然这些支出并非完全浪费,因为实际任务确实需要这些内存,但其中相当一部分费用实际上是为原本并非实际需求的计算能力买单。.
这是一个结构性问题,而不是规划或采购方式的问题。只要内存和计算在硬件层面上捆绑在一起,团队就无法解决这些问题。 内存容量 他们将继续为他们不需要的计算能力付费,而且随着模型规模的增大和训练状态内存与原始模型大小的比率的增加,这种差距往往会扩大。.
另一种思考记忆容量的方式
正是在这里,将内存与 GPU 硬件分离成为一种真正不同的方法,这也是 Pascari aiDAPTIV 背后的理念。.
该解决方案并非将 GPU 内存作为微调任务的唯一可用资源,而是结合了 aiDAPTIV 中间件和 aiDAPTIV 缓存,将有效 AI 内存扩展到三个层级:GPU 内存、系统 DRAM 和专用的基于闪存的缓存层。中间件位于训练框架和这个扩展的内存池之间,实时决定哪些数据需要立即保留在高速 GPU 内存中,哪些数据可以移动到 DRAM 或闪存,并在需要时立即恢复。原本需要额外 GPU 才能存储的模型权重、优化器状态和激活值,现在可以分布在这个更大的有效内存池中,并通过协调机制确保 GPU 仍然拥有所需的资源以继续计算。.
实际效果是,微调作业的内存占用不再仅仅受限于GPU的物理内存。以前需要增加GPU数量才能达到足够总内存的工作负载,现在只需一小部分硬件即可运行,因为内存上限不再由GPU硬件单独决定,而是由GPU内存、DRAM和缓存的综合容量决定。.
这种转变会产生一些值得逐一提及的具体后续影响:
降低基础设施成本
GPU 数量越少,意味着前期硬件采购或租赁规模越小,连接它们的网络架构越少,以及在项目生命周期内需要配置和维护的部署规模越小。.
降低峰值功率和冷却需求
由于任何给定时刻处于活动状态的 GPU 数量较少,峰值 功耗和冷却负荷 部署规模也相应缩小。这一点需要明确说明,因为它与降低作业的总能耗是不同的概念。峰值负载,即设施在任何特定时间点必须支持的最大功率,会降低。完成作业所消耗的总能耗是单独计算的,而且由于运行时间更长,总能耗并不一定更低。aiDAPTIV 改变的是您需要预留的空间大小,而不是特定微调运行的总能耗。.
坦白说,这的确是一种权衡。
由于实际执行计算的GPU数量较少,且在DRAM和闪存层之间移动数据需要时间(而完全在GPU内存中运行的作业则无需如此),因此这些运行的完成时间比在内存充足的大型GPU集群上要长。这并非权宜之计或隐藏成本,而是直接的资源交换。对于那些GPU资本成本、可用性或物理空间占用是主要限制因素,且可以接受更长完成时间的企业而言,这是一个简单的权衡,它允许对工作负载进行微调,而这些工作负载原本需要更大的硬件投资。对于那些需要在严格的截止日期前完成任务,且GPU数量从未成为瓶颈的团队而言,在进行切换之前,值得仔细权衡这种利弊。.
在不增加成本的情况下,对更大的模型进行微调。
用 GPU 扩展来解决内存问题是可以理解的。这是最常见的方法,并且有成熟的工具支持。但值得注意的是,这种做法通常只是针对内存限制(而非计算限制)的一种昂贵的权宜之计,其成本增长速度远超工作负载的实际计算需求。像 aiDAPTIV 这样的方法指明了一条不同的道路:直接解决内存容量问题,根据实际计算需求来调整 GPU 数量,并在完成时间方面做出明确的权衡,从而降低基础设施成本。.
详细了解 Pascari aiDAPTIV 或者 请联系 Pascari 销售代表 今天。.
常见问题 (FAQ):
为什么微调大型 AI 模型需要如此多的 GPU 内存?
微调需要 数量要多得多 相比推理,内存占用更高,因为系统必须在整个训练过程中存储模型权重、优化器状态、梯度和激活值,从而产生总内存占用,其大小可达模型检查点大小的 5 到 10 倍。仅优化器状态就可能占用大量内存。 要求 权重的内存占用量是其两到四倍,而梯度则需要额外分配一个参数大小的内存。随着批次大小和序列长度的增加,激活函数的内存需求也会进一步增加。.
AI模型微调过程中,什么原因会导致GPU内存瓶颈?
当权重、优化器状态、梯度和激活值超过可用设备内存时,即使GPU的计算能力足以应对工作负载,也会出现GPU内存瓶颈。随着参数的增加,这种限制会变得更加明显。 计数,, 批次大小和序列长度都会增加。这种区别很重要,因为添加 计算 并未直接解决根本需求: 额外的 内存容量。.
多GPU如何解决大型模型微调中的内存限制?
多GPU通过张量并行、流水线并行和完全分片数据并行训练等技术,将模型权重、优化器状态、激活值和其他训练数据分布到多个设备上,从而提高总内存容量。这种方法可以实现大型模型的微调,但它也带来了一些问题。 额外的 内存 额外的 即使硬件需求主要取决于内存而非处理吞吐量,计算能力仍然至关重要。.
增加 GPU 数量是否总是微调大型 AI 模型的最佳方法?
当工作负载既需要GPU又需要CPU时,添加GPU的效果很好。 额外的 内存和并行计算,但当内存容量而非计算吞吐量成为瓶颈时,效率可能会很低。 决定 所需的GPU数量。在内存密集型工作负载中,, 额外的 GPU可能会造成计算能力利用率不足,同时增加硬件、网络、机架空间、电力、散热、资源调配和维护方面的需求。合适的架构取决于完成时间和基础设施占用空间哪个更重要。 代表 更重要的限制因素。.
使用更多 GPU 和使用闪存扩展 AI 内存之间有什么权衡取舍?
当训练数据能够容纳在总 GPU 内存中时,更大的 GPU 集群可以更快地完成微调;而将有效内存扩展到 DRAM 和闪存的分层架构可以降低 GPU 需求,但代价是更长的完成时间。在内存层之间移动数据会引入延迟,而较少的 GPU 提供的并行计算能力也较弱。因此,企业需要权衡完成时间要求与 GPU 的购置成本、可用性、电力容量、散热和物理空间占用等因素。.
Pascari aiDAPTIV 如何减少 AI 微调所需的 GPU 数量?
帕斯卡里 爱达普替夫™ 可以通过将有效 AI 内存扩展到 GPU 内存、系统 DRAM 和专用闪存,来降低内存密集型微调对 GPU 的需求。 爱达普替夫 使用缓存内存,而不是完全依赖聚合的GPU内存。. 爱达普替夫 内存管理中间件负责协调这些层级之间的数据放置,以便模型权重、优化器状态和激活值可以…… 居住 除非需要,否则GPU内存中会存储着GPU资源。这种方法允许组织根据计算需求更紧密地调整GPU资源的大小,而不是使用外部存储。 额外的 GPU 主要用作昂贵的内存容量。.
aiDAPTIV 内存管理中间件如何跨内存层管理 AI 训练数据?
aiDAPTIV 内存管理中间件动态 决定 哪些训练数据必须保留在高速GPU中 记忆 哪些数据可以移动到系统DRAM或 爱达普替夫 将缓存内存保留到工作负载再次需要时。这种编排方式扩展了可用于微调工作负载的有效内存,同时确保GPU在计算过程中始终能够访问所需数据。该架构直接针对内存容量限制问题,否则该限制可能会迫使企业增加GPU数量。.
群联电子的闪存技术如何提升AI基础设施的效率?
群联 应用其存储和闪存 专业知识 通过使用专用的基于闪存的缓存内存作为分层内存架构的一部分,为人工智能基础设施提供支持,从而解决内存密集型微调问题,而无需 GPU 内存来承载整个训练数据。在 Pascari 中 爱达普替夫, 闪存与GPU内存、系统DRAM和内存管理软件协同工作,以扩展AI的有效内存容量。这种设计可以减少主要用于内存而非计算的GPU数量。.
企业何时应该考虑使用 Pascari aiDAPTIV 而不是扩展其 GPU 集群?
组织应考虑帕斯卡里 爱达普替夫当GPU内存容量、硬件成本、GPU可用性、峰值功耗、散热或物理空间占用等因素对模型微调的限制大于运行时间时,扩展DRAM和闪存可以支持更大的模型占用空间,但与在足够大的纯GPU集群上运行相同任务相比,工作负载的运行时间会更长。对于对截止日期要求严格且GPU容量充足的工作负载,扩展GPU集群可能仍然是更好的选择。.
Pascari aiDAPTIV 如何影响 AI 数据中心的电力和冷却需求?
帕斯卡里 爱达普替夫™ 可以通过启用内存密集型微调工作负载来降低 AI 基础设施的峰值功耗和散热需求。 操作 使用更少的活跃 GPU,会降低 最大限度 数据中心必须同时应对的负载。这种优势并不一定能转化为更低的总体能耗,因为减少GPU数量和分层数据传输可能会延长作业完成时间。主要的基础设施优势在于减少了GPU、电力、冷却、网络和物理空间的配置。.








