了解 KV 缓存增长如何悄无声息地降低 AI 推理性能,以及为什么内存感知基础设施对于扩展现代 AI 工作负载至关重要。.
由于不断增长的键值缓存会消耗可用内存,人工智能推理性能往往在GPU达到计算极限之前就已经开始下降。本文将阐述内存瓶颈如何影响延迟、并发性和可扩展性,以及Pascari aiDAPTIV™如何帮助优化GPU、系统内存和闪存的内存使用,从而构建更高效的人工智能基础架构。.
现代的 人工智能基础设施 如今,GPU 能够提供比以往更大的模型、更长的上下文窗口以及更多的并发用户。然而,许多组织发现,在 GPU 达到其理论计算极限之前,推理性能就已经开始下降。响应时间变得不稳定,吞吐量意外下降,尽管投入了昂贵的硬件,用户仍然会遇到交互速度变慢或可靠性降低的问题。.
罪魁祸首通常是 KV 缓存内存瓶颈。.
键值缓存存储语言模型生成每个新词元所需的注意力状态,其内存需求会随着活跃上下文和并发请求的增加而增长。当这种需求接近可用 GPU 内存时,系统可能会降低并发性、延迟或拒绝请求,或者丢弃可重用的缓存数据,这些数据之后必须重建。应用程序也可能缩短对话历史记录以保持在内存限制范围内。由于这些变化可能在没有明显硬件故障的情况下发生,内存压力会悄无声息地降低推理性能和用户体验。.
在部署过程中,了解这种情况发生的原因变得越来越重要。 本地或私有人工智能基础设施. 随着您在各个部门、客户或边缘位置扩展推理工作负载,内存管理变得与 GPU 性能本身一样重要。.
缓慢、不稳定的AI推理背后隐藏的故障模式
基础设施团队习惯于寻找明显的故障预警信号,例如 CPU 利用率飙升、存储空间被占满、网络链路饱和等。这些事件相对容易识别和排查。.
人工智能推理过程中的内存饱和情况有所不同。.
许多生产环境中的人工智能系统仍在运行,但性能却逐渐下降。平均延迟可能仍可接受,但尾延迟却急剧上升。一些请求很快完成,而另一些请求则需要数倍的时间才能完成。吞吐量变得不稳定,用户开始报告一些无法预测的行为,而这些行为并不能立即指向硬件限制。.
这造成了运维上的挑战,因为基础设施表面上看起来运行正常。GPU 仍在处理请求,应用程序也保持在线。传统的监控仪表盘通常显示的利用率水平也看似合理。.
与此同时,用户体验却持续恶化。.
当管理员意识到某种模式时,他们可能已经发现同时处理的 AI 请求减少、利用率降低,或者听到沮丧的用户抱怨他们一直在等待本应更早到来的回复。.
随着人工智能在企业中的部署不断扩大,这些细微的性能问题正日益成为业务问题,而不仅仅是技术问题。.
KV缓存的作用
要了解为什么 AI 内存饱和会成为一个如此重要的问题,了解 KV 缓存实际存储的内容会有所帮助。.
每次大型语言模型(LLM)处理提示时,它都会创建内部表示,以便理解词语、句子以及对话先前部分之间的关系。这些表示被称为键和值,它们共同构成了键值缓存(KV缓存)。.
模型每次生成新词元时,缓存机制不会重新计算注意力信息,而是将其保存在内存中。这显著加快了推理速度,因为模型可以重用之前的注意力数据,而无需重复重建。.
把它想象成阅读一本冗长的技术手册。你不需要在翻到下一页之前把前面的每一章都重新读一遍,而是应该记住你已经学到的知识,并在此基础上继续深入理解。.
法学硕士的运作方式也大致相同。.
问题在于,这种记忆会在整个对话过程中不断增长。更长的提示需要缓存更多的注意力数据。同时进行多个对话会成倍增加必须立即访问的缓存信息量。.
许多组织在规划 AI 基础设施时主要关注模型规模。但实际上,键值缓存的增长速度往往超出预期,因为它会随着上下文长度和并发性的增加而扩展。随着部署的成熟,它可能会成为 GPU 内存消耗最大的组件之一。.
为什么内存占用速度比预期更快
人们通常认为,安装更大功率的GPU就能自动解决未来的增长难题。然而,在实践中,模型性能的提升往往会更快地增加内存需求。.
现代人工智能应用很少仅仅由简短的提示和简短的回复组成。企业助手能够分析冗长的文档、总结合同、审查软件仓库、回答涵盖庞大知识库的问题,并进行跨越数千个令牌的对话。.
同时,这些系统需要同时服务多个用户。每个活跃请求都维护着自己的键值缓存。每增加一个活跃请求,系统对内存的需求就会增加。较长的会话会在整个交互过程中不断扩展这些缓存。.
即使可用计算资源未得到充分利用,这也会导致 GPU 内存瓶颈,影响推理性能。.
换句话说,GPU仍然有处理能力,只是内存不足,无法高效地支持所有正在进行的请求。.
添加 GPU 可以提供更多的计算能力和内存,但对于主要受内存容量限制的工作负载来说,这可能是一种昂贵的解决方案。.
构建记忆感知型人工智能架构
在规划未来的AI部署时,您需要考虑的不再局限于GPU规格。内存感知型AI架构认识到,推理性能取决于计算资源与可用内存的平衡,同时还要确保两者能够随着工作负载的演变而同步扩展。.
与其将GPU内存视为固定限制,不如利用系统内存和闪存作为额外的内存层来扩展有效内存容量。这些内存层的速度虽然比GPU内存慢,但容量却大得多。.
收益取决于工作负载。重用已保留或预缓存的数据可以避免系统重复执行某些工作,从而提高性能。在其他情况下,额外的容量允许运行更大的模型、更长的上下文或更多并发请求,而这些资源原本无法满足工作负载的需求。.
让每个内存层级都达到GPU内存的性能并非我们的目标。我们的目标是根据每个内存层级的价值最大化来使用它们:在数据可重用时加速工作负载,在内存成为瓶颈时提供额外的容量。.
Pascari aiDAPTIV™ 如何解决内存饱和问题
Phison 开发了 Pascari aiDAPTIV,旨在帮助企业解决 AI 内存需求与系统可用内存之间日益扩大的差距。.
该解决方案结合了 aiDAPTIV 中间件和 aiDAPTIV 缓存,用于管理跨 GPU 内存、系统内存和闪存的特定 AI 数据。这扩展了有效内存容量,而无需将工作负载的每个部分都保留在速度最快但容量最有限的内存层级中。.
在可以重用保留或 预缓存的KV数据,aiDAPTIV 可以通过避免重复计算来降低延迟。在其他工作负载中,它可能会牺牲一些性能来换取支持更大模型、更长上下文或更多并发请求所需的额外容量。.
这为您提供了扩展 AI 基础设施的另一种方法。您不必完全依赖更大、更昂贵的 GPU 配置,而是可以使用更大的内存层次结构来加快某些工作负载的速度,并启用其他原本无法运行的工作负载。.
重用可提高性能
aiDAPTIV 提高性能的一种方法是保留预缓存的 KV 数据,这样系统就不必重复相同的预填充工作。.
在LG gram Pro 16英寸AI PC上使用Llama 3.1 8B进行测试时,重用预缓存的KV数据减少了 首次代币到达时间 输入 8K 个令牌时,耗时从 58.38 秒降至 0.69 秒。输入 16K 个令牌时,耗时从 163.54 秒降至 8.02 秒。.*
性能提升并非源于闪存速度快于GPU或系统内存,而是源于避免重复计算。aiDAPTIV预先执行预填充工作,保留生成的KV数据,并在需要时可供重用。.
规划下一代人工智能基础设施
许多组织仍然主要根据模型参数或GPU规格来评估人工智能基础设施的规模。但如今,这些衡量标准只能反映部分情况。.
随着上下文窗口不断扩大,越来越多的用户同时依赖人工智能,记忆行为成为长期推理性能的最强预测指标之一。.
基础设施团队在评估未来部署方案时,应该提出除了GPU数量之外的问题:
-
-
- 上下文长度会如何影响内存消耗随时间的变化?
- 当并发使用量翻倍时会发生什么?
- 随着内存利用率的提高,性能会发生怎样的变化?
- 该架构是否预留了扩展空间,而无需彻底更换硬件?
-
及早回答这些问题可以帮助您避免那些通常只有在系统达到生产规模后才会出现的隐性性能瓶颈。.
内存已成为人工智能响应速度、效率和可扩展性的关键因素。通过认识到这一转变并做好规划,您的组织将能更好地为未来功能日益强大的人工智能应用提供支持。.
详细了解 Pascari aiDAPTIV 或者 请联系 Pascari 销售代表 今天。.
( *测试配置: 英特尔® 酷睿™ 超极本 7 255H 处理器,英特尔® Arc™ 140T 显卡,32 GB LPDDR5X-8400 内存,Windows 11,Llama 3.1 8B Q4_K_M,2TB Phison E28 启动固态硬盘,以及 320 GB Phison AI100 固态硬盘(用于 aiDAPTIV 高速缓存)。
常见问题 (FAQ):
AI推理中的KV缓存是什么?
KV缓存存储大型语言模型在运行过程中生成的注意力键和值。 推理 这样它就可以重复使用。 以前的 无需为每个新词元重新计算,而是重复使用这些信息。重用这些信息可以降低计算开销,提高推理效率。随着提示和对话长度的增加,键值缓存也会增长,使得内存容量变得越来越重要。 重要因素 在人工智能基础设施性能方面。.
为什么在GPU达到满负荷运转之前,AI推理速度就会减慢?
AI推理速度经常变慢,因为GPU内存会在GPU计算资源完全释放之前就达到其容量上限。 利用. 由于键值缓存消耗更多内存,即使处理核心数没有增加,系统也可能会降低并发性、清除缓存数据或延迟请求。 保持 可用。这会导致延迟不稳定和吞吐量降低,但不会造成明显的硬件故障。.
更长的上下文窗口如何影响人工智能的内存使用?
更长的上下文窗口会增加 AI 的内存消耗,因为每 额外的 令牌会扩展键值缓存,该缓存必须在整个推理过程中保持可用。当多个用户 提交 如果同时出现长时间的提示,则每个活动会话的内存需求都会增加。这使得上下文长度和并发性成为GPU内存需求的主要驱动因素。.
KV缓存饱和的迹象有哪些?
KV缓存饱和通常表现为响应时间不一致、吞吐量降低、并发性下降、缓存驱逐以及系统持续运行时尾延迟增加。 操作 通常情况下,传统的监控工具可能仍然会报告GPU性能良好。 利用率, 这使得底层内存瓶颈难以解决。 确认 直到用户体验明显下降。.
增加GPU数量是解决AI内存瓶颈的最佳方法吗?
增加更多GPU可以提高两者的效率。 计算 虽然内存容量和工作负载都很重要,但当工作负载主要受限于内存时,它并非总是最有效的解决方案。能够智能利用 GPU 内存、系统内存和闪存的内存感知架构可以提高有效容量,并支持更大的模型、更长的上下文或更高的并发性,而无需完全依赖更大的 GPU 部署。.
Pascari aiDAPTIV™ 如何帮助减少 AI 内存瓶颈?
帕斯卡里 爱达普替夫™ 通过管理跨 GPU 内存、系统内存和...的选定数据来扩展有效的 AI 内存容量 爱达普替夫 使用缓存内存而非要求所有数据都保留在 GPU 内存中。这种分层方法有助于支持更大的模型、更长的上下文窗口和更高的并发性,同时降低 GPU 内存饱和对推理性能的影响。.
为什么控制器级内存管理对人工智能基础设施至关重要?
控制器级内存管理有助于 优化 AI 数据如何在多个内存层级间移动,从而提高资源利用率 利用率 作为 工作负载 规模。群联控制器 专业知识 和 爱达普替夫 中间件和 爱达普替夫 缓存内存可高效地管理 GPU 内存、系统内存和闪存中的选定 AI 数据,从而在不断增长的推理需求下实现更可预测的性能。.
KV缓存重用如何提升AI推理性能?
KV缓存重用通过以下方式提高AI推理性能 消除 对先前已处理的提示重复进行预填充计算。. 与其为每个请求重建注意力数据,不如在适当的时候重用保留的 KV 缓存数据,从而显著减少受支持工作负载获得第一个令牌的时间。. 性能提升来自于避免冗余计算,而不是让闪存像GPU内存一样运行。.
企业为何应该采用内存感知型人工智能架构?
内存感知型人工智能架构有助于企业在上下文窗口变化时保持可预测的推理性能。 扩张 随着并发工作负载的增加,通过平衡GPU内存、系统内存和闪存,企业可以提高可扩展性,减少内存瓶颈,并构建能够满足未来AI增长需求的架构,而无需完全依赖更大规模的GPU配置。.
Phison 如何支持超越 GPU 性能的可扩展 AI 基础设施?
Phison 通过结合控制器级创新、分层内存管理和 Pascari 技术,为可扩展的 AI 基础设施提供支持。 爱达普替夫™ 旨在解决日益影响人工智能推理性能的内存限制问题。这种方法有助于组织 优化 有效的内存容量,支持更长的上下文窗口和更高的并发性,并构建专为持续企业级部署而设计的 AI 平台,而不仅仅是计算性能。.











