InfoQ中国8月10日刊文讨论AI推理规模上升后存储角色的变化。华为云公开产品资料显示,其弹性内存存储EMS以DRAM为主要存储介质,面向大语言模型推理中的缓存与加速场景。资料称,EMS可将多轮对话和公共前缀等历史KV Cache缓存在内存存储中,并通过分布式内存池进行管理。
在Transformer推理中,模型会为已处理的上下文保留键值缓存,避免生成后续内容时重复计算。华为云“以存代算”资料介绍了KV缓存与模型维度、层数、数据精度和上下文长度的关系,并说明推理请求所需缓存会随上下文长度变化。EMS产品介绍将该方案描述为在传统“计算—存储”两层架构之间加入内存层,形成“计算—内存—存储”三层架构。
华为云称,这一内存层可池化AI服务器中的部分空闲DRAM资源,并通过高性能内存缓存持久化存储层数据或计算过程中产生的中间数据。官方材料将应用目标指向降低冗余计算、提升推理吞吐量、减少首Token时延,以及补充部分推理场景中的显存和内存资源。产品资料还说明,AI推理部署会同时使用计算与存储资源,模型文件、输入输出数据和日志分别属于不同的资源配置环节。
技术资料说明的是产品能力与使用方式,并未披露EMS的客户数量、部署规模、收入,以及不同模型上的资源节省比例,也未给出与其他方案的统一性能对比。可以确认的是,华为云已将内存池化和KV缓存管理作为面向推理的产品路径;具体资源表现则会受模型规模、上下文长度、硬件配置、网络和实际负载影响。
KV缓存池化对推理基础设施配置的传导
推理负载上升时,KV缓存占用会使资源安排从单纯采购计算卡,延伸至内存、存储与网络的协同配置。面向这类场景的内存池化产品,会增加技术硬件、存储与外设行业围绕推理工作负载进行适配的需求,配置重点也转向缓存容量、带宽和数据移动效率。对互联网服务与基础设施行业而言,减少重复计算有助于优化部分资源使用方式,但运营方也需在DRAM、持久存储、网络与计算资源之间重新平衡成本。由于公开资料未披露采购规模,这一影响主要体现为基础设施架构需求的变化,而非已确认订单。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 技术硬件、存储与外设 | 利好 | KV缓存管理把内存和存储性能纳入推理服务配置,扩大面向推理优化的适配需求。 |
| 互联网服务与基础设施 | 中性 | 以存代算可优化部分推理资源使用,同时增加内存、网络与存储的协同管理要求。 |
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
