瑞网广通 AI KV Cache 存储 KV Cache 存储五大典型 AI应用场景 02|大模型推理服务: KV Cache 如何释放GPU HBM, 提升推理并发?
大模型在线推理正在从单请求生成走向高并发、长上下文和规模化服务。每一个请求都需要生成并维护 KV Cache,随着并发用户数和上下文长度不断增加,KV Cache 会快速占用宝贵的 GPU HBM,并逐渐成为制约单卡并发能力和 GPU 利用率的重要因素。
■ 推理服务为什么越来越需要 KV Cache
在大模型推理过程中,模型首先对输入上下文进行 Prefill,并生成 KV Cache;随后在 Decode 阶段持续复用历史 KV,以减少重复计算。对于大模型 API 服务、企业智能问答、AI 搜索与知识库问答、Coding Assistant 以及大模型在线推理平台而言,请求量和上下文长度不断增长,KV Cache 的容量压力也随之上升。
■ 典型业务与用户所面临的挑战
■ 典型业务 大模型 API 服务 企业智能问答 AI 搜索与知识库问答 Coding Assistant 大模型在线推理平台 ■ 用户面临的挑战 ◆ KV Cache 持续占用 GPU HBM,挤压模型计算空间 ◆ 长上下文和高并发导致显存快速耗尽 ◆ 为满足 KV Cache 容量需求,被迫增加 GPU 数量 ◆ 请求结束后 KV Cache 被直接释放,重复计算成本较高
■ 从 GPU HBM 到分层 KV Cache Storage
瑞网广通 AI KV Cache 存储方案将部分 KV Cache 从 GPU HBM Offload 至NVMe SSD,并根据访问热度进行分层管理。

高频访问数据留在更靠近 GPU 的位置,低热度 KV 则向更大容量的存储层迁移,从而在性能、容量和成本之间实现平衡。
某国产 GPU 实测:使用瑞网广通 AI 高性能 KV Cache 存储后,Token 吞吐量↑100+倍,充分释放 GPU 性能!
■ 核心价值
✓ 降低 GPU HBM 的 KV Cache 占用
✓ 提升单 GPU 并发请求数量
✓ 支撑更长上下文推理
✓ 降低 GPU 扩容需求
✓ 提高 GPU 资源利用率
对于在线推理用户而言,瑞网广通 AI KV Cache 存储的意义并不是简单“把缓存放到 SSD”,而是通过分层卸载,让 GPU HBM 更聚焦于高价值的计算与 Hot KV,同时用更大容量的存储承接更多 Context 数据。
瑞网广通 AI KV Cache 存储 · 五大典型AI应用场景 · 产品场景介绍