瑞网广通 AI KV Cache 存储 · 五大典型 AI 应用场景-02|大模型推理服务:KV Cache 如何释放 GPU HBM,提升推理并发?

2026-09-30 16:38:46 admin 2


  瑞网广通 AI KV Cache 存储

KV Cache 存储五大典型 AI应用场景

02|大模型推理服务:

KV Cache

如何释放GPU HBM,

提升推理并发?

大模型在线推理正在从单请求生成走向高并发、长上下文和规模化服务。每一个请求都需要生成并维护 KV Cache,随着并发用户数和上下文长度不断增加,KV Cache 会快速占用宝贵的 GPU HBM,并逐渐成为制约单卡并发能力和 GPU 利用率的重要因素。

■ 推理服务为什么越来越需要 KV Cache

在大模型推理过程中,模型首先对输入上下文进行 Prefill,并生成 KV Cache;随后在 Decode 阶段持续复用历史 KV,以减少重复计算。对于大模型 API 服务、企业智能问答、AI 搜索与知识库问答、Coding Assistant 以及大模型在线推理平台而言,请求量和上下文长度不断增长,KV Cache 的容量压力也随之上升。

■ 典型业务与用户所面临的挑战

■ 典型业务

 大模型 API 服务 

 企业智能问答    

 AI 搜索与知识库问答 

 Coding Assistant   

 大模型在线推理平台 

■ 用户面临的挑战

◆ KV Cache 持续占用 GPU HBM,挤压模型计算空间

◆ 长上下文和高并发导致显存快速耗尽

◆ 为满足 KV Cache 容量需求,被迫增加 GPU 数量

◆ 请求结束后 KV Cache 被直接释放,重复计算成本较高

■ 从 GPU HBM 到分层 KV Cache Storage

瑞网广通 AI KV Cache 存储方案将部分 KV Cache 从 GPU HBM Offload 至NVMe SSD,并根据访问热度进行分层管理。 

图片关键词

高频访问数据留在更靠近 GPU 的位置,低热度 KV 则向更大容量的存储层迁移,从而在性能、容量和成本之间实现平衡。

某国产 GPU 实测:使用瑞网广通 AI 高性能 KV Cache 存储后,Token 吞吐量↑100+倍,充分释放 GPU 性能!

■ 核心价值

 ✓ 降低 GPU HBM 的 KV Cache 占用   

 ✓ 提升单 GPU 并发请求数量  

 ✓ 支撑更长上下文推理  

 ✓ 降低 GPU 扩容需求   

 ✓ 提高 GPU 资源利用率 

结语|从 Cache 到 AI Context Memory

对于在线推理用户而言,瑞网广通 AI KV Cache 存储的意义并不是简单“把缓存放到 SSD”,而是通过分层卸载,让 GPU HBM 更聚焦于高价值的计算与 Hot KV,同时用更大容量的存储承接更多 Context 数据。


瑞网广通 AI KV Cache 存储 · 五大典型AI应用场景 · 产品场景介绍


电话咨询
产品服务
解决方案