瑞网FFS|AI高性能 KV Cache存储 赋能Token生产降本增效!

AI 推理基础设施 · 深度解读当英伟达用 CMX G3.5 重新定义推理存储,瑞网广通给出了另一个 KV Cache 存储解法从 KV Cache「显存墙」到多级缓存卸载,国产存储如何对标CMX G3.5 架构,瑞网广通用AI 高性能KV Cache存储给出自己的答案。 CMX G3.5 KV Cache TOKEN工厂 AI存储 2026 年 GTC 大会

AI 推理基础设施 · 深度解读

当英伟达用 CMX G3.5 重新定义推理存储,瑞网广通给出了另一个 KV Cache 存储解法

KV Cache「显存墙」到多级缓存卸载,国产存储如何对标CMX G3.5 架构,瑞网广通AI 高性能KV Cache存储给出自己的答案。

 CMX G3.5    KV Cache       TOKEN工厂     AI存储       

2026 年 GTC 大会上,黄仁勋说了一句让存储行业震动的话:

“KV Cache 的激增足以催生一个全新的存储市场。”
—— 黄仁勋,GTC 2026

这句话的背后,是 AI 推理正在从“算力瓶颈”转向“数据供给瓶颈”。GPU 买了一批又一批,真正跑满的时候却不多——问题不在芯片,而在存储喂不饱算力

英伟达给出的解法叫CMX(Context Memory eXtension)英伟达给出的Rubin整机柜方案中,在存储层级中插入了一个全新的G3.5 层而瑞网广通用 FFS AI 高性能KV Cache存储,完美匹配Pod专属KV缓存层全部技术要求。

两条技术实现路径,殊途同归还是各有千秋?今天我们来拆解。

一、KV Cache 膨胀瓶颈:被显存墙卡住的推理

先说清楚一个问题:KV Cache 到底有多大?

在大模型推理中,每一轮对话都会生成 KV Cache(键值缓存),它是模型理解上下文的“短期记忆”。随着上下文变长、对话轮次增多,KV Cache 会指数级膨胀。一组测算数据可以直观感受其量级:

~400GB

单请求 KV Cache
64K tokens)

~45PB

10万用户总需求
(人均15次对话)

1:1:16

Rubin 标配
1张GPU:1T显存:16T KVCache

什么概念?一张 GPU 的显存根本装不下它需要处理的 KV Cache。

传统做法是:放不下的 KV 要么丢掉重算(浪费算力),要么塞到本地 SSD(无法跨节点共享),要么推到网络存储(延迟太高)。结果是:

电话咨询
产品服务
解决方案