AI 推理基础设施 · 深度解读 当英伟达用 CMX G3.5 重新定义推理存储,瑞网广通给出了另一个 KV Cache 存储解法 从 KV Cache「显存墙」到多级缓存卸载,国产存储如何对标CMX G3.5 架构,瑞网广通用AI 高性能KV Cache存储给出自己的答案。 CMX G3.5 KV Cache TOKEN工厂 AI存储 |
2026 年 GTC 大会上,黄仁勋说了一句让存储行业震动的话:
“KV Cache 的激增足以催生一个全新的存储市场。”
—— 黄仁勋,GTC 2026
这句话的背后,是 AI 推理正在从“算力瓶颈”转向“数据供给瓶颈”。GPU 买了一批又一批,真正跑满的时候却不多——问题不在芯片,而在存储喂不饱算力。
英伟达给出的解法叫CMX(Context Memory eXtension),英伟达给出的Rubin整机柜方案中,在存储层级中插入了一个全新的G3.5 层。而瑞网广通用 FFS AI 高性能KV Cache存储,完美匹配Pod专属KV缓存层全部技术要求。
两条技术实现路径,殊途同归还是各有千秋?今天我们来拆解。
一、KV Cache 膨胀瓶颈:被显存墙卡住的推理
先说清楚一个问题:KV Cache 到底有多大?
在大模型推理中,每一轮对话都会生成 KV Cache(键值缓存),它是模型理解上下文的“短期记忆”。随着上下文变长、对话轮次增多,KV Cache 会指数级膨胀。一组测算数据可以直观感受其量级:
~400GB 单请求 KV Cache | ~45PB 10万用户总需求 | 1:1:16 Rubin 标配 |
什么概念?一张 GPU 的显存根本装不下它需要处理的 KV Cache。
传统做法是:放不下的 KV 要么丢掉重算(浪费算力),要么塞到本地 SSD(无法跨节点共享),要么推到网络存储(延迟太高)。结果是: