在日前公布的MLPerf Storage v3.0评测结果中,焱融科技F9000X三节点集群在3D U-Net训练数据供给测试中实现544GiB/s的聚合带宽,并在Checkpoint 70B测试中取得读、写带宽双项第一。但比成绩本身更值得注意的,是这一轮评测开始考察什么。

MLPerf Storage v3.0新增了KVCache测试项,模拟多轮会话中的KV Cache整体写入与回读,并报告模拟输出Token吞吐、读写带宽和P95读取时延。这意味着存储要处理的对象,从预先准备好的数据集,延伸到了推理过程中产生的运行时状态。过去AI存储的核心任务是持续、稳定地为GPU供数,服务于计算开始之前;现在它被要求让一次已经完成的计算继续发挥作用,进入推理过程内部。

在Transformer架构中,已计算的Key和Value会被保留为KV Cache,供后续Token生成时直接复用。若不同请求之间存在相同的上下文前缀,理论上这部分计算状态也能跨请求复用,省去重复的预填充开销。但从“单次生成内部的缓存”走向“跨请求的全局复用”,中间隔着三重相互牵连的系统工程挑战:内容相同不等于缓存可用,系统提示词微调或Token序列微移都会导致复用前缀失效;显存有限,缓存未必留得住;节点孤立,留得住也未必用得上。

焱融从训练存储起步,到推出AI原生推理存储系统YRCache,再到发布共享缓存一体机ContextBox,为观察这一变化提供了具体样本。在单机架构中,焱融采用三级分层:G1为GPU显存,G2为主机内存,G3为本地SSD,层级越往下容量越大、单位成本越低,但回读延迟与搬运开销也越高。训练的目标是让GPU少等数据,推理的目标则是让GPU少做重复计算。单纯提高读写带宽只能加快数据搬运,若无法解决状态匹配、跨机共享与全局调度,便无法真正释放上下文复用的价值。