DeepSeek 发布原生多模态 MoE 模型 DeepSeek-V4.1-Flash,支持最高 100 万 Token 上下文。该模型拥有 552B 主干参数和 196B Engram 条件记忆参数,但在 Prefill 阶段每 Token 仅激活 8B 参数,Decode 阶段激活 16B 参数。相比之下,上一代 DeepSeek-V4-Flash 主干参数为 284B,每 Token 激活 13B 参数。这意味着新模型主干规模接近翻倍,读取 Prompt 时实际参与计算的参数反而减少。

这一代模型的技术重点转向长程 Agent 的真实部署成本。当 Agent 不断读取代码、网页、文档和工具返回结果时,模型工作负载越来越“输入重型”,长上下文带来的 Prefill 计算、KV Cache 占用、SSD 存储和数据搬运,开始成为比模型参数本身更突出的成本瓶颈。

根据技术报告,V4.1-Flash 共有 40 层语言主干,划分为 20 层因果编码器和 20 层 Decoder。前两层只使用滑动窗口注意力,其余层采用新的压缩稀疏注意力 CSA2,并集成 Single-Pass mHC、Engram、DSpark 以及分层稀疏索引器等模块。Prefill 时,Prompt 先经过前 20 层因果编码器,进入后 20 层 Decoder 后,全局 KV 直接从第 20 层 Encoder 最终隐藏状态投影得到,大部分 Prompt Token 无需完整经过后半部分网络,报告显示 Prefill 计算量接近减半。

在 KV Cache 方面,DeepSeek 将 V4 使用的 CSA 与 HCA 混合架构改为纯 CSA2,并增加跨 Transformer 层共享 KV Cache 的压缩维度。CSA2 中的 Layer 被划分为 Full、Reindex 和 Reuse 三种模式,分别对应完整生成 KV 与索引、复用 Global KV 并重新计算重要历史位置,以及连 Top-K 索引一并复用,以降低长上下文场景下的存储与数据搬运开销。