DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用
DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse
精选理由
文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。
AI 摘要
DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。
正文 · AI 翻译
长时程智能体已经把 LLM 服务变成了一种输入密集型负载。反复的预填充和百万级 token 上下文留下的 KV cache 给 HBM、SSD 容量和带宽带来了巨大压力。DeepSeek AI围绕这一瓶颈打造了其最新发布。DeepSeek-V4.1-Flash是一款多模态混合专家模型,拥有 552B 骨干参数、196B 额外 Engram 参数,以及 1M token 上下文窗口。它在预填充阶段每个 token 激活 8B 参数,在解码阶段激活 16B。核心数字是每 token 全局 KV cache 占用仅 890 字节,约为 DeepSeek-V4-Flash 的 1/4,比 DeepSeek-V1 小约 437 倍。
它能部署吗?能。开放权重以MIT 许可证发布,在 Hugging Face 上提供 vLLM、SGLang 和 Transformers 路径,研究团队还描述了一个公开 API,设有低、高、最高三档推理层级。
因果编码器-解码器:预填充减半
40 层骨干被拆分为 20 层因果编码器和 20 层解码器。受YOCO启发,解码器不计算自身的全局 KV。相反,逐层投影权重从编码器最终隐藏状态中推导出它。因此提示词 token 止步于编码器,这几乎将预填充计算量减半。128 token 窗口的滑动窗口注意力(SWA)仍在每一层运行,因此解码器 SWA 状态只需重放最后 128 个提示词 token 即可重建。研究团队称之为解码器 SWA 有界重放。
压缩稀疏注意力 2(CSA2)
DeepSeek-V4 将 CSA 与高度压缩注意力(Heavily Compressed Attention)混合使用。V4.1-Flash 采用纯 CSA2,并沿层轴压缩缓存大小。每个 CSA2 层被静态分配为以下 3 种模式之一:
Full:计算自身的主 KV,从中投影出 indexer K,并选出全新的 Top-512 索引。
Reindex:复用上一个 Full 层的主 KV 和 indexer K,但用自身的 indexer Q 对它们重新打分。
Reuse:同时复用主 KV 和最新的 Top-K 索引,完全跳过 indexer。
每一层都保留自己的主 Q 和 SWA KV。18 个 CSA2 编码器层采用压缩比 2,分为 3 组、每组 6 层(1 个 Full,5 个 Reuse)。20 个解码器层采用压缩比 1,分为 5 组、每组 4 层:第一组为 Full 加 3 个 Reuse,其余为 Reindex 加 3 个 Reuse。解码器中的分层稀疏索引器(Hierarchical Sparse Indexer)让 Full 层构建一个最多 16,384 个位置(2,048 个块,每块 8 个)的候选池,从而使后续的 Reindex 层只需对有限集合打分,而非整个上下文。
FP4 KV、有界重放及其他扩展
主 KV 缓存被量化为 E2M1,每 16 个通道配一个 E4M3 缩放因子,遵循 NVFP4 但不含其全局缩放因子。这通过后训练阶段的量化感知训练引入,相比 V4 的 FP8 缓存几乎将存储减半。
在部署层面,SWA KV 不再持久化到 SSD。它驻留在一个分布式池中,该池从主机 DRAM 的 10% 中划分而来,TTL 为分钟级,而全局 KV 则保证 72 小时的生命周期。未命中时,Encoder SWA Bounded Replay 只重新计算 128 个 token,而非层数乘以窗口大小。
其他改动包括 Single-Pass mHC,它将输入混合系数偏移一个 block,使融合的 Mega-mHC kernel 能将激活内存流量减半;位于第 1 层和第 14 层的 Engram 条件记忆模块;在预训练后以冻结主干训练的 DSpark 投机解码;以及 head-wise Muon。当上下文从 4K 增长到 1M 时,单 token 解码 FLOPs 仅增加 1/4。
训练与结果
预训练覆盖 45T 多模态 token,文本与多模态比例为 7:1。稀疏注意力从零开始以 64K 序列长度训练,无稠密预热,并在 34T token 时将上下文扩展至 1M。基础模型在世界知识和编程方面与 DeepSeek-V4-Pro-Base 相当,而总参数量仅为其 1/3,激活参数量仅为其 1/4。
后训练未引入新算法。收益来自大规模合成可验证的智能体任务、跨异构脚手架(Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness)的 RL,以及来自 40 多个教师模型的 on-policy 蒸馏。精选的最大努力结果如下:
基准测试DS-V4.1-FlashDS-V4-FlashOpus-5GPT-5.6 Sol
Terminal-Bench 2.190.682.789.188.8
DeepSWE v1.174.254.474.073.0
Terminal-Bench 4.031.27.051.839.9
Automation-Bench54.837.750.345.8
GPQA Diamond90.989.993.494.1
Codeforces(评分)34713289n/an/a
交互式讲解
核心要点
全局 KV cache 降至每 token 890 字节,约为 V4-Flash 的 1/4,比 V1 低 437 倍。
CED 在 prefill 阶段仅运行 20 个编码器层,激活 8B 参数,而 decode 阶段为 16B。
CSA2 在 Full、Reindex 和 Reuse 模式下跨层共享主 KV、indexer K 和 Top-K 索引。
FP4 主 KV 加上 SWA 有界重放,将持久缓存削减至 V4-Flash 的约 1/8。
在 Terminal-Bench 2.1 和 DeepSWE v1.1 上以 MIT 权重击败 Opus-5 和 GPT-5.6 Sol。
原文
Original Title
DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse
Source
MarkTechPost(RSS)
Site
marktechpost.com
Author
Asif Razzaq
Published
2026-09-10 15:31