开源推理框架 vLLM 团队与 Inferact 10 月 7 日发布技术博客,介绍他们为 DeepSeek-V4.1-Flash 做的一整套推理优化。在模拟智能体工作负载的测试里,低并发场景下速度提升 1.9 倍;在把单用户输出速度卡在每秒 150 token 的约束下,整体吞吐提升 5.3 倍。
测试负载用的是 SemiAnalysis 的 AgentX 基准,团队把它当作有代表性的智能体服务场景:多轮对话、长上下文、会话亲和保持前缀缓存命中。低延迟配置是 4 卡张量并行加 FlashInfer,高吞吐配置是 2 路数据并行加专家并行。
模型本身的特点
按博客的描述,V4.1 Flash 采用因果编码器-解码器结构,共 40 层,第 20 层负责算出解码器用的全局 KV。生成阶段每个 token 激活约 160 亿参数,预填充阶段约 80 亿。全局 KV 缓存经过压缩、跨层共享,FP4 精度下每 token 约 890 字节;另有一段滑动窗口 KV 覆盖最近 128 个位置,以 FP8 存储不压缩。
缓存这么小,带来一个直接结果:整轮基准跑下来,不需要把 KV 缓存卸载到内存或硬盘。长上下文智能体任务里,卸载往往是拖慢延迟的主要来源之一。
八项优化里的几个大头
团队列了八项改动,收益最明显的几项:
- 滑动窗口有界重放:遇到前缀缓存命中时,直接重算最近 128 个 token,配合 CUDA Graph,首 token 延迟下降约 30%。在约 10 万 token 的上下文上,首 token 延迟降了将近 70%。这项在 V4.1 上默认开启,可用
--no-swa-bounded-replay关掉。 - 稀疏 MQA 打分核:512K 上下文下比原实现快 14 到 23 倍,8K 下只快 1.2 倍,落到端到端解码约 3% 到 6%。
- NVFP4 注意力:KV 缓存比此前 FP8 方案小 45%,对应环节提速约 1.45 倍。
- Engram 查表:异步预取加透明大页,查找最快提速约 10 倍。
另外几项是算子融合:把混合专家路由的几步合进一个核,中等批量下快 1.18 到 1.31 倍;mHC 相关核在 GB200 上比 TileLang 版本快 1.14 到 1.51 倍。
精度方面,团队在 GSM8K 和 GPQA 上做了对照,称质量损失”negligible”(可以忽略),差距在约 1.5 个标准误以内。博客没给出更多任务上的评测。
国内部署能用上多少
这组数字全部来自英伟达 Blackwell 平台。受美国出口管制,国内机构很难拿到 GB200、GB300 这类卡,NVFP4 也是 Blackwell 才有的数据格式,相关收益在 H20 或国产加速卡上没法直接复现。
能迁移的部分主要在调度和缓存层。滑动窗口重放、会话亲和、不卸载 KV 这几条跟硬件绑定较弱,代码进了 vLLM 主线,用同一个模型的团队升级版本就能拿到。各项内核集成的进度,vLLM 在 GitHub 第 57448 号 issue 里集中跟踪。国产卡上的实际提速是多少,目前还没有第三方测过。
参考来源:vLLM 官方技术博客、CocoLoop、SemiAnalysis AgentX 基准说明;博客数据核验各项优化的提速倍数、测试硬件与并行配置。