DeepSeek-V4.1-Flash 发布:552B MoE + CED 架构 + 890B/Token KV Cache · 干货攻略

  • 链接: https://api-docs.deepseek.com/news/news260910 | https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-09-23
  • 仓库: deepseek-ai/DeepSeek-V4.1-Flash

这是什么

DeepSeek-V4.1-Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseek-v4-pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 API(model ID: deepseek-flash)提供服务。

从技术定位上,V4.1-Flash 与 V4-Flash(2026-07-31)和 V4-Pro(2026-08-13)是同一代产品,但架构已全面迭代,不是简单升级。


为什么值得关注

谁分享的

本条干货线索来自 X @rasbt(Sebastian Raschka,AI 教育领域知名研究者),其长期跟踪开源 LLM 发布节奏,信号质量较高。

解决了什么问题

当前 agentic AI 的核心痛点有两个:推理成本高、KV Cache 显存膨胀。 V4.1-Flash 从架构层面同时回应了这两个问题:

  • Causal Encoder-Decoder(CED)架构:输入端只用 8B 活跃参数,输出端 16B,骨干网络 552B 总参数量。相比 V4-Pro(49B 激活)的成本结构大幅压缩。
  • Compressed Sparse Attention 2(CSA2)+ FP4 KV Cache:全局 KV Cache 压缩至 890 bytes/token,是 V4-Flash 的 1/4,是初代 DeepSeek-V1 的 1/437。这意味着 1M token 上下文的 KV Cache 只需约 890MB,而非传统架构的 GB 级。

从 benchmark 来看,DeepSeek 官方模型卡数据(vendor-reported)在 agentic 任务上全面领先 V4-Pro 并与闭源前沿模型正面竞争:

Benchmark(最高推理档位) V4.1 Flash V4 Pro Claude Opus 5 GPT-5.6 Sol
Terminal-Bench 2.1 90.6 87.9 89.1 88.8
DeepSWE v1.1 74.2 62.7 74.0 73.0
AutomationBench 54.8 43.2 50.3 45.8
Terminal-Bench 4.0 31.2 12.4 51.8 39.9
GPQA Diamond(知识) 90.9 92.4 93.4 94.1

V4.1 Flash 在 agentic(终端任务、代码工程、自动化工作流)上显著领先 V4-Pro,在知识类 benchmark 上略逊于 Opus 5 / GPT-5.6 Sol,但在成本端有数量级优势。DeepSeek 官方也坦承,在 Terminal-Bench 3.0/4.0 等高难度 agentic 任务上与 Opus 5 仍有差距。


核验过程

官方来源(已读)

  1. HuggingFace READMEdeepseek-ai/DeepSeek-V4.1-Flash):确认了 CED 架构参数(40层=20+20)、552B 总参、8B/16B 活跃参数、384 routed experts、6 activated/expert/token、CSA2 分层稀疏索引器、FP4 E2M1 主 KV 缓存、890 bytes/token 全局 KV Cache、DeepSeek-ViT 视觉编码器、Engram 196B 稀疏记忆、Dspark 投机解码、45T token 预训练语料、SWA Bounded Replay、推理档位 1-100 等核心架构细节。
  2. DeepSeek 官方公告api-docs.deepseek.com/news/news260910):确认发布日期 2026-09-10、API model ID deepseek-flash、V4-Flash/V4-Flash-Vision-Exp 退役、deepseek-v4-pro 路由至 V4.1 Flash(2026-09-14 生效)、V4.1-Flash 全面超越 V4-Pro 性能和成本、vLLM/SGLang 支持、社区合作计划。
  3. DeepSeek 官方技术报告 PDF(HuggingFace 仓库,1.81 MB):确认基准测试数据来源路径及预训练/后训练流程。
  4. DeepSeek 官方定价页api-docs.deepseek.com):确认 off-peak 定价 $0.15/M 输入 / $0.60/M 输出 / $0.003/M 缓存命中;peak 时段双倍。

交叉验证

多源第三方报道(KIE.AI、Coursiv.io、Distk.in、MindStudio.ai、Beam.ai、Tech-Insider.org)均一致指向相同的核心数字:552B 总参、8B/16B 活跃、MIT 协议、1M context、9月10日发布、benchmark 分数高度吻合。输出速度社区报告范围为 190–427 tokens/s(有报告称 500+),此为第三方实测,DeepSeek 官方未公布标称速度,属于原帖主张"300+ tokens/s",此处标注为社区实测区间,非官方承诺


上手步骤

1. 通过官方 API 调用(推荐快速上手)

# OpenAI 兼容接口,标准 SDK 改一行 base_url 即可
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-flash",          # 官方 model ID
    messages=[
        {"role": "user", "content": "解释 Causal Encoder-Decoder 架构和传统 Transformer 的区别"}
    ],
    max_tokens=1024,
    temperature=0.7
)
print(response.choices[0].message.content)

注意deepseek-v4-flash 字符串仍可使用(临时兼容路由),但推荐迁移至 deepseek-flash

2. 通过 vLLM 本地部署

# 克隆权重后用 vLLM 启动
python -m vllm.entrypoints.openai.api_server \
  --model deepseek-ai/DeepSeek-V4.1-Flash \
  --max-model-len 1048576 \
  --gpu-memory-utilization 0.92 \
  --enforce-eager          # CED 架构建议 eager 模式启动

3. 通过 SGLang 部署

python -m sglang.launch_server \
  --model-path deepseek-ai/DeepSeek-V4.1-Flash \
  --max-running-seq-len 1048576 \
  --mem_fraction-static 0.92

4. 视觉多模态调用

import base64

def image_to_base64(path):
    with open(path, "rb") as f:
        return base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_to_base64('diagram.png')}"}},
            {"type": "text", "text": "描述这张架构图的关键组件"}
        ]
    }]
)

5. 控制推理档位(Reasoning Effort)

V4.1-Flash 支持整数 1–100 的推理档位,数值越高推理越深入(消耗更多输出 token):

# 关闭思考(快速响应)
response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "今天天气如何?"}],
    extra_body={"thinking_friendly": False}
)

# 最高推理档位(复杂 agent 任务)
response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "写一个完整的多线程 HTTP 服务器"}],
    extra_body={"thinking_friendly": True, "thinking_budget": 100}
)

坑与适用边界

⚠️ 1. 速度标称值是社区实测,DeepSeek 未官方公布

原帖称"300+ tokens/s",多源实测区间为 190–427 tokens/s,与并发量、硬件配置、服务端负载强相关。不要将此作为 SLA 承诺,生产环境请以实际压测为准。

⚠️ 2. V4.1 Flash 在知识类 benchmark 上落后于前沿闭源模型

Terminal-Bench 4.0(31.2 vs Opus 5 的 51.8)、GPQA Diamond(90.9 vs 94.1)等知识密集型任务与 Claude Opus 5 / GPT-5.6 Sol 仍有差距。若任务高度依赖专业知识推理,评估时需实测而非仅看 agentic 基准。

⚠️ 3. API 定价有 peak/off-peak 之别

off-peak(峰谷时段)价格是 peak 时段的 50%。对成本敏感的工作流应避开 01:00–04:00 UTC 高峰期,调度到 off-peak 执行。缓存命中($0.003/M)相比未命中($0.15/M)有 98% 折扣,在 agentic 长程任务中善用上下文缓存是成本优化关键。

⚠️ 4. 原 deepseek-v4-flash 模型 ID 是旧版(V4-Flash,July 31)

9月10日之后调用 deepseek-v4-flash 实际路由到 V4.1 Flash,但语义上应使用新的 deepseek-flash 以确保正确的版本控制和定价溯源。

⚠️ 5. 多模态图像输入边界条件未完全公开

官方确认支持原生图像理解,但图像格式支持范围、单图大小限制等细节 DeepSeek 尚未完全披露,复杂多图 agent 场景建议先行实测。

适用边界总结

场景 推荐度 理由
Agentic 终端/代码任务 ⭐⭐⭐⭐⭐ 官方 benchmark 领先,尤其 Terminal-Bench/DeepSWE
高频短推理(聊天、摘要) ⭐⭐⭐⭐ 成本极低,8B prefill 活跃参数
长程 agent 工作流(>32K token) ⭐⭐⭐⭐⭐ 890B/token KV Cache,1M context,缓存成本优势明显
复杂知识推理(科研/法律/医学) ⭐⭐⭐ 知识类 benchmark 落后于 Opus 5/GPT-5.6 Sol
实时低延迟对话(<100ms P50) ⭐⭐⭐ 取决于部署硬件和并发,190–427 tokens/s 是区间值

一句话结论

DeepSeek-V4.1-Flash 以 CED 架构和 CSA2 KV 压缩将 552B MoE 的 agentic 推理成本压至 V4-Pro 的约 1/4,MIT 开源权重 + 1M context + 原生多模态,是当前 1M 超长程 agent 任务性价比最高的选择之一——但极限知识推理和实时低延迟场景仍需根据实测决策。