DeepSeek-V4.1-Flash 发布:552B MoE + CED 架构 + 890B/Token KV Cache · 干货攻略
- 链接: https://api-docs.deepseek.com/news/news260910 | https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- 分类: x-tips
- 来源: X @rasbt
- 作者: Jay
- 更新: 2026-09-23
- 仓库: deepseek-ai/DeepSeek-V4.1-Flash
这是什么
DeepSeek-V4.1-Flash 是 DeepSeek 于 2026 年 9 月 10 日 正式发布的开源多模态 MoE 大模型,是 DeepSeek 新架构家族的最小成员。它在 9 月 14 日已接管原 deepseek-v4-pro 的全部流量,成为 DeepSeek API 的主力模型。模型以 MIT 协议开源权重,同时通过 DeepSeek 官方 API(model ID: deepseek-flash)提供服务。
从技术定位上,V4.1-Flash 与 V4-Flash(2026-07-31)和 V4-Pro(2026-08-13)是同一代产品,但架构已全面迭代,不是简单升级。
为什么值得关注
谁分享的
本条干货线索来自 X @rasbt(Sebastian Raschka,AI 教育领域知名研究者),其长期跟踪开源 LLM 发布节奏,信号质量较高。
解决了什么问题
当前 agentic AI 的核心痛点有两个:推理成本高、KV Cache 显存膨胀。 V4.1-Flash 从架构层面同时回应了这两个问题:
- Causal Encoder-Decoder(CED)架构:输入端只用 8B 活跃参数,输出端 16B,骨干网络 552B 总参数量。相比 V4-Pro(49B 激活)的成本结构大幅压缩。
- Compressed Sparse Attention 2(CSA2)+ FP4 KV Cache:全局 KV Cache 压缩至 890 bytes/token,是 V4-Flash 的 1/4,是初代 DeepSeek-V1 的 1/437。这意味着 1M token 上下文的 KV Cache 只需约 890MB,而非传统架构的 GB 级。
从 benchmark 来看,DeepSeek 官方模型卡数据(vendor-reported)在 agentic 任务上全面领先 V4-Pro 并与闭源前沿模型正面竞争:
| Benchmark(最高推理档位) | V4.1 Flash | V4 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 87.9 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 62.7 | 74.0 | 73.0 |
| AutomationBench | 54.8 | 43.2 | 50.3 | 45.8 |
| Terminal-Bench 4.0 | 31.2 | 12.4 | 51.8 | 39.9 |
| GPQA Diamond(知识) | 90.9 | 92.4 | 93.4 | 94.1 |
V4.1 Flash 在 agentic(终端任务、代码工程、自动化工作流)上显著领先 V4-Pro,在知识类 benchmark 上略逊于 Opus 5 / GPT-5.6 Sol,但在成本端有数量级优势。DeepSeek 官方也坦承,在 Terminal-Bench 3.0/4.0 等高难度 agentic 任务上与 Opus 5 仍有差距。
核验过程
官方来源(已读)
- HuggingFace README(
deepseek-ai/DeepSeek-V4.1-Flash):确认了 CED 架构参数(40层=20+20)、552B 总参、8B/16B 活跃参数、384 routed experts、6 activated/expert/token、CSA2 分层稀疏索引器、FP4 E2M1 主 KV 缓存、890 bytes/token 全局 KV Cache、DeepSeek-ViT 视觉编码器、Engram 196B 稀疏记忆、Dspark 投机解码、45T token 预训练语料、SWA Bounded Replay、推理档位 1-100 等核心架构细节。 - DeepSeek 官方公告(
api-docs.deepseek.com/news/news260910):确认发布日期 2026-09-10、API model IDdeepseek-flash、V4-Flash/V4-Flash-Vision-Exp 退役、deepseek-v4-pro 路由至 V4.1 Flash(2026-09-14 生效)、V4.1-Flash 全面超越 V4-Pro 性能和成本、vLLM/SGLang 支持、社区合作计划。 - DeepSeek 官方技术报告 PDF(HuggingFace 仓库,1.81 MB):确认基准测试数据来源路径及预训练/后训练流程。
- DeepSeek 官方定价页(
api-docs.deepseek.com):确认 off-peak 定价 $0.15/M 输入 / $0.60/M 输出 / $0.003/M 缓存命中;peak 时段双倍。
交叉验证
多源第三方报道(KIE.AI、Coursiv.io、Distk.in、MindStudio.ai、Beam.ai、Tech-Insider.org)均一致指向相同的核心数字:552B 总参、8B/16B 活跃、MIT 协议、1M context、9月10日发布、benchmark 分数高度吻合。输出速度社区报告范围为 190–427 tokens/s(有报告称 500+),此为第三方实测,DeepSeek 官方未公布标称速度,属于原帖主张"300+ tokens/s",此处标注为社区实测区间,非官方承诺。
上手步骤
1. 通过官方 API 调用(推荐快速上手)
# OpenAI 兼容接口,标准 SDK 改一行 base_url 即可
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-flash", # 官方 model ID
messages=[
{"role": "user", "content": "解释 Causal Encoder-Decoder 架构和传统 Transformer 的区别"}
],
max_tokens=1024,
temperature=0.7
)
print(response.choices[0].message.content)
注意:
deepseek-v4-flash字符串仍可使用(临时兼容路由),但推荐迁移至deepseek-flash。
2. 通过 vLLM 本地部署
# 克隆权重后用 vLLM 启动
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-V4.1-Flash \
--max-model-len 1048576 \
--gpu-memory-utilization 0.92 \
--enforce-eager # CED 架构建议 eager 模式启动
3. 通过 SGLang 部署
python -m sglang.launch_server \
--model-path deepseek-ai/DeepSeek-V4.1-Flash \
--max-running-seq-len 1048576 \
--mem_fraction-static 0.92
4. 视觉多模态调用
import base64
def image_to_base64(path):
with open(path, "rb") as f:
return base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{image_to_base64('diagram.png')}"}},
{"type": "text", "text": "描述这张架构图的关键组件"}
]
}]
)
5. 控制推理档位(Reasoning Effort)
V4.1-Flash 支持整数 1–100 的推理档位,数值越高推理越深入(消耗更多输出 token):
# 关闭思考(快速响应)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "今天天气如何?"}],
extra_body={"thinking_friendly": False}
)
# 最高推理档位(复杂 agent 任务)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "写一个完整的多线程 HTTP 服务器"}],
extra_body={"thinking_friendly": True, "thinking_budget": 100}
)
坑与适用边界
⚠️ 1. 速度标称值是社区实测,DeepSeek 未官方公布
原帖称"300+ tokens/s",多源实测区间为 190–427 tokens/s,与并发量、硬件配置、服务端负载强相关。不要将此作为 SLA 承诺,生产环境请以实际压测为准。
⚠️ 2. V4.1 Flash 在知识类 benchmark 上落后于前沿闭源模型
Terminal-Bench 4.0(31.2 vs Opus 5 的 51.8)、GPQA Diamond(90.9 vs 94.1)等知识密集型任务与 Claude Opus 5 / GPT-5.6 Sol 仍有差距。若任务高度依赖专业知识推理,评估时需实测而非仅看 agentic 基准。
⚠️ 3. API 定价有 peak/off-peak 之别
off-peak(峰谷时段)价格是 peak 时段的 50%。对成本敏感的工作流应避开 01:00–04:00 UTC 高峰期,调度到 off-peak 执行。缓存命中($0.003/M)相比未命中($0.15/M)有 98% 折扣,在 agentic 长程任务中善用上下文缓存是成本优化关键。
⚠️ 4. 原 deepseek-v4-flash 模型 ID 是旧版(V4-Flash,July 31)
9月10日之后调用 deepseek-v4-flash 实际路由到 V4.1 Flash,但语义上应使用新的 deepseek-flash 以确保正确的版本控制和定价溯源。
⚠️ 5. 多模态图像输入边界条件未完全公开
官方确认支持原生图像理解,但图像格式支持范围、单图大小限制等细节 DeepSeek 尚未完全披露,复杂多图 agent 场景建议先行实测。
适用边界总结
| 场景 | 推荐度 | 理由 |
|---|---|---|
| Agentic 终端/代码任务 | ⭐⭐⭐⭐⭐ | 官方 benchmark 领先,尤其 Terminal-Bench/DeepSWE |
| 高频短推理(聊天、摘要) | ⭐⭐⭐⭐ | 成本极低,8B prefill 活跃参数 |
| 长程 agent 工作流(>32K token) | ⭐⭐⭐⭐⭐ | 890B/token KV Cache,1M context,缓存成本优势明显 |
| 复杂知识推理(科研/法律/医学) | ⭐⭐⭐ | 知识类 benchmark 落后于 Opus 5/GPT-5.6 Sol |
| 实时低延迟对话(<100ms P50) | ⭐⭐⭐ | 取决于部署硬件和并发,190–427 tokens/s 是区间值 |
一句话结论
DeepSeek-V4.1-Flash 以 CED 架构和 CSA2 KV 压缩将 552B MoE 的 agentic 推理成本压至 V4-Pro 的约 1/4,MIT 开源权重 + 1M context + 原生多模态,是当前 1M 超长程 agent 任务性价比最高的选择之一——但极限知识推理和实时低延迟场景仍需根据实测决策。