DeepSeek V4 Flash 0731 · 干货攻略
- 链接:https://x.com/_akhaliq/status/2083213086970847569
- 分类:x-tips
- 来源:X @_akhaliq
- 作者:Jay
- 更新:2026-08-06
- 仓库:deepseek-ai/DeepSeek-V4-Flash-0731
这是什么
DeepSeek V4 Flash 0731 是 DeepSeek 于 2026 年 7 月 31 日正式发布的开源 MoE 大语言模型权重,MIT 许可证,可免费下载、部署、商业使用。它是 V4 Flash 预览版(2026 年 4 月发布)的生产更新版,架构和参数量完全不变(284B 总参,13B 激活),核心改进来自后训练数据质量带来的 agent 能力跃升,并附带了 DSpark 投机解码模块。
核心规格(来源:DeepSeek 官方 Hugging Face 模型卡)
| 规格 | 数值 |
|---|---|
| 总参数量 | 284B |
| 激活参数量 | 13B / token |
| MoE 路由 | 256 路由专家 + 1 共享专家,每 token 选 6 个 |
| 注意力架构 | Hybrid Attention(CSA + HCA,压缩稀疏注意力) |
| 上下文窗口 | 1M tokens |
| 最大输出 | 384K tokens |
| 投机解码 | DSpark 模块(附于 checkpoint,非独立模型) |
| 许可证 | MIT |
| 发布日期 | 2026 年 7 月 31 日 |
为什么值得关注
@_akhaliq 的分享指出这是"MIT 协议 + Unsloth/llama.cpp 双重本地运行路径"的组合拳,实际价值体现在三个方面:
1. 价格锚定重新定义本地部署边界。 DeepSeek V4 Flash 官方 API 定价为 $0.14/M 输入、$0.28/M 输出——只有 V4 Pro 输出价格的约 1/3。这个价格意味着很多场景下 API 比本地硬件更划算,但 MIT 许可证让本地商业部署彻底无门槛,两者组合让开发者有了更大的灵活空间。
2. Agent 能力大幅超越预览版,甚至超越 V4 Pro 预览。 官方评测数据(均为 vendor-reported,需自行验证):
| Benchmark | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7% | 61.8% | 72.1% |
| DeepSWE | 54.4% | 7.3% | 12.8% |
| Toolathlon-Verified | 70.3% | 49.7% | 55.9% |
| NL2Repo | 54.2% | 39.4% | 38.5% |
终端执行、代码搜索、工具调用——这些正是 Agent 场景的核心能力。V4 Flash 0731 在这些指标上相比预览版的跃升幅度极大(Terminal Bench 2.1 从 61.8% 跳到 82.7%),而且在多个维度超越了参数多出 10 倍的 V4 Pro 预览版(后者 1.6T 总参 / 49B 激活)。
3. 投机解码模块 DSpark 是生产级推理加速的关键。 vLLM 和 SGLang 均已支持该模块,单卡 flag 即可开启,减少延迟。
核验过程
本攻略中所有事实均经过以下来源交叉核验:
官方来源: - DeepSeek 官方 Hugging Face 模型卡(deepseek-ai/DeepSeek-V4-Flash-0731):架构参数、许可证、benchmark 数据、API 定价、vLLM/SGLang 运行命令 - Unsloth 官方文档(unsloth.ai/docs/models/deepseek-v4):GGUF 量化规格、内存需求表、推理参数建议、lossless Q8 量化验证数据 - NVIDIA NGC Catalog:模型描述与架构确认
交叉验证结论: - 参数量(284B / 13B):Hugging Face、Unsloth、NGC 三方一致确认 - MIT 许可证:Hugging Face 模型卡明确标注 License: MIT;Unsloth GGUF 同;antirez 仓库明确引用 opensource.org/licenses/MIT - 内存需求:Unsloth 量化表(1-bit 92GB → Q8 169GB)与 Wavect 测评数据(2-bit 约 91-97GB,3-bit 约 110-135GB,4-bit 约 137-155GB)吻合 - API 价格:Together.ai 列示 $0.14/M 输入 / $0.28/M 输出,与官方模型卡一致 - "168GB RAM for 4-bit 量化":原帖候选描述的数字与 Unsloth 官方表(Q8 169GB,4-bit ~137-155GB)不精确吻合。取 Unsloth 官方数字:4-bit UD-Q4_K_XL ≈ 137-155 GB;3-bit UD-IQ3_XXS ≈ 103-110 GB。建议实际以 Unsloth 表为准。 - Benchmark 数据:全部为 DeepSeek 官方评测,Wavect 等第三方测评均标注为 vendor-reported,未独立复现
上手步骤
路径一:Unsloth GGUF(推荐,最省事)
Unsloth 提供预转换的 GGUF 文件,bit-exact 复现官方权重,带 MXFP4 原生打包,经验证 KL 散度 ≈ 0。
1. 安装 llama.cpp
macOS:
brew install llama.cpp
Linux:
brew install llama.cpp
# 或从 releases 下载预编译二进制
2. 下载 GGUF 权重(选量化等级)
# 3-bit(推荐 128GB RAM 设备):约 103 GB
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "UD-IQ3_XXS"
# 4-bit(near-lossless,约 137-155 GB):需要 ~162 GB 设备
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "UD-Q4_K_XL"
# 8-bit(lossless,162 GB):需要 ~169 GB 设备
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "UD-Q8_K_XL"
3. 运行推理
llama-cli \
--model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_XXS/DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-XXXX.gguf \
--temp 1.0 \
--top-p 0.95 \
-p "<|begin_of_text|><|user|>|message|Content\n你好<|eot|>" \
-cnv
4. 启动 API Server(可选)
llama-server \
--model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-Q4_K_XL/... \
-fa
路径二:antirez llama.cpp fork(Mac Metal 优化版)
针对 Macbook 128GB RAM 优化,使用 2-bit 量化,打包在 Hugging Face。
# 下载 antirez 的 GGUF
# https://huggingface.co/antirez/deepseek-v4-gguf
llama-cli \
-m DeepSeek-V4-Flash-IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8-chat.gguf \
-cnv
⚠️ antirez 明确说明该量化未经过广泛测试,"frontier-model vibes but not extensively tested"。生产级使用建议走 Unsloth 路径。
路径三:vLLM(多 GPU 服务器)
DSpark 投机解码开箱即用:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
--data-parallel-size 4 --enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
控制推理行为
关闭 thinking(快回复模式):
--chat-template-kwargs '{"enable_thinking":false}'
调整推理投入(reasoning effort):
--chat-template-kwargs '{"reasoning_effort":"max"}' # 最强推理
--chat-template-kwargs '{"reasoning_effort":"high"}' # 高推理(默认)
--chat-template-kwargs '{"reasoning_effort":"low"}' # 轻推理
推荐推理参数(来源:DeepSeek 官方模型卡):
| 场景 | temperature | top-p |
|---|---|---|
| Agent 场景 | 1.0 | 0.95 |
| 其他任务 | 1.0 | 1.0 |
坑与适用边界
⚠️ 硬件门槛高,别被标题党带偏
V4 Flash 0731 的 284B 总参在任意精度下都无法在消费级 GPU 上运行。Wavect 的实测总结非常清晰:
"A 2-bit DeepSeek build is physically plausible on 128GB unified memory. It does not make the platform equivalent to a four-GPU GB300 server."
| 量化等级 | 最低可用设备 | 实际推荐 |
|---|---|---|
| 1-bit | 96GB RAM | 仅实验,输出质量极低 |
| 2-bit | 128GB RAM | 可行但无 context headroom |
| 3-bit | 110-135GB RAM | 128GB Mac 推荐 |
| 4-bit | ~162GB RAM | 192GB+ 工作站 |
| Q8 (lossless) | ~169GB RAM | 多 GPU 或高端工作站 |
128GB Mac 能跑,但别期待高速。 YouTube 测评显示:M5 Max(128GB)2-bit 约 34 tokens/s,M3 Max 约 26 tokens/s,512GB Mac Studio 4-bit 约 35 tokens/s。这些数字受量化等级、context 长度、OS 内存争用影响较大。
⚠️ 本地部署不一定比 API 便宜
Wavect 做了完整的经济核算:128GB 机器的硬件摊销 + 电费在低利用率下远超 API 成本(API 每百万 token 约 $0.28)。如果只是单用户、低并发,API 是更理性的选择。本地部署的真正价值在于数据隐私和合规要求,而不是成本。
⚠️ Benchmark 是官方自测,谨慎对待
DeepSeek 官方评测使用了"minimal mode of DeepSeek Harness"(该 harness 本身尚未发布),且 DSBench-FullStack 和 DSBench-Hard 均为内部数据集。Wavect 等第三方明确标注这些数字为 vendor-reported,未独立复现。真正有意义的评估需要自己在目标硬件上用目标数据集跑。
⚠️ 4-bit ≠ 4-bit,不同量化方式差距极大
Unsloth 的分析揭示了一个重要事实:DeepSeek 对路由专家使用了原生 MXFP4 量化(QAT 训练),这意味着非 Unsloth 的 4-bit GGUF 如果重新量化了专家层,会引入显著误差(Q4_K 对 MXFP4 路由专家 RMSE 约 5.2%)。选 Unsloth UD-Q4_K_XL 或 UD-Q8_K_XL 比选第三方 4-bit 更稳妥。
适用边界
✅ 适合: 有高端 Mac(128GB+)或高端工作站的开发者做实验性推理;隐私合规必须本地部署的场景;Agent 系统快速原型(Terminal Bench 表现优异)
❌ 不适合: 常规 NLP 任务(Qwen3 等小模型性价比更高);需要高吞吐量的生产服务(vLLM 多 GPU 方案成本高);期待 1M context 在本地跑满(RAM 不够)
一句话结论
DeepSeek V4 Flash 0731 以 MIT 许可证将 284B MoE(13B 激活)+ 1M context + DSpark 投机解码开源,Unsloth GGUF 让 128GB RAM Mac 运行 3-bit 成为可能;但它不是"免费版 GPT-4",高显存需求和本地推理速度决定了它最适合隐私敏感的高端开发者实验,主流场景 API 仍是更理性的选择。