Maple-Preview:三元权重量化推理模型,Mac Mini M4 跑出 218 tok/s · 干货攻略
- 链接:https://x.com/abacaj/status/2044444194774357068
- 分类:x-tips
- 来源:X @abacaj
- 作者:Jay
- 更新:2026-08-12
- 仓库:deepgrove/maple-preview
这是什么
Maple-Preview 是 DeepGrove(@deepgrove_ai)于 2026 年 8 月初开源的一个 20B-A1B 三元权重组合专家(ternary-weight MoE)推理模型。所谓"三元权重",即权重值仅使用 {-1, 0, +1} 三个离散值,而非常见的 INT4/INT8 量化——这意味着权重本身已经是极端低精度状态,但仍从零开始以三元格式训练,而非事后对全精度模型做后处理量化。
核心参数(来源:Hugging Face 官方 model card):
| 参数 | 数值 |
|---|---|
| 总参数量 | 20B |
| 激活参数量 | 1B(A1B) |
| 架构 | 24 层,256 experts(8 active) |
| 注意力 | 3:1 SWA-512:GA(滑动窗口 512 : 全局注意力) |
| Checkpoint 大小 | 5.31 GB |
| 上下文窗口 | 131,072 tokens |
| 许可 | MIT |
项目开源在 Hugging Face:deepgrove/maple-preview,MIT 许可证。
为什么值得关注
在边缘/本地推理场景中,"小模型高速推理 + 可接受推理质量"一直是核心目标。Maple-Preview 的意义在于它从训练阶段就采用三元权重,DeepGrove 称之为"从零开始训练,而非事后量化",并认为事后量化是"fundamentally the wrong approach"(根本错误的方向)。
解决的核心问题:在消费级硬件(尤其是 Apple Silicon)上,用极小的内存占用跑出接近高端量化模型的推理速度。
- 218 tok/s on M4 Mac mini(官方实测,Hugging Face model card 明确标注)
- 比 Gemma 4、Qwen3.5、gpt-oss 快 5–16 倍(官方对比)
- Checkpoint 仅 5.31 GB,Mac mini M4(16GB 内存)完全装得下
- 131k token 超长上下文,适合长程推理任务
适合的场景:本地数学/代码推理、长文档分析、对速度敏感的本地 agent 下游任务。DeepGrove 自身也承认其在 agentic benchmarks 上表现偏弱,因为 Preview 版本几乎没有做过 agent 专项后训练。
核验过程
官方来源
-
Hugging Face Model Card (
huggingface.co/deepgrove/maple-preview) - 架构:24 层 / 256 experts(8 active)/ 3:1 SWA-512:GA ✅ - 218 tok/s on M4 Mac mini ✅ - 5.31 GB checkpoint ✅ - 131,072 token context ✅ - MIT license ✅ - IMO 级问题解决能力(SOTA in weight class)✅ - Benchmark 对比图(以图片形式嵌入,无法提取文字数字) -
README.md (
huggingface.co/deepgrove/maple-preview/blob/main/README.md) - Transformers 实现需要 Triton + FlashAttention,适用于 CUDA 环境 - Apple Silicon 结果来自独立 on-device runtime(CUDA 版不能直接用在 Mac 上) -
DeepGrove 官方博客 (
deepgrove.ai/maple-preview) - 状态:HTTP 404,无 Wayback Machine 存档,无法核验
交叉验证结论
- 218 tok/s on M4 Mac mini:Glonce、AI Weekly 等多个独立来源均引用此数字,来源均指向 DeepGrove 官方;Glonce 报道中注明该数字来自 HF model card。可确认来自官方文档。
- 5–16× vs Gemma 4 / Qwen3.5 / gpt-oss:HF model card 文字明确注明,Glonce 确认。来自官方,未独立复现。
- iPhone 120 tok/s:该数字仅出现在 Hacker News 提交标题及第三方报道(GIGAZINE 等),HF model card 中不存在,HN 评论员(hahahaa)已公开纠正:实测设备是 Mac mini,不是 iPhone。DeepGrove 官方博客(现已 404)据传包含此数字但无法核验。原帖主张「120 tok/s on iPhone」属未证实说法,攻略中不引用此数字。
- Benchmark 评分:HF model card 中对比图表为 PNG 图片,无法提取文字数值,无法独立核验。
- 独立测试(YouTube):有用户在 A100(80GB)上实测仅 ~50–71 tok/s,远低于 Mac mini 的 218 tok/s,说明该模型对 Apple Silicon 优化显著,GPU 并非其优势平台。
上手步骤
方式一:Hugging Face Transformers(CUDA 环境,需要 Triton + FlashAttention)
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "deepgrove/maple-preview"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
input_text = "Solve this problem: ..."
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0]))
⚠️ 注意:HF Transformers 实现依赖 Triton + FlashAttention,仅适用于 CUDA 兼容 GPU 环境。Apple Silicon 用户请参考 on-device runtime(见下方)。
方式二:Docker Model Runner(多平台,支持 llama.cpp backend)
Docker Model Runner 是官方 HF 推荐的推理路径,天然支持 llama.cpp backend(支持 macOS Apple Silicon)。
# 安装 Docker Model Runner(需要 Docker 已运行)
docker model install-runner --backend llama.cpp
# 下载并运行 Maple-Preview
docker model pull deepgrove/maple-preview
docker model run deepgrove/maple-preview
💡 首次运行会下载 ~5.3 GB 模型,建议挂载本地模型缓存目录避免重复下载。
方式三:vLLM(SGLang 同理,GPU 服务器场景)
# 安装
pip install vllm
# 启动服务
python -m vllm.entrypoints.openai.api_server \
--model deepgrove/maple-preview \
--gpu-memory-utilization 0.9
# API 调用
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepgrove/maple-preview",
"messages": [{"role": "user", "content": "Solve: 2x + 3 = 7"}]
}'
方式四:在线 Demo(免本地部署)
DeepGrove 官方运营 chat.deepgrove.ai,可直接在浏览器体验,无需任何安装。
坑与适用边界
⚠️ 必须知道的限制
- Agentic 能力弱:Maple-Preview 是一个 preview 版本,DeepGrove 明确指出"receives minimal post-training for agentic tasks and only small-scale general RL"。如果你的目标是让模型调用工具、操作文件、持续对话,请降低预期或等待正式版。
- 幻觉问题:多位 HN 网友实测发现,模型在窄领域技术问题(如代码/数学)表现良好,但在常识性问题上会自信地输出错误答案。建议搭配验证层使用,不要直接用于生产知识问答。
- Benchmark 分数不透明:HF model card 中性能对比以图片形式提供,无法提取独立数值。官方宣称的"SOTA reasoning"在攻略中标注为官方主张,未独立核验。
- Apple Silicon 专用 runtime:218 tok/s 的实测用的是 Apple Silicon 专用 runtime,不是 Transformers pip 安装版。如果你在 GPU 服务器上用 CUDA 版,速度会明显低于官方宣传数字(A100 实测 ~50–71 tok/s)。
- iPhone 120 tok/s 数字无官方来源:该说法只见于 HN 标题和第三方报道,官方 model card 未收录。攻略正文不引用此数字。
适用边界
- ✅ 本地数学/竞赛级推理任务(AIME、HMMT 等)
- ✅ Mac Mini M4 用户需要本地高速 LLM(16GB 内存完全够用)
- ✅ 对模型文件大小敏感(5.31 GB)的本地部署
- ❌ 需要强 agent 工具调用能力的场景(当前版本不擅长)
- ❌ 需要多模态能力(纯文本模型)
- ❌ GPU 服务器场景追求极致吞吐量(考虑 27B 或更大的量化模型)
一句话结论
Maple-Preview 是一个在 5.31 GB 体积内实现 218 tok/s(Mac mini M4) 的三元权重建模尝试,代表了"从训练阶段原生低精度"这条技术路线在 20B 规模的首次亮相;其实测速度令人印象深刻,但作为 Preview 版本,在 agentic 能力、常识准确性和 benchmark 透明度上仍有明显短板——适合作为本地高速推理引擎接入工作流,而非直接当通用助手使用。