Maple-Preview:三元权重量化推理模型,Mac Mini M4 跑出 218 tok/s · 干货攻略

  • 链接:https://x.com/abacaj/status/2044444194774357068
  • 分类:x-tips
  • 来源:X @abacaj
  • 作者:Jay
  • 更新:2026-08-12
  • 仓库:deepgrove/maple-preview

这是什么

Maple-Preview 是 DeepGrove(@deepgrove_ai)于 2026 年 8 月初开源的一个 20B-A1B 三元权重组合专家(ternary-weight MoE)推理模型。所谓"三元权重",即权重值仅使用 {-1, 0, +1} 三个离散值,而非常见的 INT4/INT8 量化——这意味着权重本身已经是极端低精度状态,但仍从零开始以三元格式训练,而非事后对全精度模型做后处理量化。

核心参数(来源:Hugging Face 官方 model card):

参数 数值
总参数量 20B
激活参数量 1B(A1B)
架构 24 层,256 experts(8 active)
注意力 3:1 SWA-512:GA(滑动窗口 512 : 全局注意力)
Checkpoint 大小 5.31 GB
上下文窗口 131,072 tokens
许可 MIT

项目开源在 Hugging Face:deepgrove/maple-preview,MIT 许可证。


为什么值得关注

在边缘/本地推理场景中,"小模型高速推理 + 可接受推理质量"一直是核心目标。Maple-Preview 的意义在于它从训练阶段就采用三元权重,DeepGrove 称之为"从零开始训练,而非事后量化",并认为事后量化是"fundamentally the wrong approach"(根本错误的方向)。

解决的核心问题:在消费级硬件(尤其是 Apple Silicon)上,用极小的内存占用跑出接近高端量化模型的推理速度。

  • 218 tok/s on M4 Mac mini(官方实测,Hugging Face model card 明确标注)
  • 比 Gemma 4、Qwen3.5、gpt-oss 快 5–16 倍(官方对比)
  • Checkpoint 仅 5.31 GB,Mac mini M4(16GB 内存)完全装得下
  • 131k token 超长上下文,适合长程推理任务

适合的场景:本地数学/代码推理、长文档分析、对速度敏感的本地 agent 下游任务。DeepGrove 自身也承认其在 agentic benchmarks 上表现偏弱,因为 Preview 版本几乎没有做过 agent 专项后训练。


核验过程

官方来源

  1. Hugging Face Model Card (huggingface.co/deepgrove/maple-preview) - 架构:24 层 / 256 experts(8 active)/ 3:1 SWA-512:GA ✅ - 218 tok/s on M4 Mac mini ✅ - 5.31 GB checkpoint ✅ - 131,072 token context ✅ - MIT license ✅ - IMO 级问题解决能力(SOTA in weight class)✅ - Benchmark 对比图(以图片形式嵌入,无法提取文字数字)

  2. README.md (huggingface.co/deepgrove/maple-preview/blob/main/README.md) - Transformers 实现需要 Triton + FlashAttention,适用于 CUDA 环境 - Apple Silicon 结果来自独立 on-device runtime(CUDA 版不能直接用在 Mac 上)

  3. DeepGrove 官方博客 (deepgrove.ai/maple-preview) - 状态:HTTP 404,无 Wayback Machine 存档,无法核验

交叉验证结论

  • 218 tok/s on M4 Mac mini:Glonce、AI Weekly 等多个独立来源均引用此数字,来源均指向 DeepGrove 官方;Glonce 报道中注明该数字来自 HF model card。可确认来自官方文档。
  • 5–16× vs Gemma 4 / Qwen3.5 / gpt-oss:HF model card 文字明确注明,Glonce 确认。来自官方,未独立复现。
  • iPhone 120 tok/s:该数字仅出现在 Hacker News 提交标题及第三方报道(GIGAZINE 等),HF model card 中不存在,HN 评论员(hahahaa)已公开纠正:实测设备是 Mac mini,不是 iPhone。DeepGrove 官方博客(现已 404)据传包含此数字但无法核验原帖主张「120 tok/s on iPhone」属未证实说法,攻略中不引用此数字。
  • Benchmark 评分:HF model card 中对比图表为 PNG 图片,无法提取文字数值,无法独立核验。
  • 独立测试(YouTube):有用户在 A100(80GB)上实测仅 ~50–71 tok/s,远低于 Mac mini 的 218 tok/s,说明该模型对 Apple Silicon 优化显著,GPU 并非其优势平台。

上手步骤

方式一:Hugging Face Transformers(CUDA 环境,需要 Triton + FlashAttention)

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "deepgrove/maple-preview"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

input_text = "Solve this problem: ..."
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0]))

⚠️ 注意:HF Transformers 实现依赖 Triton + FlashAttention,仅适用于 CUDA 兼容 GPU 环境。Apple Silicon 用户请参考 on-device runtime(见下方)。

方式二:Docker Model Runner(多平台,支持 llama.cpp backend)

Docker Model Runner 是官方 HF 推荐的推理路径,天然支持 llama.cpp backend(支持 macOS Apple Silicon)。

# 安装 Docker Model Runner(需要 Docker 已运行)
docker model install-runner --backend llama.cpp

# 下载并运行 Maple-Preview
docker model pull deepgrove/maple-preview
docker model run deepgrove/maple-preview

💡 首次运行会下载 ~5.3 GB 模型,建议挂载本地模型缓存目录避免重复下载。

方式三:vLLM(SGLang 同理,GPU 服务器场景)

# 安装
pip install vllm

# 启动服务
python -m vllm.entrypoints.openai.api_server \
  --model deepgrove/maple-preview \
  --gpu-memory-utilization 0.9

# API 调用
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepgrove/maple-preview",
    "messages": [{"role": "user", "content": "Solve: 2x + 3 = 7"}]
  }'

方式四:在线 Demo(免本地部署)

DeepGrove 官方运营 chat.deepgrove.ai,可直接在浏览器体验,无需任何安装。


坑与适用边界

⚠️ 必须知道的限制

  1. Agentic 能力弱:Maple-Preview 是一个 preview 版本,DeepGrove 明确指出"receives minimal post-training for agentic tasks and only small-scale general RL"。如果你的目标是让模型调用工具、操作文件、持续对话,请降低预期或等待正式版。
  2. 幻觉问题:多位 HN 网友实测发现,模型在窄领域技术问题(如代码/数学)表现良好,但在常识性问题上会自信地输出错误答案。建议搭配验证层使用,不要直接用于生产知识问答。
  3. Benchmark 分数不透明:HF model card 中性能对比以图片形式提供,无法提取独立数值。官方宣称的"SOTA reasoning"在攻略中标注为官方主张,未独立核验
  4. Apple Silicon 专用 runtime:218 tok/s 的实测用的是 Apple Silicon 专用 runtime,不是 Transformers pip 安装版。如果你在 GPU 服务器上用 CUDA 版,速度会明显低于官方宣传数字(A100 实测 ~50–71 tok/s)。
  5. iPhone 120 tok/s 数字无官方来源:该说法只见于 HN 标题和第三方报道,官方 model card 未收录。攻略正文不引用此数字

适用边界

  • ✅ 本地数学/竞赛级推理任务(AIME、HMMT 等)
  • ✅ Mac Mini M4 用户需要本地高速 LLM(16GB 内存完全够用)
  • ✅ 对模型文件大小敏感(5.31 GB)的本地部署
  • ❌ 需要强 agent 工具调用能力的场景(当前版本不擅长)
  • ❌ 需要多模态能力(纯文本模型)
  • ❌ GPU 服务器场景追求极致吞吐量(考虑 27B 或更大的量化模型)

一句话结论

Maple-Preview 是一个在 5.31 GB 体积内实现 218 tok/s(Mac mini M4) 的三元权重建模尝试,代表了"从训练阶段原生低精度"这条技术路线在 20B 规模的首次亮相;其实测速度令人印象深刻,但作为 Preview 版本,在 agentic 能力、常识准确性和 benchmark 透明度上仍有明显短板——适合作为本地高速推理引擎接入工作流,而非直接当通用助手使用。