GLM-5.3-Flash 架构拆解:KDA + 稀疏 MLA 双效混合注意力 · 干货攻略
- 链接: https://x.com/rasbt/status/2092629415813365899
- 分类: x-tips
- 来源: X @rasbt
- 作者: Jay
- 更新: 2026-09-02
这是什么
2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM-5.3-Flash,来自智谱 AI(Zhipu AI,国际品牌 Z.ai)。
这不是一次普通发布。GLM-5.3-Flash 是 GLM-5 系列中第一个原生多模态模型,320B 总参数 / 18B 激活参数,MIT 许可证权重开源,1M context,API 定价仅为 Claude Opus 4.8 的约 1/20。
@rasbt(Sebastian Raschka,AI 研究者、LLM Architecture Gallery 维护者)随后发布了一篇架构拆解笔记,将这个模型的设计称为 "super hybrid"(超级混合)——因为它同时融合了两个效率向的注意力机制,而非像 Kimi(KDA + 全注意力 MLA)或 DeepSeek V3.2(DSA + 全注意力 MLA)那样只搭配一个高效机制配一个全注意力。
为什么值得关注
这不只是"又一个大模型"
GLM-5.3-Flash 的核心价值在于架构效率:它是首个在 MoE 大模型中同时引入线性注意力(KDA)和稀疏注意力(MLA/DSA)的开源前沿模型。根据 Z.ai 官方数据,相比 GLM-5.3(对应全注意力 MLA),GLM-5.3-Flash 将注意力计算量压缩 3.01 倍,KV Cache 体积缩小 4.44 倍,同时保持了几乎同等的智能水平(Terminal-Bench 2.1: 84.3 vs Opus 4.8 的 85.0)。
这意味着在超长上下文(1M token)场景下,GLM-5.3-Flash 的服务成本远低于全注意力模型,同时智能差距几乎可忽略。对 Agent 开发者而言,这直接影响:更低的单步推理成本 + 更长的上下文记忆能力。
架构演进的关键节点
理解 GLM-5.3-Flash 的设计,需要放在整个 GLM 系列和行业 attention 演进的坐标系里:
| 模型 | 注意力机制 | 特点 |
|---|---|---|
| GLM-4 系列 | 全注意力 MLA | 标准配置 |
| GLM-5.2 | 稀疏 MoE,744B-A40B | 规模大,激活参数多 |
| GLM-5.3 | 全注意力 + 更强 MoE | 355B/32B 配置 |
| GLM-5.3-Flash | KDA + 稀疏 MLA/DSA 混合 | 320B/18B,效率优先 |
这次"降参数量、提效率"的思路与 Kimi(线性注意力降成本)和 DeepSeek(稀疏注意力降成本)走的是同一条路,但 GLM-5.3-Flash 是第一次将两条路合并。
核验过程
官方来源(核心依据)
-
Z.ai 官方文档(docs.z.ai/guides/vlm/glm-5.3-flash) - 确认:320B 总参 / 18B 激活,MIT 许可证,1M context - 确认:注意力计算压缩 3.01×,KV Cache 压缩 4.44× vs GLM-5.3 - 确认:sparse + linear 混合注意力架构,Z.ai 称为"首例开源前沿模型同时结合两种注意力" - 确认:mHC(Manifold-Constrained Hyper-Connections)残差路径 - 确认:Native Multimodal(视觉编码器集成在 coding loop 中) - 确认:API 定价 $0.15/$0.50 per M tokens(输入/输出),缓存输入 $0.03
-
Z.ai HuggingFace 仓库(huggingface.co/zai-org/GLM-5.3-Flash) - 确认:预训练数据 30T multimodal tokens - 确认:支持 SGLang / vLLM / KTransformers / Unsloth / Transformers 本地部署 - 确认:benchmark 评测参数(Terminal-Bench 用 Claude Code 2.1.207,DeepSWE 用 mini-swe-agent) - 确认:benchmark 数值(见正文"为什么值得关注"和"上手步骤")
-
Sebastian Raschka 博客(sebastianraschka.com/blog/2026/glm-5-3-flash-architecture-notes.html) - 这是本次干货的原帖,rasbt 独立从权重分析中推导出层数和 attention 模式 - rasbt 指出 KDA + MLA/DSA 双效混合为"super hybrid"命名来源
交叉验证
-
MarkTechPost(marktechpost.com,2026-08-26 报道 Z.ai 官方发布) - 确认 benchmark 数值:Terminal-Bench 2.1: 84.3,DeepSWE v1.1: 63.4(GLM-5.2: 46.2),AutomationBench: 48.8(GLM-5.2: 26.2) - 确认 API 定价与官方一致
-
Reddit r/LocalLLaMA Megathread(独立社区解析,基于权重分析) - 确认层数结构:45 层(前 3 层 dense MLP,后 42 层 MoE) - 确认 Hidden Layout:11 × (3 × (KDA Linear Attention → MoE) → 1 × (Sparse Attention → MoE)) + 1 trailing linear layer - 确认 KDA 层参数:64 heads,head dimension 128 - 确认 Sparse Attention 层参数:64 heads,QK/V head dim 256/256,Indexer 32 heads,top-2048 budget - 确认 MoE 参数:288 routed experts + 1 shared expert,激活 8 routed + 1 shared expert
⚠️ 需标注的未核验说法
- rasbt 原帖称"GLM-5.2 为 744B-A40B MoE":此说法来自 rasbt 的权重分析,Z.ai 官方文档对比的是 GLM-5.3(355B/32B),而非 GLM-5.2。744B 具体指哪个版本或统计口径,官方文档未提及。本攻略不引用此 744B 数字,以官方数据为准。
- "stealth week 全部在国产芯片上运行":据 Linas's Substack 报道,Z.ai 声称约 10 万块国产 AI 芯片。此数字未经独立核验,标注为"原帖主张,未核验"。
- "OpenRouter 6 天 23T tokens":同 Linas's Substack 来源,未经 OpenRouter 官方独立确认,标注为"原帖主张,未核验"。
上手步骤
模型获取
API 方式(推荐,大多数场景)
# Z.ai API,模型代码
glm-5.3-flash
# 官方推荐参数(来自 Z.ai docs)
temperature: 1.0
top_p: 0.95
reasoning_effort: max # 可选 low/high/max,默认 max
#thinking 参数(仅支持 enabled,不支持关闭)
thinking.type: enabled
thinking.clear_thinking: false # chat 场景建议设为 true
# streaming(推荐同时开启)
stream: true
tool_stream: true
本地部署框架(按推荐度排序)
| 框架 | 适用场景 | 备注 |
|---|---|---|
| SGLang | 生产部署,H100/H200 | Cookbook |
| vLLM | 通用推理,Hopper+ | v0.27.0+ 需要 FlashInfer 0.6.17+ 支持 NoPE sparse MLA |
| Unsloth | 快速尝鲜,Mac/消费级 GPU | Day 1 即支持 dynamic GGUF,Q4/K4 量化可跑在 128GB 机器 |
| KTransformers | 内存受限环境 | 教程 |
| Transformers | 调试/研究 | 文档 |
量化参考(来自 Unsloth / Reddit 社区) - 1-bit(Q4_K + 动态量化):约需 100 GB 内存 - 3-bit(Q3_K/XL):约需 128 GB 内存(Mac Studio M5 Ultra 可用)
Benchmark 对照表
| Benchmark | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 | GPT-5.6 Terra |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | — | 85.0 | 87.4 |
| DeepSWE v1.1 | 63.4 | 46.2 | — | — |
| AutomationBench | 48.8 | 26.2 | — | — |
| Z.ai Code Bench v1.0 (max) | 29.0 | — | 29.5 | — |
| HLE w/ tools | 55.3 | — | — | — |
| OfficeQA Pro | 62.4 | — | (低于 Opus) | — |
数据来源:Z.ai 官方 HuggingFace README,评测参数见 README Footnotes。Terminal-Bench 用 Claude Code 2.1.207 评测,DeepSWE 用 mini-swe-agent harness(6h timeout,400K context),均为官方复现配置。
核心架构参数一览
| 参数 | 数值 |
|---|---|
| 总参数量 | 320B |
| 激活参数 | 18B |
| Hidden Dimension | 4096 |
| 词汇表大小 | 154,880 |
| 总层数 | 45(前3 dense MLP + 后42 MoE) |
| KDA 层 | ~34层(3:1 比例结构) |
| Sparse Attention 层 | ~11层 |
| MoE Experts | 288 routed + 1 shared |
| 激活 Experts | 8 routed + 1 shared |
| Expert Intermediate Dim | 2048 |
| 注意力计算压缩比 | 3.01× vs GLM-5.3 |
| KV Cache 压缩比 | 4.44× vs GLM-5.3 |
| Context Length | 1M token |
| 最大输出 | 128K token |
层数分布细节来自社区对权重的独立解析(Reddit Megathread),与 rasbt 原帖 34 KDA / 11 Sparse 数据一致,但标注为非官方数据。
坑与适用边界
已知坑
-
Thinking 模式不可关闭:GLM-5.3-Flash 的
thinking.type只支持enabled,无法像其他模型那样禁用 thinking 过程。对需要无思考过程快速回复的场景不友好。 -
本地部署硬件门槛仍高:FP8 权重约需 306 GiB(官方 SGLang/vLLM recipe),至少需要单卡 H100/H200 或等效显存。消费级即使 Q3_K 量化也需要 128GB 内存,门槛不低。
-
激活参数 18B ≠ 等效 18B 密集模型:MoE 的 8+1 expert 路由意味着每个 token 实际使用约 10B 参数计算(8/288 × 320B + 18B shared),但在复杂推理任务上 MoE 的 expert selection 可能不如等参数量密集模型稳定。
-
Benchmark 分数与实际 Agent 体验可能有差距:Terminal-Bench 等 benchmark 反映的是特定任务子集,实际 coding agent 场景(多文件编辑、调试循环、长程规划)的表现需要自己测试。
-
国产芯片运营声明无法独立核验:Z.ai 声称 stealth week 完全使用国产 AI 芯片运营,无 NVIDIA 硬件参与,此说法目前无公开第三方验证。
适用边界
- 适用:超长上下文任务(代码库理解、论文分析、完整项目开发)、成本敏感型 Agent 系统、需要本地部署且有硬件条件的团队
- 不适用:需要无 thinking 快速回复的场景、无法满足硬件门槛的消费级部署、对"国产芯片"说法有合规审查需求的企业
- 注意:benchmark 评测基于特定 harness 配置(Claude Code 2.1.207 评测 Terminal-Bench),实际效果因使用方式不同可能存在差异
一句话结论
GLM-5.3-Flash 的核心创新不是"更大",而是"更聪明地更高效"——KDA + 稀疏 MLA 双效混合注意力将 1M token 的服务成本压到 Opus 4.8 的 1/20,对 Agent 开发者的性价比极具冲击力,但 thinking 不可关闭且本地部署仍有硬件门槛,需按实际场景评估。