GLM-5.3-Flash 架构拆解:KDA + 稀疏 MLA 双效混合注意力 · 干货攻略

  • 链接: https://x.com/rasbt/status/2092629415813365899
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-09-02

这是什么

2026 年 8 月 20 日,OpenRouter 上悄然出现一个匿名模型 Ox Alpha:无所属、无模型卡、免费使用、1M token 上下文、支持图文视频输入。六天后,它成了 OpenRouter 有史以来最热门的模型,吞吐量是第二名的 2.3 倍。8 月 26 日,Bloomberg 证实其真身——GLM-5.3-Flash,来自智谱 AI(Zhipu AI,国际品牌 Z.ai)。

这不是一次普通发布。GLM-5.3-Flash 是 GLM-5 系列中第一个原生多模态模型,320B 总参数 / 18B 激活参数,MIT 许可证权重开源,1M context,API 定价仅为 Claude Opus 4.8 的约 1/20。

@rasbt(Sebastian Raschka,AI 研究者、LLM Architecture Gallery 维护者)随后发布了一篇架构拆解笔记,将这个模型的设计称为 "super hybrid"(超级混合)——因为它同时融合了两个效率向的注意力机制,而非像 Kimi(KDA + 全注意力 MLA)或 DeepSeek V3.2(DSA + 全注意力 MLA)那样只搭配一个高效机制配一个全注意力。


为什么值得关注

这不只是"又一个大模型"

GLM-5.3-Flash 的核心价值在于架构效率:它是首个在 MoE 大模型中同时引入线性注意力(KDA)和稀疏注意力(MLA/DSA)的开源前沿模型。根据 Z.ai 官方数据,相比 GLM-5.3(对应全注意力 MLA),GLM-5.3-Flash 将注意力计算量压缩 3.01 倍,KV Cache 体积缩小 4.44 倍,同时保持了几乎同等的智能水平(Terminal-Bench 2.1: 84.3 vs Opus 4.8 的 85.0)。

这意味着在超长上下文(1M token)场景下,GLM-5.3-Flash 的服务成本远低于全注意力模型,同时智能差距几乎可忽略。对 Agent 开发者而言,这直接影响:更低的单步推理成本 + 更长的上下文记忆能力。

架构演进的关键节点

理解 GLM-5.3-Flash 的设计,需要放在整个 GLM 系列和行业 attention 演进的坐标系里:

模型 注意力机制 特点
GLM-4 系列 全注意力 MLA 标准配置
GLM-5.2 稀疏 MoE,744B-A40B 规模大,激活参数多
GLM-5.3 全注意力 + 更强 MoE 355B/32B 配置
GLM-5.3-Flash KDA + 稀疏 MLA/DSA 混合 320B/18B,效率优先

这次"降参数量、提效率"的思路与 Kimi(线性注意力降成本)和 DeepSeek(稀疏注意力降成本)走的是同一条路,但 GLM-5.3-Flash 是第一次将两条路合并


核验过程

官方来源(核心依据)

  1. Z.ai 官方文档(docs.z.ai/guides/vlm/glm-5.3-flash) - 确认:320B 总参 / 18B 激活,MIT 许可证,1M context - 确认:注意力计算压缩 3.01×,KV Cache 压缩 4.44× vs GLM-5.3 - 确认:sparse + linear 混合注意力架构,Z.ai 称为"首例开源前沿模型同时结合两种注意力" - 确认:mHC(Manifold-Constrained Hyper-Connections)残差路径 - 确认:Native Multimodal(视觉编码器集成在 coding loop 中) - 确认:API 定价 $0.15/$0.50 per M tokens(输入/输出),缓存输入 $0.03

  2. Z.ai HuggingFace 仓库(huggingface.co/zai-org/GLM-5.3-Flash) - 确认:预训练数据 30T multimodal tokens - 确认:支持 SGLang / vLLM / KTransformers / Unsloth / Transformers 本地部署 - 确认:benchmark 评测参数(Terminal-Bench 用 Claude Code 2.1.207,DeepSWE 用 mini-swe-agent) - 确认:benchmark 数值(见正文"为什么值得关注"和"上手步骤")

  3. Sebastian Raschka 博客(sebastianraschka.com/blog/2026/glm-5-3-flash-architecture-notes.html) - 这是本次干货的原帖,rasbt 独立从权重分析中推导出层数和 attention 模式 - rasbt 指出 KDA + MLA/DSA 双效混合为"super hybrid"命名来源

交叉验证

  1. MarkTechPost(marktechpost.com,2026-08-26 报道 Z.ai 官方发布) - 确认 benchmark 数值:Terminal-Bench 2.1: 84.3,DeepSWE v1.1: 63.4(GLM-5.2: 46.2),AutomationBench: 48.8(GLM-5.2: 26.2) - 确认 API 定价与官方一致

  2. Reddit r/LocalLLaMA Megathread(独立社区解析,基于权重分析) - 确认层数结构:45 层(前 3 层 dense MLP,后 42 层 MoE) - 确认 Hidden Layout:11 × (3 × (KDA Linear Attention → MoE) → 1 × (Sparse Attention → MoE)) + 1 trailing linear layer - 确认 KDA 层参数:64 heads,head dimension 128 - 确认 Sparse Attention 层参数:64 heads,QK/V head dim 256/256,Indexer 32 heads,top-2048 budget - 确认 MoE 参数:288 routed experts + 1 shared expert,激活 8 routed + 1 shared expert

⚠️ 需标注的未核验说法

  • rasbt 原帖称"GLM-5.2 为 744B-A40B MoE":此说法来自 rasbt 的权重分析,Z.ai 官方文档对比的是 GLM-5.3(355B/32B),而非 GLM-5.2。744B 具体指哪个版本或统计口径,官方文档未提及。本攻略不引用此 744B 数字,以官方数据为准。
  • "stealth week 全部在国产芯片上运行":据 Linas's Substack 报道,Z.ai 声称约 10 万块国产 AI 芯片。此数字未经独立核验,标注为"原帖主张,未核验"
  • "OpenRouter 6 天 23T tokens":同 Linas's Substack 来源,未经 OpenRouter 官方独立确认,标注为"原帖主张,未核验"

上手步骤

模型获取

API 方式(推荐,大多数场景)

# Z.ai API,模型代码
glm-5.3-flash

# 官方推荐参数(来自 Z.ai docs)
temperature: 1.0
top_p: 0.95
reasoning_effort: max  # 可选 low/high/max,默认 max

#thinking 参数(仅支持 enabled,不支持关闭)
thinking.type: enabled
thinking.clear_thinking: false  # chat 场景建议设为 true

# streaming(推荐同时开启)
stream: true
tool_stream: true

本地部署框架(按推荐度排序)

框架 适用场景 备注
SGLang 生产部署,H100/H200 Cookbook
vLLM 通用推理,Hopper+ v0.27.0+ 需要 FlashInfer 0.6.17+ 支持 NoPE sparse MLA
Unsloth 快速尝鲜,Mac/消费级 GPU Day 1 即支持 dynamic GGUF,Q4/K4 量化可跑在 128GB 机器
KTransformers 内存受限环境 教程
Transformers 调试/研究 文档

量化参考(来自 Unsloth / Reddit 社区) - 1-bit(Q4_K + 动态量化):约需 100 GB 内存 - 3-bit(Q3_K/XL):约需 128 GB 内存(Mac Studio M5 Ultra 可用)

Benchmark 对照表

Benchmark GLM-5.3-Flash GLM-5.2 Claude Opus 4.8 GPT-5.6 Terra
Terminal-Bench 2.1 84.3 85.0 87.4
DeepSWE v1.1 63.4 46.2
AutomationBench 48.8 26.2
Z.ai Code Bench v1.0 (max) 29.0 29.5
HLE w/ tools 55.3
OfficeQA Pro 62.4 (低于 Opus)

数据来源:Z.ai 官方 HuggingFace README,评测参数见 README Footnotes。Terminal-Bench 用 Claude Code 2.1.207 评测,DeepSWE 用 mini-swe-agent harness(6h timeout,400K context),均为官方复现配置。

核心架构参数一览

参数 数值
总参数量 320B
激活参数 18B
Hidden Dimension 4096
词汇表大小 154,880
总层数 45(前3 dense MLP + 后42 MoE)
KDA 层 ~34层(3:1 比例结构)
Sparse Attention 层 ~11层
MoE Experts 288 routed + 1 shared
激活 Experts 8 routed + 1 shared
Expert Intermediate Dim 2048
注意力计算压缩比 3.01× vs GLM-5.3
KV Cache 压缩比 4.44× vs GLM-5.3
Context Length 1M token
最大输出 128K token

层数分布细节来自社区对权重的独立解析(Reddit Megathread),与 rasbt 原帖 34 KDA / 11 Sparse 数据一致,但标注为非官方数据。


坑与适用边界

已知坑

  1. Thinking 模式不可关闭:GLM-5.3-Flash 的 thinking.type 只支持 enabled,无法像其他模型那样禁用 thinking 过程。对需要无思考过程快速回复的场景不友好。

  2. 本地部署硬件门槛仍高:FP8 权重约需 306 GiB(官方 SGLang/vLLM recipe),至少需要单卡 H100/H200 或等效显存。消费级即使 Q3_K 量化也需要 128GB 内存,门槛不低。

  3. 激活参数 18B ≠ 等效 18B 密集模型:MoE 的 8+1 expert 路由意味着每个 token 实际使用约 10B 参数计算(8/288 × 320B + 18B shared),但在复杂推理任务上 MoE 的 expert selection 可能不如等参数量密集模型稳定。

  4. Benchmark 分数与实际 Agent 体验可能有差距:Terminal-Bench 等 benchmark 反映的是特定任务子集,实际 coding agent 场景(多文件编辑、调试循环、长程规划)的表现需要自己测试。

  5. 国产芯片运营声明无法独立核验:Z.ai 声称 stealth week 完全使用国产 AI 芯片运营,无 NVIDIA 硬件参与,此说法目前无公开第三方验证。

适用边界

  • 适用:超长上下文任务(代码库理解、论文分析、完整项目开发)、成本敏感型 Agent 系统、需要本地部署且有硬件条件的团队
  • 不适用:需要无 thinking 快速回复的场景、无法满足硬件门槛的消费级部署、对"国产芯片"说法有合规审查需求的企业
  • 注意:benchmark 评测基于特定 harness 配置(Claude Code 2.1.207 评测 Terminal-Bench),实际效果因使用方式不同可能存在差异

一句话结论

GLM-5.3-Flash 的核心创新不是"更大",而是"更聪明地更高效"——KDA + 稀疏 MLA 双效混合注意力将 1M token 的服务成本压到 Opus 4.8 的 1/20,对 Agent 开发者的性价比极具冲击力,但 thinking 不可关闭且本地部署仍有硬件门槛,需按实际场景评估。