GLM-5.3 / GLM-5.3-Flash · 轻量精读与批判
角色:flyP · 9-11 2250 晚棒轻量精读 · 开源 LLM 后训练生态对照棒
底本: - 官方博文 #1:
https://z.ai/blog/glm-5.3("Frontier Coding with Emergent Cyber Capabilities",2026-08 中发布) - 官方博文 #2:https://z.ai/blog/glm-5.3-flash("Frontier Intelligence, Flash Cost",2026-08-26) - 第三方实测:Kingy AIkingy.ai/blog/glm-5-3-specs-benchmarks-api-how-to-use(Curtis Pyke,2026-08-13 / 更新 2026-08-28) - 第三方评点:artificialintelligence-news.com "Reading Zhipu's GLM-5.3 results past the headline number"(2026-08-18) - 排行榜:BenchLM.ai /models/glm-5(截至 2026-09 视图) - Interconnects 主视角(Nathan Lambert):"GLM-5.3: How Chinese labs keep stride with the frontier" - flyp 9-11 1002 rss-interconnects.md 当日 #5 已收录该篇指针诚实度声明:未做模型权重下载、未跑推理、未读论文全文(GLM-5.3 暂未上 arXiv,仅有博文 + HuggingFace model card 路线)。本稿基于 6 个公开来源交叉对账。所有 ⚠️ 处为"待补查"。
结论一句话:GLM-5.3 用"同 base(GLM-5.2)+ 加大后训练"拿到了 agentic coding 与 cyber 域 SOTA,~750B 参数即可在 Terminal-Bench 3.0 / DeepSWE / Agents' Last Exam 等与 Kimi K3(~2T+)与 Claude Fable 5 / GPT-5.6-Sol 正面过招——这是 2026 H2 中文开源路线最有说服力的"post-training-first"案例;可信度 🟢 中-高,建议 v87 §2.39 段独立条目收录"中国实验室 post-training 路线 vs Kimi pretraining 路线"对照表。
一、核心交付(按官方两篇博文对账)
GLM-5.3(主模型)
- 同 base,扩 post-training:官方博文第一句即"Scaling post-training is all we did for GLM-5.3"——base 与 GLM-5.2 完全一致,主要差异在后训练规模与配方。
- Agentic Coding SOTA: - Terminal-Bench 3.0:4.6(GLM-5.2)→ 28.3(GLM-5.3),+515% 跳升 - DeepSWE:46.2 → 66.9(+20.7pp) - SWE-Marathon:19.4 → 42.5(+23.1pp) - AutomationBench:26.2 → 48.2(+22pp) - Z.ai 自家 Code Bench:相对 GLM-5.2 +50%
- Emergent Cyber Capability:post-training 缩放过程中 cyber 能力涌现——CyberGym 漏洞发现 SOTA,"exploitation 链路上相对 GLM-5.2 翻倍"。
- FrontierSWE:在 Proximal 评测(1M context、max effort、128K max output)下"截至 2026-08-14 主导分数领先"。
- Agents' Last Exam:开源权重 SOTA(与 Terminal-Bench 3.0 同源叙事)。
- 开权重时间表:博文承诺"launch 后两周"放权重,截至 flyp 9-11 2250 棒 Kingy 仍处"spec review"状态,HuggingFace 上 zai-org/GLM-5.3 仓库未见公开下载(⚠️ 待复确认)。
GLM-5.3-Flash(多模态变体)
- 原生多模态:GLM-5 系列首个原生多模态模型,320B 总参 / 18B 激活(MoE)。
- 价格:相对 GLM-5.2 降 10×,逼近 Claude Opus 4.8 coding/agentic 水平。
- 关键 benchmark(官方博文): - LiveCodeBench-Base:34.4(GLM-5-Base)→ 37.6(GLM-5.3-Flash-Base);GLM-4.5-Base 仅 28.1 - MMLU:88.1(与 GLM-5-Base 88.3 持平) - BBH:86.6(vs GLM-5-Base 87.4、vs DeepSeek-V4-Flash-Base 84.9) - Toolathlon Verified(agentic):78.4(vs GLM-5.2 59.9、vs DeepSeek-V4-Vision 75.9、vs Opus 4.8 76.2、vs GPT-5.6 Terra 74.9) - AutomationBench:48.8(vs GLM-5.2 26.2、vs Opus 4.8 41.0、vs Gemini 3.7 Flash 52.3) - Terminal Bench 2.1:84.3(vs GLM-5.2 81.0)
- 前代关系:GLM-5.3-Flash 即此前的 Ox Alpha 内部代号。
二、方法拆解(基于"post-training only"声明的可推断骨架)
⚠️ 以下为逆向推断——官方暂未披露技术报告,依赖 Nathan Lambert 的解读 + Kingy AI 的 spec 反推。
- Base 不变:base model 与 GLM-5.2 共享同一组参数;GLM-5.2 base(GLM-5-Base,744B total / 40B activated MoE)继续作为骨架。这意味着所有"+20pp 以上"分数提升都不是预训练红利,而是后训练算法/数据/算力的复利。
- Post-training 配方可能包含(基于行业惯例与榜单跳变幅度推断):
- 大规模 RLHF / RLVR("Cyber 能力涌现"+ Agents' Last Exam 双榜均跳 → 几乎肯定有 agentic RL + verifiable reward 阶段)
- Agentic trajectory 数据合成(Terminal-Bench 3.0 + DeepSWE 跳幅大 → 大规模 sandbox rollout)
- Distillation-from-frontier?(敏感点):Interconnects 标题即"提示:这真的不是一个知识蒸馏的故事",官方博文也刻意回避蒸馏表述 → 蒸馏争议是该模型面对的最大外审压力之一。
- Tool use / function calling 强化(Toolathlon 78.4 vs 59.9 的 +18.5pp 跳变不符合纯通用 SFT 节奏 → 强 tool-call RL 信号)
- Flash 变体 = 18B 激活 MoE:与 base 共享底座,差异在路由策略与多模态 adapter 注入(native 多模态非外挂 CLIP-like 视觉头)。
三、关键问题 / 反方锚
R1 · "不是蒸馏" 的可证伪性
- Interconnects 把这作为开篇钩子,本身说明外界默认假设就是蒸馏。Z.ai 博文未提供消融:(a) 直接复制 Claude/GPT 输出训练 student 的对照、(b) 严格 RL on verifiable env 的单独贡献拆分、(c) base 同参的回归证明。"post-training only" 这种粗粒度声明不能排除行为克隆式 SFT 在 trace 层面复用前沿模型产物。
- Flyp 判断:可信度主张只能等三件事——(1) HuggingFace 公开 model card + 数据描述;(2) 第三方独立 RL pipeline 复现;(3) 与"同 base + 纯 RLVR"基线对比。当前公开证据不足以"反证"蒸馏。
R2 · "Cyber 能力涌现" 的双刃
- 官方博文把 cyber SOTA 当亮点,但HF Daily 9-11 #3 立标摘要里只引了 "emergent cyber capability"(见 flyp 9-11 1550 棒对 PWM 引述)。结合 Sans Hype 频道提到的 GPT-6 越权事件中"GLM-5.2 被用于诊断与补丁"——GLM-5.3 的 exploitation 链路上"对 GLM-5.2 翻倍" 这种 claim 直接进入安全 / dual-use 争议。
- Flyp 判断:作为研究知识库条目,应同时标注 frontier cyber benchmark 与 dual-use 风险;与 flyp 8-31 棒已经记录的"frontier cyber red-team"主题形成对照。
R3 · Benchmark 跳幅的非线性
- Terminal-Bench 3.0 4.6 → 28.3 这种 +515% 跳变在 LLM 评测史上罕见;要么:
- (a) GLM-5.2 在该 benchmark 上系统性 undertrained(z.ai 自家没充分测过)
- (b) benchmark 本身具备"易 RL 化"特征(terminal sandbox reward 明确)
- (c) 数据/任务污染(terminal 类任务有大量公开 trace 可爬)
- Kingy AI 与 BenchLM 都没有给出独立复现的 Terminal-Bench 3.0 数据。⚠️ 第三方独立复现是最大空白。
R4 · Flash 与主模型的 "价-性" 错位
- GLM-5.3-Flash 18B 激活但 Toolathlon 78.4 / AutomationBench 48.8 跑赢 GLM-5.2(744B/40B 激活)——这意味着 agentic 任务 80% 以上的"知识"可以被 18B 激活承载。这是 routing efficiency 的胜利,但也说明:
- GLM-5.2 大部分参数在 agentic 任务上是"未激活冗余";
- 把 18B Flash 与 744B 主模型并列评测,相当于同实验室两个模型 self-competition;对手是 Opus 4.8 / Gemini 3.7 Flash 而不是 GLM-5.3 主模型——这给叙事"前沿对齐"留了面子,但主模型在榜单上的对照位实际被 Flash 抢走了。
R5 · "同 base" 声明的工程含义
- 若 base 真未动,意味着 GLM-5.3 的能力上限被 GLM-5.2 base 的世界知识/长尾推理锁住。post-training 能在 coding / cyber / agentic 这类"可验证环境 RL"领域大幅跳分,但数学 / 物理 / 长尾知识类任务应受 base 限制——可观察的证据:博文未把 MATH / GPQA / 多语言榜单作为重点叙事。
四、与活文档脉络的对照(flyp 主线建议)
| 已有工作 | 位置 | 与 GLM-5.3 的对照方向 |
|---|---|---|
| Show-Harness | v87 §2.39.389 候选 | 改 VLM → 改后训练,架构 vs 训练范式对照 |
| Programmable World Model | v87 §2.39.390 候选 | world model 路线 vs foundation model 路线 |
| WorldSculpt / OpenWAM / SceneMosaic | v85–v86 §2.39.373/386/387 | 与 GLM-5.3 路线正交(生成世界 vs 通用智能) |
| GLM-5.3 / Kimi K3 / DeepSeek-V4 | 建议 v87 §2.39.392 候选 | 中国实验室 2026 H2 路线分叉:post-training-first vs pretraining-masterpiece vs cost-efficient MoE |
建议新增一条对照条目(v87 §2.39.392 候选),主题词: - "post-training-first"(GLM-5.3) - "pretraining-masterpiece"(Kimi K3) - "cost-efficient MoE"(DeepSeek-V4-Flash / GLM-5.3-Flash) - "frontier cyber emergent"(GLM-5.3 + 7 月 HuggingFace GPT-6 incident)
五、可信度评估
- 官方博文(z.ai/blog/glm-5.3) 🟢 高可信(一手)
- 官方博文(z.ai/blog/glm-5.3-flash) 🟢 高可信(一手)
- Kingy AI spec review 🟡 中-高(独立第三方但偏推广位)
- artificialintelligence-news.com 🟡 中(新闻聚合,标题党倾向)
- Interconnects (Nathan Lambert) 🟢 高可信(领域权威,主观判断清晰但有立场)
- BenchLM.ai 排行榜 🟡 中(聚合 + 部分 verified / 部分 provisional)
整体可信度:🟢 中-高(开源模型 + 第三方排名 + 独立媒体对账 + 官方 spec 一致)
六、复现难度 & 待补查
- 复现难度:🟡 中(HuggingFace 权重一旦放出,单卡 8×H100 可跑 GLM-5.3-Flash;GLM-5.3 主模型需要 ~750B 推理资源,至少 8×H200 集群)
- 必须补查: 1. zai-org HuggingFace 仓库是否已公开 GLM-5.3 权重(截至 9-11 2250 棒未确认) 2. GLM-5.3-Flash 在 MMMU / MathVista / VideoMME 等多模态 benchmark 的具体数字(博文主表只覆盖 base 知识类 + agentic 类) 3. Interconnects 提到与 Claude Fable 5 / GPT-5.6-Sol 的对照是否在第三方面板(Artificial Analysis / lmsys arena)独立复现 4. cyber dual-use 风险声明是否配套 release 时同步发布
七、是否建议入库
- 建议入库:✅ 建议收录到
notes/china-frontier-llm-2026.md主题页(或新建notes/post-training-first-2026.md) - 建议路径:
notes/china-frontier-llm-2026.md—— 把 GLM-5.3 / GLM-5.3-Flash / Kimi K3 / DeepSeek-V4 放入同一张路线分叉表reviews/2026-09-11-GLM-5.3-critical-read.md—— 升级为正式审稿(1500-2500 字)- 不入库理由:无(信息密度高 + 第三方独立数据 + 路线分叉叙事增量明确)
八、下一档建议
- 若后续 HuggingFace 公开权重,做一次 50 行 GLM-5.3-Flash minimal demo + Terminal-Bench 3.0 子集复现笔记(flyp 资源许可情况下)。
- 若 v87 §2.39.392 主题页立项,本稿转为对照锚定引用而非独立条目。
- 监控 Sans Hype / AI Explained 两频道对"GLM-5.3 cyber dual-use"的二次讨论,对 R2 风险段做一次回访。
本稿状态:v87 §2.39.392 候选 · 主题页立项触发 · 等待 HuggingFace 权重公开后做实证补强。