GLM-5.2 · 智谱开放权重 1M-context Agent 模型 · 批判性精读
角色:flyP · 批判性审稿 主题:开源长上下文 Agent / MoE / 1M-token 上下文 / MIT 权重 / 长周期 agentic engineering 核心信源(均不抓全文,按摘要+官方页+第三方基准) - Z.ai 官方 blog(GLM-5.2 长周期任务页):https://z.ai/blog/glm-5.2 - Z.ai 官方 blog(GLM-5 · Vibe Coding → Agentic Engineering):https://z.ai/blog/glm-5 - GitHub 仓库:https://github.com/zai-org/GLM-5(Apache-2.0 仓库 · 包含 GLM-5 / 5.1 / 5.2 README 与 bench 图) - HF 权重:https://huggingface.co/zai-org/GLM-5.2 - 第三方评估:VentureBeat https://venturebeat.com/technology/z-ais-open-weights-glm-5-2-beats-gpt-5-5-on-multiple-long-horizon-coding-benchmarks-for-1-6th-the-cost,Semgrep cyber-bench https://semgrep.dev/blog/2026/we-have-mythos-at-home-glm-52-beats-claude-in-our-cyber-benchmarks - arXiv 技术报告:https://arxiv.org/abs/2602.15763(本稿未抓全文 PDF) - Interconnects 评论:https://www.interconnects.ai/p/glm-52-is-the-step-change-for-open 本稿定位:仅做摘要 + 第三方对位 + 关键风险批判;不复制 Z.ai 原页 / 第三方长文 / 论文 PDF 生成时间:2026-07-14 15:50 Asia/Shanghai
1. 卡片(仅事实摘要,不补猜)
| 字段 | 内容 | 信源 |
|---|---|---|
| 名称 | GLM-5.2 | Z.ai blog / GitHub README |
| 发布方 | Z.ai(前 Zhipu AI / 智谱) | Z.ai blog |
| 发布日 | 2026-06-13(订阅者预览)→ 2026-06-16(开放权重 + 公开 benchmark scorecard) | lushbinary 报道 + Z.ai blog |
| 架构 | Mixture-of-Experts,744B 总参 / 激活参数未官方点明 | layer3labs / eigent.ai(媒体口径,未在官方 blog 自报) |
| 上下文 | 1M token("solid 1M-token context",由 200K 扩到 1M) | Z.ai blog 自报 |
| 输出上限 | 128K / 131K(不同评测设定不一致) | Z.ai blog(FrontierSWE 128K) / lushbinary(131,072) |
| 注意力加速 | 集成 IndexShare(arXiv 2603.12201)压低 DSA indexer 成本 | Z.ai blog |
| 推理模式 | dual thinking-effort(轻量 / 长思考两档) | lushbinary 报道 |
| 部署 | vLLM v0.23.0+ 支持;Ascend NPU 阵营 vLLM-Ascend / xLLM / SGLang | GitHub README |
| 许可证 | MIT(权重)+ Apache-2.0(仓库) | Z.ai blog / HF 卡片 / GitHub README |
| 价格 | 订阅 $12.60/月起 | VentureBeat 报道 |
| 主要对位 | vs GPT-5.5、Claude Opus 4.7/4.8、DeepSeek v4 | Z.ai blog + VentureBeat |
不补猜:未在官方 blog 公开的细节(激活参数量、训练 token 总量、scaling 曲线、训练数据组成、scaffolding)一律不补;待 arXiv 2602.15763 PDF 核验。
2. 核心贡献(官方自报,不补猜)
- 1M-token 稳定上下文 —— 从 GLM-5.1 的 200K 扩到 1M,配合 IndexShare 降低 attention 成本
- 长周期 agentic 能力跃迁 —— 在 FrontierSWE / PostTrainBench / SWE-Marathon 三个长周期 coding/agent 基准上,PostTrainBench 超过 Opus 4.7 与 GPT-5.5,仅次于 Opus 4.8
- 真正开放权重 + MIT 许可 —— HF 公开下载、自部署、微调,无附加限制
- 多档 reasoning effort —— 同一权重支持"快速"与"长思考"两档,调用侧可调
- 国产硬件适配 —— Ascend NPU 上 vLLM-Ascend / xLLM / SGLang 三栈可部署
3. 方法拆解(仅基于已公开命名 + 第三方报道;不补 backbone)
| 模块 | 公开信息 | 命名观察 | 待核验 |
|---|---|---|---|
| 架构 | MoE,744B 总参 | 与 DeepSeek v3 / Qwen3-MoE 同一量级路线 | 激活参数量、专家数、共享专家结构——待 arXiv |
| 长上下文 | IndexShare(arXiv 2603.12201)压低 DSA indexer 成本 | IndexShare 是 DeepSeek 在 2025-2026 推的稀疏 attention 索引方案,被 GLM 复用 | 真正是否做 needle / RULER / LongBench v2 全套——未见公开 |
| Reasoning | dual thinking-effort(推测与 Qwen3 / DeepSeek R1 同款的 budget control) | 实现机制未在 blog 披露 | 是否基于 RL 后训练 / 蒸馏 / 模式路由——待 PDF |
| Agentic training | Vending Bench 2 / PostTrainBench / SWE-Marathon / Terminal-Bench 2 | 都是"长周期工具使用+状态保持"型 benchmark | 训练数据 / 工具环境 / RL recipe——待 PDF |
| 部署 | vLLM v0.23.0+(含 vllm-ascend) | 与 OpenAI 兼容 API | 是否出 GGUF / AWQ / FP8 量化版本——待查 |
不补出:训练 token 量 / 训练 GPU 数量 / 数据配比 / SFT 比例 / RL 算法(GRPO / PPO / DPO)等推测性细节。
4. 第三方对位(仅引用公开 benchmark 数字,不复制图)
| 基准 | 官方/第三方声明 | 备注 |
|---|---|---|
| PostTrainBench | GLM-5.2 超过 Opus 4.7 + GPT-5.5,仅次 Opus 4.8 | Z.ai blog 自报(z.ai/blog/glm-5.2) |
| FrontierSWE | 第三方 Proximal 在 1M context / max effort / 128K out 下跑 | Z.ai blog 给出设定,数字未在搜索结果中明确披露 |
| SWE-Marathon | 第三方 Abundant AI 在 1M context / max effort / 128K out 下跑 | 同上 |
| Vending Bench 2(GLM-5 上代) | 余额 $4,442,逼近 Opus 4.5,开源第一 | Z.ai blog / Andon Labs |
| Semgrep cyber-bench(第三方,标题党但与 Claude 比对) | "Mythos at Home",GLM-5.2 击败 Claude | semgrep.dev 博客(注意:是安全代码生成类专项基准,不是通用 coding) |
| Interconnects(Nathan Lambert) | "阶跃式飞跃",定位为开源 Agent 阈值 | 主观评价,无新基准 |
不补猜:Z.ai 内部 swe-bench / Terminal-Bench 2 / Multi-SWE-bench 的具体数字一律不补;待官方 scorecard 全文核验。
5. 反方审稿(六条可证伪 + 待核验)
5.1 "1M 上下文"与"1M 上下文可用"是两件事
- Z.ai blog 自称 "solid 1M-token context";但未公布 needle / RULER / LongBench v2 / OOLONG / 多跳问答等长上下文硬测结果
- 可证伪判定:若 7-31 前 Z.ai 发布 1M context 的 needle acc + 多跳 QA 完整表 → 风险降;若仅有"我们能跑 1M KV cache" → 风险维持
- 第三方 VentureBeat 也只引用了 Z.ai 自家基准,未独立验证长上下文质量
5.2 "长周期 Agent"的判定窗口偏窄
- 官方主推的三个基准(FrontierSWE / PostTrainBench / SWE-Marathon)都由 Z.ai 选定的第三方跑出,且都围绕 SWE / 后训练场景
- 缺:τ-bench(客服多轮)/ ToolBench / BFCL / WebArena / GAIA / OSWorld 这种"非 SWE 链路"上的横向
- 可证伪判定:若仅在 SWE-family 强,则"开源 Agent 阶跃"是 场景特定结论而非 通用结论
5.3 "MIT 许可"vs"开放权重"的措辞博弈
- 官方 blog 强调 MIT,但 GitHub 仓库许可证是 Apache-2.0
- 权重 MIT 不等于代码 MIT:部署代码、训练框架、tokenizer 仓库的许可证要分别确认
- 可证伪判定:HF 卡片的具体 license 字段 + tokenizer 仓库 LICENSE 需逐项确认;不得只信 blog 措辞
5.4 与 DeepSeek v4 / Qwen3-Max / Kimi K2 的对位缺失
- Interconnects 文章把它定位为"开源 Agent 阶跃",但同期可比对手:
- DeepSeek v4(VentureBeat 同源报道:1/6 Opus 4.7 成本、近 SOTA)
- Qwen3-Max(阿里面向 agent 的强基线)
- Kimi K2(Moonshot 长上下文 agent 先驱)
- 官方 blog 没有在 PostTrainBench 上并排 DeepSeek v4 / Qwen3-Max / Kimi K2
- 可证伪判定:若 7-31 前 Z.ai 补出与 DeepSeek v4 / Qwen3-Max / Kimi K2 的同表对比,则"阶跃"成立;否则仍是"在选定基准上的开源第一"
5.5 "1/6 成本"是按 token 单价,不是按有效产能
- VentureBeat 标题用 "$1/6 the cost",但成本比较是按每百万 token 价算
- 长周期 agent 任务里,1M context 不一定全程灌满,平均实际 token 消耗要看任务
- 可证伪判定:需独立基准(按"完成一个 SWE 任务的总价")才能下"成本优势"结论;目前标题党概率高
5.6 复现与本地化门槛
- 744B MoE 全精度推理需要 ≥ 8× H100/H200(按 fp16 估)或 ≥ 4× B200;Ascend NPU 适配官方已确认,但 vLLM-Ascend / xLLM 实测性能未公开
- 可证伪判定:若 8 月底出现社区 AWQ / FP8 / GGUF 量化版本(类似 DeepSeek v3.2 路径),可玩性提升;否则多数中小团队只能走 API
6. 与本知识库已有产出的对位
| 已精读条目 | 时间 | 关联点 | 差异 |
|---|---|---|---|
| LingBot-Video | 2026-07-13 | 国产 MoE 视频模型 | 视频生成 vs 文本 agent |
| Vidu S1 | 2026-07-13 | 国产视频交互 | 同上 |
| Canvas360 | 2026-07-13 | 长上下文多模态 | 与 GLM-5.2 "1M context" 路线不同(多模态 vs 纯文本 coding) |
| Visual Thoughts (MCoT) | 2026-07-11 | MLLM 推理 | GLM-5.2 是文本 reasoning effort,无视觉 CoT |
| STEP3-VL-10B | 2026-07-11 | 紧凑 MLLM | STEP3-VL 10B,GLM-5.2 744B,体量差两个数量级 |
| TVI-CoT / PRCO | 2026-06-28 | CoT 推理批判 | GLM-5.2 的 dual thinking-effort 走的是推理深度路由而非 CoT 显式结构化 |
| DeepPlanning | 2026-07-11 | 长周期规划 | GLM-5.2 自报强在长周期 coding,DeepPlanning 是带约束的长周期规划算法 |
定位:GLM-5.2 在知识库中应作为"2026-06 国产开源长上下文 Agent 旗舰"的代表,与 DeepSeek v4 / Qwen3-Max / Kimi K2 共同构成"6-7 月开源 agent 四强"主题页。
7. 可信度评估
| 维度 | 评分 | 理由 |
|---|---|---|
| 学术/工业背书 | ⭐⭐⭐⭐⭐ | Z.ai 是国内一线 LLM 团队,arXiv 2602.15763 是真技术报告 |
| 公开度 | ⭐⭐⭐⭐⭐ | 权重 + 仓库 + 第三方基准均公开,MIT 许可 |
| 第三方独立验证 | ⭐⭐⭐ | Semgrep cyber-bench 一项独立;SWE / PostTrainBench 由 Z.ai 选定的第三方跑出 |
| 长上下文可用度 | ⭐⭐ | 官方未给 needle / RULER / LongBench v2 完整表 |
| 复现门槛 | ⭐⭐ | 744B MoE 全精度自部署成本高,依赖 vLLM-Ascend 等国产栈成熟度 |
| 综合 | ⭐⭐⭐⭐(4/5) | 强烈建议入库,但需配"待长上下文硬测核验"标签 |
8. 建议处理路径
- 入库类型:建议列入
notes/llm-systems/open-llm-flagships-2026.md或新建notes/llm-systems/glm-5.2.md,与 DeepSeek v4 / Qwen3-Max / Kimi K2 共建主题页 - 建议路径:
- 单条精读:
reviews/open-llm/glm-5.2.md- 主题聚合:notes/llm-systems/open-llm-flagships-2026-h2.md - 精读触发条件(避免无依据大吹): - Z.ai 发布 1M context 完整 needle / RULER 表 - 或 与 DeepSeek v4 / Qwen3-Max / Kimi K2 在 PostTrainBench / SWE-bench / BFCL 上的同表对比 - 或 社区发布 AWQ / FP8 量化版本 + 复现数据
- 本稿状态:已基于公开信息完成短审稿;待 arXiv 2602.15763 PDF 核验 §3-§5
9. 后续验证动作
- [ ] 重抓 arXiv 2602.15763 PDF(模型规模、训练数据、scaling law、RL recipe)
- [ ] 核对 HF 卡片 license 字段 + tokenizer 仓库 LICENSE
- [ ] 关注社区是否发布 AWQ / FP8 量化版本
- [ ] 关注是否在 LongBench v2 / RULER / OOLONG 公开补测
- [ ] 与 DeepSeek v4 / Qwen3-Max / Kimi K2 共同建"开源 Agent 四强 2026-06"主题页
引用边界声明:本稿仅引用 Z.ai 官方 blog 的公开段落、GitHub README 元数据、arXiv abs 链接、第三方媒体(VentureBeat / Semgrep / Interconnects / lushbinary / eigent.ai / layer3labs / tosea.ai)的摘要性结论。不复制任何一篇长文 / PDF 全文 / benchmark 图。所有具体数字、参数、声明均按"信源可追溯"原则标注。