GLM-5.2 · 智谱开放权重 1M-context Agent 模型 · 批判性精读

角色:flyP · 批判性审稿 主题:开源长上下文 Agent / MoE / 1M-token 上下文 / MIT 权重 / 长周期 agentic engineering 核心信源(均不抓全文,按摘要+官方页+第三方基准) - Z.ai 官方 blog(GLM-5.2 长周期任务页):https://z.ai/blog/glm-5.2 - Z.ai 官方 blog(GLM-5 · Vibe Coding → Agentic Engineering):https://z.ai/blog/glm-5 - GitHub 仓库:https://github.com/zai-org/GLM-5(Apache-2.0 仓库 · 包含 GLM-5 / 5.1 / 5.2 README 与 bench 图) - HF 权重:https://huggingface.co/zai-org/GLM-5.2 - 第三方评估:VentureBeat https://venturebeat.com/technology/z-ais-open-weights-glm-5-2-beats-gpt-5-5-on-multiple-long-horizon-coding-benchmarks-for-1-6th-the-cost,Semgrep cyber-bench https://semgrep.dev/blog/2026/we-have-mythos-at-home-glm-52-beats-claude-in-our-cyber-benchmarks - arXiv 技术报告:https://arxiv.org/abs/2602.15763(本稿未抓全文 PDF) - Interconnects 评论:https://www.interconnects.ai/p/glm-52-is-the-step-change-for-open 本稿定位:仅做摘要 + 第三方对位 + 关键风险批判;不复制 Z.ai 原页 / 第三方长文 / 论文 PDF 生成时间:2026-07-14 15:50 Asia/Shanghai


1. 卡片(仅事实摘要,不补猜)

字段 内容 信源
名称 GLM-5.2 Z.ai blog / GitHub README
发布方 Z.ai(前 Zhipu AI / 智谱) Z.ai blog
发布日 2026-06-13(订阅者预览)→ 2026-06-16(开放权重 + 公开 benchmark scorecard) lushbinary 报道 + Z.ai blog
架构 Mixture-of-Experts,744B 总参 / 激活参数未官方点明 layer3labs / eigent.ai(媒体口径,未在官方 blog 自报)
上下文 1M token("solid 1M-token context",由 200K 扩到 1M) Z.ai blog 自报
输出上限 128K / 131K(不同评测设定不一致) Z.ai blog(FrontierSWE 128K) / lushbinary(131,072)
注意力加速 集成 IndexShare(arXiv 2603.12201)压低 DSA indexer 成本 Z.ai blog
推理模式 dual thinking-effort(轻量 / 长思考两档) lushbinary 报道
部署 vLLM v0.23.0+ 支持;Ascend NPU 阵营 vLLM-Ascend / xLLM / SGLang GitHub README
许可证 MIT(权重)+ Apache-2.0(仓库) Z.ai blog / HF 卡片 / GitHub README
价格 订阅 $12.60/月起 VentureBeat 报道
主要对位 vs GPT-5.5、Claude Opus 4.7/4.8、DeepSeek v4 Z.ai blog + VentureBeat

不补猜:未在官方 blog 公开的细节(激活参数量、训练 token 总量、scaling 曲线、训练数据组成、scaffolding)一律不补;待 arXiv 2602.15763 PDF 核验。


2. 核心贡献(官方自报,不补猜)

  1. 1M-token 稳定上下文 —— 从 GLM-5.1 的 200K 扩到 1M,配合 IndexShare 降低 attention 成本
  2. 长周期 agentic 能力跃迁 —— 在 FrontierSWE / PostTrainBench / SWE-Marathon 三个长周期 coding/agent 基准上,PostTrainBench 超过 Opus 4.7 与 GPT-5.5,仅次于 Opus 4.8
  3. 真正开放权重 + MIT 许可 —— HF 公开下载、自部署、微调,无附加限制
  4. 多档 reasoning effort —— 同一权重支持"快速"与"长思考"两档,调用侧可调
  5. 国产硬件适配 —— Ascend NPU 上 vLLM-Ascend / xLLM / SGLang 三栈可部署

3. 方法拆解(仅基于已公开命名 + 第三方报道;不补 backbone)

模块 公开信息 命名观察 待核验
架构 MoE,744B 总参 与 DeepSeek v3 / Qwen3-MoE 同一量级路线 激活参数量、专家数、共享专家结构——待 arXiv
长上下文 IndexShare(arXiv 2603.12201)压低 DSA indexer 成本 IndexShare 是 DeepSeek 在 2025-2026 推的稀疏 attention 索引方案,被 GLM 复用 真正是否做 needle / RULER / LongBench v2 全套——未见公开
Reasoning dual thinking-effort(推测与 Qwen3 / DeepSeek R1 同款的 budget control) 实现机制未在 blog 披露 是否基于 RL 后训练 / 蒸馏 / 模式路由——待 PDF
Agentic training Vending Bench 2 / PostTrainBench / SWE-Marathon / Terminal-Bench 2 都是"长周期工具使用+状态保持"型 benchmark 训练数据 / 工具环境 / RL recipe——待 PDF
部署 vLLM v0.23.0+(含 vllm-ascend) 与 OpenAI 兼容 API 是否出 GGUF / AWQ / FP8 量化版本——待查

不补出:训练 token 量 / 训练 GPU 数量 / 数据配比 / SFT 比例 / RL 算法(GRPO / PPO / DPO)等推测性细节。


4. 第三方对位(仅引用公开 benchmark 数字,不复制图)

基准 官方/第三方声明 备注
PostTrainBench GLM-5.2 超过 Opus 4.7 + GPT-5.5,仅次 Opus 4.8 Z.ai blog 自报(z.ai/blog/glm-5.2)
FrontierSWE 第三方 Proximal 在 1M context / max effort / 128K out 下跑 Z.ai blog 给出设定,数字未在搜索结果中明确披露
SWE-Marathon 第三方 Abundant AI 在 1M context / max effort / 128K out 下跑 同上
Vending Bench 2(GLM-5 上代) 余额 $4,442,逼近 Opus 4.5,开源第一 Z.ai blog / Andon Labs
Semgrep cyber-bench(第三方,标题党但与 Claude 比对 "Mythos at Home",GLM-5.2 击败 Claude semgrep.dev 博客(注意:是安全代码生成类专项基准,不是通用 coding)
Interconnects(Nathan Lambert) "阶跃式飞跃",定位为开源 Agent 阈值 主观评价,无新基准

不补猜:Z.ai 内部 swe-bench / Terminal-Bench 2 / Multi-SWE-bench 的具体数字一律不补;待官方 scorecard 全文核验。


5. 反方审稿(六条可证伪 + 待核验)

5.1 "1M 上下文"与"1M 上下文可用"是两件事

  • Z.ai blog 自称 "solid 1M-token context";但未公布 needle / RULER / LongBench v2 / OOLONG / 多跳问答等长上下文硬测结果
  • 可证伪判定:若 7-31 前 Z.ai 发布 1M context 的 needle acc + 多跳 QA 完整表 → 风险降;若仅有"我们能跑 1M KV cache" → 风险维持
  • 第三方 VentureBeat 也只引用了 Z.ai 自家基准,未独立验证长上下文质量

5.2 "长周期 Agent"的判定窗口偏窄

  • 官方主推的三个基准(FrontierSWE / PostTrainBench / SWE-Marathon)都由 Z.ai 选定的第三方跑出,且都围绕 SWE / 后训练场景
  • 缺:τ-bench(客服多轮)/ ToolBench / BFCL / WebArena / GAIA / OSWorld 这种"非 SWE 链路"上的横向
  • 可证伪判定:若仅在 SWE-family 强,则"开源 Agent 阶跃"是 场景特定结论而非 通用结论

5.3 "MIT 许可"vs"开放权重"的措辞博弈

  • 官方 blog 强调 MIT,但 GitHub 仓库许可证是 Apache-2.0
  • 权重 MIT 不等于代码 MIT:部署代码、训练框架、tokenizer 仓库的许可证要分别确认
  • 可证伪判定:HF 卡片的具体 license 字段 + tokenizer 仓库 LICENSE 需逐项确认;不得只信 blog 措辞

5.4 与 DeepSeek v4 / Qwen3-Max / Kimi K2 的对位缺失

  • Interconnects 文章把它定位为"开源 Agent 阶跃",但同期可比对手:
  • DeepSeek v4(VentureBeat 同源报道:1/6 Opus 4.7 成本、近 SOTA)
  • Qwen3-Max(阿里面向 agent 的强基线)
  • Kimi K2(Moonshot 长上下文 agent 先驱)
  • 官方 blog 没有在 PostTrainBench 上并排 DeepSeek v4 / Qwen3-Max / Kimi K2
  • 可证伪判定:若 7-31 前 Z.ai 补出与 DeepSeek v4 / Qwen3-Max / Kimi K2 的同表对比,则"阶跃"成立;否则仍是"在选定基准上的开源第一"

5.5 "1/6 成本"是按 token 单价,不是按有效产能

  • VentureBeat 标题用 "$1/6 the cost",但成本比较是按每百万 token 价
  • 长周期 agent 任务里,1M context 不一定全程灌满,平均实际 token 消耗要看任务
  • 可证伪判定:需独立基准(按"完成一个 SWE 任务的总价")才能下"成本优势"结论;目前标题党概率高

5.6 复现与本地化门槛

  • 744B MoE 全精度推理需要 ≥ 8× H100/H200(按 fp16 估)或 ≥ 4× B200;Ascend NPU 适配官方已确认,但 vLLM-Ascend / xLLM 实测性能未公开
  • 可证伪判定:若 8 月底出现社区 AWQ / FP8 / GGUF 量化版本(类似 DeepSeek v3.2 路径),可玩性提升;否则多数中小团队只能走 API

6. 与本知识库已有产出的对位

已精读条目 时间 关联点 差异
LingBot-Video 2026-07-13 国产 MoE 视频模型 视频生成 vs 文本 agent
Vidu S1 2026-07-13 国产视频交互 同上
Canvas360 2026-07-13 长上下文多模态 与 GLM-5.2 "1M context" 路线不同(多模态 vs 纯文本 coding)
Visual Thoughts (MCoT) 2026-07-11 MLLM 推理 GLM-5.2 是文本 reasoning effort,无视觉 CoT
STEP3-VL-10B 2026-07-11 紧凑 MLLM STEP3-VL 10B,GLM-5.2 744B,体量差两个数量级
TVI-CoT / PRCO 2026-06-28 CoT 推理批判 GLM-5.2 的 dual thinking-effort 走的是推理深度路由而非 CoT 显式结构化
DeepPlanning 2026-07-11 长周期规划 GLM-5.2 自报强在长周期 coding,DeepPlanning 是带约束的长周期规划算法

定位:GLM-5.2 在知识库中应作为"2026-06 国产开源长上下文 Agent 旗舰"的代表,与 DeepSeek v4 / Qwen3-Max / Kimi K2 共同构成"6-7 月开源 agent 四强"主题页。


7. 可信度评估

维度 评分 理由
学术/工业背书 ⭐⭐⭐⭐⭐ Z.ai 是国内一线 LLM 团队,arXiv 2602.15763 是真技术报告
公开度 ⭐⭐⭐⭐⭐ 权重 + 仓库 + 第三方基准均公开,MIT 许可
第三方独立验证 ⭐⭐⭐ Semgrep cyber-bench 一项独立;SWE / PostTrainBench 由 Z.ai 选定的第三方跑出
长上下文可用度 ⭐⭐ 官方未给 needle / RULER / LongBench v2 完整表
复现门槛 ⭐⭐ 744B MoE 全精度自部署成本高,依赖 vLLM-Ascend 等国产栈成熟度
综合 ⭐⭐⭐⭐(4/5) 强烈建议入库,但需配"待长上下文硬测核验"标签

8. 建议处理路径

  1. 入库类型:建议列入 notes/llm-systems/open-llm-flagships-2026.md 或新建 notes/llm-systems/glm-5.2.md,与 DeepSeek v4 / Qwen3-Max / Kimi K2 共建主题页
  2. 建议路径: - 单条精读:reviews/open-llm/glm-5.2.md - 主题聚合:notes/llm-systems/open-llm-flagships-2026-h2.md
  3. 精读触发条件(避免无依据大吹): - Z.ai 发布 1M context 完整 needle / RULER 表 - 或 与 DeepSeek v4 / Qwen3-Max / Kimi K2 在 PostTrainBench / SWE-bench / BFCL 上的同表对比 - 或 社区发布 AWQ / FP8 量化版本 + 复现数据
  4. 本稿状态已基于公开信息完成短审稿;待 arXiv 2602.15763 PDF 核验 §3-§5

9. 后续验证动作

  • [ ] 重抓 arXiv 2602.15763 PDF(模型规模、训练数据、scaling law、RL recipe)
  • [ ] 核对 HF 卡片 license 字段 + tokenizer 仓库 LICENSE
  • [ ] 关注社区是否发布 AWQ / FP8 量化版本
  • [ ] 关注是否在 LongBench v2 / RULER / OOLONG 公开补测
  • [ ] 与 DeepSeek v4 / Qwen3-Max / Kimi K2 共同建"开源 Agent 四强 2026-06"主题页

引用边界声明:本稿仅引用 Z.ai 官方 blog 的公开段落、GitHub README 元数据、arXiv abs 链接、第三方媒体(VentureBeat / Semgrep / Interconnects / lushbinary / eigent.ai / layer3labs / tosea.ai)的摘要性结论。不复制任何一篇长文 / PDF 全文 / benchmark 图。所有具体数字、参数、声明均按"信源可追溯"原则标注