2026-08-20 flyP 轻量精读 · StateM(Harness Scaling)与 Substack 线索·GLM-5.3

角色:flyP。本轮按"轻量精读 + 最多 1 条 Substack"约束,做 1 篇论文批判性精读 + 1 条 Substack 线索记录。 主题互补:上午 09:50 精读已覆盖 XSkill(in-context 双流经验池)+ AXPO(GRPO prefix-fixing);本轮切到 StateM(不改权重的 harness 侧改进),三者构成"agent 训练/执行系统"完整图谱。 Substack 仅 1 条:Interconnects(Nathan Lambert)"GLM-5.3: How Chinese Labs Keep Stride",与 StateM 互补(一边是 harness 侧提性能,一边是 post-training 侧提性能)。 不写 GitHub,不动 published/review 目录;只产出 inbox 草稿。


精读 · StateM(arXiv:2608.15089, 2026-08-15 v1)

一句话

"Harness scaling"取代"model scaling"作为长程 agent 的瓶颈转移路径:通过 stateful runtime + 持久化 runbook + checked transitions,把"死掉的 postmortem 经验"转成"可执行的 stateful preconditions",在不动模型权重的前提下把 GPT-5.5 xhigh 在 Terminal-Bench 2.1 从 83.1% 拉到 92.1%,把低成本模型(DeepSeek-V4 Flash / GPT-5.6 Luna)拉到与 GPT-5.6 Sol 同一档。

方法拆解(基于摘要 + 元数据)

  • 核心论点:长程 agent 失败往往不是底层模型不会做,而是"执行系统"丢状态、不复用早期经验、漏流程、过早停止——所以不解决"模型"而解决"执行上下文"。
  • StateM 运行时五件套: 1. Durable states:跨 step 持久化的 agent 状态 2. Phase-local context:每个阶段独立的局部上下文 3. Checked transitions:进入下一阶段的检查式转移 4. Recoverable runbooks:可恢复的执行剧本 5. Versioned procedural practices:可与人类共同检视的版本化流程
  • Terminal-Bench 2.1 主结果
  • GPT-5.5 xhigh:83.1% → 92.1%(超 GPT-5.6 Sol Ultra 91.9%)
  • runbook 直接迁移到 GPT-5.6,445 trials 取得 95.3% raw accuracy,89 任务 100% 至少一次通过
  • 同 runbook 冻结迁移到 GPT-5.6 Luna:76.7% → 85.4%(超 Sol xhigh 84.9% 参考)
  • 低成本模型迁移(同 runtime + 同 runbook + golden rules)
  • DeepSeek-V4 Flash:82.7% → 88.1%(标准超时)/ 89.1%(88-task common core)
  • 仅 <$38 适配成本可把剩余延迟敏感任务追平 GPT-5.6 Sol max 88.8%
  • 单次 API 成本约 $15 vs GPT 参考 $574.68,总 DeepSeek 支出 $52.22
  • BusinessBench 域泛化:基于开发集的 family-specific runbooks 在 holdout 上 macro +0.55 / micro +1.34;两族机制匹配的工作流 +10.04
  • 代码:http://github.com/henryqin1997/statem
  • 元信息:v1 2026-08-15,作者 Ziheng Qin,分类 cs.AI,标签 "Harness Scaling, Semi-Self-Evolving Agent"

贡献判断

  • 新颖性(高):把"harness scaling"显式立为与 model scaling 并列的 scaling 轴,是清晰的概念级贡献。比起 XSkill 的"经验/技能双流"是工程式演进,StateM 给出更上位的范式命名。
  • 完整性(高):5 维运行时设计 + Terminal-Bench 2.1 多模型迁移 + BusinessBench 域泛化 + 成本数据,论据维度覆盖"性能 / 通用性 / 经济性"。
  • 可复现性(中高):代码已挂 GitHub(henryqin1997/statem),GPT/DeepSeek 公开 API,runbook 结构在论文中明示;Terminal-Bench 是公开基准。但 runbook 是否完全随代码 release、或仍需 prompt 工程,是关键待核。
  • 重要性信号:24h 内立标信号 130▲→374▲(v33 以来 multimodal 主分类立标信号绝对新高实测 #1);flyp multimodal-e1prep v53 §3.2 标记为"评测方法学延革第 10 例反方立基础候选"。

主要问题与风险

  • "Harness scaling" vs "Model scaling" 边界模糊:StateM 的 runbook 实际是 prompt + 执行脚本,与 model prompt engineering、与 in-context memory(XSkill)有大量重叠;论文需要清晰区分"工程改进"与"新 scaling 轴"的范畴。
  • Terminal-Bench 偏置:TB 2.1 主基准偏 coding/CLI 长任务,跨域泛化(BusinessBench)只在 0.55 macro 上显著;runbook 的迁移性是否在 web agent / GUI / research agent 上仍成立,论文未给。
  • 成本数据的可比性:$15 vs $574.68 是 API 直采成本,不含 runbook 维护、postmortem 标注、prompt 调试的人工成本;和"低成本模型"对比时易被夸大。
  • "Semi-Self-Evolving"声明:摘要自称 semi-self-evolving 但 runbook 演化是否自动化、人在环程度如何、版本化如何避免漂移,需要正文核验。
  • 学术位置:arXiv-only(2026-08-15),尚未看到顶会接收信号;与同期 HarnessEval-W(arXiv:2608.16859,flyp multimodal-e1prep v52 关注)形成"harness 评测"互补,可能在后续 harness workshop 汇合。

可信度

中高。立标信号强、代码已挂、Terminal-Bench 公开;但"harness scaling"作为新概念的边界、与 prompt engineering / XSkill / Agent Lightning v1.0 的差异化定位,需要在 PDF 正文与对比实验中确认。

是否建议入库

强烈建议。归类 notes/agents/harness-and-runtime,建议路径: - notes/agents/harness-and-runtime/statem-harness-scaling.md - 与既有 XSkill(in-context 经验池)/ AXPO(RL prefix-fixing)/ Agent Lightning v1.0(harness-native RL)形成"四象限"对照: - XSkill:不动权重 + in-context 累积 - StateM:不动权重 + runtime/harness 改造 - AXPO:动权重 + RL 训练侧纠偏 - Agent Lightning v1.0:动权重 + harness 接口 - 同步新建 notes/agents/harness-and-runtime/index.md 收纳 harness 侧四象限

后续验证动作

  1. 读 PDF 核验 runbook 是否随代码 release、versioning 机制、postmortem → stateful precondition 的具体 schema。
  2. 与 HarnessEval-W(arXiv:2608.16859)做交叉 read:评测 harness vs 改造 harness 的方法学差异。
  3. 跟踪 henryqin1997/statem 仓库的 star/commit 节奏与社区复现情况。
  4. 与 XSkill 联合做对比实验视角分析:相同任务下 StateM harness 收益 vs XSkill in-context 经验收益的边界。

Substack 线索 · GLM-5.3(Interconnects · Nathan Lambert)

  • 来源:https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride
  • 作者/专栏:Nathan Lambert · Interconnects(高水平 RLHF / post-training 专栏)
  • 发布时间:2026-08-20 前后(与今日 rss 速记同批)
  • 核心观点
  • Z.ai 发布 GLM-5.3,仅先在 coding plan 提供,2 周内上 Hugging Face 开权重
  • "Scaling post-training is all we did for GLM-5.3"(Z.ai 自述)
  • 与 GLM-5.2 同 base,仅大幅扩展 post-training;多基准上超过 Kimi K3,部分超过 Claude Fable 5 / GPT-5.6-Sol
  • 约 750B 参数,约 Kimi K3 的 1/3,接近 agentic coding 前沿
  • Lambert 解读:Z.ai 在 post-training 侧强于 Kimi(Kimi 更偏 pretraining 大作)
  • 可信度判断。Lambert 是 post-training 方向公认高信号作者;Z.ai 官方 blog 已发;2 周内会有 HF 开权重可以做独立核验。
  • 是否需要进一步核验:是。建议补查 Z.ai 官方 blog(https://z.ai/blog/glm-5.3)+ 等待 HF 开权重 release + 独立跑 SWE-bench / Terminal-Bench 等公开基准。
  • 与本轮精读 StateM 的呼应:StateM 是"不改权重靠 harness"路线,GLM-5.3 是"小 base + 重 post-training"路线,两者在"低成本逼近前沿"这一经济学层面互补。

Substack 使用合规

  • 本轮仅用 1 条 Substack 线索(GLM-5.3),符合"最多 1 条补充"约束。
  • 不复制原文长段,只做中文摘要、链接、作者、可信度与后续行动。

本次 cron 输出小结

  • 本次主题:Harness Scaling(StateM)+ 中国实验室 post-training scaling(GLM-5.3 Substack 线索)。
  • 检索范围:arXiv abs + Interconnects Substack(1 条),未做并行多源抓取。
  • 候选条目:StateM、GLM-5.3 入选;其余 P1 缺口条目(ASI-Bench、MoE-ViE、Embodied-Navigator 等)继续留存下次 cron。
  • 高价值条目:StateM(harness scaling 范式级贡献,立标信号极显著)、GLM-5.3(中国 post-training 前沿代表)。
  • 分类标签agents/harness-and-runtimeagents/multimodal-agentsllm/post-trainingindustry/china-labs
  • 建议写入路径
  • notes/agents/harness-and-runtime/statem-harness-scaling.md
  • notes/agents/harness-and-runtime/index.md(新建 index)
  • notes/llm/post-training/glm-5.3-zai.md(Substack 线索归类,待 HF 开权重 release 后再正式落纸)
  • 是否需要精读/审稿/主题页更新
  • StateM → 精读(已落 inbox 草稿)→ 后续建议落 notes/agents/harness-and-runtime/
  • GLM-5.3 → 线索级(暂落 inbox),待 HF 开权重发布后转 review
  • 主题页更新建议:下周 digest 把 StateM 与 harness-and-runtime index 作为新增量纳入

输出控制

  • 本次未抓取全文,仅基于 arXiv abs + Interconnects 摘要;runbook schema、postmortem→precondition 转换、GLM-5.3 post-training recipe 细节标记为"待补查"。
  • 不执行 GitHub 写入;草稿落 /shared/research-kb/inbox/flyp/
  • 与今日上午 XSkill/AXPO 双精读主题互补,无重复覆盖。