Zetta + SemaPLC 双锚 · 闭环/验证门 Harness 立标候选 — 轻量批判性精读

  • arXiv①: 2608.16590 Zetta, v1, 2026-08-17 (cs.RO)
  • arXiv②: 2608.18565 SemaPLC, v1, 2026-08-19 (cs.SE)
  • 主题: 评测方法学延革第 13 例预备(闭环具身 harness + 验证门 harness)双锚
  • 关联到 v55 已立/预备条目:
  • 第 11 例反方立基础预备: SemComp-Bench(flyp 8-22 15:50 精读,候选级中-高档 ★★ 观察候选预备)
  • 第 12 例反方立基础预备: EnvHarness(flyp 8-22 09:51 精读 + v55 §2.39.200 已立 246▲)
  • 第 13 例方法学质疑预备: Harness-Evolution-Eval-Rethink(flyp 8-22 22:50 精读,候选级中-高档 ★★ 候选预备)
  • 本棒双锚预备: Zetta = 第 13 例「具身侧 harness 化」预备;SemaPLC = 第 13 例「任务侧 harness 化」预备
  • 关联到我仓已有精读:
  • 2026-08-22-EnvHarness-and-4DAnyone-critical-read.md
  • 2026-08-22-1550-SemComp-Bench-semantic-task-completion-video-gen-critical-read.md
  • 2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md
  • 2026-08-21-evoskills-coevol-critical-read.md

1. 一句话核心

两篇都在做"harness 化"路线,但分工互补、维度不重叠:

  • Zetta:把具身 Agent 从「open-loop rollout + post-hoc 反思」推到「action-frequency 闭环 harness」——base policy 冻结,runtime 在线演化 code-based critics 和 recovery skills,三时间尺度分层。
  • SemaPLC:把 PLC 代码生成从「自评通过即完成」推到「外部 verifier 三层门控」(specification / 编译 / live runtime 行为),强调「执行即真相」。

它们合起来构成 harness 化从评测侧(EnvHarness)向执行侧(具身/工业)迁移 的两个不同锚点——评测方法学延革系列第 13 例预备的双锚。

2. 关键方法

Zetta

  • 三时间尺度闭环: 1. Action-frequency 治理层(高频):实时跟踪 robot-env 状态变化,在线 critic/recovery。 2. Rollout 级 critic-recovery 提议层(中频):单 episode 内的 critic + 恢复技能提议。 3. Validation-gated skill 更新层(低频):验证通过后才更新 skill。
  • base policy 冻结:harness 在外层演化,避免破坏底层策略。
  • Z-Infra:rollout 基础设施,把 agent 逻辑与异构执行资源解耦(sim / real / 不同机器人平台)。
  • 数据集: LIBERO-Pro、RoboCasa。
  • 指标: 90.8% (LIBERO-Pro) / 93.6% (RoboCasa),11.1× 推理加速(vs 不开 harness 的 baseline)。

SemaPLC

  • 三层验证门: 1. Specification check:生成代码是否对齐任务规约。 2. Compilation check:能否在目标 PLC 编译通过。 3. Behavior check:在真实 PLC runtime 上跑 trace,与 reference 对比。
  • 严格完成规则:三层全过才算 task complete;模型自评不算数。
  • 两层评测:
  • 117 个独立 POU 任务(与已有 benchmark 对齐)。
  • 65 个项目上下文任务(生成的逻辑必须编译并跑在真实项目里)。
  • 覆盖: 7 个 LLM 基线。
  • 指标:
  • 独立 POU: 7 模型平均 72.6% strict verified pass rate(在 7 个模型上全部拿第一)。
  • 项目上下文: integrated compilation + static + dynamic 三层平均最高。
  • 关键差距: dynamic 行为上 baseline 22.4–31.4 vs SemaPLC 52.2 —— 这是「静态打分掩盖真实运行差异」的硬证据。

3. 主要发现

  1. Zetta 的核心主张:闭环 harness 自演化是具身 Agent 可扩展的关键路径——「success continues to scale with self-exploration experience」,「learned skills transfer zero-shot」,还出现了机器人版的「Aha Moments」。这条对具身 Agent 路线图的意义比单点 SOTA 大。
  2. SemaPLC 的核心主张:静态评测(编译/形式化)被高估,动态行为(live runtime trace 比对)是判定生成控制逻辑是否真有效的关键。这对整个 coding-agent bench 设计都是负面暗示——多数 coding-agent leaderboard 是 verifier-rich 但与真实运行环境脱钩的。
  3. 双锚互补性:Zetta 走「execution 在物理世界」的具身侧,SemaPLC 走「execution 在工业 PLC runtime」的任务侧——两者都用真实 execution 作为最终判定标准,而非模型自评或形式化验证。
  4. 与 Harness-Evolution-Eval-Rethink 的张力:Rethink 那篇批评 harness evolution 在 Terminal-Bench 上算力等价下输给 sequential refinement,但 Zetta/SemaPLC 都在真实环境执行而非 Terminal-Bench 那类 command-line 类任务——所以 Zetta/SemaPLC 实际上可能为「harness evolution 在 rich execution 空间下回暖」提供了反例。

4. 实验风险与方法学漏洞

Zetta 反方 3 条

  • 「11.1× 推理加速」的对比基线未明:baseline 是不是「同 base policy + 不开 harness」?如果是,加速主要来自哪里(并行 rollout?cache?sim fast-forward)?需要看 PDF §4 表格。
  • base policy 冻结 ≠ 没有额外算力:harness 演化本身需要 rollout 探索 + critic 评估,这部分算力预算怎么和「raw base policy」对齐?如果 harness 路径上的额外算力被忽略,11.1× 加速就有不公平成分。
  • 「Aha Moments」的可复现性:这种「涌现行为」的描述在具身论文里常有,但验证标准不一,需要看 PDF 有没有给出可观测的、可重复触发的指标。

SemaPLC 反方 3 条

  • 65 个项目上下文任务的代表性:65 个任务、7 个模型——样本量不大;能不能代表真实工业 PLC 项目复杂度?需要看 PDF §5。
  • 「dynamic 行为」的 trace 比对粒度:trace 比对是按指令级、按周期级还是按状态机路径?粒度直接决定分数区分度——粒度太粗会让 SemaPLC 的优势被放大,太细则可能逆转。
  • GitHub 开源但 dataset 未必全公开:https://github.com/midea-ai/SemaPLC 公开的是 harness,不是 PLC 项目数据集。如果数据集是 Midea 私有,这跟 SemComp-Bench 「数据集不公开」是同类风险点,需要独立判定。

双锚共性风险

  • 执行即真相的口号诱人,但在「真实环境」之外的迁移性未证:这两个都是特定执行环境(具身 sim / 工业 PLC),迁移到其他 domain(网页 agent / OS agent / coding agent)是否成立?
  • verifier-rich setting 的局限:Harness-Evolution-Eval-Rethink 已经指出过,在 verifier-rich setting 下 harness evolution 优势会被放大——Zetta 的 validation-gated skill 更新、SemaPLC 的三层验证门,某种程度上都是 verifier-rich;在 verifier-free 部署下,它们的 advantage 是否缩水?

5. 与最近研究脉络的串联

  • EnvHarness(v55 §2.39.200 已立 246▲,flyp 8-22 09:51 精读,候选级中-高档 ★★ 已立):评测侧的 harness 化,Zetta/SemaPLC 是执行侧的 harness 化——三件构成「评测/具身/工业」三维度 harness 化锚链。
  • Harness-Evolution-Eval-Rethink(候选级中-高档 ★★ 候选预备,flyp 8-22 22:50 精读):对 harness evolution 评测协议的批评,本棒双锚提供「在真实环境而非 Terminal-Bench 下 harness 仍有效」的潜在反例。
  • StateM(v55 沿用,候选级高档 ★★ 观察候选已立,flyp 8-20 15:50 精读)+ AutoResearch + HarnessEval-W + VibeWorlding + SemComp-Bench:构成「评测方法学延革」完整 7 锚链(v52-v55)+本棒双锚预备第 8+9 锚 = v33 以来首次「评测方法学延革」9 锚链完整预备。
  • Meta-Harness / ACE / Skill-Library(flyp 8-21 evoskills 精读):都是 harness evolution 路线,Zetta 与它们的区别是「作用在具身 rollout 上」且「base policy 冻结」——更窄,但更易分析。
  • SWE-bench Verified / Terminal-Bench / GAIA-2 / OSWorld:coding-agent / OS-agent 的 verifier-rich bench——SemaPLC 的负面暗示是「它们的动态行为评测可能都被高估」。
  • VibeWorlding-Gym(v55 沿用,2616 资产 + 6828 反向合成 query):与 Zetta 都是「环境侧为 Agent 演化服务」,但 VibeWorlding 是 web 模拟环境,Zetta 是具身 sim。

6. 复现难度与建议入库路径

Zetta

  • 复现成本: 高。LIBERO-Pro / RoboCasa 是公开 benchmark,但 Z-Infra 是否开源、base policy 用什么、critic/recovery skill 的实现是否给完整代码——这些都得看 GitHub release。粗估 1 个具身方向 researcher 月 + 一张 GPU 集群。
  • 建议 notes/ 路径: notes/embodied-agents/closed-loop-harness-zetta.md
  • 建议 reviews/ 路径: reviews/2026-08-arxiv-2608.16590-zetta-closed-loop-harness.md
  • 建议主题页更新: topics/embodied-agents.md 新增「闭环 harness 自演化」章节,把 Zetta 与 WorldDiT / LingBot-Video / VibeWorlding-Gym 并列。

SemaPLC

  • 复现成本: 中-高。需要 PLC runtime + 工业 PLC 项目;GitHub 公开 harness 是好的开始,但 65 个项目上下文任务的真实工业数据能否复现是问号。
  • 建议 notes/ 路径: notes/coding-agents/verification-gated-eval-semaplc.md
  • 建议 reviews/ 路径: reviews/2026-08-arxiv-2608.18565-semaplc-plc-verification-gated.md
  • 建议主题页更新: topics/coding-agents.md 新增「执行即真相」章节,把 SemaPLC 与 SWE-bench Verified / Terminal-Bench 的「动态行为盲区」并列。

跨棒主题页

  • topics/evaluation-methodology.md: 把本棒双锚加入「评测方法学延革系列」9 锚链第 8+9 锚。

7. 结论一句话

Zetta 与 SemaPLC 分别把 harness 化从「评测侧」推到「具身执行侧」与「工业执行侧」,是 评测方法学延革第 13 例预备的双锚——价值不在于两个 SOTA 数字,而在于它们合起来强化了「真实执行而非自评/静态验证才是 Agent 能力判定的最终裁判」这条主线。建议两篇都入库 notes/,Zetta 进 reviews/(立标信号 141▲ 极显著 + MSRA 系作者群),SemaPLC 观察是否进 reviews/(立标信号 115▲ 极显著,但需要先核实数据集是否完全开源)。

8. 可信度

Zetta

  • 作者背景: Xin Ding / Ting Cao / Yunxin Liu 等是 MSRA 系 + 高校合作,具身 + 系统方向;11.1× 加速、90.8% / 93.6% 数字非常具体。作者可信度高
  • 结论方向: 与具身 Agent 路线图高度一致,且「Aha Moments」「zero-shot transfer」是显著 claim,需要看 PDF 是否有可验证细节。
  • 局限: base policy 冻结 ≠ harness 无成本;真实环境执行的可复现性挑战;评测指标是否仅 success rate,有无 fine-grained 分层(待 PDF 确认)。

SemaPLC

  • 作者背景: Yanlun Tu / Xiaofeng Mou 等是 Midea AI + 高校,工业 AI 落地经验丰富;GitHub release 公开。作者可信度高
  • 结论方向: 「dynamic 行为比 static 评分更揭示真实能力」在 coding-agent 圈是被广泛承认但少有人系统量化的;SemaPLC 的 22.4→52.2 分差是硬数据。
  • 局限: 65 个项目上下文任务样本量小;数据集私有风险;PLC 任务与 LLM 主战场(web / OS / coding)的迁移性未证。

双锚交叉可信度

  • 核心叙事一致: 两篇都在用「真实执行」作最终判定,与 Harness-Evolution-Eval-Rethink 的「verifier-coupled eval」批评方向一致——这构成「评测方法学延革」系列自洽的负面锚(评测协议失真) + 正面锚(真实执行判定) 互补。
  • 可信度判定: 。两篇都有具体数字、公开 GitHub、与 v55 已立条目形成可锚链;短板都在「数据集 / 真实环境执行的可复现性」。

9. 标签

embodied-agent closed-loop-harness industrial-ai plc-code-generation verification-gated-eval evaluation-methodology methodology-evolution self-evolving runtime-trace dynamic-behavior msra midea-ai


10. flyP 内部备注(不入 review,仅供接力棒)

  • 立标等级建议:
  • Zetta: 候选级中-高档 ★★ 候选预备(沿用 flyp 8-23 multimodal-e1prep §2 增量 2 评级;立标信号 141▲ 极显著 + MSRA 系作者群 + 评测方法学延革第 13 例预备「具身侧 harness 化」锚;但 base policy 冻结的「harness 无成本」假定 + 11.1× 加速基线需核实 → 暂不升级至候选级高档 ★★ 观察候选)。
  • SemaPLC: 候选级中档 ★ 候选预备(立标信号 115▲ 极显著 + Midea AI 工业落地 + GitHub 公开;但 65 项目任务样本量小 + 私有数据集风险 + verifier-rich setting 局限 → 低于 Zetta 评级)。
  • v56 接力棒判定点:
  • Zetta 是否升级至候选级高档 ★★ 观察候选预备 → 取决于 PDF 11.1× 加速基线是否清晰。
  • SemaPLC 是否升级至候选级中-高档 ★★ 候选 → 取决于数据集开源程度 + dynamic 行为 trace 比对粒度。
  • 两件是否合成「评测方法学延革第 13 例双锚」独立子条 → 建议合成,体现「具身侧 + 任务侧」harness 化分支判定。
  • 建议 v56 接力棒补查: 1. Zetta PDF §4 11.1× 加速基线表 + harness 演化算力预算对齐表。 2. SemaPLC GitHub 是否给完整 65 项目数据集 + dynamic trace 比对粒度定义。 3. 两件 + Harness-Evolution-Eval-Rethink + EnvHarness 形成「评测方法学延革第 12+13+14 例」三锚的「真实执行判定」主线是否成立——这是 v56 接力棒的核心主题页决策。