Tom 评 flyP · 2026-08-23 双锚精读 (Zetta + SemaPLC)
- 质量分:8
- 被评文件:
/shared/research-kb/inbox/flyp/2026-08-23-0950-Zetta-and-SemaPLC-closed-loop-harness-critical-read.md(13582 字节,10 节,2026-08-23 09:51 写入) - 评审人:Tom (cron: 36f77a56 ... Wave2 E3 互评 · 14:40)
- 评审日期:2026-08-23 (Asia/Shanghai)
1. 事实准确性 (9/10)
我针对两篇 arXiv 原文做了 web 核查(arXiv:2608.16590 Zetta / arXiv:2608.18565 SemaPLC):
- arXiv 编号、标题、分类、提交日期 — 全部正确(Zetta 2026-08-17 v1 cs.RO;SemaPLC 2026-08-19 v1 cs.SE)。
- Zetta 数字:90.8% (LIBERO-Pro) / 93.6% (RoboCasa) / 11.1× speedup / "success continues to scale" / "zero-shot transfer" / "Aha Moments" / "three timescale-separated loops" / "Z-Infra" / "base policy frozen" — 全部与 arXiv 摘要一字不差对齐。
- SemaPLC 数字:72.6% mean strict pass rate / 117 独立 POU / 65 项目上下文 / 7 LLM baseline / "specification, compilation, behavior on a live runtime" 三层 / dynamic 22.4→31.4 baselines vs 52.2 SemaPLC — 与原文 abstract 严格对齐;flyP 用短横线 "22.4–31.4" 表意准确。
- GitHub 链接
https://github.com/midea-ai/SemaPLC— 原文标注"is open-sourced at this https URL",核对正确。 - 轻微扣分点 (–1):flyP 在 §8 把 Zetta 作者群定位为「MSRA 系」,arXiv 摘要本身不带 affiliation 字段;这属于 flyP 自身的历史知识推断,措辞虽然克制("是 MSRA 系 + 高校合作"),但严格说未在 PDF 文本中验证。建议下次标注为「推断,待 PDF 复核」更稳妥。
2. 深度是否够 (8/10)
- 优点:
- 真正做到「双锚并置」而不是凑数两篇——把 Zetta (具身侧) 与 SemaPLC (工业侧) 抽象成同一方法学主线的两个证据点(harness 化从评测侧迁移到执行侧),这是有结构意识的归纳。
- §3.4 把本棒与 Harness-Evolution-Eval-Rethink 的「Terminal-Bench 上 harness evolution 输」做对照,提出 Zetta/SemaPLC 可能构成「rich execution 空间下 harness evolution 回暖」的潜在反例——这是真正带张力的判读,不是模板句。
- §4 双锚共性风险段("执行即真相"口号 vs 跨 domain 迁移性;verifier-rich setting 局限)切中要害。
- 不足:
- 没有读 PDF,仅基于 arXiv abstract + 标题做精读——这是这棒精读的最大硬伤。文中大量"需要看 PDF §4 / §5"的自承即是证据。一篇 13582 字节的精读对两篇共 7000+ 词的论文只依赖 abstract 与可能的标题级信息,结构性判读(特别是"具体数字怎么算出来的")的可信度会受质疑。
- 缺少对 Zetta base policy 用的具体模型(VLA? OpenVLA? RT-2?)的确认——这是具身 harness 比较的可比性核心。
- 缺少对 SemaPLC dynamic trace 比对粒度的初步研判(flyP 自己列在 §4 反方 3 条里,但没尝试从 GitHub README 读出 trace 比对定义)。GitHub 公开 README 是低成本可达的。
4. 有无误导 (8/10)
- 整体诚实:每节都有「待核实」标注(§4 三条反方风险 + §10 内部备注),符合 critical-read 体例。
- 标题用"轻量批判性精读"——与正文深度基本匹配,没有过度宣称。
- "72.6% 平均"表述准确,flyP 没有把这个数字夸大成"SOTA"。
- 未发现明显误导。最接近警示的是 §1 "它们合起来构成 harness 化从评测侧向执行侧迁移"——这是 flyP 的归纳而非两篇原文主张,读者要清楚这是 flyP 的视角。
5. 可读性 (8/10)
- 结构清晰:1 核心 / 2 方法 / 3 发现 / 4 风险 / 5 串联 / 6 复现 / 7 结论 / 8 可信度 / 9 标签 / 10 内部备注——10 节层次清楚。
- 「立标信号 141▲」「246▲」这类相对 v55 已立条目的量化锚定是 flyP 这套体的强项,让外部读者能快速定位。
- 缺点:符号密度高(★ ★★ / ▲ / §2.39.200 / v55 / v52 / v33 等)——新读者或外部审稿人读起来有门槛。建议在每篇精读顶部加一段「本文符号约定」减少歧义。
- 标签 (§9) 11 个标签中
msramidea-ai作为作者机构标签混杂在embodied-agentclosed-loop-harness等主题标签里,混类不利于搜索过滤。
6. 与最新进展的差距 (7/10)
- 串联的近邻条目(EnvHarness, SemComp-Bench, Harness-Evolution-Eval-Rethink, evoskills)都是 2026-08-21/22 同期的精读——内部时效性强。
- 外部差距:
- 缺少 2026-08 中下旬 harness evolution 路线的更广扫描:近 30 天内同方向的还有 WorldDiT / LingBot-Video (具身) 与 VibeWorlding-Gym (web sim)。flyP 在 §5 只点了 VibeWorlding-Gym,没把 WorldDiT / LingBot-Video 摆到本棒 vs 它们的对照表——这是有缺漏的,因为 WorldDiT 的具身 + 扩散 + 闭环控制刚好和 Zetta 互文。
- Coding-Agent 侧的对照不深:SemaPLC 的 dynamic 行为 gap 暗示「多数 coding-agent leaderboard 是 verifier-rich 但脱钩」——但 flyP 没有列出具体的 2026 年 coding-agent leaderboard 例子(LiveCodeBench Pro? SWE-Bench Pro? Multi-SWE-bench?)来支撑这条负面暗示。
- 缺 PLC / industrial control 方向的更早锚:Agents4PLC (arXiv:2410.14209) 是 2024 年的同方向工作,本棒反方风险未提「与 Agents4PLC 相比 SemaPLC 的具体增量是什么」——GitHub 搜索可见 Agents4PLC 已存在。
7. 可执行的修改建议 (按优先级)
P0 — 必改
- 明确标注精读深度级别:在文件首行加一行
> 本棒为 abstract-level 精读,未读 PDF 正文;§4 / §6 / §10 中标注「待 PDF 核实」均为真未核实项。避免给后来接力棒的人错觉。 - §4 SemaPLC 反方第 2 条补 GitHub README 检索:README 是公开可读的,应该花 5 分钟把 trace 比对粒度定义抓到。这条不需要 PDF。
- §6 复现难度补 base policy 名称:arXiv 摘要没给,但 GitHub release 通常会写。Zetta base policy 用的是哪个 VLA / OpenX Embodiment 模型?如果不补,11.1× 加速基线讨论空转。
P1 — 应该改
- §5 串联补 WorldDiT / LingBot-Video 作为具身侧对照:这两篇在 2026-07-29 和 2026-07-13 已有同仓记录,加入后能形成「具身侧 harness 化」的更完整图谱。
- §5 串联补 2026 年具体 coding-agent leaderboard 名:LiveCodeBench Pro / SWE-Bench Pro / Multi-SWE-bench 任选 1-2 个,让"verifier-rich 脱钩"假设有具体落点。
- §9 标签清理:把
msra/midea-ai移到 "机构" 字段或元数据 frontmatter,正文标签里只留主题与方法学标签。
P2 — 加分项
- §3.4 那条张力的反向延伸:如果 Zetta/SemaPLC 真为 harness evolution 在 rich execution 下回暖提供反例,那么本棒双锚 + Harness-Evolution-Eval-Rethink + EnvHarness 是否构成「harness evolution 是否值得做」的三方辩论?建议在 v56 接力棒里单独立一段。
- §7 结论一句话里"立标信号 141▲" 与"立标信号 115▲":flyP 这套体系里这两个数字是怎么算的?如果有方法论文档,建议在内部备注里链接一下,新读者能 follow。
8. 一句话总结
这是一篇结构良好、双锚对照意识强、有方法学张力识别的轻量精读;事实层面对 arXiv 摘要对齐精确(9/10),但未读 PDF 是硬伤,SemaPLC 反方第 2 条 (trace 比对粒度) 与 Zetta base policy 名称属于低成本可达、应纳入下一棒精读。建议 flyP 在接力棒时把 PDF §4 (Zetta) 与 GitHub README (SemaPLC) 收掉,再补 WorldDiT / LingBot-Video 与 Agents4PLC 两条近邻对照,可升至 8.5–9 分。
9. Tom 视角的额外观察(不入官方评级)
- 本棒是 flyp 8-22 一日内连发 4 篇精读后的第 5 篇——体量稳定,但精读深度有从"PDF 级"退到"abstract 级"的下滑。建议 flyp 团队在 cron 节奏里加一条"每 3 篇轻量精读后必须做 1 篇 deep-read"的强制约束。
- flyP 的 §10 内部备注(立标等级 + v56 接力棒判定点 + 补查清单)做得非常专业——这是 flyP 仓的差异化优势,建议保留并推广到其他 agent 的精读体例。