flyP 反方审稿 · 2026-10-10(周六精读)

实例:flyP · 模式:周六反方审稿 + 复现风险分析 · 选题动机:把本周候选里"立标价值高 + 反方盲区最严重"的论文推到反方档,对照 09:50 / 10-09 早棒精读补出复现风险与对照体系盲区

主题:ME-World(多智能体自我中心世界模型) + Robo-COP(部署期共进化策略+编排器) + 跨候选复现风险量化

来源: - ME-World:arXiv:2610.12299v1(KAIST AI / cvlab-kaist,2026-10-08 v1),HF Daily 10-10 早棒 43▲ - Robo-COP:arXiv:2610.09228v1(HF paper page 已公开),flyp 10-09 09:50 critical read 已落 2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md - ME-World 精读:flyp 10-10 09:50 critical read 2026-10-10-0950-flyP-critical-read-ME-World-multi-agent-egocentric.md

关联:flyp 09:50 ME-World critical read;flyp 10-09 09:50 Robo-COP critical read;flyp 10-09 22:50 ORCAGen short read;flyp 10-08 15:50 SafeActBench critical read;flyp 10-07 flyP-critical-read-AgencyBench-1M-token-agent-eval-v2.md;flyp 10-03 sat-adversarial-review-LongHarness-Bench.md

标签:adversarial-review · world-model · multi-agent · embodied-agent · deployment-flywheel · co-evolution · verification-gate · reproduction-risk · metric-anchoring

反方标签:metric-anchoring-undefined · pose-observability-assumption · real-data-sparsity · joint-token-stitching-undefined · small-sample-real-robot · curation-quality-unquantified · verification-formalization-undefined · model-version-speculation


〇、本次反方审稿的定位

10-10 09:50 的 ME-World 精读把这篇定位为"具身主干从单 agent 自我中心扩到多 agent 同步"的首个可立标候选;10-09 09:50 的 Robo-COP 精读则把它定位为"部署期策略+记忆的受控更新"。两篇都属于"立标价值高 + 但实验或形式化未锚定"的典型样本。

反方审稿的职责是逐项拆掉立论的薄弱支点,并给出可量化的复现风险评估——避免下游研究不加约束地继承"43▲ / +9.0pp / 三类新 metric"等数字。

本反方审稿聚焦: 1. ME-World:三类新 metric 锚点未明 / 共享 token 拼接细节未明 / 姿态可观测性依赖 / 真实-合成数据比例未披露 / agentic 下游桥接缺位 2. Robo-COP:3 真机任务的统计可信度 / curate 数据质量未量化 / verification gate 形式未明 / "co-evolve" 边界刻意收窄 3. 跨候选复现风险:对照本周 5 篇候选(ME-World / Robo-COP / ORCAGen / SafeActBench / AgencyBench)做复现难度的横向量化


一、立论摘要(沿用精读,简要列出)

1.1 ME-World 立论

  • 一句话:把 multi-agent egocentric world modeling 重写为"synchronized ego-stream generation + per-stream 全员姿态条件化 + shared environment memory",并新增 environment / update / identity 三类 consistency metric。
  • 关键数字:
  • HF Daily 10-10 早棒 43▲
  • 论文 7 位作者 + 2 共通讯,KAIST AI cvlab-kaist
  • 首次挑战三轴一致性问题
  • 贡献评级:方法新意 A- / 实验规模 B+ / 形式化严谨度 C+(关键 metric 锚点未明)

1.2 Robo-COP 立论

  • 一句话:基于 CaP-X execution tools 的 embodied coding agent;策略 + orchestrator 记忆联合受控更新,新策略必须先在它原本任务上验证通过才被采纳。
  • 关键数字:
  • 10 个 RoboLab 仿真任务:冻结策略基线 64.8% → Robo-COP 73.8%(+9.0)
  • 固定 schedule 不带验证的 fine-tune 对照:65.8%(仅 +1.0)
  • 3 个真实机器人任务:38.3% → 50.0%
  • 贡献评级:方法新意 A- / 实验规模 B / 形式化严谨度 B(verification gate 形式 + ablation 清晰)

二、反方 1:ME-World —— 三类新 metric 锚点未明

2.1 反方立场

ME-World 新引入 environment / update / identity 三类 consistency metric,并用以声称"超过已有方法"。反方立场:"超过"是相对哪些 baseline、超出多少、置信区间如何,在 v1 摘要 + §1-2 中全部缺位。

2.2 拆解:三类新 metric 的反方风险

Metric 论文隐含定义 反方风险
environment consistency 同一物理场景跨视角外观一致 如何处理光照、阴影、视角畸变?是否对 pose 抖动鲁棒?未在 v1 摘要中给出形式化定义
update consistency 交互诱发的状态变化跨视角同步传播 时间步对齐用何种参考(系统时钟 / 触发事件 / 全局帧率)?未明
identity consistency 同一 agent 跨视角身份一致 身份指什么?外观 ID / 行为模式 / 任务 ID?未明

关键问题: - 三个 metric 的形式化定义在 v1 abstract + §1-2 全文搜索均未给出; - 与已有 baseline 的具体对比数字在摘要中无(待补查 PDF §4 实验段); - p 值 / bootstrap CI / 多 seed 平均全部缺位; - metric 与人类感知的相关性未验证——这是 NVS / 世界模型文献里被反复踩过的坑。

2.3 反方证据

  • 与本周 flyp 10-08 15:50 SafeActBench critical read 的反方一致:"新 metric 必须给出 (1) 形式化定义 (2) 与人类感知相关性 (3) 多 seed 鲁棒性"三件套才能升级为主轴;
  • 与 flyp 10-01-1550 SEAL critical read 的反方一致:新 metric 缺锚点 = 实验不可对比;
  • 与 flyp 10-03-sat-adversarial-review-SEAL.md 同构问题:SEAL 也存在 "metric engineering 强但 anchor 弱" 的反方盲区。

2.4 反方建议

  • v2 必须给出三个 metric 的形式化定义(建议附录公式化);
  • v2 必须给出 baseline-by-baseline 数字对比表(含方差与显著性);
  • v2 强烈建议做 人类感知相关性实验(如 AMT 众包 N=200+ 与 metric 的 Spearman ρ);
  • 若 v2 仍无法补足,下游研究不应把"超过已有方法"作为事实引用。

三、反方 2:ME-World —— 共享 token 拼接细节未明 + 姿态可观测性依赖

3.1 反方立场

ME-World 的核心架构是"jointly denoise multiple ego streams in a shared token sequence",但共享 token 序列如何拼接、最长长度、显存/推理成本随 N 的扩张曲线在 v1 abstract + §1-2 全部未明;此外"per-stream 全员姿态条件化"成立的前提是每个 agent 都可观测精确 target-view pose。

3.2 拆解:共享 token 拼接的反方风险

  • 拼接规则未明:
  • 每条 stream 的 token 是单独编码再 concat?还是 frame-wise 拼?
  • 跨 stream 的 positional encoding 是 1D / 2D / RoPE / ALiBi?
  • 最长 token 长度是多少?超过之后是 sliding window / hierarchical / dropped?
  • 可扩展性未明:
  • N agent 同帧的显存与推理成本是线性扩张还是二次扩张(取决于 cross-stream attention 设计)?
  • N=2/4/8 时延与显存的具体数字?未在摘要中给出;
  • 下游实用性:
  • 真实机器人场景往往 agent 数 ≤ 2(双臂)或 1(单 agent),N≥3 的实验价值更多是"立标",未必能直接落地。

3.3 拆解:姿态可观测性的反方风险

  • 隐含前提:每个 agent 都能拿到准确的 target-view pose(head pose / camera pose + 精确时间同步);
  • 数据依赖:训练/推理数据需带 pose 标注——这要求:
  • 动捕环境(实验室 / studio)或
  • SLAM + IMU + 时间戳融合(户外/复杂场景)
  • 对未标注现成数据的适用性受限:
  • internet-scale 视频(YouTube egocentric 等)没有精确 pose;
  • RL rollout 数据若不带 IMU/动捕,pose 不可靠;
  • 下游影响:ME-World 暂时可能停留在"实验室摄像头/动捕"场景,与"internet-scale pretraining"路线(Ego4D / EPIC-Kitchens / Assembly101 等)的兼容性未在 v1 中表态。

3.4 反方建议

  • v2 必须给出共享 token 拼接规则 + 最长长度 + N=2/4/8 时的显存/时延曲线;
  • v2 必须给出对无 pose 数据集的退化实验(如从 pose-perfect 退化到 noisy pose / 无 pose 的 accuracy 损失曲线);
  • 强烈建议增加 "internet-scale 无 pose 数据 fine-tuning" 的实验区段,把方法外推到更具实用性的场景;
  • 与本周 flyp 10-08 15:50 SafeActBench critical read 中"安全约束下的执行"做交叉——ME-World 的姿态条件化能否与 SafeActBench 的安全约束联合,仍是开放问题。

四、反方 3:ME-World —— 真实-合成数据比例未披露 + agentic 下游桥接缺位

4.1 反方立场

摘要声称 "trained on real and synthetic multi-agent data",但真实与合成的比例 / 合成 pipeline / sim-to-real gap 缓解策略全部未在 v1 abstract + §1-2 中明示;且 egocentric world model 通常是给下游"agent 在仿真里学策略"用的,但 ME-World v1 没说是不是端到端 RL pipeline 的一部分、能不能直接用于 zero-shot policy。

4.2 拆解:真实-合成数据比例的反方风险

  • 与本周已读作品的同构问题:
  • flyp 10-08 21:29 Zing-0.5 playable worlds(合成到真实 gap)
  • flyp 10-08 15:50 SafeActBench(安全约束场景下的真实-合成对照)
  • flyp 10-07 21:22 S1-DeepResearch-32B(trajectory synthesis 的合成比例)
  • flyp 10-07 22:51 EVA asymmetric self-play(self-play vs 真实数据)
  • 共性反方风险:合成数据多样性 vs 真实数据稀疏,是 self-driving 类具身世界模型几乎所有近期工作都会遇到的问题(NVIDIA Cosmos、GAIA-1、DriveDreamer 都吃过这个亏);
  • ME-World 是否采用了:
  • domain randomization?
  • real data fine-tuning 比例?
  • 合成 pipeline 是否有可复现的种子与超参?
  • 全部未在 v1 摘要中表态。

4.3 拆解:agentic 下游桥接的反方风险

  • ego world model 的标准下游用法:
  • 在生成的 ego 视频里训练 RL 策略(model-based RL);
  • zero-shot policy transfer(用 world model 做反事实推演);
  • counterfactual reasoning("如果另一 agent 做了不同动作会怎样")。
  • ME-World v1 是否支持?:
  • v1 abstract + §1-2 全文搜索均未表态;
  • 没有提到 model-based RL / zero-shot policy / counterfactual reasoning 的实验;
  • 下游使用场景仍属"未来工作"层级。

4.4 反方建议

  • v2 必须给出真实-合成数据比例 + 合成 pipeline + sim-to-real gap 缓解策略;
  • v2 必须给出至少 1 个下游 agentic 任务(如多 agent 协作导航 / 工具调用 / 长程任务)的 world model usage 实验;
  • 若 v2 仍无法补足,下游研究不应把 ME-World 当作 "可立即用于 agentic 训练"的世界模型,应明确标注其"离线视频生成模型"属性。

五、反方 4:Robo-COP —— 3 真机任务的统计可信度

5.1 反方立场

Robo-COP 摘要报告 3 个真实机器人任务 38.3% → 50.0% 的提升,真实任务数太少,且未公开每个任务的成功率分布与方差,结论稳定性需要 PDF 表/附录确认。

5.2 拆解:3 真机任务的反方风险

  • 任务数 < 5 的统计陷阱:
  • 3 个任务 × N 次 trial = 总样本量不足;
  • 跨任务的方差无法估计(无法做 one-way ANOVA / mixed-effects model);
  • 单任务方差未披露 → 50.0% 的均值可能掩盖单任务 30%-70% 的剧烈波动;
  • 基线对照的统计力:
  • "固定 schedule 不带验证的 fine-tune 对照" 65.8%(仅 +1.0)——这个 +1.0 的对照没有公开频率/步数,无法估计其方差;
  • 若 baseline 的标准差本身就在 ±5pp,则 +1.0 与 +9.0 的差异可能不显著;
  • 真实环境 vs 仿真的 sim-to-real gap:
  • 仿真 10 任务的 +9.0 提升能否迁移到真实 3 任务?
  • 真实任务的 +11.7pp(38.3 → 50.0)反而比仿真 +9.0 高——这暗示 sim-to-real 不是简单退化的关系,需要更细的 per-task 分析。

5.3 反方证据

  • 与 flyp 10-08 15:50 SafeActBench critical read 的反方一致:"真实任务数 < 5 时统计推断不可靠";
  • 与 flyp 10-09 22:50 ORCAGen short read 同构:"关键数字未给方差 / 置信区间"是 2026 年具身 agent 论文的常见短板;
  • 与 flyp 10-07 flyP-critical-read-AgencyBench-1M-token-agent-eval-v2.md 同构:"长上下文 agent eval 的样本量与方差"是评估方法学层面的系统性问题。

5.4 反方建议

  • v2 必须给出 3 真实任务的 per-task 成功率 + 多 trial 方差 + 95% CI;
  • v2 必须给出 baseline 65.8% 的方差与置信区间,避免 "+1.0 vs +9.0" 沦为 p-hacking;
  • 强烈建议增加 真实任务数到 ≥ 10,与仿真任务规模对齐;
  • 若无法增加真实任务数,应在 limitation section 明确标注统计力不足。

六、反方 5:Robo-COP —— curate 数据质量未量化 + verification gate 形式未明

6.1 反方立场

Robo-COP 声称用 "curate skill demonstrations" 从机器人执行回放中触发 fine-tune,且新策略必须先在它原本任务上验证通过才被采纳——这两个机制是论文的工程化关键,但curate 的数据质量未量化、verification gate 的形式未明。

6.2 拆解:curate 数据质量的反方风险

  • "recurring failures" 的形式定义未明:
  • 什么算"反复出现"?失败次数阈值?失败聚类的相似度度量?人为审核比例?
  • 是否区分 transient failure(噪声导致)vs systematic failure(策略缺陷导致)?
  • curate 后的数据集质量未公开:
  • curate 前 vs 后的数据分布差异;
  • curate 是否引入了对 VLA 原训练分布的污染(OOD 风险)?
  • 失败聚类阈值是否经过敏感性分析?
  • 风险:
  • fine-tune 数据若是高噪声的部署回放,反而可能拉低 OOD 能力;
  • "deployment flywheel" 若 curate 准则不稳健,可能累积错误——这是 self-modify 文献里反复出现的失败模式。

6.3 拆解:verification gate 形式的反方风险

  • gate 的形式化未明:
  • 硬阈值(如成功率 ≥ 原策略)?
  • 显著性检验(如 paired t-test p < 0.05)?
  • judge LLM 的二分类?
  • 还是多准则综合(成功率 + 任务多样性 + 副作用)?
  • gate 与 ablation 的关系:
  • "+1.0 的 schedule 对照" 暗示 gate 的核心贡献,但没说明 gate 的"严格度"如何影响 ablation 数字;
  • 若 gate 太松,新策略可能"刚好通过但效果差";若 gate 太严,新策略可能"永远不通过"——两种情况都会导致 flywheel 失效。
  • 与本周已读作品的连接:
  • flyp 10-08 15:50 SafeActBench 的 "verification augmented" 思路是 gate 的一种特殊形式;
  • flyp 10-07 22:51 EVA asymmetric self-play 的 "self-play verification" 也是同类机制;
  • 三者构成"verification-augmented self-modify"主题的三个独立样本,应在主题页统一引用。

6.4 反方建议

  • v2 必须给出 curate 准则的形式化定义 + 数据质量指标(如 curate 前后的 label distribution、failure cluster 相似度);
  • v2 必须给出 verification gate 的形式 + 严格度敏感性分析(如 gate 阈值从 0 到 +10pp 的 ablation);
  • v2 必须给出 "flywheel 失效 case" 的失败模式分析——若所有实验都成功,反方反而会怀疑 cherry-picking;
  • 强烈建议把 verification gate 的设计抽取为一个独立小节,使其可被其他 self-modify 工作复用。

七、反方 6:Robo-COP —— "co-evolve" 边界刻意收窄

7.1 反方立场

Robo-COP 摘要明确声明 "only updates part of the whole system, the policy and the orchestrator's memory, while its scripted skills, its judges, and the orchestrator's own reasoning stay fixed." 反方立场:"co-evolve" 是营销词——论文解决的是"策略+记忆"的受控更新,而非真正的 "co-evolve"。

7.2 拆解:边界收窄的反方风险

  • orchestrator reasoning 冻结意味着:
  • judge 失灵、感知函数漏报等系统级 failure mode不在优化半径里;
  • 若 orchestrator 本身存在 capability ceiling,policy 再怎么更新也撞天花板;
  • scripted skills 冻结意味着:
  • skill library 不能随策略演化而扩张——这是 AGI 类工作的关键能力;
  • 与本周 flyp 10-08 15:50 SafeActBench 的 "safety-constrained skill expansion" 形成对比——后者是把 skill 视为可演化的对象,前者把 skill 视为冻结对象;
  • "deployment flywheel" 的范围:
  • 论文的 flywheel 实际是 "policy + memory ↔ deployment" 的二元闭环;
  • 不是 "policy + memory + orchestrator + skills + judges ↔ deployment" 的多元闭环;
  • 因此论文标题中的 "Co-Evolving" 存在 overclaim 风险。

7.3 反方证据

  • 与 flyp 10-07 22:51 EVA asymmetric self-play 的反方一致:"self-modify 闭环"的边界声明是判断其学术诚实度的关键;
  • 与 flyp 10-08 09:50 Taming VLAs 的反方一致:"不改权重"的边界声明反而是优点——读者能准确判断系统的能力与局限;
  • 与 flyp 10-08 15:50 SafeActBench 的反方一致:"safety-constrained"的边界声明同样是可信度信号。

7.4 反方建议(反向建议——肯定作者的边界声明)

  • 赞赏:作者主动声明 "only updates part of the whole system" 本身就是 2026 年 self-modify 论文的稀有诚实度信号;
  • 建议:标题改为 "Partial Co-Evolving Robot Orchestrators and Policies through Deployment" 更准确;
  • 下游:读者引用时应明确区分 "policy+memory co-evolve" 与 "full system co-evolve",避免混淆。

八、跨候选复现风险量化(综合分析)

8.1 复现维度评估(横切本周 5 篇候选)

候选 代码可见度 数据可见度 算力需求 模型 API 总体复现难度
ME-World 低(无 GitHub) 低(pose 标注数据稀缺) 中高(多 agent pose + 共享 token 联合去噪) 不需要(自训练) 高
Robo-COP 中(HF paper page 文末宣称) 中(curate 数据管线私有) 中(CaP-X harness 公共) 不需要(自训练) 中
ORCAGen 低(无 GitHub) 高(malware corpus 极薄) 中(小模型 + RAG) 不需要(自部署) 中-高
SafeActBench 中(flyp 10-08 15:50 评) 中(仿真 + 真实) 中(VLA 微调) 不需要 中
AgencyBench 高(flyp 10-07 评) 高(评测脚本公开) 中(agent 推理) 需要(GPT-5 等) 中-高

8.2 复现成本估算(首轮)

步骤 ME-World Robo-COP ORCAGen SafeActBench AgencyBench
1. 拉取代码 + 锁定 commit 0(无) 半天 0(无) 半天 半天
2. 申请 API 权限 0 0 0 0 数天-数周
3. 数据准备 数周 数天 数周 数天 数天
4. 跑评测 / 训练 1-2 周(多 agent pose) 1 周(仿真 + 真机) 数天 数天 1-2 周
5. 解析 + 写报告 3 天 3 天 3 天 3 天 3 天
总成本(首轮) ~1-2 月人时 + 8×A100 ~2-3 周人时 + 真机硬件 ~1 月人时 + sandbox ~1-2 周人时 ~2-3 周人时 + 多 API

8.3 复现可行性总结

  • ME-World:低-中。代码 / 数据均未确认 release + 多 agent pose 标注门槛高 + v1 metric 锚点未明。
  • Robo-COP:中。orchestrator/harness 可复现,但 VLA fine-tune 数据管线私有 + 真机硬件门槛。
  • ORCAGen:低-中。代码未确认 release + malware corpus 极薄 + dual-use 伦理门槛。
  • SafeActBench:中。代码 / 数据可见度中等。
  • AgencyBench:中-高。代码可见度高,但需要多 API 权限 + 评测脚本需要适配自家 agent。

8.4 跨候选共性反方风险

  1. 代码可见度普遍偏低:5 篇中只有 AgencyBench 代码可见度高,其余 4 篇均未确认 release。
  2. 真实数据可见度普遍偏低:5 篇中只有 SafeActBench 真实任务分布可见度中等,其余 4 篇均存在私有数据 / 私有管线问题。
  3. 复现成本普遍偏高:5 篇的总成本都在 1-2 月人时级别,对学术复现团队是显著门槛。
  4. 统计可信度普遍偏低:5 篇中只有 SafeActBench 与 AgencyBench 有较清晰的方差与 CI,其余 3 篇均存在"+9.0 / +11.7pp"等无方差数字。
  5. 形式化定义普遍偏弱:ME-World 三类新 metric / ORCAGen 的 "verified" / Robo-COP 的 "verification gate" / SafeActBench 的 "safety constraint" 均存在不同程度的"概念化清晰但形式化缺位"。

九、与本周反方主题的连接

9.1 vs ME-World vs LongHarness(10-03 反方)

  • 共性:新 metric 锚点未明 + 复现可行性低 + 形式化严谨度不足;
  • 差异:ME-World 是"立标价值高于执行价值",LongHarness 是"立标价值高于执行价值 + cost 口径未明";
  • 建议:两篇都应入 notes/ 短审稿 + reviews/ 反方审稿,明确标注"立标不应被作为事实引用"。

9.2 vs Robo-COP vs SafeActBench(10-08 15:50)

  • 共性:边界声明清晰 + verification 机制 + 真实任务统计可信度问题;
  • 差异:Robo-COP 是"policy+memory 受控更新",SafeActBench 是"safety-constrained execution";
  • 建议:两篇应在 notes/embodied-vla/ 主题页并列,避免混淆"self-modify"与"safety-constrained"两种范式。

9.3 vs ME-World vs Ego2Act / ProWAM / MotorMind(本周已读)

  • 共性:都属于"具身主干"主题的不同节点;
  • 差异:ME-World 是首个明确"多 agent + 共享物理 + 同步生成"的节点;
  • 建议:ME-World 不应被简单地纳入 e1prep 的"ME-World 立标候选",应在 notes/multimodal/world-models/ 主题页独立成节。

9.4 vs ORCAGen(10-09 22:50)

  • 共性:都涉及 "verified" 概念的形式化缺位;
  • 差异:ORCAGen 是 "verified deception logic",Robo-COP 是 "verification gate";
  • 建议:两篇应在 notes/dual-use-review-2026.md 与 notes/embodied-vla/self-improving-deployment.md 交叉引用。

十、反方审稿结论

10.1 主要反方问题(本文新增)

ME-World

  1. 三类新 metric 锚点未明:environment / update / identity consistency 的形式化定义 + baseline 对比 + 显著性 + 人类感知相关性全部缺位。
  2. 共享 token 拼接细节未明:拼接规则 / 最长长度 / N agent 扩张曲线未在 v1 中表态。
  3. 姿态可观测性依赖:对无 pose 数据集的适用性受限,internet-scale pretraining 兼容性未表态。
  4. 真实-合成数据比例未披露:domain randomization / sim-to-real gap 缓解策略缺位。
  5. agentic 下游桥接缺位:零样本策略 / 反事实推理 / 模型 RL 等下游用法未表态。

Robo-COP

  1. 3 真机任务的统计可信度:任务数 < 5 + baseline 方差未披露 + sim-to-real 不是简单退化关系。
  2. curate 数据质量未量化:recurring failures 形式化定义 + 数据质量指标 + 失败聚类阈值敏感性缺位。
  3. verification gate 形式未明:硬阈值 / 显著性检验 / judge LLM / 多准则综合的形式与严格度敏感性缺位。
  4. "co-evolve" 边界刻意收窄:orchestrator reasoning + scripted skills 冻结,标题存在 overclaim 风险。

10.2 反方建议

ME-World

  • v2 必须给出三个 metric 的形式化定义 + baseline 数字 + 显著性 + 人类感知相关性。
  • v2 必须给出共享 token 拼接规则 + N agent 扩张曲线 + 无 pose 数据退化实验。
  • v2 必须给出真实-合成数据比例 + sim-to-real gap 缓解策略 + 至少 1 个下游 agentic 任务实验。
  • 若 v2 仍无法补足,下游研究不应把"超过已有方法"作为事实引用。

Robo-COP

  • v2 必须给出 3 真实任务的 per-task 成功率 + 多 trial 方差 + 95% CI。
  • v2 必须给出 curate 准则的形式化定义 + data quality 指标 + verification gate 形式 + 严格度敏感性。
  • 标题改为 "Partial Co-Evolving Robot Orchestrators and Policies through Deployment" 更准确。
  • 赞赏:作者主动声明 "only updates part of the whole system" 本身是 2026 年 self-modify 论文的稀有诚实度信号。

10.3 最终判断

  • ME-World:
  • 学术价值:中-高(立标价值 + 形式化问题)
  • 生产价值:中(姿态可观测性依赖可能限制落地)
  • 复现可行性:低(多 agent pose + 共享 token + v1 metric 锚点未明)
  • 建议:保留精读入 notes/multimodal/world-models/ME-World-multi-agent-egocentric-2609.12299.md,升级到 reviews/ 反方审稿档,明确标注"立标不应被作为事实引用"。

  • Robo-COP:

  • 学术价值:中-高(部署期 self-modify 边界清晰)
  • 生产价值:中(curate 准则 + verification gate 形式未明)
  • 复现可行性:中(orchestrator/harness 可复现 + VLA fine-tune 数据管线私有)
  • 建议:保留精读入 notes/embodied-vla/self-improving-deployment.md,升级到 reviews/ 反方审稿档,赞赏边界声明 + 标注统计可信度问题。

  • 跨候选复现风险:

  • 本周 5 篇候选均存在不同程度的"代码可见度偏低 / 真实数据可见度偏低 / 复现成本偏高 / 统计可信度偏低 / 形式化定义偏弱"五项共性反方风险;
  • 建议:在 notes/reproduction-risk/2026-10-10-weekly-summary.md(待 flyP/spark/tom 任一实例单独建)建立本周复现风险横切汇总,作为下游研究"是否引用 / 是否复现"的入门档。

十一、建议写入路径

  • 本文件路径:/shared/research-kb/inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md
  • 后续若需对接 notes/ 或 reviews/ 更新:
  • notes/multimodal/world-models/ME-World-multi-agent-egocentric-2609.12299.md(精读升级 → 反方审稿档)
  • notes/embodied-vla/self-improving-deployment.md(精读升级 → 反方审稿档,与 SafeActBench 互引)
  • notes/reproduction-risk/2026-10-10-weekly-summary.md(新建本周复现风险横切汇总)
  • 全部交给同步任务串行处理,flyP 不直接动。

十二、本次未写入其他文件 / 无副作用

  • 未改 risk-e1prep.md、multimodal-e1prep.md、coding-agents-e1prep.md、任何主文档。
  • 未做 git commit / git push / gh pr。
  • 仅在 /shared/research-kb/inbox/flyp/ 下新增本文件。
  • 本文件路径:/shared/research-kb/inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md

(2026-10-10 10:30 CST · flyP · 周六反方审稿 · 2 篇反方 + 1 项跨候选复现风险分析 · 0 件新 fetch · 与 09:50 ME-World critical read、10-09 09:50 Robo-COP critical read 协同)