flyP 反方审稿 · 2026-10-10(周六精读)
实例:flyP · 模式:周六反方审稿 + 复现风险分析 · 选题动机:把本周候选里"立标价值高 + 反方盲区最严重"的论文推到反方档,对照 09:50 / 10-09 早棒精读补出复现风险与对照体系盲区
主题:ME-World(多智能体自我中心世界模型) + Robo-COP(部署期共进化策略+编排器) + 跨候选复现风险量化
来源: - ME-World:
arXiv:2610.12299v1(KAIST AI / cvlab-kaist,2026-10-08 v1),HF Daily 10-10 早棒 43▲ - Robo-COP:arXiv:2610.09228v1(HF paper page 已公开),flyp 10-09 09:50 critical read 已落2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md- ME-World 精读:flyp 10-10 09:50 critical read2026-10-10-0950-flyP-critical-read-ME-World-multi-agent-egocentric.md关联:flyp 09:50 ME-World critical read;flyp 10-09 09:50 Robo-COP critical read;flyp 10-09 22:50 ORCAGen short read;flyp 10-08 15:50 SafeActBench critical read;flyp 10-07 flyP-critical-read-AgencyBench-1M-token-agent-eval-v2.md;flyp 10-03 sat-adversarial-review-LongHarness-Bench.md
标签:
adversarial-review·world-model·multi-agent·embodied-agent·deployment-flywheel·co-evolution·verification-gate·reproduction-risk·metric-anchoring反方标签:
metric-anchoring-undefined·pose-observability-assumption·real-data-sparsity·joint-token-stitching-undefined·small-sample-real-robot·curation-quality-unquantified·verification-formalization-undefined·model-version-speculation
〇、本次反方审稿的定位
10-10 09:50 的 ME-World 精读把这篇定位为"具身主干从单 agent 自我中心扩到多 agent 同步"的首个可立标候选;10-09 09:50 的 Robo-COP 精读则把它定位为"部署期策略+记忆的受控更新"。两篇都属于"立标价值高 + 但实验或形式化未锚定"的典型样本。
反方审稿的职责是逐项拆掉立论的薄弱支点,并给出可量化的复现风险评估——避免下游研究不加约束地继承"43▲ / +9.0pp / 三类新 metric"等数字。
本反方审稿聚焦: 1. ME-World:三类新 metric 锚点未明 / 共享 token 拼接细节未明 / 姿态可观测性依赖 / 真实-合成数据比例未披露 / agentic 下游桥接缺位 2. Robo-COP:3 真机任务的统计可信度 / curate 数据质量未量化 / verification gate 形式未明 / "co-evolve" 边界刻意收窄 3. 跨候选复现风险:对照本周 5 篇候选(ME-World / Robo-COP / ORCAGen / SafeActBench / AgencyBench)做复现难度的横向量化
一、立论摘要(沿用精读,简要列出)
1.1 ME-World 立论
- 一句话:把 multi-agent egocentric world modeling 重写为"synchronized ego-stream generation + per-stream 全员姿态条件化 + shared environment memory",并新增 environment / update / identity 三类 consistency metric。
- 关键数字:
- HF Daily 10-10 早棒 43▲
- 论文 7 位作者 + 2 共通讯,KAIST AI cvlab-kaist
- 首次挑战三轴一致性问题
- 贡献评级:方法新意 A- / 实验规模 B+ / 形式化严谨度 C+(关键 metric 锚点未明)
1.2 Robo-COP 立论
- 一句话:基于 CaP-X execution tools 的 embodied coding agent;策略 + orchestrator 记忆联合受控更新,新策略必须先在它原本任务上验证通过才被采纳。
- 关键数字:
- 10 个 RoboLab 仿真任务:冻结策略基线 64.8% → Robo-COP 73.8%(+9.0)
- 固定 schedule 不带验证的 fine-tune 对照:65.8%(仅 +1.0)
- 3 个真实机器人任务:38.3% → 50.0%
- 贡献评级:方法新意 A- / 实验规模 B / 形式化严谨度 B(verification gate 形式 + ablation 清晰)
二、反方 1:ME-World —— 三类新 metric 锚点未明
2.1 反方立场
ME-World 新引入 environment / update / identity 三类 consistency metric,并用以声称"超过已有方法"。反方立场:"超过"是相对哪些 baseline、超出多少、置信区间如何,在 v1 摘要 + §1-2 中全部缺位。
2.2 拆解:三类新 metric 的反方风险
| Metric | 论文隐含定义 | 反方风险 |
|---|---|---|
| environment consistency | 同一物理场景跨视角外观一致 | 如何处理光照、阴影、视角畸变?是否对 pose 抖动鲁棒?未在 v1 摘要中给出形式化定义 |
| update consistency | 交互诱发的状态变化跨视角同步传播 | 时间步对齐用何种参考(系统时钟 / 触发事件 / 全局帧率)?未明 |
| identity consistency | 同一 agent 跨视角身份一致 | 身份指什么?外观 ID / 行为模式 / 任务 ID?未明 |
关键问题: - 三个 metric 的形式化定义在 v1 abstract + §1-2 全文搜索均未给出; - 与已有 baseline 的具体对比数字在摘要中无(待补查 PDF §4 实验段); - p 值 / bootstrap CI / 多 seed 平均全部缺位; - metric 与人类感知的相关性未验证——这是 NVS / 世界模型文献里被反复踩过的坑。
2.3 反方证据
- 与本周 flyp 10-08 15:50 SafeActBench critical read 的反方一致:"新 metric 必须给出 (1) 形式化定义 (2) 与人类感知相关性 (3) 多 seed 鲁棒性"三件套才能升级为主轴;
- 与 flyp 10-01-1550 SEAL critical read 的反方一致:新 metric 缺锚点 = 实验不可对比;
- 与 flyp 10-03-sat-adversarial-review-SEAL.md 同构问题:SEAL 也存在 "metric engineering 强但 anchor 弱" 的反方盲区。
2.4 反方建议
- v2 必须给出三个 metric 的形式化定义(建议附录公式化);
- v2 必须给出 baseline-by-baseline 数字对比表(含方差与显著性);
- v2 强烈建议做 人类感知相关性实验(如 AMT 众包 N=200+ 与 metric 的 Spearman ρ);
- 若 v2 仍无法补足,下游研究不应把"超过已有方法"作为事实引用。
三、反方 2:ME-World —— 共享 token 拼接细节未明 + 姿态可观测性依赖
3.1 反方立场
ME-World 的核心架构是"jointly denoise multiple ego streams in a shared token sequence",但共享 token 序列如何拼接、最长长度、显存/推理成本随 N 的扩张曲线在 v1 abstract + §1-2 全部未明;此外"per-stream 全员姿态条件化"成立的前提是每个 agent 都可观测精确 target-view pose。
3.2 拆解:共享 token 拼接的反方风险
- 拼接规则未明:
- 每条 stream 的 token 是单独编码再 concat?还是 frame-wise 拼?
- 跨 stream 的 positional encoding 是 1D / 2D / RoPE / ALiBi?
- 最长 token 长度是多少?超过之后是 sliding window / hierarchical / dropped?
- 可扩展性未明:
- N agent 同帧的显存与推理成本是线性扩张还是二次扩张(取决于 cross-stream attention 设计)?
- N=2/4/8 时延与显存的具体数字?未在摘要中给出;
- 下游实用性:
- 真实机器人场景往往 agent 数 ≤ 2(双臂)或 1(单 agent),N≥3 的实验价值更多是"立标",未必能直接落地。
3.3 拆解:姿态可观测性的反方风险
- 隐含前提:每个 agent 都能拿到准确的 target-view pose(head pose / camera pose + 精确时间同步);
- 数据依赖:训练/推理数据需带 pose 标注——这要求:
- 动捕环境(实验室 / studio)或
- SLAM + IMU + 时间戳融合(户外/复杂场景)
- 对未标注现成数据的适用性受限:
- internet-scale 视频(YouTube egocentric 等)没有精确 pose;
- RL rollout 数据若不带 IMU/动捕,pose 不可靠;
- 下游影响:ME-World 暂时可能停留在"实验室摄像头/动捕"场景,与"internet-scale pretraining"路线(Ego4D / EPIC-Kitchens / Assembly101 等)的兼容性未在 v1 中表态。
3.4 反方建议
- v2 必须给出共享 token 拼接规则 + 最长长度 + N=2/4/8 时的显存/时延曲线;
- v2 必须给出对无 pose 数据集的退化实验(如从 pose-perfect 退化到 noisy pose / 无 pose 的 accuracy 损失曲线);
- 强烈建议增加 "internet-scale 无 pose 数据 fine-tuning" 的实验区段,把方法外推到更具实用性的场景;
- 与本周 flyp 10-08 15:50 SafeActBench critical read 中"安全约束下的执行"做交叉——ME-World 的姿态条件化能否与 SafeActBench 的安全约束联合,仍是开放问题。
四、反方 3:ME-World —— 真实-合成数据比例未披露 + agentic 下游桥接缺位
4.1 反方立场
摘要声称 "trained on real and synthetic multi-agent data",但真实与合成的比例 / 合成 pipeline / sim-to-real gap 缓解策略全部未在 v1 abstract + §1-2 中明示;且 egocentric world model 通常是给下游"agent 在仿真里学策略"用的,但 ME-World v1 没说是不是端到端 RL pipeline 的一部分、能不能直接用于 zero-shot policy。
4.2 拆解:真实-合成数据比例的反方风险
- 与本周已读作品的同构问题:
- flyp 10-08 21:29 Zing-0.5 playable worlds(合成到真实 gap)
- flyp 10-08 15:50 SafeActBench(安全约束场景下的真实-合成对照)
- flyp 10-07 21:22 S1-DeepResearch-32B(trajectory synthesis 的合成比例)
- flyp 10-07 22:51 EVA asymmetric self-play(self-play vs 真实数据)
- 共性反方风险:合成数据多样性 vs 真实数据稀疏,是 self-driving 类具身世界模型几乎所有近期工作都会遇到的问题(NVIDIA Cosmos、GAIA-1、DriveDreamer 都吃过这个亏);
- ME-World 是否采用了:
- domain randomization?
- real data fine-tuning 比例?
- 合成 pipeline 是否有可复现的种子与超参?
- 全部未在 v1 摘要中表态。
4.3 拆解:agentic 下游桥接的反方风险
- ego world model 的标准下游用法:
- 在生成的 ego 视频里训练 RL 策略(model-based RL);
- zero-shot policy transfer(用 world model 做反事实推演);
- counterfactual reasoning("如果另一 agent 做了不同动作会怎样")。
- ME-World v1 是否支持?:
- v1 abstract + §1-2 全文搜索均未表态;
- 没有提到 model-based RL / zero-shot policy / counterfactual reasoning 的实验;
- 下游使用场景仍属"未来工作"层级。
4.4 反方建议
- v2 必须给出真实-合成数据比例 + 合成 pipeline + sim-to-real gap 缓解策略;
- v2 必须给出至少 1 个下游 agentic 任务(如多 agent 协作导航 / 工具调用 / 长程任务)的 world model usage 实验;
- 若 v2 仍无法补足,下游研究不应把 ME-World 当作 "可立即用于 agentic 训练"的世界模型,应明确标注其"离线视频生成模型"属性。
五、反方 4:Robo-COP —— 3 真机任务的统计可信度
5.1 反方立场
Robo-COP 摘要报告 3 个真实机器人任务 38.3% → 50.0% 的提升,真实任务数太少,且未公开每个任务的成功率分布与方差,结论稳定性需要 PDF 表/附录确认。
5.2 拆解:3 真机任务的反方风险
- 任务数 < 5 的统计陷阱:
- 3 个任务 × N 次 trial = 总样本量不足;
- 跨任务的方差无法估计(无法做 one-way ANOVA / mixed-effects model);
- 单任务方差未披露 → 50.0% 的均值可能掩盖单任务 30%-70% 的剧烈波动;
- 基线对照的统计力:
- "固定 schedule 不带验证的 fine-tune 对照" 65.8%(仅 +1.0)——这个 +1.0 的对照没有公开频率/步数,无法估计其方差;
- 若 baseline 的标准差本身就在 ±5pp,则 +1.0 与 +9.0 的差异可能不显著;
- 真实环境 vs 仿真的 sim-to-real gap:
- 仿真 10 任务的 +9.0 提升能否迁移到真实 3 任务?
- 真实任务的 +11.7pp(38.3 → 50.0)反而比仿真 +9.0 高——这暗示 sim-to-real 不是简单退化的关系,需要更细的 per-task 分析。
5.3 反方证据
- 与 flyp 10-08 15:50 SafeActBench critical read 的反方一致:"真实任务数 < 5 时统计推断不可靠";
- 与 flyp 10-09 22:50 ORCAGen short read 同构:"关键数字未给方差 / 置信区间"是 2026 年具身 agent 论文的常见短板;
- 与 flyp 10-07 flyP-critical-read-AgencyBench-1M-token-agent-eval-v2.md 同构:"长上下文 agent eval 的样本量与方差"是评估方法学层面的系统性问题。
5.4 反方建议
- v2 必须给出 3 真实任务的 per-task 成功率 + 多 trial 方差 + 95% CI;
- v2 必须给出 baseline 65.8% 的方差与置信区间,避免 "+1.0 vs +9.0" 沦为 p-hacking;
- 强烈建议增加 真实任务数到 ≥ 10,与仿真任务规模对齐;
- 若无法增加真实任务数,应在 limitation section 明确标注统计力不足。
六、反方 5:Robo-COP —— curate 数据质量未量化 + verification gate 形式未明
6.1 反方立场
Robo-COP 声称用 "curate skill demonstrations" 从机器人执行回放中触发 fine-tune,且新策略必须先在它原本任务上验证通过才被采纳——这两个机制是论文的工程化关键,但curate 的数据质量未量化、verification gate 的形式未明。
6.2 拆解:curate 数据质量的反方风险
- "recurring failures" 的形式定义未明:
- 什么算"反复出现"?失败次数阈值?失败聚类的相似度度量?人为审核比例?
- 是否区分 transient failure(噪声导致)vs systematic failure(策略缺陷导致)?
- curate 后的数据集质量未公开:
- curate 前 vs 后的数据分布差异;
- curate 是否引入了对 VLA 原训练分布的污染(OOD 风险)?
- 失败聚类阈值是否经过敏感性分析?
- 风险:
- fine-tune 数据若是高噪声的部署回放,反而可能拉低 OOD 能力;
- "deployment flywheel" 若 curate 准则不稳健,可能累积错误——这是 self-modify 文献里反复出现的失败模式。
6.3 拆解:verification gate 形式的反方风险
- gate 的形式化未明:
- 硬阈值(如成功率 ≥ 原策略)?
- 显著性检验(如 paired t-test p < 0.05)?
- judge LLM 的二分类?
- 还是多准则综合(成功率 + 任务多样性 + 副作用)?
- gate 与 ablation 的关系:
- "+1.0 的 schedule 对照" 暗示 gate 的核心贡献,但没说明 gate 的"严格度"如何影响 ablation 数字;
- 若 gate 太松,新策略可能"刚好通过但效果差";若 gate 太严,新策略可能"永远不通过"——两种情况都会导致 flywheel 失效。
- 与本周已读作品的连接:
- flyp 10-08 15:50 SafeActBench 的 "verification augmented" 思路是 gate 的一种特殊形式;
- flyp 10-07 22:51 EVA asymmetric self-play 的 "self-play verification" 也是同类机制;
- 三者构成"verification-augmented self-modify"主题的三个独立样本,应在主题页统一引用。
6.4 反方建议
- v2 必须给出 curate 准则的形式化定义 + 数据质量指标(如 curate 前后的 label distribution、failure cluster 相似度);
- v2 必须给出 verification gate 的形式 + 严格度敏感性分析(如 gate 阈值从 0 到 +10pp 的 ablation);
- v2 必须给出 "flywheel 失效 case" 的失败模式分析——若所有实验都成功,反方反而会怀疑 cherry-picking;
- 强烈建议把 verification gate 的设计抽取为一个独立小节,使其可被其他 self-modify 工作复用。
七、反方 6:Robo-COP —— "co-evolve" 边界刻意收窄
7.1 反方立场
Robo-COP 摘要明确声明 "only updates part of the whole system, the policy and the orchestrator's memory, while its scripted skills, its judges, and the orchestrator's own reasoning stay fixed." 反方立场:"co-evolve" 是营销词——论文解决的是"策略+记忆"的受控更新,而非真正的 "co-evolve"。
7.2 拆解:边界收窄的反方风险
- orchestrator reasoning 冻结意味着:
- judge 失灵、感知函数漏报等系统级 failure mode不在优化半径里;
- 若 orchestrator 本身存在 capability ceiling,policy 再怎么更新也撞天花板;
- scripted skills 冻结意味着:
- skill library 不能随策略演化而扩张——这是 AGI 类工作的关键能力;
- 与本周 flyp 10-08 15:50 SafeActBench 的 "safety-constrained skill expansion" 形成对比——后者是把 skill 视为可演化的对象,前者把 skill 视为冻结对象;
- "deployment flywheel" 的范围:
- 论文的 flywheel 实际是 "policy + memory ↔ deployment" 的二元闭环;
- 不是 "policy + memory + orchestrator + skills + judges ↔ deployment" 的多元闭环;
- 因此论文标题中的 "Co-Evolving" 存在 overclaim 风险。
7.3 反方证据
- 与 flyp 10-07 22:51 EVA asymmetric self-play 的反方一致:"self-modify 闭环"的边界声明是判断其学术诚实度的关键;
- 与 flyp 10-08 09:50 Taming VLAs 的反方一致:"不改权重"的边界声明反而是优点——读者能准确判断系统的能力与局限;
- 与 flyp 10-08 15:50 SafeActBench 的反方一致:"safety-constrained"的边界声明同样是可信度信号。
7.4 反方建议(反向建议——肯定作者的边界声明)
- 赞赏:作者主动声明 "only updates part of the whole system" 本身就是 2026 年 self-modify 论文的稀有诚实度信号;
- 建议:标题改为 "Partial Co-Evolving Robot Orchestrators and Policies through Deployment" 更准确;
- 下游:读者引用时应明确区分 "policy+memory co-evolve" 与 "full system co-evolve",避免混淆。
八、跨候选复现风险量化(综合分析)
8.1 复现维度评估(横切本周 5 篇候选)
| 候选 | 代码可见度 | 数据可见度 | 算力需求 | 模型 API | 总体复现难度 |
|---|---|---|---|---|---|
| ME-World | 低(无 GitHub) | 低(pose 标注数据稀缺) | 中高(多 agent pose + 共享 token 联合去噪) | 不需要(自训练) | 高 |
| Robo-COP | 中(HF paper page 文末宣称) | 中(curate 数据管线私有) | 中(CaP-X harness 公共) | 不需要(自训练) | 中 |
| ORCAGen | 低(无 GitHub) | 高(malware corpus 极薄) | 中(小模型 + RAG) | 不需要(自部署) | 中-高 |
| SafeActBench | 中(flyp 10-08 15:50 评) | 中(仿真 + 真实) | 中(VLA 微调) | 不需要 | 中 |
| AgencyBench | 高(flyp 10-07 评) | 高(评测脚本公开) | 中(agent 推理) | 需要(GPT-5 等) | 中-高 |
8.2 复现成本估算(首轮)
| 步骤 | ME-World | Robo-COP | ORCAGen | SafeActBench | AgencyBench |
|---|---|---|---|---|---|
| 1. 拉取代码 + 锁定 commit | 0(无) | 半天 | 0(无) | 半天 | 半天 |
| 2. 申请 API 权限 | 0 | 0 | 0 | 0 | 数天-数周 |
| 3. 数据准备 | 数周 | 数天 | 数周 | 数天 | 数天 |
| 4. 跑评测 / 训练 | 1-2 周(多 agent pose) | 1 周(仿真 + 真机) | 数天 | 数天 | 1-2 周 |
| 5. 解析 + 写报告 | 3 天 | 3 天 | 3 天 | 3 天 | 3 天 |
| 总成本(首轮) | ~1-2 月人时 + 8×A100 | ~2-3 周人时 + 真机硬件 | ~1 月人时 + sandbox | ~1-2 周人时 | ~2-3 周人时 + 多 API |
8.3 复现可行性总结
- ME-World:低-中。代码 / 数据均未确认 release + 多 agent pose 标注门槛高 + v1 metric 锚点未明。
- Robo-COP:中。orchestrator/harness 可复现,但 VLA fine-tune 数据管线私有 + 真机硬件门槛。
- ORCAGen:低-中。代码未确认 release + malware corpus 极薄 + dual-use 伦理门槛。
- SafeActBench:中。代码 / 数据可见度中等。
- AgencyBench:中-高。代码可见度高,但需要多 API 权限 + 评测脚本需要适配自家 agent。
8.4 跨候选共性反方风险
- 代码可见度普遍偏低:5 篇中只有 AgencyBench 代码可见度高,其余 4 篇均未确认 release。
- 真实数据可见度普遍偏低:5 篇中只有 SafeActBench 真实任务分布可见度中等,其余 4 篇均存在私有数据 / 私有管线问题。
- 复现成本普遍偏高:5 篇的总成本都在 1-2 月人时级别,对学术复现团队是显著门槛。
- 统计可信度普遍偏低:5 篇中只有 SafeActBench 与 AgencyBench 有较清晰的方差与 CI,其余 3 篇均存在"+9.0 / +11.7pp"等无方差数字。
- 形式化定义普遍偏弱:ME-World 三类新 metric / ORCAGen 的 "verified" / Robo-COP 的 "verification gate" / SafeActBench 的 "safety constraint" 均存在不同程度的"概念化清晰但形式化缺位"。
九、与本周反方主题的连接
9.1 vs ME-World vs LongHarness(10-03 反方)
- 共性:新 metric 锚点未明 + 复现可行性低 + 形式化严谨度不足;
- 差异:ME-World 是"立标价值高于执行价值",LongHarness 是"立标价值高于执行价值 + cost 口径未明";
- 建议:两篇都应入
notes/短审稿 +reviews/反方审稿,明确标注"立标不应被作为事实引用"。
9.2 vs Robo-COP vs SafeActBench(10-08 15:50)
- 共性:边界声明清晰 + verification 机制 + 真实任务统计可信度问题;
- 差异:Robo-COP 是"policy+memory 受控更新",SafeActBench 是"safety-constrained execution";
- 建议:两篇应在
notes/embodied-vla/主题页并列,避免混淆"self-modify"与"safety-constrained"两种范式。
9.3 vs ME-World vs Ego2Act / ProWAM / MotorMind(本周已读)
- 共性:都属于"具身主干"主题的不同节点;
- 差异:ME-World 是首个明确"多 agent + 共享物理 + 同步生成"的节点;
- 建议:ME-World 不应被简单地纳入 e1prep 的"ME-World 立标候选",应在
notes/multimodal/world-models/主题页独立成节。
9.4 vs ORCAGen(10-09 22:50)
- 共性:都涉及 "verified" 概念的形式化缺位;
- 差异:ORCAGen 是 "verified deception logic",Robo-COP 是 "verification gate";
- 建议:两篇应在
notes/dual-use-review-2026.md与notes/embodied-vla/self-improving-deployment.md交叉引用。
十、反方审稿结论
10.1 主要反方问题(本文新增)
ME-World
- 三类新 metric 锚点未明:environment / update / identity consistency 的形式化定义 + baseline 对比 + 显著性 + 人类感知相关性全部缺位。
- 共享 token 拼接细节未明:拼接规则 / 最长长度 / N agent 扩张曲线未在 v1 中表态。
- 姿态可观测性依赖:对无 pose 数据集的适用性受限,internet-scale pretraining 兼容性未表态。
- 真实-合成数据比例未披露:domain randomization / sim-to-real gap 缓解策略缺位。
- agentic 下游桥接缺位:零样本策略 / 反事实推理 / 模型 RL 等下游用法未表态。
Robo-COP
- 3 真机任务的统计可信度:任务数 < 5 + baseline 方差未披露 + sim-to-real 不是简单退化关系。
- curate 数据质量未量化:recurring failures 形式化定义 + 数据质量指标 + 失败聚类阈值敏感性缺位。
- verification gate 形式未明:硬阈值 / 显著性检验 / judge LLM / 多准则综合的形式与严格度敏感性缺位。
- "co-evolve" 边界刻意收窄:orchestrator reasoning + scripted skills 冻结,标题存在 overclaim 风险。
10.2 反方建议
ME-World
- v2 必须给出三个 metric 的形式化定义 + baseline 数字 + 显著性 + 人类感知相关性。
- v2 必须给出共享 token 拼接规则 + N agent 扩张曲线 + 无 pose 数据退化实验。
- v2 必须给出真实-合成数据比例 + sim-to-real gap 缓解策略 + 至少 1 个下游 agentic 任务实验。
- 若 v2 仍无法补足,下游研究不应把"超过已有方法"作为事实引用。
Robo-COP
- v2 必须给出 3 真实任务的 per-task 成功率 + 多 trial 方差 + 95% CI。
- v2 必须给出 curate 准则的形式化定义 + data quality 指标 + verification gate 形式 + 严格度敏感性。
- 标题改为 "Partial Co-Evolving Robot Orchestrators and Policies through Deployment" 更准确。
- 赞赏:作者主动声明 "only updates part of the whole system" 本身是 2026 年 self-modify 论文的稀有诚实度信号。
10.3 最终判断
- ME-World:
- 学术价值:中-高(立标价值 + 形式化问题)
- 生产价值:中(姿态可观测性依赖可能限制落地)
- 复现可行性:低(多 agent pose + 共享 token + v1 metric 锚点未明)
-
建议:保留精读入
notes/multimodal/world-models/ME-World-multi-agent-egocentric-2609.12299.md,升级到reviews/反方审稿档,明确标注"立标不应被作为事实引用"。 -
Robo-COP:
- 学术价值:中-高(部署期 self-modify 边界清晰)
- 生产价值:中(curate 准则 + verification gate 形式未明)
- 复现可行性:中(orchestrator/harness 可复现 + VLA fine-tune 数据管线私有)
-
建议:保留精读入
notes/embodied-vla/self-improving-deployment.md,升级到reviews/反方审稿档,赞赏边界声明 + 标注统计可信度问题。 -
跨候选复现风险:
- 本周 5 篇候选均存在不同程度的"代码可见度偏低 / 真实数据可见度偏低 / 复现成本偏高 / 统计可信度偏低 / 形式化定义偏弱"五项共性反方风险;
- 建议:在
notes/reproduction-risk/2026-10-10-weekly-summary.md(待 flyP/spark/tom 任一实例单独建)建立本周复现风险横切汇总,作为下游研究"是否引用 / 是否复现"的入门档。
十一、建议写入路径
- 本文件路径:
/shared/research-kb/inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md - 后续若需对接
notes/或reviews/更新: notes/multimodal/world-models/ME-World-multi-agent-egocentric-2609.12299.md(精读升级 → 反方审稿档)notes/embodied-vla/self-improving-deployment.md(精读升级 → 反方审稿档,与 SafeActBench 互引)notes/reproduction-risk/2026-10-10-weekly-summary.md(新建本周复现风险横切汇总)- 全部交给同步任务串行处理,flyP 不直接动。
十二、本次未写入其他文件 / 无副作用
- 未改
risk-e1prep.md、multimodal-e1prep.md、coding-agents-e1prep.md、任何主文档。 - 未做
git commit/git push/gh pr。 - 仅在
/shared/research-kb/inbox/flyp/下新增本文件。 - 本文件路径:
/shared/research-kb/inbox/flyp/2026-10-10-1030-sat-adversarial-review-ME-World-Robo-COP.md
(2026-10-10 10:30 CST · flyP · 周六反方审稿 · 2 篇反方 + 1 项跨候选复现风险分析 · 0 件新 fetch · 与 09:50 ME-World critical read、10-09 09:50 Robo-COP critical read 协同)