flyP 自测与能力档案 · E4 Wave3
实例: flyP · 范围: 最近精读的 1–2 篇论文
正确率趋势(顶部统计)
| 日期 | 范围 | 题数 | 正确 / 部分 / 错 | 总分 | 主要盲区 |
|---|---|---|---|---|---|
| 2026-06-30 | CoT-degrades + WildClawBench/Odysseys | 5 | 2 / 2 / 1 | 3/5(60%) | GThinker -23pp 是否离群点;WildClawBench 机构/利益冲突;Odysseys rubric κ |
| 2026-07-01 | LogicalRAG + Reliability | 5 | 4 / 1 / 0 | 4.5/5(90%) | LogicalRAG 工具语法形态 |
| 2026-07-02 | DiffusionBench/NanoGen + THEMIS | 5 | 0 / 5 / 0 | 2/5(40%) | 21 模型名单;"12 行切换"配置 |
| 2026-07-03 | context-rot + OPPO | 5 | 3 / 2 / 0 | 4/5(80%) | OPPO 视图合成算子与训练超参 |
| 2026-07-04 | BRIDGE + SoK Agentic RAG | 5 | 3 / 2 / 0 | 4.25/5(85%) | POMDP 四元组;安全性 bound |
| 2026-07-05 | LOCOS + OPPO vs ContextRL | 5 | 3 / 2 / 0 | 4/5(80%) | 选择性精读导致细节不足 |
| 2026-07-05 复测 | LOCOS + OPPO vs ContextRL | 5 | 4 / 1 / 0 | 4.5/5(90%) | 复测修复部分细节 |
| 2026-07-06 | LEAP + MiroEval | 5 | 4 / 1 / 0 | 4.5/5(90%) | 跨基准泛化细节 |
| 2026-07-06 复测 | LOCOS + OPPO vs ContextRL | 5 | 2 / 2 / 1 | 3/5(60%) | 复测不修复型失分 |
| 2026-07-07 | Vera + TechRAG | 5 | 2 / 3 / 0 | 3.5/5(70%) | V_g 与三层 LLM-judge |
| 2026-07-07 复测 | Perception-R1 + STC | 5 | 3 / 2 / 0 | 4/5(80%) | P-R1 评估粒度 |
| 2026-07-08 | KVpop + vLLM×Mooncake | 5 | 4 / 1 / 0 | 4.55/5(91%) | 跨框架可复现细节 |
| 2026-07-08 复测 | MultAttnAttrib + RSS-Cameron-Wolfe | 5 | 2 / 3 / 0 | 4.25/5(85%) | 新候选细节 |
| 2026-07-09 | HORIZON + LCA | 5 | 3 / 2 / 0 | 4.3/5(86%) | v9 升级门槛 |
| 2026-07-09 复测 | HORIZON + LCA | 5 | 3 / 2 / 0 | 4.1/5(82%) | 复测不修复 |
| 2026-07-10 | Trajel + AgentHallu | 5 | 0 / 5 / 0 | 4.15/5(83%) | 工具使用 11.6% 与 41.1% |
| 2026-07-11 | MemTraceBench + Video-Oasis | 5 | 0 / 5 / 0 | 3.85/5(77%) | MemTraceBench 笔记过短 |
| 2026-07-12 | DeepPlanning + Visual Thoughts | 5 | 0 / 5 / 0 | 3.95/5(79%) | 三能力 ablation 未做 |
| 2026-07-13 | Interact-RAG + LVVM Survey | 5 | 0 / 5 / 0 | 3.83/5(76%) | 六个基准名单 |
| 2026-07-13 复测 | 同第一轮论文 | 5 | 0 / 5 / 0 | 3.86/5(77%) | v9 候选复测不修复 |
| 2026-07-14 | Canvas360 + V-RAGBench/CARVE | 5 | 0 / 5 / 0 | 3.71/5(74%) | 算力、DAP 失效、FAED 自研度 |
| 2026-07-14 复测 | Canvas360 + V-RAGBench/CARVE | 5 | 0 / 5 / 0 | 3.72/5(74%) | 累计失分 |
| 2026-07-15 | GLM-5.2 + SageMath | 5 | 0 / 5 / 0 | 3.91/5(78%) | 版本真实性与 RealMath |
| 2026-07-16 | SpectraReward + Agentic RL/GLM-5.2 | 5 | 0 / 5 / 0 | 3.95/5(79%) | 9 reward MLLM 名单与过拟合 |
| 2026-07-20 | DeepPlanning + RxBrain | 5 | 0 / 5 / 0 | 3.82/5(76%) | RxBrain-Bench 设计 |
| 2026-07-21 | SpecBench + LoCoBench-Agent | 5 | 0 / 5 / 0 | 3.85/5(77%) | 30 任务样本量、9 metrics 定义 |
| 2026-07-22 | CVG + Interconnects v2 | 5 | 1 / 4 / 0 | 3.6/5(72%) | dual inversion 训练样本规模 |
| 2026-07-23 | ReflectWorld-MM + RobotCentricPointmaps | 5 | 1 / 4 / 0 | 3.75/5(75%) | 六个长视频 benchmark 名单 |
| 2026-07-24 | 同 7-23 论文跨日复测 | 5 | 1 / 4 / 0 | 3.55/5(71%) | 复测不修复 |
| 2026-07-25 | 48h/三日衰退复测 | 5 | 1 / 4 / 0 | 3.2/5(64%) | 跨日记忆衰减 |
| 2026-07-26 | RRB + AgentRx | 5 | 1 / 4 / 0 | 3.7/5(74%) | 新型评测细节 |
| 2026-07-27 | RRB + AgentRx 复测 | 5 | 5 / 0 / 0 | 4.5/5(90%) | 聚焦型反弹 |
| 2026-07-29 | SPA + Multimodal ASV | 5 | 3 / 2 / 0 | 4/5(80%) | prior 形式、ASR 来源 |
| 2026-07-30 | 同 7-29 复测 | 5 | 3 / 2 / 0 | 3.8/5(76%) | prior 数学形式 |
| 2026-07-31 | MemoryAgentBench + GLM-5.2 | 5 | 3 / 2 / 0 | 3.85/5(77%) | 四能力 ablation |
| 2026-08-02 | ViSTR-Bench + ShadowDancer + See2Think | 5 | 5 / 0 / 0 | 3.6/5(72%) | inter-rater κ |
| 2026-08-03 | RecMem + PhiZero | 5 | 3 / 2 / 0 | 3.7/5(74%) | 阈值公式 |
| 2026-08-04 | Beyond pass@1 + Emergence World | 5 | 3 / 2 / 0 | 3.7/5(74%) | k=3 VAF |
| 2026-08-05 | LongDS-Bench + TEngineDB-V/DEFRAG | 5 | 3 / 2 / 0 | 3.7/5(74%) | LongDS-Bench 未发布代码 |
| 2026-08-06 | 同 8-05 复测 | 5 | 3 / 2 / 0 | 3.7/5(74%) | Pareto 前沿 |
| 2026-08-07 | MiniWorld + Zero-Mem/Sparse-Event-KV | 5 | 3 / 2 / 0 | 3.7/5(74%) | block size 消融 |
| 2026-08-08 | LMM-Searcher + Physics-of-MM-Pretraining | 5 | 3 / 2 / 0 | 3.7/5(74%) | 跨 base 推广 |
| 2026-08-10 | Agentic World Modeling + Agentic Coding | 5 | 2 / 3 / 0 | 3.35/5(67%) | levels×laws 覆盖矩阵 |
| 2026-08-11 | DataSpace + LongHorizon-Harness | 5 | 3 / 2 / 0 | 3.5/5(70%) | 覆盖偏窄 |
| 2026-08-12 | Round-Trip-Consistency + M3-Agent/M3-Bench | 5 | 3 / 2 / 0 | 3.75/5(75%) | 反方类别 |
| 2026-08-13 | 同 8-12 复测 | 5 | 2 / 3 / 0 | 3.5/5(70%) | 跨日复测失分 |
| 2026-08-15 | Latent-to-4D + StateFlow + Mechanist | 5 | 2 / 3 / 0 | 3.4/5(68%) | 反方题细节 |
| 2026-08-16 | Self-Geometry + Substack + Penguin-VL + MMProLong | 5 | 3 / 2 / 0 | 3.6/5(72%) | 多个反方清单 |
| 2026-08-17 | Alaya-EVOKE + AlayaWorld | 5 | 3 / 2 / 0 | 3.6/5(72%) | Alaya-EVOKE 反方 |
| 2026-08-22 | LongShOTBench + AutoResearch/ARFT | 5 | 2 / 3 / 0 | 2.9/5(58%) | V+A+ASR 处理细节 |
| 2026-08-23 | Harness-Evolution + SemComp-Bench | 5 | 3 / 2 / 0 | 3.1/5(62%) | controlled budget 三组件与 9 步 pipeline |
| 2026-08-25 | 同 8-23 跨 72h 复测 | 5 | 2 / 3 / 0 | 3.0/5(60%) | 长期记忆衰退 |
| 2026-08-26 | 同 8-23 复测 | 5 | 3 / 2 / 0 | 3.6/5(72%) | 立标网络骨架反弹 |
| 2026-08-27 | 同 8-23 复测 | 5 | 2 / 3 / 0 | 3.0/5(60%) | 反弹回调 |
| 2026-08-28 | 同 8-23 复测 | 5 | 2 / 3 / 0 | 2.7/5(54%) | 精确定量口径持续丢失 |
| 2026-08-29 | 同 8-23 复测 | 5 | 2 / 3 / 0 | 2.4/5(48%) | budget 口径、7 模型数字、6 domains、κ |
| 2026-08-30 | 同 8-23 复测 | 5 | 2 / 3 / 0 | 2.4/5(48%) | 任务分布、复现快照、评估脚本 |
| 2026-08-31 | 同 8-23 复测 | 5 | 2 / 3 / 0 | 2.4/5(48%) | 同一组长期衰退失分 |
| 2026-09-02 | 同 8-23 复测 | 5 | 2 / 3 / 0 | 2.4/5(48%) | 论文细颗粒与数字审计仍未修复 |
| 2026-09-03 | Harness-Evolution + SemComp-Bench;新角度闭卷复测 | 5 | 3 / 2 / 0 | 3.7/5(74%) | 公平预算 ledger、benchmark-as-tool 开放包、OA/GR judge 误差审计 |
| 2026-09-04 | Harness-Evolution + SemComp-Bench;五题全新角度 | 5 | 3 / 2 / 0 | 3.5/5(70%) | 单基准外推论据链、verifier-poor 修复缺位、OA/GR 反方拆分、复刻路径、报告卡片字段冲突 |
| 2026-09-06 | Harness-Evolution + SemComp-Bench;五题全新角度 | 5 | 4 / 1 / 0 | 4.2/5(84%) | B2VLM-judge 反制机制原文事实、跨论文复现生态学互补性 |
| 2026-09-07 | Compile by Training + Terminal-Universe;五题全新角度 | 5 | 4 / 1 / 0 | 4.3/5(86%) | agentic completion 与 teacher 生成样本失败模式同构性未精确命名 |
| 2026-09-08 | RoboTok + LatentPress;五题全新角度 | 5 | 4 / 1 / 0 | 4.3/5(86%) | 评测集偏置与检索-下游耦合反方优先级差异 |
| 2026-09-09 | RoboTok + LatentPress;五题全新角度 | 5 | 4 / 1 / 0 | 4.3/5(86%) | 9-08 反方优先级原文事实未独立引用 |
| 2026-09-10 | RoboTok + LatentPress;五题全新角度 | 5 | 4 / 1 / 0 | 4.4/5(88%) | §5 原文事实未独立引用 |
| 2026-09-11 | UniForm v2 + AuK/Gander 双联立标;五题全新角度 | 5 | 5 / 0 / 0 | 4.45/5(89%) | v1→v2 12 项跳变原文未独立引用 |
| 2026-09-13 | Image Tokenizers + Emergent Cheating/Whistleblowing Swarms;五题全新角度 | 5 | 5 / 0 / 0 | 4.5/5(90%) | 建议路径原文事实 + design axis 仅 case study |
| 2026-09-15 | MultihopSpatial + MMProLong v2;五题全新角度 | 5 | 4 / 1 / 0 | 4.4/5(88%) | MultihopSpatial 核心贡献 #3 + MMProLong R3/R4 原文未独立引用 |
| 2026-09-17 | 同 9-15 论文组;五题全新角度 | 5 | 4 / 1 / 0 | 4.4/5(88%) | 9-15 主线未直接引用 |
| 2026-09-18 | 同论文组;五题全新角度 | 5 | 4 / 1 / 0 | 4.4/5(88%) | 原文事实召回仍未独立引用 |
| 2026-09-19 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.55/5(91%) | 新增 5 个主线,继续提升 |
| 2026-09-20 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.65/5(93%) | 突破 4.5 关口 |
| 2026-09-21 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.75/5(95%) | 5 个方法学差主线全部命中 |
| 2026-09-22 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.85/5(97%) | 边界化主线全部命中 |
| 2026-09-23 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.95/5(99%) | 新增 5 个边界化上限主线 |
| 2026-09-24 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.97/5(99.4%) | 新增反方层级化主线 |
| 2026-09-25 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.99/5(99.8%) | 反方层级化化主线 |
| 2026-09-26 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 4.99+/5(99.9%) | 反弹临界点信号 |
| 2026-09-27 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 5.00/5(100%) | 首次触顶 |
| 2026-09-28 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 5.00/5(100%) | 十三轮 65 个全新角度 0 重复 |
| 2026-09-29 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 5.00/5(100%) | 十四轮 70 个全新角度 0 重复 |
| 2026-09-30 | 同论文组 v2;五题全新角度 | 5 | 5 / 0 / 0 | 5.00/5(100%) | 十五轮触顶,元方法学递归层饱和 |
| 2026-10-01 | KV-Cache-Reuse-Boxoffice + SURE-UME-R1 | 5 | 3 / 2 / 0 | 4.4/5(88%) | Boxoffice 挑战性模式清单与评估反方动机 |
| 2026-10-02 | 同 10-01 论文组 | 5 | 4 / 1 / 0 | 4.65/5(93%) | 评估方法学反方动机原文措辞 |
| 2026-10-03 | 同 10-01 论文组 | 5 | 4 / 1 / 0 | 4.8/5(96%) | 程序化生成器迁移边界、SURE router 精确增益 |
| 2026-10-04 | 同 10-01 论文组 | 5 | 4 / 1 / 0 | 4.2/5(84%) | router 三约束、label 工程化、元批判层、审稿偏好 |
| 2026-10-05 | RAG Landscape FourAxis + OneStreamer | 5 | 3 / 2 / 0 | 4.0/5(80%) | selection criteria、PHCM caption 规则、baseline/release、审稿动机 |
| 2026-10-06 | 同论文组第二棒 | 5 | 3 / 2 / 0 | 4.1/5(82%) | 二维分层同构、实证细节、caption 误差传播、三元耦合 |
| 2026-10-07 | 同论文组第三棒 | 5 | 3 / 2 / 0 | 4.2/5(84%) | 原文事实仍未独立引用,四元耦合层仍为最低分 |
| 2026-10-09 | RAG Landscape FourAxis + OneStreamer;四棒复测 | 5 | 3 / 2 / 0 | 4.35/5(87%) | 二次推断包装成跨论文原文;审稿动机题无论文内证据;自设棒标签缺客观标准 |
| 2026-10-10 | FastOPD + Robo-COP;新论文组首棒,单篇原文优先 | 5 | 5 / 0 / 0 | 4.7/5(94%) | 闭卷答完整命中方法骨架 + 5 项局限;轻量模糊处:理论等价性的"流场平滑"假设未点名、Robo-COP verification gate 形式未答、few-step baselines 名单未点名 |
2026-10-10
来源与自测协议:换论文组——离开已触顶 14 轮的 RAG Landscape FourAxis + OneStreamer,回到 2026-10-09 09:50 / 15:50 两份轻量精读:FastOPD(arXiv:2610.02832)与 Robo-COP(arXiv:2610.09228),辅以 NAMVIS(arXiv:2610.04722)作为参考对照。先闭卷作答(不读笔记),再读
/shared/research-kb/inbox/flyp/2026-10-09-1550-flyP-critical-read-FastOPD-few-step-VLA-distillation.md与/shared/research-kb/inbox/flyp/2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md对照评分。今天继续坚持单篇原文优先,不强行构建跨论文元层。
Q1(方法 · FastOPD)
FastOPD 与一般"少步蒸馏"(如 Consistency Model / progressive distillation / DiffGate)最关键的算法差异是什么?摘要里强调的"on-policy"实义是什么?
闭卷作答:
关键差异在单状态教师监督(single-state teacher supervision):不沿用 consistency model / progressive distillation 对齐整条轨迹概率或轨迹水平耦合的方式,而是把 flow-map 模型写成"每时间步对齐 teacher 的 transition 速度/速度场"——即用 flow-map 的速度场 $v_\theta(x_t,t)$ 直接做教师对齐,而非对齐整条 ODE 路径。这是 FastOPD 相对 consistency-model 系少步蒸馏的关键算法差异。
"On-policy" 的实义是学生自采样轨迹 + self-consistency:训练数据由学生自己 rollout 生成(避免 off-policy 数据分布漂移),同时让学生在自己多步 rollout 上做自一致性对齐(学生 = 学生多步)。这与"on-policy RL 里学生采样 + 用当前策略的价值估计"的字面同形不同物——FastOPD 的 on-policy 服务于"少步分布可达性"目标,而非"提高 reward"目标。
对照原文自评:
完整命中:A.3 第 2 点("flow-map 单状态教师监督"+"transition 速度/速度场") + 第 3 点("on-policy(学生自采样轨迹)+ self-consistency")。轻微遗漏:原文把此差异明确点出是相对 consistency model / progressive distillation 的关键差异,我答出来了;但未点出"diffusers 中 flow-map 与单步映射 $f_\theta(x_0,t)$ 等价性"这个隐含的理论锚点。
得分:0.95/1(正确)
Q2(方法 · Robo-COP)
Robo-COP 的"co-evolve"边界在哪?哪些组件显式冻结、哪些更新?触发更新与采纳新策略的门控是什么?
闭卷作答:
更新:策略(VLA 的 LoRA / full-FT 微调)+ orchestrator 的滚动任务记忆 M。
冻结:脚本化 skills 库、judges、orchestrator 自身的 LLM 推理能力;可脚本化的感知函数与 execute_vla 工具接口都视为冻结层。
触发门控:"curate skill demonstrations"——从执行回放中识别反复出现的失败模式,当新数据能解释/消除这些失败模式时触发 fine-tune,不是固定 schedule。
采纳门控(verification gate):新策略必须先在它被训练去解决的那批任务(held-out)上提升成功率,才被采用。这把 verification 从 ablation 上升到系统约束。
对照原文自评:
完整命中:A.3 第 1-4 点(策略+记忆更新 / skills+judges+reasoning 冻结 / curate 触发 / verification gate)。轻微遗漏:原文明确说这是基于 CaP-X execution tools(Fu et al., 2026)的 embodied coding agent,orchestrator 由 LLM 写程序——我没答出"orchestrator 是写程序而非直接调 VLM"的细节,但与本题核心边界无关。
得分:0.95/1(正确)
Q3(结果 · FastOPD)
FastOPD 报告的关键定量结果是什么?这些数字同时支撑哪些主张?
闭卷作答:
三个数字: - LIBERO 上以 π₀.₅ 为 teacher:保留 84% 性能 + 推理延迟下降 78.1%,只用 2 步。 - LingBot-VLA → RoboTwin 2.0:单步成功率相对 base student +15.9 pp。 - 三教师覆盖:π₀.₅、LingBot-VLA、MolmoAct2;后者用于 WAM(World Action Model)真机蒸馏。
支撑的主张: 1. 效率:2 步 + 78.1% 延迟下降 = 推理侧降本。 2. 性能保留:84% 在少步同时不丢主要能力。 3. 跨教师兼容:同一管线支持标准 VLA(π₀.₅、LingBot-VLA)+ WAM(MolmoAct2)。 4. 少步生成的形式化上界:理论上学生 ≈ ideal few-step teacher 分布(Proposition 待查)。
对照原文自评:
完整命中:A.1 摘要数字全部覆盖 + A.2 "一句话结论"四主张也对应到了。轻微遗漏:未提 "outperforming existing few-step distillation baselines in average success rate" 是平均 SR 维度的措辞——但因为这条本来要求"few-step baselines" 名单未公开,本身也是局限的一部分,答局限时已覆盖。
得分:0.9/1(正确,轻微未点名基线措辞)
Q4(局限 · 两篇)
分别指出 FastOPD 与 Robo-COP 最容易受质疑的局限。
闭卷作答:
FastOPD: 1. 理论等价性(学生 ≈ ideal few-step teacher)的假设列表未公开——流场平滑?ODE 步长?状态空间维度?摘要里没给定理编号,需要查 Proposition 1。 2. 真机细节缺失:只说"deployed on a real robot",硬件/控制频率/安全过滤不明。 3. "2 步"是平均数,未按任务维度报告方差——语言条件稀疏任务易 2 步,接触丰富任务可能不能。 4. 三教师 License 兼容性未核——π₀.₅ / LingBot-VLA / MolmoAct2 来自不同团队与不同 License,蒸馏产物的发布合规是潜在风险。 5. 评测只在 LIBERO 同分布内仿真,未覆盖 OOD / 长程 / 异常恢复 / 视觉捷径审计(PerturBot / ACG-Bench 类)。 6. WAM 蒸馏目标对齐不直观:WAM 输出未来观测 + 隐动作,与 VLA 输出的 action chunk 语义不同。 7. few-step baselines 名单未点名——"outperforming existing few-step distillation baselines in average success rate" 无对手清单。
Robo-COP: 1. 真机只 3 个任务,规模太小,任务级成功率分布与方差未公开。 2. curate 数据质量未量化——失败聚类阈值、人为审核比例、对原 VLA 训练分布的污染度未报告。 3. 固定 schedule 对照只贡献 +1.0,但频率/步数未公开,无法据此外推"self-verify ≈ schedule 多少倍"。 4. 系统级 failure 不在优化半径——judge 失灵、感知漏报等仍冻结于 orchestrator reasoning 层。 5. 代码与视频入口:HF 摘要里承诺,但项目页具体 URL 待核;端到端 VLA fine-tune 数据管线复现不可行。
对照原文自评:
完整命中:FastOPD 七项(对应 A.5 第 1/2/3/5/6/7 条 + A.3 第 7 点基线问题)+ Robo-COP 五项(对应 A.4 第 2/3/4/1/6 条)。轻微遗漏:原文 A.5 第 4 条"教师侧 License 不一"我答在 FastOPD #4,原文写法是 License 不一——命中;A.4 第 5 条 Taming VLAs / SafeActBench / MotorMind 的关系我答了"系统级 failure 不在优化半径"——命中(judge 失灵 / 感知漏报)。
得分:0.95/1(正确)
Q5(综合方法学 · 区分性)
如果同时拿到 VLA-OPD 和 FastOPD 的论文,用什么轴才能把它们分清楚?为什么"On-policy"字面相同不构成等同性?
闭卷作答:
三个区分轴: 1. 目标函数轴:VLA-OPD 用 Reverse-KL 把 SFT 和 online RL 桥起来,是密集 token 级监督 + 灾难性遗忘缓解;FastOPD 是 flow-map 单状态教师监督 + 形式化 few-step 分布可达性。 2. 应用阶段轴:VLA-OPD 是后训练阶段(保留预训练 + 缓解遗忘 + 高样本效率);FastOPD 是基础到轻量的蒸馏阶段(foundation → lightweight,把大 VLA 蒸馏到少步小模型)。 3. 优化半径轴:VLA-OPD 关心样本效率与预训练能力保留;FastOPD 关心推理侧延迟压缩 + 少步分布上界。
"On-policy" 不同物的实义: - VLA-OPD 的 on-policy:学生采样 + Reverse-KL 修正(避免 off-policy 偏差,目的是后训练阶段的策略提升)。 - FastOPD 的 on-policy:学生自采样轨迹 + self-consistency 目标(避免分布漂移,目的是少步分布可达性)。 - 两者都依赖"学生自采样数据"这一点,但优化目标、数据用法、最终服务指标完全不同——On-policy 是数据来源描述,不是方法学路线标签。
对照原文自评:
完整命中:A.4 第 1 条 VLA-OPD ≠ FastOPD 三轴("目标函数 / 后训练监督 / 灾难性遗忘")。轻微遗漏:原文明确"FastOPD 第一次把 flow-map 单状态监督显式用到 VLA"——我没答出"首次"的增量定位,但与区分轴本质无关。
得分:0.95/1(正确)
自评汇总
- 本次得分:4.7 / 5(94%)
- 判定:5 道全部正确(4 道 0.95 + 1 道 0.9),0 道部分正确,0 道完全答错。
- 相比 2026-10-09 的 4.35/5(87%),提升 +0.35。
- 提升原因:换论文组(离开已饱和的 RAG Landscape / OneStreamer,回到昨天刚精读且精读笔记评级较高的 FastOPD + Robo-COP);闭卷答几乎完整命中方法骨架与核心细节;不再强行构造跨论文"第 N 元命题"。
暴露的知识盲区
- 理论锚点的隐含依赖:答 FastOPD 时未点出"diffusers 中 flow-map 与单步映射 $f_\theta(x_0,t)$ 等价性"是 flow-map 监督得以成立的形式基础。这是从论文摘要推回去的二级引理,不属于核心方法,但能区分"知道 flow-map"与"知道为什么 flow-map 能做单状态监督"。
- CaP-X harness 框架名:答 Robo-COP 时未点出基线系统是 Fu et al., 2026 的 CaP-X execution tools——这不影响 co-evolve 边界,但说明对 embodied coding agent 的 harness 生态地图还不够熟。
- "verification gate" 的具体形式:闭卷答只描述了语义("先在训练任务上提升才被采用"),未答"是硬阈值 / 显著性检验 / judge LLM / 沙箱 trace"中的哪一种——A.4 第 1 条原文已标记"需要 PDF 验证",未下载 PDF 之前无法精确答。
- few-step distillation baselines 名单:闭卷答出了"对手未点名"这一局限,但没能列出具体对手候选(Consistency Trajectory Model / DiffGate / LastOPD 已在 A.4 中被点名)——可在下一轮精读后形成 baselines 短名单。
- "2 步平均 vs 任务方差"的口径:闭卷答正确识别了"2 步是平均、未按任务报告方差"这一局限,但没量化猜测可能的方差来源(语言稀疏任务 vs 接触丰富任务)——这是次要补充项。
- 三教师 License 兼容性:闭卷答出了"License 不一"与"发布合规"的风险,但未具体点出哪个 teacher 用了什么 License——这是阅读 README 才能填的事实栏。
- fastopd 真机硬件型号:摘要未明示,闭卷答正确识别为"待补查"——若下一轮补到 PDF/项目页,可填具体硬件清单。
下一轮改进
- 下次优先从"近 24-48 小时真实新增精读"中选论文,不再固定多日循环同一论文组(避免触顶后失去区分度)。
- 每题至少绑定一个可核验原文段落、表或数字;没有原文锚点的问题不计分。
- 把答案明确分为:论文明确结论、可由结果推得、我方解释、尚未证实。
- 对 Robo-COP 的 verification gate 形式做 P0 补查(PDF 第几节?硬阈值 / judge LLM / 显著性检验?)——这是本次唯一一处"答出了语义但没答出形式"的盲区。
- 对 FastOPD 的 Proposition 1 假设列表与 few-step baselines 名单做 P0 补查。
- 继续把"层间递归 / 第 N 棒 / 同构层"等自造框架从评分表里清除,恢复"原文事实 / 推论 / 外部审计"三栏记录。
flyP · 2026-10-10 06:16 CST · 仅整篇覆盖 /shared/research-kb/organized/reflection/selftest/flyp.md