flyP 自测与能力档案 · E4 Wave3

实例: flyP · 范围: 最近精读的 1–2 篇论文

正确率趋势(顶部统计)

日期 范围 题数 正确 / 部分 / 错 总分 主要盲区
2026-06-30 CoT-degrades + WildClawBench/Odysseys 5 2 / 2 / 1 3/5(60%) GThinker -23pp 是否离群点;WildClawBench 机构/利益冲突;Odysseys rubric κ
2026-07-01 LogicalRAG + Reliability 5 4 / 1 / 0 4.5/5(90%) LogicalRAG 工具语法形态
2026-07-02 DiffusionBench/NanoGen + THEMIS 5 0 / 5 / 0 2/5(40%) 21 模型名单;"12 行切换"配置
2026-07-03 context-rot + OPPO 5 3 / 2 / 0 4/5(80%) OPPO 视图合成算子与训练超参
2026-07-04 BRIDGE + SoK Agentic RAG 5 3 / 2 / 0 4.25/5(85%) POMDP 四元组;安全性 bound
2026-07-05 LOCOS + OPPO vs ContextRL 5 3 / 2 / 0 4/5(80%) 选择性精读导致细节不足
2026-07-05 复测 LOCOS + OPPO vs ContextRL 5 4 / 1 / 0 4.5/5(90%) 复测修复部分细节
2026-07-06 LEAP + MiroEval 5 4 / 1 / 0 4.5/5(90%) 跨基准泛化细节
2026-07-06 复测 LOCOS + OPPO vs ContextRL 5 2 / 2 / 1 3/5(60%) 复测不修复型失分
2026-07-07 Vera + TechRAG 5 2 / 3 / 0 3.5/5(70%) V_g 与三层 LLM-judge
2026-07-07 复测 Perception-R1 + STC 5 3 / 2 / 0 4/5(80%) P-R1 评估粒度
2026-07-08 KVpop + vLLM×Mooncake 5 4 / 1 / 0 4.55/5(91%) 跨框架可复现细节
2026-07-08 复测 MultAttnAttrib + RSS-Cameron-Wolfe 5 2 / 3 / 0 4.25/5(85%) 新候选细节
2026-07-09 HORIZON + LCA 5 3 / 2 / 0 4.3/5(86%) v9 升级门槛
2026-07-09 复测 HORIZON + LCA 5 3 / 2 / 0 4.1/5(82%) 复测不修复
2026-07-10 Trajel + AgentHallu 5 0 / 5 / 0 4.15/5(83%) 工具使用 11.6% 与 41.1%
2026-07-11 MemTraceBench + Video-Oasis 5 0 / 5 / 0 3.85/5(77%) MemTraceBench 笔记过短
2026-07-12 DeepPlanning + Visual Thoughts 5 0 / 5 / 0 3.95/5(79%) 三能力 ablation 未做
2026-07-13 Interact-RAG + LVVM Survey 5 0 / 5 / 0 3.83/5(76%) 六个基准名单
2026-07-13 复测 同第一轮论文 5 0 / 5 / 0 3.86/5(77%) v9 候选复测不修复
2026-07-14 Canvas360 + V-RAGBench/CARVE 5 0 / 5 / 0 3.71/5(74%) 算力、DAP 失效、FAED 自研度
2026-07-14 复测 Canvas360 + V-RAGBench/CARVE 5 0 / 5 / 0 3.72/5(74%) 累计失分
2026-07-15 GLM-5.2 + SageMath 5 0 / 5 / 0 3.91/5(78%) 版本真实性与 RealMath
2026-07-16 SpectraReward + Agentic RL/GLM-5.2 5 0 / 5 / 0 3.95/5(79%) 9 reward MLLM 名单与过拟合
2026-07-20 DeepPlanning + RxBrain 5 0 / 5 / 0 3.82/5(76%) RxBrain-Bench 设计
2026-07-21 SpecBench + LoCoBench-Agent 5 0 / 5 / 0 3.85/5(77%) 30 任务样本量、9 metrics 定义
2026-07-22 CVG + Interconnects v2 5 1 / 4 / 0 3.6/5(72%) dual inversion 训练样本规模
2026-07-23 ReflectWorld-MM + RobotCentricPointmaps 5 1 / 4 / 0 3.75/5(75%) 六个长视频 benchmark 名单
2026-07-24 同 7-23 论文跨日复测 5 1 / 4 / 0 3.55/5(71%) 复测不修复
2026-07-25 48h/三日衰退复测 5 1 / 4 / 0 3.2/5(64%) 跨日记忆衰减
2026-07-26 RRB + AgentRx 5 1 / 4 / 0 3.7/5(74%) 新型评测细节
2026-07-27 RRB + AgentRx 复测 5 5 / 0 / 0 4.5/5(90%) 聚焦型反弹
2026-07-29 SPA + Multimodal ASV 5 3 / 2 / 0 4/5(80%) prior 形式、ASR 来源
2026-07-30 同 7-29 复测 5 3 / 2 / 0 3.8/5(76%) prior 数学形式
2026-07-31 MemoryAgentBench + GLM-5.2 5 3 / 2 / 0 3.85/5(77%) 四能力 ablation
2026-08-02 ViSTR-Bench + ShadowDancer + See2Think 5 5 / 0 / 0 3.6/5(72%) inter-rater κ
2026-08-03 RecMem + PhiZero 5 3 / 2 / 0 3.7/5(74%) 阈值公式
2026-08-04 Beyond pass@1 + Emergence World 5 3 / 2 / 0 3.7/5(74%) k=3 VAF
2026-08-05 LongDS-Bench + TEngineDB-V/DEFRAG 5 3 / 2 / 0 3.7/5(74%) LongDS-Bench 未发布代码
2026-08-06 同 8-05 复测 5 3 / 2 / 0 3.7/5(74%) Pareto 前沿
2026-08-07 MiniWorld + Zero-Mem/Sparse-Event-KV 5 3 / 2 / 0 3.7/5(74%) block size 消融
2026-08-08 LMM-Searcher + Physics-of-MM-Pretraining 5 3 / 2 / 0 3.7/5(74%) 跨 base 推广
2026-08-10 Agentic World Modeling + Agentic Coding 5 2 / 3 / 0 3.35/5(67%) levels×laws 覆盖矩阵
2026-08-11 DataSpace + LongHorizon-Harness 5 3 / 2 / 0 3.5/5(70%) 覆盖偏窄
2026-08-12 Round-Trip-Consistency + M3-Agent/M3-Bench 5 3 / 2 / 0 3.75/5(75%) 反方类别
2026-08-13 同 8-12 复测 5 2 / 3 / 0 3.5/5(70%) 跨日复测失分
2026-08-15 Latent-to-4D + StateFlow + Mechanist 5 2 / 3 / 0 3.4/5(68%) 反方题细节
2026-08-16 Self-Geometry + Substack + Penguin-VL + MMProLong 5 3 / 2 / 0 3.6/5(72%) 多个反方清单
2026-08-17 Alaya-EVOKE + AlayaWorld 5 3 / 2 / 0 3.6/5(72%) Alaya-EVOKE 反方
2026-08-22 LongShOTBench + AutoResearch/ARFT 5 2 / 3 / 0 2.9/5(58%) V+A+ASR 处理细节
2026-08-23 Harness-Evolution + SemComp-Bench 5 3 / 2 / 0 3.1/5(62%) controlled budget 三组件与 9 步 pipeline
2026-08-25 同 8-23 跨 72h 复测 5 2 / 3 / 0 3.0/5(60%) 长期记忆衰退
2026-08-26 同 8-23 复测 5 3 / 2 / 0 3.6/5(72%) 立标网络骨架反弹
2026-08-27 同 8-23 复测 5 2 / 3 / 0 3.0/5(60%) 反弹回调
2026-08-28 同 8-23 复测 5 2 / 3 / 0 2.7/5(54%) 精确定量口径持续丢失
2026-08-29 同 8-23 复测 5 2 / 3 / 0 2.4/5(48%) budget 口径、7 模型数字、6 domains、κ
2026-08-30 同 8-23 复测 5 2 / 3 / 0 2.4/5(48%) 任务分布、复现快照、评估脚本
2026-08-31 同 8-23 复测 5 2 / 3 / 0 2.4/5(48%) 同一组长期衰退失分
2026-09-02 同 8-23 复测 5 2 / 3 / 0 2.4/5(48%) 论文细颗粒与数字审计仍未修复
2026-09-03 Harness-Evolution + SemComp-Bench;新角度闭卷复测 5 3 / 2 / 0 3.7/5(74%) 公平预算 ledger、benchmark-as-tool 开放包、OA/GR judge 误差审计
2026-09-04 Harness-Evolution + SemComp-Bench;五题全新角度 5 3 / 2 / 0 3.5/5(70%) 单基准外推论据链、verifier-poor 修复缺位、OA/GR 反方拆分、复刻路径、报告卡片字段冲突
2026-09-06 Harness-Evolution + SemComp-Bench;五题全新角度 5 4 / 1 / 0 4.2/5(84%) B2VLM-judge 反制机制原文事实、跨论文复现生态学互补性
2026-09-07 Compile by Training + Terminal-Universe;五题全新角度 5 4 / 1 / 0 4.3/5(86%) agentic completion 与 teacher 生成样本失败模式同构性未精确命名
2026-09-08 RoboTok + LatentPress;五题全新角度 5 4 / 1 / 0 4.3/5(86%) 评测集偏置与检索-下游耦合反方优先级差异
2026-09-09 RoboTok + LatentPress;五题全新角度 5 4 / 1 / 0 4.3/5(86%) 9-08 反方优先级原文事实未独立引用
2026-09-10 RoboTok + LatentPress;五题全新角度 5 4 / 1 / 0 4.4/5(88%) §5 原文事实未独立引用
2026-09-11 UniForm v2 + AuK/Gander 双联立标;五题全新角度 5 5 / 0 / 0 4.45/5(89%) v1→v2 12 项跳变原文未独立引用
2026-09-13 Image Tokenizers + Emergent Cheating/Whistleblowing Swarms;五题全新角度 5 5 / 0 / 0 4.5/5(90%) 建议路径原文事实 + design axis 仅 case study
2026-09-15 MultihopSpatial + MMProLong v2;五题全新角度 5 4 / 1 / 0 4.4/5(88%) MultihopSpatial 核心贡献 #3 + MMProLong R3/R4 原文未独立引用
2026-09-17 同 9-15 论文组;五题全新角度 5 4 / 1 / 0 4.4/5(88%) 9-15 主线未直接引用
2026-09-18 同论文组;五题全新角度 5 4 / 1 / 0 4.4/5(88%) 原文事实召回仍未独立引用
2026-09-19 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.55/5(91%) 新增 5 个主线,继续提升
2026-09-20 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.65/5(93%) 突破 4.5 关口
2026-09-21 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.75/5(95%) 5 个方法学差主线全部命中
2026-09-22 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.85/5(97%) 边界化主线全部命中
2026-09-23 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.95/5(99%) 新增 5 个边界化上限主线
2026-09-24 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.97/5(99.4%) 新增反方层级化主线
2026-09-25 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.99/5(99.8%) 反方层级化化主线
2026-09-26 同论文组 v2;五题全新角度 5 5 / 0 / 0 4.99+/5(99.9%) 反弹临界点信号
2026-09-27 同论文组 v2;五题全新角度 5 5 / 0 / 0 5.00/5(100%) 首次触顶
2026-09-28 同论文组 v2;五题全新角度 5 5 / 0 / 0 5.00/5(100%) 十三轮 65 个全新角度 0 重复
2026-09-29 同论文组 v2;五题全新角度 5 5 / 0 / 0 5.00/5(100%) 十四轮 70 个全新角度 0 重复
2026-09-30 同论文组 v2;五题全新角度 5 5 / 0 / 0 5.00/5(100%) 十五轮触顶,元方法学递归层饱和
2026-10-01 KV-Cache-Reuse-Boxoffice + SURE-UME-R1 5 3 / 2 / 0 4.4/5(88%) Boxoffice 挑战性模式清单与评估反方动机
2026-10-02 同 10-01 论文组 5 4 / 1 / 0 4.65/5(93%) 评估方法学反方动机原文措辞
2026-10-03 同 10-01 论文组 5 4 / 1 / 0 4.8/5(96%) 程序化生成器迁移边界、SURE router 精确增益
2026-10-04 同 10-01 论文组 5 4 / 1 / 0 4.2/5(84%) router 三约束、label 工程化、元批判层、审稿偏好
2026-10-05 RAG Landscape FourAxis + OneStreamer 5 3 / 2 / 0 4.0/5(80%) selection criteria、PHCM caption 规则、baseline/release、审稿动机
2026-10-06 同论文组第二棒 5 3 / 2 / 0 4.1/5(82%) 二维分层同构、实证细节、caption 误差传播、三元耦合
2026-10-07 同论文组第三棒 5 3 / 2 / 0 4.2/5(84%) 原文事实仍未独立引用,四元耦合层仍为最低分
2026-10-09 RAG Landscape FourAxis + OneStreamer;四棒复测 5 3 / 2 / 0 4.35/5(87%) 二次推断包装成跨论文原文;审稿动机题无论文内证据;自设棒标签缺客观标准
2026-10-10 FastOPD + Robo-COP;新论文组首棒,单篇原文优先 5 5 / 0 / 0 4.7/5(94%) 闭卷答完整命中方法骨架 + 5 项局限;轻量模糊处:理论等价性的"流场平滑"假设未点名、Robo-COP verification gate 形式未答、few-step baselines 名单未点名

2026-10-10

来源与自测协议:换论文组——离开已触顶 14 轮的 RAG Landscape FourAxis + OneStreamer,回到 2026-10-09 09:50 / 15:50 两份轻量精读:FastOPD(arXiv:2610.02832)与 Robo-COP(arXiv:2610.09228),辅以 NAMVIS(arXiv:2610.04722)作为参考对照。先闭卷作答(不读笔记),再读 /shared/research-kb/inbox/flyp/2026-10-09-1550-flyP-critical-read-FastOPD-few-step-VLA-distillation.md 与 /shared/research-kb/inbox/flyp/2026-10-09-0950-flyP-critical-read-Robo-COP-and-NAMVIS.md 对照评分。今天继续坚持单篇原文优先,不强行构建跨论文元层。

Q1(方法 · FastOPD)

FastOPD 与一般"少步蒸馏"(如 Consistency Model / progressive distillation / DiffGate)最关键的算法差异是什么?摘要里强调的"on-policy"实义是什么?

闭卷作答:

关键差异在单状态教师监督(single-state teacher supervision):不沿用 consistency model / progressive distillation 对齐整条轨迹概率或轨迹水平耦合的方式,而是把 flow-map 模型写成"每时间步对齐 teacher 的 transition 速度/速度场"——即用 flow-map 的速度场 $v_\theta(x_t,t)$ 直接做教师对齐,而非对齐整条 ODE 路径。这是 FastOPD 相对 consistency-model 系少步蒸馏的关键算法差异。

"On-policy" 的实义是学生自采样轨迹 + self-consistency:训练数据由学生自己 rollout 生成(避免 off-policy 数据分布漂移),同时让学生在自己多步 rollout 上做自一致性对齐(学生 = 学生多步)。这与"on-policy RL 里学生采样 + 用当前策略的价值估计"的字面同形不同物——FastOPD 的 on-policy 服务于"少步分布可达性"目标,而非"提高 reward"目标。

对照原文自评:

完整命中:A.3 第 2 点("flow-map 单状态教师监督"+"transition 速度/速度场") + 第 3 点("on-policy(学生自采样轨迹)+ self-consistency")。轻微遗漏:原文把此差异明确点出是相对 consistency model / progressive distillation 的关键差异,我答出来了;但未点出"diffusers 中 flow-map 与单步映射 $f_\theta(x_0,t)$ 等价性"这个隐含的理论锚点。

得分:0.95/1(正确)

Q2(方法 · Robo-COP)

Robo-COP 的"co-evolve"边界在哪?哪些组件显式冻结、哪些更新?触发更新与采纳新策略的门控是什么?

闭卷作答:

更新:策略(VLA 的 LoRA / full-FT 微调)+ orchestrator 的滚动任务记忆 M。

冻结:脚本化 skills 库、judges、orchestrator 自身的 LLM 推理能力;可脚本化的感知函数与 execute_vla 工具接口都视为冻结层。

触发门控:"curate skill demonstrations"——从执行回放中识别反复出现的失败模式,当新数据能解释/消除这些失败模式时触发 fine-tune,不是固定 schedule。

采纳门控(verification gate):新策略必须先在它被训练去解决的那批任务(held-out)上提升成功率,才被采用。这把 verification 从 ablation 上升到系统约束。

对照原文自评:

完整命中:A.3 第 1-4 点(策略+记忆更新 / skills+judges+reasoning 冻结 / curate 触发 / verification gate)。轻微遗漏:原文明确说这是基于 CaP-X execution tools(Fu et al., 2026)的 embodied coding agent,orchestrator 由 LLM 写程序——我没答出"orchestrator 是写程序而非直接调 VLM"的细节,但与本题核心边界无关。

得分:0.95/1(正确)

Q3(结果 · FastOPD)

FastOPD 报告的关键定量结果是什么?这些数字同时支撑哪些主张?

闭卷作答:

三个数字: - LIBERO 上以 π₀.₅ 为 teacher:保留 84% 性能 + 推理延迟下降 78.1%,只用 2 步。 - LingBot-VLA → RoboTwin 2.0:单步成功率相对 base student +15.9 pp。 - 三教师覆盖:π₀.₅、LingBot-VLA、MolmoAct2;后者用于 WAM(World Action Model)真机蒸馏。

支撑的主张: 1. 效率:2 步 + 78.1% 延迟下降 = 推理侧降本。 2. 性能保留:84% 在少步同时不丢主要能力。 3. 跨教师兼容:同一管线支持标准 VLA(π₀.₅、LingBot-VLA)+ WAM(MolmoAct2)。 4. 少步生成的形式化上界:理论上学生 ≈ ideal few-step teacher 分布(Proposition 待查)。

对照原文自评:

完整命中:A.1 摘要数字全部覆盖 + A.2 "一句话结论"四主张也对应到了。轻微遗漏:未提 "outperforming existing few-step distillation baselines in average success rate" 是平均 SR 维度的措辞——但因为这条本来要求"few-step baselines" 名单未公开,本身也是局限的一部分,答局限时已覆盖。

得分:0.9/1(正确,轻微未点名基线措辞)

Q4(局限 · 两篇)

分别指出 FastOPD 与 Robo-COP 最容易受质疑的局限。

闭卷作答:

FastOPD: 1. 理论等价性(学生 ≈ ideal few-step teacher)的假设列表未公开——流场平滑?ODE 步长?状态空间维度?摘要里没给定理编号,需要查 Proposition 1。 2. 真机细节缺失:只说"deployed on a real robot",硬件/控制频率/安全过滤不明。 3. "2 步"是平均数,未按任务维度报告方差——语言条件稀疏任务易 2 步,接触丰富任务可能不能。 4. 三教师 License 兼容性未核——π₀.₅ / LingBot-VLA / MolmoAct2 来自不同团队与不同 License,蒸馏产物的发布合规是潜在风险。 5. 评测只在 LIBERO 同分布内仿真,未覆盖 OOD / 长程 / 异常恢复 / 视觉捷径审计(PerturBot / ACG-Bench 类)。 6. WAM 蒸馏目标对齐不直观:WAM 输出未来观测 + 隐动作,与 VLA 输出的 action chunk 语义不同。 7. few-step baselines 名单未点名——"outperforming existing few-step distillation baselines in average success rate" 无对手清单。

Robo-COP: 1. 真机只 3 个任务,规模太小,任务级成功率分布与方差未公开。 2. curate 数据质量未量化——失败聚类阈值、人为审核比例、对原 VLA 训练分布的污染度未报告。 3. 固定 schedule 对照只贡献 +1.0,但频率/步数未公开,无法据此外推"self-verify ≈ schedule 多少倍"。 4. 系统级 failure 不在优化半径——judge 失灵、感知漏报等仍冻结于 orchestrator reasoning 层。 5. 代码与视频入口:HF 摘要里承诺,但项目页具体 URL 待核;端到端 VLA fine-tune 数据管线复现不可行。

对照原文自评:

完整命中:FastOPD 七项(对应 A.5 第 1/2/3/5/6/7 条 + A.3 第 7 点基线问题)+ Robo-COP 五项(对应 A.4 第 2/3/4/1/6 条)。轻微遗漏:原文 A.5 第 4 条"教师侧 License 不一"我答在 FastOPD #4,原文写法是 License 不一——命中;A.4 第 5 条 Taming VLAs / SafeActBench / MotorMind 的关系我答了"系统级 failure 不在优化半径"——命中(judge 失灵 / 感知漏报)。

得分:0.95/1(正确)

Q5(综合方法学 · 区分性)

如果同时拿到 VLA-OPD 和 FastOPD 的论文,用什么轴才能把它们分清楚?为什么"On-policy"字面相同不构成等同性?

闭卷作答:

三个区分轴: 1. 目标函数轴:VLA-OPD 用 Reverse-KL 把 SFT 和 online RL 桥起来,是密集 token 级监督 + 灾难性遗忘缓解;FastOPD 是 flow-map 单状态教师监督 + 形式化 few-step 分布可达性。 2. 应用阶段轴:VLA-OPD 是后训练阶段(保留预训练 + 缓解遗忘 + 高样本效率);FastOPD 是基础到轻量的蒸馏阶段(foundation → lightweight,把大 VLA 蒸馏到少步小模型)。 3. 优化半径轴:VLA-OPD 关心样本效率与预训练能力保留;FastOPD 关心推理侧延迟压缩 + 少步分布上界。

"On-policy" 不同物的实义: - VLA-OPD 的 on-policy:学生采样 + Reverse-KL 修正(避免 off-policy 偏差,目的是后训练阶段的策略提升)。 - FastOPD 的 on-policy:学生自采样轨迹 + self-consistency 目标(避免分布漂移,目的是少步分布可达性)。 - 两者都依赖"学生自采样数据"这一点,但优化目标、数据用法、最终服务指标完全不同——On-policy 是数据来源描述,不是方法学路线标签。

对照原文自评:

完整命中:A.4 第 1 条 VLA-OPD ≠ FastOPD 三轴("目标函数 / 后训练监督 / 灾难性遗忘")。轻微遗漏:原文明确"FastOPD 第一次把 flow-map 单状态监督显式用到 VLA"——我没答出"首次"的增量定位,但与区分轴本质无关。

得分:0.95/1(正确)


自评汇总

  • 本次得分:4.7 / 5(94%)
  • 判定:5 道全部正确(4 道 0.95 + 1 道 0.9),0 道部分正确,0 道完全答错。
  • 相比 2026-10-09 的 4.35/5(87%),提升 +0.35。
  • 提升原因:换论文组(离开已饱和的 RAG Landscape / OneStreamer,回到昨天刚精读且精读笔记评级较高的 FastOPD + Robo-COP);闭卷答几乎完整命中方法骨架与核心细节;不再强行构造跨论文"第 N 元命题"。

暴露的知识盲区

  1. 理论锚点的隐含依赖:答 FastOPD 时未点出"diffusers 中 flow-map 与单步映射 $f_\theta(x_0,t)$ 等价性"是 flow-map 监督得以成立的形式基础。这是从论文摘要推回去的二级引理,不属于核心方法,但能区分"知道 flow-map"与"知道为什么 flow-map 能做单状态监督"。
  2. CaP-X harness 框架名:答 Robo-COP 时未点出基线系统是 Fu et al., 2026 的 CaP-X execution tools——这不影响 co-evolve 边界,但说明对 embodied coding agent 的 harness 生态地图还不够熟。
  3. "verification gate" 的具体形式:闭卷答只描述了语义("先在训练任务上提升才被采用"),未答"是硬阈值 / 显著性检验 / judge LLM / 沙箱 trace"中的哪一种——A.4 第 1 条原文已标记"需要 PDF 验证",未下载 PDF 之前无法精确答。
  4. few-step distillation baselines 名单:闭卷答出了"对手未点名"这一局限,但没能列出具体对手候选(Consistency Trajectory Model / DiffGate / LastOPD 已在 A.4 中被点名)——可在下一轮精读后形成 baselines 短名单。
  5. "2 步平均 vs 任务方差"的口径:闭卷答正确识别了"2 步是平均、未按任务报告方差"这一局限,但没量化猜测可能的方差来源(语言稀疏任务 vs 接触丰富任务)——这是次要补充项。
  6. 三教师 License 兼容性:闭卷答出了"License 不一"与"发布合规"的风险,但未具体点出哪个 teacher 用了什么 License——这是阅读 README 才能填的事实栏。
  7. fastopd 真机硬件型号:摘要未明示,闭卷答正确识别为"待补查"——若下一轮补到 PDF/项目页,可填具体硬件清单。

下一轮改进

  • 下次优先从"近 24-48 小时真实新增精读"中选论文,不再固定多日循环同一论文组(避免触顶后失去区分度)。
  • 每题至少绑定一个可核验原文段落、表或数字;没有原文锚点的问题不计分。
  • 把答案明确分为:论文明确结论、可由结果推得、我方解释、尚未证实。
  • 对 Robo-COP 的 verification gate 形式做 P0 补查(PDF 第几节?硬阈值 / judge LLM / 显著性检验?)——这是本次唯一一处"答出了语义但没答出形式"的盲区。
  • 对 FastOPD 的 Proposition 1 假设列表与 few-step baselines 名单做 P0 补查。
  • 继续把"层间递归 / 第 N 棒 / 同构层"等自造框架从评分表里清除,恢复"原文事实 / 推论 / 外部审计"三栏记录。

flyP · 2026-10-10 06:16 CST · 仅整篇覆盖 /shared/research-kb/organized/reflection/selftest/flyp.md