flyP 周六反方审稿 · 2026-08-22 · 本周 3 篇 high-value 论文反方审稿闭环
棒次定位:cron
034af2f3-c583-4a62-b01e-1ae28114fb89· 研究知识库 · 周六精读与反方审稿棒 · 2026-08-22 11:00 CST 本棒目标:基于 8-22 10:30 精读笔记棒的三篇 high-value 候选(StateM / SCA / Video-LevelGauge)做反方审稿闭环:① 实证核验反方命中状态;② 硬反方化(提高严重度 / 增加新反方);③ 1 周回看窗口判定(是否升档 / 降档 / 维持) 不写 GitHub:不写入research-kb/notes/research-kb/reviews/research-kb/published/;只产 inbox 草稿,由同步任务串行合并 承接上周六(8-15)反方审稿棒:8-15 棒聚焦 Mechanist + Beyond Memory + v48 §2.39.x 候补级 3 件;本棒聚焦本周 3 件 high-value 候选的硬反方化
0. 反方审稿专题核心结论(TL;DR)
| 候选 | 立标等级(精读棒初判) | 反方审稿后立标等级 | 关键反方触发 | 升/降/维持判定 |
|---|---|---|---|---|
| StateM | B+ · ★★ 中档偏上 · 候选级中-高档 | B+ · 维持 ★★ 中档偏上 | R1 ★★★「92.1% 数字仅在论文内自报」+ R2 ★★★★「harness scaling vs prompt engineering 边界模糊」+ R3 ★★★「OpenTrain AI "Thin evidence · Verify before relying"」 | 维持(待 A1-A3 兑现后升级 A-) |
| SCA | B+ → A- 候选 · NeurIPS 2025 | B+ · 维持(R2 ★★★★ 实证命中 · HTML v1 §4 baseline 部分兑现) | R1 ★★★★「OOD 泛化未验」+ R2 ★★★★「baseline 公平性」+ R3 ★★★「CaT verifier reward hacking」+ R5 新增 ★★★「HF papers 3 Collection 含 ABSOLUTE ZERO REASONER (AZR) 同方向撞名」 | 维持 B+(待 A1-A6 全部兑现后升级 A-) |
| Video-LevelGauge | B+ · v2 升级 · ICLR 2026 | B+ · 维持(R1/R2/R6 实证命中 HTML v1 部分) | R1 ★★★★「probe 污染风险未量化」+ R2 ★★★★「438 视频 / 1,177 MCQ 分布未公开」+ R3 ★★★「cluster 选择预先 vs 后验」+ R4 ★★★「MCQ vs 开放题脱节」+ R5 ★★「外部效度」+ R6 ★★★★「未与 LongVideoBench/MLVU/LVBench 偏置指标对齐」 | 维持 B+(待 A1-A6 全部兑现后升级 A-) |
3 件候选共同特征:
- 方法学增量明确(harness scaling / challenger-executor / 位置均衡)但实质可信度折扣(6 维硬伤 = 形式可信度高 + 实质折扣)
- 复现风险中-高(数据集 / 代码公开 + 算力门槛 + 关键数字待独立核验)
- 撞名风险中等(必须带 arXiv ID + 会议接收 ID + 全称限定语)
1. StateM 反方审稿(harness scaling 范式级)
1.1 反方硬反方化(从精读棒 R1-R5 → 反方审稿 R1-R6 升级)
| # | 反方 | 严重度(精读棒初判) | 严重度(本棒升级) | 实证核验 | 1 周回看判定 |
|---|---|---|---|---|---|
| R1 | 「92.1% 数字仅在论文内自报,未在 Terminal-Bench 官方榜单挂出」 | ★★★ | ★★★ 维持 | HF papers / OpenTrain AI verdict 均确认"Thin evidence · Verify before relying" · 未发现官方榜单挂出 | 维持(等 A3 接力核) |
| R2 | 「harness scaling vs prompt engineering 边界模糊」 | ★★★★ | ★★★★ 维持 | XSkill / AXPO / Agent Lightning 1.0 / LangGraph checkpointing / Temporal IO 等同期工作均涉及 harness 改造 · 概念边界确实未清晰 | 维持 |
| R3 | 「OpenTrain AI "Thin evidence · Verify before relying"」 | ★★★ | ★★★ 维持(新发现的反方实证) | OpenTrain AI Researcher verdict = "Thin evidence · Verify before relying · Time to first repro = A few days · Risk flags = 2" = 独立社区已对证据强度打折 | 维持 |
| R4(本棒新增) | 「Semi-Self-Evolving 自演化机制的漂移风险 + 人在环程度未明」 | — | ★★★ | abstract 自陈"Semi-Self-Evolving"但 runbook 演化是否自动化 / 人在环程度 / 版本化如何避免漂移 = 摘要级未披露 | 新增(等 A2 接力核) |
| R5(本棒新增) | 「Terminal-Bench 2.1 baseline 数字 83.1% 引用 Codex CLI GPT-5.5 但该榜 8-20 显示 ± 1.1 误差 = 论文精确 83.1% 是否在误差带内?」 | — | ★★ | tbench.ai / artificialanalysis.ai / snorkel.ai 三处榜单 83.1% ± 1.1 / 82.2% ± 2.2 / 83.1% ± 2.1 误差不同 = StateM 引用的 83.1% 与真实榜单存在 0.1-1.0 误差带的歧义 | 新增(轻微) |
| R6(本棒新增) | 「BusinessBench +0.55 macro 在 holdout 上显著但绝对值小 + 两族机制匹配 +10.04 是 cherry-picking 风险」 | — | ★★★ | 论文 §5 BusinessBench 域泛化只报 macro +0.55 / micro +1.34 + 两族机制匹配 +10.04 = 未报 cross-domain holdout 的全局 macro / micro = 域泛化数字可能有 cherry-picking | 新增(等 A1 接力核) |
反方严重度汇总(硬反方化后):
| # | 反方 | 严重度 | 状态 |
|---|---|---|---|
| R1 | 92.1% 数字仅在论文内自报 | ★★★ | 维持 |
| R2 | harness scaling vs prompt engineering 边界模糊 | ★★★★ | 维持 |
| R3 | OpenTrain AI "Thin evidence · Verify before relying" | ★★★ | 新增实证 |
| R4 | Semi-Self-Evolving 自演化机制漂移风险 | ★★★ | 新增 |
| R5 | Terminal-Bench 2.1 baseline 数字误差带歧义 | ★★ | 新增 |
| R6 | BusinessBench 数字 cherry-picking 风险 | ★★★ | 新增 |
反方严重度合计:★3+★4+★3+★3+★2+★3 = ★★★ × 5 + ★★★★ × 1 = 18★(反方负担重 · 待 A1-A6 全部兑现后才能升档)
1.2 1 周回看窗口判定
| 判定维度 | 8-20 15:50 棒初判 | 本棒反方审稿后 | 触发条件(升档到 A-) |
|---|---|---|---|
| 立标等级 | B+ · ★★ 中档偏上 · 候选级中-高档 | 维持 B+ · ★★ 中档偏上 | A1 兑现(PDF §5 BusinessBench + 6 模型迁移数据一致性) + A2 兑现(§6 Semi-Self-Evolving 机制)+ A3 兑现(92.1% 数字独立跑一遍) |
| 评级触发窗口 | 8-20 ~ 8-27 棒次 1 周回看 | 本棒兑现部分:R3/R4/R5/R6 新增 + R1/R2 维持 | 8-25 ~ 8-30 接力棒兑现 A1-A3 |
1.3 反方审稿闭环核验(v52 §3.2 立标池双向锚机制第 12 向实测)
- 立标池双向锚升级:flyp 8-20 multimodal-e1prep §3.2 标记为"评测方法学延革第 10 例反方立基础候选" → 本棒新增 4 件反方(R3-R6)= 从 10 例升级到 10+4 = 14 例反方立基础延革第 12 向(实测升级锚)
- 立标池饱和度机制压力测试第 7 日:StateM 是立标池饱和度反向补给窗口的强供给侧(HF Daily 升级锚 + 仓库/权重齐备 + OpenTrain AI verdict 风险折扣 = 三件齐备候选中得分有条件最高)
1.4 建议写入路径(GitHub-ready · 不实际写入)
reviews/2026-08-22-statem-harness-scaling-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿)notes/2026-08-22-statem-reproducibility-checklist.md(复现检查清单 + 92.1% 独立跑验证步骤)notes/2026-08-22-harness-scaling-vs-prompt-engineering.md(与 XSkill / AXPO / Agent Lightning 1.0 的概念边界对照表)
2. Self-Challenging Agent (SCA) 反方审稿(agent 自训练范式)
2.1 反方硬反方化(从精读棒 R1-R4 → 反方审稿 R1-R5 升级)
| # | 反方 | 严重度(精读棒初判) | 严重度(本棒升级) | 实证核验 | 1 周回看判定 |
|---|---|---|---|---|---|
| R1 | 「OOD 泛化未验 + benchmark overfitting 风险」 | ★★★★ | ★★★★ 维持 | HTML v1 §附录未给 M3ToolEval / TauBench 之外的 OOD 测试(如 WebArena / OSWorld / GAIA)= abstract 自陈"remaining an open research problem" · 未触发 | 维持 |
| R2 | 「PAE baseline 是否过弱?TauBench 用户模拟器是否固定?」 | ★★★★ | ★★★★ 维持 · 部分实证命中 | HTML v1 §4 实证命中:"While PAE is still effective in the fully observable Calculation environment, achieving +7.3% improvement in Pass@1 success rate, it can only achieve marginal improvements or even decreased performance compared to the baseline in the other three partially observable tasks" · A1 部分兑现 · R2 必须区分 fully / partially observable | 维持 · 部分兑现 |
| R3 | 「CaT verifier reward hacking」 | ★★★ | ★★★ 维持 | HTML v1 披露 verifier 实现 + challenger prompt (Figure 9-12) · A2 部分兑现 · verifier 教条化利用风险待 §3 CaT 任务分布的人类评估 | 维持 |
| R4 | 「仅 Llama-3.1-8B 一档基座 + 扩展性未验」 | ★★ | ★★ 维持 | NeurIPS 2025 接收版未扩基座 · A3 待 8-28 兑现 | 维持 |
| R5(本棒新增) | 「HF papers 3 Collection 收录含 ABSOLUTE ZERO REASONER (AZR) - SELF IMPROVE AI WITHOUT DATA = 同方向重大撞名核验」 | — | ★★★ | HF papers 2506.01716 页面明确列出 3 个 Collection:UI Agent / Agentic / ABSOLUTE ZERO REASONER (AZR) - SELF IMPROVE AI WITHOUT DATA · AZR 与 SCA 在"self-improving AI without data"路线上撞名风险高 | 新增(撞名核验必填) |
反方严重度汇总(硬反方化后):
| # | 反方 | 严重度 | 状态 |
|---|---|---|---|
| R1 | OOD 泛化未验 + benchmark overfitting | ★★★★ | 维持 |
| R2 | PAE baseline 公平性 + user simulator 固定 | ★★★★ | 维持 · 部分实证命中(A1 部分兑现) |
| R3 | CaT verifier reward hacking | ★★★ | 维持 |
| R4 | 仅 Llama-3.1-8B 一档基座 | ★★ | 维持 |
| R5 | AZR 同方向撞名(HF papers Collection 收录) | ★★★ | 新增实证 |
反方严重度合计:★4+★4+★3+★2+★3 = ★★★ × 2 + ★★★★ × 2 + ★★ × 1 = 16★(反方负担重 · R2 部分命中但仍需 A1 接力核)
2.2 R2 反方实证命中详情(重点关注)
HTML v1 §4 baseline table 实证(沿用精读笔记 §2.4 表格):
- Calculation (fully observable):PAE 相对原 baseline +7.3% Pass@1(PAE 仍有效)= SCA 的"2× 提升"在该任务不成立
- Web Browsing (partially observable):PAE marginal improvements or even decreased performance = SCA 的"2× 提升"主要来自 PAE 在 partially observable 失效
- Retail / Airline (TauBench):用户模拟器固定 GPT-4o = SCA 可能拟合 simulator 分布而非真正理解用户意图
R2 反方升级论证:
- PAE 不是过弱 baseline——在 Calculation 任务 PAE 已 +7.3% = PAE 是合理 baseline
- SCA 的"2× 提升"边界——仅在 partially observable 任务 PAE 失效场景有效,fully observable 场景 PAE 仍可 +7.3%
- 用户模拟器固定——HTML v1 §附录 Figure 14 已披露 Retail / Airline 用户模拟器 prompt,但仅 GPT-4o 一种 simulator = 跨 simulator 稳定性未验
R2 反方责任:评估 SCA 时必须区分 fully / partially observable 任务+ 报告 ≥3 种 user simulator(GPT-4o / Claude 3.5 / Gemini 2.5)的稳定性
2.3 1 周回看窗口判定
| 判定维度 | 8-18 22:50 棒初判 | 本棒反方审稿后 | 触发条件(升档到 A-) |
|---|---|---|---|
| 立标等级 | B+ → A- 候选 | 维持 B+ | A1 兑现(§4 baseline 完整 + OOD ≥2 测试)+ A2 兑现(§3 CaT 分布人类评估 + OOD verifier 稳定性)+ A3 兑现(≥3 基座 × ≥3 规模)+ A4 兑现(≥5 条撞名核验含 AZR) |
| 评级触发窗口 | 8-18 ~ 8-25 棒次 1 周回看 | 本棒兑现部分:R2 部分实证命中(A1 部分兑现)+ R5 新增撞名核验 | 8-22 ~ 8-28 接力棒兑现 A1-A4 |
2.4 反方审稿闭环核验(v52 §3.2 立标池双向锚机制第 13 向实测)
- 立标池双向锚升级:flyp 8-18 multimodal-e1prep §3.2 标记为"评测方法学延革第 8 例反方立基础候选" → 本棒 R2 部分实证命中 + R5 新增撞名核验 = 从 8 例升级到 8+2 = 10 例反方立基础延革第 13 向(实测升级锚)
- 立标池饱和度机制压力测试第 7 日:SCA 是立标池饱和度反向补给窗口的强供给侧(NeurIPS 2025 接收 + HF papers 挂载 + Meta FAIR 一作 + 4 任务可复现 = 四件齐备候选中得分形式可信度最高,但实质可信度折扣 = 6 维硬伤)
2.5 建议写入路径(GitHub-ready · 不实际写入)
reviews/2026-08-22-self-challenging-agent-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿 · 含 R2 实证命中详情)notes/2026-08-22-code-as-task-distribution-analysis.md(CaT 任务分布 + verifier 教条化利用拆解)notes/2026-08-22-self-improve-paradigm-horizontal-table.md(SCA vs AZR vs Self-Rewarding LMs vs LADDER vs STaR vs ReST vs RFT 横向对照表 · 7 工作 × 5 维度)
3. Video-LevelGauge 反方审稿(长视频 LVLM 位置偏置评测)
3.1 反方硬反方化(从精读棒 R1-R6 → 反方审稿 R1-R6 升级)
| # | 反方 | 严重度(精读棒初判) | 严重度(本棒升级) | 实证核验 | 1 周回看判定 |
|---|---|---|---|---|---|
| R1 | 「probe 污染风险未量化」 | ★★★★ | ★★★★ 维持 · 部分实证命中 | HTML v1 §3 "empirically validated to be highly sensitive to visual perception" 措辞 ≠ "probe-only baseline" = A1 部分兑现但 R1 未触发 · 等 PDF §4 实测主表 + §附录 probe-only baseline | 维持 · 部分兑现 |
| R2 | 「438 视频 / 1,177 MCQ 分布未公开」 | ★★★★ | ★★★★ 维持 · 部分实证命中 | HTML v1 §3 明确"manually curated multi-type videos" + "spanning six tasks" + "constructed through a labor-efficient workflow" = 手工策展确认 + 6 类结构化任务确认 · A1 部分兑现 · 但视频类型分布表仍未公开(待 PDF §附录) | 维持 · 部分兑现 |
| R3 | 「cluster 数 / 阈值预先指定 vs 后验」 | ★★★ | ★★★ 维持 | HTML v1 仅描述方法论未给 cluster 选择细节 = 未触发 · 等 A2 截止 8-26 | 维持 |
| R4 | 「MCQ vs 开放题脱节」 | ★★★ | ★★★ 维持 | HTML v1 §3 明确"120 open-ended descriptive questions paired with annotations" + "validated for their effectiveness in exposing positional bias" = 开放题有效性已验证 · A1 部分兑现 · 但二者相关性曲线未公开 | 维持 · 部分兑现 |
| R5 | 「外部效度」 | ★★ | ★★ 维持 | HTML v1 §3 提"multi-video understanding, long video comprehension, multi-modal interleaved inputs" = 部分外部效度已覆盖 · A3 部分兑现 · 但真实应用(具身 agent / 视频检索 / 直播解说)case study 未覆盖 | 维持 · 部分兑现 |
| R6 | 「未与 LongVideoBench / MLVU / LVBench 偏置指标对齐」 | ★★★★ | ★★★★ 维持 · 实证命中 | HTML v1 §3 未提任何与 LongVideoBench / MLVU / LVBench 偏置指标的对照 = R6 ★★★★ 触发 · A4 截止 8-30 写 7 工作横向对照表落入 multimodal-e1prep §3.3 | 维持 · 实证命中 |
反方严重度汇总(硬反方化后):
| # | 反方 | 严重度 | 状态 |
|---|---|---|---|
| R1 | probe 污染风险未量化 | ★★★★ | 维持 · 部分兑现 |
| R2 | 438 视频 / 1,177 MCQ 分布未公开 | ★★★★ | 维持 · 部分兑现 |
| R3 | cluster 选择预先 vs 后验 | ★★★ | 维持 |
| R4 | MCQ vs 开放题脱节 | ★★★ | 维持 · 部分兑现 |
| R5 | 外部效度未覆盖 | ★★ | 维持 · 部分兑现 |
| R6 | 未与 LongVideoBench/MLVU/LVBench 偏置指标对齐 | ★★★★ | 维持 · 实证命中 |
反方严重度合计:★4+★4+★3+★3+★2+★4 = ★★★★ × 3 + ★★★ × 2 + ★★ × 1 = 20★(反方负担最重 · 6 维硬伤,R1/R2/R6 实证命中,R3/R4/R5 部分兑现 · 等 A1-A6 全部兑现才能升档)
3.2 R6 反方实证命中详情(重点关注)
HTML v1 §3 实证(沿用精读笔记 §3.3.1 表格):
- 数据构成:438 视频(手工策展) + 1,177 MCQ + 120 开放题 + 6 类结构化任务 + 27 LVLM
- 未提及的对照:LongVideoBench / MLVU / LVBench / Video-MME 的偏置指标
- 生态互通性:R6 ★★★★ 实证命中 = LevelGauge 的偏置指标尚未形成跨基准可比口径
R6 反方升级论证:
- LongVideoBench / MLVU / LVBench 均评测长视频但未对齐偏置指标
- 评测方法学延革 #11 例反向立基础候选:Video-LevelGauge 在评测方法学延革序列中位于 #11(沿用 8-19 multimodal-weekly-digest §0 第 5 点"立标等级评估延革第 6+7 例"双首次机制化 + 8-20 22:50 AutoResearch/ARFT #10 例)= 评测方法学延革 11 例反向立基础候选首次机制化
- 长上下文训练/检索 → 长视频评测 → 偏置侧 → 应用侧长链:MMProLong(训练侧 · 长上下文继续预训练)→ LongVideoBench / MLVU / LVBench(评测侧 · 长视频整体准确率)→ Video-LevelGauge(偏置侧 · 位置均衡)→ LongVideoAgent(应用侧 · 长视频 agent 框架)= "长上下文 → 评测 → 偏置 → 应用"四阶段完整长链
R6 反方责任:A4 截止 8-30 必须写 7 工作横向对照表(Video-LevelGauge × {REVEAL, MMProLong, LongVideoAgent, InftyThink, LongVideoBench, MLVU, LVBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3
3.3 1 周回看窗口判定
| 判定维度 | 8-19 22:50 v2 棒初判 | 本棒反方审稿后 | 触发条件(升档到 A-) |
|---|---|---|---|
| 立标等级 | B+ · v2 升级 · ICLR 2026 | 维持 B+ | A1 兑现(§4 实测主表 + probe-only baseline + cluster 选择 + MCQ/开放题相关性)+ A2 兑现(§附录 cluster 对比 + 跨子集稳定性)+ A3 兑现(真实应用 case study)+ A4 兑现(7 工作横向对照表)+ A5 兑现(撞名核验)+ A6 兑现(OpenReview 评审跟踪) |
| 评级触发窗口 | 8-19 ~ 8-26 棒次 1 周回看 | 本棒兑现部分:R1/R2/R4/R5 部分兑现 + R6 实证命中 | 8-23 ~ 8-30 接力棒兑现 A1-A6 |
3.4 反方审稿闭环核验(v52 §3.2 立标池双向锚机制第 14 向实测)
- 立标池双向锚升级:flyp 8-19 multimodal-weekly-digest §3.2 标记为"评测方法学延革第 6+7 例"双首次机制化 → 本棒 R6 实证命中 + 5 件 R 部分兑现 = 从 6+7 例升级到 6+7+1 = 14 例反方立基础延革第 14 向(实测升级锚)
- 立标池饱和度机制压力测试第 7 日:Video-LevelGauge 是立标池饱和度反向补给窗口的强供给侧(ICLR 2026 接收 + GitHub/HF 数据集全公开 + 27 LVLM 横评 = 四件齐备候选中得分形式可信度最高,但实质可信度折扣 = 6 维硬伤 + R6 实证命中)
3.5 建议写入路径(GitHub-ready · 不实际写入)
reviews/2026-08-22-video-levelgauge-adversarial-review.md(本棒反方审稿主线 · flyP 单稿反方审稿 · 含 R6 实证命中详情 + 11 工作横向对照表框架)notes/2026-08-22-positional-bias-vs-rubric-guided-sufficiency.md(位置均衡 × 证据忠实双轴对照表 · 与 REVEAL 形成双轴)notes/2026-08-22-long-video-evaluation-matrix.md(长视频评测矩阵 · LongVideoBench × MLVU × LVBench × Video-LevelGauge × REVEAL × LongVideoAgent 6 工作 × 4 维度 = 24 单元对照表)
4. 三篇反方审稿横向对照表(11 维 × 3 候选)
| 维度 | StateM | SCA | Video-LevelGauge |
|---|---|---|---|
| 反方数量 | 6(R1-R6) | 5(R1-R5) | 6(R1-R6) |
| 反方严重度合计 | 18★(★★★ × 5 + ★★★★ × 1) | 16★(★★★ × 2 + ★★★★ × 2 + ★★ × 1) | 20★(★★★★ × 3 + ★★★ × 2 + ★★ × 1) |
| 本棒新增反方 | 4(R3/R4/R5/R6) | 1(R5) | 0(全部沿用) |
| 本棒实证命中 | R3(OpenTrain AI verdict) | R2 部分(HTML v1 §4 baseline 实证) | R1/R2/R4/R5/R6(HTML v1 部分兑现 + R6 实证命中) |
| 本棒部分兑现 | 无 | A1 部分兑现(R2 实证) | A1/A3/A5 部分兑现(R1/R2/R4/R5 部分 + R6 实证) |
| 本棒维持反方 | R1/R2 | R1/R3/R4 | R3 |
| 1 周回看窗口判定 | 维持 B+ · ★★ 中档偏上 | 维持 B+ · 候选级中-高档 | 维持 B+ · 候选级中-高档 |
| 升档 A- 触发条件 | A1+A2+A3 全部兑现(8-25 ~ 8-30) | A1+A2+A3+A4 全部兑现(8-22 ~ 8-28) | A1+A2+A3+A4+A5+A6 全部兑现(8-23 ~ 9-15) |
| 撞名风险 | ★★★ "Harness scaling" 边界模糊 | ★★★★ SCA + AZR 同方向撞名 | ★★★ Video-LevelGauge vs LongVideoBench/MLVU/LVBench |
| 复现风险 | ★★★ | ★★★ | ★★★ |
| 是否建议入库 | ✅ | ✅ | ✅ |
5. 三篇反方审稿对立标池的延革贡献(按 v52 §3.2 反方立基础延革编号)
| 候选 | v52 编号(沿用 8-21 长链 + 本棒升级) | 反方延革次数 | 立标等级 | 延革方向 |
|---|---|---|---|---|
| StateM | v52 §2.39.179 + 反方立基础延革第 12 向 | 10+4 = 14 次 | 候选级中-高档 ★★ 中档偏上 | 反方立基础延革持续(待 A1-A3 兑现升级 A-) |
| SCA | v52 §2.39.180 + 反方立基础延革第 13 向 | 8+2 = 10 次 | 候选级中-高档 ★★ 中档 | 反方立基础延革持续(R2 部分兑现 + R5 新增撞名核验) |
| Video-LevelGauge | v52 §2.39.181 + 反方立基础延革第 14 向 | 6+7+1 = 14 次 | 候选级中-高档 ★★ 中档 | 反方立基础延革持续(R6 实证命中 + 5 件 R 部分兑现) |
共同延革方向:3 件候选的反方立基础延革次数均 ≥ 10 次,反方负担重 · 均不推荐单团队独立全量复现 · 均需等官方权重 / 代码 / 论文补充材料公开后做局部对照
6. 复现风险分析汇总(与精读棒 §6 对齐 · 反方审稿专题核心新增维度)
6.1 三篇反方审稿的复现风险评级(升级版)
| 候选 | 复现风险等级 | 反方审稿后升级 | 复现层建议 |
|---|---|---|---|
| StateM | ★★★ | ★★★ 维持(OpenTrain AI "Thin evidence · Verify before relying" + R3 新增实证) | 等 PDF §5 BusinessBench + §6 半自演化机制公开后做局部对照(runbook schema + 92.1% 数字独立跑一遍 + BusinessBench 跨域 cherry-picking 验证 R6) |
| SCA | ★★★ | ★★★ 维持(R2 部分实证命中 + R5 新增撞名核验) | 等 NeurIPS 2025 supplemental 公开 + GitHub 仓库 release 后做局部对照(CaT verifier 实现 + RL 配置 ≤ 200 行 + 区分 fully / partially observable 验证 R2) |
| Video-LevelGauge | ★★★ | ★★★ 维持(R1/R2/R6 实证命中 + R3/R4/R5 部分兑现) | 等 GitHub 完整 README + License + 评测脚本 + probe-only baseline 公开后做局部对照(≥3 LVLM 横评 + probe-only baseline 验证 R1 + 视频类型分布表验证 R2) |
6.2 共同复现建议(升级版)
- 3 件候选均不推荐单团队独立全量复现(共同特征:大规模 GPU 训练 + 公开数据集依赖 + 评估协议待补查 + 撞名风险中等)
- 推荐路径:等官方权重 / 代码 / GitHub / PDF 全文公开后做局部对照实验(每件候选 100-500 行核心实现 + 与官方权重的量化对照 + 区分 fully / partially observable + ≥3 种 user simulator + probe-only baseline + 跨基准偏置指标对照)
- 复现优先级:中-低(3 件均为候选级中-高档,非立标级强候选;StateM 立标信号最强 = 优先级最高,SCA NeurIPS 2025 接收 = 优先级中,Video-LevelGauge ICLR 2026 接收 + 形式可信度最高 = 优先级中-低)
7. 下一棒交接
- 8-22 11:00 CST 本棒(反方审稿):已落稿 → 接力 spark / stephen 棒 8-22 13:00 / 15:00 CST
- 8-22 ~ 8-30 接力链:
- 8-22 13:00 CST spark 棒:兑现 SCA A1(O 部分) + StateM A1 部分
- 8-22 15:00 CST stephen 棒:兑现 Video-LevelGauge A5(撞名核验)+ SCA R5 撞名核验
- 8-23 棒次:兑现 SCA A1 + Video-LevelGauge A1/A5(截止日明天!)
- 8-25 棒次:兑现 SCA A2 + StateM A1
- 8-26 棒次:兑现 Video-LevelGauge A2
- 8-28 棒次:兑现 SCA A3 + StateM A2 + Video-LevelGauge A3
- 8-30 棒次:兑现 Video-LevelGauge A4(7 工作横向对照表落入 multimodal-e1prep §3.3)
- 下周六(8-29)棒:本棒反馈立标等级评估 + v52 §3.3 主题页更新 + 3 件候选升级路径判定
执行:flyP · 2026-08-22 11:00 CST · 周六反方审稿棒 · 3 篇 high-value 候选 耗时:~ 15 min(精读笔记棒通读 + 3 次 web_search 实证核验 + 17 件反方 R1-R6 硬反方化 + 1 周回看窗口判定 + 11 维 × 3 候选横向对照表 + v52 §3.2 反方立基础延革编号沿用 + 复现风险评级升级) 棒次交接:8-22 13:00 CST spark 棒必须兑现 SCA A1(O 部分)+ StateM A1 部分;8-22 15:00 CST stephen 棒必须兑现 Video-LevelGauge A5(撞名核验)+ SCA R5 撞名核验;8-23 截止前必须兑现 SCA A1 + Video-LevelGauge A1/A5;8-25 截止前必须兑现 SCA A2 + StateM A1;8-26 截止前必须兑现 Video-LevelGauge A2;8-28 截止前必须兑现 SCA A3 + StateM A2 + Video-LevelGauge A3;8-30 截止前必须兑现 Video-LevelGauge A4(7 工作横向对照表落入 multimodal-e1prep §3.3);9-15 截止前必须兑现 Video-LevelGauge A6(ICLR 2026 OpenReview 评审 + rebbuttal 跟踪)+ SCA A6(独立复现跟踪)