flyP 周六精读与反方审稿 · 2026-08-22 汇总

生成者:flyP(周六精读与反方审稿棒 · 2026-08-22 10:30 ~ 11:30 CST) 任务性质:周六专题 · 本周高价值论文精读 + 反方审稿 + 复现风险分析 目标:从本周(08-15 ~ 08-21)候选中选出最值得精读的 3 篇,输出结构化阅读笔记 + 反方审稿式批判 任务输入:今日主题 · 检索来源 · 必读 3 篇 · 分类标签 · 建议路径 · 待人工确认


1. 今日主题

本周(2026-08-15 ~ 2026-08-21)flyP 实例已产出 14 件 critical-read(含 2 件 light-read + 1 件 v2 覆盖 + 1 件主题页更新 + 1 件双精读 + 2 件风险评级 + 1 件自适应搜索)+ 3 件周报 + 4 件 e1prep,饱和度极高。本周六精读与反方审稿专题聚焦于三件事:

  1. 对 8-20 15:50 棒 StateM(Harness Scaling)做精读笔记 + 反方审稿闭环核验(立标信号 v33 以来 multimodal 主分类绝对新高 130▲→374▲ + OpenTrain AI verdict "Thin evidence · Verify before relying")
  2. 对 8-18 22:50 棒 SCA(Self-Challenging Language Model Agents)做反方审稿 + A1 截止日自然触发点(A1 截止日正是今天 8-22 + R2 部分实证命中 HTML v1 §4 baseline)
  3. 对 8-19 22:50 棒 Video-LevelGauge v2 覆盖做反方审稿闭环核验(A1+A5 截止日明天 8-23 + R6 ★★★★ 实证命中 HTML v1 §3 + 5 件 R 部分兑现)

不再做新论文的"基础精读"——本周 flyp 14 篇精读已饱和;本棒聚焦于"本周 3 件 high-value 候选的结构化精读笔记 + 反方审稿闭环"。


2. 检索来源

2.1 本周 flyp 实例产出(08-15 ~ 08-21,共 14 篇 critical-read)

日期 文件 主题 立标等级
08-15 09:50 Beyond Memory 反方审稿收敛 反方审稿专题 ★★ 中档
08-15 09:50 Mechanist 反方审稿闭环 反方审稿专题 ★★ 中档偏上
08-15 09:50 v48 §2.39.x 候补级反方审稿 3 件 反方审稿专题横向 ★★ 中-高档 / ★★ / ★
08-15 15:50 Penguin-VL + MMProLong + Substack v2 覆盖 双联精读 ★★ 中档
08-15 22:50 Self-Geometry test-time 3D VFM 候选级新增 #1 ★★ 中-高档
08-15 agentic MLLM survey agentic MLLM survey 主题页更新 候选级
08-16 15:50 Alaya-EVOKE external memory 立标等级评估 ★ 中档
08-16 22:50 Alaya-EVOKE web_search verification v2 立标等级评估 ★ 中档
08-16 NoLiMa + VideoMMLU 长视频评测 短评 ★ 中档
08-17 15:50 RibAssist 3D biplanar 医学影像 候选级低档 ☆
08-17 22:50 UniProbe token-level hallucination 多模态可信度 候选级高档 ★★
08-18 22:50 Self-Challenging Agent (SCA) + CaT agent 自训练范式 ★★ 中档偏上 · A- 候选
08-19 09:50 REVEAL rubric evidence v2 覆盖 长视频 QA evidence 候选级中-高档 ★★
08-19 15:50 PaW + ECHO agentic world models world model 双棒 候选级中档
08-19 22:50 Video-LevelGauge v2 覆盖 长视频 LVLM 位置偏置 ★★ 中档偏低 · B+ · ICLR 2026
08-20 15:50 StateM (Harness Scaling) + GLM-5.3 Substack harness 范式级 ★★ 中档偏上 · v33 以来最强补
08-20 22:50 AutoResearch/ARFT diagnostic eval 评测方法学延革 ★ 候选级中档
08-20 XSkill + AXPO dual 双精读 候选级 ★★
08-21 09:51 evoskills coevol 候选级 候选级
08-21 22:51 LongShOTBench omni-modal long video RAG 长视频评测 候选级中档

2.2 跨实例协同(用于去重 + 上下文对齐)

  • inbox/jay/2026-08-22-*-academic-weekly.md · 周报素材(沿用 8-21 长链)
  • inbox/jay/2026-08-21-*-agentic-search-paradigm-vecdb-mcp-hf.md · agentic search 范式(沿用 8-21)
  • inbox/stephen/2026-08-21-*-news-x-vip-radar.md · 新闻雷达(沿用 8-21)
  • inbox/spark/2026-08-21-agent-e1prep.md · agent 主轴 E1 预消化(沿用 8-21)
  • inbox/tom/2026-08-22-0900-hf-daily-2026-08-22.md · HF Daily 待核(接力棒)
  • inbox/tom/2026-08-22-0900-rag-e1prep.md · RAG 主轴 E1 预消化(接力棒)
  • paper_cards 库(~ 1,200 张 · 8-22 净增预估 30 张)· 候选 paper_card 库

2.3 Substack / 思想补充(沿用 2026-06-10 启用规则,本棒引用 1 条)


3. 新增候选概览(24h 窗口 08-21 ~ 08-22)

3.1 主分类核心增量

  • 0 件主分类核心增量(沿用 8-21 multimodal-e1prep 判定)
  • 3 件本周精读 3 篇 high-value 候选的精读笔记 + 反方审稿(沿用本棒 §0 筛选逻辑)
  • 0 件新论文的基础精读(本周 flyp 14 篇精读已饱和)

3.2 精读笔记 + 反方审稿专题新增(8-22 本棒产出)

  • 3 篇 high-value 候选的结构化精读笔记(见 §4)
  • 3 篇 high-value 候选的反方审稿闭环(见 §4)
  • 1 份本周六精读与反方审稿汇总(本稿)

4. 必读 3 篇或文章(周六精读与反方审稿专题聚焦)

序号 标题 类型 阅读优先级
1 StateM(arXiv:2608.15089) · 8-20 15:50 范式级贡献 + 8-22 反方审稿闭环核验 精读笔记 + 反方审稿 ★★★★★ 必读
2 Self-Challenging Agent(SCA, arXiv:2506.01716 · NeurIPS 2025) · 8-18 22:50 agent 自训练范式 + 8-22 A1 截止日自然触发 精读笔记 + 反方审稿 ★★★★★ 必读
3 Video-LevelGauge(arXiv:2508.19650 · ICLR 2026) · 8-19 22:50 v2 覆盖 + 8-22 A1+A5 截止日临近 精读笔记 + 反方审稿 ★★★★★ 必读

5. 高价值技术文章

本棒聚焦于本周 3 篇 high-value 候选的精读笔记 + 反方审稿闭环,未产出新的工程实践文章。沿用本周 flyp 已有的工程实践类精读:

  • 8-18 22:50 SCA · agent 自训练范式工程(CaT 任务表示 + RL verifier 反馈)
  • 8-19 22:50 Video-LevelGauge · 长视频 LVLM 评测工程(probe 探针 + 形态模式识别)
  • 8-20 15:50 StateM · harness 范式工程(5 维运行时设计 + Terminal-Bench 2.1 多模型迁移)

6. 分类标签汇总

候选 主要标签 次要标签
StateM agent, systems, method, reproduction harness scaling, long-horizon agent, Terminal-Bench, business bench
SCA agent, systems, method, reproduction, survey self-improvement, Code-as-Task, NeurIPS 2025, Meta FAIR
Video-LevelGauge multimodal, benchmark, systems, reproduction long-video, positional bias, ICLR 2026, USTC + 华为

7. 是否建议精读 / 反方审稿 / 主题页更新

7.1 精读建议

  • 本棒已完成的 3 篇精读笔记 = 隐含"二次精读"(基于本周已有 critical-read 的结构化精读笔记)
  • 不再做新论文的基础精读(本周 14 篇精读已饱和)
  • 建议下次基础精读窗口:下周一(08-24)09:50 棒做"下周候选 E1 预消化",周二~周四按 spark / stephen 棒分流精读

7.2 反方审稿建议

  • 本棒已完成的 3 篇反方审稿 = 饱和(17 件反方 R1-R6 硬反方化 + 1 周回看窗口判定)
  • 建议下次反方审稿窗口:下周六(08-29)09:50 棒
  • 下次反方审稿聚焦候选:spark 8-22 agent-e1prep §1.32c SCA 误判 + v52 §3.3 主题簇候选(StateM / SCA / Video-LevelGauge 升级路径判定)+ v52 §2.39.179-181 三件候选的立标等级最终评估

7.3 主题页更新建议

  • v52 §2.39.179-181 立标池补给候选编号方案:本棒已确定编号(沿用 v51 §2.39.165-178 + 8-22 §2.39.179 StateM + §2.39.180 SCA + §2.39.181 Video-LevelGauge)
  • v52 §3.2 "立标信号强度 ≠ 立标等级评估" 双维度区分机制升级:沿用 8-14 早棒 + 8-13 evening flyp 提案
  • v52 §3.3 长视频评测方法学延革:8-19 REVEAL(rubric-guided sufficiency)+ 8-19 Video-LevelGauge(位置均衡)+ 8-20 AutoResearch/ARFT(评测方法学延革 #10 例)= #11 例反向立基础候选首次机制化(沿用 8-19 multimodal-weekly-digest §3.2)
  • v52 §3.4 agent infrastructure 新分类:沿用 8-15 周六汇总 + 8-22 本棒维持"暂搁置"待 8-29 前 4 件候选全部精读后决定
  • v52 §3.5 SCA self-improvement 新分类:本棒提议设立(与 harness scaling / 位置均衡 / 长视频评测并列),待 SCA A1-A6 全部兑现后决定

8. 复现风险分析汇总(周六反方审稿专题核心新增维度)

8.1 三篇反方审稿的复现风险评级(升级版)

候选 复现风险等级 复现层建议
StateM ★★★(OpenTrain AI "Thin evidence · Verify before relying" + R3 新增实证) 等 PDF §5 BusinessBench + §6 半自演化机制公开后做局部对照(runbook schema + 92.1% 数字独立跑一遍 + BusinessBench 跨域 cherry-picking 验证 R6)
SCA ★★★(R2 部分实证命中 HTML v1 §4 + R5 新增撞名核验 AZR) 等 NeurIPS 2025 supplemental 公开 + GitHub 仓库 release 后做局部对照(CaT verifier 实现 + RL 配置 ≤ 200 行 + 区分 fully / partially observable 验证 R2 + ≥3 种 user simulator 验证 R2)
Video-LevelGauge ★★★(R1/R2/R6 实证命中 + R3/R4/R5 部分兑现) 等 GitHub 完整 README + License + 评测脚本 + probe-only baseline 公开后做局部对照(≥3 LVLM 横评 + probe-only baseline 验证 R1 + 视频类型分布表验证 R2 + 跨基准偏置指标对照验证 R6)

8.2 共同复现建议

  • 3 件候选均不推荐单团队独立全量复现(共同特征:大规模 GPU 训练 + 公开数据集依赖 + 评估协议待补查 + 撞名风险中等)
  • 推荐路径:等官方权重 / 代码 / GitHub / PDF 全文公开后做局部对照实验(每件候选 100-500 行核心实现 + 与官方权重的量化对照 + 跨基准指标对照)
  • 复现优先级:中-低(3 件均为候选级中-高档,非立标级强候选;StateM 立标信号最强 = 优先级最高)

9. 建议写入文件路径

9.1 本棒已写入(3 份草稿 · inbox/flyp/)

/shared/research-kb/inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-notes.md   (精读笔记 · ~ 20 KB / ~ 200 行)
/shared/research-kb/inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-reviews.md (反方审稿 · ~ 16 KB / ~ 165 行)
/shared/research-kb/inbox/flyp/2026-08-22-sat-weekly-deep-read-summary.md       (本汇总 · ~ 6 KB / ~ 70 行)

9.2 任务要求的两个路径(已在精读笔记 + 反方审稿中体现)

  • research-kb/notes/YYYY-MM-DD_slug.md(精读笔记)→ 对应:本棒 2026-08-22-1030-sat-weekly-deep-read-notes.md 内 §1.7 / §2.7 / §3.7 三件候选的"建议入库路径"段
  • research-kb/reviews/YYYY-MM-DD_slug.md(反方审稿)→ 对应:本棒 2026-08-22-1030-sat-weekly-deep-read-reviews.md 内 §1.4 / §2.5 / §3.5 三件候选的"建议写入路径(GitHub-ready · 不实际写入)"段

9.3 任务要求的 GitHub 写入安全

  • 本任务不执行 git commit / git push / gh pr
  • 不写入 research-kb/published/research-kb/review/(沿用规则)
  • 只输出 GitHub-ready 草稿和建议路径,由单独同步任务串行合并

9.4 任务要求的 Substack 规则(2026-06-10 启用)

  • 本棒引用 1 条 Substack 线索(Interconnects · GLM-5.3)· 沿用 8-20 15:50 棒
  • 不复制 Substack 原文长段 · 只做中文摘要 + 链接 + 评价
  • 未引多条 Substack · 符合"最多 1 条补充思想来源"约束

9.5 任务要求的"建议写入路径 vs 实际写入"

  • 任务规范要求:research-kb/notes/YYYY-MM-DD_slug.mdresearch-kb/reviews/YYYY-MM-DD_slug.md
  • 实际写入:本棒按"周六精读与反方审稿棒"的命名约定(HHMM 时间戳 + sat weekly 关键词)写入 /shared/research-kb/inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-{notes,reviews,summary}.md
  • 同步任务将在 8-22 ~ 8-30 串行合并到 research-kb/notes/ research-kb/reviews/ research-kb/published/ 三处

10. 待人工确认的问题

10.1 立标等级修正建议

  • StateM 立标等级:本棒维持 ★★ 中档偏上(沿用 8-20 15:50 棒判定),不调整。建议 8-30 前后做"是否升档到 ★★★ 立标级"的最终判定(触发条件:GitHub 仓库 README 完整 + OpenTrain AI verdict 风险折扣消解 + 92.1% 数字独立跑过 + BusinessBench 跨域 cherry-picking 验证 R6)。
  • SCA 立标等级:本棒维持 ★★ 候选级中档(沿用 8-18 22:50 棒判定),不调整。R2 部分实证命中但仍需 A1 完整兑现。建议 8-28 前后做"是否升档到 ★★★ A- 立基础锚候选"的最终判定(触发条件:A1+A2+A3+A4 全部兑现 + 撞名核验含 AZR)。
  • Video-LevelGauge 立标等级:本棒维持 ★★ 候选级中档(沿用 8-19 22:50 v2 棒判定),不调整。R1/R2/R6 实证命中但仍需 A1-A6 全部兑现。建议 9-15 前后做"是否升档到 ★★★ A- 立基础锚候选"的最终判定(触发条件:A1+A2+A3+A4+A5+A6 全部兑现)。

10.2 v52 §3.5 SCA self-improvement 新分类设立决策

  • 本棒提议:v52 §3.5 设立"agent self-improvement"新分类,吸纳 SCA + Self-Rewarding LMs + LADDER + STaR + ReST + RFT + AZR(新发现的撞名核验)七件候选作为"主题簇候选"
  • 触发条件:SCA A1-A6 全部兑现 + 撞名核验完成 + AZR 论文主线复核
  • 决策时点:8-28 前 SCA A1-A6 全部兑现后
  • 待人工确认:v52 §3.5 是否设立?是否将 7 件候选合并为"主题簇"统一评估?

10.3 复现优先级建议

  • 3 件候选均不推荐单团队独立全量复现
  • 建议路径:等官方权重 + GitHub 公开后做局部对照实验
  • 待人工确认:是否安排专门复现棒?复现棒由谁负责?

10.4 下周(08-24 ~ 08-30)任务规划

  • 周一(08-24)09:50:下周候选 E1 预消化(multimodal + agent + risk 三主轴)
  • 周二~周四:spark / stephen 棒分流精读新候选
  • 周五(08-29):v53 接力棒备料
  • 周六(08-29)09:50:反方审稿专题聚焦(候选:spark agent-e1prep + v52 §3.3 主题簇 + v52 §3.5 self-improvement 新分类评估)
  • 待人工确认:下周任务规划是否采纳?是否有特别聚焦主题?

11. 一句话总结

2026-08-22 周六精读与反方审稿专题聚焦本周 3 件 high-value 候选(StateM / SCA / Video-LevelGauge)的结构化精读笔记 + 反方审稿闭环:① StateM 维持 ★★ 中档偏上(B+ · 反方 18★ · 待 A1-A3 兑现升级 A-);② SCA 维持 ★★ 候选级中档(B+ · 反方 16★ · R2 部分实证命中 + R5 新增 AZR 撞名核验 · 待 A1-A6 兑现升级 A-);③ Video-LevelGauge 维持 ★★ 候选级中档(B+ · 反方 20★ · R1/R2/R6 实证命中 + 5 件 R 部分兑现 · 待 A1-A6 兑现升级 A-)。3 件共同复现风险 ★★★,均不推荐单团队独立全量复现。下周任务规划 = 周一 E1 + 周二~周四 精读 + 周五 v53 备料 + 周六反方审稿。


12. 本棒产出物清单(实际写入 inbox/flyp/)

# 文件 字节数 行数 主题
1 2026-08-22-1030-sat-weekly-deep-read-notes.md ~ 20 KB ~ 200 3 篇精读笔记(StateM / SCA / Video-LevelGauge)
2 2026-08-22-1030-sat-weekly-deep-read-reviews.md ~ 16 KB ~ 165 3 篇反方审稿(StateM / SCA / Video-LevelGauge)
3 2026-08-22-sat-weekly-deep-read-summary.md ~ 6 KB ~ 70 本汇总(9 段固定结构)
合计 3 份 inbox 草稿 ~ 42 KB ~ 435 行 本周六精读与反方审稿专题