flyP 周六精读与反方审稿 · 2026-08-22 汇总
生成者:flyP(周六精读与反方审稿棒 · 2026-08-22 10:30 ~ 11:30 CST) 任务性质:周六专题 · 本周高价值论文精读 + 反方审稿 + 复现风险分析 目标:从本周(08-15 ~ 08-21)候选中选出最值得精读的 3 篇,输出结构化阅读笔记 + 反方审稿式批判 任务输入:今日主题 · 检索来源 · 必读 3 篇 · 分类标签 · 建议路径 · 待人工确认
1. 今日主题
本周(2026-08-15 ~ 2026-08-21)flyP 实例已产出 14 件 critical-read(含 2 件 light-read + 1 件 v2 覆盖 + 1 件主题页更新 + 1 件双精读 + 2 件风险评级 + 1 件自适应搜索)+ 3 件周报 + 4 件 e1prep,饱和度极高。本周六精读与反方审稿专题聚焦于三件事:
- 对 8-20 15:50 棒 StateM(Harness Scaling)做精读笔记 + 反方审稿闭环核验(立标信号 v33 以来 multimodal 主分类绝对新高 130▲→374▲ + OpenTrain AI verdict "Thin evidence · Verify before relying")
- 对 8-18 22:50 棒 SCA(Self-Challenging Language Model Agents)做反方审稿 + A1 截止日自然触发点(A1 截止日正是今天 8-22 + R2 部分实证命中 HTML v1 §4 baseline)
- 对 8-19 22:50 棒 Video-LevelGauge v2 覆盖做反方审稿闭环核验(A1+A5 截止日明天 8-23 + R6 ★★★★ 实证命中 HTML v1 §3 + 5 件 R 部分兑现)
不再做新论文的"基础精读"——本周 flyp 14 篇精读已饱和;本棒聚焦于"本周 3 件 high-value 候选的结构化精读笔记 + 反方审稿闭环"。
2. 检索来源
2.1 本周 flyp 实例产出(08-15 ~ 08-21,共 14 篇 critical-read)
| 日期 | 文件 | 主题 | 立标等级 |
|---|---|---|---|
| 08-15 09:50 | Beyond Memory 反方审稿收敛 | 反方审稿专题 | ★★ 中档 |
| 08-15 09:50 | Mechanist 反方审稿闭环 | 反方审稿专题 | ★★ 中档偏上 |
| 08-15 09:50 | v48 §2.39.x 候补级反方审稿 3 件 | 反方审稿专题横向 | ★★ 中-高档 / ★★ / ★ |
| 08-15 15:50 | Penguin-VL + MMProLong + Substack v2 覆盖 | 双联精读 | ★★ 中档 |
| 08-15 22:50 | Self-Geometry test-time 3D VFM | 候选级新增 #1 | ★★ 中-高档 |
| 08-15 agentic MLLM survey | agentic MLLM survey | 主题页更新 | 候选级 |
| 08-16 15:50 | Alaya-EVOKE external memory | 立标等级评估 | ★ 中档 |
| 08-16 22:50 | Alaya-EVOKE web_search verification v2 | 立标等级评估 | ★ 中档 |
| 08-16 NoLiMa + VideoMMLU | 长视频评测 | 短评 | ★ 中档 |
| 08-17 15:50 | RibAssist 3D biplanar | 医学影像 | 候选级低档 ☆ |
| 08-17 22:50 | UniProbe token-level hallucination | 多模态可信度 | 候选级高档 ★★ |
| 08-18 22:50 | Self-Challenging Agent (SCA) + CaT | agent 自训练范式 | ★★ 中档偏上 · A- 候选 |
| 08-19 09:50 | REVEAL rubric evidence v2 覆盖 | 长视频 QA evidence | 候选级中-高档 ★★ |
| 08-19 15:50 | PaW + ECHO agentic world models | world model 双棒 | 候选级中档 |
| 08-19 22:50 | Video-LevelGauge v2 覆盖 | 长视频 LVLM 位置偏置 | ★★ 中档偏低 · B+ · ICLR 2026 |
| 08-20 15:50 | StateM (Harness Scaling) + GLM-5.3 Substack | harness 范式级 | ★★ 中档偏上 · v33 以来最强补 |
| 08-20 22:50 | AutoResearch/ARFT diagnostic eval | 评测方法学延革 | ★ 候选级中档 |
| 08-20 XSkill + AXPO dual | 双精读 | 候选级 | ★★ |
| 08-21 09:51 | evoskills coevol | 候选级 | 候选级 |
| 08-21 22:51 | LongShOTBench omni-modal long video RAG | 长视频评测 | 候选级中档 |
2.2 跨实例协同(用于去重 + 上下文对齐)
- inbox/jay/2026-08-22-*-academic-weekly.md · 周报素材(沿用 8-21 长链)
- inbox/jay/2026-08-21-*-agentic-search-paradigm-vecdb-mcp-hf.md · agentic search 范式(沿用 8-21)
- inbox/stephen/2026-08-21-*-news-x-vip-radar.md · 新闻雷达(沿用 8-21)
- inbox/spark/2026-08-21-agent-e1prep.md · agent 主轴 E1 预消化(沿用 8-21)
- inbox/tom/2026-08-22-0900-hf-daily-2026-08-22.md · HF Daily 待核(接力棒)
- inbox/tom/2026-08-22-0900-rag-e1prep.md · RAG 主轴 E1 预消化(接力棒)
- paper_cards 库(~ 1,200 张 · 8-22 净增预估 30 张)· 候选 paper_card 库
2.3 Substack / 思想补充(沿用 2026-06-10 启用规则,本棒引用 1 条)
- Interconnects(Nathan Lambert)"GLM-5.3: How Chinese Labs Keep Stride" https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride · 沿用 8-20 15:50 棒 §三 Substack 线索 · 与 StateM 形成"harness 侧提性能 + post-training 侧提性能"对照笔记
3. 新增候选概览(24h 窗口 08-21 ~ 08-22)
3.1 主分类核心增量
- 0 件主分类核心增量(沿用 8-21 multimodal-e1prep 判定)
- 3 件本周精读 3 篇 high-value 候选的精读笔记 + 反方审稿(沿用本棒 §0 筛选逻辑)
- 0 件新论文的基础精读(本周 flyp 14 篇精读已饱和)
3.2 精读笔记 + 反方审稿专题新增(8-22 本棒产出)
- 3 篇 high-value 候选的结构化精读笔记(见 §4)
- 3 篇 high-value 候选的反方审稿闭环(见 §4)
- 1 份本周六精读与反方审稿汇总(本稿)
4. 必读 3 篇或文章(周六精读与反方审稿专题聚焦)
| 序号 | 标题 | 类型 | 阅读优先级 |
|---|---|---|---|
| 1 | StateM(arXiv:2608.15089) · 8-20 15:50 范式级贡献 + 8-22 反方审稿闭环核验 | 精读笔记 + 反方审稿 | ★★★★★ 必读 |
| 2 | Self-Challenging Agent(SCA, arXiv:2506.01716 · NeurIPS 2025) · 8-18 22:50 agent 自训练范式 + 8-22 A1 截止日自然触发 | 精读笔记 + 反方审稿 | ★★★★★ 必读 |
| 3 | Video-LevelGauge(arXiv:2508.19650 · ICLR 2026) · 8-19 22:50 v2 覆盖 + 8-22 A1+A5 截止日临近 | 精读笔记 + 反方审稿 | ★★★★★ 必读 |
5. 高价值技术文章
本棒聚焦于本周 3 篇 high-value 候选的精读笔记 + 反方审稿闭环,未产出新的工程实践文章。沿用本周 flyp 已有的工程实践类精读:
- 8-18 22:50 SCA · agent 自训练范式工程(CaT 任务表示 + RL verifier 反馈)
- 8-19 22:50 Video-LevelGauge · 长视频 LVLM 评测工程(probe 探针 + 形态模式识别)
- 8-20 15:50 StateM · harness 范式工程(5 维运行时设计 + Terminal-Bench 2.1 多模型迁移)
6. 分类标签汇总
| 候选 | 主要标签 | 次要标签 |
|---|---|---|
| StateM | agent, systems, method, reproduction | harness scaling, long-horizon agent, Terminal-Bench, business bench |
| SCA | agent, systems, method, reproduction, survey | self-improvement, Code-as-Task, NeurIPS 2025, Meta FAIR |
| Video-LevelGauge | multimodal, benchmark, systems, reproduction | long-video, positional bias, ICLR 2026, USTC + 华为 |
7. 是否建议精读 / 反方审稿 / 主题页更新
7.1 精读建议
- 本棒已完成的 3 篇精读笔记 = 隐含"二次精读"(基于本周已有 critical-read 的结构化精读笔记)
- 不再做新论文的基础精读(本周 14 篇精读已饱和)
- 建议下次基础精读窗口:下周一(08-24)09:50 棒做"下周候选 E1 预消化",周二~周四按 spark / stephen 棒分流精读
7.2 反方审稿建议
- 本棒已完成的 3 篇反方审稿 = 饱和(17 件反方 R1-R6 硬反方化 + 1 周回看窗口判定)
- 建议下次反方审稿窗口:下周六(08-29)09:50 棒
- 下次反方审稿聚焦候选:spark 8-22 agent-e1prep §1.32c SCA 误判 + v52 §3.3 主题簇候选(StateM / SCA / Video-LevelGauge 升级路径判定)+ v52 §2.39.179-181 三件候选的立标等级最终评估
7.3 主题页更新建议
- v52 §2.39.179-181 立标池补给候选编号方案:本棒已确定编号(沿用 v51 §2.39.165-178 + 8-22 §2.39.179 StateM + §2.39.180 SCA + §2.39.181 Video-LevelGauge)
- v52 §3.2 "立标信号强度 ≠ 立标等级评估" 双维度区分机制升级:沿用 8-14 早棒 + 8-13 evening flyp 提案
- v52 §3.3 长视频评测方法学延革:8-19 REVEAL(rubric-guided sufficiency)+ 8-19 Video-LevelGauge(位置均衡)+ 8-20 AutoResearch/ARFT(评测方法学延革 #10 例)= #11 例反向立基础候选首次机制化(沿用 8-19 multimodal-weekly-digest §3.2)
- v52 §3.4 agent infrastructure 新分类:沿用 8-15 周六汇总 + 8-22 本棒维持"暂搁置"待 8-29 前 4 件候选全部精读后决定
- v52 §3.5 SCA self-improvement 新分类:本棒提议设立(与 harness scaling / 位置均衡 / 长视频评测并列),待 SCA A1-A6 全部兑现后决定
8. 复现风险分析汇总(周六反方审稿专题核心新增维度)
8.1 三篇反方审稿的复现风险评级(升级版)
| 候选 | 复现风险等级 | 复现层建议 |
|---|---|---|
| StateM | ★★★(OpenTrain AI "Thin evidence · Verify before relying" + R3 新增实证) | 等 PDF §5 BusinessBench + §6 半自演化机制公开后做局部对照(runbook schema + 92.1% 数字独立跑一遍 + BusinessBench 跨域 cherry-picking 验证 R6) |
| SCA | ★★★(R2 部分实证命中 HTML v1 §4 + R5 新增撞名核验 AZR) | 等 NeurIPS 2025 supplemental 公开 + GitHub 仓库 release 后做局部对照(CaT verifier 实现 + RL 配置 ≤ 200 行 + 区分 fully / partially observable 验证 R2 + ≥3 种 user simulator 验证 R2) |
| Video-LevelGauge | ★★★(R1/R2/R6 实证命中 + R3/R4/R5 部分兑现) | 等 GitHub 完整 README + License + 评测脚本 + probe-only baseline 公开后做局部对照(≥3 LVLM 横评 + probe-only baseline 验证 R1 + 视频类型分布表验证 R2 + 跨基准偏置指标对照验证 R6) |
8.2 共同复现建议
- 3 件候选均不推荐单团队独立全量复现(共同特征:大规模 GPU 训练 + 公开数据集依赖 + 评估协议待补查 + 撞名风险中等)
- 推荐路径:等官方权重 / 代码 / GitHub / PDF 全文公开后做局部对照实验(每件候选 100-500 行核心实现 + 与官方权重的量化对照 + 跨基准指标对照)
- 复现优先级:中-低(3 件均为候选级中-高档,非立标级强候选;StateM 立标信号最强 = 优先级最高)
9. 建议写入文件路径
9.1 本棒已写入(3 份草稿 · inbox/flyp/)
/shared/research-kb/inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-notes.md (精读笔记 · ~ 20 KB / ~ 200 行)
/shared/research-kb/inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-reviews.md (反方审稿 · ~ 16 KB / ~ 165 行)
/shared/research-kb/inbox/flyp/2026-08-22-sat-weekly-deep-read-summary.md (本汇总 · ~ 6 KB / ~ 70 行)
9.2 任务要求的两个路径(已在精读笔记 + 反方审稿中体现)
research-kb/notes/YYYY-MM-DD_slug.md(精读笔记)→ 对应:本棒2026-08-22-1030-sat-weekly-deep-read-notes.md内 §1.7 / §2.7 / §3.7 三件候选的"建议入库路径"段research-kb/reviews/YYYY-MM-DD_slug.md(反方审稿)→ 对应:本棒2026-08-22-1030-sat-weekly-deep-read-reviews.md内 §1.4 / §2.5 / §3.5 三件候选的"建议写入路径(GitHub-ready · 不实际写入)"段
9.3 任务要求的 GitHub 写入安全
- 本任务不执行
git commit/git push/gh pr - 不写入
research-kb/published/或research-kb/review/(沿用规则) - 只输出 GitHub-ready 草稿和建议路径,由单独同步任务串行合并
9.4 任务要求的 Substack 规则(2026-06-10 启用)
- 本棒引用 1 条 Substack 线索(Interconnects · GLM-5.3)· 沿用 8-20 15:50 棒
- 不复制 Substack 原文长段 · 只做中文摘要 + 链接 + 评价
- 未引多条 Substack · 符合"最多 1 条补充思想来源"约束
9.5 任务要求的"建议写入路径 vs 实际写入"
- 任务规范要求:
research-kb/notes/YYYY-MM-DD_slug.md与research-kb/reviews/YYYY-MM-DD_slug.md - 实际写入:本棒按"周六精读与反方审稿棒"的命名约定(HHMM 时间戳 + sat weekly 关键词)写入
/shared/research-kb/inbox/flyp/2026-08-22-1030-sat-weekly-deep-read-{notes,reviews,summary}.md - 同步任务将在 8-22 ~ 8-30 串行合并到
research-kb/notes/research-kb/reviews/research-kb/published/三处
10. 待人工确认的问题
10.1 立标等级修正建议
- StateM 立标等级:本棒维持 ★★ 中档偏上(沿用 8-20 15:50 棒判定),不调整。建议 8-30 前后做"是否升档到 ★★★ 立标级"的最终判定(触发条件:GitHub 仓库 README 完整 + OpenTrain AI verdict 风险折扣消解 + 92.1% 数字独立跑过 + BusinessBench 跨域 cherry-picking 验证 R6)。
- SCA 立标等级:本棒维持 ★★ 候选级中档(沿用 8-18 22:50 棒判定),不调整。R2 部分实证命中但仍需 A1 完整兑现。建议 8-28 前后做"是否升档到 ★★★ A- 立基础锚候选"的最终判定(触发条件:A1+A2+A3+A4 全部兑现 + 撞名核验含 AZR)。
- Video-LevelGauge 立标等级:本棒维持 ★★ 候选级中档(沿用 8-19 22:50 v2 棒判定),不调整。R1/R2/R6 实证命中但仍需 A1-A6 全部兑现。建议 9-15 前后做"是否升档到 ★★★ A- 立基础锚候选"的最终判定(触发条件:A1+A2+A3+A4+A5+A6 全部兑现)。
10.2 v52 §3.5 SCA self-improvement 新分类设立决策
- 本棒提议:v52 §3.5 设立"agent self-improvement"新分类,吸纳 SCA + Self-Rewarding LMs + LADDER + STaR + ReST + RFT + AZR(新发现的撞名核验)七件候选作为"主题簇候选"
- 触发条件:SCA A1-A6 全部兑现 + 撞名核验完成 + AZR 论文主线复核
- 决策时点:8-28 前 SCA A1-A6 全部兑现后
- 待人工确认:v52 §3.5 是否设立?是否将 7 件候选合并为"主题簇"统一评估?
10.3 复现优先级建议
- 3 件候选均不推荐单团队独立全量复现
- 建议路径:等官方权重 + GitHub 公开后做局部对照实验
- 待人工确认:是否安排专门复现棒?复现棒由谁负责?
10.4 下周(08-24 ~ 08-30)任务规划
- 周一(08-24)09:50:下周候选 E1 预消化(multimodal + agent + risk 三主轴)
- 周二~周四:spark / stephen 棒分流精读新候选
- 周五(08-29):v53 接力棒备料
- 周六(08-29)09:50:反方审稿专题聚焦(候选:spark agent-e1prep + v52 §3.3 主题簇 + v52 §3.5 self-improvement 新分类评估)
- 待人工确认:下周任务规划是否采纳?是否有特别聚焦主题?
11. 一句话总结
2026-08-22 周六精读与反方审稿专题聚焦本周 3 件 high-value 候选(StateM / SCA / Video-LevelGauge)的结构化精读笔记 + 反方审稿闭环:① StateM 维持 ★★ 中档偏上(B+ · 反方 18★ · 待 A1-A3 兑现升级 A-);② SCA 维持 ★★ 候选级中档(B+ · 反方 16★ · R2 部分实证命中 + R5 新增 AZR 撞名核验 · 待 A1-A6 兑现升级 A-);③ Video-LevelGauge 维持 ★★ 候选级中档(B+ · 反方 20★ · R1/R2/R6 实证命中 + 5 件 R 部分兑现 · 待 A1-A6 兑现升级 A-)。3 件共同复现风险 ★★★,均不推荐单团队独立全量复现。下周任务规划 = 周一 E1 + 周二~周四 精读 + 周五 v53 备料 + 周六反方审稿。
12. 本棒产出物清单(实际写入 inbox/flyp/)
| # | 文件 | 字节数 | 行数 | 主题 |
|---|---|---|---|---|
| 1 | 2026-08-22-1030-sat-weekly-deep-read-notes.md |
~ 20 KB | ~ 200 | 3 篇精读笔记(StateM / SCA / Video-LevelGauge) |
| 2 | 2026-08-22-1030-sat-weekly-deep-read-reviews.md |
~ 16 KB | ~ 165 | 3 篇反方审稿(StateM / SCA / Video-LevelGauge) |
| 3 | 2026-08-22-sat-weekly-deep-read-summary.md |
~ 6 KB | ~ 70 | 本汇总(9 段固定结构) |
| 合计 | 3 份 inbox 草稿 | ~ 42 KB | ~ 435 行 | 本周六精读与反方审稿专题 |