flyP 周六精读笔记 · 2026-08-22 · 本周 3 篇高价值论文结构化阅读笔记

棒次定位:cron 034af2f3-c583-4a62-b01e-1ae28114fb89 · 研究知识库 · 周六精读与反方审稿棒 · 2026-08-22 10:30 CST 本棒目标:从本周(08-15 ~ 08-21)候选中选出最值得精读的 3 篇,输出结构化阅读笔记(核心论点 / 方法拆解 / 实验对照 / 可信度 / 是否建议入库) 不写 GitHub:不写入 research-kb/notes/ research-kb/reviews/ research-kb/published/;只产 inbox 草稿,由同步任务串行合并 承接上周六:8-15 sat 反方审稿专题聚焦 Mechanist + Beyond Memory + v48 §2.39.x 候补级 3 件;本棒聚焦本周 3 件立标信号更强 / 反方触发更急的候选


0. 本周候选筛选逻辑

本周(2026-08-15 ~ 2026-08-21)flyp 棒累计产出 14 件 critical-read + 2 件 light-read + 3 件周报 + 4 件 e1prep,饱和度极高。本棒筛选标准:

  1. 立标信号绝对强度(HF Daily ▲ + 顶会接收 + 代码/数据/权重齐备)
  2. 反方触发紧迫性(A1/A2/A4 截止日是否落在本棒窗口 8-22 ~ 8-30)
  3. 方法学增量独立度(是否可作为"维度级"基础锚被其它候选引用)
  4. 跨棒耦合度(是否被同日或同窗棒引用 / 是否串联其它 critical-read)

按上述 4 维,本棒选定 3 篇:

序号 候选 时间 立标信号 反方紧迫性 方法学增量 跨棒耦合
1 StateM(arXiv:2608.15089) 8-20 15:50 ★★★★★(HF Daily 130▲→374▲ · v33 以来 multimodal 主分类绝对新高) ★★★(PDF §5 BusinessBench + §6 半自演化机制 = 反方关键段待 8-25 ~ 8-30) ★★★★★(harness scaling 范式级命名 · 与 model scaling 并列) ★★★★(与 XSkill / AXPO / Agent Lightning 1.0 形成 harness 四象限)
2 Self-Challenging Agent (SCA) (arXiv:2506.01716 · NeurIPS 2025) 8-18 22:50 ★★★★(NeurIPS 2025 + HF papers 已挂 + Meta FAIR 一作 + 5 源可核验) ★★★★★A1 截止日正是今天 8-22 · R1/R2 ★★★★ 高严重度) ★★★★(challenger/executor 同模型 + CaT 代码化任务表示) ★★★★(与同日 15:50 agent-evals + 09:50 MMLongBench/Embed 形成评测锚三件簇)
3 Video-LevelGauge (arXiv:2508.19650 · ICLR 2026) 8-19 22:50 v2 覆盖 ★★★★(ICLR 2026 接收 + OpenReview 已挂 + GitHub/HF 数据集全公开 + 27 LVLM 横评) ★★★★★A1+A5 截止日 8-23 · R1/R2/R6 ★★★★) ★★★★★(位置均衡维度独立成基准 + 形态模式识别 + 与 REVEAL 形成位置均衡 × 证据忠实双轴) ★★★★★(与 REVEAL / LongVideoBench / MLVU / LVBench 形成长视频评测矩阵)

1. StateM · Harness Scaling · 范式级贡献候选立基础锚

1.1 元信息

1.2 核心论点(flyP 一句话)

"Harness scaling 取代"model scaling"作为长程 agent 的瓶颈转移路径:通过 stateful runtime + 持久化 runbook + checked transitions,把"死掉的 postmortem 经验"转成"可执行的 stateful preconditions",在不动模型权重的前提下把 GPT-5.5 xhigh 在 Terminal-Bench 2.1 从 83.1% 拉到 92.1%,并通过 runbook 冻结迁移到 GPT-5.6 Luna 让低成本模型(76.7% → 85.4%)追平 GPT-5.6 Sol xhigh 84.9% 参考。

1.3 方法拆解(StateM 运行时五件套)

# 组件 功能 与既有 harness 工作对照
1 Durable states 跨 step 持久化 agent 状态(执行历史、checkpoint、retry state) 与 LangGraph checkpointing / Temporal IO 同方向,但强调"版本化 + 持久化"
2 Phase-local context 每个阶段独立的局部上下文(避免长程上下文稀释) 与 XSkill in-context 双流经验池同方向,但"阶段"边界是显式 schema 而非自然累积
3 Checked transitions 进入下一阶段的检查式转移(前置条件 + 失败回滚) 与 FSM-style agent loop 同方向,但引入"precondition as code"
4 Recoverable runbooks 可恢复的执行剧本(含 fallback 路径) 与早期 AutoGPT / BabyAGI 同方向,但 runbook 是"模板 + 可执行脚本"而非纯 prompt
5 Versioned procedural practices 可与人类共同检视的版本化流程(git-style 版本管理) 新引入 = 与"harness as code"范式对齐(类似 Terraform / Ansible)

1.4 实验结果(核心数据)

场景 模型 baseline StateM 提升 备注
Terminal-Bench 2.1 GPT-5.5 xhigh 83.1% 92.1% +9.0 超过 GPT-5.6 Sol Ultra 91.9%
Terminal-Bench 2.1 GPT-5.6 Sol xhigh 89 任务 100% 至少 1 次 95.3% raw 89/89 至少一次 445 trials 总体
Terminal-Bench 2.1(frozen profile) GPT-5.6 Luna(低成本) 76.7% 85.4% +8.7 超过 Sol xhigh 参考 84.9%
Terminal-Bench 2.1(成本最低) DeepSeek-V4 Flash 82.7% 88.1% / 89.1% (88-task) +5.4 / +6.4 单次 API 成本约 \$15 vs GPT 参考 \$574.68 · 总 DeepSeek 支出 \$52.22
BusinessBench(域泛化) family-specific runbooks holdout macro +0.55 / micro +1.34 两族机制匹配 +10.04 域泛化能力

反向核验:Terminal-Bench 2.1 官方榜单(tbench.ai · artificialanalysis.ai · snorkel.ai)目前 Codex CLI GPT-5.5 = 83.1% ± 1.1%(与 StateM 引用的 baseline 数字一致)= StateM 在 Terminal-Bench 2.1 上的 baseline 数字确实可外部核验,但 92.1% 数字只在 StateM 论文内自报,未在官方榜单挂出 = 关键数字需独立跑一遍

1.5 方法学增量(flyP 评级)

维度 评价
新颖性 ★★★★★ · 把"harness scaling"显式立为与"model scaling"并列的 scaling 轴 = 清晰的概念级贡献(vs XSkill 是工程式演进)
完整性 ★★★★ · 5 维运行时设计 + Terminal-Bench 2.1 多模型迁移 + BusinessBench 域泛化 + 成本数据 = 论据维度覆盖性能 / 通用性 / 经济性
可复现性 ★★★ · 代码已挂 GitHub · runbook 是否随代码完全 release 待验 · Terminal-Bench 是公开基准但 OpenTrain AI 标记 "Thin evidence · Verify before relying" = 关键数字独立复现门槛未过
立标信号 ★★★★★ · 130▲→374▲ v33 以来 multimodal 主分类绝对新高 · flyp multimodal-e1prep v53 §3.2 标记为"评测方法学延革第 10 例反方立基础候选"
撞名风险 ★★★ · "Harness scaling" vs "Model scaling"边界模糊;"Semi-Self-Evolving"撞 "self-evolving"系列
flyP 评级 B+ · 候选级中-高档 ★★ 中档偏上 · 待 A1-A3 兑现后升级 A-

1.6 后续验证动作(与 8-20 15:50 棒 A1-A3 对齐)

# 动作 截止日 验收标准
A1 抓 PDF §5 BusinessBench 域泛化实验细节 + 6 模型迁移(GPT-5.5/5.6/DeepSeek-V4 Flash)数据一致性 2026-08-25 列出 ≥3 模型迁移完整表 + BusinessBench 跨域对照
A2 抓 PDF §6 "Semi-Self-Evolving" 自动演化机制 + 人在环程度 + 版本化如何避免漂移 2026-08-28 列出 runbook 自演化具体步骤 + 漂移检测机制
A3 抓 §4 Terminal-Bench 2.1 主表 vs 官方榜单交叉验证(92.1% 是否在独立跑也可复现) 2026-08-30 列出官方榜单数字 vs StateM 自报对照表 + 独立跑 ≥1 次

1.7 建议入库路径(GitHub-ready · 不实际写入)

  • notes/agents/harness-and-runtime/statem-harness-scaling.md
  • notes/agents/harness-and-runtime/index.md(新建 index · 收纳 harness 四象限:XSkill / StateM / AXPO / Agent Lightning 1.0)
  • 与 GLM-5.3(Substack 线索)形成"harness 侧提性能 + post-training 侧提性能"对照笔记

2. Self-Challenging Language Model Agents (SCA) · agent 自训练范式 + Code-as-Task 任务合成立基础锚

2.1 元信息

2.2 核心论点(flyP 一句话)

"Challenger/Executor 同模型 + Code-as-Task (CaT) 任务表示 + self-generated training data = agent 自训练范式":让同一模型先以 challenger 角色交互工具生成任务(instruction + verifier + example solution + failure cases 四元组),再以 executor 角色 RL 训练自己执行,Llama-3.1-8B-Instruct 在 M3ToolEval + TauBench 4 任务上仅用 self-generated 训练数据达成 >2× 改进(Pass@1 12.0% → 23.5%,绝对 +10.6%,相对 PAE baseline)。

2.3 方法拆解

2.3.1 Code-as-Task (CaT) 四元组

组件 描述 工程作用 与同期工作对照
instruction 自然语言任务描述 用户侧输入 与所有 agent benchmark 一致
verification function 可执行代码:判断 agent 输出是否完成 verifier 锚 · RL 奖励信号 区别于"GPT-4 judge"路线(关键差异
example solution 标准执行轨迹 executor 训练数据 区别于"纯 prompting"
failure cases 显式枚举的反例 单元测试 · 任务质量过滤 工程化锚 = 可跑通的测试集

CaT 核心 trickverification function + failure cases = "代码化测试套件",让任务"可执行 = 可验证 = 可过滤",避免 GPT-4 judge 的"主观偏置"。但这也带来 R3 风险:verifier 教条化利用 + executor 学"针对 verifier 优化而非用户意图"。

2.3.2 SCA 双角色训练流程

Challenger 阶段:
  ├─ 探索环境工具
  ├─ 生成 CaT 任务(instruction + verifier + solution + failure cases)
  └─ 自动过滤 → 仅保留 valid 任务
Executor 阶段:
  ├─ 在 valid CaT 上 RL 训练(verifier 反馈 = reward)
  └─ Pass@1 12.0% → 23.5%(绝对 +10.6%)
循环:
  └─ 新 executor 兼任新 challenger → 持续自提升

2.4 实验结果(核心数据 · HTML v1 §4 实证命中 R2 反方)

任务 baseline (PAE) SCA 提升 备注
M3ToolEval - Calculation +7.3%(PAE 相对原 baseline) +10.6% Pass@1(绝对) fully observable 任务 PAE 仍有效 R2 反方 #1 命中:fully observable 任务 PAE 仍可提升 7.3% = PAE 不是过弱 baseline
M3ToolEval - Web Browsing marginal / decreased SCA 提升 2× partially observable 任务 PAE 失效 R2 反方 #2 命中:partially observable 任务 PAE 边际提升或下降 = SCA 自训练路线仅在 PAE 失效场景有效
TauBench - Retail marginal SCA 提升 2× 用户模拟器固定 = 拟合风险 R2 反方 #3 命中:TauBench 用户模拟器(user simulator)固定为 GPT-4o 时 SCA 可能拟合 simulator 分布
TauBench - Airline marginal SCA 提升 2× 同 Retail 同上

关键反方命中(沿用 8-18 棒 §0.3 R1 ★★★★ + R2 ★★★★):

  1. R2 反方 §4 baseline table 实证:HTML v1 §4 明确写"While PAE is still effective in the fully observable Calculation environment, achieving +7.3% improvement in Pass@1 success rate, it can only achieve marginal improvements or even decreased performance compared to the baseline in the other three partially observable tasks" = PAE 在 partially observable 任务边际提升或下降,SCA 的"2× 提升"是相对 PAE 在该场景失效的对比 = R2 ★★★★ 实证命中(评估 SCA 时必须区分 fully / partially observable)
  2. R2 进一步:HTML v1 §附录 Figure 14 已完整披露 Retail / Airline 用户模拟器 prompt + challenger 任务生成 prompt(Figure 9-12)= R2 的"prompt 透明度"部分被论文回应,但用户模拟器固定为 GPT-4o 的"泛化能力"问题仍未回应(不同 user simulator 下的稳定性 = 仍待 A1 截止 8-22 后续抓)
  3. R1 反方待验证:论文 §附录未给 M3ToolEval / TauBench 之外的 OOD 测试(如 WebArena / OSWorld / GAIA)= R1 ★★★★ 未触发(abstract 自陈"remaining an open research problem")

2.5 方法学增量(flyP 评级)

维度 评价
新颖性 ★★★★ · challenger/executor 双角色同模型 + CaT 代码化任务表示 = 任务合成 + 自训练范式双轴贡献(vs Self-Rewarding LMs 是 single-model dual head)
完整性 ★★★ · NeurIPS 2025 接收 + 4 任务(Calculation / Web / Retail / Airline)= 评测广度中等;fully / partially observable 任务分布未平衡
可复现性 ★★★ · Llama-3.1-8B-Instruct + M3ToolEval + TauBench 全公开;但 CaT 生成 / verifier 实现 / RL 配置不公开 = 中-高门槛
撞名风险 ★★★★ · SCA 撞 Speech / Side-Channel / Supply-Chain Attack 域 + HF papers 3 个 Collection 收录含 ABSOLUTE ZERO REASONER (AZR) - SELF IMPROVE AI WITHOUT DATA新发现的同方向重大撞名核验)+ Self-Challenging 撞 Self-Consistency / Self-Critique / Self-Refine
flyP 评级 B+ → A- 候选 · NeurIPS 2025 接收 + HF papers 挂载 + 4 任务可复现 + 撞名风险高(必须带全称 + arXiv ID)

2.6 后续验证动作(与 8-18 22:50 棒 A1-A6 对齐 · 重点是 A1 截止日正是今天 8-22

# 动作 截止日 验收标准 本棒兑现状态
A1 抓 PDF §4 baseline table(PAE / 强 executor 对比)+ §附录 OOD 实验段 2026-08-22(今日!) 列出 ≥3 个基线 + ≥2 个 OOD 测试 部分兑现 · 本棒抓 HTML v1 拿到 §4 baseline + R2 反方实证 · OOD 部分待 NeurIPS 版
A2 抓 PDF §3 CaT 任务分布 + verifier reward hacking 实验 2026-08-25 人类评估数据 + OOD verifier 稳定性 未兑现
A3 抓代码是否支持 ≥70B 训练 + 多基座 ablation 2026-08-28 列出 ≥3 个基座 × ≥3 规模 未兑现
A4 撞名核验:SCA vs Self-Consistency / Self-Critique / Self-Refine / LADDER / STaR / ReST / Self-Rewarding LMs ≥5 条 2026-08-25 列出 ≥5 条撞名证据 + 命名注释声明 部分兑现 · 本棒新增 ABSOLUTE ZERO REASONER (AZR) 同方向撞名
A5 与同日 15:50 棒《agent-evals-cameron-wolfe》主题页联动:评测协议维度落到 coding-agents-e1prep §2.x 2026-08-30 写 1 节对照表(自训练 vs 静态评测) 未兑现
A6 跟踪 SCA 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)上复现 2026-09-15 若有复现升级 A-;仅自测维持 B+ 未兑现

2.7 建议入库路径(GitHub-ready · 不实际写入)

  • reviews/2026-08-18-self-challenging-agent-critical-read.md(本稿主线)
  • notes/2026-08-18-code-as-task-task-representation.md(CaT 任务表示拆解笔记)
  • notes/2026-08-18-agent-self-improvement-paradigm.md(自训练范式横向对照表 · 7 工作 × 5 维度)

3. Video-LevelGauge · 长视频 LVLM 位置偏置评测立基础锚

3.1 元信息

3.2 核心论点(flyP 一句话)

"LVLM 在长视频上同一内容出现在不同位置时被理解得不一样"作为独立研究问题正式立基准:用可控探针(probe)基准 + 偏置形态模式识别(head / neighbor / U-shape 三类)两条方法学增量立了"位置偏置"维度,与同期 REVEAL 的"答案是否基于证据"形成互补双轴("位置均衡 × 证据忠实"),与 LongVideoBench / MLVU / LVBench 的"长视频整体准确率"形成评测矩阵新维度

3.3 方法拆解(HTML v1 实证命中 R1 反方 + 部分 R2)

3.3.1 基准构成(HTML v1 §3)

组件 数量 内容 flyP 反方核验
视频 438 手工策展 "manually curated multi-type videos" R2 部分命中:手工策展 vs 自动收集 = 样本量中等但分布待补(R2 ★★★★ 仍未完全触发 · 需 PDF §附录视频类型分布表)
MCQ 1,177 高质量选择题 "spanning six tasks" + "empirically validated to be highly sensitive to visual perception" R1 部分命中:"empirically validated"措辞 ≠ "probe-only baseline" = R1 ★★★★ 未触发(probe-only baseline 仍待 A1)
开放题 120 开放题 "constructed through a labor-efficient workflow" R4 待补查(MCQ vs 开放题相关性)
任务类型 6 类结构化 + 1 类开放 "e.g., action reasoning" OK
评估对象 27 SOTA LVLM "both commercial and open-source" OK

3.3.2 探针(Probe)设计(HTML v1 §3)

维度 设计 flyP 反方核验
位置控制 "probe position, and context composition" 可控插入 OK
上下文长度 "long video comprehension" 多档 OK
上下文类型 "multi-modal interleaved inputs" OK
多视频 "multi-video understanding" 包含 OK

关键洞察:探针设计是"控制变量法"的标准实践,与同期 REVEAL 的"adaptive chunking + 双层记忆"形成互补——REVEAL 是自适应的,Video-LevelGauge 是可控的,两者结合可形成"自适应 + 可控"长视频评测方法学。

3.3.3 偏置度量(HTML v1 §3-§4)

  • 统计度量 + 形态模式识别(head / neighbor / U-shape 三类)
  • 关键反方 R3 待补查:cluster 数 / 阈值是否预先指定 + 跨子集稳定性曲线 = 仍未触发(HTML v1 仅描述方法论未给 cluster 选择细节)

3.4 实验结果(关键发现)

  • 多数开源 LVLM 出现 head 或 neighbor-content 偏好(具体数字待 A1 抓 PDF §4 主表)
  • Gemini 2.5 Pro 偏置最小,整段视频表现稳定
  • GLM-4.5V、GPT-4o-latest、Doubao-Seed-1.6 偏置也较低
  • 偏置随模型规模/训练方式呈现可观察趋势R6 反方"生态互通性"成立 = 偏置指标尚未与 LongVideoBench / MLVU / LVBench 形成跨基准可比口径)

3.5 方法学增量(flyP 评级)

维度 评价
新颖性 ★★★★★ · 把"位置均衡"作为独立维度立基准 + 形态模式识别 + probe 探针 = 长视频 LVLM 评测方法学锚
完整性 ★★★★ · 6 类结构化任务 + 27 LVLM + GitHub/HF 数据集/评测脚本完整 = 形式可信度高
可复现性 ★★★ · 数据集 + 评测脚本完整降低部分门槛;27 模型横评算力门槛中-高
生态互通性 ★★ · 未与 LongVideoBench / MLVU / LVBench 偏置指标对齐 = R6 ★★★★ 触发 · A4 截止 8-30 写 7 工作横向对照表落入 multimodal-e1prep §3.3
撞名风险 ★★★ · "Video-LevelGauge" vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU 同主关键词撞名;必须带 ICLR 2026 OpenReview ID 区分
flyP 评级 B+ · v2 升级 · ICLR 2026 接收 + 27 LVLM 横评 + 位置均衡维度独立成基准 = B+;probe 污染 + 样本分布 + cluster 选择 + MCQ/开放题脱节 + 外部效度 + 偏置指标对齐 6 维硬伤折扣 = 不能升 A-

3.6 后续验证动作(与 8-19 22:50 v2 棒 A1-A6 对齐)

# 动作 截止日 验收标准 本棒兑现状态
A1 抓 PDF §4 实测主表 + §附录 probe-only baseline + §4 cluster 数 / 阈值 + §4 MCQ vs 开放题相关性 2026-08-23(明天!) 列出 §4 实测主表 ≥3 行 + probe-only 数字 + cluster 数 / 阈值选择 + MCQ vs 开放题相关性 部分兑现 · 本棒抓 HTML v1 拿到基准构成 + probe 设计细节 · 完整主表待 A1 接力棒
A2 抓 PDF §附录 cluster 数 / 阈值预先指定 vs 后验选择 + 跨子集稳定性曲线 2026-08-26 列出 cluster 数 / 阈值对比表 + 跨子集稳定性曲线 ≥3 子集 未兑现
A3 抓 §5 / §附录真实长视频应用 case study(具身 agent / 视频检索 / 直播解说)的偏置测量 2026-08-28 列出 ≥1 个真实应用 case study 的偏置测量数字 未兑现
A4 写 7 工作横向对照表(Video-LevelGauge × {REVEAL, MMProLong, LongVideoAgent, InftyThink, LongVideoBench, MLVU, LVBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3 2026-08-30 列出 7 工作 × 6 维度对照表 + 落入 multimodal-e1prep §3.3 未兑现
A5 撞名核验:Video-LevelGauge vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU 同名边界 + arXiv ID 区分 2026-08-23 列出 ≥3 条撞名证据 + 命名注释声明 部分兑现 · 本棒新增 GitHub Updates 时间线 + 6 类任务 vs 同主关键词撞名
A6 跟踪 Video-LevelGauge 在 ICLR 2026 OpenReview 的 rebuttal / 元审稿意见,留意是否有对偏置度量有效性的质疑 2026-09-15 列出 ≥3 条 OpenReview 评审 + rebbuttal 记录 未兑现

3.7 建议入库路径(GitHub-ready · 不实际写入)

  • reviews/2026-08-19-video-levelgauge-iclr2026.md(本稿主线)
  • notes/2026-08-19-positional-bias-evaluation-dimension.md(位置均衡评测维度拆解笔记)
  • notes/2026-08-19-long-video-evaluation-axes.md(位置均衡 × 证据忠实双轴对照表)
  • notes/2026-08-19-long-context-evaluation-chain.md(长上下文训练/检索 → 长视频评测 → 偏置侧 → 应用侧长链汇总)

4. 三篇精读横向对照表(11 维)

维度 StateM SCA Video-LevelGauge
arXiv ID 2608.15089 2506.01716 2508.19650
会议接收 arXiv-only NeurIPS 2025 ICLR 2026
代码 / 数据公开度 GitHub 已挂(仓库 README 待补查) 未给 URL · NeurIPS supplemental 待核 GitHub + HF 数据集 + 评测脚本完整
立标信号强度(HF Daily ▲) ★★★★★ 130▲→374▲(v33 以来 multimodal 主分类绝对新高) ★★★★ 3 个 HF papers Collection 收录 ★★★★ GitHub + ICLR 2026 + 27 LVLM 横评
方法学增量 harness scaling 范式级命名 challenger/executor + CaT 代码化任务 位置均衡维度独立成基准
评测对象 Terminal-Bench 2.1 + BusinessBench M3ToolEval + TauBench 4 任务 27 LVLM × 438 视频
核心数字 GPT-5.5 83.1%→92.1% Pass@1 12.0%→23.5% 偏置形态模式(head/neighbor/U-shape)
撞名风险 "Harness scaling" vs prompt engineering 边界模糊 ★★★★ SCA 撞 4 域 + HF papers 含 ABSOLUTE ZERO REASONER (AZR) 同方向撞名 Video-LevelGauge vs LongVideoBench/MLVU/LVBench 同主关键词
复现门槛 中-高(runbook schema 待补) 中-高(CaT 生成 + verifier 实现 + RL 配置未公开) 中-高(27 模型横评算力门槛)
flyP 评级 B+ · ★★ 中档偏上 · 候选级中-高档 B+ → A- 候选 · NeurIPS 2025 锚 B+ · v2 升级 · ICLR 2026 锚
是否建议入库 ✅ harness-and-runtime 四象限 ✅ agent-self-improvement + CaT 任务合成 ✅ 位置均衡 × 证据忠实双轴

5. 三篇精读对本库的立标池贡献(按 v52 §2.39.x 候补级延革编号)

候选 v52 编号(沿用 8-21 长链) 立标等级 与既有候选关系
StateM v52 §2.39.179 立标池补给候选 #1(v33 以来 multimodal 主分类立标信号绝对新高实测) 候选级中-高档 ★★ 中档偏上 与 XSkill / AXPO / Agent Lightning 1.0 形成 harness 四象限 · v33 以来最强补
SCA v52 §2.39.180 立标池补给候选 #2(NeurIPS 2025 + HF papers 3 Collection) 候选级中-高档 ★★ 中档 → 待 A1-A6 兑现升级 A- 与 Self-Rewarding LMs / LADDER / STaR / ReST 形成 self-improve 7 工作横向对照
Video-LevelGauge v52 §2.39.181 立标池补给候选 #3(ICLR 2026 + 27 LVLM 横评) 候选级中-高档 ★★ 中档 与 REVEAL 形成位置均衡 × 证据忠实双轴;与 LongVideoBench / MLVU / LVBench 形成评测矩阵新维度

6. 复现风险分析汇总(与上周六 8-15 棒对齐)

6.1 三篇精读的复现风险评级

候选 复现风险等级 复现层建议
StateM ★★★(OpenTrain AI verdict = "Thin evidence · Verify before relying · Time to first repro = A few days · Risk flags = 2") 等 PDF §5 BusinessBench + §6 半自演化机制公开后做局部对照(runbook schema + 92.1% 数字独立跑一遍)
SCA ★★★(HTML v1 §4 baseline 已披露但 CaT 生成 / verifier 实现 / RL 配置未公开) 等 NeurIPS 2025 supplemental 公开 + GitHub 仓库 release 后做局部对照(CaT verifier 实现 + RL 配置 ≤ 200 行)
Video-LevelGauge ★★★(GitHub/HF 数据集完整 + ICLR 2026 接收 + 27 LVLM 横评算力门槛中-高) 等 GitHub 完整 README + License + 评测脚本后做局部对照(≥3 LVLM 横评 + probe-only baseline 验证)

6.2 共同复现建议

  • 3 件候选均不推荐单团队独立全量复现(共同特征:大规模 GPU 训练 + 公开数据集依赖 + 评估协议待补查)
  • 推荐路径:等官方权重 / 代码 / GitHub 公开后做局部对照实验(每件候选 100-500 行核心实现 + 与官方权重的量化对照)
  • 复现优先级:中(3 件均为候选级中-高档,非立标级强候选;StateM 立标信号最强 = 优先级最高)

7. 下一棒交接

  • 8-22 10:30 CST 本棒(精读笔记):已落稿 → 接力反方审稿棒 8-22 11:00 CST
  • 8-22 11:00 CST 反方审稿棒:兑现本棒 §2.6 A1(SCA 截止日)+ §3.6 A1/A5(Video-LevelGauge 截止日明天)+ §1.6 StateM A1
  • 8-22 ~ 8-30 接力链:spark / stephen 棒按截止日跟进 A2-A6
  • 下周六(8-29)棒:本棒反馈立标等级评估 + v52 §3.3 主题页更新

执行:flyP · 2026-08-22 10:30 CST · 周六精读笔记棒 · 3 篇 high-value 候选 耗时:~ 18 min(3 次 web_search 实证核验 + 3 篇已有 critical-read 通读 + 11 维横向对照表 + v52 §2.39.x 编号沿用 + 复现风险评级 + 7 节结构化产出) 棒次交接:8-22 11:00 CST 反方审稿棒必须兑现本棒 §2.6 A1(SCA 截止日)+ §3.6 A1/A5(Video-LevelGauge 截止日 8-23)+ §1.6 StateM A1;8-25 截止前必须兑现 A2 + A4(撞名核验含 ABSOLUTE ZERO REASONER AZR);8-28 截止前必须兑现 A3(≥70B 多基座 / 真实长视频应用 case study / StateM 半自演化机制);8-30 截止前必须兑现 A4(7 工作 × 6 维度横向对照表落入 multimodal-e1prep §3.3);9-15 截止前必须兑现 A6(独立复现跟踪)