flyP 周六精读笔记 · 2026-08-22 · 本周 3 篇高价值论文结构化阅读笔记
棒次定位:cron 034af2f3-c583-4a62-b01e-1ae28114fb89 · 研究知识库 · 周六精读与反方审稿棒 · 2026-08-22 10:30 CST
本棒目标:从本周(08-15 ~ 08-21)候选中选出最值得精读的 3 篇,输出结构化阅读笔记(核心论点 / 方法拆解 / 实验对照 / 可信度 / 是否建议入库)
不写 GitHub:不写入 research-kb/notes/ research-kb/reviews/ research-kb/published/;只产 inbox 草稿,由同步任务串行合并
承接上周六:8-15 sat 反方审稿专题聚焦 Mechanist + Beyond Memory + v48 §2.39.x 候补级 3 件;本棒聚焦本周 3 件立标信号更强 / 反方触发更急的候选
0. 本周候选筛选逻辑
本周(2026-08-15 ~ 2026-08-21)flyp 棒累计产出 14 件 critical-read + 2 件 light-read + 3 件周报 + 4 件 e1prep,饱和度极高。本棒筛选标准:
- 立标信号绝对强度(HF Daily ▲ + 顶会接收 + 代码/数据/权重齐备)
- 反方触发紧迫性(A1/A2/A4 截止日是否落在本棒窗口 8-22 ~ 8-30)
- 方法学增量独立度(是否可作为"维度级"基础锚被其它候选引用)
- 跨棒耦合度(是否被同日或同窗棒引用 / 是否串联其它 critical-read)
按上述 4 维,本棒选定 3 篇:
| 序号 |
候选 |
时间 |
立标信号 |
反方紧迫性 |
方法学增量 |
跨棒耦合 |
| 1 |
StateM(arXiv:2608.15089) |
8-20 15:50 |
★★★★★(HF Daily 130▲→374▲ · v33 以来 multimodal 主分类绝对新高) |
★★★(PDF §5 BusinessBench + §6 半自演化机制 = 反方关键段待 8-25 ~ 8-30) |
★★★★★(harness scaling 范式级命名 · 与 model scaling 并列) |
★★★★(与 XSkill / AXPO / Agent Lightning 1.0 形成 harness 四象限) |
| 2 |
Self-Challenging Agent (SCA) (arXiv:2506.01716 · NeurIPS 2025) |
8-18 22:50 |
★★★★(NeurIPS 2025 + HF papers 已挂 + Meta FAIR 一作 + 5 源可核验) |
★★★★★(A1 截止日正是今天 8-22 · R1/R2 ★★★★ 高严重度) |
★★★★(challenger/executor 同模型 + CaT 代码化任务表示) |
★★★★(与同日 15:50 agent-evals + 09:50 MMLongBench/Embed 形成评测锚三件簇) |
| 3 |
Video-LevelGauge (arXiv:2508.19650 · ICLR 2026) |
8-19 22:50 v2 覆盖 |
★★★★(ICLR 2026 接收 + OpenReview 已挂 + GitHub/HF 数据集全公开 + 27 LVLM 横评) |
★★★★★(A1+A5 截止日 8-23 · R1/R2/R6 ★★★★) |
★★★★★(位置均衡维度独立成基准 + 形态模式识别 + 与 REVEAL 形成位置均衡 × 证据忠实双轴) |
★★★★★(与 REVEAL / LongVideoBench / MLVU / LVBench 形成长视频评测矩阵) |
1. StateM · Harness Scaling · 范式级贡献候选立基础锚
1.1 元信息
1.2 核心论点(flyP 一句话)
"Harness scaling 取代"model scaling"作为长程 agent 的瓶颈转移路径:通过 stateful runtime + 持久化 runbook + checked transitions,把"死掉的 postmortem 经验"转成"可执行的 stateful preconditions",在不动模型权重的前提下把 GPT-5.5 xhigh 在 Terminal-Bench 2.1 从 83.1% 拉到 92.1%,并通过 runbook 冻结迁移到 GPT-5.6 Luna 让低成本模型(76.7% → 85.4%)追平 GPT-5.6 Sol xhigh 84.9% 参考。
1.3 方法拆解(StateM 运行时五件套)
| # |
组件 |
功能 |
与既有 harness 工作对照 |
| 1 |
Durable states |
跨 step 持久化 agent 状态(执行历史、checkpoint、retry state) |
与 LangGraph checkpointing / Temporal IO 同方向,但强调"版本化 + 持久化" |
| 2 |
Phase-local context |
每个阶段独立的局部上下文(避免长程上下文稀释) |
与 XSkill in-context 双流经验池同方向,但"阶段"边界是显式 schema 而非自然累积 |
| 3 |
Checked transitions |
进入下一阶段的检查式转移(前置条件 + 失败回滚) |
与 FSM-style agent loop 同方向,但引入"precondition as code" |
| 4 |
Recoverable runbooks |
可恢复的执行剧本(含 fallback 路径) |
与早期 AutoGPT / BabyAGI 同方向,但 runbook 是"模板 + 可执行脚本"而非纯 prompt |
| 5 |
Versioned procedural practices |
可与人类共同检视的版本化流程(git-style 版本管理) |
新引入 = 与"harness as code"范式对齐(类似 Terraform / Ansible) |
1.4 实验结果(核心数据)
| 场景 |
模型 |
baseline |
StateM |
提升 |
备注 |
| Terminal-Bench 2.1 |
GPT-5.5 xhigh |
83.1% |
92.1% |
+9.0 |
超过 GPT-5.6 Sol Ultra 91.9% |
| Terminal-Bench 2.1 |
GPT-5.6 Sol xhigh |
89 任务 100% 至少 1 次 |
95.3% raw |
89/89 至少一次 |
445 trials 总体 |
| Terminal-Bench 2.1(frozen profile) |
GPT-5.6 Luna(低成本) |
76.7% |
85.4% |
+8.7 |
超过 Sol xhigh 参考 84.9% |
| Terminal-Bench 2.1(成本最低) |
DeepSeek-V4 Flash |
82.7% |
88.1% / 89.1% (88-task) |
+5.4 / +6.4 |
单次 API 成本约 \$15 vs GPT 参考 \$574.68 · 总 DeepSeek 支出 \$52.22 |
| BusinessBench(域泛化) |
family-specific runbooks |
holdout |
macro +0.55 / micro +1.34 |
两族机制匹配 +10.04 |
域泛化能力 |
反向核验:Terminal-Bench 2.1 官方榜单(tbench.ai · artificialanalysis.ai · snorkel.ai)目前 Codex CLI GPT-5.5 = 83.1% ± 1.1%(与 StateM 引用的 baseline 数字一致)= StateM 在 Terminal-Bench 2.1 上的 baseline 数字确实可外部核验,但 92.1% 数字只在 StateM 论文内自报,未在官方榜单挂出 = 关键数字需独立跑一遍。
1.5 方法学增量(flyP 评级)
| 维度 |
评价 |
| 新颖性 |
★★★★★ · 把"harness scaling"显式立为与"model scaling"并列的 scaling 轴 = 清晰的概念级贡献(vs XSkill 是工程式演进) |
| 完整性 |
★★★★ · 5 维运行时设计 + Terminal-Bench 2.1 多模型迁移 + BusinessBench 域泛化 + 成本数据 = 论据维度覆盖性能 / 通用性 / 经济性 |
| 可复现性 |
★★★ · 代码已挂 GitHub · runbook 是否随代码完全 release 待验 · Terminal-Bench 是公开基准但 OpenTrain AI 标记 "Thin evidence · Verify before relying" = 关键数字独立复现门槛未过 |
| 立标信号 |
★★★★★ · 130▲→374▲ v33 以来 multimodal 主分类绝对新高 · flyp multimodal-e1prep v53 §3.2 标记为"评测方法学延革第 10 例反方立基础候选" |
| 撞名风险 |
★★★ · "Harness scaling" vs "Model scaling"边界模糊;"Semi-Self-Evolving"撞 "self-evolving"系列 |
| flyP 评级 |
B+ · 候选级中-高档 ★★ 中档偏上 · 待 A1-A3 兑现后升级 A- |
1.6 后续验证动作(与 8-20 15:50 棒 A1-A3 对齐)
| # |
动作 |
截止日 |
验收标准 |
| A1 |
抓 PDF §5 BusinessBench 域泛化实验细节 + 6 模型迁移(GPT-5.5/5.6/DeepSeek-V4 Flash)数据一致性 |
2026-08-25 |
列出 ≥3 模型迁移完整表 + BusinessBench 跨域对照 |
| A2 |
抓 PDF §6 "Semi-Self-Evolving" 自动演化机制 + 人在环程度 + 版本化如何避免漂移 |
2026-08-28 |
列出 runbook 自演化具体步骤 + 漂移检测机制 |
| A3 |
抓 §4 Terminal-Bench 2.1 主表 vs 官方榜单交叉验证(92.1% 是否在独立跑也可复现) |
2026-08-30 |
列出官方榜单数字 vs StateM 自报对照表 + 独立跑 ≥1 次 |
1.7 建议入库路径(GitHub-ready · 不实际写入)
notes/agents/harness-and-runtime/statem-harness-scaling.md
notes/agents/harness-and-runtime/index.md(新建 index · 收纳 harness 四象限:XSkill / StateM / AXPO / Agent Lightning 1.0)
- 与 GLM-5.3(Substack 线索)形成"harness 侧提性能 + post-training 侧提性能"对照笔记
2. Self-Challenging Language Model Agents (SCA) · agent 自训练范式 + Code-as-Task 任务合成立基础锚
2.1 元信息
2.2 核心论点(flyP 一句话)
"Challenger/Executor 同模型 + Code-as-Task (CaT) 任务表示 + self-generated training data = agent 自训练范式":让同一模型先以 challenger 角色交互工具生成任务(instruction + verifier + example solution + failure cases 四元组),再以 executor 角色 RL 训练自己执行,Llama-3.1-8B-Instruct 在 M3ToolEval + TauBench 4 任务上仅用 self-generated 训练数据达成 >2× 改进(Pass@1 12.0% → 23.5%,绝对 +10.6%,相对 PAE baseline)。
2.3 方法拆解
2.3.1 Code-as-Task (CaT) 四元组
| 组件 |
描述 |
工程作用 |
与同期工作对照 |
| instruction |
自然语言任务描述 |
用户侧输入 |
与所有 agent benchmark 一致 |
| verification function |
可执行代码:判断 agent 输出是否完成 |
verifier 锚 · RL 奖励信号 |
区别于"GPT-4 judge"路线(关键差异) |
| example solution |
标准执行轨迹 |
executor 训练数据 |
区别于"纯 prompting" |
| failure cases |
显式枚举的反例 |
单元测试 · 任务质量过滤 |
工程化锚 = 可跑通的测试集 |
CaT 核心 trick:verification function + failure cases = "代码化测试套件",让任务"可执行 = 可验证 = 可过滤",避免 GPT-4 judge 的"主观偏置"。但这也带来 R3 风险:verifier 教条化利用 + executor 学"针对 verifier 优化而非用户意图"。
2.3.2 SCA 双角色训练流程
Challenger 阶段:
├─ 探索环境工具
├─ 生成 CaT 任务(instruction + verifier + solution + failure cases)
└─ 自动过滤 → 仅保留 valid 任务
Executor 阶段:
├─ 在 valid CaT 上 RL 训练(verifier 反馈 = reward)
└─ Pass@1 12.0% → 23.5%(绝对 +10.6%)
循环:
└─ 新 executor 兼任新 challenger → 持续自提升
2.4 实验结果(核心数据 · HTML v1 §4 实证命中 R2 反方)
| 任务 |
baseline (PAE) |
SCA |
提升 |
备注 |
| M3ToolEval - Calculation |
+7.3%(PAE 相对原 baseline) |
+10.6% Pass@1(绝对) |
fully observable 任务 PAE 仍有效 |
R2 反方 #1 命中:fully observable 任务 PAE 仍可提升 7.3% = PAE 不是过弱 baseline |
| M3ToolEval - Web Browsing |
marginal / decreased |
SCA 提升 2× |
partially observable 任务 PAE 失效 |
R2 反方 #2 命中:partially observable 任务 PAE 边际提升或下降 = SCA 自训练路线仅在 PAE 失效场景有效 |
| TauBench - Retail |
marginal |
SCA 提升 2× |
用户模拟器固定 = 拟合风险 |
R2 反方 #3 命中:TauBench 用户模拟器(user simulator)固定为 GPT-4o 时 SCA 可能拟合 simulator 分布 |
| TauBench - Airline |
marginal |
SCA 提升 2× |
同 Retail |
同上 |
关键反方命中(沿用 8-18 棒 §0.3 R1 ★★★★ + R2 ★★★★):
- R2 反方 §4 baseline table 实证:HTML v1 §4 明确写"While PAE is still effective in the fully observable Calculation environment, achieving +7.3% improvement in Pass@1 success rate, it can only achieve marginal improvements or even decreased performance compared to the baseline in the other three partially observable tasks" = PAE 在 partially observable 任务边际提升或下降,SCA 的"2× 提升"是相对 PAE 在该场景失效的对比 = R2 ★★★★ 实证命中(评估 SCA 时必须区分 fully / partially observable)
- R2 进一步:HTML v1 §附录 Figure 14 已完整披露 Retail / Airline 用户模拟器 prompt + challenger 任务生成 prompt(Figure 9-12)= R2 的"prompt 透明度"部分被论文回应,但用户模拟器固定为 GPT-4o 的"泛化能力"问题仍未回应(不同 user simulator 下的稳定性 = 仍待 A1 截止 8-22 后续抓)
- R1 反方待验证:论文 §附录未给 M3ToolEval / TauBench 之外的 OOD 测试(如 WebArena / OSWorld / GAIA)= R1 ★★★★ 未触发(abstract 自陈"remaining an open research problem")
2.5 方法学增量(flyP 评级)
| 维度 |
评价 |
| 新颖性 |
★★★★ · challenger/executor 双角色同模型 + CaT 代码化任务表示 = 任务合成 + 自训练范式双轴贡献(vs Self-Rewarding LMs 是 single-model dual head) |
| 完整性 |
★★★ · NeurIPS 2025 接收 + 4 任务(Calculation / Web / Retail / Airline)= 评测广度中等;fully / partially observable 任务分布未平衡 |
| 可复现性 |
★★★ · Llama-3.1-8B-Instruct + M3ToolEval + TauBench 全公开;但 CaT 生成 / verifier 实现 / RL 配置不公开 = 中-高门槛 |
| 撞名风险 |
★★★★ · SCA 撞 Speech / Side-Channel / Supply-Chain Attack 域 + HF papers 3 个 Collection 收录含 ABSOLUTE ZERO REASONER (AZR) - SELF IMPROVE AI WITHOUT DATA(新发现的同方向重大撞名核验)+ Self-Challenging 撞 Self-Consistency / Self-Critique / Self-Refine |
| flyP 评级 |
B+ → A- 候选 · NeurIPS 2025 接收 + HF papers 挂载 + 4 任务可复现 + 撞名风险高(必须带全称 + arXiv ID) |
2.6 后续验证动作(与 8-18 22:50 棒 A1-A6 对齐 · 重点是 A1 截止日正是今天 8-22)
| # |
动作 |
截止日 |
验收标准 |
本棒兑现状态 |
| A1 |
抓 PDF §4 baseline table(PAE / 强 executor 对比)+ §附录 OOD 实验段 |
2026-08-22(今日!) |
列出 ≥3 个基线 + ≥2 个 OOD 测试 |
部分兑现 · 本棒抓 HTML v1 拿到 §4 baseline + R2 反方实证 · OOD 部分待 NeurIPS 版 |
| A2 |
抓 PDF §3 CaT 任务分布 + verifier reward hacking 实验 |
2026-08-25 |
人类评估数据 + OOD verifier 稳定性 |
未兑现 |
| A3 |
抓代码是否支持 ≥70B 训练 + 多基座 ablation |
2026-08-28 |
列出 ≥3 个基座 × ≥3 规模 |
未兑现 |
| A4 |
撞名核验:SCA vs Self-Consistency / Self-Critique / Self-Refine / LADDER / STaR / ReST / Self-Rewarding LMs ≥5 条 |
2026-08-25 |
列出 ≥5 条撞名证据 + 命名注释声明 |
部分兑现 · 本棒新增 ABSOLUTE ZERO REASONER (AZR) 同方向撞名 |
| A5 |
与同日 15:50 棒《agent-evals-cameron-wolfe》主题页联动:评测协议维度落到 coding-agents-e1prep §2.x |
2026-08-30 |
写 1 节对照表(自训练 vs 静态评测) |
未兑现 |
| A6 |
跟踪 SCA 是否被独立第三方在 2026 H1 新一代模型(Gemini 3.1 / GPT-5.5 / Claude Opus 4.7)上复现 |
2026-09-15 |
若有复现升级 A-;仅自测维持 B+ |
未兑现 |
2.7 建议入库路径(GitHub-ready · 不实际写入)
reviews/2026-08-18-self-challenging-agent-critical-read.md(本稿主线)
notes/2026-08-18-code-as-task-task-representation.md(CaT 任务表示拆解笔记)
notes/2026-08-18-agent-self-improvement-paradigm.md(自训练范式横向对照表 · 7 工作 × 5 维度)
3. Video-LevelGauge · 长视频 LVLM 位置偏置评测立基础锚
3.1 元信息
3.2 核心论点(flyP 一句话)
"LVLM 在长视频上同一内容出现在不同位置时被理解得不一样"作为独立研究问题正式立基准:用可控探针(probe)基准 + 偏置形态模式识别(head / neighbor / U-shape 三类)两条方法学增量立了"位置偏置"维度,与同期 REVEAL 的"答案是否基于证据"形成互补双轴("位置均衡 × 证据忠实"),与 LongVideoBench / MLVU / LVBench 的"长视频整体准确率"形成评测矩阵新维度。
3.3 方法拆解(HTML v1 实证命中 R1 反方 + 部分 R2)
3.3.1 基准构成(HTML v1 §3)
| 组件 |
数量 |
内容 |
flyP 反方核验 |
| 视频 |
438 手工策展 |
"manually curated multi-type videos" |
R2 部分命中:手工策展 vs 自动收集 = 样本量中等但分布待补(R2 ★★★★ 仍未完全触发 · 需 PDF §附录视频类型分布表) |
| MCQ |
1,177 高质量选择题 |
"spanning six tasks" + "empirically validated to be highly sensitive to visual perception" |
R1 部分命中:"empirically validated"措辞 ≠ "probe-only baseline" = R1 ★★★★ 未触发(probe-only baseline 仍待 A1) |
| 开放题 |
120 开放题 |
"constructed through a labor-efficient workflow" |
R4 待补查(MCQ vs 开放题相关性) |
| 任务类型 |
6 类结构化 + 1 类开放 |
"e.g., action reasoning" |
OK |
| 评估对象 |
27 SOTA LVLM |
"both commercial and open-source" |
OK |
3.3.2 探针(Probe)设计(HTML v1 §3)
| 维度 |
设计 |
flyP 反方核验 |
| 位置控制 |
"probe position, and context composition" 可控插入 |
OK |
| 上下文长度 |
"long video comprehension" 多档 |
OK |
| 上下文类型 |
"multi-modal interleaved inputs" |
OK |
| 多视频 |
"multi-video understanding" 包含 |
OK |
关键洞察:探针设计是"控制变量法"的标准实践,与同期 REVEAL 的"adaptive chunking + 双层记忆"形成互补——REVEAL 是自适应的,Video-LevelGauge 是可控的,两者结合可形成"自适应 + 可控"长视频评测方法学。
3.3.3 偏置度量(HTML v1 §3-§4)
- 统计度量 + 形态模式识别(head / neighbor / U-shape 三类)
- 关键反方 R3 待补查:cluster 数 / 阈值是否预先指定 + 跨子集稳定性曲线 = 仍未触发(HTML v1 仅描述方法论未给 cluster 选择细节)
3.4 实验结果(关键发现)
- 多数开源 LVLM 出现 head 或 neighbor-content 偏好(具体数字待 A1 抓 PDF §4 主表)
- Gemini 2.5 Pro 偏置最小,整段视频表现稳定
- GLM-4.5V、GPT-4o-latest、Doubao-Seed-1.6 偏置也较低
- 偏置随模型规模/训练方式呈现可观察趋势(R6 反方"生态互通性"成立 = 偏置指标尚未与 LongVideoBench / MLVU / LVBench 形成跨基准可比口径)
3.5 方法学增量(flyP 评级)
| 维度 |
评价 |
| 新颖性 |
★★★★★ · 把"位置均衡"作为独立维度立基准 + 形态模式识别 + probe 探针 = 长视频 LVLM 评测方法学锚 |
| 完整性 |
★★★★ · 6 类结构化任务 + 27 LVLM + GitHub/HF 数据集/评测脚本完整 = 形式可信度高 |
| 可复现性 |
★★★ · 数据集 + 评测脚本完整降低部分门槛;27 模型横评算力门槛中-高 |
| 生态互通性 |
★★ · 未与 LongVideoBench / MLVU / LVBench 偏置指标对齐 = R6 ★★★★ 触发 · A4 截止 8-30 写 7 工作横向对照表落入 multimodal-e1prep §3.3 |
| 撞名风险 |
★★★ · "Video-LevelGauge" vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU 同主关键词撞名;必须带 ICLR 2026 OpenReview ID 区分 |
| flyP 评级 |
B+ · v2 升级 · ICLR 2026 接收 + 27 LVLM 横评 + 位置均衡维度独立成基准 = B+;probe 污染 + 样本分布 + cluster 选择 + MCQ/开放题脱节 + 外部效度 + 偏置指标对齐 6 维硬伤折扣 = 不能升 A- |
3.6 后续验证动作(与 8-19 22:50 v2 棒 A1-A6 对齐)
| # |
动作 |
截止日 |
验收标准 |
本棒兑现状态 |
| A1 |
抓 PDF §4 实测主表 + §附录 probe-only baseline + §4 cluster 数 / 阈值 + §4 MCQ vs 开放题相关性 |
2026-08-23(明天!) |
列出 §4 实测主表 ≥3 行 + probe-only 数字 + cluster 数 / 阈值选择 + MCQ vs 开放题相关性 |
部分兑现 · 本棒抓 HTML v1 拿到基准构成 + probe 设计细节 · 完整主表待 A1 接力棒 |
| A2 |
抓 PDF §附录 cluster 数 / 阈值预先指定 vs 后验选择 + 跨子集稳定性曲线 |
2026-08-26 |
列出 cluster 数 / 阈值对比表 + 跨子集稳定性曲线 ≥3 子集 |
未兑现 |
| A3 |
抓 §5 / §附录真实长视频应用 case study(具身 agent / 视频检索 / 直播解说)的偏置测量 |
2026-08-28 |
列出 ≥1 个真实应用 case study 的偏置测量数字 |
未兑现 |
| A4 |
写 7 工作横向对照表(Video-LevelGauge × {REVEAL, MMProLong, LongVideoAgent, InftyThink, LongVideoBench, MLVU, LVBench} × 6 维度 = 42 单元)落入 multimodal-e1prep §3.3 |
2026-08-30 |
列出 7 工作 × 6 维度对照表 + 落入 multimodal-e1prep §3.3 |
未兑现 |
| A5 |
撞名核验:Video-LevelGauge vs LongVideoBench / Video-MME / MLVU / LVBench / Video-MMLU 同名边界 + arXiv ID 区分 |
2026-08-23 |
列出 ≥3 条撞名证据 + 命名注释声明 |
部分兑现 · 本棒新增 GitHub Updates 时间线 + 6 类任务 vs 同主关键词撞名 |
| A6 |
跟踪 Video-LevelGauge 在 ICLR 2026 OpenReview 的 rebuttal / 元审稿意见,留意是否有对偏置度量有效性的质疑 |
2026-09-15 |
列出 ≥3 条 OpenReview 评审 + rebbuttal 记录 |
未兑现 |
3.7 建议入库路径(GitHub-ready · 不实际写入)
reviews/2026-08-19-video-levelgauge-iclr2026.md(本稿主线)
notes/2026-08-19-positional-bias-evaluation-dimension.md(位置均衡评测维度拆解笔记)
notes/2026-08-19-long-video-evaluation-axes.md(位置均衡 × 证据忠实双轴对照表)
notes/2026-08-19-long-context-evaluation-chain.md(长上下文训练/检索 → 长视频评测 → 偏置侧 → 应用侧长链汇总)
4. 三篇精读横向对照表(11 维)
| 维度 |
StateM |
SCA |
Video-LevelGauge |
| arXiv ID |
2608.15089 |
2506.01716 |
2508.19650 |
| 会议接收 |
arXiv-only |
NeurIPS 2025 |
ICLR 2026 |
| 代码 / 数据公开度 |
GitHub 已挂(仓库 README 待补查) |
未给 URL · NeurIPS supplemental 待核 |
GitHub + HF 数据集 + 评测脚本完整 |
| 立标信号强度(HF Daily ▲) |
★★★★★ 130▲→374▲(v33 以来 multimodal 主分类绝对新高) |
★★★★ 3 个 HF papers Collection 收录 |
★★★★ GitHub + ICLR 2026 + 27 LVLM 横评 |
| 方法学增量 |
harness scaling 范式级命名 |
challenger/executor + CaT 代码化任务 |
位置均衡维度独立成基准 |
| 评测对象 |
Terminal-Bench 2.1 + BusinessBench |
M3ToolEval + TauBench 4 任务 |
27 LVLM × 438 视频 |
| 核心数字 |
GPT-5.5 83.1%→92.1% |
Pass@1 12.0%→23.5% |
偏置形态模式(head/neighbor/U-shape) |
| 撞名风险 |
"Harness scaling" vs prompt engineering 边界模糊 |
★★★★ SCA 撞 4 域 + HF papers 含 ABSOLUTE ZERO REASONER (AZR) 同方向撞名 |
Video-LevelGauge vs LongVideoBench/MLVU/LVBench 同主关键词 |
| 复现门槛 |
中-高(runbook schema 待补) |
中-高(CaT 生成 + verifier 实现 + RL 配置未公开) |
中-高(27 模型横评算力门槛) |
| flyP 评级 |
B+ · ★★ 中档偏上 · 候选级中-高档 |
B+ → A- 候选 · NeurIPS 2025 锚 |
B+ · v2 升级 · ICLR 2026 锚 |
| 是否建议入库 |
✅ harness-and-runtime 四象限 |
✅ agent-self-improvement + CaT 任务合成 |
✅ 位置均衡 × 证据忠实双轴 |
5. 三篇精读对本库的立标池贡献(按 v52 §2.39.x 候补级延革编号)
| 候选 |
v52 编号(沿用 8-21 长链) |
立标等级 |
与既有候选关系 |
| StateM |
v52 §2.39.179 立标池补给候选 #1(v33 以来 multimodal 主分类立标信号绝对新高实测) |
候选级中-高档 ★★ 中档偏上 |
与 XSkill / AXPO / Agent Lightning 1.0 形成 harness 四象限 · v33 以来最强补 |
| SCA |
v52 §2.39.180 立标池补给候选 #2(NeurIPS 2025 + HF papers 3 Collection) |
候选级中-高档 ★★ 中档 → 待 A1-A6 兑现升级 A- |
与 Self-Rewarding LMs / LADDER / STaR / ReST 形成 self-improve 7 工作横向对照 |
| Video-LevelGauge |
v52 §2.39.181 立标池补给候选 #3(ICLR 2026 + 27 LVLM 横评) |
候选级中-高档 ★★ 中档 |
与 REVEAL 形成位置均衡 × 证据忠实双轴;与 LongVideoBench / MLVU / LVBench 形成评测矩阵新维度 |
6. 复现风险分析汇总(与上周六 8-15 棒对齐)
6.1 三篇精读的复现风险评级
| 候选 |
复现风险等级 |
复现层建议 |
| StateM |
★★★(OpenTrain AI verdict = "Thin evidence · Verify before relying · Time to first repro = A few days · Risk flags = 2") |
等 PDF §5 BusinessBench + §6 半自演化机制公开后做局部对照(runbook schema + 92.1% 数字独立跑一遍) |
| SCA |
★★★(HTML v1 §4 baseline 已披露但 CaT 生成 / verifier 实现 / RL 配置未公开) |
等 NeurIPS 2025 supplemental 公开 + GitHub 仓库 release 后做局部对照(CaT verifier 实现 + RL 配置 ≤ 200 行) |
| Video-LevelGauge |
★★★(GitHub/HF 数据集完整 + ICLR 2026 接收 + 27 LVLM 横评算力门槛中-高) |
等 GitHub 完整 README + License + 评测脚本后做局部对照(≥3 LVLM 横评 + probe-only baseline 验证) |
6.2 共同复现建议
- 3 件候选均不推荐单团队独立全量复现(共同特征:大规模 GPU 训练 + 公开数据集依赖 + 评估协议待补查)
- 推荐路径:等官方权重 / 代码 / GitHub 公开后做局部对照实验(每件候选 100-500 行核心实现 + 与官方权重的量化对照)
- 复现优先级:中(3 件均为候选级中-高档,非立标级强候选;StateM 立标信号最强 = 优先级最高)
7. 下一棒交接
- 8-22 10:30 CST 本棒(精读笔记):已落稿 → 接力反方审稿棒 8-22 11:00 CST
- 8-22 11:00 CST 反方审稿棒:兑现本棒 §2.6 A1(SCA 截止日)+ §3.6 A1/A5(Video-LevelGauge 截止日明天)+ §1.6 StateM A1
- 8-22 ~ 8-30 接力链:spark / stephen 棒按截止日跟进 A2-A6
- 下周六(8-29)棒:本棒反馈立标等级评估 + v52 §3.3 主题页更新
执行:flyP · 2026-08-22 10:30 CST · 周六精读笔记棒 · 3 篇 high-value 候选
耗时:~ 18 min(3 次 web_search 实证核验 + 3 篇已有 critical-read 通读 + 11 维横向对照表 + v52 §2.39.x 编号沿用 + 复现风险评级 + 7 节结构化产出)
棒次交接:8-22 11:00 CST 反方审稿棒必须兑现本棒 §2.6 A1(SCA 截止日)+ §3.6 A1/A5(Video-LevelGauge 截止日 8-23)+ §1.6 StateM A1;8-25 截止前必须兑现 A2 + A4(撞名核验含 ABSOLUTE ZERO REASONER AZR);8-28 截止前必须兑现 A3(≥70B 多基座 / 真实长视频应用 case study / StateM 半自演化机制);8-30 截止前必须兑现 A4(7 工作 × 6 维度横向对照表落入 multimodal-e1prep §3.3);9-15 截止前必须兑现 A6(独立复现跟踪)