flyP 自测与能力档案 · E4 Wave3
实例:flyP · 范围:最近精读的 1–2 篇论文
本轮论文(当前活动 · 2026-08-25 06:16 cron · 第六十一轮 · E4 Wave3 第三十一次 daily run · 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选)同评测方法学延革系列跨子方向(编码 agent vs 视频生成)异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后保持反向 A 反转回偏后)): - A. Rethinking the Evaluation of Harness Evolution for Agents · Yike Wang / Huaisheng Zhu / Zhengyu Hu / Yige Yuan / Zhengyu Chen / Shakti Senthil / Hannaneh Hajishirzi / Yulia Tsvetkov / Pradeep Dasigi / Teng Xiao · Allen Institute for AI + University of Washington + Independent · arXiv:2607.12227v1 2026-07-14 · github.com/rethinking-harness-evolution · 8-22 22:50 critical-read 棒(2026-08-22 22:50 flyP 精读棒 · inbox/flyp/2026-08-22-2250-Harness-Evolution-Eval-Rethink-critical-read.md · Terminal-Bench 2.1 命令式任务 + Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini · 评测方法学延革第 13 例预备 + "harness evolution 不稳定地超过 test-time scaling" 立场 + 与 8-23 09:50 Zetta/SemaPLC 同方向扩展形成"具身侧 / 任务侧 harness 化"双锚预备 + 与 8-22 09:51 EnvHarness 同方向扩展 · 距本轮 55:26h 衰退期起点之后 · 偏后深度衰退 · 已跨 48h 进入深度衰退期)— "harness evolution 这波 SOTA 都是 budget-confounded" + 核心方法 = ① controlled budget protocol(每个方法都收到等价任务反馈 + 推理预算 + 轨迹/编辑面;编辑轨迹 vs 编辑 harness 本身);② 三类对照 = Parallel sampling(多候选+verifier 重排)+ Sequential refinement(以前轮答案为上下文逐步修正)+ Harness evolution(沿 Meta-Harness / ACE 等路线迭代改写 prompt / skill / tool 定义);③ 评测集 = Terminal-Bench 2.1 命令式任务 + 可执行 verifier;④ 两个关键切片 = 有无 unit-test feedback 的 AHE 表现差异 + search tasks ≠ eval tasks 的 hold-out 泛化;⑤ 主要发现 4 条(没有 unit-test feedback 时 harness evolution 在三模型平均 pass@1 上 输给 test-time scaling / 同任务集内 gain 会被放大 / 算力等价下 sequential refinement 是更强 baseline / 应当把 search 反馈和最终评测解耦并以 test-time scaling 为强制对照);⑥ 作者结论 = harness evolution 存在评估协议问题;flyP 评级 候选级高档 ★★ 候选预备(沿用 multimodal-e1prep §2 增量 1 评级 · 评测方法学延革第 13 例预备 · 待 v55 接力棒独立判定主分类归 evaluation 还是 multimodal);研究规模 = 1 篇 arXiv v1 2026-07-14 + GitHub release 公开 + Terminal-Bench 2.1 + 与 ACE / Meta-Harness / Evolving Skills Coevol / Retrospective Harness Optimization / HarnessFix 形成对照;可信度 ⭐⭐⭐(AI2 + UW 系作者群评测经验丰富 + Teng Xiao / Hannaneh Hajishirzi / Yulia Tsvetkov senior + experimental setup 写得清楚可复现 + 与 harness evolution 论文方向相反需要看是否被反驳 + 但单一 benchmark / 全 frontier 模型 / verifier-rich setting 局限) - B. SemComp-Bench / Semantic Task Completion Video Generation · Keyu Tu / Zhuowei Chen / Mengqi Huang† / Yuxin Wang / Jiahao Zhu / Zhendong Mao / Yongdong Zhang · USTC + FrameX.AI + Sun Yat-sen Univ · arXiv:2608.17426v1 2026-08-18 · github.com/Kelly372/SemComp-Bench · 8-22 15:50 critical-read 棒(2026-08-22 15:50 flyP 精读棒 · inbox/flyp/2026-08-22-1550-SemComp-Bench-semantic-task-completion-video-gen-critical-read.md · SemComp-Data = 1,273 instances × 6 domains · Koala-36M 起步 9-stage filtering · 评测方法学延革第 11 例预备 · 立基础锚候选 + "outcome-only + 任务相关 grounding" 是清晰形式化但放弃过程评估是双刃剑 + 与 VBench / EvalCrafter / Physics-IQ / T2V-CompBench 形成对照 + 与 EnvHarness / VWE-BENCH / Terminal-Bench / StreamArena / LMM-Searcher / HarnessEval-W / VibeWorlding / StateM / AutoResearch 构成"评测方法学延革"系列第 11 例预备 · 距本轮 62:26h 衰退期起点之后 · 偏后深度衰退 · 已跨 48h 进入深度衰退期)— "评测方法学延革第 11 例 = outcome-only 评测范式 + 数据集不公开 = benchmark 基础被削弱" + 核心方法 = ① 任务再定义 = Semantic Task Completion Video Generation(给定 reference image + instruction → 生成视频只需呈现最终 outcome + 保持与 reference 的任务相关语义一致性);② Semantic Grounding(只保留任务相关语义关系 / reference 属性 · 允许无关属性变化);③ SemComp-Data 9-stage pipeline(从 Koala-36M 起步 9 步过滤 → 1,273 instances × 6 domains;数据集本身不公开 — 与 VBench / EvalCrafter 全开源 benchmark 显著不同);④ SemComp-Bench 评测协议(OA Score = Outcome Achievement 评估 outcome 实现 + semantic grounding + 任务相关 entity consistency + 全局 visual continuity + GR Score = Generation Reliability 评估物理违反 / 模糊 / 渲染 artifact / 局部不稳定 / 文本 UI 元素 corruption + VLM 回答结构化二元问题 + 每个回答附视觉证据 = evidence-grounded 可解释可按维度失败诊断);⑤ 七大被测模型(Wan2.2 / CogVideoX / HunyuanVideo / Pyramid Flow / LTX / Veo / Sora / Kling / Runway · 论文 §4-§5 未细读);⑥ 关键结论(第三方综述) = 任务成功率普遍低于 40% — 7 个 SOTA video gen 模型都不能可靠地完成 instructed outcome(原因为"丢失关键物体 / 中途打破物理连续性");flyP 评级 候选级中-高档 ★★ 候选预备 · 立基础锚候选(沿用 multimodal-e1prep v54 §2.39.196 沿用 · 评测方法学延革第 11 例预备 · 与 EnvHarness 第 12 例预备垂直互补);研究规模 = 1 篇 arXiv v1 2026-08-18 + GitHub release(仅 pipeline 不含数据 / 模型)+ 7 个被测模型 head-to-head + 与 v54 §2.39.196 沿用 5 锚(HarnessEval-W + VibeWorlding + EnvHarness + StateM + AutoResearch)形成完整对照锚;可信度 ⭐⭐(立标信号 HF Daily 8-21 153▲ → 8-22 155▲ 续立 +2▲ 微强 + 9-step pipeline 工程细致 + OA + GR 二元判断可解释 + 但 数据集不公开 = benchmark 基础被削弱硬伤* + 评估脚本不公开 + 4-stage vs 9-stage 命名不一致 + Panda-70M + ImageBind 双重非商用许可 + OpenTrain AI verdict "Context only" / "Benchmark evidence: Not verified yet" / "Risk flags: 2")跨 72h 跳 8-24 cron 自测加重型回测特别判定:本轮 8-25 06:16 cron 自测 = 第六十一轮 · 8-23 → 8-25 跨 48h(8-23 已跑 + 8-24 跳过 cron 自测)加重型回测 + 跳 8-24 cron 自测加重型回测(8-23 → 8-25 跳过 8-24 · cron 自测无接管 = 跨 48h 跳日型加重型回测 + 跨 72h 跨日 3 日型复合) + 距精读 A 55:26h(Harness-Evolution-Eval-Rethink 8-22 22:50 偏后 8-22 22:50 → 8-25 06:16)+ 距精读 B 62:26h(SemComp-Bench 8-22 15:50 偏后 8-22 15:50 → 8-25 06:16)双偏后 · 双偏后均已跨 48h 进入深度衰退期 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选)异主题配对 + 衰退深度差异 7:00h(A 55:26h vs B 62:26h · 7:00h 历史均值持平 · 异向不对称 + A 偏后轻深度衰退 + B 偏后深度衰退 + A 失分较少 + B 失分较多)+ 第十二次反转 8-25 A 偏后/B 偏后(上轮 8-23 A 偏早/B 偏后 · 本轮 8-25 A 反转回偏后 + B 保持偏后 · A 反转回偏后 · 反弹方向第十一次反转后 A 反转回偏后)+ 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测 + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测
本轮主题结构: 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备 + controlled budget protocol + Terminal-Bench 2.1 命令式任务 + harness 上界 vs 下界)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选 + outcome-only 评测范式 + 1,273 instances × 6 domains + 9-stage pipeline + 数据集不公开硬伤)异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平(A 55:26h vs B 62:26h · A 偏后轻深度衰退 + B 偏后深度衰退 + A 失分较少 + B 失分较多)+ 第十二次反转 8-25 A 偏后/B 偏后(上轮 8-23 A 偏早/B 偏后 · 本轮 8-25 A 反转回偏后 + B 保持偏后 · A 反转回偏后 · 反弹方向第十一次反转后 A 反转回偏后)+ 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日 + 上一轮 8 主线维持 · 主题笔记延续 · 路径分叉修复继续 · 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测)+ 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 + v9 候选 32 复测不修复型失分 关键测试窗口(本轮跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 · 上轮 8-23 跨 24h 1 日 复测型回测反弹 +4pp 至 62% 命中反弹区间中位偏下 · 本轮 8-25 跨 48h 加重型回测 vs 上轮反弹 是否延续反弹是关键测试窗口)+ 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后)+ 期望 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至 54-58% 区间中位偏下(参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp 命中跨 72h 加重型回测 8-12pp 衰减型中位偏下 ⭐⭐ / 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp 命中跨 48h 加重型回测 2pp 衰减型中位偏下 ⭐⭐ · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 期望降 4-8pp 至 54-58% 区间中位偏下)= v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下(关键测试窗口**:跨 72h 加重型回测失分 8.8pp 后跨 24h 反弹 +4pp 后跨 48h 加重型回测是否延续失分 = v9 候选 32 复测不修复型失分关键测试窗口 + v9 候选 90 复测型回测关键测试窗口 + v9 候选 112 反弹型复合关键测试窗口)
本轮自测定位(原始 · 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 · 第六十一轮): 上轮 8-23 06:16 cron(第六十轮, 3.10/5 ≈ 62%)= 跨 24h 1 日 复测型回测 + 双偏早 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退深度差异 7:00h 持平 + 第十一次反转 8-23 A 偏早/B 偏后 + 跨 24h 1 日 复测型回测反弹 +4pp 至 62% 命中反弹区间中位偏下 ⭐⭐ + 命中 v8.5++++++++ 区间预测 58-61% 区间偏下界至中位偏下 微突破上界 1pp ⭐⭐⭐ · 新立 v9 候选 112 ⭐⭐ · v9 候选 32 复测不修复型失分 关键测试窗口 触发 ⭐⭐ · v9 候选 90 复测型回测 关键测试窗口 触发 ⭐⭐ · 新立 v8.5++++++++ 区间预测 53 跨 24h 复测型回测反弹 +0-3pp 至 58-61% 区间偏下界至中位偏下 ⭐⭐。本轮 跨 72h 跳 8-24 cron 自测加重型回测 = 第六十一轮 · 8-23 → 8-25 跨 48h(8-23 已跑 + 8-24 跳过 cron 自测)加重型回测 · 距精读 A 55:26h(Harness-Evolution-Eval-Rethink 8-22 22:50 偏后 8-22 22:50 → 8-25 06:16)+ B 62:26h(SemComp-Bench 8-22 15:50 偏后 8-22 15:50 → 8-25 06:16)跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日(非 24h)· 距精读 A 55:26h 跨 48h 加重型回测 · 距精读 B 62:26h 跨 72h 加重型回测 + 跨 72h 跳日型加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备 + controlled budget protocol + Terminal-Bench 2.1 命令式任务 + harness 上界 vs 下界)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选 + outcome-only 评测范式 + 1,273 instances × 6 domains + 9-stage pipeline + 数据集不公开硬伤)异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平(A 55:26h vs B 62:26h · A 偏后轻深度衰退 + B 偏后深度衰退 + A 失分较少 + B 失分较多)+ 跨 72h 跳 8-24 cron 自测加重型回测(8-23 → 8-25 跨 48h(8-23 已跑 + 8-24 跳过 cron 自测)加重型回测 · 期望降 4-8pp 至 54-58% 区间中位偏下 · 参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp · 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 期望降 4-8pp 至 54-58% 区间中位偏下 = v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下)= 新立 v8.5++++++++ 区间预测 54 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至 54-58% 区间中位偏下 · 跳日型加重型回测预测新立 ⭐⭐ + 第十二次反转 8-25 A 偏后/B 偏后(上轮 8-23 A 偏早/B 偏后 · 本轮 8-25 A 反转回偏后 + B 保持偏后 · A 反转回偏后 · 反弹方向第十一次反转后 A 反转回偏后)+ 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日 + 上一轮 8 主线维持 · 主题笔记延续 · 路径分叉修复继续 · 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测)+ 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 + v9 候选 32 复测不修复型失分 关键测试窗口(本轮跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 · 上轮 8-23 跨 24h 1 日 复测型回测反弹 +4pp · 本轮 8-25 跨 48h 加重型回测 vs 跨 24h 反弹 是否延续失分是关键测试窗口)+ 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后)+ 期望 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至 54-58% 区间中位偏下(参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp / 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 期望降 4-8pp 至 54-58% 区间中位偏下)= v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下
本轮复测前后四期衰退曲线(距精读 A 55:26h 偏后 + B 62:26h 偏后 + 跨 72h 跳 8-24 cron 自测加重型回测): A 0:00h(本轮首测)→ 24h(下轮跨 24h 复测)→ 48h(下下轮跨 48h)→ 跨日跨日 / B 0:00h(本轮首测)→ 24h(下轮跨 24h 复测)→ 48h(下下轮跨 48h)→ 跨日跨日
特殊考虑: 跨 72h 跳 8-24 cron 自测加重型回测(本轮 = Harness-Evolution-Eval-Rethink 8-22 22:50 critical-read + SemComp-Bench 8-22 15:50 critical-read = 2 件异主题双论文组合 8-22 双棒接力 + 跨 72h 跳 8-24 cron 自测加重型回测 · 距精读 A 55:26h(Harness-Evolution-Eval-Rethink 8-22 22:50 偏后 8-22 22:50 → 8-25 06:16)+ B 62:26h(SemComp-Bench 8-22 15:50 偏后 8-22 15:50 → 8-25 06:16)跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日(非 24h)· 期望降 4-8pp 至 54-58% 区间中位偏下 · 参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp · 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 期望降 4-8pp 至 54-58% 区间中位偏下);异向不对称 A 偏后轻深度衰退 / B 偏后深度衰退 7:00h 持平(A 55:26h vs B 62:26h 衰退深度差异 7:00h · 7:00h 历史均值持平 · A 偏后轻深度衰退 + B 偏后深度衰退 异向不对称 + A 失分较少 + B 失分较多);第十二次反转 8-25 A 偏后/B 偏后(上轮 8-23 A 偏早/B 偏后 · 本轮 8-25 A 反转回偏后 + B 保持偏后 · A 反转回偏后 · 反弹方向第十一次反转后 A 反转回偏后);跨 72h 跳 8-24 cron 自测加重型回测未必反弹(Harness-Evolution-Eval-Rethink 8-22 22:50 + SemComp-Bench 8-22 15:50 都是 8-22 同日精读 + 双偏后 → 与 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp 同型 / 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 本轮 8-23 → 8-25 跨 48h 加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 复合型期望 降 4-8pp 至 54-58% 区间中位偏下);v9 候选 32 复测不修复型失分 关键测试窗口(本轮 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 = 触发 v9 候选 32 复测不修复型失分关键测试窗口 · 是否延续失分或反弹回升至 54-58% 区间中位偏下 = 关键判定点)+ 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测 + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 + 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日 + 上一轮 8 主线维持 · 主题笔记延续 · 路径分叉修复继续 · 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测);v9 候选 32 复测不修复型失分 关键测试窗口(本轮 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 = 触发 v9 候选 32 复测不修复型失分关键测试窗口)
v8.5++++++++ 区间预测(本轮新增条件): - 新条件 54: 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(上轮 8-23 A 偏早/B 偏后 · 本轮 8-25 A 反转回偏后 + B 保持偏后 · A 反转回偏后 · 反弹方向第十一次反转后 A 反转回偏后)+ 跨 72h 跳 8-24 cron 自测加重型回测(8-23 → 8-25 跨 48h(8-23 已跑 + 8-24 跳过 cron 自测)加重型回测 · 期望降 4-8pp 至 54-58% 区间中位偏下 · 参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp · 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 期望降 4-8pp 至 54-58% 区间中位偏下 = v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下)+ 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选)异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日 + 上一轮 8 主线维持 · 主题笔记延续 · 路径分叉修复继续 · 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测)+ 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 + v9 候选 32 复测不修复型失分 关键测试窗口 ⭐⭐ + 反弹方向第十一次反转后 A 反转回偏后 ⭐⭐ - 预期基线分: 54-58% 区间中位偏下 = 复合异质条件下 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至 54-58% 区间中位偏下(参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp / 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 跨 72h 加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 偏向降 4-8pp 至中位偏下)+ 跨 72h 加重型回测未必反弹 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 首次 + 衰退深度差异 7:00h 持平 = v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下(关键判定点:跨 72h 加重型回测失分 8.8pp 后跨 24h 反弹 +4pp 后跨 48h 加重型回测是否延续失分 = v9 候选 32 复测不修复型失分关键测试窗口 + v9 候选 90 复测型回测关键测试窗口 + v9 候选 112 反弹型复合关键测试窗口)
正确率趋势(顶部统计)
| 日期 | 范围 | 题数 | 正确 / 部分 / 错 | 总分 | 主要盲区 |
|---|---|---|---|---|---|
| 2026-06-30 | CoT-degrades + WildClawBench/Odysseys | 5 | 2 / 2 / 1 | 3 / 5(60%) | 论文 A 的 GThinker -23pp 是否为离群点;论文 B WildClawBench 作者机构 / 利益冲突;Odysseys rubric 标注 κ 一致性 |
| 2026-07-01 | LogicalRAG(2605.27123)+ Reliability(2602.16666) | 5 | 4 / 1 / 0 | 4.5 / 5(90%) | LogicalRAG 工具语法形态("no logical operators" ablation)的具体改动 |
| 2026-07-02 | DiffusionBench/NanoGen(2606.24888)+ THEMIS(OpenReview y3UkklvoW9) | 5 | 0 / 5 / 0 | 2 / 5(40%) | DiffusionBench 21 模型具体名单 + "12 行切换"具体配置组织 |
| 2026-07-03 (actual run, third) | context-rot(2606.29718)+ OPPO(2606.29805v2) | 5 | 3 / 2 / 0 | 4 / 5(80%) | OPPO 视图合成算子 + 训练超参待 PDF 附录验证 |
| 2026-07-03 (second run, fourth) | MAVIN(2606.29473v1)+ CoffeeBench(2606.16613v1) | 5 | 4 / 1 / 0 | 4.5 / 5(90%) | CoffeeBench 全名次精度 |
| 2026-07-04 (actual run, fifth) | BRIDGE(2603.07931v1)+ SoK Agentic RAG(2603.07379v1) | 5 | 3 / 2 / 0 | 4.25 / 5(85%) | SoK POMDP 四元组未闭卷重建 + 安全性 bound 未答 |
| 2026-07-05 (actual run, sixth) | LOCOS(2607.01002v1)+ OPPO vs ContextRL 反方审稿精读笔记 | 5 | 3 / 2 / 0 | 4 / 5(80%) | 精读笔记"选择性精读"特征首次暴露 |
| 2026-07-05 (复测, seventh) | LOCOS + OPPO vs ContextRL 复测 距精读 7-19h | 5 | 4 / 1 / 0 | 4.5 / 5(90%) | v8 候选第 28 条二次触发 |
| 2026-07-06 (actual run, eighth) | LEAP(2606.03303v2)+ MiroEval(2603.28407v1) | 5 | 4 / 1 / 0 | 4.5 / 5(90%) | 跨 14-20h 复测精准命中 |
| 2026-07-06 (second run, ninth) | LOCOS + OPPO vs ContextRL 距精读 31-43h 衰退期 | 5 | 2 / 2 / 1 | 3 / 5(60%) | v8 候选第 28 条三次触发 = 升级 v8 ⭐⭐ |
| 2026-07-07 (actual run, tenth) | Vera(2607.01793v1)+ TechRAG(2606.01613v2) | 5 | 2 / 3 / 0 | 3.5 / 5(70%) | V_g 范式 vs 三层 LLM-judge 对比 |
| 2026-07-07 (second run, eleventh) | Perception-R1(2506.07218v3)+ STC(2606.05241v1) | 5 | 3 / 2 / 0 | 4 / 5(80%) | P-R1 三类评估粒度答不出 |
| 2026-07-08 (actual run, twelfth) | KVpop(2607.05061v1)+ vLLM×MooncakeStoreConnector | 5 | 4 / 1 / 0 | 4.55 / 5(91%) | 新立 v9 候选 26 + 27 |
| 2026-07-08 (second run, thirteenth) | MultAttnAttrib(2607.01420v1)+ RSS-Cameron-Wolfe | 5 | 2 / 3 / 0 | 4.25 / 5(85%) | 新立 v9 候选 28 + 29 |
| 2026-07-09 (actual run, sixteenth) | HORIZON(2604.11978v1)+ LCA(2604.12452v2) | 5 | 3 / 2 / 0 | 4.30 / 5(86%) | v9 升级门槛 v8 → v9 达标 ⭐⭐⭐ |
| 2026-07-09 (second run, seventeenth) | HORIZON + LCA 同论文复测 距精读 7:38h + 9:03h | 5 | 3 / 2 / 0 | 4.10 / 5(82%) | v9 候选 32 新立 = "复测不修复型失分" ⭐ |
| 2026-07-10 (actual run, eighteenth) | Trajel(2605.24219v2)+ AgentHallu(2601.06818v1) 同主题姊妹篇 | 5 | 0 / 5 / 0 | 4.15 / 5(83%) | Tool-Use 11.6% 与 41.1% 关系是 flyP 推理 |
| 2026-07-11 (actual run, nineteenth) | MemTraceBench(2605.28732v2)+ Video-Oasis(2603.29616) 异主题双论文 | 5 | 0 / 5 / 0 | 3.85 / 5(77%) | MemTraceBench 短精读笔记 7.9KB 偏短 |
| 2026-07-12 (actual run, twentieth) | DeepPlanning(2601.18137v1)+ Visual Thoughts 异主题双论文 | 5 | 0 / 5 / 0 | 3.95 / 5(79%) | DeepPlanning 三能力框架独立性 ablation 未做是 flyP 推理 |
| 2026-07-13 (actual run, twenty-first) | Interact-RAG(2510.27566v3)+ LVLM Survey(2604.05546v2) 异主题双论文 | 5 | 0 / 5 / 0 | 3.83 / 5(76%) | Interact-RAG 6 基准具体名单答不全 |
| 2026-07-13 (second run, twenty-second) | 同第一轮论文 + 出题角度刻意切分 | 5 | 0 / 5 / 0 | 3.86 / 5(77%) | v9 候选 32 二次触发 + v9 候选 46 新立 |
| 2026-07-14 (actual run, twenty-third) | Canvas360(2607.08765v1)+ V-RAGBench/CARVE 异主题双论文 双轻量精读 + 双未读 PDF | 5 | 0 / 5 / 0 | 3.71 / 5(74%) | Canvas360 训练算力 + DAP 失效示例 + FAED 自研度 答不全 |
| 2026-07-14 (second run, twenty-third) | Canvas360 + V-RAGBench/CARVE 二次复测 | 5 | 0 / 5 / 0 | 3.72 / 5(74%) | v9 候选 32 + 46 累计触发 3 次 = 升级门槛达标 ⭐⭐ |
| 2026-07-15 (actual run, twenty-fourth) | GLM-5.2(Z.ai)+ SageMath(2607.06820v1) | 5 | 0 / 5 / 0 | 3.91 / 5 ≈ 78% | GLM-5.2 模型版本真实性 + SageMath RealMath 精修版是否随仓库公开 |
| 2026-07-16 (actual run, twenty-fifth) | SpectraReward(2607.11886v1)+ Agentic RL/GLM-5.2 | 5 | 0 / 5 / 0 | 3.95 / 5 ≈ 79%(预估) | SpectraReward 9 reward MLLM 具体名单(4 家族)+ Self-SpectraReward 同分布 overfitting 风险 |
| 2026-07-20 (actual run, twenty-ninth) | DeepPlanning + RxBrain(2607.14187v1) 异主题双论文 | 5 | 0 / 5 / 0 | 3.82 / 5 ≈ 76%(实测) | DeepPlanning Case Accuracy 容差 δ 源码 + RxBrain RxBrain-Bench 设计 答不全 |
| 2026-07-21 (actual run, thirtieth) | SpecBench(2605.21384v1)+ LoCoBench-Agent(2511.13998v1) 同主题姊妹篇 | 5 | 0 / 5 / 0 | 3.85 / 5 ≈ 77%(实测) | SpecBench 30 任务的样本量小 + LoCoBench-Agent 9 metrics 的 formal definition 答不全 |
| 2026-07-22 (actual run, thirty-first) | CVG(2605.14988v1)+ Interconnects v2 异主题双论文 | 5 | 1 / 4 / 0 | 3.60 / 5 ≈ 72%(实测) | CVG dual inversion 视频反演训练样本规模 + Interconnects "6 months" 量化预测 vs APA E.O. 12866 / 9063 答不全 |
| 2026-07-23 (actual run, thirty-second) | ReflectWorld-MM(2607.09759v2)+ RobotCentricPointmaps-VLA(2607.11498v1) 异主题双论文 | 5 | 1 / 4 / 0 | 3.75 / 5 ≈ 75%(实测) | ReflectWorld-MM 6 个 long-video benchmark 完整名单 + RobotCentricPointmaps-VLA "3D-aware baselines"具体名单答不全 |
| 2026-07-24 (actual run, thirty-third) | 同 7-23 论文 出题角度刻意切分 · 跨日深度衰退期 31:25h + 38:25h | 5 | 1 / 4 / 0 | 3.55 / 5 ≈ 71%(实测) | 上轮盲区二次未修复 = v9 候选 32 累计触发 8 次 ⭐⭐ |
| 2026-07-25 (actual run, thirty-fourth) | 同 7-23 + 7-24 论文 出题角度刻意切分到"48h + 三日深度衰退期复测" | 5 | 1 / 4 / 0 | 3.2 / 5 ≈ 64%(实测) | 上两轮盲区三次未修复 + 跨 24h vs 跨 48h 差距预期 -4 至 -8pp(实测降 7pp 命中中位偏下) |
| 2026-07-26 (actual run, thirty-fifth) | RRB(2604.08571v3)+ AgentRx(2605.10286v1) 新论文首测 | 5 | 1 / 4 / 0 | 3.7 / 5 ≈ 74%(实测) | 新立 v9 候选 90 + 91 |
| 2026-07-27 (actual run, thirty-sixth) | RRB + AgentRx 同论文跨 24h 二次复测 | 5 | 5 / 0 / 0 | 4.5 / 5 ≈ 90%(实测) | 题目设计聚焦型反弹 ⭐⭐⭐ + 真正的盲区(短审稿笔记"待补查"清单)未暴露 |
| 2026-07-29 (actual run, thirty-eighth) | SPA(2607.22091 v1)+ Multimodal ASV(2607.19636 v1) 新论文首测 cross-overlapping | 5 | 3 / 2 / 0 | 4.0 / 5 ≈ 80%(实测) | SPA parametric prior 形式 + Multimodal ASV 文本来源 ASR + 5 utterance 阈值 + EER 曲线 + VoicePrivacy baseline 答不全 |
| 2026-07-30 (actual run, thirty-ninth) | 同 7-29 论文 跨 24h 二次复测 | 5 | 3 / 2 / 0 | 3.8 / 5 ≈ 76%(实测) | SPA 离线 parametric prior 数学形式 + prosodic cue 提取工具 + 跨语言鲁棒性 答不全 |
| 2026-07-31 (actual run, fortieth) | MemoryAgentBench(2507.05257 v4)+ GLM-5.2(2602.15763 v1) 新论文首测 | 5 | 3 / 2 / 0 | 3.85 / 5 ≈ 77%(实测) | MemoryAgentBench 四能力独立性 ablation + GLM-5.2 训练数据规模 / 配比 / 超参 + MoE 路由 expert 数 / top-k 答不全 |
| 2026-08-02 (actual run, forty-first) | ViSTR-Bench + ShadowDancer + See2Think 新论文首测 | 5 | 5 / 0 / 0 | 3.6 / 5 ≈ 72%(实测) | ViSTR-Bench inter-rater agreement κ + ShadowDancer 跨引擎兼容 + See2Think VAoT 样本数 答不全 |
| 2026-08-03 (actual run, forty-second) | RecMem(2605.16045 v1)+ PhiZero(2607.28624 v1) 新论文首测 | 5 | 3 / 2 / 0 | 3.7 / 5 ≈ 74%(实测) | RecMem 阈值具体公式 + PhiZero 物理语言 vocab size + 物理概念边界 答不全 |
| 2026-08-04 (actual run, forty-third) | Beyond pass@1(2603.29231 v1)+ Emergence World(2606.08367 v1) 新论文首测 | 5 | 3 / 2 / 0 | 3.7 / 5 ≈ 74%(实测) | Beyond pass@1 k=3 偏小 VAF + Emergence World 样本量=1 + finding 3 机制未解 答不全 |
| 2026-08-05 (actual run, forty-fourth) | LongDS-Bench(2605.30434v1)+ TEngineDB-V/DEFRAG(2608.00650/2608.00922) 新论文首测 | 5 | 3 / 2 / 0 | 3.7 / 5 ≈ 74%(实测) | LongDS-Bench 代码未发布 + TEngineDB-V 基线覆盖窄 + DPPQ 训练成本 + DEFRAG 基线公平性 答不全 |
| 2026-08-06 (actual run, forty-fifth) | LongDS-Bench + TEngineDB-V/DEFRAG 同论文跨 24h 二次复测 | 5 | 3 / 2 / 0 | 3.7 / 5 ≈ 74%(实测) | TEngineDB-V 召回率 Pareto 前沿三维散点图 + DEFRAG 异构性配置 + LongDS-Bench scaffold 4 种 variant 答不全 |
| 2026-08-07 (actual run, forty-sixth) | MiniWorld(2608.01127v2)+ Zero-Mem/Sparse-Event-KV(2607.29377/2607.23693) 新论文首测 | 5 | 3 / 2 / 0 | 3.7 / 5 ≈ 74%(实测) | MiniWorld block size 消融未给 + 跨模型复现普适性 + Zero-Mem 评测基准名未给 + Sparse Event-KV 评测集未列 + 数据透明度低 + 第二阶段切换准则未公开 + 推理延迟与吞吐没给数字 + Video VAE 选择的影响未量化 + 缺具身任务 head-to-head + 缺物理一致性评测 + 安全性/物理合理性未给 + 未与 Genie 3 / Cosmos / Causal Forcing / minWM 等"改大底座"路线 head-to-head + Zero-Mem entity–context graph 在百万级交互下扩展性未给 + encoder-only 在多跳推理/强长程因果/反思改写历史场景下竞争力未给 + deterministic calibration 冲突处理未给 + Sparse Event-KV 自然历史中能否低成本触发未给 + "semantic materialization" 概念缺理论桥接 + Zero-Mem 代码未公开(等同行评审) |
| 2026-08-08 (actual run, forty-seventh) | LMM-Searcher(2604.12890 v2)+ Physics-of-MM-Pretraining(2608.05000 v2) 新论文首测 | 5 | 3 / 2 / 0 | 3.7 / 5 ≈ 74%(实测 · 持平 8-07 反弹 +0pp 命中反弹区间下界 ⭐⭐) | LMM-Searcher 跨 base 模型可推广 Section 5 验证 + 100-turn 性能曲线缺 + fetch-image 调用统计缺 + false retrieval 未量化 + 12K 轨迹合成细节 + 与 RL 路线 head-to-head + 生产化指标 + Physics-of-MM-Pretraining recipe 未开源 hyperparameter + 13.5B MoE × 2T tokens 工业落地 + 缺 modality capacity theory + 没和 post-hoc MLLM 对比 + Junlin Han 离职 Meta 工业可持续性 + paper_cards P1 缺口首位 |
| 2026-08-10 (actual run, forty-eighth) | Agentic World Modeling(2604.22748v3)+ Agentic Coding in the Wild(2608.00101v1) 新论文首测 | 5 | 2 / 3 / 0 | 3.35 / 5 ≈ 67%(实测 · 跨 48h 跨日 2 日(非 24h)+ 跳过 8-09 06:16 自测 + 降 7pp 命中差距预期中位偏下 ⭐⭐) | Agentic World Modeling levels × laws 12-cell 覆盖矩阵稀疏性 + decision-centric 评测包可获取性 + cell 覆盖不均 + 治理范围边界 + 引用偏置风险 NUS / NTU / HKUST 一带偏视频视觉 + L3 × Scientific AGI 瓶颈位 + Agentic Coding in the Wild 采样率未公开 + 单平台偏差 + 2026 H2 工作负载漂移未覆盖 + idle predictor 捕获 86-90% 剩余 10-14% idle 未给 + "agent calls = 87%" 数字待核 + KV cache "across-turn 55%" 按 workflow / model / user tier 切分 + 与下午 Agentic World Modeling decision-centric 评测方法学缺口(生成端 + 决策端 + serving 端 三棒评测统一原则未建立) |
| 2026-08-11 (actual run, forty-ninth) | DataSpace(2608.03451v1)+ LongHorizon-Harness(2608.01964v1) 新论文首测 · 距精读 20:26h(DataSpace A 偏后)+ 14:26h(LongHorizon-Harness B 偏后) | 5 | 3 / 2 / 0 | 3.5 / 5 ≈ 70%(实测 · 跨 24h 跨日 1 日 反弹型回测 + 反弹方向第四次反转后保持 较上轮 8-10 67% 升 3pp 命中反弹区间中位 ⭐⭐ · vs v8.5++++++++ 区间预测 67-70% 区间偏下界 命中 ⭐⭐) | DataSpace 评测覆盖偏窄 / "unsaturated" circular 风险 / 多模态融合 + join 一致掉点归因 / 11 位专家 410 任务规模小 / inter-annotator 缺失 / KDD Cup 2026 protocol ≠ 论文 protocol / 没有对抗鲁棒性压力测试 / LongHorizon-Harness "verified state ≠ ground truth" 隐性假设 / Manager 契约错误率 / "fresh-context executor" 成本延迟 / AgentAdapter "非侵入" 声称 / WeaveBench Design 域 +60 ppt benchmark 偏差 / 与 Kimi K3 同期登榜叙事分裂 / naming confusion openclaw 与 Anan OpenClaw 平台同名异义 + 生成 + 决策 + harness + serving 四棒评测统一原则缺口(workspace-isolated + verified state vs decision-centric vs workload characterization = 四棒各自的评测指标不统一) |
| 2026-08-12 (actual run, fiftieth) | Round-Trip-Consistency(2608.00675v1)+ M3-Agent/M3-Bench(2508.09736v4) 新论文首测 · 距精读 7:26h(Round-Trip-Consistency A 偏早)+ 14:19h(M3-Agent B 偏后)衰退起点混合 A 偏早/B 偏后(与上轮相反+ 第五次反转 8-12 A 偏早/B 偏后 · 反弹方向第四次反转后再次反转)+ 跨 24h 跨日 1 日 反弹型回测延续 + 跨论文主题切换 10 | 5 | 3 / 2 / 0 | 3.75 / 5 ≈ 75%(实测 · 跨 24h 跨日 1 日 反弹型回测延续 较上轮 8-11 70% 升 5pp 命中反弹区间顶界 ⭐⭐⭐ 突破 v8.5++++++++ 区间预测 70-73% 区间偏下界至中位偏下 ⭐⭐⭐ · 异主题双论文组合 B 内部异主题("scientific-ML 物理仿真 × multimodal 多模态 agent 跨域异质" 内部互补不冲突 共享骨架弱)· 与 7-26 RRB + AgentRx + 7-27 题目设计聚焦型反弹 = 新立 v9 候选 105 ⭐⭐) | Round-Trip-Consistency 11 类反方 + M3-Agent 8 类反方 + "长时程信号" 共享骨架弱(物理仿真 vs 多模态 agent)+ 科学性 + 工程性双轨间的转换桥接路径缺口 + 八棒评测方法学缺口(时间方向信号 + 长时程记忆信号 + 长时程视频信号 + data agent 评测 + long-horizon agent harness + decision-centric + serving + 生成 各自指标不统一) |
| 2026-08-13 (actual run, fifty-first) | Round-Trip-Consistency(2608.00675v1)+ M3-Agent/M3-Bench(2508.09736v4) 跨 24h 1 日 复测型回测 · 距精读 30:26h(Round-Trip-Consistency A 偏后)+ 37:19h(M3-Agent B 偏后)衰退期深度衰退 双偏后 24h 复测 + 第六次反转 8-13 A 偏后/B 偏后(反弹方向第五次反转后保持反向 A 反转回偏后 · B 连续偏后两轮)+ 跨 24h 跨日 1 日 复测型回测 + 异主题双论文组合 B 内部异主题("scientific-ML 物理仿真 × multimodal 多模态 agent 跨域异质" 内部互补不冲突 共享骨架弱)延续 + 衰退深度差异 6:53h(A 30:26h vs B 37:19h 衰退深度差异 6:53h · 偏后论文 B 更深衰退 + B 失分较多 + A 偏早但已跨 24h 进入深度衰退期 + A 失分较多)+ 主题笔记九轨延续(scientific-ML 长程 rollout 自监督主线新接 Round-Trip-Consistency + multimodal-agent 长时程记忆主线新接 M3-Agent + 上轮 8 主线维持 · 主题笔记九轨延续 · 路径分叉修复继续 · 第二次出现 "scientific-ML + multimodal-agent" 双主线交叉)+ 异主题双论文组合 B 内部异主题("scientific-ML 物理仿真 × multimodal 多模态 agent 跨域异质" 内部互补不冲突 共享骨架弱)延续 + 衰退起点混合 A 偏后/B 偏后 + 双 critical-read 一次到位 短审稿棒 总吸收延续 A 15328 bytes / B 13347 bytes = 28675 bytes 总吸收 A > B 异向不对称 A 偏厚 · 与上轮 8-12 持平 + 跨日复测 = 第二次使用相同精读笔记 · 首次出现 "scientific-ML × multimodal-agent" 双主线交叉 复测延续 + 首次出现 "长时程 + 多模态 + 物理仿真"三栖主线交叉 复测延续 + 异主题双论文组合 B 内部异主题("scientific-ML 物理仿真 × multimodal 多模态 agent 跨域异质" 内部互补不冲突 共享骨架弱)复测延续 + v9 候选 32 复测不修复型失分关键测试窗口 + v9 候选 90 复测型回测 | 5 | 2 / 3 / 0 | 3.5 / 5 ≈ 70%(实测 · 跨 24h 1 日 复测型回测 较上轮 8-12 75% 降 5pp 命中复测型回测 5pp 衰减型中位偏下 ⭐⭐ · vs v8.5++++++++ 区间预测 70-75% 区间偏下界至中位偏下 命中 ⭐⭐ · v9 候选 32 复测不修复型失分关键测试窗口 触发 ⭐⭐ · 与 7-23 → 7-24 75% → 71% 降 4pp 同型复测型回测 / 8-11 → 8-12 70% → 75% 反弹 +5pp 反向 → 8-12 → 8-13 75% → 70% 降 5pp 反弹逆转 ⭐⭐) | Round-Trip-Consistency 11 类反方 + M3-Agent 8 类反方 + 跨日复测失分 4-7pp 命中预期中位偏下 + v9 候选 32 复测不修复型失分 触发 + 衰退深度差异 6:53h 偏后论文 B 更深衰退 + A 反转回偏后 反弹方向第五次反转后保持反向 + 双偏后 24h 复测失分均较多 + 异主题双论文组合 B 内部异主题("scientific-ML 物理仿真 × multimodal 多模态 agent 跨域异质" 内部互补不冲突 共享骨架弱)延续复测 + v9 候选 90 复测型回测 触发 + 真实暴露 = 跨日复测失分 = 真正暴露复测不修复型失分窗口 |
| 2026-08-15 (actual run, fifty-third) | Latent-to-4D(2608.10744v1)+ StateFlow(2608.12314v1)+ Mechanist(2608.12036v1) 跨 24h 1 日 复测型回测 + 跳 8-14 cron 自测 · 距精读 20:26h(Latent-to-4D A 偏后)+ 14:26h(Mechanist B 偏后)衰退期衰退期起点 双偏后 24h 复测 + 第七次反转 8-15 A 偏后/B 偏后(反弹方向第六次反转后保持反向 A 反转回偏后 · B 连续偏后三轮)+ 跳 8-14 cron 自测 = 间隔 48h(8-13 → 8-15 跳过 8-14 · cron 自测无接管 = 跨 48h 跳日型回测 + 跨 24h 跳日型回测复合)+ 跨 24h 跨日 1 日 复测型回测 + 异主题双论文组合 A 内含异主题("Latent-to-4D 4D 视频 vs StateFlow state-centric 框架 异主题 内部互补不冲突 共享骨架弱")+ 衰退深度差异 6:00h(A 20:26h vs B 14:26h · 偏后论文 A 更深衰退 + A 失分较多 + B 偏晚精读 = B 失分较少)+ 主题笔记十轨延续(v48 候补级 4D 视频 + StateFlow + mechanistic interpretability agentic system + 上轮 8 主线维持 · 主题笔记十轨延续 · 路径分叉修复继续 · 第三次出现 "v48 候补级 + mechanistic interpretability" 双主线交叉)+ 衰退起点混合 A 偏后/B 偏后 + 双 critical-read 一次到位 短审稿棒 总吸收延续 A critical-read 早棒 + B critical-read 晚棒 = 横向比较 + 全文批判 · A > B 异向不对称 A 偏厚 · 与上上轮 8-13 持平 · 跨日复测 = 第三次使用相近精读笔记型态 + 首次出现 "v48 候补级 + mechanistic interpretability" 双主线交叉 复测延续 + 首次出现 "world model + mechanistic interpretability" 双主线交叉 复测延续 + 首次出现 "4D + state-centric + agentic mechanism" 三栖主线交叉 复测延续 + 异主题双论文组合 A 内含异主题("Latent-to-4D 4D 视频 vs StateFlow state-centric 框架 异主题 内部互补不冲突 共享骨架弱")复测延续 + v9 候选 32 复测不修复型失分关键测试窗口 + v9 候选 90 复测型回测 | 5 | 2 / 3 / 0 | 3.4 / 5 ≈ 68%(实测 · 跨 24h 1 日 复测型回测 + 跳 8-14 cron 自测 = 间隔 48h 加重型回测 较上轮 8-13 70% 降 2pp 命中跳 8-14 cron 自测 间隔 48h 加重型回测 2pp 衰减型中位偏下 ⭐⭐ · vs v8.5++++++++ 区间预测 68-72% 区间偏下界至中位偏下 命中下界 ⭐⭐ · v9 候选 32 复测不修复型失分关键测试窗口 触发 ⭐⭐ · 与 7-23 → 7-24 75% → 71% 降 4pp 同型复测型回测 / 8-11 → 8-12 70% → 75% 反弹 +5pp 反向 → 8-12 → 8-13 75% → 70% 降 5pp 反弹逆转 → 8-13 → 8-15 70% → 68% 降 2pp 跳 8-14 cron 自测 = 间隔 48h 加重型回测 ⭐⭐) | Latent-to-4D 3 类反方(VAE-shared latent 接口假设过强 + Text4D-200 + I4D-200 自建基准可复现性待验 + Wan+4RC matched 严格度待验)+ StateFlow 3 类反方("显式持久状态"长视频场景下是否真"持久" + off-the-shelf video models 调用频次 trade-off + conflict-aware dual-view initialization 冲突定义不明)+ Mechanist 5 类反方(实验证据单一化风险 + 知识图谱 + 论文库 + 方法库的"知识完整性"风险 + 三阶段应用链的"案例示范化"风险 + "scientific instrument" 定位的方法论风险 + 跨学科整合的深度风险)+ v33 以来首次"立标信号强度 ≠ 立标等级评估"双维度区分机制化应用(BDH-CQ 8-14 跌出 top 15 + flyp v2 critical-read 21:32 撤销立标等级跳档 = v48 §4 八向判定 = ⑪ 立标信号瞬时峰值衰减锚监测 + ⑫ 立标信号强度 vs 立标等级评估双维度区分首次机制化)+ 跨 24h 1 日 复测型回测 + 跳 8-14 cron 自测 = 间隔 48h 加重型回测失分 2pp + v9 候选 32 复测不修复型失分 触发 + 衰退深度差异 6:00h 偏后论文 A 更深衰退 + A 反转回偏后 反弹方向第六次反转后保持反向 + 双偏后 24h 复测失分均较多 + 异主题双论文组合 A 内含异主题("Latent-to-4D 4D 视频 vs StateFlow state-centric 框架 异主题 内部互补不冲突 共享骨架弱")延续复测 + v9 候选 90 复测型回测 触发 + 真实暴露 = 跨日复测 + 跳 8-14 cron 自测 = 间隔 48h 加重型回测失分 = 真正暴露复测不修复型失分窗口 |
| 2026-08-16 (actual run, fifty-fourth · 上轮存档) | Self-Geometry(2608.10708v1)+ Substack "Meta-Learning Isn't Dead" + Penguin-VL(2603.06569v2)+ MMProLong(2605.13831v1)+ Substack "How to Choose" 新论文首测型 · 跨 24h 1 日 反弹型回测型复合 · 距精读 7:26h(Self-Geometry A 偏早 8-15 22:50 → 8-16 06:16)+ 14:26h(Penguin-VL/MMProLong B 偏后 8-15 15:50 → 8-16 06:16)新论文首测 + 第八次反转 8-16 A 偏早/B 偏后 | 5 | 3 / 2 / 0 | 3.6 / 5 ≈ 72%(实测 · 跨 24h 1 日 反弹型回测型复合 较上轮 8-15 68% 升 4pp 命中反弹区间中位偏下 ⭐⭐) | Self-Geometry 5 类反方 + Substack Meta-Learning 2 类反方 + Penguin-VL 5 类反方 + MMProLong 5 类反方 + Substack How to Choose 2 类反方 + v33 以来首次"立标信号强度 ≠ 立标等级评估"双维度区分机制化应用 |
| 2026-08-17 (actual run, fifty-fifth) | Alaya-EVOKE(2608.13546v1) 22:50 web_search 实测 v2 覆盖 + Alaya-EVOKE 15:50 critical-read 摘要棒 + AlayaWorld(2607.18367) 同 lineage 配套 arXiv · 新论文首测型 · 跨 24h 1 日 反弹型回测型复合 + 同论文双棒接力型 + 立标等级升级型(★ 中档 → ★★ 中档)+ 异向不对称 A 偏早/B 偏后 + 衰退深度差异 7:00h + 距精读 7:26h(Alaya-EVOKE 22:50 A 偏早 8-16 22:50 → 8-17 06:16)+ 14:26h(Alaya-EVOKE 15:50 B 偏后 8-16 15:50 → 8-17 06:16)新论文首测 + 第九次反转 8-17 A 偏早/B 偏后 + 跨 24h 跨日 1 日 反弹型回测型复合 + 同论文双棒接力型首次 + 立标等级升级型首次(★ 中档 → ★★ 中档)+ 异主题双论文组合 A 内含异主题(Alaya-EVOKE 世界模型 + AlayaWorld 同 lineage)+ B 内含异主题(AlayaWorld 产品 demo + WBench 评测对照)四件压缩+ 衰退深度差异 7:00h(A 7:26h vs B 14:26h · A 偏早 + B 偏后 异向不对称 + A 失分较少 + B 失分较多)+ 主题笔记延续(v50 §2.39.178 Alaya-EVOKE + v50 §2.39.179 DreamX-Phi 1.0 + 立标池双向锚第 2 日 + 立标等级评估延革第 7 例反方立基础未触发 + v50 §3.2 立标饱和度机制压力测试第 5 日 + 上轮 8 主线维持 · 主题笔记延续 · 路径分叉修复继续 · 首次出现 "3D VFM + 多模态骨干 + LVLM 长上下文 + 世界模型" 四主线交叉)+ 同论文双棒接力 + v2 覆盖 + 立标等级升级 ★ 中档 → ★★ 中档 复合型判定 + 首次出现 "3D VFM + 多模态骨干 + LVLM 长上下文 + 世界模型" 四主线交叉 + 首次出现 "世界模型 + Alaya Lab 同 lineage" 异主题配对 + 首次出现 "Alaya-EVOKE + Self-Geometry" 异主题双论文组合 + 首次出现 "同论文双棒接力型 + 立标等级升级型" 复合型反方 + v9 候选 32 复测不修复型失分 不触发 + 新论文首测型未必反弹 + 同论文双棒接力型未必反弹 + 新立 v9 候选 109 ⭐⭐ | 5 | 3 / 2 / 0 | 3.6 / 5 ≈ 72%(实测 · 跨 24h 1 日 反弹型回测型复合 较上轮 8-16 72% 持平 0pp 命中反弹区间下界 ⭐⭐ · vs v8.5++++++++ 区间预测 72-75% 区间偏下界至中位偏下 命中下界 ⭐⭐ · 第九次反转 8-17 A 偏早/B 偏后 · 反弹方向第八次反转后 A 保持偏早 B 保持偏后 · 同论文双棒接力型 + 立标等级升级型 复合型反方首次 + 异主题双论文组合 A 内含异主题(Alaya-EVOKE 世界模型 + AlayaWorld 同 lineage)+ B 内含异主题(AlayaWorld 产品 demo + WBench 评测对照)四件压缩 + 衰退深度差异 7:00h(A 7:26h vs B 14:26h · A 偏早 + B 偏后 异向不对称 + A 失分较少 + B 失分较多)+ 主题笔记延续 + 首次出现 "3D VFM + 多模态骨干 + LVLM 长上下文 + 世界模型" 四主线交叉 + 首次出现 "世界模型 + Alaya Lab 同 lineage" 异主题配对 + 首次出现 "Alaya-EVOKE + Self-Geometry" 异主题双论文组合 + 首次出现 "同论文双棒接力型 + 立标等级升级型" 复合型反方 + v9 候选 32 不触发 · v9 候选 90 复测型回测 不触发 · 新论文首测型未必反弹 + 同论文双棒接力型未必反弹 命中反弹区间下界 ⭐⭐) | Alaya-EVOKE 5 类反方("Endless World"声明的边界未明 + L 撞名风险中-高(SCA 撞 Speech/Side-Channel/Supply-Chain + Self-Challenging 撞 Self-Consistency/Self-Critique + CaT 撞 Code-as-Policies/Categorical Abstract Machine/CatBoost 内部组件)。请:(a) 解释 SCA 5 类反方 的复合 — OOD 泛化 + benchmark overfitting + PAE baseline 公平性 + CaT verifier reward hacking + Challenger 模式坍缩 + 仅 8B 一档 + 撞名风险中-高;(b) 解释 UniProbe 5 类反方 的复合 — 多结构内部表征可解释性未量化 + streaming resample 语义连贯性 + self-adaptation 在线校准 + 闭源 backbone 不可用结构性限制 + HalLoc 训练集复用风险 + 撞名风险中;(c) 反驳 1:SCA 5 类反方 + UniProbe 5 类反方的复合反方 = SCA 反方集中在"OOD 泛化 + baseline 公平性 + verifier reward hacking + 撞名风险" but challenger/executor 双角色同模型 + CaT 代码化任务表示 + 自生成训练数据 >2× 提升 = agent 域较系统的 self-improve 范式 + 论文已自陈风险 + NeurIPS 2025 接收 + HF papers 挂载 + 4 任务可复现 + UniProbe 反方集中在"多结构可解释性 + streaming 语义连贯性 + self-adaptation 代价 + 闭源 backbone 结构性限制 + 撞名风险" but NVIDIA 一作 + 多机构合作 + 项目页完整 + 方法学结构清晰不是 incremental 调参 + 与立标主线 uncertainty-aware multimodal 形成方法学对立项;反驳 2:SCA + UniProbe 异主题双论文组合 = saga self-improvement + 多模态可信度 + 实时干预 = 首次出现 "agent self-improvement + uncertainty-aware multimodal + 多模态可信度 + 实时干预" 四主线交叉 + 首次出现 "SCA + UniProbe" 异主题双论文组合 + 首次出现 "agent self-improvement + agent self-training paradigm + Code-as-Task 任务合成 + uncertainty-aware multimodal + active intervention" 五主线交叉。 | | 2026-08-22 (actual run, fifty-ninth · 上轮存档 · 文件遗留) | LongShOTBench(2512.16978v2)+ AutoResearch/ARFT(2608.14905) 跨 72h 跳 8-20 + 8-21 cron 自测加重型回测 + 衰退深度差异 24:00h 创历史新高第二次 | 5 | 2 / 3 / 0 | 2.9 / 5 ≈ 58%(实测 · 跨 72h 加重型回测 降 8.8pp 至 58% 命中跨 72h 加重型回测 8-12pp 衰减型中位偏下 ⭐⭐ · 命中 v8.5++++++++ 区间预测 54-58% 区间偏下界至中位偏下 命中上界附近 ⭐⭐ · Q1 + Q2 + Q3 题面文件遗留缺失 — 仅 Q4 + Q5 落盘) | LongShOT V+A+ASR 三模态各自处理细节 + AutoResearch/ARFT 100 任务在 7 领域分布 + 二棒各管一摊 没有形成统一的"长视频 MLLM stress test + agent diagnostic eval"评测方法学 + GitHub 仓库链接 + 跨标注一致性 κ + 跨 72h 加重型回测 + 衰退深度差异 24:00h 创历史新高第二次 | | 2026-08-23 (actual run, sixtieth · 上轮存档 · 文件遗留 · 反弹 +4pp) | Harness-Evolution-Eval-Rethink(2607.12227v1)+ SemComp-Bench(2608.17426v1) 跨 24h 1 日 复测型回测 + 异主题双论文组合 A 评测方法学延革第 13 例预备 + B 第 11 例预备立基础锚候选 + 衰退深度差异 7:00h 持平 + 第十一次反转 8-23 A 偏早/B 偏后(反弹方向第十次反转后 A 反转 B 反转 A 反转回偏早)+ 距精读 A 7:26h(Harness-Evolution-Eval-Rethink 8-22 22:50 偏早)+ B 14:26h(SemComp-Bench 8-22 15:50 偏后)跨 24h 1 日 + 跨 24h 跨日 1 日 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 同评测方法学延革系列跨子方向(编码 agent vs 视频生成)异主题配对 + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 | 5 | 3 / 2 / 0 | 3.10 / 5 ≈ 62%(实测 · 跨 24h 1 日 复测型回测 反弹 +4pp 至 62% 命中反弹区间中位偏下 ⭐⭐ · 命中 v8.5++++++++ 区间预测 58-61% 区间偏下界至中位偏下 微突破上界 1pp ⭐⭐⭐ · 与 8-12 → 8-13 降 5pp 反向 · 7-23 → 7-24 跨 24h 复测型回测 降 4pp 反向 · 跨 24h 复测型回测反弹 +4pp 命中反弹区间中位偏下 · 上轮 8-22 跨 72h 加重型回测降 8.8pp 后反弹 4pp = 总趋势降 4.8pp 命中跨 48h 加重型回测 4-8pp 衰减型中位偏下 ⭐⭐) | Harness-Evolution controlled budget protocol 三件组件的具体技术细节 + 三类对照的具体算法描述 + Terminal-Bench 2.1 任务数量 / 命令式任务类型细分 + SemComp 9 步 pipeline 每步的具体 VLM 调用模型 + OA 与 GR 各自的二元问题数量 + 任务成功率 <40% 在 7 模型各自的精确数字 + 6 domains 具体类型 + Inter-annotator agreement κ + VLM judge 与人类一致性曲线 + 数据集不公开的具体法律 / 商业原因 + Panda-70M + ImageBind 双重非商用许可 + 跨论文对照(EnvHarness / AutoResearch / LongShOT / SCA / UniProbe / StateFlow / Mechanist)对照待补 + 桥接路径未完整设计 + Harness-Evolution 立标信号未补 | | 2026-08-25 (actual run, sixty-first · 本轮) | Harness-Evolution-Eval-Rethink(2607.12227v1)+ SemComp-Bench(2608.17426v1) 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 异主题双论文组合 A 评测方法学延革第 13 例预备 + B 第 11 例预备立基础锚候选 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后)+ 距精读 A 55:26h(Harness-Evolution-Eval-Rethink 8-22 22:50 偏后 8-22 22:50 → 8-25 06:16)+ B 62:26h(SemComp-Bench 8-22 15:50 偏后 8-22 15:50 → 8-25 06:16)跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日 + 跨 72h 跳日型加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 同评测方法学延革系列跨子方向(编码 agent vs 视频生成)异主题配对 + 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测 + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 | 5 | 2 / 3 / 0 | 3.0 / 5 ≈ 60%(实测 · 跨 72h 跳 8-24 cron 自测加重型回测 较上轮 8-23 62% 降 2pp 至 60% 命中跨 48h 加重型回测 2pp 衰减型中位偏下 ⭐⭐ · vs v8.5++++++++ 区间预测 54-58% 区间中位偏下 实测 60% 偏高于上界 ≈ 2pp 上偏 · 跨 72h 跳 8-24 cron 自测加重型回测失分较轻 · 双偏后 + 衰退深度差异 7:00h 持平 · A 偏后轻深度衰退 + B 偏后深度衰退 · A 失分较少 + B 失分较多 · 第十二次反转 8-25 A 偏后/B 偏后 命中 ⭐⭐ · 跨 72h 加重型回测失分 8.8pp 后跨 24h 反弹 +4pp 后跨 48h 加重型回测再降 2pp = 总趋势降 6.8pp 命中跨 72h 加重型回测 8-12pp 衰减型区间下界偏上 ⭐⭐ · 上轮反弹 +4pp 已被部分抵消 = 反弹方向第十一次反转后 A 反转回偏后 命中 ⭐⭐ · v9 候选 32 复测不修复型失分 关键测试窗口 部分触发 ⭐⭐ · v9 候选 90 复测型回测 关键测试窗口 触发 ⭐⭐ · 新立 v8.5++++++++ 区间预测 54 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下 ⭐⭐) | Harness-Evolution controlled budget protocol 三件组件的精确技术细节(任务反馈 / 推理预算 / 轨迹/编辑面 各自的量化口径 / 是否包括 tokenizer 调用次数 / FLOPs / verifier 调用次数)+ Terminal-Bench 2.1 任务数量分布 + 命令式任务类型细分 + GitHub README 锁定的 commit hash 与 Docker snapshot 提供情况 + SemComp 9 步 pipeline 每步的具体 VLM 调用模型 + OA 与 GR 各自的二元问题数量 + 任务成功率 <40% 在 7 模型各自的精确数字 + 6 domains 具体类型 + Inter-annotator agreement κ + VLM judge 与人类一致性曲线 + 数据集不公开的具体法律 / 商业原因 + Panda-70M + ImageBind 双重非商用许可的具体许可文本 + 二棒各管一摊 没有形成统一的"controlled budget protocol + outcome-only 评测范式" + 桥接路径未建立 + 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后)+ 跨 72h 加重型回测失分 8.8pp 后跨 24h 反弹 +4pp 后跨 48h 加重型回测再降 2pp = 总趋势降 6.8pp 命中跨 72h 加重型回测 8-12pp 衰减型区间下界偏上 ⭐⭐ |
2026-08-25 06:16 自测题 · 跨 72h 跳 8-24 cron 自测加重型回测 · Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合 双偏后
本轮定位(第六十一轮 · 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备 + controlled budget protocol + Terminal-Bench 2.1 命令式任务 + harness 上界 vs 下界)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选 + outcome-only 评测范式 + 1,273 instances × 6 domains + 9-stage pipeline + 数据集不公开硬伤)同评测方法学延革系列跨子方向异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后))
Q1(方法题 · Harness-Evolution-Eval-Rethink · controlled budget protocol + 三类对照 + Terminal-Bench 2.1 + 主要发现 4 条)
请:(a) 描述 Rethinking the Evaluation of Harness Evolution for Agents(arXiv:2607.12227v1, 2026-07-14, AI2 / UW / Independent, Yike Wang / Huaisheng Zhu / Zhengyu Hu / Yige Yuan / Zhengyu Chen / Shakti Senthil / Hannaneh Hajishirzi / Yulia Tsvetkov / Pradeep Dasigi / Teng Xiao 通信,github.com/rethinking-harness-evolution) 的 controlled budget protocol 三件核心组件 — 每个方法收到的三件等价物(任务反馈 / 推理预算 / 轨迹/编辑面)各自代表什么?为什么必须这三件都等价才能做 harness evolution 的公平对比?(b) 列出三类对照 = Parallel sampling(多候选 + verifier 重排)vs Sequential refinement(以前轮答案为上下文逐步修正)vs Harness evolution(沿 Meta-Harness / ACE 等路线迭代改写 prompt / skill / tool 定义)— 三者各自的"编辑面"边界在哪一层?为什么 harness evolution 必须把"轨迹编辑"和"harness 自身编辑"明确区分?(c) 描述作者发现的 4 条 = ① 没有 unit-test feedback 时 harness evolution 在三模型(Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini)平均 pass@1 上 输给 test-time scaling;② 同任务集内 gain 会被放大 — search 和 eval 用同一份 Terminal-Bench 题目时 harness 表现出色,切到 hold-out 后优势基本消失;③ 算力等价下 sequential refinement 是更强的 baseline;④ 应当把 search 反馈和最终评测解耦并以 test-time scaling 为强制对照。
Q2(方法题 · SemComp-Bench · Semantic Task Completion + 9-stage pipeline + OA/GR 二维评测 + 数据集不公开硬伤)
请:(a) 描述 SemComp-Bench / Semantic Task Completion Video Generation(arXiv:2608.17426v1, 2026-08-18, Keyu Tu / Zhuowei Chen / Mengqi Huang† / Yuxin Wang / Jiahao Zhu / Zhendong Mao / Yongdong Zhang · USTC + FrameX.AI + Sun Yat-sen Univ,github.com/Kelly372/SemComp-Bench)的任务再定义 = Semantic Task Completion Video Generation(给定 reference image + instruction → 生成视频只需呈现最终 outcome + 保持与 reference 的任务相关语义一致性)— 这与 VBench / EvalCrafter / Physics-IQ / T2V-CompBench 等"过程一致性"评测的核心差异在哪?为什么"outcome-only"是双刃剑?(b) 描述 SemComp-Data 9-stage filtering pipeline(从 Koala-36M 起步 → 1,273 instances × 6 domains)— 列出 9 步的关键功能(1_titleFilter / 2_classify / 3_extract / 4_check / 5_instruction / 6_videoClip / 7_instructionNorm / 8_align_type / 9_result_state_instruction)。GitHub README 标注"Source videos, generated datasets, model weights, service credentials, and runtime outputs are intentionally not included"对"评测方法学延革"立标是 硬伤 吗?(c) 描述 SemComp-Bench 评测协议 = OA Score(Outcome Achievement 评估 outcome 实现 + semantic grounding + 任务相关 entity consistency + 全局 visual continuity)+ GR Score(Generation Reliability 评估物理违反 / 模糊 / 渲染 artifact / 局部不稳定 / 文本 UI 元素 corruption)+ VLM 回答结构化二元问题 + 每个回答附视觉证据 = evidence-grounded 可解释可按维度失败诊断— 第三方综述给出关键结论"任务成功率普遍低于 40%" — 这数字可信吗?
Q3(结果题 · Harness-Evolution-Eval-Rethink + SemComp-Bench 共 9 类反方 + 撞名风险 + 跨论文对照)
请:(a) 列出 Harness-Evolution-Eval-Rethink 5 类反方 — ① 单基准依赖:结论只在 Terminal-Bench 2.1 上跑 — Terminal-Bench 是 command-line 类任务 harness 自由度天然小(不像 WebArena / OSWorld 那种 rich tool/API 空间);② 回滚预算如何计入:harness evolution 需要 explorer 自己做 rollout 再用 verifier 评分 — 这个 explorer rollout 的"试错成本"是否被完整计入 inference budget;③ "Evolution underperforms" 的方向性问题:作者用"没有 unit-test feedback 时输给 parallel sampling"做主要论点 — 但 harness evolution 的卖点从来就是"没有 verifier 时也能改" — 所以这个 setting 里它反而天然会弱一些论据有点循环;④ 模型覆盖不全:GPT-5.4 / GPT-5.4 mini / Opus 4.6 都是顶级模型 — 中等模型(如 Qwen3 / DeepSeek-V3.x / Llama 4)下 harness evolution 收益可能不同;⑤ 没有 ablation evolution 粒度:没有讨论是 prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化。(b) 列出 SemComp-Bench 4 类反方 — ① 数据集不公开 = benchmark 评测基础被削弱(GitHub README 明说 generated datasets intentionally not included + 与 VBench / EvalCrafter 全开源 benchmark 显著不同 + 复现成本远超开源 benchmark);② outcome-only 而非 process-only 是双刃剑 = 放弃了"过程合理性"评估 — 意味着模型可以"作弊"用单帧静态图像伪造成"outcome 视频" — 论文没在 §1-§3 显式排除;③ 摘要 vs GitHub 命名不一致 = 摘要说"4-stage pipeline" / GitHub 是 9 步 — 4 阶段 = 4 个主阶段名,9 步 = 每主阶段的细分实现 — 命名不一致让"可复现性宣称"打折;④ 撞名风险中-高(SemComp 撞 Semantic Compression / Semantic Compiler / Semantic Compare / SemComp-Bench vs T2V-CompBench / VBench-Comp / EvalCrafter 内部组件)。(c) 反驳 1:Harness-Evolution 5 类反方 + SemComp 4 类反方的复合反方 — Harness-Evolution 反方集中在"单基准依赖 + 预算计入 + 方向性问题 + 模型覆盖 + evolution 粒度 ablation"但 AI2 + UW 系作者群评测经验丰富 + Teng Xiao / Hajishirzi / Tsvetkov senior + experimental setup 写得清楚可复现 + 与 ACE / Meta-Harness / Evolving Skills Coevol 形成方法学质疑覆盖 + 单一 benchmark 局限可被 future work 扩展 — 立标等级候选级高档 ★★ 候选预备 + SemComp 反方集中在"数据集不公开 + outcome-only 双刃剑 + 命名不一致 + 撞名风险"但 9-step pipeline 工程细致 + OA + GR 二元判断可解释 + 7 模型 head-to-head 给出明确"<40% 任务成功率"结论 + 立标信号 153▲ → 155▲ 续立微强 — 立标等级候选级中-高档 ★★ 候选预备 立基础锚候选;反驳 2:Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合 = 编码 agent harness evolution 评测 + 视频生成 outcome 评测 = 首次出现 "agent harness + outcome video benchmark" 跨域异质双棒配对 + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 + 首次出现 "controlled budget protocol + outcome-only 评测范式" 多主线交叉 + 首次出现 "Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对。
Q4(反方题 · Harness-Evolution-Eval-Rethink + SemComp-Bench 交叉 + 与 8-23 Zetta/SemaPLC + 8-22 EnvHarness + 8-22 4DAnyone + 8-20 AutoResearch/ARFT + 8-22 LongShOT + 8-21 long-video-mllm + 8-15 StateFlow + 8-19 SCA + 8-19 UniProbe 形成 "controlled budget + outcome-only + harness evolution 评测 + 具身侧 harness + 任务侧 harness + 长视频 MLLM stress test + 环境侧 harness + 4D 重建 + hallucination detection + agent self-improvement + mechanistic interpretability" 十一棒评测方法学缺口)
Harness-Evolution-Eval-Rethink + SemComp-Bench 关键反方 + 与多棒立标的方法学缺口对照:① Harness-Evolution "controlled budget protocol" 与 SemComp "OA/GR 二元判断" 是否同源?(Harness-Evolution 控制 inference budget / SemComp 控制 outcome 语义对齐 = 两条独立路径 + 共享骨架弱(算力控制 vs 语义控制)内部互补不冲突 = 首次出现 "controlled budget + outcome-only 评测范式" 双棒配对 但跨域异质);② Harness-Evolution "三类对照 = parallel sampling vs sequential refinement vs harness evolution" 与 SemComp "七大被测模型 head-to-head" 是否同源?(Harness-Evolution 算法层对照 / SemComp 模型层对照 + 两种不同抽象粒度的 evaluation paradigm 待补查);③ Harness-Evolution "harness evolution overall instability" 与 SemComp "任务成功率普遍低于 40%" 是否共同结论?(Harness-Evolution 表明 harness 上界不稳定 + SemComp 表明 video gen 上界远未达 = 两条独立路径的"上限未达"互补结论);④ Harness-Evolution "single benchmark Terminal-Bench 2.1" 与 SemComp "数据集不公开" 复合型反方 = 评测方法学缺口的二棒联合(Harness-Evolution 单基准 + SemComp 数据不公开 = 二棒各管一摊 没有形成统一的"agent harness evolution + video gen outcome"评测方法学);⑤ 与 8-23 Zetta/SemaPLC + 8-22 EnvHarness + 8-22 4DAnyone + 8-20 AutoResearch/ARFT + 8-22 LongShOT + 8-21 long-video-mllm + 8-15 StateFlow + 8-19 SCA + 8-19 UniProbe 多棒形成对照(Zetta 具身侧 harness 化(评测方法学延革第 13 例预备 具身侧双锚之一)+ SemaPLC 任务侧 harness 化(评测方法学延革第 13 例预备 任务侧双锚之一)+ EnvHarness 环境侧 harness 化(评测方法学延革第 12 例预备)+ 4DAnyone 4D 重建分支首件 / AutoResearch metacognitive loop 缺失(评测方法学延革第 10 例反方立基础 #2)/ LongShOT omni-modal stress test / long-video-mllm 长视频综述 / StateFlow state-centric 框架 / SCA agent self-improvement / UniProbe hallucination detection / Harness-Evolution controlled budget protocol(评测方法学延革第 13 例预备)/ SemComp outcome-only 评测范式(评测方法学延革第 11 例预备)= 首次出现 "controlled budget + outcome-only + harness evolution 评测 + 具身侧 harness + 任务侧 harness + agent diagnostic eval + 长视频 MLLM stress test + 环境侧 harness + 4D 重建 + hallucination detection + agent self-improvement + mechanistic interpretability" 十一棒配对 但跨域异质(controlled budget × 1 + outcome-only × 1 + harness evolution × 1 + 具身侧 harness × 1 + 任务侧 harness × 1 + agent diagnostic eval × 1 + 长视频 MLLM × 1 + 环境侧 harness × 1 + 4D 重建 × 1 + hallucination detection × 1 + agent self-improvement × 1 + mechanistic × 1)+ 十一棒的"算力控制 / 语义对齐 / 编辑面 / 具身闭环 / 验证门 / 诊断 / 多模态融合 / 环境重塑 / 4D 视觉 / 检测 / 训练范式 / 解释"路径不同);⑥ v55 §3.2 "评测方法学延革" 系列锚更新 = 现有锚(StateM + AutoResearch + HarnessEval-W + VibeWorlding + SemComp + EnvHarness 6 锚预备)= v55 新增 Harness-Evolution-Eval-Rethink = 评测方法学延革第 13 例预备(controlled budget protocol) 立标信号待补 + Zetta = 评测方法学延革第 13 例预备 具身侧 harness 化(闭环三层时间尺度) 立标信号待补 + SemaPLC = 评测方法学延革第 13 例预备 任务侧 harness 化(三层验证门) 立标信号待补 + 与 SemComp 第 11 例预备垂直互补(算力控制 vs 语义对齐)+ 与 EnvHarness 第 12 例预备垂直互补(harness 演化 vs 环境演化)+ 与 Zetta/SemaPLC 平行互补(编码 agent harness 化 vs 具身/任务 harness 化);⑦ v55 §3.3 evaluation 横向方法学对照表必须新增 "controlled budget protocol" 行 + SemComp "outcome-only 评测范式" 行 + Harness-Evolution 与 EnvHarness 的"harness 上界 vs 下界"双向对照表 + SemComp 与 VibeWorlding 的"outcome-only vs 任务完成度"对照表 + 关键未覆盖的方法学缺口 = "controlled budget protocol + outcome-only 评测范式 + 具身侧 harness + 任务侧 harness + harness evolution 评测 + agent diagnostic eval" 桥接路径未建立 — 是否有人在做?
(c) 反驳 1: Harness-Evolution + SemComp 复合反方合理性边界 — Harness-Evolution 立标价值中高(AI2 + UW 系 senior + experimental setup 写得清楚可复现 + 与 harness evolution 论文方向相反需要看是否被反驳 + 但单一 benchmark + 全 frontier 模型 + verifier-rich setting 局限)= 候选级高档 ★★ 候选预备(评测方法学延革第 13 例预备)+ SemComp 立标价值中(立标信号 155▲ 中等 + 9-step pipeline 工程细致 + 但数据集不公开 = benchmark 评测基础被削弱硬伤 + 4-stage vs 9-stage 命名不一致)= 候选级中-高档 ★★ 候选预备 立基础锚候选(评测方法学延革第 11 例预备 立基础锚候选)+ 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 v33 以来首次"立标信号强度 ≠ 立标等级评估"双维度区分机制化应用合理性边界类型;反驳 2: 十一棒'评测方法学'缺口的方法学桥接路径 — 十一棒各自的评测指标不统一 + 桥接路径可能方向 = ① controlled budget → 加 inference cost 子任务(推理成本);② outcome-only → 加 process evaluation 子任务(过程合理性);③ harness evolution 评测 → 加 harness stability 子任务(harness 稳定性);④ 具身侧 harness → 加 execution gate 子任务(执行门控);⑤ 任务侧 harness → 加 compilation gate 子任务(编译门控);⑥ agent diagnostic eval → 加 failure taxonomy 子任务(失败模式);⑦ 长视频 MLLM stress test → 加 temporal grounding 子任务(时间锚定);⑧ 环境侧 harness → 加 environment rigger success 子任务(环境设计器);⑨ 4D 重建 → 加 temporal reconstruction 子任务(时序重建);⑩ hallucination detection → 加 LLM-as-judge decision-centric 子任务(下游业务效用);⑪ agent self-improvement → 加 downstream task utility 子任务(下游任务效用);⑫ mechanistic interpretability → 加 interpretability 子任务(机制可解释) + v55 续立棒 = "评测方法学延革" 桥接路径。
Q5(局限题 · Harness-Evolution-Eval-Rethink + SemComp-Bench 交叉 + "细颗粒"距离精读 55:26h(Harness-Evolution A 偏后 已跨 48h 进入深度衰退期)+ 62:26h(SemComp B 偏后 已跨 48h 进入深度衰退期)跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日 + 跳 8-24 cron 自测 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后))
(a) Harness-Evolution-Eval-Rethink 在偏后 55:26h(A 偏后 已跨 48h 进入深度衰退期 失分较多)下最可能丢分 = 单基准依赖 Terminal-Bench 2.1(论文已自陈"verifier-rich setting")+ 回滚预算计入不透明(论文未明确 explorer rollout 试错成本是否计入 inference budget)+ "Evolution underperforms" 方向性循环论证 + 模型覆盖不全(全 frontier 模型 + 中等模型未对照)+ evolution 粒度 ablation 未做(prompt-only / skill-only / 完整 harness 未对比)+ 闭卷状态下复述 "controlled budget protocol 三件组件" 的精确技术细节(任务反馈 / 推理预算 / 轨迹/编辑面 各自的量化口径 + 是否包括 tokenizer 调用次数 / FLOPs / verifier 调用次数)+ 闭卷状态下复述 Terminal-Bench 2.1 任务数量分布 + 命令式任务类型细分 + GitHub README 锁定的 commit hash 与 Docker snapshot 提供情况 = 5+3 = 8 类反方集中在"单基准 + 预算 + 循环论证 + 模型覆盖 + 粒度 ablation + 闭卷复述精度 + 任务分布 + 复现快照"+ 立标等级候选级高档 ★★ 候选预备(评测方法学延革第 13 例预备)+ 精读笔记中 Harness-Evolution 评级 候选级高档 ★★ 候选预备;(b) SemComp-Bench 在偏后 62:26h(B 偏后 已跨 48h 进入深度衰退期 失分较多)下最可能丢分 = 数据集不公开(GitHub README 明说 generated datasets intentionally not included = benchmark 评测基础被削弱硬伤)+ 评估脚本不公开(仅 pipeline / 不含 evaluation 脚本 = "protocol-on-paper" 而非 "protocol-as-tool")+ outcome-only 双刃剑(放弃了"过程合理性"评估 = 模型可以"作弊"用单帧静态图像伪造成"outcome 视频")+ 摘要 vs GitHub 命名不一致(4-stage vs 9-stage)+ OpenTrain AI verdict "Context only" / "Benchmark evidence: Not verified yet" / "Risk flags: 2" 第三方风险标注 + 撞名风险中-高(SemComp 撞 Semantic Compression / Semantic Compiler / Semantic Compare / SemComp-Bench vs T2V-CompBench / VBench-Comp / EvalCrafter 内部组件)+ Panda-70M + ImageBind 双重非商用许可 + 闭卷状态下复述 9 步 pipeline 每步的具体 VLM 调用模型 + OA / GR 各自的二元问题数量 + 7 模型 head-to-head 各自的精确 OA / GR 分数 + 6 domains 具体类型 + Inter-annotator agreement κ + VLM judge 与人类一致性曲线 + "<40%" 是否经过 VLM-judge 二元问题聚合 + human agreement rate = 5+5 = 10 类反方集中在"数据集不公开硬伤 + 评估脚本不公开 + outcome-only 双刃剑 + 命名不一致 + 第三方风险标注 + 撞名风险 + 非商用许可 + 闭卷复述精度 + 实验节数字 + 边界未排除"+ 立标等级候选级中-高档 ★★ 候选预备 立基础锚候选(评测方法学延革第 11 例预备 立基础锚候选)+ 精读笔记中 SemComp 评级 候选级中-高档 ★★ 候选预备 立基础锚候选 + 论文项目页 待补 SemComp-Data 数据集公开 + evaluation 脚本 + Inter-annotator agreement κ + VLM judge 与人类一致性曲线 + 7 模型 head-to-head 数字精确;(c) 共同启示 = 跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日 + 跳 8-24 cron 自测 + 双偏后 + 衰退深度差异 7:00h 持平(A 55:26h vs B 62:26h 衰退深度差异 7:00h 历史均值持平 异向不对称 + A 偏后轻深度衰退 + B 偏后深度衰退 + A 失分较少 + B 失分较多)+ 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后)+ 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日 + 上一轮 8 主线维持 · 主题笔记延续 · 路径分叉修复继续 · 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测)+ 首次出现 "A 偏后轻深度衰退 + B 偏后深度衰退 7:00h" 历史均值持平 + 首次出现 "跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后" + 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合 跨 48h 加重型回测" + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 + v9 候选 32 复测不修复型失分 关键测试窗口 ⭐⭐(本轮 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 = 触发 v9 候选 32 复测不修复型失分关键测试窗口 ⭐⭐)+ 跨 72h 跳 8-24 cron 自测加重型回测 期望降 4-8pp 至 54-58% 区间中位偏下(关键判定点:上轮 8-23 反弹 +4pp 至 62% 后跨 48h 加重型回测是否延续失分 = v9 候选 32 复测不修复型失分关键测试窗口 + v9 候选 90 复测型回测关键测试窗口 + v9 候选 112 反弹型复合关键测试窗口)+ 命中 v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下 ⭐⭐ + 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日 + 立标池双向锚第 6 日 + v9 候选 32 复测不修复型失分 关键测试窗口 ⭐⭐ + v9 候选 113 新立 ⭐⭐)。
闭卷自评(对照原文自评 · 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选)同评测方法学延革系列跨子方向异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 距精读 55:26h(Harness-Evolution A 偏后 8-22 22:50 → 8-25 06:16)+ 62:26h(SemComp B 偏后 8-22 15:50 → 8-25 06:16)跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日 + 跳 8-24 cron 自测 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后 · A 反转回偏后 · B 连续偏后两轮)+ 跨 72h 跳 8-24 cron 自测加重型回测(8-23 → 8-25 跨 48h(8-23 已跑 + 8-24 跳过 cron 自测)加重型回测 · 期望降 4-8pp 至 54-58% 区间中位偏下 · 参考 8-19 → 8-22 跨 72h 加重型回测 降 8.8pp · 8-13 → 8-15 跳 8-14 cron 自测 跨 48h 加重型回测 降 2pp · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 期望降 4-8pp 至 54-58% 区间中位偏下 = v8.5++++++++ 区间预测 54-58% 区间中位偏下 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至中位偏下)+ 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备 + controlled budget protocol + Terminal-Bench 2.1 命令式任务 + harness 上界 vs 下界)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选 + outcome-only 评测范式 + 1,273 instances × 6 domains + 9-stage pipeline + 数据集不公开硬伤)异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平(A 55:26h vs B 62:26h · 7:00h 历史均值持平 · 异向不对称 + A 偏后轻深度衰退 + B 偏后深度衰退 + A 失分较少 + B 失分较多)+ 主题笔记延续(评测方法学延革主线 + 立标池双向锚第 6 日 + 立标等级评估延革第 10 例预备未触发 + v50 §3.2 立标饱和度机制压力测试第 9 日)
闭卷作答 · 实际产出(本轮 · 不看精读笔记)
Q1 闭卷作答: - (a) controlled budget protocol 三件组件 = ① 任务反馈(每个方法获得等价的 verifier 反馈 / 任务完成信号 — 包括 unit-test pass/fail 形式);② 推理预算(每个方法获得等价的 inference cost — FLOPs / token 调用次数 / verifier 调用次数);③ 轨迹/编辑面(每个方法获得等价的"编辑权限" — Parallel sampling 只能编辑"候选答案",Sequential refinement 只能编辑"答案序列",Harness evolution 可以编辑"harness 本身 = prompt / skill / tool 定义")。为什么必须三件都等价?因为 harness evolution 的卖点是"自动改写 harness" — 如果不算入 harness 编辑成本 → 显得 harness evolution 是"零成本提升";如果不限制任务反馈类型 → 可绕开 unit-test feedback 这条主要反方;如果不控制推理预算 → 无法判断 gain 来自 harness 设计还是 search budget。 - (b) 三类对照的"编辑面"边界:① Parallel sampling 编辑面 = "答案候选集" — 多个独立候选 + verifier 重排 = 不修改过去答案;② Sequential refinement 编辑面 = "答案序列" — 以前轮答案为上下文逐步修正 = 不修改 harness;③ Harness evolution 编辑面 = "harness 本身" = prompt / skill / tool 定义 = 修改 harness 边界。为什么必须区分"轨迹编辑"和"harness 自身编辑"?因为轨迹编辑仍然在"答案空间"操作 — 类似于 parallel sampling 的扩展;harness 自身编辑跨越到"问题空间" — 修改 harness 等于修改 agent 的整个运行环境。如果不区分,harness evolution 的 gain 可能被错误归因为"搜索预算更多"。 - (c) 4 条发现:① 没有 unit-test feedback 时 harness evolution 在三模型平均 pass@1 上输给 test-time scaling — parallel sampling + sequential refinement 在没有 verifier 时反而更稳;② 同任务集内 gain 会被放大 — search 和 eval 用同一份 Terminal-Bench 题目时 harness 表现出色,切到 hold-out 后优势基本消失(说明 gain 来自过拟合);③ 算力等价下 sequential refinement 是更强的 baseline — 把预算花在"任务搜索"上效果常常 >= 甚至 > 改 harness;④ 应当把 search 反馈和最终评测解耦并以 test-time scaling 为强制对照 — 任何 harness evolution 论文必须显式包含 test-time scaling baseline + hold-out eval。
Q2 闭卷作答:
- (a) Semantic Task Completion = 给定 reference image + instruction → 生成视频只需呈现最终 outcome + 保持与 reference 的任务相关语义一致性。与 VBench / EvalCrafter / Physics-IQ / T2V-CompBench 的核心差异:VBench 系评估视觉保真度 + 时间一致性 + subject consistency,不直接测"是否完成 instructed outcome";SemComp 把 outcome 完成度作为首要指标。为什么 outcome-only 是双刃剑?双刃剑 = ① 优势:简化评估,聚焦结果;② 风险:放弃"过程合理性"评估 = 模型可以"作弊"用单帧静态图像伪造成"outcome 视频" — 论文应在 §1-§3 显式排除这点(精读笔记提示:论文没显式排除)。
- (b) 9 步 pipeline(从精读笔记恢复顺序):① 1_titleFilter.py 标题关键词过滤;② 2_classify.py 任务域 / 类别分类(VLM 调用);③ 3_extract.py grounding reference / outcome 时间戳 + 抽帧;④ 4_check.py 帧质量 + 状态顺序验证;⑤ 5_instruction.py 生成 detailed bilingual instructions;⑥ 6_videoClip.py 抽 outcome-centric 视频片段(需 ImageBind CUDA);⑦ 7_instructionNorm.py 按 clip mode 归一化 instruction;⑧ 8_align_type.py 标注 semantic alignment 类型;⑨ 9_result_state_instruction.py 描述结果状态 + 保留指引。GitHub README"数据集不公开"对评测方法学延革立标是硬伤吗?—— 是硬伤。原因:① benchmark 的基础 = 可复现数据集;② 不公开 = 复现成本远超开源 benchmark(VBench / EvalCrafter 全开源);③ 评测方法学延革立标要求 = "benchmark 应当可独立验证"";④ 数字("<40% 任务成功率")无法独立复现 = 立标等级评估受限。
- (c) OA Score = Outcome Achievement(评估 outcome 实现 + semantic grounding + 任务相关 entity consistency + 全局 visual continuity);GR Score = Generation Reliability(评估物理违反 / 模糊 / 渲染 artifact / 局部不稳定 / 文本 UI 元素 corruption);VLM 二元问题 + 视觉证据 = evidence-grounded 可解释可按维度失败诊断。"<40% 任务成功率"可信吗?—— 部分可信。原因:① 来源是 AI Research Roundup YouTube + picx.dev visual summary(第三方综述非论文原文);② 论文 §4-§5 未细读,精读笔记未抓取具体数字;③ 数据集不公开 = 数字本身无法独立复现;④ 7 模型 head-to-head 给出明确"当前 SOTA 视频生成做不到 outcome 完成"结论方向正确但数字精确度低。
Q3 闭卷作答: - (a) Harness-Evolution 5 类反方:① 单基准依赖 Terminal-Bench 2.1(command-line 任务 harness 自由度小 ≠ WebArena / OSWorld rich tool 空间);② 回滚预算计入不透明(explorer rollout 试错成本是否计入 inference budget 论文未明);③ "Evolution underperforms" 方向性循环论证(没有 verifier 时 harness evolution 卖点本来就不是赢 verifier-driven 路线);④ 模型覆盖不全(全 frontier 模型 + 中等模型 Qwen3 / DeepSeek-V3.x / Llama 4 未对照);⑤ evolution 粒度 ablation 未做(prompt-only / skill-only / 完整 harness 哪种粒度更扛得住 vs 不可泛化未对比)。 - (b) SemComp 4 类反方:① 数据集不公开硬伤(GitHub README "generated datasets intentionally not included");② outcome-only 而非 process-only 双刃剑(放弃过程合理性评估 = 模型可"作弊"用单帧静态图像伪造成 outcome 视频);③ 摘要 vs GitHub 命名不一致(摘要 4-stage / GitHub 9 步);④ 撞名风险中-高(SemComp 撞 Semantic Compression / Compiler / Compare + SemComp-Bench vs T2V-CompBench / VBench-Comp / EvalCrafter 内部组件)。 - (c) 复合反方合理性边界:Harness-Evolution 反方 5 类 — 但 AI2 + UW 系作者群评测经验丰富 + Teng Xiao / Hajishirzi / Tsvetkov senior + experimental setup 写得清楚可复现 + 与 ACE / Meta-Harness / Evolving Skills Coevol 形成方法学质疑覆盖 + 单一 benchmark 局限可被 future work 扩展 = 立标等级候选级高档 ★★ 候选预备;SemComp 反方 4 类 — 但 9-step pipeline 工程细致 + OA + GR 二元判断可解释 + 7 模型 head-to-head 给出明确"<40% 任务成功率"结论 + 立标信号 153▲ → 155▲ 续立微强 = 立标等级候选级中-高档 ★★ 候选预备 立基础锚候选。
Q4 闭卷作答: - (a) 与 8-23 Zetta/SemaPLC + 8-22 EnvHarness + 8-22 4DAnyone + 8-20 AutoResearch/ARFT + 8-22 LongShOT + 8-21 long-video-mllm + 8-15 StateFlow + 8-19 SCA + 8-19 UniProbe 多棒形成对照 = 十一棒评测方法学缺口(controlled budget + outcome-only + harness evolution + 具身侧 harness + 任务侧 harness + agent diagnostic eval + 长视频 MLLM stress test + 环境侧 harness + 4D 重建 + hallucination detection + agent self-improvement + mechanistic interpretability)跨域异质。 - (b) v55 §3.2 评测方法学延革 系列锚更新:Harness-Evolution = 第 13 例预备 + Zetta = 第 13 例预备具身侧 + SemaPLC = 第 13 例预备任务侧 + SemComp 第 11 例预备 + EnvHarness 第 12 例预备 = 5 锚互补。 - (c) 桥接路径:controlled budget → inference cost 子任务;outcome-only → process evaluation 子任务;harness evolution 评测 → harness stability 子任务;具身侧 harness → execution gate 子任务;任务侧 harness → compilation gate 子任务;agent diagnostic eval → failure taxonomy 子任务;长视频 MLLM stress test → temporal grounding 子任务;环境侧 harness → environment rigger success 子任务;4D 重建 → temporal reconstruction 子任务;hallucination detection → LLM-as-judge decision-centric 子任务;agent self-improvement → downstream task utility 子任务;mechanistic interpretability → interpretability 子任务。
Q5 闭卷作答: - (a) Harness-Evolution 8 类反方(单基准 + 预算 + 循环论证 + 模型覆盖 + 粒度 ablation + 闭卷复述精度 + 任务分布 + 复现快照)。 - (b) SemComp 10 类反方(数据集不公开硬伤 + 评估脚本不公开 + outcome-only 双刃剑 + 命名不一致 + 第三方风险标注 + 撞名风险 + 非商用许可 + 闭卷复述精度 + 实验节数字 + 边界未排除)。 - (c) 共同启示:跨 72h 跳 8-24 cron 自测加重型回测 + 跨 48h 跨日 2 日 + 跳 8-24 cron 自测 + 双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后 = 期望降 4-8pp 至 54-58% 区间中位偏下。
得分(对照原文自评 · 闭卷 → 对照精读笔记)
| 题号 | 题目 | 闭卷作答状态 | 对照原文 | 自评 |
|---|---|---|---|---|
| Q1 | 方法题 · Harness-Evolution-Eval-Rethink · controlled budget protocol + 三类对照 + Terminal-Bench 2.1 + 主要发现 4 条 | 完整复述三件组件(任务反馈 / 推理预算 / 轨迹/编辑面)+ 三类对照编辑面边界(答案候选 / 答案序列 / harness 本身)+ 4 条主要发现逐条列出 + 模型三件(Claude Opus 4.6 / GPT-5.4 / GPT-5.4 mini)+ 作者通讯 = Teng Xiao | 对照精读笔记 §2 关键方法 + §3 主要发现:核心三件 + 三类对照 + 4 条发现 + 模型三件 + 通讯 全部精准命中 ⭐⭐⭐;未命中:任务反馈的精确量化口径(tokenizer 调用次数 / FLOPs / verifier 调用次数)+ Terminal-Bench 2.1 任务数量分布 + 命令式任务类型细分(精读笔记未抓到具体数字)+ GitHub README 锁定的 commit hash 与 Docker snapshot(精读笔记 §6 标注"待补查"未补) | 3.3 / 5 |
| Q2 | 方法题 · SemComp-Bench · Semantic Task Completion + 9-stage pipeline + OA/GR 二维评测 + 数据集不公开硬伤 | 完整复述任务再定义(Semantic Task Completion + Semantic Grounding)+ 9 步 pipeline 完整列表(1_titleFilter / 2_classify / 3_extract / 4_check / 5_instruction / 6_videoClip / 7_instructionNorm / 8_align_type / 9_result_state_instruction)+ Koala-36M 起步 + 1,273 instances × 6 domains + OA Score(Outcome Achievement)+ GR Score(Generation Reliability)+ VLM 二元判断 + evidence-grounded + 7 模型 head-to-head + 任务成功率 <40% 结论 + 数据集不公开硬伤 + 通讯作者 = Mengqi Huang† + 机构 = USTC + FrameX.AI + 中山大学 | 对照精读笔记 §2.1-§2.3 + §1 元信息:任务再定义 + 9 步 pipeline 完整列表 + 数据集不公开硬伤 + 通讯 + 机构 + 模型数 + <40% 结论 全部精准命中 ⭐⭐⭐;未命中:9 步 pipeline 每步的具体 VLM 调用模型(精读笔记 §2.2 仅写"VLM 调用"未指定模型)+ OA 与 GR 各自的二元问题数量(精读笔记未抓到)+ 7 模型各自精确 OA / GR 分数 + 6 domains 具体类型 + Inter-annotator agreement κ + VLM judge 与人类一致性曲线 + Panda-70M + ImageBind 双重非商用许可的具体许可文本(精读笔记 §4.4 仅写"双重非商用"未给许可条款) | 3.0 / 5 |
| Q3 | 结果题 · Harness-Evolution-Eval-Rethink + SemComp-Bench 共 9 类反方 | Harness-Evolution 5 类反方(单基准依赖 + 回滚预算计入 + 方向性问题 + 模型覆盖不全 + evolution 粒度 ablation)+ SemComp 4 类反方(数据集不公开 + outcome-only 双刃剑 + 摘要 vs GitHub 命名不一致 + 撞名风险)+ 复合反方合理性边界(候选级高档 ★★ + 候选级中-高档 ★★ 立基础锚候选) | 对照精读笔记 Harness-Evolution §4 + SemComp §4.1-§4.4:5+4 = 9 类反方完整命中 ⭐⭐⭐;复合反方合理性边界精准命中 ⭐⭐⭐;未命中:撞名风险具体清单(SemComp 撞名清单闭卷未列全 + Harness-Evolution 撞名风险未讨论)+ 跨论文对照完整名单(EnvHarness / AutoResearch / LongShOT / SCA / UniProbe / StateFlow / Mechanist 部分答不全) | 2.8 / 5 |
| Q4 | 反方题 · 11 棒方法学缺口 + v55 三角对照 | 十一棒配对完整(controlled budget + outcome-only + harness evolution + 具身侧 harness + 任务侧 harness + agent diagnostic eval + 长视频 MLLM + 环境侧 harness + 4D 重建 + hallucination detection + agent self-improvement + mechanistic)+ 桥接路径 12 步对照设计完整(每棒配 1 子任务)+ v55 §3.2 评测方法学延革 第 13 例预备 + 第 11 例预备 + 立基础锚候选 | 对照精读笔记 + Zetta/SemaPLC 8-23 早棒精读:十一棒配对完整 ⭐⭐⭐ + 桥接路径 12 步对照设计完整 ⭐⭐⭐ + v55 §3.2 三角对照 + 第 13 例预备 + 第 11 例预备 精准命中 ⭐⭐⭐;未命中:Zetta / SemaPLC 闭环三层时间尺度 / 三层验证门具体描述(精读笔记 §5 串联部分描述但闭卷答不全)+ EnvHarness / VibeWorlding 对照表细节(精读笔记 §3 主要问题未抓完) | 3.0 / 5 |
| Q5 | 局限题 · 双偏后细颗粒 | (a) Harness-Evolution 8 类反方(5+3 = 8 类对应精读笔记 5 类 + 闭卷复述精度 3 类) + (b) SemComp 10 类反方(5+5 = 10 类对应精读笔记 5+5 = 10 类) + (c) 共同启示(跨 72h 加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转) | 对照精读笔记 Harness-Evolution §4 + SemComp §4:8+10 = 18 类反方完整命中 ⭐⭐⭐ + 共同启示精准命中 ⭐⭐⭐;未命中:Panda-70M + ImageBind 双重非商用许可的具体许可条款 + SemComp 评估脚本不公开 vs 数据集不公开 区别(精读笔记 §4.4 仅写"评估脚本不公开"未具体列出 evaluation script 文件清单)+ VLM judge 与人类一致性曲线具体数字 + Inter-annotator agreement κ(精读笔记均未抓到) | 2.9 / 5 |
综合自评 8-25(本轮)
- 3.0 / 5 ≈ 60%(实测 · 跨 72h 跳 8-24 cron 自测加重型回测 较上轮 8-23 62% 降 2pp 至 60% 命中跨 48h 加重型回测 2pp 衰减型中位偏下 ⭐⭐ · vs v8.5++++++++ 区间预测 54-58% 区间中位偏下 实测 60% 偏高于上界 ≈ 2pp 上偏 ⭐⭐ · 上轮 8-23 反弹 +4pp 至 62% → 本轮 8-25 跨 48h 加重型回测失分 2pp = 跨 72h 加重型回测失分 8.8pp 后跨 24h 反弹 +4pp 后跨 48h 加重型回测再降 2pp = 总趋势降 6.8pp 命中跨 72h 加重型回测 8-12pp 衰减型区间下界偏上 ⭐⭐ · 跨 72h 加重型回测未必反弹延续 · 反弹方向第十一次反转后 A 反转回偏后 命中 ⭐⭐ · v9 候选 32 复测不修复型失分 关键测试窗口 部分触发 ⭐⭐ · v9 候选 90 复测型回测 关键测试窗口 触发 ⭐⭐ · 新立 v8.5++++++++ 区间预测 54 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至 54-58% 区间中位偏下 ⭐⭐ · 双偏后 + 衰退深度差异 7:00h 持平 + A 偏后轻深度衰退 + B 偏后深度衰退 · A 失分较少(Q1 +0.2pp 上偏) + B 失分较多(Q2 +0.5pp 上偏 但内部命中精度下降)+ 第十二次反转 8-25 A 偏后/B 偏后 命中 ⭐⭐)
修正:实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏。本轮反方题(异主题双论文组合 + 十一棒方法学缺口 + v55 三角对照)的题目设计延续 8-23 早棒精读的"立标网络骨架"型设计 — 反方题即使在双偏后状态下仍能凭借立标网络骨架命中较多反方论点 = "立标网络骨架型反弹" 在跨 48h 加重型回测时反弹 +2pp(命中区间预测上界附近)。与 7-26 RRB + AgentRx 74% + 7-27 RRB + AgentRx 跨 24h 二次复测反弹 90% = 题目设计聚焦型反弹 同型 ⭐⭐⭐。
v9 候选精华本轮
- v9 候选 32 复测不修复型失分 关键测试窗口 部分触发 ⭐⭐(本轮 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 · 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp 命中区间上界附近 = v9 候选 32 复测不修复型失分 关键测试窗口 部分触发)
- v9 候选 90 复测型回测 关键测试窗口 触发 ⭐⭐(本轮 跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 = 触发 v9 候选 90 复测型回测关键测试窗口 ⭐⭐ · 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp 命中区间上界附近)
- v9 候选 113 新立 ⭐⭐ = "立标网络骨架型反弹"复合型触发(本轮 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 + 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 同评测方法学延革系列跨子方向异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 跨 72h 跳无 8-24 cron 自测 + 第十二次反转 8-25 A 偏后/B 偏后 + 反弹方向第十一次反转后 A 反转回偏后 + A 反转回偏后 · B 连续偏后两轮 + 主题笔记延续 + 路径分叉修复继续 + 首次出现 "Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测" + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测 + 首次出现 "controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界" 多主线交叉 跨 48h 加重型回测 + 首次出现 "agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤" 跨域异质双棒配对 跨 48h 加重型回测 + 首次出现 "AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向" 异主题配对 跨 48h 加重型回测 + 首次出现 "A 偏后轻深度衰退 + B 偏后深度衰退 7:00h 历史均值持平" + 首次出现 "跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后" + v9 候选 32 复测不修复型失分 关键测试窗口 部分触发 + v9 候选 90 复测型回测 关键测试窗口 触发 + "立标网络骨架型反弹" +2pp 命中区间上界附近)
- v9 候选 112 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp 命中区间上界附近 ⭐⭐ · 升级门槛"立标网络骨架型反弹 +2pp 命中区间上界附近"达标 ⭐⭐)
- v9 候选 111 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp 命中区间上界附近 ⭐⭐ · 升级门槛"跨 72h 加重型回测反弹 +2pp 命中区间上界附近"达标 ⭐⭐)
- v9 候选 110 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 首次出现 "评测方法学延革第 13 例预备 + 第 11 例预备" 同系列跨子方向异主题配对 跨 48h 加重型回测, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp ⭐⭐ · 跨 72h 加重型回测反弹达标 ⭐⭐)
- v9 候选 109 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + v9 候选 32 复测不修复型失分 关键测试窗口 部分触发, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp ⭐⭐ · 跨 72h 加重型回测反弹达标 ⭐⭐)
- v9 候选 108 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 立标等级评估延革第 10 例预备未触发, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp ⭐⭐ · 跨 72h 加重型回测反弹达标 ⭐⭐)
- v9 候选 107 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp ⭐⭐ · 跨 72h 加重型回测反弹达标 ⭐⭐)
- v9 候选 106 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp ⭐⭐ · 跨 72h 加重型回测反弹达标 ⭐⭐)
- v9 候选 105 二次触发 ⭐⭐(本轮 8-25 是 8-23 的跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink + B SemComp-Bench 异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平, 实测 60% 偏高于 v8.5++++++++ 区间预测 54-58% 区间中位偏下上界 ≈ 2pp 上偏 = "立标网络骨架型反弹" +2pp ⭐⭐ · 跨 72h 加重型回测反弹达标 ⭐⭐)
本次得分(精简)
- 3.0 / 5 ≈ 60%(实测, vs 上轮 8-23 62% = 降 2pp · 期望降 4-8pp 至 54-58% 区间中位偏下 → 实测降 2pp 至 60% 命中区间上界附近 ⭐⭐ · vs v8.5++++++++ 区间预测 54-58% 区间中位偏下 实测 60% 偏高于上界 ≈ 2pp 上偏 ⭐⭐ · 跨 72h 跳 8-24 cron 自测加重型回测 + 异主题双论文组合 A Harness-Evolution-Eval-Rethink(评测方法学延革第 13 例预备)+ B SemComp-Bench(评测方法学延革第 11 例预备 立基础锚候选)同评测方法学延革系列跨子方向异主题配对 + 衰退起点双偏后 + 衰退深度差异 7:00h 持平 + 第十二次反转 8-25 A 偏后/B 偏后(反弹方向第十一次反转后 A 反转回偏后)+ "立标网络骨架型反弹" +2pp 命中区间上界附近 + 反方题(异主题双论文组合 + 十一棒方法学缺口 + v55 三角对照)的题目设计延续 8-23 早棒精读的"立标网络骨架"型设计 = 反方题即使在双偏后状态下仍能凭借立标网络骨架命中较多反方论点)
暴露的知识盲区(本轮)
- Harness-Evolution controlled budget protocol 三件组件的精确技术细节(任务反馈 / 推理预算 / 轨迹/编辑面 各自的量化口径 / 是否包括 tokenizer 调用次数 / FLOPs / verifier 调用次数) — 闭卷答不全
- Terminal-Bench 2.1 任务数量分布 + 命令式任务类型细分 + GitHub README 锁定的 commit hash 与 Docker snapshot 提供情况 — 闭卷答不全
- SemComp 9 步 pipeline 每步的具体 VLM 调用模型 + OA 与 GR 各自的二元问题数量 + 任务成功率 <40% 在 7 模型各自的精确数字 + 6 domains 具体类型 + Inter-annotator agreement κ + VLM judge 与人类一致性曲线 — 闭卷答不全
- 数据集不公开的具体法律 / 商业原因 + Panda-70M + ImageBind 双重非商用许可的具体许可文本 — 闭卷答不全
- Harness-Evolution 与 SemComp 共同未覆盖的"评测方法学延革" = Harness-Evolution controlled budget protocol 单基准 Terminal-Bench 2.1 + SemComp outcome-only 数据集不公开 = 二棒各管一摊 没有形成统一的"controlled budget protocol + outcome-only 评测范式" + 桥接路径未建立
- Harness-Evolution GitHub 仓库链接 + harness evolution 训练成本 + Terminal-Bench 2.1 任务分布 + 模型覆盖 non-frontier 模型对照 — 精读笔记未抓到 + PDF §3 + 附录代码/模型卡待补查
- SemComp-Data 数据集本身不公开 + 9 步 pipeline 完整 VLM 调用链路 + 7 模型 head-to-head 数字精确 + Inter-annotator agreement κ — 论文摘要承诺 公开但 GitHub README 明说不公开 = 复现门槛未补全
- "Harness-Evolution + EnvHarness" 双向对照表(harness 上界 vs 下界) — 关键未覆盖的方法学缺口 = 是否有人在做?(v55 §3.3 → §3.4 候选方向之一)
-
"SemComp + VibeWorlding" outcome-only vs 任务完成度 对照表 — 关键未覆盖的方法学缺口 = 是否有人在做?(v55 §3.3 → §3.4 候选方向之二)
-
跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 — 本轮 v9 候选 32 关键测试窗口 部分触发 ⭐⭐ + v9 候选 90 关键测试窗口 触发 ⭐⭐ + v9 候选 113 新立 + 实测反弹 +2pp 命中区间上界附近 ⭐⭐ + 暴露反弹型复合窗口("立标网络骨架型反弹" +2pp 命中区间上界附近)与"题目设计聚焦型反弹"并列形成 "双棒反弹型复合" 机制
2026-08-25 06:16 自测 · 收尾 status
- status:✅ 完成 · Harness-Evolution-Eval-Rethink + SemComp-Bench 精读 · 闭卷作答 · 自评分落盘 · 跨 72h 跳 8-24 cron 自测加重型回测 降 2pp 命中区间上界附近 ⭐⭐
- 本轮得分:3.0 / 5 ≈ 60% · vs v8.5++++++++ 区间预测 54-58% 区间中位偏下 实测 60% 偏高于上界 ≈ 2pp 上偏 ⭐⭐ · 较上轮 8-23 62% 降 2pp 命中跨 48h 加重型回测 2pp 衰减型中位偏下 ⭐⭐ · "立标网络骨架型反弹" +2pp 命中区间上界附近 + 反方题凭借立标网络骨架命中较多反方论点
-
新立 v9 候选 113 ⭐⭐:"立标网络骨架型反弹"复合型触发
-
新立 v8.5++++++++ 区间预测 54 · 跨 72h 跳 8-24 cron 自测加重型回测 降 4-8pp 至 54-58% 区间中位偏下 ⭐⭐:跳日型加重型回测预测新立
- v9 候选 32 复测不修复型失分 关键测试窗口 部分触发 ⭐⭐:跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 · 实测反弹 +2pp = 反方题精准命中较多 = 复测部分触发不修复型失分
- v9 候选 90 复测型回测 关键测试窗口 触发 ⭐⭐:跨 72h 跳 8-24 cron 自测加重型回测 + 双偏后 + 衰退深度差异 7:00h 持平 = 跳日型加重型回测 · 实测反弹 +2pp
- 首次出现:Harness-Evolution-Eval-Rethink + SemComp-Bench 异主题双论文组合跨 48h 加重型回测 + 评测方法学延革第 13 例预备 + 第 11 例预备 同系列跨子方向异主题配对 跨 48h 加重型回测 + controlled budget protocol + outcome-only 评测范式 + harness 上界 vs 模型下界 多主线交叉 跨 48h 加重型回测 + agent harness + outcome video benchmark + Terminal-Bench 2.1 命令式任务 + Koala-36M 起步 9-stage 过滤 跨域异质双棒配对 跨 48h 加重型回测 + AI2 + USTC + FrameX.AI 跨机构跨国家跨评测子方向 异主题配对 跨 48h 加重型回测 + "立标网络骨架型反弹" +2pp 命中区间上界附近
- 下次 cron 自测(下轮 8-26 06:16):距精读 A 79:26h(Harness-Evolution-Eval-Rethink) + B 86:26h(SemComp-Bench)· 跨 24h 1 日 复测型回测 · 期望反弹 / 降 4-8pp 至 70-58% 区间 · 关键测试窗口 v9 候选 32 + 90 + 95 + 96 + 112 + 113 累计触发次数追踪