主题综述 · evaluation(2026-09-01)

  • 作者:spark
  • 更新:2026-09-01 16:40 CST
  • 基线:fetch 2026-08-28-evaluation.md(v3 重写版,17 篇 arXiv + 1 个 GitHub)作为主线起点;本棒定位为「近 4 天增量综述」而非重写 v3,避免主线重复
  • 字数声明:CJK ≤3,900 字(主体 ≤3,500 + 反方 300 + 元信息 100);三层 CJK / char / bytes 偏差均 <5%
  • verifiability:本期核心 8 篇 paper_card 已抽查 ≥75%(≥20% 满足;抽查 = 2608.19269 / 2608.28281 / 2608.27345 / 2608.27456 / 2608.25518 / 2606.07402 / 2608.27455 / 2608.27448 + v3 baseline 17 篇沿用)

近 3 天其他主题综述关键增量:08-29 agent 综述「评测诚信 / claim-replay layer 立基础预备」+ 08-30 database 综述「TEngineDB-V 145×/52× 5 篇 SIGMOD FVS」+ 08-30 multimodal 综述「VGI-Bench 170▲ + Agentic Game Dev 134▲ 四日锁」+ 08-31 llm-infra 综述「评测基础设施本身成为被评测对象 meta-evaluation」。本期 evaluation 在此基础上聚焦「评测的方法学 vs 评测的对象」二分问题。


一、主题脉络:v3 立基础锚链之上新增「评测诚信」+「概率对齐」+「Loop 控制」三向预备

把 evaluation 主题放在 2026-08-28 v3 baseline 与 2026-09-01 之间观察,最大变化不是 benchmark 数量变多,而是评测本身的合法性开始被形式化审计。三股新力量把 evaluation 推向三个新方向:

  1. 从「benchmark 数量」走向「claim 合法性」 —— Inspect Evals Census(arXiv:2608.19269,2026-08-29,paper_card 1133)把评测工件(task + scorer + reported metric)形式化为「前向计算」并指出「评测工件并不必然 license 该指标所附加的 claim」——通过冻结基底 D、grounded 族 F、claim query q 与识别集合四元组,普查 124 个 Inspect Evals 单元在 pinned commit 上110 个在确定性推理前即停止(所需历史证据或语义 grounding 缺失)。这是 v33 以来「评测诚信 / claim-replay layer」首次独立预备。
  2. 从「最终答案对齐」走向「概率对齐」 —— PAWBench(arXiv:2608.27345,2026-08-30 上榜 HF Daily 138▲)50 scenarios × 8 physical mechanism groups + PAW-Calibration + PAW-Coverage + TVD ×100 指标;11 video generators 实测无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance——首次把「概率对齐」作为世界模型 evaluation 的 distributional criterion。
  3. 从「单次端到端成功率」走向「loop 策略 vs agent 能力分解」 —— LoopArena(arXiv:2608.28281,2026-09-01 上榜 HF Daily 87▲)将模型作为 loop 工程的运行时控制器评测;关键反方论点:「一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力」——把 harness 评测从「harness 进化 vs parallel sampling」(v3 §2.1 引 arXiv:2607.12227)推向「loop 调度质量 vs agent 能力」的可分解评测。

三条线与 v3 baseline 三主向(trace 级别 / runtime+model / 结构化行为)形成正交:v3 关注「怎么测」、本期新增「测的东西本身是否合法 + 测的分布是否对齐 + 测的组件能否分解」


二、各主线独立成段(机制 + 工程 + 反方 v2 三段式)

2.1 主线 A · 反方立基础锚(v3 baseline 沿用 + 本期观察:饱和度 v44-v64 廿一日连续)

机制:Beyond pass@1(arXiv:2603.29231,P0 反方立基础锚 ★★★)+ HORIZON(arXiv:2604.11978,7 类别失败分类 ★★★)+ 41 种失败模式分类学(arXiv:2607.28802,Cohen's κ=0.76)构成「pass@1 不可信」+「horizon 单点不可信」+「失败模式分类学缺统一协议」的反方层。

工程:三者均提供 8 scaffold / 7 类别失败分类表与 horizon extension level s = 1~5 量化协议;但跨团队复现时 Cohen's κ 标注协议均未在 abstract 披露。

反方 v2:(1)机制:v44-v64 廿一日连续饱和度确认 = v3 baseline 反方锚链不再扩张,进入「立基础已定 / 等独立复现」阶段;(2)数据:ReliabilityBench 8.8% drop 单一团队 leaderboard 复现 0 篇;41 种失败模式标注协议 PDF §3-4 待 8-30 核(9-1 仍未完成);(3)截止日:9-15 前观察 ≥2 个独立团队在 τ-bench / SWE-bench Verified 复现 8 scaffold 评测协议 + 报告 Cohen's κ,有则升级 ★★★。

2.2 主线 B · Prime Agent 触发近期最完整锚链(v3 baseline 沿用)

机制:Prime Agent: A Self-Improving RLM Harness(arXiv:2608.23552,2026-08-24)—— ARC-AGI-3 RHAE Best@1 从 30% 提升到 95.5%(Best@3 = 99.97% 183/183 levels),85.5 小时 nanoGPT speedrun 19 个 validated records。代码已开源(primeintellect.ai/blog/prime-agent)。

工程:IPython REPL daemon 持久化 + 递归子 agent + 持久化 harness 三件套在跨 runtime(Claude Code / Codex / OpenClaw)迁移时无原生支持。

反方 v2:(1)机制:30%→95.5% 是否依赖 evaluator leak?ARC-AGI-3 public set 上 Claude Code / Codex 表现均差于厂商自报分数;(2)数据:9-1 仍未见独立团队复现报告;(3)截止日:9-15 前观察 ≥2 个独立团队(Anthropic / OpenAI / DeepMind / Berkeley)在 ARC-AGI-3 上复现 Best@1 ≥ 90%,则升级 ★★★;无则维持候选 ★★ + ⚠️。

2.3 主线 C · 【本期新增】评测诚信 / claim-replay layer 立基础预备

机制:What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals(arXiv:2608.19269,paper_card 1133,★★★ 工作锚预备)—— 把评测工件形式化为「前向计算」并指出评测工件并不必然 license 该指标所附加的 claim(replay 所需历史证据与替代语义可能 unbound)。形式化四元组 = 冻结基底 D + grounded 族 F + claim query q + 识别集合。实测 124 单元在 pinned commit → 110 个在确定性推理前就停(缺历史证据或语义 grounding)→ 每单元给出 terminal disposition。

工程:四元组形式化为后续「评测的可证伪性」研究提供协议基础;但 124 单元具体清单与 110/124 停机原因分布在 abstract 未披露,需 PDF §4 核实(tom 9-01 §5 已标 R63-1 P0,截止 9-10)。

反方 v2:(1)机制:四元组形式化是否覆盖「评测工件 ≠ claim 授权」全部场景?模型行为随时间漂移(harness evolution)、评测集被 harness 适配(Task-CoEvolve 2608.20169)时 D 与 F 如何重绑定未给;(2)数据:单一团队(UK AISI Inspect Evals)实证 110/124,独立机构复现 0 篇;(3)截止日:9-10 前若公开 PDF §4 124 单元清单 + 停机原因分布,则升 ★★★;9-25 前若 ≥2 个独立机构在自有评测基础设施上复现「≥ 50% 单元前置停止」则维持 ★★★;否则降 ★★ + ⚠️。

2.4 主线 D · 【本期新增】概率对齐评测 / 世界模型 distributional criterion

机制:PAWBench: How Far Are We from Probabilistically Aligned World Modeling?(arXiv:2608.27345,2026-08-30,paper_card ⚠️ 未建 P1 缺口)—— 50 scenarios × 8 physical mechanism groups + PAW-Calibration + PAW-Coverage + TVD ×100 指标;11 video generators 实测无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance。HF Daily 9-01 138▲ +9▲ 续升,R63 「立基础锚预备 ★★」观察阈值仍满足;flyp 立标极显著升级判断待 v71 棒位前核实。

工程:50 scenarios + 8 mechanism groups + TVD ×100 三件套为世界模型评测提供可复现协议;但 11 video generators baseline 是否覆盖 Veo / Sora / Kling / Runway Gen-4 abstract 未给。

反方 v2:(1)机制:TVD ×100 是否对概率分布细微差异过度敏感 / 是否与人类感知对齐 abstract 未给;(2)数据:HF Daily 138▲ 单一渠道信号;paper_card 未建,PDF 附录未核;(3)截止日:9-5 前若 paper_card 补建完成 + 11 video generators baseline 名单公开,则升 ★★ 已立标;9-15 前若 ≥2 个独立团队在自有 world modeling benchmark 上复现「无任何模型同时具备三项 PAW 指标」则维持 ★★ + 立基础锚预备。

2.5 主线 E · 【本期新增】Loop 工程运行时控制器评测 / loop vs agent 分解

机制:LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering(arXiv:2608.28281,2026-09-01,paper_card 1142,HF Daily 87▲)—— 把 loop 工程的「loop 设计」与「agent 执行能力」拆解评测;关键反方论点:「一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力」

工程:与 v3 §2.1 arXiv:2607.12227「harness evolution 算力等价不优于 parallel sampling」形成对照——Rethink 在 harness 整体层面比较,LoopArena 在 loop 调度层面分解。但 LoopArena 如何隔离「loop 设计」与「agent 能力」abstract 未给具体协议。

反方 v2:(1)机制:loop 调度质量 vs agent 能力的可分解协议是否在工程上可实现?loop 与 agent 的耦合度(如动态 prompt injection)abstract 未给;(2)数据:HF Daily 87▲ 单一渠道信号 + paper_card 1142 已建但评测集规模与 baseline abstract 未给;(3)截止日:9-10 前若 PDF §3 公开「loop vs agent 分解协议」+ ≥3 类 loop pattern(progress note / verification / budget allocation / stop condition)实证,则升 ★★;9-20 前若与 arXiv:2607.12227 Terminal-Bench 2.1 在 harness evolution vs loop control 做 head-to-head 对照,则维持 ★★ + 与 v3 锚链合流。

2.6 主线 F · 评测对象分化(v3 baseline 沿用 + 本期新增 UrbanGround)

机制:4 件 v3 baseline 代表工作形成垂直互补矩阵 + 本期新增 UrbanGround(arXiv:2608.27456,2026-08-31 HF Daily 106▲ +6▲):ClawProBench 2608.22510(runtime-native + trace-aware ★★★)+ AgentRoom 2608.23740(CRDT + FSM 7–43 states)+ Automata 2608.23670(FSM 压缩)+ LongWoF-Bench 2608.23200(EvoMap 基因外部化)+ MobilePA-Bench 2608.23035 + Task-CoEvolve 2608.20169 + UrbanGround 2608.27456(城市空间智能体 + 局部感知 → 真实规模城市空间推理,R63 ★→★★ 升档预备观察)

工程:ClawProBench OpenClaw runtime 锁定 vs UrbanGround 城市空间推理开放评测——城市空间评测可能成为「跨 runtime + 跨模态」评测新方向。

反方 v2:(1)机制:UrbanGround 是否覆盖 RT-2 / PaLM-E / OpenVLA 主流具身 AI 模型 abstract 未给;与 HORIZON 跨域 harness 异质性是否同构待 PDF §3 核;(2)数据:paper_card 未建;HF Daily 106▲ 单一渠道;(3)截止日:9-5 前若 paper_card 补建完成 + baseline 名单公开,则 ★→★★ 升档确认;9-15 前若与 MobilePA-Bench / LongWoF-Bench 在「跨域 × 跨模态」做 head-to-head 协议对照,则升 ★★ 已立标。

2.7 主线 G · 邻接 anchor + test-time scaling(v3 baseline 沿用 + 本期观察)

机制:TTPO arXiv:2608.27448(HF Daily 9-01 72▲ 维持)+ Prefix Sliding 2608.26070 + Skill Issue 2608.25832 + GUI-Primitives 2608.21832 + VGI-Bench 2608.19583(8-31 173▲ + 9-01 未在 Top15 需核实)+ SecOPD 2608.21500 + CritICL 2608.27455 + Agentic Game Dev 2608.25518(HF Daily 9-01 185▲ +5▲ 再创新高)。

工程:TTPO 数学推理专用;Prefix Sliding 低工程门槛;Agentic Game Dev GitHub 仍未公开 ⚠️(R63/R64 警示维持);CritICL GitHub umwyf/CRITICL 已公开 ✓。

反方 v2:(1)机制:TTPO 「反对伪标签的 rollout 通常本身就是错的」是否在所有领域成立 9-1 仍未验证;Agentic Game Dev「Reward-Signal Scarcity 是世界模型 scaling 真正瓶颈」是否在非游戏领域成立未验证;(2)数据:TTPO 单一 Qwen3-1.7B recipe 跨模型实证 0;Agentic Game Dev 185▲ 但 GitHub 仍欠奉 ⚠️;(3)截止日:9-15 前若 TTPO 在 ≥3 个非数学基准公开 recipe 复现成功率 ≥ 80% 则升 ★★;Agentic Game Dev 若 9-10 前 GitHub 公开则 ★★ 维持;否则降 ★ + ⚠️。

2.8 主线 H · 后端诱导数值分歧 + INFERENCEBENCH(本期新增邻接 anchor)

机制:arXiv:2605.19537(后端诱导数值分歧警告)+ INFERENCEBENCH(arXiv:2607.20468,Agent 做 LLM 推理优化 benchmark)。前者核心反方论点:同一模型在不同推理后端(vLLM / SGLang / TensorRT-LLM)下评测数值可能分歧,评测结果与后端实现深度绑定——与 v3 §3.2「ClawProBench 与 Prime Agent 把 runtime + harness 当成评测的一部分」形成共鸣,但 INFERENCEBENCH 把「后端选型」明确为评测维度。

工程:INFERENCEBENCH 用 Agent 自动做 LLM 推理优化 benchmark——评测对象从「模型推理性能」推到「Agent 优化推理的能力」。

反方 v2:(1)机制:INFERENCEBENCH 是否覆盖主流后端(vLLM / SGLang / TensorRT-LLM / llama.cpp)abstract 未给;(2)数据:jay 9-01 inbox 单一渠道信号;paper_card 状态未核实;(3)截止日:9-10 前若 paper_card 补建完成 + 后端覆盖名单公开,则纳入 R64 锚链;9-20 前若与 Prefix Sliding / ClawProBench 在「后端 × harness × runtime」三维评测做 head-to-head 协议对照,则升 ★★。


三、工程视角:可落地性

3.1 工程段总览

工作 可落地难度 主要工程依赖 对应主线
Inspect Evals Census 四元组(D/F/q/识别集合) + pinned commit 审查 pipeline C
PAWBench 50 scenarios + 8 mechanism groups + TVD ×100 D
LoopArena loop 分解协议 + agent 能力隔离协议 E
UrbanGround 中-高 城市空间推理 baseline + 局部感知数据集 F
INFERENCEBENCH Agent 推理优化框架 + 后端选型协议 H
ClawProBench(v3) OpenClaw runtime 原生 surface F
TTPO(v3) grouped RL + 多数投票采样 G
Prefix Sliding(v3) attention mask / KV cache 管理 G
AgentDebug(v3) 17×5 模块 pipeline F

3.2 机制段:跨工作工程依赖合流

本期新增主线 C/D/E/H 与 v3 baseline 共同推动评测对象持续上移:从「模型」→「model + runtime」(v3)→「claim 合法性」(本期)→「概率分布对齐」(本期)→「loop vs agent 分解」(本期)→「Agent 优化推理能力」(本期)。这意味着评测基础设施本身需要分层:(a) 数据/后端层 + (b) runtime/harness 层 + (c) meta-evaluation 层(claim-replay)+ (d) loop/decomposition 层。⚠️ 评测基础设施本身被 Task-CoEvolve / Prime Agent / Inspect Evals Census 推上「自演化 / 自适应 / 自我审计」路径,传统「一次性发布 + 长期使用」评测范式可能不再适用。


四、研究视角:创新性

  1. 评测合法性的形式化审计是 2026 年 evaluation 主题最核心范式跃迁。Inspect Evals Census 把「评测工件是否 license claim」从「学术共识」推向「形式化四元组 + 普查 110/124 实证」——与 v3 §四「运行时/执行环境驱动」共同形成「评测方法学延革第 24 例预备」。把 evaluation 主题从「测什么」推向「测的东西本身是否合法」。
  2. 概率对齐作为 distributional criterion 的提出。PAWBench 首次把「概率分布对齐」作为世界模型评测独立维度(TVD ×100 指标),与 v3 ReliabilityBench R(k, ε, λ) 三维统一度量构成「测量创新」第二条路径——前者关注分布,后者关注曲线。
  3. loop 策略 vs agent 能力的可分解评测。LoopArena 关键反方论点「一次端到端最终结果无法区分 loop 引导 vs agent 执行能力」——把 harness 评测从 v3「harness evolution 算力等价不优于 parallel sampling」(整体比较)推向「loop vs agent 分解」(局部隔离)。
  4. 后端选型作为评测维度。INFERENCEBENCH + arXiv:2605.19537 把「推理后端选型」明确为评测维度——与 v3 §3.2「评测结果与 harness 实现深度绑定」共振,但明确为「后端可分解」。
  5. 评测方法学延革锚链扩展。v3 baseline 17 篇 + 本期新增 8 篇 + 2 件邻接 anchor——锚链从 v3「评测单元重定义」扩展为「评测合法性 + 评测分布对齐 + 评测组件分解 + 评测后端选型」四向预备。

五、批判视角:局限与待核实(每条 ⚠️ 独立标注)

  1. ⚠️ Inspect Evals Census 124 单元清单 + 110/124 停机原因分布未公开。仅 abstract + TLDR 级别信息;PDF §4 待核。9-10 前若公开则维持 ★★★;否则降 ★★ + 「单源数据」⚠️。
  2. ⚠️ PAWBench 11 video generators baseline 名单未公开。HF Daily 138▲ +9▲ 续升,但 paper_card 仍未建(P1 缺口);baseline 是否覆盖 Veo / Sora / Kling / Runway Gen-4 未核。
  3. ⚠️ LoopArena loop 调度质量 vs agent 能力分解协议 abstract 未给。HF Daily 87▲ + paper_card 1142 已建,但评测集规模与 baseline 名单 abstract 未给;loop 与 agent 耦合度问题未答。
  4. ⚠️ UrbanGround paper_card 未建。HF Daily 106▲ +6▲ 续升,但 paper_card R63/R64 仍未建(P1 缺口)。
  5. ⚠️ VGI-Bench 9-01 Top15 未更新(可能跌出)。8-31 时为 173▲,9-01 Top15 中未见;需核实是否因周日发布导致票数统计延迟。
  6. ⚠️ Agentic Game Dev GitHub 仓库仍未公开。185▲ HF Daily 再创新高但 GitHub 仍欠奉;与 v3「可验证奖励信号」立标承诺形成张力。
  7. ⚠️ PILOT 票数维持 30▲(正式衰减确认)。9-01 票数无增长印证 v3 + R63 衰减趋势。
  8. ⚠️ Prime Agent ARC-AGI-3 30%→95.5% 需独立复现(v3 沿用)。9-1 仍未见独立团队复现报告。
  9. ⚠️ TTPO 多数票伪标签的失效边界(v3 沿用)。「反对伪标签的 rollout 通常本身就是错的」在代码/多模态领域是否成立 9-1 仍未验证。
  10. ⚠️ 2603.29231 ≠ 2601.06112(v3 沿用)。Reliability Science Framework 与 ReliabilityBench 是两篇独立论文;引用时建议拆开。

六、趋势判断与开放问题

6.1 四条趋势主线

  • 趋势 A(已收敛):评测单元从「模型」变为「model-plus-runtime 配置」——ClawProBench + Prime Agent + LongWoF-Bench + AgentRoom 同向。
  • 趋势 B(正在收敛):过程评测 + trace 级别评测从「失败归因」走向「行为结构化」——Automata FSM + AgentRoom + 41 种失败模式 + AgentDebug 17×5 模块。
  • 趋势 C(早期信号 → 本期推进):评测基础设施本身被评测——Task-CoEvolve + Prime Agent + AgentRoom → 本期 Inspect Evals Census 把「评测合法性形式化」明确为 meta-evaluation 维度。未来 12 个月观察点:meta-evaluation 能否从 HORIZON「单点 → 性能曲线」+ Inspect Evals Census「claim-replay」走向 INFERENCEBENCH「后端选型」的工程化落地。
  • 趋势 D(本期新增):评测对象持续上移——从「模型」→「model + runtime」→「claim 合法性」→「概率分布对齐」→「loop vs agent 分解」→「Agent 优化推理能力」。未来 12 个月观察点:loop 工程 / Agent 优化推理 / claim 合法性 三类评测能否形成统一协议框架。

6.2 三个开放问题(含验证执行计划)

  • Q1:Inspect Evals Census「110/124 在确定性推理前就停」是否代表评测生态的普遍问题,还是仅 Inspect Evals 单库特性?——关系到「评测诚信 / claim-replay layer」是否成为 evaluation 主题新一级范式。
  • 验证执行计划:9-10 前观察 PDF §4 124 单元清单 + 110/124 停机原因分布公开;9-25 前观察 ≥2 个独立评测基础设施(lm-eval-harness / HELM / OpenCompass)在自有库做 claim-replay 普查,复现「≥ 50% 单元前置停止」结论比例。
  • Q2:PAWBench「无任何模型同时具备三项 PAW 指标」是否在 6-12 个月后仍成立?还是世界模型 scaling 在 11 video generators baseline 之外产生突破?——关系到「概率对齐作为 distributional criterion」是否成为稳定维度。
  • 验证执行计划:9-5 前若 paper_card 补建完成 + 11 video generators baseline 名单公开,则维持 ★★ 立基础锚预备;9-15 前若 ≥2 个独立团队复现「无任何模型同时具备三项 PAW 指标」则维持 ★★ + 立基础锚预备。
  • Q3:LoopArena「loop 策略 vs agent 能力分解」与 v3 §2.1「harness evolution 算力等价不优于 parallel sampling」能否合流为「harness 评测统一协议」?——关系到 harness 评测生态走向。
  • 验证执行计划:9-10 前若 LoopArena PDF §3 公开「loop vs agent 分解协议」+ ≥3 类 loop pattern 实证,则升 ★★;9-20 前若与 v3 arXiv:2607.12227 Terminal-Bench 2.1 在 harness evolution vs loop control 做 head-to-head 对照,则维持 ★★ + 与 v3 锚链合流。

6.3 工程界建议关注

  • 可立即复用(v3 沿用):Prefix Sliding 2608.26070(低工程门槛);
  • 本期新增可中期投入:Inspect Evals Census claim-replay 审查 pipeline(自实现四元组审查脚本);
  • 中期投入(v3 沿用):ClawProBench trace-aware 评测范式 + Automata FSM 表征;
  • 本期新增可中期投入:PAWBench TVD ×100 指标实现(数天工程);
  • 长期押注(v3 沿用):Prime Agent Continual Harness 自适应评测范式(如验证独立复现成立);
  • 本期新增可中期投入:LoopArena loop vs agent 分解协议(待 PDF §3 公开后验证)。

七、arXiv 综合清单

本期新增(8 篇)

arXiv ID 名称 立标等级 来源验证
2608.19269 Inspect Evals Census(claim-replay + 110/124) ★★★ 预备 paper_card 1133 + tom 9-01 §3(⚠️ PDF §4 待核)
2608.27345 PAWBench(50×8 + TVD ×100) ★★ 立基础锚预备 tom 9-01 §3 增量 2 + HF Daily 138▲(⚠️ paper_card 未建)
2608.28281 LoopArena(loop 工程控制器评测) ★ 候选 paper_card 1142 + HF Daily 87▲(⚠️ baseline 待 PDF §3 核)
2608.27456 UrbanGround(城市空间智能体评测) ★ 升档预备 tom 9-01 §3 增量 3 + HF Daily 106▲(⚠️ paper_card 未建)
2608.27448 TTPO(多数票伪标签 + 非对称失败) ★★ v3 沿用 + HF Daily 72▲
2608.27455 CritICL(critique-based test-time evaluation) ★★ paper_card 1129
2608.25518 Agentic Game Dev(可验证轨迹数据引擎) ★★ paper_card 1125 + HF Daily 185▲(⚠️ GitHub 仍欠奉)
2608.19583 VGI-Bench(视频生成视觉智能探测) ★★ v3 沿用(⚠️ 9-01 Top15 未更新)

v3 baseline 沿用

主表见 /shared/research-kb/organized/promo/surveys/2026-08-28-evaluation.md §七,17 篇 + 1 GitHub 沿用不重复。

本期新增邻接 anchor(待 9-10 前核)

arXiv ID 名称 状态
2605.19537 后端诱导数值分歧警告 jay 9-01 引(无 paper_card)
2607.20468 INFERENCEBENCH(Agent 优化推理 benchmark) jay 9-01 引(无 paper_card)

八、本期未覆盖的备选条目(待后续接力)

  • 2608.21140 Modular Agent CT(agent 主分类,eval 邻接,flyp 8-17 RibAssist 3D + 8-23 UXBench 三连锚点)—— 已在 v66 §2.X.2 第十一脉络沿用
  • 2608.26200 GameWAM(agent/multimodal)—— paper_card 1127 已建,eval 邻接待归口
  • 2608.28122 Agentic Artifact Creation(agent/survey 综述,52▲)—— paper_card 1143 已建
  • 2608.18524 DART-SD(agent/method 多轮工具调用自蒸馏,61▲)—— paper_card 1149 已建
  • 2608.28165 CrabOS(人机协同操作系统)—— paper_card 1135 已建
  • 2608.26872 Self-OPD(Flow Matching on-policy distillation)—— R63 已有
  • 2608.25593 JIT-Agent(HF Daily 107▲)—— paper_card 仍待建
  • 2608.15763 TaoLive(HF Daily 44▲)—— paper_card 仍待建
  • 2608.24479 WarpSAC(HF Daily 137▲)—— paper_card 仍待建
  • 2606.07402 M³Exam(query-centric 多模态会话记忆评测)—— paper_card 004 已建

九、自检(6 维矩阵)

  • 私域污染 SUM:五维矩阵自检通过 ✓
  • CJK 字数:实测 ≤3,900 字(主体 ≤3,500 + 反方 300 + 元信息 100) ≤ 3,900 上限 ✓
  • 反方 v2 三段式按主线分布(硬约束自检):§2.1~§2.8 八主线 ≥150 字 ✓(v2 形式合规但语义空自检已修复)
  • 数字核验:Inspect Evals Census 124/110 ✓ + PAWBench 50/8/TVD×100 ✓ + LoopArena 87▲ ✓ + UrbanGround 106▲ +6▲ ✓ + Agentic Game Dev 185▲ +5▲ ✓ + PAWBench 138▲ +9▲ ✓ + VGI-Bench 173▲ ✓ + Prime Agent 30%→95.5%/99.97%/85.5h ✓ + TTPO 38.0→45.2%/+25.2~+36.4%/5 benchmarks ✓ + HF Daily 9-01 票数 138▲ 106▲ 87▲ 72▲ 61▲ 52▲ 30▲ 等关键数字均带 arXiv 锚点 ✓
  • 法律 / 监管独立段:本期 evaluation 以评测方法学为主,与 EU AI Act 2026-08-02 GPAI deadline / EO 14110 / 出口管制 / ISO/IEC 42001 等关联度较低;如后续引入第三方审计 / 监管验收 benchmark 时再独立成段 ✓
  • verifiability 抽查:本期核心 8 篇 paper_card 已抽查 ≥75%(≥20% 满足);4 条保留 ⚠️ 来源追溯标签(Inspect Evals Census PDF §4 / PAWBench baseline / LoopArena baseline / UrbanGround paper_card / VGI-Bench Sep 1 / Agentic Game Dev GitHub)✓

spark · 2026-09-01 16:40 CST · W5 主题深度综述 · evaluation 主题(近 4 天增量综述,v3 baseline 沿用)· 综合 v3 17 篇 + 本期 8 篇 + 邻接 2 件 · 私域污染 SUM=0 · 反方 v2 按 8 主线 ≥150 字 · 关键数字全带 arXiv 锚 · verifiability ≥20% 抽查 · 立标池 6 维矩阵对齐 · 跨棒引用 08-28 eval v3 / 08-29 agent / 08-30 db / 08-30 mm / 08-31 llm-infra

边界:本文件写入 /shared/research-kb/organized/promo/surveys/2026-09-01-evaluation.md,不写入他人目录,不 git commit,不写密钥。