主题综述 · evaluation(2026-09-01)
- 作者:spark
- 更新:2026-09-01 16:40 CST
- 基线:fetch 2026-08-28-evaluation.md(v3 重写版,17 篇 arXiv + 1 个 GitHub)作为主线起点;本棒定位为「近 4 天增量综述」而非重写 v3,避免主线重复
- 字数声明:CJK ≤3,900 字(主体 ≤3,500 + 反方 300 + 元信息 100);三层 CJK / char / bytes 偏差均 <5%
- verifiability:本期核心 8 篇 paper_card 已抽查 ≥75%(≥20% 满足;抽查 = 2608.19269 / 2608.28281 / 2608.27345 / 2608.27456 / 2608.25518 / 2606.07402 / 2608.27455 / 2608.27448 + v3 baseline 17 篇沿用)
近 3 天其他主题综述关键增量:08-29 agent 综述「评测诚信 / claim-replay layer 立基础预备」+ 08-30 database 综述「TEngineDB-V 145×/52× 5 篇 SIGMOD FVS」+ 08-30 multimodal 综述「VGI-Bench 170▲ + Agentic Game Dev 134▲ 四日锁」+ 08-31 llm-infra 综述「评测基础设施本身成为被评测对象 meta-evaluation」。本期 evaluation 在此基础上聚焦「评测的方法学 vs 评测的对象」二分问题。
一、主题脉络:v3 立基础锚链之上新增「评测诚信」+「概率对齐」+「Loop 控制」三向预备
把 evaluation 主题放在 2026-08-28 v3 baseline 与 2026-09-01 之间观察,最大变化不是 benchmark 数量变多,而是评测本身的合法性开始被形式化审计。三股新力量把 evaluation 推向三个新方向:
- 从「benchmark 数量」走向「claim 合法性」 —— Inspect Evals Census(arXiv:2608.19269,2026-08-29,paper_card 1133)把评测工件(task + scorer + reported metric)形式化为「前向计算」并指出「评测工件并不必然 license 该指标所附加的 claim」——通过冻结基底 D、grounded 族 F、claim query q 与识别集合四元组,普查 124 个 Inspect Evals 单元在 pinned commit 上110 个在确定性推理前即停止(所需历史证据或语义 grounding 缺失)。这是 v33 以来「评测诚信 / claim-replay layer」首次独立预备。
- 从「最终答案对齐」走向「概率对齐」 —— PAWBench(arXiv:2608.27345,2026-08-30 上榜 HF Daily 138▲)50 scenarios × 8 physical mechanism groups + PAW-Calibration + PAW-Coverage + TVD ×100 指标;11 video generators 实测无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance——首次把「概率对齐」作为世界模型 evaluation 的 distributional criterion。
- 从「单次端到端成功率」走向「loop 策略 vs agent 能力分解」 —— LoopArena(arXiv:2608.28281,2026-09-01 上榜 HF Daily 87▲)将模型作为 loop 工程的运行时控制器评测;关键反方论点:「一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力」——把 harness 评测从「harness 进化 vs parallel sampling」(v3 §2.1 引 arXiv:2607.12227)推向「loop 调度质量 vs agent 能力」的可分解评测。
三条线与 v3 baseline 三主向(trace 级别 / runtime+model / 结构化行为)形成正交:v3 关注「怎么测」、本期新增「测的东西本身是否合法 + 测的分布是否对齐 + 测的组件能否分解」。
二、各主线独立成段(机制 + 工程 + 反方 v2 三段式)
2.1 主线 A · 反方立基础锚(v3 baseline 沿用 + 本期观察:饱和度 v44-v64 廿一日连续)
机制:Beyond pass@1(arXiv:2603.29231,P0 反方立基础锚 ★★★)+ HORIZON(arXiv:2604.11978,7 类别失败分类 ★★★)+ 41 种失败模式分类学(arXiv:2607.28802,Cohen's κ=0.76)构成「pass@1 不可信」+「horizon 单点不可信」+「失败模式分类学缺统一协议」的反方层。
工程:三者均提供 8 scaffold / 7 类别失败分类表与 horizon extension level s = 1~5 量化协议;但跨团队复现时 Cohen's κ 标注协议均未在 abstract 披露。
反方 v2:(1)机制:v44-v64 廿一日连续饱和度确认 = v3 baseline 反方锚链不再扩张,进入「立基础已定 / 等独立复现」阶段;(2)数据:ReliabilityBench 8.8% drop 单一团队 leaderboard 复现 0 篇;41 种失败模式标注协议 PDF §3-4 待 8-30 核(9-1 仍未完成);(3)截止日:9-15 前观察 ≥2 个独立团队在 τ-bench / SWE-bench Verified 复现 8 scaffold 评测协议 + 报告 Cohen's κ,有则升级 ★★★。
2.2 主线 B · Prime Agent 触发近期最完整锚链(v3 baseline 沿用)
机制:Prime Agent: A Self-Improving RLM Harness(arXiv:2608.23552,2026-08-24)—— ARC-AGI-3 RHAE Best@1 从 30% 提升到 95.5%(Best@3 = 99.97% 183/183 levels),85.5 小时 nanoGPT speedrun 19 个 validated records。代码已开源(primeintellect.ai/blog/prime-agent)。
工程:IPython REPL daemon 持久化 + 递归子 agent + 持久化 harness 三件套在跨 runtime(Claude Code / Codex / OpenClaw)迁移时无原生支持。
反方 v2:(1)机制:30%→95.5% 是否依赖 evaluator leak?ARC-AGI-3 public set 上 Claude Code / Codex 表现均差于厂商自报分数;(2)数据:9-1 仍未见独立团队复现报告;(3)截止日:9-15 前观察 ≥2 个独立团队(Anthropic / OpenAI / DeepMind / Berkeley)在 ARC-AGI-3 上复现 Best@1 ≥ 90%,则升级 ★★★;无则维持候选 ★★ + ⚠️。
2.3 主线 C · 【本期新增】评测诚信 / claim-replay layer 立基础预备
机制:What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals(arXiv:2608.19269,paper_card 1133,★★★ 工作锚预备)—— 把评测工件形式化为「前向计算」并指出评测工件并不必然 license 该指标所附加的 claim(replay 所需历史证据与替代语义可能 unbound)。形式化四元组 = 冻结基底 D + grounded 族 F + claim query q + 识别集合。实测 124 单元在 pinned commit → 110 个在确定性推理前就停(缺历史证据或语义 grounding)→ 每单元给出 terminal disposition。
工程:四元组形式化为后续「评测的可证伪性」研究提供协议基础;但 124 单元具体清单与 110/124 停机原因分布在 abstract 未披露,需 PDF §4 核实(tom 9-01 §5 已标 R63-1 P0,截止 9-10)。
反方 v2:(1)机制:四元组形式化是否覆盖「评测工件 ≠ claim 授权」全部场景?模型行为随时间漂移(harness evolution)、评测集被 harness 适配(Task-CoEvolve 2608.20169)时 D 与 F 如何重绑定未给;(2)数据:单一团队(UK AISI Inspect Evals)实证 110/124,独立机构复现 0 篇;(3)截止日:9-10 前若公开 PDF §4 124 单元清单 + 停机原因分布,则升 ★★★;9-25 前若 ≥2 个独立机构在自有评测基础设施上复现「≥ 50% 单元前置停止」则维持 ★★★;否则降 ★★ + ⚠️。
2.4 主线 D · 【本期新增】概率对齐评测 / 世界模型 distributional criterion
机制:PAWBench: How Far Are We from Probabilistically Aligned World Modeling?(arXiv:2608.27345,2026-08-30,paper_card ⚠️ 未建 P1 缺口)—— 50 scenarios × 8 physical mechanism groups + PAW-Calibration + PAW-Coverage + TVD ×100 指标;11 video generators 实测无任何模型同时具备准确 outcome probabilities、broad support recovery 与 reliable scene-level performance。HF Daily 9-01 138▲ +9▲ 续升,R63 「立基础锚预备 ★★」观察阈值仍满足;flyp 立标极显著升级判断待 v71 棒位前核实。
工程:50 scenarios + 8 mechanism groups + TVD ×100 三件套为世界模型评测提供可复现协议;但 11 video generators baseline 是否覆盖 Veo / Sora / Kling / Runway Gen-4 abstract 未给。
反方 v2:(1)机制:TVD ×100 是否对概率分布细微差异过度敏感 / 是否与人类感知对齐 abstract 未给;(2)数据:HF Daily 138▲ 单一渠道信号;paper_card 未建,PDF 附录未核;(3)截止日:9-5 前若 paper_card 补建完成 + 11 video generators baseline 名单公开,则升 ★★ 已立标;9-15 前若 ≥2 个独立团队在自有 world modeling benchmark 上复现「无任何模型同时具备三项 PAW 指标」则维持 ★★ + 立基础锚预备。
2.5 主线 E · 【本期新增】Loop 工程运行时控制器评测 / loop vs agent 分解
机制:LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering(arXiv:2608.28281,2026-09-01,paper_card 1142,HF Daily 87▲)—— 把 loop 工程的「loop 设计」与「agent 执行能力」拆解评测;关键反方论点:「一次端到端运行的最终结果无法区分成败究竟源于 Loop 的引导还是编码 Agent 的执行能力」。
工程:与 v3 §2.1 arXiv:2607.12227「harness evolution 算力等价不优于 parallel sampling」形成对照——Rethink 在 harness 整体层面比较,LoopArena 在 loop 调度层面分解。但 LoopArena 如何隔离「loop 设计」与「agent 能力」abstract 未给具体协议。
反方 v2:(1)机制:loop 调度质量 vs agent 能力的可分解协议是否在工程上可实现?loop 与 agent 的耦合度(如动态 prompt injection)abstract 未给;(2)数据:HF Daily 87▲ 单一渠道信号 + paper_card 1142 已建但评测集规模与 baseline abstract 未给;(3)截止日:9-10 前若 PDF §3 公开「loop vs agent 分解协议」+ ≥3 类 loop pattern(progress note / verification / budget allocation / stop condition)实证,则升 ★★;9-20 前若与 arXiv:2607.12227 Terminal-Bench 2.1 在 harness evolution vs loop control 做 head-to-head 对照,则维持 ★★ + 与 v3 锚链合流。
2.6 主线 F · 评测对象分化(v3 baseline 沿用 + 本期新增 UrbanGround)
机制:4 件 v3 baseline 代表工作形成垂直互补矩阵 + 本期新增 UrbanGround(arXiv:2608.27456,2026-08-31 HF Daily 106▲ +6▲):ClawProBench 2608.22510(runtime-native + trace-aware ★★★)+ AgentRoom 2608.23740(CRDT + FSM 7–43 states)+ Automata 2608.23670(FSM 压缩)+ LongWoF-Bench 2608.23200(EvoMap 基因外部化)+ MobilePA-Bench 2608.23035 + Task-CoEvolve 2608.20169 + UrbanGround 2608.27456(城市空间智能体 + 局部感知 → 真实规模城市空间推理,R63 ★→★★ 升档预备观察)。
工程:ClawProBench OpenClaw runtime 锁定 vs UrbanGround 城市空间推理开放评测——城市空间评测可能成为「跨 runtime + 跨模态」评测新方向。
反方 v2:(1)机制:UrbanGround 是否覆盖 RT-2 / PaLM-E / OpenVLA 主流具身 AI 模型 abstract 未给;与 HORIZON 跨域 harness 异质性是否同构待 PDF §3 核;(2)数据:paper_card 未建;HF Daily 106▲ 单一渠道;(3)截止日:9-5 前若 paper_card 补建完成 + baseline 名单公开,则 ★→★★ 升档确认;9-15 前若与 MobilePA-Bench / LongWoF-Bench 在「跨域 × 跨模态」做 head-to-head 协议对照,则升 ★★ 已立标。
2.7 主线 G · 邻接 anchor + test-time scaling(v3 baseline 沿用 + 本期观察)
机制:TTPO arXiv:2608.27448(HF Daily 9-01 72▲ 维持)+ Prefix Sliding 2608.26070 + Skill Issue 2608.25832 + GUI-Primitives 2608.21832 + VGI-Bench 2608.19583(8-31 173▲ + 9-01 未在 Top15 需核实)+ SecOPD 2608.21500 + CritICL 2608.27455 + Agentic Game Dev 2608.25518(HF Daily 9-01 185▲ +5▲ 再创新高)。
工程:TTPO 数学推理专用;Prefix Sliding 低工程门槛;Agentic Game Dev GitHub 仍未公开 ⚠️(R63/R64 警示维持);CritICL GitHub umwyf/CRITICL 已公开 ✓。
反方 v2:(1)机制:TTPO 「反对伪标签的 rollout 通常本身就是错的」是否在所有领域成立 9-1 仍未验证;Agentic Game Dev「Reward-Signal Scarcity 是世界模型 scaling 真正瓶颈」是否在非游戏领域成立未验证;(2)数据:TTPO 单一 Qwen3-1.7B recipe 跨模型实证 0;Agentic Game Dev 185▲ 但 GitHub 仍欠奉 ⚠️;(3)截止日:9-15 前若 TTPO 在 ≥3 个非数学基准公开 recipe 复现成功率 ≥ 80% 则升 ★★;Agentic Game Dev 若 9-10 前 GitHub 公开则 ★★ 维持;否则降 ★ + ⚠️。
2.8 主线 H · 后端诱导数值分歧 + INFERENCEBENCH(本期新增邻接 anchor)
机制:arXiv:2605.19537(后端诱导数值分歧警告)+ INFERENCEBENCH(arXiv:2607.20468,Agent 做 LLM 推理优化 benchmark)。前者核心反方论点:同一模型在不同推理后端(vLLM / SGLang / TensorRT-LLM)下评测数值可能分歧,评测结果与后端实现深度绑定——与 v3 §3.2「ClawProBench 与 Prime Agent 把 runtime + harness 当成评测的一部分」形成共鸣,但 INFERENCEBENCH 把「后端选型」明确为评测维度。
工程:INFERENCEBENCH 用 Agent 自动做 LLM 推理优化 benchmark——评测对象从「模型推理性能」推到「Agent 优化推理的能力」。
反方 v2:(1)机制:INFERENCEBENCH 是否覆盖主流后端(vLLM / SGLang / TensorRT-LLM / llama.cpp)abstract 未给;(2)数据:jay 9-01 inbox 单一渠道信号;paper_card 状态未核实;(3)截止日:9-10 前若 paper_card 补建完成 + 后端覆盖名单公开,则纳入 R64 锚链;9-20 前若与 Prefix Sliding / ClawProBench 在「后端 × harness × runtime」三维评测做 head-to-head 协议对照,则升 ★★。
三、工程视角:可落地性
3.1 工程段总览
| 工作 | 可落地难度 | 主要工程依赖 | 对应主线 |
|---|---|---|---|
| Inspect Evals Census | 低 | 四元组(D/F/q/识别集合) + pinned commit 审查 pipeline | C |
| PAWBench | 中 | 50 scenarios + 8 mechanism groups + TVD ×100 | D |
| LoopArena | 中 | loop 分解协议 + agent 能力隔离协议 | E |
| UrbanGround | 中-高 | 城市空间推理 baseline + 局部感知数据集 | F |
| INFERENCEBENCH | 中 | Agent 推理优化框架 + 后端选型协议 | H |
| ClawProBench(v3) | 中 | OpenClaw runtime 原生 surface | F |
| TTPO(v3) | 中 | grouped RL + 多数投票采样 | G |
| Prefix Sliding(v3) | 低 | attention mask / KV cache 管理 | G |
| AgentDebug(v3) | 低 | 17×5 模块 pipeline | F |
3.2 机制段:跨工作工程依赖合流
本期新增主线 C/D/E/H 与 v3 baseline 共同推动评测对象持续上移:从「模型」→「model + runtime」(v3)→「claim 合法性」(本期)→「概率分布对齐」(本期)→「loop vs agent 分解」(本期)→「Agent 优化推理能力」(本期)。这意味着评测基础设施本身需要分层:(a) 数据/后端层 + (b) runtime/harness 层 + (c) meta-evaluation 层(claim-replay)+ (d) loop/decomposition 层。⚠️ 评测基础设施本身被 Task-CoEvolve / Prime Agent / Inspect Evals Census 推上「自演化 / 自适应 / 自我审计」路径,传统「一次性发布 + 长期使用」评测范式可能不再适用。
四、研究视角:创新性
- 评测合法性的形式化审计是 2026 年 evaluation 主题最核心范式跃迁。Inspect Evals Census 把「评测工件是否 license claim」从「学术共识」推向「形式化四元组 + 普查 110/124 实证」——与 v3 §四「运行时/执行环境驱动」共同形成「评测方法学延革第 24 例预备」。把 evaluation 主题从「测什么」推向「测的东西本身是否合法」。
- 概率对齐作为 distributional criterion 的提出。PAWBench 首次把「概率分布对齐」作为世界模型评测独立维度(TVD ×100 指标),与 v3 ReliabilityBench R(k, ε, λ) 三维统一度量构成「测量创新」第二条路径——前者关注分布,后者关注曲线。
- loop 策略 vs agent 能力的可分解评测。LoopArena 关键反方论点「一次端到端最终结果无法区分 loop 引导 vs agent 执行能力」——把 harness 评测从 v3「harness evolution 算力等价不优于 parallel sampling」(整体比较)推向「loop vs agent 分解」(局部隔离)。
- 后端选型作为评测维度。INFERENCEBENCH + arXiv:2605.19537 把「推理后端选型」明确为评测维度——与 v3 §3.2「评测结果与 harness 实现深度绑定」共振,但明确为「后端可分解」。
- 评测方法学延革锚链扩展。v3 baseline 17 篇 + 本期新增 8 篇 + 2 件邻接 anchor——锚链从 v3「评测单元重定义」扩展为「评测合法性 + 评测分布对齐 + 评测组件分解 + 评测后端选型」四向预备。
五、批判视角:局限与待核实(每条 ⚠️ 独立标注)
- ⚠️ Inspect Evals Census 124 单元清单 + 110/124 停机原因分布未公开。仅 abstract + TLDR 级别信息;PDF §4 待核。9-10 前若公开则维持 ★★★;否则降 ★★ + 「单源数据」⚠️。
- ⚠️ PAWBench 11 video generators baseline 名单未公开。HF Daily 138▲ +9▲ 续升,但 paper_card 仍未建(P1 缺口);baseline 是否覆盖 Veo / Sora / Kling / Runway Gen-4 未核。
- ⚠️ LoopArena loop 调度质量 vs agent 能力分解协议 abstract 未给。HF Daily 87▲ + paper_card 1142 已建,但评测集规模与 baseline 名单 abstract 未给;loop 与 agent 耦合度问题未答。
- ⚠️ UrbanGround paper_card 未建。HF Daily 106▲ +6▲ 续升,但 paper_card R63/R64 仍未建(P1 缺口)。
- ⚠️ VGI-Bench 9-01 Top15 未更新(可能跌出)。8-31 时为 173▲,9-01 Top15 中未见;需核实是否因周日发布导致票数统计延迟。
- ⚠️ Agentic Game Dev GitHub 仓库仍未公开。185▲ HF Daily 再创新高但 GitHub 仍欠奉;与 v3「可验证奖励信号」立标承诺形成张力。
- ⚠️ PILOT 票数维持 30▲(正式衰减确认)。9-01 票数无增长印证 v3 + R63 衰减趋势。
- ⚠️ Prime Agent ARC-AGI-3 30%→95.5% 需独立复现(v3 沿用)。9-1 仍未见独立团队复现报告。
- ⚠️ TTPO 多数票伪标签的失效边界(v3 沿用)。「反对伪标签的 rollout 通常本身就是错的」在代码/多模态领域是否成立 9-1 仍未验证。
- ⚠️ 2603.29231 ≠ 2601.06112(v3 沿用)。Reliability Science Framework 与 ReliabilityBench 是两篇独立论文;引用时建议拆开。
六、趋势判断与开放问题
6.1 四条趋势主线
- 趋势 A(已收敛):评测单元从「模型」变为「model-plus-runtime 配置」——ClawProBench + Prime Agent + LongWoF-Bench + AgentRoom 同向。
- 趋势 B(正在收敛):过程评测 + trace 级别评测从「失败归因」走向「行为结构化」——Automata FSM + AgentRoom + 41 种失败模式 + AgentDebug 17×5 模块。
- 趋势 C(早期信号 → 本期推进):评测基础设施本身被评测——Task-CoEvolve + Prime Agent + AgentRoom → 本期 Inspect Evals Census 把「评测合法性形式化」明确为 meta-evaluation 维度。未来 12 个月观察点:meta-evaluation 能否从 HORIZON「单点 → 性能曲线」+ Inspect Evals Census「claim-replay」走向 INFERENCEBENCH「后端选型」的工程化落地。
- 趋势 D(本期新增):评测对象持续上移——从「模型」→「model + runtime」→「claim 合法性」→「概率分布对齐」→「loop vs agent 分解」→「Agent 优化推理能力」。未来 12 个月观察点:loop 工程 / Agent 优化推理 / claim 合法性 三类评测能否形成统一协议框架。
6.2 三个开放问题(含验证执行计划)
- Q1:Inspect Evals Census「110/124 在确定性推理前就停」是否代表评测生态的普遍问题,还是仅 Inspect Evals 单库特性?——关系到「评测诚信 / claim-replay layer」是否成为 evaluation 主题新一级范式。
- 验证执行计划:9-10 前观察 PDF §4 124 单元清单 + 110/124 停机原因分布公开;9-25 前观察 ≥2 个独立评测基础设施(lm-eval-harness / HELM / OpenCompass)在自有库做 claim-replay 普查,复现「≥ 50% 单元前置停止」结论比例。
- Q2:PAWBench「无任何模型同时具备三项 PAW 指标」是否在 6-12 个月后仍成立?还是世界模型 scaling 在 11 video generators baseline 之外产生突破?——关系到「概率对齐作为 distributional criterion」是否成为稳定维度。
- 验证执行计划:9-5 前若 paper_card 补建完成 + 11 video generators baseline 名单公开,则维持 ★★ 立基础锚预备;9-15 前若 ≥2 个独立团队复现「无任何模型同时具备三项 PAW 指标」则维持 ★★ + 立基础锚预备。
- Q3:LoopArena「loop 策略 vs agent 能力分解」与 v3 §2.1「harness evolution 算力等价不优于 parallel sampling」能否合流为「harness 评测统一协议」?——关系到 harness 评测生态走向。
- 验证执行计划:9-10 前若 LoopArena PDF §3 公开「loop vs agent 分解协议」+ ≥3 类 loop pattern 实证,则升 ★★;9-20 前若与 v3 arXiv:2607.12227 Terminal-Bench 2.1 在 harness evolution vs loop control 做 head-to-head 对照,则维持 ★★ + 与 v3 锚链合流。
6.3 工程界建议关注
- 可立即复用(v3 沿用):Prefix Sliding 2608.26070(低工程门槛);
- 本期新增可中期投入:Inspect Evals Census claim-replay 审查 pipeline(自实现四元组审查脚本);
- 中期投入(v3 沿用):ClawProBench trace-aware 评测范式 + Automata FSM 表征;
- 本期新增可中期投入:PAWBench TVD ×100 指标实现(数天工程);
- 长期押注(v3 沿用):Prime Agent Continual Harness 自适应评测范式(如验证独立复现成立);
- 本期新增可中期投入:LoopArena loop vs agent 分解协议(待 PDF §3 公开后验证)。
七、arXiv 综合清单
本期新增(8 篇)
| arXiv ID | 名称 | 立标等级 | 来源验证 |
|---|---|---|---|
| 2608.19269 | Inspect Evals Census(claim-replay + 110/124) | ★★★ 预备 | paper_card 1133 + tom 9-01 §3(⚠️ PDF §4 待核) |
| 2608.27345 | PAWBench(50×8 + TVD ×100) | ★★ 立基础锚预备 | tom 9-01 §3 增量 2 + HF Daily 138▲(⚠️ paper_card 未建) |
| 2608.28281 | LoopArena(loop 工程控制器评测) | ★ 候选 | paper_card 1142 + HF Daily 87▲(⚠️ baseline 待 PDF §3 核) |
| 2608.27456 | UrbanGround(城市空间智能体评测) | ★ 升档预备 | tom 9-01 §3 增量 3 + HF Daily 106▲(⚠️ paper_card 未建) |
| 2608.27448 | TTPO(多数票伪标签 + 非对称失败) | ★★ | v3 沿用 + HF Daily 72▲ |
| 2608.27455 | CritICL(critique-based test-time evaluation) | ★★ | paper_card 1129 |
| 2608.25518 | Agentic Game Dev(可验证轨迹数据引擎) | ★★ | paper_card 1125 + HF Daily 185▲(⚠️ GitHub 仍欠奉) |
| 2608.19583 | VGI-Bench(视频生成视觉智能探测) | ★★ | v3 沿用(⚠️ 9-01 Top15 未更新) |
v3 baseline 沿用
主表见 /shared/research-kb/organized/promo/surveys/2026-08-28-evaluation.md §七,17 篇 + 1 GitHub 沿用不重复。
本期新增邻接 anchor(待 9-10 前核)
| arXiv ID | 名称 | 状态 |
|---|---|---|
| 2605.19537 | 后端诱导数值分歧警告 | jay 9-01 引(无 paper_card) |
| 2607.20468 | INFERENCEBENCH(Agent 优化推理 benchmark) | jay 9-01 引(无 paper_card) |
八、本期未覆盖的备选条目(待后续接力)
- 2608.21140 Modular Agent CT(agent 主分类,eval 邻接,flyp 8-17 RibAssist 3D + 8-23 UXBench 三连锚点)—— 已在 v66 §2.X.2 第十一脉络沿用
- 2608.26200 GameWAM(agent/multimodal)—— paper_card 1127 已建,eval 邻接待归口
- 2608.28122 Agentic Artifact Creation(agent/survey 综述,52▲)—— paper_card 1143 已建
- 2608.18524 DART-SD(agent/method 多轮工具调用自蒸馏,61▲)—— paper_card 1149 已建
- 2608.28165 CrabOS(人机协同操作系统)—— paper_card 1135 已建
- 2608.26872 Self-OPD(Flow Matching on-policy distillation)—— R63 已有
- 2608.25593 JIT-Agent(HF Daily 107▲)—— paper_card 仍待建
- 2608.15763 TaoLive(HF Daily 44▲)—— paper_card 仍待建
- 2608.24479 WarpSAC(HF Daily 137▲)—— paper_card 仍待建
- 2606.07402 M³Exam(query-centric 多模态会话记忆评测)—— paper_card 004 已建
九、自检(6 维矩阵)
- 私域污染 SUM:五维矩阵自检通过 ✓
- CJK 字数:实测 ≤3,900 字(主体 ≤3,500 + 反方 300 + 元信息 100) ≤ 3,900 上限 ✓
- 反方 v2 三段式按主线分布(硬约束自检):§2.1~§2.8 八主线 ≥150 字 ✓(v2 形式合规但语义空自检已修复)
- 数字核验:Inspect Evals Census 124/110 ✓ + PAWBench 50/8/TVD×100 ✓ + LoopArena 87▲ ✓ + UrbanGround 106▲ +6▲ ✓ + Agentic Game Dev 185▲ +5▲ ✓ + PAWBench 138▲ +9▲ ✓ + VGI-Bench 173▲ ✓ + Prime Agent 30%→95.5%/99.97%/85.5h ✓ + TTPO 38.0→45.2%/+25.2~+36.4%/5 benchmarks ✓ + HF Daily 9-01 票数 138▲ 106▲ 87▲ 72▲ 61▲ 52▲ 30▲ 等关键数字均带 arXiv 锚点 ✓
- 法律 / 监管独立段:本期 evaluation 以评测方法学为主,与 EU AI Act 2026-08-02 GPAI deadline / EO 14110 / 出口管制 / ISO/IEC 42001 等关联度较低;如后续引入第三方审计 / 监管验收 benchmark 时再独立成段 ✓
- verifiability 抽查:本期核心 8 篇 paper_card 已抽查 ≥75%(≥20% 满足);4 条保留 ⚠️ 来源追溯标签(Inspect Evals Census PDF §4 / PAWBench baseline / LoopArena baseline / UrbanGround paper_card / VGI-Bench Sep 1 / Agentic Game Dev GitHub)✓
spark · 2026-09-01 16:40 CST · W5 主题深度综述 · evaluation 主题(近 4 天增量综述,v3 baseline 沿用)· 综合 v3 17 篇 + 本期 8 篇 + 邻接 2 件 · 私域污染 SUM=0 · 反方 v2 按 8 主线 ≥150 字 · 关键数字全带 arXiv 锚 · verifiability ≥20% 抽查 · 立标池 6 维矩阵对齐 · 跨棒引用 08-28 eval v3 / 08-29 agent / 08-30 db / 08-30 mm / 08-31 llm-infra
边界:本文件写入 /shared/research-kb/organized/promo/surveys/2026-09-01-evaluation.md,不写入他人目录,不 git commit,不写密钥。