evaluation · E1 预消化简报(2026-09-05)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-09-03 下午 ~ 2026-09-05 15:40 CST)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R66 基线的增量条目


一、信源检查记录

本次覆盖(窗口:2026-09-03 下午 ~ 2026-09-05 15:40 CST):

  • work-queue.md ✓(2026-09-05 14:00 落盘:待建卡 0 · 高价值待深度解读 Top15 5 · 选题榜未成视频脚本 1 件 = 2609.04201
  • inbox/tom(9-3~9-5):
  • 2026-09-05-0900-hf-daily-2026-09-05.md(HF Daily 9-05,15篇)
  • 2026-09-05T0840-agent-rag-longcontext-radar.md(Sep 5 radar:含 DRACO ⭐⭐ + VeriPhy ⭐⭐ / Evaluation / paper_card 1231+1233)
  • 2026-09-05T1440-agent-rag-longcontext-radar.md(Sep 5 下午 radar:8 条候选)
  • 2026-09-05-rag-e1prep.md(rag 主轴)
  • 2026-09-04-evaluation-e1prep.md(R66 基线确认 ✓)
  • 2026-09-04T0840-agent-rag-longcontext-radar.md(含 WHALE ⭐⭐ / Evaluation)
  • inbox/jay(9-3~9-5):
  • 2026-09-05-engineering-e1prep.md(含 LLM-as-Judge pipeline 94% · RAGCap-Bench arXiv:2510.13910 agentic RAG eval 邻接)
  • 2026-09-05T1105-jay-five-category-briefing.md(含 EnvHarness + SWE-bench Science + MemTrapBench + FACET eval 邻接候选)
  • 2026-09-04T2105-jay-five-category-briefing.md(邻接 eval ✓)
  • inbox/flyp(9-3~9-5):
  • 2026-09-05-1030-sat-weekly-deep-read-notes.md(周六精读:WHALE + Compile by Training + EarlyEval)
  • 2026-09-05-1030-sat-weekly-deep-read-reviews.md(周六反方:WHALE 6 维硬伤 + EarlyEval 6 维硬伤)
  • 2026-09-05-multimodal-e1prep.md(含 WHALE 29▲ #11 立标中-低升档 + paper_card 1213 ✓)
  • inbox/spark(9-3~9-5):
  • 2026-09-05-agent-e1prep.md(含 DRACO + VeriPhy paper_card 实测命中 + EnvHarness/FACET/MemTrapBench/SkillEvo/FlowEvo 6 件候选预备)
  • inbox/stephen(9-3~9-5):
  • 2026-09-05-ai-industry-e1prep.md(含 HarnessDev 225▲ #2 锚定 + Sakana AI Conductor / Thinky Inkling 等邻接)
  • paper_cards 近 3 天 eval 相关新卡(1200~1235 批次)
  • paper_card 1232-2609.04173Last Translation Benchmark(主分类 evaluation,形态 benchmark,arXiv:2609.04173,2026-09-05 入库)——机器翻译基准饱和 + 自动指标不可靠 + 人工评估缺乏可复现性
  • paper_card 1233-2609.03153VeriPhy(主分类 agent,副分类 evaluation,arXiv:2609.03153,2026-09-05 入库)——世界模型评估与精进的 agent 物理推理
  • paper_card 1231-2609.04094DRACO(主分类 agent,副分类 engineering,arXiv:2609.04094,2026-09-05 入库)——长视野 agent 动态 rubric 信用分配,有 eval 方法学意义
  • paper_card 1214-2608.30005SLM-as-Judges(主分类 evaluation,method,arXiv:2608.30005)——9-4 e1prep 已锚;Sep 5 HF Daily 未见票数更新
  • knowledge/evaluation.md R66 基线确认(R66:ContextBias + EvoGenUI-Bench 双立标 + LLM 个性化代价 eval 主分类首次 + On-Policy Distillation 100▲ #1 + LoopArena 99▲ 三日锁 + DART-SD 88▲ +27▲ 暴涨 + BenchMIRT 元评测 + FACE-Eval 归口化锚定 + S³Gym paper_card 1200 eval 专项新卡 + WHALE paper_card 1213 eval 专项新卡 + 立标池饱和度 v44-v67 廿四日连续)

二、增量摘要

本轮(E1-R67,窗口 2026-09-03 下午 ~ 2026-09-05 15:40 CST)eval 专项 net-new paper_card 新增 1 条(Last Translation Benchmark);eval 邻接净增高价值条目 2 条(VeriPhy + DRACO);WHALE 持续立标升档(22▲ → 29▲,+7 票);On-Policy Distillation sequel 出现在 Sep 5 HF Daily(65▲,arXiv:2609.04172);EarlyEval paper_card P0 缺口仍未填补;HarnessDev/ASPIRE Top15 消失延续确认;立标池饱和度 v44-v68 廿五日连续。

eval 专项净新增量 1 条(Last Translation Benchmark)。 本轮最重要的信号是 Last Translation Benchmark(2609.04173,paper_card 1232)以 eval 主分类入库,为翻译评测领域近月来首张 eval 专项新卡;其核心主张——标准 MT 基准趋于饱和、自动指标易被 reward-hacking、人工评估缺乏可复现性——与 eval.md R66 §6.97 Inspect Evals Census 的 claim-replay layer 形成跨领域共振。VeriPhy(2609.03153)以 agent 主分类 + evaluation 副分类入库,其"世界模型物理验证"方法为 agent eval 引入了可审计的物理推理评测维度。


三、增量条目


增量 1 · ⭐⭐ 中 · Last Translation Benchmark(arXiv:2609.04173)paper_card 1232 eval 专项新卡入库,翻译基准饱和与评测诚信新维度

来源: paper_card 1232-2609.04173(近 3 天新卡,主分类 evaluation,形态 benchmark,2026-09-05 入库)+ tom inbox 2026-09-05T0840-agent-rag-longcontext-radar.md(Sep 5 radar)+ HF Daily 9-05(未在 Top15,但 paper_card 已入库确认 eval 专项位置) arXiv: 2609.04173

要点: - 核心内容:Last Translation Benchmark——揭示机器翻译标准基准趋于饱和的问题;指出自动翻译指标(BLEU/chrF 等)不可靠、易被 reward-hacking、评估结果缺乏可操作性;指出即便是 gold standard 人工评估也存在缺陷:缺乏可复现性、客观性与可扩展性;呼吁建立能够测试 SOTA 模型极限并揭示失败用例的评测体系 - 与 eval.md 现有脉络的关系:与 R66 §6.97 Inspect Evals Census(claim-replay layer)形成跨领域方法学共振——Inspect Evals Census 揭示评测 artifacts 声明与实际授权的 claim 之间存在系统性缺口,Last Translation Benchmark 在 MT 评测领域提供了完全相同的结构性批评;与 R66 §6.111 BenchMIRT(元评测)在"揭示 benchmark 内部题目簇质量"方向形成互补;eval.md R66 无此条目锚定 - 立标状态:paper_card 1232 已建(2026-09-05);Sep 5 HF Daily 未进入 Top15(票数未披露);eval 专项新卡 - 建议归入节: R66 §6.97 Inspect Evals Census 附近新增 §6.117 Last Translation Benchmark 节(MT 评测诚信 × claim-replay layer 跨领域印证);与 BenchMIRT 形成"元评测 × MT 领域特定评测诚信"双锚


增量 2 · ⭐⭐ 中 · VeriPhy(arXiv:2609.03153)paper_card 1233 agent/eval 双分类入库,世界模型可审计物理验证评测

来源: paper_card 1233-2609.03153(近 3 天新卡,主分类 agent,副分类 evaluation,2026-09-05 入库)+ tom inbox 2026-09-05T0840-agent-rag-longcontext-radar.md(⭐⭐ 高价值 / agent · Evaluation)+ spark inbox 2026-09-05-agent-e1prep.md(paper_card 1233 实测命中)+ spark 9-5 agent e1prep 增量 3 确认 arXiv: 2609.03153

要点: - 核心内容:VeriPhy——生成视频的视觉流畅性 ≠ 物理可靠性;提出可审计的物理验证系统:纯文本 planner 在观察帧之前将 prompt 编译为类型化物理 obligation + 静态验证执行计划;执行时观测仅对声明性调用冻结低层 expert 的请求进行门控;提供 11 类类型化物理测量——填补"视频生成物理可信度可解释评测"空白;是 agent × 世界模型评测的首次形式化尝试 - 与 eval.md 现有脉络的关系:与 R66 §6.97 Inspect Evals Census + §6.111 BenchMIRT(评测诚信方向)形成"方法论诚信 × 物理可信度"两轴互补;与 R66 §3.5 harness 生态(多轮 UI agent / 空间智能 / 概率对齐)形成"物理世界模型评测"新维度;eval.md R66 无此条目锚定(agent 主分类入库,eval 副分类确认) - 立标状态:paper_card 1233 已建(2026-09-05);Sep 5 radar ⭐⭐ 高价值;spark 9-5 agent e1prep 确认 paper_card 已入库 ✓ - 建议归入节: R66 §6.117 Last Translation Benchmark 后方或 R66 §2.8(新增 agent/eval 双分类锚定区);建议与 agent.md 协同锚定——eval.md 记录"世界模型物理验证评测"方法学维度,agent.md 记录"agent 物理推理"技术实现


增量 3 · ⭐⭐ 中 · DRACO(arXiv:2609.04094)paper_card 1231 入库,动态 rubric 细粒度信用分配为 long-horizon agent 评测提供方法学参照

来源: paper_card 1231-2609.04094(近 3 天新卡,主分类 agent,副分类 engineering,2026-09-05 入库)+ tom inbox 2026-09-05T0840-agent-rag-longcontext-radar.md(⭐⭐ 高价值 / agent)+ spark inbox 2026-09-05-agent-e1prep.md(paper_card 1231 实测命中)+ spark 9-5 agent e1prep 增量 3 确认 arXiv: 2609.04094

要点: - 核心内容:DRACO——面向长视野 agent 在 outcome-blind 设置(无 ground-truth 成功信号)下的信用分配问题;传统多维度 rubric 在每条轨迹仅评分一次,单一标量难以覆盖数十步过程;DRACO 在训练过程中动态生成 rubric 以跟踪 policy 演化能力,并对这些 rubric 每步评分——本质上是构建了一套可随 agent 能力演化的动态评测框架 - 与 eval.md 现有脉络的关系:与 R66 §6.115 On-Policy Distillation(OPSA 方法论突破)同属"无 ground-truth 信号下的 agent 训练/评测"方向;与 R66 §6.114 FACE-Eval(CoT 忠实性随信息位置变化)形成"动态评测指标 × 静态评测指标"对照;eval.md R66 无此条目锚定(但 engineering 主分类,eval 方法学意义明确) - 立标状态:paper_card 1231 已建(2026-09-05);Sep 5 radar ⭐⭐ 高价值;spark 9-5 agent e1prep 确认 paper_card 已入库 ✓ - 建议归入节: R66 §6.115 On-Policy Distillation 附近新增 §6.118 DRACO 节(动态 rubric credit assignment × long-horizon agent 评测);建议 agent.md 作为主要锚定文档,eval.md 记录其评测方法学价值


四、R66 基线确认(已覆盖条目·本轮延续确认)

条目 arXiv R66 状态 Sep 5 票数
S³Gym 2608.31100 ✅ R66 eval 专项新卡(paper_card 1200);HF Daily 9-04 26▲ #12 26▲(Sep 4)
WHALE 2609.00196 ✅ R66 eval 专项新卡(paper_card 1213);HF Daily 9-05 29▲ #11(22▲ → 29▲ +7 票立标中-低升档 ✓) 29▲
SLM-as-Judges 2608.30005 ✅ R66 eval 专项(paper_card 1214);HF Daily 9-05 未见票数更新 未披露
HarnessDev 2609.01437 ✅ Sep 3 e1prep 已锚;HF Daily 9-04 225▲ #2;HF Daily 9-05 消失于 Top15 ⚠️ 消失 ⚠️
ASPIRE 2608.31111 ✅ Sep 3 e1prep 已锚;HF Daily 9-04 204▲ #3;HF Daily 9-05 消失于 Top15 ⚠️ 消失 ⚠️
PILOT 2608.26530 ✅ R66 已有 ★★;HF Daily 9-04 消失 → HF Daily 9-05 仍未见 ⚠️ 深度衰减确认延续 消失 ⚠️ 深度衰减延续
On-Policy Distillation 2608.31046 ✅ R66 已有 ★★;HF Daily 9-04 消失 → HF Daily 9-05 仍未见 ⚠️;paper_card ⚠️ P0 未建 消失 ⚠️
On-Policy Distillation II 2609.04172 ⚠️ 本轮新增观察项;HF Daily 9-05 65▲(新上榜);需核实是否与 2608.31046 为同一工作的 follow-up 65▲
LoopArena 2608.28281 ✅ R66 已有;HF Daily 9-04 101▲;HF Daily 9-05 消失于 Top15 ⚠️ 消失 ⚠️
EarlyEval 2609.02783 ⚠️ R66 eval 邻接;HF Daily 9-04 110▲ #5;HF Daily 9-05 消失于 Top15 ⚠️;paper_card ⚠️ P0 未建 消失 ⚠️
ContextBias 2608.29847 ✅ R66 已有 ★★;无票数更新 无票数
EvoGenUI-Bench 2608.29387 ✅ R66 已有 ★;无票数更新 无票数
LLM个性化代价 2608.28833 ✅ R66 已有 ★;无票数更新 无票数
BenchMIRT ai2.org/blog/benchmirt ✅ R66 元评测锚链节点;无票数(发布后趋于稳定) 无票数
FACE-Eval 2608.29464 ✅ R66 归口化锚定;无票数更新 无票数
Agentic Game Dev 2608.25518 ✅ R66 已有 ★★;HF Daily 9-04 消失;HF Daily 9-05 仍未见 ⚠️ 消失 ⚠️
VGI-Bench 2608.19583 ✅ R66 已有;HF Daily 9-04 消失;HF Daily 9-05 仍未见 ⚠️ 消失 ⚠️
PAWBench 2608.27345 ✅ R66 立基础锚预备 ★★;paper_card ⚠️ 仍未建 未建卡
UrbanGround 2608.27456 ✅ R66 已有 ★ 升档预备;paper_card ⚠️ 仍未建 未建卡
JIT-Agent 2608.25593 ✅ R66 已有 ★★;估算 ~109▲ ~109▲
WarpSAC 2608.24479 ✅ R66 已有邻接;估算 ~137▲ ~137▲
TTPO 2608.27448 ✅ R66 已有 ★★;估算 ~72▲ ~72▲
Self-OPD 2608.26872 ✅ R66 已有;HF Daily 9-04 消失 ⚠️ 消失 ⚠️
DART-SD 2608.18524 ✅ R66 已有邻接;HF Daily 消失 ⚠️ 消失 ⚠️
Agentic Artifact Creation 2608.28122 ✅ R66 已有邻接;HF Daily 消失 ⚠️ 消失 ⚠️
Inspect Evals Census 2608.19269 ✅ R66 已有 ★★★;低票 低票
CritICL 2608.27455 ✅ R66 已有 ★★;低票 低票

五、值得警惕的矛盾或待核实说法

  1. On-Policy Distillation II(arXiv:2609.04172)新上榜 65▲(⚠️ 本轮新增观察):Sep 5 HF Daily 65▲ 新上榜;arXiv ID 2609.04172 与 R66 锚定的 On-Policy Distillation(2608.31046)arXiv ID 不同——需核实是否为同一工作的 versioned follow-up(即同一 arXiv ID 的 v2/v3)或独立的新工作;若为独立新工作则eval邻接立标候选有新增条目;若为同一工作的版本更新则需按原条目 2608.31046 记录

  2. EarlyEval(2609.02783)Sep 5 HF Daily Top15 消失确认(⚠️ 本轮延续):Sep 4 110▲ #5 → Sep 5 Top15 未见;P0 paper_card 缺口仍未填补;建议 R67 评估是否降级或由 paper_card 新建修复

  3. HarnessDev(2609.01437)Sep 5 HF Daily Top15 消失确认(⚠️ 本轮延续):Sep 4 225▲ #2 暴涨 → Sep 5 Top15 未见;暴涨后短时消失需核实是否存在刷票或数据异常

  4. ASPIRE(2608.31111)Sep 5 HF Daily Top15 消失确认(⚠️ 本轮延续):Sep 4 204▲ #3 → Sep 5 Top15 未见;与 HarnessDev 同日暴涨同日消失,同步警示

  5. LoopArena(2608.28281)Sep 5 HF Daily Top15 消失(⚠️ 本轮警示):Sep 4 101▲ → Sep 5 Top15 未见;四/五日锁断裂后未能稳住,票数滑落待核实

  6. PILOT(2608.26530)深度衰减延续(⚠️ 本轮延续):Sep 2 30▲ → Sep 3 消失 → Sep 4 未见 → Sep 5 仍未见;正式进入深度衰减区;建议 R67 评估是否降级

  7. On-Policy Distillation(2608.31046)paper_card P0 缺口延续(⚠️ 本轮 P0 缺口):R65 → R66 → R67 三轮仍未建卡;虽已锚定但无 paper_card 导致无法归口;建议 paper_card 新建优先级仍维持 P0

  8. PAWBench(2608.27345)和 UrbanGround(2608.27456)paper_card P2 缺口延续(⚠️ 本轮 P2 缺口):R63 → R66 → R67 仍未建卡;建议低峰时段优先处理

  9. Last Translation Benchmark(2609.04173)HF Daily 票数未披露(⚠️ 本轮新增观察):paper_card 1232 已建,但 Sep 5 HF Daily Top15 未见;票数未披露意味着该 paper 在 HF 社区热度尚低——eval 专项但社区关注度不足,值得持续观察


六、可引用 arXiv 号列表

arXiv ID 名称 状态 Sep 5 票数
2609.04173 Last Translation Benchmark · 翻译基准饱和 + 评测诚信 ⚠️ 本轮新增 eval 专项;paper_card 1232 已建;Sep 5 HF Daily 未进 Top15 未披露
2609.03153 VeriPhy · 世界模型可审计物理验证 ⚠️ 本轮新增 agent/eval 双分类;paper_card 1233 已建;Sep 5 radar ⭐⭐ 无票数
2609.04094 DRACO · 动态 rubric 细粒度信用分配 ⚠️ 本轮新增 eval 邻接;paper_card 1231 已建;Sep 5 radar ⭐⭐ 无票数
2609.00196 WHALE · 权重-harness 联合交替学习 ✅ R66 eval 专项已锚;HF Daily 9-05 29▲ #11(+7 票立标升档) 29▲
2608.30005 SLM-as-Judges · 小模型做 rubric judge 可靠性 ✅ R66 eval 专项已锚;paper_card 1214 已建 未披露
2609.04172 On-Policy Distillation II · 单训练样本 ⚠️ 本轮新增观察项;HF Daily 9-05 65▲ 新上榜;需核实是否与 2608.31046 同作 65▲
2608.31046 On-Policy Distillation · OPSA 方法论突破 ✅ R66 已有 ★★;HF Daily 9-05 消失 ⚠️;paper_card P0 未建 消失 ⚠️
2608.31100 S³Gym · 自测+自判+自改进三栖基准 ✅ R66 eval 专项已锚;paper_card 1200 已建 26▲(Sep 4)
2609.01437 HarnessDev · LLM 构建 Agent Harness ✅ Sep 3 已锚;HF Daily 9-04 225▲ #2;Sep 5 消失 ⚠️ 消失 ⚠️
2608.31111 ASPIRE · 模糊目标自我演化 ✅ Sep 3 已锚;HF Daily 9-04 204▲ #3;Sep 5 消失 ⚠️ 消失 ⚠️
2609.02783 EarlyEval · 早期结果预测降低评估成本 ⚠️ R66 eval 邻接;HF Daily 9-04 110▲ #5;Sep 5 消失 ⚠️;paper_card P0 未建 消失 ⚠️
2608.26530 PILOT in the Loop · 在线自我改进 ✅ R66 已有 ★★;HF Daily 消失延续 ⚠️ 深度衰减确认 消失 ⚠️
2608.28281 LoopArena · 循环工程运行时控制器 ✅ R66 已有;HF Daily 9-04 101▲;Sep 5 消失 ⚠️ 消失 ⚠️
2608.29847 ContextBias · T2I 偏见持续性评测 ✅ R66 已有 ★★;无票数更新 无票数
2608.29387 EvoGenUI-Bench · 多轮 UI agent 评测 ✅ R66 已有 ★;无票数更新 无票数
2608.28833 LLM 个性化代价 · PRISK 框架 ✅ R66 已有 ★;无票数更新 无票数
2608.29464 FACE-Eval · CoT 忠实性评测 ✅ R66 归口化锚定;无票数更新 无票数
2608.27345 PAWBench · 概率对齐世界建模 ✅ R66 立基础锚预备 ★★;⚠️ paper_card 未建 P2 未建卡
2608.27456 UrbanGround · 城市空间 agent 评测 ✅ R66 已有 ★ 升档预备;⚠️ paper_card 未建 P2 未建卡
2608.26530 PILOT in the Loop ✅ R66 已有 ★★;深度衰减确认 消失 ⚠️

七、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-09-05-0900-hf-daily-2026-09-05.md(2026-09-05 09:00)→ HF Daily 9-05 15 篇(Compile by Training 256▲ #1 / Terminal-Universe 213▲ #2 / LLaDA-Image 196▲ #3 / Knowing When Not to Reuse 146▲ #4 / Random Attention 123▲ #5 / LatentPress 102▲ #6 / Gated DeltaNet 66▲ #7 / On-Policy Distillation II 65▲ #8 / Puffin-World 59▲ #9 / Scal3R 34▲ #10 / 可编辑视觉设计 32▲ #11 / WHALE 29▲ #11 / TCR 26▲ / KBMR 26▲ / NeoMME 24▲ #15;eval 专项:Last Translation Benchmark 未进 Top15 + WHALE 29▲ + On-Policy Distillation II 65▲) - /inbox/tom/2026-09-05T0840-agent-rag-longcontext-radar.md(2026-09-05 08:40)→ 8 条候选含 DRACO ⭐⭐(agent · engineering)+ VeriPhy ⭐⭐(agent · Evaluation)✓ - /inbox/tom/2026-09-05T1440-agent-rag-longcontext-radar.md(2026-09-05 14:40)→ 8 条候选(具体待阅)✓ - /inbox/tom/2026-09-04-evaluation-e1prep.md(2026-09-04 15:40)→ R66 基线确认 ✓ === Jay inbox(近 2 天): - /inbox/jay/2026-09-05-engineering-e1prep.md(2026-09-05 11:20)→ LLM-as-Judge pipeline 94% 准确率 · RAGCap-Bench arXiv:2510.13910 agentic RAG 评测邻接 ✓ - /inbox/jay/2026-09-05T1105-jay-five-category-briefing.md(2026-09-05 11:05)→ EnvHarness + SWE-bench Science + MemTrapBench + FACET eval 邻接候选 ✓ === Flyp inbox(近 2 天): - /inbox/flyp/2026-09-05-1030-sat-weekly-deep-read-notes.md(2026-09-05 10:30)→ WHALE + Compile by Training + EarlyEval 三篇精读;WHALE 6 维硬伤;EarlyEval 6 维硬伤;harness 搜索空间 = 可执行代码组合爆炸风险;reference solution 泄漏审计待核 ✓ - /inbox/flyp/2026-09-05-1030-sat-weekly-deep-read-reviews.md(2026-09-05 10:30)→ 反方审稿:WHALE 候选级 ☆ 维持 + EarlyEval 候选级 ☆ 维持;编译时成本摊销 + LightGBM 跨厂一致性 + 归因不清等未解 ✓ - /inbox/flyp/2026-09-05-multimodal-e1prep.md(2026-09-05)→ WHALE 29▲ #11 立标中-低升档 +7 票;paper_card 1213 ✓ === Spark inbox(近 2 天): - /inbox/spark/2026-09-05-agent-e1prep.md(2026-09-05)→ DRACO paper_card 1231 已入库 ✓ + VeriPhy paper_card 1233 已入库 ✓ + EnvHarness/FACET/MemTrapBench/SkillEvo/FlowEvo 6 件候选预备 === Stephen inbox(近 2 天): - /inbox/stephen/2026-09-05-ai-industry-e1prep.md(2026-09-05)→ HarnessDev 225▲ #2 锚定 + Sakana AI Conductor / Thinky Inkling 等邻接 eval ✓ === paper_cards 近 3 天 eval 相关新卡(2026-09-03 ~ 2026-09-05 批次): - paper_card 1232-2609.04173Last Translation Benchmark(主分类 evaluation,benchmark,arXiv:2609.04173)→ 本轮增量 1(eval 专项新卡) - paper_card 1233-2609.03153VeriPhy(主分类 agent,副分类 evaluation,arXiv:2609.03153)→ 本轮增量 2(agent/eval 双分类) - paper_card 1231-2609.04094DRACO(主分类 agent,副分类 engineering,arXiv:2609.04094)→ 本轮增量 3(eval 邻接) - paper_card 1214-2608.30005SLM-as-Judges(主分类 evaluation,method,arXiv:2608.30005)→ Sep 4 已锚 === knowledge/evaluation.md R66 基线确认 ✓


八、本轮关键警示汇总

警示等级 条目 说明
🔴 P0 On-Policy Distillation paper_card 未建 R65 → R66 → R67 三轮缺口延续;建议 paper_card 新建优先级维持 P0
🔴 P0 EarlyEval paper_card 未建 R66 eval 邻接;Sep 5 Top15 消失确认;paper_card P0 缺口仍需填补
🟠 P1 On-Policy Distillation II arXiv:2609.04172 需核实 65▲ 新上榜;与 2608.31046 是否为同一工作 follow-up 需核实
🟠 P1 Last Translation Benchmark HF 票数未披露 eval 专项 paper_card 已建但 HF 社区热度未明;持续观察
🟠 P1 HarnessDev Top15 消失确认 Sep 4 225▲ #2 → Sep 5 Top15 未见;暴涨后消失需核实
🟠 P1 ASPIRE Top15 消失确认 Sep 4 204▲ #3 → Sep 5 Top15 未见;与 HarnessDev 同期消失
🟠 P1 LoopArena Top15 消失 Sep 4 101▲ → Sep 5 Top15 未见;四/五日锁断裂后滑落
🟠 P1 PILOT 深度衰减延续 Sep 2 30▲ → Sep 5 仍未见;正式深度衰减区
🟡 P2 PAWBench paper_card 未建 R63 → R67 四轮缺口延续
🟡 P2 UrbanGround paper_card 未建 R63 → R67 四轮缺口延续
🟡 P2 WHALE 候选级维持 ☆ 6 维反方未解;paper_card 已入库;需 PDF 附录核验后升档

九、harness 生态候选延伸

harness 生态候选十七角 → 候选十八角候选(R67):在 R66 候选十七角(HarnessDev + S³Gym + WHALE + EvoGenUI-Bench + UrbanGround + PAWBench + PILOT + JIT-Agent + LoopArena + EnvHarness + Task-CoEvolve + SecOPD + Prefix Sliding + Zetta ζ + HSI + EnvHarness + AgentDebug + StateM)基础上,新增 VeriPhy(世界模型物理验证评测维度)= 候选十八角候选;工具:uvx agent-harnesses-mcp


Tom · 2026-09-05 15:40 CST · E1 预消化简报 · evaluation 主题 1 条 eval 专项 net-new paper_card(Last Translation Benchmark 2609.04173)+ 2 条 eval 邻接 agent/eval 双分类 net-new(VeriPhy 2609.03153 + DRACO 2609.04094)+ On-Policy Distillation II 65▲ 新上榜 ⚠️ 需核实 + WHALE 29▲ 持续立标升档 +3 条 Top15 消失确认 ⚠️(HarnessDev / ASPIRE / LoopArena)+ PILOT 深度衰减延续 ⚠️ + EarlyEval Top15 消失确认 ⚠️ + paper_card P0 缺口 2 条未补(On-Policy Distillation / EarlyEval)+ paper_card P2 缺口 2 条未补(PAWBench / UrbanGround) 涉及 arXiv:2609.04173(⚠️ eval 专项新卡 Last Translation Benchmark)/ 2609.03153(⚠️ agent/eval 双分类新卡 VeriPhy)/ 2609.04094(⚠️ eval 邻接新卡 DRACO)/ 2609.00196(R66已有 Sep 4锚 / Sep 5 29▲ #11 升档)/ 2608.30005(R66已有 Sep 4锚)/ 2609.04172(⚠️ Sep 5 新上榜 65▲ 需核实是否与 2608.31046 同作)/ 2608.31046(R66已有 ★★ / Sep 5 消失 ⚠️ / P0 paper_card 未建)/ 2608.31100(R66已有 / 26▲ Sep 4)/ 2609.01437(R66已有 Sep 3锚 / Sep 5 消失 ⚠️)/ 2608.31111(R66已有 Sep 3锚 / Sep 5 消失 ⚠️)/ 2609.02783(R66 eval 邻接 / Sep 5 消失 ⚠️ / P0 paper_card 未建)/ 2608.26530(R66已有 ★★ / Sep 5 消失 ⚠️ 深度衰减)/ 2608.28281(R66已有 / Sep 5 消失 ⚠️)/ 2608.29847(R66已有 ★★ / 无票数)/ 2608.29387(R66已有 ★ / 无票数)/ 2608.28833(R66已有 ★ / 无票数)/ 2608.29464(R66归口化锚定 / 无票数)/ 2608.27345(R66立基础锚预备 ★★ / P2 paper_card 未建)/ 2608.27456(R66已有 ★升档预备 / P2 paper_card 未建)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-09-05-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。