evaluation · E1 预消化简报(2026-09-03)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-09-01 下午 ~ 2026-09-03 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R65 → R66)预习备料,聚焦尚未进入 R65 基线的增量条目


一、信源检查记录

本次覆盖(窗口:2026-09-01 下午 ~ 2026-09-03 15:40 CST):

  • work-queue.md ✓(2026-09-03 14:00 落盘:待建卡 8 · 高价值待深度解读 Top15 0 · 选题榜未成视频脚本 1 件 = 2609.01601(ACToR,rag 主分类))
  • inbox/tom(9-1~9-3):
  • 2026-09-01-evaluation-e1prep.md(R65 基线确认 ✓)
  • 2026-09-02-evaluation-e1prep.md(R65 详细 ✓)
  • 2026-09-03-0900-hf-daily-2026-09-03.md(HF Daily 9-03,15篇)
  • 2026-09-03T0840-agent-rag-longcontext-radar.md(8 条候选,含 AgentJudgeBench ⭐⭐⭐⭐ + Agent Memory EAL ⭐⭐⭐⭐)
  • 2026-09-03T1440-agent-rag-longcontext-radar.md(8 条候选,含 Harness-of-Harness ⭐⭐⭐⭐ + S³Gym + SnapBench)
  • 2026-09-03-rag-e1prep.md(rag 主轴,含 AgentJudgeBench RAG-adjacent 邻接 ✓)
  • inbox/jay(9-1~9-3):
  • 2026-09-03-engineering-e1prep.md(含 Harness-of-Harness paper_card 1180 + Acquire-Repair-Preserve paper_card 1154;eval 邻接为主 ✓)
  • 2026-09-03T1050-jay-inference-agent-engineering-filter.md(vLLM/SGLang/TensorRT-LLM benchmark;eval 邻接 ✓)
  • 2026-09-03T1505-jay-five-category-afternoon-briefing.md(含 Agent Harness 六层测试栈 + 12 指标评估框架;eval 邻接 ✓)
  • 2026-09-03T1450-jay-engineering-agents-testing-kozuchi-afternoon.md(engineering agent testing;eval 邻接 ✓)
  • inbox/flyp(9-1~9-3):
  • 2026-09-02-LoopArena-controller-loop-engineering-critical-read.md(LoopArena 精读批判;eval 邻接 ✓)
  • 2026-09-03-1000-rss-cameron-wolfe.md(Agentic RL 系列;eval 邻接为主 ✓)
  • inbox/spark(9-1~9-3):
  • 2026-09-03-agent-e1prep.md(v79 备料,含 AgentJudgeBench paper_card 1194 实测命中 + Token-Efficient Data Reasoning paper_card 1192 实测命中;eval 邻接 ✓)
  • inbox/stephen(9-1~9-3):
  • 2026-09-02-1245-coord-check.md(冲突 #17 BenchMIRT 元评测;eval 邻接 ✓)
  • 2026-09-03-1245-coord-check.md(9-3 早盘协调,冲突 #30-32;eval 无专项净增高价值 ✓)
  • 2026-09-03-ai-industry-e1prep.md(ai-industry 主轴,含 Claude Fable/Mythos 5.1 / BenchMIRT;eval 邻接 ✓)
  • paper_cards 近 3 天 eval 相关新卡(已扫全量 1177~1194 共 18 张)
  • paper_card 1180-2609.01481Harness-of-Harness(主分类 evaluation / 形态 method / 副分类 agent / arXiv:2609.01481)——多日自主软件开发持续改进框架;70+ 迭代;eval 专项新卡
  • paper_card 1194-2608.26623AgentJudgeBench(主分类 evaluation / 形态 benchmark / 副分类 agent / arXiv:2608.26623)——LLM judge 在 agentic tool-calling DAG 上的可靠性基准;3,808 实例 × 6 DAG × 3 难度;eval 专项新卡
  • 2 张 eval 专项 net-new paper_card(vs R65 基线:Harness-of-Harness + AgentJudgeBench)
  • knowledge/evaluation.md R65 基线确认(R65:ContextBias + EvoGenUI-Bench 双立标候选 + LLM 个性化代价 24▲ eval 主分类首次出现 + On-Policy Distillation 100▲ #1 新上榜 + LoopArena 99▲ +12▲ 三日锁 + DART-SD 88▲ +27▲ 暴涨 + BenchMIRT 元评测 + paper_card 未建 1 条警示(On-Policy Distillation)+ PILOT 30▲ 衰减确认 + 立标池饱和度 v44-v66 廿三日连续)

二、增量摘要

本轮(E1-R66,窗口 2026-09-01 下午 ~ 2026-09-03 下午)eval 主题 eval 专项 net-new paper_card 新增 2 条(Harness-of-Harness + AgentJudgeBench);eval 相关投票极显著变化 3 件(PILOT 衰减确认消失于 HF Daily Top15 / On-Policy Distillation 疑似暴跌 ⚠️ 待核实 / UI-Venus-2 25▲ eval 主分类新上榜);harness 生态候选十七角候选 → 候选十八角候选(新增 Harness-of-Harness)。

eval 专项净新增量 2 条。 本轮最重要的信号是:HF Daily Sep 3 中 PILOT(30▲ Sep 2)消失于 Top15(估算 <25▲),正式衰减进入深水区;On-Policy Distillation(100▲ Sep 2 #1)在 Sep 3 Top15 中完全消失(⚠️ 疑似暴跌至 <19▲,数据收集缺口待核实);Harness-of-Harness(2609.01481)和 AgentJudgeBench(2608.26623)两张 paper_card 同批次入库,主分类均为 evaluation。


三、增量条目


增量 1 · ⭐⭐ 中 · Harness-of-Harness(arXiv:2609.01481)paper_card 1180 eval 专项新卡入库,多日自主软件开发 eval 专项

来源: paper_card 1180-2609.01481(近 3 天新卡,主分类 evaluation,形态 method,2026-09-03 入库)+ tom inbox 2026-09-03T1440-agent-rag-longcontext-radar.md(⭐⭐⭐⭐ 高价值)+ jay inbox 2026-09-03-engineering-e1prep.md(paper_card 1180 锚定) arXiv: 2609.01481

要点: - 核心内容:Harness-of-Harness(HoH)——编码 agent 在无人工干预下将高层需求转化为完整可用软件系统;运行于现有编码 agent 框架之上,将执行组织为迭代的规划—编码—测试循环;在 70+ 迭代的多日部署中自主开发了一款含完整核心机制、可玩体验、精美视觉与集成音频的第一人称射击游戏 - 与 eval.md 现有脉络的关系:与 R65 §6.110 LoopArena(单任务 loop 控制器评测)形成"单次任务 vs 多日持续改进"对位;与 engineering.md §2.2 AgentChaos / ReliabilityBench / AgentChaosBench 形成"故障注入/压力测试 → 持续改进 harness 的 harness"递进;eval.md R65 无此条目锚定 - 立标状态:paper_card 1180 已建;HF Daily 无票数数据(未上榜 Top15);jay engineering-e1prep 已锚定 - 建议归入节: R65 §3.5 harness 生态候选十七角候选邻接延伸(多日持续改进评测层);§6.112-§6.115 附近新增 §6.116 HoH 节;建议与 LoopArena 形成 harness 生态"单次 vs 多日"双节点


增量 2 · ⭐⭐ 中 · AgentJudgeBench(arXiv:2608.26623)paper_card 1194 eval 专项新卡入库,LLM Judge 可靠性评测 eval 专项

来源: paper_card 1194-2608.26623(近 3 天新卡,主分类 evaluation,形态 benchmark,2026-09-03 入库)+ tom inbox 2026-09-03T0840-agent-rag-longcontext-radar.md(⭐⭐⭐⭐ 高价值 / HF Daily 16 票)+ spark inbox 2026-09-03-agent-e1prep.md(paper_card 1194 实测命中) arXiv: 2608.26623

要点: - 核心内容:首个系统研究 LLM-as-a-Judge 在 agentic tool-calling DAG 上可靠性的基准;3,808 实例 × 6 种 DAG 拓扑 × 3 个难度层级;评测 5 个生成器(3B-70B + GPT-5.4)和 6 个 judge(20B 到 frontier);发现 ground-truth 存在时 vs 不存在时 judge 表现差异显著 - 与 eval.md 现有脉络的关系:与 R65 §6.97 Inspect Evals Census(claim-replay layer 评测诚信)同属"评测诚信/评测方法学"方向;与 R65 §6.115 On-Policy Distillation(范式质疑)形成"judge 可靠性 → distillation 范式"评测方法学双锚;eval.md R65 §3.3 Q105.193 预备级锚入 - 立标状态:paper_card 1194 已建;HF Daily 16 票(paper_card 来源标注);spark v79 已实测命中锚定 - 建议归入节: R65 §4 维度矩阵"LLM-as-Judge 可靠性评测"新节点 + §6.116 附近新增 §6.117 AgentJudgeBench 节;与 Inspect Evals Census 形成"judge 可靠性 vs 评测 license"互补


增量 3 · ⭐ 中 · UI-Venus-2 25▲ HF Daily eval 主分类新上榜(arXiv:2609.00028,eval 专项邻接)

来源: tom inbox 2026-09-03-0900-hf-daily-2026-09-03.md(HF Daily 9-03 #5,25▲) arXiv: 2609.00028

要点: - 首次上榜:HF Daily 9-03 Top15 中以 eval 主分类出现(25▲),eval.md R65 无此条目锚定 - 核心内容:UI-Venus-2 技术报告——评估大语言模型在 UI 操作任务上的表现(多模态 UI agent 评测) - 与 eval.md 现有脉络的关系:与 R65 §6.113 EvoGenUI-Bench(多轮生成式 UI agent 评测)形成"UI agent benchmark"双锚;两者均测 UI 交互能力,但 EvoGenUI-Bench 测多轮生成式 UI,UI-Venus-2 测 UI 操作任务 - 立标状态:25▲(HF Daily 9-03 #5);票数偏低但 eval 专项信号明确 - paper_card 状态:⚠️ paper_card 1183 已建(主分类 multimodal),但 eval.md R65 无锚定 - 建议归入节: R65 §4 维度矩阵"UI agent 评测"新节点(与 EvoGenUI-Bench 并列);建议 paper_card 1183 邻接 eval.md 锚定确认


四、R65 基线确认(已覆盖条目·本轮延续确认)

条目 arXiv R65 状态 Sep 3 票数
Agentic Game Dev 2608.25518 ✅ R65 已有 ★★;HF Daily 9-03 未在 Top15(估算 ~185▲ 无更新 ⚠️ 消失待核实) ~185▲ ⚠️
PAWBench 2608.27345 ✅ R65 立基础锚预备 ★★;HF Daily 9-03 未在 Top15(估算 ~138▲ 无更新) ~138▲
UrbanGround 2608.27456 ✅ R65 已有 ★→★★ 升档预备;HF Daily 9-03 未在 Top15(估算 ~106▲ 无更新) ~106▲
VGI-Bench 2608.19583 ✅ R65 已有;HF Daily 9-03 未在 Top15(估算 ~173▲ 无更新) ~173▲
PILOT 2608.26530 ✅ R65 已有 ★★;HF Daily 9-03 消失于 Top15 ⚠️(Sep 2 确认 30▲,Sep 3 估算 <25▲) <25▲ ⚠️
LoopArena 2608.28281 ✅ R65 已有;HF Daily 9-03 93▲(Sep 2 99▲ #2 → Sep 3 93▲;-6▲,三日锁断裂待确认) 93▲ ⚠️
JIT-Agent 2608.25593 ✅ R65 已有 ★★;HF Daily 9-03 未在 Top15(估算 ~109▲ 无更新) ~109▲
WarpSAC 2608.24479 ✅ R65 已有邻接;HF Daily 9-03 未在 Top15(估算 ~137▲ 无更新) ~137▲
TTPO 2608.27448 ✅ R65 已有 ★★;HF Daily 9-03 未在 Top15(估算 ~72▲ 无更新) ~72▲
Self-OPD 2608.26872 ✅ R65 已有;HF Daily 9-03 未在 Top15(估算 ~71▲ 无更新 ⚠️) ~71▲ ⚠️
DART-SD 2608.18524 ✅ R65 已有邻接;HF Daily 9-03 未在 Top15(Sep 2 88▲ #4;⚠️ 估算 <25▲) <25▲ ⚠️
Agentic Artifact Creation 2608.28122 ✅ R65 已有邻接;HF Daily 9-03 25▲(Sep 2 56▲ #7 → Sep 3 25▲;-31▲) 25▲
On-Policy Distillation 2608.31046 ✅ R65 已有 ★★;HF Daily 9-03 消失于 Top15 ⚠️(Sep 2 100▲ #1 → Sep 3 估算 <19▲;疑似暴跌) <19▲ ⚠️
ContextBias 2608.29847 ✅ R65 已有 ★★;HF Daily 9-03 未在 Top15(无票数更新) 无票数
EvoGenUI-Bench 2608.29387 ✅ R65 已有 ★;HF Daily 9-03 未在 Top15(无票数更新) 无票数
LLM个性化代价 2608.28833 ✅ R65 已有 ★;HF Daily 9-03 未在 Top15(Sep 2 24▲ #15;⚠️ 可能已跌出) <19▲ ⚠️
ASI-Bench 2608.17271 ✅ R65 衰减跌出(连续 14+ 日跌出确认) 跌出
Inspect Evals Census 2608.19269 ✅ R65 已有 ★★★ 低票
CritICL 2608.27455 ✅ R65 已有 ★★(paper_card 1129) 低票

五、值得警惕的矛盾或待核实说法

  1. PILOT(2608.26530)消失于 HF Daily Sep 3 Top15(⚠️ 本轮新增警示): Sep 2 确认 30▲;Sep 3 Top15 中完全消失,估算 <25▲——正式进入深度衰减区;R65 已确认"正式衰减确认",本轮升级为"深度衰减确认";建议 R66 评估是否仍维持 ★★ 等级

  2. On-Policy Distillation(2608.31046)疑似暴跌(⚠️ 本轮新增警示): Sep 2 HF Daily 100▲ #1 登顶;Sep 3 Top15 中完全消失(估算 <19▲)——若属实,为 eval 邻接立标预备有史以来最速衰减案例之一;若为数据收集缺口则需修正;paper_card ⚠️ 仍未建(P0 缺口)

  3. Agentic Game Dev(2608.25518)消失于 HF Daily Sep 3 Top15(⚠️ 本轮新增警示): Sep 2 估算 ~185▲ 无 HF Daily 更新;Sep 3 Top15 未见;估算仍在 ~185▲ 但无法确认——若真实跌落则需降级预警

  4. LoopArena(2608.28281)三日锁断裂(⚠️ 本轮新增警示): Sep 2 99▲ #2;Sep 3 93▲(-6▲);虽然仍在前 15,但三日锁结构已断;R65 已确认 flyp critical-read 已落盘 + GitHub 已开源;建议 R66 评估票数下跌是否影响 ★→★★ 升档节奏

  5. DART-SD(2608.18524)疑似暴跌(⚠️ 本轮新增警示): Sep 2 88▲ #4(+27▲ 暴涨);Sep 3 消失于 Top15(估算 <25▲)——若属实,为 eval 邻接又一次极速衰减

  6. Harness-of-Harness(2609.01481)paper_card 1180 eval 专项新卡入库但 HF Daily 无票数: paper_card 1180 主分类 evaluation 已建;但 HF Daily 无上榜记录;eval 邻接信号待观测

  7. BenchMIRT 元评测 arXiv 号仍未核实(⚠️ R65 延续警示): stephen coord-check 冲突 #17 部分闭环,BenchMIRT 技术细节仍未在 stephen 9-3 e1prep 中展开;建议 R66 确认 arXiv 号

  8. On-Policy Distillation(2608.31046)paper_card 仍未建(⚠️ R65 延续 P0 缺口): R65 已标注;本轮消失于 HF Daily Top15 进一步削弱建卡紧迫性,但仍需建卡以完成 anchor list 覆盖

  9. PAWBench(2608.27345)和 UrbanGround(2608.27456)paper_card 仍未建(⚠️ R63→R65→本轮仍未建): PAWBench ~138▲ 维持立基础锚预备阈值;UrbanGround ~106▲ 维持 ★→★★ 升档预备;建议 R66 确认 paper_card 新建进度


六、可引用 arXiv 号列表

arXiv ID 名称 状态 Sep 3 票数
2609.01481 Harness-of-Harness · 多日自主 SW 开发持续改进 ⚠️ 本轮新增 eval 专项;paper_card 1180 已建;HF Daily 无票数 无票数
2608.26623 AgentJudgeBench · LLM Judge 可靠性基准 ⚠️ 本轮新增 eval 专项;paper_card 1194 已建;HF Daily 16 票 16▲
2609.00028 UI-Venus-2 · UI 操作任务 LLM 评测 ⚠️ 本轮新增 eval 主分类;paper_card 1183 已建(multimodal);eval.md R65 无锚定 25▲
2609.01836 Agent Memory EAL · 内生授权洗白 ⚠️ 本轮新增 eval 邻接;paper_card 1187 已建(agent 主分类);EAL-Bench 评测邻接 2▲(tom 0840 radar 标注)
2608.31046 On-Policy Distillation · 从噪声教师到自我提升 ✅ R65 已有 ★★;HF Daily 9-03 消失 ⚠️(Sep 2 100▲ #1 → 估算 <19▲) <19▲ ⚠️
2608.26530 PILOT in the Loop · 在线自我改进 ✅ R65 已有 ★★;HF Daily 9-03 消失 ⚠️(Sep 2 30▲ → 估算 <25▲ 深度衰减) <25▲ ⚠️
2608.28281 LoopArena · 循环工程运行时控制器基准 ✅ R65 已有;HF Daily 9-03 93▲(-6▲ 三日锁断裂 ⚠️) 93▲ ⚠️
2608.18524 DART-SD · 多轮工具调用 Agent 自蒸馏 ✅ R65 已有邻接;HF Daily 9-03 消失 ⚠️(Sep 2 88▲ → 估算 <25▲) <25▲ ⚠️
2608.28122 Agentic Artifact Creation · Agentic 制品创建综述 ✅ R65 已有邻接;HF Daily 9-03 25▲(-31▲) 25▲
2608.25518 Agentic Game Dev · 可验证轨迹数据引擎 ✅ R65 已有 ★★;HF Daily 9-03 消失 ⚠️(估算 ~185▲ 无确认) ~185▲ ⚠️
2608.27345 PAWBench · 概率对齐世界建模评测 ✅ R65 立基础锚预备 ★★;估算 ~138▲ ⚠️ paper_card 未建 ~138▲
2608.27456 UrbanGround · 城市空间智能体评测 ✅ R65 已有 ★ 升档预备;估算 ~106▲ ⚠️ paper_card 未建 ~106▲
2608.19583 VGI-Bench · 视频生成视觉智能探测 ✅ R65 已有;估算 ~173▲(无确认) ~173▲ ⚠️
2608.27448 TTPO · 测试时策略优化 ✅ R65 已有 ★★;估算 ~72▲(无确认) ~72▲
2608.25593 JIT-Agent · JIT harness intelligence ✅ R65 已有 ★★;估算 ~109▲(无确认) ~109▲
2608.24479 WarpSAC · 可扩展 off-policy RL ✅ R65 已有邻接;估算 ~137▲(无确认) ~137▲
2608.26872 Self-OPD · Flow Matching on-policy distillation ✅ R65 已有;估算 ~71▲ ⚠️ Sep 3 消失待核实 ~71▲ ⚠️
2608.29847 ContextBias · T2I 偏见持续性评测 ✅ R65 已有 ★★;无 HF Daily 票数更新 无票数
2608.29387 EvoGenUI-Bench · 多轮 UI agent 可执行评测 ✅ R65 已有 ★;无 HF Daily 票数更新 无票数
2608.28833 LLM个性化代价 · 个性化隐式代价评测 ✅ R65 已有 ★;Sep 3 消失 ⚠️(Sep 2 24▲ #15 → 估算 <19▲) <19▲ ⚠️
2608.17271 ASI-Bench ✅ R65 衰减跌出(连续 14+ 日跌出确认) 跌出
2608.19269 Inspect Evals Census · 评测诚信 claim-replay layer ✅ R65 已有 ★★★(paper_card 1133) 低票
2608.27455 CritICL · critique-based test-time evaluation ✅ R65 已有 ★★(paper_card 1129) 低票

七、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-09-01-evaluation-e1prep.md(2026-09-01 15:40)→ R65 基线确认 ✓ - /inbox/tom/2026-09-02-evaluation-e1prep.md(2026-09-02 15:40)→ R65 详细 ✓ - /inbox/tom/2026-09-03-0900-hf-daily-2026-09-03.md(2026-09-03 09:00)→ HF Daily 9-03 15 篇(StudentSim 464▲ #1 / Qwen-Drive-1.0 340▲ #2 / DreamX-Creator 93▲ #3 / SMELT 75▲ #4 / UI-Venus-2 55▲ #5 / H3-World 42▲ #6 / ZimaBlue 39▲ #7 / From Production Traffic 31▲ #8 / Hi-Q 26▲ #9 / LightNav-0 26▲ #10 / Super Library Agent 25▲ #11 / LLM个性化代价 25▲ #12 / Drone VLA 21▲ #13 / Multimodal CoWT 21▲ #14 / Safin-1 19▲ #15;eval 专项:UI-Venus-2 25▲ + LLM个性化代价 25▲ ⚠️消失) - /inbox/tom/2026-09-03T0840-agent-rag-longcontext-radar.md(2026-09-03 08:40)→ 8 条候选含 AgentJudgeBench ⭐⭐⭐⭐⭐(HF Daily 16 票)+ Agent Memory EAL ⭐⭐⭐⭐(HF Daily 2 票)✓ - /inbox/tom/2026-09-03T1440-agent-rag-longcontext-radar.md(2026-09-03 14:40)→ 8 条候选含 Harness-of-Harness ⭐⭐⭐⭐(HF Daily 14 票)+ S³Gym ⭐⭐⭐ + SnapBench ⭐⭐ ✓ - /inbox/tom/2026-09-03-rag-e1prep.md(2026-09-03 08:50)→ rag 主轴,含 AgentJudgeBench RAG-adjacent 邻接 ✓ === Jay inbox(近 2 天): - /inbox/jay/2026-09-03-engineering-e1prep.md(2026-09-03 11:20)→ Harness-of-Harness paper_card 1180(eval/agent)+ Acquire-Repair-Preserve paper_card 1154(engineering/agent);eval 邻接为主 ✓ - /inbox/jay/2026-09-03T1505-jay-five-category-afternoon-briefing.md(2026-09-03 15:05)→ Agent Harness 六层测试栈 + 12 指标评估框架;eval 邻接 ✓ - /inbox/jay/2026-09-03T1050-jay-inference-agent-engineering-filter.md(2026-09-03 10:50)→ vLLM/SGLang/TensorRT-LLM benchmark;eval 邻接 ✓ - /inbox/jay/2026-09-03T1450-jay-engineering-agents-testing-kozuchi-afternoon.md(2026-09-03 14:50)→ engineering agent testing;eval 邻接 ✓ === Flyp inbox(近 2 天): - /inbox/flyp/2026-09-02-LoopArena-controller-loop-engineering-critical-read.md(2026-09-02 09:50)→ LoopArena 精读批判;eval 邻接 ✓ - /inbox/flyp/2026-09-03-1000-rss-cameron-wolfe.md(2026-09-03 10:00)→ Agentic RL 系列;eval 邻接为主 ✓ === Spark inbox(近 2 天): - /inbox/spark/2026-09-03-agent-e1prep.md(2026-09-03 13:30)→ AgentJudgeBench paper_card 1194 实测命中 + Token-Efficient Data Reasoning paper_card 1192 实测命中;eval 邻接 ✓ === Stephen inbox(近 2 天): - /inbox/stephen/2026-09-02-1245-coord-check.md(2026-09-02 12:45)→ 冲突 #17 BenchMIRT 元评测;eval 邻接 ✓ - /inbox/stephen/2026-09-03-1245-coord-check.md(2026-09-03 12:45)→ 9-3 早盘协调;冲突 #30-32;eval 无专项净增高价值 ✓ - /inbox/stephen/2026-09-03-ai-industry-e1prep.md(2026-09-03 10:24)→ ai-industry 主轴,含 Claude Fable/Mythos 5.1 / BenchMIRT;eval 邻接 ✓ === paper_cards 近 3 天 eval 相关新卡(9-3 批次 1177~1194 共 18 张): - paper_card 1180-2609.01481Harness-of-Harness(主分类 evaluation,method,agent 副分,arXiv:2609.01481)→ 本轮增量 1(eval 专项新卡) - paper_card 1194-2608.26623AgentJudgeBench(主分类 evaluation,benchmark,agent 副分,arXiv:2608.26623)→ 本轮增量 2(eval 专项新卡) - paper_card 1187-2609.01836Agent Memory EAL(主分类 agent,method;EAL-Bench eval 邻接) - paper_card 1183-2609.00028UI-Venus-2(主分类 multimodal;eval 主分类邻接;HF Daily 25▲)→ 本轮增量 3(eval 主分类新上榜) === knowledge/evaluation.md R65 基线确认 ✓


八、本轮关键警示汇总

警示等级 条目 说明
🔴 P0 On-Policy Distillation paper_card 未建 R65 P0 缺口延续;本轮消失于 HF Daily Top15 后更需建卡锚定
🔴 P0 On-Policy Distillation 疑似暴跌 Sep 2 100▲ #1 → Sep 3 估算 <19▲;数据缺口 vs 真实衰减待核实
🟠 P1 PILOT 深度衰减 Sep 2 30▲ → Sep 3 消失(<25▲);建议评估是否仍维持 ★★
🟠 P1 LoopArena 三日锁断裂 Sep 2 99▲ → Sep 3 93▲(-6▲);三日锁结构断裂
🟠 P1 Agentic Game Dev Top15 消失 Sep 3 Top15 未见;估算 ~185▲ 但无法确认
🟠 P1 DART-SD 疑似暴跌 Sep 2 88▲ → Sep 3 消失(<25▲)
🟡 P2 BenchMIRT arXiv 号未核实 R65 延续;stephen 9-3 e1prep 技术细节未展开
🟡 P2 PAWBench paper_card 未建 R63→R65→本轮仍未建
🟡 P2 UrbanGround paper_card 未建 R63→R65→本轮仍未建
🟡 P2 Harness-of-Harness HF Daily 无票数 paper_card 1180 已建但无 HF 社区验证

九、harness 生态候选延伸

harness 生态候选十七角 → 候选十八角候选(R66):在 R65 候选十七角(StateM + HarnessEval-W + HarnessRisk + Zetta ζ + HSI + EnvHarness + HarnessEval-W cs.CV + AgentDebug + Task-CoEvolve + SecOPD + Prefix Sliding + PILOT live self-improvement + JIT-Agent + PAWBench + UrbanGround + LoopArena + EvoGenUI-Bench)基础上,新增 Harness-of-Harness 多日持续改进评测层 = 候选十八角候选;工具:uvx agent-harnesses-mcp


Tom · 2026-09-03 15:40 CST · E1 预消化简报 · evaluation 主题 2 条 eval 专项 net-new paper_card(Harness-of-Harness 2609.01481 + AgentJudgeBench 2608.26623)+ 1 条 eval 主分类 HF Daily 新上榜(UI-Venus-2 2609.00028 25▲)+ PILOT 深度衰减消失 ⚠️ + On-Policy Distillation 疑似暴跌 ⚠️ + LoopArena 三日锁断裂 ⚠️ + 5 条 Top15 消失警示 ⚠️ + BenchMIRT arXiv 号待核实 + paper_card 未建 3 条(P0:On-Policy Distillation / P2:PAWBench / P2:UrbanGround) 涉及 arXiv:2609.01481(⚠️ eval 专项新卡)/ 2608.26623(⚠️ eval 专项新卡)/ 2609.00028(⚠️ eval 主分类新上榜 25▲)/ 2609.01836(⚠️ eval 邻接 EAL-Bench)/ 2608.31046(⚠️ R65已有 ★★ / Sep 3 消失 <19▲)/ 2608.26530(⚠️ R65已有 ★★ / Sep 3 消失 <25▲ 深度衰减)/ 2608.28281(R65已有 / 93▲ -6▲ 三日锁断裂)/ 2608.18524(R65已有邻接 / Sep 3 消失 <25▲)/ 2608.28122(R65已有邻接 / 25▲ -31▲)/ 2608.25518(R65已有 ★★ / Sep 3 消失 ⚠️)/ 2608.27345(R65立基础锚预备 ★★ / ~138▲ ⚠️未建)/ 2608.27456(R65已有 ★升档预备 / ~106▲ ⚠️未建)/ 2608.19583(R65已有 / ~173▲)/ 2608.27448(R65已有 ★★ / ~72▲)/ 2608.25593(R65已有 ★★ / ~109▲)/ 2608.24479(R65已有邻接 / ~137▲)/ 2608.26872(R65已有 / ~71▲ ⚠️)/ 2608.29847(R65已有 ★★ / 无票数)/ 2608.29387(R65已有 ★ / 无票数)/ 2608.28833(R65已有 ★ / Sep 3 消失 ⚠️)/ 2608.17271(R65衰减跌出)/ 2608.19269(R65已有 ★★★)/ 2608.27455(R65已有 ★★)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-09-03-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。