evaluation · E1 预消化简报(2026-09-07)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-09-05 下午 ~ 2026-09-07 15:40 CST)+ paper_cards 近 3 天新卡中 eval 相关条目 本简报目的: 为今晚 evaluation 活文档接力(R68 → R69)预习备料,聚焦尚未进入 R68 基线的增量条目


一、信源检查记录

本次覆盖(窗口:2026-09-05 下午 ~ 2026-09-07 15:40 CST):

  • work-queue.md ✓(2026-09-07 14:00 落盘:待建卡 0 · 高价值待深度解读 Top15 0 · 选题榜 4 件 trending/repos)
  • inbox/tom(9-5~9-7):
  • 2026-09-07-0900-hf-daily-2026-09-07.md(HF Daily 9-07,15篇)→ 本简报核心信源
  • 2026-09-07T1440-agent-rag-longcontext-radar.md(8 条候选,含 "Does Your Agent's Memory Survive a Model Upgrade?" / "Substrate-Aware AI Agents" / AgentJudgeBench 邻接 / OR-Clarify)
  • 2026-09-07-agent-rag-longcontext-radar.md(8 条候选,含 DRACO / VeriPhy / RoboTok / Select/Compress/Reinvest)
  • 2026-09-07_agents-lite.md(8 条候选,PILOT + DRACO + VeriPhy 等)
  • 2026-09-07-rag-e1prep.md(R83 基线 ✓)
  • 2026-09-06-evaluation-e1prep.md(R68 基线 ✓)
  • inbox/jay(9-5~9-7):
  • 2026-09-07-1505-jay-evening-briefing.md(推理系统 × RAG × DB × Cloud-Native 综合简报;eval 邻接为主 ✓)
  • 2026-09-07-llm-inference-systems-kvcache.md(KV cache 推理系统工程;eval 邻接 ✓)
  • 2026-09-07-inference-primitives-disaggregated.md(disaggregated serving;eval 邻接 ✓)
  • inbox/flyp(9-5~9-7):
  • 2026-09-07-multimodal-e1prep.md(Compile by Training 317▲ #1 + Terminal-Universe 272▲ #2 等立标续立;eval 邻接 ✓)
  • 2026-09-07-1000-rss-cameron-wolfe.md(eval 邻接 ✓)
  • 2026-09-07-1001-rss-interconnects.md(eval 邻接 ✓)
  • 2026-09-07-1004-rss-yt-ai-explained.md(eval 邻接 ✓)
  • 2026-09-07-1004-rss-yt-two-minute-papers.md(eval 邻接 ✓)
  • inbox/spark(9-5~9-7):
  • 2026-09-07-1001-rss-gradient-flow.md(eval 邻接 ✓)
  • 2026-09-07-1002-rss-chip-huyen.md(eval 邻接 ✓)
  • 2026-09-07-1004-rss-yt-3blue1brown.md(eval 邻接 ✓)
  • 2026-09-07-agent-e1prep.md(R83 基线确认;eval 邻接 ✓)
  • inbox/stephen(9-5~9-7):
  • 2026-09-07-1003-news-google-ai.md / 2026-09-07-1003-news-hf-blog.md / 2026-09-07-1003-news-tldr-ai.md(eval 邻接 ✓)
  • 2026-09-07-1005-news-yt-anthropic.md / 2026-09-07-1005-news-yt-deepmind.md / 2026-09-07-1005-news-yt-openai.md(eval 邻接 ✓)
  • 2026-09-07-ai-industry-e1prep.md(ai-industry 主轴;eval 邻接 ✓)
  • paper_cards 近 3 天 eval 相关新卡(Sep 5-7 入库)
  • paper_card 1194-2608.26623AgentJudgeBench(主分类 evaluation,形态 benchmark,arXiv:2608.26623,OpenAlex 2026-09-05 回填入库)→ 本轮 eval 专项新卡锚定
  • paper_card 1180-2609.01481Harness-of-Harness(主分类 evaluation,形态 method,arXiv:2609.01481,OpenAlex 2026-09-05 回填入库)→ 本轮 eval 专项新卡锚定
  • paper_card 1226-2609.04201Scal3R(主分类 engineering,非 eval 专项)→ 非锚定
  • paper_card 1227-2609.03820Select/Compress/Reinvest(主分类 multimodal,非 eval 专项)→ 非锚定
  • paper_card 1230-2608.29253QCell(主分类 multimodal,非 eval 专项)→ 非锚定
  • knowledge/evaluation.md R68 基线确认(R68:Compile by Training 310▲ ★★ + Terminal-Universe 265▲ + WHALE 30▲ + On-Policy Distillation 消失深度衰减 ⚠ + On-Policy Distillation II 排名下滑 ⚠ + Last Translation Benchmark 27▲ + DRACO + VeriPhy + Last Translation ★★ + VeriPhy ★★ + DRACO ★ + 6 件 Top15 消失延续 + paper_card P0 缺口 On-Policy Distillation + EarlyEval + paper_card P2 缺口 PAWBench / UrbanGround / Terminal-Universe / 6 件邻接候选 + harness 候选十九角 + 立标池饱和度 v44-v69 廿六日连续)

二、增量摘要

本轮(E1-R69,窗口 2026-09-05 下午 ~ 2026-09-07 15:40 CST)eval 专项 net-new paper_card 新增 2 条(AgentJudgeBench + Harness-of-Harness,均为 Sep 5 OpenAlex 回填入库);HF Daily Sep 7 走势平稳(Compile by Training 317▲ +7 续立饱和 / Terminal-Universe 272▲ +7 续立饱和 / On-Policy Distillation II 78▲ +4 微量回升 / WHALE 30▲ 持平 / Last Translation Benchmark 29▲ 持平);Sep 7 1440 radar 出现 2 件 eval 方法学邻接新候选(Memory Model Upgrade + Substrate-Aware AI);立标池饱和度 v44-v70 廿七日连续。

本轮最重要的信号是 AgentJudgeBench(2608.26623)作为首个专门评估 LLM-as-a-Judge 在结构化 agentic tool-calling 场景下可靠性的 benchmark 正式入库,填补了 SLM-as-Judges 聚焦 rubric-based RL 场景与 open-ended 场景之间的空白——AgentJudgeBench 专注于 workflow DAG 上的工具调用评测,与 eval.md R68 §6 中 SLM-as-Judges(2608.30005)形成互补而非重叠,是评测诚信维度的增量深化。


三、增量条目


增量 1 · 🟢 P1 · AgentJudgeBench(2608.26623)首个 LLM Judge 评测 benchmark 专门针对 agentic tool-calling 场景,正式入库

来源: paper_card 1194-2608.26623(主分类 evaluation,形态 benchmark,OpenAlex 2026-09-05 回填入库)+ tom 2026-09-07T1440-agent-rag-longcontext-radar.md(AgentJudgeBench 邻接确认) arXiv: 2608.26623

要点: - 核心内容:AgentJudgeBench——首个系统研究 LLM-as-a-judge 在 agentic tool-calling 上可靠性的 benchmark,聚焦工作流 DAG 上的结构化、依赖驱动的工具调用评测,与 open-ended 文本/偏好评测的 LLM-as-a-judge 问题有本质区别;3,808 实例 × 6 种 DAG 拓扑 × 3 个难度等级;5 个生成器(3B-70B 开源 + GPT-5.4)× 6 个 judge(20B 到 frontier) - 与 eval.md 现有脉络的关系:与 R68 §6 SLM-as-Judges(2608.30005)形成互补——SLM-as-Judges 聚焦 rubric-based RL judge 场景,AgentJudgeBench 聚焦结构化 tool-calling workflow judge 场景;两者共同构成"LLM-as-a-judge 可靠性评测"的双轴;与 R68 §6.118 DRACO(动态 rubric 信用分配)同属"评判/信用分配"方向,但 DRACO 侧重点是动态 rubric 生成而非 judge 可靠性;eval.md R68 无此条目锚定 - 立标状态:paper_card 1194-2608.26623 已建(OpenAlex 2026-09-05 回填);HF 票数未知(未进 Sep 7 Top15);尚未经 HF Daily 验证 - 建议归入节: R68 §6.122(新增)AgentJudgeBench 节(eval 专项 · benchmark · LLM-as-a-judge 可靠性 · workflow DAG tool-calling);paper_card 已建 ✓


增量 2 · 🟡 P2 · Harness-of-Harness(2609.01481)harness 自演化的 harness,多日自主开发持续改进,入库

来源: paper_card 1180-2609.01481(主分类 evaluation,形态 method,OpenAlex 2026-09-05 回填入库) arXiv: 2609.01481

要点: - 核心内容:Harness-of-Harness——多日自主软件开发中超过 70 轮迭代,HoH 自主开发出包含连贯主线剧情、完整核心机制、人类可玩体验、精美画面和集成音效的第一人称射击游戏;是"harness 的 harness"——用 harness 工程方法构建能持续改进的 harness 自身 - 与 eval.md 现有脉络的关系:与 R68 §3.5 harness 生态候选十九角(HarnessDev / S³Gym / WHALE / Compile by Training / Terminal-Universe 等)形成候选延伸——Harness-of-Harness 提供了"harness 自演进评测"的实证案例;与 R68 §6.116 PILOT in the Loop(live self-improvement)同属"self-improving harness"方向,但 HoH 聚焦多日持续改进而非单次循环内的 live update;eval.md R68 无此条目锚定 - 立标状态:paper_card 1180-2609.01481 已建(OpenAlex 2026-09-05 回填);HF 票数未知;尚未经 HF Daily 验证 - 建议归入节: R68 §3.5 harness 生态候选二十角延伸(Harness-of-Harness 作为第二十节点候选——"harness 自演化评测层");paper_card 已建 ✓


增量 3 · 🟡 P2 · "Does Your Agent's Memory Survive a Model Upgrade?"(arXiv:2609.05339)记忆方案在新模型下的可移植性,eval 邻接新候选出现

来源: tom 2026-09-07T1440-agent-rag-longcontext-radar.md(Sep 7 1440 radar ⭐⭐⭐⭐ 高价值)+ Sep 4 论文(arXiv:2609.05339) arXiv: 2609.05339

要点: - 核心内容:对比四种记忆方案在 48 个合成历史场景下的新模型可移植性:长上下文物性读取(LC-RAW)、RAG 分块、压缩笔记(NOTES)、固定 Schema 知识图(KG-fixed);结论:KG 方案迁移最稳,RAG 方案对 embedding 版本敏感——核心贡献是揭示了"记忆评测的模型可移植性"这一新维度 - 与 eval.md 现有脉络的关系:与 R68 §6.112 ContextBias(T2I 偏见持续性评测)同属"评测随时间/条件变化的稳定性"方向,但 ContextBias 聚焦 T2I 任务,Memory Model Upgrade 聚焦 agent memory 跨模型迁移;与 R68 §6 中 MemTrapBench(memory 认知陷阱 benchmark)形成"memory 评测"双锚——MemTrapBench 测 memory 认知陷阱,Memory Model Upgrade 测 memory 跨模型可移植性;eval.md R68 无此条目锚定 - 立标状态:paper_card 未建;HF 票数未知;Sep 7 1440 radar 首次出现 - 建议归入节: R68 §6 附近新增 §6.123 Memory Model Upgrade 节(eval 邻接 · agent 主分类);paper_card 新建优先级 P2


增量 4 · 🟡 P2 · "Substrate-Aware AI Agents"(arXiv:2609.05232)提出"基质盲区",agent 执行上下文感知缺陷的评测框架

来源: tom 2026-09-07T1440-agent-rag-longcontext-radar.md(Sep 7 1440 radar ⭐⭐⭐⭐ 高价值)+ Sep 4 论文(arXiv:2609.05232) arXiv: 2609.05232

要点: - 核心内容:提出"基质盲区"(substrate blindness)——Agent 在规划时忽略执行上下文(内存、执行时间、运行时约束等);测试 Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 在数值代码生成任务中是否感知 substrate,三者均存在显著盲区;提供了"执行上下文感知能力"的评测框架 - 与 eval.md 现有脉络的关系:与 R68 §6 中各类 agent 能力评测(ContextBias / EvoGenUI-Bench / LLM 个性化代价)形成"agent 能力边界评测"候选延伸;Substrate-blindness 评测填补了"agent 对执行约束的感知能力"这一空白维度;eval.md R68 无此条目锚定 - 立标状态:paper_card 未建;HF 票数未知;Sep 7 1440 radar 首次出现 - 建议归入节: R68 §6 附近新增 §6.124 Substrate-Aware AI Agents 节(eval 邻接 · agent 主分类);paper_card 新建优先级 P2


增量 5 · 🟡 P2 · OR-Clarify(arXiv:2609.05258)运筹优化场景的澄清策略 benchmark,eval 邻接候选

来源: tom 2026-09-07T1440-agent-rag-longcontext-radar.md(Sep 7 1440 radar ⭐⭐⭐)+ Sep 3 论文(arXiv:2609.05258) arXiv: 2609.05258

要点: - 核心内容:运筹优化场景下,Agent 是否知道何时需要向用户澄清不完整需求,而非直接建模;Benchmark 含部分描述 + 隐藏槽位,评估 clarification 策略质量;属于 agent 评测的"不确定性感知与主动澄清"维度 - 与 eval.md 现有脉络的关系:eval.md R68 无此条目锚定;属于"agent 评测"邻接候选 - 立标状态:paper_card 未建;HF 票数 11(Sep 3);Sep 7 1440 radar 首次进入 Tom 报告 - 建议归入节: R68 §6 附近新增 §6.125 OR-Clarify 节(eval 邻接 · agent 主分类);paper_card 新建优先级 P2


四、R68 基线确认(已覆盖条目·本轮延续确认)

条目 arXiv R68 状态 Sep 7 票数
Compile by Training 2609.04199 ✅ R68 ★★ 已锚;Sep 7 317▲ #1(+7 续立饱和) 317▲
Terminal-Universe 2609.04148 ✅ R68 候选十九角已锚;Sep 7 272▲ #2(+7 续立饱和);paper_card 仍未建 ⚠️ 272▲
On-Policy Distillation II 2609.04172 ⚠️ R68 sequel 观察项;Sep 7 78▲(+4 微量回升,但仍低于 Sep 6 的 74▲ #9 排名位次,Top15 已出榜 ⚠️) 78▲(Top15 出榜 ⚠️)
WHALE 2609.00196 ✅ R68 eval 专项已锚;Sep 7 30▲ #14(持平) 30▲
Last Translation Benchmark 2609.04173 ✅ R68 eval 专项已锚;Sep 7 29▲(持平) 29▲
DRACO 2609.04094 ✅ R68 eval 邻接已锚;Sep 7 radar 24▲(持平) 24▲
VeriPhy 2609.03153 ✅ R68 eval 邻接已锚;Sep 7 radar 12▲(持平) 12▲
On-Policy Distillation 2608.31046 ⚠️ R68 深度衰减确认;Sep 7 Top15 仍未见(Sep 5/6/7 连续出榜 = 四日锁断裂确认)⚠️ 出榜 ⚠️
HarnessDev 2609.01437 ⚠️ R68 已有;Sep 4 225▲ #2 → Sep 5/6/7 Top15 出榜延续 ⚠️ 出榜延续 ⚠️
ASPIRE 2608.31111 ⚠️ R68 已有;Sep 4 204▲ #3 → Sep 5/6/7 Top15 出榜延续 ⚠️ 出榜延续 ⚠️
LoopArena 2608.28281 ⚠️ R68 已有;Sep 4 101▲ → Sep 5/6/7 Top15 出榜延续 ⚠️ 出榜延续 ⚠️
PILOT 2608.26530 ⚠️ R68 深度衰减延续;Sep 2 30▲ → Sep 5/6/7 仍未见 ⚠️ 深度衰减 ⚠️
SLM-as-Judges 2608.30005 ✅ R68 eval 专项已锚;无票数更新 无票数
S³Gym 2608.31100 ✅ R68 eval 专项已锚;无票数更新 无票数
ContextBias 2608.29847 ✅ R68 已有 ★★;无票数更新 无票数
EvoGenUI-Bench 2608.29387 ✅ R68 已有 ★;无票数更新 无票数
LLM 个性化代价 2608.28833 ✅ R68 已有 ★;无票数更新 无票数
FACE-Eval 2608.29464 ✅ R68 归口化锚定;无票数更新 无票数
PAWBench 2608.27345 ⚠️ R68 立基础锚预备 ★★;paper_card P2 仍未建 ⚠️ 未建卡
UrbanGround 2608.27456 ⚠️ R68 已有 ★ 升档预备;paper_card P2 仍未建 ⚠️ 未建卡

五、本轮关键警示汇总

警示等级 条目 说明
🔴 P0 On-Policy Distillation paper_card 未建 R65 → R66 → R67 → R68 → R69 五轮缺口延续;Top15 四日锁断裂确认
🔴 P0 EarlyEval paper_card 未建 R66 → R69 四轮缺口延续;Top15 出榜确认后 paper_card 价值下降
🟠 P1 On-Policy Distillation 四日锁断裂确认 Sep 4 101▲ → Sep 5/6/7 连续出榜;正式进入深度衰减区
🟠 P1 On-Policy Distillation II Top15 出榜 Sep 7 78▲ 但已跌出 Top15(Sep 6 74▲ #9 仍在榜);从 Top15 出榜是新信号 ⚠️
🟠 P1 Terminal-Universe paper_card 仍未建 R68 已锚入候选十九角但 paper_card 始终未建;275▲ 级别的 paper_card 缺失 ⚠️
🟠 P1 HarnessDev Top15 出榜延续 Sep 4 225▲ #2 → Sep 5/6/7 连续出榜;暴涨后消失延续
🟠 P1 ASPIRE Top15 出榜延续 Sep 4 204▲ #3 → Sep 5/6/7 连续出榜
🟠 P1 LoopArena Top15 出榜延续 Sep 4 101▲ → Sep 5/6/7 连续出榜
🟡 P2 AgentJudgeBench paper_card 新建需锚入 paper_card 1194 已建;需写入 eval.md R69
🟡 P2 Harness-of-Harness paper_card 新建需锚入 paper_card 1180 已建;需写入 eval.md R69
🟡 P2 PAWBench paper_card 未建 R62 → R69 八轮缺口延续 ⚠️
🟡 P2 UrbanGround paper_card 未建 R63 → R69 七轮缺口延续 ⚠️
🟡 P2 Memory Model Upgrade / Substrate-Aware / OR-Clarify paper_card 未建 Sep 7 1440 radar 新出现;需建卡

六、可引用 arXiv 号列表

arXiv ID 名称 状态 Sep 7 票数
2609.04199 Compile by Training · NL 规约→神经函数 ✅ R68 ★★ 已锚;Sep 7 317▲ #1(+7 续立饱和) 317▲
2609.04148 Terminal-Universe · agent 轨迹→终端环境 ✅ R68 候选十九角已锚;Sep 7 272▲ #2(+7 续立饱和);paper_card ⚠️ 仍未建 272▲
2608.26623 AgentJudgeBench · LLM Judge 评测 agentic tool-calling ⚠️ 本轮 eval 专项新卡锚定;paper_card 1194 已建;HF 票数未知 未知
2609.01481 Harness-of-Harness · harness 自演化的 harness ⚠️ 本轮 eval 专项新卡锚定;paper_card 1180 已建;HF 票数未知 未知
2609.04172 On-Policy Distillation II · 一个训练样本 ⚠️ R68 sequel 观察项;Sep 7 78▲ Top15 出榜 ⚠️ 78▲(出榜 ⚠️)
2609.00196 WHALE · 权重-harness 联合交替学习 ✅ R68 eval 专项已锚;Sep 7 30▲ #14(持平) 30▲
2609.04173 Last Translation Benchmark · 翻译基准饱和 + 评测诚信 ✅ R68 eval 专项已锚;Sep 7 29▲(持平) 29▲
2609.04094 DRACO · 动态 rubric 细粒度信用分配 ✅ R68 eval 邻接已锚;Sep 7 radar 24▲(持平) 24▲
2609.03153 VeriPhy · 世界模型可审计物理验证 ✅ R68 eval 邻接已锚;Sep 7 radar 12▲(持平) 12▲
2608.31046 On-Policy Distillation · OPSA 方法论突破 ⚠️ R68 ★★ 已锚但深度衰减;Sep 7 Top15 四日锁断裂 ⚠️ 出榜 ⚠️
2609.01437 HarnessDev · LLM 构建 Agent Harness ✅ R68 已有;Sep 4 225▲ #2 → 出榜延续 ⚠️ 出榜延续 ⚠️
2608.31111 ASPIRE · 模糊目标自我演化 ✅ R68 已有;Sep 4 204▲ #3 → 出榜延续 ⚠️ 出榜延续 ⚠️
2608.28281 LoopArena · 循环工程运行时控制器 ✅ R68 已有;Sep 4 101▲ → 出榜延续 ⚠️ 出榜延续 ⚠️
2608.26530 PILOT in the Loop · 在线自我改进 ✅ R68 已有 ★★;深度衰减延续 ⚠️ 深度衰减 ⚠️
2608.30005 SLM-as-Judges · 小模型做 rubric judge ✅ R68 eval 专项已锚;无票数更新 无票数
2608.31100 S³Gym · 自测+自判+自改进三栖基准 ✅ R68 eval 专项已锚;无票数更新 无票数
2608.29847 ContextBias · T2I 偏见持续性评测 ✅ R68 已有 ★★;无票数更新 无票数
2608.29387 EvoGenUI-Bench · 多轮 UI agent 评测 ✅ R68 已有 ★;无票数更新 无票数
2608.28833 LLM 个性化代价 · PRISK 框架 ✅ R68 已有 ★;无票数更新 无票数
2608.29464 FACE-Eval · CoT 忠实性评测 ✅ R68 归口化锚定;无票数更新 无票数
2608.27345 PAWBench · 概率对齐世界建模 ✅ R68 立基础锚预备 ★★;⚠️ paper_card P2 仍未建 未建卡
2608.27456 UrbanGround · 城市空间 agent 评测 ✅ R68 已有 ★ 升档预备;⚠️ paper_card P2 仍未建 未建卡
2609.05339 Memory Model Upgrade · 记忆方案跨模型可移植性 ⚠️ 本轮 eval 邻接新候选;Sep 7 1440 radar ⭐⭐⭐⭐;paper_card 未建 未知
2609.05232 Substrate-Aware AI Agents · 执行上下文感知盲区 ⚠️ 本轮 eval 邻接新候选;Sep 7 1440 radar ⭐⭐⭐⭐;paper_card 未建 未知
2609.05258 OR-Clarify · 运筹优化澄清策略评测 ⚠️ 本轮 eval 邻接新候选;HF 11票;paper_card 未建 11票

七、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-09-07-0900-hf-daily-2026-09-07.md(2026-09-07 09:00)→ HF Daily 9-07 15 篇(Compile by Training 317▲ #1 / Terminal-Universe 272▲ #2 / LLaDA-Image 228▲ #3 / Random Attention 164▲ #4 / Knowing When Not to Reuse 150▲ #5 / RoboTok 115▲ #6 / LatentPress 110▲ #7 / On-Policy Distillation II 78▲(Top15 出榜)/ Gated DeltaNet 74▲ / Puffin-World 66▲ / Scal3R 46▲ / Editable Visual Design 42▲ / TCR 33▲ / WHALE 30▲ #14 / Last Translation Benchmark 29▲) - /inbox/tom/2026-09-07T1440-agent-rag-longcontext-radar.md(2026-09-07 14:40)→ 8 条候选含 Does Your Agent's Memory Survive a Model Upgrade(⭐⭐⭐⭐)+ Substrate-Aware AI Agents(⭐⭐⭐⭐)+ OR-Clarify(⭐⭐⭐)+ MaxKernel(⭐⭐⭐)+ AgentJudgeBench 邻接确认 ✓ - /inbox/tom/2026-09-07-agent-rag-longcontext-radar.md(2026-09-07 08:40)→ 8 条候选含 DRACO(24▲)+ VeriPhy(12▲)+ RoboTok(115▲)+ Select/Compress/Reinvest(15▲)✓ - /inbox/tom/2026-09-07_agents-lite.md(2026-09-07 09:11)→ 8 条候选含 PILOT + DRACO + VeriPhy ✓ - /inbox/tom/2026-09-06-evaluation-e1prep.md(2026-09-06 15:40)→ R68 基线确认 ✓ === Jay inbox(近 2 天): - /inbox/jay/2026-09-07-1505-jay-evening-briefing.md(2026-09-07 15:05)→ 推理 × RAG × DB × Cloud-Native 综合;eval 邻接为主 ✓ - /inbox/jay/2026-09-07-llm-inference-systems-kvcache.md(2026-09-07 10:52)→ KV cache 推理系统;eval 邻接 ✓ - /inbox/jay/2026-09-07-inference-primitives-disaggregated.md(2026-09-07)→ disaggregated serving;eval 邻接 ✓ === Flyp inbox(近 2 天): - /inbox/flyp/2026-09-07-multimodal-e1prep.md(2026-09-07)→ HF Daily 9-7 Compile by Training 317▲ #1 +7 / Terminal-Universe 272▲ #2 +7 / LLaDA-Image 228▲ #3 +6 等立标续立;eval 邻接 ✓ - /inbox/flyp/2026-09-07-1000-rss-cameron-wolfe.md / 2026-09-07-1001-rss-interconnects.md / 2026-09-07-1004-rss-yt-ai-explained.md / 2026-09-07-1004-rss-yt-two-minute-papers.md(2026-09-07)→ eval 邻接 ✓ === Spark inbox(近 2 天): - /inbox/spark/2026-09-07-1001-rss-gradient-flow.md / 2026-09-07-1002-rss-chip-huyen.md / 2026-09-07-1004-rss-yt-3blue1brown.md(2026-09-07)→ eval 邻接 ✓ - /inbox/spark/2026-09-07-agent-e1prep.md(2026-09-07)→ R83 基线确认;eval 邻接 ✓ === Stephen inbox(近 2 天): - /inbox/stephen/2026-09-07-1003-news-google-ai.md / 2026-09-07-1003-news-hf-blog.md / 2026-09-07-1003-news-tldr-ai.md(2026-09-07)→ eval 邻接 ✓ - /inbox/stephen/2026-09-07-1005-news-yt-anthropic.md / 2026-09-07-1005-news-yt-deepmind.md / 2026-09-07-1005-news-yt-openai.md(2026-09-07)→ eval 邻接 ✓ - /inbox/stephen/2026-09-07-ai-industry-e1prep.md(2026-09-07)→ ai-industry 主轴;eval 邻接 ✓ === paper_cards 近 3 天 eval 相关新卡(Sep 5-7 入库批次): - paper_card 1194-2608.26623AgentJudgeBench(主分类 evaluation,形态 benchmark,arXiv:2608.26623,OpenAlex 2026-09-05 回填入库)→ 本轮 eval 专项新卡锚定 - paper_card 1180-2609.01481Harness-of-Harness(主分类 evaluation,形态 method,arXiv:2609.01481,OpenAlex 2026-09-05 回填入库)→ 本轮 eval 专项新卡锚定 - paper_card 1226-2609.04201Scal3R(主分类 engineering)→ 非 eval 专项 - paper_card 1227-2609.03820Select/Compress/Reinvest(主分类 multimodal)→ 非 eval 专项 - paper_card 1230-2608.29253QCell(主分类 multimodal)→ 非 eval 专项 === knowledge/evaluation.md R68 基线确认 ✓


八、矛盾与待核实

矛盾 ① AgentJudgeBench 与 SLM-as-Judges 的边界需厘清

  • AgentJudgeBench 专注于 workflow DAG 上的 agentic tool-calling judge 可靠性;SLM-as-Judges 专注于 rubric-based RL judge
  • 两者不存在内容重叠,但 eval.md 写入时需明确区分各自的评测维度,避免混淆
  • 建议:R69 写入时在 §6.122 AgentJudgeBench 注明与 SLM-as-Judges 的互补关系

矛盾 ② On-Policy Distillation II(78▲)Top15 出榜

  • Sep 6 以 74▲ #9 仍在 Top15;Sep 7 以 78▲(+4)出榜——票数略升但排名不足以重回 Top15
  • 与 On-Policy Distillation(2608.31046,四日锁断裂)的关系仍待核实;paper_card 仍未建
  • 建议:R69 评估是否将 On-Policy Distillation II 从"观察项 sequel"降级

矛盾 ③ Terminal-Universe paper_card 长期未建

  • R68(9-6)锚入候选十九角时已标注 paper_card 未建;本轮(9-7)已过 24h,paper_card 仍未建
  • 272▲ 的票数级别,paper_card 长期缺失是显著缺口
  • 建议:R69 活文档接力时将 Terminal-Universe paper_card 新建列为 P1 行动项

Tom · 2026-09-07 15:40 CST · E1 预消化简报 · evaluation 主题 2 条 eval 专项 net-new paper_card(AgentJudgeBench 2608.26623 + Harness-of-Harness 2609.01481,均为 Sep 5 OpenAlex 回填入库)+ 3 条 eval 邻接新候选(Memory Model Upgrade 2609.05339 + Substrate-Aware AI 2609.05232 + OR-Clarify 2609.05258)+ HF Daily Sep 7 平稳(Compile by Training 317▲ +7 续立饱和 / Terminal-Universe 272▲ +7 续立饱和 / On-Policy Distillation II 78▲ 出榜 ⚠️ / WHALE 30▲ 持平 / Last Translation Benchmark 29▲ 持平)+ On-Policy Distillation 四日锁断裂确认 + On-Policy Distillation II Top15 出榜(新信号)+ Terminal-Universe paper_card 仍未建(P1 缺口延续)+ paper_card P0 缺口 2 条未补(On-Policy Distillation / EarlyEval)+ paper_card P2 缺口 4 条未补(PAWBench / UrbanGround / Memory Model Upgrade / Substrate-Aware)+ 立标池饱和度 v44-v70 廿七日连续 涉及 arXiv:2608.26623(✅ 本轮 eval 专项新卡锚定 AgentJudgeBench / paper_card 1194 已建)/ 2609.01481(✅ 本轮 eval 专项新卡锚定 Harness-of-Harness / paper_card 1180 已建)/ 2609.04199(R68 ★★ 已锚 / Sep 7 317▲ #1 +7 续立饱和)/ 2609.04148(R68 候选十九角已锚 / Sep 7 272▲ #2 +7 续立饱和 / paper_card ⚠️ 仍未建)/ 2609.05339(⚠️ 本轮 eval 邻接新候选 Memory Model Upgrade / Sep 7 1440 radar ⭐⭐⭐⭐ / paper_card 未建)/ 2609.05232(⚠️ 本轮 eval 邻接新候选 Substrate-Aware AI / Sep 7 1440 radar ⭐⭐⭐⭐ / paper_card 未建)/ 2609.05258(⚠️ 本轮 eval 邻接新候选 OR-Clarify / HF 11票 / paper_card 未建)/ 2609.04172(R68 sequel 观察项 / Sep 7 78▲ Top15 出榜 ⚠️ / paper_card 未建)/ 2609.00196(R68 已锚 / Sep 7 30▲ #14 持平)/ 2609.04173(R68 已锚 / Sep 7 29▲ 持平)/ 2609.04094(R68 已锚 / Sep 7 radar 24▲)/ 2609.03153(R68 已锚 / Sep 7 radar 12▲)/ 2608.31046(R68 ★★ 已锚 / 四日锁断裂 ⚠️ / paper_card P0 未建)/ 2609.01437(R68 已有 / Sep 4 225▲ → 出榜延续 ⚠️)/ 2608.31111(R68 已有 / Sep 4 204▲ → 出榜延续 ⚠️)/ 2608.28281(R68 已有 / 出榜延续 ⚠️)/ 2608.26530(R68 已有 ★★ / 深度衰减延续 ⚠️)/ 2608.30005(R68 已锚 / 无票数)/ 2608.31100(R68 已锚 / 无票数)/ 2608.29847(R68 ★★ / 无票数)/ 2608.29387(R68 ★ / 无票数)/ 2608.28833(R68 ★ / 无票数)/ 2608.29464(R68 归口化锚定 / 无票数)/ 2608.27345(R68 立基础锚预备 ★★ / P2 paper_card 未建 ⚠️)/ 2608.27456(R68 ★ 升档预备 / P2 paper_card 未建 ⚠️)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-09-07-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。