evaluation · E1 预消化简报(2026-08-15)
信源检查记录
本次覆盖: - work-queue.md ✓(Top 15 含 Mechanist / SkillZip / LLMRouter #2 等,均已在 evaluation.md 脉络或 paper_card 建卡) - inbox/jay(8/13~8/15):engineering-e1prep 含 AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)邻接 eval ✓;无 evaluation 专项新件 - inbox/flyp(8/13~8/15):multimodal-e1prep 无 evaluation 直接增量 ✓;critical-read 无 eval 专项新件 ✓ - inbox/spark(8/13~8/15):agent-e1prep 无 evaluation 直接增量 ✓ - inbox/stephen(8/13~8/15):ai-industry-e1prep 含 Mechanist 续立加强(82▲)+ 立标池双向锚 v33 以来首次 6 向并存 邻接 eval ✓;无 eval 专项新件 - inbox/tom(8/13~8/15):HF Daily × 3(8/13 BDH-CQ 553▲;8/14 BDH-CQ 跌出 + OpenART 184▲ 回 top1;8/15 OpenART 252▲ + LLMRouter 90▲ 新登)✓;radar 无 eval 候选净增 ✓;evaluation-e1prep × 2(R45/R46 基线参考)✓ - paper_cards 近 3 天新卡(950~960 范围):955(Context-Matched Distillation multimodal/systems)、956(Hybrid-Policy Self-Editing)、957(Specification-first agent)、958(Thought-Level Beam Search agent)、959(Low-Frequency Safety benchmark邻接 evaluation);950(PlayWorld benchmark邻接 evaluation)、951(AutoDesign meta-harness 邻接 evaluation);947(LLMRouter evaluation 已建卡);929(Mechanist 已建卡) ✓ - knowledge/evaluation.md R46 基线 ✓
增量摘要
本轮(E1-R47,窗口 2026-08-14 下午 ~ 2026-08-15 下午)发现 3 条确认增量(1 条 eval 专项 + 2 条 eval 邻接),均为近 3 天内新信号但 eval.md 尚未覆盖的候选。主体脉络为:R46 立标池双向锚 6 向并存第 2 日续立(OpenART #1 252▲)+ LLMRouter 以 evaluation 主分类新登 HF Daily top2(90▲)为 eval 专项净增;DarwinX(演化 Agent Harness)和 PlayWorld(世界模型基准测试)以 eval 邻接身份进入候选视野;VibeLifeBench P1 缺口仍未建卡(跨轮待填);R45/R46 遗留的 Decoding-Level Taboo / 360CityArena / TSDS-Toolbox 仍未归入 eval.md。
条目一:LLMRouter(arXiv:2608.06867)— LLM 路由器开发/评估/部署的统一基础设施
来源:inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md(HF Daily 8-15 #2,90▲ 新登)
arXiv:2608.06867 | https://arxiv.org/abs/2608.06867
主分类:evaluation;形态:application
卡状态:✅ paper_cards 947 已建;evaluation.md 未覆盖
要点
- 核心问题:没有单一 LLM 在所有查询和预算约束下均最优,模型路由对成本可控部署至关重要;但现有路由器形式化定义和实现各异,难以公平对比与扩展
- 核心方案:将 LLM 路由统一形式化为五组件序贯决策过程:上下文编码器、模型编码器、评分函数、决策规则、学习信号,覆盖单轮 / 多轮 / 个性化路由三类场景
- 评测维度:基于该形式化,开发自动化 pipeline 用于路由器一致性评估,并提供统一基准对比框架
- 工程价值:统一 LLM 路由器的评测方法学,为 cost-quality 权衡提供量化依据
- 立标信号:HF Daily 8-15 #2,90▲ 新登,信号强
与 knowledge/evaluation.md R46 现有脉络的关系
- 现有脉络:R46 §2.1 评测方法学综述(78 件套)+ §2.2 Benchmark 设计场景专化 + §9.2 评测 harness/benchmark 套件(216+ 件)——LLMRouter 以"LLM 路由统一评测基础设施"填补 R46 缺失的 router evaluation 工具箱空白
- 缺失:LLM 路由器评测基准;cost-quality 权衡量化评测框架;多轮 / 个性化路由评测方法论
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——LLM 路由器评测基准(LLMRouter 五组件形式化);§9.2 评测 harness/benchmark 套件新增 LLMRouter 条目
矛盾 / 待核实
- paper_cards 947 已建但 eval.md 未覆盖,归口优先级需确认
- 五组件形式化中"学习信号"的具体评测指标需读原文 §3
- 与现有 router 方案(如 RouterEval 等)的边界需厘清
arXiv 列表
- 2608.06867(✅ paper_cards 947 已建,eval.md 待补)
条目二:DarwinX(arXiv:2608.07545)— 通过自然选择演化 Agent Harness
来源:inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md(HF Daily 8-15 #7,59▲ 新登)
arXiv:2608.07545 | https://arxiv.org/abs/2608.07545
主分类:agent;副分类:evaluation(邻接);形态:benchmark
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:Agent Harness(测试 / 评测框架)的设计依赖人工经验,缺乏自动化搜索机制——如何让 Harness 自身通过演化机制自动优化?
- 核心方案:将自然选择引入 Agent Harness 优化——通过演化算法搜索最优的测试场景 / 评测指标 / 环境配置组合
- 评测维度:以实际 Agent 任务表现为 selection pressure,优胜劣汰生成更有效的评测框架
- 立标信号:HF Daily 8-15 #7,59▲ 新登,信号中等偏强
与 knowledge/evaluation.md R46 现有脉络的关系
- 现有脉络:R46 §2.4 Judge & Harness 工程(77 件套)+ §3.4 EDD(96 件)+ §9.3 评测方法学 toolkit(77 件)——DarwinX 以"演化式 Harness 优化"补充 R46 缺失的 Harness 自动搜索方法论,属于 Harness 工程化的新方向
- 缺失:Harness 自动化设计方法论;演化算法在评测中的应用;DarwinX eval.md 待补归口
矛盾 / 待核实
- paper_card 未建;59▲ 立标信号中等偏强但非 top3
- "自然选择"的具体 selection pressure 定义(哪些指标驱动选择)需读原文 §2
- 与现有 AutoEval/AutoBench 框架的关系需厘清
arXiv 列表
- 2608.07545(🆕 paper_cards 未建,eval.md 待补)
条目三:PlayWorld(arXiv:2608.13552)— 使用 Agent 玩家在长时目标上对世界模型进行基准测试
来源:inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md(HF Daily 8-15 #10,33▲ 新登)
arXiv:2608.13552 | https://arxiv.org/abs/2608.13552
主分类:cs.AI;副分类:evaluation(benchmark);形态:benchmark
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:世界模型(World Model)评测多依赖单任务指标,缺乏在开放世界 / 长时目标条件下对 Agent 行为一致性的系统性评测
- 核心方案:PlayWorld——让 Agent 玩家在受控世界模型环境中追逐长时目标,以评测世界模型对 Agent 行为预测的准确性
- 评测维度:世界模型的 groundedness(与物理世界的一致性)+ Agent 目标达成率 + 长时预测保真度
- 与 R46 现有脉络的关系:与 VibeLifeBench(长视野主动性评测)和 Can LLM Agents Stick to the Script?(叙事一致性)共同构成"长程行为评测三件套"——VibeLifeBench 侧重主动性,Can LLM Agents 侧重叙事一致性,PlayWorld 侧重世界模型对 Agent 的预测保真度
- 立标信号:HF Daily 8-15 #10,33▲ 新登,信号中等
与 knowledge/evaluation.md R46 现有脉络的关系
- 现有脉络:R46 §2.2 Benchmark 设计场景专化;R46 §2.7 评测对象横向分化(78 维 + 32 邻接)——PlayWorld 以"世界模型 Agent 驱动评测"补充长程行为一致性 benchmark,与 VibeLifeBench + Can LLM Agents Stick to the Script? 构成"长程行为评测三件套"
- 缺失:世界模型评测 benchmark;长时目标驱动的 Agent 行为保真度评测
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——世界模型长时目标评测(PlayWorld);与 VibeLifeBench / Can LLM Agents 并列形成长程行为评测三件套
矛盾 / 待核实
- paper_card 未建;33▲ 立标信号中等
- "世界模型"的具体定义(learned world model vs physics engine)是关键区分点,需读原文
- 与 Minecraft/AgentBench 等现有世界模拟 benchmark 的具体边界需厘清
arXiv 列表
- 2608.13552(🆕 paper_cards 未建,eval.md 待补)
综合:矛盾与待核实清单
- LLMRouter(2608.06867):paper_cards 947 已建但 eval.md 未覆盖;五组件形式化中"学习信号"的具体评测指标需读原文
- DarwinX(2608.07545):paper_card 未建;selection pressure 的具体定义需读原文 §2;59▲ 中等偏强
- PlayWorld(2608.13552):paper_card 未建;33▲ 中等立标信号;"世界模型"类型定义待核实;与现有世界模拟 benchmark 边界需厘清
- VibeLifeBench(2608.10875):R45 已标注 P1 缺口,paper_card 仍未建;跨轮遗留,需 8-15 前补建
- BDH-CQ 双维度区分验证:R46 硬约束——8-15 HF Daily 复核 BDH-CQ 票数仍未回到 top15(R46 §2.200 待确认)
- Decoding-Level Taboo(2608.09900)/ 360CityArena(2608.08814)/ TSDS-Toolbox(2608.08119):R45 确认的"建卡未归口"缺口,eval.md 仍未填补(跨轮遗留)
本轮检查过的来源(无新增时列出)
| 来源 | 内容 |
|---|---|
| /shared/research-kb/organized/queue/work-queue.md | Top 15 含 Mechanist / SkillZip / LLMRouter;无 evaluation 直接增量 |
| inbox/jay/2026-08-14-engineering-e1prep.md | AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)✓ 邻接 eval |
| inbox/jay/2026-08-15-engineering-e1prep.md | 7 条工程 net-new;无 eval 专项新件 ✓ |
| inbox/jay/2026-08-15-1105-jay-five-category-briefing.md | Salesforce Compound AI 3.9x 吞吐;无 eval 专项 |
| inbox/flyp/2026-08-14-multimodal-e1prep.md | 无 eval 直接增量 ✓ |
| inbox/flyp/2026-08-15-multimodal-e1prep.md | 无 eval 直接增量;立标池双向锚续立邻接 eval ✓ |
| inbox/spark/2026-08-14-agent-e1prep.md | 无 eval 直接增量 ✓ |
| inbox/spark/2026-08-15-agent-e1prep.md | 无 eval 直接增量 ✓ |
| inbox/stephen/2026-08-14-ai-industry-e1prep.md | Mechanist 立标等级 ★★ 中档偏上续立加强(82▲)✓ 邻接 eval |
| inbox/stephen/2026-08-15-ai-industry-e1prep.md | 立标池双向锚 6 向并存第 2 日;无 eval 专项新件 ✓ |
| inbox/tom/2026-08-15-0900-hf-daily-2026-08-15.md | LLMRouter #2 90▲ eval 专项新增;DarwinX #7 59▲;PlayWorld #10 33▲;AutoDesign #11 32▲ ✓ |
| inbox/tom/2026-08-15T0840-agent-rag-longcontext-radar.md | 无 eval 直接新增候选 ✓ |
| inbox/tom/2026-08-14-evaluation-e1prep.md | R46 基线(3 条确认增量) |
| inbox/tom/2026-08-13-evaluation-e1prep.md | R45 基线(5 条确认增量) |
| paper_cards/947-2608-06867(LLMRouter) | 已建卡;evaluation 主分类;eval.md 未覆盖 |
| paper_cards/929-2608-12036(Mechanist) | 已建卡;agent 主分类;eval.md R46 已覆盖(§6.54 评测方法学 5+ 元组立基础延展) |
| paper_cards/950-2608-13160 | PlayWorld cs.AI 邻接 evaluation;paper_card 未建 |
| paper_cards/951-2608-13010 | AutoDesign meta-harness 邻接 evaluation;paper_card 未建 |
| paper_cards/955-2608-13391(Context-Matched Distillation) | multimodal/systems;已在 flyp R49 §3.3 |
| knowledge/evaluation.md R46 | 确认现有脉络;Harness 三元组七件套 + 五维立标级 + Decoding-Level Taboo / 360CityArena / TSDS-Toolbox 建卡未归口缺口 |
结论
本轮(E1-R47,2026-08-15)eval 主题处于 R46 立标池双向锚 6 向并存第 2 日续立阶段,确认 eval 专项净增 1 条(LLMRouter),eval 邻接净增 2 条(DarwinX + PlayWorld),无 paper_card 层面的 net-new eval 论文出现。
确认增量 3 条: - LLMRouter(2608.06867) 以 evaluation 主分类 + 90▲ 新登 HF Daily top2,是本轮唯一的 eval 专项净增——以"LLM 路由统一五组件形式化评测基础设施"填补 router evaluation 工具箱空白 - DarwinX(2608.07545) 以演化式 Harness 优化进入 eval 邻接候选视野——paper_card 未建,建议先建卡再归口 - PlayWorld(2608.13552) 以"世界模型 Agent 驱动长时目标评测"进入 eval 邻接候选——与 VibeLifeBench + Can LLM Agents Stick to the Script? 共同构成"长程行为评测三件套",paper_card 未建
涉及 arXiv 号:2608.06867(✅ paper_cards 已建,eval.md 待补)、2608.07545(🆕 待建卡)、2608.13552(🆕 待建卡);已在基线续立:2608.12036(Mechanist R46)、2608.08160(Can LLM Agents R46)、2608.10875(VibeLifeBench P1 缺口)、2608.09888(BDH-CQ)、2608.09900(R45 Decoding-Level Taboo)、2608.08814(R45 360CityArena)、2608.08119(R45 TSDS-Toolbox)
建议后续动作: - [ ] LLMRouter(2608.06867)eval.md 归口(§2.2 场景专化轴 + §9.2) - [ ] DarwinX(2608.07545)paper_card 建卡后归入 §2.4(DarwinX)或 §9.3(DarwinX) - [ ] PlayWorld(2608.13552)paper_card 建卡后归入 §2.2(与 VibeLifeBench + Can LLM Agents 并列长程行为评测三件套) - [ ] VibeLifeBench(2608.10875)paper_card 建卡(P1 缺口,R45 已标注,跨轮遗留) - [ ] BDH-CQ 8-15 HF Daily 复核(R46 硬约束未在 inbox 显式提及,需确认最新状态) - [ ] Decoding-Level Taboo(2608.09900)/ 360CityArena(2608.08814)/ TSDS-Toolbox(2608.08119)eval.md 归口(R45 建卡未归口缺口,跨轮遗留)
Tom · 2026-08-15 15:40 CST · E1 预消化简报 · 3 条确认增量(1 eval 专项 + 2 eval 邻接)+ 6 件待核实 · 涉及 arXiv:2608.06867(✅ 已建卡/eval 待补)/ 2608.07545(🆕 待建卡)/ 2608.13552(🆕 待建卡)