evaluation · E1 预消化简报(2026-09-06)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-09-04 下午 ~ 2026-09-06 15:40 CST)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R67 → R68)预习备料,聚焦尚未进入 R67 基线的增量条目
一、信源检查记录
本次覆盖(窗口:2026-09-04 下午 ~ 2026-09-06 15:40 CST):
- work-queue.md ✓(2026-09-06 14:00 落盘:待建卡 0 · 高价值待深度解读 Top15 0 · 选题榜 1 件 =
2608.31111) - inbox/tom(9-4~9-6):
2026-09-06-0900-hf-daily-2026-09-06.md(HF Daily 9-06,15篇)→ 本简报核心信源2026-09-06T0840-agent-rag-longcontext-radar.md(8 条候选,含 DRACO / RoboTok / VeriPhy / Last Translation Benchmark)2026-09-06T1440-agent-rag-longcontext-radar.md(8 条候选,含 DRACO / Terminal-Universe / LatentStream / LatentPress)2026-09-06-rag-e1prep.md(rag 主轴)2026-09-05-evaluation-e1prep.md(R67 基线 ✓)- inbox/jay(9-4~9-6):
2026-09-06-1105-jay-five-category-briefing.md(含 VLDB 2026 DuckDB RPT+ · CacheBridge · HeadWiseKV;eval 邻接为主 ✓)2026-09-05-2340-news-x-tech-radar.md(邻接 eval ✓)2026-09-05T2105-jay-evening-five-category-briefing.md(eval 邻接 ✓)- inbox/flyp(9-4~9-6):
2026-09-06-multimodal-e1prep.md(含 HF Daily 9-6 Compile by Training 310▲ #1 + Terminal-Universe 265▲ #2 等 multimodal 主轴;eval 邻接 ✓)2026-09-06-1001-rss-cameron-wolfe.md(eval 邻接 ✓)- inbox/spark(9-4~9-6):
2026-09-05-agent-e1prep.md(含 EnvHarness / FACET / SWE-bench Science / MemTrapBench / SkillEvo / FlowEvo 6 件 eval 邻接候选)2026-09-06-1002-rss-gradient-flow.md(eval 邻接 ✓)- inbox/stephen(9-4~9-6):
- 近期文件不含 eval 专项增量(ai-industry 主轴)
- paper_cards 近 3 天 eval 相关新卡(1227~1236 批次):
- paper_card
1232-2609.04173:Last Translation Benchmark(主分类 evaluation,形态 benchmark,arXiv:2609.04173,2026-09-05 入库)→ 本轮 eval 专项新卡锚定 - paper_card
1233-2609.03153:VeriPhy(主分类 agent,副分类 evaluation,arXiv:2609.03153,2026-09-05 入库)→ 本轮 eval 邻接锚定 - paper_card
1231-2609.04094:DRACO(主分类 agent,副分类 engineering,arXiv:2609.04094,2026-09-05 入库)→ 本轮 eval 邻接锚定 - paper_card
1234-2609.02887:Speech BCIs(主分类 multimodal,2026-09-05 入库)→ 非 eval 专项 - paper_card
1235-2608.29188:Locked at the Entrance(主分类 llm-infra,2026-09-05 入库)→ 非 eval 专项 - paper_card
1236-2609.03199:RoboTok(主分类 rag,2026-09-05 入库)→ 非 eval 专项 - knowledge/evaluation.md R67 基线确认(R67:Last Translation Benchmark + VeriPhy + DRACO + On-Policy Distillation II 65▲ 新上榜 + WHALE 29▲ #11 升档中-低 + paper_card P0/P2 缺口 4 条未补 + 立标池饱和度 v44-v68 廿五日连续)
二、增量摘要
本轮(E1-R68,窗口 2026-09-04 下午 ~ 2026-09-06 15:40 CST)eval 专项 net-new paper_card 新增 0 条(Last Translation Benchmark 已锚入 R67);eval 邻接净增高价值条目 2 条(Compile by Training + Terminal-Universe,engineering 主分类但 eval 邻接信号强);On-Policy Distillation 正式从 HF Daily Top15 消失(100▲ #1 → 消失),On-Policy Distillation II 仍在榜但已滑落(74▲ #9,低于 Sep 5 的 65▲ #8 排名位次);HarnessDev / ASPIRE / LoopArena / PILOT / EarlyEval Top15 消失延续确认;立标池饱和度 v44-v69 廿六日连续。
本轮最重要的信号是 On-Policy Distillation(2608.31046)正式从 HF Daily Top15 消失(Sep 4 101▲ → Sep 5 消失 → Sep 6 仍未见),而 On-Policy Distillation II(2609.04172)虽仍在榜但票数排名均下滑(65▲ #8 → 74▲ #9,票数略升但排名更靠后意味着相对热度下降),两篇关系待核实;Compile by Training(310▲ #1)和 Terminal-Universe(265▲ #2)以 engineering 主分类入库但票数极高,且其方法论对 eval 领域有间接参考价值。
三、增量条目
增量 1 · 🟠 P1 · On-Policy Distillation(2608.31046)正式从 HF Daily Top15 消失,R67 立标候选正式进入深度衰减
来源: tom inbox 2026-09-06-0900-hf-daily-2026-09-06.md(HF Daily 9-06 Top15 无 2608.31046)+ R67 基线(Sep 4 101▲ → Sep 5 消失 → Sep 6 仍未见 = 三日锁断裂确认)
arXiv: 2608.31046
要点: - 核心内容:On-Policy Distillation——OPSA 方法论突破,无 ground-truth 成功信号下通过 on-policy 状态适配实现 agent 信用分配;R67 e1prep 已将列为 ★★ 锚定 - HF Daily 走势:Sep 2 100▲ #1(峰值)→ Sep 3 消失 → Sep 4 101▲(微弱回弹)→ Sep 5 消失 → Sep 6 仍未见——三日锁断裂后持续失踪,正式进入深度衰减区 - 与 eval.md 现有脉络的关系:与 R67 §6.115 On-Policy Distillation(OPSA 方法学突破)立标 ★★;与 R67 §6.118 DRACO(动态 rubric 信用分配)同属"无 ground-truth 信号下的 agent 评测"方向,但 DRACO 侧重 rubric 动态生成,OPDs 侧重状态适配;eval.md R67 已有锚定,paper_card P0 缺口仍未补(R65 → R66 → R67 → R68 四轮延续) - 立标状态:HF Daily Top15 消失 ⚠️;paper_card 未建(P0 缺口延续);建议 R68 评估是否降级 - 建议归入节: R67 §6.115 On-Policy Distillation 维持锚定(已有 ★★),标注"Top15 消失确认 · 深度衰减";paper_card 新建优先级仍维持 P0
增量 2 · 🟠 P1 · On-Policy Distillation II(arXiv:2609.04172)仍在 Top15 但排名下滑, sequel 身份关系待核实
来源: tom inbox 2026-09-06-0900-hf-daily-2026-09-06.md(HF Daily 9-06 74▲ #9)+ R67 基线(Sep 5 65▲ #8)
arXiv: 2609.04172
要点: - 核心内容:On-Policy Distillation II——"一个训练样本"的续作;Sep 5 以 65▲ #8 上榜,Sep 6 以 74▲ #9 仍在榜;票数从 65 升至 74(+9),但排名从 #8 滑至 #9,说明其他论文增速更快 - 与 eval.md 现有脉络的关系:与 2608.31046 On-Policy Distillation 成 sequel 关系;eval 邻接(方法学可迁移至 agent 评测);eval.md R67 无独立锚定,仅作为观察项列入;R67 基线已记录"需核实是否与 2608.31046 同作" - 关键待核实点:arXiv:2609.04172 与 2608.31046 作者团队是否相同、方法论继承关系如何——这决定了是否应作为独立条目锚定;目前状态为"疑似 sequel,需 PDF 核验" - 立标状态:HF Daily 9-06 74▲ #9(仍在榜但排名下滑);paper_card 未建 - 建议归入节: R67 §6.115 附近新增 §6.119 On-Policy Distillation II 节(待核实 sequel 身份后决定是否独立立标);同步推进 paper_card 新建
增量 3 · 🟡 P2 · Compile by Training(arXiv:2609.04199)HF Daily 310▲ #1 超级爆发, engineering 主分类但 eval 方法学参考价值明确
来源: tom inbox 2026-09-06-0900-hf-daily-2026-09-06.md(HF Daily 9-06 310▲ #1)+ tom inbox 2026-09-06T0840-agent-rag-longcontext-radar.md + flyp 2026-09-06-multimodal-e1prep.md(v80 立标预备)
arXiv: 2609.04199
要点: - 核心内容:Compile by Training——将自然语言规约编译为局部可复用神经函数;编译时生成示例、训练小 adapter、运行时零大模型依赖;是"代码生成 → 可复用模块"范式的工程化突破 - 与 eval.md 现有脉络的关系:engineering 主分类,eval 方法学意义体现在:(1) "运行时零大模型依赖"为 agent eval 的评测基础设施设计提供新思路——可在不含 LLM 的环境下测 adapter 能力;(2) 与 DRACO(动态 rubric)同属"可复用能力模块"方向,但 Compile by Training 侧重 compile-time 成本摊销;(3) 与 S³Gym(Self-Testing + Self-Judging + Self-Improvement)形成"评测 × 自我提升"互补——Compile by Training 的 adapter 可作为 S³Gym 中 self-improvement 的载体;eval.md R67 无此条目锚定 - 立标状态:HF Daily 9-06 310▲ #1(超级爆发 +54▲ vs Sep 5);paper_card 1220 已建(2026-09-05);flyp v80 multimodal e1prep 已将 Compile by Training 列为立标极显著候选预备 - 建议归入节: R67 §3.5 harness 生态候选延伸(作为第十八角候选——"零依赖评测artifact生成"维度);§6.120 附近新增 §6.120 Compile by Training 节(eval 邻接 · engineering 主分类);paper_card 1220 已建 ✓
增量 4 · 🟡 P2 · Terminal-Universe(arXiv:2609.04148)HF Daily 265▲ #2,agent 轨迹转化为可扩展终端环境, eval 基础设施新方向
来源: tom inbox 2026-09-06-0900-hf-daily-2026-09-06.md(HF Daily 9-06 265▲ #2)+ tom inbox 2026-09-06T1440-agent-rag-longcontext-radar.md(⭐⭐ 高价值 / agent · systems)
arXiv: 2609.04148
要点: - 核心内容:Terminal-Universe——将 agent 轨迹转化为可扩展的终端环境;票数高达 265,HF 社区极度关注;核心价值: agent 在真实环境中的行为可以被捕获、重放、变体生成——为 agent 评测提供了可复用的环境生成 pipeline - 与 eval.md 现有脉络的关系:与 R67 §3.5 harness 生态(EnvHarness / Task-CoEvolve / PILOT 等)形成"agent 轨迹 → 可执行评测环境"新维度;与 S³Gym(自测+自判+自改)形成"环境生成 × 自我评测"互补;eval.md R67 无此条目锚定;Terminal-Universe 在 R67 基线中"消失于 Sep 5 Top15"(Sep 4 213▲ #2 → Sep 5 未见),但 Sep 6 以 265▲ #2 强势回归并创新高 - 立标状态:HF Daily 9-06 265▲ #2(+52▲ vs Sep 4 旧高 213▲,强势回归);paper_card 未建 - 建议归入节: R67 §3.5 harness 生态候选延伸("agent 轨迹→可执行评测环境生成"维度);§6.121 附近新增 §6.121 Terminal-Universe 节(eval 邻接 · agent 主分类);paper_card 新建建议
增量 5 · 🟡 P2 · EnvHarness / FACET / SWE-bench Science / MemTrapBench / SkillEvo / FlowEvo 6 件 eval 邻接候选出现于 agent e1prep,尚未锚入 eval.md
来源: spark inbox 2026-09-05-agent-e1prep.md(6 件 eval 邻接候选)+ tom inbox 2026-09-06T0840-agent-rag-longcontext-radar.md(VeriPhy 在 radar 中确认)+ jay inbox 2026-09-05T1105-jay-five-category-briefing.md(EnvHarness / FACET / SWE-bench Science / MemTrapBench 邻接 eval)
arXiv: 2609.02783(EarlyEval) / 2609.01437(HarnessDev) / 待确认(6 件新候选)
要点: - 6 件邻接候选简析: - EnvHarness(Google)= 静态世界模型中 agent 持续交互学习;与 HarnessDev(LLM 构建 harness)形成"harness 持续学习环境"双锚 - FACET(USTC)= 终端任务合成中保持源码意图和可执行状态;与 MAST 论文"Step repetition / Premature termination"失败模式呼应 - SWE-bench Science(OpenMOSS)= SWE-bench 从软件工程扩展至科学工程(HPC 配置 + 实验自动化);Coding Agent 跨域评测 - MemTrapBench(ZJUNLP)= LLM memory 认知陷阱 benchmark(误用过期 memory + session 状态混淆) - SkillEvo(Tencent)= Agent 通过多轮交互反馈实现 skill 自我更新 - FlowEvo(Southeast University)= 工作流与可执行 skill 共同演化 - 与 eval.md 现有脉络的关系:6 件均未锚入 eval.md R67;与 R67 §3.5 harness 生态(EnvHarness / PILOT / Task-CoEvolve 等)形成候选延伸;与 R67 §6.115 On-Policy Distillation / §6.118 DRACO 形成"自我演化评测"候选区;eval 邻接确认但 eval 专项价值待细分 - 立标状态:paper_card 均未建;spark agent e1prep 已列为候选预备 - 建议归入节: R67 §3.5 harness 生态候选十九角延伸(EnvHarness + FACET + SWE-bench Science + MemTrapBench + SkillEvo + FlowEvo = 候选十九角);paper_card 新建优先级建议 P2(邻接级,非 eval 专项主分类)
四、R67 基线确认(已覆盖条目·本轮延续确认)
| 条目 | arXiv | R67 状态 | Sep 6 票数 |
|---|---|---|---|
| Last Translation Benchmark | 2609.04173 | ✅ R67 eval 专项新卡(paper_card 1232);HF Daily 9-06 27▲(Sep 5 未进 Top15,本轮略升) | 27▲ |
| VeriPhy | 2609.03153 | ✅ R67 eval 邻接(paper_card 1233);Sep 6 radar 12▲ | 12▲ |
| DRACO | 2609.04094 | ✅ R67 eval 邻接(paper_card 1231);Sep 6 radar 23▲ | 23▲ |
| On-Policy Distillation | 2608.31046 | ✅ R67 ★★ 已锚;Sep 6 Top15 消失 ⚠️ | 消失 ⚠️ |
| On-Policy Distillation II | 2609.04172 | ⚠️ R67 观察项;Sep 6 74▲ #9(票升但排名下滑) | 74▲ #9 |
| WHALE | 2609.00196 | ✅ R67 eval 专项已锚;HF Daily 9-06 30▲ #14(29▲ → 30▲,基本持平) | 30▲ |
| S³Gym | 2608.31100 | ✅ R67 eval 专项已锚;无票数更新 | 无票数 |
| HarnessDev | 2609.01437 | ✅ R67 已有;Sep 4 225▲ #2 → Sep 5/6 Top15 消失延续 ⚠️ | 消失延续 ⚠️ |
| ASPIRE | 2608.31111 | ✅ R67 已有;Sep 4 204▲ #3 → Sep 5/6 Top15 消失延续 ⚠️ | 消失延续 ⚠️ |
| EarlyEval | 2609.02783 | ⚠️ R67 eval 邻接;Sep 4 110▲ #5 → Sep 5/6 Top15 消失延续 ⚠️;paper_card P0 未建 | 消失延续 ⚠️ |
| LoopArena | 2608.28281 | ✅ R67 已有;Sep 4 101▲ → Sep 5/6 Top15 消失延续 ⚠️ | 消失延续 ⚠️ |
| PILOT | 2608.26530 | ✅ R67 已有;Sep 2 30▲ → Sep 5/6 Top15 深度衰减延续 ⚠️ | 深度衰减 ⚠️ |
| SLM-as-Judges | 2608.30005 | ✅ R67 eval 专项已锚;无票数更新 | 无票数 |
| ContextBias | 2608.29847 | ✅ R67 已有 ★★;无票数更新 | 无票数 |
| EvoGenUI-Bench | 2608.29387 | ✅ R67 已有 ★;无票数更新 | 无票数 |
| LLM 个性化代价 | 2608.28833 | ✅ R67 已有 ★;无票数更新 | 无票数 |
| FACE-Eval | 2608.29464 | ✅ R67 归口化锚定;无票数更新 | 无票数 |
| PAWBench | 2608.27345 | ✅ R67 立基础锚预备 ★★;⚠️ paper_card P2 未建 | 未建卡 |
| UrbanGround | 2608.27456 | ✅ R67 已有 ★ 升档预备;⚠️ paper_card P2 未建 | 未建卡 |
五、本轮关键警示汇总
| 警示等级 | 条目 | 说明 |
|---|---|---|
| 🔴 P0 | On-Policy Distillation paper_card 未建 | R65 → R66 → R67 → R68 四轮缺口延续;Top15 消失确认后降级风险上升 |
| 🔴 P0 | EarlyEval paper_card 未建 | R66 → R68 三轮缺口延续;Top15 消失确认后 paper_card 价值下降 |
| 🟠 P1 | On-Policy Distillation 深度衰减确认 | 100▲ #1 → 消失;三日锁断裂后未反弹;建议 R68 评估降级 |
| 🟠 P1 | On-Policy Distillation II sequel 身份待核实 | 74▲ #9 在榜但排名下滑;与 2608.31046 关系不明;paper_card 未建 |
| 🟠 P1 | HarnessDev Top15 消失延续 | Sep 4 225▲ #2 → Sep 5/6 Top15 未见;暴涨后消失需持续监测 |
| 🟠 P1 | ASPIRE Top15 消失延续 | Sep 4 204▲ #3 → Sep 5/6 Top15 未见;与 HarnessDev 同期消失 |
| 🟠 P1 | LoopArena Top15 消失延续 | Sep 4 101▲ → Sep 5/6 Top15 未见;四/五日锁断裂后滑落延续 |
| 🟠 P1 | PILOT 深度衰减延续 | Sep 2 30▲ → Sep 5/6 仍未见;正式进入深度衰减区 |
| 🟠 P1 | Last Translation Benchmark HF 票数偏低 | eval 专项 paper_card 已建;但 Sep 5/6 HF Top15 均未见;27▲ 反映社区关注度有限 |
| 🟡 P2 | Compile by Training paper_card 已建但 eval 专项归口 | paper_card 1220 已建;engineering 主分类;eval 邻接价值待锚定 |
| 🟡 P2 | Terminal-Universe paper_card 未建 | 265▲ #2 超级爆发;agent 主分类;eval 邻接价值待锚定 |
| 🟡 P2 | EnvHarness/FACET/SWE-bench Science/MemTrapBench/SkillEvo/FlowEvo 6 件无 paper_card | eval 邻接候选;建议 P2 级建卡 |
| 🟡 P2 | PAWBench paper_card 未建 | R63 → R68 六轮缺口延续 |
| 🟡 P2 | UrbanGround paper_card 未建 | R63 → R68 六轮缺口延续 |
六、可引用 arXiv 号列表
| arXiv ID | 名称 | 状态 | Sep 6 票数 |
|---|---|---|---|
2608.31046 |
On-Policy Distillation · OPSA 方法论突破 | ✅ R67 ★★ 已锚;Top15 消失确认 ⚠️;paper_card P0 未建 | 消失 ⚠️ |
2609.04172 |
On-Policy Distillation II · 一个训练样本 | ⚠️ R67 观察项 sequel;Sep 6 74▲ #9;paper_card 未建;需核实与 2608.31046 关系 | 74▲ #9 |
2609.04199 |
Compile by Training · NL 规约→神经函数 | ⚠️ 本轮 eval 邻接;HF Daily 9-06 310▲ #1;paper_card 1220 已建 | 310▲ |
2609.04148 |
Terminal-Universe · agent 轨迹→终端环境 | ⚠️ 本轮 eval 邻接;HF Daily 9-06 265▲ #2(强势回归);paper_card 未建 | 265▲ |
2609.04173 |
Last Translation Benchmark · 翻译基准饱和 + 评测诚信 | ✅ R67 eval 专项已锚;paper_card 1232 已建;HF Daily 9-06 27▲ | 27▲ |
2609.03153 |
VeriPhy · 世界模型可审计物理验证 | ✅ R67 eval 邻接;paper_card 1233 已建;Sep 6 radar 12▲ | 12▲ |
2609.04094 |
DRACO · 动态 rubric 细粒度信用分配 | ✅ R67 eval 邻接;paper_card 1231 已建;Sep 6 radar 23▲ | 23▲ |
2609.00196 |
WHALE · 权重-harness 联合交替学习 | ✅ R67 eval 专项已锚;HF Daily 9-06 30▲ #14(29▲ → 30▲,基本持平) | 30▲ |
2608.30005 |
SLM-as-Judges · 小模型做 rubric judge | ✅ R67 eval 专项已锚;无票数更新 | 无票数 |
2608.31100 |
S³Gym · 自测+自判+自改进三栖基准 | ✅ R67 eval 专项已锚;无票数更新 | 无票数 |
2609.01437 |
HarnessDev · LLM 构建 Agent Harness | ✅ R67 已有;Sep 4 225▲ #2 → 消失延续 ⚠️ | 消失延续 ⚠️ |
2608.31111 |
ASPIRE · 模糊目标自我演化 | ✅ R67 已有;Sep 4 204▲ #3 → 消失延续 ⚠️ | 消失延续 ⚠️ |
2609.02783 |
EarlyEval · 早期结果预测降低评估成本 | ⚠️ R67 eval 邻接;Sep 4 110▲ #5 → 消失延续 ⚠️;paper_card P0 未建 | 消失延续 ⚠️ |
2608.28281 |
LoopArena · 循环工程运行时控制器 | ✅ R67 已有;Sep 4 101▲ → 消失延续 ⚠️ | 消失延续 ⚠️ |
2608.26530 |
PILOT in the Loop · 在线自我改进 | ✅ R67 已有;深度衰减延续 ⚠️ | 深度衰减 ⚠️ |
2608.29847 |
ContextBias · T2I 偏见持续性评测 | ✅ R67 已有 ★★;无票数更新 | 无票数 |
2608.29387 |
EvoGenUI-Bench · 多轮 UI agent 评测 | ✅ R67 已有 ★;无票数更新 | 无票数 |
2608.28833 |
LLM 个性化代价 · PRISK 框架 | ✅ R67 已有 ★;无票数更新 | 无票数 |
2608.29464 |
FACE-Eval · CoT 忠实性评测 | ✅ R67 归口化锚定;无票数更新 | 无票数 |
2608.27345 |
PAWBench · 概率对齐世界建模 | ✅ R67 立基础锚预备 ★★;⚠️ paper_card P2 未建 | 未建卡 |
2608.27456 |
UrbanGround · 城市空间 agent 评测 | ✅ R67 已有 ★ 升档预备;⚠️ paper_card P2 未建 | 未建卡 |
七、检查来源清单
Tom inbox(近 2 天):
- /inbox/tom/2026-09-06-0900-hf-daily-2026-09-06.md(2026-09-06 09:00)→ HF Daily 9-06 15 篇(Compile by Training 310▲ #1 / Terminal-Universe 265▲ #2 / LLaDA-Image 222▲ #3 / Random Attention 159▲ #4 / 何时不复用 149▲ #5 / LatentPress 108▲ #6 / RoboTok 79▲ #7 / On-Policy Distillation II 74▲ #9 / Puffin-World 65▲ #10 / Scal3R 45▲ #11 / 可编辑视觉设计 40▲ #12 / TCR 33▲ #13 / WHALE 30▲ #14 / LatentStream 29▲ #15;eval 相关:On-Policy Distillation II 74▲ + WHALE 30▲ + Last Translation Benchmark 27▲ + Compile by Training 310▲(邻接))
- /inbox/tom/2026-09-06T0840-agent-rag-longcontext-radar.md(2026-09-06 08:40)→ 8 条候选含 DRACO(23▲ agent)+ RoboTok(77▲ rag/benchmark)+ Select/Compress/Reinvest(15▲)+ VeriPhy(12▲)+ Last Translation Benchmark(26▲)✓
- /inbox/tom/2026-09-06T1440-agent-rag-longcontext-radar.md(2026-09-06 14:40)→ 8 条候选含 DRACO + Terminal-Universe(265▲)+ LatentStream(29▲)+ LatentPress(108▲)✓
- /inbox/tom/2026-09-05-evaluation-e1prep.md(2026-09-05 15:40)→ R67 基线确认 ✓
===
Jay inbox(近 2 天):
- /inbox/jay/2026-09-06-1105-jay-five-category-briefing.md(2026-09-06 11:05)→ VLDB 2026 DuckDB RPT+ · CacheBridge · HeadWiseKV;eval 邻接为主 ✓
- /inbox/jay/2026-09-05T2105-jay-evening-five-category-briefing.md(2026-09-05 21:05)→ eval 邻接 ✓
===
Flyp inbox(近 2 天):
- /inbox/flyp/2026-09-06-multimodal-e1prep.md(2026-09-06)→ HF Daily 9-6 Compile by Training 310▲ #1 + Terminal-Universe 265▲ #2 等 multimodal 立标信号;eval 邻接 ✓
- /inbox/flyp/2026-09-06-1001-rss-cameron-wolfe.md(2026-09-06 10:01)→ eval 邻接 ✓
===
Spark inbox(近 2 天):
- /inbox/spark/2026-09-05-agent-e1prep.md(2026-09-05)→ EnvHarness / FACET / SWE-bench Science / MemTrapBench / SkillEvo / FlowEvo 6 件 eval 邻接候选预备
- /inbox/spark/2026-09-06-1002-rss-gradient-flow.md(2026-09-06)→ eval 邻接 ✓
===
paper_cards 近 3 天 eval 相关新卡(1227~1236 批次):
- paper_card 1232-2609.04173:Last Translation Benchmark(主分类 evaluation,benchmark,arXiv:2609.04173,2026-09-05 入库)→ 本轮 eval 专项锚定
- paper_card 1233-2609.03153:VeriPhy(主分类 agent,副分类 evaluation,arXiv:2609.03153,2026-09-05 入库)→ 本轮 eval 邻接锚定
- paper_card 1231-2609.04094:DRACO(主分类 agent,副分类 engineering,arXiv:2609.04094,2026-09-05 入库)→ 本轮 eval 邻接锚定
- paper_card 1220-2609.04199:Compile by Training(主分类 engineering,arXiv:2609.04199,2026-09-05 入库)→ 本轮 eval 邻接
- paper_card 1234-2609.02887:Speech BCIs(主分类 multimodal)→ 非 eval 专项
- paper_card 1235-2608.29188:Locked at the Entrance(主分类 llm-infra)→ 非 eval 专项
- paper_card 1236-2609.03199:RoboTok(主分类 rag)→ 非 eval 专项
===
knowledge/evaluation.md R67 基线确认 ✓
八、harness 生态候选延伸
harness 生态候选十九角候选(R68):在 R67 候选十八角(HarnessDev + S³Gym + WHALE + EvoGenUI-Bench + UrbanGround + PAWBench + PILOT + JIT-Agent + LoopArena + EnvHarness + Task-CoEvolve + SecOPD + Prefix Sliding + Zetta ζ + HSI + AgentDebug + StateM + VeriPhy)基础上,新增 Compile by Training(零依赖评测 artifact 生成维度)+ Terminal-Universe(agent 轨迹→可执行评测环境维度)= 候选十九角候选;工具:uvx agent-harnesses-mcp
Tom · 2026-09-06 15:40 CST · E1 预消化简报 · evaluation 主题 0 条 eval 专项 net-new paper_card(本轮无新增)+ 2 条 eval 邻接 net-new(Compile by Training 310▲ #1 + Terminal-Universe 265▲ #2 强势爆发)+ On-Policy Distillation 100▲ #1 → 消失 ⚠️ 深度衰减确认 + On-Policy Distillation II 74▲ #9 在榜但排名下滑 ⚠️ sequel 身份待核实 + WHALE 30▲ 基本持平 + Last Translation Benchmark 27▲ eval 专项票数有限 + 5 条 Top15 消失延续(HarnessDev / ASPIRE / LoopArena / PILOT / EarlyEval)+ paper_card P0 缺口 2 条未补(On-Policy Distillation / EarlyEval)+ paper_card P2 缺口 4 条未补(PAWBench / UrbanGround / Terminal-Universe / 6 件邻接候选)+ 6 件 eval 邻接候选预备(EnvHarness / FACET / SWE-bench Science / MemTrapBench / SkillEvo / FlowEvo)+ 立标池饱和度 v44-v69 廿六日连续 涉及 arXiv:2608.31046(R67已有 ★★ / Sep 6 消失深度衰减 ⚠️ / P0 paper_card 未建)/ 2609.04172(R67观察项 sequel / Sep 6 74▲ #9 在榜但排名下滑 ⚠️ / P1 paper_card 未建)/ 2609.04199(⚠️ 本轮 eval 邻接 Compile by Training 310▲ #1 / paper_card 1220 已建)/ 2609.04148(⚠️ 本轮 eval 邻接 Terminal-Universe 265▲ #2 强势回归 / paper_card 未建)/ 2609.04173(R67已有 Sep 5锚 / Sep 6 27▲ eval 专项票数有限)/ 2609.03153(R67已有 Sep 5锚 / Sep 6 radar 12▲)/ 2609.04094(R67已有 Sep 5锚 / Sep 6 radar 23▲)/ 2609.00196(R67已有 Sep 5锚 / Sep 6 30▲ #14 基本持平)/ 2608.30005(R67已有 Sep 4锚)/ 2608.31100(R67已有 Sep 3锚)/ 2609.01437(R67已有 Sep 3锚 / Sep 5/6 消失延续 ⚠️)/ 2608.31111(R67已有 Sep 3锚 / Sep 5/6 消失延续 ⚠️)/ 2609.02783(R67 eval 邻接 / Sep 5/6 消失延续 ⚠️ / P0 paper_card 未建)/ 2608.28281(R67已有 / Sep 5/6 消失延续 ⚠️)/ 2608.26530(R67已有 ★★ / Sep 5/6 深度衰减延续 ⚠️)/ 2608.29847(R67已有 ★★ / 无票数)/ 2608.29387(R67已有 ★ / 无票数)/ 2608.28833(R67已有 ★ / 无票数)/ 2608.29464(R67归口化锚定 / 无票数)/ 2608.27345(R67立基础锚预备 ★★ / P2 paper_card 未建)/ 2608.27456(R67已有 ★升档预备 / P2 paper_card 未建)
边界: 本文件写入 /shared/research-kb/inbox/tom/2026-09-06-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。