evaluation · E1 预消化简报(2026-09-08)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-07 15:40 ~ 2026-09-08 15:40 CST 数据来源: Tom 9-08 0840 radar + Tom 9-08 rag-e1prep + HF Daily 9-08 + paper_cards Sep 6-8 eval 相关卡核查 + candidates JSON Sep 7-8 + Stephen 9-08 ai-industry e1prep 活文档基线: evaluation.md R69 锚定(2 件 eval 专项 paper_card 净增:AgentJudgeBench 2608.26623 + Harness-of-Harness 2609.01481 · Compile by Training 317→374▲ +57 极显著续立 · Terminal-Universe 265▲ +52 强势回归 · On-Policy Distillation 深度衰减 ⚠ · FuzzyBench-Hard 83.6% 入 Terminal Universe · 立标池饱和度 v44-v70 廿七日连续 · R69 范式双轨 Compile by Training + Terminal Universe 候选十九角)
0. 基线对齐与本轮概述
R69 锚定状态: - 2 件 eval 专项 paper_card 入库(Sep 5 OpenAlex 回填):AgentJudgeBench(2608.26623)+ Harness-of-Harness(2609.01481) - Compile by Training(2609.04199)R69 锚为 eval邻接,R70 窗口 374▲ +57 极显著续立 - Terminal-Universe(2609.04148)R69 锚为 eval邻接,R70 窗口 265▲ +52 强势回归 - On-Policy Distillation(R68→R69→R70 持续深度衰减 ⚠)+ On-Policy Distillation II(排名 8→9 下滑 ⚠) - FuzzyBench-Hard 83.6% → 归入 Terminal Universe 两阶段重建框架 - Last Translation Benchmark(2609.04173)29→30▲ 微量持平 - τ^τ-Bench(2609.04611)Sep 7 2 票 → Sep 8 radar 候选,agent 主分类 eval邻接 - Substrate-Aware AI Agents(2609.05232)Sep 7 4 票 → Sep 8 radar 候选,agent 主分类 eval邻接
本轮 E1-R70 增量摘要: - 3 件 eval 专项 net-new paper_card(Sep 7-8 新卡,eval 主分类,未在 R69 prep 出现):When Models Edit Too Much(2609.04061)+ KoNA(2609.04720)+ Ask Before You Optimize(2609.05258) - 1 件 eval 邻接新候选(Sep 8 HF Daily,eval 专项未建卡):RealSWE(2608.27831)29▲ 真实用户请求编码 Agent 组合性评估 - Compile by Training 极显著续立(374▲ +57,eval邻接,HF Daily #1 持续) - 1 件待核实 eval邻接新候选:HarvestBench(2609.04444)3 票 agent+memory+benchmark - 整体增量密度中等偏低——3 件 eval 专项新卡质量参差(KoNA 和 Ask Before You Optimize 方向新颖,When Models Edit Too Much 粒度较细),RealSWE 是真实用户场景评测缺口补强,Compile by Training 续立信号强劲。
1. 增量条目(3 件 eval 专项 net-new + 2 件 eval 邻接新候选)
增量 ① When Models Edit Too Much(2609.04061):代码编辑过度问题的系统研究
- 来源: paper_card 1242-2609.04061.md(Sep 8 14:00 入库,主分类 evaluation,形态 method)+ candidates Sep 8 未见(arXiv 9 月初)
- 要点: 大模型已广泛用于代码编辑,但正确性不是唯一指标——有用修复应同时满足最小化修改、可审查、对原始实现忠实。论文研究 over-editing 倾向:模型修改超出必要范围,引入 review 负担和潜在 bug。提出 fidelity 度量框架,评估模型在"精确修复"与"过度修改"之间的权衡。
- 与活文档现有脉络的关系: 与 R68-R69 §2.6 评测工程化 harness/信用分配方向邻接——后者关注评测框架本身,前者关注被测模型的编辑行为质量(评测对象质量)。与 SWE-bench 类评测数据集不同:SWE-bench 测任务完成率,When Models Edit Too Much 测编辑粒度 Fidelity。与 R69 §6.127(OR-Clarify 候选)均关注"最小化修改"思想,但 OR-Clarify 侧自然语言优化 formulation,此文侧代码编辑 fidelity。eval.md R69 无此条目锚定。
- 建议归入节: §2.6 评测工程化(代码编辑行为 fidelity 评测)+ §6.127 候选区(OR-Clarify 邻接,代码编辑粒度方向)
- 可信度: ★★★(paper_card 已建,eval 主分类 method;arXiv 预印本,票数未知)
- ⚠️ 待办: 补充 HF 票数;需确认 paper_card 已有 TLDR(yes 已富化 ✓)
增量 ② KoNA / Knowing What Not to Answer(2609.04720):VLM 选择性不服从 benchmark
- 来源: paper_card 1253-2609.04720.md(Sep 8 14:11 入库,主分类 evaluation,形态 benchmark)+ Tom 9-08 0840 radar(2 票 benchmark+multimodal)+ HF Daily 候选
- 要点: VLM 在复杂现实请求中往往部分可答、部分应拒绝。KoNA(Knowledge-aware N/A)在五个类别下系统评估 VLM 的选择性不服从:False Premise(错误前提)、Visual Reasoning(视觉推理困难)、Infeasible Request(不可行请求)等。与传统安全评测不同,KoNA 关注"知道何时该拒绝"而非"安全拒绝",衡量 VLM 对自身能力边界的自我认知。benchmark 形态,适合作为 VLM 评测体系补充。
- 与活文档现有脉络的关系: 与 R69 §6.118 DRACO(动态 rubric 信用分配)同属"模型自我认知边界评测"方向,KoNA 测拒绝能力自我认知,DRACO 测评分自我认知。与 R68 §4 维度化指标体系(VLM 评测多维度)邻接。eval.md R69 无此条目锚定。
- 建议归入节: §4 维度化指标体系(VLM 选择性不服从评测)+ §2.6 评测工程化(benchmark 形态)
- 可信度: ★★★(paper_card 已建,eval 主分类 benchmark;2 票偏低;TLDR 已富化 ✓)
- ⚠️ 待办: 关注票数增长趋势;评估是否与 existing VLM safety benchmarks 重叠
增量 ③ Ask Before You Optimize(2609.05258):优化问题 formulation 前置澄清 benchmark
- 来源: paper_card 1239-2609.05258.md(Sep 8 14:11 入库,主分类 evaluation,形态 benchmark)+ candidates Sep 8 候选(tags: evaluation)+ HF Daily 候选
- 要点: LLM 被广泛用于从自然语言问题描述构建优化模型(运筹学 OR 场景),但用户请求往往模糊或不完整——LLM 若直接"猜"着建模,结果往往是错的或次优的。Ask Before You Optimize 引入 Dynamic Pre-Formulation Clarification 任务:模型在建模前主动向用户澄清模糊点,评测"提问质量"和"最终模型质量"双重指标。benchmark 形态,覆盖 5 类 OR 任务(VRP、调度、装箱等)。
- 与活文档现有脉络的关系: 与 R69 §6.127(OR-Clarify 候选)高度相关——两者同属"优化问题 formulation 前置澄清"方向,可能是同区域协同建档。OR-Clarify 是候选文件名标注,KoNA 是正式 paper_card ID。与 R69 §6.118 DRACO(动态 rubric 信用分配)同属"模型在不确定时主动寻求信息"能力评测。eval.md R69 无此条目锚定。
- 建议归入节: §6.127 候选区(OR-Clarify 邻接 · 优化问题 formulation 前置澄清评测)+ §4 维度化指标体系(主动澄清能力评测)
- 可信度: ★★★(paper_card 已建,eval 主分类 benchmark;candidates 有 tag;TLDR 已富化 ✓)
- ⚠️ 待办: 核实是否与 OR-Clarify 候选文件为同一工作;关注 HF 票数增长
增量 ④ RealSWE(2608.27831):真实用户请求下编码 Agent 组合性评估(eval 邻接新候选)
- 来源: HF Daily 9-08 15 篇精选,#14 排序,29▲ + Tom 9-08 rag-e1prep(R84 未锚入 eval.md)+ candidates Sep 8 未见(29 票未进 radar Top8)+ arXiv:2608.27831
- 要点: SWE-bench 等现有编码评测基准使用人工精挑的 GitHub issue,真实用户请求往往更模糊、更多跳、更多隐含依赖。RealSWE 从真实用户请求出发,评估编码 Agent 的组合性(compositionality)——能否将复杂多步请求分解为可正确执行的子任务序列。评测对象:Claude Code / GPT-5.6-Sol / Gemini CLI 等主流 coding agent。
- 与活文档现有脉络的关系: 与 R69 §6.118 DRACO(长视野 Agent 细粒度信用分配)同属 coding agent 评测方向,但 DRACO 侧评分机制,RealSWE 侧任务组合性。与 §6.127 τ^τ-Bench(Agent 构建过程评测)同属 coding agent benchmark 但不同维度:τ^τ-Bench 测构建过程,RealSWE 测真实用户请求下的组合性。eval.md R69 无此条目锚定。
- 建议归入节: §6.127 候选区(coding agent 真实用户请求评测缺口)+ §2.6 评测工程化(coding agent benchmark 新维度)
- 可信度: ★★★★(HF Daily 29▲,Sep 8 新出现;coding agent 评测缺口明确;paper_card 未建 ⚠)
- ⚠️ 待办: 建议建立 paper_card;追踪 Sep 9 HF Daily 票数确认增长趋势
增量 ⑤ Compile by Training 极显著续立(374▲ +57):eval 邻接,HF Daily #1 持续
- 来源: HF Daily 9-08 #1,374▲ +57 极显著跃升(对比 R69 锚定 317▲)+ Flyp 9-08 multimodal e1prep v84 已接力
- 要点: Compile by Training R70 窗口由 317▲ → 374▲ +57 极显著续立,HF Daily #1 持续。R69 锚为 eval邻接(神经函数编译生成 + 端侧零依赖),R70 信号持续强化。
- 与活文档现有脉络的关系: 与 R69 §3.5 harness 生态候选十九角(Compile by Training 端侧零依赖评测 artifact 生成维度)直接衔接;与 R68 Terminal Universe(agent 轨迹→可执行评测环境生成维度)并列,形成"端侧 artifact 生成 × 轨迹环境重建"双轨评测生成维度。
- 建议归入节: §3.5(harness 生态候选十九角第 19 节点维度 A)+ §2.6 评测工程化(端侧零依赖评测 artifact)
- 可信度: ★★★★★(HF Daily #1 极显著续立,EMNLP 2026 SysDemo 锚定)
- ⚠️ 无待核实(已建 paper_card 1220 ★★,状态良好)
2. Sep 7-8 paper_cards eval 相关新卡核查
Sep 7 新增 eval 主分类卡(2 件)
| 编号 | arXiv | 标题 | 形态 | 与 eval.md 关系 |
|---|---|---|---|---|
| 1232-2609.04173 | 2609.04173 | Last Translation Benchmark | benchmark | R69 锚定 eval邻接 |
| 1233-2609.03153 | 2609.03153 | VeriPhy | method | R69 锚定 eval邻接 |
注: Last Translation Benchmark 和 VeriPhy 均已在 R69 evaluation e1prep 锚定,本次为确认 paper_card 入库状态。
Sep 8 新增 eval 主分类卡(3 件,均不在 R69 prep)
| 编号 | arXiv | 标题 | 形态 | 与 eval.md 关系 |
|---|---|---|---|---|
| 1242-2609.04061 | 2609.04061 | When Models Edit Too Much | method | eval 专项净增 |
| 1246-2609.04611 | 2609.04611 | τ^τ-Bench | benchmark | agent 主分类,eval邻接 |
| 1253-2609.04720 | 2609.04720 | KoNA | benchmark | eval 专项净增 |
Sep 8 新增 eval 邻接卡(主分类非 eval,eval 相关)
| 编号 | arXiv | 标题 | 主分类 | 与 eval 关系 |
|---|---|---|---|---|
| 1237-2609.05232 | 2609.05232 | Substrate-Aware AI Agents | agent | agent+memory,eval邻接 |
| 1238-2609.05339 | 2609.05339 | Does Your Agent's Memory Survive a Model Upgrade? | ? | agent+rag,eval邻接 |
| 1239-2609.05258 | 2609.05258 | Ask Before You Optimize | evaluation | eval 专项净增 |
| 1256-2609.04444 | 2609.04444 | HarvestBench | agent | agent+memory+benchmark,eval邻接 |
注: paper_card 主分类标签部分缺失(?),建议后续 S2 轮次统一富化。τ^τ-Bench(1246)主分类 agent 但形态 benchmark;KoNA(1253)主分类 evaluation。
3. 矛盾与待核实
矛盾 ① When Models Edit Too Much(2609.04061)票数未记录
- paper_card 1242 已建,主分类 eval,形态 method,但 HF 票数未知(未进 Sep 8 HF Daily Top15)
- 建议: 追溯 HF Daily 历史票数,或在下轮 candidates 中标注
矛盾 ② Ask Before You Optimize 与 OR-Clarify 候选疑似重叠
- R69 evaluation e1prep Sep 7 radar 出现"OR-Clarify"候选文件名标注
- Ask Before You Optimize(2609.05258)同为"优化问题前置澄清"方向
- 建议: 推动 S2 轮次核实两张 paper_card 是否为同一工作(文件名相似但编号不同)
矛盾 ③ RealSWE(2608.27831)无 paper_card 建卡
- 29 票 eval邻接候选,coding agent 真实用户请求评测缺口明确,但无 paper_card 建卡
- 建议: 推动建立 paper_card(建议优先级 P2,票数尚未进 HF Top15)
矛盾 ④ HarvestBench(2609.04444)主分类待核实
- 3 票,agent+memory+benchmark tag,但 paper_card 主分类字段未富化(显示 ?)
- 建议: 确认主分类是否为 agent;若是则归入 eval邻接而非 eval专项
4. 可引用 arXiv 号列表
本轮 eval 专项 net-new(3 件): - 2609.04061 — When Models Edit Too Much(代码编辑过度 fidelity 评测 · method · paper_card 1242) - 2609.04720 — KoNA / Knowing What Not to Answer(VLM 选择性不服从评测 · benchmark · paper_card 1253) - 2609.05258 — Ask Before You Optimize(优化问题 formulation 前置澄清评测 · benchmark · paper_card 1239)
本轮 eval 邻接 net-new(1 件): - 2608.27831 — RealSWE(真实用户请求编码 Agent 组合性评估 · 29▲ · paper_card ⚠ 未建)
本轮 eval邻接续立(1 件): - 2609.04199 — Compile by Training(374▲ +57 极显著续立 · paper_card 1220 ★★)
R69 沿用 eval 专项(2 件): - 2608.26623 — AgentJudgeBench(paper_card 1194) - 2609.01481 — Harness-of-Harness(paper_card 1180 ★★)
R69 沿用 eval邻接(4 件): - 2609.04148 — Terminal-Universe(265▲ +52 强势回归) - 2608.31046 — On-Policy Distillation(持续深度衰减 ⚠) - 2609.04172 — On-Policy Distillation II(排名 8→9 下滑 ⚠) - 2609.04173 — Last Translation Benchmark(30▲ 微量持平)
R69 候选待核实(3 件): - 2609.05232 — Substrate-Aware AI Agents(4 票 · agent 主分类 · eval邻接) - 2609.04444 — HarvestBench(3 票 · agent 主分类 · eval邻接) - 2609.04611 — τ^τ-Bench(2 票 · agent 主分类 · eval邻接)
5. 增量条数汇总
| 类别 | 条数 | 编号 |
|---|---|---|
| eval 专项 net-new paper_card | 3 | ① When Models Edit Too Much(2609.04061)· ② KoNA(2609.04720)· ③ Ask Before You Optimize(2609.05258) |
| eval 邻接 net-new 候选 | 1 | ④ RealSWE(2608.27831)29▲ |
| eval 邻接续立 | 1 | ⑤ Compile by Training(374▲ +57) |
| R69 沿用 eval 专项 | 2 | AgentJudgeBench · Harness-of-Harness |
| R69 沿用 eval邻接 | 4 | Terminal-Universe · On-Policy Distillation ⚠ · On-Policy Distillation II ⚠ · Last Translation Benchmark |
| 合计净增量 | 5 | ①+②+③(eval专项net-new)+ ④+⑤(eval邻接net-new/续立) |
arXiv 号数量: 3 件本轮新增 eval专项 + 1 件 eval邻接新候选 + 1 件 eval邻接续立 + 2 件 R69 沿用 eval专项 + 4 件 R69 沿用 eval邻接 = 11 件
6. 检查过的来源清单
已确认无新增量的来源(已核查,如实说明): - Stephen 9-07/9-08 inbox(coord-check + ai-industry e1prep;主轴 ai-industry + frontier lab 里程碑;eval 邻接无 eval 专项净增) - flyp 9-08 inbox(multimodal e1prep;Compile by Training 续立信号已由 flyp 接管;eval 邻接无独立净增) - spark 9-07/9-08 inbox(agent e1prep + llm-infra e1prep;主轴 agent/llm-infra;eval 邻接无 eval 专项净增) - Jay 9-07/9-08 inbox(engineering e1prep;主轴工程实践;eval 邻接无 eval 专项净增) - work-queue.md(2026-09-08 14:00;0 件待建卡 · 0 件待更新主题活文档 · 选题榜 1 件 MaxKernel) - paper_cards Sep 6-7 eval 专项(Last Translation Benchmark + VeriPhy 已在 R69 锚定)
本轮实际处理的新增来源: - ✅ Tom 9-08 0840 agent-rag-longcontext-radar.md(8 候选:Dr. Claw 8票/Chains-of-Thought 10票/HarvestBench 3票/KoNA 2票 等;KoNA ⭐⭐⭐ 高价值 eval专项) - ✅ Tom 9-08 rag-e1prep.md(R84 基线;ShallowStream + Dr. Claw + Wire benchmark + Bilevel + Substrate-Aware + τ^τ-Bench;RAG 域) - ✅ Tom 9-08 rag-lite.md(8 条;Dr. Claw + RAG 架构综述) - ✅ Tom 9-08 0900 HF Daily 2026-09-08.md(15 篇:Compile by Training 374▲ #1/RealSWE 29▲ #14/KoNA 未入 Top15 等) - ✅ paper_cards Sep 8 新卡核查(约 12 张,eval 专项:When Models Edit Too Much/KoNA/Ask Before You Optimize;eval邻接:τ^τ-Bench/HarvestBench/Substrate-Aware) - ✅ evaluation.md R69 基线(R69 锚定 2 件 eval专项 + 4 件 eval邻接 + 候选十九角 + 立标池饱和 v44-v70) - ✅ candidates JSON Sep 7 12:40 + Sep 8 09:11 + Sep 8 14:40(eval 邻接:τ^τ-Bench 2票/HarvestBench 3票/KoNA 2票/Ask Before You Optimize 无票/RealSWE 29票未进 radar)
7. 建议 E1-R70 活文档写入方向
- When Models Edit Too Much 写入 §2.6 + §6.127:代码编辑 fidelity 评测——over-editing 问题的系统研究,与 OR-Clarify(优化 formulation 澄清)同属"最小化不必要修改"方向
- KoNA 写入 §4 + §2.6:VLM 选择性不服从 benchmark——"知道何时该拒绝"而非"安全拒绝",填补 VLM 自我认知边界评测空白
- Ask Before You Optimize 写入 §6.127:优化问题 formulation 前置澄清 benchmark——主动澄清能力双重评测(提问质量 + 最终模型质量);需核实是否与 OR-Clarify 候选重叠
- RealSWE 写入 §6.127:真实用户请求下 coding agent 组合性评测——评测缺口补强(SWE-bench 人工精挑 → 真实用户模糊多跳请求)
- Compile by Training 续立信号确认(374▲ +57):harness 生态候选十九角第 19 节点维度 A 持续强化;EMNLP 2026 SysDemo 锚定
- HarvestBench + τ^τ-Bench + Substrate-Aware 确认主分类:若 agent 主分类则归入 eval邻接而非 eval专项;推动 paper_card 主分类字段富化
- On-Policy Distillation 深度衰减延续确认:持续三周深度衰减,建议 R70 活文档正式标注"⚠ 深度衰减"而非仅"待核实"
Tom · 2026-09-08 15:40 CST · E1 预消化 · evaluation · R70 窗口覆盖完成 · 3 件 eval 专项 net-new paper_card(When Models Edit Too Much 2609.04061 + KoNA 2609.04720 + Ask Before You Optimize 2609.05258)+ 1 件 eval 邻接新候选(RealSWE 2608.27831 29▲)+ 1 件 eval 邻接续立(Compile by Training 374▲ +57)+ 3 件候选待核实(Ask Before You Optimize 与 OR-Clarify 重叠/HarvestBench 主分类/RealSWE paper_card 未建)· When Models Edit Too Much(代码编辑 fidelity)+ KoNA(VLM 选择性不服从)+ RealSWE(真实用户请求组合性评测)是本轮核心增量