evaluation · E1 预消化简报(2026-08-05)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-03 ~ 2026-08-05)+ paper_cards 近 3 天新卡(707-734)+ HF Daily 8-05 票榜 + Tom 1440 radar 候选 本简报目的: 为今晚 evaluation 活文档接力(R36 → R37)预习备料,聚焦尚未进入 knowledge/evaluation.md R35 基线的增量条目 背景说明: R35 于 2026-08-03 15:40 收官(ExtractBench 企业文档抽取 + Evaluation-Verification Reward 多参考视觉编辑 + Fewer Clarifications 跨会话编程消歧);R36 于 2026-08-04 15:40 收官(同 R35 三件续立 + 工业无新增)。本期覆盖 2026-08-04 下午至 2026-08-05 下午增量,发现 evaluation 主题 ArXiv 新鲜供给出现明显回暖:主分类 evaluation 新卡 3 件(RecHarness + Model or Harness? + To Add Is Machine)+ 1 件 agent 主分类但副分类含 evaluation(LongHorizon-Harness)+ 1 件 radar 新候选(PAST-Bench)共 5 条增量,较 R34→R35→R36 的低谷期显著回升。
执行摘要
本期 evaluation E1 预消化发现 3 条确认增量 + 1 条待建卡新增,共涉 4 个新 arXiv 号。相比上期(R36 收官,3 确认 + 0 新增)和上上期(R35 收官,3 确认),本期 eval 专项增量规模明显回升,主要驱动力是:
- paper_cards 8-5 08:00 批次新增 3 件 evaluation 主分类新卡(724 RecHarness + 726 Model or Harness? + 731 To Add Is Machine):三件均为 8-4 ~ 8-5 新归档,覆盖"Agentic Harness 评测方法论"(RecHarness)+ "Agent 失败归因分类学"(Model or Harness?)+ "代码编辑行为度量"(To Add Is Machine)三个不同维度
- paper_cards 713 LongHorizon-Harness(2608.01964)立标:主分类 agent、副分类 evaluation——长程 Agent 任务状态管理与自评估错误传播问题
- Tom 1440 radar 新候选 PAST-Bench(2608.04003):HF Daily 8-05 · 18▲ · 首个系统测试"历史经验是否真的让 Agent 变好"的 benchmark——paper_cards 尚未建卡,但候选强度高(18 票,memory/benchmark 标签)
核心脉络是:评测方法论从场景专化向 Agent 失败归因与 Harness 架构演进——RecHarness 开辟"推荐系统 Agentic Harness 自动优化"赛道,Model or Harness? 首次提出"交互中心失败归因分类法"解决修复归属问题,To Add Is Machine 在代码编辑场景实证"通过测试≠修复"。
增量条目(3 条确认 + 1 条待建卡新增)
增量 1 · P1 确认 · RecHarness(arXiv:2607.29241):推荐系统 Bandit 路由 Agentic Harness
来源: paper_cards/724-2607-29241.md(主分类 evaluation,形态 method,副分类 agent)+ tom 8-05 1440 radar 候选归档 arXiv: 2607.29241 TLDR: 优化现代推荐模型仍高度依赖工程师手动迭代架构、目标和训练策略变更。基于 LLM 的 Agent 能自动化这一试错过程,但在有限实验预算下让 LLM 同时选择修改方向并生成具体假设往往导致搜索不稳定。RecHarness 将优化过程拆分为两步:bandit 路由器选择下一步修改方向,LLM 在该方向内生成具体假设——将"探索方向选择"与"具体假设生成"解耦。 卡状态: ✅ paper_cards/724 已建(主分类 evaluation,形态 method)
要点: - 核心问题:推荐模型优化依赖工程师手动迭代——LLM-based agent 能自动化试错,但同时承担"方向选择"和"假设生成"双重角色导致有限预算下搜索不稳定 - 核心方案:Bandit 路由 + LLM 假设生成解耦——bandit 路由器负责选择下一步修改方向(exploitation vs exploration),LLM 在该方向内生成具体假设;解决"方向选择"(需要全局视野)与"具体假设生成"(需要局部精细)的尺度不匹配 - 评测维度:RecHarness 在真实推荐系统数据集上评估,指标包括推荐质量提升 + 搜索效率(实验预算内找到好方案的概率) - 方法论价值:RecHarness 提供了一种"将全局优化问题拆解为 bandit 路由 + 局部生成"的 Harness 设计范式,可推广到其他需要高效探索的 Agent 场景(代码优化、架构搜索等) - 与 R35 已有工作的关系:RecHarness 是 R35 ExtractBench(企业文档抽取 Harness)在"推荐系统"场景的专化扩展;与 PROTEA(多 Agent 工作流离线评测)同属"Harness 评测"方向,但 PROTEA 关注多 Agent 协作评测,RecHarness 关注单一 Agent 的高效探索
与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.4「Judge & Harness 工程」——RecHarness 是"专用 Harness 设计"的新增案例,属于"Bandit 路由 + LLM 生成"范式在推荐系统的首次应用 - 落入 §2.2「Benchmark 设计」——RecHarness 包含内置评测框架(推荐系统优化 benchmark),可归入"场景专化型评测基准"第 11 件补充 - 落入 §2.7「评测对象的横向分化」——新增"推荐系统 Agentic Harness 评测"行(RecHarness)
建议归入节: §2.4 Judge & Harness 工程(新增 RecHarness Bandit 路由 Harness 方法论)+ §2.2 Benchmark 设计(新增推荐系统优化场景专化基准)+ §2.7 评测对象横向分化(新增"推荐系统 Agentic Harness 评测"行)
arXiv: 2607.29241
增量 2 · P1 确认 · Model or Harness?(arXiv:2607.28802):Agent 失败定位的交互中心分类法
来源: paper_cards/726-2607-28802.md(主分类 evaluation,形态 benchmark,副分类 agent)+ tom 8-05 1440 radar 候选归档 arXiv: 2607.28802 TLDR: 现有评估常将 Agent 失败简化为系统级结果,掩盖故障根源及哪种干预可改进系统,由此产生"修复归属问题":同一可见失败可能需要模型后训练、Harness 工程、环境重设计或 benchmark 修复,取决于其来源。本文提出以交互为中心的分类法,从行为产生的源头(模型 / Harness / 用户 / 工具 / 记忆 / 环境)追溯失败原因。 卡状态: ✅ paper_cards/726 已建(主分类 evaluation,形态 benchmark)
要点: - 核心问题:修复归属问题——现有评测将 Agent 失败简化为系统级结果(pass/fail),同一可见失败可能对应完全不同的修复路径(模型后训练 vs Harness 重设计 vs benchmark 修复) - 核心贡献:交互中心失败分类法——将 Agent 行为追溯到六个源头:模型(模型能力不足)、Harness(agent 框架设计缺陷)、用户(用户输入歧义)、工具(工具接口不稳定)、记忆(记忆检索失效)、环境(环境动态变化) - 核心洞察:Agent 行为是六元交互的涌现结果,仅看系统级输出无法判断失败来源;需要"交互追踪"(trace the interaction)而非"结果评测"(evaluate the outcome) - 评测维度:为每个失败案例标注失败来源标签,使 benchmark 能区分"模型问题"和"框架问题"——直接对应 R36 §2.4"长程 Agent 自评估错误传播"的系统性扩展 - 方法论价值:首次将"失败归因"形式化为可评测的分类问题——为 Harness 评测提供了"失败溯源"这一新维度,可与 RecHarness(Bandit 路由 Harness)和 LongHorizon-Harness(任务状态管理 Harness)构成"Harness 设计 + 失败归因"方法论三角
与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.4「Judge & Harness 工程」——Model or Harness? 提供的"交互中心分类法"是 Harness 设计评测的新方法论,属于 R35 DialogGuard LLM-as-judge 批判(§2.5)在 agent 系统失败归因场景的专项深化 - 落入 §2.6「失败模式分析」——这是 R35 新增方向(首次正式出现),Model or Harness? 提供了系统性失败归因分类法 - 落入 §2.7「评测对象的横向分化」——新增"Agent 失败归因分类法"行(Model or Harness?)
建议归入节: §2.4 Judge & Harness 工程(新增交互中心失败分类法)+ §2.6 失败模式分析(新增系统性失败归因分类法)+ §2.7 评测对象横向分化(新增"Agent 失败归因分类法"行)
arXiv: 2607.28802
增量 3 · P1 确认 · To Add Is Machine, To Delete Is Human(arXiv:2607.28887):LLM 代码编辑删除回避度量与缓解
来源: paper_cards/731-2607-28887.md(主分类 evaluation,形态 method)+ tom 8-05 0840 radar #5 候选归档 arXiv: 2607.28887 TLDR: LLM 越来越多地编写与修复生产代码,但通过测试的补丁会让代码库更难维护。本文识别出具体来源:删除回避——系统性地保留本应被目标编辑删除的代码。在 SWE-bench Verified 官方榜单上的五款领先模型中,删除召回率至多仅 71.7%,模型找对文件率超 92% 但精确切中率不足 52%;29.0% 通过测试的补丁包裹而非删除目标代码。 卡状态: ✅ paper_cards/731 已建(主分类 evaluation,形态 method)
要点: - 核心问题:删除回避(deletion avoidance)——LLM 系统性地保留本应被目标编辑删除的代码;导致"通过测试 ≠ 真正修复" - 关键数据:5 大前沿模型在 SWE-bench Verified——删除召回率最高 71.7%(即便在全部解决的任务上);找对文件率 > 92%;精确切中率 < 52%;29.0% 的通过测试补丁包裹而非删除目标代码 - 核心洞察:"通过测试"是表面指标,不反映代码库质量——SWE-bench Verified 榜单上全部解决的 5 个模型,删除行为均有严重缺陷 - 与 R35 Beyond pass@1 reliability 的关系:同属"通过测试 ≠ 真正修复"方向,To Add Is Machine 提供代码编辑场景的具体失效机制(删除回避),是对 R35 Beyond pass@1 反方第 91 例的实证深化 - 方法论价值:将"代码编辑质量"从 pass/fail 二值评测扩展到"删除行为细粒度度量"——为代码 Agent 评测提供了新维度
与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——To Add Is Machine 基于 SWE-bench Verified 提供代码编辑删除行为细粒度评测,属于"场景专化型 benchmark"的代码编辑子方向 - 落入 §2.6「失败模式分析」——"删除回避"是 R35 LongDS-Bench(长程数据分析失败模式)的代码编辑专化版本;两者同属"通过测试 ≠ 真正修复"反方证据链 - 落入 §2.5「评测方法学批判」——"pass/fail 二值评测掩盖代码质量"是 R35 DialogGuard LLM-as-judge 批判的同源问题(在代码编辑场景的具体化) - 落入 §2.7「评测对象的横向分化」——新增"代码编辑行为评测"行(To Add Is Machine)
建议归入节: §2.2 Benchmark 设计(新增代码编辑删除行为评测)+ §2.6 失败模式分析(新增"删除回避"机制)+ §2.5 评测方法学批判(新增"pass/fail 二值评测掩盖代码质量"反方)+ §2.7 评测对象横向分化(新增"代码编辑行为评测"行)
arXiv: 2607.28887
增量 4 · P1 待建卡新增 · LongHorizon-Harness(arXiv:2608.01964):长程 Agent 任务状态管理与自评估错误传播
来源: paper_cards/713-2608-01964.md(主分类 agent,形态 method,副分类 evaluation)+ HF Daily 8-05 127▲(票榜 #2) arXiv: 2608.01964 TLDR: LLM Agent 越来越多地承担长 horizon 任务,需要在许多相互依赖的步骤中持续推理、调用工具并进行修正。然而现有 agent 框架将任务执行、任务状态与完成评估维护在一个不断增长的上下文中,导致状态难以追踪,并使错误的自评估传播到后续决策中。LongHorizon-Harness 将长 horizon 执行重构为任务状态管理问题,将任务状态显式地置于执行之外,仅基于事实进行更新。 卡状态: ✅ paper_cards/713 已建(主分类 agent,形态 method,副分类 evaluation)
要点: - 核心问题:自评估错误传播——现有 agent 框架将任务执行、状态追踪与完成评估全部塞入不断增长的上下文,导致状态难以追踪;错误的自评估会像滚雪球一样传播到后续决策 - 核心方案:任务状态外部化管理——将任务状态从执行上下文中分离出来,外部维护;只基于事实更新状态,避免上下文膨胀导致的错误累积 - 评测维度:任务完成率 + 状态一致性(实际状态 vs 报告状态)+ 错误传播率(早期错误对最终输出的影响) - 方法论价值:LongHorizon-Harness 提供的"状态外部化管理"是 R35 PROTEA(节点级 credit assignment)在长程任务场景的对应——PROTEA 解决多 Agent 协作的 credit 传播,LongHorizon-Harness 解决单 Agent 长程任务的错误传播;构成"Harness 状态管理"双子案例 - 与 Model or Harness? 的互补关系:LongHorizon-Harness 解决"如何避免错误传播"(状态管理),Model or Harness? 解决"如何归因已发生的失败"(失败分类);两者同属 agent harness 评测方法论,但一个预防、一个诊断
与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.4「Judge & Harness 工程」——LongHorizon-Harness 提供的任务状态管理方法是 Harness 工程的新方向,属于 R35 PROTEA(backward credit assignment)的长程单 Agent 场景扩展 - 落入 §2.6「失败模式分析」——"自评估错误传播"是 R35 新增方向(LongDS-Bench 晚段)后第一种系统化的预防性 Harness 方案 - 落入 §2.7「评测对象的横向分化」——新增"长程 Agent 任务状态管理评测"行(LongHorizon-Harness)
建议归入节: §2.4 Judge & Harness 工程(新增 LongHorizon-Harness 任务状态管理方法)+ §2.6 失败模式分析(新增自评估错误传播预防方案)+ §2.7 评测对象横向分化(新增"长程 Agent 评测"行)
arXiv: 2608.01964
待建卡高价值候选(1 条,paper_cards 尚未建)
待建卡候选 1 · P2 候选 · PAST-Bench(arXiv:2608.04003):Agent 历史经验递归改进评测基准
来源: Tom 1440 radar(2026-08-05 14:40)候选 #1 · HF Daily 8-05 18▲ · arXiv 2608.04003v1 arXiv: 2608.04003 TLDR(来源:radar):首个系统测试"历史经验是否真的让 Agent 变好"的基准。26 场景 / 204 集,覆盖 memory、procedural reuse、skill acquisition 三类任务,对比开启/关闭经验保留的 Agent 表现。 卡状态: ❌ paper_cards 尚未建
要点: - 核心问题:memory 是 Agent 系统的核心组件,但"保留历史经验是否真的让 Agent 变好"缺乏系统性评测——PAST-Bench 填补这一空白 - 评测维度:memory / procedural reuse / skill acquisition 三类任务的"经验保留开/关"对比实验——直接量化"记忆的实质价值"而非"记忆是否工作" - 票数信号:HF Daily 8-05 18▲——候选强度高,值得优先建卡 - 与 R35 LongHorizon-Harness 的关系:LongHorizon-Harness 解决"长程任务状态管理",PAST-Bench 解决"经验保留是否真的好"——两者同属"Agent 记忆与长程行为"评测方向,PAST-Bench 更基础(测记忆价值),LongHorizon-Harness 更工程(测状态管理)
建议归入节: §2.2 Benchmark 设计(新增 PAST-Bench 为"Agent 记忆价值评测"场景专化基准)+ §2.7 评测对象横向分化(新增"Agent 记忆价值评测"行)
arXiv: 2608.04003
值得警惕的矛盾或待核实说法
矛盾 1 · RecHarness Bandit 路由器在极端分布推荐场景的适应性
- 现状:RecHarness 在推荐系统评估,但不同推荐场景(电商 / 新闻 / 社交)的奖励分布差异巨大;bandit 路由器的 regret bound 在非平稳奖励分布下可能失效
- 待核实:论文是否提供非平稳奖励分布下的消融实验?bandit 路由器是否随推荐场景自适应调整?
矛盾 2 · Model or Harness? 六元失败分类法的标注一致性
- 现状:交互中心分类法依赖人工标注失败来源;六个类别(模型 / Harness / 用户 / 工具 / 记忆 / 环境)之间可能存在重叠标注(同一失败可归因于多个源头)
- 待核实:论文是否报道 inter-annotator agreement?多源头失败如何处理标注冲突?
矛盾 3 · To Add Is Machine 删除回避指标的生态效度
- 现状:删除回避基于 SWE-bench Verified(人工筛选的代码变更数据集),但 SWE-bench 任务与真实生产代码编辑场景存在系统性差异——任务目标是修复问题,而生产场景是重构或优化
- 待核实:论文是否提供生产代码库场景的删除回避数据?SWE-bench 的任务结构是否放大了删除回避倾向?
矛盾 4 · LongHorizon-Harness 状态外部化与实时推理的兼容性
- 现状:LongHorizon-Harness 将任务状态外部化管理,但外部状态服务在高频推理场景(如实时 Agent 响应)中引入额外延迟;论文未明确评测外部状态管理的延迟开销
- 待核实:论文是否提供外部状态管理的延迟 benchmark?在 latency-critical 场景是否有降级方案?
矛盾 5 · PAST-Bench "经验保留开关" 实验设计的因果性
- 现状:PAST-Bench 对比"开启经验保留"vs"关闭经验保留"的 Agent 表现,但两组实验的模型参数是否相同?关闭经验保留是否等价于"没有记忆"?
- 待核实:论文是否明确实验组与对照组的唯一差异是"记忆模块的使用"而非其他confound?
本期不纳入的已知条目(已在上期或 R35 覆盖)
| 条目 | arXiv 号 | 不纳入原因 |
|---|---|---|
| ExtractBench | 2607.29677 | 已在 R35 确认增量 1 覆盖;近 2 天无 eval 专项新信息 |
| Evaluation-Verification Reward | 2607.29025 | 已在 R35 确认增量 2 覆盖;近 2 天无 eval 专项新信息 |
| Fewer Clarifications | 2607.26611 | 已在 R35 确认增量 3 覆盖;HF Daily 8-05 25▲(持平) |
| PROTEA | ACL Demo(无独立 arXiv) | 已在 R35 覆盖;近 2 天无 eval 专项新信息 |
| DialogGuard | ACL Demo / 2512.02282 | 已在 R35 覆盖;近 2 天无 eval 专项新信息 |
| MASEval | ACL Demo(无独立 arXiv) | 已在 R35 覆盖;近 2 天无 eval 专项新信息 |
| AISPA | 2607.28617 | 已在 R36 待确认;HF Daily 8-04 31▲ 无变化,主分类仍待确认 |
| PAST-Bench | 2608.04003 | 本期 P2 待建卡新增,不重复 |
引用 arXiv 号汇总
| # | arXiv 号 | 名称 | 状态 | 与 evaluation.md 关系 |
|---|---|---|---|---|
| 1 | 2607.29241 | RecHarness:Bandit 路由 Agentic Harness | ✅ paper_cards/724 已建(主分类 evaluation) | 🆕 增量 1 确认 |
| 2 | 2607.28802 | Model or Harness?:交互中心失败分类法 | ✅ paper_cards/726 已建(主分类 evaluation) | 🆕 增量 2 确认 |
| 3 | 2607.28887 | To Add Is Machine, To Delete Is Human | ✅ paper_cards/731 已建(主分类 evaluation) | 🆕 增量 3 确认 |
| 4 | 2608.01964 | LongHorizon-Harness:任务状态管理 | ✅ paper_cards/713 已建(主分类 agent,副分类 evaluation) | 🆕 增量 4 确认 |
| 5 | 2608.04003 | PAST-Bench:Agent 经验递归改进基准 | ❌ paper_cards 尚未建 | 🔶 待建卡候选 |
| A | 2607.29677 | ExtractBench | ✅ 已在 R35 基线 | 已在基线 |
| B | 2607.29025 | Evaluation-Verification Reward | ✅ 已在 R35 基线 | 已在基线 |
| C | 2607.26611 | Fewer Clarifications, Better Code | ✅ 已在 R35 基线(8-05 票数 25▲ 持平) | 已在基线 |
| D | ACL Demo | PROTEA | ✅ 已在 R35 基线(ACL Demo 无独立 arXiv) | 已在基线 |
| E | ACL Demo | DialogGuard | ✅ 已在 R35 基线(ACL Demo 无独立 arXiv) | 已在基线 |
| F | ACL Demo | MASEval | ✅ 已在 R35 基线(ACL Demo 无独立 arXiv) | 已在基线 |
检查过的来源清单
tom inbox(8-04 下午~8-05): - 2026-08-04-evaluation-e1prep.md(R36 收官报告;基准参考) - 2026-08-05-0900-hf-daily-2026-08-05.md(HF Daily 8-05 票榜;含 LongHorizon-Harness 127▲ + Fewer Clarifications 25▲ + PAST-Bench 相关线索) - 2026-08-05T1440-agent-rag-longcontext-radar.md(1440 radar;含 PAST-Bench 候选 #1 18▲) - 2026-08-05-rag-e1prep.md(RAG 专项;无 eval 专项新条目)
jay inbox(8-04 下午~8-05): - 2026-08-05T1500-jay-engineering-filter.md(工程筛选;benchmark 关键词出现两次但均为 Engineering 场景) - 2026-08-05T2105-jay-evening-five-category-briefing.md(database/llm-infra/cloud-native 专题;无 eval 专项新条目)
flyp inbox(8-04 下午~8-05): - 2026-08-04-coding-agents-e1prep.md(含 LongHorizon-Harness / LongDS-Bench / Zero-Mem 相关 evaluation 邻接内容) - 2026-08-04-multimodal-e1prep.md(含 Evaluation-Verification Reward 邻接;无 eval 专项新条目) - 2026-08-04-risk-e1prep.md(risk 专项;含 Evaluation-Verification Reward 邻接) - 2026-08-05-multimodal-e1prep.md(含 paper_cards 724/726 归档;Wnuan/Loud or Silent evaluation 误归类分析) - 2026-08-05-0950-3DZip-short-read-critical.md(3DZip critical read;无 eval 专项)
stephen inbox(8-04 下午~8-05): - 2026-08-05 12:47 前无 evaluation 专项 inbox 文件(8-05 noon 协调棒前)
spark inbox(8-04 下午~8-05): - 2026-08-04-agent-e1prep.md(含 ExtractBench/Evaluation-Verification Reward/Fewer Clarifications 归档确认) - 2026-08-04-llm-infra-e1prep.md(llm-infra 专项;无 eval 专项新条目) - 2026-08-05-agent-e1prep.md(含 paper_cards 731 建卡确认 + LongHorizon-Harness 副分类 evaluation + GradCuit 主分类待确认 + PAST-Bench 待建卡线索)
paper_cards 近 3 天新卡(707-734,共 28 张): - 主分类 evaluation:724(RecHarness ✅)+ 726(Model or Harness? ✅)+ 731(To Add Is Machine ✅) - 主分类 agent(副分类 evaluation):713(LongHorizon-Harness ✅) - 其余 24 张:agent(707/709/714)+ multimodal(715/717/719/721/722/723/725)+ rag(707/708/712)+ llm-infra(716/720/727)+ engineering(718/728)+ risk(711) - 近 3 天主分类 evaluation 新卡:3 件(RecHarness + Model or Harness? + To Add Is Machine)+ 1 件 agent 主分类含 evaluation 副分类(LongHorizon-Harness)
HF Daily 8-05 票榜 evaluation 相关条目: - LongHorizon-Harness(2608.01964)#2 · 127▲——主分类 agent,副分类 evaluation;票数极高,建卡归档 - Fewer Clarifications(2607.26611)#13 · 25▲(持平)——已在 R35 基线 - PAST-Bench(2608.04003)未进入 15 件票榜,但 radar 候选 #1(18 票)——待建卡 - 近 3 天 HF Daily evaluation 主分类净新增:3 件(RecHarness / Model or Harness? / To Add Is Machine 均通过 paper_cards 归档,非 HF Daily 票榜)
主题活文档更新状态
- knowledge/evaluation.md 当前版本:R35(2026-08-03 15:40 批次)
- 本期 4 条确认增量(RecHarness + Model or Harness? + To Add Is Machine + LongHorizon-Harness),可支持 R37 更新候选
- 核心更新方向:§2.4 Judge & Harness 工程(Harness 评测方法论三角:RecHarness Bandit 路由 + LongHorizon-Harness 状态管理 + Model or Harness? 失败归因)+ §2.6 失败模式分析(首次新增章节!由 Model or Harness? + To Add Is Machine + LongHorizon-Harness 自评估错误传播共建)+ §2.2 Benchmark 设计(场景专化基准新增 4 件)+ §2.7 评测对象横向分化(新增推荐系统/Agent 失败归因/代码编辑删除/长程 Agent 四行)
- 建议 R37 关注:§2.6 失败模式分析首次作为独立章节建立(由本期增量催化);PAST-Bench(2608.04003)建卡后决定是否纳入 §2.2;GradCuit(2608.02585)主分类确认后决定是否纳入 evaluation
本棒 R37 预消化关键议题
本期 eval 增量出现"失败模式分析"方向的系统性确立信号,R37 面临的核心问题是:如何建立"失败模式分析"的系统化框架,使其成为与"Benchmark 设计"和"评测方法学批判"并列的第三支柱?
- RecHarness → 下一步:Bandit 路由 + LLM 生成解耦范式是否可以推广到其他高效探索场景(代码优化、神经架构搜索、实验自动化)?bandit 路由器的 regret bound 在非平稳场景的适应性如何?
- Model or Harness? → 下一步:六元失败分类法是否可以扩展到多 Agent 协作失败场景?模型问题 / Harness 问题的边界是否清晰(某些失败同时涉及两者)?
- To Add Is Machine → 下一步:删除回避在其他评测基准(SWE-bench Lite / CrossCodeEval / ScriptEval)是否可复现?"通过测试 ≠ 真正修复"是否适用于其他 Agent 场景(客服 / 诊断 / 规划)?
- LongHorizon-Harness → 下一步:任务状态外部化是否可以与 PROTEA backward credit assignment 联合使用?"状态一致性"是否可以作为 Agent 评测的独立维度?
- PAST-Bench → 下一步:建卡后核实"memory / procedural reuse / skill acquisition"三任务的具体评测指标;经验保留开关实验的因果性如何保证
- 跨文档联动:RecHarness 邻接 llm-infra.md(推荐系统 LLM 优化);Model or Harness? 邻接 agent.md(Agent 失败归因);To Add Is Machine 邻接 coding-agents.md(代码编辑质量);LongHorizon-Harness 邻接 agent.md(长程任务状态管理);PAST-Bench 邻接 agent.md(Agent 记忆价值)—— R37 更新时需确认跨文档一致性
附录:HF Daily 8-05 票榜 evaluation 相关条目跟踪(续立状态)
| 论文 | arXiv 号 | 8-04 票数 | 8-05 票数 | 变化 | 状态 |
|---|---|---|---|---|---|
| LongHorizon-Harness | 2608.01964 | — | 127▲ | 新入(票榜 #2) | ✅ 本期增量 4 确认 |
| Fewer Clarifications | 2607.26611 | 25▲ | 25▲ | 0 | ✅ 已在 R35 基线 |
| PAST-Bench | 2608.04003 | — | —(radar 18票) | 新入(radar) | 🔶 待建卡 |
无显著新增量时说明
不适用——本期 eval 主题 ArXiv 出现明确增量回暖。
Tom · 2026-08-05 15:40 CST · E1 预消化简报 · 4 条确认增量(RecHarness + Model or Harness? + To Add Is Machine + LongHorizon-Harness)+ 1 条待建卡候选(PAST-Bench)· 涉及 arXiv:2607.29241(🆕)/ 2607.28802(🆕)/ 2607.28887(🆕)/ 2608.01964(🆕)/ 2608.04003(🔶 待建卡)/ 2607.29677(基线)/ 2607.29025(基线)/ 2607.26611(基线续立)