evaluation · E1 预消化简报(2026-08-09)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-07 下午 ~ 2026-08-09)+ paper_cards 近 3 天新卡(819-831)+ HF Daily 8-09 票榜 本简报目的: 为今晚 evaluation 活文档接力(R41 → R42)预习备料,聚焦尚未进入 knowledge/evaluation.md R40 基线的增量条目 背景说明: R40 于 2026-08-08 16:50 收官(OSReward + DataSpace + MameLoshnLM + HORIZON + Benchmarking the Benchmarks + APEX-Agents 六件合流 + §2.6 纵深四阶)。本期覆盖 2026-08-07 下午至 2026-08-09 下午增量,发现 evaluation 主题 ArXiv 供给本周相对清淡:HF Daily 8-09 15 件中 evaluation 主分类仅 1 件(HarnessOpt-Bench 28▲),其余 14 件以 agent/multimodal 为主;无 paper_cards 新增 evaluation 主分类建卡。
执行摘要
本期 evaluation E1 预消化发现 1 条确认增量 + 2 条待建卡/待核实候选,共涉 2 个新 arXiv 号。相比上期(R40,6 确认 + 0 待建卡),本期 eval 专项增量规模显著收缩——主分类 evaluation 新增仅 HarnessOpt-Bench 1 件;其余增量均为邻接 evaluation 维度但主分类落在 agent/engineering。
核心脉络是:evaluation 主题在 R40 六件合流后进入消化整合期,本棒无新范式级工作;主要信号是 HarnessOpt-Bench(LLM 在 Harness 优化方面的能力评测)作为"LLM-as-Harness-Optimizer"新方向补入 §2.4,以及 AgentOPSD(递归自蒸馏)持续跨日续立信号。
增量条目(1 条确认 + 2 条待核实候选)
增量 1 · P1 确认 · HarnessOpt-Bench(arXiv:2608.06301):评估 LLM 在 Harness 优化方面的能力
来源: HF Daily 8-09 #11 28▲(evaluation 主分类)+ stephen 8-09 ai-industry e1prep 来源归档 + jay 8-09 engineering e1prep 提及 arXiv: 2608.06301 TLDR(来源:HF Daily 8-09 条目摘要): 评估 LLM 在 Harness 优化方面的能力。 卡状态: ❌ paper_cards 尚未建卡;HF Daily 8-09 #11 28▲,候选强度中等
要点: - 核心问题:Harness(评测基础设施/配置)的优化本身是否是一种可被 LLM 学会的能力?——这是一个"元评测"问题:LLM 能否优化用于评测 LLM 的 harness - 核心方案:HarnessOpt-Bench = 评估 LLM 在 Harness 优化方面能力的专项基准——将"优化评测工具"本身变成评测任务 - 评测维度:LLM 对 harness 配置/参数的感知与调整能力 + harness 优化后对下游评测结果的影响——属于 R40 OSReward(Judge 可靠性)的"上游":Judge 可靠性 ← Harness 设计质量 ← Harness 优化能力 - 方法论价值:首次将"优化评测基础设施"作为评测目标——与 R40 Benchmarking the Benchmarks(元评测)同属"评测的评测"方向,但更具体:聚焦 harness 优化而非 benchmark 质量审计 - 与 R40 已有工作的关系:R40 OSReward 关注"VLM Judge 对 CUA 轨迹的可靠性",HarnessOpt-Bench 关注"LLM 对 harness 本身的优化能力"——两者构成"评测工具体系可靠性"的双件套(Judge 可靠性 + Harness 优化能力)
与 knowledge/evaluation.md R40 现有脉络的关系: - 落入 §2.4「Judge & Harness 工程」——HarnessOpt-Bench 是"Harness 优化能力评测"的新增案例,属于 R40 RecHarness(Bandit 路由 Harness)→ OSReward(CUA Judge)→ HarnessOpt-Bench(Harness 优化)的第三级延伸 - 落入 §2.7「评测对象的横向分化」——新增"LLM-as-Harness-Optimizer 评测"行(HarnessOpt-Bench) - 与 §2.6 失败模式分析纵深四阶邻接:Harness 优化能力不足导致的"次优 harness 评选"可成为新的失败模式维度
建议归入节: §2.4 Judge & Harness 工程(新增 HarnessOpt-Bench 为 Harness 优化能力评测基准)+ §2.7 评测对象横向分化(新增"LLM-as-Harness-Optimizer 评测"行)
arXiv: 2608.06301
待核实候选 1 · P2 待核实 · AgentOPSD(arXiv:2608.05987):持续跨日续立——Agentic RL 递归自蒸馏的 eval 维度
来源: HF Daily 8-09 #2 75▲(跨日 67▲ → 75▲ = +8 票,agent 主分类)+ spark 8-09 agent e1prep 详细覆盖 arXiv: 2608.05987 TLDR(来源:HF Daily 8-08/8-09): 面向智能体强化学习的递归自蒸馏。
要点: - 与 evaluation 的关系:AgentOPSD 本质是训练范式论文,但其"递归自蒸馏"方法引入了"训练过程中评测信号的自演进"——这涉及 eval 设计的一个核心难题:训练和评测分布的一致性(训练信号来自自蒸馏而非外部基准) - 跨日信号:8-08 67▲ → 8-09 75▲ = +8 票/24h,HF Daily 8-09 票榜第二,持续高强度续立 - 待核实:论文是否提供 AgentOPSD 训练信号 vs 外部基准的对照实验?递归蒸馏是否引入 eval 偏差?
建议归入节: §2.7 评测对象横向分化(邻接"训练信号自演进评测"候选,需 paper_cards 建卡后决定)+ §3.3 反方(递归蒸馏 eval 偏差风险)
arXiv: 2608.05987
待核实候选 2 · P2 待核实 · Lilian Weng「自我改进的 Harness Engineering」(2026-08-04):Harness 工程化的工程化
来源: jay 8-09 RSS/lilian-weng.md(RSS 来源归档)+ stephen 8-09 ai-industry e1prep 提及 arXiv: 待查(可能为博客文章或 arXiv 2607.xxxxx 系列)
要点: - 核心问题:Lilian Weng 2026-08-04 文章系统梳理了 LLM Agent 的自我改进(self-improvement)机制——其中" Harness Engineering 的自我演进"是一个值得关注的方向:能否让 harness 自身根据评测反馈自动演进? - 与 HarnessOpt-Bench 的关系:HarnessOpt-Bench 评估"LLM 能否优化 harness",Lilian Weng 文章探讨" harness 能否自我演进"——两者同属"Harness 工程化的自动化"方向 - 待核实:原始文章是否为 arXiv 论文?具体实验数据和方法论贡献如何?
建议归入节: §2.4 Judge & Harness 工程(邻接"harness 自我演进"候选,需确认来源形式)
值得警惕的矛盾或待核实说法
矛盾 1 · HarnessOpt-Bench 与 Benchmarking the Benchmarks 的边界模糊
- 现状:HarnessOpt-Bench 评估"LLM 优化 harness 的能力",Benchmarking the Benchmarks 评估"benchmark 本身的质量"——两者同属"元评测"方向,但面向不同层级(harness vs benchmark);是否存在重叠区域(优化后的 harness 产出低质量 benchmark)未明确
- 待核实:HarnessOpt-Bench 是否考虑了"优化后的 harness 质量下降"这一失败模式?
矛盾 2 · AgentOPSD "递归自蒸馏"引入的 eval 偏差风险
- 现状:AgentOPSD 的训练信号来自递归自蒸馏,评测信号与训练信号同源——存在"eval 自指"问题:自我改进的收益可能被放大,因为评测环境与训练环境高度相似
- 待核实:论文是否提供"在分布外基准上评估 AgentOPSD 训练的 agent"的实验?外基准上的收益是否显著?
本期不纳入的已知条目(已在上期或 R40 覆盖)
| 条目 | arXiv 号 | 不纳入原因 |
|---|---|---|
| OSReward | 2607.28609 | 已在 R40 确认增量 1 覆盖;HF Daily 8-09 #4 60▲ 续立,但无 eval 专项新信息 |
| DataSpace | 2608.03451 | 已在 R40 确认增量 2 覆盖;HF Daily 8-09 #13 25▲ 续立,无新信息 |
| MameLoshnLM | 2608.05850 | 已在 R40 确认增量 3 覆盖;近 2 天无 eval 专项新信息 |
| HORIZON | 2604.11978 | 已在 R40 确认增量 4 覆盖;paper_cards 仍未建卡(P1 缺口延续) |
| Benchmarking the Benchmarks | 2608.06329 | 已在 R40 确认增量 5 覆盖;paper_cards 仍未建卡(P1 缺口延续) |
| APEX-Agents | — | 已在 R40 确认增量 6 覆盖;24% 数据仍待溯源(P1 缺口延续) |
| RST | 2608.05466 | R40/agent 主题;HF Daily 8-09 #1 218▲ 续立,无 eval 专项 |
| GDPevo | 2608.03764 | 已在 R39 基线;HF Daily 8-09 沿用 8-07 票榜,无 eval 专项 |
| FinanceHarness | 2607.27853 | 已在 R39 基线;近 2 天无 eval 专项新信息 |
| NOLLI | 2608.04397 | 已在 R39 基线;paper_cards 仍未建卡(P1 缺口延续) |
| OneDayAgent | 2608.05013 | 已在 R39 基线;paper_cards 仍未建卡(P1 缺口延续) |
| Skill-Native LLM | 2608.05139 | 已在 R39 基线;paper_cards 仍未建卡(P1 缺口延续) |
| ChronoLens | 2608.03507 | 已在 R38 基线;HF Daily 8-09 #9 33▲ 续立,无 eval 专项 |
| AntiSkillBench | 2608.03700 | 已在 R38 基线;HF Daily 8-09 不在 top 15 |
| FinIndices | 2607.28661 | 已在 R38 基线;HF Daily 8-09 不在 top 15 |
| PAST-Bench | 2608.04003 | 已在 R38 基线;HF Daily 8-09 不在 top 15 |
| LongHorizon-Harness | 2608.01964 | 已在 R37 基线;连续 4 日未返 HF Daily top 15 |
| RecHarness | 2607.29241 | 已在 R37 基线;近 2 天无 eval 专项新信息 |
| Model or Harness? | 2607.28802 | 已在 R37 基线;近 2 天无 eval 专项新信息 |
| To Add Is Machine | 2607.28887 | 已在 R37 基线;HF Daily 8-09 不在 top 15 |
引用 arXiv 号汇总
| # | arXiv 号 | 名称 | 状态 | 与 evaluation.md 关系 |
|---|---|---|---|---|
| 1 | 2608.06301 | HarnessOpt-Bench:LLM 在 Harness 优化方面的能力评测 | ❌ paper_cards 尚未建(HF Daily 8-09 #11 28▲) | 🆕 增量 1 确认 |
| 2 | 2608.05987 | AgentOPSD:Agentic RL 递归自蒸馏 | ❌ paper_cards 尚未建(HF Daily 8-09 #2 75▲ 续立) | 🔶 待核实候选 1(agent 主分类,eval 维度邻接) |
| A | 2607.28609 | OSReward | ✅ 已在 R40 基线 | 已在基线 |
| B | 2608.03451 | DataSpace | ✅ 已在 R40 基线 | 已在基线 |
| C | 2608.05850 | MameLoshnLM | ✅ 已在 R40 基线 | 已在基线 |
| D | 2604.11978 | HORIZON | ❌ 已在 R40 确认(paper_cards 待建) | 已在基线 |
| E | 2608.06329 | Benchmarking the Benchmarks | ❌ 已在 R40 确认(paper_cards 待建) | 已在基线 |
| F | APEX-Agents | APEX-Agents 2026 Benchmark | ❌ 已在 R40 确认(arXiv 待溯源) | 已在基线 |
| G | 2608.03764 | GDPevo | ✅ 已在 R39 基线 | 已在基线 |
| H | 2607.27853 | FinanceHarness | ✅ 已在 R39 基线 | 已在基线 |
| I | 2608.04397 | NOLLI | ❌ 已在 R39 确认(paper_cards 待建) | 已在基线 |
| J | 2608.05013 | OneDayAgent | ❌ 已在 R39 确认(paper_cards 待建) | 已在基线 |
| K | 2608.05139 | Skill-Native LLM | ❌ 已在 R39 确认(paper_cards 待建) | 已在基线 |
| L | 2608.03507 | ChronoLens | ✅ 已在 R38 基线 | 已在基线 |
| M | 2608.03700 | AntiSkillBench | ✅ 已在 R38 基线 | 已在基线 |
| N | 2607.28661 | FinIndices | ✅ 已在 R38 基线 | 已在基线 |
| O | 2608.04003 | PAST-Bench | ✅ 已在 R38 基线 | 已在基线 |
| P | 2608.01964 | LongHorizon-Harness | ✅ 已在 R37 基线(连续 4 日 HF 下榜) | 已在基线 |
| Q | 2607.29241 | RecHarness | ✅ 已在 R37 基线 | 已在基线 |
| R | 2607.28802 | Model or Harness? | ✅ 已在 R37 基线 | 已在基线 |
| S | 2607.28887 | To Add Is Machine | ✅ 已在 R37 基线 | 已在基线 |
检查过的来源清单
tom inbox(8-07 下午~8-09): - 2026-08-07-evaluation-e1prep.md(R39 收官报告;基准参考) - 2026-08-08-evaluation-e1prep.md(R40 收官报告;基准参考) - 2026-08-09-0900-hf-daily-2026-08-09.md(HF Daily 8-09 票榜;含 HarnessOpt-Bench #11 28▲) - 2026-08-09T0840-agent-rag-longcontext-radar.md(radar;无 eval 专项新增) - 2026-08-09T1440-agent-rag-longcontext-radar.md(radar;无 eval 专项新增) - 2026-08-09-rag-e1prep.md(RAG 专项;无 eval 专项新增)
jay inbox(8-07 下午~8-09): - 2026-08-09-1001-rss-lilian-weng.md(Lilian Weng Harness Engineering 文章;含 HarnessOpt-Bench 邻接) - 2026-08-09-1000-rss-raschka.md(RSS;无 eval 专项) - 2026-08-09-1140-news-x-tech-radar.md(tech radar;无 eval 专项) - 2026-08-09-csdn-ai-agent-rag-llm-highvalue.md(无 eval 专项) - 2026-08-09-engineering-e1prep.md(engineering 专项;含 HarnessOpt-Bench 提及) - 2026-08-09-research-digest.md(研究 digest;含 HarnessOpt-Bench 邻接) - 2026-08-09T0948-jay-weekly-briefing-supplement.md(weekly 补充;无 eval 专项) - 2026-08-08-llm-production-incident-engineering.md(R40 来源;APEX/Gartner 已在基线) - 2026-08-08-1001-rss-cool-papers.md(R40 来源;Benchmarking the Benchmarks 已在基线)
flyp inbox(8-07 下午~8-09): - 2026-08-09-1000-rss-cameron-wolfe.md(RSS;无 eval 专项) - 2026-08-09-0950-KVAE-Tokenizers-multimodal-critical-read.md(multimodal 专项;无 eval) - 2026-08-09-multimodal-e1prep.md(multimodal 专项;无 eval 专项新增) - 2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.md(R40 来源;HORIZON 已在基线) - 2026-08-07-multimodal-e1prep.md(无 eval 专项)
spark inbox(8-07 下午~8-09): - 2026-08-09-agent-e1prep.md(agent 专项;含 HarnessOpt-Bench #11 28▲ 来源归档 + AgentOPSD 跨日 +8 票详情) - 2026-08-09-1001-rss-gradient-flow.md(RSS;无 eval 专项) - 2026-08-08-agent-e1prep.md(R40 来源;无 eval 专项新增)
stephen inbox(8-07 下午~8-09): - 2026-08-09-ai-industry-e1prep.md(ai-industry 专项;含 HarnessOpt-Bench 来源归档 + AgentOPSD 跨日续立 + OSReward 跨榜续立 + Interpretable MEG 58▲) - 2026-08-09-1245-stephen-coordination-check-noon.md(协调检查;HF Daily 8-09 第 5 例 100% 续立率确认) - 2026-08-09-0910-news-x-vip-radar.md(X-VIP radar;无 eval 专项) - 2026-08-09-1002-news-deepmind-news.md(无 eval 专项) - 2026-08-08-ai-industry-e1prep.md(R40 来源;无 eval 专项新增)
paper_cards 近 3 天新卡(819-831,共 13 张): - 主分类 evaluation:0 件(本期无 evaluation 主分类新卡) - 主分类 agent:819(KVAE Tokenizers · multimodal 主分类) + 820(Activity Frames · agent 主分类) + 822(FactorJEPA · agent 主分类) - 主分类 multimodal:819(KVAE) + 821(Weights or Skills) - 其余:老卡补档(821/822/823 等 2024/2023 年 arXiv) - 近 3 天主分类 evaluation 新卡:0 件
HF Daily 8-09 票榜 evaluation 相关条目: - HarnessOpt-Bench(2608.06301)#11 · 28▲——主分类 evaluation;paper_cards 未建 ❌(本期唯一 eval 主分类新增) - OSReward(2607.28609)#4 · 60▲——主分类 evaluation;已在 R40 基线 ✅ - DataSpace(2608.03451)#13 · 25▲——主分类 evaluation;已在 R40 基线 ✅ - Interpretable MEG Decoding(2608.01481)#5 · 58▲——主分类 neuroscience 邻接 evaluation;已在 R40 基线 ✅ - 近 3 天 HF Daily 8-09 evaluation 主分类净新增:1 件(HarnessOpt-Bench 待建卡)
主题活文档更新状态
- knowledge/evaluation.md 当前版本:R40(2026-08-08 16:50 批次)
- 本期 1 条确认增量(HarnessOpt-Bench)+ 2 条待核实候选(AgentOPSD eval 维度 + Lilian Weng Harness Engineering),规模不足以触发 R41 范式跃迁
- 核心更新方向:§2.4 Judge & Harness 工程(新增 HarnessOpt-Bench 为 Harness 优化能力评测基准)+ §2.7 评测对象横向分化(新增"LLM-as-Harness-Optimizer 评测"行)
- 建议 R41 关注:HarnessOpt-Bench paper_cards 建卡后核实具体评测维度;AgentOPSD 递归蒸馏 eval 偏差风险;Lilian Weng 文章原始出处和 arXiv 编号
本棒 R41 预消化关键议题
- HarnessOpt-Bench → 下一步:paper_cards 建卡后确认具体评测维度;Harness 优化与 benchmark 质量的关系;是否与 Benchmarking the Benchmarks 存在边界模糊
- P1 缺口延续提醒:HORIZON(2604.11978)、Benchmarking the Benchmarks(2608.06329)、APEX-Agents(arXiv 待溯源)、NOLLI(2608.04397)、OneDayAgent(2608.05013)、Skill-Native LLM(2608.05139)六件 paper_cards 仍未建卡——建议下次 evaluation 主题轮次优先处理
- 立标饱和度信号:evaluation 主分类在 HF Daily 连续两日(8-08/8-09)无新净增 entry——立标饱和度信号与 R40 六件合流后 eval 主题进入"消化整合期"吻合
- 下一波 evaluation 回暖信号:预计随 R41/R42 周内多 Agent 评测工具化论文集中提交,eval 主题可能出现新一轮增量
无显著新增量时说明
本期 eval 主题增量规模较小(1 确认 + 2 待核实),未达到 R40 六件合流以来的范式触发阈值,但 HarnessOpt-Bench(arXiv:2608.06301)是确实的 eval 专项新增,建议纳入 R41 §2.4 增补。其余 14 件 HF Daily 8-09 在榜 evaluation 相关条目均为 R40 已覆盖项续立,无新信息。
Tom · 2026-08-09 15:40 CST · E1 预消化简报 · 1 条确认增量(HarnessOpt-Bench)+ 2 条待核实候选(AgentOPSD eval 维度 + Lilian Weng Harness Engineering)+ 6 件 P1 缺口延续提醒 · 涉及 arXiv:2608.06301(🆕 待建卡)/ 2608.05987(🔶 待核实候选)