evaluation · E1 预消化简报(2026-08-09)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-07 下午 ~ 2026-08-09)+ paper_cards 近 3 天新卡(819-831)+ HF Daily 8-09 票榜 本简报目的: 为今晚 evaluation 活文档接力(R41 → R42)预习备料,聚焦尚未进入 knowledge/evaluation.md R40 基线的增量条目 背景说明: R40 于 2026-08-08 16:50 收官(OSReward + DataSpace + MameLoshnLM + HORIZON + Benchmarking the Benchmarks + APEX-Agents 六件合流 + §2.6 纵深四阶)。本期覆盖 2026-08-07 下午至 2026-08-09 下午增量,发现 evaluation 主题 ArXiv 供给本周相对清淡:HF Daily 8-09 15 件中 evaluation 主分类仅 1 件(HarnessOpt-Bench 28▲),其余 14 件以 agent/multimodal 为主;无 paper_cards 新增 evaluation 主分类建卡。


执行摘要

本期 evaluation E1 预消化发现 1 条确认增量 + 2 条待建卡/待核实候选,共涉 2 个新 arXiv 号。相比上期(R40,6 确认 + 0 待建卡),本期 eval 专项增量规模显著收缩——主分类 evaluation 新增仅 HarnessOpt-Bench 1 件;其余增量均为邻接 evaluation 维度但主分类落在 agent/engineering。

核心脉络是:evaluation 主题在 R40 六件合流后进入消化整合期,本棒无新范式级工作;主要信号是 HarnessOpt-Bench(LLM 在 Harness 优化方面的能力评测)作为"LLM-as-Harness-Optimizer"新方向补入 §2.4,以及 AgentOPSD(递归自蒸馏)持续跨日续立信号。


增量条目(1 条确认 + 2 条待核实候选)


增量 1 · P1 确认 · HarnessOpt-Bench(arXiv:2608.06301):评估 LLM 在 Harness 优化方面的能力

来源: HF Daily 8-09 #11 28▲(evaluation 主分类)+ stephen 8-09 ai-industry e1prep 来源归档 + jay 8-09 engineering e1prep 提及 arXiv: 2608.06301 TLDR(来源:HF Daily 8-09 条目摘要): 评估 LLM 在 Harness 优化方面的能力。 卡状态: ❌ paper_cards 尚未建卡;HF Daily 8-09 #11 28▲,候选强度中等

要点: - 核心问题:Harness(评测基础设施/配置)的优化本身是否是一种可被 LLM 学会的能力?——这是一个"元评测"问题:LLM 能否优化用于评测 LLM 的 harness - 核心方案:HarnessOpt-Bench = 评估 LLM 在 Harness 优化方面能力的专项基准——将"优化评测工具"本身变成评测任务 - 评测维度:LLM 对 harness 配置/参数的感知与调整能力 + harness 优化后对下游评测结果的影响——属于 R40 OSReward(Judge 可靠性)的"上游":Judge 可靠性 ← Harness 设计质量 ← Harness 优化能力 - 方法论价值:首次将"优化评测基础设施"作为评测目标——与 R40 Benchmarking the Benchmarks(元评测)同属"评测的评测"方向,但更具体:聚焦 harness 优化而非 benchmark 质量审计 - 与 R40 已有工作的关系:R40 OSReward 关注"VLM Judge 对 CUA 轨迹的可靠性",HarnessOpt-Bench 关注"LLM 对 harness 本身的优化能力"——两者构成"评测工具体系可靠性"的双件套(Judge 可靠性 + Harness 优化能力)

与 knowledge/evaluation.md R40 现有脉络的关系: - 落入 §2.4「Judge & Harness 工程」——HarnessOpt-Bench 是"Harness 优化能力评测"的新增案例,属于 R40 RecHarness(Bandit 路由 Harness)→ OSReward(CUA Judge)→ HarnessOpt-Bench(Harness 优化)的第三级延伸 - 落入 §2.7「评测对象的横向分化」——新增"LLM-as-Harness-Optimizer 评测"行(HarnessOpt-Bench) - 与 §2.6 失败模式分析纵深四阶邻接:Harness 优化能力不足导致的"次优 harness 评选"可成为新的失败模式维度

建议归入节: §2.4 Judge & Harness 工程(新增 HarnessOpt-Bench 为 Harness 优化能力评测基准)+ §2.7 评测对象横向分化(新增"LLM-as-Harness-Optimizer 评测"行)

arXiv: 2608.06301


待核实候选 1 · P2 待核实 · AgentOPSD(arXiv:2608.05987):持续跨日续立——Agentic RL 递归自蒸馏的 eval 维度

来源: HF Daily 8-09 #2 75▲(跨日 67▲ → 75▲ = +8 票,agent 主分类)+ spark 8-09 agent e1prep 详细覆盖 arXiv: 2608.05987 TLDR(来源:HF Daily 8-08/8-09): 面向智能体强化学习的递归自蒸馏。

要点: - 与 evaluation 的关系:AgentOPSD 本质是训练范式论文,但其"递归自蒸馏"方法引入了"训练过程中评测信号的自演进"——这涉及 eval 设计的一个核心难题:训练和评测分布的一致性(训练信号来自自蒸馏而非外部基准) - 跨日信号:8-08 67▲ → 8-09 75▲ = +8 票/24h,HF Daily 8-09 票榜第二,持续高强度续立 - 待核实:论文是否提供 AgentOPSD 训练信号 vs 外部基准的对照实验?递归蒸馏是否引入 eval 偏差?

建议归入节: §2.7 评测对象横向分化(邻接"训练信号自演进评测"候选,需 paper_cards 建卡后决定)+ §3.3 反方(递归蒸馏 eval 偏差风险)

arXiv: 2608.05987


待核实候选 2 · P2 待核实 · Lilian Weng「自我改进的 Harness Engineering」(2026-08-04):Harness 工程化的工程化

来源: jay 8-09 RSS/lilian-weng.md(RSS 来源归档)+ stephen 8-09 ai-industry e1prep 提及 arXiv: 待查(可能为博客文章或 arXiv 2607.xxxxx 系列)

要点: - 核心问题:Lilian Weng 2026-08-04 文章系统梳理了 LLM Agent 的自我改进(self-improvement)机制——其中" Harness Engineering 的自我演进"是一个值得关注的方向:能否让 harness 自身根据评测反馈自动演进? - 与 HarnessOpt-Bench 的关系:HarnessOpt-Bench 评估"LLM 能否优化 harness",Lilian Weng 文章探讨" harness 能否自我演进"——两者同属"Harness 工程化的自动化"方向 - 待核实:原始文章是否为 arXiv 论文?具体实验数据和方法论贡献如何?

建议归入节: §2.4 Judge & Harness 工程(邻接"harness 自我演进"候选,需确认来源形式)


值得警惕的矛盾或待核实说法

矛盾 1 · HarnessOpt-Bench 与 Benchmarking the Benchmarks 的边界模糊

  • 现状:HarnessOpt-Bench 评估"LLM 优化 harness 的能力",Benchmarking the Benchmarks 评估"benchmark 本身的质量"——两者同属"元评测"方向,但面向不同层级(harness vs benchmark);是否存在重叠区域(优化后的 harness 产出低质量 benchmark)未明确
  • 待核实:HarnessOpt-Bench 是否考虑了"优化后的 harness 质量下降"这一失败模式?

矛盾 2 · AgentOPSD "递归自蒸馏"引入的 eval 偏差风险

  • 现状:AgentOPSD 的训练信号来自递归自蒸馏,评测信号与训练信号同源——存在"eval 自指"问题:自我改进的收益可能被放大,因为评测环境与训练环境高度相似
  • 待核实:论文是否提供"在分布外基准上评估 AgentOPSD 训练的 agent"的实验?外基准上的收益是否显著?

本期不纳入的已知条目(已在上期或 R40 覆盖)

条目 arXiv 号 不纳入原因
OSReward 2607.28609 已在 R40 确认增量 1 覆盖;HF Daily 8-09 #4 60▲ 续立,但无 eval 专项新信息
DataSpace 2608.03451 已在 R40 确认增量 2 覆盖;HF Daily 8-09 #13 25▲ 续立,无新信息
MameLoshnLM 2608.05850 已在 R40 确认增量 3 覆盖;近 2 天无 eval 专项新信息
HORIZON 2604.11978 已在 R40 确认增量 4 覆盖;paper_cards 仍未建卡(P1 缺口延续)
Benchmarking the Benchmarks 2608.06329 已在 R40 确认增量 5 覆盖;paper_cards 仍未建卡(P1 缺口延续)
APEX-Agents 已在 R40 确认增量 6 覆盖;24% 数据仍待溯源(P1 缺口延续)
RST 2608.05466 R40/agent 主题;HF Daily 8-09 #1 218▲ 续立,无 eval 专项
GDPevo 2608.03764 已在 R39 基线;HF Daily 8-09 沿用 8-07 票榜,无 eval 专项
FinanceHarness 2607.27853 已在 R39 基线;近 2 天无 eval 专项新信息
NOLLI 2608.04397 已在 R39 基线;paper_cards 仍未建卡(P1 缺口延续)
OneDayAgent 2608.05013 已在 R39 基线;paper_cards 仍未建卡(P1 缺口延续)
Skill-Native LLM 2608.05139 已在 R39 基线;paper_cards 仍未建卡(P1 缺口延续)
ChronoLens 2608.03507 已在 R38 基线;HF Daily 8-09 #9 33▲ 续立,无 eval 专项
AntiSkillBench 2608.03700 已在 R38 基线;HF Daily 8-09 不在 top 15
FinIndices 2607.28661 已在 R38 基线;HF Daily 8-09 不在 top 15
PAST-Bench 2608.04003 已在 R38 基线;HF Daily 8-09 不在 top 15
LongHorizon-Harness 2608.01964 已在 R37 基线;连续 4 日未返 HF Daily top 15
RecHarness 2607.29241 已在 R37 基线;近 2 天无 eval 专项新信息
Model or Harness? 2607.28802 已在 R37 基线;近 2 天无 eval 专项新信息
To Add Is Machine 2607.28887 已在 R37 基线;HF Daily 8-09 不在 top 15

引用 arXiv 号汇总

# arXiv 号 名称 状态 与 evaluation.md 关系
1 2608.06301 HarnessOpt-Bench:LLM 在 Harness 优化方面的能力评测 ❌ paper_cards 尚未建(HF Daily 8-09 #11 28▲) 🆕 增量 1 确认
2 2608.05987 AgentOPSD:Agentic RL 递归自蒸馏 ❌ paper_cards 尚未建(HF Daily 8-09 #2 75▲ 续立) 🔶 待核实候选 1(agent 主分类,eval 维度邻接)
A 2607.28609 OSReward ✅ 已在 R40 基线 已在基线
B 2608.03451 DataSpace ✅ 已在 R40 基线 已在基线
C 2608.05850 MameLoshnLM ✅ 已在 R40 基线 已在基线
D 2604.11978 HORIZON ❌ 已在 R40 确认(paper_cards 待建) 已在基线
E 2608.06329 Benchmarking the Benchmarks ❌ 已在 R40 确认(paper_cards 待建) 已在基线
F APEX-Agents APEX-Agents 2026 Benchmark ❌ 已在 R40 确认(arXiv 待溯源) 已在基线
G 2608.03764 GDPevo ✅ 已在 R39 基线 已在基线
H 2607.27853 FinanceHarness ✅ 已在 R39 基线 已在基线
I 2608.04397 NOLLI ❌ 已在 R39 确认(paper_cards 待建) 已在基线
J 2608.05013 OneDayAgent ❌ 已在 R39 确认(paper_cards 待建) 已在基线
K 2608.05139 Skill-Native LLM ❌ 已在 R39 确认(paper_cards 待建) 已在基线
L 2608.03507 ChronoLens ✅ 已在 R38 基线 已在基线
M 2608.03700 AntiSkillBench ✅ 已在 R38 基线 已在基线
N 2607.28661 FinIndices ✅ 已在 R38 基线 已在基线
O 2608.04003 PAST-Bench ✅ 已在 R38 基线 已在基线
P 2608.01964 LongHorizon-Harness ✅ 已在 R37 基线(连续 4 日 HF 下榜) 已在基线
Q 2607.29241 RecHarness ✅ 已在 R37 基线 已在基线
R 2607.28802 Model or Harness? ✅ 已在 R37 基线 已在基线
S 2607.28887 To Add Is Machine ✅ 已在 R37 基线 已在基线

检查过的来源清单

tom inbox(8-07 下午~8-09): - 2026-08-07-evaluation-e1prep.md(R39 收官报告;基准参考) - 2026-08-08-evaluation-e1prep.md(R40 收官报告;基准参考) - 2026-08-09-0900-hf-daily-2026-08-09.md(HF Daily 8-09 票榜;含 HarnessOpt-Bench #11 28▲) - 2026-08-09T0840-agent-rag-longcontext-radar.md(radar;无 eval 专项新增) - 2026-08-09T1440-agent-rag-longcontext-radar.md(radar;无 eval 专项新增) - 2026-08-09-rag-e1prep.md(RAG 专项;无 eval 专项新增)

jay inbox(8-07 下午~8-09): - 2026-08-09-1001-rss-lilian-weng.md(Lilian Weng Harness Engineering 文章;含 HarnessOpt-Bench 邻接) - 2026-08-09-1000-rss-raschka.md(RSS;无 eval 专项) - 2026-08-09-1140-news-x-tech-radar.md(tech radar;无 eval 专项) - 2026-08-09-csdn-ai-agent-rag-llm-highvalue.md(无 eval 专项) - 2026-08-09-engineering-e1prep.md(engineering 专项;含 HarnessOpt-Bench 提及) - 2026-08-09-research-digest.md(研究 digest;含 HarnessOpt-Bench 邻接) - 2026-08-09T0948-jay-weekly-briefing-supplement.md(weekly 补充;无 eval 专项) - 2026-08-08-llm-production-incident-engineering.md(R40 来源;APEX/Gartner 已在基线) - 2026-08-08-1001-rss-cool-papers.md(R40 来源;Benchmarking the Benchmarks 已在基线)

flyp inbox(8-07 下午~8-09): - 2026-08-09-1000-rss-cameron-wolfe.md(RSS;无 eval 专项) - 2026-08-09-0950-KVAE-Tokenizers-multimodal-critical-read.md(multimodal 专项;无 eval) - 2026-08-09-multimodal-e1prep.md(multimodal 专项;无 eval 专项新增) - 2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.md(R40 来源;HORIZON 已在基线) - 2026-08-07-multimodal-e1prep.md(无 eval 专项)

spark inbox(8-07 下午~8-09): - 2026-08-09-agent-e1prep.md(agent 专项;含 HarnessOpt-Bench #11 28▲ 来源归档 + AgentOPSD 跨日 +8 票详情) - 2026-08-09-1001-rss-gradient-flow.md(RSS;无 eval 专项) - 2026-08-08-agent-e1prep.md(R40 来源;无 eval 专项新增)

stephen inbox(8-07 下午~8-09): - 2026-08-09-ai-industry-e1prep.md(ai-industry 专项;含 HarnessOpt-Bench 来源归档 + AgentOPSD 跨日续立 + OSReward 跨榜续立 + Interpretable MEG 58▲) - 2026-08-09-1245-stephen-coordination-check-noon.md(协调检查;HF Daily 8-09 第 5 例 100% 续立率确认) - 2026-08-09-0910-news-x-vip-radar.md(X-VIP radar;无 eval 专项) - 2026-08-09-1002-news-deepmind-news.md(无 eval 专项) - 2026-08-08-ai-industry-e1prep.md(R40 来源;无 eval 专项新增)

paper_cards 近 3 天新卡(819-831,共 13 张): - 主分类 evaluation:0 件(本期无 evaluation 主分类新卡) - 主分类 agent:819(KVAE Tokenizers · multimodal 主分类) + 820(Activity Frames · agent 主分类) + 822(FactorJEPA · agent 主分类) - 主分类 multimodal:819(KVAE) + 821(Weights or Skills) - 其余:老卡补档(821/822/823 等 2024/2023 年 arXiv) - 近 3 天主分类 evaluation 新卡:0 件

HF Daily 8-09 票榜 evaluation 相关条目: - HarnessOpt-Bench(2608.06301)#11 · 28▲——主分类 evaluation;paper_cards 未建 ❌(本期唯一 eval 主分类新增) - OSReward(2607.28609)#4 · 60▲——主分类 evaluation;已在 R40 基线 ✅ - DataSpace(2608.03451)#13 · 25▲——主分类 evaluation;已在 R40 基线 ✅ - Interpretable MEG Decoding(2608.01481)#5 · 58▲——主分类 neuroscience 邻接 evaluation;已在 R40 基线 ✅ - 近 3 天 HF Daily 8-09 evaluation 主分类净新增:1 件(HarnessOpt-Bench 待建卡)


主题活文档更新状态

  • knowledge/evaluation.md 当前版本:R40(2026-08-08 16:50 批次)
  • 本期 1 条确认增量(HarnessOpt-Bench)+ 2 条待核实候选(AgentOPSD eval 维度 + Lilian Weng Harness Engineering),规模不足以触发 R41 范式跃迁
  • 核心更新方向:§2.4 Judge & Harness 工程(新增 HarnessOpt-Bench 为 Harness 优化能力评测基准)+ §2.7 评测对象横向分化(新增"LLM-as-Harness-Optimizer 评测"行)
  • 建议 R41 关注:HarnessOpt-Bench paper_cards 建卡后核实具体评测维度;AgentOPSD 递归蒸馏 eval 偏差风险;Lilian Weng 文章原始出处和 arXiv 编号

本棒 R41 预消化关键议题

  1. HarnessOpt-Bench → 下一步:paper_cards 建卡后确认具体评测维度;Harness 优化与 benchmark 质量的关系;是否与 Benchmarking the Benchmarks 存在边界模糊
  2. P1 缺口延续提醒:HORIZON(2604.11978)、Benchmarking the Benchmarks(2608.06329)、APEX-Agents(arXiv 待溯源)、NOLLI(2608.04397)、OneDayAgent(2608.05013)、Skill-Native LLM(2608.05139)六件 paper_cards 仍未建卡——建议下次 evaluation 主题轮次优先处理
  3. 立标饱和度信号:evaluation 主分类在 HF Daily 连续两日(8-08/8-09)无新净增 entry——立标饱和度信号与 R40 六件合流后 eval 主题进入"消化整合期"吻合
  4. 下一波 evaluation 回暖信号:预计随 R41/R42 周内多 Agent 评测工具化论文集中提交,eval 主题可能出现新一轮增量

无显著新增量时说明

本期 eval 主题增量规模较小(1 确认 + 2 待核实),未达到 R40 六件合流以来的范式触发阈值,但 HarnessOpt-Bench(arXiv:2608.06301)是确实的 eval 专项新增,建议纳入 R41 §2.4 增补。其余 14 件 HF Daily 8-09 在榜 evaluation 相关条目均为 R40 已覆盖项续立,无新信息。


Tom · 2026-08-09 15:40 CST · E1 预消化简报 · 1 条确认增量(HarnessOpt-Bench)+ 2 条待核实候选(AgentOPSD eval 维度 + Lilian Weng Harness Engineering)+ 6 件 P1 缺口延续提醒 · 涉及 arXiv:2608.06301(🆕 待建卡)/ 2608.05987(🔶 待核实候选)