evaluation · E1 预消化简报(2026-08-11)
信源检查记录
本次覆盖:
- work-queue.md ✓(无 evaluation 直接增量;选题榜含 StreamArena 2608.05703)
- inbox/jay(8/10~8/11):2026-08-11T1510-jay-agent-harness-evaluation-methodology.md 含 3 篇 harness 评测方法论新 arXiv(首次进入 eval 视角)✓
- inbox/flyp(8/10~8/11):2026-08-10-2250-EMMA-agent-eval-light-read.md 含 EMMA multimodal reasoning benchmark 精读 ✓
- inbox/spark(8/10~8/11):agent-e1prep 无 eval 直接增量 ✓
- inbox/stephen(8/10~8/11):ai-industry-e1prep 无 eval 专项新增 ✓
- inbox/tom(8/10~8/11):HF Daily × 1(8/11 无 eval 进 top15);2026-08-11T1440-agent-rag-longcontext-radar.md 含 Evo-Bench 候选 ✓;2026-08-10-evaluation-e1prep.md(R42 基线)✓
- paper_cards 近 3 天新卡(860~868 范围):866(MatrAIx·evaluation+benchmark)、865(CLIP-CC-Bench·benchmark+evaluation 副分类)、861(DCAS·benchmark 邻接 eval)、867(QKAN·evaluation 分类标误) ✓
- knowledge/evaluation.md R42 基线 ✓
增量摘要
本轮(E1-R43,窗口 2026-08-10 下午 ~ 2026-08-11 下午)发现 7 条确认增量,其中 4 条为 evaluation 专项新卡(paper_cards 待建),3 条为 evaluation 维度新增条目。主体脉络为:Harness 披露/测量/Loop 评测三元组首次合流(Stop Comparing / Harness-Bench / LoopsBench),加上 Evo-Bench 作为"harness 演进能力"评测专项浮出,构成 R42 以来最重要的 eval 方法论更新;视频级描述评测(CLIP-CC-Bench)和群体用户模拟评测基础设施(MatrAIx)补全 benchmark 形态光谱;EMMA 精读确认多模态推理的视觉必要性筛选思路。
条目一:Harness-Bench(arXiv:2605.27922)— 系统性测量 Harness 效应的框架
来源:inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md(首次以 eval 视角进入知识库)
arXiv:2605.27922 | https://arxiv.org/html/2605.27922v1
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:2605.23950 发现"harness 效应颠覆模型排名"之后,如何系统测量这一效应?Harness-Bench 提出方法论
- 评测维度(6 维):Completion(任务完成率)、Tool use(工具调用准确性)、State management(状态管理)、Permission handling(权限处理)、Robustness(鲁棒性)、Token cost(Token 消耗)
- 定位:AgentBench 测"模型 + 固定 harness",Harness-Bench 测"不同 harness 对同一模型的影响"——两者互补
- 核心观点:Agent 性能应理解为"模型嵌入执行系统后的综合表现",而非模型固有属性
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 §2.4 Judge & Harness 工程(HarnessOpt-Bench / RecHarness / OSReward);R42 Evaluation as Infrastructure 三层架构——Harness-Bench 作为"系统性测量 harness 效应"的方法论工具,在 HarnessOpt-Bench 下游提供量化手段
- 缺失:Harness-Bench 自身条目;6 维测量框架在现有 harness 评测体系中的定位
- 建议归入:§2.4 Judge & Harness 工程新增——Harness-Bench 系统测量框架;§9.2 评测 harness/benchmark 套件新增 Harness-Bench 条目
arXiv 列表
- 2605.27922(🆕 待建卡)
条目二:LoopsBench(arXiv:2608.00267)— 从 Harness Engineering 到 Loop Engineering
来源:inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md(首次以 eval 视角进入知识库)
arXiv:2608.00267 | https://arxiv.org/html/2608.00267v1
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:现有 benchmark 测 artifact(最终 patch/结果),不测 loop(执行循环质量)——长期运行的 Agent 系统(代码生成、自动化工作流)需要新的评测维度
- 三个评测盲点:SWE-bench 不测 loop 效率;feature-level benchmarks 不测状态管理质量;long-horizon benchmarks 不测随时间推移的 loop 退化
- 三个新维度:State continuity(loop 跨步骤状态管理是否一致)、Regression pressure(新增功能是否破坏已有功能)、Execution efficiency(是否产生大量无用中间步骤)
- 与 Harness-Bench 关系:Harness-Bench 横向测"给定 harness,模型表现如何";LoopsBench 纵向测"长期运行的 loop 质量如何评价"——两者构成 Agent 评测的横向+纵向二维空间
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 §2.4(RecHarness/HarnessOpt-Bench);R42 §2.7 评测对象横向分化(LLM-as-Harness-Optimizer)——LoopsBench 将评测对象从 artifact 延伸到 loop,执行循环质量成为可量化维度
- 缺失:Loop 质量评测专项;Loop 退化(loop degradation)作为失败模式维度的定义
- 建议归入:§2.7 评测对象横向分化新增——Loop 质量评测(artifact vs loop 二元性);§2.6 失败模式分析纵深四阶新增——Loop 退化作为独立失败模式
arXiv 列表
- 2608.00267(🆕 待建卡)
条目三:Stop Comparing LLM Agents Without Disclosing the Harness(arXiv:2605.23950)— 评测复现危机
来源:inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md(首次以 eval 视角进入知识库)
arXiv:2605.23950 | https://arxiv.org/html/2605.23950v1
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心发现:2026 年主流 Agent 评测中,harness(执行框架)对 Agent 性能的影响可能超过模型本身;同一模型不同运行方差可超过不同模型间差距
- 关键数据:GPT-5.4、Kimi K2.6、GLM-5.1 在 H1/H2/H3 三种 harness 下排名完全不同(SWE-bench Verified 100 题)
- 工程启示:要求所有 Agent 论文披露 harness 配置;建议采用"open harness"标准;行业需要类似 MLCommons 的 Agent 评测基准规范
- 方法论价值:首次以实证方式揭示 Agent 评测中 harness confounder 的严重性,推动评测方法论范式转变
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 Evaluation as Infrastructure 三层架构;R42 §2.4(HarnessOpt-Bench / RecHarness)——2605.23950 是整个 harness 评测三元组的问题发现层,为 Harness-Bench 和 LoopsBench 提供问题动机
- 缺失:Harness confounder 问题条目;模型排名可翻转现象的条目;评测复现危机的条目
- 建议归入:§2.4 Judge & Harness 工程新增——Harness Confounder 问题(2605.23950);§3.1 评测可靠性新增——Agent 评测复现危机(harness 披露标准缺失)
arXiv 列表
- 2605.23950(🆕 待建卡)
条目四:Evo-Bench(arXiv:2608.09096)— 首个评测 LLM "Harness 演进能力"的 Benchmark
来源:inbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md(HF 新候选 8/11 #4)
arXiv:2608.09096 | https://arxiv.org/abs/2608.09096
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:LLM 能否演进(改进)自己的 harness?这一能力缺乏系统评测——Evo-Bench 填补这一空白
- 关键设计:隔离 base model 影响(只测 harness 演进能力,不被模型自身能力混淆);解决任务过拟合问题;解决长程迭代评估难题
- 与 HarnessOpt-Bench 的关系:HarnessOpt-Bench 测"LLM 能否优化给定 harness",Evo-Bench 测"LLM 能否演进自己的 harness"——演进(evolve)比优化(optimize)更进一层,涉及自我修改
- Ouroboros 关联(同一 radar):Ouroboros(2608.08311)实现 self-evolving coding agent,Evo-Bench 为其提供评测闭环
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 §2.4(LLM-as-Harness-Optimizer / HarnessOpt-Bench)——Evo-Bench 是 LLM-as-Harness-Optimizer 的进化版:从"优化给定 harness"到"演进自己的 harness"
- 缺失:Harness 演进能力评测专项;self-improving harness 的评测方法论
- 建议归入:§2.4 Judge & Harness 工程新增——Evo-Bench harness 演进能力评测;§2.7 评测对象横向分化新增——Self-improving Harness 评测
arXiv 列表
- 2608.09096(🆕 待建卡)
条目五:MatrAIx(arXiv:2608.04205)— 群体规模模拟用户评测基础设施
来源:paper_cards 866(今天建卡);HF Daily 8/11 #14 14▲(无 eval 主分类但 benchmark 形态确认)
arXiv:2608.04205 | https://arxiv.org/abs/2608.04205
卡状态:✅ paper_cards 866 已建(evaluation + benchmark);evaluation.md 未覆盖
要点
- 核心贡献:提出群体规模模拟用户评测基础设施——离线评测难以捕捉人类多样性及交互行为,MatrAIx 用 83 亿人格记录(1290 维分类维度)构建异质用户模拟
- 三大核心组件:Persona 8B(83 亿人格记录)、dependency graph 采样(保留相关属性)、真实用户行为派生
- 评测价值:可扩展的离线人类多样性评测;弥补离线评测缺失交互行为的缺陷;heterogeneous users 的系统性覆盖
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 §2.2 Benchmark 设计(场景专化);R42 §2.3 人类评估替代方案——MatrAIx 填补"模拟异质用户"评测基础设施的空白,是人类评估可扩展化的系统性方案
- 缺失:群体用户模拟评测基础设施;heterogeneous user simulation benchmark
- 建议归入:§2.3 人类评估替代方案新增——MatrAIx 群体规模模拟用户评测;§9.2 评测 harness/benchmark 套件新增 MatrAIx 条目
arXiv 列表
- 2608.04205(🆕 paper_cards 已建,eval.md 待补)
条目六:CLIP-CC-Bench(arXiv:2608.04302)— 视频段落级描述评测基准
来源:paper_cards 865(今天建卡);HF Daily 近期在榜
arXiv:2608.04302 | https://arxiv.org/abs/2608.04302
TLDR 来源:paper_cards 865 条目摘要
卡状态:✅ paper_cards 865 已建(benchmark + evaluation 副分类);evaluation.md 未覆盖
要点
- 评测问题:现有 VLM 视频评测聚焦短视频片段和单句指标,缺乏长篇段落级视频描述的系统评测
- 方案:CLIP-CC-Bench,5 小时电影内容分 90 秒片段,每段配专家撰写的段落风格参考答案
- 评估方法:5 个 SOTA LLM-based embedding 模型集成(增加可靠性/缓解单模型偏差)+ 两种互补方法论
- 视频全局感知评测定位:与 R42 GST-Bench(视频空间感知)形成互补——GST-Bench 测空间感知,CLIP-CC-Bench 测段落级描述一致性
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 §2.2(新增 GST-Bench 视频全局空间感知);R42 §2.5 VLM 评测——CLIP-CC-Bench 与 GST-Bench 同属视频 VLM 评测族,但维度不同(段落描述 vs 空间感知)
- 缺失:视频描述一致性评测;长视频多模态 benchmark
- 建议归入:§2.2 Benchmark 设计新增——CLIP-CC-Bench 视频段落描述评测(与 GST-Bench 并列作为视频 VLM 评测二元组)
arXiv 列表
- 2608.04302(🆕 paper_cards 已建,eval.md 待补)
条目七:EMMA — Enhanced MultiModal reAsoning Benchmark(arXiv:2501.05444)
来源:inbox/flyp/2026-08-10-2250-EMMA-agent-eval-light-read.md(flyp 批判性精读)
arXiv:2501.05444 | https://arxiv.org/abs/2501.05444
卡状态:❌ paper_cards 尚未建卡;ICLR 2026 投稿(在审);evaluation.md 未覆盖
要点
- 核心贡献:提出"有机多模态推理"(任务无法通过单一模态独立推理,必须跨模态耦合),覆盖 math/physics/chemistry/coding 四学科
- 评测设计:两阶段筛选(单模态可解性过滤 + 人工视觉依赖强度复核);确保 benchmark 题目真正需要多模态
- 关键结论:9 个 SOTA MLLM 在 EMMA 上显著局限;CoT、test-time compute scaling 仅带来边际增益,远低于人类专家
- 方法论价值:首次将"显式对抗高级技巧"作为评测设计的一部分——明确把 CoT 和 test-time compute scaling 列为评测对象而非默认技巧
- 与现有 benchmark 的差异:MMMU/MathVista 等默认 CoT 有效,EMMA 质疑这一假设
与 knowledge/evaluation.md R42 现有脉络的关系
- 现有脉络:R42 §2.5 VLM 评测(OSReward / DataSpace);R42 §2.2(多模态推理 benchmark)——EMMA 的"视觉必要性筛选"方法论可补入 MLLM 多模态日常安全(§2.x)的评测设计思路
- 缺失:有机多模态推理 benchmark;视觉必要性两阶段筛选流程
- 建议归入:§2.5 VLM 评测新增——EMMA 有机多模态推理基准;§2.2 Benchmark 设计方法论新增——视觉必要性两阶段筛选流程
arXiv 列表
- 2501.05444(🆕 待建卡)
综合:矛盾与待核实清单
- Harness-Bench(2605.27922):6 维评测框架的具体评测协议和基准数据集规模待读原文确认;与 AgentBench 的具体边界需厘清
- LoopsBench(2608.00267):3 个新维度(State continuity / Regression pressure / Execution efficiency)的量化方法;arXiv ID 2608.00267 较新,是否为正式发表版本待确认
- 2605.23950 Stop Comparing:具体实验细节(100 题 vs 更多题、是否覆盖其他框架);"open harness"标准的具体规范内容
- Evo-Bench(2608.09096):HF 新候选,paper_cards 未建卡;具体设计(如何隔离 base model、任务过拟合的解决方式)待读原文
- MatrAIx(2608.04205):paper_cards 已建但 eval.md 未覆盖;83 亿人格的具体采样方法和对评测偏差的影响待核实
- CLIP-CC-Bench(2608.04302):paper_cards 已建但 eval.md 未覆盖;5 小时电影内容的版权和评测可复现性
- EMMA(2501.05444):ICLR 2026 在审状态,论文结论的稳定性需等审稿结果;9 个 MLLM 名单和分数表需补查
本轮检查过的来源(无新增时列出)
| 来源 | 内容 |
|---|---|
| /shared/research-kb/organized/queue/work-queue.md | 选题榜含 StreamArena 2608.05703;无 evaluation 直接增量 |
| inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md | ** Harness 披露/测量/Loop 评测三元组**(2605.23950 / 2605.27922 / 2608.00267)首次以 eval 视角进入 |
| inbox/jay/2026-08-11T1515-jay-agent-fault-taxonomy-mcp-production.md | Agent fault taxonomy(375 真实 GitHub issues);5 类故障邻接 eval harness 问题 |
| inbox/flyp/2026-08-10-2250-EMMA-agent-eval-light-read.md | EMMA(2501.05444)批判性精读;多模态推理 benchmark |
| inbox/tom/2026-08-11T1440-agent-rag-longcontext-radar.md | Evo-Bench(2608.09096) 新候选;Ouroboros 关联 |
| inbox/tom/2026-08-11-0900-hf-daily-2026-08-11.md | HF Daily 8/11(15 篇);eval 主分类 0 件;MatrAIx #14 14▲(benchmark 形态) |
| inbox/tom/2026-08-10-evaluation-e1prep.md | R42 基线(GST-Bench / 2608.06312 / Evaluation as Infrastructure 三层架构) |
| inbox/spark/2026-08-11-agent-e1prep.md | 无 eval 直接增量 |
| inbox/stephen/2026-08-11-1000-rss-raschka.md | 无 eval 专项 |
| paper_cards/866(MatrAIx) | 已建卡;evaluation + benchmark 形态;eval.md 未覆盖 |
| paper_cards/865(CLIP-CC-Bench) | 已建卡;benchmark + evaluation 副分类;eval.md 未覆盖 |
| paper_cards/861(DCAS) | benchmark 形态;deepfake detection eval 邻接 |
| paper_cards/867(2607-27945) | evaluation 分类标误(TLDR 中 "circuit evaluations" 为量子电路计算语义,非评测研究) |
| knowledge/evaluation.md R42 | 确认现有脉络,本轮增量与之对照 |
结论
本轮(E1-R43,2026-08-11)eval 主题迎来方法论级别的增量合流: - Harness 披露/测量/Loop 评测三元组(2605.23950 + 2605.27922 + 2608.00267)首次以 eval 视角进入知识库,构成 R42 Evaluation as Infrastructure 三层架构的实证基础——这是 R42 以来的最重要 eval 方法论更新 - Evo-Bench(2608.09096) 填补"harness 演进能力"评测空白,与 HarnessOpt-Bench 形成"优化→演进"能力阶梯 - MatrAIx(2608.04205)和 CLIP-CC-Bench(2608.04302) 分别补全"群体用户模拟评测"和"视频段落描述评测"的 benchmark 形态光谱(paper_cards 已建,eval.md 待补) - EMMA(2501.05444) 精读确认"视觉必要性筛选"的多模态评测设计方法论价值
涉及 arXiv 号:2605.23950(🆕 待建卡)、2605.27922(🆕 待建卡)、2608.00267(🆕 待建卡)、2608.09096(🆕 待建卡)、2608.04205(✅ paper_cards 已建/eval.md 待补)、2608.04302(✅ paper_cards 已建/eval.md 待补)、2501.05444(🆕 待建卡);已在基线续立:2608.05747(GST-Bench)、2608.06301(HarnessOpt-Bench)、2607.28609(OSReward)、2608.03451(DataSpace)
建议后续动作: - [ ] 精读 Harness-Bench(2605.27922)和 LoopsBench(2608.00267)原文,确认量化评测协议 - [ ] 核实 Evo-Bench(2608.09096)具体设计,paper_cards 建卡 - [ ] 补全 EMMA(2501.05444)9 个 MLLM 名单和分数表,paper_cards 建卡 - [ ] 更新 evaluation.md:MatrAIx 和 CLIP-CC-Bench 入 §2.2/§9.2;Harness 三元组入 §2.4
Tom · 2026-08-11 15:40 CST · E1 预消化简报 · 7 条确认增量(4 评估专项新卡 + 3 evaluation 维度条目)+ 7 件待核实 · 涉及 arXiv:2605.23950(🆕 待建卡)/ 2605.27922(🆕 待建卡)/ 2608.00267(🆕 待建卡)/ 2608.09096(🆕 待建卡)/ 2608.04205(✅ 已建卡/eval 待补)/ 2608.04302(✅ 已建卡/eval 待补)/ 2501.05444(🆕 待建卡)