evaluation · E1 预消化简报(2026-08-08)

信源检查记录

本次覆盖: - work-queue.md ✓ - inbox/jay (8-07~8-08): llm-production-incident-engineering / cool-papers RSS / briefing / ai-trending-weekly ✓ - inbox/flyp (8-07~8-08): HORIZON critical-read / multimodal e1prep / coding-agents e1prep / risk e1prep ✓ - inbox/spark (8-07~8-08): agent e1prep / llm-infra e1prep ✓ - inbox/stephen (8-07~8-08): ai-industry e1prep / llm-application e1prep / coordination checks ✓ - inbox/tom (8-07~8-08): RSS feeds ✓ - paper_cards 735-820 净增 86 张(8-05~8-08窗口)中的 evaluation 相关条目 ✓ - knowledge/evaluation.md 现有脉络(R39) ✓


增量摘要

本轮(E1-R40,窗口 2026-08-07~08-08)发现 7 条显著增量,其中 3 条为 evaluation 主分类新卡,4 条为跨主题但 evaluation 维度重要。无新范式级跃迁;主体脉络为 R39「五件合流 + §2.6 纵深三阶」的工业落地延伸与 benchmark 评测质量方法论新支。


条目一:OSReward — CUA 轨迹 VLM Judge 可靠性系统性研究

来源:paper_cards/802-2607.28609 (主分类 evaluation 副 agent,候选期 2026-08-07~08-08,未入 R39)
arXiv:2607.28609 | https://arxiv.org/abs/2607.28609

要点

  • 核心问题:计算机使用 Agent(CUA)日益依赖 VLM 评判 CUA 轨迹质量,但 VLM judge 是否足够可靠长期未被系统检验
  • 提出 OSReward:首个跨平台 CUA reward model 标准化评估框架
  • CUA 轨迹三要素:action(动作)+ state(状态)+ reasoning(推理过程)
  • 评判对象:CUA 是否完成任务指令 → 涉及评估、数据整理、RL 三类用途
  • 关键质疑:人工编写的验证器无法规模化,人工标注成本极高,于是转向 VLM judge,但根本问题"VLM 评判者是否足够可靠"被长期忽视

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R39 已在 §2.4 覆盖 Judge 校准二十二轨(R39+1:经济价值驱动+金融 deep research+多语言难度校准+自主 Agent 长视野+技能原生五件合流);§9.3 覆盖评测方法学 toolkit
  • 缺失:VLM judge 对 CUA 轨迹的可靠性问题在现有体系中无对应条目;CUA/Computer-Using Agent 是 2026 年 Agent 落地主场景,VLM judge reliability 是该场景评测的核心未解问题
  • 建议归入:§2.4(Judge & Harness 工程)新增一轨——CUA 轨迹 VLM Judge 可靠性;§9.3 评测 toolkit 新增 OSReward 条目

arXiv 列表

  • 2607.28609

条目二:Benchmarking the Benchmarks — 对话 Agent 基准评测的质量审计

来源:Jay inbox/2026-08-08-1001-rss-cool-papers.md (信源 Cool Papers cs.CL)
arXiv:2608.06329 | https://papers.cool/arxiv/2608.06329

要点

  • 核心问题:任务导向对话 Agent 通常使用人工构建或自动生成的 benchmark 进行评估,但 benchmark 本身的质量很少被审视
  • 低质量 benchmark 风险:benchmark 本身可能存在不一致、ground truth 错误、任务描述模糊等问题,导致评测结果不可信
  • 这是 meta-evaluation——对评测基准的评测,填补了"benchmark 质量审计"这一方法论空白
  • 来源渠道可信:cs.CL Cool Papers,是高质量的 arXiv cs.CL 过滤频道

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R39 覆盖了评测方法学二十九轴,但对 benchmark 本身质量审计(元评测)无专门章节
  • 缺失:benchmark 质量审计方法论;低质量 benchmark 对评测结果的误导性
  • 建议归入:§1.15 评测方法学二十九轴新增一轴——benchmark 质量审计/元评测方法论;§9.2 评测 harness/benchmark 套件新增 Benchmarking the Benchmarks 条目

矛盾/待核实

  • 该 paper 的具体实验规模、覆盖 benchmark 数量、审计维度分类细节需读原文核验;目前仅知梗概

arXiv 列表

  • 2608.06329

条目三:LongHorizon-Harness — 长程 Agent 任务状态外部化管理(已入 R37,确认续立)

来源:paper_cards/713-2608.01964 (R37 已入库,副分类 evaluation)
arXiv:2608.01964 | https://arxiv.org/abs/2608.01964
另见:flyp inbox/2026-08-08 HORIZON critical-read

要点(本轮新增上下文)

  • 已有结论(R37):LongHorizon-Harness 将任务状态显式置于执行之外,仅基于事实更新,避免错误自评估传播
  • 本轮 flyp critical-read 新增:HORIZON 基准(arXiv:2604.11978)提供互补视角——长程失败不是成功率线性下降,而是失败结构迁移:horizon 拉长后 planning/memory 类失败(子规划错误、灾难性遗忘)变成主导,而非工具调用错误
  • HORIZON 失败归因七维:observation / planning / action / memory / reflection / verification / termination
  • HORIZON 方法论:FMEA( Failure Mode and Effects Analysis)思想 + LLM-as-a-Judge 分阶段归因;inter-annotator κ=0.61,human-judge κ=0.84
  • 关键发现与 LongHorizon-Harness 互补:LongHorizon-Harness 解决"任务状态外部化",HORIZON 揭示"失败类型随 horizon 迁移的规律"——两者共同指向长程 Agent 评测需同时管理状态和监测失败类型迁移

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R37 已建立 LongHorizon-Harness;§2.6 失败模式分析已有独立章节(一阶 4 件);R39 §2.6 纵深三阶含 OneDayAgent(长视野 Harness 组件因果识别)
  • 本轮新增:HORIZON 作为长程失败归因方法论补充;长程失败"结构迁移"规律可归入 §2.6 失败模式分析的 horizon-specific failure mode 维度
  • 建议归入:§2.6 失败模式分析 §2.6.x 新增——长程失败结构迁移规律(HORIZON arXiv:2604.11978);§9.2 评测 harness 套件新增 HORIZON 条目

arXiv 列表

  • 2608.01964(LongHorizon-Harness,已有)
  • 2604.11978(HORIZON,新增)

条目四:HORIZON — 长程任务 mirage 现象诊断(方法论增量)

来源:flyp inbox/2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.md
arXiv:2604.11978 | https://arxiv.org/abs/2604.11978

要点

  • 核心论点:长程任务表现存在 mirage 假象——horizon 初期看起来进展顺利,但随步数增加失败结构系统性迁移,而非线性退化
  • breadth vs depth extension:HORIZON 区分两种 horizon 扩展方式——Web/Embodied 用 breadth(独立子任务并行组合),OS/Database 用 depth(插入不可跳过的中间状态)
  • 跨域 horizon 不可比:Web s=4 是极限,Embodied s=5 就崩溃;OS/Database 可到 s=8
  • GPT-5 vs Claude-4 跨域对比:覆盖 Web/OS/Database/Embodied 四域,3100+ 条轨迹
  • 警示:self-reporting bias 风险——LLM-as-a-Judge 评判同源模型时可能偏袒;开源模型缺席;底座局限性(环境简化)会带入 HORIZON

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R39 §2.6 已有一阶(R37 Model or Harness?/To Add Is Machine/LongHorizon-Harness/RecHarness)、二阶(ChronoLens/AntiSkillBench/FinIndices/PAST-Bench)、三阶(GDPevo/FinanceHarness/NOLLI/OneDayAgent/Skill-Native LLM)
  • 本轮增量:HORIZON 提供长程失败"结构迁移"规律,属 长程任务可靠性科学范畴,与 R36 八件中 LongDS-Bench 邻接
  • 建议归入:§2.6 新增 §2.6.x——horizon 扩展类型与失败结构迁移;§9.2 评测 harness 套件新增 HORIZON 条目

矛盾/待核实

  • 3100+ 轨迹跨 4 域 × 多模型 × 多 s 摊薄后统计显著性需原文核验
  • LLM-as-a-Judge 自偏置按模型分解的分析尚未公开
  • GitHub 代码仓库未在论文中直接给出,复现路径需补查

arXiv 列表

  • 2604.11978

条目五:DataSpace — 异构工作空间可验证分析数据 Agent 基准

来源:paper_cards/808-2608.03451 (主分类 evaluation 副 agent,候选期 2026-08-07~08-08,未入 R39)
arXiv:2608.03451 | https://arxiv.org/abs/2608.03451

要点

  • 评测对象:数据 Agent 跨异构工作空间(数据库/结构化文件/长文档/多媒体)的自然语言分析能力
  • 可验证表格结果:Agent 生成可验证的表格输出,是可验证性评测的实例化
  • 规模:410 个跨语言任务 + 7,439 个 artifact
  • 现有基准缺口:大多孤立评估结构化查询、检索或开放式分析,未统一异构证据发现、完整表格输出与确定性评估
  • 评测维度:异构证据发现 + 完整表格输出 + 确定性评估,三维统一

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R39 覆盖多 Agent 工作流评测、数据分析长程 state evolution 等维度,但无专门的"异构工作空间数据 Agent 评测"条目
  • 缺失:DataSpace 与 R36 ExtractBench、Evaluation-Verification Reward 同属可验证性评测家族,但 DataSpace 聚焦异构多模态工作流,是新场景
  • 建议归入:§2.2 Benchmark 设计新增——异构工作空间数据 Agent 评测;§9.2 评测 harness/benchmark 套件新增 DataSpace 条目

arXiv 列表

  • 2608.03451

条目六:MameLoshnLM / Oytser — 意第绪语语言模型评测基准

来源:paper_cards/805-2608.05850 (主分类 evaluation 形态 benchmark,候选期 2026-08-07~08-08,未入 R39)
arXiv:2608.05850 | https://arxiv.org/abs/2608.05850

要点

  • 首个意第绪语开源 8B LLM + 配套评测基准
  • 评测挑战:意第绪语数字化资源稀缺,现有 multilingual 基准对该语言代理质量差(噪声/机翻/误分类)
  • 解决方案:Oytser 高质量意第绪语预训练语料库;MameLoshnLM 评测基准
  • 垂直领域评测:这是语言模型垂直领域评测的实例,填补了意第绪语 NLP 的评测空白
  • 与现有评测体系关系:属于 R36 场景专化评测方法学的语言专项延伸,但语言方向与 R36 所列企业文档/视觉/跨会话场景不同

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R36 场景专化评测包含企业文档抽取、多参考视觉一致性、跨会话个性化消歧等
  • 本轮新增:意第绪语专项语言评测;体现"语言专项 benchmark"作为垂直评测的一类
  • 建议归入:§2.2 Benchmark 设计场景专化轴新增——语言专项评测(MameLoshnLM 意第绪语);§9.2 评测 harness/benchmark 套件新增 MameLoshnLM 条目

arXiv 列表

  • 2608.05850

条目七:APEX-Agents 2026 Benchmark + Gartner 预测 — Agent 首次尝试完成率仅 24%

来源:Jay inbox/2026-08-08-llm-production-incident-engineering.md (FutureAGI/Paolo Perrone 引用)
原始引用:APEX-Agents 2026 benchmark;Gartner 预测(报告编号待核验)

要点

  • APEX-Agents 2026 Benchmark:即使最佳模型在真实任务中首次尝试完成率仅 24%——量化了当前 Agent 系统的根本性可靠性不足
  • Gartner 预测(2027 年底):>40% agentic AI 项目将被取消,原因:成本上升、商业价值不清晰、风险控制不足
  • n8n v2.6.3 JSON Schema 故障案例:跨供应商 schema 不兼容导致企业授权 workflow 全部中断,单次事故成本 $47K
  • 核心判断(Paolo Perrone):真正问题不在模型质量,而在 context management、connector reliability、permission boundaries、observability 的系统性投入不足

与 knowledge/evaluation.md 现有脉络的关系

  • 现有脉络:R39 §2.6 失败模式分析已建立 Model or Harness?(失败归因分类)、RecHarness(Harness 工程化)、LongHorizon-Harness(任务状态管理)、To Add Is Machine(代码编辑行为);R37 五件含 fail-plausible 机制但侧重叙事性失败
  • 本轮新增:APEX 24% 是当前最具公信力的真实任务 Agent 首次尝试率量化数据;Gartner 40% 取消率是工业级预测;n8n 事故是跨供应商 schema 不兼容的具象案例
  • 与现有脉络的关系:与 R37 §2.6 一阶四件互补——一阶四件侧重"评测工具/方法论"(Model or Harness?/RecHarness/LongHorizon-Harness/To Add Is Machine),APEX + Gartner 补充"工业级量化失败率"维度
  • 建议归入:§2.6 失败模式分析 §2.6.x 新增——工业级 Agent 首次尝试成功率量化(APEX 24%);§8 趋势预判增补——Gartner 40% agentic 项目取消率作为 2027 预测佐证;§7.1 共识新增一条

矛盾/待核实

  • APEX-Agents 2026 benchmark 原文尚未精读,24% 数据来自第三方引用
  • Gartner 预测原始报告编号、日期、具体口径待核验
  • n8n $47K 事故数字来源和统计口径待核实

arXiv 列表

  • APEX-Agents benchmark arXiv ID 待补查(当前仅知被引用,原文未入库)

综合:无显著矛盾;以下待核实

  1. APEX-Agents 2026 benchmark 原文 arXiv ID 和全文(目前仅知被引用,24% 数据需溯源)
  2. Gartner 2027 40% 取消率原始报告编号(预测性质,需标注置信度)
  3. HORIZON(2604.11978)GitHub 仓库链接和统计显著性附录
  4. Benchmarking the Benchmarks(2608.06329)具体审计维度和方法
  5. OSReward(2607.28609)对 VLM judge 可靠性的具体量化结论

值得警惕的矛盾或存疑说法

  1. APEX 24% 完成率:来源为 Paolo Perrone(工程记者)引用 APEX-Agents benchmark,非一手论文;需找原始 benchmark 确认口径(是否涵盖所有任务类型、是否限定模型等)
  2. Gartner 40% 取消率:机构预测,非实证数据;适合作为趋势佐证,不宜作为事实引用
  3. n8n $47K 事故:来源为同一篇文章,未独立核实;单案例数字代表性有限
  4. HORIZON self-reporting bias:作者给出了 human-judge 一致性(κ=0.84),但未公开按模型分解的偏置分析,VLM judge 偏袒同源模型的风险未充分评估

本轮检查过的来源(无新增时列出)

来源 内容
/shared/research-kb/organized/queue/work-queue.md Top 15 候选,无 evaluation 直接增量
inbox/jay/2026-08-08-llm-production-incident-engineering.md APEX/Gartner/FutureAGI/五类静默故障
inbox/jay/2026-08-08-1001-rss-cool-papers.md Benchmarking the Benchmarks(2608.06329)
inbox/jay/2026-08-08-briefing.md Agent Skills Survey(2602.12430/2601.01743)/SoK Agentic RAG
inbox/jay/2026-08-08-ai-trending-weekly.md The AI Agents Stack 2026(Context-Bench/Recovery-Bench/Terminal-Bench)
inbox/flyp/2026-08-08-0950-HORIZON-critical-read.md HORIZON(2604.11978)+CriticTool(2506.13977)
inbox/flyp/2026-08-07-multimodal-e1prep.md 无 evaluation 直接增量
inbox/spark/2026-08-07-agent-e1prep.md 无 evaluation 直接增量
inbox/spark/2026-08-08-agent-e1prep.md 无 evaluation 直接增量
inbox/stephen/2026-08-07-ai-industry-e1prep.md 无 evaluation 直接增量
paper_cards/713(LongHorizon-Harness) R37 已入库,本轮 flyp critical-read 补充 HORIZON 上下文
paper_cards/726(Model or Harness?) R37 已入库
paper_cards/735(PAST-Bench) R37 已入库
paper_cards/778(GDPevo) R39 已入库
paper_cards/794(FinanceHarness) R39 已入库
paper_cards/802(OSReward) 新增,主分类 evaluation
paper_cards/805(MameLoshnLM) 新增,主分类 evaluation
paper_cards/808(DataSpace) 新增,主分类 evaluation
paper_cards/818(Beyond Top-K) 主分类 rag 副 agent,邻接 evaluation
paper_cards/820(Activity Frames) 主分类 agent,邻接 evaluation(Agent Memory 评测维度)
paper_cards/795(EnvACE) 主分类 agent,邻接 evaluation
paper_cards/796(CalibForge) 主分类 agent,邻接 evaluation
knowledge/evaluation.md(R39) 确认现有脉络,本轮增量与之对照

结论

本轮(E1-R40,2026-08-08)无新范式级跃迁(R39 五件合流 + §2.6 纵深三阶仍为最新脉络)。增量集中在: - CUA VLM Judge 可靠性(OSReward):填补 CUA 场景评测空白 - Benchmark 质量审计(Benchmarking the Benchmarks):meta-evaluation 方法论新轴 - 长程失败结构迁移(HORIZON):与 LongHorizon-Harness 互补 - 异构数据 Agent 可验证评测(DataSpace):垂直场景新支 - 语言专项评测基准(MameLoshnLM):垂直语言评测新增 - 工业级 Agent 成功率量化(APEX 24%):R39 §2.6 工业实证补充

建议后续动作: - [ ] 精读 OSReward(2607.28609)原文,补充 VLM judge 可靠性具体量化结论 - [ ] 溯源 APEX-Agents benchmark 原文,确认 24% 口径 - [ ] 补查 HORIZON(2604.11978)GitHub 仓库和统计显著性附录 - [ ] 精读 Benchmarking the Benchmarks(2608.06329),提取 benchmark 质量审计方法论