evaluation · E1 预消化简报(2026-08-08)
信源检查记录
本次覆盖: - work-queue.md ✓ - inbox/jay (8-07~8-08): llm-production-incident-engineering / cool-papers RSS / briefing / ai-trending-weekly ✓ - inbox/flyp (8-07~8-08): HORIZON critical-read / multimodal e1prep / coding-agents e1prep / risk e1prep ✓ - inbox/spark (8-07~8-08): agent e1prep / llm-infra e1prep ✓ - inbox/stephen (8-07~8-08): ai-industry e1prep / llm-application e1prep / coordination checks ✓ - inbox/tom (8-07~8-08): RSS feeds ✓ - paper_cards 735-820 净增 86 张(8-05~8-08窗口)中的 evaluation 相关条目 ✓ - knowledge/evaluation.md 现有脉络(R39) ✓
增量摘要
本轮(E1-R40,窗口 2026-08-07~08-08)发现 7 条显著增量,其中 3 条为 evaluation 主分类新卡,4 条为跨主题但 evaluation 维度重要。无新范式级跃迁;主体脉络为 R39「五件合流 + §2.6 纵深三阶」的工业落地延伸与 benchmark 评测质量方法论新支。
条目一:OSReward — CUA 轨迹 VLM Judge 可靠性系统性研究
来源:paper_cards/802-2607.28609 (主分类 evaluation 副 agent,候选期 2026-08-07~08-08,未入 R39)
arXiv:2607.28609 | https://arxiv.org/abs/2607.28609
要点
- 核心问题:计算机使用 Agent(CUA)日益依赖 VLM 评判 CUA 轨迹质量,但 VLM judge 是否足够可靠长期未被系统检验
- 提出 OSReward:首个跨平台 CUA reward model 标准化评估框架
- CUA 轨迹三要素:action(动作)+ state(状态)+ reasoning(推理过程)
- 评判对象:CUA 是否完成任务指令 → 涉及评估、数据整理、RL 三类用途
- 关键质疑:人工编写的验证器无法规模化,人工标注成本极高,于是转向 VLM judge,但根本问题"VLM 评判者是否足够可靠"被长期忽视
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R39 已在 §2.4 覆盖 Judge 校准二十二轨(R39+1:经济价值驱动+金融 deep research+多语言难度校准+自主 Agent 长视野+技能原生五件合流);§9.3 覆盖评测方法学 toolkit
- 缺失:VLM judge 对 CUA 轨迹的可靠性问题在现有体系中无对应条目;CUA/Computer-Using Agent 是 2026 年 Agent 落地主场景,VLM judge reliability 是该场景评测的核心未解问题
- 建议归入:§2.4(Judge & Harness 工程)新增一轨——CUA 轨迹 VLM Judge 可靠性;§9.3 评测 toolkit 新增 OSReward 条目
arXiv 列表
- 2607.28609
条目二:Benchmarking the Benchmarks — 对话 Agent 基准评测的质量审计
来源:Jay inbox/2026-08-08-1001-rss-cool-papers.md (信源 Cool Papers cs.CL)
arXiv:2608.06329 | https://papers.cool/arxiv/2608.06329
要点
- 核心问题:任务导向对话 Agent 通常使用人工构建或自动生成的 benchmark 进行评估,但 benchmark 本身的质量很少被审视
- 低质量 benchmark 风险:benchmark 本身可能存在不一致、ground truth 错误、任务描述模糊等问题,导致评测结果不可信
- 这是 meta-evaluation——对评测基准的评测,填补了"benchmark 质量审计"这一方法论空白
- 来源渠道可信:cs.CL Cool Papers,是高质量的 arXiv cs.CL 过滤频道
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R39 覆盖了评测方法学二十九轴,但对 benchmark 本身质量审计(元评测)无专门章节
- 缺失:benchmark 质量审计方法论;低质量 benchmark 对评测结果的误导性
- 建议归入:§1.15 评测方法学二十九轴新增一轴——benchmark 质量审计/元评测方法论;§9.2 评测 harness/benchmark 套件新增 Benchmarking the Benchmarks 条目
矛盾/待核实
- 该 paper 的具体实验规模、覆盖 benchmark 数量、审计维度分类细节需读原文核验;目前仅知梗概
arXiv 列表
- 2608.06329
条目三:LongHorizon-Harness — 长程 Agent 任务状态外部化管理(已入 R37,确认续立)
来源:paper_cards/713-2608.01964 (R37 已入库,副分类 evaluation)
arXiv:2608.01964 | https://arxiv.org/abs/2608.01964
另见:flyp inbox/2026-08-08 HORIZON critical-read
要点(本轮新增上下文)
- 已有结论(R37):LongHorizon-Harness 将任务状态显式置于执行之外,仅基于事实更新,避免错误自评估传播
- 本轮 flyp critical-read 新增:HORIZON 基准(arXiv:2604.11978)提供互补视角——长程失败不是成功率线性下降,而是失败结构迁移:horizon 拉长后 planning/memory 类失败(子规划错误、灾难性遗忘)变成主导,而非工具调用错误
- HORIZON 失败归因七维:observation / planning / action / memory / reflection / verification / termination
- HORIZON 方法论:FMEA( Failure Mode and Effects Analysis)思想 + LLM-as-a-Judge 分阶段归因;inter-annotator κ=0.61,human-judge κ=0.84
- 关键发现与 LongHorizon-Harness 互补:LongHorizon-Harness 解决"任务状态外部化",HORIZON 揭示"失败类型随 horizon 迁移的规律"——两者共同指向长程 Agent 评测需同时管理状态和监测失败类型迁移
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R37 已建立 LongHorizon-Harness;§2.6 失败模式分析已有独立章节(一阶 4 件);R39 §2.6 纵深三阶含 OneDayAgent(长视野 Harness 组件因果识别)
- 本轮新增:HORIZON 作为长程失败归因方法论补充;长程失败"结构迁移"规律可归入 §2.6 失败模式分析的 horizon-specific failure mode 维度
- 建议归入:§2.6 失败模式分析 §2.6.x 新增——长程失败结构迁移规律(HORIZON arXiv:2604.11978);§9.2 评测 harness 套件新增 HORIZON 条目
arXiv 列表
- 2608.01964(LongHorizon-Harness,已有)
- 2604.11978(HORIZON,新增)
条目四:HORIZON — 长程任务 mirage 现象诊断(方法论增量)
来源:flyp inbox/2026-08-08-0950-HORIZON-long-horizon-agent-diagnosis-critical-read.md
arXiv:2604.11978 | https://arxiv.org/abs/2604.11978
要点
- 核心论点:长程任务表现存在 mirage 假象——horizon 初期看起来进展顺利,但随步数增加失败结构系统性迁移,而非线性退化
- breadth vs depth extension:HORIZON 区分两种 horizon 扩展方式——Web/Embodied 用 breadth(独立子任务并行组合),OS/Database 用 depth(插入不可跳过的中间状态)
- 跨域 horizon 不可比:Web s=4 是极限,Embodied s=5 就崩溃;OS/Database 可到 s=8
- GPT-5 vs Claude-4 跨域对比:覆盖 Web/OS/Database/Embodied 四域,3100+ 条轨迹
- 警示:self-reporting bias 风险——LLM-as-a-Judge 评判同源模型时可能偏袒;开源模型缺席;底座局限性(环境简化)会带入 HORIZON
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R39 §2.6 已有一阶(R37 Model or Harness?/To Add Is Machine/LongHorizon-Harness/RecHarness)、二阶(ChronoLens/AntiSkillBench/FinIndices/PAST-Bench)、三阶(GDPevo/FinanceHarness/NOLLI/OneDayAgent/Skill-Native LLM)
- 本轮增量:HORIZON 提供长程失败"结构迁移"规律,属 长程任务可靠性科学范畴,与 R36 八件中 LongDS-Bench 邻接
- 建议归入:§2.6 新增 §2.6.x——horizon 扩展类型与失败结构迁移;§9.2 评测 harness 套件新增 HORIZON 条目
矛盾/待核实
- 3100+ 轨迹跨 4 域 × 多模型 × 多 s 摊薄后统计显著性需原文核验
- LLM-as-a-Judge 自偏置按模型分解的分析尚未公开
- GitHub 代码仓库未在论文中直接给出,复现路径需补查
arXiv 列表
- 2604.11978
条目五:DataSpace — 异构工作空间可验证分析数据 Agent 基准
来源:paper_cards/808-2608.03451 (主分类 evaluation 副 agent,候选期 2026-08-07~08-08,未入 R39)
arXiv:2608.03451 | https://arxiv.org/abs/2608.03451
要点
- 评测对象:数据 Agent 跨异构工作空间(数据库/结构化文件/长文档/多媒体)的自然语言分析能力
- 可验证表格结果:Agent 生成可验证的表格输出,是可验证性评测的实例化
- 规模:410 个跨语言任务 + 7,439 个 artifact
- 现有基准缺口:大多孤立评估结构化查询、检索或开放式分析,未统一异构证据发现、完整表格输出与确定性评估
- 评测维度:异构证据发现 + 完整表格输出 + 确定性评估,三维统一
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R39 覆盖多 Agent 工作流评测、数据分析长程 state evolution 等维度,但无专门的"异构工作空间数据 Agent 评测"条目
- 缺失:DataSpace 与 R36 ExtractBench、Evaluation-Verification Reward 同属可验证性评测家族,但 DataSpace 聚焦异构多模态工作流,是新场景
- 建议归入:§2.2 Benchmark 设计新增——异构工作空间数据 Agent 评测;§9.2 评测 harness/benchmark 套件新增 DataSpace 条目
arXiv 列表
- 2608.03451
条目六:MameLoshnLM / Oytser — 意第绪语语言模型评测基准
来源:paper_cards/805-2608.05850 (主分类 evaluation 形态 benchmark,候选期 2026-08-07~08-08,未入 R39)
arXiv:2608.05850 | https://arxiv.org/abs/2608.05850
要点
- 首个意第绪语开源 8B LLM + 配套评测基准
- 评测挑战:意第绪语数字化资源稀缺,现有 multilingual 基准对该语言代理质量差(噪声/机翻/误分类)
- 解决方案:Oytser 高质量意第绪语预训练语料库;MameLoshnLM 评测基准
- 垂直领域评测:这是语言模型垂直领域评测的实例,填补了意第绪语 NLP 的评测空白
- 与现有评测体系关系:属于 R36 场景专化评测方法学的语言专项延伸,但语言方向与 R36 所列企业文档/视觉/跨会话场景不同
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R36 场景专化评测包含企业文档抽取、多参考视觉一致性、跨会话个性化消歧等
- 本轮新增:意第绪语专项语言评测;体现"语言专项 benchmark"作为垂直评测的一类
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——语言专项评测(MameLoshnLM 意第绪语);§9.2 评测 harness/benchmark 套件新增 MameLoshnLM 条目
arXiv 列表
- 2608.05850
条目七:APEX-Agents 2026 Benchmark + Gartner 预测 — Agent 首次尝试完成率仅 24%
来源:Jay inbox/2026-08-08-llm-production-incident-engineering.md (FutureAGI/Paolo Perrone 引用)
原始引用:APEX-Agents 2026 benchmark;Gartner 预测(报告编号待核验)
要点
- APEX-Agents 2026 Benchmark:即使最佳模型在真实任务中首次尝试完成率仅 24%——量化了当前 Agent 系统的根本性可靠性不足
- Gartner 预测(2027 年底):>40% agentic AI 项目将被取消,原因:成本上升、商业价值不清晰、风险控制不足
- n8n v2.6.3 JSON Schema 故障案例:跨供应商 schema 不兼容导致企业授权 workflow 全部中断,单次事故成本 $47K
- 核心判断(Paolo Perrone):真正问题不在模型质量,而在 context management、connector reliability、permission boundaries、observability 的系统性投入不足
与 knowledge/evaluation.md 现有脉络的关系
- 现有脉络:R39 §2.6 失败模式分析已建立 Model or Harness?(失败归因分类)、RecHarness(Harness 工程化)、LongHorizon-Harness(任务状态管理)、To Add Is Machine(代码编辑行为);R37 五件含 fail-plausible 机制但侧重叙事性失败
- 本轮新增:APEX 24% 是当前最具公信力的真实任务 Agent 首次尝试率量化数据;Gartner 40% 取消率是工业级预测;n8n 事故是跨供应商 schema 不兼容的具象案例
- 与现有脉络的关系:与 R37 §2.6 一阶四件互补——一阶四件侧重"评测工具/方法论"(Model or Harness?/RecHarness/LongHorizon-Harness/To Add Is Machine),APEX + Gartner 补充"工业级量化失败率"维度
- 建议归入:§2.6 失败模式分析 §2.6.x 新增——工业级 Agent 首次尝试成功率量化(APEX 24%);§8 趋势预判增补——Gartner 40% agentic 项目取消率作为 2027 预测佐证;§7.1 共识新增一条
矛盾/待核实
- APEX-Agents 2026 benchmark 原文尚未精读,24% 数据来自第三方引用
- Gartner 预测原始报告编号、日期、具体口径待核验
- n8n $47K 事故数字来源和统计口径待核实
arXiv 列表
- APEX-Agents benchmark arXiv ID 待补查(当前仅知被引用,原文未入库)
综合:无显著矛盾;以下待核实
- APEX-Agents 2026 benchmark 原文 arXiv ID 和全文(目前仅知被引用,24% 数据需溯源)
- Gartner 2027 40% 取消率原始报告编号(预测性质,需标注置信度)
- HORIZON(2604.11978)GitHub 仓库链接和统计显著性附录
- Benchmarking the Benchmarks(2608.06329)具体审计维度和方法
- OSReward(2607.28609)对 VLM judge 可靠性的具体量化结论
值得警惕的矛盾或存疑说法
- APEX 24% 完成率:来源为 Paolo Perrone(工程记者)引用 APEX-Agents benchmark,非一手论文;需找原始 benchmark 确认口径(是否涵盖所有任务类型、是否限定模型等)
- Gartner 40% 取消率:机构预测,非实证数据;适合作为趋势佐证,不宜作为事实引用
- n8n $47K 事故:来源为同一篇文章,未独立核实;单案例数字代表性有限
- HORIZON self-reporting bias:作者给出了 human-judge 一致性(κ=0.84),但未公开按模型分解的偏置分析,VLM judge 偏袒同源模型的风险未充分评估
本轮检查过的来源(无新增时列出)
| 来源 | 内容 |
|---|---|
| /shared/research-kb/organized/queue/work-queue.md | Top 15 候选,无 evaluation 直接增量 |
| inbox/jay/2026-08-08-llm-production-incident-engineering.md | APEX/Gartner/FutureAGI/五类静默故障 |
| inbox/jay/2026-08-08-1001-rss-cool-papers.md | Benchmarking the Benchmarks(2608.06329) |
| inbox/jay/2026-08-08-briefing.md | Agent Skills Survey(2602.12430/2601.01743)/SoK Agentic RAG |
| inbox/jay/2026-08-08-ai-trending-weekly.md | The AI Agents Stack 2026(Context-Bench/Recovery-Bench/Terminal-Bench) |
| inbox/flyp/2026-08-08-0950-HORIZON-critical-read.md | HORIZON(2604.11978)+CriticTool(2506.13977) |
| inbox/flyp/2026-08-07-multimodal-e1prep.md | 无 evaluation 直接增量 |
| inbox/spark/2026-08-07-agent-e1prep.md | 无 evaluation 直接增量 |
| inbox/spark/2026-08-08-agent-e1prep.md | 无 evaluation 直接增量 |
| inbox/stephen/2026-08-07-ai-industry-e1prep.md | 无 evaluation 直接增量 |
| paper_cards/713(LongHorizon-Harness) | R37 已入库,本轮 flyp critical-read 补充 HORIZON 上下文 |
| paper_cards/726(Model or Harness?) | R37 已入库 |
| paper_cards/735(PAST-Bench) | R37 已入库 |
| paper_cards/778(GDPevo) | R39 已入库 |
| paper_cards/794(FinanceHarness) | R39 已入库 |
| paper_cards/802(OSReward) | 新增,主分类 evaluation |
| paper_cards/805(MameLoshnLM) | 新增,主分类 evaluation |
| paper_cards/808(DataSpace) | 新增,主分类 evaluation |
| paper_cards/818(Beyond Top-K) | 主分类 rag 副 agent,邻接 evaluation |
| paper_cards/820(Activity Frames) | 主分类 agent,邻接 evaluation(Agent Memory 评测维度) |
| paper_cards/795(EnvACE) | 主分类 agent,邻接 evaluation |
| paper_cards/796(CalibForge) | 主分类 agent,邻接 evaluation |
| knowledge/evaluation.md(R39) | 确认现有脉络,本轮增量与之对照 |
结论
本轮(E1-R40,2026-08-08)无新范式级跃迁(R39 五件合流 + §2.6 纵深三阶仍为最新脉络)。增量集中在: - CUA VLM Judge 可靠性(OSReward):填补 CUA 场景评测空白 - Benchmark 质量审计(Benchmarking the Benchmarks):meta-evaluation 方法论新轴 - 长程失败结构迁移(HORIZON):与 LongHorizon-Harness 互补 - 异构数据 Agent 可验证评测(DataSpace):垂直场景新支 - 语言专项评测基准(MameLoshnLM):垂直语言评测新增 - 工业级 Agent 成功率量化(APEX 24%):R39 §2.6 工业实证补充
建议后续动作: - [ ] 精读 OSReward(2607.28609)原文,补充 VLM judge 可靠性具体量化结论 - [ ] 溯源 APEX-Agents benchmark 原文,确认 24% 口径 - [ ] 补查 HORIZON(2604.11978)GitHub 仓库和统计显著性附录 - [ ] 精读 Benchmarking the Benchmarks(2608.06329),提取 benchmark 质量审计方法论