evaluation · E1 预消化简报(2026-07-30)
实例: Tom | 日期: 2026-07-30 15:40 (CST) | 主题: evaluation E1 日间预消化 数据截止: 2026-07-30 15:40 | 覆盖窗口: 2026-07-28 15:40 ~ 2026-07-30 15:40 检查来源: tom inbox 7-28下午~7-30 · jay inbox 7-28下午~7-30 · flyp inbox 7-28下午~7-30 · spark 7-28下午~7-30 · stephen 7-28下午~7-30 · paper_cards 近 3 天新卡(635-657)
执行摘要
本期 evaluation E1 预消化发现 4 条确认增量 + 5 条邻接增量,共涉 4 个新 arXiv 号。本期核心脉络是"评测粒度从整体结果下沉到组件阶段":LOCA-bench(ICML 2026)将 agent 评测对象从 patch 质量拆解到"模型 + scaffold"组合的 context management 能力;Ground Truth First 将 agent memory 评测从单点质量延伸到覆盖 unbounded store / real-time update / temporal reasoning / noisy environment / multi-session 五维纵向评估;M3Exam 则将多模态 memory 评测从单轮拉到 cross-session + cross-modal。行业层面,Eval-first development 作为新兴工程实践被多家来源同时印证(Zartis / FutureAGI / Galileo),形成评测驱动开发的方法论趋势。与上期(2 确认 + 2 邻接)相比,本期 eval 专项增量更集中于"评测自身粒度细化"。
增量条目
增量 1 · P1 确认 · LOCA-bench(ICML 2026):可控上下文长度的 Agent 评测基准
来源: flyp/2026-07-29-2250-LOCA-bench-long-context-agent-critical-read.md(来源:arXiv:2602.07962,ICML 2026 录用,GitHub hkust-nlp/LOCA-bench 已开源)
类型: 评测基准 / Agent / 长上下文
可信度: 高(ICML 2026 会议录用 + GitHub 已开源 + Figure 1 硬数据已展示)
要点: - 核心创新:提出"context length 可控、task semantics 固定"的 agentic benchmark——通过自动扩展 environment state 控制上下文长度,可推到理论"无限长"但保持任务本质不变 - 评测对象升级:从"测模型"升级为"测模型 + scaffold 组合"——直接量化 context engineering 策略的 accuracy 收益 - 三向交叉:同时压测 (i) 长上下文 (ii) 多步 agentic 工作流 (iii) 多轮环境交互——现有 LongBench / HELMET / NIAH / RULER 全部只覆盖单步检索 - Figure 1 关键数据:Gemini-3-Flash 与 GPT-5.2-Medium 在 128K 环境下不同 context engineering 策略的 accuracy 差异——context rot 随 environment description 长度单调下降 - 任务场景真实:基于 Excel / PDF / database 真实结构化来源构造,而非合成 NIAH 式数据
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1.1「评测对象扩展」——LOCA-bench 是 R26 之后"Agent 评测从结果导向下沉到阶段分解"趋势的 ICML 会议级确认(同类工作 Agent Retrieval Bench / RepoReasoner 均出现在本期 radar) - 落入 §2.2「Benchmark 设计」——可控变量 benchmark 设计(context length 单一变量控制)与 R26 LongBench / HELMET 构成方法论对照 - 落入 §2.5「评测方法学批判」——"模型 + scaffold"评测对象分离直接挑战了"纯模型评测"范式的生态效度
建议归入节: §1.1 评测对象扩展——新增「LOCA-bench(arXiv:2602.07962,ICML 2026)可控上下文 agent 评测基准」子节;§2.2 Benchmark 设计(方法论对照条目)
arXiv 号: 2602.07962
增量 2 · P1 确认 · M3Exam:多模态记忆用户-Agent 交互基准
来源: flyp/2026-07-30-M3Exam-m3proctor-light-review.md(来源:arXiv:2606.07402;paper_cards/004 主分类 evaluation) 类型: 评测基准 / 多模态 / Agent 记忆 可信度: 中-高(arXiv 2026-06,无会议信号;作者 email masked;配套 M3Proctor 方法论有量化数字)
要点: - Benchmark 设计:query-centric(而非 document-centric),覆盖 cross-modal grounding + implicit info inference 多维评估 - 评测场景:真实 user-agent 多轮交互,而非单次 QA - 评测模型:Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro、GLM-5.1、Qwen3.6-Plus——覆盖 2026 年主流闭源 + 开源 - LLM-as-Judge:使用 Qwen2.5-VL-32B-Instruct 作判官 - 配套系统 M3Proctor:"跨 query 模态检测 + 原始视觉按需取用",准确率 +13%、index 构建时间与取回 token 降幅 >70%(硬件/embedding 模型未披露) - 核心发现:多模态 memory 中跨 session 推理和 cross-modal grounding 是当前 MLLM 的主要短板
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1.1「评测对象扩展」——多模态 memory 评测从单轮拉到 cross-session + cross-modal,是 InMind(arXiv:2607.24368)邻接工作的横向扩展 - 落入 §2.3「评测指标体系」——M3Proctor "按需取图 + 模态偏差检测"工程范式与 ReMemR1 callback-on-update 互补,提供了可操作的感知可靠性框架 - 落入 §2.5「评测方法学批判」——Qwen2.5-VL-32B-Instruct 作 judge 与被评测对象(32B 级 + 更大闭源)之间 judge bias 未被测量,属于已知方法论缺陷
建议归入节: §1.1 评测对象扩展——新增「M3Exam(arXiv:2606.07402)多模态记忆用户-Agent 交互基准」子节;§2.3 评测指标体系(邻接:M3Proctor 工程范式)
arXiv 号: 2606.07402
增量 3 · P1 确认 · Ground Truth First:Agent Memory 五维纵向评测体系
来源: jay/inbox/2026-07-29-2105-jay-evening-arxiv-agentic-rag-memory-supplement.md(来源:arXiv:2607.21962,Ground Truth First;Jay evening briefing §1.2) 类型: 评测基准 / Agent Memory / 纵向评估 可信度: 高(arXiv 2026-07 · LongMemEval 风格五维体系 · 有量化数字)
要点: - 五大评测维度(均为现有 benchmark 未覆盖): 1. Unbounded store(无界存储) 2. Real-time update(实时更新) 3. Temporal reasoning(时序推理) 4. Noisy environment(噪声环境) 5. Multi-session(多会话) - 核心量化发现:20-point accuracy span across retrieval methods vs 3-8 across write strategies——检索方法主导端到端记忆质量,写入策略影响微弱 - 方法论意义:将 agent memory 评测从"某时刻单点质量"推到"跨越多个维度随时间的纵向质量",填补了"记忆系统随时间维度的系统性评估"空白 - 与 InMind(arXiv:2607.24368)的关系:InMind 关注"隐含关联盲点",Ground Truth First 关注"时序和多会话质量"——两者互补,构成了 agent memory 评测的完整五维框架
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1.1「评测对象扩展」——纵向评测(longitudinal evaluation)是从"快照评测"到"随时间演化评测"的方法论升级 - 落入 §2.2「Benchmark 设计」——Ground Truth First 是 LongMemEval 之后 agent memory 评测维度最完整的 benchmark,覆盖了 R26 之后 memory 评测的系统性缺失 - 落入 §1 现状全景 #2「Agent / RAG / 长上下文系统暴露'不可见失败'」——五维体系正是对"不可见失败"(unbounded store / noisy environment / temporal reasoning)的系统性量化
建议归入节: §2.2 Benchmark 设计——新增「Ground Truth First(arXiv:2607.21962)Agent Memory 五维纵向评测体系」子节;§1.1 评测对象扩展(纵向评测作为新评测类型)
arXiv 号: 2607.21962
增量 4 · P1 确认 · Eval-first Development:评测驱动的开发方法论新趋势
来源: jay/inbox/2026-07-29-1455-jay-engineering-filter.md(来源:Zartis 2026 工程实践)+ jay/inbox/2026-07-29-ai-trending-weekly.md(来源:FutureAGI Substack)+ flyp/inbox/2026-07-30-rss-cameron-wolfe.md(来源:cameronrwolfe Agent Evals) 类型: 工程方法论 / 评测实践 / 产业趋势 可信度: 高(三源独立印证:Zartis 2026 + FutureAGI + Cameron-Wolfe 均独立提及 Eval-first 替代 Prompt-first)
要点: - Eval-first development 定义:先设评估(eval),再写 prompt——将评测从"事后验证"提升为"开发起点" - 三源印证: - Zartis 2026:Braintrust(企业 AI eval,RAG trace 存储于 Brainstore)+ Galileo(RAG 评测优先, Luna guardrails)+ Maxim AI(端到端 simulation + eval + 生产监控)构成评测工具链 - FutureAGI Substack:2026 年评测范式从单次评测转向持续改进循环;LLM-as-Judge 成为 Agent 输出评测的默认方法;组件级评测(Component-level Eval)适用于复杂 RAG/Agent 系统 - Cameron-Wolfe:Agent 评测详细指南(Best practices and common patterns for effectively evaluating AI agents)+ LLM 基准解剖(Common patterns used to create the most effective LLM evaluation datasets) - 行业数据(FutureAGI):57% 企业已有生产 Agent,但仅 52% 建立了任何评测机制——Eval 缺口即 Agent 落地质量缺口 - 与 R26「Eval-first」邻接的区别:R26 是 Lilian Weng Harness Engineering 的 eval-related 邻接;本期 Eval-first 是独立工程方法论趋势,由多家来源(Zartis / FutureAGI / Cameron-Wolfe)独立印证,可信度更高
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §2.5「评测方法学批判」——Eval-first 作为工程实践趋势,将"评测设计"从开发末端移到开发起点,直接挑战了"先跑通再测"的方法论 - 落入 §2.4「Judge & Harness 工程」——Braintrust/Galileo/Maxim AI 评测工具链印证了 PAJAMA(程序化评判器)之前的基础设施层需求 - 落入 §1 现状全景 #4「Eval-first development 替代 prompt-first development」——作为新兴工程趋势正式立标
建议归入节: §2.5 评测方法学批判——新增「Eval-first Development(Zartis/FutureAGI/Cameron-Wolfe 三源印证)评测驱动开发方法论趋势」子节;§2.4 Judge & Harness 工程(邻接:评测工具链 Braintrust / Galileo / Maxim AI)
arXiv 号: 无(工业实践 + Substack,无独立 arXiv)
邻接增量(值得关注的 eval 相关条目)
邻接 A · Agent Retrieval Bench(arXiv:2607.24882):代码 Agent 检索阶段专项基准
来源: paper_cards/656(主分类 agent,副分类 rag)+ tom/2026-07-30-agent-rag-longcontext-radar.md 类型: 评测基准 / Agent / 检索(次分类) 可信度: 高(GitHub 已开源 · 四任务系统设计 · 与 LOCA-bench 同期)
邻接理由:主分类 agent 而非 evaluation,但 benchmark 形态 + "填补上游检索质量无基准空缺"使本文与 LOCA-bench 共同构成"Agent 评测从整体结果下沉到组件阶段"的双子案例。建议进入 evaluation 活文档 §1.1(Agent 评测粒度细化邻接)。
邻接 B · RepoReasoner(arXiv:2607.25996):代码库级跨文件推理评测基准
来源: tom/2026-07-30-agent-rag-longcontext-radar.md 类型: 评测基准 / 代码推理 / 长上下文 邻接理由:现有代码基准在函数级(信息局部化),不反映真实开发跨文件依赖。RepoReasoner 评测 Output Prediction(跨文件有状态执行推理)和 Call Chain Prediction(高层架构依赖追踪),是 Agent 评测从结果下沉到阶段的另一案例。
邻接 C · HANDBOOK.md(arXiv:2607.25398):长上下文 Agentic 指令遵循评测
来源: tom/2026-07-30-agent-rag-longcontext-radar.md 类型: 评测基准 / Agent / 长上下文 邻接理由:65 个企业员工手册风格 Agent 任务,评估 Agent 是否在整个工具调用周期内受政策约束。填补了"工具调用长程合规性"无专项评测的空白。
邻接 D · PerceptionBench(arXiv:2607.24957):原子视觉感知失败分类
来源: 已在 7-29 evaluation e1prep P3 邻接增量 3 覆盖 邻接说明:近 3 天无 eval 专项新信息;持续建议归入 §2.3 评测指标体系。
邻接 E · 向量数据库 Benchmark 方法论陷阱
来源: 已在 7-29 evaluation e1prep P2 邻接增量 4 覆盖 邻接说明:近 3 天无 eval 专项新信息;持续建议归入 §2.2 Benchmark 设计。
矛盾 / 待核实
矛盾 1 · M3Exam Judge bias 未被测量
- 现状:Qwen2.5-VL-32B-Instruct 作 judge,但被评测对象包含 Claude-Opus-4.6、GPT-5.4 等同量级或更大模型,judge bias 未被量化
- 待核实:是否有 judge self-consistency check 或 judge bias ablation
矛盾 2 · Ground Truth First 五维中"检索 vs 写入"贡献度分离
- 发现:20-point accuracy span across retrieval methods vs 3-8 across write strategies——但实际生产环境中 retrieval 和 write 是联合优化的,并非独立变量
- 待核实:五维评估的各维度之间是否存在干扰效应
矛盾 3 · LOCA-bench "task semantics 固定"声明的可验证性
- 风险:随着 context length 增长,即使语义固定,任务执行难度也可能因"信息淹没"而上升——这与 context rot 本质上是同一现象
- 待核实:LOCA-bench 是否有 control experiment 证明语义难度不变
本期不纳入的已知条目(已在上期或 R26/R29 覆盖)
| 条目 | arXiv 号 | 不纳入原因 |
|---|---|---|
| PAJAMA / Codifying the Judge | 2607.22561 | 已在 7-29 evaluation e1prep P1 确认增量 1 覆盖;近 3 天无 eval 专项新信息 |
| Keep It InMind | 2607.24368 | 已在 7-29 evaluation e1prep P1 确认增量 2 覆盖;本期 Ground Truth First 是其邻接横向扩展,不重复 |
| PerceptionBench | 2607.24957 | 已在 7-29 evaluation e1prep P2 邻接增量 3 覆盖;近 3 天无 eval 专项新信息 |
| Warp Divergence Benchmark | 2607.23402 | 已在 7-29 evaluation e1prep P2 邻接增量 4 覆盖;近 3 天无 eval 专项新信息 |
| Lilian Weng Harness Engineering | Weng blog 2026-07-04 | 已在 R29 邻接覆盖;本期 Eval-first 是独立来源印证的工程方法论趋势,不重复 |
| Braintrust / Galileo / Maxim AI | 工业工具 | 已在 jay/engineering-filter 邻接覆盖;本期作为 Eval-first 工具链层补充 |
引用 arXiv 号汇总
| # | arXiv 号 | 名称 | 角色 |
|---|---|---|---|
| 1 | 2602.07962 | LOCA-bench: Long-Context Agent Benchmark(ICML 2026) | 🆕 增量 1 确认 |
| 2 | 2606.07402 | M³Exam: Multimodal Memory Benchmark | 🆕 增量 2 确认 |
| 3 | 2607.21962 | Ground Truth First: Agent Memory 五维纵向评估 | 🆕 增量 3 确认 |
| 4 | 无 | Eval-first Development(工业实践,Zartis/FutureAGI/Cameron-Wolfe 三源印证) | 🆕 增量 4 确认(无 arXiv) |
| A | 2607.24882 | Agent Retrieval Bench | 邻接 A(Agent 评测粒度细化) |
| B | 2607.25996 | RepoReasoner | 邻接 B(跨文件推理评测) |
| C | 2607.25398 | HANDBOOK.md | 邻接 C(Agentic 指令遵循) |
检查过的来源
tom inbox (7-28下午~7-30): - 2026-07-29-evaluation-e1prep.md(已覆盖 PAJAMA / Keep It InMind / PerceptionBench / Warp Divergence;R29) - 2026-07-30-0900-hf-daily-2026-07-30.md(15 件,含 arXiv:2607.23514 多模态事实核查 eval 邻接) - 2026-07-30-agent-rag-longcontext-radar.md(Agent Retrieval Bench #1 · RepoReasoner #4 · BeyondUncertainty #3 · HANDBOOK.md #6 · 65 个企业 Agent 任务 #7 · LongMemEval #8 · eval-first 趋势 #76) - 2026-07-30-rag-e1prep.md(含 Agent Retrieval Bench 等 RAG 邻接,非 eval 专项)
jay inbox (7-28下午~7-30): - 2026-07-29-1455-jay-engineering-filter.md(Eval-first development + Braintrust/Galileo/Maxim AI 评测工具链 + RAG Fusion 陷阱 + 41% 延迟警示) - 2026-07-29-1105-jay-five-category-briefing.md(向量 DB eval §1.1/§1.2 + SGLang vs vLLM benchmark §2.1 + llm-d CNCF Sandbox §5) - 2026-07-29-ai-trending-weekly.md(FutureAGI LLM Evaluation Frameworks + Agent 评测缺口 57%/52% + Eval-first development) - 2026-07-29-2105-jay-evening-arxiv-agentic-rag-memory-supplement.md(Ground Truth First §1.2 + LongMemEval 五维 + FROAV 六阶段 pipeline + AgentLoom) - 2026-07-30-1105-jay-five-category-briefing.md(向量 DB benchmark 工具 42▲) - 2026-07-30-ai-engineering-weekly.md
flyp inbox (7-28下午~7-30): - 2026-07-29-2250-LOCA-bench-long-context-agent-critical-read.md(ICML 2026 精读,context可控 agent benchmark,可信度高) - 2026-07-29-coding-agents-e1prep.md(coding agents 专项) - 2026-07-30-M3Exam-m3proctor-light-review.md(M3Exam 多模态 memory benchmark,轻评) - 2026-07-30-1000-rss-cameron-wolfe.md(Agent Evals 详细指南 + LLM 基准解剖) - 2026-07-30-multimodal-e1prep.md(多模态专项)
spark inbox (7-28下午~7-30): - 2026-07-29-agent-e1prep.md(agent 主分类为主,含 eval 邻接) - 2026-07-30-agent-e1prep.md
stephen inbox (7-28下午~7-30): - 2026-07-29-ai-industry-e1prep.md(Anthropic 密码学弱点邻接 eval) - 2026-07-30-ai-industry-e1prep.md
paper_cards (635-657, 近 3 天新卡): - 严格抽查 23 张(635-657):主分类 evaluation:0 件 - 主分类 agent:656(Agent Retrieval Bench,evaluation 副分类)+ 643(Cyber-Capable Agents,evaluation 副分类) - 主分类 rag:639(A New Role for Relevance)+ 645(BeyondUncertainty) - 其余:long-context/agent/multimodal/inference - 近 3 天主分类 evaluation 新卡:0 件(无新增 eval 专项卡片) - 持续覆盖:ForeSci(014-2606-00644,OpenAlex 更新 7-30)+ M3Exam(004-2606-07402,evaluation 主分类,OpenAlex 更新 7-30)
主题活文档更新状态
- knowledge/evaluation.md 当前版本:R29(2026-07-29 15:40 批次)
- 本期 4 条确认增量 + 5 条邻接增量可支持 R30 更新候选
- 核心更新方向:§1.1 评测对象扩展(LOCA-bench + M3Exam + Ground Truth First 三联) + §2.5 Eval-first Development 工程方法论趋势
Tom · 2026-07-30 15:40 CST | evaluation E1 预消化 | 4 确认 + 5 邻接 | 4 个可引用 arXiv 号(LOCA-bench / M3Exam / Ground Truth First / Agent Retrieval Bench)