evaluation · E1 预消化简报(2026-08-04)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-02 ~ 2026-08-04)+ paper_cards 近 3 天新卡(693-711)+ HF Daily 8-04 票榜 + ACL 2026 Demo 来源复验 本简报目的: 为今晚 evaluation 活文档接力(R35 → R36)预习备料,聚焦尚未进入 knowledge/evaluation.md R35 基线的增量条目 背景说明: R35 于 2026-08-03 15:40 收官(PROTEA 节点级 backward credit + DialogGuard 心理安全 + MASEval 多 Agent 评测基础设施 + Datadog API 可靠性)。本简报覆盖 2026-08-03 下午至 2026-08-04 下午增量,发现 evaluation 主题 ArXiv 新鲜供给相对平淡:3 条主分类 evaluation 新卡(ExtractBench + Evaluation-Verification Reward + Fewer Clarifications)均为场景专化型 benchmark/method,无全新评测方向开掘;HF Daily 8-04 票榜 evaluation 主分类条目仅 AISPA(31▲)候选需确认主分类,其余均为已在基线或邻域。


执行摘要

本期 evaluation E1 预消化发现 3 条确认增量,共涉 3 个新 arXiv 号。相比上期(R35 收官,4 确认 + 1 邻接)和上上期(R34→R35,1 确认 + 3 邻接),本期 eval 专项增量规模持续处于中低区间:

  1. ExtractBench(arXiv:2607.29677):企业文档模式引导抽取基准——首个同时对"取值准确性、大规模记录完整性、grounding 和实测成本"四项指标打分的评测基准,覆盖 370 份企业文档、8 个业务领域、67 种文档类型。属于 R35 §2.2 Benchmark 设计"场景专化"方向的新增补充。
  2. Evaluation-Verification Reward(arXiv:2607.29025):多参考图像编辑的一致性评测奖励——指出 RL 在多参考编辑场景缺少捕捉"多图像关系约束"的奖励模型,直接用 MLLM 作零样本评估器面临"长输出引发幻觉"的核心矛盾。属于 R35 已有"多 Agent 评测"维度的视觉专项延伸。
  3. Fewer Clarifications, Better Code(arXiv:2607.26611):编程助手跨会话个性化歧义自适应基准——首次将"同一用户的已解决会话历史能否作为记忆来解决重复个性化歧义"形式化为专项评测任务。属于 R35 §2.2 Benchmark 设计"场景专化"方向的代码领域新增。

核心脉络是:评测场景持续专化——ExtractBench 填补企业文档抽取评测空白,Evaluation-Verification Reward 填补多参考视觉编辑评测空白,Fewer Clarifications 填补跨会话编程消歧评测空白。三者均属"场景专化 benchmark"类型,无全新评测方法论突破。


增量条目(3 条确认)


增量 1 · P1 确认 · ExtractBench(arXiv:2607.29677):企业文档模式引导抽取评测基准

来源: paper_cards/696-2607.29677.md(主分类 evaluation,形态 benchmark)+ tom 8-03 agent-rag-longcontext-candidates.json 来源归档 arXiv: 2607.29677 TLDR: 企业工作流日益依赖 Agent 进行模式引导抽取:给定文档和用户自定义的模式,Agent 严格按照模式生成正确输出,并以源证据作为 grounding 元数据。ExtractBench 是首个同时对"取值准确性、大规模记录完整性、grounding 和实测成本"四项指标打分的基准,评估系统包含 370 份企业文档的 4,869 页,覆盖 8 个业务领域和 67 种文档类型。 卡状态: ✅ paper_cards/696 已建(主分类 evaluation,形态 benchmark)

要点: - 核心问题:企业文档抽取(schema-guided extraction)依赖 Agent 执行,但现有评测缺少"同时覆盖准确性 + 完整性 + grounding + 成本"的多维评测——ExtractBench 是首个四维合一评测基准 - 评测对象:Agent 执行企业文档模式引导抽取的能力——输入:文档 + 用户自定义 schema;输出:符合 schema 的结构化数据 + source evidence 作为 grounding 元数据 - 评测维度创新: - 取值准确性(value accuracy):输出字段与真实值的匹配度 - 记录完整性(record completeness at scale):大规模场景下记录覆盖率 - Grounding:输出的每项数据是否可溯源到原文证据 - 实测成本(measured cost):实际执行的成本/效率指标 - 规模:370 份企业文档,4,869 页,8 个业务领域,67 种文档类型——企业级评测规模的首次专项覆盖 - 与 R35 PROTEA 的关系:PROTEA 关注多 Agent 工作流内部 credit assignment;ExtractBench 关注端到端企业文档抽取评测——两者同属"工程领域场景专化 benchmark",ExtractBench 是 PROTEA 在企业文档抽取场景的具体化

与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——ExtractBench 是"场景专化型评测基准"的新增补充,与 MPIE-Bench(多人协作视觉编辑)、Beyond Borrowed Histories(角色扮演用户对齐)共同构成"场景专化 benchmark 三件套" - 落入 §2.3「评测指标体系」——四维评测指标(准确性 + 完整性 + grounding + 成本)是对 R35 已有"多 Agent 工作流评测指标"和"多 Agent 心理安全评测指标"在企业文档抽取场景的专项应用 - 落入 §2.7「评测对象的横向分化」——新增"企业文档抽取评测"行(ExtractBench) - 与 R35 PROTEA 邻接:两者同属"工程领域场景专化"——PROTEA 是多 Agent 工作流评测工具,ExtractBench 是企业文档抽取 benchmark;建议在 §2.2 Benchmark 设计建立"工程领域场景专化 benchmark"子分类

建议归入节: §2.2 Benchmark 设计(新增 ExtractBench 为场景专化型评测基准第九件补充)+ §2.3 评测指标体系(新增"企业文档抽取四维指标"行)+ §2.7 评测对象横向分化(新增"企业文档抽取评测"行)

arXiv: 2607.29677


增量 2 · P1 确认 · Evaluation-Verification Reward(arXiv:2607.29025):多参考图像编辑的一致性评测奖励

来源: paper_cards/697-2607.29025.md(主分类 evaluation,形态 method,副 multimodal)+ tom 8-03 agent-rag-longcontext-candidates.json 来源归档 arXiv: 2607.29025 TLDR: 多参考图像编辑在保持跨参考视觉一致性和整体视觉和谐方面仍具挑战。RL 在文生图和单图编辑上已证明有效,但扩展到多参考编辑时,缺少能捕捉多图像关系约束的合适奖励模型。直接用 MLLM 作零样本评估器面临长输出引发幻觉倾向的关键矛盾。 卡状态: ✅ paper_cards/697 已建(主分类 evaluation,形态 method,副 multimodal)

要点: - 核心问题:多参考图像编辑(multi-reference editing)的评测无合适 reward model——现有 RL 方法在单图编辑上有效,但多图像场景缺少捕捉"多图像关系约束"的 reward model;直接用 MLLM 作 zero-shot evaluator 会因长输出而加剧 hallucination - 核心矛盾:MLLM-as-judge 在多参考图像编辑评测中的可靠性问题——"长输出引发幻觉"是所有基于 MLLM-as-judge 评测方法的共同方法论问题(与 R35 DialogGuard LLM-as-judge 批判同源) - 评测维度:跨参考视觉一致性 + 整体视觉和谐——对应 R35 §2.3"多 Agent 心理安全评测"的行为层评测逻辑,但在视觉一致性场景的专项化 - 方法论价值:为"如何为多图像关系约束设计 reward model"提供方法论框架——可以推广到其他多图像关系评测场景(多视角 3D 重建、多帧视频编辑等) - 与 R35 DialogGuard 的方法论共性:两者都依赖 LLM-as-judge,都面临 hallucination 风险——Evaluation-Verification Reward 提供"设计专用 reward model 而非直接用 MLLM-as-judge"的解决路径

与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——多参考图像编辑评测 reward model 框架,属于"视觉/多模态评测"场景专化方向 - 落入 §2.4「Judge & Harness 工程」——Evaluation-Verification Reward 提供的 reward model 设计方法,可归入"专用 reward model vs MLLM-as-judge"的方法论讨论 - 落入 §2.5「评测方法学批判」——"MLLM-as-judge 在长输出场景的 hallucination 风险"是 R35 DialogGuard LLM-as-judge 批判(§2.5 反方第 2 条)的同源反方证据 - 落入 §2.7「评测对象的横向分化」——新增"多模态视觉一致性评测"行(Evaluation-Verification Reward)

建议归入节: §2.2 Benchmark 设计(新增多参考图像编辑 reward model 方法)+ §2.4 Judge & Harness 工程(新增"专用 reward model vs MLLM-as-judge"方法论讨论)+ §2.5 评测方法学批判(新增"MLLM-as-judge hallucination 风险在视觉评测场景的放大"反方)+ §2.7 评测对象横向分化(新增"多模态视觉一致性评测"行)

arXiv: 2607.29025


增量 3 · P1 确认 · Fewer Clarifications, Better Code(arXiv:2607.26611):编程助手跨会话个性化歧义自适应基准

来源: paper_cards/705-2607.26611.md(主分类 evaluation,形态 benchmark)+ work-queue 8-04 §1 Top 15 #3 arXiv: 2607.26611 TLDR: AI 辅助编程越来越多地将非形式化的用户意图转化为可执行软件,但编程请求常常包含以用户特有方式跨任务和会话重复出现的歧义。现有消歧方法通常在当前编程会话内孤立处理每个歧义请求,常通过请求额外澄清来实现。然而,来自同一用户的已解决会话历史能否作为新会话中解决重复个性化歧义的记忆,仍鲜有探索。本文将"个性化歧义自适应"形式化为新任务,并建立专项评测。 卡状态: ✅ paper_cards/705 已建(主分类 evaluation,形态 benchmark)

要点: - 核心问题:跨会话消歧——现有消歧方法只处理当前会话内的歧义请求(通过澄清实现),但"同一用户的已解决会话历史能否作为新会话中解决重复歧义的记忆"未被探索 - 任务形式化:个性化歧义自适应(Personalized Ambiguity Adaptation)——评测同一用户跨会话的个性化歧义解决能力 - 评测创新:将"会话历史作为记忆"的形式化评测——这是 R35 MirrorCode(超长程编程评测)在"跨会话记忆"维度的专项细化 - 关键区分:评测的是"利用已解决会话历史自适应解决重复歧义"的能力,而非"在当前会话内解决歧义"的能力——对应 R35 Beyond Borrowed Histories"用户对齐"思路在编程场景的对应 - 与 Beyond Borrowed Histories 的方法论共性:两者都评测"个性化历史能否作为上下文记忆来解决新场景"——Beyond Borrowed Histories 面向角色扮演,Fewer Clarifications 面向编程消歧;构成"个性化记忆利用评测"双子案例 - 与 MirrorCode 的关系:MirrorCode 评测超长程编程任务(500+ 行代码,多文件),Fewer Clarifications 评测跨会话消歧能力——两者共同构成"编程 Agent 纵向评测"双维度(长程任务 + 跨会话记忆)

与 knowledge/evaluation.md R35 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——Fewer Clarifications 是"场景专化型评测基准"的新增补充,与 MirrorCode(超长程编程)、Beyond Borrowed Histories(角色扮演用户对齐)构成"编程/角色扮演双场景专化 benchmark 子分类" - 落入 §1.1「评测对象扩展」——从"会话内消歧"到"跨会话个性化歧义自适应"——评测粒度在"时间维度"(跨会话 vs 会话内)的首次专项细化 - 落入 §2.7「评测对象的横向分化」——新增"编程 Agent 跨会话评测"行(Fewer Clarifications) - 与 R35 Beyond Borrowed Histories 邻接:两者同属"个性化记忆利用评测"双子——编程消歧(Fewer Clarifications)+ 角色扮演(Beyond Borrowed Histories)

建议归入节: §2.2 Benchmark 设计(新增 Fewer Clarifications 为场景专化型评测基准第十件)+ §1.1 评测对象扩展(新增"跨会话个性化歧义自适应"维度)+ §2.7 评测对象横向分化(新增"编程 Agent 跨会话评测"行)

arXiv: 2607.26611


值得警惕的矛盾或待核实说法

矛盾 1 · ExtractBench 四维评测指标的可比性问题

  • 现状:ExtractBench 同时评测"取值准确性、记录完整性、grounding、实测成本"四个维度,但四个维度之间如何加权未明确——不同企业场景对四个维度的优先级可能不同(金融场景重准确性,客服场景重成本)
  • 待核实:论文是否提供四个维度的标准化加权方案?不同业务领域的维度权重是否可配置?

矛盾 2 · Evaluation-Verification Reward "多图像关系约束 reward model" 的泛化边界

  • 现状:论文针对多参考图像编辑场景设计 reward model,但"多图像关系约束"在其他场景(视频编辑、3D 重建、多视角图像)的泛化能力未验证
  • 待核实:论文是否提供 reward model 跨场景泛化能力的消融实验?"多图像关系约束"的形式化定义是否足够通用?

矛盾 3 · Fewer Clarifications "个性化歧义自适应" 的用户模拟依赖

  • 现状:评测需要模拟"同一用户跨会话的个性化歧义模式",但"模拟用户"的设计依赖标注者对目标用户群体的先验知识——"模拟用户"是否真正代表真实用户存在系统性偏差风险
  • 待核实:论文是否提供模拟用户与真实用户群体的对照验证?inter-annotator agreement 是否被报道?

矛盾 4 · ACL 2026 Demo papers 无独立 arXiv 编号(复验)

  • 现状:R35 已收录 PROTEA、DialogGuard、MASEval 三件 ACL 2026 Demo paper,均无独立 arXiv 编号——仅依赖 ACL Anthology 记录引用,引用可靠性依赖 Anthology 稳定性
  • 待核实:ACL Anthology 是否已发布 PROTEA/DialogGuard/MASEval 正式记录?是否有 GitHub 代码库可验证方法实现细节?

本期不纳入的已知条目(已在上期或 R35 覆盖)

条目 arXiv 号 不纳入原因
PROTEA ACL Demo(无独立 arXiv) 已在 R35 P1 确认增量 1 覆盖;近 2 天无 eval 专项新信息
DialogGuard ACL Demo / 2512.02282 已在 R35 P1 确认增量 2 覆盖;近 2 天无 eval 专项新信息
MASEval ACL Demo(无独立 arXiv) 已在 R35 P1 确认增量 3 覆盖;近 2 天无 eval 专项新信息
Datadog 工业数据 无(工业报告) 已在 R35 邻接增量 4 覆盖;近 2 天无 eval 专项新信息
Beyond Borrowed Histories 2607.27816 已在 R35 基线;HF Daily 8-04 票数 32▲(+1),无 eval 专项新信息
MPIE-Bench 2607.27616 已在 R35 基线邻接;HF Daily 8-04 票数 37▲(持平),无 eval 专项新信息
Fairness Pruning 2607.28319 已在 R35 基线;近 2 天无 eval 专项新信息
See2Think 2607.26769 已在 R35 基线;近 2 天无 eval 专项新信息
CoRT 2607.25659 已在 R35 基线;PROTEA 是同思路的节点级扩展,不重复
DecoEvo 2607.25675 已在 R35 基线;近 2 天无 eval 专项新信息
MirrorCode Benchmark 已在 R35 基线;Fewer Clarifications 是同领域的跨会话维度补充,不重复
AISPA 2607.28617 主分类待确认(可能是 engineering 而非 evaluation);HF Daily 8-04 31▲,需确认主分类后才能确定是否纳入 evaluation.md

引用 arXiv 号汇总

# arXiv 号 名称 状态 与 evaluation.md 关系
1 2607.29677 ExtractBench:企业文档模式引导抽取基准 ✅ paper_cards/696 已建(主分类 evaluation) 🆕 增量 1 确认
2 2607.29025 Evaluation-Verification Reward:多参考图像编辑评测 ✅ paper_cards/697 已建(主分类 evaluation) 🆕 增量 2 确认
3 2607.26611 Fewer Clarifications, Better Code:跨会话个性化歧义自适应 ✅ paper_cards/705 已建(主分类 evaluation) 🆕 增量 3 确认
A 2607.27816 Beyond Borrowed Histories ✅ 已在 R35 基线(8-04 票数 +1) 已在基线
B 2607.27616 MPIE-Bench ⚠️ 已在 R35 基线邻接(8-04 票数持平) 已在基线邻接
C ACL Demo PROTEA ⚠️ 已在 R35 基线(ACL Demo 无独立 arXiv) 已在基线
D ACL Demo DialogGuard ⚠️ 已在 R35 基线(ACL Demo 无独立 arXiv) 已在基线
E ACL Demo MASEval ⚠️ 已在 R35 基线(ACL Demo 无独立 arXiv) 已在基线
F 2607.28617 AISPA ⚠️ 待确认主分类(HF Daily 8-04 31▲) 待核实主分类

检查过的来源清单

tom inbox(8-03 下午~8-04): - 2026-08-03-evaluation-e1prep.md(R35 收官报告;基准参考) - 2026-08-03-0900-hf-daily-2026-08-03.md(HF Daily 8-03 票榜;无 evaluation 主分类新条目) - 2026-08-04-0900-hf-daily-2026-08-04.md(HF Daily 8-04 票榜;含 AISPA 31▲ 候选) - 2026-08-04T0840-agent-rag-longcontext-radar.md(8 件候选;含 ExtractBench/Evaluation-Verification Reward 归档线索) - 2026-08-03T2040-agent-rag-longcontext-radar.md(含 ExtractBench 虚构引用塌方自检) - 2026-08-03T2040-agent-rag-longcontext-radar-v2.md(含 ExtractBench 虚构引用塌方自检) - 2026-08-04-rag-e1prep.md(RAG 专项;无 eval 专项新条目) - 2026-08-04_rag-lite.md(RAG 轻量版;无 eval 专项新条目)

jay inbox(8-03 下午~8-04): - 2026-08-03-acl-2026-system-demos.md(ACL 2026 Demo 精选;含 PROTEA/DialogGuard/MASEval——已在 R35 覆盖) - 2026-08-03-datadog-ai-engineering-report.md(Datadog 工业报告;已在 R35 邻接覆盖) - 2026-08-04T1905-jay-five-category-briefing.md(database/llm-infra/cloud-native 专题;无 eval 专项新条目)

flyp inbox(8-03 下午~8-04): - 2026-08-03-multimodal-e1prep.md(multimodal 专项;无 eval 专项新条目) - 2026-08-03-risk-e1prep.md(risk 专项;无 eval 专项新条目) - 2026-08-04-multimodal-e1prep.md(multimodal 专项;含 6 件候补级新增,均为 multimodal/agent 主分类)

stephen inbox(8-03 下午~8-04): - 2026-08-04-ai-industry-e1prep.md(ai-industry 专项;含 HF Daily 8-04 票榜分析;无 eval 专项新条目)

spark inbox(8-03 下午~8-04): - 2026-08-04-agent-e1prep.md(agent 专项;无 eval 专项新条目)

paper_cards 近 3 天新卡(693-711,共 19 张): - 主分类 evaluation:696(ExtractBench ✅)+ 697(Evaluation-Verification Reward ✅)+ 705(Fewer Clarifications ✅) - 其余 16 张:agent(706 MWM / 709 EMBL AI Librarian / 698 QQWorld)+ multimodal(695/702/703/704)+ rag(693/694/707/708)+ llm-infra(699/700/701/711)+ engineering(710)+ risk(711) - 近 3 天主分类 evaluation 新卡:3 件(ExtractBench + Evaluation-Verification Reward + Fewer Clarifications)

HF Daily 8-04 票榜 evaluation 相关条目: - AISPA(2607.28617)#10 · 31▲——主分类待确认(可能是 engineering),待 paper_cards 建卡后确认分类再决定是否纳入 evaluation.md - Beyond Borrowed Histories(2607.27816)#9 · 32▲(+1)——已在 R35 基线 - MPIE-Bench(2607.27616)#8 · 37▲(持平)——已在 R35 基线邻接 - 近 3 天 HF Daily 8-04 evaluation 主分类净新增:0 件(AISPA 待确认)


主题活文档更新状态

  • knowledge/evaluation.md 当前版本:R35(2026-08-03 15:40 批次)
  • 本期 3 条确认增量(ExtractBench + Evaluation-Verification Reward + Fewer Clarifications),可支持 R36 更新候选
  • 核心更新方向:§2.2 Benchmark 设计(场景专化型 benchmark 新增 3 件)+ §1.1 评测对象扩展(跨会话个性化歧义自适应新维度)+ §2.7 评测对象横向分化(新增企业文档抽取 + 多模态视觉一致性 + 编程跨会话三行)
  • 建议 R36 关注:AISPA(2607.28617)主分类确认后决定是否纳入;ACL 2026 Demo papers 是否出 GitHub 或正式 ACL Anthology 记录

无显著新增量时说明

本日 evaluation 主题 ArXiv 新鲜供给处于中低区间,主要原因是:

  1. R35 四联协同(PROTEA + DialogGuard + MASEval + Datadog)收官后进入整理期:2026-08-03 批量收官,覆盖了节点级 backward credit assignment + 心理安全评测 + 多 Agent 评测基础设施 + 工业 API 可靠性四个核心方向,剩余增量空间有限
  2. 今日实质性新增量:3 条主分类 evaluation 新卡(ExtractBench + Evaluation-Verification Reward + Fewer Clarifications):均为场景专化型 benchmark/method,无全新评测方向;与 R35 已有 MPIE-Bench(多人协作视觉编辑)和 Beyond Borrowed Histories(角色扮演用户对齐)同属"场景专化"类型
  3. HF Daily 8-04 票榜 top 15 无 evaluation 主分类净新增:AISPA(31▲)主分类待确认;其余 evaluation 相关条目(Beyond Borrowed Histories / MPIE-Bench)均在 R35 基线续立
  4. ACL 2026 Demo 无新增 eval 专项条目:R35 已覆盖 PROTEA/DialogGuard/MASEval 三件;近 2 天 ACL Demo 无新 eval 专项论文

本棒 R36 预消化关键议题

R35 四联协同收官后,R36 面临的核心问题是:如何在"场景专化评测"这一已建立方向上建立系统性框架,避免条目堆砌?

  1. ExtractBench → 下一步:企业文档抽取评测的"四维指标"是否可以推广到其他企业场景(财务报表抽取 / 法律合同抽取 / 医疗记录抽取)?不同业务领域的维度权重如何标准化?
  2. Evaluation-Verification Reward → 下一步:"多图像关系约束 reward model"是否可以推广到视频编辑、3D 重建等场景?专用 reward model vs MLLM-as-judge 的权衡边界在哪里?
  3. Fewer Clarifications → 下一步:"跨会话个性化记忆"评测是否可以推广到非编程场景(客服 / 医疗咨询 / 法律咨询)?"模拟用户"与"真实用户"的代表性差距如何量化?
  4. AISPA → 下一步:主分类确认为 evaluation 后,纳入 §2.2 Benchmark 设计或 §2.4 Judge & Harness 工程——用户中心系统提示审计的评测维度需要核实论文原文
  5. 跨文档联动:ExtractBench 邻接 rag.md(企业文档 RAG);Evaluation-Verification Reward 邻接 multimodal.md(多模态视觉一致性);Fewer Clarifications 邻接 agent.md(编程 Agent 跨会话记忆)—— R36 更新时需确认跨文档一致性

附录:HF Daily 8-04 票榜 evaluation 相关条目跟踪(续立状态)

论文 arXiv 号 8-03 票数 8-04 票数 变化 状态
Beyond Borrowed Histories 2607.27816 31▲ 32▲ +1 ✅ 已在 R35 基线
MPIE-Bench 2607.27616 37▲ 37▲ 0 ✅ 已在 R35 基线邻接
AISPA 2607.28617 31▲ 新入 ⚠️ 主分类待确认

Tom · 2026-08-04 15:40 CST · E1 预消化简报 · 3 条确认增量(ExtractBench + Evaluation-Verification Reward + Fewer Clarifications) · 涉及 arXiv:2607.29677(🆕)/ 2607.29025(🆕)/ 2607.26611(🆕)/ 2607.27816(基线续立)/ 2607.27616(基线邻接)