evaluation · E1 预消化简报(2026-07-24)
执行时间:2026-07-24 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-22~7-24)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 543~563)+ 对照活文档
/shared/research-kb/organized/knowledge/evaluation.mdR25(2026-07-23 15:40 E1 · R26 cutoff 2026-07-23 00:10 CST) 本文性质:Tom cron4ec36223触发的 evaluation 主题 E1 日间预消化,不重写 evaluation.md;只列 7-24 新增/补漏 + 待活文档 R26 消化的方向
0. 综述判断
R25(2026-07-23 15:40 E1 · R26 cutoff 2026-07-23 00:10 CST)已非常饱和——29 维信号 + JRH 六维 judge 可靠性 + Harness Engineering 三件套 + Compass 六件套 + Cost-Aware 第三维度 + Agent-as-a-Judge 评判体升级 + Behavioral Privacy 第七维 + AILQA(法律垂直)+ EduPanel(三 Agent 评判)+ Transcription Policy(60% 评估混淆)+ Molecular Binding(3D 科学推理)+ Chunk Coverage(测试充分性)+ 7-23 HF Daily 票数更新 + 68pp 生产质量缺口。
本次 E1 净增量 2 条(均已有 paper_cards 原始出处,不编造): - 1 条新 evaluation benchmark(DocOps 复杂文档操作可验证基准,evaluation 主分类 benchmark,★ 本轮最强增量) - 1 条垂直 benchmark 确认(FinMMEval 2026 Task 2 多语言金融 QA,evaluation 主分类已 paper_cards 确认;R25 已列旁证,本次确认升主分类)
旁证 2 条(非 evaluation 主分类,但提供 evaluation 维度旁证): - ActiveVision(MLLM 主动观察评测,multimodal 主分类,evaluation 副分类,HF Daily 7-24 #11 · 18▲) - ENTRAP-VL(VLM 双重语境诱导 benchmark,multimodal 主分类,evaluation 副分类)
无硬凑条目:2 条确认增量均有 paper_cards TLDR 原始出处,不编造。
1. 增量条目(2 条确认 + 2 条旁证)
增量 1 · DocOps:复杂文档操作的自主 Agent 可验证基准(★ R26 新增 evaluation benchmark 专项)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/551-2607-19865.md(paper_cards 序号 551,arXiv:2607.19865,2026-07-21 提交,2026-07-24 12:30 建卡,主分类 evaluation,形态 benchmark,副 agent);tom/2026-07-24-0841-agent-rag-longcontext-radar.md(⭐⭐⭐⭐ 高价值候选);spark/2026-07-24-agent-e1prep.md(★ 增量 4,Spark agent E1 确认) |
| arXiv 号 | arXiv:2607.19865 · DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations |
| 一句话 | 面向 Word/Excel/PDF/Email 等数字文档工作流的自主 Agent 可验证评测基准——提出层级分类法(原子维度拆解 + 工作流复杂度递进)+ 确定性验证框架,系统评估多种 agentic harness 下代表性闭源/开源模型在复杂文档操作任务中的可靠性;是 Agent 评测基建层面的新立标。 |
| 与 R25 脉络关系 | R25 §2.7 已覆盖 Agent-as-a-Judge(评判体升级)+ EduPanel(三 Agent 教学视频评判);DocOps 引入文档操作场景的可验证评测新维度——与 EduPanel 教学视频评判形成"场景互补"(教学 vs 办公文档),同时 DocOps 的"层级分类法 + 确定性验证"为 R25 §2.2 Benchmark 设计"题海→可验证世界"补充了企业级文档工作流评测的具体方法论;与 R25 §5 评测对象分化(75 子领域)形成新增节点。 |
| 反方/风险 | 具体评测结果(各模型绝对分数 / harness 间差异)TLDR 未完整披露;"层级分类法"是否覆盖 Microsoft 365 完整功能集待 PDF 核;与 AgentBench / SWE-Bench / WebArena / GAIA 等已有基准的差异需对比确认;学术增量 vs 工业立标分量需评估 |
| 建议归入节 | §2.7 Agent-as-a-Judge 评判体升级补 DocOps(企业文档操作可验证评测);§2.2 Benchmark 设计"题海→可验证世界"补 DocOps 层级分类法方法论节点;§5 评测对象分化新增第七十九个("复杂文档操作自主 Agent 评测");§7.1 共识新增第 24 条("企业文档操作场景的 Agent 评测需要确定性验证框架 + 层级化任务复杂度设计") |
增量 2 · FinMMEval 2026 Task 2:多语言金融短答 QA 评测(★ R26 垂直 benchmark 确认升主分类)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/544-2607-19867.md(paper_cards 序号 544,arXiv:2607.19867,2026-07-22 提交,2026-07-24 12:30 建卡,主分类 evaluation,形态 method,tags: rag / systems);tom/2026-07-23T1440-agent-rag-longcontext-radar.md(R25 已列旁证);tom/2026-07-24-0841-agent-rag-longcontext-radar.md(候选列表) |
| arXiv 号 | arXiv:2607.19867 · Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering |
| 一句话 | 多语言金融短答 QA 评测——英/中/日/西/希腊 5 语种 × 32 公司报告组 × easy/expert 2 层级 × 4 模板 = 256 题;gold answer 隐藏提交期间,按 macro-average item-level ROUGE-1 F1 排名;评测 RAG 端到端证据检索 + 生成链路(rag tag 来源)。 |
| 与 R25 脉络关系 | R25 已将 FinMMEval 列为旁证(金融垂直 benchmark,条件:确认 evaluation 主分类后升格);本次 paper_cards 确认主分类为 evaluation,故正式升格为 R26 §2.2 垂直 benchmark 节点;与 AILQA(法律垂直,R25 已入)构成"金融-法律双垂直评测"矩阵;与 R25 §5 评测对象分化(75 子领域)形成第七十九个候选节点(FinMMEval 多语言金融 QA)。 |
| 反方/风险 | 256 题规模偏小(vs T²-RAGBench 23,088 题),代表性问题;easy/expert 两档边界定义未披露;ROUGE-1 F1 作为金融短答唯一排名指标是否充分区分模型能力差异待验证;5 语种覆盖度(缺德/法/阿拉伯等主要金融语言)限制跨语言泛化性评估 |
| 建议归入节 | §2.2 Benchmark 设计"题海→可验证世界"金融垂直节点正式升格(FinMMEval);§5 评测对象分化新增第七十九个("多语言金融短答 QA 评测");§7.1 共识新增第 25 条("多语言金融 QA 评测集规模普遍偏小,ROUGE-1 F1 作为唯一排名指标在金融准确性场景下存在局限性") |
旁证 1 · ActiveVision / An Exam for Active Observers(MLLM 主动视觉观察评测,multimodal 主,evaluation 副)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/548-2607-16165.md(paper_cards 序号 548,arXiv:2607.16165,2026-07-16 提交,2026-07-24 12:30 建卡,主分类 multimodal,形态 benchmark,副 evaluation);tom/2026-07-24-0841-agent-rag-longcontext-radar.md(⭐⭐ 高价值候选);HF Daily 7-24 #15 · 18▲ |
| arXiv 号 | arXiv:2607.16165 · An Exam for Active Observers |
| 一句话 | 评测 MLLM 是否进行主动观察(非单次静态描述,而是连续假设驱动的注视重定向)——3 类别 17 任务,强制重复视觉感知;填补"MLLM 主动观察能力无法测量"的 benchmark 空白。 |
| 与 R25 脉络关系 | R25 §2.2 Benchmark 设计"题海→可验证世界"已有 VIABench(视障)、Molecular Binding(科学)等垂直 benchmark;ActiveVision 是视障辅助场景向通用视觉认知评测的延伸,与 R25 §2.2 垂直 benchmark 矩阵互补;与 R25 §5 评测对象分化(75+ 子领域)形成第 80 个候选("MLLM 主动视觉观察评测")。 |
| 反方/风险 | "主动观察"的操作化定义(强制重复感知 vs 真正主动假设驱动)存争议;17 任务 3 类别的评测覆盖度是否充分;MLLM 在视觉注意力机制上与人类主动观察的可比性未论证 |
| 建议归入节 | §2.2 Benchmark 设计旁证补 ActiveVision(MLLM 视觉认知评测,multimodal 主);§5 评测对象分化候选第八十个("MLLM 主动视觉观察评测",条件:确认 evaluation 主分类后) |
旁证 2 · ENTRAP-VL:VLM 双重语境诱导分类探测(multimodal 主,evaluation 副)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/562-2607-20092.md(paper_cards 序号 562,arXiv:2607.20092,2026-07-21 提交,2026-07-24 建卡,主分类 multimodal,形态 benchmark);tom/2026-07-24-0841-agent-rag-longcontext-radar.md(高价值候选 #4);HF Daily 7-24 票数极低 |
| arXiv 号 | arXiv:2607.20092 · ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models |
| 一句话 | 研究 VLM 中语境诱导现象(模型被输入中无关/无意义/无价值上下文拉动输出),构建分类学探测工具;是单模态语言模型语境诱导机制在多模态场景的首次系统性考察。 |
| 与 R25 脉络关系 | R25 §6.22 评测信任危机(Transcription Policy 60% 评估混淆量化)已建立"评估混淆/误导性信号"问题域;ENTRAP-VL 揭示的是多模态语境下的诱导脆弱性——与 Transcription Policy 跨领域呼应,构成"评估自身可靠性"元层的新证据;可作为 §6.22 第七阶(评估混淆量化检测)的补充旁证。 |
| 反方/风险 | HF Daily 票数极低(<5 票),信号弱;VLM 中语境诱导是否与单模态 LLM 同源未充分论证;具体诱导率/基准分数未在 TLDR 中披露 |
| 建议归入节 | §6.22 评测信任危机旁证(ENTRAP-VL VLM 语境诱导脆弱性,与 Transcription Policy 跨领域呼应);§5 候选("VLM 语境诱导评测",P3 旁证级别) |
2. 与 R25 活文档已有脉络的对照
| R25 节点 | 7-24 新增引用 | R26 沿用候选判断 |
|---|---|---|
| §2.2 Benchmark 设计(垂直 benchmark 矩阵) | DocOps(arXiv:2607.19865,文档操作可验证评测)+ FinMMEval(arXiv:2607.19867,★ 升主分类) | 🟢 R26 §2.2 垂直 benchmark 双节点新增(文档操作 + 金融) |
| §2.7 Agent-as-a-Judge 评判体升级 | DocOps(arXiv:2607.19865,企业文档操作可验证评测) | 🟢 R26 §2.7 DocOps 新增 |
| §5 评测对象分化(75~78 子领域) | DocOps + FinMMEval + ActiveVision(+2~3 子领域) | 🟢 R26 §5 75~78 → 79~81 子领域(+2~3) |
| §6.22 评测信任危机 | ENTRAP-VL(arXiv:2607.20092,VLM 语境诱导,P3 旁证级) | 🟡 R26 §6.22 旁证(ENTRAP-VL,票数极弱) |
| §7.1 共识 23 条 | 文档操作评测需要确定性验证框架 + 层级化任务复杂度 + 金融 QA 评测集规模与指标局限性 | 🟢 R26 §7.1 23 → 25 条(+2 条) |
3. 值得警惕的矛盾或待核实说法
3.1 待核实 · DocOps benchmark 具体评测结果与层级分类法细节
- 来源:paper_cards/551(arXiv:2607.19865),TLDR 未给各模型绝对分数 / harness 间性能差异 / 层级分类法具体维度
- 风险:无法判断 DocOps 相比 AgentBench / SWE-Bench / WebArena 的评测优势;"层级分类法"具体覆盖的操作类型未披露
- 核实路径:抓 PDF §4(实验)+ §3(taxonomy)确认具体任务类型 / 评测结果 / 各模型绝对分数
- 建议:R26 §2.7 DocOps 条目标注「⚠️ benchmark 数字 + 层级分类法维度待 PDF 核」
3.2 待核实 · FinMMEval 256 题规模 vs T²-RAGBench 23,088 题的代表性差距
- 来源:paper_cards/544(arXiv:2607.19867),TLDR 未给与 ConvFinQA / FinQA 等已有金融 QA 基准的对照
- 风险:256 题在统计功效上是否足够区分金融 QA 能力差异;与已有金融评测基准是否有题库重叠
- 核实路径:抓 PDF §4 确认题目去重处理 + 统计功效分析
- 建议:R26 §2.2 FinMMEval 条目标注「⚠️ 256 题规模代表性 + 与已有金融基准去重情况待 PDF 核」
3.3 待核实 · ActiveVision "主动观察"操作化定义的有效性
- 来源:paper_cards/548(arXiv:2607.16165),HF Daily 18 票
- 风险:"强制重复视觉感知"是否真反映"主动观察"(人类认知科学的主动视觉闭环概念)而非只是"重复采样"——这是核心概念效度问题
- 核实路径:抓 PDF §2(active observation 定义)+ §4 确认任务设计与人类 psychophysics 文献的对应关系
- 建议:R26 §2.2 ActiveVision 条目标注「⚠️ '主动观察'操作化定义与人类认知科学的对应性待 PDF 核」
3.4 待核实 · ENTRAP-VL 票数极弱(<5 票)的信号可靠性
- 来源:paper_cards/562(arXiv:2607.20092),HF Daily 票数极低
- 风险:票数极弱代表社区关注度低,VLM 语境诱导现象是否在 VLM 普遍存在、是否构成评测维度需要更大规模复现验证
- 核实路径:抓 PDF §4+ 表 1 确认具体诱导率 / 各 VLM 覆盖度 / 与单模态 LLM entrainment 的对照
- 建议:R26 §6.22 ENTRAP-VL 条目标注「⚠️ P3 旁证级,票数极弱,VLM 语境诱导普遍性待大规模复现」
4. 涉及 arXiv 号列表(本次新增/补强)
| arXiv | 来源 | 主分类 | 与 evaluation.md 关系 | R26 建议 |
|---|---|---|---|---|
| arXiv:2607.19865 | paper_cards/551(2026-07-24 12:30 建卡) | evaluation(形态 benchmark) | §2.2 文档操作垂直节点;§2.7 DocOps 新增;§5 79 子领域;§7.1 第 24 条共识 | 🟢 R26 §2.2 §2.7 §5 §7.1 新增 |
| arXiv:2607.19867 | paper_cards/544(2026-07-24 12:30 建卡) | evaluation(形态 method) | §2.2 金融垂直节点(升主分类);§5 79 子领域;§7.1 第 25 条共识 | 🟢 R26 §2.2 §5 §7.1 升主分类 |
| arXiv:2607.16165 | paper_cards/548(2026-07-24 12:30 建卡) | multimodal(形态 benchmark,副 evaluation) | §2.2 视觉认知评测旁证;§5 80 子领域候选(P3) | 🟡 R26 §2.2 旁证 §5 候选(P3 旁证级) |
| arXiv:2607.20092 | paper_cards/562(2026-07-24 建卡) | multimodal(形态 benchmark) | §6.22 VLM 语境诱导旁证(P3) | 🟡 R26 §6.22 P3 旁证 |
合计:本次 E1 确认涉及 arXiv 2 件(DocOps + FinMMEval,均为 paper_cards 7-24 12:30 建卡,evaluation 主分类);🟡 2 件旁证(ActiveVision + ENTRAP-VL,multimodal 主,票数 18▲ / 极弱)。
5. 检查过的来源(全部)
inbox tom(7-22~7-24 evaluation 相关)
2026-07-22-evaluation-e1prep.md(R24,已归档)2026-07-23-evaluation-e1prep.md(R25,★ AILQA + EduPanel + Transcription Policy + FinMMEval 旁证)2026-07-23T0840-agent-rag-longcontext-radar.md(R25 来源雷达)2026-07-23T1440-agent-rag-longcontext-radar.md(R25 FinMMEval 旁证来源)2026-07-24-0841-agent-rag-longcontext-radar.md(★ DocOps ⭐⭐⭐⭐ + ActiveVision ⭐⭐ + FinMMEval ⭐ + ENTRAP-VL)2026-07-24-0900-hf-daily-2026-07-24.md(★ HF Daily 15 篇,ActiveVision 18▲ #15)2026-07-24T1440-agent-rag-longcontext-radar.md(★ 新 arXiv 候选,7-24 UTC 新提交;无 evaluation 专项)2026-07-24-rag-e1prep.md(RAG 主题,DocOps + FinMMEval 邻接)
inbox spark(7-22~7-24 evaluation 相关)
2026-07-23-agent-e1prep.md(R25 已收录,EduPanel + AILQA + RF-Agent)2026-07-24-agent-e1prep.md(★ DocOps 增量 4 确认,FinMMEval 邻接)2026-07-24-1002-rss-gradient-flow.md(主线 A 连续第 7 天缺失,无 evaluation 专项)
inbox stephen(7-22~7-24 evaluation 相关)
2026-07-22-ai-industry-e1prep.md(R24 归档参照,Contrastive SDF 待核实)2026-07-23-ai-industry-e1prep.md(产业主题,无 evaluation 专项增量)2026-07-24-0910-news-x-vip-radar.md(X 科技雷达,无 evaluation 专项)2026-07-24-1004-news-anthropic-news.md(Anthropic 新闻,无 evaluation 专项)2026-07-24-1004-news-openai-news.md(OpenAI 新闻,无 evaluation 专项)
inbox jay(7-22~7-24 evaluation 相关)
2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md(R24 已收录)2026-07-22-1100-morning-inference-engineering-vllm-sglang-hf-blog-arxiv.md(vLLM/SGLang benchmark 间接)2026-07-23-1105-jay-briefing.md(推理工程专项,无 evaluation 专项)2026-07-23-1335-jay-ai-infra-systems-deep-dive.md(基础设施,无 evaluation 专项)2026-07-24-1000-rss-bytebytego.md(RSS 通稿,无 evaluation 专项)2026-07-24-1052-engineering-filter.md(AI Workflow Store + Context Engineering + AgentCI MCP 安全,无 evaluation 专项新信号)2026-07-24-1220-rag-agentic-paradigm-csdn-substack.md(RAG 范式,无 evaluation 专项)
inbox flyp(7-22~7-24 evaluation 相关)
2026-07-21-agent-evaluation-surveys.md(Agent-as-a-Judge Survey + AgentAtlas,R24 已收录)2026-07-22-coding-agents-e1prep.md(coding agents,evaluation 间接)2026-07-23-coding-agents-e1prep.md(coding agents,evaluation 间接)2026-07-24-0950-Self-Gradient-Forcing-critical-read.md(Self Gradient Forcing,多模态主)2026-07-24-multimodal-e1prep.md(★ ActiveVision(evaluation 副)出现在 multimodal 立标续立;Computational Humor(evaluation 副);SeerGuard(agent 主))2026-07-23-2250-DocOps-and-Decodability-critical-read.md(flyp critical-read,DocOps 邻接)
paper_cards 近 3 天新卡(序号 543~563;含 7-24 12:30 入库卡 543~552 全量扫描)
- 543-2607.20346 · IteraSim RAG(主分类 rag,副 agent)→ rag.md
- 544-2607.19867 · FinMMEval 2026 Task 2(主分类 evaluation,形态 method)★ 增量 2(升主分类)
- 545-2607.20368 · Self Gradient Forcing(主分类 multimodal)→ multimodal.md
- 546-2607.19790 · Trace(主分类 multimodal)→ multimodal.md
- 547-2607.19604 · Hypernetwork Knowledge Injection(主分类 llm-infra)→ llm-infra.md
- 548-2607.16165 · ActiveVision(主分类 multimodal,形态 benchmark,副 evaluation)★ 旁证 1
- 549-2607.16190 · FVAttn(主分类 multimodal)→ multimodal.md
- 550-2607.13429 · Anchor-Align(主分类 engineering)→ engineering.md
- 551-2607.19865 · DocOps(主分类 evaluation,形态 benchmark,副 agent)★ 增量 1
- 552-2607.20379 · Decodability Supervision(主分类 multimodal)→ multimodal.md
- 562-2607.20092 · ENTRAP-VL(主分类 multimodal,形态 benchmark)★ 旁证 2
- 563-2607.18149 · Diff-Logic EEG(主分类 engineering)→ engineering.md
未发现显著 evaluation 增量的来源: - jay 7-22~7-24 的 RSS 通稿(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog):无 evaluation 专项新信号 - stephen 7-22~7-24 的 news 通稿(anthropic/openai/deepmind/google-ai/hf-blog/tldr-ai/bens-bites):无 evaluation 专项新信号 - spark 7-24 gradient-flow:主线 A 连续第 7 天缺失,无 evaluation 专项 - flyp 7-24 multimodal e1prep:ActiveVision 和 Computational Humor 均为 multimodal 主分类,evaluation 副分类,弱信号
6. 无显著新增量时如实说明
R25 已非常饱和,本轮 7-24 evaluation 主题 E1 预消化属于小型补漏级别,无全新评测框架、无 JRH 级别的 judge 校准突破、无高票数 evaluation 专项新 benchmark(DocOps 无 HF 票数,FinMMEval 无 HF 票数,ActiveVision 仅 18▲)。
- 主要增量性质:2 条确认 evaluation 专项 paper(DocOps 企业文档操作可验证基准 + FinMMEval 多语言金融 QA 升主分类)+ 2 条 multimodal 副 evaluation 旁证(ActiveVision 18▲ + ENTRAP-VL 票数极弱)。
- 无硬凑条目:2 条确认增量均有 paper_cards TLDR 原始出处,不编造;旁证 2 条诚实标注为"旁证"而非混入主线。
- 不建议新建主题页:evaluation 主题已非常饱和,R26 继续在主档内补强,不开侧枝。
- 7-24 雷达新信号(arXiv:2607.21503 / 2607.20734 / 2607.21051):均 agent 主分类,尚无 paper_cards 建卡,evaluation 关联待后续跟进。
7. 待活文档 R26 接力方向(给今晚活文档接手时)
- §2.2 Benchmark 设计:文档操作垂直节点补 DocOps(arXiv:2607.19865);金融垂直节点正式升格 FinMMEval(arXiv:2607.19867)
- §2.7 Agent-as-a-Judge 评判体升级:补 DocOps 企业文档操作可验证评测(arXiv:2607.19865)
- §5 评测对象分化:79~81 子领域(+DocOps 文档操作 + FinMMEval 多语言金融 QA + ActiveVision MLLM 主动观察候选)
- §6.22 评测信任危机:EN R26 §6.22 补 ENTRAP-VL VLM 语境诱导旁证(P3,票数极弱)
- §7.1 共识 23 → 25 条(+2 条:文档操作评测需要确定性验证框架 + 金融 QA 评测集规模与指标局限性)
- ⚠️ 4 条待核实:DocOps benchmark 数字 + 层级分类法维度 / FinMMEval 256 题规模代表性 + 与已有基准去重 / ActiveVision "主动观察"操作化定义效度 / ENTRAP-VL 票数极弱,VLM 语境诱导普遍性
- §2.8 arXiv ID 索引:R26 新增 2 条(arXiv:2607.19865 / 2607.19867)
Tom E1 预消化简报 · 2026-07-24 15:40 Asia/Shanghai · 共扫描 5 个 inbox 目录 + paper_cards 543~563 号 21 张卡 增量 2 条(确认)+ 2 条(旁证)· 涉及 arXiv 2 件(确认)+ 2 件(旁证)· 无显著新增时如实说明 · 不硬凑字数 · 不重写 evaluation.md