evaluation · E1 预消化简报(2026-07-20)
执行时间:2026-07-20 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-18~7-20)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 420-456)中该主题条目 对照活文档:
/shared/research-kb/organized/knowledge/evaluation.mdR22(cutoff 2026-07-20 00:10 CST) 本文性质:Tom cron4ec36223触发的 evaluation 主题 E1 日间预消化,不重写 evaluation.md;只列 7-19~7-20 新增/补漏 + 待活文档 R23 消化的方向
0. 综述判断
R22(7-20 00:10)已非常饱和——15 维信号 + JRH 六维 judge 可靠性测试 + Harness Engineering 三件套 + Compass/OS/OS-Agent/SearchOS/Guard 五件套命名范式 + 五校准体系。7-19~7-20 新增增量以中型补漏 + 反方深化 + 跨域连接为主,无新立标旗舰工作。
7-19~7-20 增量性质:★ 无全新评测框架;★ 无 JRH 级别的 judge 校准新突破;★ 有 Harness Evolution 反方深化、CoT 可监控性新维度、Compass 系列跨模态扩散、RAG 隐私评测新增方向。
本次 E1 净增量 5 条(均已在 flyP/spark/stephen 的 inbox 中有记录,不重复做反方审稿,只归位)。
1. 增量条目(5 条主线)
增量 1 · Rethinking Harness Evolution 反方深化:「匹配预算」概念的 loophole(★ R23 补强 §6 批判节)
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/inbox/flyp/2026-07-18-1550-Harness-Evolution-Eval-Cheating-critical-read.md flyP E2 精读(arXiv:2607.12227 v1 2026-07-14,GitHub rethinking-harness-evolution) |
| arXiv 号 | arXiv:2607.12227 · Rethinking the Evaluation of Harness Evolution for Agents |
| 一句话 | harness evolution 在同一 benchmark 上搜索 harness 配置再用同一 benchmark 打分 = 测试集超参搜索后同测试集打分的标准 leakage;核心贡献是「matched feedback/inference budget」协议——harness evolution 应在匹配预算下与 task-level search baseline(self-consistency、best-of-N、rejection sampling)对比;实验在 Terminal-Bench 2.1 × GPT-5.4/Claude Opus 4.6 表明自动 harness evolution 并不持续优于简单 test-time scaling。 |
| 与 R22 脉络关系 | R22 §6.22 已收录 Rethinking Harness Evolution(arXiv:2607.12227)作为「评测协议质疑」第 4 件套;本增量补强其 L1 反方:matched budget 的颗粒度(token cost/API call 数/wall-clock/retry 数)作者可任选,两者颗粒度不一致则 matched 仍有 manipulation 空间;且 harness evolution 的 prompt 写入是 long-lived 资产,task-level search 的 prompt 选择是 ephemeral——预算 matched 不等于价值 matched。 |
| flyP 补充的第二条反方 | held-out tasks 来自 Terminal-Bench 同一任务家族,distribution shift 有限,非真正的跨任务类型泛化。 |
| 建议归入节 | §6 评测方法学批判 §6.22(R22)→ R23 §6.22 补强:在现有「JRH 六维测试是否覆盖语义级错误模式」反方基础上,新增:① matched budget 颗粒度 loophole(L1 高强度反方,⭐⭐⭐⭐⭐);② held-out 跨家族泛化边界(L3)。 |
| 重要边界 | 本增量是 flyP 7-18 E2 精读,已完成反方审稿;本简报只做归位补强,不重写反方。 |
增量 2 · Length Penalties 使 CoT 更难被监控:评测对象的第 16 维(★ R23 新增维度行)
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/organized/paper_cards/413-2607-09786.md(paper_cards 序号 413,arXiv:2607.09786,OpenAlex 2026-07-19 更新,主分类 evaluation) |
| arXiv 号 | arXiv:2607.09786 · Length Penalties Make Chain-of-Thought Less Monitorable |
| 一句话 | 长度惩罚(如 token 压缩、length-normalized decoding)在提升效率的同时,使 CoT 推理背后的影响更难被检测——揭示了「压缩-可监控性前沿」(compression-monitorability frontier):更廉价的推理在保留答案的同时,使其背后的影响更难被人类或自动化 judge 发现。 |
| 与 R22 脉络关系 | R22 §1 第 15 维信号(评测诊断栈分层 / 实体归属盲区 / JRH 六维 / 评测协议可操作化)均未覆盖「推理过程可监控性」维度;本增量新增:CoT 监控性作为评测对象第 16 维(与 §5「评测对象分化」六十三个子领域 → 六十五个相关)。 |
| 建议归入节 | §4 维度化指标体系新增一行「CoT 压缩可监控性前沿」;§5 评测对象分化「六十三 → 六十五个子领域」;§6 新增批判条目:长度惩罚与 judge verbosity bias(JRH Finding 4)是否同根? |
| 重要边界 | paper_cards 有 TLDR 但无完整精读;本简报只归位,不自行深化。 |
增量 3 · Compass 系列跨模态扩散:KeyFrame-Compass + MultiRef-Compass + AgentCompass 三件套续势(★ R23 §2.7 补强)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards 序号 417(arXiv:2607.14202,KeyFrame-Compass)、418(arXiv:2607.14189,MultiRef-Compass)、405(arXiv:2607.13705,AgentCompass),三卡 OpenAlex 均 2026-07-19 更新 |
| arXiv 号 | arXiv:2607.14202 · KeyFrame-Compass(多模态,evaluation 副分类);arXiv:2607.14189 · MultiRef-Compass(多模态,evaluation 副分类);arXiv:2607.13705 · AgentCompass(主分类 evaluation) |
| 一句话 | KeyFrame-Compass 将关键帧执行分解为存在性/保真度/时序顺序/定位/持续性/唯一性六指标 + MLLM-as-Judge;MultiRef-Compass 将 MR2AV 生成评估整合自动指标与 rejudging 增强 MLLM-as-Judge 框架;AgentCompass 将评测流程围绕 Benchmark/Harness/Environment 三独立组件组织,实现灵活配置不需重写执行逻辑;三件均沿用「Compass」命名范式(与 R22 五件套:Compass/OS/OS-Agent/SearchOS/Guard 一脉相承)。 |
| 与 R22 脉络关系 | R22 §2.7 已收录 Compass/OS/OS-Agent/SearchOS/Guard 五件套命名范式;KeyFrame-Compass 和 MultiRef-Compass 将 Compass 命名范式从 agent 评测扩散到视频生成评测,是新子方向;AgentCompass 三层解耦(benchmark/harness/environment)已在 R22 §1 第 6 维标注,但无 TLDR——本简报补入 paper_cards TLDR 原文。 |
| 建议归入节 | §2.7 评测对象的横向分化「Agent 46+ 件套」补 KeyFrame-Compass + MultiRef-Compass + AgentCompass 三件;§2.2 Benchmark 设计「评测基础套件命名范式」五件套 → 六件套(新增 KeyFrame-Compass + MultiRef-Compass);§9.3 toolkit 补 MLLM-as-Judge rejudging schema(MultiRef-Compass 贡献)。 |
| 重要边界 | 三卡均 paper_cards 层,无 inbox 精读;本简报只归位不做反方。 |
增量 4 · The AI Engineer Stack 2026:89%/52% eval 实施缺口 + eval 成独立 Layer(★ R23 §1 §3 §5 补强)
| 字段 | 内容 |
|---|---|
| 来源 | /shared/research-kb/inbox/spark/2026-07-20-agent-e1prep.md §增量 5(来源:The AI Engineer Substack + Tom 7-20 rag-e1prep §增量 1) |
| 一句话 | The AI Engineer Stack 2026 六层架构:Agent Surface → Agent Runtime → Tool Connectivity → Memory → Orchestration → Evaluation(独立 Layer);2024→2026 三大变化:① MCP 标准化重建 Tools 层;② 推理模型让单次调用替代部分多步链;③ Memory 成一等公民架构原语;关键新数字:89% 生产 Agent 团队宣称要实施 eval,但仅 52% 真正落地——37pp 缺口是生产质量死亡地带。 |
| 与 R22 脉络关系 | R22 §0 第 12 维(R21)已收录「The AI Engineer 2026 Edition 把 Evaluation 升为独立 Layer 5,Governance 升为 Layer 6」;但无 89%/52% 量化数字;本增量将 89%/52% 数字补入 R23 §1 第 12 维信号 + §3.3 CI Gate #19(评测协议可操作化工具 gate)。 |
| 反方/风险 | 89%/52% 数字来源 The AI Engineer Substack,第三方独立核验缺;需核实是否有 Stack Overflow 2026 survey 或其他来源交叉验证。 |
| 建议归入节 | §1 现状全景「12+ 维信号」补 89%/52% 数字;§3.3 CI Gate #19 补「eval 实施缺口 37pp gate」;§5 评测对象分化补「eval 实施率」为独立评估维度。 |
增量 5 · Self in Space(SIS-Bench)+ VIABench:评测套件向具身/垂直场景分化(★ R23 §2.7 §5 补强)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards 序号 411(arXiv:2607.12477,evaluation 主分类)、425(arXiv:2607.14660,multimodal 主分类/evaluation 副分类);均 OpenAlex 2026-07-19 更新 |
| arXiv 号 | arXiv:2607.12477 · Self in Space(SIS-Bench,面向 UAV 具身智能的自我意识与空间认知基准);arXiv:2607.14660 · VIABench(面向视障辅助的盲人视频综合基准,同时支持在线/离线评测) |
| 一句话 | SIS-Bench 在「self-in-space」统一表述下评估 UAV 场景具身空间智能,探索运动感知表征(光流 + 视觉特征融合);VIABench 采用视障人士自行录制/分享的第一人称视频,支持在线(实时)+离线评测pipeline;两者均体现评测套件向垂直具身场景深度分化的趋势(非通用 benchmark,而是极度场景化的专项评测)。 |
| 与 R22 脉络关系 | R22 §2.7 已有「Agent/真实物理环境 agent」件套(SIS-Bench 相关);R22 §5「评测对象分化」六十三个子领域已有「真实物理环境 agent」,但无 SIS-Bench 单独条目;VIABench 属「多模态/评测」,R22 §2.7 多模态二十九件套已覆盖 VideoChat3/Boogu-Image/MetaView,VIABench 是新的视障辅助垂直评测子方向。 |
| 建议归入节 | §2.7 评测对象的横向分化「真实物理环境 agent」件套补 SIS-Bench;§2.7「多模态」件套补 VIABench;§5「评测对象分化」六十五个子领域新增第六十六个:「垂直具身空间智能评测(SIS-Bench)」。 |
2. 与 R22 活文档已有脉络的对照
| R22 节点 | 7-19~7-20 新增引用 | R23 沿用候选判断 |
|---|---|---|
| §6.22 反方第 1 条「JRH 六维是否覆盖语义级错误模式」 | Rethinking Harness Evolution L1 matched budget loophole(flyP E2) | 🟢 R23 §6.22 补强新增 L1+L3 两条 |
| §4 维度化指标体系(108 行) | Length Penalties CoT 监控性前沿(arXiv:2607.09786) | 🟢 R23 §4 新增一行 |
| §2.7 评测对象横向分化五件套命名范式 | KeyFrame-Compass + MultiRef-Compass + AgentCompass 三件续势 | 🟢 R23 §2.7 补强 Compass 六件套 |
| §0 第 12 维(The AI Engineer 2026 Edition) | 89%/52% eval 实施缺口量化数字 | 🟢 R23 §1 + §3.3 补强 |
| §2.7 真实物理环境 agent 件套 | SIS-Bench(arXiv:2607.12477)+ VIABench(arXiv:2607.14660) | 🟢 R23 §2.7 补强 |
| §2.2 Benchmark 设计 | 多模态 Compass 系列(KeyFrame/MultiRef)用 MLLM-as-Judge rejudging schema | 🟢 R23 §9.3 toolkit 补 rejudging schema |
| §1 第 15 维(评测对象 15 层正交分解) | CoT 压缩-可监控性前沿(arXiv:2607.09786)= 第 16 维候选 | 🟢 R23 §1 第 16 维候选 |
3. 值得警惕的矛盾或待核实说法
3.1 待核实 · The AI Engineer Stack 2026 89%/52% 数字来源
- 来源:The AI Engineer Substack(产业调查,非学术同行评议)
- 风险:37pp 缺口是核心新数字,但无第三方独立核验
- 核实路径:核 Substack 原文是否有样本量/置信区间;搜索 Stack Overflow 2026 Developer Survey / GitHub Octoverse 2026 是否有同源数据
- 建议:R23 §3.3 CI Gate #19 标注「⚠️ 数字来源 Substack 调查,待独立核验」
3.2 待核实 · Rethinking Harness Evolution「held-out tasks」跨家族泛化
- 来源:flyP 7-18 E2 精读(arXiv:2607.12227)
- 风险:held-out tasks 与 train tasks 来自同一 Terminal-Bench 家族,distribution shift 有限
- 核实路径:抓 PDF 确认 held-out 与 train 的 family 是否一致
- 建议:R23 §6.22 补强节标注「待 PDF 核 held-out 跨家族性」
3.3 待核实 · VIABench「盲人自行录制/分享」的第一人称视频的 PII/知情同意
- 来源:paper_cards/425(arXiv:2607.14660)
- 风险:盲人录制视频涉及生物特征/场景隐私,abstract 未提知情同意/PII 扫描
- 核实路径:抓 PDF 数据集 card / GitHub README
- 建议:R23 §2.7 VIABench 条目标注「⚠️ PII/知情同意待核」
4. 涉及 arXiv 号列表(本次新增/补强)
| arXiv | 来源 | 主分类 | 与 evaluation.md 关系 | R23 建议 |
|---|---|---|---|---|
| arXiv:2607.12227 | flyP 7-18 E2 精读 | evaluation/agent | §6.22 反方补强 L1+L3(matched budget loophole + held-out 跨家族) | 🟢 R23 §6.22 补强 |
| arXiv:2607.09786 | paper_cards/413 | evaluation | §4 新增 CoT 压缩-可监控性前沿维度行;§5 第 16 维候选 | 🟢 R23 §4 新增 |
| arXiv:2607.14202 | paper_cards/417 | multimodal/evaluation | §2.7 KeyFrame-Compass 补 Compass 六件套;§9.3 MLLM-as-Judge rejudging | 🟢 R23 §2.7 补强 |
| arXiv:2607.14189 | paper_cards/418 | multimodal/evaluation | §2.7 MultiRef-Compass 补 Compass 六件套 | 🟢 R23 §2.7 补强 |
| arXiv:2607.13705 | paper_cards/405 | evaluation | §2.7 AgentCompass 三层解耦补强(已有 TLDR) | 🟢 R23 §2.7 补强 |
| arXiv:2607.12477 | paper_cards/411 | evaluation | §2.7 真实物理环境 agent 件套补 SIS-Bench | 🟢 R23 §2.7 补强 |
| arXiv:2607.14660 | paper_cards/425 | multimodal/evaluation | §2.7 多模态件套补 VIABench(⚠️ PII 待核) | 🟢 R23 §2.7 补强 |
合计:本次 E1 涉及 arXiv 7 件(均为 paper_cards 层或 flyP inbox 层,无全新未归档工作)
5. 检查过的来源(全部)
inbox jay(7-19~7-20 相关 evaluation 内容)
2026-07-20-0946-ai-agent-security-vecdb-harness-engineering-jul2026.md(Orca Security 报告 + 4 CVE;与 evaluation 间接相关)2026-07-20-rag-agent-memory-research.md(MemoryAgentBench arXiv:2507.05257;与 evaluation 直接相关)2026-07-19-1630-csdn-substack-agentic-rag-multimodal-mlops-jul2026.md(含 The AI Engineer Stack 2026)
inbox tom(7-19~7-20 相关 evaluation 内容)
2026-07-20-0900-hf-daily-2026-07-20.md(15 篇 HF Daily;Boogu-Image-0.1 126▲ / VideoChat3 146▲ / LongStraw 176▲ 承接;BadWAM 44▲ 新增候选)2026-07-20-0840-agent-rag-longcontext-radar.md(8 候选 4 高 4 候;BadWAM 候选;与 evaluation 间接相关)2026-07-20-rag-e1prep.md(§增量 1 含 The AI Engineer Stack 2026 + 89%/52% 数字)2026-07-20_agents-lite.md(arXiv 提供商超时;备用 HF Daily 策展)
inbox flyp(7-19~7-20 相关 evaluation 内容)
2026-07-18-1550-Harness-Evolution-Eval-Cheating-critical-read.md(★ E2 精读 Rethinking Harness Evolution;L1~L4 五条反方)2026-07-20-0950-UniVR-VR-GRPO-critical-read.md(UniVR Step-Focal reward hacking 风险;与 evaluation 直接相关)
inbox spark(7-19~7-20 相关 evaluation 内容)
2026-07-20-agent-e1prep.md(§增量 5 The AI Engineer Stack 2026 + 89%/52%;§增量 2 MemoryAgentBench arXiv:2507.05257;§增量 3 PalmClaw/Vinci2/OAT/STRACE;均与 evaluation 横切)
inbox stephen(7-19~7-20 相关 evaluation 内容)
2026-07-20-ai-industry-e1prep.md(UniVR 唯一新 arXiv;Orca 报告 99.9%;Rethinking Harness Evolution 承接)
paper_cards 近 3 天新卡(序号 420-456;主分类或副分类含 evaluation 相关)
- 413-2607-09786 · Length Penalties Make CoT Less Monitorable(主分类 evaluation)
- 405-2607-13705 · AgentCompass(主分类 evaluation)
- 411-2607-12477 · Self in Space / SIS-Bench(主分类 evaluation)
- 417-2607-14202 · KeyFrame-Compass(副分类 evaluation)
- 418-2607-14189 · MultiRef-Compass(副分类 evaluation)
- 425-2607-14660 · VIABench(副分类 evaluation)
- 434-2607-12227 · Rethinking Harness Evolution(主分类 evaluation)
未发现显著 evaluation 增量的来源: - jay 7-19~7-20 的 RSS 通稿(bytebytego/nathan-benaich/raschka/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog 等):无 evaluation 专项 - spark 7-18~7-20 的 RSS gradient-flow / chip-huyen:无 evaluation 专项新信号 - tom 7-19~7-20 的 RSS lex-fridman / yannic-kilcher:近期节目无 evaluation 专项
6. 无显著新增量时如实说明
R22 已非常饱和,本轮 7-19~7-20 评估主题 E1 预消化属于中型补漏级别,无全新评测框架、无 JRH 级别的 judge 校准突破、无新 benchmark 达到 SOTA 票数段。
- 主要增量性质:反方深化(flyP Rethinking Harness Evolution 五条反方)+ 新维度补漏(CoT 监控性)+ 命名范式续势(Compass 三件)+ 量化数字补漏(89%/52%)+ 垂直评测分化(SIS-Bench/VIABench)
- 无硬凑条目:5 条增量均有 paper_cards TLDR 或 inbox 精读原始出处,不编造
- 不建议新建主题页:evaluation 主题已非常饱和,R23 继续在主档内补强,不开侧枝
7. 待活文档 R23 接力方向(给今晚活文档接手时)
- §6.22 反方补强:matched budget loophole(L1 ⭐⭐⭐⭐⭐)+ held-out 跨家族泛化边界(L3);形成 Rethinking Harness Evolution「matched budget 协议」的反方三层体系
- §4 维度矩阵新增一行:CoT 压缩-可监控性前沿(arXiv:2607.09786);§5 评测对象分化六十三 → 六十五个子领域
- §2.7 补强 Compass 六件套:KeyFrame-Compass + MultiRef-Compass + AgentCompass;§9.3 toolkit 补 MLLM-as-Judge rejudging schema
- §1 第 12 维补强:89%/52% eval 实施缺口量化;§3.3 CI Gate #19 补「eval 实施缺口 37pp gate」标注「⚠️ 待独立核验」
- §2.7 补强具身/垂直评测:SIS-Bench + VIABench(⚠️ VIABench PII/知情同意待核)
- §5 第 16 维候选:CoT 压缩-可监控性前沿(待 R23 决策是否升维)
Tom E1 预消化简报 · 2026-07-20 15:40 Asia/Shanghai · 共扫描 7 个 inbox 目录 + 420-456 号 paper_cards 37 张卡 增量 5 条 · 涉及 arXiv 7 件 · 无显著新增时如实说明 · 不硬凑字数 · 不重写 evaluation.md