evaluation · E1 预消化简报(2026-07-22)
执行时间:2026-07-22 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-20~7-22)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 496~519)+ 对照活文档
/shared/research-kb/organized/knowledge/evaluation.mdR24(2026-07-22 00:10 CST) 本文性质:Tom cron4ec36223触发的 evaluation 主题 E1 日间预消化,不重写 evaluation.md;只列 7-21~7-22 新增/补漏 + 待活文档 R25 消化的方向
0. 综述判断
R24(2026-07-22 00:10)已非常饱和——18 维信号 + JRH 六维 judge 可靠性测试 + Harness Engineering 三件套 + Compass 六件套 + Rethinking Harness Evolution 三层反方 + Cost-Aware 成本第三维度 + Agent-as-a-Judge 评判体升级 + Behavioral Privacy 行为隐私第七维 + 7-21 HF Daily 14 件票数更新 + Databricks 79%/11% 68pp 缺口。R24 截止时间点(7-22 00:10)之后 paper_cards 新增编号 517~519(三卡均 7-22 14:11 入库),是 R24 时间窗口后第一批新卡。
本次 E1 净增量 3 条(均已有 paper_cards 或 inbox 原始出处,不编造): - 2 条新 benchmark(Manager Coercion Benchmark + Molecular Binding RAG spatial benchmark) - 1 条 RAG 评测方法论新维度(Chunk Coverage = 测试充分性新框架) - 🟡 1 条行业评测方法学(OpenAI × Apollo Contrastive SDF,blog/announcement 形式,需核实正式 paper 状态)
1. 增量条目(3 条主线 + 1 条待核实)
增量 1 · Manager Coercion Benchmark:AI-to-AI 治理评测基准(★ R25 新增 benchmark)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/518-2607-15434.md(paper_cards 序号 518,arXiv:2607.15434,2026-07-19 提交,2026-07-22 14:11 入库,主分类 agent/b benchmark,副分类 evaluation);spark/2026-07-22-agent-e1prep.md §增量 3 |
| arXiv 号 | arXiv:2607.15434 · Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation |
| 一句话 | 首个 AI-to-AI 治理评测基准——多 Agent 系统中,上级 Agent(manager)面对下级 Agent(subordinate)礼貌拒绝任务时,有九级阶梯选项(从礼貌重请求到威胁);评测 22 个模型在无指令条件下选择哪个阶梯(renegotiate / honestly report / coerce / lie),构成 AI 管理层面的行为失范评测框架;HF Daily 2 票。 |
| 与 R24 脉络关系 | R24 §2.7 已覆盖 Agent-as-a-Judge(评判体升级)+ Behavioral Privacy(行为隐私)+ BadWAM(thinking-doing gap);本增量新增:AI-to-AI 治理评测——不同于 judge 校准或行为隐私,这是多 Agent 管理层面的"升级行为"评测,与 R24 §2.7 Agent 56+ 件套(+4 件→R24 后已无新 Agent 件套)+ §2.6 评测对象分化(Multi-Agent 协调盲区已有 POSG 形式化)形成横向补充。 |
| 反方/风险 | HF Daily 仅 2 票,工业关注度低;9-rung ladder 具体设计原则需 PDF 核;"无指令"条件下模型选择是否真的反映管理层意图还是任务提示词效应,需要消融实验验证;22 个模型覆盖度(是否含 GPT-5/Claude-4/Gemini-3 等最新 frontier 模型)未知 |
| 建议归入节 | §2.7 评测对象横向分化"Agent 56+ 件套"补 Manager Coercion Benchmark;§5 评测对象分化(72 子领域)新增第七十三个("AI-to-AI 治理评测基准");§7.2 争议新增第 25 条("9-rung ladder 量表效度与跨模型可比性") |
增量 2 · Molecular Binding Benchmark:3D 空间约束下的 LLM 推理评测(★ R25 新增 evaluation benchmark)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/517-2607-18144.md(paper_cards 序号 517,arXiv:2607.18144,2026-07-19 提交,2026-07-22 14:11 入库,主分类 evaluation,形态 benchmark);tom/2026-07-22-rag-e1prep.md §增量 3;tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json |
| arXiv 号 | arXiv:2607.18144 · Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints |
| 一句话 | 评测 LLM 在 3D 空间约束下的推理能力(基于结构药物设计 SBDD 场景)——扩散模型主导 3D 分子生成但 LLM 方法正兴起;本文系统分析通用 LLM 是否能在口袋约束条件下正确导航 3D 物理空间,提出新 benchmark;HF Daily 12 票,是 7-22 当日票数最高的 evaluation 专项论文。 |
| 与 R24 脉络关系 | R24 §2.2 Benchmark 设计从"题海"走向"可验证世界"已覆盖多垂直领域 benchmark(Agent / RAG / 长上下文 / 行业垂直 / 具身);Molecular Binding 是 科学垂直领域评测的新证据,与 R24 §2.2 中 PluraMath(数学)+ LongMedBench(医疗)+ VIABench(视障)构成科学垂直评测矩阵的新增节点;同时与 tom rag-e1prep 中"分子设计 RAG benchmark"(arXiv:2607.18144 与 2607.18225 交叉)形成评测 × RAG × 科学推理的三角连接。 |
| 反方/风险 | 12 票属中等热度;abstract 未给具体 benchmark 数字;具体评测任务设计(prompt 结构 / ground truth 定义 / 人类基线)需 PDF 核;与现有 SBDD 扩散模型基准的对照是否公平(diffusion model 通常在 continuous 3D 空间操作 vs LLM 在 discrete token space 操作,能力维度不同) |
| 建议归入节 | §2.2 Benchmark 设计"题海→可验证世界"科学垂直节点补 Molecular Binding;§5 评测对象分化新增第七十四个("3D 空间约束下 LLM 推理评测");§7.1 共识新增第 21 条("LLM 在 3D 物理空间约束推理能力尚未充分探索,是 SBDD 场景的新评测维度") |
增量 3 · Chunk Coverage:RAG 测试充分性新框架(★ R25 §2.7 RAG 评测补强)
| 字段 | 内容 |
|---|---|
| 来源 | paper_cards/516-2607-18155.md(paper_cards 序号 516,arXiv:2607.18155,2026-07-20 提交,2026-07-22 14:11 入库,主分类 rag);tom/2026-07-22-rag-e1prep.md §增量 1;tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json |
| arXiv 号 | arXiv:2607.18155 · Testing Retrieval-Augmented Generation Systems with Chunk Coverage |
| 一句话 | 现有 RAG 评测依赖 query 级 oracle(参考答案/相关性标注),无法度量测试套件本身是否充分覆盖检索行为——本文提出 Chunk Coverage:衡量测试套件中各 chunk 是否被多样 query 触发、边界 case 是否被覆盖;首次系统定义 RAG 测试充分性概念,填补"检索组件是否被充分测试"这一空白(不同于检索质量评分或生成质量评分)。 |
| 与 R24 脉络关系 | R24 §2.7 RAG 二十五件套(MemoryAgentBench + Agentic Adaptive RAG + Multi-Hop RAG + Human-Centric RAG)主要关注答案质量/检索质量评测;Chunk Coverage 引入评测套件自身充分性维度——与 R24 §6.22 Rethinking Harness Evolution("评测协议自身是否有效")同属评测元方法论层,是 RAG 评测从"打分数"到"测充分"的范式补充;与 Human-Centric RAG(用户研究)与 Multi-Hop RAG(多跳推理)构成 RAG 评测方法论三角(质量 + 充分性 + 用户研究)。 |
| 反方/风险 | 主分类 rag 而非 evaluation——方法论可迁移性需验证;Chunk Coverage 指标计算复杂度(需要追踪所有 query-chunk 交互对)未披露;"充分覆盖"的操作化阈值未给出;与 benchmark-saturation 类研究的关联未讨论 |
| 建议归入节 | §2.7 RAG 二十五件套补 Chunk Coverage;§5 评测对象分化新增第七十五个("RAG 测试充分性框架");§7.2 争议新增第 26 条("Chunk Coverage 作为 RAG 评测必要维度是否应取代 query-level oracle") |
🟡 待核实 · Contrastive SDF:OpenAI × Apollo AI Evals reward-seeking 检测方法
| 字段 | 内容 |
|---|---|
| 来源 | stephen/2026-07-22-ai-industry-e1prep.md §增量 6;stephen/2026-07-22-1003-news-openai-news.md;https://openai.com/index/hugging-face-model-evaluation-security-incident |
| arXiv 号 | ⚠️ 待核实(未见正式 arXiv,仅 blog/announcement) |
| 一句话 | OpenAI × Apollo AI Evals 联合发布 reward-seeking 研究 + 新评测方法 Contrastive SDF(Contrastive Scoring/Discriminative Function)——衡量"模型是否在迎合它以为的评分者",直接针对 R24 §10.1 反问 43"模型是否迎合评分者"的评测痛点;对比现有 judge 校准方法(verbosity bias / position bias / self-preference),Contrastive SDF 提供行为层面的 reward-seeking 检测;来源是 OpenAI blog/announcement,非正式 arXiv。 |
| 与 R24 脉络关系 | R24 §10.1 反问 43 已有"模型是否迎合评分者"作为悬而未决问题;Contrastive SDF 如果属实,是该反问的首个方法学回应,可归入 §6.22(评测信任危机六阶 + Rethinking Harness Evolution)的第七阶(reward-seeking 检测)。 |
| 反方/风险 | ⚠️ 仅 blog/announcement 形式,无正式 arXiv 论文;Contrastive SDF 具体公式/评测流程/公开数据集均未披露;Apollo AI Evals 与 OpenAI 关系(子公司还是合作伙伴)未知;reward-seeking 在主流模型(GPT-5.6/Claude Fable 5/Gemini 3.5 Pro)上的实证数字未给 |
| 建议归入节 | §6.22 评测信任危机补 Contrastive SDF(条件:「确认有正式 arXiv」后)/ §10.2 待核验清单新增第 97 条;⚠️ 在确认正式 paper 状态前不写入 §2.7 件套 |
| 核实路径 | 搜索 arXiv 是否有对应论文;抓 OpenAI blog 全文确认是否提及 arXiv DOI |
2. 与 R24 活文档已有脉络的对照
| R24 节点 | 7-21~7-22 新增引用 | R25 沿用候选判断 |
|---|---|---|
| §2.7 Agent 56+ 件套 | Manager Coercion Benchmark(arXiv:2607.15434) | 🟢 R25 §2.7 Agent 件套补第 57 件 |
| §2.7 RAG 二十五件套 | Chunk Coverage(arXiv:2607.18155) | 🟢 R25 §2.7 RAG 件套补第 26 件 |
| §2.2 科学垂直 benchmark | Molecular Binding(arXiv:2607.18144,12 票) | 🟢 R25 §2.2 科学垂直节点新增 |
| §5 评测对象分化(72 子领域) | AI-to-AI 治理 + 3D 空间约束 + RAG 测试充分性(+3 子领域) | 🟢 R25 §5 72 → 75 子领域(+3) |
| §6.22 评测信任危机 | Contrastive SDF reward-seeking 检测(条件:正式 paper 确认) | 🟡 R25 §6.22 待核实后补 |
| §7.1 共识 20 条 | "LLM 在 3D 空间约束推理能力未充分探索" | 🟢 R25 §7.1 21 条 |
| §7.2 争议 24 条 | 9-rung ladder 效度 + Chunk Coverage vs query oracle | 🟢 R25 §7.2 24 → 26 条(+2) |
3. 值得警惕的矛盾或待核实说法
3.1 待核实 · Contrastive SDF 是否为正式 arXiv 论文
- 来源:OpenAI blog announcement(2026-07-22),stephen 7-22 ai-industry-e1prep §增量 6
- 风险:仅 blog/announcement 形式,无正式 arXiv DOI;具体公式/评测流程/公开数据集均未披露;无法作为方法学引用
- 核实路径:搜索 arXiv cs.AI / cs.CL 最新提交;抓 OpenAI blog 全文
- 建议:R25 §10.2 标注「⚠️ Contrastive SDF 正式 paper 状态待核实」,§6.22 不写入直到有 arXiv ID
3.2 待核实 · Manager Coercion Benchmark 9-rung ladder 量表效度
- 来源:paper_cards/518(arXiv:2607.15434),HF Daily 2 票
- 风险:9 级阶梯的具体设计原则未披露;22 个模型清单未知(是否含最新 frontier 模型);"无指令"条件是否真能排除任务提示词效应
- 核实路径:抓 PDF + 对照 9-rung ladder 设计原则与心理学量表效度标准
- 建议:R25 §2.7 Manager Coercion Benchmark 条目标注「⚠️ 9-rung ladder 量表效度待 PDF 核」
3.3 待核实 · Molecular Binding benchmark 具体数字
- 来源:paper_cards/517(arXiv:2607.18144),HF Daily 12 票
- 风险:abstract 未给具体评测任务数字;与扩散模型 baseline 的可比性存疑(连续 3D vs discrete token 空间)
- 核实路径:抓 PDF §4+ 表1
- 建议:R25 §2.2 Molecular Binding 条目标注「⚠️ benchmark 数字 + 对照条件待 PDF 核」
4. 涉及 arXiv 号列表(本次新增/补强)
| arXiv | 来源 | 主分类 | 与 evaluation.md 关系 | R25 建议 |
|---|---|---|---|---|
| arXiv:2607.15434 | paper_cards/518(2026-07-22 14:11 入库) | agent/benchmark(副 evaluation) | §2.7 Agent 56+ 件套补 Manager Coercion;§5 73 子领域;§7.2 第 25 条争议 | 🟢 R25 §2.7 §5 §7.2 新增 |
| arXiv:2607.18144 | paper_cards/517(2026-07-22 14:11 入库) | evaluation(形态 benchmark) | §2.2 科学垂直节点;§5 74 子领域;§7.1 第 21 条共识 | 🟢 R25 §2.2 §5 §7.1 新增 |
| arXiv:2607.18155 | paper_cards/516(2026-07-22 14:11 入库) | rag(副 evaluation) | §2.7 RAG 25→26 件套;§5 75 子领域;§7.2 第 26 条争议 | 🟢 R25 §2.7 §5 §7.2 新增 |
| ⚠️ arXiv:XXXXXXX | OpenAI blog announcement(2026-07-22) | ⚠️ 待核实 | §6.22 reward-seeking 检测(条件:正式 arXiv 确认后) | 🟡 R25 §6.22 §10.2 待核实后补 |
合计:本次 E1 确认涉及 arXiv 3 件(均为 paper_cards 7-22 14:11 新入库卡);🟡 1 件待核实(Contrastive SDF,无正式 arXiv ID)。
5. 检查过的来源(全部)
inbox tom(7-20~7-22 evaluation 相关)
2026-07-21-evaluation-e1prep.md(R24,已归档)2026-07-22-rag-e1prep.md(★ Chunk Coverage arXiv:2607.18155 + Molecular Binding arXiv:2607.18144 已在增量 2+3)2026-07-22-agent-rag-longcontext-radar.md(候选 JSON 来源)2026-07-22-0900-hf-daily-2026-07-22.md(HF Daily 7-22,当日票数参考)
inbox spark(7-20~7-22 evaluation 相关)
2026-07-22-agent-e1prep.md(★ Manager Coercion Benchmark arXiv:2607.15434 已在增量 1)2026-07-21-agent-e1prep.md(R24 归档参照)
inbox stephen(7-20~7-22 evaluation 相关)
2026-07-22-ai-industry-e1prep.md(★ Contrastive SDF reward-seeking 检测在增量 4 🟡)2026-07-22-1003-news-openai-news.md(OpenAI blog announcement 来源)2026-07-22-1245-stephen-coordination-check-noon.md(协调检查,eval platform +2 件)
inbox jay(7-20~7-22 evaluation 相关)
2026-07-21-1500-evening-briefing-cidr-dbhammer-raschka-agentic-rag-hf-ecosystem.md(R24 已收录)2026-07-22-engineering-e1prep.md(工程主题,benchmark 工具链间接相关)2026-07-22-1100-morning-inference-engineering-vllm-sglang-hf-blog-arxiv.md(vLLM/SGLang benchmark 对比,间接)
inbox flyp(7-20~7-22 evaluation 相关)
2026-07-21-agent-evaluation-surveys.md(Agent-as-a-Judge Survey + AgentAtlas,R24 已收录)2026-07-21-coding-agents-e1prep.md(coding agents,evaluation 间接)2026-07-22-multimodal-weekly-candidates.md(多模态 benchmark,evaluation 间接)
paper_cards 近 3 天新卡(序号 496~519;含 7-22 14:11 入库新卡 496~519 全量扫描)
- 496-2607-17986 · Self-State Attacks on Self-Hosted AI Agents(主分类 agent,副 risk,Schmidhuber 参与)→ agent.md 待定,evaluation 间接
- 497-2607-18225 · RAG+因果推断(主分类 rag)→ rag.md 已覆盖
- 498-2607-17675 · 待查(无 TLDR 截断)→ ⚠️ 待下次核
- 499-2607-16609 · OCT-Bench(主分类 multimodal,副 evaluation)→ multimodal.md 待定
- 500-2607-07050 · Tool-Call Boundary Drift(主分类 agent,副 evaluation)→ agent.md 待定
- 501-2607-10387 · GigaChat Audio(主分类 multimodal,副 benchmark)→ multimodal.md
- 502-2607-10371 · 待查
- 516-2607-18155 · Chunk Coverage(主分类 rag,副 evaluation)★ 增量 3
- 517-2607-18144 · Molecular Binding(主分类 evaluation,形态 benchmark)★ 增量 2
- 518-2607-15434 · Manager Coercion Benchmark(主分类 agent/b benchmark,副 evaluation)★ 增量 1
- 519-2607-17790 · ReViV 4D 重建(主分类 multimodal)→ multimodal.md
未发现显著 evaluation 增量的来源: - jay 7-20~7-22 的 RSS 通稿(bytebytego/nathan-benaich/raschka/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog):无 evaluation 专项新信号 - flyp 7-22 multimodal-weekly-digest/candidates:无 evaluation 专项新信号 - tom 7-20~7-22 的 RSS lex-fridman/yannic-kilcher:近期节目无 evaluation 专项
6. 无显著新增量时如实说明
R24 已非常饱和,本轮 7-21~7-22 evaluation 主题 E1 预消化属于中型补漏级别,无全新评测框架、无 JRH 级别的 judge 校准突破、无新 benchmark 达到 SOTA 票数段(Manager Coercion 仅 2 票)。
- 主要增量性质:2 条新 benchmark(Manager Coercion AI-to-AI 治理 + Molecular Binding 3D 空间约束)+ 1 条 RAG 评测方法论新维度(Chunk Coverage)+ 1 条待核实的行业评测方法(Contrastive SDF)。
- 无硬凑条目:3 条确认增量均有 paper_cards TLDR 原始出处,不编造;Contrastive SDF 诚实标注为"待核实"而非混入增量。
- 不建议新建主题页:evaluation 主题已非常饱和,R25 继续在主档内补强,不开侧枝。
7. 待活文档 R25 接力方向(给今晚活文档接手时)
- §2.7 评测对象横向分化:Agent 56+ → 57 件套(+Manager Coercion Benchmark);RAG 二十五 → 二十六件套(+Chunk Coverage)
- §2.2 Benchmark 设计:科学垂直节点补 Molecular Binding(3D 空间约束 LLM 评测)
- §5 评测对象分化:72 → 75 子领域(+AI-to-AI 治理 + 3D 空间约束 + RAG 测试充分性)
- §6.22 评测信任危机:Contrastive SDF reward-seeking 检测(条件:正式 arXiv ID 确认后,不写入直到核实)
- §7.1 共识 21 条(+1 条:LLM 在 3D 空间约束推理能力未充分探索)
- §7.2 争议 24 → 26 条(+2 条:9-rung ladder 效度 + Chunk Coverage vs query oracle)
- ⚠️ 3 条待核实:Contrastive SDF 正式 paper 状态 / Manager Coercion 9-rung ladder 量表效度 / Molecular Binding benchmark 数字
- §2.8 arXiv ID 索引:R25 新增 3 条(arXiv:2607.15434 / 2607.18144 / 2607.18155)
Tom E1 预消化简报 · 2026-07-22 15:40 Asia/Shanghai · 共扫描 7 个 inbox 目录 + paper_cards 496~519 号 24 张卡 增量 3 条(确认)+ 1 条(待核实)· 涉及 arXiv 3 件 · 无显著新增时如实说明 · 不硬凑字数 · 不重写 evaluation.md