evaluation · E1 预消化简报(2026-07-25)

执行时间:2026-07-25 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-23~7-25)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 564~585)+ 对照活文档 /shared/research-kb/organized/knowledge/evaluation.md R26(2026-07-24 R26 · 固化时间 2026-07-24 14:00 CST) 本文性质:Tom cron 4ec36223 触发的 evaluation 主题 E1 日间预消化,不重写 evaluation.md;只列 7-25 新增/补漏 + 待活文档 R27 消化的方向


0. 综述判断

R26(2026-07-24 R26 · 15 维度信号 + 法律垂直 AILQA + 多 Agent 评判 EduPanel + 评估混淆 Transcription Policy + 物理定律视频 Apple-π 四件入库 + 68pp 生产质量死亡地带)已非常饱和。

本次 E1 净增量 2 条(均已有 paper_cards 原始出处,不编造): - 1 条新 evaluation benchmark 专项(Show, Don't Tell:像素级空间认知评测基准,evaluation 主分类,HF Daily #6 · 34▲,★ 本轮最强增量) - 1 条 evaluation 维度量化旁证(Compounding Error 0.85^10 ≈ 0.197 + Gartner 2027 40% 废弃预测 → 与 R26 68pp eval gap 死亡地带形成生产失败量化闭环)

旁证 3 条(非 evaluation 主分类,但提供 evaluation 维度旁证): - K12-KGraph(arXiv:2605.09635,教育 LLM 课程认知评测基准,evaluation 主分类,HF Daily 40▲,教育垂直 benchmark,与 evaluation 关联偏弱) - OpenForgeRL(arXiv:2607.21557,harness-native agent 训练,evaluation 主分类为形态 method,与 R26 §1.33c Harness 工程化栈邻接) - Cameron Wolfe agentic evaluation 三连(Agentic World Models + Agentic RL + Agent 评估详尽指南,立场层立标)

无显著全新 benchmark 或 JRH 级别 judge 校准突破;本次属于小型补漏级别,无硬凑条目。


1. 增量条目(1 条确认 + 1 条量化旁证)

增量 1 · Show, Don't Tell:像素级空间认知评测基准——"答案接口不匹配"问题的新 benchmark(★ R27 新增 evaluation benchmark 专项)

字段 内容
来源 paper_cards/565-2607-21072.md(paper_cards 序号 565,arXiv:2607.21072,2026-07-21 提交,建卡时间待确认,主分类 evaluation,形态 benchmark);tom/2026-07-25-0900-hf-daily-2026-07-25.md(HF Daily #6 · 34▲,当日高票);tom/2026-07-25T1440-agent-rag-longcontext-radar.md(候选引用)
arXiv 号 arXiv:2607.21072 · Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
一句话 现有空间推理 benchmark 要求坐标/选项/文本,但图像生成模型的强项是"指向/标记/绘制"而非报告精确坐标——造成答案接口不匹配(answer-interface mismatch)。本文提出像素级空间认知评测:强制图像生成模型通过生成像素而非输出文本来表达位置/区域/路径,从而在相同任务语义下与 LLM 对齐评测。填补了"图像生成模型空间智能无法被现有评测测量"的方法论空白。
与 R26 脉络关系 R26 §2.2 Benchmark 设计"题海→可验证世界"已有 VIABench(视障)、Molecular Binding(科学 3D)、Apple-π(物理定律视频)等垂直 benchmark;Show, Don't Tell 是视障辅助场景向图像生成空间智能的延伸——引入"答案接口不匹配"这一评测方法论新问题(模型强项与 benchmark 接口不匹配导致无法公平评测),与 R26 §6.22 评测信任危机的"评估混淆"(Transcription Policy 60% WER)形成跨领域呼应:两者都是"评测接口与被测能力接口不匹配导致评估失真**;同时与 R26 §2.2 垂直 benchmark 矩阵互补;与 R26 §5 评测对象分化(32 维)形成第 34 个候选维度("图像生成模型空间认知评测")。
反方/风险 具体评测结果(各模型绝对分数 / 图像生成模型 vs LLM 跨模态对照)TLDR 未完整披露;"空间认知"的操作化定义(指向/标记/绘制是否真反映"空间推理"而非只是"视觉 motor 输出")存在概念效度争议;pixel-level ground truth 如何对齐不同评测任务的尺度未披露;与 existing VQA benchmark(VQAv2/GQA等)的关系需对比确认
建议归入节 §2.2 Benchmark 设计"题海→可验证世界"补 Show, Don't Tell(答案接口不匹配,图像生成模型空间认知评测);§6.22 评测信任危机补"答案接口不匹配"(与 Transcription Policy 评估混淆跨领域呼应);§5 评测对象分化新增第 34 个候选维度("图像生成模型空间认知评测");§7.1 共识新增第 26 条("答案接口不匹配(answer-interface mismatch)是跨模态评测的新兴方法论问题,图像生成模型的空间智能需要像素级评测接口")

旁证 1 · Compounding Error 量化公式 + Gartner 2027 40% Agentic AI 项目废弃预测(★ R27 evaluation 量化旁证,生产失败闭环)

字段 内容
来源 jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md(theaiengineer.substack.com · Paolo Perrone · 2026-07-25);spark/2026-07-25-agent-e1prep.md §增量 8(★ P1 旁证,已收录)
arXiv 号 无 arXiv(来源为 Substack + Gartner 预测)
一句话 Agent 生产失败三模式:① Dumb RAG(检索低质量上下文却以完整置信度陈述)② Brittle Connectors(凭证过期/Schema 变更/API 版本)③ Compounding Error(每步 85% 准确率,10 步工作流成功率仅 20% · 0.85^10 ≈ 0.197);关键洞察:确定性系统失败是 loud(报错可见),Agent 失败是 quiet(静默累积误差);Gartner 预测 2027 年 40% Agentic AI 项目废弃。
与 R26 脉络关系 R26 §1(第 14 重范式跃迁)Databricks State of AI Agents Report 2026:79% 采用 vs 11% 生产的 68pp 缺口 + AI Engineer Stack 2026:89% observability / 52% eval 落地 = 37pp 缺口;Compounding Error 量化公式 0.85^10 ≈ 0.197 将"多步 Agent 工作流静默失败累积"量化为具体数字,与 68pp 生产质量死亡地带的形成机制形成闭环解释;"quiet failure"(静默失败)与 R26 §6.22 评测信任危机(评估混淆 / Transcrption Policy 60% WER)形成"评估自身不可信"的另一面:不仅评测工具有偏差,生产失败本身也静默累积难以被观测;与 R26 §2.6 评测、可靠性与对抗邻接。
反方/风险 0.85 准确率数字来源未明确(哪个 benchmark 的 85%?何种任务类型?);10 步工作流代表性问题(真实生产环境可能是 50+ 步);"quiet failure"与"loud failure"区分缺乏形式化定义;Gartner 40% 废弃预测与 Berkeley RDI 2027 末 40% 取消风险预测是否同源未交叉核验(R26 §2.7 待核实)
建议归入节 §6.22 评测信任危机补 Compounding Error 量化公式(0.85^10 ≈ 0.197,多步工作流静默失败累积机制);§7.1 共识新增第 27 条("Agent 生产失败的主要机制是静默累积误差(quiet failure),而非确定性报错(loud failure),导致评测低估真实失败率");§7.1 共识新增第 28 条("多步 Agent 工作流的成功概率呈指数衰减,10 步后仅剩约 20%,这对评测覆盖度设计有直接影响")

2. 旁证条目(3 条)

旁证 1 · K12-KGraph:课程对齐知识图谱——教育 LLM 评测基准(evaluation 主,HF Daily 40▲)

字段 内容
来源 paper_cards/572-2605-09635.md(paper_cards 序号 572,arXiv:2605.09635,建卡时间待确认,主分类 evaluation,形态 benchmark);tom/2026-07-25-0900-hf-daily-2026-07-25.md(HF Daily #4 · 40▲,当日第二高票);tom/2026-07-25T0840-agent-rag-longcontext-radar.md(候选引用)
arXiv 号 arXiv:2605.09635 · K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
一句话 现有教育 LLM benchmark 主要测试考试答题,而非测试"课程知识结构与可视化呈现方式的理解"(curriculum cognition)——涵盖先修关系链、概念分类法、实验-概念关联、教学排序与视觉定位。从人民教育出版社官方教材(数学/物理/化学/生物)提取,覆盖小/初/高。
与 R26 脉络关系 R26 §2.2 Benchmark 设计已有法律(AILQA)、金融(FinMMEval)、医疗(VIABench)、科学(Molecular Binding)垂直 benchmark;K12-KGraph 是教育垂直 benchmark 的新增节点,与 R26 §5 评测对象分化(32 维)形成第 35 个候选维度("K-12 课程认知评测");但与 R26 §6(多模态/物理/ASR 等核心评测维度)关联较弱,定位偏教育垂直而非通用评测方法论。
反方/风险 HF Daily 40▲ 高票但与 evaluation 主题核心维度(harness/judge/agent/rag 评测方法论)关联有限;arXiv 编号 2605 为 2025 年 5 月提交,论文较旧;"课程认知"(curriculum cognition)是否成为通用评测维度而非教育专项未论证
建议归入节 §2.2 Benchmark 设计旁证补 K12-KGraph(教育垂直课程认知评测,evaluation 主分类但关联偏弱);§5 评测对象分化候选第 35 个("K-12 课程认知评测",P3 旁证级)

旁证 2 · OpenForgeRL benchmark 数据:6 harness × 6 基准的系统性实证(evaluation 主分类,method 形态)

字段 内容
来源 paper_cards/585-2607-21557.md(paper_cards 序号 585,arXiv:2607.21557,2026-07-23 提交,建卡时间待确认,主分类 evaluation,形态 method,副 agent);tom/2026-07-25-0900-hf-daily-2026-07-25.md(HF Daily 当日未上榜,无票数);tom/2026-07-25T0840-agent-rag-longcontext-radar.md(★ 高价值候选 #2);work-queue.md(Top 15 高价值候选,权重 0.5)
arXiv 号 arXiv:2607.21557 · OpenForgeRL: Train Harness-native Agents in Any Environment
一句话 OpenForgeRL 提出的 6 harness(Claude Code / Codex / OpenClaw 等)× 6 评测基准(ClawEval / QwenClawBench / MCPAtlas / OSWorld-Verified / Online-Mind2Web / WebVoyager)系统性评测数据——OpenForge-Claw(30B-A3B MoE)ClawEval pass³ 31.7 / QwenClawBench 33.7 / MCPAtlas 28.1;OpenForge-GUI(8B)OSWorld-Verified 37.7 / Online-Mind2Web 63.0 / WebVoyager 72.3;揭示 harness design 直接影响 RL 训练效率(Codex 比 OpenClaw 难收敛);benchmark 分数与 harness 选择存在显著相关性。
与 R26 脉络关系 R26 §1.33c AI Agents Stack 2026(Evaluation Layer)已有 89% observability / 52% eval 落地 37pp 缺口;OpenForgeRL 的 6×6 实征数据从harness 选择影响评测结果角度为 37pp 缺口提供机制解释:不同 harness 产生的训练信号质量不同,导致同一模型在不同 harness 下评测分数不可比;与 R26 §2.5 运行时与基础设施(HACO / SkewAdam / FlashRT)以及 §1.33c Harness Engineering 学科化邻接;但 OpenForgeRL 主分类 evaluation 形态 method,核心贡献是 agent 训练基础设施,评测数字属于副产品。
反方/风险 评测结果(各 harness 绝对分数)作为 method 输出而非 primary evaluation contribution,具体实验设计(是否控制 base model / 是否消融 proxy effect / 是否跨云 determinism)未充分披露;6×6 覆盖度("任意 harness × 任意环境"声明与实测 6×6 差距)存疑;benchmark 分数本身未在 TLDR 中完整披露
建议归入节 §1.33c AI Agents Stack 2026 Evaluation Layer 邻接(OpenForgeRL 6×6 harness-benchmark 实证,harness 选择影响评测结果);§2.2 Benchmark 设计旁证(harness间评测结果可比性,与 AgentCompass 解耦思路呼应);§7.1 共识新增第 29 条("harness 选择直接影响 agent 评测结果,同一模型在不同 harness 下评测分数不可直接比较,需要标准化 harness 评测协议")

旁证 3 · Cameron Wolfe 7-25 agentic 三连——Agent 评估详尽指南(立场层立标,comment layer)

字段 内容
来源 flyp/2026-07-25-1000-rss-cameron-wolfe.md(5 条 · Agentic World Models + Agentic RL + Agent 评估详尽指南);spark/2026-07-25-agent-e1prep.md §增量 9
arXiv 号 无 arXiv(来源为 Cameron Wolfe blog)
一句话 Cameron Wolfe 7-25 连发三篇:① Agentic World Models(世界模型在 agentic AI 中的角色)② Agentic RL(框架与最佳实践)③ Agent 评估详尽指南(How to Evaluate Agents — A Running List)——系统梳理现有 agent 评测方法,涵盖 benchmark 类型、harness 设计、judge 可靠性、轨迹诊断等。
与 R26 脉络关系 R26 §1(第 7 重范式跃迁)评测元方法学三源合流(Cameron Wolfe + Gradient Flow + Lilian Weng)已将 Wolfe 列为评测立场层(comment layer)来源;本次 Wolfe "Agent 评估详尽指南"是 R26 三源合流的第 4 次立标续立,进一步巩固 Cameron Wolfe 作为 agent 评测方法论评论权威的地位;与 R26 §7.2 争议(judge 校准路线分歧)和 §7.1 共识形成评论层锚点。
反方/风险 blog post 无正式 arXiv;具体评测建议是否经过 peer review 未验证;立场层立标(comment layer)不能作为 primary source 引用
建议归入节 §7.2 争议旁证补 Cameron Wolfe "Agent 评估详尽指南"(立场层立标,comment layer 第 4 次续立);§7.1 共识旁证(评论层锚点,与 Lilian Weng / Gradient Flow 三源合流续立)

3. 与 R26 活文档已有脉络的对照

R26 节点 7-25 新增引用 R27 沿用候选判断
§2.2 Benchmark 设计(垂直 benchmark 矩阵) Show, Don't Tell(arXiv:2607.21072,答案接口不匹配)+ K12-KGraph(arXiv:2605.09635,教育垂直) 🟢 R27 §2.2 新增 Show, Don't Tell(强);🟡 K12-KGraph(弱,P3 旁证级)
§6.22 评测信任危机 Show, Don't Tell(答案接口不匹配,跨领域呼应 Transcription Policy)+ Compounding Error(0.85^10 ≈ 0.197,quiet failure 量化) 🟢 R27 §6.22 双节点新增(答案接口不匹配 + quiet failure 量化公式)
§1.33c AI Agents Stack 2026 Evaluation Layer OpenForgeRL 6×6 harness-benchmark 实证 🟡 R27 §1.33c 旁证(method 副产品,但实证数据有价值)
§5 评测对象分化(32 维) Show, Don't Tell + K12-KGraph(+1~2 维度候选) 🟢 R27 §5 32 维 → 34~35 维(+1~2)
§7.1 共识 25 条 答案接口不匹配 + quiet failure + 多步工作流指数衰减 + harness 选择影响可比性 🟢 R27 §7.1 25 → 29 条(+4 条)

4. 值得警惕的矛盾或待核实说法

4.1 待核实 · Show, Don't Tell 具体评测结果与"答案接口不匹配"的有效性

  • 来源:paper_cards/565(arXiv:2607.21072),TLDR 未给各模型绝对分数 / 图像生成模型 vs LLM 跨模态对照分数
  • 风险:无法判断"像素级输出"是否真比"文本坐标输出"更能反映空间认知;pixel-level ground truth 标注方式未披露
  • 核实路径:抓 PDF §4(实验)+ §3(benchmark design)确认具体任务类型 / 评测结果 / ground truth 标注协议
  • 建议:R27 §2.2 Show, Don't Tell 条目标注「⚠️ benchmark 数字 + 答案接口不匹配操作化定义有效性待 PDF 核」

4.2 待核实 · Compounding Error 0.85 准确率来源 + quiet failure 形式化定义

  • 来源:jay 7-25 substack(theaiengineer.substack.com),非正式 arXiv
  • 风险:0.85 每步准确率来源未注明(哪个 benchmark?何种任务类型?);"quiet failure"与"loud failure"缺乏形式化定义,概念边界模糊
  • 核实路径:追溯 Substack 原文确认 0.85 数字来源;查找是否有相关 arXiv 论文提供 formal model
  • 建议:R27 §6.22 Compounding Error 条目标注「⚠️ 0.85 数字来源待追溯;quiet failure 形式化定义缺失」

4.3 待核实 · K12-KGraph 40▲ 高票但关联偏弱——是否应进入 evaluation.md

  • 来源:paper_cards/572(arXiv:2605.09635),HF Daily 40▲
  • 风险:K12-KGraph 是教育垂直 benchmark,与 evaluation 主题核心(harness/judge/agent 评测方法论)关联有限;进入 evaluation.md 可能稀释核心内容
  • 核实路径:确认 evaluation.md 的收录边界——是否包含所有 evaluation 主分类 benchmark,还是聚焦通用评测方法论
  • 建议:R27 §2.2 K12-KGraph 条目标注「⚠️ 教育垂直 benchmark,建议降级为 §5 候选维度而非 §2.2 主节点」

4.4 待核实 · OpenForgeRL "任意 harness × 任意环境"声明与实测 6×6 的覆盖差距

  • 来源:paper_cards/585(arXiv:2607.21557)
  • 风险:OpenForgeRL 声称"任意环境训练",但只给了 6×6 评测数据;harness 间性能差异是否因 proxy 拦截引入的 latency/token 漂移而非真实能力差距未消融
  • 核实路径:抓 PDF §5(behavior analysis)确认 proxy effect 消融实验
  • 建议:R27 §1.33c OpenForgeRL 条目标注「⚠️ 6×6 覆盖度代表性 + proxy effect 消融待 PDF 核」

5. 涉及 arXiv 号列表(本次新增/补强)

arXiv 来源 主分类 与 evaluation.md 关系 R27 建议
arXiv:2607.21072 paper_cards/565(2026-07-25 建卡) evaluation(形态 benchmark) §2.2 答案接口不匹配节点;§6.22 跨领域呼应;§5 34 维度候选;§7.1 第 26 条共识 🟢 R27 §2.2 §6.22 §5 §7.1 新增
arXiv:2605.09635 paper_cards/572(2026-07-25 建卡) evaluation(形态 benchmark) §2.2 教育垂直旁证(P3);§5 35 维度候选(P3) 🟡 R27 §2.2 旁证 §5 候选(P3 旁证级)
arXiv:2607.21557 paper_cards/585(2026-07-25 建卡) evaluation(形态 method,副 agent) §1.33c Evaluation Layer 旁证;§2.2 harness 可比性旁证;§7.1 第 29 条共识 🟡 R27 §1.33c 旁证 §7.1 新增(method 副产品,实证数据有价值)

合计:本次 E1 确认涉及 arXiv 1 件(Show, Don't Tell,evaluation 主分类 benchmark,HF Daily 34▲);🟡 2 件旁证(K12-KGraph,40▲但关联偏弱;OpenForgeRL,method 副产品)。


6. 检查过的来源(全部)

inbox tom(7-23~7-25 evaluation 相关)

  • 2026-07-23-evaluation-e1prep.md(R25,AILQA + EduPanel + Transcription Policy + FinMMEval 旁证)
  • 2026-07-24-evaluation-e1prep.md(R26,DocOps + FinMMEval 升主分类 + ActiveVision + ENTRAP-VL)
  • 2026-07-23T0840-agent-rag-longcontext-radar.md(R25 来源雷达)
  • 2026-07-23T1440-agent-rag-longcontext-radar.md(R25 FinMMEval 旁证来源)
  • 2026-07-24-0841-agent-rag-longcontext-radar.md(R26 DocOps + ActiveVision + ENTRAP-VL 来源)
  • 2026-07-24T1440-agent-rag-longcontext-radar.md(R26 无 evaluation 专项)
  • 2026-07-25-0900-hf-daily-2026-07-25.md(★ HF Daily 15 篇,Show, Don't Tell #6 · 34▲,K12-KGraph #4 · 40▲)
  • 2026-07-25T0840-agent-rag-longcontext-radar.md(★ OpenForgeRL ⭐⭐ + Agentic Context Management ⭐ + FinanceComplexQA ⭐)
  • 2026-07-25T1440-agent-rag-longcontext-radar.md(★ FinanceComplexQA + Agentic Context Management + OpenForgeRL)
  • 2026-07-25-rag-e1prep.md(RAG 主题,无 evaluation 专项增量)

inbox spark(7-23~7-25 evaluation 相关)

  • 2026-07-23-agent-e1prep.md(R25 已收录,EduPanel + AILQA)
  • 2026-07-24-agent-e1prep.md(R26 DocOps 邻接)
  • 2026-07-25-agent-e1prep.md(★ Compounding Error 0.85^10 ≈ 0.197 + Gartner 40% 废弃预测 + Cameron Wolfe agentic 三连 + OpenForgeRL + Claude Opus 5 评测→系统卡→红队链条)

inbox stephen(7-23~7-25 evaluation 相关)

  • 2026-07-23-ai-industry-e1prep.md(产业主题,无 evaluation 专项)
  • 2026-07-24-llm-application-e1prep.md(llm-application 主题,无 evaluation 专项)
  • 2026-07-25-ai-industry-e1prep.md(Claude Opus 5 + AREX + OpenForgeRL,无 evaluation 专项新信号)
  • 2026-07-25-1003-news-anthropic-news.md(Claude Opus 5 系统卡,评测→系统卡→评论→红队链条)

inbox jay(7-23~7-25 evaluation 相关)

  • 2026-07-23-1105-jay-briefing.md(推理工程专项,无 evaluation 专项)
  • 2026-07-24-1052-engineering-filter.md(AI Workflow Store + Agent Harness + Context Engineering,无 evaluation 专项)
  • 2026-07-25-1002-rss-import-ai.md(RSS 通稿,无 evaluation 专项)
  • 2026-07-25-1001-rss-lilian-weng.md(Lilian Weng 自我改进 Harness 工程,无 evaluation 专项新信号)
  • 2026-07-25-1105-substack-agents-production-failure-a2a-cua.md(★ Compounding Error 0.85^10 ≈ 0.197 + Gartner 40% 废弃预测)
  • 2026-07-25-1140-news-x-tech-radar.md(Raschka 推理 effort 控制,无 evaluation 专项新信号)
  • 2026-07-25-1450-jay-engineering-filter-p2.md(engineering filter P2,无 evaluation 专项)

inbox flyp(7-23~7-25 evaluation 相关)

  • 2026-07-24-multimodal-e1prep.md(ActiveVision + Computational Humor,multimodal 主,evaluation 副)
  • 2026-07-25-1000-rss-cameron-wolfe.md(★ Cameron Wolfe agentic 三连含 agent 评估详尽指南)
  • 2026-07-25-multimodal-e1prep.md(ARE X + Self Gradient Forcing,multimodal 主,无 evaluation 专项)
  • 2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md(Isolation + OpenForgeRL + Agentic Context Management,无 evaluation 专项新信号)

paper_cards 近 3 天新卡(序号 564~585;含 7-25 新入库卡全量扫描)

  • 564-2607.21503 · Agentic Context Management(主分类 agent)→ agent.md
  • 565-2607.21072 · Show, Don't Tell(主分类 evaluation,形态 benchmark)★ 增量 1
  • 566-2607.21485 · Recurrent Sinusoidal INRs(主分类 engineering)→ engineering.md
  • 567-2607.21051 · Sample-Efficient Learning(主分类 agent)→ agent.md
  • 568-2607.20061 · ReferTrack(主分类 multimodal)→ multimodal.md
  • 569-2607.20734 · LLMs Get Lost in Evolving User Intent(主分类 agent)→ agent.md
  • 570-2607.20785 · Robostral Navigate(主分类 agent)→ agent.md
  • 571-2607.12746 · Color Pass-Through(主分类 multimodal)→ multimodal.md
  • 572-2605.09635 · K12-KGraph(主分类 evaluation,形态 benchmark)★ 旁证 1
  • 573-2607.21576 · Self-Supervised Learning(主分类 multimodal)→ multimodal.md
  • 574-2607.21553 · SANA-Video 2.0(主分类 multimodal)→ multimodal.md
  • 575-2607.19238 · FinanceComplexQA(主分类 agent,副 evaluation)→ agent.md
  • 576-2607.04763 · ReOPD(主分类 agent)→ agent.md
  • 585-2607.21557 · OpenForgeRL(主分类 evaluation,形态 method)★ 旁证 2

未发现显著 evaluation 增量的来源: - spark 7-23~7-25 gradient-flow:主线 A 连续第 8 天缺失,无 evaluation 专项 - jay 7-25 的 RSS 通稿(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog):无 evaluation 专项新信号 - stephen 7-23~7-25 的 news 通稿(anthropic/openai/deepmind/google-ai/hf-blog/tldr-ai/bens-bites):Claude Opus 5 系统卡披露有价值,但属于 frontier lab 产品发布而非专项 evaluation research - flyp 7-25 multimodal e1prep:多模态主题,无 evaluation 专项新信号


7. 无显著新增量时如实说明

R26 已非常饱和,本轮 7-25 evaluation 主题 E1 预消化属于小型补漏级别,无全新评测框架、无 JRH 级别的 judge 校准突破、无高票 evaluation 专项新 benchmark(Show, Don't Tell 仅 34▲,K12-KGraph 40▲ 但关联偏弱)。

  • 主要增量性质:1 条确认 evaluation benchmark(Show, Don't Tell 答案接口不匹配,HF Daily 34▲)+ 1 条量化旁证(Compounding Error 0.85^10 ≈ 0.197,与 R26 68pp eval gap 形成生产失败量化闭环)
  • 无硬凑条目:2 条确认增量均有 paper_cards TLDR 原始出处,不编造;3 条旁证诚实标注为"旁证"而非混入主线
  • 不建议新建主题页:evaluation 主题已非常饱和,R27 继续在主档内补强,不开侧枝

8. 待活文档 R27 接力方向(给今晚活文档接手时)

  1. §2.2 Benchmark 设计:补 Show, Don't Tell(arXiv:2607.21072,答案接口不匹配);🟡 K12-KGraph 降级旁证(arXiv:2605.09635,40▲ 但关联偏弱)
  2. §6.22 评测信任危机:补"答案接口不匹配"(Show, Don't Tell,跨领域呼应 Transcription Policy)+ Compounding Error 0.85^10 ≈ 0.197(quiet failure 量化公式)
  3. §1.33c AI Agents Stack 2026 Evaluation Layer:补 OpenForgeRL 6×6 harness-benchmark 实证(arXiv:2607.21557)
  4. §5 评测对象分化:32 维 → 34~35 维(+Show, Don't Tell + K12-KGraph)
  5. §7.1 共识 25 → 29 条(+4 条:答案接口不匹配 + quiet failure + 多步工作流指数衰减 + harness 选择影响可比性)
  6. ⚠️ 4 条待核实:Show, Don't Tell benchmark 数字 + 答案接口不匹配有效性 / Compounding Error 0.85 数字来源 + quiet failure 形式化定义 / K12-KGraph 是否应降级为 P3 旁证 / OpenForgeRL 6×6 覆盖度代表性 + proxy effect 消融
  7. §2.8 arXiv ID 索引:R27 新增 1 条(arXiv:2607.21072)

Tom E1 预消化简报 · 2026-07-25 15:40 Asia/Shanghai · 共扫描 5 个 inbox 目录 + paper_cards 564~585 号 22 张卡 增量 1 条(确认)+ 3 条(旁证)· 涉及 arXiv 1 件(确认)+ 2 件(旁证)· 无显著新增量时如实说明 · 不硬凑字数 · 不重写 evaluation.md