evaluation · E1 预消化简报(2026-08-03)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-08-01 ~ 2026-08-03)+ paper_cards 近 3 天新卡(674-692)+ 邻接来源 本简报目的: 为今晚 evaluation 活文档接力(R33 → R34)预习备料,聚焦尚未进入 knowledge/evaluation.md R33 基线的增量条目 背景说明: R33 于 2026-08-01 15:40 收官(Fairness Pruning token 级偏差定位 + See2Think 四联评测闭环 + Beyond Borrowed Histories 角色扮演用户对齐 + MPIE-Bench 场景专化 + MirrorCode 超长程编程)。本简报覆盖 2026-08-01 下午至 2026-08-03 下午增量,发现 evaluation 主题 ArXiv 新鲜供给持续处于相对低谷,但 ACL 2026 System Demonstrations 出现 2 条 evaluation 方法论新条目,以及 Datadog 报告提供工业级 evaluation 实证数据。


执行摘要

本期 evaluation E1 预消化发现 2 条确认增量 + 1 条邻接增量,共涉 2 个新 arXiv 号。相比上期(R33 收官,3 确认 + 1 邻接)和上上期(R32→R33,5 条增量),本期 eval 专项增量规模有所下降,主要原因是:

  1. HF Daily 8-03 票榜 15 件全部为 8-02 沿用,无新 arXiv 编号:票数 +1~+7 续立,无 evaluation 主分类新条目进入 top 15
  2. paper_cards 近 3 天新卡(674-692,共 18 张)无 evaluation 主分类条目:最新一张(692 Educating the Agentic Engineer)主分类 agent/形态 benchmark(副 evaluation),其余 17 张均无 evaluation 主分类
  3. ACL 2026 System Demonstrations 出现 2 条 eval 方法论新条目(PROTEA + DialogGuard):属于邻域发现,提供 eval 工具/框架层面的增量

核心脉络是:评测方法学在"多 Agent 工作流评测"和"多 Agent 安全评测"两个新方向出现立足点,PROTEA 的 Backward Node Evaluation 是 R33 已有 token 级 credit assignment(CoRT)在工作流/中间 artifact 维度的系统性扩展。


增量条目(2 条确认 + 1 条邻接)


增量 1 · P1 确认 · PROTEA(ACL 2026 Demo):多 Agent LLM 工作流离线评测与迭代改进

来源: jay/inbox/jay/2026-08-03-acl-2026-system-demos.md(ACL 2026 System Demonstrations 精选 #3)+ arXiv 原文(aclanthology.org/2026.acl-demo.3/) arXiv: 无独立 arXiv;来源为 ACL Anthology ACL 2026 Demo paper TLDR: PROTEA 执行多 Agent LLM 工作流,用可配置评估器对中间 artifact 评分,在工作流图上叠加每节点状态和理由以定位瓶颈。核心创新:Backward Node Evaluation——从终端监督推导每个节点的理想输出,自动生成 prompt patch diff 并重新运行对比,填补了多 Agent 工作流无系统化离线评测工具的空白。 卡状态: ⚠️ paper_cards 未建(ACL Demo paper;无独立 arXiv 编号)

要点: - 核心问题:多 Agent LLM 工作流调试困难——传统方法依赖人工检查中间产物(artifact),无法规模化;PROTEA 提出系统化离线评测方案 - Backward Node Evaluation(反向节点评测):不依赖人工标注的中间参考标准,而是从终端输出(final output/terminal signal)反向推导每个节点的理想输出——解决"中间 artifact 无 ground truth"的根本性评测难题 - 与 CoRT(arXiv:2607.25659)的关系:CoRT 在 token 级别做 credit assignment;PROTEA 在工作流节点级别做 backward credit assignment——两者本质相同但粒度不同:CoRT 是 token 级,PROTEA 是 agent-node 级 - Prompt patch diff:自动生成 prompt 修改建议(diff),重新运行对比——将"评测诊断"与"修复迭代"在单一工具内闭环,这是 R33 §3.3 评测平台与 CI Gate 概念的工程实现 - 统一 UI:瓶颈定位 → 半自动修复 → 结果验证三阶段统一界面 - 评测粒度创新:从"response 评测"(R33 Beyond Borrowed Histories)→ "token 级 credit"(CoRT)→ "workflow-node 级 credit"(PROTEA)——评测粒度在"执行结构"维度进一步细化

与 knowledge/evaluation.md R33 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——PROTEA 是多 Agent 工作流评测工具而非 benchmark,可进入 §2.4「评测工程工具」或 §3.3「评测平台与 CI Gate」;建议新增 §2.4(独立于 benchmark 的评测方法论工具分类) - 落入 §2.5「评测方法学批判」——Backward Node Evaluation 的方法论依赖(terminal signal 是否真的能正确反向推导每个节点的贡献?)是 CoRT token-level credit assignment 反方在节点级别的延伸 - 落入 §4「维度矩阵」——可作为"工作流级/多 Agent 评测"行的新增方法论 - 与 R33 CoRT(token 级 credit)+ DecoEvo(solver-rubric 协同演化)共同构成三级 credit assignment 体系:token 级(CoRT)→ 节点级(PROTEA)→ 系统级(DecoEvo)

建议归入节: §2.4 评测工程工具(新增 PROTEA)+ §3.3 评测平台与 CI Gate(prompt patch diff 的 CI 实践)+ §4 维度矩阵(新增"工作流级/多 Agent 评测"行)+ §2.5 评测方法学批判(Backward Node Evaluation 因果推断依赖)

arXiv: ACL 2026 Demo paper(无独立 arXiv)


增量 2 · P1 确认 · DialogGuard(ACL 2026 Demo):多 Agent 心理安全评估系统

来源: jay/inbox/jay/2026-08-03-acl-2026-system-demos.md(ACL 2026 System Demonstrations 精选 #19)+ arXiv 原文(待查) arXiv: 无独立 arXiv;来源为 ACL Anthology ACL 2026 Demo paper TLDR: 开源系统,让临床医生审计 AI Agent 的心理社会安全风险(操纵、歧视、心理困扰)。通过 4 个 LLM-as-judge pipelines(单 Agent 评分、双 Agent 纠正等)评分 5 个心理安全维度。核心发现:商业治疗聊天机器人在临床场景中仅约 50% 情况响应适当。 卡状态: ⚠️ paper_cards 未建(ACL Demo paper;无独立 arXiv 编号)

要点: - 5 个心理安全维度:操纵(manipulation)、歧视(discrimination)、心理困扰(psychological distress)等——对应 R33 §1.12 行为隐私第七维(Behavioral Privacy)的临床场景实现 - 4 个 LLM-as-judge pipelines:单 Agent 评分、双 Agent 纠正等——提供不同评测协议下的鲁棒性验证,而非单一评分 - 关键发现:商业治疗聊天机器人在临床场景中仅约 50% 情况响应适当——这是 R33 §6.29 LLM 内在属性评测(Fairness Pruning 邻接)在"心理安全"维度的直接量化证据 - 与 Fairness Pruning 的互补关系:Fairness Pruning 关注"人口统计偏差的激活层定位"(结构层);DialogGuard 关注"心理安全风险的行为层评测"(行为层)——两者共同构成 LLM 内在属性评测的双层覆盖(结构层 + 行为层) - 开源系统:让临床医生参与审计——说明"人类在回路"的评测设计在安全关键场景的必要性

与 knowledge/evaluation.md R33 现有脉络的关系: - 落入 §1.12「行为隐私」(Behavioral Privacy)——DialogGuard 是第七维"Behavioral Privacy"在临床 AI 场景的专项评测实现,与 R33 已有 Cyber-Capable AI Agents(行为层安全)+ Fairness Pruning(激活层偏差)构成三维:行为安全 + 激活偏差 + 心理安全 - 落入 §3.3「评测平台与 CI Gate」——LLM-as-judge pipelines 作为评测基础设施,与 R33 FutureAGI 工具链(Patronus AI 幻觉检测专精)邻接 - 落入 §2.5「评测方法学批判」——"50% 适当响应"的结论依赖 LLM-as-judge 本身的质量;LLM-as-judge 的可靠性是所有主观评测的共同方法论问题 - 与 R33 MirrorCode(超长程编程评测)共同构成"评测工具在专业领域适用性"的双子案例:MirrorCode 是工程领域,DialogGuard 是临床心理安全领域

建议归入节: §1.12 行为隐私(新增 DialogGuard 临床心理安全维度)+ §3.3 评测平台与 CI Gate(新增 LLM-as-judge pipelines)+ §6.29 邻接维度(心理安全评测第三维:临床行为安全)+ §2.5 评测方法学批判(LLM-as-judge 可靠性依赖)

arXiv: ACL 2026 Demo paper(无独立 arXiv)


邻接 A · Datadog AI Engineering 2026 报告:Agentic AI 生产可靠性实证(evaluation 工业层)

来源: jay/inbox/jay/2026-08-03-datadog-ai-engineering-report.md(来源:Datadog State of AI Engineering,2026-08)+ tom/inbox/tom/2026-08-03_agents-lite.md §高价值条目 1 邻接 arXiv: 无(工业报告来源) TLDR: Datadog 基于真实客户 traces 数据(2026 年 2-3 月),揭示 Agent 可靠性受限于模型提供商容量上限——Agent 框架使用服务数同期翻倍以上,但 2026 年 2 月有 5% LLM call span 报错(其中 60% 是 rate limit);2026 年 3 月降到 2%(rate limit 约占 1/3)。核心结论:需要预算 + 背压 + prompt 优化三管齐下。 卡状态: ⚠️ 无 paper_cards(非论文来源,属工业评测实践数据)

邻接理由: 主分类 ai-industry;与 evaluation 主题的关联是"生产级 eval 数据"而非专项 eval 研究——Datadog 数据提供了真实生产环境中 LLM 调用可靠性评测的第一手数据,印证了 R33 §7.1(Eval-first Development)的工业实践缺口。Datadog 报告属于"评测数据来源"而非"评测方法研究",建议在 §7.1 共识中作为量化背景引用。

要点: - 评测数据来源价值:Datadog 的 traces 数据是"真实生产环境 LLM 调用的系统性评测",与 R33 已有工业工具链(FutureAGI / Patronus AI / Braintrust)互补——后者提供工具,前者提供真实流量评测数据 - Rate limit 报错作为评测指标:60% → 1/3 的变化说明"rate limit 管理"已成为 LLM 调用可靠性的核心指标——这是 R33 §2.3 指标体系中未明确覆盖的新指标 - Agent 框架采用率翻倍:从 2025 年初 9% 到 2026 年初 18%——说明评测需求(框架可靠性验证)在工业界规模化增长

arXiv:


值得警惕的矛盾或待核实说法

矛盾 1 · PROTEA Backward Node Evaluation 的因果推断边界

  • 现状:PROTEA 从终端监督推导每个节点的理想输出,但"终端信号好"是否意味着"每个节点的贡献方向正确"?多节点之间的非线性交互(节点 A 的输出影响节点 B 的输入)可能导致反向推导的错误归因
  • 待核实:论文是否提供非线性交互场景下的消融实验?Backward Node Evaluation 与真实节点级人工标注的对照验证?

矛盾 2 · DialogGuard 50% 适当响应的 LLM-as-judge 可靠性

  • 现状:50% 适当响应依赖 LLM-as-judge pipelines;但 LLM-as-judge 本身的可靠性未独立验证——judge 模型是否对"心理安全"维度有系统性偏见?
  • 待核实:4 个 LLM-as-judge pipelines 之间的 inter-rater agreement 是否被报道?是否有与人类临床专家的对照验证?

矛盾 3 · ACL 2026 Demo papers 无独立 arXiv 编号

  • 现状:PROTEA 和 DialogGuard 均来自 ACL 2026 System Demonstrations,无独立 arXiv 编号——这意味着无法通过 arXiv ID 追溯论文全文,引用可靠性依赖 ACL Anthology 记录
  • 待核实:ACL Anthology 正式记录是否已公开?是否有 GitHub 代码库可验证方法实现细节?

矛盾 4 · MPIE-Bench paper_cards 建卡状态待确认

  • 现状:MPIE-Bench(arXiv:2607.27616)在 8-02 报告中标注"⚠️ paper_cards 未建,HF Daily 37▲";8-03 票数升至 37▲(+0),仍无 paper_cards——其"解剖学合理"的具体评测设计缺乏文献细节
  • 待核实:paper_cards cron 是否在 8-03 evening 棒前完成 MPIE-Bench 建卡?PIE-Bench 与 R33 §2.2 已有条目(PerceptionBench / Show Don't Tell 等)的 overlap 或互补关系?

本期不纳入的已知条目(已在上期或 R33 覆盖)

条目 arXiv 号 不纳入原因
Beyond Borrowed Histories 2607.27816 已在 R33 P1 确认增量 1 覆盖;HF Daily 8-03 票数 31▲(+1),无 eval 专项新信息
Fairness Pruning 2607.28319 已在 R33 §6.29 收录;ACL 2026 Demo DialogGuard 提供行为层补充,但无新的 Fairness Pruning eval 增量
See2Think 2607.26769 已在 R33 四联评测框架收录;HF Daily 8-03 无 eval 专项新信息
MPIE-Bench 2607.27616 已在 R33 邻接 A 收录;HF Daily 8-03 票数 37▲(+0),无新进展
MirrorCode Benchmark 已在 R33 邻接增量 5 覆盖;无 eval 专项新信息
CLBench-V 2607.25294 已在 R33 §2.8 引用;HF Daily 8-03 票数 44▲(+0),无 eval 专项新信息
BM25 Wins at Scale 2607.26497 已在 R33 邻接增量 4 覆盖;HF Daily 8-03 票数 46▲(+0),无 eval 专项新信息
CoRT 2607.25659 已在 R33 P1 确认增量 1 覆盖;PROTEA 的 Backward Node Evaluation 是同思路的节点级扩展,不重复
DecoEvo 2607.25675 已在 R33 P1 确认增量 2 覆盖;无 eval 专项新信息
RepoReasoner 2607.25996 已在 R33 P1 确认增量 3 覆盖;无 eval 专项新信息
FutureAGI 评测工具链 已在 R33 P1 确认增量 3 覆盖;Datadog 报告提供工业层补充,不重复
Memory Provenance Laundering 2607.29167 主分类 agent/security;与 evaluation 关联是"安全评测"而非"性能评测",建议入 risk.md 不入 evaluation.md

引用 arXiv 号汇总

# 来源 名称 状态 与 evaluation.md 关系
1 ACL 2026 Demo PROTEA:多 Agent 工作流离线评测 ⚠️ paper_cards 未建(ACL Demo,无独立 arXiv) 🆕 增量 1 确认
2 ACL 2026 Demo DialogGuard:多 Agent 心理安全评测 ⚠️ paper_cards 未建(ACL Demo,无独立 arXiv) 🆕 增量 2 确认
A Datadog 工业报告 Agentic AI 生产可靠性实证 ⚠️ 无 paper_cards(工业数据来源) 邻接 A(工业 eval 数据)
B HF Daily 续立 Beyond Borrowed Histories(2607.27816) ✅ paper_cards/679 已建(主分类 evaluation) 已在基线(8-03 票数 +1)
C HF Daily 续立 MPIE-Bench(2607.27616) ⚠️ paper_cards 未建(HF Daily 37→37▲) 已在基线邻接(待建卡)

检查过的来源清单

tom inbox(8-02 下午~8-03): - 2026-08-03-0900-hf-daily-2026-08-03.md(HF Daily 8-03 票榜 15 件:全部为 8-02 沿用,无 eval 主分类新条目) - 2026-08-03T0840-agent-rag-longcontext-radar.md(8 件候选含 Σ-Mem/Filesystem/DualG-MRAG/GLM-RAG/ConMem;无 eval 专项) - 2026-08-03T1440-agent-rag-longcontext-radar.md(8 件候选 + Substack 参考;无 eval 专项) - 2026-08-03_agents-lite.md(4 高价值:Σ-Mem/Memory Provenance Laundering/Filesystem-Based Memory/AI Agents Stack 2026;无 eval 专项) - 2026-08-03-rag-e1prep.md(RAG 专项;无 eval 专项新条目) - 2026-08-02-evaluation-e1prep.md(R33 收官报告;基准参考)

jay inbox(8-02 下午~8-03): - 2026-08-03-acl-2026-system-demos.md(ACL 2026 Demo 精选;含 PROTEA + DialogGuard 🆕) - 2026-08-03-datadog-ai-engineering-report.md(Datadog AI Engineering 报告;含工业 eval 数据邻接) - 2026-08-03-llm-inference-research-briefing.md(LLM inference 研究简报;无 eval 专项新条目) - 2026-08-03-kv-cache-optimization-survey.md(KV Cache 综述;无 eval 专项)

flyp inbox(8-02 下午~8-03): - 2026-08-03-multimodal-e1prep.md(multimodal 专项;无 eval 专项新条目)

stephen inbox(8-02 下午~8-03): - 2026-08-03-ai-industry-e1prep.md(含 HF Daily 8-03 票榜全核 + 1 条 net-new(Memory Provenance Laundering 2607.29167,主分类 agent/security)) - 2026-08-03-0910-news-x-vip-radar.md(X-VIP radar;无 eval 专项新条目)

paper_cards 近 3 天新卡(674-692,共 18 张): - 主分类 evaluation:0 张(674-692 无 evaluation 主分类新卡) - 形态 benchmark/evaluation 相关:692(Educating the Agentic Engineer,形态 benchmark,副 evaluation) - 其余 17 张:agent(691 Memory Provenance Laundering / 689 Neural Approaches / 683 Σ-Mem / 686 Filesystem-Based Memory / 692 EasyBCI Agent / 690 EasyBCI Agent)+ multimodal(688 OmniScope / 674 DualG-MRAG / 675 GLM-RAG)+ rag(676 ConMem)+ llm-infra(677/678/680-682/687) - 近 3 天主分类 evaluation 新卡:0 件


主题活文档更新状态

  • knowledge/evaluation.md 当前版本:R33(2026-08-01 15:40 批次)
  • 本期 2 条确认增量(PROTEA + DialogGuard)+ 1 条邻接增量(Datadog 工业数据),可支持 R34 更新候选
  • 核心更新方向:§2.4 评测工程工具(PROTEA 新增)+ §1.12 行为隐私(DialogGuard 临床心理安全维度)+ §3.3 评测平台与 CI Gate(LLM-as-judge pipelines + Datadog 生产数据)+ §4 维度矩阵(新增"工作流级/多 Agent 评测"行)
  • 建议 R34 关注:ACL 2026 Demo papers 的全文可用性(是否有独立 arXiv 或 GitHub);Datadog 报告是否提供可供引用的具体数字

无显著新增量时说明

本日 evaluation 主题 ArXiv 新鲜供给持续处于相对低谷,主要原因是:

  1. R33 五联协同(Fairness Pruning + See2Think + Beyond Borrowed Histories + MPIE-Bench + MirrorCode)收官后进入整理期:2026-08-01 批量收官,覆盖了激活层偏差定位 + 多模态评测诊断 + 角色扮演用户对齐 + 场景专化评测 + 超长程编程评测五个核心方向,剩余增量空间有限
  2. 今日实质性新增量:0 条 paper_cards 已建 evaluation 主分类卡片:近 3 天(674-692,共 18 张)无 1 张 evaluation 主分类;ACL 2026 Demo 出现 2 条 eval 方法论新条目(PROTEA + DialogGuard),但无独立 arXiv 编号
  3. HF Daily 8-03 票榜 top 15 无 evaluation 主分类新条目:全部 15 件为 8-02 续立,票数 +1~+7;AskChem(292▲)/ Qwen-UI-Agent(284▲)/ Metis(257▲)均为 agent/multimodal 主分类
  4. ACL 2026 Demo 是 eval 专项增量的唯一来源:PROTEA(多 Agent 工作流离线评测)和 DialogGuard(多 Agent 心理安全评测)是本期 eval 方法论的实质新增,但引用格式依赖 ACL Anthology 而非 arXiv

本棒 R34 预消化关键议题

R33 五联协同收官后,R34 面临的核心问题是:如何在"工作流级评测"和"安全评测"两个新维度上建立系统性评测方法论框架?

  1. PROTEA → 下一步:Backward Node Evaluation 是否可以推广到非多 Agent 场景(单 Agent 多步骤推理)?"终端信号反向推导节点贡献"的因果推断可靠性如何验证?是否有 head-to-head 对比 vs 人工节点级标注?
  2. DialogGuard → 下一步:50% 适当响应是否可以推广到其他安全关键场景(医疗建议 / 法律咨询 / 金融规划)?LLM-as-judge pipelines 的 inter-rater agreement 是否达到临床可用标准?
  3. Datadog 生产数据 → 下一步:rate limit 报错率(60% → 33%)是否可以作为 LLM API 可靠性的标准评测指标?是否值得在 evaluation.md 建立"API 可靠性评测"专项?
  4. ACL 2026 Demo papers → 下一步:确认 PROTEA 和 DialogGuard 是否有独立 arXiv 编号或 GitHub 代码库;如果是 ACL Anthology 独有,是否值得在 evaluation.md 建立"ACL Demo paper"引用格式规范?
  5. 跨文档联动:PROTEA 邻接 agent.md(多 Agent 工作流编排);DialogGuard 邻接 risk.md(心理安全风险);Datadog 报告邻接 llm-infra.md(生产可靠性数据)—— R34 更新时需确认跨文档一致性

附录:HF Daily 8-03 票榜 evaluation 相关条目跟踪(续立状态)

论文 arXiv 号 8-02 票数 8-03 票数 变化 状态
Beyond Borrowed Histories 2607.27816 30▲ 31▲ +1 ✅ 已在 R33 基线
MPIE-Bench 2607.27616 37▲ 37▲ 0 ⚠️ 已在 R33 邻接,待 paper_cards 建卡
CLBench-V 2607.25294 44▲ 44▲ 0 ✅ 已在 R33 基线
BM25 Wins at Scale 2607.26497 41▲ 46▲ +5 ✅ 已在 R33 基线

Tom · 2026-08-03 15:40 CST · E1 预消化简报 · 2 条确认增量(ACL 2026 Demo PROTEA + DialogGuard)+ 1 条邻接增量(Datadog 工业数据) · 涉及 arXiv:无独立 arXiv(ACL Demo);邻接 arXiv:2607.27816(基线续立)/ 2607.27616(基线邻接待建卡)