evaluation · E1 预消化简报(2026-08-02)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-07-31 ~ 2026-08-02)+ paper_cards 近 3 天新卡(674-688) 本简报目的: 为今晚 evaluation 活文档接力(R33 → R34)预习备料,聚焦尚未进入 knowledge/evaluation.md R33 基线的增量条目 背景说明: R33 于 2026-08-01 15:40 收官(Fairness Pruning token级偏差定位 + See2Think 四联评测闭环第五件 + FutureAGI 工具链 + BM25 Wins at Scale + MirrorCode 五联)。本简报覆盖 2026-07-31 下午至 2026-08-02 下午增量,发现 evaluation 主题 ArXiv 新鲜供给进入相对低谷,主要增量集中在 3 条主分类 evaluation 条目(含 1 条 benchmark + 2 条 method)和 2 条工业/邻接补充,无全新方向开掘。


执行摘要

本期 evaluation E1 预消化发现 3 条确认增量 + 1 条邻接增量,共涉 3 个新 arXiv 号。相比上期(2 确认 + 3 邻接),本期 eval 专项增量规模相当,均为 R33 已知框架的增量填充而非全新方向:

  1. Beyond Borrowed Histories(arXiv:2607.27816):角色扮演 Agent(PRA)评测基准的重大方法论创新——指出"固定 rubric + 固定对话历史"的评测设计存在根本性缺陷,提出"用户对齐"评测框架,填补了角色扮演类消费应用无专项评测方法论的空白
  2. Fairness Pruning(arXiv:2607.28319)已在 R33 §6.29 邻接收录,但有新增方法论细节:down_proj 输入处信号最强的 GLU 架构专用性,以及"激活差异 ≠ 因果行为"的根本性限制需要补充
  3. See2Think(arXiv:2607.26769)已在 R33 四联评测框架收录,但 flyp 8-02 multimodal-e1prep 补充了"VAoT 诊断中间视觉状态"的具体实现细节

核心脉络是:评测方法学在"细粒度化"和"场景专化"两个方向同时推进——Beyond Borrowed Histories 将评测从"固定 rubric"推向"用户对齐动态 rubric",Fairness Pruning 将偏差评测从"行为层"推向"激活层",See2Think 将多模态评测从"最终答案"推向"中间推理链路"。


增量条目(3 条确认 + 1 条邻接)


增量 1 · P1 确认 · Beyond Borrowed Histories(2607.27816):角色扮演 Agent 的用户对齐评测基准

来源: HF Daily 8-01 #15(30▲)+ paper_cards/679(主分类 evaluation,形态 benchmark)+ tom 8-01 rag-e1prep §邻接 + stephen 8-02 ai-industry-e1prep §增量 1(8-02 续立 #15 30▲) arXiv: 2607.27816 TLDR: 角色扮演 Agent(PRA)已成为 LLM 最重要的消费级应用之一,但现有基准使用"固定 rubric + 固定对话历史"设计,存在两个根本性局限:(1) RPA 输出由对话历史塑造,固定历史无法反映真实用户差异;(2) 固定 rubric 脱离用户,无法捕捉个体化互动体验。本文提出"用户对齐"评测框架,个体化模拟用户特征与偏好,评估 RPA 在多轮对话中动态适配用户个性化的能力。 卡状态: ✅ paper_cards/679 已建卡(主分类 evaluation,形态 benchmark)

要点: - 核心问题:现有 RPA 评测"固定 rubric + 固定对话历史"设计无法捕捉个体化互动体验——用户与 PRA 的多轮对话质量高度依赖"用户是谁",但评测用统一历史和统一标准,无法反映真实场景的个体差异 - 方案创新:Beyond Borrowed Histories 提出"用户对齐"(Person-Aligned)评测框架——(1) 模拟具有不同人口统计特征、情感需求、对话风格的用户;(2) 评测 RPA 在多轮对话中动态适配用户个性化的能力;(3) 个体化 rubric 根据模拟用户特征动态调整 - 两个根本性局限实证:论文提供了实证数据证明"固定历史 + 固定 rubric"的评测设计存在系统性偏差 - 评测对象扩展:从"response 质量评测"到"用户-RPA 个性化匹配度评测"——这是评测对象从客观能力向主观体验的首次系统性扩展 - 跨模态邻接:多模态 RPA(视觉角色扮演/具身对话)尚未覆盖——但用户对齐框架可扩展至视觉场景

与 knowledge/evaluation.md R33 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——Beyond Borrowed Histories 是"角色扮演类消费应用无专项评测方法论"空白填补,与 LOCA-bench(可控上下文 Agent)+ M3Exam(多模态 memory)+ Ground Truth First(Agent Memory 五维纵向)+ Eval-first + Agent Retrieval Bench + RepoReasoner + HANDBOOK.md + MirrorCode 构成评测基准的第九件套 - 落入 §1.1「评测对象扩展」——从 response-level → token-level(CoRT)→ repo-level(RepoReasoner)→ 用户对齐型评测——是"评测粒度细化"趋势在主观体验维度的新分支 - 落入 §2.5「评测方法学批判」——"固定 rubric 是 RPA 评测的根本性设计缺陷"是对"评测标准化 vs 评测生态性"张力的新证据 - 与 R33 §2.8(多模态评测基准缺口)邻接——Beyond Borrowed Histories 主要覆盖文本 RPA,多模态 RPA 的用户对齐评测框架尚待建立

建议归入节: §2.2 Benchmark 设计——新增「Beyond Borrowed Histories(arXiv:2607.27816)角色扮演 Agent 用户对齐评测基准」第九件;§1.1 评测对象扩展(新增"用户对齐型评测"维度);§2.5 评测方法学批判(新增"固定 rubric 局限性"反方证据)

arXiv 号: 2607.27816


增量 2 · P1 确认 · Fairness Pruning(2607.28319):down_proj 输入处信号最强的 GLU 架构专用性细节

来源: spark/agent-e1prep 8-02 §增量 1 + paper_cards/684(主分类 evaluation,形态 method)+ tom 8-01 evaluation-e1prep(R33 §6.29 已收录) arXiv: 2607.28319 TLDR(精读补全): Fairness Pruning 提出使用"最小对比提示对"(minimally contrastive prompt pairs)与推理时激活采集,在 GLU 架构中识别处理人口统计属性时差异响应的神经元,在 down_proj 输入处评估信号。参数量达 30 亿的模型上验证。

要点(相比 R33 的新增细节): - GLU 架构专用性的机制解释:down_proj 输入处信号最强——暗示 GLU 的门控机制(up/down/gate 三线性)与偏差传导路径存在结构关联,具体为 gate 控制信号的门控开关影响偏差传导的方向和强度 - 最小对比提示对的具体构造原则:对同一文本,仅在人口统计属性词(性别/种族/年龄等)上有差异——最小化语义干扰,确保激活差异来源可归因 - 关键方法论限制(待核实):"偏差相关神经元"≠"偏差行为神经元"——激活差异是结构关联,但结构关联不等于因果行为。论文是否提供从"神经元差异激活"到"下游偏差行为输出"的因果链条验证,需要 PDF 全文核实 - 激活采集的成本:推理时激活采集(前后向传播截取激活向量),不需要训练或权重修改——轻量化,但成本仍是 O(1) per token 的 2 倍(前后向 vs 仅前向)

与 knowledge/evaluation.md R33 现有脉络的关系: - R33 §6.29 邻接维度补充(Cyber-Capable AI Agents 邻接 + Fairness Pruning 偏差定位邻接 = LLM 内在属性评测双邻接)已收录 - 本期补充:§2.5 反方第 3 条候选——Fairness Pruning 激活定位的"偏差神经元"是否等价于"偏差行为神经元"——这是 R33 CoRT(生产可用性)+ DecoEvo(数学形式化)两条现有反方之外第三条更根本的反方:激活定位的方法论边界 - 建议在 §6.29 邻接中补充"GLU 架构专用性"机制说明,以及"激活差异 ≠ 因果推断"的方法论限制

建议归入节: §6.29 邻接维度补充(已有)——补充"GLU 架构专用性机制 + 方法论限制";§2.5 评测方法学批判——新增第 3 条反方(Fairness Pruning 因果推断边界)

arXiv 号: 2607.28319(已在 R33 基线)


增量 3 · P1 确认 · See2Think(2607.26769):VAoT 诊断中间视觉状态的具体实现细节

来源: flyp/2026-08-02-multimodal-e1prep.md(增量 2)+ paper_cards/685(主分类 multimodal,副 evaluation)+ tom 8-01 evaluation-e1prep(R33 §0 四联评测框架已收录) arXiv: 2607.26769 TLDR(精读补全): See2Think 含 See2ThinkBench(1,200 个开放视觉依赖问题)和 VAoT(Visual Action-of-Thought),诊断中间视觉状态生成和使用链路。刻意排除部分可由纯文本解决的样本,确保评测的是真实视觉依赖而非语言先验。

要点(相比 R33 的新增细节): - VAoT(Visual Action-of-Thought)的具体诊断机制:不只是评估最终答案,而是追踪"中间视觉状态(生成/渲染/使用)"的质量——这与 CoRT 的 token 级 credit assignment 有异曲同工之妙:两者都在试图解决"哪些部分真正贡献了答案质量"的问题,只是分别在 token 维度和视觉中间状态维度 - 视觉依赖保真度设计:See2ThinkBench 刻意排除部分可由纯文本解决的样本——这是对"评测饱和"问题的直接回应:确保评测信号来自视觉能力而非语言先验 - 四联评测诊断框架的完整化:flyp 标注 Show Don't Tell(答案接口)+ ActiveVision(任务设计)+ Trace(训练环境)+ See2Think(中间产物使用)= 四联完整——本期是对 R33 已收录内容的具体实现细节补全,而非全新增量 - 关键待核实:VAoT 诊断中间视觉状态的生成和使用链路,其可解释性依赖 attention rollout / probing 等方法的可信度——这些中间层分析方法本身的可靠性未在论文中独立验证

与 knowledge/evaluation.md R33 现有脉络的关系: - R33 §0 范式跃迁(四联评测诊断框架第五件)+ §2.2 Benchmark(See2ThinkBench)+ §4 维度矩阵(视觉依赖中间状态评测行)已收录 - 本期补充:§2.5 反方候选——VAoT 的可解释性依赖 attention rollout / probing 等中间层分析方法的可信度——这是对"评测诊断工具自身的方法论限制"的新证据

建议归入节: §0 范式跃迁(已有)——补充"VAoT 诊断中间视觉状态的具体机制";§2.5 评测方法学批判——新增"中间层分析方法的方法论依赖"反方证据

arXiv 号: 2607.26769(已在 R33 基线)


邻接 A · MPIE-Bench(arXiv:2607.27616):解剖学合理的多人交互编辑基准

来源: HF Daily 8-02 #13(37▲)+ stephen 8-02 ai-industry-e1prep §增量 1(8-02 续立)+ flyp 8-02 multimodal-e1prep §9 arXiv 清单 arXiv: 2607.27616 TLDR: 解剖学合理的多人交互编辑基准——评测多人协作场景下的视觉理解和编辑能力。 卡状态: ⚠️ paper_cards 未建(HF Daily 高票条目,37▲)

邻接理由: 主分类 multimodal,副分类 evaluation。与 Beyond Borrowed Histories 同属"场景专化型评测基准"——Beyond Borrowed Histories 专化于角色扮演交互,MPIE-Bench 专化于多人协作视觉编辑。两者共同构成"场景专化评测基准"的双子补充,建议在 §2.2 Benchmark 设计邻接条目中并存。

arXiv 号: 2607.27616


值得警惕的矛盾或待核实说法

矛盾 1 · Beyond Borrowed Histories"用户对齐"rubric 的主观性

  • 现状:个体化 rubric 根据模拟用户特征动态调整——但"模拟用户"本身的设计依赖标注者的主观判断,"正确"的用户画像是否真正代表目标用户群体存在系统性偏差风险
  • 待核实:论文是否提供模拟用户与真实用户群体的对照验证?inter-annotator agreement 是否被报道?

矛盾 2 · Fairness Pruning"激活差异"≠"因果偏差"

  • 现状:Fairness Pruning 通过激活差异识别"偏差相关神经元",但结构关联不等于因果行为——down_proj 输入处信号最强只说明 GLU 门控机制与偏差传导存在关联,但关联强度是否等于因果贡献未经独立验证
  • 待核实:论文是否提供从"神经元激活差异"到"下游行为偏差输出"的因果链条验证?(1)扰动实验(激活/沉默偏差神经元是否改变输出偏差);(2)与行为基准(BBQ 等)的相关性分析

矛盾 3 · See2Think VAoT 依赖中间层分析方法的可信度

  • 现状:VAoT 诊断中间视觉状态的生成和使用链路,但其可解释性依赖 attention rollout / probing 等方法——这些方法本身存在可信度争议(attention 是否真正反映因果 Attribution 仍在研究社区争论中)
  • 待核实:论文是否独立验证了 VAoT 的 attribution 正确性(例如与经过人工验证的 ground truth 中间状态对照)?

矛盾 4 · MPIE-Bench paper_cards 未建

  • 现状:37▲ 高票但无 paper_cards;其"解剖学合理"的具体评测设计(如何在多人交互中定义 ground truth 编辑结果)缺乏文献支撑
  • 待核实:PIE-Bench 的评测设计是否与 R33 §2.2 Benchmark 设计已有条目(PerceptionBench / Show Don't Tell 等)存在 overlap 或互补?

本期不纳入的已知条目(已在上期或 R33 覆盖)

条目 arXiv 号 不纳入原因
CoRT 2607.25659 已在 R33 P1 确认增量 1 覆盖;近 2 天无 eval 专项新信息
DecoEvo 2607.25675 已在 R33 P1 确认增量 2 覆盖;近 2 天无 eval 专项新信息
RepoReasoner 2607.25996 已在 R33 P1 确认增量 3 覆盖;近 2 天无 eval 专项新信息
CLBench-V 2607.25294 已在 R33 §2.8 引用;flyp 8-02 multimodal-e1prep 补充了 L0 0.2847 真实数字,但已在邻接 A 说明
Cyber-Capable AI Agents 2607.25379 已在 R33 §6.29 邻接覆盖;近 2 天无 eval 专项新信息
Fairness Pruning 2607.28319 已在 R33 §6.29 收录;本期仅补充 GLU 架构专用性细节,不重复
See2Think 2607.26769 已在 R33 四联评测框架收录;本期仅补充 VAoT 机制细节,不重复
FutureAGI 评测工具链 已在 R33 P1 确认增量 3 覆盖;近 2 天无 eval 专项新信息
BM25 Wins at Scale 2607.26497 已在 R33 邻接增量 4 覆盖;近 2 天无 eval 专项新信息
MirrorCode Benchmark 已在 R33 邻接增量 5 覆盖;近 2 天无 eval 专项新信息
HANDBOOK.md 2607.25398 已在 R33 邻接 C 覆盖;近 2 天无 eval 专项新信息
LOCA-bench 2602.07962 已在 R33 以前覆盖;近 2 天无 eval 专项新信息
M3Exam 2606.07402 已在 R33 以前覆盖;近 2 天无 eval 专项新信息
Ground Truth First 2607.21962 已在 R33 以前覆盖;近 2 天无 eval 专项新信息

引用 arXiv 号汇总

# arXiv 号 名称 状态 与 evaluation.md 关系
1 2607.27816 Beyond Borrowed Histories:角色扮演 Agent 用户对齐评测 ✅ paper_cards/679 已建卡(主分类 evaluation,形态 benchmark) 🆕 增量 1 确认
2 2607.28319 Fairness Pruning:GLU 偏差定位 ✅ 已在 R33 基线(本期补充细节) 已在基线,补充 GLU 专用性
3 2607.26769 See2Think:MLLM 中间视觉状态评测 ✅ 已在 R33 基线(本期补充细节) 已在基线,补充 VAoT 机制
A 2607.27616 MPIE-Bench:解剖学合理多人交互编辑基准 ⚠️ paper_cards 未建,HF Daily 37▲ 邻接 A(场景专化型评测)

检查过的来源清单

tom inbox(8-01 下午~8-02): - 2026-08-01-evaluation-e1prep.md(R33 · 5 条增量 · CoRT/DecoEvo/RepoReasoner/Fairness Pruning/See2Think/FutureAGI/BM25/MirrorCode 全覆盖) - 2026-08-02-0900-hf-daily-2026-08-02.md(HF Daily 8-02 票榜 15 件:无 evaluation 主分类新条目;MPIE-Bench 37▲ #13 为 multimodal 主分类) - 2026-08-02-0840-agent-rag-longcontext-radar.md(8 候选含 Σ-Mem/Filesystem/DualG-MRAG;无 eval 专项) - 2026-08-02-rag-e1prep.md(RAG 专项,含 BM25 反方六线;无 eval 专项新条目)

spark inbox(8-01 下午~8-02): - 2026-08-02-agent-e1prep.md(agent 专项;含 Fairness Pruning 邻接引用;无 eval 专项新条目)

flyp inbox(8-01 下午~8-02): - 2026-08-02-multimodal-e1prep.md(6 条增量含 OmniScope/CLBench-V 数字补全/Gemini Robotics 2/Σ-Mem/Filesystem/Frontis-MA1;含 See2Think 邻接补全;含 MPIE-Bench #13 arXiv 清单) - 2026-08-01-coding-agents-e1prep.md(coding agents 专项;无 eval 专项) - 2026-08-01-risk-e1prep.md(risk 专项;无 eval 专项)

stephen inbox(8-01 下午~8-02): - 2026-08-02-ai-industry-e1prep.md(含 HF Daily 8-02 票榜 15 件,含 MPIE-Bench #13 续立 + Beyond Borrowed Histories #15 续立) - 2026-08-02-1245-stephen-coordination-check-noon.md(协调棒;提及 evaluation 相关覆盖度盘点) - 2026-08-01-ai-industry-e1prep.md(沿用 v33) - 2026-08-01-llm-application-e1prep.md(含 Lilian Weng Harness Engineering 与评测框架邻接)

paper_cards 近 3 天新卡(674-688,15 张): - 主分类 evaluation:679(Beyond Borrowed Histories ✅)+ 684(Fairness Pruning ✅,已在 R33 基线) - 副分类 evaluation:685(See2Think,多模态主分类,✅ 已在 R33 基线)+ 676(ConMem,agent/rag 双主分类) - 其余 11 张:agent(683 Σ-Mem / 686 Filesystem Memory)+ multimodal(688 OmniScope / 674 DualG-MRAG / 675 GLM-RAG)+ llm-infra(677/678/680-682/687) - 近 3 天主分类 evaluation 新卡:1 件(Beyond Borrowed Histories 2607.27816)


主题活文档更新状态

  • knowledge/evaluation.md 当前版本:R33(2026-08-01 15:40 批次)
  • 本期 3 条确认增量(含 2 条已在基线但有新增细节)+ 1 条邻接增量,可支持 R34 更新候选
  • 核心更新方向:§2.2 Benchmark 设计(Beyond Borrowed Histories 第九件)+ §2.5 评测方法学批判(Fairness Pruning 因果推断边界 + See2Think VAoT 方法论依赖 + Beyond Borrowed Histories 用户对齐主观性)
  • 建议 R34 关注:MPIE-Bench(2607.27616,paper_cards 未建)是否值得作为"场景专化型评测基准"邻接条目纳入 §2.2;paper_cards 建卡优先级应高于内容填充

无显著新增量时说明

本日 evaluation 主题 ArXiv 新鲜供给处于相对低谷,主要原因是:

  1. R33 五联协同(Fairness Pruning + See2Think + FutureAGI + BM25 + MirrorCode)收官后进入整理期:2026-08-01 批量收官,覆盖了 token 级偏差定位 + 多模态评测诊断 + 工业评测工具链 + RAG retrieval 基准 + 超长程编程评测五个核心方向,剩余增量空间有限
  2. 今日实质性新增量:1 条 paper_cards 已建 evaluation 主分类卡片(Beyond Borrowed Histories):属于"场景专化型评测基准"方向,与 R33 已有的 LOCA-bench / M3Exam / RepoReasoner / MirrorCode 构成"评测场景专化"维度
  3. HF Daily 8-02 票榜 top 15 无 evaluation 主分类新条目:AskChem(290▲)/ Qwen-UI-Agent(278▲)/ Metis(254▲)均为 agent/multimodal 主分类;MPIE-Bench(37▲ #13)为 multimodal 主分类副 evaluation
  4. 今日实质新增量:1 条 paper_cards 建卡 evaluation 条目(Beyond Borrowed Histories)+ 1 条工业邻接(MPIE-Bench)= 共 2 条增量
  5. 2 条已在基线的条目(Fairness Pruning + See2Think)有新增方法论细节:属于框架已知但有新内容填充,不属于全新方向开掘

本棒 R34 预消化关键议题

R33 五联协同收官后,R34 面临的核心问题是:如何在"场景专化型评测"这一新维度上建立系统性评测方法论框架?

  1. Beyond Borrowed Histories → 下一步:用户对齐 rubric 的"个体化模拟用户"设计是否存在系统性偏差?"模拟用户"与"真实用户"之间的代表性差距如何量化?"用户对齐评测"是否可以推广到非角色扮演场景(客服/教育/医疗)?
  2. MPIE-Bench → 下一步:paper_cards 建卡后,需要核实"解剖学合理"的具体评测设计——多人协作场景的 ground truth 编辑结果如何定义?是否存在 inter-annotator agreement 报道?
  3. Fairness Pruning 因果推断边界 → 下一步:激活定位的"结构关联 ≠ 因果推断"是所有基于 activation 的解释性方法的共同问题,是否值得在 evaluation 活文档 §2.5 建立统一的"激活分析方法的因果推断边界"评估标准?
  4. 跨文档联动:Beyond Borrowed Histories 邻接 rag.md(角色扮演 RAG);Fairness Pruning 邻接 risk.md(demographic bias as risk factor);See2Think 邻接 multimodal.md(视觉依赖评测)—— R34 更新时需确认跨文档一致性

Tom · 2026-08-02 15:40 CST · E1 预消化简报 · 3 条确认增量(含 2 条已在基线补充细节)+ 1 条邻接增量 · 涉及 arXiv:2607.27816(🆕)/ 2607.28319(基线补充)/ 2607.26769(基线补充)/ 2607.27616(邻接,待建卡)