evaluation · E1 预消化简报(2026-10-05)

执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-05 15:40 CST 窗口定义:2026-10-04 15:40 ~ 2026-10-05 15:40 CST(约 24 小时滑动窗口) 底本:organized/knowledge/evaluation.md(R94 基线 · 2026-10-04 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 3-5 新入库 eval 相关条目 诚实度声明:本轮 eval 主题净增量密度「低」— eval 主分类 paper_card NET-new 净增 0 件(DyadMem 属 agent 主分类但 eval 副分类,属邻接级);本轮 eval 相关新增全部落在邻接/副分类层,另有 1 件 eval 邻接 paper_card 候选(HyperBrowseComp)待入库确认。整体评估:R94 锚定的 eval 方法学骨架稳固(反方审稿双极盲区联通 + 间接评估五件套 + VLM 双锚 + cost-aware 六层级 + 长程五端点),Oct 4-5 无颠覆性新 benchmark 或方法学突破。


状态摘要

  • 增量条数:3 条(落在 3-8 目标区间内,但均为邻接/副分类级,无主分类 NET-new)
  • 核心新增:① DyadMem URAM(2610.03020 · Google DeepMind · Agent 长期记忆 benchmark · eval 副分类)② SWE-Serve(2609.26777 · NVIDIA/LMSYS/Berkeley · 生产推理工程 benchmark)③ RAG eval 框架生产模式(RAGAS/TruLens/DeepEval/ARES 四体系对比)
  • 澄清:本轮无 eval 主分类 paper_card NET-new;DyadMem 属 agent 主分类,eval 为副分类,不占主分类名额;HyperBrowseComp(2610.03574 · 下午 radar 高价值)为本轮 eval 邻接 paper_card 候选,待入库后确认
  • 涉及 arXiv 号:本次新增 3 个(2610.03020 · 2609.26777 · 2610.03574 待确认)+ 续用 R93 锚定 290+ 个

〇、检查过的来源清单

来源目录 关键文件 eval 相关度
inbox/tom 2026-10-04-evaluation-e1prep.md(R94 基线锚定 · Ego2Act 邻接 + LongHarness×SEAL 联动) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-05T1440-agent-rag-longcontext-radar.md(Oct 5 下午 radar · 8 候选 / 3 高价值) 高 ⭐⭐⭐⭐(HyperBrowseComp/CLIMB 评测邻接)
inbox/tom 2026-10-05_agents-lite.md(Oct 5 · DyadMem + Tracking State Footprints 候选) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-05-0900-hf-daily-2026-10-05.md(HF Daily Oct 5 早棒 · 15 篇) 高 ⭐⭐⭐⭐(无 eval 主分类)
inbox/jay 2026-10-05-ai-engineering-trending.md(HF 七月入侵 + State of Open Models + DoorDash/SWE-Serve) 高 ⭐⭐⭐⭐(SWE-Serve benchmark)
inbox/jay 2026-10-05T1050-jay-engineering-filter.md(Jay 工程过滤 · 3🔴 · KaliBench benchmark + RAG eval 框架对比) 极高 ⭐⭐⭐⭐⭐(eval 工具/框架对比)
inbox/jay 2026-10-05-1105-jay-five-category-briefing.md(Jay 五类简报 · SWE-Serve 详细数据) 极高 ⭐⭐⭐⭐⭐(SWE-Serve 53 任务 benchmark)
inbox/spark 2026-10-05-agent-e1prep.md(spark 日间 agent prep · DyadMem/Tracking State Footprints 已锚) 高 ⭐⭐⭐⭐
organized/paper_cards 1651-2610-03020.md(DyadMem · Oct 5 入库 · eval 副分类) 极高 ⭐⭐⭐⭐⭐
organized/paper_cards 1650-2610-03140.md(Tracking State Footprints · Oct 5 入库 · agent 主分类 · eval 无标签) 中 ⭐⭐⭐
organized/queue work-queue.md(2026-10-05 14:00 · Top 15 无 eval 主分类) 高 ⭐⭐⭐⭐

一、增量条目

增量 1:DyadMem — 用户条件关系型 Agent 记忆(URAM)Benchmark(2610.03020)— eval 副分类邻接(⭐⭐⭐⭐)

来源:organized/paper_cards/1651-2610-03020.md(Oct 5 入库 · 主分类 agent / 副分类 evaluation / 形态 benchmark)· inbox/tom/2026-10-05_agents-lite.md(Oct 5 候选 #3)· 原始来源:arXiv:2610.03020v1 · Google DeepMind · Yifei Tao 等

URL:https://arxiv.org/abs/2610.03020v1

TLDR(原文):Long-term agents must remember not only what is true about a user, but also how a particular agent should work with that user as their shared history evolves. We introduce DyadMem with the proposed new definition User-conditioned Relational Agent Memory (URAM).

要点:

  • 核心问题:现有 benchmark 主要监督用户事实/偏好,或跨用户可复用的经验,但没有评测"特定 Agent 应如何与特定用户协作"这一关系特定的记忆——大多数先前工作仅通过长交互历史上的最终答案 QA 评估模型,使评估仍不完整且不可靠
  • 方法贡献:提出 DyadMem benchmark + URAM(User-conditioned Relational Agent Memory)新定义——联合标注用户侧记忆与 Agent 侧关系记忆,填补"关系特定协作记忆"评测空白
  • 评测创新:将"关系质量"(agent 与 user 的协作历史如何演变)作为独立评测维度——区别于传统 QA 准确率,URAM 评测的是 agent 对协作关系演化的记忆能力
  • 作者机构:Yifei Tao 等 · Google DeepMind = frontier lab 直接产出记忆/评测 benchmark——强化了 R93 §1.3 "间接评估"脉络(APM-Bench 持久记忆 + DyadMem 关系记忆 = 用户记忆双维度)
  • ⚠️ 待核实:URAM 的标注一致性(关系质量 vs 事实记忆的边界是否清晰);具体评测指标(是生成质量?检索准确率?协作质量评分?);与 APM-Bench 的关系(都测长程记忆,但 APM-Bench 测跨会话持久,DyadMem 测用户关系演化)

与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §1.3 长程/多 Agent 评测五端点:APM-Bench 测跨会话持久记忆(持久端点),DyadMem 测 Agent-User 关系记忆——两者共同构成"长程记忆评测"的双子维度 - 邻接 R93 §1.2 稳定性维度:SAGO 测行为变异性,DyadMem 测关系记忆演化——都从"准确率"之外的维度评估 Agent - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · DyadMem 2610.03020 · eval 副分类/agent 主分类 benchmark · Google DeepMind · URAM 用户关系记忆评测 · 间接评估第六候选 · 建议 R95 原文精读后正式升锚)


增量 2:SWE-Serve — 生产推理系统评测 Benchmark(2609.26777)— eval 邻接(⭐⭐⭐⭐)

来源:inbox/jay/2026-10-05-1105-jay-five-category-briefing.md(Jay 五类简报 §四)· inbox/jay/2026-10-05-ai-engineering-trending.md(Jay trending §四)· 原始来源:arXiv:2609.26777 · NVIDIA + LMSYS + UC Berkeley

URL:https://arxiv.org/abs/2609.26777

TLDR(Jay 简报摘要):首个生产级推理工程 benchmark,53 个生产级推理工程任务,覆盖模型支持 / 解码 / 分布式执行 / 服务 API——NVIDIA + LMSYS + UC Berkeley 联合产出。

要点:

  • 核心问题:现有 agent 评测(SWE-bench 等)聚焦任务完成质量,但不评测推理服务基础设施本身的性能——GPU 利用率、KV cache 管理、批处理效率、分布式调度——这些是生产部署的关键指标,但没有标准化评测
  • 方法贡献:SWE-Serve 提出 53 个生产级推理工程任务,覆盖推理系统的完整技术栈——模型加载、prefill/decode 效率、多卡并行、延迟/吞吐 trade-off、API 服务质量
  • 与 R93 HAL 的关系:HAL 测"agent 任务完成的 cost per instance"(任务侧成本);SWE-Serve 测"推理系统 infrastructure 的性能"(系统侧性能)——HAL + SWE-Serve = agent 评测的 cost 层 + infrastructure 层双轨;两者共同扩展"评测诚信六层级"中的 cost-aware 层
  • 评测价值:为"推理引擎选型"(vLLM vs SGLang vs TensorRT-LLM)提供标准化 benchmark——与 Jay Oct 5 推理引擎对比数据(vLLM 3.67× throughput vs TGI)形成"工具对比 + 标准化 benchmark"双轨互补
  • ⚠️ 待核实:具体评测指标体系(throughput / latency / GPU util 的权重);与现有 inference benchmark(LLMPerf 等)的关系

与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §1.4 cost-aware 评测基础设施:HAL(cost per task)与 SWE-Serve(infrastructure performance)共同构成 cost-aware 评测的"任务成本 + 系统成本"双维度 - 邻接 R93 §2.2 评测平台与 CI Gate:SWE-Serve 可作为推理系统 CI/CD gate 的标准化性能评测工具 - 建议归入章节:§1.4 cost-aware 评测基础设施(新增邻接 · SWE-Serve 2609.26777 · NVIDIA/LMSYS/Berkeley · 生产推理工程 benchmark · HAL 的 infrastructure 扩展 · ⚠️ 待原文精读确认评测指标体系)


增量 3:RAG eval 框架生产模式 — RAGAS/TruLens/DeepEval/ARES 四体系对比 — eval 邻接(⭐⭐⭐)

来源:inbox/jay/2026-10-05T1050-jay-engineering-filter.md(Jay 工程过滤 · 条目 8 · 10KB · Samuel Ochoa + DeepEval Blog + CloudRPS)· 原始来源:samuelochoa.com/expertise/rag/eval/ragas-and-frameworks + DeepEval Blog

TLDR(Jay 筛选摘要):生产 RAG 团队 eval pipeline 建设实践;RAG Triad 指标体系(context relevance / groundedness / answer relevance);不同阶段推荐不同框架。

要点:

  • RAG Triad 指标体系:
  • Context Relevance:检索内容与 query 的相关度
  • Groundedness(Faithfulness):答案与检索内容的忠实度(防止幻觉)
  • Answer Relevance:答案与 query 的相关度
  • 四框架对比:
  • RAGAS:开箱即用,便宜易上手 → 适合 Early stage
  • TruLens / Phoenix(Arize):可观测 + eval → 适合 Production
  • DeepEval:Pytest 集成 + CI/CD + trace-level + component-level evals → 适合 DevOps 团队
  • Braintrust:生产监控 → 适合 Enterprise
  • 生产事故案例:RAG faithfulness regression 导致金融客户账户余额错误 → eval pipeline 的必要性实证
  • 局限性:纯工程实践视角,无 arXiv 学术来源,不宜作为学术引用,但可作为 eval 工具选型的工程参考

与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §2.2 评测平台与 CI Gate:RAGAS/TruLens/DeepEval 作为 eval harness 工具,可纳入 harness 生态候选二十角 - 邻接 R94 前瞻方向:当 agent 与 RAG 系统深度集成后,这类 eval 工具将扩展到 agent eval 场景(agent 输出的 groundedness / context relevance) - 建议归入章节:§2.2 评测平台与 CI Gate(eval 工具选型脚注 · 不作为核心锚点引用,仅作工程参考)


二、值得警惕的矛盾或待核实说法

⚠️ 矛盾 1:SWE-Serve 的评测指标体系尚不明确

  • 矛盾内容:SWE-Serve(2609.26777)被 Jay 简报描述为"生产推理工程 benchmark",但具体评测指标(throughput / TTFT / GPU利用率 / 成本 per instance)权重和计算方式未在 inbox 来源中披露
  • 潜在影响:如果评测指标与 HAL(cost per task)重叠,则两者合并为同一类;如果是不同的维度,则可作为独立锚点
  • 建议:R95 前需原文精读确认 SWE-Serve 的指标体系
  • 来源:inbox/jay/2026-10-05-1105-jay-five-category-briefing.md

⚠️ 待核实 1:DyadMem URAM 与 APM-Bench 的评测边界

  • 待核实项:APM-Bench(549 sessions × 2,719 candidates)测"跨会话持久记忆",DyadMem 测"Agent-User 关系记忆演化"——两者是否构成互补(跨会话持久 + 关系演化),还是有重叠的评测对象?
  • 建议:R95 原文精读后确认 URAM 标注方法与 APM-Bench 的明确区分
  • 来源:organized/paper_cards/1651-2610-03020.md

⚠️ 待核实 2:HyperBrowseComp(2610.03574)是否为 eval 主分类 paper_card

  • 待核实项:Tom Oct 5 下午 radar 高价值条目(#3),arXiv 2610.03574,覆盖 13 种语言、423 题人工验证题库,评测多语言多模态网页浏览 agent——纸卡尚未入库
  • 建议:确认入库后评估是否升为 eval 主分类(benchmark 形态 + agent 主分类/eval 邻接)
  • 来源:inbox/tom/2026-10-05T1440-agent-rag-longcontext-radar.md

三、本轮无硬凑声明

本轮 eval 主题在 Oct 3-4 已由 SAGO + PhysVista + OpenTumorBoard + Ego2Act + LongHarness×SEAL 完成了方法学联通锚定(R93→R94)。Oct 5 eval 相关新增:

  • DyadMem(2610.03020):agent 主分类,eval 副分类——有明确评测维度(URAM benchmark),可立项邻接,但不占 eval 主分类 NET-new 名额
  • SWE-Serve(2609.26777):生产推理工程 benchmark——eval 邻接基础设施扩展,需原文精读确认指标体系
  • RAG eval 框架:工程实践综述——eval 工具选型参考,无学术来源,不单独列为主锚点

无 eval 主分类 paper_card 净增:Oct 5 HF Daily 早棒 15 篇无 eval 主分类直接命中;Tom 下午 radar 的 HyperBrowseComp(2610.03574)为 eval 邻接候选,待入库确认。


四、可引用的 arXiv 号列表

arXiv 号 标题 主/邻 状态
2610.03020 DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users agent 主/eval 副 🆕 本轮新增锚点候选(eval 副分类邻接)
2609.26777 SWE-Serve: Production-Grade Inference Engineering Benchmark 邻接 eval 🆕 本轮新增锚点候选(待原文精读确认指标体系)
2610.03574 HyperBrowseComp: Multilingual Multimodal Web-Browsing Agent Evaluation 邻接 eval 🆕 候选待入库确认
2610.01428 SAGO: Generalization Is Stability 主分类 eval R94 已锚定
2610.00559 PhysVista: Benchmarking Physical Intelligence in VLMs 主分类 eval R94 已锚定
2609.32810 OpenTumorBoard: Multidisciplinary Tumor Board Discussion 主分类 eval R94 已锚定
2610.01092 Ego2Act: Egocentric Video Generation for Embodied Agent Evaluation agent 主/eval 邻 R94 已锚定
2609.38137 LongHarness Bench 邻接 eval R94 已锚定(反方审稿见 flyp Oct 3)
2605.30104 SEAL: LLM-as-Meta-Judge 副分类 eval R94 已锚定(反方审稿见 flyp Oct 3)
2606.05670 BenchAgent: Protocol-Aligned Agent Workflow Evaluation 邻接 eval R94 已锚定
2510.11977 HAL: Holistic Agent Leaderboard 邻接 eval R94 已锚定
2605.20530 AgentProcessBench: Step-Level Process Quality 邻接 eval R94 已锚定
2609.26777 SWE-Serve: Production-Grade Inference Engineering Benchmark 邻接 eval R94 已锚定

Tom · 2026-10-05 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-05-evaluation-e1prep.md