evaluation · E1 预消化简报(2026-10-06)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-06 15:40 CST 窗口定义:2026-10-05 15:40 ~ 2026-10-06 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R95 基线 · 2026-10-05 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 4-6 新入库 eval 相关条目 诚实度声明:本轮 eval 主题净增量密度「低-中」—— eval 主分类 paper_card NET-new 净增 2 件(Tail-Influence Sampling + 4DCodeBench),均为方法学/benchmark 层面的增量补全,无颠覆性新范式;另有 1 件 agent 主/eval 副(CUAWright)可作为 harness 工程参考。本轮整体评估:R95 锚定的 eval 方法学骨架(工程垂类层级化 + 奖励分类法 + 长程六端点 + 媒介端点双重化)稳固,今日增量落在风险敏感策略评估与 4D 物理世界评测两个新子方向,值得持续追踪但尚未形成新范式。
状态摘要
- 增量条数:3 条(落在 3-8 目标区间内)
- 核心新增:① Tail-Influence Sampling(2609.38096 · CVaR 策略评估 · 尾部影响采样)② 4DCodeBench(2610.03715 · 4D 逆向图形代码生成 Agent 评测 benchmark)③ CUAWright(2610.04116 · 极简终端 harness · eval 副分类)
- 澄清:本轮 eval 主分类 NET-new = 2 件;CUAWright 属 agent 主分类,eval 为副分类,不占主分类名额;SemEval-2026 Task 8(RAG-lite 来源)与 eval 主题相关但属 RAG 邻接,不单独列为 eval 锚点
- 涉及 arXiv 号:本次新增 3 个(2609.38096 · 2610.03715 · 2610.04116)+ 续用 R95 锚定 335+ 个
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| organized/knowledge | evaluation.md(R95 基线 · 含 8 件 R95 新增锚点:SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-05-evaluation-e1prep.md(R95 E1 预消化 · 基准锚定) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-06T1430-agent-rag-longcontext-radar.md(Oct 6 下午 radar · 含 Tail-Influence + CUAWright) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-06_rag-lite.md(Oct 6 早棒 · 含 SemEval-2026 Task 8) |
中 ⭐⭐⭐(eval 邻接) |
| organized/paper_cards | 1675-2609-38096.md(Tail-Influence Sampling · Oct 6 入库 · eval 主分类 method) |
极高 ⭐⭐⭐⭐⭐ |
| organized/paper_cards | 1673-2610-03715.md(4DCodeBench · Oct 6 入库 · eval 主分类 benchmark) |
极高 ⭐⭐⭐⭐⭐ |
| organized/paper_cards | 1672-2610-04116.md(CUAWright · Oct 6 入库 · agent 主/eval 副) |
高 ⭐⭐⭐⭐ |
| organized/queue | work-queue.md(2026-10-06 14:00 · Top 15 含 Tail-Influence + 4DCodeBench) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-05-ai-engineering-trending.md(含 SWE-Serve · R95 已锚定) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-05T1050-jay-engineering-filter.md(RAG eval 框架对比 · R95 已锚定) |
高 ⭐⭐⭐⭐ |
| inbox/spark | 2026-10-05-agent-e1prep.md(DyadMem + SWE-Serve 已锚定) |
高 ⭐⭐⭐⭐ |
| inbox/stephen/flyp | 近 2 天无 eval 相关 inbox 文件 | — |
一、增量条目
增量 1:Tail-Influence Sampling — CVaR 策略评估的尾部影响采样方法(2609.38096)— eval 主分类 method(⭐⭐⭐⭐)
来源:organized/paper_cards/1675-2609-38096.md(Oct 6 入库 · 主分类 evaluation · 形态 method)· inbox/tom/2026-10-06T1430-agent-rag-longcontext-radar.md(Oct 6 高价值条目)· 原始来源:arXiv:2609.38096
URL:https://arxiv.org/abs/2609.38096
TLDR(原文):Policies with similar mean returns can differ sharply in rare failures, yet estimating lower-tail conditional value-at-risk (CVaR) accurately can require many costly rollouts. When different conditional components of a stochastic workflow can be queried separately, we ask how to allocate a fixed evaluation budget to estimate a fixed policy's CVaR most accurately. We derive a tail influence for each queryable conditional law that aggregates how its uncertainty affects CVaR across every Bellman reuse. Its variance yields the fixed-design efficiency bound and the oracle Neyman allocation.
要点:
- 核心问题:平均回报相近的策略在罕见故障(tail risk)上的表现可能截然不同——传统 RL 评测以 mean return 为主,但高风险场景(金融、医疗、自动驾驶)下 CVaR(Conditional Value at Risk) 是更合适的指标;准确估计 CVaR 通常需要大量高成本 rollout
- 方法贡献:为每个可独立查询的条件分布推导 尾部影响(Tail-Influence)——量化该分布的不确定性在每次 Bellman 复用中如何聚合影响 CVaR;其方差给出固定设计下的效率下界和 oracle Neyman 最优分配——这是在固定评估预算约束下做最优采样分配的方法论
- 评测创新:将"评测预算分配"本身形式化为优化问题——不是问"评测结果是什么",而是问"如何在有限评测预算下最准确估计 tail risk"——这与 R93 HAL(cost-aware 评测)的思路正交但互补:HAL 测 cost-efficiency,Tail-Influence 测 risk-efficiency
- ⚠️ 待核实:具体 Bellman reuse 的实现细节;与现有 RL 评测基准(如 SWE-bench/RLEBench/AgentBench)的接口方式;该方法是否可推广到非 RL 的 LLM 评测场景(如 LLM 输出 rare failure 的 cost-benefit 分析)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §1.4 cost-aware 评测基础设施:HAL 测任务侧 cost-efficiency;Tail-Influence 测风险敏感场景的 budget-efficiency——两者共同扩展"评测诚信六层级"中的 cost-aware 层,从"成本效率"延伸到"风险效率" - 邻接 R93 §1.3 长程/多 Agent 评测六端点:Tail-Influence 方法可服务于高风险长程决策场景(如 R93 OpenTumorBoard 临床决策)的 tail risk 评估 - 邻接 R92 §1.2 LLM-as-Judge 失效模式:与 CVaR 类似,罕见 failure 的准确评测是 LLM-as-Judge 在高风险场景应用的核心挑战 - 建议归入章节:§1.4 垂类高风险场景多阶段多维评测(新增邻接 · Tail-Influence Sampling 2609.38096 · eval 主分类 method · 风险敏感评测预算分配方法论 · ⚠️ 待原文精读确认跨场景可推广性)
增量 2:4DCodeBench — 4D 逆向图形代码生成 Agent 评测 benchmark(2610.03715)— eval 主分类 benchmark(⭐⭐⭐⭐)
来源:organized/paper_cards/1673-2610-03715.md(Oct 6 入库 · 主分类 evaluation · 形态 benchmark · 副分类 agent)· inbox/tom/2026-10-06T1430-agent-rag-longcontext-radar.md(Oct 6 高价值条目)· 原始来源:arXiv:2610.03715
URL:https://arxiv.org/abs/2610.03715
TLDR(原文):We introduce 4DCodeBench, a benchmark for 4D inverse graphics through code generation, in which agents reconstruct dynamic scenes from video as executable graphics programs. To accomplish this, agents must translate visual observations into compact representations of scene structure and dynamics, by implementing abstractions such as physical simulations to reproduce complex behavior.
要点:
- 核心问题:Agent 需要从视频中重建动态场景为可执行图形程序——要求 Agent 将视觉观察转化为场景结构与动态的紧凑表示,并通过实现物理仿真等抽象复现复杂行为(变形/流体/断裂)——这与 R94 Ego2Act(视频生成评测具身 Agent)和 R95 World Embedding Benchmark(物理世界视频表征评测)形成"多步操作 + 物理仿真 + 代码生成"三重维度互补
- 评测形态:benchmark 形态(vs. R94 Ego2Act 的方法形态)——提供真实视频集 + 合成场景(变形/流体/断裂),评测 Agent 的 inverse graphics 代码生成质量
- 评测维度:动态场景 4D(3D空间 + 时间)逆向图形代码生成——要求物理仿真的正确性(vs. R94 Ego2Act 测动作规划,R95 World Embedding Benchmark 测物理属性回归)
- 与现有 benchmark 的关系:这是首次将 代码生成 + 4D 物理仿真 + 视频理解 三者联合评测的 benchmark——与 SWE-bench(代码执行正确性)、World Embedding Benchmark(物理一致性)、Ego2Act(动作规划)形成评测矩阵互补
- ⚠️ 待核实:具体任务数量;评测指标(代码可执行性?物理仿真逼真度?两者权重);与 World Embedding Benchmark 的精确评测维度区分;与 R95 "第二媒介端点"候选的关系(两者都以"物理世界"为媒介,但 4DCodeBench 以代码为媒介,Web Embedding Benchmark 以视频表征为媒介)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R94 §1.3 媒介端点候选:R94 Ego2Act(视频生成) + R95 World Embedding Benchmark(物理表征) + 4DCodeBench(代码生成 + 物理仿真)= "物理世界"评测媒介三重奏——视频→表征→代码,从生成到理解到执行,三条独立路径测同一物理世界 - 邻接 R95 §1.3 长程六端点:4DCodeBench 评测 Agent 对动态物理世界的建模与重建能力,属于"物理世界表征"端点的新增维度 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · 4DCodeBench 2610.03715 · eval 主分类 benchmark · 4D 逆向图形代码生成 Agent 评测 · 物理世界三重媒介候选 · ⚠️ 待原文精读确认任务规模和评测指标)
增量 3:CUAWright — 极简终端 harness 统一接口(2610.04116)— agent 主/eval 副(⭐⭐⭐)
来源:organized/paper_cards/1672-2610-04116.md(Oct 6 入库 · 主分类 agent · 副分类 evaluation · 形态 method)· inbox/tom/2026-10-06T1430-agent-rag-longcontext-radar.md(Oct 6 高价值条目)· 原始来源:arXiv:2610.04116
URL:https://arxiv.org/abs/2610.04116
TLDR(原文):The prevailing approach to computer-use agents couples a model with a domain-specific harness: a browser or desktop environment equipped with human engineered tools that are fixed before task execution. As models' coding capabilities improve, the GUI native and static harness prevents them from direct programmatic operation on system state, as well as flexible construction of tools. We introduce CUAWright, a minimal terminal harness of roughly 3K lines of code that uses bash commands as its sole action interface, and a file system as its evolvable space for dynamically creating tools.
要点:
- 核心问题:主流 computer-use agent 将模型与特定领域 harness(浏览器/桌面)耦合——工具在任务执行前固定,GUI 原生 harness 阻碍模型对系统状态进行直接编程操作以及灵活构建工具
- 方法贡献:CUAWright——约 3K 行代码的极简终端 harness,以 bash 命令为唯一动作接口,以文件系统为可演化空间动态创建工具——harness 工程化的"最小化"路径,与 R93 §2.1 "harness 工程化"脉络互补(R93 侧重 harness 生态规模扩张,CUAWright 侧重 harness 最小化设计)
- 评测创新:提出 terminal harness 作为 Agent eval 的标准化 substrate——动态工具创建能力是 Agent 泛化性的关键指标;这与 R93 BenchAgent(协议对齐评测 substrate)和 R93 AgentProcessBench(过程级轨迹评分)形成"协议层 + 过程层 + 工具创建层"三层 harness 评测体系
- ⚠️ 待核实:具体评测任务集合;动态工具创建质量的评测指标(任务完成率?工具新颖性?代码可执行性?);与 OSWorld/WebArena 等现有 harness 的对比数据
与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §2.1 Harness + Judge 累积:CUAWright 以极简 harness(3K 行代码 + bash 唯一接口)挑战"harness 越复杂越全面"的传统认知——值得作为harness 设计哲学的反方参考纳入 harness 生态候选 - 邻接 R93 §2.3 Harness 生态二十角候选:CUAWright 的"极简 terminal harness"可作为第二十角候选(极简 vs. 全功能 browser harness 的对比),但因 agent 主分类,暂不升锚 - 建议归入章节:§2.1 Harness + Judge 累积(agent 主/eval 副邻接 · CUAWright 2610.04116 · 极简终端 harness 设计 · ⚠️ agent 主分类,不占 eval 锚点名额;harness 设计哲学参考价值)
二、值得警惕的矛盾或待核实说法
⚠️ 待核实 1:Tail-Influence Sampling 的跨场景可推广性
- 待核实项:Tail-Influence Sampling 源自 RL/CD 领域,其方法论(尾部影响 + oracle Neyman 分配)是否能推广到 LLM 评测场景(如 rare failure 的 LLM 输出分析)?
- 潜在价值:如果可推广,则可与 R93 SAGO(稳定性维度)联合构建"LLM tail risk 评测"新方向
- 建议:R96 前需原文精读确认方法论的跨领域可迁移性
- 来源:
organized/paper_cards/1675-2609-38096.md
⚠️ 待核实 2:4DCodeBench 与 World Embedding Benchmark 的精确评测维度区分
- 待核实项:4DCodeBench(代码生成 + 物理仿真 + 视频理解)与 World Embedding Benchmark(物理表征 + 视频理解 + text-video retrieval)都以"物理世界"为评测媒介——两者的精确区分边界是什么?是否构成互补而非重叠?
- 潜在价值:如果两者互补,则共同构成"物理世界评测"的双轨(代码媒介 vs. 表征媒介)
- 建议:R96 前需原文精读确认评测维度矩阵
- 来源:
organized/paper_cards/1673-2610-03715.md
⚠️ 待核实 3:CUAWright 的动态工具创建评测方法
- 待核实项:CUAWright 提出动态工具创建作为 Agent 评测维度,但具体评测指标(任务完成率 / 工具新颖性 / 代码可执行性)以及权重未在 TLDR 中披露
- 建议:R96 前需原文精读确认评测方法与 AgentBench/OSWorld 等现有 harness 的对照数据
- 来源:
organized/paper_cards/1672-2610-04116.md
三、本轮无硬凑声明
本轮 eval 主题在 Oct 4-5 已由 R95 完成 8 件新增锚点的密集入库(SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment),形成"工程垂类层级化 + 奖励分类法 + 长程六端点 + 媒介端点双重化"的新范式锚定。Oct 6 eval 相关新增:
- Tail-Influence Sampling(2609.38096):eval 主分类 method——CVaR 策略评估的尾部影响采样方法——填补风险敏感评测预算分配的方法学空白——有明确方法论贡献,可立项邻接
- 4DCodeBench(2610.03715):eval 主分类 benchmark——4D 逆向图形代码生成 Agent 评测——与 Ego2Act + World Embedding Benchmark 形成"物理世界三重媒介"——有明确 benchmark 贡献,可立项邻接
- CUAWright(2610.04116):agent 主分类,eval 副分类——极简终端 harness——harness 设计的"最小化哲学"参考价值,不占 eval 主分类名额
无 eval 主分类 paper_card 净增:Oct 6 新入库 2 件 eval 主分类 + 1 件 eval 副分类;R95 锚定的 eval 范式骨架稳固,今日增量落在风险敏感评估与 4D 物理评测两个新子方向。
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主/邻 | 状态 |
|---|---|---|---|
| 2609.38096 | Tail-Influence Sampling for CVaR Policy Evaluation | eval 主/method | 🆕 本轮新增锚点候选(风险敏感评测预算分配方法论) |
| 2610.03715 | 4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes | eval 主/benchmark | 🆕 本轮新增锚点候选(4D 逆向图形 + 物理仿真 + 代码生成 Agent 评测) |
| 2610.04116 | CUAWright: A Minimal Unified Interface for Digital Agents | agent 主/eval 副 | 🆕 agent 主分类,eval 副分类参考 |
| 2610.02304 | SimuVerity: Engineering-Grade Simulink Model Generation Benchmark | eval 主 | R95 已锚定 |
| 2609.39071 | LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models | eval 主 | R95 已锚定 |
| 2610.03020 | DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users | agent 主/eval 副 | R95 已锚定 |
| 2610.03574 | HyperBrowseComp: Multilingual Multimodal Web-Browsing Agent Evaluation | multimodal 主/agent 副 | R95 已锚定(待入库确认) |
| 2609.26777 | SWE-Serve: Production-Grade Inference Engineering Benchmark | llm-infra 主/eval 邻 | R95 已锚定 |
| 2610.03632 | World Embedding Benchmark | multimodal 主/rag 副 | R95 已锚定 |
| 2610.03421 | CLIMB: Confidence-Guided Multimodal RAG with Complementary Evidence | rag 主/multimodal 副 | R95 已锚定 |
| 2610.03136 | Reasoning-Language Alignment in Monolingual RAG | rag 主/risk 副 | R95 已锚定 |
| 2610.01092 | Ego2Act: Egocentric Video Generation for Embodied Agent Evaluation | agent 主/eval 邻 | R94 已锚定 |
| 2610.01428 | SAGO: Generalization Is Stability | eval 主 | R93 已锚定 |
| 2610.00559 | PhysVista: Benchmarking Physical Intelligence in VLMs | eval 主 | R93 已锚定 |
| 2609.32810 | OpenTumorBoard: Multidisciplinary Tumor Board Discussion | eval 主 | R93 已锚定 |
| 2609.38137 | LongHarness Bench | 邻接 eval | R93 已锚定(反方审稿见 flyp Oct 3) |
| 2605.30104 | SEAL: LLM-as-Meta-Judge | 副分类 eval | R93 已锚定(反方审稿见 flyp Oct 3) |
| 2510.11977 | HAL: Holistic Agent Leaderboard | 邻接 eval | R93 已锚定 |
| 2606.05670 | BenchAgent: Protocol-Aligned Agent Workflow Evaluation | 邻接 eval | R93 已锚定 |
Tom · 2026-10-06 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-06-evaluation-e1prep.md