主题综述 · evaluation(2026-10-07)
- 作者:spark
- 更新:2026-10-07
- 本棒 net-new = 4 件(AgencyBench 1M-token 真实世界 Agent 评测 + JIL Attack 调度安全形式化 + Selection vs Extraction 预注册负面 + LMBuild 邻接预备 · 主分类 NET-new = 1、邻接/副 NET-new = 3 · 沿用 R96 终结信号 v1 骨架)
§0 自检栏 9 维实测
| 维度 | 实测 |
|---|---|
| 字数(CJK) | ≈3,820(落在 2,500-4,000 区间内) |
| ⚠️ 标注密度 | 11 处(覆盖 LMBuild + 待核 + rubric) |
| 反方按主线段数 | 6 段 × ≥150 字(harness/评分/调度/预注册/媒介/tail risk) |
| 立标池主表 | 6 件 + ★★★ PDF 待核 |
| §五 合流密度 | 6 处 × ≥150 字 |
| §3.4 法律独立段 | 1 段(类比 net neutrality / GDPR Art. 22) |
| verifiability 主轴独立抽检 | 4/19 = 21.1% ≥ 20% |
| 元语言串 14 字禁词次数 | 0 次 |
| 数字 verbatim 来源 | 9 处全引 |
§一 主题脉络与本棒窗口
1.1 evaluation 主题在 2026 Q4 的范式累积(R60–R96 骨架)
organized/knowledge/evaluation.md R97 锚定 "评测诚信六层级 + 长程七端点 + 媒介端点三重化 + 决策型 judge 失效模式四元 + 风险敏感 + 调度安全" 的复合骨架,累积锚 187 件(R60 = 17、R70 = 67、R80 = 116、R90 = 161、R97 = 193)。本棒评估长期内最显著的范式跃迁包括:R88 InferenceBench 元评测新范式 → R92 评测诚信五层级 + 评测失真类型学四元化 → R93 评测诚信六层级(+ cost-aware)+ VLM 评测双锚 + 长程五端点首次完整 + 反方审稿正式落地 → R95 工程垂类层级化 + 奖励分类法 → R96 风险敏感评测预算分配 + 物理世界三重媒介 + Harness 设计哲学极简化反方参考(沿用)。
1.2 本棒 24h 窗口(2026-10-06 ~ 2026-10-07 CST)delta
主分类 NET-new = 1 件(AgencyBench 1M-token 真实世界 Agent 评测),邻接/副分类 NET-new = 3 件(JIL Attack 调度安全 + Selection vs Extraction 预注册负面 + LMBuild 邻接预备)。整体落在 "长程端点第七向 + 调度公平性 + 预注册范式 + Harness 工具链" 四个新子方向,无颠覆性新 benchmark 范式;R96 终结信号 v1 骨架稳固,进入新范式拓展期 v2。
1.3 本棒承接关系
- R97 沿用 R96:Tail-Influence Sampling(锚 187)+ 4DCodeBench(锚 188)+ CUAwright(锚 189)= 风险敏感 + 4D 物理 + 极简 harness 三向全沿用;
- R97 沿用 R95:SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment = 锚 179-186 全部沿用;
- 本棒新增:锚 190(AgencyBench)+ 191(JIL Attack)+ 192(Selection vs Extraction)+ 193(LMBuild)。
§二 各工作贡献与相互关系
2.1 AgencyBench — 1M-token 真实世界 Agent 评测(2601.11044 · 主分类 benchmark · 锚 190)
- 作者机构:Shanghai Innovation Institute / SJTU / Hong Kong PolyU 等;通讯作者 Keyu Li / Pengfei Liu 等;v4(2026-04-23 提交);已由 ACL 2026 Main 会议接纳(Long Papers, pp. 7422–7440, San Diego 2026-07);
- GitHub 仓库:
GAIR-NLP/AgencyBench—— 已 release; - 核心规模:32 场景 × 138 任务,平均 ≈90 次工具调用 / ≈1M token / 数小时工作流;6 大 agent 能力 × 32 场景 mapping;评测闭环三层自动化 = user-sim(迭代式反馈)+ Docker sandbox(可复现沙箱)+ 双 rubric(视觉 + 功能)自动打分;
- 核心数据:闭源 48.4% vs 开源 32.1%;Claude-4.5-Opus × Claude-Agent-SDK 内部耦合度最佳,开源在不同 scaffold 下各现高峰;
- 与活文档 evaluation.md 的关系:与 R93 §1.3 长程六端点(执行 + 理论 + 持久 + 构造 + 临床 + 关系记忆)形成 "真实任务第七端点"——评测对象从 "刻意构造的长任务" 走向 "自然生成的日常真实工作流"。
2.2 JIL Attack — LLM 长度预测调度器系统性安全漏洞(2610.03430 · engineering 主/eval 强邻接 · 锚 191)
- 核心问题:对抗性后缀使长度预测调度器(TRAIL/vLLM/SGLang)低估输出长度,从而获得更高调度优先级;完成时间减少 27-46%;多租户 LLM 服务直接受威胁;
- 评测创新:首次形式化 "调度公平性"(scheduling-fairness)作为评测诚信新子维度;cost-aware 扩展为 cost-aware + scheduling-fairness;
- 缓解方案:粗粒度长度分组(请求按长度区间分组而非精确预测),效果待生产环境验证;
- 与活文档 evaluation.md 的关系:与 R93 HAL(任务侧 cost-efficiency)+ R96 Tail-Influence(风险敏感预算分配)形成 "cost-aware + risk-efficient + scheduling-fairness" 三维 cost-aware 评测诚信。
2.3 Selection vs Extraction — Agent 记忆预注册研究负面结果(2609.34227 · agent 主/eval 副 · Google DeepMind · 锚 192)
- 核心问题:对话 Agent 记忆形式争议——LLM 抽取精炼事实(extraction)vs 直接选取原始轮次(selection);已发表结果分歧;
- 方法贡献:预注册研究方法首次落地——在 LoCoMo 对话和 LongMemEval 上对 held-out 数据评估;LoCoMo 紧预算下 Jev 单次调用选取原始轮次对 LLM 抽取式记忆呈非劣效(单侧 95% 边界 -3.0 百分点,优于 -5 百分点的非劣效边界);
- 评测方法学:预注册设计使结论更可信,避免 p-hacking 与 publication bias;与 R92 MIST(个例)+ R93 SAGO(稳定性)形成 "评测方法学严谨化的三联(个例 + 稳定性 + 预注册)";
- Jev 跨主题复用:Jev 既可用于记忆选择,也可用于评判(flyp risk-e1prep 中 JEV Judges 96% 错误共现率)。
2.4 LMBuild — Agent 构建与评测框架(2610.04292 · eval 邻接候选 · 锚 193 · ⚠️⚠️⚠️ 待原文 TLDR 确认)
- 来源:HF Daily 2026-10-07 早棒 #2 顶置新立(24▲ 涨幅),仅次于 RealCompanion 250▲;
- 状态:⚠️ TLDR 在来源文件中截断;本条目基于 arXiv 号 + 排序推断;引用前必须读原文确认内容,不可基于推断写入 knowledge base 核心锚点;harness 工具链邻接预备;
- 可能贡献:根据 arXiv 号 2610.04292 与标题格式(LMBuild)+ Agent 构建评测上下文,推测为 Agent 开发/评测工具链相关(Scaffold 生成 / Agent 构建框架 / 评测自动化工具),具体待原文核实。
2.5 沿用锚点的对照补充(R96 + R95)
- Tail-Influence Sampling(2609.38096 · 主分类 method · 锚 187):tail influence + oracle Neyman 分配;CliffWalking MSE 降 41%/76% + frozen LM 23/24 MMLU-Pro 胜出 + six-call FinQA 2.4-3.4× MSE 优势;
- 4DCodeBench(2610.03715 · 主分类 benchmark · 锚 188):200 段视频 + 18 模型;动态场景逆向图形代码生成;与 Ego2Act + World Embedding Benchmark 形成 "动作生成 → 表征一致性 → 代码生成" 三重物理世界评测媒介;
- CUAwright(2610.04116 · agent 主/eval 副 · 锚 189):3K 行代码 + bash 唯一接口 + 文件系统为可演化工具空间;
- DyadMem(2610.03020 · agent 主/eval 副 · 锚 183):URAM 用户条件关系型 Agent 记忆;与 APM-Bench 形成 "长程记忆评测双子维度";
- SWE-Serve(2609.26777 · eval 邻接 · 锚 184):53 生产级推理工程任务;与 HAL 形成 "任务成本 + 系统性能" 双轨;
- SAGO(2610.01428 · 主分类 benchmark · 锚 175):泛化即稳定性;生成一致性 + 内部激活 + 置信度 + 响应镜像多轴;
- PhysVista(2610.00559 · 主分类 benchmark · 锚 173):感知-推理-评估闭环;VLM 物理理解缺陷;
- OpenTumorBoard(2609.32810 · 主分类 benchmark · 锚 174):611 患者 × 19,157 讨论轮次 × 10 专家角色;临床多 Agent 高风险决策垂类。
2.6 关系图(综合篇)
| 维度 | R96 锚 | R97 锚 | 联合信号 |
|---|---|---|---|
| 长程端点 | — | AgencyBench(第七向·真实任务) | 长程评测从 "实验室长程" 走向 "真实部署长程" |
| 调度公平性 | — | JIL Attack(调度安全) | cost-aware → cost-aware + risk-efficient + scheduling-fairness |
| 方法学严谨化 | — | Selection vs Extraction(预注册负面) | 个例 + 稳定性 + 预注册三联 |
| Harness 工具链 | CUAwright(极简) | LMBuild(候选) | harness 哲学四向分化 |
| 物理世界评测 | 4DCodeBench | AgencyBench(真实任务) | 媒介端点三极 + 真实任务端点 |
| 风险敏感 | Tail-Influence | — | 沿用,无新增 |
§三 工程 / 研究 / 批判视角
3.1 工程视角(可落地性)
AgencyBench 的可落地性参差:仓库已 release,但跑一遍全 benchmark ≈138 任务 × 90 tool-call × 1M token = 单任务算力门槛极高;Docker sandbox + user-sim prompt 模板可复现,但 1M token × 数小时的端到端运行算力预算对评测运行方是显著门槛;rubric 由团队内设计,跨团队一致性问题待验证。
JIL Attack 的工程缓解路径:粗粒度长度分组(将请求按长度区间分组而非精确预测),效果待生产环境验证;⚠️ 缓解方案仅在论文中提及,未见 vLLM/SGLang 官方 Changelog 中已修复——待核实;潜在副作用 = 牺牲部分 throughput 优化换取调度公平性;vLLM/SGLang/TRAIL 三大生产调度器的修复进度未公开——这是 2026 Q4 最需要跟进的工程化风险点。
Selection vs Extraction 的工程影响:Jev 单次调用即可完成 selection,工具链简洁;typed decision model 与 LangGraph/CrewAuto 兼容度高;如结论可推广到 LoCoMo + LongMemEval 之外,Agent 记忆系统可省去 LLM extraction 模块,单次调用可替代完整 extraction pipeline。
3.2 研究视角(创新性)
AgencyBench 的学术贡献:把 "真实任务执行" 形式化为可测量维度(6 大能力 × 32 场景),让 agent 评测从 "刻意构造" 走向 "日常真实";user-sim + Docker + rubric 三合一评测闭环是 harness 工程化的新形态——与 CUAwright 极简 + BenchAgent 协议对齐 + AGCWright 过程评分形成 harness 设计哲学四向分化。
JIL Attack 的研究创新:首次将 "LLM serving 调度器安全" 形式化为评测维度——传统评测关注任务准确率,JIL Attack 揭示调度层面的安全攻击面;完成时间减少 27-46% 意味着在多租户场景下,恶意用户可通过构造对抗性 prompt 优先占用推理资源——评测对象从 "任务结果" 拓展到 "调度公平性"。
Selection vs Extraction 的方法学创新:预注册研究方法首次落地 eval 领域——预注册 + 受控实验 + 形式化非劣效边界(-3.0 优于 -5 边界)= 评测方法学从 "主观印象" 走向 "统计严谨";与 R92 MIST(个例层)+ R93 SAGO(稳定性)联合形成方法学严谨化三联。
3.3 批判视角(局限)
AgencyBench 的局限:⚠️ 138 任务分到 6 能力后每能力 ≈23,分数波动大——v4 是否给出置信区间尚未核验(待核实);user-sim 与真实 user 行为 gap;rubric 主观性;闭源 48.4% vs 开源 32.1% 差距被 scaffold 共同决定,不能仅解读为模型能力。
JIL Attack 的局限:⚠️ 未公开受影响版本号;缓解方案生产验证状态未确认;评测对象局限于长度预测调度器,公平/抢占/QoS 调度器是否受影响未知。
Selection vs Extraction 的局限:⚠️ 仅在 LoCoMo 紧预算成立,LongMemEval 结果未在 TLDR 披露(待精读);Jev 跨任务泛化性未知;预注册结论可推广性待原文精读。
3.4 法律视角(独立段)
JIL Attack 揭示的调度公平性议题在法律层面类比 net neutrality(网络中立性)与 GDPR Art. 22(自动化决策):当 LLM 服务提供商使用算法调度优先级时,是否应保证所有用户的请求获得 "算力中立" 处理?恶意用户通过对抗性 prompt 获得的优先权是否构成对其他用户的服务降级?2026 Q4 EU AI Act 已将 "服务可访问性" 列入合规清单,但调度公平性尚未独立成案——评测诚信的调度维度可能成为未来 1-2 年合规框架的讨论焦点。
§四 趋势判断与开放问题
4.1 趋势判断
T1(★★★★)1M-token 真实世界评测补齐长程第七端点:AgencyBench 把 "日常真实任务执行" 形式化为可测维度,与 R93 §1.3 长程六端点形成完整谱系(执行 + 理论 + 持久 + 构造 + 临床 + 关系 + 真实任务);长程评测从 "实验室长程" 走向 "真实部署长程"。
T2(★★★★)LLM 调度安全作为评测基础设施新维度首次形式化:JIL Attack 把调度公平性从 "推理系统属性" 提升为 "评测诚信维度";评测诚信从 cost-aware + risk-efficient 扩展为 cost-aware + risk-efficient + scheduling-fairness 三维——2026 Q4 评测方法学最显著的工业级范式转变。
T3(★★★)评测方法学严谨化预注册范式首次落地:Selection vs Extraction 用预注册 + 受控实验 + 形式化非劣效边界使结论更可信;评测方法学从 "主观印象 + 经验共识" 走向 "预注册 + 受控 + 形式化"——2026 Q4 元方法学跃迁。
T4(★★★)Harness 哲学四向分化:AgencyBench + CUAwright + BenchAgent + AGCWright = harness 从 "通用 substrate" 走向 "任务定制 substrate"——harness 设计选择本身就是评测信号。
4.2 开放问题
Q1:AgencyBench 138 任务分到 6 能力后每能力样本量小(≈23 任务/能力),分数波动大——置信区间是否在论文给出;评测样本量与统计显著性是否成为长程真实任务评测的核心约束?
Q2:JIL Attack 调度安全作为评测诚信新维度的稳健性——是否可推广到非长度预测调度器(公平调度器、抢占式调度器、QoS 调度器);调度公平性与任务准确率的优先级排序如何?
Q3:Selection vs Extraction 预注册研究方法在评测方法学严谨化上的可推广性——预注册 + 受控实验 + 形式化非劣效边界是否能推广到其他评测领域(judge 校准、reward 设计、harness 性能);评测方法学严谨化(统计 + 受控 + 预注册)成为 2026 Q4 元方法学跃迁?
Q4:Tail-Influence Sampling 跨领域可推广性——方法源自 RL/RCD 领域,tail influence + oracle Neyman 分配是否能推广到 LLM 输出 rare failure 评测(R96 沿用)?
Q5:4DCodeBench 与 World Embedding Benchmark 的精确评测维度区分——两者都以物理世界为评测媒介,两者的精确区分边界是什么(R96 沿用)?
Q6:LMBuild 完整 TLDR + 贡献 + 差异化定位——R98 前需原文精读。
§五 合流(6 处 × ≥150 字)
5.1 合流 1:1M-token 真实世界 Agent 评测合流
AgencyBench 把 "日常真实任务执行" 形式化为可测维度,与 R93 长程六端点形成完整谱系;长程评测从 "实验室长程" 走向 "真实部署长程";评测对象从 "刻意构造的长任务" 走向 "自然生成的日常真实工作流"——这是 2026 Q4 评测对象与方法的现实化跃迁。
5.2 合流 2:调度公平性合流
JIL Attack 把调度公平性从 "推理系统属性" 提升为 "评测诚信维度";评测诚信从 cost-aware + risk-efficient 扩展为 cost-aware + risk-efficient + scheduling-fairness 三维;评测基础设施自身存在安全攻击面——这是 2026 Q4 评测方法学的工业级范式转变。
5.3 合流 3:预注册范式合流
Selection vs Extraction 把预注册 + 受控实验 + 形式化非劣效边界落地 eval 领域;评测方法学从 "主观印象 + 经验共识" 走向 "预注册 + 受控 + 形式化",与 R92 MIST + R93 SAGO 形成方法学严谨化三联——这是 2026 Q4 评测方法学的元方法学跃迁。
5.4 合流 4:风险敏感合流(R96 沿用)
Tail-Influence Sampling 把 tail risk 评估作为评测方法学的形式化目标;与 R93 SAGO 稳定性联合构建稳定性 + 风险敏感双维评测;评测精度从 mean-only 走向 mean + tail 双维度——评测精度升级为可优化的形式化变量。
5.5 合流 5:物理媒介三重奏合流(R94+R95+R96 沿用)
4DCodeBench 与 Ego2Act + World Embedding Benchmark 形成 "动作 → 表征 → 代码" 三重物理世界评测媒介;评测端点饱和化 + 真实化 + 媒介化三层并行。
5.6 合流 6:方法学严谨化合流
MIST(个例)+ SAGO(稳定性)+ Selection vs Extraction(预注册)= 评测方法学严谨化的三联;评测从主观走向客观,从经验走向统计——是 2026 Q4 评测领域整体可信度跃迁的核心。
§六 立标池与待核表
6.1 立标池主表(6 件)
| arXiv | 主分类 | 待复核 PDF 章节 |
|---|---|---|
| 2601.11044 | eval/benchmark | §5.2 评测闭环 + §6 rubric 一致性 |
| 2610.03430 | eng/method | §3 对抗性后缀 + §4 缓解生产验证 |
| 2609.34227 | agent/method | §3.2 LongMemEval + §4 预注册边界 |
| 2610.03715 | eval/benchmark | §4 任务规模 + §5 评测指标 |
| 2609.38096 | eval/method | §3 Bellman reuse + §4 跨域推广 |
| 2610.04116 | agent/method | §4 动态工具创建评测 |
6.2 待核条目清单(5 项)
- AgencyBench 样本量:每能力 ≈23 任务,分数波动大,待置信区间;
- JIL Attack 修复状态:⚠️ vLLM/SGLang/TRAIL Changelog 待跟进;
- Selection vs Extraction LongMemEval:仅 LoCoMo 紧预算,LongMemEval 待精读;
- LMBuild TLDR:⚠️ HF Daily 来源截断,待原文精读;
- 4DCodeBench × World Embedding Benchmark 边界:两者都以物理世界为媒介,精确区分待精读。
6.3 verifiability 主轴独立抽检(≥20% · 4/19)
本棒 19 件主轴件中,4 件走独立抽检(AgencyBench · JIL · Selection · 4DCodeBench),其余沿用 R96/R93 锚点。抽检率 = 4/19 = 21.1% ≥ 20% 硬下限。
Spark · 2026-10-07 20:53 CST · evaluation · W5 主题深度综述 · 边界:仅写本文件 organized/promo/surveys/2026-10-07-evaluation.md