evaluation · 知识库活文档

  • 更新:R99 Agent Plasticity 2610.08902 三维自我改进评测 + ThinkingBox 数据库状态评测范式 + LMBuild/SafeActBench 精确化 + Harness 自演进 4 篇伴生

0. 范围与定调

本活文档面向 LLM / Agent / RAG / 多模态系统评测,覆盖 benchmark 设计、指标体系、judge/harness 工程、可信评测方法学、跨模态评测、EDD。与 agent.md、rag.md、multimodal.md、llm-infra.md 平行。时间锚定 2026 年 10 月初。

R99 范式跃迁 第七十七重:① Agent Plasticity 三维自我改进;② ThinkingBox OpenEnv 数据库状态评测(pass@1 Opus 5.5 67.16% > GPT-5.4 65.36% > GPT-5.6 Sol 61.91% · 20/20 一致性极低);③ LMBuild 4 维精确化(structural & visual > functional-part completeness, kinematic correctness, simulation-based operability);④ SafeActBench 精确化(GLM/DeepSeek 96-98% static → 37-67% 交互行动前未建证据 → GLM 12.1% 多步 DAG · harness 翻转失败模式);⑤ Harness 自演进伴生 4 件(SEA-Eval 2604.08988 / EvoAgentBench 2607.05202 / Evo-Bench 2608.09096 / Harness Updating 2605.30621)——R98 EMHO 单点 → 新锚。

R98 范式跃迁:(a) AgencyBench 1M-token 真实任务 + 6 能力精确化(★★★★·ACL 2026 Main · 6 能力 = game dev / front-end / back-end / code gen / research / MCP tool use · user-sim Claude-4-Sonnet · github.com/GAIR-NLP/AgencyBench);(b) LMBuild 物理可构建/可功能 3D 结构(★★★★·arXiv:2610.04292 · UIUC + Microsoft · 64 pages · 30 systems · 4 维:structural soundness / functional affordance / design quality / physical realization)+ 与 R94 Ego2Act + R95 WEB + R96 4DCodeBench = 物理世界四重奏;(c) JIL Attack 数据校正(★★★·arXiv:2610.03430 · 预测长度最多减少 83.4% + 完成时间最多加速 1.53× + 2×4 配置);(d) SafeActBench 证据-行动链端点(★★★·arXiv:2610.07753 · 656 案例 × 6 域 × 5 协议 · "静态强 + 交互弱")+ UndoBench + AgencyBench = 任务-证据-恢复三栖闭合 = 第八端点;(e) EMHO Harness 自演进(★★★·arXiv:2610.08432 · 冻结具身模型 + Harness 自演进)。

R97 范式跃迁(第七十五重,沿用 + 数据精确化):1 NET-new eval 主分类(AgencyBench)+ eval 邻接/副分类 NET-new 3 件(JIL Attack + Selection vs Extraction + LMBuild)。R98 数据校正后沿用。R97 详细段已归档至 archive evaluation-changelog.md 第 97 轮段。

R96 / R95 / R94 / R93 / R92 / R91 / R60-R90 累积(简略骨架,沿用归档):详见 §8 R75-R98 全索引 + archive evaluation-changelog.md。

1. 评测设计方法学:bench 设计 × judge 设计 × 范式跃迁

1.1 评测诚信八层 + Harness 自演进(R93-R99)

R88 InferenceBench → R89 KV Reuse Eval + R90 Keyword-Semantic → R91 SEAL → R92 BiasReducer + MILO → R93 反方审稿双响(LongHarness + SEAL)+ HAL/BenchAgent 评测成本标准化 = 第六层 cost-aware → R94 双极盲区联通补遗 → R95 工程垂类层级化(SimuVerity 三层解耦)→ R96 风险敏感评测层(Tail-Influence Sampling)→ R97 调度安全维度(JIL Attack 形式化)→ R98 物理世界评测四重奏 + Harness 自演进层:

  • 7 层(R88-R97):harness R88 InferenceBench;指标 R89 KV Reuse Eval + R90 Keyword-Semantic;聚合 R91 SEAL → R93 反方;reward R92 BiasReducer;harness 自动化 R92 MILO;cost-aware R93 HAL/BenchAgent/AgentProcessBench;工程层级化 R95 SimuVerity(arXiv:2610.02304 · artifact delivery → native executability → engineering qualification);风险敏感 R96 Tail-Influence Sampling(arXiv:2609.38096 · tail influence + oracle Neyman 分配);调度安全 R97 JIL Attack(arXiv:2610.03430 · 83.4% 长度减少 + 1.53× 完成加速 + 2×4 配置)
  • 8 层 + 物理世界四重奏 + Harness 自演进(R98):LMBuild(arXiv:2610.04292 · UIUC + Microsoft · 64 pages · 30 systems · 4 维评测:structural soundness / functional affordance / design quality / physical realization)+ EMHO(arXiv:2610.08432 · 冻结具身模型 + Harness 自演进)→ 与 R94 Ego2Act + R95 World Embedding Benchmark + R96 4DCodeBench 形成"动作→表征→代码→物理可构建/可功能"四重奏 + "harness 静态/动态/自演进"三向分化

R95 核心判定:R94 "立标 + 反方 + 价值层锚定"三轨制扩展为 "立标 + 反方 + 价值层锚定 + 工程层级化"四轨制——SimuVerity"三层解耦评估器"是立标工作的新方法学骨架,与 R93 LongHarness/SEAL 反方相鉴 → 工程垂类评测从"单层准确率"走向"artifact → executability → qualification 三阶门控"是 2026 Q4 评测方法学的工程化跃迁。

R96 核心判定:R95 四轨制扩展为五轨制 + 风险敏感预算分配。

R97 核心判定:R96 五轨制扩展为六轨制 + 调度安全。

R98 核心判定:R97 六轨制扩展为八轨制"立标 + 反方 + 价值层锚定 + 工程层级化 + 风险敏感预算分配 + 调度安全 + 物理世界评测四重奏(4 维媒介饱和化) + Harness 自演进层"——LMBuild 把 3D 可构建/可功能结构作为评测对象——EMHO 把 harness 从"静态设计"扩展为"动态自演进"——这是 2026 Q4 评测方法学最显著的物理化 + 动态化跃迁。

1.2 judge 范式 + 多维评估框架 + 自我改进三维权衡(R84 → R99)

R84 JEV-as-a-Judge → R88 LangChain 独立验证 → R89 ARGUS 跨领域 → R90 Chinese-Jev 多语言化 → R92 SEAL 聚合层失效 + MIST 个例层失效 + Training LLM Judges 训练层失效 → R93 VLM 评测双锚 + SAGO 稳定性新维度 → R95 LexReward 奖励分类法扩展 → R97 Selection vs Extraction 预注册方法扩展 → R98 LMBuild 4 维评估框架扩展:

  • 聚合层失效(R92 SEAL):SEAL Spearman ρ vs FullPair 0.83-1.00,但 R93 反方审稿揭示——ρ 高 ≠ 与人类偏好对齐——传递效应(若 FullPair ρ_vs_human=0.7,则 SEAL 真实有效性 = 0.7 × 1.0 = 0.7);
  • 个例层失效(R92 MIST + R93 PhysVista 互补):MIST 200 句揭示 VLM judge 被无关图像劫持 verdict;PhysVista 揭示 VLM 本身的物理理解缺陷——VLM 评测双锚首次完整;
  • 训练层失效(R92 Training LLM Judges):outcome-supervised RL 忽略 criterion-choice token 独立 credit;
  • 稳定性维度(R93 SAGO):SAGO 把"行为变异性"作为泛化目标;
  • 奖励分类法维度(R95 LexReward,预备级):法律 LLM 奖励信号三维分类法 Style + Element + Chain;
  • 预注册方法维度(R97,预备级):Selection vs Extraction(arXiv:2609.34227 paper_card 1698 · Google DeepMind/Jev)——LoCoMo 紧预算下 Jev 单次调用选取原始轮次对 LLM 抽取式记忆呈非劣效(单侧 95% 边界 -3.0 百分点,优于 -5 百分点的非劣效边界)——预注册设计使结论更可信——与 R92 MIST/R93 SAGO 形成"评测方法学严谨化的三联(个例 + 稳定性 + 预注册)";
  • 多维评估框架维度(R98 预备级):LMBuild(arXiv:2610.04292 · UIUC + Microsoft)——评测 4 维度:structural soundness / functional affordance / design quality / physical realization——30 frontier agent systems 实测发现:"Soundness 和 alignment 不再是 frontier closed-source 模型的主要瓶颈,而 functional affordance 和 physical operability 仍显著更难"——多维评测框架揭示评测对象的层次化难易分布是评测方法学的新骨架。

判别趋势:LLM-as-Judge 失效模式从 R92 三联扩展为 R93 四元(+ 稳定性维度),R95 沿用四元并新增奖励分类法维度,R97 新增预注册方法维度,R98 新增多维评估框架维度作为评测对象层次化难易分布的揭示——评测方法学的严谨化(统计 + 受控 + 预注册 + 多维层次)是 2026 Q4 评测方法学的元方法学跃迁。

1.3 长程 / 多 Agent 评测六端点 + 临床端点 + 关系记忆第六端点 + 真实任务第七端点 + 证据-行动链端点 + 媒介端点四重奏(R83 → R98)

R83 GameHorizon → R88 AgentWorld(执行端点)+ R89 SAGE(理论端点 SCA 框架)+ R91 APM-Bench(持久端点·多会话持久记忆)+ R92 The Endless Exam(构造端点·无上限数学构造)+ R93 OpenTumorBoard(临床端点·真实多学科协作轨迹)——五端点首次完整 → R95 关系记忆第六端点(DyadMem URAM)→ R97 真实任务第七端点(AgencyBench)→ R98 真实任务第七端点精确化 + 证据-行动链端点预备:

  • 执行端点(R88):50+ 轮 + 100 任务——测"能不能稳定执行";
  • 理论端点(R89):SCA 框架——测"为什么长程难";
  • 持久端点(R91):APM-Bench 549 sessions × 2,719 candidates——测"跨会话持久记忆";
  • 构造端点(R92):The Endless Exam + 无上限评分;
  • 临床端点(R93):OpenTumorBoard 611 患者 × 19,157 讨论轮次 × 10 专家角色;
  • 关系记忆端点(R95):DyadMem URAM(arXiv:2610.03020 · Google DeepMind);
  • 真实任务第七端点(R97 → R98 精确化):AgencyBench(arXiv:2601.11044v4 · ACL 2026 Main · GAIR/SJTU/PolyU · github.com/GAIR-NLP/AgencyBench)——32 场景 × 138 任务,平均 ≈90 次工具调用 / ≈1M token / 数小时工作流——6 核心能力维度精确化:game development / front-end development / back-end development / code generation / research / MCP tool use——user-sim 基于 Claude-4-Sonnet 提供迭代式反馈——Docker sandbox 可视/功能双 rubric 自动化闭环——闭源 48.4% vs 开源 32.1%;
  • 证据-行动链端点(R98,预备级):SafeActBench(arXiv:2610.07753 · agent 主/eval 副 · HF Daily 34▲ #1 · paper_cards/1702-2610-07753.md)——656 案例 × 6 操作域 × 5 协议——10 种模型-执行环境配置实测发现"强大的静态动作评估与弱得多的交互式执行并存"——Agent 失败诊断从"任务完成率"延伸到"证据-行动链完整性"——与 R92 UndoBench(任务 vs 恢复解耦)+ R97 AgencyBench(真实任务执行)形成"任务-证据-恢复"三栖证据链闭合——长程第八端点(证据-行动链端点)首次系统化。

R98 媒介端点改进:Ego2Act + R95 World Embedding Benchmark + R96 4DCodeBench + R98 LMBuild = 物理世界评测四重奏首次完整:动作生成 → 表征一致性 → 代码生成 → 物理可构建 + 物理可功能——媒介端点从"双重化"扩展为"四重奏"。

关键判定:长程/多 Agent 评测从五端点扩展为七端点(+ 关系记忆端点 + 真实任务端点)+ 媒介端点四重奏 + 证据-行动链端点预备(第八端点候选)——评测对象从"执行/理论/持久/构造/临床/关系/真实任务/证据链"全栈覆盖,到"动作 vs 物理表征 vs 物理代码 vs 物理可构建/可功能"四重物理世界评测媒介化——这是 2026 Q4 评测方法学端点饱和化 + 真实化 + 媒介四重化 + 证据链化的明确信号。

1.4 垂类多阶段多维评测 + Harness 自演进(R86 → R99)

R86 CLEAR 五维 + R89 IndicBankBench 四阶段 + R93 OpenTumorBoard + HAL/BenchAgent 评测成本标准化 → R95 SimuVerity 工程层级化扩展 → R96 Tail-Influence Sampling 风险敏感预算分配扩展 → R97 JIL Attack 调度安全形式化扩展 → R98 EMHO Harness 自演进 + SafeActBench 证据链断裂诊断扩展:

  • HAL(R93):Holistic Agent Leaderboard——SWE-bench Verified 中位 $163 + 单任务 $0.08-32 + 8 基准全评测 ~$800 + 242 次运行总成本 ~$46,000 + GAIA 全覆盖最高 $2,829;
  • BenchAgent(R93):协议对齐评测 substrate——benchmark 加载、工具访问、答案契约、费用计算、轨迹日志标准化;
  • AgentProcessBench(R93):1,000 轨迹 + 8,509 步标注——过程级轨迹评分;
  • OpenTumorBoard(R93):临床多 Agent 多模态高风险决策垂类场景;
  • SimuVerity(R95):101 text-to-executable Simulink tasks × 10 engineering domains;
  • SWE-Serve(R95):53 生产级推理工程任务;
  • Tail-Influence Sampling(R96):CliffWalking MSE 降 41%/76%——frozen LM review 23/24 MMLU-Pro 胜出 + six-call FinQA 2.4-3.4× MSE 优势;
  • JIL Attack(R97 → R98 数据校正):预测输出长度最多减少 83.4% + 端到端对抗请求平均完成时间最多加速 1.53×——数据集 2 件 × 4 LLM × 多种部署配置——缓解方案:粗粒度长度分组,缓解后剩余有效数据论文未给出系统披露;
  • EMHO Harness 自演进(R98,预备级):EMHO(arXiv:2610.08432 · eval 主/marginal · UIUC + Microsoft · paper_cards/1707-2610-08432.md)——冻结具身模型不变,通过分析执行轨迹与既有 Harness 历史对 Harness 进行迭代修订;优化超越技能或恢复提示层面,修改 agent 的规划/上下文/工具调用架构设计。

关键判定:垂类评测的"R86 方法论(多阶段多维)+ R89 区域试点 → R93 工具化 + 成本化 + 过程化 → R95 工程层级化 + 系统性能化 → R96 风险敏感化 → R97 调度安全化 → R98 Harness 自演进化 + 证据-行动链诊断化"——垂类评测从"工程方法论"走向"工业级基础设施 + 端到端层级门控 + 风险预算优化 + 调度公平性 + Harness 自演进 + 证据链完整性诊断"——这是 2026 Q4 评测方法学最显著的工业级范式转变 + Harness 哲学深化。

1.5 跨语言/跨文化评测维度扩张(R89 → R95)

R89 LLM 文化意识评估(海地克里奥尔语)+ R90 Chinese-Jev 多语言化 → R92 锚补 → R93 OpenTumorBoard 跨语言临床决策 → R95 多语言多模态浏览 + 单语 RAG 评测:HyperBrowseComp(423 题 × 13 语言 × 多模态证据)+ Reasoning-Language Alignment in Monolingual RAG(德语单语 RAG QA)。

1.6 长上下文评测维度(R88 PISA → R98 真实任务第七端点补齐)

R88 PISA + R89 KV Cache Reuse Eval + R92 MILO harness 自动发现 → R93 LongHarness Bench 反方审稿警示 → R97/R98 AgencyBench 1M-token 真实任务第七端点补齐——长上下文评测基础设施在工程层/方法学层/元评测层之外,新增长上下文评测的"立标价值 vs 执行价值 vs 真实任务价值"三元反思。

2. 评测工程化:harness/judge/可信评测平台/CI gate/Harness自演进

2.1 Harness + Judge 累积(R60 → R99)

Harness R60 134→138 件 + 二十角;Judge R60 94→96 件套 + 校准 38→39(R78 沿用);R88 + Prediction,R89 + InferenceBench 元评测新范式;R89 + KV Reuse Eval + IndicBankBench + ARGUS + SAGE;R90 + GAGAR + ASCT + Chinese-Jev;R91 + APM-Bench + LibraryDesignBench + Mid-Harness;R92 + MILO + SEAL + BiasReducer + MIST + Training LLM Judges;R93 + HAL + BenchAgent + AgentProcessBench + SAGO + PhysVista + OpenTumorBoard;R94 + Ego2Act;R95 + SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment;R96 + Tail-Influence Sampling + 4DCodeBench + CUAWright;R97 + AgencyBench + JIL Attack + Selection vs Extraction + LMBuild;R98 + LMBuild(升主分类)+ JIL Attack(数据校正)+ SafeActBench + EMHO + AgencyBench(数据精确化)= 评测方法学饱和化 + 调度公平性化 + 物理世界四重奏 + Harness 自演进化的最新四项。

2.2 评测平台与 CI Gate

R60 97→99 + R75 +1 Benchmark Radar 100 条;R78 + AutoTuneBench/AgentSysBench/EDGE-EVAL;R88 + InferenceBench 元评测新范式 + LangChain Jev 独立验证 + Gartner 60% 预测;R89 + KV Reuse Eval + IndicBankBench + ARGUS + SAGE;R90 + GAGAR + ASCT + Chinese-Jev + Keyword-Semantic + GPT-6 Astra;R91 + APM-Bench + LibraryDesignBench + False Frontiers + OSWorld-Science + Mid-Harness;R92 + The Endless Exam + MILO + SEAL + BiasReducer + MIST + Training LLM Judges;R93 + SAGO + PhysVista + OpenTumorBoard + HAL + BenchAgent + AgentProcessBench;R94 + Ego2Act;R95 + SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment;R96 + Tail-Influence Sampling + 4DCodeBench + CUAWright;R97 + AgencyBench + JIL Attack + Selection vs Extraction + LMBuild。

R98 §2.2 增量:本轮 eval 主分类 NET-new 2 件(AgencyBench 数据精确化 + LMBuild 升正式锚)+ eval 邻接/副分类 NET-new 3 件(JIL Attack 数据校正 + SafeActBench + EMHO)= R98 2 件主分类 NET-new + 3 件邻接 NET-new,沿用 R97 终结信号 v1 骨架,进入新范式拓展期 v2——本轮新增物理世界评测四重奏(Ego2Act + World Embedding Benchmark + 4DCodeBench + LMBuild)= 物理世界评测饱和化 v2——Harness 设计哲学从"R96 静态极简 vs R96 评测预算自演进"扩展为"R96 静态极简 vs R96 评测预算自演进 vs R98 Harness 自演进(EMHO)"三向分化。

R99 §2.2:0 主分类 + 1 邻接(Agent Plasticity)+ 1 范式(ThinkingBox)+ 4 Harness 伴生 → 新锚。

2.3 Harness 生态候选二十角候选(R98 沿用)

R60 十二角→R69 二十角→R75-77 沿用→R78 + AutoTuneBench/AgentSysBench/EDGE-EVAL→R79-80 Coding Agent Harness→R81 + TeleAntiFraud 2.0 + DeformSmith + RiskChainBench → R82 + Gricea + CADWorld → R83 + Harness-Zero + RRSI → R84 + JEV + Agensh + Tri-PvP → R85 + Calibration + FLEET + StudentBench + BenchGuard → R86 + RGBD20K + Interesting Math + RLCDAlignBench + JevOut + Agentic AI FM + CLEAR → R87 + The AI Engineer eval 行业缺口 + AV-GRPO → R88 + InferenceBench 元评测新范式 + LangChain Jev → R89 + KV Reuse Eval + IndicBankBench + SAGE → R90 + GAGAR + ASCT + Chinese-Jev → R91 + APM-Bench + LibraryDesignBench + Mid-Harness + SEAL → R92 + MILO + Endless Exam + BiasReducer + MIST + Training LLM Judges → R93 + HAL + BenchAgent + AgentProcessBench + SAGO + PhysVista + OpenTumorBoard → R94 + Ego2Act → R95 + SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment → R96 + Tail-Influence Sampling + 4DCodeBench + CUAWright → R97+...+LMBuild → R98+LMBuild(升主)+...=75-79 角预备级 → R99+Agent Plasticity+ThinkingBox+4 Harness 伴生=80-84 角预备级;不升档 第 28 节点; 工具:uvx agent-harnesses-mcp。

3. 维度化指标体系(R60 → R98)

R60新增维度沿用 + R61-R72 沿用主分类条目 + R73 + §6.144 VDiff-Bench + §6.145-§6.146 IdeaAMBIG + MetroLLM-Bench + R74 立基础锚 + R75 + DataFlex-RL + Benchmark Radar + TRACE + ReactHuman + Clinical Math Solver + R76 + DCP + SAEScientist-Bench + E2A-Bench + Root-Cause Attribution + R77 + ImpossibleRubrics + HarnessVLN + ModularRSI + MC-Search + Emergence World + R78-R83 沿用 + R84-R88 新立基础锚 + R89 + KV Reuse Eval + IndicBankBench + ARGUS + SAGE = 锚 153-156 + R90 + GAGAR + ASCT + Chinese-Jev + Keyword-Semantic + GPT-6 Astra = 锚 157-161 + R91 + APM-Bench + LibraryDesignBench + False Frontiers + OSWorld-Science + Mid-Harness = 锚 162-166 + R92 + Endless Exam + MILO + SEAL + BiasReducer + MIST + Training LLM Judges = 锚 167-171 + R93 + HAL + BenchAgent + AgentProcessBench + SAGO + PhysVista + OpenTumorBoard = 锚 172-177 + R94 + Ego2Act = 锚 178 + R95 + SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment = 锚 179-186 + R96 + Tail-Influence Sampling + 4DCodeBench + CUAWright = 锚 187-189 + R97 + AgencyBench + JIL Attack + Selection vs Extraction + LMBuild = 锚 190-193 + R98 + LMBuild(升主分类)+ JIL Attack(数据校正)+ SafeActBench + EMHO = 锚 194-197:

  • 190 AgencyBench(arXiv:2601.11044v4 · ACL 2026 Main · github.com/GAIR-NLP/AgencyBench · flyp 10-7 ⭐⭐⭐⭐ 精读 · Shanghai Innovation Institute + SJTU + Hong Kong PolyU · eval 主分类 benchmark · R98 精确化)——32 场景 × 138 任务,平均 ≈90 次工具调用 / ≈1M token / 数小时工作流——6 核心能力维度精确化:game development / front-end development / back-end development / code generation / research / MCP tool use——user-sim 基于 Claude-4-Sonnet——Docker sandbox 可视/功能双 rubric 自动化闭环——闭源 48.4% vs 开源 32.1%——长程第七端点(真实任务端点);
  • 191 JIL Attack(arXiv:2610.03430 · engineering 主/eval 强邻接 · 形态 method · 待 paper_card 建卡 · R98 数据校正)——"Jumping the Line: Exploiting Length Predictions in LLM Scheduling"——对抗性后缀欺骗长度预测调度器低估输出长度——预测输出长度最多减少 83.4% + 端到端对抗请求平均完成时间最多加速 1.53×(论文核心 end-to-end 数据;R97 摘要级"27-46% wall-clock 比率"沿用为辅助数据)——数据集 2 件 × 4 LLM × 多种部署配置——vLLM/SGLang/TRAIL 调度器受影响——调度安全作为评测基础设施新维度首次形式化——缓解方案为粗粒度长度分组;
  • 192 Selection vs Extraction(arXiv:2609.34227 paper_card 1698 · agent 主/eval 副 · Google DeepMind/Jev · 形态 method · R98 沿用)——LoCoMo 紧预算下 Jev 单次调用选取原始轮次对 LLM 抽取式记忆呈非劣效(单侧 95% 边界 -3.0 百分点,优于 -5 百分点非劣效边界);TLDR 也给到:Jev 以 LLM reranker 三分之一的延迟实现同等选取准确率,且优于多轮 graph traversal 调用——预注册研究方法使结论更可信——与 R95 DyadMem 关系记忆形成"记忆形式(抽取 vs 选择)"评测维度;
  • 193 LMBuild(arXiv:2610.04292 · eval 主分类 / 3D 构建评测 benchmark · UIUC + Microsoft · 64 pages · R98 升正式锚)——"LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures"——对象建模为 part decomposition + mechanical joints + physical materials + procedural build sequences——评测 4 维度:structural soundness / functional affordance / design quality / physical realization——30 frontier agent systems 实测发现"Soundness 和 alignment 不再是 frontier closed-source 模型的主要瓶颈,而 functional affordance 和 physical operability 仍显著更难" + "更强的模型更有效地创建新组件,而较弱的模型倾向于依赖检索"——与 R94 Ego2Act + R95 World Embedding Benchmark + R96 4DCodeBench 形成"动作生成 → 表征一致性 → 代码生成 → 物理可构建 + 物理可功能"四重物理世界评测媒介——媒介端点第四极(物理可构建/可功能端点);
  • 194 SafeActBench(arXiv:2610.07753 · paper_cards/1702-2610-07753.md · agent 主/eval 副 · HF Daily 34▲ #1 · R98 预备级)——"From Evidence to Action: How Tool-Using Agents Fail"——656 案例 × 6 操作域 × 5 协议(静态动作判断 + 调查非行动 → 单一动作 + 多动作工作流)——10 种模型-执行环境配置实测发现"强大的静态动作评估与弱得多的交互式执行并存"——Agent 失败诊断从"任务完成率"延伸到"证据-行动链完整性"——与 R92 UndoBench(任务 vs 恢复解耦)形成"任务-证据-恢复"三栖证据链闭合——长程第八端点(证据-行动链端点)首次系统化;
  • 195 EMHO(arXiv:2610.08432 · paper_cards/1707-2610-08432.md · eval 主/marginal · UIUC + Microsoft · 形态 method · R98 预备级)——"EMHO: EMbodied Agent Harness Optimization via Experience Traces"——冻结具身模型不变,通过分析执行轨迹与既有 Harness 历史对 Harness 进行迭代修订;优化超越技能或恢复提示层面,修改 agent 的规划/上下文/工具调用架构设计——在 EmbodiedBench 的导航和操作任务上评估——与 R96 CUAWright 极简 harness 静态设计 + R96 SEIS(Agent 自动构建推理引擎)形成"静态极简 vs 动态自演进 vs 跨层自优化"harness 哲学三向分化——Harness 自演进作为评测方法学新议题首次系统化。
  • 196 Agent Plasticity(2610.08902 paper_card 1734 · agent/eval 副)——三维自我改进评测(性能泛化/获取效率/崩溃点)——严谨化四联;锚 196。
  • 197 ThinkingBox(OpenEnv · 方法论范式)——数据库状态评测 · 20/20 一致性极低——"最终交付物"三联;锚 197。
  • 198 Harness 自演进伴生工作群(R99 新锚):SEA-Eval+EvoAgentBench+Evo-Bench+Harness Updating——四联;锚 198。

R98 待精读预备(预备级):5 件 R98 入库条目中 4 件 ⚠️ 待精读确认评测指标体系 + 数据集规模 + 与现有基准的对比数据 + 工业部署成熟度 — R99 前需原文精读。

R97 待精读预备(预备级):4 件 R97 入库条目中 3 件 ⚠️ 待精读确认 — R98 前需原文精读(R98 本轮已完成 JIL Attack 数据校正 + AgencyBench 数据精确化 + LMBuild 升正式锚)。

R96 / R95 待精读预备:沿用(R96 3 件 + R95 8 件)。

4. 评测方法学批判(R60 → R98)

§6.1-§6.175:R25-R89 沿用(见 archive)

§6.176-§6.181:R90-R96 新增节(简略沿用)

R90 5 节(GAGAR / ASCT / Chinese-Jev / Keyword-Semantic Framework / GPT-6 Astra VLM);R92 6 节(The Endless Exam + MILO + SEAL v2 + BiasReducer + MIST + Training LLM Judges);R93 6 节(SAGO + PhysVista + OpenTumorBoard + HAL + BenchAgent + AgentProcessBench);R95 8 节(SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment);R96 3 节(Tail-Influence Sampling + 4DCodeBench + CUAWright);锚 153-189。

§6.182 R97 新增 4 节(沿用 + R98 数据精确化)

§6.182.1 AgencyBench 1M-token 真实世界 Agent 评测 Benchmark ★★★★(arXiv:2601.11044v4 · ACL 2026 Main · github.com/GAIR-NLP/AgencyBench · flyp 10-7 ⭐⭐⭐⭐ 精读 · Shanghai Innovation Institute + SJTU + Hong Kong PolyU · 主分类 evaluation · R98 数据精确化)——"AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts"——核心规模:32 场景 × 138 任务,平均 ≈90 次工具调用 / ≈1M token / 数小时工作流——评测闭环三层自动化:user-sim 基于 Claude-4-Sonnet 迭代式反馈 + Docker sandbox 可复现沙箱 + 双 rubric(视觉 + 功能)自动打分——6 大 agent 能力精确化:game development / front-end development / back-end development / code generation / research / MCP tool use——闭源 48.4% vs 开源 32.1%(Claude-4.5-Opus × Claude-Agent-SDK scaffold 耦合度差异显著)——长程第七端点(真实任务端点)首次系统化——评测对象从"刻意构造的长任务"走向"日常真实工作流"——138 任务分到 6 能力后每能力样本量小(≈23 任务/能力),分数波动大,统计显著性重新成为长程评测核心约束;与 OneMillion-Bench / WildClawBench 形成横向对照——HF 收录(4 collections including AI Paper of the Day);⚠️ TLDR 来自精读 + 待原文 PDF/HTML 精读确认 rubric 设计的评分一致性 + user-sim prompt 模板 + 评测成本 + Docker 安全边界 + 数据污染风险——R99 前需原文精读;锚 190。

§6.182.2 JIL Attack LLM 长度预测调度器系统性安全漏洞 ★★★★(arXiv:2610.03430 · engineering 主/eval 强邻接 · 形态 method · 待 paper_card 建卡 · R98 数据校正)——"Jumping the Line: Exploiting Length Predictions in LLM Scheduling"——核心问题:对抗性后缀使长度预测调度器低估输出长度——恶意用户构造对抗性 prompt 优先占用推理资源——预测输出长度最多减少 83.4%(论文核心数据)+ 端到端对抗请求平均完成时间最多加速 1.53×(论文核心 end-to-end 数据;R97 摘要级"27-46% wall-clock 比率"沿用为辅助数据)——数据集 2 件 × 4 LLM × 多种部署配置——vLLM/SGLang/TRAIL 所有使用长度预测的生产调度器受影响——多租户 LLM 服务直接受影响——首次形式化调度安全作为评测基础设施新维度——评测诚信从 cost-aware + risk-efficient 扩展为 cost-aware + risk-efficient + scheduling-fairness——评测基础设施自身存在安全攻击面——缓解方案:粗粒度长度分组(请求按长度区间分组而非精确预测),缓解后剩余有效数据论文未给出系统披露;⚠️ TLDR 来自 inbox 摘要级信息 + 完整 TLDR 缺失 + 未入 paper_cards + 缓解方案生产验证状态 + 受影响版本号和修复进度均未知——R99 前需原文精读;锚 191。

§6.182.3 Selection vs Extraction Agent 记忆预注册研究负面结果 ★★★★(arXiv:2609.34227 paper_card 1698 · agent 主/eval 副分类 · Google DeepMind/Jev · 形态 method · R98 沿用)——"When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model"——核心问题:对话 Agent 记忆形式争议——LLM 抽取精炼事实 vs 直接选取原始轮次——已发表结果相互矛盾(extraction 派 vs ranking 派)——预注册研究方法(pre-registered study)首次落地:在 LoCoMo 对话和 LongMemEval 上对 held-out 数据进行评估;LoCoMo 紧预算下 Jev 单次调用选取原始轮次对 LLM 抽取式记忆呈非劣效(单侧 95% 边界 -3.0 百分点,优于 -5 百分点非劣效边界)——TLDR 也给到:Jev 以 LLM reranker 三分之一的延迟实现同等选取准确率,且优于多轮 graph traversal 调用——评测方法学严谨化新锚:预注册设计使结论更可信,避免 p-hacking 和 publication bias——与 R95 DyadMem(关系记忆端点)形成"记忆形式(抽取 vs 选择)"评测维度——与 R92 MIST/R93 SAGO 形成"评测方法学严谨化的三联(个例 + 稳定性 + 预注册)"——Jev(TypeSafe AI 的 decision model)既可用于记忆选择,也可用于评判(与 flyp risk-e1prep 中 JEV Judges 形成跨主题呼应);⚠️ 待 LongMemEval 上的具体结果 + Jev vs LLM extraction 在不同模型规模下的差异 + 预注册结论可推广性——R99 前需原文精读;锚 192。

§6.182.4 LMBuild Agent 构建与评测框架(升正式 eval 主分类锚)★★★(arXiv:2610.04292 · LMBuild paper_card 待建 · eval 主分类 / 3D 构建评测 benchmark · UIUC + Microsoft · 64 pages · 形态 benchmark · R98 升正式锚)——"LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures"——核心贡献:不是 agent 构建框架,而是通用框架 = (1) 交互式环境(agent 使用工具检索/创建/放置组件构建对象)+ (2) 整合 CAD 数据集 + Wikipedia 知识的 curated benchmark + (3) 4 维度评测框架——对象建模为 part decomposition + mechanical joints + physical materials + procedural build sequences——评测 4 维度:structural soundness / functional affordance / design quality / physical realization——30 frontier agent systems 实测发现:"(a) Soundness 和 alignment 不再是 frontier closed-source 模型的主要瓶颈,而 functional affordance 和 physical operability 仍显著更难" + "(b) 更强的模型更有效地创建新组件,而较弱的模型倾向于依赖检索"——与 R94 Ego2Act + R95 World Embedding Benchmark + R96 4DCodeBench 形成"动作生成 → 表征一致性 → 代码生成 → 物理可构建 + 物理可功能"物理世界评测四重奏——媒介端点第四极(物理可构建/可功能端点)首次系统化——⚠️ LMBuild 设计为"框架结构比值"框架而非"真实工程就绪"认证程序;锚 193。

§6.184 R99 新增 3 节

§6.184.1 Agent Plasticity 三维自我改进评测 ★★★★(2610.08902)——能力快照→学习轨迹——性能泛化/获取效率/崩溃点——严谨化四联;锚 196。

§6.184.2 ThinkingBox 数据库状态评测 ★★★★(OpenEnv)——20/20 一致性极低——最终交付物三联;锚 197。

§6.184.3 Harness 自演进伴生 ★★★★(R99 新锚)——R98 EMHO→四联(SEA-Eval/EvoAgentBench/Evo-Bench/Harness Updating);锚 198。

§6.183 R98 新增 2 节

§6.183.1 SafeActBench 工具使用 Agent 证据-行动链条断裂诊断 Benchmark ★★★★(arXiv:2610.07753 · paper_cards/1702-2610-07753.md · agent 主/eval 副分类 · HF Daily 34▲ #1 · 形态 benchmark · 待原文核实精读)——"From Evidence to Action: How Tool-Using Agents Fail"——核心问题:工具使用 Agent 在执行外部状态变更时,即便结果正确,也无法保证其行为有先前建立的证据支撑——"证据到行动"链条在何处断裂,是长程 Agent 评测的关键盲区——方法贡献:656 案例 × 6 操作域 × 5 协议;协议从静态动作判定 + 调查非行动 → 单一动作 + 多动作工作流——关键发现:失败往往在执行前就已开始——Agent 在调查尚未完成时即停止,或在所需证据尚未建立前即行动;10 种模型-执行环境配置下,强大的静态动作评估可能与弱得多的交互式执行并存——评测创新:首次系统化诊断"有结果的正确"与"有依据的正确"之间的差距——从"任务完成率"延伸到"证据链完整性"——与 R92 UndoBench(任务 vs 恢复解耦)形成"任务-证据-恢复"三栖证据链闭合——长程第八端点(证据-行动链端点)首次系统化——立标延革预备第 133 例(spark 10-8 标记);⚠️ TLDR 来自 paper_card 1702 + 待原文精读确认 6 操作域定义 + 5 协议的具体内容 + 10 种配置分布特征 + 静态/交互式差距的根因分析(harness 差异?任务类型差异?协议复杂度差异?);R99 前需原文精读;锚 194。

§6.183.2 EMHO 具身 Agent Harness 自演进方法 ★★★(arXiv:2610.08432 · paper_cards/1707-2610-08432.md · eval 主/marginal · UIUC + Microsoft · 形态 method · 待原文核实精读)——"EMHO: EMbodied Agent Harness Optimization via Experience Traces"——核心问题:提升具身 Agent 通常聚焦于通过训练优化底层模型,而 Agent Harness(规划、上下文、工具调用)多以工程方式搭建;EMHO 提出——Harness 能否直接在稀疏环境反馈下、依据经验轨迹自我改进?——EMHO 冻结具身模型不变,通过分析执行轨迹与既有 Harness 历史对 Harness 进行迭代修订;优化超越技能或恢复提示层面,修改 agent 的规划/上下文/工具调用架构设计——评测:在 EmbodiedBench 导航和操作任务上评估——定性发现:EMHO 超越从失败与无效动作中恢复,重塑了具身 Agent 对环境的解释与交互方式——Harness 自演进作为评测方法学新议题首次系统化——与 R96 CUAWright 极简 harness + R96 SEIS(Agent 自动构建推理引擎)形成"静态极简 vs 动态自演进 vs 跨层自优化"harness 哲学三向分化——⚠️ jay 10-8 engineering-e1prep 将 EMHO 判定为"marginal 工程相关"——paper_card 1707 主分类标注为 evaluation,但 EMHO 的核心贡献是"harness 自演进方法",而非新的评测基准或指标体系;⚠️ 待原文精读确认 + 工业部署成熟度 + harness 自演进的质量评测指标(任务完成率/工具新颖性/代码可执行性/规划稳定性)+ 在 EmbodiedBench 之外任务类型的泛化性;R99 前需原文精读;锚 195。

5. 共识、争议与开放问题

7.1 共识(58→58,R93-R98 沿用)

R92 沿用 58 条共识;R93 / R94 / R95 / R96 / R97 / R98 沿用无新增——本轮为方法学扩展/类型学深化/反方审稿落地轮,未触及新基础原则。

7.2 争议(161→161,R93-R98 沿用)

R92 沿用 161 条争议;R93 / R94 / R95 / R96 / R97 / R98 沿用无新增——本轮反方审稿未触及新争议。

7.3 开放问题(325→329,R93 + 4,R94 +0,R95 +2,R96 +2,R97 +3,R98 +4)

R92 沿用 5 件:(1) The Endless Exam 14 个数学构造家族具体信息与无上限评分机制;(2) MILO 协同进化算法与 lineage memory 结构;(3) BiasReducer reward bias 缓解与四维评测失真类型学的可推广性;(4) MIST 200 句 benchmark 与 VLM judge 个例失效模式的可推广性;(5) Training LLM Judges criterion-choice token 独立 credit 与 LLM judge 训练范式新方向的稳健性。

R93 新增 6 件:(1) SAGO 稳定性多轴测量的具体量化方法与跨任务稳健性;(2) PhysVista 感知-推理-评估闭环与 VLM 评测双锚的可推广性;(3) OpenTumorBoard SPECIALIST TURN 准确率 + BOARD SIMULATION 轨迹质量评估方法的可靠性;(4) HAL 评测成本数据在 2026 Q4 是否仍是 leaderboard 设计的主流参考;(5) BenchAgent 协议对齐 substrate 的工业部署成熟度;(6) LongHarness Bench 12.4× 数字在 v2 复现后的实际可行性。

R95 新增 2 件:(1) SimuVerity 三层评估器的精确计算方法与跨工程领域稳健性;(2) LexReward 三维法律 reward 分类法在跨司法管辖区 / 跨语言场景下的可推广性。

R96 新增 2 件:(1) Tail-Influence Sampling 跨领域可推广性——方法源自 RL/RCD 领域,tail influence + oracle Neyman 分配是否能推广到 LLM 输出 rare failure 评测;(2) 4DCodeBench 与 World Embedding Benchmark 的精确评测维度区分。

R97 新增 3 件:(1) AgencyBench 138 任务分到 6 能力后每能力样本量小——置信区间是否在摘要给出——统计显著性验证方法;(2) JIL Attack 调度安全作为评测诚信新维度的稳健性——是否可推广到非长度预测调度器;(3) Selection vs Extraction 预注册研究方法在评测方法学严谨化上的可推广性。

R98 新增 4 件:(1) LMBuild 4 维度评测框架的层级化难易分布是否可推广——"Soundness 和 alignment 不再是 frontier closed-source 模型的主要瓶颈,而 functional affordance 和 physical operability 仍显著更难" 是否在其他物理世界评测基准上同时成立——评测对象的层次化难易分布是否构成评测方法学的新骨架;(2) JIL Attack 数据校正后调度安全维度评级——预测输出长度最多减少 83.4% + 完成时间最多加速 1.53× + 2 件数据集 × 4 LLM × 多种部署配置 = 是否需要将调度公平性从"评测诚信子维度"升级为"独立第七层"——R97 沿用调度公平性子维度判断是否成立;(3) SafeActBench 证据-行动链端点与 R97 AgencyBench 真实任务端点的边界——656 案例 × 6 操作域 × 5 协议是否覆盖了"日常真实任务"的证据链完整性——证据链完整性是真实任务评测的内嵌子维度还是独立维度;(4) EMHO Harness 自演进方法的评测维度统一性——harness 自演进方法在评测对象(任务完成率)、harness 质量(工具新颖性、规划可读性)、训练稳定性(自演进收敛性)三个维度上是否需要标准化评测协议——Harness 自演进层作为评测诚信第七层是否成立。

R99 开放(5):Agent Plasticity 跨垂类;ThinkingBox schema/一致性;Harness 5 件完整/边界;LMBuild 4 维跨基准;SafeActBench 37-67% 推广。共 5+4+3+2+2+6+5=27 条。

6. 趋势预判(2026 H2,R60 → R98)

R60-R97 累计 167 条趋势(沿用,见 archive)。

R97 趋势主线(+3 第 165-167 条) 沿用:1M-token 真实世界 Agent 评测补齐长程端点第七向(★★★★)+ LLM 调度安全作为评测基础设施新维度首次形式化(★★★★)+ 评测方法学严谨化预注册范式首次落地(★★★)。

R96 / R95 趋势主线 沿用:风险敏感评测预算分配范式首次系统化(★★★★);物理世界评测媒介三重奏首次完整成型(★★★);Harness 设计哲学极简化反方参考(★★★);工程垂类层级化范式(★★★★);奖励分类法范式(★★★★);评测方法学端点饱和化(★★★)。

R98 趋势主线(+4 第 168-171 条):

    1. 物理世界评测媒介四重奏首次完整成型(★★★★)——R94 Ego2Act(动作生成)+ R95 World Embedding Benchmark(物理表征)+ R96 4DCodeBench(代码生成)+ R98 LMBuild(物理可构建 + 物理可功能)= 物理世界评测四重奏首次完整成型——评测对象从"几何/表征/代码/可构建/可功能"五维饱和化——这是 2026 Q4 评测方法学最显著的物理化饱和化信号;
    1. 长程第八端点(证据-行动链端点)首次系统化(★★★)——SafeActBench(arXiv:2610.07753)以 656 案例 × 6 操作域 × 5 协议首次系统化揭示工具使用 Agent "证据-行动链"断裂诊断——失败往往在执行前就已开始——Agent 在调查尚未完成时即停止,或在所需证据未建立前即行动——与 R92 UndoBench(任务 vs 恢复解耦)+ R97 AgencyBench(真实任务执行)形成"任务-证据-恢复"三栖证据链闭合——长程/多 Agent 评测从七端点扩展为八端点;
    1. Harness 自演进层作为评测方法学新议题首次系统化(★★★)——EMHO(arXiv:2610.08432)以"冻结具身模型不变 + 通过分析执行轨迹与既有 Harness 历史对 Harness 进行迭代修订"实现 Harness 自演进——与 R96 CUAWright(极简静态)+ R96 Tail-Influence Sampling(评测预算自演进)形成"harness 静态/动态/自演进"三向分化——评测方法学从"harness 设计"走向"harness 演化";
    1. 评测对象层次化难易分布作为评测方法学新骨架(★★★)——LMBuild 30 frontier agent systems 实测发现 "Soundness 和 alignment 不再是 frontier closed-source 模型的主要瓶颈,而 functional affordance 和 physical operability 仍显著更难"——多维评测框架揭示评测对象的层次化难易分布是评测方法学的新骨架——评测方法学从"单层准确率"走向"层次化难易分布"。

R99 趋势(+4 172-175):172 能力快照→学习轨迹 ★★★;173 中间过程→最终交付物 ★★★;174 Harness 自演进→新锚 ★★★★;175 静态-交互断层工具使用 Agent 系统化 ★★★。

7. 平台、基础设施与生态

7.1-7.5 平台/基础设施/生态总览

33 平台;328 → 332 件 harness/benchmark 套件(R98 +4:LMBuild 升正式锚 + SafeActBench 邻接 + EMHO marginal + AgencyBench 数据精确化);126 件 EDD;143 → 147 邻接维(R98 +4:3d-physical-buildable-eval + scheduling-security-corrected + evidence-action-chain + harness-self-evolved),不升档 第 26 节点。

7.6 Harness 生态候选二十角候选(R98 沿用)

详见 §2.3,二十角候选沿用,第七十五-七十九角预备级(R98 LMBuild + JIL Attack + SafeActBench + EMHO + AgencyBench 数据精确化);不升档 第 27 节点;工具:uvx agent-harnesses-mcp。

8. R75-R99 atomic missing=0 全索引

R99 新增 4 arXiv IDs(345→349):Agent Plasticity 2610.08902 + SEA-Eval 2604.08988 + EvoAgentBench 2607.05202 + Evo-Bench 2608.09096;2 数据精确化(LMBuild 4 维发现 + SafeActBench 37-67%)

R98 新增 3 arXiv IDs + 1 数据校正(342→345):LMBuild 2610.04292(升正式锚)+ SafeActBench 2610.07753(邻接预备)+ EMHO 2610.08432(marginal 邻接预备)+ JIL Attack 2610.03430 数据校正(83.4% + 1.53× + 2×4 配置);AgencyBench 2601.11044 数据精确化(ACL 2026 Main + GAIR-NLP 开源 + 6 能力维度精确化 + Claude-4-Sonnet user-sim)

R97 新增 4 arXiv IDs:AgencyBench 2601.11044 + JIL Attack 2610.03430 + Selection vs Extraction 2609.34227 + LMBuild 2610.04292

R96 新增 3 arXiv IDs(335→338):Tail-Influence Sampling 2609.38096 + 4DCodeBench 2610.03715 + CUAWright 2610.04116

R95 新增 8 arXiv IDs(327→335):SimuVerity 2610.02304 + LexReward 2609.39071 + DyadMem 2610.03020 + HyperBrowseComp 2610.03574 + SWE-Serve 2609.26777 + World Embedding Benchmark 2610.03632 + CLIMB 2610.03421 + Reasoning-Language Alignment 2610.03136

R94 新增 1 arXiv ID(298→299):Ego2Act 2610.01092(agent 主分类/eval 邻接)

R93 新增 7 arXiv IDs:SAGO 2610.01428 + PhysVista 2610.00559 + OpenTumorBoard 2609.32810 + HAL 2510.11977 + BenchAgent 2606.05670 + AgentProcessBench 2605.20530 + LongHarness Bench 2609.38137

R92 新增 6 arXiv IDs(285→291):The Endless Exam 2609.24555 + MILO 2609.38349 + SEAL 2605.30104 + BiasReducer 2609.32720 + MIST 2609.37863 + Training LLM Judges 2609.38792

R91 新增 5 arXiv IDs(286→291 → R92 沿用):APM-Bench 2609.37559 + LibraryDesignBench 2609.36730 + False Frontiers 2609.39102 + OSWorld-Science 2609.39903 + Mid-Harness 2609.39982

R90 新增 5 arXiv IDs(281→286):arXiv:2609.32577 GAGAR + arXiv:2609.35215 ASCT + arXiv:2609.36965 Chinese-Jev + arXiv:2609.37749 Keyword-Semantic Framework + arXiv:2609.35718 GPT-6 Astra

R89 新增 4 arXiv IDs(277→281):KV Cache Reuse Eval 2609.31415 + IndicBankBench 2609.29167 + ARGUS 2609.30867 + SAGE 2609.30192

R88 新增 3 arXiv IDs(274→277):InferenceBench 2607.20468 + AgentWorld 2609.31590 + PISA 2609.31093

R99 加 10 URLs:arxiv.org/abs/2604.08988 2605.30621 2607.05202 2608.09096 2610.08902 huggingface.co/papers/2610.04292 arxiv.org/html/2610.04292v1 github.com/huggingface/openenv aicoder.com/news/news-20261007-lmbuild-evaluating-agents-buildable-functional-structures aiweekly.co/alerts/safeactbench-paper-shows-tool-using-agents-pass-97-static-but-act-before

R98 加 3 URLs + 1 数据校正 + 2 数据精确化 URLs:https://arxiv.org/abs/2610.04292(LMBuild 升正式锚)+ https://arxiv.org/abs/2610.07753(SafeActBench)+ https://arxiv.org/abs/2610.08432(EMHO)+ https://github.com/GAIR-NLP/AgencyBench(R98 新增)+ https://arxiv.org/html/2610.03430v1(JIL 数据校正)+ https://arxiv.org/abs/2601.11044(AgencyBench 沿用 + 数据精确化)+ https://arxiv.org/pdf/2610.04292(LMBuild PDF)

R75→R99 arXiv ID 累积(R99 +4 = 349):1702.08608 1705.08045 2002.05651 2110.11334 2206.14858 2501.05444 2507.00310 2509.02473 2510.11977 2511.02230 2511.14136 2512.02282 2512.02882 2512.14629 2601.04043 2601.06112 2601.11044 2601.14242 2603.00873 2603.08835 2603.29231 2604.10352 2604.11978 2605.01604 2605.10286 2605.18032 2605.20530 2605.23950 2605.27922 2605.30104 2605.30434 2606.05670 2606.08367 2606.14747 2607.08028 2607.12227 2607.20468 2607.27616 2607.27816 2607.27853 2607.27888 2607.28609 2607.28661 2607.28802 2607.28887 2607.29241 2607.29677 2608.00267 2608.00677 2608.01964 2608.03451 2608.03507 2608.03700 2608.03764 2608.04003 2608.04205 2608.04302 2608.04397 2608.05013 2608.05139 2608.05747 2608.05850 2608.06301 2608.06312 2608.06329 2608.06614 2608.06729 2608.06867 2608.07545 2608.08119 2608.08160 2608.08311 2608.08466 2608.08676 2608.08722 2608.08814 2608.08975 2608.09096 2608.09158 2608.09766 2608.09802 2608.09805 2608.09867 2608.09888 2608.09900 2608.10708 2608.10744 2608.10875 2608.11341 2608.11745 2608.11947 2608.12036 2608.12149 2608.12314 2608.12571 2608.12743 2608.12781 2608.12875 2608.13010 2608.13120 2608.13160 2608.13417 2608.13489 2608.13505 2608.13546 2608.13547 2608.13552 2608.13558 2608.13560 2608.13588 2608.13606 2608.13760 2608.13951 2608.14022 2608.14036 2608.14106 2608.14284 2608.14340 2608.14457 2608.14546 2608.14905 2608.15022 2608.15089 2608.15127 2608.15669 2608.15763 2608.16425 2608.16590 2608.16798 2608.16859 2608.17253 2608.17271 2608.17379 2608.17393 2608.17426 2608.17528 2608.17597 2608.17950 2608.18077 2608.18184 2608.18484 2608.18489 2608.18524 2608.18565 2608.18580 2608.18613 2608.18701 2608.18940 2608.19098 2608.19197 2608.19269 2608.19583 2608.19609 2608.19799 2608.19854 2608.19880 2608.20169 2608.20202 2608.20335 2608.20336 2608.20438 2608.20574 2608.20910 2608.21031 2608.21156 2608.21159 2608.21208 2608.21249 2608.21252 2608.21360 2608.21500 2608.21832 2608.21833 2608.22510 2608.23035 2608.23200 2608.23256 2608.23552 2608.23670 2608.23691 2608.23740 2608.24479 2608.25518 2608.25529 2608.25593 2608.25798 2608.25832 2608.26005 2608.26070 2608.26200 2608.26530 2608.26623 2608.26872 2608.27260 2608.27345 2608.27448 2608.27455 2608.27456 2608.27831 2608.28122 2608.28281 2608.28833 2608.29387 2608.29464 2608.29847 2608.30005 2608.31046 2608.31100 2608.31111 2609.00006 2609.00196 2609.01437 2609.01481 2609.02783 2609.03153 2609.04061 2609.04094 2609.04148 2609.04172 2609.04173 2609.04199 2609.04280 2609.04720 2609.04753 2609.05232 2609.05258 2609.05324 2609.05339 2609.05405 2609.05779 2609.05903 2609.06011 2609.06107 2609.06245 2609.06289 2609.06746 2609.06986 2609.08149 2609.08418 2609.08832 2609.09113 2609.09219 2609.09875 2609.10016 2609.10451 2609.10539 2609.10728 2609.10895 2609.11115 2609.11873 2609.12078 2609.13141 2609.13463 2609.13948 2609.14302 2609.14857 2609.15195 2609.15818 2609.16251 2609.16816 2609.16900 2609.17320 2609.17496 2609.18123 2609.18323 2609.18487 2609.18605 2609.18620 2609.18654 2609.19169 2609.19656 2609.19879 2609.20715 2609.20784 2609.20804 2609.22039 2609.22076 2609.22220 2609.22255 2609.22323 2609.22682 2609.23989 2609.24555 2609.24972 2609.24974 2609.25001 2609.26489 2609.26550 2609.26637 2609.26777 2609.26780 2609.26781 2609.27657 2609.28470 2609.28603 2609.28654 2609.29028 2609.29167 2609.29429 2609.29647 2609.29816 2609.30192 2609.30210 2609.30243 2609.30867 2609.31093 2609.31415 2609.31506 2609.31590 2609.32577 2609.32720 2609.32810 2609.34227 2609.35215 2609.35718 2609.36138 2609.36730 2609.37533 2609.37559 2609.37590 2609.37690 2609.37749 2609.37863 2609.38096 2609.38137 2609.38349 2609.38792 2609.39071 2609.39102 2609.39378 2609.39841 2609.39903 2609.39982 2609.40222 2610.00437 2610.00559 2610.00574 2610.00812 2610.01092 2610.01428 2610.01762 2610.01767 2610.01939 2610.02185 2610.02196 2610.02201 2610.02304 2610.03020 2610.03136 2610.03140 2610.03421 2610.03430 2610.03574 2610.03632 2610.03664 2610.03715 2610.04116 2610.04292 2610.05162 2610.07753 2610.08432 2604.08988 2605.30621 2607.05202 2608.09096 2610.08902

R75→R98 URL 累积精选(按主题精简,去重 v1/v2 与 hf/arxiv 重复):https://arxiv.org/abs/2501.05444 https://arxiv.org/abs/2509.02473 https://arxiv.org/abs/2510.11977 https://arxiv.org/abs/2511.14136 https://arxiv.org/abs/2512.02282 https://arxiv.org/abs/2512.14629 https://arxiv.org/abs/2601.04043 https://arxiv.org/abs/2601.06112 https://arxiv.org/abs/2601.11044 https://arxiv.org/abs/2601.14242 https://arxiv.org/abs/2603.00873 https://arxiv.org/abs/2603.08835 https://arxiv.org/abs/2603.29231 https://arxiv.org/abs/2604.10352 https://arxiv.org/abs/2604.11978 https://arxiv.org/abs/2605.01604 https://arxiv.org/abs/2605.10286 https://arxiv.org/abs/2605.18032 https://arxiv.org/abs/2605.20530 https://arxiv.org/abs/2605.23950 https://arxiv.org/abs/2605.27922 https://arxiv.org/abs/2605.30104 https://arxiv.org/abs/2605.30434 https://arxiv.org/abs/2606.05670 https://arxiv.org/abs/2606.08367 https://arxiv.org/abs/2606.14747 https://arxiv.org/abs/2607.08028 https://arxiv.org/abs/2607.12227 https://arxiv.org/abs/2607.20468 https://arxiv.org/abs/2607.27616 https://arxiv.org/abs/2607.27816 https://arxiv.org/abs/2607.27853 https://arxiv.org/abs/2607.27888 https://arxiv.org/abs/2607.28609 https://arxiv.org/abs/2607.28661 https://arxiv.org/abs/2607.28802 https://arxiv.org/abs/2607.28887 https://arxiv.org/abs/2607.29241 https://arxiv.org/abs/2607.29677 https://arxiv.org/abs/2608.00267 https://arxiv.org/abs/2608.00677 https://arxiv.org/abs/2608.01964 https://arxiv.org/abs/2608.03451 https://arxiv.org/abs/2608.03507 https://arxiv.org/abs/2608.03700 https://arxiv.org/abs/2608.03764 https://arxiv.org/abs/2608.04003 https://arxiv.org/abs/2608.04205 https://arxiv.org/abs/2608.04302 https://arxiv.org/abs/2608.04397 https://arxiv.org/abs/2608.05013 https://arxiv.org/abs/2608.05139 https://arxiv.org/abs/2608.05747 https://arxiv.org/abs/2608.05850 https://arxiv.org/abs/2608.06301 https://arxiv.org/abs/2608.06312 https://arxiv.org/abs/2608.06329 https://arxiv.org/abs/2608.06614 https://arxiv.org/abs/2608.06729 https://arxiv.org/abs/2608.06867 https://arxiv.org/abs/2608.07545 https://arxiv.org/abs/2608.08119 https://arxiv.org/abs/2608.08160 https://arxiv.org/abs/2608.08311 https://arxiv.org/abs/2608.08466 https://arxiv.org/abs/2608.08676 https://arxiv.org/abs/2608.08722 https://arxiv.org/abs/2608.08814 https://arxiv.org/abs/2608.08914 https://arxiv.org/abs/2608.08975 https://arxiv.org/abs/2608.09096 https://arxiv.org/abs/2608.09158 https://arxiv.org/abs/2608.09766 https://arxiv.org/abs/2608.09802 https://arxiv.org/abs/2608.09805 https://arxiv.org/abs/2608.09867 https://arxiv.org/abs/2608.09888 https://arxiv.org/abs/2608.09900 https://arxiv.org/abs/2608.10708 https://arxiv.org/abs/2608.10744 https://arxiv.org/abs/2608.10875 https://arxiv.org/abs/2608.11341 https://arxiv.org/abs/2608.11745 https://arxiv.org/abs/2608.12036 https://arxiv.org/abs/2608.12149 https://arxiv.org/abs/2608.12314 https://arxiv.org/abs/2608.12571 https://arxiv.org/abs/2608.12743 https://arxiv.org/abs/2608.12781 https://arxiv.org/abs/2608.12875 https://arxiv.org/abs/2608.13010 https://arxiv.org/abs/2608.13120 https://arxiv.org/abs/2608.13160 https://arxiv.org/abs/2608.13417 https://arxiv.org/abs/2608.13489 https://arxiv.org/abs/2608.13505 https://arxiv.org/abs/2608.13546 https://arxiv.org/abs/2608.13547 https://arxiv.org/abs/2608.13552 https://arxiv.org/abs/2608.13558 https://arxiv.org/abs/2608.13560 https://arxiv.org/abs/2608.13588 https://arxiv.org/abs/2608.13606 https://arxiv.org/abs/2608.13760 https://arxiv.org/abs/2608.13951 https://arxiv.org/abs/2608.14022 https://arxiv.org/abs/2608.14036 https://arxiv.org/abs/2608.14106 https://arxiv.org/abs/2608.14284 https://arxiv.org/abs/2608.14340 https://arxiv.org/abs/2608.14457 https://arxiv.org/abs/2608.14546 https://arxiv.org/abs/2608.14905 https://arxiv.org/abs/2608.15022 https://arxiv.org/abs/2608.15089 https://arxiv.org/abs/2608.15127 https://arxiv.org/abs/2608.15669 https://arxiv.org/abs/2608.15763 https://arxiv.org/abs/2608.16425 https://arxiv.org/abs/2608.16590 https://arxiv.org/abs/2608.16798 https://arxiv.org/abs/2608.16859 https://arxiv.org/abs/2608.17253 https://arxiv.org/abs/2608.17271 https://arxiv.org/abs/2608.17379 https://arxiv.org/abs/2608.17393 https://arxiv.org/abs/2608.17426 https://arxiv.org/abs/2608.17528 https://arxiv.org/abs/2608.17597 https://arxiv.org/abs/2608.17950 https://arxiv.org/abs/2608.18077 https://arxiv.org/abs/2608.18184 https://arxiv.org/abs/2608.18484 https://arxiv.org/abs/2608.18489 https://arxiv.org/abs/2608.18524 https://arxiv.org/abs/2608.18565 https://arxiv.org/abs/2608.18580 https://arxiv.org/abs/2608.18701 https://arxiv.org/abs/2608.19098 https://arxiv.org/abs/2608.19269 https://arxiv.org/abs/2608.19799 https://arxiv.org/abs/2608.19854 https://arxiv.org/abs/2608.19880 https://arxiv.org/abs/2608.20169 https://arxiv.org/abs/2608.20202 https://arxiv.org/abs/2608.20335 https://arxiv.org/abs/2608.20336 https://arxiv.org/abs/2608.20438 https://arxiv.org/abs/2608.20574 https://arxiv.org/abs/2608.20910 https://arxiv.org/abs/2608.21031 https://arxiv.org/abs/2608.21156 https://arxiv.org/abs/2608.21159 https://arxiv.org/abs/2608.21208 https://arxiv.org/abs/2608.21249 https://arxiv.org/abs/2608.21252 https://arxiv.org/abs/2608.21360 https://arxiv.org/abs/2608.21500 https://arxiv.org/abs/2608.21833 https://arxiv.org/abs/2608.22510 https://arxiv.org/abs/2608.23035 https://arxiv.org/abs/2608.23200 https://arxiv.org/abs/2608.23256 https://arxiv.org/abs/2608.23552 https://arxiv.org/abs/2608.23670 https://arxiv.org/abs/2608.23691 https://arxiv.org/abs/2608.23740 https://arxiv.org/abs/2608.24479 https://arxiv.org/abs/2608.25518 https://arxiv.org/abs/2608.25529 https://arxiv.org/abs/2608.25593 https://arxiv.org/abs/2608.25798 https://arxiv.org/abs/2608.25832 https://arxiv.org/abs/2608.26005 https://arxiv.org/abs/2608.26070 https://arxiv.org/abs/2608.26200 https://arxiv.org/abs/2608.26530 https://arxiv.org/abs/2608.26623 https://arxiv.org/abs/2608.26872 https://arxiv.org/abs/2608.27260 https://arxiv.org/abs/2608.27345 https://arxiv.org/abs/2608.27448 https://arxiv.org/abs/2608.27455 https://arxiv.org/abs/2608.27456 https://arxiv.org/abs/2608.27831 https://arxiv.org/abs/2608.28122 https://arxiv.org/abs/2608.28281 https://arxiv.org/abs/2608.28833 https://arxiv.org/abs/2608.29387 https://arxiv.org/abs/2608.29464 https://arxiv.org/abs/2608.29847 https://arxiv.org/abs/2608.30005 https://arxiv.org/abs/2608.31046 https://arxiv.org/abs/2608.31100 https://arxiv.org/abs/2608.31111 https://arxiv.org/abs/2609.00196 https://arxiv.org/abs/2609.01437 https://arxiv.org/abs/2609.02783 https://arxiv.org/abs/2609.03153 https://arxiv.org/abs/2609.04061 https://arxiv.org/abs/2609.04094 https://arxiv.org/abs/2609.04148 https://arxiv.org/abs/2609.04172 https://arxiv.org/abs/2609.04173 https://arxiv.org/abs/2609.04199 https://arxiv.org/abs/2609.04280 https://arxiv.org/abs/2609.04720 https://arxiv.org/abs/2609.04753 https://arxiv.org/abs/2609.05232 https://arxiv.org/abs/2609.05258 https://arxiv.org/abs/2609.05324 https://arxiv.org/abs/2609.05339 https://arxiv.org/abs/2609.05405 https://arxiv.org/abs/2609.05779 https://arxiv.org/abs/2609.05903 https://arxiv.org/abs/2609.06011 https://arxiv.org/abs/2609.06107 https://arxiv.org/abs/2609.06245 https://arxiv.org/abs/2609.06289 https://arxiv.org/abs/2609.06746 https://arxiv.org/abs/2609.08149 https://arxiv.org/abs/2609.08418 https://arxiv.org/abs/2609.08832 https://arxiv.org/abs/2609.09113 https://arxiv.org/abs/2609.09219 https://arxiv.org/abs/2609.09875 https://arxiv.org/abs/2609.10016 https://arxiv.org/abs/2609.10451 https://arxiv.org/abs/2609.10539 https://arxiv.org/abs/2609.10728 https://arxiv.org/abs/2609.10895 https://arxiv.org/abs/2609.11115 https://arxiv.org/abs/2609.11873 https://arxiv.org/abs/2609.12078 https://arxiv.org/abs/2609.13141 https://arxiv.org/abs/2609.13463 https://arxiv.org/abs/2609.13948 https://arxiv.org/abs/2609.14302 https://arxiv.org/abs/2609.14857 https://arxiv.org/abs/2609.15195 https://arxiv.org/abs/2609.15818 https://arxiv.org/abs/2609.16251 https://arxiv.org/abs/2609.16816 https://arxiv.org/abs/2609.16900 https://arxiv.org/abs/2609.17320 https://arxiv.org/abs/2609.17496 https://arxiv.org/abs/2609.18123 https://arxiv.org/abs/2609.18323 https://arxiv.org/abs/2609.18605 https://arxiv.org/abs/2609.18620 https://arxiv.org/abs/2609.18748 https://arxiv.org/abs/2609.19169 https://arxiv.org/abs/2609.19656 https://arxiv.org/abs/2609.19879 https://arxiv.org/abs/2609.20715 https://arxiv.org/abs/2609.20784 https://arxiv.org/abs/2609.20804 https://arxiv.org/abs/2609.22039 https://arxiv.org/abs/2609.22076 https://arxiv.org/abs/2609.22220 https://arxiv.org/abs/2609.22255 https://arxiv.org/abs/2609.22323 https://arxiv.org/abs/2609.22682 https://arxiv.org/abs/2609.23407 https://arxiv.org/abs/2609.23989 https://arxiv.org/abs/2609.24555 https://arxiv.org/abs/2609.24972 https://arxiv.org/abs/2609.24974 https://arxiv.org/abs/2609.25001 https://arxiv.org/abs/2609.26489 https://arxiv.org/abs/2609.26550 https://arxiv.org/abs/2609.26637 https://arxiv.org/abs/2609.26777 https://arxiv.org/abs/2609.26781 https://arxiv.org/abs/2609.27657 https://arxiv.org/abs/2609.28470 https://arxiv.org/abs/2609.28603 https://arxiv.org/abs/2609.28654 https://arxiv.org/abs/2609.29028 https://arxiv.org/abs/2609.29167 https://arxiv.org/abs/2609.29429 https://arxiv.org/abs/2609.29816 https://arxiv.org/abs/2609.30192 https://arxiv.org/abs/2609.30243 https://arxiv.org/abs/2609.30867 https://arxiv.org/abs/2609.31093 https://arxiv.org/abs/2609.31415 https://arxiv.org/abs/2609.31415v1 https://arxiv.org/abs/2609.31590 https://arxiv.org/abs/2609.32720 https://arxiv.org/abs/2609.32810 https://arxiv.org/abs/2609.34227 https://arxiv.org/abs/2609.35215v1 https://arxiv.org/abs/2609.36730v1 https://arxiv.org/abs/2609.36965v1 https://arxiv.org/abs/2609.37559v1 https://arxiv.org/abs/2609.37749v1 https://arxiv.org/abs/2609.37863 https://arxiv.org/abs/2609.38096 https://arxiv.org/abs/2609.38137 https://arxiv.org/abs/2609.38349 https://arxiv.org/abs/2609.38792 https://arxiv.org/abs/2609.39071 https://arxiv.org/abs/2609.39102v1 https://arxiv.org/abs/2609.39903v1 https://arxiv.org/abs/2609.39982v1 https://arxiv.org/abs/2610.00437 https://arxiv.org/abs/2610.00559 https://arxiv.org/abs/2610.01092 https://arxiv.org/abs/2610.01428 https://arxiv.org/abs/2610.02304 https://arxiv.org/abs/2610.03020 https://arxiv.org/abs/2610.03136 https://arxiv.org/abs/2610.03421 https://arxiv.org/abs/2610.03430 https://arxiv.org/abs/2610.03574 https://arxiv.org/abs/2610.03632 https://arxiv.org/abs/2610.03664 https://arxiv.org/abs/2610.03715 https://arxiv.org/abs/2610.04116 https://arxiv.org/abs/2610.04292 https://arxiv.org/html/2608.06312v1 https://arxiv.org/html/2608.10875v1 https://arxiv.org/html/2608.14905v1 https://arxiv.org/html/2609.04148v1 https://arxiv.org/html/2609.11115v1 https://arxiv.org/html/2609.18123v1 https://arxiv.org/html/2609.18620v1(R98 新增·LMBuild + AgencyBench 开源仓库)+ https://arxiv.org/html/2610.03430v1(JIL 数据校正)+ https://arxiv.org/abs/2610.04292(LMBuild 升正式锚)+ https://arxiv.org/abs/2610.07753(SafeActBench 邻接预备)+ https://arxiv.org/abs/2610.08432(EMHO marginal 邻接预备)+ https://arxiv.org/pdf/2610.04292(LMBuild PDF)+ https://arxiv.org/abs/2601.11044(AgencyBench 沿用 + 数据精确化)。

R75→R98 non-arxiv URL 累积精选(含 HF papers / GitHub / blog):https://21yrm.github.io/Apple-PI-homepage https://21yrm.io/Apple-PI-homepage https://academ.us/article/2608.10875 https://aclanthology.org/2026.acl-demo.19/ https://aclanthology.org/2026.acl-demo.3/ https://aclanthology.org/2026.acl-demo.34/ https://aclanthology.org/volumes/2026.acl-demo https://aievaluation.substack.com/p/2026-may-ai-evaluation-digest https://aiweekly.co/alerts/acl-2026-publishes-demo-track-list-heavy-on-llm-safety-tools https://aiweekly.co/alerts/coercion-benchmark-claude-never-threatens-deletion-rivals-do https://aiweekly.co/alerts/compile-by-training-reaches-836-on-fuzzybench-hard-subset https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal https://allenai.org/blog/benchmirt https://artificialanalysis.ai/evaluations/apex-agents-aa https://cameronrwolfe.substack.com/p/agent-evals https://developer.nvidia.com/blog/agent-evaluation-framework-step-level-end-to-end https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation https://github.com/21yrm/Apple-PI https://github.com/AMAP-ML/LoopArena https://github.com/AmamiSora1228/MMLongEmbed https://github.com/Andrew0613/PAWBench https://github.com/Gen-Verse/Skill-Entropy-RL https://github.com/ModalityDance/Awesome-Agent-as-a-Judge https://github.com/ai-boost/awesome-harness-engineering https://github.com/aisa-group/InferenceBench https://github.com/gulucaptain/MiniMax-H3-Reason https://github.com/hkust-nlp/LOCA-bench https://github.com/jiaminchen-1031/SEAL https://github.com/maseval/MASEval https://github.com/mattheliu/riskchainbench-task1 https://github.com/pathwaycom/bdh https://github.com/run-llama/ExtractBench https://github.com/ulab-uiuc/AgentDebug https://github.com/umwyf/CRITICL https://github.com/zjunlp/DataMind https://github.com/zjunlp/OneDayAgent https://huggingface.co/blog/security-incident-july-2026 https://huggingface.co/datasets/mercor/apex-agents https://huggingface.co/papers/2608.00677 https://huggingface.co/papers/2608.05747 https://huggingface.co/papers/2608.06867 https://huggingface.co/papers/2608.07545 https://huggingface.co/papers/2608.08160 https://huggingface.co/papers/2608.09867 https://huggingface.co/papers/2608.10875 https://huggingface.co/papers/2608.11745 https://huggingface.co/papers/2608.13552 https://huggingface.co/papers/2608.13560 https://huggingface.co/papers/2608.14905 https://huggingface.co/papers/2608.15127 https://huggingface.co/papers/2608.16859 https://huggingface.co/papers/2608.19269 https://huggingface.co/papers/2608.25593 https://huggingface.co/papers/2608.26530 https://huggingface.co/papers/2608.27455 https://huggingface.co/papers/2608.28281 https://huggingface.co/papers/2608.28833 https://huggingface.co/papers/2608.29387 https://huggingface.co/papers/2608.29847 https://huggingface.co/papers/2608.30005 https://huggingface.co/papers/2608.31046 https://huggingface.co/papers/2608.31100 https://huggingface.co/papers/2608.31111 https://huggingface.co/papers/2609.00196 https://huggingface.co/papers/2609.01437 https://huggingface.co/papers/2609.02783 https://huggingface.co/papers/2609.03153 https://huggingface.co/papers/2609.04094 https://huggingface.co/papers/2609.04172 https://huggingface.co/papers/2609.04173 https://huggingface.co/papers/2609.04199 https://huggingface.co/papers/2609.06011 https://huggingface.co/papers/2609.06107 https://huggingface.co/papers/2609.11115 https://huggingface.co/papers/2609.11873 https://huggingface.co/papers/2609.13948 https://huggingface.co/papers/2609.14302 https://huggingface.co/papers/2609.14857 https://huggingface.co/papers/2609.15195 https://huggingface.co/papers/2609.16251 https://huggingface.co/papers/2609.16816 https://huggingface.co/papers/2609.16900 https://huggingface.co/papers/2609.17320 https://huggingface.co/papers/2609.17496 https://huggingface.co/papers/2609.18123 https://huggingface.co/papers/2609.18323 https://huggingface.co/papers/2609.18605 https://huggingface.co/papers/2609.18620 https://huggingface.co/papers/2609.18748 https://huggingface.co/papers/2609.19169 https://huggingface.co/papers/2609.19656 https://huggingface.co/papers/2609.19879 https://huggingface.co/papers/2609.20715 https://huggingface.co/papers/2609.20784 https://huggingface.co/papers/2609.20804 https://huggingface.co/papers/2609.22039 https://huggingface.co/papers/2609.22076 https://huggingface.co/papers/2609.22220 https://huggingface.co/papers/2609.24974 https://huggingface.co/papers/2609.25001 https://huggingface.co/papers/2609.26550 https://huggingface.co/papers/2609.26781 https://huggingface.co/papers/2609.28603 https://huggingface.co/papers/2609.28654 https://huggingface.co/papers/2609.29028 https://huggingface.co/papers/2609.29429 https://huggingface.co/papers/2609.29816 https://huggingface.co/papers/2609.30192 https://huggingface.co/papers/2609.30243 https://huggingface.co/papers/2609.30867 https://huggingface.co/papers/2609.31093 https://huggingface.co/papers/2609.31415 https://huggingface.co/papers/2609.31590 https://hugobowne.substack.com/p/stop-overengineering-your-agent-harness https://hyper.ai/en/papers/2608.10875 https://inferencebench.ai https://kenashe.ai/blog/2026-09-01-on-policy-distillation-may-be-pruning-tails-not-teaching https://koutian.is-a.dev/posts/2026/09/benchmark-radar-day46 https://lilianweng.github.io/posts/2026-07-04-harness/ https://martinfowler.com/articles/engineering-practices-llm.html https://maseval.readthedocs.io https://mirros-lab.github.io/HarnessEval-W https://openreview.net/forum?id https://papers.cool/arxiv/2608.14905 https://papers.cool/arxiv/2609.11115 https://papers.cool/arxiv/2609.28603 https://papers.cool/arxiv/2609.29028 https://papers.cool/arxiv/2609.29429 https://papers.cool/arxiv/2609.30243 https://pawbench.github.io https://randcorporation.github.io/judge-reliability-harness https://sherlocks.ai/blog https://stolen-thoughts.com https://theaiengineer.substack.com/ https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition https://usersim.ai/bibliography https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026 https://www.aimodeling.com/en/news/slug/compile-by-training-neural-functions https://www.aimodeling.com/en/news/slug/terminal-universe-trajectory-environments https://www.alphaxiv.org/abs/2608.05747 https://www.alphaxiv.org/abs/2608.09867 https://www.alphaxiv.org/abs/2608.25593 https://www.alphaxiv.org/abs/2608.27345 https://www.alphaxiv.org/abs/2608.31046 https://www.alphaxiv.org/abs/2609.04148 https://www.alphaxiv.org/abs/2609.28603 https://www.alphaxiv.org/abs/2609.28654 https://www.alphaxiv.org/abs/2609.29028 https://www.alphaxiv.org/abs/2609.29429 https://www.braintrust.dev/articles/best-ai-agent-debugging-tools-2026 https://www.datadoghq.com/state-of-ai-engineering https://www.developersdigest.tech/blog/terminal-universe-agent-trajectories https://www.explainx.ai/blog/langchain-jev-agent-evals-benchmark-september-2026 https://www.freecodecamp.org/news/ai-evaluation-engineering-build-a-production-grade-llm-evaluation-platform-handbook https://www.langchain.com/state-of-agent-engineering-2026 https://www.mercor.com/blog/introducing-apex-agents https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 https://www.vibeleaderboard.ai/intel/3eb3f658-723d-4c4c-92ce-0439fbd62c41 https://x.com/dair_ai/status/2095880318146507139 https://x.com/jerryjliu0/status/2090204727091093841 https://x.com/omarsar0/status/2038627572108743001 https://xwang2775.github.io/horizon-leaderboard/

9. 反问与遗留清单(R60 → R98)

9.1 本主题内反问(221→225,R98 +4)

R93 沿用 6 件反问:SAGO 泛化=稳定性可推广性 / PhysVista 闭环可迁移非物理 / OpenTumorBoard 数据泄漏 / HAL 2027H1 参考价值 / BenchAgent 工业采纳 / LongHarness 立标价值分离通用模式。

R95 新增 2 件反问:(1) SimuVerity 三层评估器跨任务稳健性;(2) LexReward 三维分类法在跨司法管辖区 / 跨语言场景下的可推广性。

R97 新增 3 件反问:(1) AgencyBench 138 任务分到 6 能力后每能力样本量小(≈23 任务/能力)——分数波动大,统计显著性需要看置信区间;(2) JIL Attack 调度公平性 vs 任务准确率优先级——评测诚信六层级是否需要新增"调度公平性"作为独立第七层;(3) Selection vs Extraction 预注册研究方法的工业落地路径——预注册 + 受控实验 + 形式化非劣效边界是否能推广到其他评测领域。

R98 新增 4 件反问:(1) LMBuild 30 frontier agent systems 数据是否构成跨领域共识——"Soundness 和 alignment 不再是 frontier closed-source 模型的主要瓶颈,而 functional affordance 和 physical operability 仍显著更难"是否在其他物理世界评测基准上同时成立——评测对象的层次化难易分布是否构成评测方法学的新骨架?(2) JIL Attack 数据校正后调度公平性评级是否需要升级——预测长度最多减少 83.4% + 完成时间最多加速 1.53× + 2 件数据集 × 4 LLM × 多种部署配置 = 是否需要将调度公平性从"评测诚信子维度"升级为"独立第七层"?(3) SafeActBench 证据-行动链端点与 R97 AgencyBench 真实任务端点的边界——656 案例 × 6 操作域 × 5 协议是否覆盖了"日常真实任务"的证据链完整性——长程第八端点(证据-行动链端点)是否成立?(4) EMHO Harness 自演进方法的评测维度统一性——harness 自演进方法在评测对象、harness 质量、训练稳定性三个维度上是否需要标准化评测协议。

R99 反问(5):Agent Plasticity 跨垂类/崩溃点;ThinkingBox schema/一致性;Harness 5 件完整/边界;LMBuild 4 维跨基准;SafeActBench 37-67% 推广。

9.2 待补/待核验(388→392,R98 +4)

R93 沿用 6 件待补:SAGO 多轴稳定性量化 / PhysVista 闭环+VLM 双锚验证 / OpenTumorBoard 评估方法 / HAL 成本快照口径 / BenchAgent 采纳情况 / AgentProcessBench 过程评测方法。

R95 新增 8 件待补:(1) SimuVerity 101 任务具体分布 + 10 工程领域具体清单 + 三层评估器精确计算方法;(2) LexReward 三维的具体评分权重 + 法律原文风格实验 + 与现有法律评测基准对比数据;(3) DyadMem URAM 标注一致性 + 评测方法 + 与 APM-Bench 精确区分;(4) HyperBrowseComp 13 语言具体清单 + 评测指标体系;(5) SWE-Serve 53 任务具体清单 + 评测指标权重;(6) World Embedding Benchmark 80 families 具体清单 + 三任务权重;(7) CLIMB MMR 目标函数 + 置信度停止条件;(8) Reasoning-Language Alignment 德语测试集大小 + 推理-语言对齐量化方法。

R96 新增 3 件待补:(1) Tail-Influence Sampling 跨领域可推广性;(2) 4DCodeBench 200 视频任务分布 + 18 模型清单 + 三维评测指标权重与计算方法;(3) CUAWright 3K 行代码架构公开性 + 动态工具创建质量评测指标权重 + 与 OSWorld/WebArena 现有 harness 对照数据。

R97 新增 4 件待补:(1) AgencyBench 32 场景 × 138 任务具体分布 + 6 大能力维度具体定义 + user-sim prompt 模板 + 视觉/功能双 rubric 的评分一致性 + 评测成本 + Docker 容器安全边界 + 数据污染风险——R98 前需原文 PDF/HTML 精读(R98 本轮已完成 ACL 2026 Main + GAIR-NLP 开源 + 6 能力维度精确化 + Claude-4-Sonnet user-sim 四项数据校正);(2) JIL Attack 完整 TLDR + 缓解方案生产验证状态——R98 前需原文精读 + 跟进 vLLM/SGLang 官方 Changelog(R98 本轮已完成 83.4% + 1.53× + 2×4 配置 + TRAIL 案例四项数据校正);(3) Selection vs Extraction LongMemEval 上的具体结果(非劣效边界是否也成立)+ Jev 选取 vs LLM extraction 在不同模型规模下的表现差异——R99 前需原文精读;(4) LMBuild 完整 TLDR + 具体贡献 + 与其他 agent 构建工具的差异化定位——R98 前需原文精读(R98 本轮已完成 ⚠️ 待 TLDR 升正式 eval 主分类锚 + 1 件 web_search + 4 维度评测框架 + 30 systems 实测数据)。

R98 新增 4 件待补:(1) LMBuild 4 维度评测框架的精确计算方法——structural soundness / functional affordance / design quality / physical realization 各自的权重 + 计算方法 + 在 CAD-derived benchmark 上的具体任务分布 + 与现有基准(Ego2Act / World Embedding Benchmark / 4DCodeBench)的对照数据;(2) JIL Attack 完整 TLDR + 缓解方案生产验证状态——粗粒度长度分组在 vLLM/SGLang/TRAIL 最新版本中是否已有修复 + 受影响版本号和修复进度——R99 前需原文精读 + 跟进 vLLM/SGLang 官方 Changelog(R98 数据校正后仍需生产环境验证);(3) SafeActBench 656 案例的具体分布 + 6 操作域定义 + 5 协议的具体内容 + 10 种模型-执行环境配置差距的根因分析(harness 差异?任务类型差异?协议复杂度差异?)——R99 前需原文精读;(4) EMHO 工业部署成熟度 + harness 自演进质量评测指标(任务完成率/工具新颖性/规划可读性/自演进收敛性)+ 在 EmbodiedBench 之外任务类型的泛化性——R99 前需原文精读。

R99 待补(5):Agent Plasticity 控制实验/权重;ThinkingBox schema/review;4 件伴生+EMHO 精读;LMBuild 4 维对照;SafeActBench 37-67% 推广。

9.3 与其他主题交叉(168→172,R98 +4)

R93 沿用 6 件交叉:SAGO(eval/llm-infra)+ PhysVista(eval/multimodal)+ OpenTumorBoard(eval/agent+risk)+ HAL(llm-infra/eval/ai-industry)+ BenchAgent(llm-infra/eval/agent)+ LongHarness Bench 反方(long-context/eval/coding-agents)。

R97 新增 3 件交叉:(1) AgencyBench(eval 主/agent 邻);(2) JIL Attack(engineering 主/eval 强邻接);(3) Selection vs Extraction(agent 主/eval 副)。

R98 新增 4 件交叉:(1) LMBuild(eval 主/multimodal 邻接/engineering 邻接 · 3D 可构建/可功能结构评测,与 multimodality 3D 物理世界评测跨主题,与 ai-industry 工业设计工具评测跨主题,与 coding-agents 代码生成评测跨主题,与 long-context 长上下文评测跨主题——与 R96 4DCodeBench(物理世界代码生成)+ R95 World Embedding Benchmark(物理表征)+ R94 Ego2Act(动作生成)形成"动作 → 表征 → 代码 → 物理构建"四重物理世界评测媒介);(2) SafeActBench(agent 主/eval 副 · 工具使用 Agent 证据-行动链断裂诊断,与 agent 失败归因跨主题,与 coding-agents 工具调用稳定性跨主题,与 risk 工具使用安全审计跨主题);(3) EMHO(eval 主/marginal · 具身 Agent Harness 自演进方法,与 llm-infra 推理引擎自演进跨主题,与 agent Harness 自演进跨主题,与 multimodess 跨主题);(4) JIL Attack 数据校正(engineering 主/eval 强邻接 · 调度安全评测,与 llm-infra 推理引擎跨主题,与 ai-industry 多租户 LLM 服务跨主题,与 risk adversarial attack 跨主题)。

R99 交叉(5):Agent Plasticity(训练/coding);ThinkingBox(coding后端/database);Harness 5 件(训练/llm-infra——Q4 新锚);LMBuild 4 维(3D/ai-industry);SafeActBench(coding/risk)。

本次变更

  • 2026-10-09 16:50(R99,本轮新增):1 邻接+1 范式+2 精确化+4 Harness 伴生(8 件)。判定:Harness R98 单点→R99 新锚 ★★★★;能力快照→学习轨迹 ★★★;中间→最终交付物 ★★★;静态-交互断层系统化 ★★★;0 主分类+R98 锚定稳固。变更:§0-2/§3 锚 196-198/§6.184/§7.3+5/§6+4/§8+4 arXiv+10 URLs/§9+5/+5/+5。R98 详细段已归档。

  • 2026-10-08 16:50(R98,简略段):2 件 NET-new eval 主分类(LMBuild 2610.04292 升正式锚 + UIUC/Microsoft · 30 systems · 4 维)+ eval 邻接 NET-new 3 件(SafeActBench 2610.07753 paper_card 1702 + EMHO 2610.08432 paper_card 1707 + Selection vs Extraction 沿用)+ 数据校正 2 件(AgencyBench → ACL 2026 Main + GAIR-NLP + 6 能力精确化 + Claude-4-Sonnet + JIL Attack → 83.4% 长度减少 + 1.53× 完成加速 + 2×4 配置)——R97 终结信号 v1 沿用 + 新范式拓展期 v2 启动 + 物理世界评测饱和化 v2 + Harness 自演进层 v3。关键判定:(a) 物理世界评测四重奏首次完整成型(★★★★·R94 Ego2Act + R95 WEB + R96 4DCodeBench + R98 LMBuild);(b) 长程第八端点(证据-行动链端点)首次系统化(★★★·SafeActBench 656 案例 × 6 域 × 5 协议);(c) Harness 自演进层作为评测方法学新议题首次系统化(★★★·EMHO 冻结具身模型 + Harness 自演进);(d) 评测对象层次化难易分布作为评测方法学新骨架(★★★·LMBuild 30 systems 实测);(e) AgencyBench 6 能力维度精确化 + JIL Attack 数据校正(★★★·真实任务第七端点 + 调度公平性子维度)。变更:(I) §0 R98 范式跃迁 + R97/R96 简略段;(II) §1.1 评测诚信八层级 + 物理世界四重奏 + Harness 自演进层;(III) §1.2 LLM-as-Judge 失效模式六元 + 多维评估框架;(IV) §1.3 长程七端点 + 第八端点预备 + 媒介端点四重奏;(V) §1.4 cost-aware + 风险敏感 + 调度安全 + Harness 自演进;(VI) §6.182 R97 4 节沿用 + 数据精确化 + §6.183 R98 新增 2 节;(VII) §3 锚 194-195;(VIII) §7.3 +4 开放问题(325→329);(IX) §6 趋势 +4(168-171)+ §8 +3 arXiv IDs(342→345)+ +4 URLs(含 github.com/GAIR-NLP/AgencyBench);(X) §9.1/9.2/9.3 +4/+4/+4;(XI) 计数更新(harness 套件 328→332 + 邻接维 143→147 + 二十角预备级 75-79)。R97 详细段已归档至 archive evaluation-changelog.md 第 97 轮段。

  • 2026-10-07 16:50(R97,简略段):1 件 NET-new eval 主分类 paper_card(AgencyBench 2601.11044 · flyp 10-7 ⭐⭐⭐⭐ 精读 · 待建卡)+ 3 件 NET-new eval 邻接 paper_card(JIL Attack 2610.03430 · 待建卡 · engineering 主/eval 强邻接 + Selection vs Extraction 2609.34227 paper_card 1698 · agent 主/eval 副 + LMBuild 2610.04292 · ⚠️ TLDR 截断 · 待建卡)——R96 终结信号 v1 沿用 + 新范式拓展期 v2 启动。R98 数据校正后沿用,JIL Attack 数据 83.4% + 1.53× + 2×4 配置 + AgencyBench 6 能力维度精确化 + LMBuild 升正式 eval 主分类锚。R97 详细段已归档至 archive evaluation-changelog.md 第 97 轮段。