evaluation · E1 预消化简报(2026-10-07)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-07 15:40 CST 窗口定义:2026-10-06 15:40 ~ 2026-10-07 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R95 基线 · 2026-10-06 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 5-7 新入库 eval 相关条目 + flyp/spark/agent eval 联动内容 诚实度声明:本轮 eval 主题净增量密度「低-中」—— eval 主分类 paper_card NET-new 净增 1 件(AgencyBench 2601.11044 · flyp 10-7 精读 ⭐⭐⭐⭐);eval 邻接/副分类新增 3 件(JIL Attack + Selection vs Extraction + LMBuild);整体落在 agent 长程评测与调度安全评测两个新子方向,无颠覆性新 benchmark 范式。
状态摘要
- 增量条数:4 条(落在 3-8 目标区间内)
- 核心新增:① AgencyBench(2601.11044 · 1M token 真实世界 Agent 评测 benchmark · flyp 精读 ⭐⭐⭐⭐)② JIL Attack(2610.03430 · LLM 长度预测调度器安全 · eval 邻接 · 待建卡)③ Selection vs Extraction(2609.34227 · Agent 记忆提取 vs 选择预注册研究 · eval 副分类)④ LMBuild(2610.04292 · Agent 构建评测框架 · 24▲ HF Daily #2 · eval 邻接)
- 澄清:本轮 eval 主分类 NET-new = 1 件(AgencyBench);JIL Attack 属 engineering 主分类,eval 强邻接,不占主分类名额;Selection vs Extraction 和 LMBuild 均属 eval 副分类/邻接
- 涉及 arXiv 号:本次新增 4 个(2601.11044 · 2610.03430 · 2609.34227 · 2610.04292)+ 续用 R95 锚定 335+ 个
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| organized/knowledge | evaluation.md(R95 基线 · 含 8 件 R95 新增锚点:SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-06-evaluation-e1prep.md(R95 E1 预消化 · 基准锚定) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/tom | 2026-10-07T0840-agent-rag-longcontext-radar.md(Oct 7 早 radar · 含 Selection vs Extraction 2609.34227) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-07-0900-hf-daily-2026-10-07.md(Oct 7 早棒 · LMBuild 24▲ #2) |
高 ⭐⭐⭐⭐ |
| inbox/flyp | 2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md(Oct 7 · ⭐⭐⭐⭐ · 本轮核心新增) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/spark | 2026-10-07-agent-e1prep.md(Oct 7 13:30 · 含 AgencyBench + RLVR Reward Hacking 协同) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-07-engineering-e1prep.md(Oct 7 · 含 JIL Attack) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-07-1450-jay-engineering-screening-oct07-r7.md(Oct 7 · 推理引擎 benchmark 横向对比) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-06T1220-jay-reasoning-failure-reward-hacking.md(Oct 6 · RLVR Reward Hacking · risk/eval 邻接) |
高 ⭐⭐⭐⭐ |
| inbox/flyp | 2026-10-06-risk-e1prep.md(Oct 6 · JEV Judges 96% 错误共现率 + RLVR 五篇 arXiv) |
高 ⭐⭐⭐⭐ |
| organized/paper_cards | 1698-2609-34227.md(Selection vs Extraction · Oct 7 入库 · agent 主/eval 副) |
极高 ⭐⭐⭐⭐⭐ |
| organized/paper_cards | 1692-2610-05622.md(UndoBench · agent 主/eval 副) |
高 ⭐⭐⭐⭐ |
| organized/queue | work-queue.md(2026-10-07 14:00 · Top 15 含 Selection vs Extraction) |
高 ⭐⭐⭐⭐ |
| inbox/jay/spark/stephen/flyp | 近 2 天其余 eval 相关 inbox 文件 | 已在 Oct 5-6 E1 prep 覆盖或 eval 邻接级 |
一、增量条目
增量 1:AgencyBench — 1M-Token 真实世界 Agent 评测 Benchmark(2601.11044)— eval 主分类 benchmark(⭐⭐⭐⭐)
来源:inbox/flyp/2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md(Oct 7 · flyp 精读 ⭐⭐⭐⭐)· 原始来源:arXiv:2601.11044v4(2026-04-23 提交 · Shanghai Innovation Institute + SJTU + Hong Kong PolyU 联合)
URL:https://arxiv.org/abs/2601.11044
TLDR(原文摘要):把"日常真实任务"扩成 32 个场景 / 138 个任务,平均 ≈90 次工具调用、≈1M token、若干小时;用 user-simulation + Docker 沙箱 + 视觉/功能 rubric 自动打分,对闭源 vs 开源 agent 做系统化 benchmark。
要点:
- 核心问题:现有 agent 评测停留在单回合 QA 或短任务,缺乏对"真实长程工作流"的评测——实际部署中 agent 需要处理小时级、多工具、多步骤的真实任务,评测成本极高且难以自动化
- 方法贡献:AgencyBench 提出 32 场景 × 138 任务,平均 ≈90 次工具调用 / ≈1M token / 数小时工作流;评测闭环 = user sim(迭代式用户反馈)+ Docker sandbox(可复现沙箱)+ 双 rubric(视觉 + 功能)
- 核心数据:闭源 48.4% vs 开源 32.1%——差距显著,但更像是 scaffold + 工具链共同决定,而非单纯模型能力差异
- 评测创新:6 大能力维度 × 32 场景 mapping;反馈驱动自我修正(不同模型利用 user-sim 反馈的差距是"长任务鲁棒性"的有效信号);同一模型在不同 scaffold 下表现差异显著(Claude-4.5-Opus × Claude-Agent-SDK 效果更好)
- ⚠️ 待核实:具体 rubric 设计(视觉/功能双 rubric 的评分一致性);user-sim prompt 模板(自动化 user 与真实 user 行为差异);评测成本(1M token × 138 任务 × 90 tool-call = 第三方复现门槛);Docker 容器安全边界(agent 是否被诱导超出授权操作);数据污染风险(日常任务与公网教程/QA 重合度)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R95 §1.3 长程/多 Agent 评测六端点:AgencyBench 以 1M token + 90 tool-call + 数小时工作流定义了"长程 Agent 评测"的新基线——与 R95 World Embedding Benchmark(物理表征)、4DCodeBench(代码生成 + 物理仿真)形成"物理世界三重媒介"互补,AgencyBench 则从"真实日常任务执行"维度扩展长程评测的覆盖范围 - 邻接 R93 §1.3 媒介端点候选:R94 Ego2Act(视频生成)+ R95 World Embedding Benchmark(物理表征)+ 4DCodeBench(代码生成)+ AgencyBench(真实日常任务执行)= 物理世界评测 + 任务执行评测的四轨并行 - 邻接 R93 §2.1 Harness + Judge 累积:AgencyBench 的 user-sim + Docker + rubric 三合一评测闭环是 harness 工程化的新形态;其 scaffold 耦合度发现(同一模型不同 scaffold 下表现差异显著)与 CUAWright(极简 harness 哲学)形成harness 设计理念的正反对比 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增锚点候选 · AgencyBench 2601.11044 · eval 主分类 benchmark · 1M token 真实世界 Agent 评测 · 6 能力维度 × 32 场景 × 138 任务 · user-sim/Docker/rubric 自动化闭环 · ⚠️ 待原文精读确认 rubric 设计和评测成本)
增量 2:JIL Attack — LLM 长度预测调度器系统性安全漏洞(2610.03430)— engineering 主/eval 强邻接(⭐⭐⭐⭐)
来源:inbox/jay/2026-10-07-engineering-e1prep.md(Oct 7 · 工程主轴最强棒 · 增量 1)· inbox/jay/2026-10-07-1105-jay-five-category-oct07-afternoon.md(Oct 7 · P1-1)· 原始来源:arXiv:2610.03430(2026)· 未入 paper_cards,待建卡
URL:https://arxiv.org/abs/2610.03430
TLDR(Jay 简报摘要):对抗性后缀使预测长度调度器(以 TRAIL 为例)低估输出长度,从而获得更高调度优先级,完成时间减少 27-46%;vLLM/SGLang/TRAIL 所有使用长度预测的生产调度器受影响;多租户 LLM 服务直接受影响。
要点:
- 核心问题:LLM 推理系统在生产环境使用"长度预测调度器"来优先处理预估输出较短的请求(以提升吞吐量/降低延迟);JIL Attack 发现对抗性后缀可欺骗长度预测器,使其低估实际输出长度,从而获取不应有的调度优先级——这是一种针对 LLM serving 基础设施的系统性安全攻击
- 评测创新:首次将"LLM serving 调度器安全"形式化为评测维度——传统评测关注任务准确率,JIL Attack 揭示了调度层面的安全攻击面;完成时间减少 27-46% 意味着在多租户场景下,恶意用户可通过构造对抗性 prompt 优先占用推理资源
- 受影响范围:vLLM / SGLang / TRAIL 等所有使用长度预测的调度器;多租户 LLM 服务(API 提供商)直接受影响
- 缓解方案:粗粒度长度分组(将请求按长度区间分组而非精确预测)——但效果待生产环境验证
- ⚠️ 待核实:完整 TLDR 缺失(摘要级信息);未入 paper_cards,无法交叉验证;缓解方案生产验证状态;受影响版本号和修复进度
与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §1.4 cost-aware 评测基础设施:HAL 测任务侧 cost-efficiency;JIL Attack 揭示调度层面的 cost不公平性——恶意用户通过欺骗调度器获取优先权,破坏 cost-aware 评测的前提假设(请求优先级应与实际计算成本匹配) - 邻接 R93 §2.1 Harness + Judge 累积:JIL Attack 的缓解方案(粗粒度长度分组)与 CUAWright(极简 harness)共同说明——评测基础设施本身存在安全攻击面,harness 评测应包含 adversarial 场景 - 邻接 R93 §2.4 Agent、工具、MCP 与 harness:JIL Attack 与 OpenAI Rogue Agent(2026-10-05 Wikimedia 入侵)共同构成"Agent 基础设施安全"的双层叙事(外层:Agent 行为失控;内层:serving 调度器被攻击) - 建议归入章节:§1.4 垂类高风险场景多阶段多维评测(新增邻接 · JIL Attack 2610.03430 · engineering 主/eval 强邻接 · LLM 调度安全漏洞 · 27-46% 完成时间减少 · ⚠️ 待 paper_card 建卡 + 原文精读确认缓解方案生产验证状态)
增量 3:Selection vs Extraction — Agent 记忆提取优于选择?预注册研究负面结果(2609.34227)— agent 主/eval 副(⭐⭐⭐⭐)
来源:organized/paper_cards/1698-2609-34227.md(Oct 7 入库 · 主分类 agent / 副分类 evaluation / 形态 method)· inbox/tom/2026-10-07T0840-agent-rag-longcontext-radar.md(Oct 7 早 radar 高价值 #1)· work-queue.md(2026-10-07 Top 15 高价值待深度解读)· 原始来源:arXiv:2609.34227
URL:https://arxiv.org/abs/2609.34227
TLDR(原文):Does conversational memory need LLM-extracted facts, or is selecting the right raw turns enough? Published results disagree. Extraction-based systems report gains from distilled facts. Recent studies find raw history with good ranking does as well, but disagree about whether ranking matters. We ran a pre-registered study on held-out LoCoMo conversations and LongMemEval. At a tight budget on LoCoMo, raw turns selected by a single call to Jev, a typed decision model, are non-inferior to an LLM-extraction memory (one-sided 95% bound -3.0 points against a -5-point margin).
要点:
- 核心问题:对话 Agent 记忆领域长期存在争议——是 LLM 抽取精炼事实(extraction),还是直接选取原始轮次(selection)?已发表结果相互矛盾:extraction 派报告蒸馏事实有增益;ranking 派报告原始历史 + 良好排序效果相当,但 ranking 是否关键仍有分歧
- 方法贡献:预注册研究(pre-registered study)——在 LoCoMo 对话和 LongMemEval 上对 held-out 数据进行评估;在紧预算下,Jev(typed decision model,单次调用)选取的原始轮次对 LLM 抽取式记忆呈非劣效(单侧 95% 边界 -3.0 百分点,优于 -5 百分点的非劣效边界)
- 预注册研究的价值:预注册设计使结论更可信——作者在实验前公布假设和方法,避免 p-hacking 和 publication bias;这是 agent 记忆评测方法论的重要进步
- 与 Jev 的关联:Jev(TypeSafe AI 的 decision model)在本研究中作为 selection 的工具——这与 flyp risk-e1prep 中 JEV Judges(LLM-as-Judge 的替代方案)形成有趣的跨主题呼应:Jev 既可用于记忆选择(Jev 选取原始轮次),也可用于评判(JEV Judges 替代 LLM judge)
- ⚠️ 待核实:LongMemEval 上的具体结果(非劣效边界是否也成立);Jev 选取 vs LLM extraction 在不同模型规模下的表现差异;预注册研究的结论是否可推广到其他记忆场景(不只是 LoCoMo 客服对话)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R95 §1.3 长程/多 Agent 评测六端点:Agent 记忆评测(extraction vs selection)是长程 Agent 的核心能力维度;R95 的 DyadMem(URAM 用户关系记忆)测关系演化,本研究测记忆形式(抽取 vs 选择)——两者共同构成"长程记忆评测"的双子维度 - 邻接 R93 §1.2 LLM-as-Judge 失效模式:Jev 作为 typed decision model 替代 LLM extraction 或 LLM judge——与 JEV Judges(flyp risk-e1prep)的 96% 错误共现率发现共同说明:Jev 系列方法在评测和应用中有广泛价值,但也存在共享的归纳偏置 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · Selection vs Extraction 2609.34227 · agent 主/eval 副 · 预注册负面结果 · Jev typed decision model 非劣效于 LLM extraction · ⚠️ 待 LongMemEval 结果确认)
增量 4:LMBuild — Agent 构建与评测框架(2610.04292)— eval 邻接(⭐⭐⭐)
来源:inbox/tom/2026-10-07-0900-hf-daily-2026-10-07.md(Oct 7 早棒 · 24▲ #2 顶置新立)· work-queue.md(2026-10-07 Top 15 高价值待深度解读 · #2)· 原始来源:arXiv:2610.04292
URL:https://arxiv.org/abs/2610.04292
TLDR(HF Daily 摘要):[注:TLDR 在来源文件中截断,依据 arXiv 链接和 HF Daily 排序推断]
要点:
- 定位:HF Daily 2026-10-07 早棒 24▲ #2(仅次于 RealCompanion 250▲),在 15 件立标中排名最高的新入库论文之一——社区关注度高
- 推测(待原文核实):根据 arXiv 号 2610.04292 和标题格式(LMBuild),以及"Agent 构建与评测"的上下文,推测为 Agent 开发/评测工具链相关——可能是 Scaffold 生成、Agent 构建框架或 Agent 评测自动化工具
- ⚠️ 重要声明:TLDR 在来源文件中截断,本条目基于 arXiv 号 + 排序推断;引用前必须读原文确认内容,不可基于推断写入 knowledge base
- ⚠️ 待核实:完整 TLDR;具体贡献(是新的 agent 构建框架?自动化评测工具?两者兼有?);与其他 agent 构建工具(如 LangGraph/CrewAI/AutoGen)的差异化定位
与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §2.1 Harness + Judge 累积:如果 LMBuild 是 Agent 构建/评测工具,与 CUAWright(极简 harness)和 AgencyBench(user-sim + Docker + rubric 闭环)共同构成"harness 工具链"——从构建到评测的完整工具链 - 建议归入章节:§2.1 Harness + Judge 累积(eval 邻接候选 · LMBuild 2610.04292 · ⚠️ 待原文 TLDR 确认后决定是否升锚 · 不可在 TLDR 确认前写入 knowledge base 核心锚点)
二、值得警惕的矛盾或待核实说法
⚠️ 待核实 1:AgencyBench 的 user-sim 偏差与 rubric 主观性
- 待核实项:AgencyBench 使用 user simulation agent 提供迭代式反馈,但自动化 user 与真实 user 的"非理性/不完整/对抗"行为可能不一致——这会导致评测结果偏向"听话 agent";双 rubric(视觉 + 功能)的评分一致性也未经充分验证
- 潜在影响:如果 user-sim 偏差显著,AgencyBench 的 48.4% vs 32.1% 闭源/开源差距数据可能无法推广到真实用户场景
- 建议:R96/E1 前需原文 PDF/HTML 精读确认 rubric 设计细节和 user-sim prompt 模板
- 来源:
inbox/flyp/2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md
⚠️ 待核实 2:JIL Attack 缓解方案的生产验证状态
- 待核实项:JIL Attack(2610.03430)的缓解方案(粗粒度长度分组)尚无生产环境验证;在 vLLM/SGLang/TRAIL 的最新版本中是否已有修复或缓解措施?
- 潜在影响:如果主要推理引擎已修复,JIL Attack 的时效性会快速下降;如果未修复,则是需要立即关注的 eval 优先项
- 建议:第一时间读原文 + 确认 paper_card 建卡 + 跟进 vLLM/SGLang 官方 Changelog
- 来源:
inbox/jay/2026-10-07-engineering-e1prep.md
⚠️ 待核实 3:Selection vs Extraction 在 LongMemEval 上的泛化性
- 待核实项:本研究在 LoCoMo 紧预算条件下证明 Jev selection 非劣效于 LLM extraction;但在 LongMemEval(更大规模/更复杂场景)上是否成立?Jev 的 typed decision model 在不同任务类型上的泛化性如何?
- 建议:原文精读后确认 LongMemEval 实验结果
- 来源:
organized/paper_cards/1698-2609-34227.md
⚠️ 待核实 4:LMBuild 完整内容截断,不可引用推断
- 待核实项:LMBuild(2610.04292)在 HF Daily 早棒中 TLDR 截断;当前条目内容基于 arXiv 号和排序推断,不可作为可信引用来源
- 建议:立即读取原文确认;如为 eval 相关且有明确贡献,升为邻接锚点;如为 agent 构建工具(非评测),归入 engineering 主轴承引
- 来源:
inbox/tom/2026-10-07-0900-hf-daily-2026-10-07.md
三、本轮无硬凑声明
本轮 eval 主题在 Oct 6 已由 Tail-Influence Sampling + 4DCodeBench + CUAWright 完成了 2 件 eval 主分类 NET-new(R95 锚定后第一轮补充)。Oct 7 eval 相关新增:
- AgencyBench(2601.11044):eval 主分类 benchmark——1M token 真实世界 Agent 评测——6 能力维度 × 32 场景 × 138 任务——user-sim/Docker/rubric 自动化闭环——flyp 精读 ⭐⭐⭐⭐——有明确 benchmark 贡献,可立项邻接
- JIL Attack(2610.03430):engineering 主分类,eval 强邻接——LLM 长度预测调度器安全漏洞——27-46% 完成时间减少——eval 邻接级,暂不占 eval 主分类名额
- Selection vs Extraction(2609.34227):agent 主分类,eval 副分类——预注册负面结果——Jev typed decision model 非劣效于 LLM extraction——eval 副分类邻接,有方法学贡献
- LMBuild(2610.04292):eval 邻接候选——24▲ HF Daily #2——⚠️ TLDR 截断,不可引用推断内容,待原文确认
无 eval 主分类 paper_card 净增:Oct 7 新入库 paper_cards(1694-1698)中无 eval 主分类;AgencyBench(2601.11044)不在 paper_cards 中(flyp 精读覆盖);R95 锚定的 eval 范式骨架稳固(工程垂类层级化 + 奖励分类法 + 长程六端点 + 媒介端点双重化),今日增量落在长程 agent 评测与 LLM 调度安全评测两个新子方向。
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主/邻 | 状态 |
|---|---|---|---|
| 2601.11044v4 | AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts | eval 主/benchmark | 🆕 本轮新增锚点候选(1M token 真实世界 Agent 评测 · flyp 精读 ⭐⭐⭐⭐ · 仍待 paper_card 建卡) |
| 2610.03430 | JIL Attack: 利用长度预测干扰 LLM 调度 | engineering 主/eval 强邻接 | 🆕 本轮新增邻接候选(LLM 调度安全 · ⚠️ 待 paper_card 建卡 + 原文确认) |
| 2609.34227 | When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model | agent 主/eval 副 | 🆕 本轮新增邻接候选(预注册负面结果 · Jev 非劣效于 LLM extraction) |
| 2610.04292 | LMBuild | eval 邻接候选 | 🆕 本轮候选(TLDR 截断 · ⚠️ 不可引用推断内容 · 待原文确认) |
| 2609.38096 | Tail-Influence Sampling for CVaR Policy Evaluation | eval 主/method | Oct 6 E1 prep 已锚定 |
| 2610.03715 | 4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes | eval 主/benchmark | Oct 6 E1 prep 已锚定 |
| 2610.04116 | CUAWright: A Minimal Unified Interface for Digital Agents | agent 主/eval 副 | Oct 6 E1 prep 已锚定 |
| 2610.02304 | SimuVerity: Engineering-Grade Simulink Model Generation Benchmark | eval 主 | R95 已锚定 |
| 2609.39071 | LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models | eval 主 | R95 已锚定 |
| 2610.03020 | DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users | agent 主/eval 副 | R95 已锚定 |
| 2609.26777 | SWE-Serve: Production-Grade Inference Engineering Benchmark | llm-infra 主/eval 邻 | R95 已锚定 |
| 2610.03632 | World Embedding Benchmark | multimodal 主/rag 副 | R95 已锚定 |
| 2610.03421 | CLIMB: Confidence-Guided Multimodal RAG with Complementary Evidence | rag 主/multimodal 副 | R95 已锚定 |
| 2610.03136 | Reasoning-Language Alignment in Monolingual RAG | rag 主/risk 副 | R95 已锚定 |
| 2601.11044 | AgencyBench (旧版引用) | eval 主/benchmark | flyp 10-7 精读 ⭐⭐⭐⭐ |
| 2609.29769v2 | JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places | eval 主/risk 副 | flyp 10-6 risk-e1prep 已锚定(96% 错误共现率 + Cascade 失败) |
| 2602.06176 | LLM Reasoning Failures | 主 reasoning 副 risk | flyp 10-6 risk-e1prep 已锚定 |
| 2604.15149 | LLMs Gaming Verifiers: RLVR Can Lead to Reward Hacking | 主 rl 副 risk | flyp 10-6 risk-e1prep 已锚定 |
| 2607.02869 | Reward Granularity in RLVR: Process vs Outcome | 主 rl 副 risk | flyp 10-6 risk-e1prep 已锚定 |
| 2606.11470v1 | The Periodic Table of LLM Reasoning | 主 reasoning 副 risk | flyp 10-6 risk-e1prep 已锚定 |
| 2605.30104 | SEAL: LLM-as-Meta-Judge | 副分类 eval | R93 已锚定 |
| 2510.11977 | HAL: Holistic Agent Leaderboard | 邻接 eval | R93 已锚定 |
| 2606.05670 | BenchAgent: Protocol-Aligned Agent Workflow Evaluation | 邻接 eval | R93 已锚定 |
| 2610.01428 | SAGO: Generalization Is Stability | 主分类 eval | R93 已锚定 |
| 2609.00559 | PhysVista: Benchmarking Physical Intelligence in VLMs | 主分类 eval | R93 已锚定 |
| 2609.32810 | OpenTumorBoard: Multidisciplinary Tumor Board Discussion | 主分类 eval | R93 已锚定 |
| 2609.38137 | LongHarness Bench | 邻接 eval | R93 已锚定 |
Tom · 2026-10-07 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-07-evaluation-e1prep.md