evaluation · E1 预消化简报(2026-10-07)

执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-07 15:40 CST 窗口定义:2026-10-06 15:40 ~ 2026-10-07 15:40 CST(约 24 小时滑动窗口) 底本:organized/knowledge/evaluation.md(R95 基线 · 2026-10-06 下午)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 5-7 新入库 eval 相关条目 + flyp/spark/agent eval 联动内容 诚实度声明:本轮 eval 主题净增量密度「低-中」—— eval 主分类 paper_card NET-new 净增 1 件(AgencyBench 2601.11044 · flyp 10-7 精读 ⭐⭐⭐⭐);eval 邻接/副分类新增 3 件(JIL Attack + Selection vs Extraction + LMBuild);整体落在 agent 长程评测与调度安全评测两个新子方向,无颠覆性新 benchmark 范式。


状态摘要

  • 增量条数:4 条(落在 3-8 目标区间内)
  • 核心新增:① AgencyBench(2601.11044 · 1M token 真实世界 Agent 评测 benchmark · flyp 精读 ⭐⭐⭐⭐)② JIL Attack(2610.03430 · LLM 长度预测调度器安全 · eval 邻接 · 待建卡)③ Selection vs Extraction(2609.34227 · Agent 记忆提取 vs 选择预注册研究 · eval 副分类)④ LMBuild(2610.04292 · Agent 构建评测框架 · 24▲ HF Daily #2 · eval 邻接)
  • 澄清:本轮 eval 主分类 NET-new = 1 件(AgencyBench);JIL Attack 属 engineering 主分类,eval 强邻接,不占主分类名额;Selection vs Extraction 和 LMBuild 均属 eval 副分类/邻接
  • 涉及 arXiv 号:本次新增 4 个(2601.11044 · 2610.03430 · 2609.34227 · 2610.04292)+ 续用 R95 锚定 335+ 个

〇、检查过的来源清单

来源目录 关键文件 eval 相关度
organized/knowledge evaluation.md(R95 基线 · 含 8 件 R95 新增锚点:SimuVerity + LexReward + DyadMem + HyperBrowseComp + SWE-Serve + World Embedding Benchmark + CLIMB + Reasoning-Language Alignment) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-06-evaluation-e1prep.md(R95 E1 预消化 · 基准锚定) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-07T0840-agent-rag-longcontext-radar.md(Oct 7 早 radar · 含 Selection vs Extraction 2609.34227) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-07-0900-hf-daily-2026-10-07.md(Oct 7 早棒 · LMBuild 24▲ #2) 高 ⭐⭐⭐⭐
inbox/flyp 2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md(Oct 7 · ⭐⭐⭐⭐ · 本轮核心新增) 极高 ⭐⭐⭐⭐⭐
inbox/spark 2026-10-07-agent-e1prep.md(Oct 7 13:30 · 含 AgencyBench + RLVR Reward Hacking 协同) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-07-engineering-e1prep.md(Oct 7 · 含 JIL Attack) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-07-1450-jay-engineering-screening-oct07-r7.md(Oct 7 · 推理引擎 benchmark 横向对比) 高 ⭐⭐⭐⭐
inbox/jay 2026-10-06T1220-jay-reasoning-failure-reward-hacking.md(Oct 6 · RLVR Reward Hacking · risk/eval 邻接) 高 ⭐⭐⭐⭐
inbox/flyp 2026-10-06-risk-e1prep.md(Oct 6 · JEV Judges 96% 错误共现率 + RLVR 五篇 arXiv) 高 ⭐⭐⭐⭐
organized/paper_cards 1698-2609-34227.md(Selection vs Extraction · Oct 7 入库 · agent 主/eval 副) 极高 ⭐⭐⭐⭐⭐
organized/paper_cards 1692-2610-05622.md(UndoBench · agent 主/eval 副) 高 ⭐⭐⭐⭐
organized/queue work-queue.md(2026-10-07 14:00 · Top 15 含 Selection vs Extraction) 高 ⭐⭐⭐⭐
inbox/jay/spark/stephen/flyp 近 2 天其余 eval 相关 inbox 文件 已在 Oct 5-6 E1 prep 覆盖或 eval 邻接级

一、增量条目

增量 1:AgencyBench — 1M-Token 真实世界 Agent 评测 Benchmark(2601.11044)— eval 主分类 benchmark(⭐⭐⭐⭐)

来源:inbox/flyp/2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md(Oct 7 · flyp 精读 ⭐⭐⭐⭐)· 原始来源:arXiv:2601.11044v4(2026-04-23 提交 · Shanghai Innovation Institute + SJTU + Hong Kong PolyU 联合)

URL:https://arxiv.org/abs/2601.11044

TLDR(原文摘要):把"日常真实任务"扩成 32 个场景 / 138 个任务,平均 ≈90 次工具调用、≈1M token、若干小时;用 user-simulation + Docker 沙箱 + 视觉/功能 rubric 自动打分,对闭源 vs 开源 agent 做系统化 benchmark。

要点:

  • 核心问题:现有 agent 评测停留在单回合 QA 或短任务,缺乏对"真实长程工作流"的评测——实际部署中 agent 需要处理小时级、多工具、多步骤的真实任务,评测成本极高且难以自动化
  • 方法贡献:AgencyBench 提出 32 场景 × 138 任务,平均 ≈90 次工具调用 / ≈1M token / 数小时工作流;评测闭环 = user sim(迭代式用户反馈)+ Docker sandbox(可复现沙箱)+ 双 rubric(视觉 + 功能)
  • 核心数据:闭源 48.4% vs 开源 32.1%——差距显著,但更像是 scaffold + 工具链共同决定,而非单纯模型能力差异
  • 评测创新:6 大能力维度 × 32 场景 mapping;反馈驱动自我修正(不同模型利用 user-sim 反馈的差距是"长任务鲁棒性"的有效信号);同一模型在不同 scaffold 下表现差异显著(Claude-4.5-Opus × Claude-Agent-SDK 效果更好)
  • ⚠️ 待核实:具体 rubric 设计(视觉/功能双 rubric 的评分一致性);user-sim prompt 模板(自动化 user 与真实 user 行为差异);评测成本(1M token × 138 任务 × 90 tool-call = 第三方复现门槛);Docker 容器安全边界(agent 是否被诱导超出授权操作);数据污染风险(日常任务与公网教程/QA 重合度)

与活文档 evaluation.md 现有脉络的关系: - 邻接 R95 §1.3 长程/多 Agent 评测六端点:AgencyBench 以 1M token + 90 tool-call + 数小时工作流定义了"长程 Agent 评测"的新基线——与 R95 World Embedding Benchmark(物理表征)、4DCodeBench(代码生成 + 物理仿真)形成"物理世界三重媒介"互补,AgencyBench 则从"真实日常任务执行"维度扩展长程评测的覆盖范围 - 邻接 R93 §1.3 媒介端点候选:R94 Ego2Act(视频生成)+ R95 World Embedding Benchmark(物理表征)+ 4DCodeBench(代码生成)+ AgencyBench(真实日常任务执行)= 物理世界评测 + 任务执行评测的四轨并行 - 邻接 R93 §2.1 Harness + Judge 累积:AgencyBench 的 user-sim + Docker + rubric 三合一评测闭环是 harness 工程化的新形态;其 scaffold 耦合度发现(同一模型不同 scaffold 下表现差异显著)与 CUAWright(极简 harness 哲学)形成harness 设计理念的正反对比 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增锚点候选 · AgencyBench 2601.11044 · eval 主分类 benchmark · 1M token 真实世界 Agent 评测 · 6 能力维度 × 32 场景 × 138 任务 · user-sim/Docker/rubric 自动化闭环 · ⚠️ 待原文精读确认 rubric 设计和评测成本)


增量 2:JIL Attack — LLM 长度预测调度器系统性安全漏洞(2610.03430)— engineering 主/eval 强邻接(⭐⭐⭐⭐)

来源:inbox/jay/2026-10-07-engineering-e1prep.md(Oct 7 · 工程主轴最强棒 · 增量 1)· inbox/jay/2026-10-07-1105-jay-five-category-oct07-afternoon.md(Oct 7 · P1-1)· 原始来源:arXiv:2610.03430(2026)· 未入 paper_cards,待建卡

URL:https://arxiv.org/abs/2610.03430

TLDR(Jay 简报摘要):对抗性后缀使预测长度调度器(以 TRAIL 为例)低估输出长度,从而获得更高调度优先级,完成时间减少 27-46%;vLLM/SGLang/TRAIL 所有使用长度预测的生产调度器受影响;多租户 LLM 服务直接受影响。

要点:

  • 核心问题:LLM 推理系统在生产环境使用"长度预测调度器"来优先处理预估输出较短的请求(以提升吞吐量/降低延迟);JIL Attack 发现对抗性后缀可欺骗长度预测器,使其低估实际输出长度,从而获取不应有的调度优先级——这是一种针对 LLM serving 基础设施的系统性安全攻击
  • 评测创新:首次将"LLM serving 调度器安全"形式化为评测维度——传统评测关注任务准确率,JIL Attack 揭示了调度层面的安全攻击面;完成时间减少 27-46% 意味着在多租户场景下,恶意用户可通过构造对抗性 prompt 优先占用推理资源
  • 受影响范围:vLLM / SGLang / TRAIL 等所有使用长度预测的调度器;多租户 LLM 服务(API 提供商)直接受影响
  • 缓解方案:粗粒度长度分组(将请求按长度区间分组而非精确预测)——但效果待生产环境验证
  • ⚠️ 待核实:完整 TLDR 缺失(摘要级信息);未入 paper_cards,无法交叉验证;缓解方案生产验证状态;受影响版本号和修复进度

与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §1.4 cost-aware 评测基础设施:HAL 测任务侧 cost-efficiency;JIL Attack 揭示调度层面的 cost不公平性——恶意用户通过欺骗调度器获取优先权,破坏 cost-aware 评测的前提假设(请求优先级应与实际计算成本匹配) - 邻接 R93 §2.1 Harness + Judge 累积:JIL Attack 的缓解方案(粗粒度长度分组)与 CUAWright(极简 harness)共同说明——评测基础设施本身存在安全攻击面,harness 评测应包含 adversarial 场景 - 邻接 R93 §2.4 Agent、工具、MCP 与 harness:JIL Attack 与 OpenAI Rogue Agent(2026-10-05 Wikimedia 入侵)共同构成"Agent 基础设施安全"的双层叙事(外层:Agent 行为失控;内层:serving 调度器被攻击) - 建议归入章节:§1.4 垂类高风险场景多阶段多维评测(新增邻接 · JIL Attack 2610.03430 · engineering 主/eval 强邻接 · LLM 调度安全漏洞 · 27-46% 完成时间减少 · ⚠️ 待 paper_card 建卡 + 原文精读确认缓解方案生产验证状态)


增量 3:Selection vs Extraction — Agent 记忆提取优于选择?预注册研究负面结果(2609.34227)— agent 主/eval 副(⭐⭐⭐⭐)

来源:organized/paper_cards/1698-2609-34227.md(Oct 7 入库 · 主分类 agent / 副分类 evaluation / 形态 method)· inbox/tom/2026-10-07T0840-agent-rag-longcontext-radar.md(Oct 7 早 radar 高价值 #1)· work-queue.md(2026-10-07 Top 15 高价值待深度解读)· 原始来源:arXiv:2609.34227

URL:https://arxiv.org/abs/2609.34227

TLDR(原文):Does conversational memory need LLM-extracted facts, or is selecting the right raw turns enough? Published results disagree. Extraction-based systems report gains from distilled facts. Recent studies find raw history with good ranking does as well, but disagree about whether ranking matters. We ran a pre-registered study on held-out LoCoMo conversations and LongMemEval. At a tight budget on LoCoMo, raw turns selected by a single call to Jev, a typed decision model, are non-inferior to an LLM-extraction memory (one-sided 95% bound -3.0 points against a -5-point margin).

要点:

  • 核心问题:对话 Agent 记忆领域长期存在争议——是 LLM 抽取精炼事实(extraction),还是直接选取原始轮次(selection)?已发表结果相互矛盾:extraction 派报告蒸馏事实有增益;ranking 派报告原始历史 + 良好排序效果相当,但 ranking 是否关键仍有分歧
  • 方法贡献:预注册研究(pre-registered study)——在 LoCoMo 对话和 LongMemEval 上对 held-out 数据进行评估;在紧预算下,Jev(typed decision model,单次调用)选取的原始轮次对 LLM 抽取式记忆呈非劣效(单侧 95% 边界 -3.0 百分点,优于 -5 百分点的非劣效边界)
  • 预注册研究的价值:预注册设计使结论更可信——作者在实验前公布假设和方法,避免 p-hacking 和 publication bias;这是 agent 记忆评测方法论的重要进步
  • 与 Jev 的关联:Jev(TypeSafe AI 的 decision model)在本研究中作为 selection 的工具——这与 flyp risk-e1prep 中 JEV Judges(LLM-as-Judge 的替代方案)形成有趣的跨主题呼应:Jev 既可用于记忆选择(Jev 选取原始轮次),也可用于评判(JEV Judges 替代 LLM judge)
  • ⚠️ 待核实:LongMemEval 上的具体结果(非劣效边界是否也成立);Jev 选取 vs LLM extraction 在不同模型规模下的表现差异;预注册研究的结论是否可推广到其他记忆场景(不只是 LoCoMo 客服对话)

与活文档 evaluation.md 现有脉络的关系: - 邻接 R95 §1.3 长程/多 Agent 评测六端点:Agent 记忆评测(extraction vs selection)是长程 Agent 的核心能力维度;R95 的 DyadMem(URAM 用户关系记忆)测关系演化,本研究测记忆形式(抽取 vs 选择)——两者共同构成"长程记忆评测"的双子维度 - 邻接 R93 §1.2 LLM-as-Judge 失效模式:Jev 作为 typed decision model 替代 LLM extraction 或 LLM judge——与 JEV Judges(flyp risk-e1prep)的 96% 错误共现率发现共同说明:Jev 系列方法在评测和应用中有广泛价值,但也存在共享的归纳偏置 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · Selection vs Extraction 2609.34227 · agent 主/eval 副 · 预注册负面结果 · Jev typed decision model 非劣效于 LLM extraction · ⚠️ 待 LongMemEval 结果确认)


增量 4:LMBuild — Agent 构建与评测框架(2610.04292)— eval 邻接(⭐⭐⭐)

来源:inbox/tom/2026-10-07-0900-hf-daily-2026-10-07.md(Oct 7 早棒 · 24▲ #2 顶置新立)· work-queue.md(2026-10-07 Top 15 高价值待深度解读 · #2)· 原始来源:arXiv:2610.04292

URL:https://arxiv.org/abs/2610.04292

TLDR(HF Daily 摘要):[注:TLDR 在来源文件中截断,依据 arXiv 链接和 HF Daily 排序推断]

要点:

  • 定位:HF Daily 2026-10-07 早棒 24▲ #2(仅次于 RealCompanion 250▲),在 15 件立标中排名最高的新入库论文之一——社区关注度高
  • 推测(待原文核实):根据 arXiv 号 2610.04292 和标题格式(LMBuild),以及"Agent 构建与评测"的上下文,推测为 Agent 开发/评测工具链相关——可能是 Scaffold 生成、Agent 构建框架或 Agent 评测自动化工具
  • ⚠️ 重要声明:TLDR 在来源文件中截断,本条目基于 arXiv 号 + 排序推断;引用前必须读原文确认内容,不可基于推断写入 knowledge base
  • ⚠️ 待核实:完整 TLDR;具体贡献(是新的 agent 构建框架?自动化评测工具?两者兼有?);与其他 agent 构建工具(如 LangGraph/CrewAI/AutoGen)的差异化定位

与活文档 evaluation.md 现有脉络的关系: - 邻接 R93 §2.1 Harness + Judge 累积:如果 LMBuild 是 Agent 构建/评测工具,与 CUAWright(极简 harness)和 AgencyBench(user-sim + Docker + rubric 闭环)共同构成"harness 工具链"——从构建到评测的完整工具链 - 建议归入章节:§2.1 Harness + Judge 累积(eval 邻接候选 · LMBuild 2610.04292 · ⚠️ 待原文 TLDR 确认后决定是否升锚 · 不可在 TLDR 确认前写入 knowledge base 核心锚点)


二、值得警惕的矛盾或待核实说法

⚠️ 待核实 1:AgencyBench 的 user-sim 偏差与 rubric 主观性

  • 待核实项:AgencyBench 使用 user simulation agent 提供迭代式反馈,但自动化 user 与真实 user 的"非理性/不完整/对抗"行为可能不一致——这会导致评测结果偏向"听话 agent";双 rubric(视觉 + 功能)的评分一致性也未经充分验证
  • 潜在影响:如果 user-sim 偏差显著,AgencyBench 的 48.4% vs 32.1% 闭源/开源差距数据可能无法推广到真实用户场景
  • 建议:R96/E1 前需原文 PDF/HTML 精读确认 rubric 设计细节和 user-sim prompt 模板
  • 来源:inbox/flyp/2026-10-07-flyP-critical-read-AgencyBench-1M-token-agent-eval.md

⚠️ 待核实 2:JIL Attack 缓解方案的生产验证状态

  • 待核实项:JIL Attack(2610.03430)的缓解方案(粗粒度长度分组)尚无生产环境验证;在 vLLM/SGLang/TRAIL 的最新版本中是否已有修复或缓解措施?
  • 潜在影响:如果主要推理引擎已修复,JIL Attack 的时效性会快速下降;如果未修复,则是需要立即关注的 eval 优先项
  • 建议:第一时间读原文 + 确认 paper_card 建卡 + 跟进 vLLM/SGLang 官方 Changelog
  • 来源:inbox/jay/2026-10-07-engineering-e1prep.md

⚠️ 待核实 3:Selection vs Extraction 在 LongMemEval 上的泛化性

  • 待核实项:本研究在 LoCoMo 紧预算条件下证明 Jev selection 非劣效于 LLM extraction;但在 LongMemEval(更大规模/更复杂场景)上是否成立?Jev 的 typed decision model 在不同任务类型上的泛化性如何?
  • 建议:原文精读后确认 LongMemEval 实验结果
  • 来源:organized/paper_cards/1698-2609-34227.md

⚠️ 待核实 4:LMBuild 完整内容截断,不可引用推断

  • 待核实项:LMBuild(2610.04292)在 HF Daily 早棒中 TLDR 截断;当前条目内容基于 arXiv 号和排序推断,不可作为可信引用来源
  • 建议:立即读取原文确认;如为 eval 相关且有明确贡献,升为邻接锚点;如为 agent 构建工具(非评测),归入 engineering 主轴承引
  • 来源:inbox/tom/2026-10-07-0900-hf-daily-2026-10-07.md

三、本轮无硬凑声明

本轮 eval 主题在 Oct 6 已由 Tail-Influence Sampling + 4DCodeBench + CUAWright 完成了 2 件 eval 主分类 NET-new(R95 锚定后第一轮补充)。Oct 7 eval 相关新增:

  • AgencyBench(2601.11044):eval 主分类 benchmark——1M token 真实世界 Agent 评测——6 能力维度 × 32 场景 × 138 任务——user-sim/Docker/rubric 自动化闭环——flyp 精读 ⭐⭐⭐⭐——有明确 benchmark 贡献,可立项邻接
  • JIL Attack(2610.03430):engineering 主分类,eval 强邻接——LLM 长度预测调度器安全漏洞——27-46% 完成时间减少——eval 邻接级,暂不占 eval 主分类名额
  • Selection vs Extraction(2609.34227):agent 主分类,eval 副分类——预注册负面结果——Jev typed decision model 非劣效于 LLM extraction——eval 副分类邻接,有方法学贡献
  • LMBuild(2610.04292):eval 邻接候选——24▲ HF Daily #2——⚠️ TLDR 截断,不可引用推断内容,待原文确认

无 eval 主分类 paper_card 净增:Oct 7 新入库 paper_cards(1694-1698)中无 eval 主分类;AgencyBench(2601.11044)不在 paper_cards 中(flyp 精读覆盖);R95 锚定的 eval 范式骨架稳固(工程垂类层级化 + 奖励分类法 + 长程六端点 + 媒介端点双重化),今日增量落在长程 agent 评测与 LLM 调度安全评测两个新子方向。


四、可引用的 arXiv 号列表

arXiv 号 标题 主/邻 状态
2601.11044v4 AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts eval 主/benchmark 🆕 本轮新增锚点候选(1M token 真实世界 Agent 评测 · flyp 精读 ⭐⭐⭐⭐ · 仍待 paper_card 建卡)
2610.03430 JIL Attack: 利用长度预测干扰 LLM 调度 engineering 主/eval 强邻接 🆕 本轮新增邻接候选(LLM 调度安全 · ⚠️ 待 paper_card 建卡 + 原文确认)
2609.34227 When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model agent 主/eval 副 🆕 本轮新增邻接候选(预注册负面结果 · Jev 非劣效于 LLM extraction)
2610.04292 LMBuild eval 邻接候选 🆕 本轮候选(TLDR 截断 · ⚠️ 不可引用推断内容 · 待原文确认)
2609.38096 Tail-Influence Sampling for CVaR Policy Evaluation eval 主/method Oct 6 E1 prep 已锚定
2610.03715 4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes eval 主/benchmark Oct 6 E1 prep 已锚定
2610.04116 CUAWright: A Minimal Unified Interface for Digital Agents agent 主/eval 副 Oct 6 E1 prep 已锚定
2610.02304 SimuVerity: Engineering-Grade Simulink Model Generation Benchmark eval 主 R95 已锚定
2609.39071 LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models eval 主 R95 已锚定
2610.03020 DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users agent 主/eval 副 R95 已锚定
2609.26777 SWE-Serve: Production-Grade Inference Engineering Benchmark llm-infra 主/eval 邻 R95 已锚定
2610.03632 World Embedding Benchmark multimodal 主/rag 副 R95 已锚定
2610.03421 CLIMB: Confidence-Guided Multimodal RAG with Complementary Evidence rag 主/multimodal 副 R95 已锚定
2610.03136 Reasoning-Language Alignment in Monolingual RAG rag 主/risk 副 R95 已锚定
2601.11044 AgencyBench (旧版引用) eval 主/benchmark flyp 10-7 精读 ⭐⭐⭐⭐
2609.29769v2 JEV vs. LLMs as Rubric Judges: Cheaper, Faster, and Wrong in the Same Places eval 主/risk 副 flyp 10-6 risk-e1prep 已锚定(96% 错误共现率 + Cascade 失败)
2602.06176 LLM Reasoning Failures 主 reasoning 副 risk flyp 10-6 risk-e1prep 已锚定
2604.15149 LLMs Gaming Verifiers: RLVR Can Lead to Reward Hacking 主 rl 副 risk flyp 10-6 risk-e1prep 已锚定
2607.02869 Reward Granularity in RLVR: Process vs Outcome 主 rl 副 risk flyp 10-6 risk-e1prep 已锚定
2606.11470v1 The Periodic Table of LLM Reasoning 主 reasoning 副 risk flyp 10-6 risk-e1prep 已锚定
2605.30104 SEAL: LLM-as-Meta-Judge 副分类 eval R93 已锚定
2510.11977 HAL: Holistic Agent Leaderboard 邻接 eval R93 已锚定
2606.05670 BenchAgent: Protocol-Aligned Agent Workflow Evaluation 邻接 eval R93 已锚定
2610.01428 SAGO: Generalization Is Stability 主分类 eval R93 已锚定
2609.00559 PhysVista: Benchmarking Physical Intelligence in VLMs 主分类 eval R93 已锚定
2609.32810 OpenTumorBoard: Multidisciplinary Tumor Board Discussion 主分类 eval R93 已锚定
2609.38137 LongHarness Bench 邻接 eval R93 已锚定

Tom · 2026-10-07 15:40 CST · evaluation · E1 预消化轮 · inbox/tom/2026-10-07-evaluation-e1prep.md