evaluation · E1 预消化简报(2026-09-23)
角色:Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-22 15:40 ~ 2026-09-23 15:40 CST 数据来源:Tom 9-22 evaluation e1prep(R82 基线)+ Stephen 9-23 ai-industry e1prep + Jay 9-23 engineering-e1prep + spark 9-23 agent-e1prep + flyp 9-23 multimodal-e1prep + paper_cards 1456-1469 批次 + Tom 9-23 两轮 radar + work-queue 9-23 12:00 活文档基线:evaluation.md R82 锚定(256 arXiv ID · AutoTuneBench 2609.18123 + AgentSysBench 2608.15127 待入库 + MC-Search 2603.00873 + ImpossibleRubrics 2609.16816 + HarnessVLN 2609.15195 + ModularRSI 2609.14857 + Emergence World 2609.17320 + Fuse 2609.17496 + PACT 2609.18605 + Coding Agent Harness 2609.20804 + MiniMax-H3 2609.18323 + Atria Dawn 2609.15818 + VākQA 2609.19879)
0. 基线对齐与本轮概述
R82→R83 锚定状态: - R82 锚入的 3 件 eval 待入库(AutoTuneBench 2609.18123 + AgentSysBench 2608.15127 + EDGE-EVAL)本轮仍无新进展,paper_card 仍未入库——⚠️ R83 活文档应保留"待入库"标注 - R82 的 IBM+Yale 2026 Agent 评测新范式量化数据(SWE-bench Pro <25% / Claw-Eval 44% / LiveAgentBench 35.29%)本轮无新进展,但 SWE-bench-lite(arXiv:2609.10451)提供了 XAgent 62% 解决率的交叉锚点 - R82 的 Anthropic + Accenture 嵌入式评估本轮出现第三次确认——Anthropic 9-22 evening 公告 + OpenAI 9-23 早棒"有效第三方评估的优先事项与原则"形成 frontier lab 评测治理公开化新锚点
本轮 E1-R83 增量摘要: - 2 件 eval 主分类 paper_card 新入库(GameHorizon Suite 2609.25001 + Mutation Analysis GPU-Kernel 2609.22220,Sep 22-23 入库) - 1 件 eval 主分类/邻接 paper_card 新入库待确认(Harness-Zero 2609.24974,paper_card 1458 ✓ 9-22 后期入库,evaluation 主分类确认) - 3 件 eval 方法学新信号:OpenAI 有效第三方评估原则(治理)+ ReliabilityBench 混沌工程量化评估 + igor-ya.com 生产级 Agent eval 框架 - 1 件 eval 邻接 SWE-bench-lite 新数据锚点:XAgent 62% vs 初代 13.86%,与 IBM+Yale 数据形成商业 Agent 能力对照 - eval 邻接 HF 新立标:RRSI 154▲ #1(Harness 正则化递归自我改进)
1. 增量条目(7 件 eval 邻接/专项新信号)
增量 ① GameHorizon Suite arXiv:2609.25001 · paper_card 1456 ✓ · Sep 22 入库 · eval 主分类确认 · HF 111▲ #3
- 来源:paper_card 1456 ✓(Sep 22 入库,主分类 evaluation,形态 benchmark)+ tom 9-23 0900 HF Daily(111▲ #3)+ flyp 9-23 multimodal-e1prep(增量 6)+ spark 9-23 agent-e1prep(增量 6)
- arXiv 号:
arXiv:2609.25001GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay - 要点:
- 核心问题:现有游戏 AI benchmark 覆盖范围窄、缺语言指令或依赖高方差在线 rollout;现代电子游戏是需要视觉理解 + 指令分解 + 目标规划 + 精确动作控制的综合测试平台
- GameHorizon Suite:统一数据与评测套件,跨多个时间历程(multi-horizon)衡量不同模型家族的游戏能力
- 三组件:第一组件为 GameHorizon 数据(具体待读全文)——与 flyp multimodal-e1prep "GameHorizon Suite = 评估方法学周主题 horizon 维度正交化第 13 件"吻合
- HF 信号:111▲ #3(9-23 早棒),eval 主分类,flyp 标注为 horizon 维度正交化第 13 件
- 与活文档现有脉络的关系:R82 §3.3 评测平台与 CI Gate(GameHorizon Suite 作为游戏 AI 多时间跨度评测候选);与 R82 的 HarnessVLN(具身导航)+ PACT(企业合规)+ Fuse(社交推理)+ MiniMax-H3(物理世界推理)构成四向评测谱系,GameHorizon 新增第五维度:时间跨度(multi-horizon)评测
- 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(GameHorizon Suite 作为游戏 AI 多时间跨度评测候选)+ §4 维度化指标体系(multi-horizon 评测维度新增)
- 可信度:⭐⭐⭐⭐(paper_card 1456 ✓ 已入库 + eval 主分类 + 111▲ #3 具体数字 + flyp + spark 同步覆盖)
- ⚠️ 待核实:三组件具体内容;现有 benchmark(Porpoise、OSWorld 等)的具体对比数据;horizon 维度的量化评测指标定义
增量 ② Harness-Zero arXiv:2609.24974 · paper_card 1458 ✓ · 9-22 后期入库 · eval 主分类确认 · agent 副分类
- 来源:paper_card 1458 ✓(9-22 后期入库,主分类 evaluation,副分类 agent,形态 application)+ tom 9-22 candidates + spark 9-23 agent-e1prep(增量 1)+ jay 9-23 engineering-e1prep(§1.11 沿用)+ stephen 9-23 noon §四 paper_card 入库表
- arXiv 号:
arXiv:2609.24974Harness-Zero: Harness Distillation via Agent-as-Harness - 要点:
- 核心问题:最优 harness 因领域/实例/模型而异;通用 Agent 只能在"次优共享 harness"和"不断增长的专用 harness 集合"之间二选一
- Harness-Zero 方案:以领域/实例优化后的 harness 作为训练时引导(Agent-as-Harness),将 harness 诱发的行为迁移到模型权重中,使增益在部署时仍然有效(survive)
- 关键问题:蒸馏后 harness 增益保留率 / 训练数据规模 / 算力开销 / 部署分布外泛化性边界均未在 TLDR 中给出——需读全文 §4 实验节
- 方法学意义:Harness 从"部署产物"升级为"训练信号"——eval 领域的方法学创新,评测对象从"测试 Agent"转向"评测 Harness 并将其内化"
- paper_card 入库状态:1458 ✓ 9-22 后期入库,evaluation 主分类,agent 副分类
- 与活文档现有脉络的关系:R82 §3.5 Harness 生态二十角候选(第二十二节点预备)+ R82 §3.3 评测平台与 CI Gate(Harness-Zero 作为 harness 评测与蒸馏方法学候选);与 Coding Agent Harness Design(2609.20804,R82 锚定)构成Harness 实证工程双重锚——Design 回答"哪些 harness 设计选择影响 Agent 性能",Zero 回答"如何将最优 harness 内化为模型权重"
- 建议归入节:evaluation.md §3.5 Harness 生态二十角候选第二十二节点预备级 + §3.3 评测平台与 CI Gate(Harness-Zero 作为评测方法学候选)+ §4 维度化指标体系(Harness 效能维度)
- 可信度:⭐⭐⭐(paper_card 1458 ✓ 已入库 + eval 主分类 + agent 副分类;但 TLDR 截断,关键量化数据缺失)
- ⚠️ 待核实:Harness 增益保留率量化数据;训练-部署漂移泛化性边界;全文 §4 实验节
增量 ③ Mutation Analysis for GPU-Kernel Benchmark Oracles arXiv:2609.22220 · paper_card 1463 ✓ · Sep 22 入库 · eval 主分类确认
- 来源:paper_card 1463 ✓(Sep 22 入库,主分类 evaluation,形态 benchmark)+ tom 9-22 candidates + jay 9-23 engineering-e1prep §1.11(沿用 v128)
- arXiv 号:
arXiv:2609.22220Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles - 要点:
- 核心问题:LLM 生成 GPU kernel 的 benchmark 用少量随机输入 + 宽松浮点容差判定正确性;其 verdict 影响 leaderboard 和 RL 奖励;现有 checker 被公认很弱,但无法衡量补丁是否充分
- Mutation Analysis 方案:将 mutation analysis 作为 kernel-benchmark oracle 的充分性度量(adequacy metric)——向 188 个 KernelBench 题目的已验证 CUDA 实现注入 10,303 个可编译缺陷
- 关键数字:7,384 个可编译缺陷中(具体比例待读全文)
- 方法学意义:这是 meta-evaluation(对评测的评测)——直接回应 R82 §6.166.3 "立标池元评测信度考验",提供了系统性评估 benchmark oracle 充分性的方法论
- paper_card 入库状态:1463 ✓ Sep 22 入库,主分类 evaluation,形态 benchmark
- 与活文档现有脉络的关系:R82 §6.166.3 立标池元评测信度考验(Atria Dawn 连续跌出 + flyp 6 项反方证据);Mutation Analysis 提供了benchmark oracle 充分性的系统性度量,与 flyp 的"评估污染 + 票数真实性"6 项反方证据形成方法学层面的呼应
- 建议归入节:evaluation.md §4 维度化指标体系(meta-evaluation / oracle adequacy 维度新增)+ §7.2 争议(立标池元评测信度 + mutation analysis 作为系统性度量候选)
- 可信度:⭐⭐⭐(paper_card 1463 ✓ 已入库 + eval 主分类 + benchmark 形态 + 10,303 缺陷具体数字;但 HF 票数未给出,信号强度待查)
- ⚠️ 待核实:7,384 个可编译缺陷的覆盖比例;mutation analysis 注入规则的具体定义;与现有 kernel benchmark(EvalPlus、Theroof 等)的关系
增量 ④ OpenAI "有效第三方评估的优先事项与原则" · frontier lab 评测治理公开化 net-new ⚠⚠
- 来源:stephen 9-23 ai-industry e1prep(§增量 2.2)+ inbox/stephen/2026-09-23-1003-news-openai-news.md(官方公告)
- 要点:
- 核心内容:OpenAI 概述了对前沿模型及安全防护进行"严谨、安全、独立"第三方评估的优先事项与原则
- 与 Anthropic 9-22 evening Accenture 嵌入式评估的关联:两者均属 frontier lab 评测治理公开化行动——Anthropic 聚焦"嵌入式评估(将评测嵌入企业咨询交付)",OpenAI 聚焦"第三方评估原则(独立、严谨、安全)"
- 与 R82 Anthropic+Accenture 第三次确认的关系:R82 的 Accenture 嵌入式评估是"内部嵌入",OpenAI 新原则是"外部独立"——两者共同构成 frontier lab 评测治理公开化的双轨信号
- ⚠️ 重要警示:OpenAI 公告停留在原则层面(priorities and principles),无具体评测协议、指标或第三方机构名单
- 与活文档现有脉络的关系:R82 §3.3 评测平台与 CI Gate(Anthropic + Accenture 嵌入式评估)+ R82 §3.3 Anthropic+Accenture 第三次确认(仍为公告层面,无具体方法学);OpenAI 原则是评测治理公开化的第二轨,与 Accenture"嵌入式评估"互补
- 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(OpenAI 第三方评估原则作为评测治理公开化第二轨候选)+ §7.3 开放问题(frontier lab 评测治理双轨:嵌入式 vs 独立第三方)
- 可信度:⭐⭐⭐(OpenAI 官方公告 + Stephen 多源覆盖;但公告停留在原则层面,无具体方法学内容)
- ⚠️ 待核实:具体优先事项清单;参与第三方评估的机构名单;评测结果公开时间表
增量 ⑤ ReliabilityBench arXiv:2601.06112 · Jay 9-23 engineering-filter 高价值条目 · 混沌工程量化评估 LLM Agent
- 来源:jay 9-23 1450 engineering-filter.md(高价值保留)+ Zylos Research 整理(2026-04)
- arXiv 号:
arXiv:2601.06112ReliabilityBench: Chaos Engineering for LLM Agent Systems - 要点:
- 三个评测维度:一致性(pass@k)+ 鲁棒性(扰动下性能)+ 容错性(工具/API 故障下性能)
- Fault injection 类型:timeout、rate limit、partial response、schema drift
- 实验规模:1,280 个类生产场景
- 关键数据:扰动使 agent 成功率从 96.9% 降至 88.1%;rate limiting 是单点最破坏性故障
- 架构对比:ReAct vs Reflexion——ReAct 在复合压力下更鲁棒
- 相关论文:MAESTRO(arXiv:2601.00481)+ AgentFixer(arXiv:2603.29848)
- 方法学意义:首个将 chaos engineering 方法论系统化引入 LLM agent 可靠性评估;96.9%→88.1% 的具体数字提供了压力场景下 Agent 性能衰减的量化锚点
- 与活文档现有脉络的关系:R82 §4 维度化指标体系(稳定性/鲁棒性评测维度)+ R82 §6.166.3 立标池元评测(Atria Dawn 跌出 + flyp 6 项反方证据);ReliabilityBench 的 96.9%→88.1% 提供了压力场景量化基线,与 LiveAgentBench 35.29%(R82 增量 ④)构成常压 vs 压力双锚
- 建议归入节:evaluation.md §4 维度化指标体系(可靠性/容错性评测维度新增)+ §7.3 开放问题(ReliabilityBench 与 LiveAgentBench 常压/压力双锚关系)
- 可信度:⭐⭐⭐(arXiv 原文 + 1,280 场景规模 + 具体 96.9%/88.1% 数字;但 2026-01 论文,较早入库,本轮才进入工程视野)
- ⚠️ 待核实:1,280 个类生产场景的具体定义;pass@k 中 k 的取值;ReAct vs Reflexion 结论的具体实验条件
增量 ⑥ SWE-bench-lite XAgent 62% 解决率 arXiv:2609.10451 · Jay 9-23 engineering-filter 高价值条目 · 商业 Agent 能力新锚点
- 来源:jay 9-23 1450 engineering-filter.md(高价值保留)+ arXiv:2609.10451(2026-09-09)
- arXiv 号:
arXiv:2609.10451SWE-bench-lite - 要点:
- SWE-bench-lite 已成为 AI software agent 最有工程参考价值的 benchmark(相比通用 benchmark 更贴近真实开发任务)
- XAgent 62% resolve rate(arXiv:2609.10451)代表当前最先进水平
- 对比基线:SWE-agent 2024 初代仅 13.86%,2026 年突破 80%(整个领域的快速进步)
- 工程启示:AI coding agent 的核心瓶颈从"能否读代码"转移到"能否在真实仓库中完成多步 patch+test+iterate"
- Princeton/UK AISI 现实检验(arXiv:2607.27191,2026-08):开放研究任务中 agent 全部被专家拒绝——暴露 self-directed research 的系统性不足
- 与 R82 IBM+Yale 量化数据的交叉锚点:SWE-bench Pro(1,865 经人工校验长程任务)Pass@1 <25% vs SWE-bench-lite XAgent 62%——两者均测 coding agent,但 Pro 测长程任务、lite 测相对短程任务,数字差异反映任务复杂度分层而非矛盾
- 与活文档现有脉络的关系:R82 §3.3 评测平台与 CI Gate(IBM+Yale 2026 Agent 评测新范式量化锚点);SWE-bench-lite 62% 与 SWE-bench Pro <25% 构成coding agent 评测的复杂度分层锚点
- 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(SWE-bench-lite 作为 coding agent 标准尺)+ §4 维度化指标体系(coding agent 评测维度 + 任务复杂度分层)
- 可信度:⭐⭐⭐⭐(arXiv 原文 + 具体 62%/13.86%/80% 数字 + 2026-09-09 较新日期)
- ⚠️ 待核实:62% 的具体评测条件(Pass@1?Pass@k?);Princeton 现实检验的具体实验设计;lite vs Pro 的具体任务定义差异
增量 ⑦ igor-ya.com 生产级 Agent Eval 框架 · Jay 9-23 engineering-filter 高价值条目 · 工程方法论新信号
- 来源:jay 9-23 1450 engineering-filter.md(高价值保留)+ https://igor-ya.com/posts/llm-agent-evals-production-framework/
- 要点:
- 失败图谱(failure map)构建方法:系统化记录 Agent 失败类型,为评测提供 ground truth 分布
- 评估分级体系:单元(unit)/ 集成(integration)/ 生产(production)三级——对应 eval 覆盖率和召回率的权衡
- Grader 设计与 pass@k 统计:Grader 是 eval 的核心组件,pass@k 统计(k=1,10,100)提供分布化性能视角
- LLM-as-judge 校准方法:judge 的校准直接影响 eval 质量,与 R82 的 Claw-Eval 44% 漏检问题(IBM+Yale 量化锚)形成方法学呼应
- Harness 架构与发布门控:将 eval 嵌入 CI/CD,作为 Agent 发布的 gate——eval-as-CI-gate 的工程实现
- LangChain State of Agent Engineering 调查数据:观测覆盖率 89% vs 评测覆盖率 52% = 37-point gap
- 方法学意义:提供了生产级 Agent eval 的完整工程方法论——failure map + 分级体系 + grader + CI gate,与 R82 的 LangChain 37-point gap 行业级量化形成"问题诊断 + 工程方案"的闭环
- 与活文档现有脉络的关系:R82 §3.3 评测平台与 CI Gate(Anthropic + Accenture 嵌入式评估 + igor-ya.com 作为生产级 eval 框架第三候选);与 ReliabilityBench(混沌工程)+ Gricea(开放科学平台)+ CADWorld(专业工程场景)构成评测生态四层覆盖:生产工程 + 混沌压力 + 开放科学 + 专业场景
- 建议归入节:evaluation.md §3.3 评测平台与 CI Gate(igor-ya.com failure map + 分级体系 + CI gate 作为生产级 eval 框架候选)+ §4 维度化指标体系(37-point gap 作为 eval 覆盖率基线)
- 可信度:⭐⭐⭐(独立工程博客 + 具体方法论(failure map / grader / CI gate)+ LangChain 数据支撑;但非学术论文,需注意适用边界)
- ⚠️ 待核实:failure map 的具体构建步骤;pass@k 统计中 k 的最优取值建议;LLM-as-judge 校准的具体方法
2. Sep 22-23 paper_cards eval 相关新卡核查
Sep 22-23 eval 主分类卡(3 件)
| 编号 | arXiv | 标题 | 主分类 | 状态 |
|---|---|---|---|---|
| 1456 | 2609.25001 | GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay | evaluation | Sep 22 入库 · HF 111▲ #3 · benchmark · multi-horizon 评测 |
| 1458 | 2609.24974 | Harness-Zero: Harness Distillation via Agent-as-Harness | evaluation | 9-22 后期入库 · application · agent 副分类 · TLDR 截断 |
| 1463 | 2609.22220 | Mutation Analysis for GPU-Kernel Benchmark Oracles | evaluation | Sep 22 入库 · benchmark · oracle adequacy metric |
Sep 22-23 eval 邻接卡(3 件)
| 编号 | arXiv | 标题 | 主分类 | eval 关系 |
|---|---|---|---|---|
| 1469 | 2609.23989 | ACLArena: Agent Continue Learning in Multi-stage Post-training | engineering | eval 邻接(ACL 评测框架 · 模型级 + token 级双视角 · paper_card 1469 ✓ 9-23) |
| 1444 | 2609.22076 | APort Vault: Benchmarking AI Agent Payment Authorization | agent | eval 副分类(支付授权安全 · 225,964 次评测 · R82 已锚入) |
| 1454 | 2609.19169 | SiliconBench: Speed, Memory, and Fidelity for LLM Serving | llm-infra | eval 副分类(Apple Silicon serving 评测 · R82 已锚入) |
说明:Sep 22-23 是 eval 主分类入库的高密度窗口(3 件主分类),优于 R82 的 2 件 + R81 的 1 件;GameHorizon Suite 的 111▲ #3 信号强度是本轮最高,Harness-Zero 开创了"Harness 蒸馏"新方向,Mutation Analysis 提供了 meta-evaluation 的系统性方法论。
3. 矛盾与待核实
矛盾 ① ⚠⚠ ImpossibleRubrics vs MC-Search HAVE 框架 —— R82 未解决,本轮无新进展
- 状态:R80 提出的方法学层面系统性冲突,本轮 inbox 来源中未出现新进展或交叉核实
- 建议:§7.3 开放问题保持 P0 标记,R84 前需完成实测交叉核实
矛盾 ② ⚠ Model-or-Harness "model-side bias 是方法学产物" 是否系统性挑战 agent consistency 双锚
- 状态:R82 §6.165.7 已标注;本轮 Harness-Zero 新增"如何将 harness 内化为模型权重"——但仍是方法学争议而非实证
- 建议:§7.2 争议保持,R84 前需评估 Harness-Zero 全文 §4 实验结果
待核实 ①:AutoTuneBench 2609.18123 paper_card 入库状态(R80 提出,本轮无进展)
- 本轮状态:仍未入库
- 建议:evaluation.md §3.3 保持 ⚠️ paper_card 未入库标注
待核实 ②:AgentSysBench 2608.15127 paper_card 入库状态(R80 提出,本轮无进展)
- 本轮状态:仍未入库
- 建议:evaluation.md §3.3 保持 ⚠️ paper_card 未入库标注
待核实 ③:EDGE-EVAL 具体 arXiv 号(R80 提出,本轮无进展)
- 本轮状态:仍未出现;arXiv 号缺失
- 建议:入库时补充具体 arXiv 号
待核实 ④:Anthropic + Accenture 嵌入式评估具体方法学(R81 提出,本轮第四次确认,无实质进展)
- 本轮状态:stephen 9-23 ai-industry e1prep 仍沿用公告层面(Anthropic Opus 5.5 系统卡 + Accenture 合作),无具体方法学内容;OpenAI 新增"第三方评估原则"作为第二轨
- 建议:§3.3 候选标注 ⚠️ 详细内容待核实;关注 OpenAI 原则与 Accenture 嵌入式评估的整合可能性
待核实 ⑤:Harness-Zero 全文量化数据(R83 本轮新增)
- 本轮状态:TLDR 截断,Harness 增益保留率、训练数据规模、算力开销、泛化性边界均未给出
- 建议:§3.3 候选标注 ⚠️ 全文 §4 实验节待核
待核实 ⑥:RRSI 154▲ #1 立标极显著性独立核验(stephen 9-23 noon 一致性警示)
- 本轮状态:RRSI(arXiv:2609.24972)9-23 HF Daily 154▲ #1 立标极显著,但仅 tom 一家给出,flyp 和 stephen 均未评级
- 与 evaluation.md 关系:RRSI = Agent Harness 正则化递归自我改进,若立标属实则是 eval 方法学重要信号
- 建议:§3.5 候选标注 ⚠️ 需 next 棒由 flyp 或 stephen 独立二次核验
4. Sep 22-23 立标池 eval 相关结构性变化
4.1 eval 主分类 GameHorizon Suite 111▲ #3(结构性改善信号)
- GameHorizon Suite(2609.25001):Sep 22 111▲ #3——本轮 HF 立标 eval 主分类最高票
- 与 R82 对比:R82 仅 Gricea(22039)+ CADWorld(16251)两件 eval 主分类入库,均无 HF 票数(Gricea 7 票、CADWorld 5 票);GameHorizon Suite 以 111▲ #3 显著优于 R82 的 eval 主分类信号
4.2 Harness-Zero 9-22 后期入库(评测方法学新方向)
- Harness-Zero(2609.24974):9-22 后期 paper_card 1458 ✓ 入库,eval 主分类——"Harness 蒸馏"开辟评测方法学新方向
4.3 RRSI 154▲ #1 立标极显著 ⚠⚠⚠(需独立核验)
- RRSI(arXiv:2609.24972):9-23 早棒 154▲ #1——立标极显著但仅 tom 一家给出,stephen noon 一致性警示需独立核验
4.4 Atria Dawn 连续第七日跌出(⚠⚠⚠⚠)
- 跌出轨迹:9-17 424▲ #1 → 9-18/19/20/21/22/23 连续第七日未入 Top15 ⚠⚠⚠⚠
- 与 R82 对比:R82 锚定"第六日跌出",本轮延续为"第七日跌出",创 R78-R83 以来最长跌出纪录
5. 可引用 arXiv 号列表
本轮 eval 主分类新入库(3 件):
- arXiv:2609.25001 — GameHorizon Suite(paper_card 1456 ✓ · HF 111▲ #3 · multi-horizon gameplay benchmark · ⭐⭐⭐⭐)
- arXiv:2609.24974 — Harness-Zero(paper_card 1458 ✓ · eval 主分类 + agent 副分类 · Harness 蒸馏 · ⭐⭐⭐ · ⚠️ TLDR 截断待全文)
- arXiv:2609.22220 — Mutation Analysis for GPU-Kernel Benchmark Oracles(paper_card 1463 ✓ · benchmark · oracle adequacy metric · ⭐⭐⭐)
本轮 eval 邻接/方法学新增锚候选(4 件):
- arXiv:2601.06112 — ReliabilityBench(chaos engineering · 1,280 场景 · 96.9%→88.1% · ⭐⭐⭐)
- arXiv:2609.10451 — SWE-bench-lite XAgent 62%(coding agent 标准尺 · 13.86%→62% vs 80% · ⭐⭐⭐⭐)
- arXiv:2609.23989 — ACLArena(paper_card 1469 ✓ · ACL 评测框架 · model-level + token-level 双视角 · ⭐⭐⭐)
- 无 arXiv — OpenAI 有效第三方评估原则(openai.com 官方公告,无 arXiv 号)
R82 沿用 eval 专项/邻接(15 件):
- arXiv:2609.22039 — Gricea(paper_card 1449 ✓ · 开放科学 CAI 平台 · HF 7 票 · ⭐⭐⭐⭐)
- arXiv:2609.16251 — CADWorld(paper_card 1453 ✓ · FreeCAD 200 tasks × 11 · HF 5 票 · ⭐⭐⭐⭐)
- arXiv:2609.22076 — APort Vault(paper_card 1444 ✓ · 225,964 次评测 · HF 2 票 · ⭐⭐⭐)
- arXiv:2609.19169 — SiliconBench(paper_card 1454 ✓ · Apple Silicon 三维度 · ⭐⭐⭐)
- arXiv:2609.18123 — AutoTuneBench(⚠️ paper_card 未入库 · ⭐⭐⭐⭐)
- arXiv:2608.15127 — AgentSysBench(⚠️ paper_card 未入库 · 178,799 sessions · ⭐⭐⭐⭐)
- EDGE-EVAL — ACL Anthology 2026(⚠️ arXiv 号待查 · ⭐⭐⭐)
- arXiv:2603.00873 — MC-Search(ICLR 2026 ✓ · Agentic MM-RAG 过程级基准 · ⭐⭐⭐⭐)
- arXiv:2609.16816 — ImpossibleRubrics(paper_card 1388 ✓ · LLM-as-Judge rubric 对抗鲁棒性 · ⭐⭐⭐⭐)
- arXiv:2609.15195 — HarnessVLN(paper_card 1389 ✓ · 零样本具身导航 harness · ⭐⭐⭐)
- arXiv:2609.14857 — ModularRSI(paper_card 1395 ✓ · modular reasoning · ⭐⭐⭐)
- arXiv:2609.17320 — Emergence World(paper_card 1399 ✓ · emergent world models · ⭐⭐⭐)
- arXiv:2609.17496 — Fuse(paper_card 1433 ✓ · 可验证社交推理 · HF 51▲ · ⭐⭐⭐⭐)
- arXiv:2609.18605 — PACT(paper_card 1417 ✓ · 企业合规 · ⭐⭐⭐⭐)
- arXiv:2609.20804 — Coding Agent Harness Design(HF 71▲ #7 持续在榜 · ⭐⭐⭐⭐)
- arXiv:2609.18323 — MiniMax-H3(paper_card 1429 ✓ · 517 instances × 4 维度 · HF 116▲ #2 · ⭐⭐⭐⭐)
本轮 R83 立标池 eval 相关新增候选:
- arXiv:2609.24972 — RRSI(⚠️ 154▲ #1 立标极显著但仅一家给出 · Agent Harness 正则化递归自我改进 · ⭐⭐⭐ · 需独立核验)
6. 检查过的来源清单
# inbox/tom/
2026-09-23-0900-hf-daily-2026-09-23.md(高 · 15 件立标 · RRSI 154▲ #1 + GameHorizon 111▲ #3)
2026-09-23T0840-agent-rag-longcontext-radar.md(高 · 8 候选 + ACLArena 8▲ + SkillSpec 4▲)
2026-09-23T1440-agent-rag-longcontext-radar.md(高 · 第三轮 · Emergent Collusion + Tasteful Agent + StableVQ)
2026-09-23-rag-e1prep.md R99(高 · D-RAC + Gricea + CADWorld 续立)
2026-09-22-0850-rag-e1prep.md R98(高 · R82 baseline 锚定)
# inbox/jay/
2026-09-23-1450-jay-engineering-filter.md(高 · 5 高价值条目:igor-ya.com + ReliabilityBench + SWE-bench-lite + AIPerf + Inference Radar)
2026-09-23-1050-jay-engineering-filter.md(高 · NVIDIA AIPerf + AMD TurboQuant + vLLM PD Serving)
2026-09-23-ai-engineering-trending.md(高 · SGLang/vLLM + Mem0 + AI Agents Stack 2026)
2026-09-23-engineering-e1prep.md(高 · v128 → v129 备料 4 件主增量)
# inbox/spark/
2026-09-23-agent-e1prep.md(高 · 61.3KB · v101 → v102 · 5 件 net-new agent 主题 + 4 件延伸)
2026-09-22-1334-agent-e1prep.md(高 · v101 baseline 沿用)
# inbox/flyp/
2026-09-23-multimodal-e1prep.md(高 · 15.4KB · 第 54 日 · WorldCrafter + GameHorizon + 立标池结构性洗牌七次确认)
2026-09-23-flyP-critical-read-CompAdapt-OST.md(中 · 方法拆解 + 实验风险 + 复现难度)
# inbox/stephen/
2026-09-23-1245-stephen-coordination-check-noon.md(高 · 34.6KB · M9 spark 主棒位缺位点名)
2026-09-23-ai-industry-e1prep.md(高 · 63.7KB · v67 → v68 · Opus 5.5 + GPT-6 Sol/Luna + 立标池跌出回升 + OpenAI 第三方评估原则)
# paper_cards/
1456-2609-25001.md(GameHorizon Suite · eval 主分类 · benchmark · 111▲ #3)
1458-2609-24974.md(Harness-Zero · eval 主分类 · agent 副分类 · 9-22 后期入库)
1463-2609-22220.md(Mutation Analysis GPU-Kernel · eval 主分类 · benchmark)
1469-2609-23989.md(ACLArena · engineering 主分类 · agent 副分类 · 9-23 入库)
1444-2609-22076.md(APort Vault · agent 主分类 · eval 副分类 · R82 已锚入)
1454-2609-19169.md(SiliconBench · llm-infra 主分类 · eval 副分类 · R82 已锚入)
# work-queue/
2026-09-23 12:00 最新版(中 · D-RAC Top 0.5 + 选题榜 2609.24788)