evaluation · E1 预消化简报(2026-09-25)
角色:Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 2026-09-24 15:40 ~ 2026-09-25 15:40 CST 数据来源:Tom 9-24 evaluation e1prep(R84 基线)+ Jay 9-25 engineering e1prep + Jay 9-25T1335 trending substack + Jay 9-25T0820 csdn/rag/highvalue + jay 9-24T1450 engineering-filter + Tom 9-25 0840 radar + Tom 9-25 1440 radar + Tom 9-25 hf-daily + paper_cards Sep 24-25 新入库批次 + work-queue 9-25 10:00 活文档基线:evaluation.md R84 锚定(JEV-as-a-Judge 2609.26550 + Agensh 2609.26781 + Tri-PvP 2609.06011 + NVIDIA Agent Eval + GameHorizon Suite 2609.25001 + Harness-Zero 2609.24974 + Mutation Analysis 2609.22220 + ACLArena 2609.23989 + Gricea 2609.22039 + CADWorld 2609.16251 + APort Vault 2609.22076 + SiliconBench 2609.19169 + SWE-bench-lite 2609.10451 + ReliabilityBench 2601.06112 + AutoTuneBench 2609.18123 ⚠paper_card 未入库 + AgentSysBench 2608.15127 ⚠paper_card 未入库 + EDGE-EVAL ⚠arXiv号待查)
0. 基线对齐与本轮概述
R84→R85 锚定状态: - R84 锚入的 3 件 eval 待入库(AutoTuneBench 2609.18123 + AgentSysBench 2608.15127 + EDGE-EVAL)本轮仍无新进展 - R84 锚入的 JEV-as-a-Judge(2609.26550)本轮 HF 票数升至 26▲,是 eval 主分类在榜第三天,信号持续稳定 - R84 锚入的 Agensh(2609.26781)和 Tri-PvP(2609.06011)本轮无状态更新 - ImpossibleRubrics vs MC-Search HAVE 框架矛盾本轮无新进展,保持 P0 开放问题标记 - JEV-as-a-Judge 置信度路由与 Harness-Zero 蒸馏构成"评测成本优化双锚"——R85 延续 R84 关键判定方向
本轮 E1-R85 增量摘要: - 3 件 eval 主分类 paper_card 新入库(Calibration 2609.26489 + FLEET 2609.27657 + StudentBench 2609.28470,Sep 25 当日入库) - 1 件 eval 邻接 paper_card 新入库(Model or Harness 2607.28802,Sep 25 前已在库但 Jay engineering e1prep 标记为 eval 高价值) - 1 件 eval 邻接 Substack 新信号(AI Evaluation Digest May 2026 · BenchGuard + EvalAgent + GroupMemBench) - 1 件 eval 邻接工程发现(GPT-5.6 Astra vs Qwen3.8 Max:同一 benchmark 不同 harness 表现差异显著) - ⚠️ 立标池 eval 相关无显著新增:JEV-as-a-Judge HF 26▲(9-24 18▲,第三天持续在榜)+ Atria Dawn 第九日跌出(⚠⚠⚠⚠⚠⚠⚠⚠⚠⚠,创 R78-R85 最长连续跌出)
1. 增量条目(5 件 eval 邻接/专项新信号)
增量 ① Calibration as a First-Class Criterion in LLM Evaluation arXiv:2609.26489 · paper_card 1504 ✓ · Sep 25 入库 · evaluation 主分类 · benchmark 形态 · work-queue Top 0.5
- 来源:paper_card 1504 ✓(Sep 25 入库,主分类 evaluation,形态 benchmark)+ Jay 9-25 engineering e1prep(高价值)+ Tom 9-25 0840 radar(#6)+ work-queue 9-25 Top 0.5
- arXiv 号:
arXiv:2609.26489Calibration as a First-Class Criterion in LLM Evaluation - 要点:
- 核心问题:LLM 校准(置信度与经验正确性的对齐)是 NLP 中研究充分的子领域,测量方法已存在;问题在于采用不足——NLP 研究引入新模型、数据集和 benchmark 时,几乎不检查模型置信度分数是否有意义
- 核心论点:采用差距(adoption gap)是可信 LLM 评估的主要障碍;校准失当在两个领域造成问题:① 部署阶段,过度自信的错误造成实际危害;② 研究内部,错误的置信度导致错误的决策(错误的模型选择 / 错误的 benchmark 结论)
- 与 JEV-as-a-Judge 的关系:JEV-as-a-Judge 提供了"决策型 judge + 置信度路由"的具体工程方案;Calibration 论文提供了这一方案的元评测视角——JEV 的置信度路由是否真的校准良好?这正是该论文指出的 adoption gap
- 新机制:提出将校准作为 LLM 评估的一等标准(而非可选项),要求新模型 / benchmark 发布时必须附带置信度校准报告
- 与活文档现有脉络的关系:R84 §3.3 锚入 JEV-as-a-Judge(置信度路由 decision-only judge)+ §2.1 评测方法学延革(Harness-Zero 蒸馏);Calibration 论文提供了元评测层面的制度性框架——JEV 解决了"如何用低 cost judge 做置信度路由",Calibration 论文解决了"为什么需要在所有 eval 中报告置信度校准";两者互补构成"工程方案 + 制度框架"的完整图景
- 建议归入节:evaluation.md §3.3(JEV-as-a-Judge 配套的元评测框架)+ §7.3 开放问题(Calibration 论文制度性建议的可执行性)
- 可信度:⭐⭐⭐⭐(paper_card 1504 ✓ Sep 25 当日入库 + eval 主分类 + benchmark 形态 + work-queue Top 0.5 + JEV 互补关系明确)
- ⚠️ 待核实:具体 adoption gap 量化数据("几乎不检查"是否有数字支撑);与现有校准方法(ECE / 温度缩放 / 矩阵缩放)的具体关系;是否提供了具体 checklist 或报告模板
增量 ② FLEET: From Logits Entropy to Enhanced Trajectories arXiv:2609.27657 · paper_card 1500 ✓ · Sep 25 入库 · evaluation 主分类 · method 形态 · HF 2▲
- 来源:paper_card 1500 ✓(Sep 25 入库,主分类 evaluation,形态 method)+ Tom 9-25 0840 radar(#3,memory + benchmark 标签)+ Tom 9-25 hf-daily
- arXiv 号:
arXiv:2609.27657FLEET: From Logits Entropy to Enhanced Trajectories in Text Generation - 要点:
- 核心问题:LLM 解决方案依赖 temperature 采样聚合多个样本来提升准确性和稳定性;但这种无记忆方法本质上次优——因为缺乏对先前生成及其评估的感知,随采样数量增加,语义重复答案比例上升,导致收益递减
- FLEET 方案:将记忆机制集成到生成过程中;用 logits 熵来识别和避免语义重复;代表每个生成及其评估的稀疏轨迹,而非穷举采样
- 与 R84 §4 维度化指标体系的关系:R84 锚入 Tri-PvP(模态偏差归因)和 JEV-as-a-Judge(置信度路由);FLEET 提供了采样效率维度的新量化方法——温度采样的"收益递减"首次被明确建模和测量
- 新维度:采样多样性(semantic diversity of generations)作为 eval 指标首次被提出;解决了"评测时采样越多越好"的隐含假设
- 与活文档现有脉络的关系:R84 §4 维度化指标体系(Tri-PvP 模态偏差 + JEV 置信度路由 + NVIDIA 双层框架);FLEET 新增采样效率 / 生成多样性评测维度,与 JEV 构成"采样成本优化"方向(FLEET 减少无效采样,JEV 减少 judge 调用成本)
- 建议归入节:evaluation.md §4 维度化指标体系(FLEET 作为采样效率 / 生成多样性评测候选)+ §7.3 开放问题(FLEET 与 JEV 的成本效率联合优化可能性)
- 可信度:⭐⭐⭐(paper_card 1500 ✓ Sep 25 当日入库 + eval 主分类 + method 形态;信号强度中等,需全文核验具体量化数据)
- ⚠️ 待核实:具体 logits 熵阈值定义;FLEET 在不同任务类型(代码 / 数学 / 开放域)的收益递减曲线;与 standard temperature 采样的具体对比数字
增量 ③ StudentBench arXiv:2609.28470 · paper_card 1496 ✓ · Sep 24 入库 · evaluation 主分类 · method 形态
- 来源:paper_card 1496 ✓(Sep 24 入库,主分类 evaluation,形态 method)+ paper_cards 批次核查(Sep 24 入库批次)
- arXiv 号:
arXiv:2609.28470StudentBench: AI and Human Tutoring Yield Equivalent GRE Learning Gains - 要点:
- 核心问题:AI 辅助教学领域缺乏系统性的"AI 教学效能"评测标准;大多数 AI tutoring 研究缺少与人类 tutoring 的公平对照
- StudentBench 方案:AI 教学评测套件 + 公共平台,大规模采集数据(已积累 175,000+ 条学生-AI 交互消息),研究 LLM 能否产生与人类辅导相当的学习成效;测量 2,383 名参与者在 GRE 数量 / 文字推理题目上的学习成效(AI tutoring vs 人类 tutoring vs 无辅导三组对照)
- 核心发现:初步结果显示 AI tutoring 在特定任务上可与人类 tutoring 持平
- 评测方法学意义:提供了 AI tutoring eval 的标准化对照实验设计模板——三组对照(AI / human / none)+ 标准化 GRE 测量 + 大规模样本;可迁移到其他 AI 技能评测设计
- 与活文档现有脉络的关系:R84 §3.5 Harness 生态候选(GameHorizon Suite 跨 horizon 游戏评测 + ACLArena ACL 评测框架);StudentBench 新增教育类 agent 评测的标准化对照设计,与 GameHorizon(游戏)构成"严肃场景 vs 趣味场景"的评测设计方法对照
- 建议归入节:evaluation.md §3.5 Harness 生态候选(StudentBench 作为教育类 agent 评测候选)+ §7.3 开放问题(AI tutoring eval 设计对其他 agent 评测的迁移价值)
- 可信度:⭐⭐⭐(paper_card 1496 ✓ Sep 24 入库 + eval 主分类 + method;175,000 消息具体规模 + 2,383 参与者量化;但尚未经同行评审广泛验证)
- ⚠️ 待核实:GRE 学习成效 vs 实际任务表现的迁移效度;AI tutoring 在其他学科(STEM / 语言)的泛化性;与现有 AI tutoring eval(Carnegie Learning 等)的关系
增量 ④ AI Evaluation Digest · May 2026 Substack — BenchGuard + EvalAgent + GroupMemBench · eval 邻接 · BenchGuard <$15/run 量化价值
- 来源:jay 9-25T1335 trending substack(#4.3 AI Evaluation Digest · May 2026)+ https://aievaluation.substack.com/p/2026-may-ai-evaluation-digest
- arXiv 号:无(Substack newsletter,非 arXiv)
- 要点:
- BenchGuard(#1 eval 邻接信号):
- 核心方法:让前沿 LLM 作为 Agent benchmark 审计员——审查现有 benchmark 的设计质量
- 核心发现:许多"Agent 失败"实为测试本身缺陷(指令指向错误文件、评分器拒绝正确答案)
- 量化数据:费用 < $15/run,是 eval 治理的低成本新工具
- 方法学意义:首次提供"meta-evaluation for eval"(对评测的元评测)的工程化路径;回答了 R83 §6.169 的"评测诚信"问题——不仅测 agent,还测 benchmark 本身
- EvalAgent(#2 eval 邻接信号):
- 核心方法:AI 测 AI 代码评测,自动化 Agent 评估劳动
- 核心发现:前沿模型执行成功率仅 30%,且生成的测试"过度工程化"——关注表面指标而非任务成功
- 方法学意义:揭示了"自动生成评测"的系统性偏差——过度关注指标可测量性而非任务完成度;提供了 eval 生成质量本身需要 eval 的元命题
- GroupMemBench(#3 eval 邻接信号):
- 核心发现:当前 LLM 在多人对话中维持记忆时"灾难性崩溃",模型缺乏基本的认知对象永久性(cognitive object permanence)
- 方法学意义:首次将 cognitive object permanence 引入 LLM 评测;与 R84 Tri-PvP(模态偏差归因)构成不同维度的"LLM 缺陷发现"——Tri-PvP 揭示模态偏差,GroupMemBench 揭示记忆持续性缺陷
- 与活文档现有脉络的关系:R84 §6.169 frontier lab 评测治理双轨(OpenAI 原则 + Anthropic-Accenture);BenchGuard 新增LLM-as-auditor 治理工具,< $15/run 是 eval 诚信化 / 治理化的最廉价工程路径;EvalAgent 与 R84 JEV(AI-as-judge)构成"AI 替代人类做 eval"的两种方向——JEV 替代人类 judge,EvalAgent 替代人类 test designer;GroupMemBench 与 R84 Tri-PvP 构成"LLM 缺陷发现"双锚
- 建议归入节:evaluation.md §3.3 BenchGuard(元评测工具 + < $15/run)+ §6.169 frontier 评测治理(BenchGuard + EvalAgent 构成 eval 治理新工具链)+ §7.3 开放问题(AI-as-auditor vs AI-as-a-judge 的角色边界)
- 可信度:⭐⭐⭐(AI Evaluation Digest Substack 有明确方法论描述;BenchGuard 有 $15/run 具体数字;EvalAgent 有 30% 成功率数字;但均依赖单一来源)
- ⚠️ 待核实:BenchGuard $15/run 的具体计算条件;EvalAgent 30% 成功率的任务定义和样本规模;GroupMemBench cognitive object permanence 测试的具体设计
增量 ⑤ Harness 对 LLM 效果影响的工程发现 — GPT-5.6 Astra vs Qwen3.8 Max · @rasbt · 同 Paint 任务不同 harness 表现差异显著
- 来源:jay 9-24 2340 news-x-tech-radar(GPT-5.6 Astra vs Qwen3.8 Max harness 信号)+ @rasbt(Sep 15 post)
- arXiv 号:无(Twitter/X 帖子,非正式论文)
- 要点:
- 核心发现:在同一 Paint 任务的 computer use benchmark 上,GPT-5.6 Astra 和 Qwen3.8 Max 的表现因 harness 不同而出现显著差异
- 方法学意义:直观展示 harness 对 LLM 效果的影响——benchmark 数字可能反映的是 harness 质量而非模型能力;是"Model or Harness"问题的最新工程实证
- 与 R84 §2.1 的关系:R84 锚入 JEV-as-a-Judge(置信度路由)+ Agensh(无中心编排器 harness)+ Harness-Zero(harness 蒸馏);本条提供了harness 对 benchmark 结论影响的最新工程案例,与 Model or Harness?taxonomy(2607.28802,41 failure modes)构成实证呼应
- 建议归入节:evaluation.md §2.1 评测方法学延革(harness 效果影响的最新工程案例,作为 Model or Harness 问题的最新实证)
- 可信度:⭐⭐⭐(Twitter/X 有具体任务类型和初步对比结论;但无受控实验详情,仅为单次观察)
- ⚠️ 待核实:Paint 任务的具体定义;不同 harness 的具体配置差异;两模型在控制 harness 后的具体数字对比
2. Sep 23-25 paper_cards eval 相关新卡核查
Sep 23-25 eval 主分类卡(5 件)
| 编号 | arXiv | 标题 | 主分类 | 状态 |
|---|---|---|---|---|
| 1456 | 2609.25001 | GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay | evaluation | Sep 22 入库 · HF 115▲ #3(R83-R84 锚入) |
| 1458 | 2609.24974 | Harness-Zero: Harness Distillation via Agent-as-Harness | evaluation | 9-22 后期入库 · TLDR 截断(R83-R84 锚入) |
| 1463 | 2609.22220 | Mutation Analysis for GPU-Kernel Benchmark Oracles | evaluation | Sep 22 入库 · benchmark(R83-R84 锚入) |
| 1504 | 2609.26489 | Calibration as a First-Class Criterion in LLM Evaluation | evaluation | Sep 25 入库 · benchmark · work-queue Top 0.5 · ⭐⭐⭐⭐ |
| 1500 | 2609.27657 | FLEET: From Logits Entropy to Enhanced Trajectories | evaluation | Sep 25 入库 · method · HF 2▲ · ⭐⭐⭐ |
| 1496 | 2609.28470 | StudentBench: AI and Human Tutoring Yield Equivalent GRE Learning Gains | evaluation | Sep 24 入库 · method · 175,000 messages · ⭐⭐⭐ |
Sep 23-25 eval 邻接/副分类卡(7 件)
| 编号 | arXiv | 标题 | 主分类 | eval 关系 |
|---|---|---|---|---|
| 1469 | 2609.23989 | ACLArena: Agent Continue Learning in Multi-stage Post-training | engineering | eval 邻接(ACL 评测框架 · model-level + token-level 双视角 · R83-R84 锚入) |
| 1444 | 2609.22076 | APort Vault: Benchmarking AI Agent Payment Authorization | agent | eval 副分类(支付授权安全 · 225,964 次评测 · R83-R84 锚入) |
| 1454 | 2609.19169 | SiliconBench: Speed, Memory, and Fidelity for LLM Serving | llm-infra | eval 副分类(Apple Silicon serving 评测 · R83-R84 锚入) |
| 726 | 2607.28802 | Model or Harness? An Interaction-Centric Taxonomy for Agent Failures | evaluation | eval 邻接(41 种失败模式 · Jay engineering 高价值 · R84 arXiv 列表已收录) |
| 1468 | 2609.22255 | Deep Persona: Psychologically Grounded Architecture for Role-Playing Agents | agent | eval 副分类(Sep 24 更新 · 三层架构 · 心理可信度) |
| 1498 | 2609.23784 | PackLab: Framework for Developing, Training, and Evaluating MLLMs in Robotic Bin Packing | engineering | eval 副分类(Sep 25 更新 ·具身评测) |
| 1483 | 2609.22323 | ALPINE: Adaptive Localization for Parameter-Efficient Few-Shot Learning | evaluation | eval 邻接(22,249-34,917 参数轻量架构 · iso-episode-budget 协议) |
3. 矛盾与待核实
矛盾 ① ⚠⚠ ImpossibleRubrics vs MC-Search HAVE 框架 —— R80 提出,本轮无新进展
- 状态:R80 提出的方法学层面系统性冲突,本轮 inbox 来源中未出现新进展或交叉核实
- 建议:§7.3 开放问题保持 P0 标记,R86 前需完成实测交叉核实
矛盾 ② ⚠ Model-or-Harness "model-side bias 是方法学产物" 是否系统性挑战 agent consistency 双锚
- 状态:R84 §6.165.7 已标注;本轮 @rasbt 的"GPT-5.6 Astra vs Qwen3.8 Max 同任务不同 harness 表现差异"是 Model or Harness?问题的最新工程实证;但仍是观察性数据,无受控实验
- 建议:§7.2 争议保持,R86 前需评估 Model or Harness?(2607.28802)全文 §4 量化数据
待核实 ①:AutoTuneBench 2609.18123 paper_card 入库状态(R80 提出,本轮无进展)
- 本轮状态:仍未入库;work-queue 9-25 10:00 仍无该 paper_card 预警
- 建议:evaluation.md §3.3 保持 ⚠️ paper_card 未入库标注
待核实 ②:AgentSysBench 2608.15127 paper_card 入库状态(R80 提出,本轮无进展)
- 本轮状态:仍未入库
- 建议:evaluation.md §3.3 保持 ⚠️ paper_card 未入库标注
待核实 ③:EDGE-EVAL 具体 arXiv 号(R80 提出,本轮无进展)
- 本轮状态:仍未出现;arXiv 号缺失
- 建议:入库时补充具体 arXiv 号
待核实 ④:Anthropic + Accenture 嵌入式评估具体方法学(R81 提出,本轮无实质进展)
- 本轮状态:Stephen 9-25 ai-industry e1prep 仍沿用公告层面;OpenAI frontier lab 评测公开化国际维(R84 Sam Altman 联合国安理会发言)本轮无更新
- 建议:§3.3 候选标注 ⚠️ 详细内容待核实
待核实 ⑤:Harness-Zero 全文量化数据(R83 提出,本轮无进展)
- 本轮状态:TLDR 截断;Harness 增益保留率、训练数据规模、算力开销、泛化性边界均未给出
- 建议:§3.3 候选标注 ⚠️ 全文 §4 实验节待核
待核实 ⑥:JEV-as-a-Judge 全文量化数据(R84 提出,本轮无进展)
- 本轮状态:TLDR 截断;多步推理链任务中 3% 差距扩大问题;置信度路由不确定性度量校准方法;第三方独立 benchmark 状态;HF 票数升至 26▲(第三天在榜)
- 建议:§2.1 候选标注 ⚠️ 全文待核
待核实 ⑦:RRSI 154▲ #1 立标极显著性独立核验(R83 提出,⚠⚠⚠ 本轮第四轮仍未独立核验)
- 本轮状态:RRSI(arXiv:2609.24972)本轮未入 HF Daily Top15;stephen 9-25 ai-industry e1prep 仍未独立核验;flyp 9-25 multimodal-e1prep 仍未独立核验
- 建议:§3.5 候选标注 ⚠️ 连续四轮未核验,R86 前需下决心降级或独立核实
待核实 ⑧:BenchGuard $15/run 成本计算条件(新增,本轮首次提出)
- 本轮状态:AI Evaluation Digest May 2026 Substack 提供"$15/run"数字,未附计算条件
- 建议:§3.3 候选标注 ⚠️ 需核实具体条件(模型 / 任务数 / 运行次数 vs $15)
4. Sep 24-25 立标池 eval 相关结构性变化
4.1 JEV-as-a-Judge 26▲ 第三天在榜(R84 锚入信号持续稳定)
- JEV-as-a-Judge(2609.26550):9-22 18▲ → 9-24 18▲ → 9-25 26▲ ——eval 方法学论文第三天在榜,信号持续稳定升档
4.2 Atria Dawn 连续第九日跌出(⚠⚠⚠⚠⚠⚠⚠⚠⚠⚠)
- 跌出轨迹:9-17 424▲ #1 → 9-18~9-25 连续第九日未入 Top15 ⚠⚠⚠⚠⚠⚠⚠⚠⚠⚠
- ⚠ 重要警示:R78-R85 以来 Atria Dawn 最长跌出纪录持续扩大;与 flyp 的"评估污染 + 票数真实性"6 项反方证据共同构成元评测层面的持续性批判
4.3 FLEET 2▲ 新立标(eval 主分类新立)
- FLEET(2609.27657):Sep 25 HF 2▲ ——eval 主分类 method 新立标,采样效率 / logits 熵新方向
4.4 OmniEchoBench 15▲ 新入(eval 邻接 benchmark · 跨模态评测)
- OmniEchoBench(2609.23407):Sep 25 HF 15▲ ——空间音视频 + 导航 benchmark,eval 邻接(197 真实场景 / 2972 Q&A / 900 导航样本)
5. 可引用 arXiv 号列表
本轮 eval 主分类新入库(3 件):
- arXiv:2609.26489 — Calibration as a First-Class Criterion in LLM Evaluation(paper_card 1504 ✓ · eval 主分类 · benchmark · work-queue Top 0.5 · ⭐⭐⭐⭐)
- arXiv:2609.27657 — FLEET: From Logits Entropy to Enhanced Trajectories(paper_card 1500 ✓ · eval 主分类 · method · HF 2▲ · ⭐⭐⭐)
- arXiv:2609.28470 — StudentBench: AI and Human Tutoring(paper_card 1496 ✓ · eval 主分类 · method · 175,000 messages · ⭐⭐⭐)
本轮 eval 邻接新入库(1 件):
- arXiv:2607.28802 — Model or Harness?(paper_card 726 ✓ · eval/agent 主分类 · 41 failure modes · Jay engineering 高价值 · R84 arXiv 列表已收录 ⚠️ 本轮 Jay e1prep 标记为 eval 高价值重提)
本轮 eval 邻接 Substack 新信号(1 件): - 无 arXiv — AI Evaluation Digest May 2026(BenchGuard <$15/run + EvalAgent 30% 成功率 + GroupMemBench 灾难性崩溃)
本轮 eval 邻接工程发现(1 件): - 无 arXiv — GPT-5.6 Astra vs Qwen3.8 Max 同 Paint 任务不同 harness 表现差异(@rasbt Sep 15,harness 效果影响最新工程案例)
R84 沿用 eval 专项/邻接(16 件):
- arXiv:2609.26550 — JEV-as-a-Judge(paper_card 1487 ✓ · eval 主分类 · method · HF 26▲ 第三天在榜 · ⭐⭐⭐⭐)
- arXiv:2609.26781 — Agensh(paper_card 1486 ✓ · eval 副分类 · 1,024 agents 无中心编排器 harness · ⭐⭐⭐⭐)
- arXiv:2609.06011 — Tri-PvP(paper_card 1491 ✓ · eval 副分类 · 8000 样本三模态冲突 benchmark · ⭐⭐⭐)
- arXiv:2609.25001 — GameHorizon Suite(paper_card 1456 ✓ · HF 115▲ #3 · multi-horizon gameplay benchmark · ⭐⭐⭐⭐)
- arXiv:2609.24974 — Harness-Zero(paper_card 1458 ✓ · eval 主分类 · TLDR 截断待全文 · ⭐⭐⭐)
- arXiv:2609.22220 — Mutation Analysis for GPU-Kernel Benchmark Oracles(paper_card 1463 ✓ · benchmark · oracle adequacy metric · ⭐⭐⭐)
- arXiv:2609.23989 — ACLArena(paper_card 1469 ✓ · ACL 评测框架 · model-level + token-level 双视角 · ⭐⭐⭐)
- arXiv:2609.22039 — Gricea(paper_card 1449 ✓ · 开放科学 CAI 平台 · HF 7 票 · ⭐⭐⭐⭐)
- arXiv:2609.16251 — CADWorld(paper_card 1453 ✓ · FreeCAD 200 tasks × 11 · ⭐⭐⭐⭐)
- arXiv:2609.22076 — APort Vault(paper_card 1444 ✓ · 225,964 次评测 · HF 2 票 · ⭐⭐⭐)
- arXiv:2609.19169 — SiliconBench(paper_card 1454 ✓ · Apple Silicon serving 三维度 · ⭐⭐⭐)
- arXiv:2609.10451 — SWE-bench-lite XAgent 62%(coding agent 标准尺 · 13.86%→62% vs 80% · ⭐⭐⭐⭐)
- arXiv:2601.06112 — ReliabilityBench(chaos engineering · 1,280 场景 · 96.9%→88.1% · ⭐⭐⭐)
- arXiv:2609.18123 — AutoTuneBench(⚠️ paper_card 未入库 · ⭐⭐⭐⭐)
- arXiv:2608.15127 — AgentSysBench(⚠️ paper_card 未入库 · 178,799 sessions · ⭐⭐⭐⭐)
- arXiv:2603.00873 — MC-Search(ICLR 2026 ✓ · Agentic MM-RAG 过程级基准 · ⭐⭐⭐⭐)
R84 沿用 eval 方法学锚(5 件):
- arXiv:2609.20804 — Coding Agent Harness Design(HF 71▲ #7 后跌出 · ⭐⭐⭐⭐)
- arXiv:2609.18605 — PACT(paper_card 1417 ✓ · 企业合规 · ⭐⭐⭐⭐)
- arXiv:2609.17496 — Fuse(paper_card 1433 ✓ · 可验证社交推理 · HF 51▲ · ⭐⭐⭐⭐)
- arXiv:2609.18323 — MiniMax-H3(paper_card 1429 ✓ · 517 instances × 4 维度 · HF 116▲ #2 · ⭐⭐⭐⭐)
- EDGE-EVAL — ACL Anthology 2026(⚠️ arXiv 号待查 · ⭐⭐⭐)
本轮 R85 立标池 eval 相关新增候选:
- arXiv:2609.24972 — RRSI(⚠️ 154▲ #1 立标极显著但仅一家给出 · Agent Harness 正则化递归自我改进 · ⭐⭐⭐ · 连续四轮未独立核验 ⚠⚠⚠)
6. 增量条数汇总
| 类别 | 条数 | 编号 |
|---|---|---|
| eval 主分类新入库 | 3 | ① Calibration(2609.26489,paper_card 1504 ✓,校准一等标准,work-queue Top 0.5)+ ② FLEET(2609.27657,paper_card 1500 ✓,logits熵采样效率,HF 2▲)+ ③ StudentBench(2609.28470,paper_card 1496 ✓,AI tutoring 三组对照,175,000 messages) |
| eval 邻接新入库 | 2 | ④ AI Evaluation Digest May 2026 Substack(BenchGuard <$15/run + EvalAgent 30% 成功率 + GroupMemBench)+ ⑤ GPT-5.6 Astra vs Qwen3.8 Max harness 工程发现(@rasbt) |
| eval 邻接重提 | 1 | ⑥ Model or Harness?(2607.28802,paper_card 726 ✓,41 failure modes,Jay engineering 高价值;R84 arXiv 列表已收录,本轮 Jay e1prep 重提) |
| 合计净增量 | 6 | ①-⑥ |
arXiv 号数量:3 件本轮 eval 主分类 + 1 件本轮 eval 邻接入库(R84 已收录) + 16 件 R84 沿用 + 5 件 R84 沿用方法学锚 + 1 件立标候选 = 26 件
7. 检查过的来源清单
# inbox/tom/
2026-09-25T1440-agent-rag-longcontext-radar.md(OmniEchoBench 15▲ #1 + IterSynth 4▲ + AgentKernel 4▲ · eval 邻接)
2026-09-25-0900-hf-daily-2026-09-25.md(15 件立标:JEV-as-a-Judge 26▲ + FLEET 2▲ · eval 主分类)
2026-09-25-0840-agent-rag-longcontext-radar.md(Calibration 2609.26489 #6 + FLEET 2609.27657 #3)
2026-09-24-evaluation-e1prep.md R84(完整基线)
2026-09-25-rag-e1prep.md(邻接)
# inbox/jay/
2026-09-25-engineering-e1prep.md(Calibration 2609.26489 高价值 + Model or Harness 2607.28802 高价值)
2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md(AI Evaluation Digest May 2026 · BenchGuard + EvalAgent + GroupMemBench)
2026-09-24T1450-jay-engineering-filter-sep24.md(eval 邻接 · NVIDIA Agent Eval 框架沿用)
2026-09-24 2340-news-x-tech-radar.md(GPT-5.6 Astra vs Qwen3.8 Max 同任务 harness 差异 · eval 邻接)
2026-09-25-1000-rss-cool-papers.md(邻接 · 无 eval 专项信号)
2026-09-25-1001-rss-import-ai.md(邻接 · 无 eval 专项信号)
# inbox/spark/
(近2天无 eval 专项 inbox)
# inbox/flyp/
(近2天无 eval 专项 inbox)
# inbox/stephen/
(近2天无 eval 专项 inbox · RRSI 仍未独立核验 ⚠⚠⚠)
# paper_cards/
1504-2609-26489.md(Calibration as a First-Class Criterion in LLM Evaluation · eval 主分类 · benchmark · Sep 25 入库)
1500-2609-27657.md(FLEET · eval 主分类 · method · Sep 25 入库)
1496-2609-28470.md(StudentBench · eval 主分类 · method · Sep 24 入库)
1487-2609-26550.md(JEV-as-a-Judge · eval 主分类 · HF 26▲ · R84 锚入)
1486-2609-26781.md(Agensh · eval 副分类 · R84 锚入)
1491-2609-06011.md(Tri-PvP · eval 副分类 · R84 锚入)
1456-2609-25001.md(GameHorizon Suite · eval 主分类 · HF 115▲ #3 · R84 锚入)
1458-2609-24974.md(Harness-Zero · eval 主分类 · TLDR 截断 · R84 锚入)
1463-2609-22220.md(Mutation Analysis GPU-Kernel · eval 主分类 · R84 锚入)
1469-2609-23989.md(ACLArena · eval 邻接 · R84 锚入)
726-2607.28802.md(Model or Harness?· eval/agent · R84 已收录 · 本轮 Jay e1prep 重提)
# work-queue/
2026-09-25 10:00(Calibration 2609.26489 Top 0.5 + StudentBench 2609.28470 新入库)
8. 无显著新增量时的如实说明
本轮 eval 领域有实质增量:3 件 eval 主分类 paper_card 入库(Calibration 2609.26489 校准一等标准 + FLEET 2609.27657 logits熵采样效率 + StudentBench 2609.28470 AI tutoring 三组对照)+ 1 件 eval 邻接 Substack 新信号(BenchGuard <$15/run 元评测工具 + EvalAgent 30% + GroupMemBench 记忆崩溃)+ 1 件 eval 邻接工程发现(GPT-5.6 Astra vs Qwen3.8 Max 同任务 harness 差异)+ 1 件 eval 邻接重提(Model or Harness 2607.28802)——信号密度低于 R83 的 7 件 eval 专项,但 Calibration 论文是本轮最高质量的 eval 元评测框架新增,与 JEV-as-a-Judge 构成"制度框架 + 工程方案"的互补。
信号质量评估: - Calibration(2609.26489)是本轮最高价值 eval 主分类入库,paper_card 1504 ✓ Sep 25 当日入库,work-queue Top 0.5;首次提出将校准作为 LLM 评估一等标准,与 JEV-as-a-Judge 的置信度路由构成"制度框架 + 工程方案"互补 - FLEET(2609.27657)paper_card 1500 ✓ Sep 25 当日入库,eval 主分类 method;首次提出温度采样的"收益递减"量化问题,与 JEV 构成"采样成本优化"双锚;但信号强度中等,需全文核验 - StudentBench(2609.28470)paper_card 1496 ✓ Sep 24 入库,175,000 messages + 2,383 参与者三组对照;AI tutoring eval 标准化设计模板,可迁移到其他 agent 评测 - BenchGuard(AI Evaluation Digest May 2026)< $15/run 是 eval 诚信化/治理化的最廉价工程路径;EvalAgent 揭示"自动生成评测"系统性偏差(30% 成功率 + 过度工程化);GroupMemBench 揭示认知对象永久性缺陷 - RRSI(2609.24972)连续第四轮未独立核验,⚠⚠⚠ 需 R86 前做出降级决定 - Atria Dawn 连续第九日跌出,创 R78-R85 以来最长跌出纪录
R85 活文档建议关注:① Calibration 全文 adoption gap 量化数据("几乎不检查"是否有数字支撑);② FLEET logits 熵阈值定义和任务泛化性;③ StudentBench 学习成效迁移效度;④ BenchGuard $15/run 具体计算条件;⑤ Model or Harness?全文 41 failure modes 量化;⑥ JEV-as-a-Judge HF 26▲ 持续在榜情况(第四天?);⑦ RRSI 154▲ #1 独立核验(连续四轮未核验,⚠⚠⚠)
Tom · 2026-09-25 15:40 CST · E1 预消化 · evaluation · R85 窗口覆盖完成 · 3 件 eval 主分类新入库(Calibration 2609.26489 paper_card 1504 ✓ + FLEET 2609.27657 paper_card 1500 ✓ + StudentBench 2609.28470 paper_card 1496 ✓)+ 1 件 eval 邻接 Substack(BenchGuard <$15/run + EvalAgent 30% 成功率 + GroupMemBench)+ 1 件 eval 邻接工程发现(GPT-5.6 Astra vs Qwen3.8 Max harness 差异)+ 1 件 eval 邻接重提(Model or Harness 2607.28802)+ ⚠️ RRSI 连续第四轮未独立核验 + ⚠️ Atria Dawn 连续第九日跌出