evaluation · E1 预消化简报(2026-10-02)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-10-02 15:40 CST 窗口定义:2026-10-01 15:40 ~ 2026-10-02 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R90 基线 · 2026-09-30 16:50)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Oct 1-2 新入库 eval 相关条目 诚实度声明:本轮 eval 主题净增量密度"中"— eval 主分类 paper_card NET-new 净增 2 件(The Endless Exam + MILO);本次 6 条增量均 eval 主分类/强邻接,可锚入 R90 既有脉络。增量来自 flyp Oct 1 SEAL 深度精读(1 条)+ HF Daily Oct 2 新 eval 主分类(2 条)+ Tom Oct 2 radar 邻接 eval(1 条)+ flyp multimodal-e1prep Oct 2 eval 邻接(2 条)。无硬凑字数。
状态摘要
- 增量条数:6 条(落在 3-8 目标区间内)
- 核心新增:① The Endless Exam(2609.24555 · 主分类 evaluation · 数学构造迈向超智能的 benchmark,14 个参数化家族)② MILO(2609.38349 · 主分类 evaluation · Agent Harness 自动发现协同进化框架)③ SEAL(2605.30104 v2 · 副分类 evaluation · LLM-as-Meta-Judge 复活饱和基准的两层 rubric 协议)④ BiasReducer(2609.32720 · 邻接 eval · 奖励模型自适应偏差缓解)⑤ MIST(2609.37863 · 邻接 eval · VLM Judge 被无关图像误导的 stress test)⑥ Training LLM Judges from Language Feedback(2609.38792 · 副分类 evaluation · 位置选择性自蒸馏从语言反馈学习评判标准)
- 澄清:本次 eval 主分类 NET-new 净增 2 件(The Endless Exam + MILO);SEAL/Training LLM Judges 属 engineering 主分类但副分类 eval;BiasReducer/MIST 属 multimodal 主分类但 eval 邻接
- 涉及 arXiv 号:本次新增 8 个(2609.24555 · 2609.38349 · 2605.30104 · 2609.32720 · 2609.37863 · 2609.38792 · 2609.39154 · 2609.34274);续用锚定 280+ 个(R90 沿用)
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| inbox/flyp | 2026-10-01-1550-flyP-critical-read-SEAL-saturated-benchmarks-meta-judge.md(Oct 1 下午 · 11.4KB · SEAL 深度精读) |
极高 ⭐⭐⭐⭐⭐(LLM-as-Meta-Judge 复活饱和基准 · 两层 rubric 协议 · 方法学可信度中高) |
| inbox/tom | 2026-10-02-0900-hf-daily-2026-10-02.md(HF Daily Oct 2 早棒 · 15 篇) |
极高 ⭐⭐⭐⭐⭐(The Endless Exam 未出现 · BiasReducer 18▲ #12 · work-queue Top 15 第 1 即 The Endless Exam) |
| inbox/tom | 2026-10-02-agent-rag-longcontext-radar.md(08:40 UTC · 4 高价值) |
极高 ⭐⭐⭐⭐⭐(Training LLM Judges + MILO + DAGent + BIABench) |
| inbox/flyp | 2026-10-02-multimodal-e1prep.md(79KB · v87+21 R43 · MIST 评估方法学第 23 件候选 + WISE-ATTA 评测方法学邻接) |
高 ⭐⭐⭐⭐(MIST 36▲ #7 + WISE-ATTA 邻接) |
| inbox/spark | 2026-10-02-agent-e1prep.md(54KB · MILO 1619 + Training LLM Judges 1617 + DAGent 1618 + BIABench 1622) |
高 ⭐⭐⭐⭐(4 件 paper_card 10-2 morning 入库 eval 主/邻接) |
| inbox/tom | 2026-10-01-evaluation-e1prep.md(昨日 E1 基线锚定) |
极高 ⭐⭐⭐⭐⭐(R90 基线:APM-Bench + LibraryDesignBench + False Frontiers + OSWorld-Science + Mid-Harness) |
| inbox/jay | 2026-10-02-engineering-e1prep.md(22KB · Meta-Harness 6× + LLM-as-Judge 引用) |
中(Meta-Harness harness 性能差距) |
| organized/queue | work-queue.md(Top 15 · The Endless Exam 2609.24555 排第 1) |
极高 ⭐⭐⭐⭐⭐ |
| paper_cards Oct 1-2 | 1619-MILO + 1610-DyRAD + 1601-Mid-Harness + 1603-OSWorld-Science + 1614-EndlessExam + 1617-TrainingLLMJudges + 1618-DAGent + 1622-BIABench + 1613-MIST | 高(eval 主/邻接 paper_card 9 件) |
一、增量条目
增量 1:The Endless Exam — 数学构造迈向超智能的 benchmark(2609.24555)— 主分类 evaluation(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1614-2609-24555.md(主分类 evaluation · 形态 benchmark · Oct 2 morning 入库)· work-queue.md(Top 15 高价值待深度解读 · 排第 1)· 原始来源:arXiv:2609.24555
URL:https://arxiv.org/abs/2609.24555
TLDR(原文):We introduce the Endless Exam, a benchmark spanning fourteen parameterised families of mathematical construction problems, with verifiable scores that distinguish progress before and beyond published mathematical frontiers. Each submitted object is checked automatically for validity and assigned a relative quality score against a published frontier or construction baseline, without capping improvements at 1.
要点:
- 核心问题:传统 benchmark 有上限分数(cap at 1),无法区分超越 published frontier 的模型——The Endless Exam 用相对质量评分机制突破此上限,专门评估"超越现有数学前沿"的能力
- 规模:14 个参数化数学构造问题家族,自动验证有效性并与已发布 frontier 对比评分
- 评测创新:无上限评分(不 cap at 1)——这是 eval 方法论的一个根本性创新:现有 benchmark 都在测"模型能解决多少已知问题",The Endless Exam 测"模型能创造多少超越已知前沿的新知识"
- 意义:与 R90 SAGE(符号闭包分析)和 Groupwise Agentic Grading 形成三角印证——都是针对"现有评测无法捕捉的能力差异"的方法论创新,但 The Endless Exam 面向数学构造,范围最广
- ⚠️ 待核实:具体是哪 14 个数学构造家族、参数化维度、自动化验证机制细节均未知;TLDR 极简
与活文档 evaluation.md 现有脉络的关系: - 邻接 R90 §1.3 长程/多 Agent 评测基准(SAGE + AgentWorld + APM-Bench + LibraryDesignBench)——The Endless Exam 是另一维度的长程评测:不测 Agent 执行能力,而是测"超越前沿的数学构造能力" - 邻接 R90 §2.2 评测平台与 CI Gate——无上限评分机制是该节"评测平台设计"的新维度,可与 IndicBankBench 四阶段 + CLEAR 五维形成互补 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · The Endless Exam 2609.24555 · 主分类 eval · 无上限评分数学构造 benchmark · 14 个参数化家族 · work-queue Top 15 第 1 · ⚠️ 需原文精读)
增量 2:MILO — Agent Harness 自动发现协同进化框架(2609.38349)— 主分类 evaluation(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1619-2609-38349.md(主分类 evaluation · 副分类 agent · Oct 2 morning 入库)· inbox/tom/2026-10-02-agent-rag-longcontext-radar.md(HF Daily Oct 2 · 15票 #14)· inbox/spark/2026-10-02-agent-e1prep.md(spark agent-e1prep §增量 5)
URL:https://arxiv.org/abs/2609.38349
TLDR(原文):Modern agentic systems combine an AI model with a harness that controls execution and environmental interactions. Harness design strongly affects long-horizon performance, yet its combinatorial search space demands substantial human effort that must be repeated as models change. Existing automated methods explore this space narrowly, optimizing only components such as prompts or skills or becoming trapped by fixed, exploitative search strategies. We introduce MILO (Meta-evolutionary Island Orchestration), a framework that co-evolves agent harnesses and the strategy used to discover them.
要点:
- 核心问题:Harness 设计空间庞大且随模型变化需重新搜索;现有自动化方法探索范围窄,容易陷入 exploit 策略——MILO 提出协同进化框架,同时优化 harness 和发现策略本身
- 核心创新:Meta-evolutionary Island Orchestration——层级 lineage memory + 协同进化策略,避免固定 exploit 策略
- 评测意义:MILO 是 eval 领域的元评测工具——它不是评测 Agent 能力,而是评测 harness 设计质量,并自动化地发现更好的 harness
- 与 R90 Mid-Harness 的关系:Mid-Harness 关注"model-harness 边界的动作可靠性",MILO 关注"harness 本身的自动化设计"——两者共同构成"harness 层评测"的新方向
- ⚠️ 待核实:具体协同进化算法细节、lineage memory 结构、实验量化数据均未知
与活文档 evaluation.md 现有脉络的关系: - 邻接 R90 §1.1 评测诚信从 harness 层延伸到指标层——MILO 是"评测 harness 本身质量"的元评测工具,与 Mid-Harness(harness 导致轨迹失真)共同扩展 R90 §1.1 的 harness 层问题 - 邻接 R90 §6.175.4 SAGE——SAGE 评测"探索偏置导致的评测失真",MILO 评测"harness 设计空间的搜索质量",但都涉及"如何避免 eval 中的 exploit" - 建议归入章节:§1.1 评测诚信(新增邻接 · MILO 2609.38349 · 主分类 eval · Agent Harness 自动发现协同进化框架 · HF 15票 · 与 Mid-Harness 形成"harness 层评测"双锚)
增量 3:SEAL — LLM-as-Meta-Judge 复活饱和基准的两层 rubric 协议(2605.30104 v2)— 副分类 evaluation(⭐⭐⭐⭐⭐)
来源:inbox/flyp/2026-10-01-1550-flyP-critical-read-SEAL-saturated-benchmarks-meta-judge.md(flyp Oct 1 15:50 深度精读 · 11.4KB)· 原始来源:arXiv:2605.30104 v2(2026-08-24)
URL:https://arxiv.org/abs/2605.30104
TLDR(flyp 精读摘要):SEAL 提出两层 rubric 复活饱和基准:固定层(Principles)保证语义稳定,自适应层(Checklist)由 meta-judge 每轮后根据 match 证据生成更细 checklist 项。Spearman ρ vs FullPair:HumanEval 0.95 / GSM8K 0.83 / MMLU 1.00 / BFCL-v2 0.98;调用次数 11.89 vs 28.00。
要点:
- 核心问题:饱和基准(如 HumanEval/GSM8K/MMLU)上强模型分数趋同,原始度量失去区分度——SEAL 不动任务不动输出,只改造聚合协议
- 两层 rubric 设计:
- 固定层(Principles):任务级评估原则全程不变,保证聚合语义稳定
- 自适应层(Checklist):由 meta-judge 每轮结束后根据 match 证据动态生成更细 checklist,早轮 broad,晚轮 fine
- 关键约束:meta-judge 只迭代优化清单,不直接打总分——这是区分于"用 meta-judge 改进 reward/DPO 偏好信号"的关键设计
- 量化结果:HumanEval ρ=0.95 / GSM8K ρ=0.83 / MMLU ρ=1.00 / BFCL-v2 ρ=0.98;调用次数 11.89 vs FullPair 28.00(节省约 58%)
- 方法可信度:高(协议描述清晰,跨任务一致,可复现);但⚠️ 缺少 vs 人类偏好对照,FlatBrk 对照不充分,N 规模化未讨论
与活文档 evaluation.md 现有脉络的关系: - 直接邻接 R90 §1.1 评测诚信从 harness 层延伸到指标层——SEAL 揭示的是"聚合协议层面"的评测失真:当原始指标饱和,是聚合协议而非任务本身出了问题;这与 KV Cache Reuse Eval(指标失真批判)构成"指标失真"的两个不同层面 - 邻接 R90 §2.2 评测平台与 CI Gate——SEAL 的"固定原则 + 动态清单"是评测平台聚合层设计的新思路,与 IndicBankBench 四阶段 + CLEAR 五维并列 - 建议归入章节:§1.1 评测诚信(新增邻接 · SEAL 2605.30104 v2 · 副分类 eval · LLM-as-Meta-Judge 两层 rubric 协议 · 饱和基准复活方法 · Spearman ρ ≥0.83 四任务 · 11.89 vs 28.00 calls)
增量 4:BiasReducer — 奖励模型自适应偏差缓解(2609.32720)— eval 邻接(⭐⭐⭐⭐)
来源:inbox/tom/2026-10-02-0900-hf-daily-2026-10-02.md(HF Daily Oct 2 · 18票 #12)· paper_card 目录检索
URL:https://arxiv.org/abs/2609.32720
TLDR(来源摘要):面向奖励模型的自适应偏差缓解——reward model 的偏差直接影响 RL 训练质量,进而影响最终模型能力评测的可信度。
要点:
- 核心问题:reward model 存在系统性偏差(如偏好特定风格/长度/格式),导致 RL 训练出的模型在下游评测中表现良好但实际能力被高估
- 解决方案:自适应偏差缓解——根据 reward model 在不同输入上的偏差模式动态调整,缓解偏差的同时保持 reward signal 有效性
- HF 18票——中等票数但 eval 启示意义强
- ⚠️ 待核实:arXiv 原文具体算法、实验设置、量化结果均未知;paper_card 尚未建立
与活文档 evaluation.md 现有脉络的关系: - 邻接 R90 §6.175.3 ARGUS(11 维审计框架 73% vs 18%)——ARGUS 的结构化 rubric 与 BiasReducer 的自适应偏差缓解都关注"评测本身的可靠性",方向互补但针对不同失真源(rubric 设计 vs reward model 偏差) - 邻接 R90 §1.1 评测诚信——reward model 偏差是 RL 后训练阶段评测失真的重要来源,BiasReducer 提供了缓解手段 - 建议归入章节:§1.1 评测诚信(新增邻接 · BiasReducer 2609.32720 · eval 邻接 · 奖励模型自适应偏差缓解 · HF 18票 · ⚠️ 需原文精读获取具体算法和量化数据)
增量 5:MIST — VLM Judge 被无关图像误导的 stress test(2609.37863)— eval 邻接(⭐⭐⭐⭐)
来源:inbox/flyp/2026-10-02-multimodal-e1prep.md(flyp multimodal-e1prep §增量 1 · MIST 评估方法学第 23 件候选)· inbox/tom/2026-10-02-0900-hf-daily-2026-10-02.md(HF Daily Oct 2 · 36票 #7 顶置新立)· organized/paper_cards/1613-2609-37863.md(主分类 multimodal · Oct 2 morning 入库)
URL:https://arxiv.org/abs/2609.37863
TLDR(原文):Vision-language models (VLMs) are increasingly used in place of human annotators, making it important that substitutability tests reflect the model rather than incidental evaluation conditions. We introduce MIST, the Misleading-Image Stress Test: 200 English sentences, each built around a phrase readable either figuratively or literally and shown with an aligned image depicting its reading, a misleading image depicting the opposite, or no image at all. The guidelines require the label to be decided from the sentence alone, so no image should change any answer.
要点:
- 核心问题:VLM 作为评测者(VLM-as-Judge)时,无关图像会扰动评判结果但并不提供有效信息——评测条件而非模型能力主导了 verdict
- MIST 设计:200 句英文句子,每句围绕一个可字面/比喻理解的短语构建,配三类图像:对齐图像(literal 解读)、误导图像(相反解读)、无图像;评判规则要求仅从句子判断,图像不应改变任何答案
- 结果:图像显著改变了 VLM judge 的答案,但这些图像与句子语义无关——VLM 的评判信号被无关上下文劫持
- 评测方法学意义:MIST 揭示了 VLM-as-Judge 的一个系统性失效模式——无关上下文扰动评测而非增强评测;这对多模态评测的 rubric 设计有直接警示意义
- HF 36票——中等偏高,MIST 作为 eval 方法学论文值得关注
与活文档 evaluation.md 现有脉络的关系: - 邻接 R90 §1.2 决策型 judge vs 生成型 judge(ARGUS 73% vs 18%)——MIST 揭示 VLM-as-Judge 的特定失效模式:图像信息劫持 verdict;这与 ARGUS 的结构化 rubric 设计形成互补:都需要更细粒度的 rubric 来排除无关信号干扰 - 邻接 R90 §3 维度化指标体系——多模态评测中的"无关上下文排除"可作为新评测维度,MIST 提供了该维度的测量工具 - 建议归入章节:§1.2 决策型 judge vs 生成型 judge(新增邻接 · MIST 2609.37863 · eval 邻接 · VLM Judge 被无关图像误导 stress test · HF 36票 · 200 句 benchmark)
增量 6:Training LLM Judges from Language Feedback — 位置选择性自蒸馏学评判标准(2609.38792)— 副分类 evaluation(⭐⭐⭐⭐)
来源:inbox/tom/2026-10-02-agent-rag-longcontext-radar.md(Tom Oct 2 08:40 radar · HF Daily · 5票)· inbox/spark/2026-10-02-agent-e1prep.md(spark agent-e1prep §增量 6)· organized/paper_cards/1617-2609-38792.md(主分类 engineering · 副分类 evaluation · Oct 2 morning 入库)
URL:https://arxiv.org/abs/2609.38792
TLDR(原文):We study training LLM judges from natural language feedback, especially for subjective tasks where the verdict depends strongly on which evaluation criteria the judge invokes and how it weighs them. The dominant approach, outcome-supervised RL (e.g., GRPO), credits every token in the rollout with a single scalar determined only by the accuracy of the final verdict, providing no separate credit at the criterion-choice tokens and ignoring the rich language feedback that naturally accompanies preference labels. Self-Distillation (SD) is one natural way to use this language feedback.
要点:
- 核心问题:outcome-supervised RL(如 GRPO)对所有 token 给同一标量 reward,忽略了 criterion-choice token 的独立 credit;自然语言反馈中包含丰富的偏好 rationale 但被忽略
- 解决方案:Position-Selective Self-Distillation——从自然语言反馈中学习评判标准本身,而非仅学习最终结论
- 评测方法学意义:这个方向直接影响 LLM-as-Judge 的训练范式——好的 judge 需要理解"评判标准"而非仅仅输出 verdicts;与 SEAL 的 meta-judge checklist 有方向性关联(都关注"评判标准的细粒度获取")
- ⚠️ 待核实:具体实验任务、量化结果、与 FullPair/SEAL 的对比数据均未知
与活文档 evaluation.md 现有脉络的关系: - 邻接 R90 §1.2 决策型 judge vs 生成型 judge——Training LLM Judges 和 SEAL 都试图解决"通用 LLM-as-Judge 质量不足"的问题,但路径不同:SEAL 改进聚合协议,Training LLM Judges 改进 judge 的训练方法 - 邻接 R90 §3 维度化指标体系——criterion-choice token 的独立 credit 意味着评测维度需要更细粒度的分解,这为§3的维度化指标体系提供了新的方法论工具 - 建议归入章节:§1.2 决策型 judge vs 生成型 judge(新增邻接 · Training LLM Judges 2609.38792 · 副分类 eval · 位置选择性自蒸馏学评判标准 · criterion-choice token 独立 credit · ⚠️ 需原文精读)
二、R90 追踪更新
R90 待核事项状态
| 待核项 | 来源 | 状态 | 更新 |
|---|---|---|---|
| Groupwise Agentic Grading(2609.32577) | R90 · HF 108票 #1 | ⚠ 维持待核 | Oct 1-2 无新进展;paper_card 未见建立 |
| Chinese-Jev(2609.36965) | Sep 30 Tom radar | ⚠ 维持待核 | Oct 1-2 无新进展;TLDR 极简 |
| 关键词/语义搜索评测框架(2609.37749) | Sep 30 Tom radar | ⚠ 维持待核 | Oct 1-2 无新进展;具体指标未知 |
| KV Cache Reuse Eval Boxoffice 工具 | R90 · P0 行动项 | ⚠ 维持 | Oct 1-2 无新进展 |
| False Frontiers(2609.39102) | Oct 1 Tom radar | ⚠ 新增待核 | Oct 2 paper_card 1602 入库;HF 190票 #2;共舞弊问题具体实验数据仍待核 |
| OSWorld-Science(2609.39903) | Oct 1 Tom radar | ⚠ 新增待核 | Oct 2 paper_card 1603 入库;HF 25票 #10;artifact 评估细节待核 |
| Mid-Harness(2609.39982) | Oct 1 Tom radar | ⚠ 新增待核 | Oct 2 paper_card 1601 入库;HF 102票 #3;test-time compute 方案具体数据待核 |
| The Endless Exam(2609.24555) | Oct 2 work-queue Top 15 #1 | ⚠ 新增待核 | Oct 2 paper_card 1614 入库;主分类 eval;无上限评分具体机制待核 |
| MILO(2609.38349) | Oct 2 HF 15票 #14 | ⚠ 新增待核 | Oct 2 paper_card 1619 入库;主分类 eval;协同进化算法细节待核 |
| SEAL(2605.30104 v2) | flyp Oct 1 深度精读 | ⚠ 新增待核 | 方法可信度高但缺少 vs 人类偏好对照;FlatBrk 对照不充分 |
| BiasReducer(2609.32720) | Oct 2 HF 18票 #12 | ⚠ 新增待核 | 具体算法和量化数据未知 |
| MIST(2609.37863) | Oct 2 HF 36票 #7 | ⚠ 新增待核 | Oct 2 paper_card 1613 入库;200 句 benchmark 具体数据待核 |
| Training LLM Judges(2609.38792) | Oct 2 Tom radar | ⚠ 新增待核 | Oct 2 paper_card 1617 入库;具体实验数据未知 |
| RRSI 154▲ #1 | R90 · ⚠⚠⚠⚠⚠⚠⚠⚠ | ⚠⚠⚠⚠⚠⚠⚠⚠ | Oct 2 HF Daily 仍跌出;连续第 9+ 日 |
| 物体永久性 198▲ #1 | R90 · 顶置续涨→跌出 | ⚠⚬⚬⚬⚬⚬⚬⚠ | Sep 30 跌出第 6 日 → Oct 1 跌出第 7 日 → Oct 2 跌出第 8 日 |
三、矛盾与警示
⚠️ 数据可靠性警示 1:BiasReducer TLDR 极简
问题:arXiv 2609.32720 仅"面向奖励模型的自适应偏差缓解"一句话描述。具体实验任务、自适应算法细节、量化缓解效果均未知。在原文精读前,不得将具体数字锚入评测维度体系。
⚠️ 数据可靠性警示 2:The Endless Exam TLDR 极简
问题:arXiv 2609.24555 TLDR 仅描述"14 个参数化数学构造家族,无上限评分"的基本框架。具体是哪 14 个家族、参数化维度、自动化验证机制、相对质量评分的具体计算方法均未知。work-queue Top 15 第 1,优先级高,但需原文精读。
⚠️ 方法学警示:SEAL vs 人类偏好的对照缺失
问题:flyp Oct 1 精读明确指出——SEAL 的 Spearman ρ 是"vs FullPair"而非"vs 人类偏好"。FullPair 本身也是 LLM-based,ρ 高 ≠ 排名真的与人类判断一致。MIST(VLM Judge 被无关图像误导)进一步说明 LLM-as-Judge 的系统性偏差是普遍问题——SEAL 的"高精度"可能是"与另一个有偏 judge 的一致"。
⚠️ 趋势警示:RRSI 和物体永久性 HF 跌出加速
问题:RRSI 154▲ 连续第 9+ 日跌出 HF 榜单;物体永久性 198▲ 从 Oct 1 跌出第 7 日加速到 Oct 2 跌出第 8 日——立标极显著 → 跌出 信号连续 8 日。这可能影响 R90 §6.174.4 的"立标持续性检验"结论。
四、本轮 eval 主题 eval 主分类 NET-new(Oct 1-2 窗口)
eval 主分类 paper_card 新入库(Oct 1-2 窗口):
- 1614-2609.24555 The Endless Exam · 主分类 eval · benchmark · Oct 2 morning 入库
- 1619-2609.38349 MILO · 主分类 eval · method · 副分类 agent · Oct 2 morning 入库
- 1601-2609.39982 Mid-Harness · 主分类 eval · Oct 2 morning 入库(Oct 1 雷达已锚定)
- 1603-2609.39903 OSWorld-Science · 主分类 eval · Oct 2 morning 入库(Oct 1 雷达已锚定)
- 1610-2609.39841 DyRAD · 主分类 eval · benchmark · Oct 2 morning 入库(driving scenes radar NVS)
eval 邻接/副分类 eval 新入库(Oct 1-2 窗口):
- 1617-2609.38792 Training LLM Judges · 主分类 engineering · 副分类 eval · Oct 2 morning 入库
- 1618-2609.39154 DAGent · 主分类 agent · 副分类 evaluation · Oct 2 morning 入库
- 1622-2609.34274 BIABench · 主分类 agent · 副分类 evaluation · Oct 2 morning 入库
- 1613-2609.37863 MIST · 主分类 multimodal · Oct 2 morning 入库(eval 邻接)
五、可引用 arXiv 号列表
| arXiv 号 | 名称 | 本轮角色 | 主分类 |
|---|---|---|---|
| 2609.24555 | The Endless Exam | NET-new 主分类 eval ⭐⭐⭐⭐⭐ · 无上限评分数学构造 benchmark · work-queue Top 15 #1 | evaluation |
| 2609.38349 | MILO | NET-new 主分类 eval ⭐⭐⭐⭐⭐ · Agent Harness 自动发现协同进化框架 · HF 15票 | evaluation |
| 2605.30104 | SEAL | NET-new 副分类 eval ⭐⭐⭐⭐⭐ · LLM-as-Meta-Judge 两层 rubric 复活饱和基准 · flyp 深度精读 | engineering |
| 2609.32720 | BiasReducer | NET-new 邻接 eval ⭐⭐⭐⭐ · 奖励模型自适应偏差缓解 · HF 18票 #12 | — |
| 2609.37863 | MIST | NET-new 邻接 eval ⭐⭐⭐⭐ · VLM Judge 被无关图像误导 stress test · HF 36票 #7 | multimodal |
| 2609.38792 | Training LLM Judges | NET-new 副分类 eval ⭐⭐⭐⭐ · 位置选择性自蒸馏学评判标准 · HF 5票 | engineering |
| 2609.39982 | Mid-Harness | 续用锚定 · 模型-harness 边界可靠性 · HF 102票 #3 | evaluation |
| 2609.39903 | OSWorld-Science | 续用锚定 · VLM Agent 科学软件评测 · HF 25票 #10 | evaluation |
| 2609.39102 | False Frontiers | 续用锚定 · 共舞弊问题 · HF 190票 #2 | agent |
| 2609.37559 | APM-Bench | 续用锚定 · 多会话持久记忆 benchmark | multimodal |
| 2609.36730 | LibraryDesignBench | 续用锚定 · Agent 设计能力两阶段 benchmark | agent |
| 2609.39841 | DyRAD | 续用锚定 · 雷达 NVS benchmark | evaluation |
| 2609.31415 | KV Cache Reuse Eval | 续用锚定 · 评测失真批判 | llm-infra |
| 2609.29167 | IndicBankBench | 续用锚定 · 四阶段银行 Agent 评测 | evaluation |
| 2609.30867 | ARGUS | 续用锚定 · 11 维审计框架 73% vs 18% | evaluation |
| 2609.30192 | SAGE | 续用锚定 · 符号闭包分析 SCA 框架 | evaluation |
| 2609.32577 | Groupwise Agentic Grading | 续用锚定 · ⚠ 未建 paper_card | agent |
| 2609.35215 | ASCT | 续用锚定 · 反事实评估用于 Agentic RL 信用分配 | agent |
| 2609.26550 | JEV-as-a-Judge | 续用锚定 · ⚠ 持续衰减 | — |
六、下游建议
-
The Endless Exam 原文精读(高优先级):2609.24555 是 work-queue Top 15 第 1,无上限评分机制是 eval 方法论的根本性创新;需原文精读获取 14 个数学构造家族的具体信息
-
MILO 原文精读(高优先级):2609.38349 主分类 eval,是"评测 harness 本身质量"的元评测工具;协同进化算法和 lineage memory 细节需原文核实
-
SEAL FlatBrk 对照核实(中优先级):flyp 精读指出 FlatBrk(无 checklist 演化的 tournament backbone)未报告 vs FullPair 的 ρ 与延迟——这是判断"自适应 checklist 单独贡献"的关键数据,需在原文 Appendix 核查
-
MIST 200 句 benchmark 跟进(中优先级):2609.37863 HF 36票,VLM-as-Judge 的无关上下文失效模式是 eval 方法学的重要警示;建议建卡并标注待精读
-
BiasReducer 建卡(中优先级):2609.32720 是 eval 邻接的有价值信号,reward model 自适应偏差缓解对 RL 评测可靠性有直接意义;但 TLDR 极简,需原文精读后才能正式锚入
-
RRSI 和物体永久性跌出第 8+ 日信号归档(低优先级):连续多日跌出,建议在 §6.174.4 标注信号衰减趋势
七、边界声明
- ✅ 本稿仅写入
/shared/research-kb/inbox/tom/2026-10-02-evaluation-e1prep.md(整篇覆盖) - ✅ 不写
organized/knowledge/、organized/reflection/、organized/paper_cards/(由其他实例/棒位承接) - ✅ 不写 inbox/{jay,tom,spark,stephen}/ 目录
- ✅ 不写 review/
- ✅ 不 git commit / git push / gh pr
- ✅ 不输出密钥 / Token / Cookie / 验证码 / 证券账户
- ✅ 仅基于已读 inbox + paper_cards 元数据 + work-queue + evaluation.md R90 基线做轻量综合
Tom · evaluation · E1 · 2026-10-02 15:40 CST · 增量 6 条 · 18 个 arXiv 号(含续用)· 下游建议 6 条