evaluation · E1 预消化简报(2026-09-30)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-09-30 15:40 CST 窗口定义:2026-09-29 15:40 ~ 2026-09-30 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R89 基线 · 2026-09-29 16:50)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Sep 28-30 新入库条目 诚实度声明:本轮 eval 主题净增量密度"低"— eval 主分类 paper_card NET-new 净增 0 件(Sep 28-30 批次内无新增 eval 主分类 paper_card);本次 4 条增量均为 eval 邻接/副分类 eval/方法学新信号,均可锚入 R89 既有脉络。无硬凑字数。
状态摘要
- 增量条数:4 条(落在 3-8 目标区间下限,但其中 2 条为 eval 强邻接)
- 核心新增:① Groupwise Agentic Grading(2609.32577 · HF Daily 9-30 #1 · 108票 · Agent 评分与优势重分配方法论)② Chinese-Jev(2609.36965 · 决策型 Judge 中文变体 · Tom 9-30 radar 高价值)③ 关键词 vs 语义搜索定量评测框架(2609.37749 · 首个 RAG vs 关键词搜索客观评测框架 · Tom 9-30 radar 高价值)④ GPT-6 Astra VLM 评测规模确认(2609.35718 · 16830 评估点 · Stephen 9-30 ai-industry-e1prep)
- 澄清:以上 4 条均为 eval 主题直接或强邻接增量;0 件 NET-new eval 主分类 paper_card
- 涉及 arXiv 号:本次新增 5 个(2609.32577 · 2609.36965 · 2609.37749 · 2609.35718 · 2609.35215);续用锚定 280+ 个(R89 沿用)
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| inbox/tom | 2026-09-30-agent-rag-longcontext-radar.md(14:40 UTC · 8 条候选) |
极高 ⭐⭐⭐⭐⭐(Chinese-Jev + 关键词/语义搜索定量框架 2 条 eval 强邻接) |
| inbox/tom | 2026-09-30T0040-agent-rag-longcontext-radar.md(00:40 UTC · 4 条高价值) |
高 ⭐⭐⭐⭐(ASCT 副分类 eval + JAM/Stashbird/SANTA++ 邻接) |
| inbox/tom | 2026-09-30-0900-hf-daily-2026-09-30.md(HF Daily 9-30 早棒) |
极高 ⭐⭐⭐⭐⭐(Groupwise Agentic Grading 108▲ #1 + GPT-6 Astra 15▲ #9) |
| inbox/stephen | 2026-09-30-ai-industry-e1prep.md(10:20 · ai-industry 主轴) |
高 ⭐⭐⭐⭐(GPT-6 Astra 评测规模:34 项能力 + 55 个基准 + 9 个 CV 领域 + 16830 个评估点) |
| inbox/jay | 2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md |
高 ⭐⭐⭐⭐(TGI 退市 + vLLM/SGLang 双寡头 + py-kvcache + MCP 无状态化) |
| inbox/jay | 2026-09-30-engineering-e1prep.md |
中(工程主轴;Context Engineering 7 大技术含 Faithfulness 约束 12%→1.5%) |
| inbox/flyp | 2026-09-30-multimodal-e1prep.md(multimodal 主轴) |
中(Alignment Illusion NeurIPS 2026 eval 方法学反方) |
| inbox/flyp | 2026-09-30-multimodal-weekly-digest.md |
中(Alignment Illusion NeurIPS 2026 跨领域印证) |
| inbox/spark | 2026-09-30-agent-e1prep.md |
中(agent 主轴) |
| inbox/tom | 2026-09-29-evaluation-e1prep.md |
极高 ⭐⭐⭐⭐⭐(R89 基线锚定:KV Cache Reuse Eval + IndicBankBench + ARGUS + SAGE) |
| paper_cards Sep 28-30 | 1573-2609-35215 ASCT · 副分类 evaluation · agent 主分类 |
高 ⭐⭐⭐⭐(反事实评估用于 Agentic RL 信用分配 · 与 R89 SAGE 偏置归因同方向) |
| paper_cards Sep 28-30 | 1577-2609-31892 NVAlign · multimodal 主分类 |
非 eval |
| paper_cards Sep 28-30 | 1576-2609-33780 Selecting Diverse SFT Traces · engineering 主分类 |
非 eval |
| paper_cards Sep 28-30 | 1575-2609-34848 DCSD · multimodal 主分类 |
非 eval |
| paper_cards Sep 28-30 | 1574-2609-36246 OLIVE · multimodal 主分类 |
非 eval |
| paper_cards Sep 28-30 | 1572-2609-35629 SANTA++ · engineering 主分类 |
非 eval |
| paper_cards Sep 28-30 | 803-2608-06130 · (旧卡) |
非 eval |
| paper_cards Sep 28-30 | 1571-2004-07213 · BN-2004 |
非 eval |
| paper_cards Sep 28-30 | 1557-2609-34242 Stashbird · agent 主分类 |
非 eval |
| paper_cards Sep 28-30 | 1556-2609-34385 JAM · agent 主分类 |
非 eval |
| work-queue 9-30 10:00 | Top 15 = 7 件 net-new(Groupwise Agentic Grading + GPT-6 Astra + Nereus + QReason + FlowTool + EngramRAG + Relic) | 高(Groupwise Agentic Grading + GPT-6 Astra eval 邻接) |
一、增量条目
增量 1:Groupwise Agentic Grading(2609.32577)— Agent 评分与优势重分配方法论(⭐⭐⭐⭐⭐)
来源:inbox/tom/2026-09-30-0900-hf-daily-2026-09-30.md(HF Daily 9-30 早棒 #1 · 108票)· inbox/stephen/2026-09-30-ai-industry-e1prep.md · 原始来源:arXiv:2609.32577
URL:https://arxiv.org/abs/2609.32577
TLDR(原文):In reinforcement learning for code generation, we often evaluate code quality through test cases—but what if the grading process itself could be improved? We propose Groupwise Agentic Grading (GAG), a method that uses the same LLM as both judge and generator to score code, then re-weights training examples based on groupwise comparisons rather than absolute scores.
要点:
- 核心问题:代码生成 RL 中,测试用例评分可能忽略实现质量差异(冗余 commit / 临时 hack / 过度注释 vs 简洁精准实现)——与 R89 SAGE(探索偏置 + 累积偏置)方向同构:都是处理"稀疏奖励下的质量差异"
- 核心方案:Groupwise Agentic Grading——用同一 LLM 同时做评判和生成,通过组间比较而非绝对分数对训练样本重新加权
- HF 108票 · 9-30 HF Daily #1 顶置新立——这是 R89 锚定之后,eval 主题在 HF 榜单上出现的最强新信号
- 关键关联:GAG 与 R89 SAGE 的互补关系——SAGE 提供"为什么长程推理失败"的理论归因(探索偏置 + 累积偏置),GAG 提供"在信用分配层面如何区分质量"的方法论工具
与活文档 evaluation.md 现有脉络的关系: - 直接邻接 R89 §1.3 长程/多 Agent 评测基准(SAGE + AgentWorld)——GAG 是 SAGE"累积偏置"在代码 Agent RL 中的具体操作化:冗余/简洁实现的质量差异本质上是一种"微小局部偏差在深度上叠加" - 邻接 R89 §6.175.4 SAGE(符号闭包分析 SCA)——SAGE 从拓扑视角刻画偏置,GAG 从信用重分配视角缓解偏置;两者构成"归因 + 缓解"互补 - 邻接 R84 JEV-as-a-Judge(结构化 typed verdict)——GAG 的组间比较与 JEV 的结构化 verdicts 方向一致:都是让评判更细粒度 - 建议归入章节:§1.3 长程/多 Agent 评测基准(新增邻接 · GAG 2609.32577 · 组间比较评分 + 信用重分配 · HF 108票 #1 · 与 SAGE 形成"归因 + 缓解"互补)
增量 2:Chinese-Jev — 决策型 Judge 中文变体(2609.36965)(⭐⭐⭐⭐)
来源:inbox/tom/2026-09-30-agent-rag-longcontext-radar.md(14:40 UTC · 8 条候选)· 原始来源:arXiv:2609.36965
URL:https://arxiv.org/abs/2609.36965
TLDR(来源摘要):大语言模型在中文决策场景中的评估方法;决策型模型(非生成);中文决策准确率提升。
要点:
- 定位:Chinese-Jev 是 JEV(Judgment-based Evaluation)决策型 judge 的中文语言变体,针对中文决策场景优化
- 核心贡献:与 R84 JEV-as-a-Judge(英文决策 judge)形成多语言扩展——决策 judge 不只适用于英文,跨语言迁移需要语言特定优化
- 与 R89 §1.2 决策型 judge vs 生成型 judge 的关系:R89 ARGUS 73% vs 18%(气候政策领域)+ R84 JEV(英文)+ Chinese-Jev(中文)= 决策型 judge 在多个语言/领域形成跨领域印证;结构化评判优于生成式判断的原则具有语言普遍性
- ⚠️ 待核实:arXiv 原文 TLDR 极简("大语言模型在中文决策场景中的评估方法;决策型模型(非生成);中文决策准确率提升"),具体实验规模、评测数据集、量化提升数据均未知——需原文精读后才能正式锚入维度体系
与活文档 evaluation.md 现有脉络的关系: - 直接邻接 R89 §1.2 决策型 judge vs 生成型 judge——Chinese-Jev 扩展了 JEV 的语言覆盖范围,是 R84 JEV 多语言化的首个具体实现案例 - 邻接 R89 §3 维度化指标体系——"决策 judge 多语言化"可作为"跨语言评测"维度的新证据,但需原文精读数据后才能正式锚入 - 建议归入章节:§1.2 决策型 judge vs 生成型 judge(新增邻接 · Chinese-Jev 2609.36965 · JEV 中文变体 · 决策 judge 多语言扩展 · ⚠️ 需原文精读获取具体数据)
增量 3:关键词 vs 语义搜索定量评测框架(2609.37749)— 首个 RAG vs 关键词搜索客观评测框架(⭐⭐⭐⭐)
来源:inbox/tom/2026-09-30-agent-rag-longcontext-radar.md(14:40 UTC · 高价值条目 #3)· 原始来源:arXiv:2609.37749(2026-09-29)
URL:https://arxiv.org/abs/2609.37749
TLDR(来源摘要):首次提出 RAG vs 关键词搜索的定量评测框架;作者:Ben Salha 等。
要点:
- 核心贡献:首个 RAG 与关键词搜索的定量对比评测框架——在此之前,RAG vs 关键词搜索的对比多为定性讨论,缺乏客观量化评测方法
- 意义:填补了 eval 方法论的一个空白——RAG 的核心价值主张是"语义检索优于关键词",但这一主张从未被系统化地评测过
- 与 R89 §1.1 评测诚信从 harness 层延伸到指标层的关系:R89 KV Cache Reuse Eval 揭示"指标失真",本框架提供一种"新的量化评测方法"——两者都关注"评测方法本身的可靠性",方向一致但针对不同技术(RAG 检索 vs KV cache 复用)
与活文档 evaluation.md 现有脉络的关系: - 邻接 R89 §1.1 评测诚信从 harness 层延伸到指标层——R89 KV Cache Reuse Eval(指标失真批判)+ 本框架(检索评测方法论补充)= 评测诚信维度的两个新证据 - 邻接 R89 §3 维度化指标体系——检索质量评测框架可作为 RAG eval 的新维度,但需原文获取具体评测指标和数据集信息 - 建议归入章节:§1.1 评测诚信从 harness 层延伸到指标层(新增邻接 · 2609.37749 · 首个 RAG vs 关键词搜索定量评测框架 · 填补检索评测方法论空白 · ⚠️ 需原文精读获取具体指标)
增量 4:GPT-6 Astra VLM 评测规模确认 + Alignment Illusion(2609.35718 · 2609.30210)(⭐⭐⭐⭐)
来源:inbox/stephen/2026-09-30-ai-industry-e1prep.md(GPT-6 Astra 评测规模:34 项能力 + 55 个基准 + 9 个 CV 领域 + 16830 个评估点)· inbox/flyp/2026-09-30-multimodal-weekly-digest.md(Alignment Illusion NeurIPS 2026)· 原始来源:arXiv:2609.35718 + arXiv:2609.30210
URL:https://arxiv.org/abs/2609.35718(GPT-6 Astra)
要点:
GPT-6 Astra 评测规模(Stephen 9-30 ai-industry-e1prep 锚定): - 34 项能力评估 - 55 个基准数据集 - 9 个 CV 领域 - 16830 个评估点 - 形态:benchmark(副分类 evaluation) - 这是截至 2026-09-30 已知规模最大的 VLM 评测之一
Alignment Illusion(2609.30210)(flyp 9-30 multimodal-weekly-digest 提及,NeurIPS 2026): - 跨领域印证 R89 ARGUS——ARGUS 的结构化 rubric(73% vs 18%)与 Alignment Illusion 的"对齐幻象"批判形成跨领域印证:两者都揭示"现有评测方法无法捕捉真实能力缺陷" - Alignment Illusion 指出:模型可能在表面指标上表现良好,但实际对齐质量低于表面数据所显示的水平 - ⚠️ 边界:Alignment Illusion 的具体实验规模和量化数据需原文核验,暂作为跨领域印证参考
与活文档 evaluation.md 现有脉络的关系: - 邻接 R89 §2.2 评测平台与 CI Gate(IndicBankBench 四阶段 + CLEAR 五维)——GPT-6 Astra 16830 评估点是评测规模的新上限,与"多阶段多维垂类评测"方向一致但规模更大 - 邻接 R89 §6.175.3 ARGUS——Alignment Illusion 与 ARGUS 跨领域印证:结构化评测方法(优于关键词/表面指标)的重要性在多个领域得到独立验证 - 建议归入章节:§2.2 评测平台与 CI Gate(新增邻接 · GPT-6 Astra 16830 评估点 · 最大规模 VLM 评测之一)+ §6.175.3 ARGUS(Alignment Illusion 跨领域印证 · "对齐幻象"批判 · NeurIPS 2026)
二、R89 追踪更新
R89 待核事项状态
| 待核项 | 来源 | 状态 | 更新 |
|---|---|---|---|
| JEV-as-a-Judge(2609.26550) | R89 · HF 持续衰减 | ⚠ 延续衰减 | Sep 30 HF Daily 未出现 JEV-as-a-Judge;Chinese-Jev(2609.36965)新出现 = JEV 多语言扩展信号,但需原文精读 |
| KV Cache Reuse Eval Boxoffice 工具核验 | R89 · P0 行动项 | ⚠ 未进展 | Sep 29-30 无 Boxoffice 工具新信号 |
| LLM 文化意识评估(2609.31506) | R89 · 待精读 | ⚠ 仍待精读 | Sep 29-30 无新进展 |
| RRSI 154▲ #1 | R89 · ⚠⚠⚠⚠⚠⚠⚠ | ⚠⚠⚠⚠⚠⚠⚠ | Sep 30 HF Daily 仍跌出;连续第 7+ 日 |
| 物体永久性 198▲ #1 | R89 · 顶置续涨→跌出 | ⚠⚬⚬⚬⚬⚠⚠ | Sep 29 跌出第 5 日 → Sep 30 跌出第 6 日;跌出加速 |
| AV-GRPO(2609.29816) | R89 · 同步性方法学 | ✅ 维持 | flyp 9-30 multimodal-weekly-digest 再次提及 |
| ASCT(2609.35215) | Sep 30 paper_card 1573 | ⚠ 新增待核 | paper_card 已建(副分类 eval · agent 主分类)· 反事实评估用于 Agentic RL 信用分配 · 与 SAGE 同方向但未独立核实 |
| Chinese-Jev(2609.36965) | Sep 30 Tom radar | ⚠ 新增待核 | JEV 中文变体 · TLDR 极简 · 具体数据未知 |
| 关键词/语义搜索评测框架(2609.37749) | Sep 30 Tom radar | ⚠ 新增待核 | 首个 RAG vs 关键词搜索定量框架 · 具体指标未知 |
三、矛盾与警示
⚠️ 数据可靠性警示 1:Chinese-Jev TLDR 极简
问题:arXiv 2609.36965 TLDR 仅"大语言模型在中文决策场景中的评估方法;决策型模型(非生成);中文决策准确率提升"三行。具体实验规模、评测数据集、量化提升数据均未知。在原文精读前,不得将具体数字锚入评测维度体系。
⚠️ 数据可靠性警示 2:关键词/语义搜索评测框架具体指标缺失
问题:arXiv 2609.37749 TLDR 仅"首次提出 RAG vs 关键词搜索的定量评测框架;作者:Ben Salha 等"两行。具体评测指标、基准数据集、量化对比数据均未知。需原文精读后才能评估其方法论贡献。
⚠️ 趋势警示:物体永久性 HF 跌出加速
问题:物体永久性从 Sep 29 跌出第 5 日加速到 Sep 30 跌出第 6 日——立标极显著 → 跌出 双连样本第 4 例实测触发第 2 日。这可能影响 R89 §6.174.4 的"立标持续性检验"结论中的信号衰减判断。
四、本轮 eval 主题无新增主分类 paper_card 的邻接领域(R89 追踪延续)
以下邻接领域在 Sep 29-30 窗口内无 eval 主分类 NET-new,eval 主题增量主要来自邻接/副分类 eval/HF 立标新信号:
- KV Cache Reuse Eval 双重警示链:Sep 29-30 无新进展,维持 R89 锚定;Boxoffice 工具核验仍 pending
- LangChain Jev 独立验证:Sep 29-30 无新复现信号;Chinese-Jev 新出现是 JEV 语言扩展信号,但非 LangChain 场景复现
- SAGE SCA 框架:Sep 29-30 无新进展;ASCT(2609.35215 · 副分类 eval)提供反事实评估方法论,与 SAGE 同方向但未独立核实
- IndicBankBench 四阶段设计:Sep 29-30 无新跟进信号
- ARGUS 跨领域印证:Sep 30 Alignment Illusion(NeurIPS 2026)新增跨领域印证,但需原文精读
五、可引用 arXiv 号列表
| arXiv 号 | 名称 | 本轮角色 | 主分类 |
|---|---|---|---|
| 2609.32577 | Groupwise Agentic Grading | NET-new 邻接 ⭐⭐⭐⭐⭐ · HF Daily 108票 #1 · Agent 评分与优势重分配 | agent |
| 2609.36965 | Chinese-Jev | NET-new 邻接 ⭐⭐⭐⭐ · JEV 中文变体 · 决策 judge 多语言扩展 ⚠需原文精读 | — |
| 2609.37749 | 关键词 vs 语义搜索定量评测框架 | NET-new 邻接 ⭐⭐⭐⭐ · 首个 RAG vs 关键词搜索客观框架 ⚠需原文精读 | — |
| 2609.35718 | GPT-6 Astra | NET-new 邻接 ⭐⭐⭐⭐ · 16830 评估点 · 最大规模 VLM 评测之一 | multimodal |
| 2609.35215 | ASCT | 新增邻接 ⭐⭐⭐⭐ · 副分类 eval · 反事实评估用于 Agentic RL 信用分配 | agent |
| 2609.31415 | KV Cache Reuse Eval | 续用锚定 · 评测失真批判 · Boxoffice 工具 | llm-infra |
| 2609.29167 | IndicBankBench | 续用锚定 · 四阶段银行 Agent 评测 | evaluation |
| 2609.30867 | ARGUS | 续用锚定 · 11 维审计框架 73% vs 18% | evaluation |
| 2609.30192 | SAGE | 续用锚定 · 符号闭包分析 SCA 框架 | evaluation |
| 2609.26550 | JEV-as-a-Judge | 续用锚定 · ⚠ 持续衰减 | — |
| 2609.29816 | AV-GRPO | 续用锚定 · 同步性方法学 | multimodal |
六、下游建议
-
Chinese-Jev 原文精读(高优先级):2609.36965 的 TLDR 极简,需原文精读获取具体实验规模、评测数据集、量化提升数据后才能正式锚入 §1.2 决策型 judge 多语言化维度
-
关键词/语义搜索评测框架原文精读(高优先级):2609.37749 填补 RAG vs 关键词搜索量化对比空白,但具体评测指标未知,需原文精读
-
Groupwise Agentic Grading 跟进(中优先级):2609.32577 HF 108票 #1,需确认 paper_card 是否已建(work-queue 未见该 ID),建议 paper_cards 实例主动建卡
-
Boxoffice 工具集成评估(中优先级):R89 P0 行动项,Sep 29-30 无进展,维持 pending 状态
-
物体永久性跌出第 6 日信号归档(低优先级):立标极显著 → 跌出信号连续第 6 日,建议在 §6.174.4 标注
七、边界声明
- ✅ 本稿仅写入
/shared/research-kb/inbox/tom/2026-09-30-evaluation-e1prep.md(整篇覆盖) - ✅ 不写
organized/knowledge/、organized/reflection/、organized/paper_cards/(由其他实例/棒位承接) - ✅ 不写 inbox/{jay,tom,spark,stephen}/ 目录
- ✅ 不写 review/
- ✅ 不 git commit / git push / gh pr
- ✅ 不输出密钥 / Token / Cookie / 验证码 / 证券账户
- ✅ 仅基于已读 inbox + paper_cards 元数据 + work-queue + evaluation.md R89 基线做轻量综合
Tom · evaluation · E1 · 2026-09-30 15:40 CST · 增量 4 条 · 11 个 arXiv 号(含续用)· 下游建议 5 条