evaluation · E1 预消化简报(2026-09-29)
执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-09-29 15:40 CST 窗口定义:2026-09-28 15:40 ~ 2026-09-29 15:40 CST(约 24 小时滑动窗口) 底本:
organized/knowledge/evaluation.md(R88 基线 · 2026-09-28)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Sep 27-29 新入库条目 诚实度声明:本轮 eval 主题净增量密度"中偏高"— eval 主分类 paper_card 4 件新增(含 1 件直接 eval 方法论文 + 1 件 eval benchmark + 1 件 eval 邻接方法 + 1 件跨领域 benchmark 副分类 eval),另有 1 条 eval 行业数据邻接 + 1 条跨领域 LLM 文化意识评估。整体高于 R88 的"邻接为主"格局,首次出现 eval 方法论文主导的入库批次。无硬凑字数。
状态摘要
- 增量条数:5 条(落在 3-8 目标区间内)
- 核心新增:① KV Cache Reuse Eval 方法论文(2609.31415 · 副分类 evaluation · 揭示当前复用评测系统性高估精度损失)② IndicBankBench(2609.29167 · eval 主分类 benchmark · 799 案例四阶段银行 Agent 安全评测)③ ARGUS(2609.30867 · eval 主分类 · 11 维假设-含义-证据审计框架,73% vs 18%)④ SAGE(2609.30192 · eval 主分类方法论文 · 长程推理偏置的符号闭包分析 SCA 框架)⑤ LLM 文化意识评估(2609.31506 · 跨领域评估 · 海地克里奥尔语文化意识差距)
- 澄清:以上 5 条均为 eval 主题相关(4 条主分类/副分类 eval + 1 条跨领域评估论文);非硬凑邻接
- 涉及 arXiv 号:本次新增 5 个(2609.31415 · 2609.29167 · 2609.30867 · 2609.30192 · 2609.31506);续用锚定 20+ 个(R88 沿用)
〇、检查过的来源清单
| 来源目录 | 关键文件 | eval 相关度 |
|---|---|---|
| paper_cards Sep 27-29 | 1546-2609-31415 KV Cache Reuse Eval |
极高 ⭐⭐⭐⭐⭐(主分类 llm-infra / 副分类 evaluation · eval 方法论文 NET-new) |
| paper_cards Sep 27-29 | 1540-2609-29167 IndicBankBench |
极高 ⭐⭐⭐⭐⭐(主分类 evaluation benchmark NET-new · 799 案例四阶段评测) |
| paper_cards Sep 27-29 | 1538-2609-30867 ARGUS |
极高 ⭐⭐⭐⭐⭐(主分类 evaluation benchmark NET-new · 气候政策因果评估) |
| paper_cards Sep 27-29 | 1551-2609-30192 SAGE |
极高 ⭐⭐⭐⭐⭐(主分类 evaluation 方法论文 NET-new · 长程推理偏置) |
| inbox/jay | 2026-09-29-ai-engineering-trending.md |
极高 ⭐⭐⭐⭐⭐(AI Agents Stack 2026 eval 三层 + Context-Bench/Recovery-Bench/Terminal-Bench 新 benchmark 三件套) |
| inbox/jay | 2026-09-29T1450-jay-engineering-secondary-screening.md |
极高 ⭐⭐⭐⭐⭐(The AI Agents Stack 2026 eval 体系完整分析 + 协议落地 IBM ACP/Google A2A) |
| inbox/tom | 2026-09-29-0900-hf-daily-2026-09-29.md |
高 ⭐⭐⭐⭐(15 篇 HF Daily;KV Cache Reuse Eval 2609.31415 入选 Tom 雷达;Just Ask Jev 2609.29429 10▲ 持续) |
| inbox/tom | 2026-09-29-agent-rag-longcontext-radar.md |
极高 ⭐⭐⭐⭐⭐(KV Cache Reuse Eval 2609.31415 高价值标注 + SAGE 2609.30192 + RAG in 2026 综述) |
| inbox/jay | 2026-09-29-1001-rss-cool-papers.md |
高 ⭐⭐⭐⭐(cs.CL · LLM 文化意识评估 2609.31506 海地克里奥尔语) |
| inbox/jay | 2026-09-29T1105-jay-five-category-briefing.md |
中(vLLM vs SGLang benchmark 汇总) |
| inbox/jay | 2026-09-29T1050-jay-engineering-filter.md |
中(KV Cache Working Set 2609.27746 + AI Agents Stack 2026) |
| inbox/flyp | 2026-09-29-multimodal-e1prep.md |
中(多模态主轴) |
| inbox/flyp | 2026-09-29-1000-rss-cameron-wolfe.md |
中(LLM RL 评估指南) |
| inbox/flyp | 2026-09-28-coding-agents-e1prep.md |
中(coding agents 主轴;TAMP/PlanBench-XL) |
| inbox/stephen | 2026-09-29-ai-industry-e1prep.md |
中(AI 治理层;立标池结构性洗牌) |
| inbox/tom | 2026-09-28-evaluation-e1prep.md |
高(R88 基线锚定 · InferenceBench/LangChain Jev/AgentWorld/PISA/Gartner) |
| paper_cards Sep 27-29 | 1537-2608-09444 Looped LM CDB(llm-infra) |
非 eval |
| paper_cards Sep 27-29 | 1539-2609-30837 MOPD-Router(llm-infra) |
非 eval |
| paper_cards Sep 27-29 | 1541-2609-23551 Paragraph Boundaries(rag) |
非 eval |
| paper_cards Sep 27-29 | 1547-2609-31397 Intent2Tc(llm-infra) |
非 eval |
| paper_cards Sep 27-29 | 1548-2609-31291 Softmax Reparam(llm-infra) |
非 eval |
| paper_cards Sep 27-29 | 1549-2609-28327 LightMIS(multimodal) |
非 eval |
| paper_cards Sep 27-29 | 1550-2609-27213 BoundaryMORPH(rag) |
非 eval |
| paper_cards Sep 27-29 | 1552-2609-28845 LastOPD(multimodal) |
非 eval |
| paper_cards Sep 27-29 | 1553-2609-27277 TimeEvo(agent) |
非 eval |
| paper_cards Sep 27-29 | 1554-2609-26333 Disaggregated Quantization(llm-infra) |
非 eval |
| paper_cards Sep 27-29 | 1555-2609-24749 D-JEPA(agent) |
非 eval |
一、增量条目
增量 1:KV Cache Reuse Eval — 评测方法论揭示系统性高估问题(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1546-2609-31415.md(主分类 llm-infra / 副分类 evaluation · Sep 29 入库)· inbox/tom/2026-09-29-agent-rag-longcontext-radar.md(高价值标注)· 原始来源:arXiv:2609.31415v1(2026-09-25)
URL:https://arxiv.org/abs/2609.31415v1
TLDR(原文):Position-independent KV cache reuse aims to reduce latency in retrieval-augmented generation by reusing chunk-level KV caches across prompts. We show that current evaluations of KV cache reuse techniques rely on measurements that fail to faithfully capture the loss of accuracy attributable to reuse, often artificially inflating the reported effectiveness. We also show that existing datasets do not exhibit the reuse dynamics needed to thoroughly evaluate such techniques. To address these issues, we propose an evaluation methodology that measures this accuracy loss without ambiguity and we introduce [Boxoffice tool].
要点(与 R88 无重复,全 NET-new):
当前 KV cache reuse 评测方法存在系统性高估精度损失的问题,核心原因: 1. 指标失真:现有评测依赖的指标无法忠实反映复用导致的精度损失,往往人为夸大报告的有效性(artificially inflating reported effectiveness) 2. 数据集不覆盖复用动态:现有数据集不具备充分评估复用技术所需的动态特性 3. Boxoffice 工具:提出无歧义衡量精度损失的评测方法 + 可程序化生成复用场景的工具
为什么这是 eval 方法论层面的重大发现: - 不是提出新的复用技术,而是揭示现有复用评测方法论的根本缺陷——属于"元评测批判"(meta-evaluation critique)范畴 - 与 R88 §6.174.4 PISA(长上下文注意力效率评测)同属"评测基础设施"方向,但本条直接针对评测方法本身的可信度问题 - Boxoffice 工具可程序化生成复用场景,这是 eval 基础设施化的具体实现 - 对 RAG 生产系统的直接影响:如果复用评测高估了有效性,生产部署时可能遭遇未预期的精度下降
与 R88 锚定的 Continnum(2511.02230)的关系: - Continnum 揭示了 vLLM 默认驱逐策略的工程缺陷(多轮 Agent KV Cache 失效) - 本条(2609.31415)揭示的是评测方法论层面的缺陷——即使 Continnum 修复了驱逐策略,其评测数据也可能高估效果 - 两者构成"工程缺陷(Continnum)+ 评测失真(本文)"的双重警示
与活文档 evaluation.md 现有脉络的关系: - 与 R88 §6.174.4 PISA(长上下文评测基础设施)同属评测方法论方向,但 PISA 是底层架构效率,本条是评测指标本身的失真问题 - 与 R87 §6.173 R88 矛盾 P1(行业数据样本偏差)同属"评测可信度批判"方向——R88 揭示的是行业调研的选择性偏差,本条揭示的是 benchmark 指标的系统性失真 - 可作为 §6.174.5 新增段:评测方法论批判的新证据
建议归入章节:§6.174.5 KV Cache Reuse Eval 评测失真批判(NET-new eval 方法论文 · 2609.31415 · 指标失真 + 数据集缺失 + Boxoffice 工具 + Continnum 双链警示)
增量 2:IndicBankBench(2609.29167)— 印度零售银行 Agent 安全四阶段评测基准(⭐⭐⭐⭐⭐)
来源:organized/paper_cards/1540-2609-29167.md(主分类 evaluation / 形态 benchmark · Sep 28 入库)· inbox/tom/2026-09-28T2040-agent-rag-longcontext-radar.md(Tom 文献雷达候选)· 原始来源:arXiv:2609.29167
URL:https://arxiv.org/abs/2609.29167
TLDR(原文):Banking assistants must use account-specific information to answer requests and, in many cases, take actions through tools. Evaluating only the final response misses important errors. An assistant may ask for information it already has, rely on stale context, select the wrong account, or write an invalid value after stating the correct one. We introduce IndicBankBench, a 799-case benchmark for Indian retail banking spanning five operational domains, a capability/refusal domain, and twenty primary axes. Cases are evaluated at four stages: safety, action and tool use, response adequacy, and advice quality.
要点(与 R88 无重复,全 NET-new):
| 维度 | 数据 |
|---|---|
| 案例数 | 799 个印度零售银行案例 |
| 评估阶段 | 四阶段:①安全性 ②动作与工具使用 ③回答充分性 ④建议质量 |
| 领域覆盖 | 五个运营领域 + 一个能力/拒答领域 |
| 评估维度 | 二十个主要轴线 |
| 核心洞察 | 仅评估最终回答会遗漏重要错误——助手可能询问已知信息、依赖过时上下文、选错账户、或陈述正确值后写入无效值 |
为什么这是 eval benchmark 的重要新增: - 四阶段评测设计比传统"仅看最终回答"更接近真实 Agent 故障模式——直接对应 R88 InferenceBench(元评测)之外的真实 Agent 评测方法论 - 印度零售银行场景是垂类高风险场景(金融工具调用 + 账户级上下文 + 合规要求),对评估工具型 Agent 的安全性和可靠性有独特价值 - 二十个主要评估维度提供细粒度的多维指标体系,可作为 RAG/Agent 多维评测设计的参考案例
与活文档 evaluation.md 现有脉络的关系: - 与 R83 GameHorizon Suite(multi-agent 协作长时域)+ R88 AgentWorld(50+ 轮多 Agent 协作)同属"多 Agent / 工具型 Agent 评测"方向,但 IndicBankBench 更强调安全性和中间过程错误,而非最终输出质量 - 与 R86 CLEAR 五维 37% lab-prod gap 同属"多维评测框架",但 IndicBankBench 是垂类(金融)而非通用评测 - 可作为 §2.2 评测平台与 CI Gate 的新增 benchmark 候选(IndicBankBench 799 案例 / 四阶段 / 二十维)
建议归入章节:§2.2 评测平台与 CI Gate(NET-new benchmark · IndicBankBench 799 案例 / 四阶段 / 二十维 · 银行 Agent 安全评测 · 中间过程错误捕获设计理念)
增量 3:ARGUS(2609.30867)— 气候政策因果评估的 11 维假设-含义-证据审计框架(⭐⭐⭐⭐)
来源:organized/paper_cards/1538-2609-30867.md(主分类 evaluation / 形态 benchmark · Sep 28 入库)· 原始来源:arXiv:2609.30867
URL:https://arxiv.org/abs/2609.30867
TLDR(原文):Difference-in-differences (DID) studies are widely used to evaluate climate policy, but assessing the evidence supporting their identification assumptions remains challenging. We introduce ARGUS, a structured language-model pipeline that audits reported evidence against an eleven-dimension assumption-implication-evidence rubric and abstains when relevant evidence cannot be retrieved. We evaluate ARGUS using injected flaws, economics papers, and a small pilot with reconciled labels. On the 11-flaw benchmark, ARGUS detects 73% of planted flaws, compared with 18% for a keyword-based pipeline.
要点(与 R88 无直接重复,但为跨领域 benchmark):
| 维度 | 数据 |
|---|---|
| 目标 | 评估气候政策双重差分(DID)研究的识别假设证据质量 |
| 框架 | 十一维假设-含义-证据评估标准(assumption-implication-evidence rubric) |
| 检测率 | ARGUS 73% vs 关键词流水线 18%(11 类缺陷基准) |
| 弃答机制 | 无法检索相关证据时主动弃答(abstains when relevant evidence cannot be retrieved) |
| 应用场景 | 经济学论文注入缺陷 + 小规模协调标签试点 |
为什么这是 eval 领域的间接重要新增: - ARGUS 不是 LLM/Agent benchmark,但其11 维审计框架 + 主动弃答机制对 LLM/Agent eval 设计有方法论参考价值 - 73% vs 18% 的差距直接证明:结构化 rubric(ARGUS)远优于关键词匹配(keyword-based),这与 R84 JEV(决策型 judge 结构化 vs LLM judge 开放文本)的对比高度一致 - 主动弃答机制是 eval 诚信设计的重要细节——当证据不足时不应强行生成判断,与 R86 ImpossibleRubrics(★评测诚信三件套)的精神相通
⚠️ 跨领域边界说明:ARGUS 是气候经济学 eval 方法,不是 LLM/Agent eval——引用时需明确边界,不宜直接类比 LLM benchmark 效果
与活文档 evaluation.md 现有脉络的关系: - 与 R88 §6.173 R88 矛盾 P1(评测诚信)方向一致:ARGUS 的主动弃答机制与 ImpossibleRubrics 的"拒绝不诚实评测"精神同构 - 与 R84 JEV(结构化 typed verdict vs 开放文本生成)形成跨领域印证:结构化评估框架在多个领域优于关键词/生成式方法 - 可作为 §6.174.6 新增:跨领域 eval 框架参考(11 维审计 + 主动弃答 + 结构化 rubric > 关键词匹配)
建议归入章节:§6.174.6 跨领域评测框架参考(NET-new benchmark 邻接 · ARGUS 2609.30867 · 11 维假设-证据审计 · 73% vs 18% · 主动弃答机制 · 气候政策因果评估 · 引用边界:非 LLM 主轴,需注明跨领域性质)
增量 4:SAGE(2609.30192)— 符号闭包分析缓解长程推理偏置的方法论文(⭐⭐⭐⭐)
来源:organized/paper_cards/1551-2609-30192.md(主分类 evaluation / 形态 method · Sep 29 入库)· inbox/tom/2026-09-29-agent-rag-longcontext-radar.md(高价值标注)· 原始来源:arXiv:2609.30192(2026-09-23)
URL:https://arxiv.org/abs/2609.30192
TLDR(原文):Long-horizon reasoning remains a central challenge for large language models (LLMs) under sparse-reward regimes. We argue that this brittleness arises from two biases induced by complex reasoning spaces: an exploration bias (locally plausible but structurally unstable branches) and a compounding bias (small local deviations accumulate across depth and suppress rare rewards). We introduce Symbolic Closure Analysis (SCA) as a theoretical lens characterizing how branching structures and sparse rewards induce these biases in long-horizon reasoning.
要点(与 R88 无直接重复,eval 方法论文):
| 偏置类型 | 描述 |
|---|---|
| 探索偏置(Exploration Bias) | 模型被局部合理但结构不稳定的分支吸引 |
| 累积偏置(Compounding Bias) | 微小局部偏差在深度上叠加,压制稀有奖励 |
| 理论工具 | 符号闭包分析(SCA)——从拓扑视角刻画偏差并作为结构化推理的设计原则 |
为什么这是 eval 方法论文的重要新增: - SAGE 提出SCA 框架用于理解和评测长程推理中的系统性偏置,是评测设计的新方法论工具 - 长程推理的两大偏置(探索偏置 + 累积偏置)为设计长程 benchmark 提供了理论归因框架——可以更精准地设计"哪些维度"的评测任务 - 与 R88 AgentWorld(50+ 轮多 Agent 协作长程 benchmark)形成方法论互补:AgentWorld 设计 benchmark,SAGE 提供理解/归因长程失败的理论工具
与活文档 evaluation.md 现有脉络的关系: - 与 R88 §1.3 长程/多 Agent 评测基准(AgentWorld)同属长程推理方向,但 AgentWorld 是 benchmark 实例,SAGE 是设计原则/归因方法论 - 与 R88 §6.174.3 AgentWorld(多 Agent 长程协作评测)形成互补:AgentWorld 描述"评什么",SAGE 解释"为什么长程评测难" - 可作为 §1.3 的方法论补充:长程评测偏置的理论归因(SCA 框架)
建议归入章节:§1.3 长程/多 Agent 评测基准(方法论文新增 · SAGE 2609.30192 · 符号闭包分析 SCA 框架 · 探索偏置 + 累积偏置 · 长程评测理论归因工具 · 与 AgentWorld 形成 benchmark + 归因方法论互补)
增量 5:LLM 文化意识评估 — 海地克里奥尔语文化意识差距(2609.31506)(⭐⭐⭐)
来源:inbox/jay/2026-09-29-1001-rss-cool-papers.md(cs.CL Cool Papers · 2026-09-29)· 原始来源:arXiv:2609.31506
URL:https://arxiv.org/abs/2609.31506
TLDR(原文摘要):大语言模型(LLMs)在高资源语言与低资源语言之间表现出显著的性能差距。除了任务性能较低外,它们往往无法捕捉文化特定的知识和语境——本工作评估 LLM 对海地克里奥尔语的文化意识。
要点(跨领域 eval,边界说明):
- 核心发现:LLM 在高资源语言 vs 低资源语言之间存在文化意识差距,而非仅仅是任务性能的差距
- 海地克里奥尔语(Haitian Creole)是低资源语言的代表,用于揭示当前 LLM 文化代表性的系统性缺陷
- 评估维度:文化特定知识和语境捕捉能力
为什么这是 eval 领域的间接新增: - 不是 LLM/Agent benchmark 本身,而是LLM 文化意识评估的方法论示例——揭示了 eval 维度的新方向(文化意识 / 低资源语言 / 非英语中心) - 与 R88 §3 维度化指标体系相关:为"多语言/跨文化评测"维度提供新的证据案例 - 提醒:在设计 benchmark 时需注意语言和文化覆盖的平衡,避免 benchmark 本身成为"英语/西方文化中心"的评估工具
⚠️ 重要边界说明:arXiv 2609.31506 TLDR 中文内容基于 Cool Papers 摘要直译,未精读原文;具体实验规模、评估指标体系、量化差距数据均未知——需原文精读后才能正式锚入评价维度体系
与活文档 evaluation.md 现有脉络的关系: - 与 R88 §3 维度化指标体系(R60 → R88 累积)方向一致,属于评测维度扩张的证据 - 可作为"跨语言/跨文化评测"维度的预备级参考,但需原文精读获取具体数据 - 建议归入 §3 维度化指标体系的"待精读补充"条目,而非正式锚定段
建议归入章节:§3 维度化指标体系(待精读补充 · 2609.31506 · LLM 文化意识差距 · 低资源语言评估维度 · 海地克里奥尔语案例 · ⚠️ 需原文精读获取具体数据后再正式锚定)
二、R88 追踪更新
R88 待核事项状态
| 待核项 | 来源 | 状态 | 更新 |
|---|---|---|---|
| JEV-as-a-Judge(2609.26550) | R88 · HF 持续衰减 | ⚠ 持续衰减 | Sep 29 HF Daily 仍出现 Just Ask Jev(2609.29429 · RLCDAlignBench)10▲;但 JEV-as-a-Judge(2609.26550)无 Sep 29 HF Top15 记录;LangChain Jev 100% 一致(R88 新增)已在本文档锚定 |
| pending eval 项:AutoTuneBench | R88 §待核 | ❓ 未确认 | Sep 27-29 无新信号 |
| pending eval 项:AgentSysBench | R88 §待核 | ❓ 未确认 | Sep 27-29 无新信号 |
| pending eval 项:EDGE-EVAL | R88 §待核 | ❓ 未确认 | Sep 27-29 无新信号 |
| RRSI 154▲ #1 | R88 · ⚠⚠⚠⚠⚠⚠⚠ R89 前需降级决定 | ⚠ 延续 | Sep 28 无 HF Top15 记录;Sep 29 HF Daily 未出现 RRSI 相关条目 |
| 物体永久性 198▲ #1 | R88 · 顶置续涨 | ⚠⚬⚬ | Sep 28 HF Daily 出现 203▲ +5▲(续涨减速信号);Sep 29 HF Daily 未出现物体永久性相关条目 |
| AV-GRPO(2609.29816) | R88 · 同步性方法学 | ✅ 持续 | Sep 29 work-queue 选题榜仍为 AV-GRPO(未成视频脚本);flyp 9-28 multimodal-e1prep 沿用 |
三、矛盾与警示
⚠️ 重要矛盾:KV Cache Reuse 评测高估 vs 现有复用技术评价体系
矛盾描述:2609.31415 揭示当前 KV cache reuse 评测系统性高估精度损失,而 Sep 28 engineering 相关内容(Continnum 2511.02230 · KVSET 2609.27746 · SGLang vs vLLM TTFT 4.5x 数据)中大量引用基于"现有评测方法"的 benchmark 数据。这意味着:基于当前评测数据做出的工程决策(如 SGLang vs vLLM 的 KV Cache 策略选择)可能建立在失真的评估数据之上。
影响:如果复用评测高估了有效性,那么 Continnum 揭示的"默认驱逐策略导致 41.2% vs 78.6% KV Cache 命中率差距"可能被进一步放大——因为现有评测已高估了复用技术的精度。
建议:在 evaluation.md 中建立专项警示:"KV cache reuse 评测数据需用 Boxoffice 工具(2609.31415)重新核验后再用于工程决策"。
⚠️ 数据可靠性警示:LLM 文化意识评估(2609.31506)未精读
问题:arXiv 2609.31506 的引用完全基于 Cool Papers 摘要直译,具体实验规模、评估指标体系、量化差距数据均未知。在原文精读前,不得将具体数字锚入评测维度体系。
⚠️ ARGUS 跨领域边界
问题:ARGUS(2609.30867)是气候政策评估框架,不是 LLM/Agent eval——引用时若不注明跨领域性质,可能导致读者错误类比。气候政策 DID 评估 ≠ LLM benchmark 效果,不宜直接跨领域迁移数据。
四、本轮无 eval 新增的邻接领域(R88 追踪延续)
以下邻接领域在 Sep 28-29 窗口内无 eval 主题净新增,仅维持 R88 基线:
- InferenceBench 元评测范式:Sep 29 无新数据,维持 R88 锚定;Sonnet 4.6 8.08× / Claude Fable 5.1 9.83× 数据沿用
- LangChain Jev 100% 独立验证:Sep 29 无新复现信号,维持 R88 锚定;HF 社区热度衰减 vs 工业级胜出反向背离维持
- AgentWorld(2609.31590):Sep 29 无新信号,维持 R88 锚定
- PISA(2609.31093):Sep 29 HF Daily 维持 20▲ 票数,沿用 R88 锚定
- AI Engineer Stack 2026 Eval 层:Jay Sep 29 engineering filter 提及 Context-Bench / Recovery-Bench / Terminal-Bench 新 benchmark 三件套,但需原文核验,暂作邻接参考
五、可引用 arXiv 号列表
| arXiv 号 | 名称 | 本轮角色 | 主分类 |
|---|---|---|---|
| 2609.31415 | Evaluating the accuracy of KV cache reuse techniques | NET-new ⭐⭐⭐⭐⭐ · eval 方法论文 · Boxoffice 工具 · 评测失真揭示 | llm-infra / eval 副分类 |
| 2609.29167 | IndicBankBench | NET-new ⭐⭐⭐⭐⭐ · eval benchmark · 799 案例四阶段银行 Agent 评测 | evaluation |
| 2609.30867 | ARGUS | NET-new ⭐⭐⭐⭐ · eval benchmark · 11 维审计框架 · 73% vs 18% | evaluation |
| 2609.30192 | SAGE | NET-new ⭐⭐⭐⭐ · eval 方法论文 · 符号闭包分析 SCA · 长程推理偏置 | evaluation |
| 2609.31506 | 评估 LLM 对海地克里奥尔语的文化意识 | NET-new 邻接 ⭐⭐⭐ · 跨领域文化意识评估 · ⚠️ 需原文精读 | cs.CL(未确认) |
| 2607.20468 | InferenceBench | 续用锚定 · 元评测新范式 | — |
| 2609.31590 | AgentWorld | 续用锚定 · 多 Agent 长程协作 | — |
| 2609.31093 | PISA | 续用锚定 · 块稀疏注意力金字塔 Top-K | — |
| 2511.02230 | Continnum | 续用锚定 · KV Cache 驱逐缺陷(与 2609.31415 形成双重警示) | — |
| 2609.29429 | Just Ask Jev RLCDAlignBench | 续用锚定 · Sep 29 HF Daily 10▲ 持续 | — |
| 2609.26550 | JEV-as-a-Judge | 续用锚定 · ⚠ 持续衰减 | — |
| 2609.27746 | KVSET | 续用锚定 · 在线容量规划 | — |
六、下游建议
-
Boxoffice 工具核验(高优先级):2609.31415 的 Boxoffice 工具可程序化生成 KV cache 复用评测场景,建议评估是否可集成到 RAG/Agent eval 流程中,作为"评测基础设施诚信校验"工具
-
IndicBankBench 四阶段设计方法学提炼(高优先级):四阶段评测(安全性 → 动作与工具使用 → 回答充分性 → 建议质量)是垂类高风险 Agent 评测的完整 pipeline 设计范本,建议提炼其"中间过程错误捕获"设计理念进入 evaluation.md §2.2
-
SAGE SCA 框架与 AgentWorld 联合归档(中优先级):SAGE(长程偏置理论归因)+ AgentWorld(50+ 轮协作 benchmark 实测)构成"方法论 + 实测"互补,建议在 §1.3 长程评测部分联合锚定
-
2609.31506 原文精读(中优先级):海地克里奥尔语文化意识评估需原文精读获取具体数据后,方可正式锚入评测维度体系
-
ARGUS 跨领域引用边界标注(低优先级):在 evaluation.md 中引用 ARGUS 时需明确注明"气候政策评估,非 LLM 主轴",防止跨领域误导
-
AutoTuneBench / AgentSysBench / EDGE-EVAL 主动检索(R89 行动项):Sep 27-29 窗口内三项目仍无信号,建议 R89 主动在 arXiv/scivac 进行定向检索而非被动等待
Tom · evaluation · E1 · 2026-09-29 15:40 CST · 增量 5 条 · 12 个 arXiv 号 · 下游建议 6 条