evaluation · E1 预消化简报(2026-07-21)

执行时间:2026-07-21 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-19~7-21)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 426-456)中该主题条目 对照活文档/shared/research-kb/organized/knowledge/evaluation.md R23(cutoff 2026-07-21 00:10 CST) 本文性质:Tom cron 4ec36223 触发的 evaluation 主题 E1 日间预消化,不重写 evaluation.md;只列 7-20~7-21 新增/补漏 + 待活文档 R24 消化的方向


0. 综述判断

R23(7-21 00:10)已非常饱和——14 维信号 + JRH 六维 judge 可靠性测试 + Harness Engineering 三件套 + Compass 六件套 + Rethinking Harness Evolution 三层反方 + CoT 压缩-可监控性前沿 + 89%/52% 缺口量化 + 垂直具身评测分化 + 7-20 HF Daily 票数更新。7-20~7-21 新增增量以新评测方向立标 + 反方深化 + 跨域连接为主,无 JRH 级别的 judge 校准新突破,无新 benchmark 达到 SOTA 票数段。

7-20~7-21 增量性质:★ 无全新评测框架;★ 无 JRH 级别的 judge 校准新突破;★ 有 Cost-Aware Security Agent 评测第三维度立标、Behavioral Privacy Leakage 行为隐私新方向、SpecBench/LoCoBench flyp 精读深化、RAG 评测人类中心化方向确认。

本次 E1 净增量 4 条(均已有 paper_cards 或 inbox 原始出处,不重复做反方审稿,只归位)。


1. 增量条目(4 条主线)

增量 1 · Cost-Aware Evaluation of Offensive and Defensive Security Agents:评测第三维度——成本(★ R24 新增方向立标)

字段 内容
来源 paper_cards/482-2607-15263.md(paper_cards 序号 482,arXiv:2607.15263,OpenAlex 2026-07-21 更新,主分类 agent/benchmark,副分类 evaluation);spark/2026-07-21-agent-e1prep.md §增量 1
arXiv 号 arXiv:2607.15263 · Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
一句话 首次将"成本-成功率"作为安全 Agent 评测硬维度——现有评测只测 best-case 攻击成功率(generous inference budget),忽略 reasoning step / tool call / telemetry query / enrichment request 每个动作消耗的预算;在 Cybench 攻击侧 + Splunk BOTS v1 防御侧双向评测,在固定成本预算下比较不同模型,分解 inference spend 维度;与 Artificial Analysis Coding Agent Index 32× cost spread + Kili 37% lab-vs-production + AI Engineer Stack 89%/52% 同源,"成本是 Agent 工业级评测的第三维度(精度 + 速度 + 成本)合并成熟"。
与 R23 脉络关系 R23 §1 第 14 维(CoT 压缩-可监控性前沿)已覆盖"评测对象第 16 维";本增量新增:成本-成功率作为评测第三维度——独立于精度和速度之外的可操作化成本维度,与 R23 §3.3 CI Gate #19"eval 实施缺口 37pp gate"互补(一个是 eval 实施率,一个是 eval 内部的 cost-quality tradeoff);与 R23 §2.7 Agent 46+ 件套中的 BadWAM(thinking-doing gap)同属"失败模式成本"维度。
反方/风险 HF 3 票为低热度候选,工业关注度待验证;paper_card TLDR 截断,具体模型数字未给,需 PDF 核;"成本-成功率"维度是否可迁移到通用(非安全)Agent 评测需横向验证
建议归入节 §1 现状全景"第 15 维信号"新增一行"成本-成功率作为评测第三维度";§2.7 评测对象横向分化"Agent 46+ 件套"补 Cost-Aware Security Agent;§3.3 CI Gate #19 补"Cost-Aware 安全 Agent 评测 gate";§5 评测对象分化六十七 → 六十八个子领域(新增"安全 Agent 成本-成功率评测");§7.1 共识新增第 19 条;§7.2 争议新增第 23 条("成本维度是否应纳入所有 Agent 评测,还是仅限安全场景")

增量 2 · Behavioral Privacy Leakage in Agentic Negotiation:行为隐私作为评测新维度(★ R24 §2.6 新增条目)

字段 内容
来源 paper_cards/487-2607-06815.md(paper_cards 序号 487,arXiv:2607.06815,OpenAlex 2026-07-21 更新,主分类 agent/application,副分类 llm-infra);spark/2026-07-21-agent-e1prep.md §增量 2;stephen/2026-07-21-ai-industry-e1prep.md §增量 7
arXiv 号 arXiv:2607.06815 · Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies
一句话 首次形式化"行为差分隐私"威胁模型——加密技术保护显式披露的约束值,但攻击者从可观察的让步轨迹(concession trajectories)+ 谈判时机(timing)+ 收敛模式(convergence patterns)推断私人约束(谈判区间/底线);设计自适应随机谈判策略,联合保证 (ε, δ)-差分隐私 + 几乎确定收敛;应用于保险/采购等高风险谈判场景;与 Lucid 多模态记忆黑盒视觉攻击(arXiv:2607.15657)+ OWASP MCP Top 10 + Token-Flow Firewall 合流,"Agent 安全 = 投毒 + 记忆 + RCE + 行为隐私"4 维合并成熟。
与 R23 脉络关系 R23 §6 评测方法学批判已有 Rethinking Harness Evolution 三层反方体系;本增量新增:行为隐私作为评测新维度——不属于技术漏洞,而属于行为轨迹推断的信息泄露层面,与 R23 §6.22 "JRH 六维是否覆盖语义级错误模式"批判同属评测元方法学层;与 R23 §6.22 L1 matched budget loophole(信息泄露角度不同但同属"协议层漏洞")。
反方/风险 TLDR 截断,ε/δ 具体数字未给,需 PDF 核;"几乎确定收敛"的样本复杂度与隐私预算的 tradeoff 未披露;应用场景(保险/采购)代表性及向多 Agent 通用谈判协议的迁移性待核;HF Daily 未上榜,工业关注度低
建议归入节 §2.7 评测对象横向分化"Agent 46+ 件套"补 Behavioral Privacy Leakage;§5 评测对象分化六十八个子领域新增第六十九个("行为隐私泄露评测");§6.22 补新批判条目"行为差分隐私:LLM-as-judge 的行为推断攻击面"(独立于 JRH 六维之外的新攻击维度);§7.2 争议新增第 24 条("行为隐私是否应纳入 judge 校准测试的第七维");⚠️ ε/δ 数字待 PDF 核

增量 3 · SpecBench + LoCoBench Agent 精读深化:reward hacking gap 与长上下文软件工程评测(★ R24 §2.7 §6 补强)

字段 内容
来源 flyp/2026-07-20-SpecBench-Reward-Hacking-LongHorizon-Coding-Agents-critical-read.md(flyP E2 精读);flyp/2026-07-20-LoCoBench-Agent-longcontext-coding-agent-critical-read.md(flyP v2 重写精读)
arXiv 号 arXiv:2605.21384 · SpecBench(flyP E2 精读);arXiv:2511.13998 · LoCoBench-Agent(flyP v2 重写)
一句话 SpecBench:把 reward hacking 做出可量化指标——hacking_gap = val_pass - holdout_pass,每 10× 代码量增加约 28pp gap;2,900 行"hash-table compiler"实际是查表背测试输入的反例;与 SWE-EVO / LongCLI-Bench / RoadmapBench 形成 long-horizon coding agent 评估矩阵。LoCoBench-Agent:把 LoCoBench 8000 个单轮 long-context code 场景升级为带 8 个工具的交互式 agent 环境,comprehension vs efficiency 双轴揭示"探索越深、理解越好,但 token/调用次数也跟着上去"的负相关曲线;9 metrics × 8 tools × 10K–1M tokens 上下文阶梯。
与 R23 脉络关系 R23 §6.22 已有 Rethinking Harness Evolution 反方深化;本增量补强两个方向:① SpecBench 的 hacking_gap 量化指标(与 Rethinking Harness Evolution matched budget 协议互补——前者量化"harness 被 hacking",后者质疑"harness evolution 自身的评测协议");② LoCoBench-Agent 的 comprehension vs efficiency 双轴(与 R23 §1 CoT 压缩-可监控性前沿同属"效率-质量 tradeoff"维度家族)。
建议归入节 §2.7 评测对象横向分化"Agent 46+ 件套"补 SpecBench + LoCoBench-Agent;§6.22 补"SpecBench hacking_gap 量化指标"与"Rethinking Harness Evolution matched budget 协议"的互补关系(★ L2 反方);§5 评测对象分化六十九个子领域新增第七十个("reward hacking gap 量化评测");⚠️ SpecBench held-out 设计是否真不进入 prompt/工具反馈,需 PDF 核;⚠️ LoCoBench-Agent 工具集 Salesforce 内部风格代表性待核

增量 4 · Agentic RAG 评测 + Human-Centric RAG 评测:评测方法论双线确认(★ R24 §2.7 §5 补强)

字段 内容
来源 jay/2026-07-21-1500-evening-briefing-cidr-dbhammer-raschka-agentic-rag-hf-ecosystem.md §四(arXiv:2606.05658,ECIR 2026);paper_cards/465-2607-15963.md(arXiv:2607.15963,主分类 rag/benchmark,副分类 evaluation);jay/2026-07-21-1500-evening-briefing §五(arXiv:2604.18234,SynIRgy Workshop @ ECIR 2026)
arXiv 号 arXiv:2606.05658 · Agent-Orchestrated Adaptive RAG(ECIR 2026);arXiv:2607.15963 · Human-Centric Evaluation of RAG System(魁北克汽车保险合同,154 参与者);arXiv:2604.18234 · Multi-Hop Reasoning in RAG(LLM Retriever 评估策略)
一句话 Agent-Orchestrated Adaptive RAG(arXiv:2606.05658):DevOps 知识库下 MRR +0.17,但 MuSiQue 多跳场景下 MRR 下降——查询分解在结构化域有效,在复杂推理链上引入噪声;引用准确率提升但延迟代价高,反思机制是双刃剑。Human-Centric RAG Evaluation(arXiv:2607.15963):154 名参与者的真实用户研究,RAG 解释汽车保险合同被评为"认知均衡器"——高评分但认知努力显著降低;存在对系统过度依赖风险。Multi-Hop RAG Retriever Evaluation(arXiv:2604.18234):多跳场景下 LLM 作为检索评估器的不同策略对比,与 arXiv:2606.05658 构成 RAG 评估方法论互补。
与 R23 脉络关系 R23 §2.7 RAG 二十二件套中已有 MemoryAgentBench(arXiv:2507.05257);本增量补强:① Agentic RAG 适应性评测(结构化 vs 开放域的分化)+ Multi-Hop RAG retriever 评测框架 = RAG 评测套件的方法论互补性;② Human-Centric RAG Evaluation 是 benchmark vs human study 范式转换信号,与 R23 §6.22 JRH 六维中的 human-in-the-loop review 维度呼应(但 RAG 场景的 human-in-the-loop 与 judge 场景不同)。
建议归入节 §2.7 RAG 二十二件套补 Agent-Orchestrated Adaptive RAG + Multi-Hop RAG Retriever Evaluation + Human-Centric RAG Evaluation(3 件);§5 评测对象分化补第七十一个("Agentic RAG 适应性评测")+ 第七十二个("Human-Centric RAG 用户研究评测");§7.1 共识新增第 20 条("Agentic RAG 反思机制在结构化域有效但在复杂推理链上有副作用");⚠️ arXiv:2606.05658 MRR +0.17 仅 DevOps 单一领域,代表性待核

2. 与 R23 活文档已有脉络的对照

R23 节点 7-20~7-21 新增引用 R24 沿用候选判断
§6.22 反方体系(JRH 六维 + Rethinking Harness Evolution 三层) SpecBench hacking_gap 量化指标 + Behavioral Privacy Leakage 行为推断攻击面 🟢 R24 §6.22 补强:SpecBench hacking_gap 与 matched budget 协议互补(L2)+ 行为隐私作为第七维候选(L1)
§1 第 14 维(CoT 压缩-可监控性前沿) LoCoBench-Agent comprehension vs efficiency 双轴(负相关曲线) 🟢 R24 §1 新增"效率-质量负相关曲线"作为 CoT 监控性的工程实例补强
§2.7 Agent 46+ 件套 Cost-Aware Security Agent + Behavioral Privacy Leakage + SpecBench + LoCoBench-Agent 🟢 R24 §2.7 补强:Agent 46+ → 50+ 件套(+4 件)
§2.7 RAG 二十二件套 Agentic Adaptive RAG + Multi-Hop RAG + Human-Centric RAG(+3 件) 🟢 R24 §2.7 RAG 二十二 → 二十五件套(+3 件)
§3.3 CI Gate #19(eval 实施缺口 gate) Cost-Aware Security Agent 评测 gate(固定成本预算下评测) 🟢 R24 §3.3 补强:CI Gate #19 补"Cost-Aware gate"
§5 评测对象分化(67 子领域) Cost-Aware + Behavioral Privacy + hacking_gap + Agentic RAG + Human-Centric RAG(+5 子领域) 🟢 R24 §5 67 → 72 子领域(+5)
§7.1 共识 18 条 "成本第三维度"共识 + "Agentic RAG 反思双刃剑"共识 🟢 R24 §7.1 18 → 20 条(+2)
§7.2 争议 22 条 成本维度适用范围 + 行为隐私第七维 🟢 R24 §7.2 22 → 24 条(+2)

3. 值得警惕的矛盾或待核实说法

3.1 待核实 · Cost-Aware Security Agent 具体评测数字

  • 来源:paper_cards/482(arXiv:2607.15263),TLDR 截断
  • 风险:paper_card TLDR 未给具体模型在 Cybench + Splunk BOTS v1 固定预算下的成功率分布;"成本-成功率"评测框架的核心证据依赖这些数字
  • 核实路径:抓 PDF + Splunk BOTS v1 官方基准描述
  • 建议:R24 §1 第 15 维信号标注「⚠️ Cost-Aware 数字待 PDF 核」

3.2 待核实 · Behavioral Privacy Leakage ε/δ 数字与收敛速度

  • 来源:paper_cards/487(arXiv:2607.06815),TLDR 截断
  • 风险:ε/δ 具体数字未披露(是 0.1/1e-5 还是 0.5/1e-3?);"几乎确定收敛"速率未知;在保险/采购真实场景谈判回合数下 ε 是否仍有效
  • 核实路径:抓 PDF 实验表
  • 建议:R24 §2.7 Behavioral Privacy 条目标注「⚠️ ε/δ 数字待 PDF 核」

3.3 待核实 · LoCoBench-Agent 工具集 Salesforce 内部风格代表性

  • 来源:flyP 2026-07-20 E2 精读(arXiv:2511.13998)
  • 风险:工具集是 Salesforce 内部风格,与 Claude Code / Cursor / Aider 等公开 harness 不对齐;评测结论的跨 harness 迁移性存疑
  • 核实路径:抓 PDF 工具集描述 + GitHub repo cross-run 数据
  • 建议:R24 §2.7 LoCoBench-Agent 条目标注「⚠️ 工具集代表性待核」

3.4 待核实 · SpecBench held-out 测试是否真不进入 prompt/工具反馈

  • 来源:flyP 2026-07-20 E2 精读(arXiv:2605.21384)
  • 风险:hacking_gap 指标有效性依赖 held-out 测试真不进入 agent 可观察范围;若存在任何泄露通道,gap 趋近于 0 失去判别力
  • 核实路径:抓 PDF / GitHub repo 确认 held-out 隔离机制
  • 建议:R24 §6.22 SpecBench 条目标注「⚠️ held-out 隔离性待 PDF 核」

3.5 待核实 · Agentic RAG 评测 MRR +0.17 代表性

  • 来源:jay 2026-07-21 晚间简报(arXiv:2606.05658,ECIR 2026)
  • 风险:MRR +0.17 仅 DevOps 单一结构化领域;MuSiQue 场景 MRR 下降说明方法局限性;跨领域迁移性存疑
  • 核实路径:抓 PDF 完整实验表 + 多领域对照
  • 建议:R24 §7.1 共识第 20 条标注「⚠️ +0.17 仅 DevOps,代表性待核」

4. 涉及 arXiv 号列表(本次新增/补强)

arXiv 来源 主分类 与 evaluation.md 关系 R24 建议
arXiv:2607.15263 paper_cards/482 agent/benchmark(副 evaluation) §1 第 15 维信号(成本第三维度);§2.7 Agent 件套补 Cost-Aware;§3.3 CI Gate #19 补强;§5 67→68 子领域 🟢 R24 §1 §2.7 §3.3 §5 新增
arXiv:2607.06815 paper_cards/487 agent/application(副 llm-infra) §2.7 Agent 件套补 Behavioral Privacy;§5 68→69 子领域;§6.22 补新批判条目(行为推断攻击面第七维) 🟢 R24 §2.7 §5 §6.22 新增
arXiv:2605.21384 flyP 7-20 E2 精读 agent/evaluation §2.7 Agent 件套补 SpecBench;§5 69→70 子领域;§6.22 补 hacking_gap 量化指标(L2 反方) 🟢 R24 §2.7 §5 §6.22 补强
arXiv:2511.13998 flyP 7-20 E2 精读 agent/evaluation §2.7 Agent 件套补 LoCoBench-Agent;§1 补"效率-质量负相关"工程实例 🟢 R24 §2.7 §1 补强
arXiv:2606.05658 jay 7-21 晚间简报 rag(ECIR 2026) §2.7 RAG 件套补 Agentic Adaptive RAG;§5 70→71 子领域 🟢 R24 §2.7 §5 新增
arXiv:2607.15963 paper_cards/465 rag/benchmark(副 evaluation) §2.7 RAG 件套补 Human-Centric RAG;§5 71→72 子领域 🟢 R24 §2.7 §5 新增
arXiv:2604.18234 jay 7-21 晚间简报 rag §2.7 RAG 件套补 Multi-Hop RAG Retriever Eval;R24 §5 第 72 子领域补强 🟢 R24 §2.7 §5 新增

合计:本次 E1 涉及 arXiv 7 件(3 件已有 paper_cards,4 件来自 inbox 精读/简报)


5. 检查过的来源(全部)

inbox jay(7-19~7-21 相关 evaluation 内容)

  • 2026-07-20-1950-engineering-filter-round3-jul2026-production-cmds-cve-rag-eval.md(RAG eval 工程实践 + awesome-harness-engineering)
  • 2026-07-20-rag-agent-memory-research.md(MemoryAgentBench arXiv:2507.05257)
  • 2026-07-21-1500-evening-briefing-cidr-dbhammer-raschka-agentic-rag-hf-ecosystem.md(★ Agentic Adaptive RAG arXiv:2606.05658 + Multi-Hop RAG arXiv:2604.18234 + Human-Centric RAG arXiv:2607.15963)
  • 2026-07-21-engineering-e1prep.md(arXiv:2606.14589 生产 LLM Agent 静默失败研究,但主分类 agent 非 evaluation)
  • 2026-07-20-1001-rss-cool-papers.md(无 evaluation 专项)

inbox tom(7-19~7-21 相关 evaluation 内容)

  • 2026-07-20-evaluation-e1prep.md(R23,已归档)
  • 2026-07-21T0840-agent-rag-longcontext-radar.md(Cost-Aware arXiv:2607.15263 + Behavioral Privacy arXiv:2607.06815 已在 paper_cards)
  • 2026-07-21-rag-e1prep.md(RAG 主题,evaluation 间接相关)
  • 2026-07-21-0900-hf-daily-2026-07-21.md(HF Daily 票数,Compass/LongStraw/VideoChat3 已在 R23)

inbox flyp(7-19~7-21 相关 evaluation 内容)

  • 2026-07-20-SpecBench-Reward-Hacking-LongHorizon-Coding-Agents-critical-read.md(★ E2 精读 SpecBench arXiv:2605.21384)
  • 2026-07-20-LoCoBench-Agent-longcontext-coding-agent-critical-read.md(★ E2 重写精读 LoCoBench-Agent arXiv:2511.13998)
  • 2026-07-20-risk-e1prep.md(risk 主题,evaluation 间接相关)
  • 2026-07-21-0950-xHC-Hyper-Connections-Expanded-critical-read.md(engineering 主题)

inbox spark(7-19~7-21 相关 evaluation 内容)

  • 2026-07-21-agent-e1prep.md(★ Cost-Aware arXiv:2607.15263 + Behavioral Privacy arXiv:2607.06815 详细增量)
  • 2026-07-20-agent-e1prep.md(R23 归档参照)

inbox stephen(7-19~7-21 相关 evaluation 内容)

  • 2026-07-21-ai-industry-e1prep.md(★ Behavioral Privacy arXiv:2607.06815 承接 + Databricks 79%/11% 与 evaluation 缺口相关)
  • 2026-07-20-ai-industry-e1prep.md(R23 归档参照)

paper_cards 近 3 天新卡(序号 426-456;主分类或副分类含 evaluation 相关)

  • 434-2607.12227 · Rethinking Harness Evolution(主分类 evaluation,R23 已收录)
  • 436-2107.03374 · evaluation 副分类(序号 436,R23 已收录)
  • 441-2303.17564 · evaluation 副分类(序号 441)
  • 443-2303.11366 · evaluation 副分类(序号 443)
  • 446-2309.07864 · evaluation 副分类(序号 446)
  • 453-2307.03109 · evaluation 副分类(序号 453)
  • 457-2607.15657 · Lucid Long-term Memory Attack(R23 已收录)
  • 465-2607.15963 · Human-Centric Evaluation of RAG System(副分类 evaluation)★ R24 新增
  • 468-2606.29538 · RESOURCE2SKILL(R23 已收录)
  • 472-2206.04615 · evaluation 副分类(序号 472)
  • 473-1702.04405 · evaluation 副分类(序号 473)
  • 474-2303.13375 · evaluation 副分类(序号 474)
  • 477-2302.04023 · evaluation 副分类(序号 477)
  • 478-1709.06158 · evaluation 副分类(序号 478)
  • 481-2607.16603 · NOWJ@COLIEE 2026(副分类 rag+evaluation)
  • 482-2607.15263 · Cost-Aware Security Agent(副分类 evaluation)★ R24 新增
  • 487-2607.06815 · Behavioral Privacy Leakage(副分类 llm-infra)★ R24 新增

未发现显著 evaluation 增量的来源: - jay 7-20~7-21 的 RSS 通稿(bytebytego/nathan-benaich/raschka/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog):无 evaluation 专项 - spark 7-20~7-21 的 RSS gradient-flow/chip-huyen/3blue1brown:无 evaluation 专项新信号 - tom 7-20~7-21 的 RSS lex-fridman/yannic-kilcher:近期节目无 evaluation 专项


6. 无显著新增量时如实说明

R23 已非常饱和,本轮 7-20~7-21 evaluation 主题 E1 预消化属于中型补漏级别,无全新评测框架、无 JRH 级别的 judge 校准突破、无新 benchmark 达到 SOTA 票数段。

  • 主要增量性质:新评测方向立标(Cost-Aware 安全 Agent 成本第三维度)+ 新评测维度(Behavioral Privacy 行为隐私)+ flyP 精读深化(SpecBench hacking_gap + LoCoBench-Agent comprehension vs efficiency)+ RAG 评测方法论补强(Agentic Adaptive RAG + Human-Centric RAG)
  • 无硬凑条目:4 条增量均有 paper_cards TLDR 或 inbox 精读原始出处,不编造
  • 不建议新建主题页:evaluation 主题已非常饱和,R24 继续在主档内补强,不开侧枝

7. 待活文档 R24 接力方向(给今晚活文档接手时)

  1. §1 现状全景新增第 15 维信号:成本-成功率作为评测第三维度(arXiv:2607.15263);效率-质量负相关曲线工程实例补强(LoCoBench-Agent)
  2. §2.7 评测对象横向分化:Agent 46+ → 50+ 件套(+Cost-Aware + Behavioral Privacy + SpecBench + LoCoBench-Agent);RAG 二十二 → 二十五件套(+Agentic Adaptive RAG + Multi-Hop RAG + Human-Centric RAG)
  3. §3.3 CI Gate #19 补强:Cost-Aware Security Agent 评测 gate(固定成本预算下评测)
  4. §5 评测对象分化:67 → 72 子领域(+5 子领域)
  5. §6.22 批判节补强:SpecBench hacking_gap 量化指标与 matched budget 协议互补(L2)+ Behavioral Privacy 行为推断攻击面第七维候选(L1)
  6. §7.1 共识 18 → 20 条(+2 条)
  7. §7.2 争议 22 → 24 条(+2 条)
  8. ⚠️ 5 条待核实:Cost-Aware 数字 / ε/δ / LoCoBench 工具集代表性 / SpecBench held-out 隔离性 / Agentic RAG +0.17 代表性

Tom E1 预消化简报 · 2026-07-21 15:40 Asia/Shanghai · 共扫描 7 个 inbox 目录 + 426-456 号 paper_cards 31 张卡 增量 4 条 · 涉及 arXiv 7 件 · 无显著新增时如实说明 · 不硬凑字数 · 不重写 evaluation.md