evaluation · E1 预消化简报(2026-08-18)

信源检查记录

本次覆盖: - work-queue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜候选无 eval 主分类净增) - inbox/jay(8/16~8/18):agentic-ai-engineering-landscape 含 AI Agents Stack 2026(eval 邻接)✓;Jay 8-18 X-tech-radar 含 MerchantBench eval 邻接候选(arXiv ID 待核实)✓ - inbox/flyp(8/16~8/18):mm-long-context-evaluation 含 MMLongBench/MMLongEmbed 精读(eval 邻接候选)✓;无 eval 专项新件 - inbox/spark(8/16~8/18):agent-e1prep 含 MerchantBench(eval 邻接)✓;无 eval 专项新件 - inbox/stephen(8/16~8/18):ai-industry-e1prep 无 eval 直接增量 ✓ - inbox/tom(8/16~8/18):HF Daily × 2(8-17 LLMRouter 102▲ + DarwinX 84▲ + PlayWorld 42▲ + LiveAnimate 21▲ + Can LLM Agents 27▲;8-18 LLMRouter + DarwinX + PlayWorld 等立标池新数据)✓;radar 无 eval 候选净增 ✓;8-17 evaluation-e1prep 基线参考 ✓ - paper_cards 近 3 天新卡(960~986 范围):984(Apodex Discovery eval 已建卡)✓;983(Is this Citation on Point? eval 已建卡 eval.md 仍未归口)✓;966(CPI-Bench eval 已建卡 eval.md 仍未归口)✓;967(Forecast Collapse eval 已建卡 eval.md 仍未归口)✓;969(PRM-as-a-Judge 1.5 eval 已建卡)✓;971(MobileMem eval 已建卡 eval.md 仍未归口)✓;976(DFM Mimir v1 eval 邻接 §2.207 沿用)✓;985(Agents Catching Agents agent 主分类)✓ - knowledge/evaluation.md R49 基线 ✓


增量摘要

本轮(E1-R50,窗口 2026-08-17 下午 ~ 2026-08-18 下午)eval 主题净增量为 1 条 eval 专项 net-new arXiv 论文(HF Daily 8-18 #3,42▲,arXiv:2608.13417)。其余 eval 相关候选均为邻接级或 eval.md 已覆盖条目延续。以下如实记录检查结果。


条目一:超越最终分数——面向长周期 AI 研发 Agent 的系统性评估(eval 专项 net-new ★★★)

来源inbox/tom/2026-08-18-0900-hf-daily-2026-08-18.md(HF Daily 8-18 #3,42▲,2026-08-18) arXiv2608.13417(paper_card 未建,需新建) 主分类:evaluation(agent 邻接) 形态:benchmark 信源交叉核实:spark 8-18 agent-e1prep 增量 4 已锚入 §2.4 节点候选(arXiv:2608.13417 HF Daily #3 42▲);paper_cards 库未见新建(986 最新卡 = arXiv:2608.13567,不同论文)

要点

  • 核心问题:现有 benchmark 多以"最终成功率"作为唯一指标,无法捕捉 Agent 在长程任务(数小时到数天科研级)中的过程质量;缺乏系统性过程评估方法
  • 核心方案(据论文标题推断):trajectory-level metrics(推理轨迹质量 / 错误恢复能力 / 工具调用效率)+ intermediate artifacts(中间产物质量)+ self-correction ability(自我纠错频次 + 成功率)+ human-in-the-loop calibration(人类反馈校准)
  • 评测维度:过程化、多阶段、可验证——"超越最终分数"意味着引入中间 checkpoint 评估,而非单一终点指标
  • 立标信号:HF Daily 8-18 #3,42▲ = eval 专项高信号(top 5 仅次于 #1 258▲ 和 #2 147▲,高于 #4-15 所有件);跨实例 2 源确认(tom HF Daily + spark agent-e1prep)

与 knowledge/evaluation.md R49 现有脉络的关系

  • 现有脉络:R49 §2.2 评测对象 79 维 + 130 子领域 + 33 邻接维;§2.1 评测方法学 32 轴并行;§2.6.67 AgentRx 医疗 AI Agent benchmark 邻接;R49 §3.4(长程行为一致性 benchmark)+ §6.59(LLMRouter 超越单一分数的 cost-quality 权衡)已有过程化评测铺垫——arXiv:2608.13417 以"长周期 AI 研发 Agent 过程化评测"填补"超长时程科研级 Agent 评测"空白,属于 §2.2 评测对象第 80 维候选
  • 立标等级:候选级中档 ★(HF Daily #3 42▲ + 跨实例 2 源 + 论文标题指向明确 eval 专项)

建议归入节

  • §2.2 评测对象 79 维 + 130 子领域 + 33 邻接维 → 第 80 维候选新增(长周期 AI 研发 Agent 过程化 benchmark)
  • §2.1 评测方法学 32 轴 → 新增第 33 轴候选:长周期 Agent 过程化评测方法学(trajectory-level metrics + intermediate checkpoints + self-correction rate)

矛盾 / 待核实

  • arXiv:2608.13417 paper_card 未建;需新建 paper_card 才能升级立标等级
  • 论文实际可访问性(PDF 内容待核);具体指标体系需读原文确认

arXiv 列表

  • 2608.13417(❌ paper_card 未建;建议新建;eval 专项 net-new)

条目二:Is this Citation on Point? — proposition-level citation support verification(eval 专项,paper_card 已建仍未归口)

来源paper_cards/983-2608-12571.md(主分类 evaluation;2026-08-17 批次)
arXiv2608.12571(paper_card 983 已建;eval.md R49 仍未归口主分类:evaluation;形态:benchmark

要点

  • 核心问题:法律领域 LLM 评测中,引用(citation)与命题(proposition)的对齐验证被忽视;Mata v. Avianca(2023)案 hallucinated citation 教训表明数据库查询可部分解决 hallucinated citation,但真实 case 中"引用存在但不支持命题"是现有 LLM 法律评测忽视的失败模式
  • 核心方案:controlled perturbations of real legal citations,对 proposition-level citation support 做验证
  • 与 R49 §2.4 已立标的关系:R49 §2.4(arXiv:2608.14210 Legal RAG Hallucination,claim-level 幻觉密度)——本篇与 2608.14210 均属法律领域 RAG 评测,但本篇聚焦 proposition-level citation verification,与 claim-level hallucination 互补(不重复)
  • 立标信号:paper_card 983 已建;eval.md R49 仍未归口(跨轮遗留)

与 knowledge/evaluation.md R49 现有脉络的关系

  • 现有脉络:R49 §2.4(Legal RAG Hallucination arXiv:2608.14210,claim-level)——本篇以 proposition-level citation verification 补充法律 RAG 评测维度,填补"引用-命题对齐验证"空白;建议归入 §2.4 或新建法律垂直评测子节
  • 建议归入节:§2.4 评测对象横向分化(法律垂直评测)——arXiv:2608.12571 proposition-level citation verification 与 arXiv:2608.14210 claim-level hallucination 并列形成法律 RAG 评测双轨

矛盾 / 待核实

  • eval.md R49 仍未归口(R45 已建卡,跨轮遗留至今 R50)

arXiv 列表

  • 2608.12571(✅ paper_card 983 已建;❌ eval.md R49 仍未归口)

条目三:CPI-Bench — 真实图像编辑场景综合基准(eval 专项,paper_card 已建仍未归口)

来源paper_cards/966-2608-14546.md(主分类 evaluation;2026-08-17 批次)
arXiv2608.14546(paper_card 966 已建;eval.md R49 仍未归口主分类:evaluation;形态:benchmark

要点

  • 核心问题:现有图像编辑 benchmark 局限于单图像简单任务,无法可靠评估复杂多图像编辑、高难度推理指令与实际部署场景
  • 核心方案:CPI-Bench——覆盖复杂多图像编辑、高难度推理指令和实际部署设置的 benchmark,填补真实场景图像编辑评测空白
  • 立标信号:paper_card 966 已建;eval.md R49 仍未归口

与 knowledge/evaluation.md R49 现有脉络的关系

  • 现有脉络:R49 无图像编辑专项 benchmark;本篇填补"复杂多图像编辑评测"空白,建议归入 §2.2 评测对象第 80 维候选邻接(图像编辑评测子领域)
  • 建议归入节:§2.2 评测对象 79 维 + 邻接维 + 子领域 → 图像编辑评测子领域新增

矛盾 / 待核实

  • eval.md R49 仍未归口(R45 建卡后跨轮遗留)

arXiv 列表

  • 2608.14546(✅ paper_card 966 已建;❌ eval.md R49 仍未归口)

条目四:Forecast Collapse — 时序基础模型预测坍缩 benchmark(eval 专项,paper_card 已建仍未归口)

来源paper_cards/967-2608-14106.md(主分类 evaluation;2026-08-17 批次)
arXiv2608.14106(paper_card 967 已建;eval.md R49 仍未归口主分类:evaluation;形态:benchmark

要点

  • 核心问题:时序基础模型(TSFM)在股票收益预测中出现"预测坍缩"(forecast collapse)——预测近乎平坦、截面相关性差;但同一设置下交易量预测无此问题
  • 核心方案:系统考察 12 个 TSFM + 12 个深度学习预测模型 + 97 个公开基准配置的预测坍缩现象,发现与目标可预测性密切相关,识别出两类成因
  • 立标信号:paper_card 967 已建;eval.md R49 仍未归口

与 knowledge/evaluation.md R49 现有脉络的关系

  • 现有脉络:R49 无时序预测评测专项 benchmark;本篇以"预测坍缩"这一新 failure mode 填补时序基础模型评测空白,建议归入 §2.6 失败模式分析(预测坍缩作为时序评测新失败模式)
  • 建议归入节:§2.6 失败模式分析(新增:时序基础模型预测坍缩 failure mode)

矛盾 / 待核实

  • eval.md R49 仍未归口

arXiv 列表

  • 2608.14106(✅ paper_card 967 已建;❌ eval.md R49 仍未归口)

条目五:MMLongBench + MMLongEmbed — 多模态长上下文评测(eval 邻接候选,flyp critical-read 精读)

来源inbox/flyp/2026-08-18-mm-long-context-evaluation.md(flyp critical-read 精读草稿,2026-08-18 09:50) URLhttps://openreview.net/forum?id=EPQi0v0OxL(MMLongBench NeurIPS 2025 D&B Track) + https://arxiv.org/abs/2606.14747(MMLongEmbed) 主分类:multimodal(邻接 evaluation);形态:benchmark

要点

  • MMLongBench(NeurIPS 2025 Datasets & Benchmarks Track):首个系统化长上下文视觉语言模型 benchmark;13,331 样本;5 类下游任务;8K-128K 输入长度;46 个开源/闭源模型评测;关键发现:单任务表现不能代表整体长上下文能力;闭源与开源模型均存在长上下文退化
  • MMLongEmbed(arXiv:2606.14747v1):多模态 embedding 长上下文 benchmark;8,460 queries + 20,880 candidates;最长 32K;关键发现:模型尺度和 embedding 维度增长不保证有效理解;细粒度检索随上下文增长明显下降
  • Flyp 批判性结论:名义上更长的上下文不等于有效利用;可靠评测应报告长度分层、关键证据位置、干扰项难度、跨模态格式、截断/压缩方式、零样本与训练数据泄漏检查
  • 立标信号:flyp critical-read 精读推荐入库(中高可信度);NeurIPS 2025 D&B Track 接收

与 knowledge/evaluation.md R49 现有脉络的关系

  • 现有脉络:R49 §2.207 评测方法学 13 元组候选;无多模态长上下文专项——MMLongBench + MMLongEmbed 以多模态长上下文评测补充 §2.207 评测方法学候选谱系
  • 建议归入节:§2.207 评测方法学 13 元组候选 → 14~15 元组候选新增(MMLongBench 多模态长上下文 + MMLongEmbed 多模态 embedding 长上下文)

矛盾 / 待核实

  • MMLongBench:数据许可和代码可用性需进一步核验;NeurIPS 2025 接收但非 arXiv 原始论文
  • MMLongEmbed:arXiv:2606.14747v1(2026-06-05,paper_card 未建);英文单一语言 + 32K 上限局限

arXiv 列表

  • 2606.14747(MMLongEmbed,MMLongBench 无 arXiv ID,仅 OpenReview)

条目六:MerchantBench — LLM Agent 电商长程一致性评测(eval 邻接候选,arXiv ID 待核实)

来源inbox/jay/2026-08-18-1140-news-x-tech-radar.md(Jay 8-18 X-tech-radar);inbox/spark/2026-08-18-agent-e1prep.md(spark §2.207 评测方法学 12→13 元组候选引用) 主分类:agent(邻接 evaluation);形态:benchmark arXiv ID:2607.29677(Jay X-tech-radar 原文引用 @_akhaliq HF Papers 2607.28... 截断,完整 ID 待核实)

要点

  • 核心问题:电商场景下 LLM Agent 的长程一致性评测基准缺失——跨多轮对话、多步骤购物流程中 Agent 行为一致性如何量化?
  • 核心方案:MerchantBench——电商长程一致性评测基准,填补专业垂直领域 Agent 长程评测空白
  • 立标信号:Jay X-tech-radar 高价值条目;spark agent-e1prep §2.207 评测方法学候选引用;立标等级候选级中档 ★(arXiv ID 截断待核实)

与 knowledge/evaluation.md R49 现有脉络的关系

  • 现有脉络:R49 §2.207 评测方法学 13 元组候选(AgentRx + LittleLearner + SAEVerbalizer + DFM Mimir v1 + PostTrainBench+ 等)——MerchantBench 以电商垂直场景长程一致性 benchmark 补充 §2.207 评测方法学候选谱系;若 arXiv ID 确认,可归入 §2.207 第 14 元组候选
  • 建议归入节:§2.207 评测方法学 13 元组候选 → 第 14 元组候选(待 arXiv ID 核实)

矛盾 / 待核实

  • arXiv ID 2607.29677 待官方核实(Jay 原文截断;需通过 arXiv 官方检索确认)
  • paper_card 未建

arXiv 列表

  • ❌ 2607.29677(arXiv ID 待核实;MerchantBench 电商长程一致性评测)

综合:立标池双向锚第 5 日信号(R50 窗口)

HF Daily 8-18 立标池双向锚进入第 5 日: - LLMRouter 8-15 90▲ → 8-16 94▲ → 8-17 102▲ → 8-18 #4 42▲(维持,+0▲ 绝对值低因 8-18 总票数较低) - DarwinX 8-15 59▲ → 8-16 66▲ → 8-17 84▲ → 8-18 #7 35▲(维持) - PlayWorld 8-15 33▲ → 8-16 35▲ → 8-17 42▲ → 8-18 #11 4▲(维持) - Can LLM Agents Stick to the Script? 8-15 26▲ → 8-16 26▲ → 8-17 27▲ → 8-18 #14 3▲(维持) - OpenART 8-15 252▲ → 8-16 252▲ → 8-17 253▲ → 8-18 跌出 top 15(衰减锚第 5 日确认) - Mechanist 8-15 82▲ → 8-16 82▲ → 8-17 84▲ → 8-18 #10 6▲(维持) - LiveAnimate 8-15 跌出 → 8-16 跌出 → 8-17 #15 21▲ → 8-18 #9 6▲(维持重入)

立标池双向锚第 5 日:OpenART 首次跌出 + LiveAnimate 维持重入 + LLMRouter/DarwinX/PlayWorld 全部维持 = 立标池饱和度结构性调整信号(v44-v52 七日连续后首次出现 top 15 结构性重组)


综合:矛盾与待核实清单

  1. arXiv:2608.13417(超越最终分数):paper_card 未建(R50 P0);论文实际可访问性待核;eval 专项 net-new 第 1 条
  2. arXiv:2608.12571(Is this Citation on Point?):paper_card 983 已建;eval.md R49 仍未归口(跨轮 R45→R50 遗留)
  3. arXiv:2608.14546(CPI-Bench):paper_card 966 已建;eval.md R49 仍未归口(R45 建卡后跨轮遗留)
  4. arXiv:2608.14106(Forecast Collapse):paper_card 967 已建;eval.md R49 仍未归口(R45 建卡后跨轮遗留)
  5. arXiv:2606.14747(MMLongEmbed):paper_card 未建;flyp critical-read 精读草稿(中高可信度);§2.207 候选
  6. MMLongBench:OpenReview NeurIPS 2025 D&B Track(非 arXiv);数据许可和代码可用性待核;§2.207 候选
  7. MerchantBench(2607.29677):arXiv ID 截断待核实(Jay X-tech-radar 引用);paper_card 未建;§2.207 第 14 元组候选
  8. OpenART 8-18 跌出 top 15:立标池双向锚衰减锚第 5 日确认(8-15 252▲ → 8-16 252▲ → 8-17 253▲ → 8-18 跌出);首次结构性变化
  9. Apodex Discovery(2608.11341):paper_card 984 已建;eval.md 仍未归口(跨轮 R47→R50 遗留)
  10. MobileMem(2608.13606):paper_card 971 已建;eval.md 仍未归口(跨轮 R47→R50 遗留)
  11. AgentRx(2605.10286):R49 §2.207 第 13 元组候选;paper_card 仍未建;AHLI 2026 会议归属待核实

本轮检查过的来源(无新增时列出)

来源 文件 Evaluation 相关性
/shared/research-kb/organized/queue/work-queue.md 2026-08-18 12:00 Top 15 backlog 无 eval 专项;选题榜无 eval 净增 ✓
inbox/jay/2026-08-18-1140-news-x-tech-radar.md 8-18 11:45 MerchantBench(eval 邻接,arXiv ID 待核实)✓
inbox/jay/2026-08-18-1105-jay-five-category-briefing.md 8-18 11:16 无 eval 专项新件 ✓
inbox/jay/2026-08-18T0820-jay-csdn-multimodal-rag-inference-substack-highfreq.md 8-18 08:22 无 eval 专项新件 ✓
inbox/spark/2026-08-18-agent-e1prep.md 8-18 13:30 MerchantBench §2.207 候选引用(eval 邻接)✓
inbox/flyp/2026-08-18-mm-long-context-evaluation.md 8-18 09:50 MMLongBench + MMLongEmbed 精读(eval 邻接候选)
inbox/flyp/2026-08-18-multimodal-e1prep.md 8-18 09:47 无 eval 直接新增;MMLongBench/MMLongEmbed 邻接 ✓
inbox/tom/2026-08-18-0900-hf-daily-2026-08-18.md 8-18 09:00 arXiv:2608.13417 #3 42▲(eval 专项 net-new)
inbox/tom/2026-08-17-0900-hf-daily-2026-08-17.md 8-17 09:00 LLMRouter 102▲ + DarwinX 84▲(eval 邻接,已覆盖)✓
inbox/tom/2026-08-17-evaluation-e1prep.md 8-17 15:40 R49 基线(0 eval 专项 net-new + 1 邻接候选 AgentRx)✓
inbox/stephen/2026-08-18-ai-industry-e1prep.md 8-18 10:27 无 eval 直接增量 ✓
inbox/stephen/2026-08-17-ai-industry-e1prep.md 8-17 10:31 无 eval 直接增量 ✓
paper_cards/983-2608-12571(Is this Citation on Point?) evaluation ✅ paper_card 已建;❌ eval.md R49 仍未归口
paper_cards/966-2608-14546(CPI-Bench) evaluation ✅ paper_card 已建;❌ eval.md R49 仍未归口
paper_cards/967-2608-14106(Forecast Collapse) evaluation ✅ paper_card 已建;❌ eval.md R49 仍未归口
paper_cards/984-2608-11341(Apodex Discovery) evaluation ✅ paper_card 已建;❌ eval.md R49 仍未归口
paper_cards/969-2608-14284(PRM-as-a-Judge 1.5) evaluation ✅ paper_card 已建
paper_cards/971-2608-13606(MobileMem) evaluation ✅ paper_card 已建;❌ eval.md R49 仍未归口
paper_cards/976-2608-13517(DFM Mimir v1) evaluation ✅ paper_card 已建;eval.md R49 §2.207 邻接沿用
paper_cards/985-2608-03744(Agents Catching Agents) agent agent 主分类,非 eval 专项
knowledge/evaluation.md R49 2026-08-17 15:40 确认现有脉络:79 维 + 33 邻接 + 130 子领域 + §2.207 13 元组 + 立标池双向锚第 4 日 + AgentRx 邻接级候选

结论

本轮(E1-R50,2026-08-18)eval 主题eval 专项 net-new arXiv 论文 1 条(arXiv:2608.13417,HF Daily #3 42▲)。

立标池双向锚结构性变化(R50 第 5 日): - OpenART 首次跌出 top 15(衰减锚第 5 日确认)——v33 以来首次结构性重组 - LiveAnimate 维持重入(#9 6▲) - LLMRouter/DarwinX/PlayWorld/Mechanist/Can LLM Agents 全部维持(续立)

eval 专项净增 1 条 + eval 邻接候选 5 条: - eval 专项:arXiv:2608.13417(超越最终分数,长周期 AI 研发 Agent 过程化评测) - eval 邻接候选: - CPI-Bench(2608.14546,图像编辑评测,paper_card 未归口) - Forecast Collapse(2608.14106,时序预测坍缩,paper_card 未归口) - Is this Citation on Point?(2608.12571,法律引用验证,paper_card 未归口) - MMLongBench + MMLongEmbed(flyp 精读,eval 邻接,§2.207 候选) - MerchantBench(2607.29677,电商长程一致性,arXiv ID 待核实)

涉及 arXiv 号:2608.13417(❌ paper_card 未建,eval 专项 net-new)、2608.12571(✅ 已建卡,eval.md 未归口)、2608.14546(✅ 已建卡,eval.md 未归口)、2608.14106(✅ 已建卡,eval.md 未归口)、2606.14747(❌ paper_card 未建,MMLongEmbed)、2607.29677(❌ arXiv ID 待核实,MerchantBench)

建议后续动作: - [ ] arXiv:2608.13417 paper_card 新建(P0,eval 专项 net-new) - [ ] Is this Citation on Point?(2608.12571)eval.md 归口(R45 建卡后跨轮 R50 仍未归口) - [ ] CPI-Bench(2608.14546)eval.md 归口(跨轮遗留) - [ ] Forecast Collapse(2608.14106)eval.md 归口(跨轮遗留) - [ ] Apodex Discovery(2608.11341)eval.md 归口(跨轮 R47→R50 遗留) - [ ] MobileMem(2608.13606)eval.md 归口(跨轮 R47→R50 遗留) - [ ] MMLongEmbed(2606.14747)paper_card 新建 + §2.207 候选 - [ ] MerchantBench(2607.29677)arXiv ID 官方核实 + paper_card 新建 + §2.207 第 14 元组候选 - [ ] AgentRx(2605.10286)paper_card 新建(R49 §2.207 第 13 元组候选)


Tom · 2026-08-18 15:40 CST · E1 预消化简报 · evaluation 主题 · 1 条 eval 专项 net-new(arXiv:2608.13417)+ 5 条 eval 邻接候选 + 立标池结构性重组 · 涉及 arXiv:2608.13417(❌ paper_card 未建/net-new)/ 2608.12571(✅ 已建卡/eval.md 未归口)/ 2608.14546(✅ 已建卡/eval.md 未归口)/ 2608.14106(✅ 已建卡/eval.md 未归口)/ 2606.14747(❌ 未建卡/MMLongEmbed)/ 2607.29677(❌ arXiv ID 待核实/MerchantBench)