evaluation · E1 预消化简报(2026-08-13)
信源检查记录
本次覆盖: - work-queue.md ✓(无 evaluation 直接增量;Top 15 待建卡 1 件:2608.10288) - inbox/jay(8/11~8/13):engineering-e1prep 含 AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)✓;RSS Import AI 468 含 PostTrainBench+ 和 23 个 RSI 构想 ✓;RSS simon-willison 含 Stealing Reasoning Traces(2608.09867,v44 §2.193 第 23 栖论文来源)邻接 eval ✓ - inbox/flyp(8/11~8/13):multimodal-e1prep 无 eval 直接增量 ✓;BDH-CQ-CoinRAG critical-read 无 eval 专项 ✓ - inbox/spark(8/11~8/13):agent-e1prep 无 eval 直接增量 ✓ - inbox/stephen(8/11~8/13):ai-industry-e1prep 含 VibeLifeBench(2608.10875,P1 paper_card 缺口)✓;8/13 协调棒含 BDH-CQ 立标等级升级建议 ★★ ✓ - inbox/tom(8/11~8/13):HF Daily × 2(8/12 无 eval 进 top15;8/13 VibeLifeBench #15 15▲)✓;evaluation-e1prep × 2(R44/R43 基线参考)✓;radar 无 eval 新增候选 ✓ - paper_cards 近 3 天新卡(900~920 范围):909(Decoding-Level Taboo·evaluation)、911(360CityArena·evaluation+agent)、904(TSDS-Toolbox·evaluation);898~920 均已检查 ✓ - knowledge/evaluation.md R44 基线 ✓
增量摘要
本轮(E1-R45,窗口 2026-08-12 下午 ~ 2026-08-13 下午)发现 4 条确认增量,其中 2 条为 evaluation 专项 paper_card 已有但 eval.md 未覆盖(Decoding-Level Taboo、360CityArena),1 条为 paper_card 未建的 P1 缺口(VibeLifeBench),1 条为跨主题邻接新增(AI Engineer Stack 2026 Eval Gap 行业级数据)。
主体脉络为:R44 三件(BDH-CQ + Cultivar + SWE-Bench ProMax)之后的消化期,eval 主轴无 paper_card 层面的 net-new,但有 3 件 paper_card 已建卡但未入 evaluation.md 的"建卡未归口"缺口需要填补,加上 VibeLifeBench(2608.10875)作为 cs.AI 生活 Agent 评测基准出现 paper_card P1 缺口,以及 AI Engineer Stack 2026 行业级 eval gap 数据(89% vs 52% = 37 点)首次以量化方式揭示生产评测缺口。
条目一:VibeLifeBench(arXiv:2608.10875)— 生活 Agent 在生活化世界中的主动性与持久性评测基准
来源:inbox/tom/2026-08-13-0900-hf-daily-2026-08-13.md(HF Daily 8-13 #15,15▲)
arXiv:2608.10875 | https://arxiv.org/abs/2608.10875
主分类:cs.AI(evaluation 邻接)
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖;stephen inbox 标注为 P1 缺口
要点
- 核心问题:现有 Agent 评测聚焦任务完成率,缺乏对"在生活化世界中保持主动与持久"这一能力的系统评测——这正是生产级生活 Agent(个人助理、管家类应用)的核心需求
- 评测维度:生活 Agent 在拟真的生活化环境中的主动规划能力和长期持久性
- cs.AI 定位:与 cs.NE(BDH-CQ)、cs.MA(Business Arena)、cs.SE(SWE-Bench ProMax)形成不同学科视角的评测体系——cs.AI 关注 agent 与环境的主动交互质量
- 立标信号:HF Daily 8-13 #15(15▲),paper_card 未建,信号相对弱但 P1 缺口已在 stephen ai-industry-e1prep 中标注
与 knowledge/evaluation.md R44 现有脉络的关系
- 现有脉络:R44 §2.2 Benchmark 设计(场景专化);R44 §2.7 评测对象横向分化——VibeLifeBench 以"生活 Agent 主动性+持久性"评测填补 R44 缺失的生活化场景 benchmark 类型
- 缺失:生活化场景 Agent 评测;Agent 主动性(proactivity)评测维度;Agent 持久性(persistence)评测维度
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——生活 Agent 主动性与持久性评测(VibeLifeBench on cs.AI);§9.2 评测 harness/benchmark 套件新增 VibeLifeBench 条目
矛盾/待核实
- 仅 15▲(HF Daily 8-13),立标信号较弱,需持续观察后续票数
- paper_card 未建,P1 缺口标注方为 stephen,优先级待人工确认
- 原文未读,"生活化世界"的具体评测环境和任务集规模需核实
arXiv 列表
- 2608.10875(🆕 paper_cards 未建卡,P1 缺口)
条目二:TSDS-Toolbox(arXiv:2608.08119)— 时间序列数据集相似性统一评测框架
来源:paper_cards 904(8/12~8/13 backlog 建卡);HF Daily 近期待观察
arXiv:2608.08119 | https://arxiv.org/abs/2608.08119
主分类:evaluation;形态:benchmark
卡状态:✅ paper_cards 904 已建;evaluation.md 未覆盖
要点
- 核心问题:时间序列基础模型受益于数据集相似性(用于微调源数据集选择),但现有 benchmark 方法碎片化且难以扩展——需要统一评测框架
- 解决方案:TSDS-Toolbox,统一框架衡量时间序列数据集相似性;支持 forecasting / classification / generation 三类任务的源数据集选择评测
- 评测场景:基础模型在时间序列领域的数据集选择质量——这是模型评测中较少被系统性 benchmark 的环节
- 与 R44 现有脉络的关系:不同于 R44 已有 benchmark(BDH-CQ on ARC-AGI-1、Cultivar 翻译、SWE-Bench ProMax 代码),TSDS-Toolbox 是垂直领域(时间序列)的评测工具箱,属于数据集相似性评测的基础设施
与 knowledge/evaluation.md R44 现有脉络的关系
- 现有脉络:R44 §2.2 Benchmark 设计(场景专化);R44 §2.3 人类评估替代方案——TSDS-Toolbox 填补时间序列领域数据集相似性评测的工具箱空白,是基础模型时代微调数据集选择的系统性评测方案
- 缺失:时间序列数据集相似性评测;微调数据集选择评测方法论
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——时间序列数据集相似性评测(TSDS-Toolbox);§9.2 评测 harness/benchmark 套件新增 TSDS-Toolbox 条目
矛盾/待核实
- paper_cards 904 已建但 eval.md 未覆盖,归口优先级待确认
- 工具箱具体包含哪些数据集和相似性指标(时间序列领域专有度量)需读原文
- 与现有时间序列 benchmark(TSB-UAD 等)的关系需厘清
arXiv 列表
- 2608.08119(✅ paper_cards 已建,eval.md 待补)
条目三:AI Engineer Stack 2026 — 生产 AI 团队 Eval Gap:89% 可观测性 vs 52% 正式评测体系
来源:inbox/jay/2026-08-13-engineering-e1prep.md(Jay 工程 E1 简报 3 条核心增量之一);engineering-filter 明确标注为高价值
主分类:engineering(eval 邻接);来源:The AI Engineer Stack 2026
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖;Jay engineering-e1prep 认定为高价值工程数据
要点
- 核心发现:AI Engineer Stack 2026 调查显示,生产 Agent 团队中:
- 89% 已实现可观测性(traces / logs / metrics)
- 仅 52% 有正式评测体系(evaluation framework / benchmark suite)
- Eval Gap = 37 个百分点
- 行业背景:这一 gap 与 EU AI Act 8 月对高风险系统全面可执行(距今约 2 周)形成时间节点压力——生产团队必须补齐正式评测能力
- 工程警示:89% 可观测性只说明团队"能看到系统运行",不代表"系统被正确评测"——eval framework 缺失意味着 Agent 质量的量化评估无从谈起
- 与 OWASP MCP CVEs(30+)叠加:MCP 安全漏洞高发 + eval framework 缺失 = 生产 Agent 系统性风险积聚
与 knowledge/evaluation.md R44 现有脉络的关系
- 现有脉络:R44 §2.1 评测方法学综述(三十轴并行);R44 §2.5 评测方法学批判(47 层反方体系)——AI Engineer Stack 2026 Eval Gap 以行业级数据量化"评测能力基础设施缺失"的严重性,是 R44 反方体系第 47 层之外的实证数据补充
- 缺失:生产 Agent 评测能力缺口行业数据;Eval-first Development 实践程度的量化指标
- 建议归入:§2.1 评测方法学综述行业数据新增——AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距);§2.5 评测方法学批判新增——生产评测体系缺失的行业级实证数据
矛盾/待核实
- 89% 可观测性是否包含"是否使用正式 benchmark"等效指标?还是仅仅是日志/traces 级别的可观测?
- 52% 正式评测体系的具体定义(包含内部评估 vs 仅有外部 benchmark)需核实原文
- 调查样本量和代表性(The AI Engineer Stack 2026 的受众结构)影响数据可信度
arXiv 列表
- 无对应 arXiv(行业调研,非学术论文)
条目四:Decoding-Level Taboo(arXiv:2608.09900)— paper_card 已建但 eval.md 未覆盖的"建卡未归口"缺口
来源:paper_cards 909(8/13 02:11 建卡);inbox/tom/2026-08-13-agent-rag-longcontext-radar.md(⭐⭐⭐ 高价值)
arXiv:2608.09900 | https://arxiv.org/abs/2608.09900
主分类:evaluation;形态:benchmark;副分类:engineering
卡状态:✅ paper_cards 909 已建;evaluation.md 未覆盖
要点
- 核心贡献:提出 Decoding-Level Taboo——零提示诊断压力测试,在运行时直接在 logit 空间进行干预,迫使模型脱离"名义路径"(nominal path),从而诊断名义条件下评测分数与部署表现之间的背离
- 核心问题:现有 benchmark 测 nominal 条件下的性能(模型走在高度优化的生成通道上),但实际部署中复杂系统提示、安全护栏和结构化约束持续迫使模型偏离该路径——导致 benchmark 分数与部署表现出现系统性背离
- 技术方案:在 logit 空间引入 decoding-level taboo constraint,强制模型生成被刻意压制的 token,从而评估模型在非 nominal 条件下的鲁棒性
- 应用价值:填补 LLM 鲁棒性评测方法论的空白——与 Arcane 等红队 benchmark 不同,Decoding-Level Taboo 从解码层面系统性干预,而非从 prompt 层面试图越狱
- 立标信号:tom radar ⭐⭐⭐(高价值)+ HF Daily 8-12 #16(16▲);flyp multimodal-e1prep 标注为 evaluation 主分类;evaluation 邻接 R44 §2.5 评测方法学批判
与 knowledge/evaluation.md R44 现有脉络的关系
- 现有脉络:R44 §2.5 评测方法学批判(47 层反方体系);R44 Evaluation as Infrastructure 三层架构——Decoding-Level Taboo 作为"名义路径背离诊断"工具,在 R44 评测可靠性批判体系中提供新的诊断维度:logit-space 鲁棒性
- 缺失:logit-space 诊断压力测试方法论;decoding-level 鲁棒性评测;名义条件与部署条件背离的系统性量化
- 建议归入:§2.5 评测方法学批判新增——Decoding-Level Taboo:logit-space 名义路径背离诊断;§9.2 评测 harness/benchmark 套件新增 Decoding-Level Taboo 条目
矛盾/待核实
- paper_cards 909 已建但 eval.md 未覆盖,归口优先级需确认
- "logit-space taboo constraint"的具体实现(taboo token 的选择机制)需读原文 §3
- 与传统 adversarial prompting benchmark 的具体边界需厘清
arXiv 列表
- 2608.09900(✅ paper_cards 已建,eval.md 待补)
条目五:360CityArena(arXiv:2608.08814)— paper_card 已建但 eval.md 未覆盖的第二件"建卡未归口"缺口
来源:paper_cards 911(8/13 09:00 建卡);inbox/tom/2026-08-13-agent-rag-longcontext-radar.md(⭐⭐ 候选)
arXiv:2608.08814 | https://arxiv.org/abs/2608.08814
主分类:evaluation;形态:benchmark;副分类:agent
卡状态:✅ paper_cards 911 已建;evaluation.md 未覆盖
要点
- 核心贡献:360CityArena,以 360 度视频构建真实感虚拟城市环境(东京秋叶原街区,602 段 360° 视频覆盖 85 条街道),评测具身智能体的城市探索能力
- 评测规模:175 项人工设计任务,三类任务:Environment Understanding、Path Planning、Navigation
- 现有 benchmark 差距:现有户外 benchmark 或缺乏真实感,或缺乏复杂度,与真实城市环境存在显著差距——360CityArena 填补 photorealism + complexity 同时满足的空白
- 方法论价值:360° 视频构建具身评测环境,是具身智能评测基础设施的重要进步——与 R44 §2.2 场景专化 benchmark 方向一致
与 knowledge/evaluation.md R44 现有脉络的关系
- 现有脉络:R44 §2.2 Benchmark 设计(场景专化);R44 §2.2(已有 GST-Bench 视频全局空间感知 + CLIP-CC-Bench 视频段落描述)——360CityArena 以 360° 视频具身导航评测补充视频 VLM 评测族,与 GST-Bench(空间感知)和 CLIP-CC-Bench(段落描述)构成视频评测三维互补
- 缺失:360° 视频具身导航 benchmark;具身智能体城市环境评测
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——360CityArena 360° 视频具身导航评测(与 GST-Bench + CLIP-CC-Bench 构成视频评测三维)
矛盾/待核实
- paper_cards 911 已建但 eval.md 未覆盖,归口优先级需确认
- 175 项任务的具体评测指标(成功率?路径效率?环境理解准确率?)需读原文
- 360° 视频环境构建的可复现性和版权问题
arXiv 列表
- 2608.08814(✅ paper_cards 已建,eval.md 待补)
综合:矛盾与待核实清单
- VibeLifeBench(2608.10875):仅 15▲(HF Daily 8-13),立标信号较弱;paper_card 未建(P1 缺口由 stephen 标注);"生活化世界"的具体评测环境定义和任务规模待读原文
- TSDS-Toolbox(2608.08119):paper_cards 已建但 eval.md 未覆盖;工具箱具体指标和数据集规模需核实;与现有时间序列 benchmark 的边界需厘清
- AI Engineer Stack 2026 Eval Gap:89% / 52% 具体定义和样本量未核实;无对应 arXiv(行业调研),数据可信度需读原文
- Decoding-Level Taboo(2608.09900):paper_cards 已建但 eval.md 未覆盖;logit-space taboo constraint 实现细节需读原文 §3
- 360CityArena(2608.08814):paper_cards 已建但 eval.md 未覆盖;175 项任务的具体评测指标定义和可复现性细节待核实
- BDH-CQ 立标信号绝对新高:8-13 553▲(v33 以来第 1 峰值),立标等级升级建议 ☆ → ★★ 需 8-14 09:00 HF Daily 复核票数 + PDF 对照图核验两个硬约束——eval 主轴关注其评测方法论(latent reasoning vs verbalized reasoning)的后续验证
本轮检查过的来源(无新增时列出)
| 来源 | 内容 |
|---|---|
| /shared/research-kb/organized/queue/work-queue.md | Top 15 待建卡 1 件(2608.10288);无 evaluation 直接增量 |
| inbox/jay/2026-08-13-engineering-e1prep.md | AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)+ PostTrainBench+ ✓ |
| inbox/jay/2026-08-13-1003-rss-import-ai.md | Import AI 468 = PostTrainBench+(沿用 8/11~8/12)+ 23 个 RSI 构想;无 eval net-new |
| inbox/jay/2026-08-13-1000-rss-simon-willison.md | Stealing Reasoning Traces(2608.09867,v44 §2.193 第 23 栖来源);非 eval 主分类 |
| inbox/flyp/2026-08-13-multimodal-e1prep.md | 无 eval 直接增量;邻接 Decoding-Level Taboo(evaluation) |
| inbox/flyp/2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md | BDH-CQ 立标等级升级建议;CoinRAG 无 eval 专项 |
| inbox/stephen/2026-08-13-ai-industry-e1prep.md | VibeLifeBench(2608.10875,P1 paper_card 缺口);Business Arena(已在 eval.md)+ Decoding-Level Taboo(已在 paper_cards)+ 360CityArena(已在 paper_cards) |
| inbox/spark/2026-08-13-agent-e1prep.md | 无 eval 直接增量 |
| inbox/tom/2026-08-13-0900-hf-daily-2026-08-13.md | VibeLifeBench #15 15▲ |
| inbox/tom/2026-08-13-1004-rss-yt-yannic-kilcher.md | 沿用 |
| inbox/tom/2026-08-13-1005-rss-yt-lex-fridman.md | 沿用 |
| inbox/tom/2026-08-13T1440-agent-rag-longcontext-radar.md | Decoding-Level Taboo ⭐⭐⭐;360CityArena ⭐⭐;无 eval 新增候选 |
| inbox/tom/2026-08-11-evaluation-e1prep.md | R44 基线(Harness 三元组七件套 + 五维立标级) |
| inbox/tom/2026-08-12-evaluation-e1prep.md | R45 基线(BDH-CQ + Cultivar + SWE-Bench ProMax 三件) |
| paper_cards/909-2608-09900(Decoding-Level Taboo) | 已建卡;evaluation 主分类;eval.md 未覆盖 |
| paper_cards/911-2608-08814(360CityArena) | 已建卡;evaluation + agent 分类;eval.md 未覆盖 |
| paper_cards/904-2608-08119(TSDS-Toolbox) | 已建卡;evaluation 主分类;eval.md 未覆盖 |
| paper_cards/894-2608-08621(Business Arena) | 已建卡;已在 eval.md(R44) |
| knowledge/evaluation.md R44 | 确认现有脉络;Harness 三元组七件套 + §6.45-§6.47 三维立标级 |
结论
本轮(E1-R45,2026-08-13)eval 主题处于 R44 三件(BDH-CQ + Cultivar + SWE-Bench ProMax)之后的消化期,无 paper_card 层面的 net-new eval 论文出现,但存在两类有价值的增量:
确认增量 5 条: - VibeLifeBench(2608.10875) paper_card P1 缺口(cs.AI 生活 Agent 主动性与持久性评测),eval.md 待补建 - TSDS-Toolbox(2608.08119) paper_card 已建(evaluation 主分类),eval.md 待归口 - AI Engineer Stack 2026 Eval Gap(无 arXiv)行业级量化数据:89% 可观测性 vs 52% 正式评测体系 = 37 点差距,与 EU AI Act 8 月节点形成评测能力补齐压力 - Decoding-Level Taboo(2608.09900) paper_card 已建但 eval.md 未覆盖(logit-space 名义路径背离诊断) - 360CityArena(2608.08814) paper_card 已建但 eval.md 未覆盖(360° 视频具身导航 benchmark,与 GST-Bench + CLIP-CC-Bench 构成视频评测三维)
涉及 arXiv 号:2608.10875(🆕 paper_cards 未建/P1 缺口)、2608.08119(✅ paper_cards 已建/eval.md 待补)、2608.09900(✅ paper_cards 已建/eval.md 待补)、2608.08814(✅ paper_cards 已建/eval.md 待补);已在基线续立:2608.09888(BDH-CQ)、2608.09766(Cultivar)、2608.09802(SWE-Bench ProMax)、2605.23950(Stop Comparing)、2605.27922(Harness-Bench)、2608.00267(LoopsBench)、2608.09096(Evo-Bench)、2608.04205(MatrAIx)、2608.04302(CLIP-CC-Bench)、2501.05444(EMMA)
建议后续动作: - [ ] VibeLifeBench(2608.10875)paper_card 建卡(P1 缺口,优先级高于 TSDS-Toolbox) - [ ] Decoding-Level Taboo(2608.09900)eval.md 归口(§2.5 + §9.2) - [ ] 360CityArena(2608.08814)eval.md 归口(§2.2,与 GST-Bench + CLIP-CC-Bench 并列) - [ ] TSDS-Toolbox(2608.08119)eval.md 归口(§2.2 场景专化轴) - [ ] AI Engineer Stack 2026 Eval Gap 读原文核实 89%/52% 定义和样本量 - [ ] 跟踪 BDH-CQ(2608.09888)立标等级升级复核:8-14 09:00 HF Daily 票数 + PDF 对照图
Tom · 2026-08-13 15:40 CST · E1 预消化简报 · 5 条确认增量(1 paper_card P1 缺口 + 4 "建卡未归口"缺口)+ 6 件待核实 · 涉及 arXiv:2608.10875(🆕 P1 缺口)/ 2608.08119(✅ 已建卡/eval 待补)/ 2608.09900(✅ 已建卡/eval 待补)/ 2608.08814(✅ 已建卡/eval 待补)