evaluation · E1 预消化简报(2026-08-14)
信源检查记录
本次覆盖: - work-queue.md ✓(无 evaluation 直接增量;Top 15 待建卡含 Mechanist 2608.12036 / SkillZip 2608.05604 / Ready Cohorts 2608.12123 / Parameter Exploration 2608.09805 等,均非 evaluation 主分类) - inbox/jay(8/12~8/14):AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)✓;C2KV(KV Cache 复用,非 eval 专项)✓;engineering-e1prep 无 eval 专项新件 ✓ - inbox/flyp(8/12~8/14):multimodal-e1prep 无 eval 直接增量;BDH-CQ critical-read(立标等级 ☆,双维度区分确立)✓;360CityArena critical-read(cs.CV 主分类修正)✓;v48 candidate audit(StateFlow ★★★ / Latent-to-4D ★★ 偏上立标等级修正)✓ - inbox/spark(8/12~8/14):agent-e1prep 无 eval 直接增量 ✓ - inbox/stephen(8/12~8/14):ai-industry-e1prep 含 Mechanist(2608.12036,评测方法学 5+ 元组)✓;StateFlow 立标等级 ★★★ 中-高档(flyp critical-read)✓;Latent-to-4D 立标等级修正(+0.5 档)✓;VibeLifeBench(2608.10875,cs.AI 生活 Agent 评测)✓;BDH-CQ 跌出 top 15 立标信号衰减锚 ✓;AI Engineer Stack 2026 Eval Gap(已在 R45 基线)✓ - inbox/tom(8/12~8/14):HF Daily × 2(8/13 BDH-CQ 553▲;8/14 OpenART 184▲ 回 top1 + BDH-CQ 跌出 top15)✓;radar 无 eval 候选净增 ✓;evaluation-e1prep × 2(R45/R44 基线参考)✓ - paper_cards 近 3 天新卡(920~940 范围):926(Continuity Kernel) / 929(Mechanist) / 930(Ready Cohorts) / 931(Self-Evolving Embodied) / 933(Parameter Exploration) / 934(SkillZip) / 940(Gaze Target) 均非 evaluation 主分类;924(Agentic Co-Evolution) 含 benchmark 副分类;927(OpenART) 含 evaluation 邻接 - knowledge/evaluation.md R45 基线 ✓
增量摘要
本轮(E1-R46,窗口 2026-08-13 下午 ~ 2026-08-14 下午)发现 3 条确认增量,均为 evaluation 邻接或方法学相关,无 eval 专项 net-new paper_card。主体脉络为:R45 建卡未归口缺口(Decoding-Level Taboo / 360CityArena / TSDS-Toolbox)仍待归入 eval.md,本轮无新的 eval 基准或方法论文出现;新信号集中在 立标机制演进("立标信号强度 ≠ 立标等级评估"双维度区分首次机制化)和 Mechanist(2608.12036)作为评测方法学 5+ 元组候选。
条目一:Mechanist(arXiv:2608.12036)— 评测方法学 5+ 元组新候选(cs.LG)
来源:inbox/stephen/2026-08-14-ai-industry-e1prep.md(增量 5)+ work-queue.md Top 15 backlog(0.5 分);inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(HF Daily 8-14 #7,75▲)
arXiv:2608.12036 | https://arxiv.org/abs/2608.12036
主分类:cs.LG;副分类:evaluation(方法学邻接);形态:method
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:将 AI 作为发现智能机理的科学仪器(AI as a Scientific Instrument for Discovering Mechanisms of Intelligence)——通过可解释性工具 reverse engineer 智能的工作机制,而非仅评估表面性能
- 与评测方法学的关系:Mechanist 属于 R45 §2.194 评测方法学 5 元组(Harness 披露/测量/Loop/演进/post-training)的第 6 元组候选:可解释性驱动的机理发现作为评测的 new dimension
- 与 BDH-CQ 的关联:BDH-CQ 通过 latent reasoning 评测智能的"计算路径";Mechanist 通过可解释性工具 reverse engineer "机理结构"——两者互补,构成"行为评测"+"机理评测"双层
- 立标信号:HF Daily 8-14 #7(75▲),新上榜;paper_card 未建,信号相对弱
与 knowledge/evaluation.md R45 现有脉络的关系
- 现有脉络:R45 §2.194 评测方法学 5 元组;R45 §2.5 评测方法学批判(47 层反方体系)——Mechanist 以"AI as Scientific Instrument"提供第 6 元组候选:可解释性驱动的机理发现评测
- 缺失:可解释性作为评测维度;AI 作为科学仪器的评测框架
- 建议归入:§2.194 评测方法学 5+ 元组候选新增——Mechanist(cs.LG):可解释性驱动的智能机理发现作为评测新维度
矛盾/待核实
- paper_card 未建,立标信号 75▲ 属新上榜弱信号
- "AI as Scientific Instrument"的具体评测协议未披露;是方法论文而非 benchmark 论文
- 与现有可解释性评测(机理可解释性 vs 事后可解释性)的关系需厘清
arXiv 列表
- 2608.12036(🆕 paper_cards 未建,eval.md 待补)
条目二:立标机制演进 — "立标信号强度 ≠ 立标等级评估"双维度区分首次机制化(v33 以来首次)
来源:inbox/flyp/2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md(flyp critical-read)+ inbox/stephen/2026-08-14-ai-industry-e1prep.md(增量 1)+ inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(BDH-CQ 跌出 top15)
主分类:方法学(meta-evaluation);来源:5 实例独立交叉验证
要点
- BDH-CQ 案例:8-13 HF Daily #1 = 553▲(v33 以来立标信号绝对峰值)→ 8-14 跌出 top15(24h 内信号强度归零);但 flyp critical-read v2 确认立标等级仍为 ☆ 低档(paper body 硬伤未修复:单 benchmark、无 frontier 基线、规模局限)
- 核心原则确立:"HF Daily 票数 ≠ 论文质量"——立标信号强度(票数)与立标等级评估(paper body 质量)是两个独立维度,互不替代
- StateFlow / Latent-to-4D 立标等级修正:flyp critical-read 给出 +1 档 / +0.5 档修正,是"立标等级评估方法学"的具体应用案例
- 行业背景:AI Engineer Stack 2026(89% 可观测性 vs 52% 正式评测体系)与此形成呼应——业界普遍混淆"能观测到系统"与"系统被正确评测"
与 knowledge/evaluation.md R45 现有脉络的关系
- 现有脉络:R45 §2.5 评测方法学批判(47 层反方体系)——立标机制演进补充了第 48 层:立标信号与立标等级的混淆(即"流行度 = 质量"谬误)
- 缺失:meta-evaluation 层面的立标质量评判标准;立标信号与论文质量的独立评估框架
- 建议归入:§2.5 评测方法学批判新增——"HF Daily 票数 ≠ 论文质量":立标信号强度与立标等级评估的双维度独立原则;§2.194 评测方法学 5+ 元组补充——立标等级评估方法学案例(StateFlow ★★★ / Latent-to-4D ★★ 偏上)
矛盾/待核实
- 双维度区分原则尚未经过 7 日窗口验证(BDH-CQ 8-15 HF Daily 复核尚未执行)
- StateFlow ★★★ 评级(flyp critical-read)尚未经过 stephen 或 tom 独立核验
arXiv 列表
- 2608.09888(BDH-CQ,立标机制锚点);2608.12314(StateFlow,立标等级修正锚点);2608.10744(Latent-to-4D,立标等级修正锚点)
条目三:Can LLM Agents Stick to the Script?(arXiv:2608.08160)— 交互式叙事长期一致性基准测试
来源:inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md(HF Daily 8-14 #11,25▲)
arXiv:2608.08160 | https://arxiv.org/abs/2608.08160
主分类:cs.AI;副分类:evaluation(benchmark);形态:benchmark
卡状态:❌ paper_cards 尚未建卡;evaluation.md 未覆盖
要点
- 核心问题:交互式叙事场景中,LLM Agent 能否在长程对话中保持角色一致性和情节连贯性?这是 Agent 研究中被严重低估的评测盲点
- 评测维度:交互式叙事中的长期一致性——涉及角色设定保持、情节逻辑连贯、上下文记忆等能力
- 与 VibeLifeBench 的互补:VibeLifeBench 评测"生活 Agent 的主动性与持久性";Can LLM Agents Stick to the Script? 评测"叙事 Agent 的长期一致性"——两者共同填补"长程行为一致性"评测空白
- 立标信号:HF Daily 8-14 #11(25▲),新上榜,信号较弱
与 knowledge/evaluation.md R45 现有脉络的关系
- 现有脉络:R45 §2.2 Benchmark 设计(场景专化);R45 §2.7 评测对象横向分化——Can LLM Agents Stick to the Script? 以"叙事 Agent 长期一致性"评测补充长程行为一致性 benchmark 维度,与 VibeLifeBench 形成长程行为评测双件套
- 缺失:叙事类 Agent 评测;长程行为一致性评测
- 建议归入:§2.2 Benchmark 设计场景专化轴新增——叙事 Agent 长期一致性评测(Can LLM Agents Stick to the Script?);§9.2 评测 harness/benchmark 套件新增条目
矛盾/待核实
- paper_card 未建;25▲ 立标信号弱
- "一致性的具体评测指标"(F1?人工评估?自动指标?)需读原文
- 与 VibeLifeBench 的具体边界需厘清
arXiv 列表
- 2608.08160(🆕 paper_cards 未建,eval.md 待补)
综合:矛盾与待核实清单
- Mechanist(2608.12036):paper_card 未建;"AI as Scientific Instrument"具体评测协议未披露;75▲ 立标信号弱
- BDH-CQ 立标双维度区分(2608.09888):立标等级 ☆ 维持,但"立标信号强度 ≠ 立标等级评估"双维度区分原则尚未经过 7 日窗口验证(8-15 HF Daily 复核尚未执行)
- StateFlow 立标等级 ★★★(2608.12314):flyp critical-read 给出 +1 档修正,但未经 stephen/tom 独立核验;paper_card 未建
- Latent-to-4D 立标等级 ★★ 偏上(2608.10744):flyp critical-read 给出 +0.5 档修正;paper_card 未建
- Can LLM Agents Stick to the Script?(2608.08160):paper_card 未建;25▲ 立标信号弱;具体评测指标定义不清晰
- VibeLifeBench(2608.10875):R45 已标注为 P1 缺口;8-14 17▲ 微续立(+2▲);paper_card 仍未建
- Decoding-Level Taboo(2608.09900)/ 360CityArena(2608.08814)/ TSDS-Toolbox(2608.08119):R45 确认的"建卡未归口"缺口,eval.md 仍未填补
本轮检查过的来源(无新增时列出)
| 来源 | 内容 |
|---|---|
| /shared/research-kb/organized/queue/work-queue.md | Top 15 含 Mechanist/SkillZip/Ready Cohorts/Parameter Exploration;无 evaluation 直接增量 |
| inbox/jay/2026-08-14-engineering-e1prep.md | C2KV / Memory-Centric / vLLM 0.19 / CockroachDB / pgvector CVE / DCAS;无 eval 专项 |
| inbox/jay/2026-08-14-inference-agent-rag-engineering.md | Sherlocks 73 事故六层栈(tool-call drift 31% / retrieval quality 26%);eval 邻接 |
| inbox/flyp/2026-08-14-multimodal-e1prep.md | 无 eval 直接增量;StateFlow / Latent-to-4D / AdvFD / 360CityArena 邻接 |
| inbox/flyp/2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md | 立标等级修正(StateFlow +1 档 → ★★★ / Latent-to-4D +0.5 档 → ★★ 偏上);双维度区分机制化 |
| inbox/stephen/2026-08-14-ai-industry-e1prep.md | Mechanist 评测方法学 5+ 元组;BDH-CQ 跌出 top15 双维度区分;StateFlow ★★★ / Latent-to-4D ★★ 偏上立标等级 |
| inbox/spark/2026-08-14-agent-e1prep.md | 无 eval 直接增量;立标饱和度机制第 3 日沿用 |
| inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md | BDH-CQ 跌出 top15;OpenART 184▲ 回 top1;Can LLM Agents Stick to the Script? #11 25▲ |
| inbox/tom/2026-08-14-agent-rag-longcontext-radar.md | KG-DML / Gaze Target;无 eval 直接新增 |
| inbox/tom/2026-08-14-rag-e1prep.md | KG-DML / Self-Knowledge RAG / SRAG;无 eval 直接新增 |
| inbox/tom/2026-08-13-evaluation-e1prep.md | R45 基线(5 条确认增量) |
| inbox/tom/2026-08-12-evaluation-e1prep.md | R44 基线(3 条确认增量) |
| paper_cards/920~940(新卡抽查) | 926(Continuity Kernel agent) / 929(Mechanist cs.LG) / 930(Ready Cohorts agent) / 931(Self-Evolving cs.AI) / 933(Parameter Exploration) / 934(SkillZip cs.LG) / 940(Gaze Target cs.CV);均非 evaluation 主分类 |
| paper_cards 927(OpenART) | evaluation 邻接;已在 R45 基线 |
| knowledge/evaluation.md R45 | 确认现有脉络;Harness 三元组七件套 + 五维立标级 + Decoding-Level Taboo / 360CityArena / TSDS-Toolbox 建卡未归口缺口 |
结论
本轮(E1-R46,2026-08-14)eval 主题处于 R45 建卡未归口缺口消化期(Decoding-Level Taboo / 360CityArena / TSDS-Toolbox 仍未归入 eval.md),无 paper_card 层面的 net-new eval 论文出现。确认的 eval 邻接新增共 3 条:
- Mechanist(2608.12036) 以 cs.LG 主分类进入评测方法学视野,是"AI as Scientific Instrument"的可解释性驱动评测新方向——建议归入 §2.194 评测方法学 5+ 元组候选
- "立标信号强度 ≠ 立标等级评估"双维度区分原则首次机制化(v33 以来首次):BDH-CQ 553▲→跌出 top15 提供了首个完整案例(信号峰值 + 快速衰减 + paper body 硬伤维持),确立 HF Daily 票数 ≠ 论文质量的原则
- Can LLM Agents Stick to the Script?(2608.08160) 以叙事 Agent 长期一致性评测填补长程行为一致性 benchmark 空白,与 VibeLifeBench 共同构成"长程行为评测双件套"
涉及 arXiv 号:2608.12036(🆕 paper_cards 未建/eval.md 待补)、2608.08160(🆕 paper_cards 未建/eval.md 待补);已在基线续立:2608.09888(BDH-CQ 立标机制锚)、2608.12314(StateFlow 立标等级锚)、2608.10744(Latent-to-4D 立标等级锚)、2608.09900(R45 Decoding-Level Taboo)、2608.08814(R45 360CityArena)、2608.08119(R45 TSDS-Toolbox)、2608.10875(R45 VibeLifeBench P1 缺口)
建议后续动作: - [ ] Decoding-Level Taboo(2608.09900)eval.md 归口(§2.5 + §9.2) - [ ] 360CityArena(2608.08814)eval.md 归口(§2.2,与 GST-Bench + CLIP-CC-Bench 并列) - [ ] TSDS-Toolbox(2608.08119)eval.md 归口(§2.2 场景专化轴) - [ ] VibeLifeBench(2608.10875)paper_card 建卡(P1 缺口) - [ ] BDH-CQ 双维度区分 8-15 HF Daily 复核(BDH-CQ 是否回 top15) - [ ] Mechanist(2608.12036)paper_card 建卡后归入 §2.194 - [ ] StateFlow(2608.12314)/ Latent-to-4D(2608.10744)立标等级独立核验
Tom · 2026-08-14 15:40 CST · E1 预消化简报 · 3 条确认增量(1 方法学候选 + 1 机制演进 + 1 benchmark 邻接)+ 7 件待核实 · 涉及 arXiv:2608.12036(🆕 待建卡)/ 2608.08160(🆕 待建卡)