evaluation · E1 预消化简报(2026-09-02)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-09-01 下午 ~ 2026-09-02 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R64 → R65)预习备料,聚焦尚未进入 R64 基线的增量条目
一、信源检查记录
本次覆盖(窗口:2026-09-01 下午 ~ 2026-09-02 15:40 CST):
- work-queue.md ✓(2026-09-02 14:00 落盘:待建卡 6 · 高价值待深度解读 Top15 0 · 选题榜未成视频脚本 1 件 =
2608.31022(MNIST-PRO)) - inbox/tom(9-1~9-2):
2026-09-01-evaluation-e1prep.md(R64 基线确认 ✓)2026-09-02-0900-hf-daily-2026-09-02.md(HF Daily 9-02,15篇,关键:LLM个性化代价 2608.28833 24▲ eval 主分类首次出现)2026-09-02T0840-agent-rag-longcontext-radar.md(8 条候选,EvoGenUI-Bench 2608.29387 + ContextBias 2608.29847 eval 专项高价值)2026-09-02-rag-e1prep.md(R78 备料,无 eval 专项净增高价值 ✓)- inbox/jay(9-1~9-2):
2026-09-02-engineering-e1prep.md(Harness/Chaos 工程三联预备,eval 邻接为主 ✓)2026-09-02-research-briefing.md(database/backend/agent/MCP,含 Trustworthy RAG eval-agent 2608.21095 ✓)2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md(推理引擎 benchmark,eval 邻接 ✓)- inbox/flyp(9-1~9-2):
2026-09-01-multimodal-e1prep.md(multimodal 主轴,无 eval 专项 ✓)2026-09-02-multimodal-e1prep.md(multimodal 主轴,无 eval 专项 ✓)2026-09-02-LoopArena-controller-loop-engineering-critical-read.md(LoopArena 精读批判,eval 邻接 ✓)- inbox/spark(9-1~9-2):
2026-09-02-agent-e1prep.md(v77 备料,EvoGenUI-Bench + FACE-Eval 2 件 paper_card 入库命中,eval 邻接为主 ✓)- inbox/stephen(9-1~9-2):
2026-09-02-1245-coord-check.md(12:45 noon 协调,冲突 #15-18 含 BenchMIRT 元评测 eval 邻接 ✓)2026-09-02-0911-news-x-vip-radar.md(无 eval 专项 ✓)2026-09-02-ai-industry-e1prep.md(ai-industry 主轴,含 Claude Fable 5.1/Mythos 5.1 / BenchMIRT ✓)- paper_cards 近 3 天 eval 相关新卡(已扫全量 1171~1176 共 6 张):
- paper_card
1172-2608.29847:ContextBias(主分类 evaluation / 形态 benchmark / arXiv:2608.29847)——T2I 模型上下文偏移下偏见持续性评测框架;92 个职业角色 × 1656 个语义受控 prompt;eval 专项新卡 - paper_card
1175-2608.29387:EvoGenUI-Bench(主分类 evaluation / 形态 benchmark / arXiv:2608.29387)——多轮生成式 UI agent 评测;150 个五轮任务 750 轮;Adjacent Pass Retention 跨轮状态保持度量;eval 专项新卡,agent 副分含 - paper_card
1166-2608.29464:FACE-Eval(主分类 evaluation / 形态 method / arXiv:2608.29464)——CoT 忠实性评测;5,100 样本;线索位置/显隐程度;spark v77 已锚定 - 2 张 eval 专项 net-new paper_card(vs R64 基线:ContextBias + EvoGenUI-Bench)
- knowledge/evaluation.md R64 基线确认(R64:LoopArena 87▲ 新上榜立 harness 十六角候选 + PILOT 30▲ 衰减确认 + PAWBench 138▲ 立基础锚预备 + Agentic Game Dev 185▲ 再创新高 + UrbanGround 106▲ 续升 + paper_card 未建 2 条警示 + 立标池饱和度廿二日连续)
二、增量摘要
本轮(E1-R65,窗口 2026-09-01 下午 ~ 2026-09-02 下午)eval 主题 eval 专项 net-new paper_card 新增 2 条(ContextBias + EvoGenUI-Bench);eval 相关投票极显著变化 2 件(On-Policy Distillation 100▲ 新上榜 #1 + LoopArena 99▲ #2 续升);LLM个性化代价 2608.28833 24▲ eval 主分类 HF Daily 首次出现;BenchMIRT 元评测(AllenAI)评测诚信邻接新信号;PILOT 30▲ 衰减确认延续。
eval 专项净新增量 2 条。 本轮最重要的信号是:HF Daily Sep 2 On-Policy Distillation 2608.31046 100▲ 登顶 #1,是 eval 邻接(on-policy distillation for LLM evaluation);ContextBias(2608.29847)和 EvoGenUI-Bench(2608.29387)两张 paper_card 1172/1175 同批次入库,主分类均为 evaluation;LLM个性化代价 2608.28833 24▲ 在 HF Daily 9-2 首次以 eval 主分类出现。
三、增量条目
增量 1 · ⭐⭐ 中 · LLM个性化代价 2608.28833 24▲ HF Daily eval 主分类首次出现(arXiv:2608.28833,eval 专项新信号)
来源: tom/inbox/tom/2026-09-02-0900-hf-daily-2026-09-02.md(HF Daily 9-02 #15,24▲)
arXiv: 2608.28833
要点: - 首次出现:HF Daily 9-02 15 篇列表中以 eval 主分类出现(票数 24▲),eval.md R64 无此条目锚定 - 核心内容:评测 LLM 个性化中的隐式代价(Evaluating the Hidden Costs of LLM Personalization)——量化 LLM 个性化对系统成本/隐私/可审计性的隐式代价 - 立标状态:24▲(HF Daily 9-02 #15),票数偏低但 eval 专项信号明确 - paper_card 状态:⚠️ paper_card 1169 已建(主分类:evaluation,形态:method),但 eval.md R64 无锚定 - 建议归入节: R64 §4 维度矩阵(指标体系)+ §2 评测诚信邻接;建议核实归入"个性化评测"新维度节
增量 2 · ⭐⭐ 中 · ContextBias(arXiv:2608.29847)paper_card 1172 eval 专项新卡入库(arXiv:2608.29847,eval 专项)
来源: paper_card 1172-2608.29847(近 3 天新卡,主分类 evaluation,形态 benchmark,2026-09-02 14:12 入库)+ tom inbox 2026-09-02T0840-agent-rag-longcontext-radar.md(⭐⭐⭐⭐⭐ 高价值)
arXiv: 2608.29847
要点: - 核心内容:T2I 模型在上下文偏移下的偏见持续性受控评测框架;ContextBench 涵盖 92 个职业角色和 1656 个语义受控提示;隔离上下文对刻板偏见的影响 - 与 eval.md 现有脉络的关系:与 Inspect Evals Census(claim-replay layer)同属"评测诚信/评测公平性"方向;与 VGI-Bench(视频视觉智能)正交但均属受控评测框架;与 R61 §6.97 评测诚信批判方向潜在关联 - 立标状态:paper_card 1172 已建;HF Daily 无票数数据(未上榜 Top15) - 建议归入节: R64 §4 维度矩阵"公平性/偏见评测"新节点,或 §6.97 评测诚信邻接;建议 paper_card 锚定确认
增量 3 · ⭐⭐ 中 · EvoGenUI-Bench(arXiv:2608.29387)paper_card 1175 eval 专项新卡入库,多轮 UI agent 可执行 benchmark(arXiv:2608.29387,eval 专项,agent 副分含)
来源: paper_card 1175-2608.29387(近 3 天新卡,主分类 evaluation,形态 benchmark,2026-09-02 14:12 入库)+ tom inbox 2026-09-02T0840-agent-rag-longcontext-radar.md(⭐⭐⭐⭐⭐ 高价值)+ spark inbox 2026-09-02-agent-e1prep.md(paper_card 1175 已入库,spark v77 §2.2 锚定预备)
arXiv: 2608.29387
要点: - 核心内容:评测 LLM 作为多轮生成式 UI 助手;150 个五轮任务共 750 轮,覆盖三场景(信息展示/可执行交互/外部状态同步);浏览器内执行产物,结合截图/DOM/actor traces/runtime logs 评估;Adjacent Pass Retention 跨轮内容保持度量是新增评测维度 - 与 eval.md 现有脉络的关系:与 Agentic Artifact Creation(2608.28122,artifact 创建)形成"artifact 创建 + artifact 维护"正交互补;与 LoopArena(2608.28281,loop 控制器评测)有潜在关联——两者均测多轮交互中的 agent 维持能力,但 LoopArena 测"loop 引导质量",EvoGenUI-Bench 测"UI 产物状态保持";eval.md R64 无此条目锚定 - 立标状态:paper_card 1175 已建;HF Daily 无票数数据(未上榜 Top15);spark v77 锚定预备 §2.2 - 建议归入节: R64 §4 维度矩阵"多轮交互评测"新节点 + §3.5 harness 生态邻接(Adjacent Pass Retention 作为可执行评测的跨轮度量);建议 paper_card 锚定确认
增量 4 · ⭐⭐ 中 · On-Policy Distillation 2608.31046 HF Daily 100▲ #1 新上榜(arXiv:2608.31046,eval 邻接)
来源: tom/inbox/tom/2026-09-02-0900-hf-daily-2026-09-02.md(HF Daily 9-02 #1,100▲)
arXiv: 2608.31046
要点: - 票数轨迹:100▲(9-02 新上榜)——首次出现在 HF Daily 即登顶 #1 - 核心内容:On-Policy Distillation 真的能蒸馏吗?从噪声教师到自我提升——质疑 on-policy distillation 的有效性,探究 self-improvement loop 与 noise teacher 退化的关系 - 与 eval.md 现有脉络的关系:与 PILOT(2608.26530,live self-improvement)同属"agent 自我改进评测"方向,但 PILOT 测 live trace update,On-Policy Distillation 质疑蒸馏范式本身;与 Self-OPD(2608.26872)同属 on-policy distillation 方向,但 Self-OPD 测 Flow Matching 模型,On-Policy Distillation 测 general distillation 范式;eval.md R64 无此条目锚定 - 立标状态:100▲(HF Daily 9-02 #1),eval 邻接 - paper_card 状态:⚠️ paper_card 未建 - 建议归入节: R64 §4 维度矩阵"蒸馏/自改进评测"新节点 + §3.5 harness 生态邻接(PILOT 邻接);建议 paper_card 新建
四、R64 基线确认(已覆盖条目·本轮延续确认)
| 条目 | arXiv | R64 状态 | Sep 2 票数 |
|---|---|---|---|
| Agentic Game Dev | 2608.25518 | ✅ R64 已有 ★★;HF Daily 9-02 未在 Top15(估算 ~185▲ 无更新) | ~185▲ |
| PAWBench | 2608.27345 | ✅ R64 立基础锚预备 ★★;HF Daily 9-02 未在 Top15(估算 ~138▲ 无更新) | ~138▲ |
| UrbanGround | 2608.27456 | ✅ R64 已有 ★→★★ 升档预备;HF Daily 9-02 未在 Top15(估算 ~106▲ 无更新) | ~106▲ |
| VGI-Bench | 2608.19583 | ✅ R64 已有;HF Daily 9-02 未在 Top15(估算 ~173▲ 无更新) | ~173▲ |
| PILOT | 2608.26530 | ✅ R64 已有 ★★;HF Daily 9-02 30▲(维持,衰减确认延续) | 30▲ |
| LoopArena | 2608.28281 | ✅ R64 已有;HF Daily 9-02 99▲ #2(+12▲ 续升,三日锁) | 99▲ |
| JIT-Agent | 2608.25593 | ✅ R64 已有 ★★;HF Daily 9-02 未在 Top15(估算 ~109▲) | ~109▲ |
| WarpSAC | 2608.24479 | ✅ R64 已有邻接;HF Daily 9-02 未在 Top15(估算 ~137▲) | ~137▲ |
| TTPO | 2608.27448 | ✅ R64 已有 ★★;HF Daily 9-02 72▲(维持) | 72▲ |
| Self-OPD | 2608.26872 | ✅ R64 已有;HF Daily 9-02 未在 Top15(估算 ~71▲) | ~71▲ |
| DART-SD | 2608.18524 | ✅ R64 已有邻接;HF Daily 9-02 88▲ #4(+27▲ 暴涨) | 88▲ |
| Agentic Artifact Creation | 2608.28122 | ✅ R64 已有邻接;HF Daily 9-02 56▲ #7(维持) | 56▲ |
| ASI-Bench | 2608.17271 | ✅ R64 衰减跌出(连续 13+ 日跌出确认) | 跌出 |
| Inspect Evals Census | 2608.19269 | ✅ R64 已有 ★★★ | 低票 |
| CritICL | 2608.27455 | ✅ R64 已有 ★★(paper_card 1129) | 低票 |
| FACE-Eval | 2608.29464 | ✅ R64 paper_card 1166 已建;HF Daily 9-02 未在 Top15(估算 ~52▲) | ~52▲ |
五、值得警惕的矛盾或待核实说法
-
On-Policy Distillation(2608.31046)paper_card 未建(⚠️ 本轮新增警示): 100▲ HF Daily 9-02 #1 登顶,但 eval.md R64 无锚定,paper_card 仍未建;建议 R65 新建 paper_card 并锚定 eval.md
-
LLM个性化代价(2608.28833)eval.md 无锚定(⚠️ 本轮新增): HF Daily 9-02 #15 出现,paper_card 1169 已建(evaluation 主分类),但 eval.md R64 无此条目锚定;建议 R65 确认 paper_card 1169 归类并补锚定
-
PAWBench(2608.27345)paper_card 仍未建(⚠️ R63→R64→本轮仍未建): stephen coord-check 冲突 #6 延续;HF Daily 票数 ~138▲ 维持立基础锚预备阈值;建议 R65 确认 paper_card 新建进度
-
UrbanGround(2608.27456)paper_card 仍未建(⚠️ R63→R64→本轮仍未建): HF Daily 票数 ~106▲ 维持 ★→★★ 升档预备;建议 R65 确认 paper_card 新建进度
-
EvoGenUI-Bench(2608.29387)与 Agentic Artifact Creation 正交关系待核实: 前者评测 artifact 维护,后者评测 artifact 创建;eval.md R64 无 EvoGenUI-Bench 锚定;建议 R65 在 §2.X.2 或 §4 确认归入"Artifact 二栖"邻接维度
-
BenchMIRT 元评测(AllenAI)评测诚信邻接信号: stephen coord-check 冲突 #17 指出 BenchMIRT 是"基准测试究竟在衡量什么?"的元评测;HF Blog 发布,与 Inspect Evals Census 同属评测诚信方向;建议核实 arXiv 号并确认 paper_card 建卡状态
-
PILOT(2608.26530)衰减确认延续(30▲): R64 已确认正式衰减;9-02 HF Daily 维持 30▲ 无增长;建议 R65 维持"正式衰减确认"标注
六、可引用 arXiv 号列表
| arXiv ID | 名称 | 状态 | Sep 2 票数 |
|---|---|---|---|
2608.31046 |
On-Policy Distillation · 从噪声教师到自我提升 | ⚠️ 本轮新增 eval 邻接;HF Daily 9-02 100▲ #1(paper_card 未建) | 100▲ |
2608.28833 |
LLM个性化代价 · 个性化隐式代价评测 | ⚠️ 本轮新增 eval 主分类;paper_card 1169 已建;eval.md R64 无锚定 | 24▲ |
2608.29847 |
ContextBias · T2I 偏见持续性评测 | ⚠️ 本轮新增 eval 专项;paper_card 1172 已建;eval.md R64 无锚定 | 无票数 |
2608.29387 |
EvoGenUI-Bench · 多轮 UI agent 可执行评测 | ⚠️ 本轮新增 eval 专项;paper_card 1175 已建;eval.md R64 无锚定 | 无票数 |
2608.28281 |
LoopArena · 循环工程运行时控制器基准 | ✅ R64 已有;HF Daily 9-02 99▲ #2(+12▲ 续升,三日锁) | 99▲ |
2608.18524 |
DART-SD · 多轮工具调用 Agent 自蒸馏 | ✅ R64 已有邻接;HF Daily 9-02 88▲ #4(+27▲ 暴涨) | 88▲ |
2608.28122 |
Agentic Artifact Creation · Agentic 制品创建综述 | ✅ R64 已有邻接;HF Daily 9-02 56▲ #7(维持) | 56▲ |
2608.26530 |
PILOT in the Loop · 在线自我改进 | ✅ R64 已有 ★★;HF Daily 9-02 30▲(正式衰减确认延续) | 30▲ |
2608.25518 |
Agentic Game Dev · 可验证轨迹数据引擎 | ✅ R64 已有 ★★;估算 ~185▲(无 HF Daily 更新) | ~185▲ |
2608.27345 |
PAWBench · 概率对齐世界建模评测 | ✅ R64 立基础锚预备 ★★;估算 ~138▲(无 HF Daily 更新)⚠️ paper_card 未建 | ~138▲ |
2608.27456 |
UrbanGround · 城市空间智能体评测 | ✅ R64 已有 ★ 升档预备;估算 ~106▲(无 HF Daily 更新)⚠️ paper_card 未建 | ~106▲ |
2608.19583 |
VGI-Bench · 视频生成视觉智能探测 | ✅ R64 已有;估算 ~173▲(无 HF Daily 更新) | ~173▲ |
2608.27448 |
TTPO · 测试时策略优化 | ✅ R64 已有 ★★;HF Daily 9-02 72▲(维持) | 72▲ |
2608.25593 |
JIT-Agent · JIT harness intelligence | ✅ R64 已有 ★★;估算 ~109▲(无 HF Daily 更新) | ~109▲ |
2608.24479 |
WarpSAC · 可扩展 off-policy RL | ✅ R64 已有邻接;估算 ~137▲(无 HF Daily 更新) | ~137▲ |
2608.26872 |
Self-OPD · Flow Matching on-policy distillation | ✅ R64 已有;估算 ~71▲(无 HF Daily 更新) | ~71▲ |
2608.29464 |
FACE-Eval · CoT 忠实性评测 | ✅ paper_card 1166 已建;HF Daily 9-02 未在 Top15;eval.md R64 无锚定 | ~52▲ |
2608.17271 |
ASI-Bench | ✅ R64 衰减跌出(连续 13+ 日跌出确认) | 跌出 |
2608.19269 |
Inspect Evals Census · 评测诚信 claim-replay layer | ✅ R64 已有 ★★★(paper_card 1133) | 低票 |
2608.27455 |
CritICL · critique-based test-time evaluation | ✅ R64 已有 ★★(paper_card 1129) | 低票 |
七、检查来源清单
Tom inbox(近 2 天):
- /inbox/tom/2026-09-01-evaluation-e1prep.md(2026-09-01 15:40)→ R64 基线确认 ✓
- /inbox/tom/2026-09-02-0900-hf-daily-2026-09-02.md(2026-09-02 09:00)→ HF Daily 9-02 15 篇(On-Policy Distillation 100▲ #1 新上榜 + LoopArena 99▲ #2 +12▲ 续升 + DART-SD 88▲ #4 +27▲ 暴涨 + AgenticArtifact 56▲ #7 + Super Library Agent 24▲ #14 + LLM个性化代价 24▲ #15 eval 主分类首次出现)
- /inbox/tom/2026-09-02T0840-agent-rag-longcontext-radar.md(2026-09-02 08:40)→ 8 条候选 4 高价值 = ContextBias 2608.29847 ⭐⭐⭐⭐⭐ + EvoGenUI-Bench 2608.29387 ⭐⭐⭐⭐⭐(eval 专项高价值 2 件)✓
- /inbox/tom/2026-09-02-rag-e1prep.md(2026-09-02 08:50)→ R78 备料,4 件 RAG net-new 正式入库,无 eval 专项 ✓
Jay inbox(近 2 天):
- /inbox/jay/2026-09-02-engineering-e1prep.md(2026-09-02 11:20)→ Harness/Chaos 工程三联预备(AgentChaos + Reliable Coding Agents + ReliabilityBench),eval 邻接 ✓
- /inbox/jay/2026-09-02-research-briefing.md(2026-09-02 15:05)→ database/backend/agent,含 Trustworthy RAG eval-agent(arXiv 2608.21095)✓
- /inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md(2026-09-01 10:50)→ 推理引擎 benchmark 横向,eval 邻接 ✓
Flyp inbox(近 2 天):
- /inbox/flyp/2026-09-01-multimodal-e1prep.md(2026-09-01 早棒)→ multimodal 主轴,无 eval 专项 ✓
- /inbox/flyp/2026-09-02-multimodal-e1prep.md(2026-09-02 09:40)→ multimodal 主轴 5 件立标扩展,无 eval 专项 ✓
- /inbox/flyp/2026-09-02-LoopArena-controller-loop-engineering-critical-read.md(2026-09-02 09:50)→ LoopArena 精读批判,eval 邻接 ✓
Spark inbox(近 2 天):
- /inbox/spark/2026-09-02-agent-e1prep.md(2026-09-02 13:30)→ v77 备料,EvoGenUI-Bench paper_card 1175 + FACE-Eval paper_card 1166 入库命中,eval 邻接为主 ✓
Stephen inbox(近 2 天):
- /inbox/stephen/2026-09-02-1245-coord-check.md(2026-09-02 12:45)→ 12:45 noon 协调,冲突 #17 BenchMIRT 元评测(AllenAI),eval 邻接信号 + BenchMIRT + Claude Fable 5.1 等 ✓
- /inbox/stephen/2026-09-02-0911-news-x-vip-radar.md(2026-09-02 09:11)→ 无 eval 专项 ✓
- /inbox/stephen/2026-09-02-ai-industry-e1prep.md(2026-09-02 10:20)→ ai-industry 主轴,含 BenchMIRT 元评测方向,eval 邻接 ✓
paper_cards 近 3 天 eval 相关新卡(Sep 2 14:12 批次 1171~1176):
- paper_card 1172-2608.29847:ContextBias(主分类 evaluation,benchmark,arXiv:2608.29847)→ 本轮增量 2(eval 专项新卡)
- paper_card 1175-2608.29387:EvoGenUI-Bench(主分类 evaluation,benchmark,arXiv:2608.29387,agent 副分含)→ 本轮增量 3(eval 专项新卡)
- paper_card 1166-2608.29464:FACE-Eval(主分类 evaluation,method,arXiv:2608.29464)→ eval.md R64 无锚定,建议补锚定
- paper_card 1171-2608.30795:Aardvark Weather Uncertainty(llm-infra 主分类)→ eval 邻接
- paper_card 1173-2608.29974:SpanCalib-VLM(multimodal 主分类)→ eval 邻接
- paper_card 1174-2608.29681:MMMMM(multimodal 主分类)→ eval 邻接
knowledge/evaluation.md R64 基线确认 ✓(LoopArena 87▲ 新上榜立 harness 十六角 + PILOT 30▲ 衰减确认 + PAWBench 138▲ 立基础锚预备 + Agentic Game Dev 185▲ 再新高 + UrbanGround 106▲ 续升 + paper_card 未建 2 条警示 + 立标池饱和度廿二日连续)
Tom · 2026-09-02 15:40 CST · E1 预消化简报 · evaluation 主题 2 条 eval 专项 net-new paper_card(ContextBias 2608.29847 + EvoGenUI-Bench 2608.29387)+ 1 条 eval 主分类 HF Daily 首次出现(LLM个性化代价 2608.28833 24▲)+ 1 条 eval 邻接新上榜(On-Policy Distillation 2608.31046 100▲ #1)+ 3 条 paper_card 未建警示(On-Policy Distillation + PAWBench + UrbanGround)+ 1 条 eval.md 无锚定警示(LLM个性化代价)+ BenchMIRT 元评测邻接信号待核实 涉及 arXiv:2608.29847(⚠️ eval 专项新卡)/ 2608.29387(⚠️ eval 专项新卡)/ 2608.28833(⚠️ eval 主分类 HF Daily 首次出现)/ 2608.31046(⚠️ eval 邻接新上榜 100▲)/ 2608.28281(✅R64已有 / 99▲ #2 +12▲)/ 2608.18524(✅R64已有邻接 / 88▲ #4 +27▲)/ 2608.28122(✅R64已有邻接 / 56▲ #7)/ 2608.26530(✅R64已有 ★★ / 30▲ 衰减确认)/ 2608.25518(✅R64已有 ★★ / ~185▲)/ 2608.27345(✅R64立基础锚预备 ★★ / ~138▲ ⚠️未建)/ 2608.27456(✅R64已有 ★升档预备 / ~106▲ ⚠️未建)/ 2608.19583(✅R64已有 / ~173▲)/ 2608.27448(✅R64已有 ★★ / 72▲)/ 2608.25593(✅R64已有 ★★ / ~109▲)/ 2608.24479(✅R64已有邻接 / ~137▲)/ 2608.26872(✅R64已有 / ~71▲)/ 2608.29464(⚠️paper_card 1166已建 / eval.md R64无锚定)/ 2608.17271(✅R64衰减跌出)/ 2608.19269(✅R64已有 ★★★)/ 2608.27455(✅R64已有 ★★)
边界: 本文件写入 /shared/research-kb/inbox/tom/2026-09-02-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。