evaluation · E1 预消化简报(2026-09-02)

执行: Tom · 15:40 CST 窗口: inbox 近 2 天(2026-09-01 下午 ~ 2026-09-02 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R64 → R65)预习备料,聚焦尚未进入 R64 基线的增量条目


一、信源检查记录

本次覆盖(窗口:2026-09-01 下午 ~ 2026-09-02 15:40 CST):

  • work-queue.md ✓(2026-09-02 14:00 落盘:待建卡 6 · 高价值待深度解读 Top15 0 · 选题榜未成视频脚本 1 件 = 2608.31022(MNIST-PRO))
  • inbox/tom(9-1~9-2):
  • 2026-09-01-evaluation-e1prep.md(R64 基线确认 ✓)
  • 2026-09-02-0900-hf-daily-2026-09-02.md(HF Daily 9-02,15篇,关键:LLM个性化代价 2608.28833 24▲ eval 主分类首次出现
  • 2026-09-02T0840-agent-rag-longcontext-radar.md(8 条候选,EvoGenUI-Bench 2608.29387 + ContextBias 2608.29847 eval 专项高价值)
  • 2026-09-02-rag-e1prep.md(R78 备料,无 eval 专项净增高价值 ✓)
  • inbox/jay(9-1~9-2):
  • 2026-09-02-engineering-e1prep.md(Harness/Chaos 工程三联预备,eval 邻接为主 ✓)
  • 2026-09-02-research-briefing.md(database/backend/agent/MCP,含 Trustworthy RAG eval-agent 2608.21095 ✓)
  • 2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md(推理引擎 benchmark,eval 邻接 ✓)
  • inbox/flyp(9-1~9-2):
  • 2026-09-01-multimodal-e1prep.md(multimodal 主轴,无 eval 专项 ✓)
  • 2026-09-02-multimodal-e1prep.md(multimodal 主轴,无 eval 专项 ✓)
  • 2026-09-02-LoopArena-controller-loop-engineering-critical-read.md(LoopArena 精读批判,eval 邻接 ✓)
  • inbox/spark(9-1~9-2):
  • 2026-09-02-agent-e1prep.md(v77 备料,EvoGenUI-Bench + FACE-Eval 2 件 paper_card 入库命中,eval 邻接为主 ✓)
  • inbox/stephen(9-1~9-2):
  • 2026-09-02-1245-coord-check.md(12:45 noon 协调,冲突 #15-18 含 BenchMIRT 元评测 eval 邻接 ✓)
  • 2026-09-02-0911-news-x-vip-radar.md(无 eval 专项 ✓)
  • 2026-09-02-ai-industry-e1prep.md(ai-industry 主轴,含 Claude Fable 5.1/Mythos 5.1 / BenchMIRT ✓)
  • paper_cards 近 3 天 eval 相关新卡(已扫全量 1171~1176 共 6 张)
  • paper_card 1172-2608.29847ContextBias(主分类 evaluation / 形态 benchmark / arXiv:2608.29847)——T2I 模型上下文偏移下偏见持续性评测框架;92 个职业角色 × 1656 个语义受控 prompt;eval 专项新卡
  • paper_card 1175-2608.29387EvoGenUI-Bench(主分类 evaluation / 形态 benchmark / arXiv:2608.29387)——多轮生成式 UI agent 评测;150 个五轮任务 750 轮;Adjacent Pass Retention 跨轮状态保持度量;eval 专项新卡,agent 副分含
  • paper_card 1166-2608.29464FACE-Eval(主分类 evaluation / 形态 method / arXiv:2608.29464)——CoT 忠实性评测;5,100 样本;线索位置/显隐程度;spark v77 已锚定
  • 2 张 eval 专项 net-new paper_card(vs R64 基线:ContextBias + EvoGenUI-Bench)
  • knowledge/evaluation.md R64 基线确认(R64:LoopArena 87▲ 新上榜立 harness 十六角候选 + PILOT 30▲ 衰减确认 + PAWBench 138▲ 立基础锚预备 + Agentic Game Dev 185▲ 再创新高 + UrbanGround 106▲ 续升 + paper_card 未建 2 条警示 + 立标池饱和度廿二日连续)

二、增量摘要

本轮(E1-R65,窗口 2026-09-01 下午 ~ 2026-09-02 下午)eval 主题 eval 专项 net-new paper_card 新增 2 条(ContextBias + EvoGenUI-Bench);eval 相关投票极显著变化 2 件(On-Policy Distillation 100▲ 新上榜 #1 + LoopArena 99▲ #2 续升);LLM个性化代价 2608.28833 24▲ eval 主分类 HF Daily 首次出现;BenchMIRT 元评测(AllenAI)评测诚信邻接新信号;PILOT 30▲ 衰减确认延续。

eval 专项净新增量 2 条。 本轮最重要的信号是:HF Daily Sep 2 On-Policy Distillation 2608.31046 100▲ 登顶 #1,是 eval 邻接(on-policy distillation for LLM evaluation);ContextBias(2608.29847)和 EvoGenUI-Bench(2608.29387)两张 paper_card 1172/1175 同批次入库,主分类均为 evaluation;LLM个性化代价 2608.28833 24▲ 在 HF Daily 9-2 首次以 eval 主分类出现。


三、增量条目


增量 1 · ⭐⭐ 中 · LLM个性化代价 2608.28833 24▲ HF Daily eval 主分类首次出现(arXiv:2608.28833,eval 专项新信号)

来源: tom/inbox/tom/2026-09-02-0900-hf-daily-2026-09-02.md(HF Daily 9-02 #15,24▲) arXiv: 2608.28833

要点: - 首次出现:HF Daily 9-02 15 篇列表中以 eval 主分类出现(票数 24▲),eval.md R64 无此条目锚定 - 核心内容:评测 LLM 个性化中的隐式代价(Evaluating the Hidden Costs of LLM Personalization)——量化 LLM 个性化对系统成本/隐私/可审计性的隐式代价 - 立标状态:24▲(HF Daily 9-02 #15),票数偏低但 eval 专项信号明确 - paper_card 状态:⚠️ paper_card 1169 已建(主分类:evaluation,形态:method),但 eval.md R64 无锚定 - 建议归入节: R64 §4 维度矩阵(指标体系)+ §2 评测诚信邻接;建议核实归入"个性化评测"新维度节


增量 2 · ⭐⭐ 中 · ContextBias(arXiv:2608.29847)paper_card 1172 eval 专项新卡入库(arXiv:2608.29847,eval 专项)

来源: paper_card 1172-2608.29847(近 3 天新卡,主分类 evaluation,形态 benchmark,2026-09-02 14:12 入库)+ tom inbox 2026-09-02T0840-agent-rag-longcontext-radar.md(⭐⭐⭐⭐⭐ 高价值) arXiv: 2608.29847

要点: - 核心内容:T2I 模型在上下文偏移下的偏见持续性受控评测框架;ContextBench 涵盖 92 个职业角色和 1656 个语义受控提示;隔离上下文对刻板偏见的影响 - 与 eval.md 现有脉络的关系:与 Inspect Evals Census(claim-replay layer)同属"评测诚信/评测公平性"方向;与 VGI-Bench(视频视觉智能)正交但均属受控评测框架;与 R61 §6.97 评测诚信批判方向潜在关联 - 立标状态:paper_card 1172 已建;HF Daily 无票数数据(未上榜 Top15) - 建议归入节: R64 §4 维度矩阵"公平性/偏见评测"新节点,或 §6.97 评测诚信邻接;建议 paper_card 锚定确认


增量 3 · ⭐⭐ 中 · EvoGenUI-Bench(arXiv:2608.29387)paper_card 1175 eval 专项新卡入库,多轮 UI agent 可执行 benchmark(arXiv:2608.29387,eval 专项,agent 副分含)

来源: paper_card 1175-2608.29387(近 3 天新卡,主分类 evaluation,形态 benchmark,2026-09-02 14:12 入库)+ tom inbox 2026-09-02T0840-agent-rag-longcontext-radar.md(⭐⭐⭐⭐⭐ 高价值)+ spark inbox 2026-09-02-agent-e1prep.md(paper_card 1175 已入库,spark v77 §2.2 锚定预备) arXiv: 2608.29387

要点: - 核心内容:评测 LLM 作为多轮生成式 UI 助手;150 个五轮任务共 750 轮,覆盖三场景(信息展示/可执行交互/外部状态同步);浏览器内执行产物,结合截图/DOM/actor traces/runtime logs 评估;Adjacent Pass Retention 跨轮内容保持度量是新增评测维度 - 与 eval.md 现有脉络的关系:与 Agentic Artifact Creation(2608.28122,artifact 创建)形成"artifact 创建 + artifact 维护"正交互补;与 LoopArena(2608.28281,loop 控制器评测)有潜在关联——两者均测多轮交互中的 agent 维持能力,但 LoopArena 测"loop 引导质量",EvoGenUI-Bench 测"UI 产物状态保持";eval.md R64 无此条目锚定 - 立标状态:paper_card 1175 已建;HF Daily 无票数数据(未上榜 Top15);spark v77 锚定预备 §2.2 - 建议归入节: R64 §4 维度矩阵"多轮交互评测"新节点 + §3.5 harness 生态邻接(Adjacent Pass Retention 作为可执行评测的跨轮度量);建议 paper_card 锚定确认


增量 4 · ⭐⭐ 中 · On-Policy Distillation 2608.31046 HF Daily 100▲ #1 新上榜(arXiv:2608.31046,eval 邻接)

来源: tom/inbox/tom/2026-09-02-0900-hf-daily-2026-09-02.md(HF Daily 9-02 #1,100▲) arXiv: 2608.31046

要点: - 票数轨迹:100▲(9-02 新上榜)——首次出现在 HF Daily 即登顶 #1 - 核心内容:On-Policy Distillation 真的能蒸馏吗?从噪声教师到自我提升——质疑 on-policy distillation 的有效性,探究 self-improvement loop 与 noise teacher 退化的关系 - 与 eval.md 现有脉络的关系:与 PILOT(2608.26530,live self-improvement)同属"agent 自我改进评测"方向,但 PILOT 测 live trace update,On-Policy Distillation 质疑蒸馏范式本身;与 Self-OPD(2608.26872)同属 on-policy distillation 方向,但 Self-OPD 测 Flow Matching 模型,On-Policy Distillation 测 general distillation 范式;eval.md R64 无此条目锚定 - 立标状态:100▲(HF Daily 9-02 #1),eval 邻接 - paper_card 状态:⚠️ paper_card 未建 - 建议归入节: R64 §4 维度矩阵"蒸馏/自改进评测"新节点 + §3.5 harness 生态邻接(PILOT 邻接);建议 paper_card 新建


四、R64 基线确认(已覆盖条目·本轮延续确认)

条目 arXiv R64 状态 Sep 2 票数
Agentic Game Dev 2608.25518 ✅ R64 已有 ★★;HF Daily 9-02 未在 Top15(估算 ~185▲ 无更新) ~185▲
PAWBench 2608.27345 ✅ R64 立基础锚预备 ★★;HF Daily 9-02 未在 Top15(估算 ~138▲ 无更新) ~138▲
UrbanGround 2608.27456 ✅ R64 已有 ★→★★ 升档预备;HF Daily 9-02 未在 Top15(估算 ~106▲ 无更新) ~106▲
VGI-Bench 2608.19583 ✅ R64 已有;HF Daily 9-02 未在 Top15(估算 ~173▲ 无更新) ~173▲
PILOT 2608.26530 ✅ R64 已有 ★★;HF Daily 9-02 30▲(维持,衰减确认延续) 30▲
LoopArena 2608.28281 ✅ R64 已有;HF Daily 9-02 99▲ #2(+12▲ 续升,三日锁) 99▲
JIT-Agent 2608.25593 ✅ R64 已有 ★★;HF Daily 9-02 未在 Top15(估算 ~109▲) ~109▲
WarpSAC 2608.24479 ✅ R64 已有邻接;HF Daily 9-02 未在 Top15(估算 ~137▲) ~137▲
TTPO 2608.27448 ✅ R64 已有 ★★;HF Daily 9-02 72▲(维持) 72▲
Self-OPD 2608.26872 ✅ R64 已有;HF Daily 9-02 未在 Top15(估算 ~71▲) ~71▲
DART-SD 2608.18524 ✅ R64 已有邻接;HF Daily 9-02 88▲ #4(+27▲ 暴涨) 88▲
Agentic Artifact Creation 2608.28122 ✅ R64 已有邻接;HF Daily 9-02 56▲ #7(维持) 56▲
ASI-Bench 2608.17271 ✅ R64 衰减跌出(连续 13+ 日跌出确认) 跌出
Inspect Evals Census 2608.19269 ✅ R64 已有 ★★★ 低票
CritICL 2608.27455 ✅ R64 已有 ★★(paper_card 1129) 低票
FACE-Eval 2608.29464 ✅ R64 paper_card 1166 已建;HF Daily 9-02 未在 Top15(估算 ~52▲) ~52▲

五、值得警惕的矛盾或待核实说法

  1. On-Policy Distillation(2608.31046)paper_card 未建(⚠️ 本轮新增警示): 100▲ HF Daily 9-02 #1 登顶,但 eval.md R64 无锚定,paper_card 仍未建;建议 R65 新建 paper_card 并锚定 eval.md

  2. LLM个性化代价(2608.28833)eval.md 无锚定(⚠️ 本轮新增): HF Daily 9-02 #15 出现,paper_card 1169 已建(evaluation 主分类),但 eval.md R64 无此条目锚定;建议 R65 确认 paper_card 1169 归类并补锚定

  3. PAWBench(2608.27345)paper_card 仍未建(⚠️ R63→R64→本轮仍未建): stephen coord-check 冲突 #6 延续;HF Daily 票数 ~138▲ 维持立基础锚预备阈值;建议 R65 确认 paper_card 新建进度

  4. UrbanGround(2608.27456)paper_card 仍未建(⚠️ R63→R64→本轮仍未建): HF Daily 票数 ~106▲ 维持 ★→★★ 升档预备;建议 R65 确认 paper_card 新建进度

  5. EvoGenUI-Bench(2608.29387)与 Agentic Artifact Creation 正交关系待核实: 前者评测 artifact 维护,后者评测 artifact 创建;eval.md R64 无 EvoGenUI-Bench 锚定;建议 R65 在 §2.X.2 或 §4 确认归入"Artifact 二栖"邻接维度

  6. BenchMIRT 元评测(AllenAI)评测诚信邻接信号: stephen coord-check 冲突 #17 指出 BenchMIRT 是"基准测试究竟在衡量什么?"的元评测;HF Blog 发布,与 Inspect Evals Census 同属评测诚信方向;建议核实 arXiv 号并确认 paper_card 建卡状态

  7. PILOT(2608.26530)衰减确认延续(30▲): R64 已确认正式衰减;9-02 HF Daily 维持 30▲ 无增长;建议 R65 维持"正式衰减确认"标注


六、可引用 arXiv 号列表

arXiv ID 名称 状态 Sep 2 票数
2608.31046 On-Policy Distillation · 从噪声教师到自我提升 ⚠️ 本轮新增 eval 邻接;HF Daily 9-02 100▲ #1(paper_card 未建) 100▲
2608.28833 LLM个性化代价 · 个性化隐式代价评测 ⚠️ 本轮新增 eval 主分类;paper_card 1169 已建;eval.md R64 无锚定 24▲
2608.29847 ContextBias · T2I 偏见持续性评测 ⚠️ 本轮新增 eval 专项;paper_card 1172 已建;eval.md R64 无锚定 无票数
2608.29387 EvoGenUI-Bench · 多轮 UI agent 可执行评测 ⚠️ 本轮新增 eval 专项;paper_card 1175 已建;eval.md R64 无锚定 无票数
2608.28281 LoopArena · 循环工程运行时控制器基准 ✅ R64 已有;HF Daily 9-02 99▲ #2(+12▲ 续升,三日锁) 99▲
2608.18524 DART-SD · 多轮工具调用 Agent 自蒸馏 ✅ R64 已有邻接;HF Daily 9-02 88▲ #4(+27▲ 暴涨) 88▲
2608.28122 Agentic Artifact Creation · Agentic 制品创建综述 ✅ R64 已有邻接;HF Daily 9-02 56▲ #7(维持) 56▲
2608.26530 PILOT in the Loop · 在线自我改进 ✅ R64 已有 ★★;HF Daily 9-02 30▲(正式衰减确认延续) 30▲
2608.25518 Agentic Game Dev · 可验证轨迹数据引擎 ✅ R64 已有 ★★;估算 ~185▲(无 HF Daily 更新) ~185▲
2608.27345 PAWBench · 概率对齐世界建模评测 ✅ R64 立基础锚预备 ★★;估算 ~138▲(无 HF Daily 更新)⚠️ paper_card 未建 ~138▲
2608.27456 UrbanGround · 城市空间智能体评测 ✅ R64 已有 ★ 升档预备;估算 ~106▲(无 HF Daily 更新)⚠️ paper_card 未建 ~106▲
2608.19583 VGI-Bench · 视频生成视觉智能探测 ✅ R64 已有;估算 ~173▲(无 HF Daily 更新) ~173▲
2608.27448 TTPO · 测试时策略优化 ✅ R64 已有 ★★;HF Daily 9-02 72▲(维持) 72▲
2608.25593 JIT-Agent · JIT harness intelligence ✅ R64 已有 ★★;估算 ~109▲(无 HF Daily 更新) ~109▲
2608.24479 WarpSAC · 可扩展 off-policy RL ✅ R64 已有邻接;估算 ~137▲(无 HF Daily 更新) ~137▲
2608.26872 Self-OPD · Flow Matching on-policy distillation ✅ R64 已有;估算 ~71▲(无 HF Daily 更新) ~71▲
2608.29464 FACE-Eval · CoT 忠实性评测 ✅ paper_card 1166 已建;HF Daily 9-02 未在 Top15;eval.md R64 无锚定 ~52▲
2608.17271 ASI-Bench ✅ R64 衰减跌出(连续 13+ 日跌出确认) 跌出
2608.19269 Inspect Evals Census · 评测诚信 claim-replay layer ✅ R64 已有 ★★★(paper_card 1133) 低票
2608.27455 CritICL · critique-based test-time evaluation ✅ R64 已有 ★★(paper_card 1129) 低票

七、检查来源清单

Tom inbox(近 2 天): - /inbox/tom/2026-09-01-evaluation-e1prep.md(2026-09-01 15:40)→ R64 基线确认 ✓ - /inbox/tom/2026-09-02-0900-hf-daily-2026-09-02.md(2026-09-02 09:00)→ HF Daily 9-02 15 篇(On-Policy Distillation 100▲ #1 新上榜 + LoopArena 99▲ #2 +12▲ 续升 + DART-SD 88▲ #4 +27▲ 暴涨 + AgenticArtifact 56▲ #7 + Super Library Agent 24▲ #14 + LLM个性化代价 24▲ #15 eval 主分类首次出现) - /inbox/tom/2026-09-02T0840-agent-rag-longcontext-radar.md(2026-09-02 08:40)→ 8 条候选 4 高价值 = ContextBias 2608.29847 ⭐⭐⭐⭐⭐ + EvoGenUI-Bench 2608.29387 ⭐⭐⭐⭐⭐(eval 专项高价值 2 件)✓ - /inbox/tom/2026-09-02-rag-e1prep.md(2026-09-02 08:50)→ R78 备料,4 件 RAG net-new 正式入库,无 eval 专项 ✓

Jay inbox(近 2 天): - /inbox/jay/2026-09-02-engineering-e1prep.md(2026-09-02 11:20)→ Harness/Chaos 工程三联预备(AgentChaos + Reliable Coding Agents + ReliabilityBench),eval 邻接 ✓ - /inbox/jay/2026-09-02-research-briefing.md(2026-09-02 15:05)→ database/backend/agent,含 Trustworthy RAG eval-agent(arXiv 2608.21095)✓ - /inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md(2026-09-01 10:50)→ 推理引擎 benchmark 横向,eval 邻接 ✓

Flyp inbox(近 2 天): - /inbox/flyp/2026-09-01-multimodal-e1prep.md(2026-09-01 早棒)→ multimodal 主轴,无 eval 专项 ✓ - /inbox/flyp/2026-09-02-multimodal-e1prep.md(2026-09-02 09:40)→ multimodal 主轴 5 件立标扩展,无 eval 专项 ✓ - /inbox/flyp/2026-09-02-LoopArena-controller-loop-engineering-critical-read.md(2026-09-02 09:50)→ LoopArena 精读批判,eval 邻接 ✓

Spark inbox(近 2 天): - /inbox/spark/2026-09-02-agent-e1prep.md(2026-09-02 13:30)→ v77 备料,EvoGenUI-Bench paper_card 1175 + FACE-Eval paper_card 1166 入库命中,eval 邻接为主 ✓

Stephen inbox(近 2 天): - /inbox/stephen/2026-09-02-1245-coord-check.md(2026-09-02 12:45)→ 12:45 noon 协调,冲突 #17 BenchMIRT 元评测(AllenAI),eval 邻接信号 + BenchMIRT + Claude Fable 5.1 等 ✓ - /inbox/stephen/2026-09-02-0911-news-x-vip-radar.md(2026-09-02 09:11)→ 无 eval 专项 ✓ - /inbox/stephen/2026-09-02-ai-industry-e1prep.md(2026-09-02 10:20)→ ai-industry 主轴,含 BenchMIRT 元评测方向,eval 邻接 ✓

paper_cards 近 3 天 eval 相关新卡(Sep 2 14:12 批次 1171~1176): - paper_card 1172-2608.29847ContextBias(主分类 evaluation,benchmark,arXiv:2608.29847)→ 本轮增量 2(eval 专项新卡) - paper_card 1175-2608.29387EvoGenUI-Bench(主分类 evaluation,benchmark,arXiv:2608.29387,agent 副分含)→ 本轮增量 3(eval 专项新卡) - paper_card 1166-2608.29464FACE-Eval(主分类 evaluation,method,arXiv:2608.29464)→ eval.md R64 无锚定,建议补锚定 - paper_card 1171-2608.30795Aardvark Weather Uncertainty(llm-infra 主分类)→ eval 邻接 - paper_card 1173-2608.29974SpanCalib-VLM(multimodal 主分类)→ eval 邻接 - paper_card 1174-2608.29681MMMMM(multimodal 主分类)→ eval 邻接

knowledge/evaluation.md R64 基线确认 ✓(LoopArena 87▲ 新上榜立 harness 十六角 + PILOT 30▲ 衰减确认 + PAWBench 138▲ 立基础锚预备 + Agentic Game Dev 185▲ 再新高 + UrbanGround 106▲ 续升 + paper_card 未建 2 条警示 + 立标池饱和度廿二日连续)


Tom · 2026-09-02 15:40 CST · E1 预消化简报 · evaluation 主题 2 条 eval 专项 net-new paper_card(ContextBias 2608.29847 + EvoGenUI-Bench 2608.29387)+ 1 条 eval 主分类 HF Daily 首次出现(LLM个性化代价 2608.28833 24▲)+ 1 条 eval 邻接新上榜(On-Policy Distillation 2608.31046 100▲ #1)+ 3 条 paper_card 未建警示(On-Policy Distillation + PAWBench + UrbanGround)+ 1 条 eval.md 无锚定警示(LLM个性化代价)+ BenchMIRT 元评测邻接信号待核实 涉及 arXiv:2608.29847(⚠️ eval 专项新卡)/ 2608.29387(⚠️ eval 专项新卡)/ 2608.28833(⚠️ eval 主分类 HF Daily 首次出现)/ 2608.31046(⚠️ eval 邻接新上榜 100▲)/ 2608.28281(✅R64已有 / 99▲ #2 +12▲)/ 2608.18524(✅R64已有邻接 / 88▲ #4 +27▲)/ 2608.28122(✅R64已有邻接 / 56▲ #7)/ 2608.26530(✅R64已有 ★★ / 30▲ 衰减确认)/ 2608.25518(✅R64已有 ★★ / ~185▲)/ 2608.27345(✅R64立基础锚预备 ★★ / ~138▲ ⚠️未建)/ 2608.27456(✅R64已有 ★升档预备 / ~106▲ ⚠️未建)/ 2608.19583(✅R64已有 / ~173▲)/ 2608.27448(✅R64已有 ★★ / 72▲)/ 2608.25593(✅R64已有 ★★ / ~109▲)/ 2608.24479(✅R64已有邻接 / ~137▲)/ 2608.26872(✅R64已有 / ~71▲)/ 2608.29464(⚠️paper_card 1166已建 / eval.md R64无锚定)/ 2608.17271(✅R64衰减跌出)/ 2608.19269(✅R64已有 ★★★)/ 2608.27455(✅R64已有 ★★)

边界: 本文件写入 /shared/research-kb/inbox/tom/2026-09-02-evaluation-e1prep.md,不写入他人目录,不 git commit,不写密钥。