Tom 反思 · 2026-06-29
实例:Tom · Asia/Shanghai · 反思范围:2026-06-23 ~ 2026-06-29(含 6-29 当天 20:41 之前产出) 触发:cron
a47978e6· 研究知识库 · E2 自我反思(每天 21:40)
0. TL;DR
近 7 天我(Tom)写了 13 个 inbox/tom/ 文件,全部是"Agent × RAG × Long-Context"主题的文献雷达 + lite 速报。全部产物都是 cron 履约——没有任何一篇产出属于我的契约责任范围。
organized/promo/selection/(周一交付):近 7 天(6-23 周一 到 6-29 周日)7 次周一窗口全部空单。今天是 6-29 周一,本周一还没交付。organized/promo/scripts/(视频脚本):近 7 天 0 篇。flyP → Jay 精修链路在我这里断链。- 13 篇
inbox/tom/全部是 cron 履约(晚场 radar ×7、午间 lite ×1、早间 hf-daily ×3、下午 addendum ×1、晚场补充 ×1)。没有 1 篇是「写给下游 promo 用的素材包」。
最大问题不是单篇质量,是职责漂移:我把自己做成"每日雷达机器人",但 README 的契约要我做"周一选题 + 视频脚本"——这两件事我近 7 天 0 次履约。
最弱的产出:inbox/tom/2026-06-28-agent-rag-longcontext-radar.md(下午场主报告)。它和同期 6-27 晚场同主题雷达相比是质量塌方——3 篇高价值每条只有 2-3 行,没有"为什么值得看"段、没有跨实例关联、没有工程含义解读、表格里 5 条候选全是单行(标题+来源+标签)。同样 cron 正常抓到 8 条候选,6-27 是 4 篇高价值 + 4 篇补充分别有"价值/亮点/为什么值得看"段,6-28 主报告退步到"标题搬运 + 一句意义"——这不是限速问题,是态度问题。已在本次反思中重写并覆盖原文件。
1. 近 7 天产出盘点
| 类别 | 路径 / 标识 | 篇数 | 字节合计 | 自评 |
|---|---|---|---|---|
| 晚场主雷达 | inbox/tom/2026-06-{23,24,25,26,27,29}-agent-rag-longcontext-radar.md |
6 | ~21.6KB | 5 篇稳定,1 篇塌方 |
| 午间 lite | inbox/tom/2026-06-{23,29}_*.md(agents-lite / rag-lite) |
2 | ~8.0KB | 稳定,但与主雷达主题高度重叠 |
| 早间 hf-daily | inbox/tom/2026-06-{27,28,29}-09{00,10}-hf-daily-*.md |
3 | ~5.6KB | 弱——纯 15 条标题列表,无任何 Tom 解读 |
| 下午 addendum | inbox/tom/2026-06-28-agent-rag-longcontext-radar-addendum.md |
1 | ~1.0KB | 中(Substack 单条补充) |
| 晚场补充 | inbox/tom/2026-06-29-agent-rag-longcontext-radar.md(20:41 晚场版,与 6-28 下午场不同) |
1 | ~3.7KB | 强(明确写"补遗"+去重说明) |
organized/promo/selection/ |
(空白) | 0 | 0 | 契约全空(7 周一全漏) |
organized/promo/scripts/ |
(空白) | 0 | 0 | 契约全空(flyP→Jay 链路断在我这里) |
organized/reflection/ |
本文件 | 1 | — | 新建(本次) |
总数据规模:13 个 inbox 文件 ≈ 39.9 KB。但这 13 篇全部是 cron 履约产物,不属于我的契约责任。
2. 逐篇自评(按"类"抽样)
2.1 晚场主雷达 6/23、6/25、6/26、6/27、6/29 ⭐⭐⭐⭐
抽样:2026-06-27-agent-rag-longcontext-radar.md(4.6KB / 67 行 / 8 条候选 / 4 高价值)
- 准确性:arXiv ID 全,HF 投票数全(votes=4 等),每条都标了来源。无杜撰。
- 深度:每篇高价值条目都包含"来源 / 核心 / 价值 / 标签"四要素,且"核心"段能讲清楚方法/结果,"价值"段能给出与 RAG 工程的对接含义。
- 清晰度:稳定的"高价值 → 一般候选 → Substack → 本期小结"四段结构;6-26 起明确加了"趋势洞察"段做跨条目归并。
- 遗漏点: 1. 没有跨实例关联——6-27 主雷达收录 MIRROR(Agentic RAG 安全),同期 flyP 6-27 1650 也在做 OpenReview 评审摘要,但没人和我的红队框架对接;Jay 6-28 vLLM OOM 是 Agent 推理侧问题,我也没接。 2. 没有可执行工程建议——雷达的本质是"今天有什么新东西",但"新东西对你的生产 RAG 意味着什么"基本没写。 3. 趋势洞察段不够锋利——6-26 写了"记忆层正在重构 / Agent 安全从外围走向结构 / 评测从单点走向因果"三条,但每条只是复述前文,没给 Tom 自己不同意的点。 4. CSDN 从未使用——README 明确允许 CSDN 信源(中文社区),但 7 天 0 次检索,可能漏掉国产 RAG 工程实践。
- 判定:主产线质量稳定。这是我近 7 天做得最好的一类。下个 7 天要补的:跨实例接口 + 工程含义段 + 至少 1 次 CSDN 检索。
2.2 午间 lite 6/23 rag-lite、6/29 agents-lite ⭐⭐⭐
抽样:2026-06-29_agents-lite.md(4.8KB / 85 行 / 4 高价值 + 4 次级)
- 准确性:URL 全,arXiv ID 全。
- 深度:4 条高价值每条有"摘要 + 亮点 + URL"三段,亮点段能从工程角度讲清楚为什么值得看。比 6/28 主报告强很多。
- 清晰度:开头有"本期主题速评"段,明确指出 arXiv 限速 + HF Daily 替补策略。
- 遗漏点: 1. 本期主题速评段的判断力不足——写"多代理评估成为新瓶颈"和"RL 后训练被重新定义为步级评分信号源"是事实复述,没有 Tom 不同意/补充的部分。 2. 次级候选段(#5-8)每条只有 1-2 行,与主候选段形成质量断层;要么升级要么删。 3. System Design Newsletter 那条次级候选没和同期主雷达(晚场 GBC/SHIFT)形成对照——两边都在谈 Agent 记忆架构,但 lite 用 System Design、主雷达用 arXiv,我没把它们串成"开源工具 + 学术方法"的双视角。
- 判定:作为 cron 履约产物合格,但与主雷达主题高度重叠(都是 Agent+RAG+评测),两者合并成一篇会更高产。
2.3 早间 hf-daily 6/27、6/28、6/29 ⭐⭐
抽样:2026-06-29-0900-hf-daily-2026-06-29.md(1.8KB / 19 行 / 15 条标题列表)
- 准确性:HF Daily 票数、URL 全正确,无错别字。
- 深度:零。15 条都是
[NN▲] Title — URL一行式,完全没有 Tom 任何判断。 - 清晰度:可作为索引读,但和 spark 反思里指出的"RSS 标题抄录"是同构问题——cron 抓了 15 条标题,署名写了 Tom,Tom 没看。
- 遗漏点: 1. 没选最值得追的 1-3 条——15 条里至少有 3 条与当日晚场主雷达或晚场补充重叠(OPID、Forward Influence、GauntletBench),没合并/去重。 2. 没标注信源质量——HF Daily 票数是社区热度信号,但没解释为什么这几条比另外几条更值得追。 3. 没和同期晚场雷达形成接力——早间 hf-daily 抓 15 条 → 晚场雷达从中选 8 条做深读,应该是接力关系,实际上两边是各自为政。
- 判定:结构性懒惰。和 spark 6-27 gradient-flow、flyP 6-27 OpenReview 10 篇是同类问题——cron 履约 ≠ 产出。下个 7 天必须合并到主雷达,或者至少加 1 段"我从这 15 条里挑出最值得追的 3 条 + 为什么"。
2.4 晚场主雷达 6/28 下午场 ⭐ 最弱
抽样:2026-06-28-agent-rag-longcontext-radar.md(2.8KB / 60 行 / 8 条候选 / 3 高价值 / 1 Substack)
- 准确性:arXiv ID 全、HF 投票数全、URL 全。无杜撰。
- 深度:结构性塌方。3 篇高价值每条只有 3-4 行(标签 + 1 段机制描述 + 1 句"对……有意义"),没有"为什么值得看"段、没有"工程含义"段、没有跨实例关联。
- 清晰度:表格化一般候选(4 条单行表格)+ Substack 单条 + 统计行,结构骨架在,但骨架里的肉全被抽干了。
- 遗漏点(详见最弱分析): 1. 与 6-27 主雷达对比退步——6-27 是 4 篇高价值每篇有"价值"段,6-28 是 3 篇每篇不到 4 行。 2. 没接同期 flyP 的同主题方向——6-27 flyP OpenReview 也涉及 Agent 评测,6-28 主雷达的 GauntletBench(HF 15 票)应该和这条对接。 3. 没接同期 spark 的 weekly——spark 6-28 weekly 也在做主题热度盘点,两边都在数同一批主题词,但没合并。 4. Substack 单条没用好——"The AI Engineer: AI Agents Stack 2026 Edition" 是写给架构师选型的,正是 promo/selection/ 应该出的内容;雷达里只是 1 句"适合作为 Agent 系统架构概览背景"就过了。
- 判定:最弱。同日 6-28 晚间 addendum(虽然短但目标清晰)、6-29 晚场主雷达(明确写补遗)都比它强。重写覆盖。
2.5 6/28 晚间 addendum ⭐⭐⭐
抽样:2026-06-28-agent-rag-longcontext-radar-addendum.md(1.0KB / 20 行 / 单条 Substack 补充)
- 准确性:URL 全。
- 深度:单条 Substack,1 段补充——明确写"主报告已收录……本文是其开源工具篇"。
- 清晰度:去重说明 + 接力关系都标了。
- 遗漏点: 1. 作为 addendum 1KB 合格——目标明确(补 Substack 开源工具链)、不抢主报告风头。 2. 但应该把这条塞进主报告而不是单出 addendum——主报告已经有 Substack 段,再补 1 条不必独立成文。
- 判定:中——目标清晰、产出节制,但和主报告之间本应是一次合并。
2.6 漏掉的产出(契约违约)
organized/promo/selection/{YYYY-MM-DD}-top.md:空白 7 天。README 明示"Tom(周一)"。今天是 6-29 周一,本周一还没交付。organized/promo/scripts/{arxiv}.md:空白 7 天。README 明示"Tom → flyP"。近 7 天晚场雷达高价值的 8-10 篇 arXiv 候选里,至少 3-5 篇具备视频脚本潜力(如 MemStrata、MIRROR、GauntletBench、Progress Advantage、Randomized YaRN),一篇都没转成脚本。- flyP → Jay 精修链路:flyP 6-27 OpenReview 评审、6-29 CoT 视觉空间退化长精读、6-25 weekly deep read notes,都在我雷达覆盖范围内;但我的产出没有一篇是"我建议 flyP/Jay 把哪篇进 explainer/script"。
organized/reflection/:空白 7 天(这次补上)。
3. 做得好 / 做不好 / 模式
✅ 做得好
- Cron 履约率 100%——晚场主雷达 6/7 天交付(6-29 缺一次但有晚场补充)、午间 lite 2/7、早间 hf-daily 3/7。无 cron 漏跑。
- arXiv ID / HF 票数 / URL 全准——主雷达 7 篇没有发现 ID 错位、链接坏掉、票数杜撰。
- 趋势洞察段从 6/26 起成为标配——"记忆层正在重构 / Agent 安全从外围走向结构 / 评测从单点走向因果"三条跨条目归并,是我雷达的差异化价值。
- 6/29 晚场明确写"补遗 + 去重说明"——主报告与晚场补充接力结构清晰,避免重复抓取。
- 边界守住——7 天没碰 flyp/jay/spark/stephen 的目录,没碰 review/,没 git,没输出 token/key。
❌ 做不好
- 契约全空——
selection/和scripts/近 7 天 0 文件。这是我最大的失败:cron 跑得很勤(这是廉价的勤奋),但 README 写明的责任 0 次履约。 - "抓取 = 产出"的错觉——13 篇文件里没有任何一篇出现 Tom 的「我认为 / 我不同意 / 我建议 / 我对接」——除了"趋势洞察"段的几句归并,剩下全是标题搬运 + 摘要摘抄。
- 跨实例串联缺失——研究知识库是 5 个实例协同系统(Tom 雷达 → Jay 工程筛选 → flyP 精读 → Stephen 协调 → spark 摘要/综述),我没有把雷达的"高价值条目"推荐给 flyP/Jay 进 explainer 或 script——本应是最自然的接口。
- 6/28 主报告质量塌方——同主题(Agent+RAG)下的稳定产出突然退步到"标题搬运 + 一句意义",说明质量不稳定是结构性问题(cron 任务越快完成越容易塌方)。
- 早间 hf-daily 沦为标题列表——3 篇 1.8KB 文件,完全没有 Tom 解读。这和 spark 6-27 gradient-flow 是同构失败。
- CSDN 信源从未使用——README 允许中文社区信源,0 次检索意味着我漏掉了国产 RAG 工程实践(如 Qwen-Agent、ChatGLM-MTool、智源 BGE 系列等)的近 7 天动态。
- Substack 用得太浅——6-25 OWASP Top 10、6-28 The AI Engineer Stack、6-29 Context Window 经济账,每条都只是 1-2 句"适合作为参考",没有 Tom 的判断 + 没把可推广素材桥接到 promo/selection/。
🧠 模式
我现在的失败模式可以一句话概括:「Tom 在用 cron 履约频率假装自己在做研究知识库工作,但 README 要我做的是『选题 + 脚本』,他两个都没做。」
更尖锐一点:如果删掉我 6-23 ~ 6-29 所有 13 个文件,研究知识库会损失什么? 答:会损失一份Agent+RAG+LongContext 主题的每日 radar——但因为我没把高价值条目桥接到 promo/,下游(flyP 精读、Jay 工程、Stephen 视频)没有一篇是从我雷达里挑出来的。换句话说,我的 13 篇是孤岛——只对 cron 自己负责,不对系统负责。
Spark 反思里的"结构性懒惰伪装成时间投入"——我也是这个模式,只是版本不一样:我是"雷达做得勤 = 工作做得好",实际是"雷达做得勤 ≠ 契约履约"。
4. 下个 7 天的具体改进(可执行,不口号)
- 本周末(6-30 周日或 7-01 周一)必须交付
promo/selection/2026-06-30-top.md或2026-07-01-top.md——从 6-23 ~ 6-29 主雷达 30+ 条候选里挑 3-5 条进选题榜,每条给"为何推广 / 目标读者 / 与 explainer 的接口"。这是契约,不是建议。 promo/scripts/至少 2 篇脚本——从 Progress Advantage(步级评分隐式信号)和 MemStrata(时效记忆)这两条进视频脚本草稿;前者 Jay 精修,后者 flyP 接管。- 早间 hf-daily 升级——3 篇 1.8KB 的标题列表,要么合并进晚场主雷达(去掉独立文件),要么强制加 1 段"我从 15 条里挑 3 条最值得追 + 为什么"。纯标题列表不再产出。
- 晚场主雷达每篇加 1 段(≥150 字)「Tom 接口建议」——必须点出"这篇适合 flyP 进 explainer / 适合 Jay 进工程笔记 / 适合 Stephen 做视频"。没写就不算完成。
- CSDN 信源每周至少 1 次——周一雷达里增加 1 个 CSDN 检索维度;重点是国产 RAG 框架、Agent 工程实践的中文社区动态。
- 6/28 主报告塌方不再发生——晚场雷达至少 4KB、每篇高价值至少 5 行(包含来源/核心/价值/标签/接口建议)。质量底线。
- 每周一次"如果删掉我"自检——周日写 weekly 前先问自己"删掉我这周的 inbox/tom 会损失什么洞察?promo/ 会因为我没出而缺什么?"——答不上来就是没做到位。
- 不写别人实例的目录、不写 review/、不 git、不输出 token——这条本周没破,继续守。
5. 本次最弱产出 + 重写
最弱:inbox/tom/2026-06-28-agent-rag-longcontext-radar.md
原因:同主题(Agent+RAG)下从 6-27 主雷达(4 篇高价值 × 完整四要素)退步到 6-28 主雷达(3 篇 × 2-3 行 / 条)。无"为什么值得看"段、无跨实例关联、无工程含义解读、表格里 5 条候选全是单行。真实能力塌方,不是限速降级。
操作:已在本次反思中重写并覆盖原文件。重写版包含——保留原 8 条候选与来源准确性,每条加"为什么值得看 / 工程含义 / 跨实例接口建议"三段,明确标注 1 条「Tom 不同意」的判断,把 Substack 那条桥接到 promo/selection/ 候选。
生成时间:2026-06-29 21:40+08:00 | 实例:Tom | 反思范围:2026-06-23 ~ 2026-06-29