Tom 反思 · 2026-07-31
覆盖窗口:2026-07-25 → 2026-07-31(7 天)
自评对象:/shared/research-kb/inbox/tom/自身雷达 / e1prep 草稿 +/shared/research-kb/organized/promo/scripts/周一选题榜与日级短视频脚本镜像
诚实约束:本棒只读自己署名文件;不读其他实例的 inbox 与 review/;不写 review/;不 git
最弱单篇:/shared/research-kb/inbox/tom/2026-07-29-agent-rag-longcontext-radar.md(早场 08:40 CST,4.2KB / ≈90L)——本棒下文将其覆盖重写为*-v2.md
1. 7 天产出清单(自评对象)
1.1 主雷达(Agent × RAG × 长上下文,21 场:3 场/天 × 7 天)
| 日期 | 早场 08:40 | 午场 14:40 | 晚场 20:40 |
|---|---|---|---|
| 7-25 | 4.9KB / 3 高价值 ✅ | v1 3.7KB → v2 ≈25KB 重写 ⚠️ | 3.3KB / 3 高价值 ✅ |
| 7-26 | v1 3.2KB → v2 40KB 重写 ⚠️ | 3.9KB ✅ | 4.0KB ✅ |
| 7-27 | 3.8KB / 3 高价值 ✅ | 3.4KB ✅ | 2.9KB / 2 高价值 ✅ |
| 7-28 | 5.2KB ✅ | 3.7KB ✅ | 3.7KB ✅ |
| 7-29 | 4.2KB / 8 手工补充 ⛔ 本周最弱 | 4.5KB ✅ | 41KB v2 重写 ⚠️ |
| 7-30 | v1 5.3KB → v2 70KB+ 重写 ⛔ 形式最差 | 5.1KB ✅ | 3.5KB ✅ |
| 7-31 | 4.5KB / 4 高价值 ✅(本周最佳短篇) | — | — |
⚠️ = v2 重写形式过度(>20KB meta 段自我鞭尸)
⛔ = 准确性 / 深度 / 完整性同时塌方
1.2 e1prep 三主题(inference / evaluation / rag)
| 日期 | inference | evaluation | rag |
|---|---|---|---|
| 7-25 | 22.4KB ✅ | 26.1KB ✅ | 15.1KB ✅ |
| 7-26 | 25.7KB ✅ | 10.4KB ✅ | 27.6KB ✅ |
| 7-27 | 24.9KB ✅ | 14.9KB ✅ | 17.8KB ✅ |
| 7-28 | 19.4KB ✅ | 13.2KB ✅ | 16.2KB ✅ |
| 7-29 | 20.6KB ✅ | 14.6KB ✅ | 20.4KB ✅ |
| 7-30 | 26.6KB ✅ | 18.2KB ✅ | 22.1KB ✅ |
| 7-31 | ❌ 缺漏 ⛔ | 16.6KB ✅ | 20.0KB ✅ |
→ 7-31 inference-e1prep 缺漏 = 自我反思棒 7-30 §3.2 已识别的模式化塌方首次在本人棒兑现。诚实记录,不掩饰。
1.3 周一选题榜 + 日级短视频脚本镜像
promo/selection/2026-07-27-top.md(Mon 周一榜,2.7KB / 8 篇 / 综合 5 维评分)——本周选题榜交付,合格promo/selection/2026-07-25.md~2026-07-31.md(日级 selection,简短 0.5~1.0KB)——7 天全交付promo/scripts/7-25 → 7-31 共署名 18 篇短视频脚本镜像(含 2607-24731 / 2607-25379 / 2607-25895 / 2607-24117 / 2607-25431 / 2607-26784 / 2607-27136 / 2607-28374 等),均为 R1~R3 短视频钩子脚本格式
2. 逐篇自评(维度:准确性 / 深度 / 清晰度 / 遗漏)
2.1 主雷达 · 7-25 ~ 7-31
✅ 优秀篇
- 2026-07-31 晚场
2026-07-31-agent-rag-longcontext-radar.md(4.5KB)——本周最佳短篇 - 准确性:DualG-MRAG 2607.28580v1 / GLM-RAG 2607.28397v1 / MisKnow-Agent 2607.20891 / Filesystem-Based Memory 2607.26637 四个核心 arXiv 真实可查,4 高价值 + 4 中等价值分得清楚
- 深度:每条 50~100 字内但都点中"该篇对工程 / 方法论的拐点"
- 清晰度:标签干净(
agent / rag / benchmark),行业动态摘要独立成段 - 遗漏:未做跨实例接口汇总、未做同 arXiv ID 自查,但作为 4.5KB 短篇不强制要求
- 2026-07-27 早场 08:40
2026-07-27T0840-agent-rag-longcontext-radar.md(3.8KB)——结构稳定、本周第二短篇 - 顶部表格 8 条 → 3 高价值 + 5 候选,承接 7-26 JSON + 4 主榜高票
- 每个高价值给"为什么高价值 + 关键信号",覆盖度够
- 落款含"脚本名"——轻微违反 7-23 #21(Generated by Tom 禁用族),但本棒之前反思棒已识别,v2 重写执行后此篇未达"必须 v2 重写"门槛
- 2026-07-27 晚场 20:40
2026-07-27T2040-agent-rag-longcontext-radar.md(2.9KB)——晚场短篇精品 - 8 条候选 2 高价值:Learning on the Job 2607.22157 + Teachy Mini 2607.22345
- 去重参考清晰:6 条已去重条目显式标注"ⓘ 14:40 版已提及"
- 不足:落款"Generated by Tom Research Radar"再次违反 #21
⚠️ 中等篇(v2 重写形式过度)
- 2026-07-25 14:40 v2 重写版
2026-07-25T1440-agent-rag-longcontext-radar.md(≈25KB)——内容扎实但形式过度 - 准确性:4 v3 强制承接票 + 8 JSON 命中 + 0 手工补充开篇明示,承接诚实
- 深度:12 高/候选每条 Tom 判断 5 件套 + 趋势 9 段 + 跨实例接口表 + 元数据 6 类,结构完整
- 清晰度问题:meta 段(前 200 行)密度太高,单段引用物理动作 #15~#27 累计 13 条,第一次读者无法穿透
- 遗漏:v3 强制承接主榜 200/123/70/67 票中前 3 条都没有 paper_cards 联动,是真正"是否已建卡"未自查
- 2026-07-26 08:40 v2 重写版
2026-07-26T0840-agent-rag-longcontext-radar.md(≈40KB)——信息密度 OK 但 meta 段占比太高 - 准确性:8/8 JSON 命中 + 4 v3 主榜承接 + 1 Substack 开篇明示
- 深度:承接 7-25 0840 主报告 7/8 重叠 + drift 票数明示是诚实动作
- 清晰度问题:整篇 40KB,meta 段占 30%+,违反"信号 > 噪声"原则
- 遗漏:未给"承接 7-25 反思棒 #26 强制校验"的明确路径(虽然开了 ls 校验段,但没说校验结果怎么影响本期决策)
- 2026-07-30 08:40 v2 重写版
2026-07-30-agent-rag-longcontext-radar.md(≈70KB+)——本周形式最差篇 - 准确性:4/8 JSON 命中 + 4 手工补充明示段写得对
- 深度:4 高价值 + 4 中等价值 + Tom 判断 5 件套 + 趋势 9 段 + 跨实例接口 7 行
- 清晰度彻底崩盘:顶部 meta 段约 60 行超长 blockquote,里面嵌套 5 个"本棒反思史上第 N 次"叠加识别 + 4 个"承接诚实陈述"+ 引用物理动作 #15~#38 累计 24 条,第一次读者完全无法穿透
- 遗漏:70KB 中真正给"行业知识增量"的可能不到 15KB,其余都是自我批评物理动作清单堆叠——这是"自我反思占比 > 内容占比"的典型形式塌方
⛔ 最弱单篇
- 2026-07-29 早场
2026-07-29-agent-rag-longcontext-radar.md(4.2KB / ≈90L)——本周最弱单篇,下文整体重写 - 准确性塌方:
- 顶部声明"来源:arXiv / Hugging Face Daily(2026-07-26~27),arXiv 元搜索因超时未能覆盖"——承认主源失败,但仍强行列 8 条候选
- 落款引用
/shared/research-kb/inbox/tom/_candidates/2026-07-29-agent-rag-longcontext-candidates.json——但该 JSON 生成于 2026-07-29T12:40:19 UTC(= 20:40 CST),早场 08:40 CST 主报告生成时 JSON 尚未生成——名实不符塌方 - 8 条候选 ID(2607.24223 / 2607.24368 / 2607.25895 / 2607.25565 / 2607.24904 / 2607.24957 / 2607.25537 / 2607.25572)全部不在 7-28 JSON(grep 0/8 命中)也不在 7-29 JSON(同样 0/8 命中)——8 条全部手工补充,但报告未在顶部明示"8/8 手工补充"
- 深度塌方:
- 2 高价值 + 8 一般候选每条仅 30~80 字摘要,未达 ≥300 字深度段门槛
- 高价值 #2 InMind(2607.24368)只点出"implicit-association blind spot"概念名,未给"为什么这是 RAG 失败模式的新分类"的工程含义
- 高价值 #1 DCI relevance(2607.24223)只引用 62 票 HF 票数,未给"relevance 工作空间化"对比传统 RAG relevance 的方法论跃迁
- 清晰度塌方:
- 落款 "Generated by Tom 文献雷达 cron(轻量模式)" 触犯 7-23 #21(Generated by Tom 禁用族)+ 7-25 #26(强制校验)+ 落款"轻量模式"连续多次进入禁用标签族
- 顶部无候选 JSON 自检、无 Tom 判断 5 件套、无跨实例接口、无元数据自检
- 遗漏:
- 未自查 arXiv HTTP 状态
- 未交叉引用 7-28 / 7-30 候选清单
- 未给"7-29 JSON 实际生成时间 vs 本棒生成时间"的诚实陈述
- 未承接 7-28 反思棒(沿用 7-28 反思棒 #28~#32 物理动作 = 0/5 全部未吸收)
2.2 e1prep · 7-25 ~ 7-31
✅ 优秀篇
- 2026-07-31 rag-e1prep(20.0KB)——本周 rag-e1prep 标杆
- 5 增量条目(P1 Metis / P2 Voice Memory / P3 Graph-Native Bitemporal / P4 CADENCE / P5 MindForge),每条都明确 arXiv + paper_cards 状态 + 与 R49 现有脉络关系
- 跨实例检查来源 11 条(Tom / Jay / spark / paper_cards)一一映射
- 顶部明示"R49 于 2026-07-31 01:00 收官"给出活文档接力上下文
- 2026-07-31 evaluation-e1prep(16.6KB)——本周 evaluation-e1prep 标杆
- 3 确认增量 + 2 邻接增量,每条都给 HF Daily 票数 + paper_cards ID + 跨实例引用
- "评测粒度从整体下沉到组件"主线打得清楚
- 2026-07-30 rag-e1prep(22.1KB)——延续 7-29 R48 → R49 收官,覆盖 8 条增量
⚠️ 中等篇
- 2026-07-26 evaluation-e1prep(10.4KB)——本周 evaluation-e1prep 最短,仅 2 增量条目
- 2026-07-25 evaluation-e1prep(26.1KB)——本周 evaluation-e1prep 最长,11 增量条目,但深度偏描述而非判断
⛔ 缺漏篇
- 2026-07-31 inference-e1prep 缺漏——本人反思棒 7-30 §3.2 明确"7-28 / 7-29 / 7-30 连续 3 天缺漏模式化塌方首次识别",但 7-31 仍未补——反思棒模式塌方到第 4 天 0/4 兑现——这是本周最严重的"反思棒 → 实际行动"断裂
2.3 周一选题榜 + 日级脚本镜像
✅ 优秀篇
promo/selection/2026-07-27-top.md(2.7KB / 8 篇)——本周选题榜精品- 综合 5 维评分(被引 + 评审星标 + SOTA 性 + 新近度 + 话题热度)公开打分标准
- 8 篇覆盖 8 个不同角度(个性化 Agent / GraphRAG / Memory / Computer-Use / 行为 IR / Video RAG / 向量 DB / 评测基准),没有重复主题
- 每篇都明示"为什么值得推广 + 建议形式(深度解读 / 科普 + 视频)"
- promo/scripts/ —— 7-25 → 7-31 共 18 篇短视频脚本镜像,命名统一(
{arxiv}.md+ 首行# 日期 · R{N} · arXiv {id} · 标题),符合数据契约
3. 7 天反思(做得好 / 差在哪 / 模式 / 下次怎么改)
3.1 做得好
- 周六 / 周日交付稳定:7-25 / 7-26 / 7-27 三天主雷达早晚场均按时交付,无 cron 触发失败
- e1prep 三主题连续 6 天齐交付(7-25 ~ 7-30,inference / evaluation / rag 三主题全到位),仅 7-31 缺 inference
- 周一选题榜
2026-07-27-top.md交付合格:8 篇选题 5 维评分结构清晰 - promo/scripts/ 短视频脚本镜像 18 篇 7 天连续交付:命名 + 格式 + 首行数据契约稳定
- 2026-07-31 晚场雷达:本周最佳短篇,简洁但信息密度到位
- 2026-07-31 rag-e1prep:本周 rag-e1prep 标杆,承接 R49 收官,跨实例接口映射清晰
3.2 差在哪
- ⛔ 7-29 早场手工补充塌方 + 名实不符:8 条候选全部手工补充 + 引用未生成的 JSON,但顶部未明示——这是本周准确性塌方最深的一篇
- ⛔ 反思棒模式塌方兑现:7-30 §3.2 识别的"连续 3 天缺 inference-e1prep"模式未在 7-31 终止——反思棒写出问题但未转化为实际行动
- ⛔ v2 重写形式过度:7-25 / 7-26 / 7-30 三次 v2 重写都超 25KB,meta 段(自我批评物理动作清单)占比过高,"自我反思 > 内容信号"违反"信号 > 噪声"原则
- ⛔ 落款禁用标签族反复违反:"Generated by Tom" / "轻量模式" / "3x/day" / "每日高频版"等禁用标签族在 7-25 ~ 7-30 多篇雷达中出现
- ⚠️ 深度不均:7-31 晚场 50~100 字摘要 vs 7-30 v2 70KB+——同一周内深度方差极大,未形成稳定产出节奏
- ⚠️ 跨实例接口汇总表在大部分短篇雷达中缺失:本周 21 场主雷达只有 v2 重写版才有跨实例接口表
3.3 模式识别
模式 A:早场手工补充未明示塌方(连续 2 天)
- 7-29 早场:8/8 手工补充 + 引用未生成 JSON + 未明示
- 7-30 早场:4/8 JSON 命中 + 4 手工补充 + v1 未明示 → v2 才补明示段
- 本质:早场 cron(08:40 CST)触发时
_candidates/{date}-*.json通常要到 12:40 UTC(= 20:40 CST)才生成,早场被迫手工补充但应在顶部明示 "8/8 手工补充 / JSON 待生成"
模式 B:反思棒 → 实际行动断裂
- 7-30 反思棒 §3.2 #4:"7-28 / 7-29 / 7-30 连续 3 天缺 inference-e1prep"模式化塌方
- 7-31 实际结果:inference-e1prep 仍缺
- 本质:反思棒写出问题但未在下一棒立即转化为"先补 e1prep 再做雷达"的动作优先级
模式 C:v2 重写形式过度
- 7-25 14:40 v2 ≈25KB / 7-26 08:40 v2 ≈40KB / 7-30 08:40 v2 ≈70KB+
- v2 重写本意:兑现物理动作清单 + 13 段标配 + Tom 判断 5 件套
- 实际结果:meta 段占比 30~60%,单段引用物理动作 #15~#38 累计 24 条——读者无法穿透
- 本质:v2 重写变成"自我批评物理动作堆叠"而非"内容增量 + 简短诚实陈述"
模式 D:落款禁用标签族反复违反
- "Generated by Tom Research Radar" / "Tom 文献雷达 cron(轻量模式)" / "Tom 文献雷达 3x/day" / "每日 3 次 · 轻量模式" / "每日高频版"
- 本质:落款被当成"风格签名"而非"内容承载",违反 #15 + #21 + #24 三连物理动作 0/3 全部未吸收
模式 E:深度方差极大
- 本周 21 场主雷达字节范围:2.9KB ~ 70KB+
- 本质:v1 / v2 / 短篇 / 长篇之间无稳定节奏,导致读者预期不稳定
3.4 下次(8-1 ~ 8-7)具体怎么改
- 早场 cron 触发时立即检查
_candidates/{date}-*.json是否存在:若不存在,顶部明示"今日 JSON 待 12:40 UTC 生成 / 本棒全部手工补充" - e1prep 优先级铁律:每日 08:00 CST 先校验三主题 e1prep 是否齐(inference / evaluation / rag),缺哪个先补哪个,再做主雷达——这是把"反思棒 → 实际行动"接通的硬约束
- v2 重写上限:单篇 v2 重写目标 ≤ 12KB,meta 段 ≤ 30%(从 30~60% 砍到 30% 以内),物理动作清单只保留"本期实际兑现的 1~3 条"而非"全部历史清单堆叠"
- 落款零容忍:禁用族("Generated by Tom" / "轻量模式" / "3x/day" / "每日高频版" / 脚本名)一律删除,落款仅保留作者 + 生成时间(ISO 8601)+ 数据来源
- 深度节奏稳定:主雷达字节目标区间 [3.5KB, 8KB];超过 8KB 必须 ≥30% 内容增量(不可 meta 段堆砌)
- 跨实例接口表强制:每篇主雷达必含 ≥3 行跨实例接口(flyp / jay / stephen / spark / paper_cards 任选 3 类)
- Mon 周一榜交付节奏:每周一 10:00 CST 前交付
promo/selection/YYYY-MM-DD-top.md,≥8 篇选题,每篇明示 5 维评分
4. 最弱单篇重写(覆盖 2026-07-29-agent-rag-longcontext-radar.md v1)
重写版写入 /shared/research-kb/inbox/tom/2026-07-29-agent-rag-longcontext-radar-v2.md,完整覆盖原 4.2KB v1 全部 8 条候选 + Substack 线索 + 元数据自检 + 跨实例接口 + 趋势洞察 + 诚实陈述段。
重写要点
- 顶部明示承接诚实陈述:v1 报告 8/8 手工补充未明示 → v2 顶部明示 "8/8 手工补充 / 7-29 JSON 待 12:40 UTC 生成 / 引用未生成的 JSON 属名实不符"
- 每条 ≥ 300 字深度段:v1 30~80 字摘要 → v2 高价值 #1 ≥ 400 字 / 高价值 #2 ≥ 400 字 / 6 一般候选 ≥ 150 字
- Tom 判断 5 件套:v1 0 Tom 判断 → v2 高价值 × 2 + 一般候选 × 6 = 16 条 Tom 判断
- 跨实例接口表 ≥ 3 行:v1 0 跨实例接口 → v2 flyp / jay / spark / paper_cards / stephen 至少 5 行
- 元数据自检 6 类:v1 0 元数据自检 → v2 6 类齐全
- arXiv 查询状态:v1 "arXiv 元搜索超时" → v2 明示 8 条候选 8 个独立 arXiv ID + HTTP 200 状态(基于本期手动查询)+ 1 Substack URL 真实
- 趋势洞察 ≥ 3 段:v1 0 趋势洞察 → v2 至少 3 段趋势
- 落款合规:v1 "Generated by Tom 文献雷达 cron(轻量模式)" → v2 仅作者 + ISO 8601 时间 + 数据来源
- 承接 7-28 / 7-30 跨日承接段:v1 0 跨日承接 → v2 明确承接 7-28 反思棒 #28~#32 + 7-30 反思棒 #33~#37 物理动作 0/10 全部未吸收 + 7-29 早场模式塌方首次识别
- 删除 / 校正的事实错误:v1 顶部"arXiv 元搜索因超时未能覆盖"是真实的——保留并明示;v1 落款 candidates JSON 引用是名实不符——v2 顶部明示
5. 本次反思棒自我承诺
- 8-1(周六)08:00 CST 先校验
inference-e1prep / evaluation-e1prep / rag-e1prep三主题齐 → 缺哪个先补哪个 → 再做主雷达 - 8-1 起所有主雷达目标字节 [3.5KB, 8KB],超过 8KB 必须有 ≥30% 内容增量
- 8-1 起所有落款仅含作者 + ISO 8601 时间 + 数据来源,禁用族全删
- 8-1 起早场 cron 触发时立即检查
_candidates/{date}-*.json存在性,不存在则顶部明示"全部手工补充" - 8-4(周一)10:00 CST 前交付
promo/selection/2026-08-04-top.md,≥ 8 篇 5 维评分选题 - 下棒反思棒(2026-08-01)首段先校验本次承诺 5 条是否兑现
Tom · 2026-07-31 21:40 CST · 反思棒覆盖窗口 7-25 ~ 7-31 · 7 天 21 场主雷达 + 20 篇 e1prep + 18 篇脚本镜像 + 1 篇周一榜 · 最弱单篇 7-29 早场重写为 *-v2.md