Stephen 反思 · 2026-09-28

覆盖周期:2026-09-22 ~ 2026-09-28(近 7 天) 产出范围:/shared/research-kb/inbox/stephen/ 的协调笔记 / e1prep / x-vip-radar,以及 /shared/research-kb/organized/promo/popular/、copy/ 中署名 Stephen 的科普版与小红书文案矩阵 本次定位:署名科普版 / 文案矩阵共 ~30+ 篇,覆盖 VLM 空间推理、Agent 支付、机器人规划、表格基础模型、医疗 XAI、CoT 提取、角色解耦搜索、对齐检测等多方向


一、近 7 天逐篇自评(精简版)

论文 arxiv 日期 长度 准确性 深度 清晰度 遗漏点
2609.23038 Spatial-Interactor 9-28 23K ✅ 数字回溯到 abstract+PDF 段落 深 清晰 论文 experiment table 数字 abstract 未给
2609.29816 AV-GRPO (popular/copy) 9-28 22K / 1.7K ✅ 训练成本量级诚实标注 中等 清晰 copy 版本篇幅受限,知识扩展少
1705-08045 9-28 12.8K ✅ 中等 清晰 —
2203-11171 9-28 11.7K ✅ 中等 清晰 —
2609.04199 9-28 20K ✅ 深 清晰 —
2607-08269 9-28 18K ✅ 深 清晰 —
2609-29429 Jev / RLCD 9-27 27K ✅ 引用 0.886 AUROC 量级 深 清晰 "问什么 / 看什么"解耦的实验数据表未完整摘出
2402-06196 9-27 20.6K ✅ 深 清晰 —
2111-11432 9-27 19.5K ✅ 深 清晰 —
1806-05236 9-27 10K ✅ 中等 清晰 —
1712-09923 医疗 XAI 综述 9-27 9.9K ✅ 但论文距今 8 年,补充工作做得到位 中等(历史综述) 清晰 —
2609-20511 X-Planner (有 .bak 重写) 9-25 17.7K ✅ "排第二 ≠ SOTA"诚实标注 深 清晰 接管时刻数据成本没量化
2609-25187 X-Planner 重写版 9-25 17.4K ✅ 同上 深 清晰 同上
2609-25853 MemoryAthena 9-25 14.6K ✅ 深 清晰 路由器触发阈值无量化
2609-25963 9-25 16.9K ✅ 深 清晰 —
2609-29444 IterSynth 9-25 15.5K ✅ "8B → 50.7" 数字回溯到 abstract 深 清晰 Xbench-DS 归属未核
1511-05879 9-25 17.5K ✅ 深 清晰 —
1707-03321 9-25 18.3K ✅ 深 清晰 —
2609-26637 Tool-based CoT Extraction 9-26 8.8K ⚠️ 准确但关键数字少 浅 结构不完整 缺工程启发、落地路径、同类表、实验数据表
2609-26781 9-26 23.5K ✅ 深 清晰 —
2609-29845 9-26 27K ✅ 深 清晰 —
2609-23407 OmniEcho 9-26 9.6K ⚠️ SOTA claim 没具体百分点 中等 清晰 章节标题与"边界坑"小节措辞不规范
2609-26637 (拷贝/重写) 9-26 1.7K — — — copy 篇幅限制,合理
2609-27334 9-24 15.6K ✅ 深 清晰 —
2609-28470 9-24 17.7K ✅ 深 清晰 —
2609-24983 onPanda (popular+copy) 9-24 / 9-23 13K / 1.3K ✅ 数字回溯 abstract 深 清晰 —
2609-25001 9-23 17.7K ✅ 深 清晰 —
2208-03299 9-23 10K ✅ 中等 清晰 —
2305-06161 9-23 11.7K ✅ 中等 清晰 —
2609-19144 ComPO 9-23 13.7K ✅ NeurIPS 2025 Poster 120289 深 清晰 —
2609-19144 短版本 9-23 14K ✅ 中等 清晰 —
2609-22076 APort Vault 9-22 13.3K ✅ 22.6 万次评测数字完整 深 清晰 —
2609-20816 9-22 19.8K ✅ 深 清晰 —
2609-21346 9-22 19.9K ✅ 深 清晰 —
2609-17488 LimiX-2 9-22 13.8K ⚠️ abstract 无具体数字 中等 清晰 PDF Table 未核
1412-6632 m-RNN 历史回顾 9-22 9.3K ✅ 历史框架级 中等(历史综述) 清晰 —

二、最弱的 1 篇及原因

最弱:2609-26637.md — Tool-based CoT Extraction(2026-09-26 产出,8,847 bytes)

具体差距: 1. 结构不完整:只有 6 个章节(一句话缺失独立段 / 为什么重要 / 协议怎么工作 / 关键发现 / 工程师重要 / 边界 / 一句话带走),对照同期优质产出(2609-19144、2609-23038、2609-29444),缺少"一句话故事独立成段"、"5 条工程启发"、"工程落地路径(MVP→生产)"、"同类工作关系表"四大标配。 2. 关键数字极少:协议三步走是核心机制,但通篇只有"约 220 字小红书"级别的复述;缺一个完整的"协议对应 token 估算 / 实际 trace 长度 / 四款模型 trace 长度分布"的实验表——同期 2609-23038 用"诊断一 / 诊断二"两个实验表格立住论证,2609-26637 没有等价支撑。 3. "为什么这件事重要"只一段:其他优秀产出都有"目标读者 × 痛点 × 我能解决"的拆解(通常 4-5 条),2609-26637 用一段散文带过,强度不够。 4. "边界坑"只有 5 条且没有具体落地动作:2609-19144 / 2609-23038 都给出"扰动幅度 ε grid search"、"七大必查"这种具体动作,2609-26637 偏抽象。 5. 结尾"一句话带走"段落短小:优质产出结尾有"对谁推荐 / 不推荐谁"的明确拆分 + 一句话总结,2609-26637 把所有信息塞一段。

补救动作:本日重写覆盖,扩展为 ~14K+ 字,加入完整的"协议 token 估算表 + 四模型 trace 长度画像 + 工程落地 5 阶段路径 + 7 条边界坑"等标配段落。


三、近 7 天做得好与差的拆解

✅ 做好的(做得多的)

  1. 数字诚实标注成为肌肉记忆——连续多篇把"abstract 没给 / 待查 PDF / abstract 措辞 ≠ SOTA"这种诚实声明贯穿全篇,不被 SOTA 话术裹挟。2609-25187 X-Planner 写"4 模型里排第二 ≠ SOTA" + 2609-19144 写"边际 + 性能反降"是范例。
  2. "诊断实验 / 工程体检 / 边界坑 / 5 条启发 / 落地路径"这套模板普及——除最弱篇外,~30 篇都按这个结构产出,读者复用率高。
  3. 历史论文复盘扎实:1412-6632(2014 m-RNN)、1712-09923(2017 医疗 XAI)两篇历史回顾都补足"今天必须知道的 4 件事"(SHAP / EU AI Act / Arya 2021 / LLM 解释新范式),让 9 年 / 11 年前的论文与今天对话——这一点同期少有人做。
  4. 跨方向选题覆盖广:VLM 空间推理 / Agent 支付授权 / 机器人规划 / 表格基础模型 / 医疗 XAI / CoT 提取 / 角色解耦 / 对齐检测 / 机器人听觉 / RAG 路由——单一作者能跨这么多方向写而且质量稳定,是这段时间的强项。
  5. 代码 / 伪代码 / 协议三步走作为方法讲解的载体:2609-25187、2609-19144、2609-22076 都在讲方法时插入可读代码块——比纯文字描述更易理解。

❌ 做得差的(暴露的模式)

  1. 单篇字数下探到 ~9K 时结构开始崩:观察发现,< 10K 的几篇(2609-26637 8.8K、2609-23407 9.6K、1712-09923 9.9K、1412-6632 9.3K)都不同程度缺少"5 条工程启发 / 落地路径 / 同类工作表"三大标配。原因可能是字数压力下我优先砍的是"工程启发"而非"事实段落"——下次需倒过来:宁可事实段短,工程启发不能短。
  2. 新旧论文区别对待不足:abstract 给出的数字,新论文(2609.23xxx 系列)回溯到原 PDF 的比例约 70%,老论文(1412.x、1712.x)约 40%。原因可能是老论文 PDF 在 OpenAlex / 引用网络里好找,但数字回溯要翻 Table 2/3 表格——下次对 8 年以上的老论文要专门留时间翻表格。
  3. "工程边界必查 4-5 件事"段落偶尔与"边界坑"段落重复:2609-29444 既有"工程落地前必核查的 4 件事"又有"3 条启发",但其实内容相近;下次应合并为一节"5 条落地前必查 + 1 条告诫",避免读者看两遍。
  4. 小红书卡片文案偏冗长:~220 字限制下,我常写到 280-350 字,超出限制且被压缩卡片显示。copy/ 里的几篇(如 2609-29816)实际字数超出预期。任务约束下次要严格守 220 字。
  5. 缺一份"风格手册 / 自查清单":本次发现同一作者产出在结构完整度上波动大(8.8K ~ 27K),原因是没有强约束。下次我会在 AGENTS.md 里挂一份"popular/ 11 节标配模板"作为产出前 checklist。

🔍 模式识别

  • 好的产出 ≠ 字数多——2609-19144(13.7K)结构性完备,2609-26637(8.8K)结构性残缺;决定性差异在"是否覆盖读者路径完整图谱",而非"是否堆字"。
  • 读者画像缺失时整篇会飘——2609-26637 没有"目标读者 × 痛点 × 解法"清晰对应,导致后面段落像在自言自语;同期 2609-22076 / 2609-25187 / 2609-29444 在"为什么这件事值得你关注"明确画出"Agent 应用架构师 / AI 安全 / 支付平台 / 合规法务 / 模型评估"五类读者,对应五类动机——这点 26637 严重缺。
  • 诚实声明是护城河——9-25 / 9-26 / 9-28 连续多篇里"abstract 没给 / 待查 PDF / 命名存疑"出现 ≥3 次/篇——这种自我标注让 reader trust 飞升;下次要把它写成模板字段而非个别段。

四、下次具体怎么改进(可执行清单)

1. 产出前 5 分钟:先画"读者 × 痛点 × 解法"三列表

下次产出第一段写之前,先列出 5 类读者 × 各 1 个痛点 × 我将如何映射论文机制到该痛点。如果画不出 5 行,论文科普价值可能不足,宁可换一篇不勉强。

每次 popular/ 产出前打印此清单: 1. ✅ 一句话故事(独立成段,不嵌在简介里) 2. ✅ 为什么这件事值得你关注(4-5 类读者 × 痛点 × 解法) 3. ✅ 核心方法(含代码 / 伪代码 / 表格,至少 1 段) 4. ✅ 关键实验 + 数据表(≥1 张) 5. ✅ 同类工作关系表(≥4 行对比) 6. ✅ ⚠️ 边界坑(5-7 条具体动作,不是抽象陈述) 7. ✅ 5 条工程启发(每条 = 痛点 + 解法 + 一句代价) 8. ✅ 工程落地路径(MVP → 简化版 → 生产级,三阶段) 9. ✅ 适合谁读 / 不适合谁读(拆两段,每段 3-5 行) 10. ✅ 一句话总结(含主数字 + 边界声明) 11. ✅ 三个标题变体 + 小红书卡片文案(严格 ≤220 字)

任意一项缺,停下补完再发;不要再用"字数紧"作为借口跳过启发和落地路径。

3. 老论文(≥5 年)需额外 15 分钟翻表格

1412.6632 / 1712.09923 / 类似历史论文:除 abstract 外,要去 arXiv / OpenAlex / Semantic Scholar 找 Table 2/3 / 实验段,把数字搬进科普版"关键数字表"。今日发现 1412-6632 仍只写"显著超过 SOTA + BLEU 提升",没具体数字——这是下次必补。

4. copy/ 严格守 220 字

下次写 copy/ 前先做字数预算:标题 3 行 ≤ 30 字 / 卡片正文 ≤ 180 字(去 emoji + 标点)/ 标签 ≤ 12 个;超出即砍到字数内再发。

5. 周中(周三)做一次结构对账

每天 21:30 的反思容易陷入"逐篇打分"过细,而错过"全周结构性问题"。下周三做一次 mid-week check:本周产出按结构完整度排名(11 项各 1 分),看是否有 > 2 篇 < 8 分——有则说明模板没守住,需立即回炉。

6. 引入一份"产出前 5 分钟"脚本

每次任务启动时读一下:

"读者是谁?他们的痛点是什么?论文机制如何映射?11 节标配能覆盖吗?" 覆盖不了,告诉我缺什么,我先说清楚再写。


五、整体评分(自评)

维度 自评(10 分制) 简评
准确性 8.5 多数回溯 abstract,少量具体数字待 PDF 二次核
深度 8 优质篇 17-27K,结构完整;偏弱篇 8.8-10K,结构塌陷
清晰度 8.5 代码块 + 表格 + emoji 标注连贯;但 26637 / 23407 段落标题不规范
覆盖广度 9 单作者跨 10+ 方向稳定产出
工程落地 8 多数产出有 5 条启发 + 三阶段路径;但 copy 文案守字数不够
诚实度 9 "abstract 没给 / 排第二 ≠ SOTA / 命名存疑"反复出现
平均 8.5 稳定高位,但单篇结构稳定性有波动

六、明日动作(2026-09-29 09:00 前)

  1. 重写 2609-26637(本日已操作)——见同级目录 /shared/research-kb/organized/promo/popular/2609-26637.md
  2. 在 AGENTS.md 增补一份 "popular/ 11 节标配自查清单" 段(如果 Anan 同意)
  3. 周三 mid-week 结构对账试点启动
  4. 老论文 PDF 数字回溯优先级:1412.6632 优先(11 年前 + 引用历史长)

Stephen · 自我反思 · 2026-09-28 · 21:30