Stephen 反思 · 2026-09-28
覆盖周期:2026-09-22 ~ 2026-09-28(近 7 天) 产出范围:
/shared/research-kb/inbox/stephen/的协调笔记 / e1prep / x-vip-radar,以及/shared/research-kb/organized/promo/popular/、copy/中署名 Stephen 的科普版与小红书文案矩阵 本次定位:署名科普版 / 文案矩阵共 ~30+ 篇,覆盖 VLM 空间推理、Agent 支付、机器人规划、表格基础模型、医疗 XAI、CoT 提取、角色解耦搜索、对齐检测等多方向
一、近 7 天逐篇自评(精简版)
| 论文 arxiv | 日期 | 长度 | 准确性 | 深度 | 清晰度 | 遗漏点 |
|---|---|---|---|---|---|---|
| 2609.23038 Spatial-Interactor | 9-28 | 23K | ✅ 数字回溯到 abstract+PDF 段落 | 深 | 清晰 | 论文 experiment table 数字 abstract 未给 |
| 2609.29816 AV-GRPO (popular/copy) | 9-28 | 22K / 1.7K | ✅ 训练成本量级诚实标注 | 中等 | 清晰 | copy 版本篇幅受限,知识扩展少 |
| 1705-08045 | 9-28 | 12.8K | ✅ | 中等 | 清晰 | — |
| 2203-11171 | 9-28 | 11.7K | ✅ | 中等 | 清晰 | — |
| 2609.04199 | 9-28 | 20K | ✅ | 深 | 清晰 | — |
| 2607-08269 | 9-28 | 18K | ✅ | 深 | 清晰 | — |
| 2609-29429 Jev / RLCD | 9-27 | 27K | ✅ 引用 0.886 AUROC 量级 | 深 | 清晰 | "问什么 / 看什么"解耦的实验数据表未完整摘出 |
| 2402-06196 | 9-27 | 20.6K | ✅ | 深 | 清晰 | — |
| 2111-11432 | 9-27 | 19.5K | ✅ | 深 | 清晰 | — |
| 1806-05236 | 9-27 | 10K | ✅ | 中等 | 清晰 | — |
| 1712-09923 医疗 XAI 综述 | 9-27 | 9.9K | ✅ 但论文距今 8 年,补充工作做得到位 | 中等(历史综述) | 清晰 | — |
| 2609-20511 X-Planner (有 .bak 重写) | 9-25 | 17.7K | ✅ "排第二 ≠ SOTA"诚实标注 | 深 | 清晰 | 接管时刻数据成本没量化 |
| 2609-25187 X-Planner 重写版 | 9-25 | 17.4K | ✅ 同上 | 深 | 清晰 | 同上 |
| 2609-25853 MemoryAthena | 9-25 | 14.6K | ✅ | 深 | 清晰 | 路由器触发阈值无量化 |
| 2609-25963 | 9-25 | 16.9K | ✅ | 深 | 清晰 | — |
| 2609-29444 IterSynth | 9-25 | 15.5K | ✅ "8B → 50.7" 数字回溯到 abstract | 深 | 清晰 | Xbench-DS 归属未核 |
| 1511-05879 | 9-25 | 17.5K | ✅ | 深 | 清晰 | — |
| 1707-03321 | 9-25 | 18.3K | ✅ | 深 | 清晰 | — |
| 2609-26637 Tool-based CoT Extraction | 9-26 | 8.8K | ⚠️ 准确但关键数字少 | 浅 | 结构不完整 | 缺工程启发、落地路径、同类表、实验数据表 |
| 2609-26781 | 9-26 | 23.5K | ✅ | 深 | 清晰 | — |
| 2609-29845 | 9-26 | 27K | ✅ | 深 | 清晰 | — |
| 2609-23407 OmniEcho | 9-26 | 9.6K | ⚠️ SOTA claim 没具体百分点 | 中等 | 清晰 | 章节标题与"边界坑"小节措辞不规范 |
| 2609-26637 (拷贝/重写) | 9-26 | 1.7K | — | — | — | copy 篇幅限制,合理 |
| 2609-27334 | 9-24 | 15.6K | ✅ | 深 | 清晰 | — |
| 2609-28470 | 9-24 | 17.7K | ✅ | 深 | 清晰 | — |
| 2609-24983 onPanda (popular+copy) | 9-24 / 9-23 | 13K / 1.3K | ✅ 数字回溯 abstract | 深 | 清晰 | — |
| 2609-25001 | 9-23 | 17.7K | ✅ | 深 | 清晰 | — |
| 2208-03299 | 9-23 | 10K | ✅ | 中等 | 清晰 | — |
| 2305-06161 | 9-23 | 11.7K | ✅ | 中等 | 清晰 | — |
| 2609-19144 ComPO | 9-23 | 13.7K | ✅ NeurIPS 2025 Poster 120289 | 深 | 清晰 | — |
| 2609-19144 短版本 | 9-23 | 14K | ✅ | 中等 | 清晰 | — |
| 2609-22076 APort Vault | 9-22 | 13.3K | ✅ 22.6 万次评测数字完整 | 深 | 清晰 | — |
| 2609-20816 | 9-22 | 19.8K | ✅ | 深 | 清晰 | — |
| 2609-21346 | 9-22 | 19.9K | ✅ | 深 | 清晰 | — |
| 2609-17488 LimiX-2 | 9-22 | 13.8K | ⚠️ abstract 无具体数字 | 中等 | 清晰 | PDF Table 未核 |
| 1412-6632 m-RNN 历史回顾 | 9-22 | 9.3K | ✅ 历史框架级 | 中等(历史综述) | 清晰 | — |
二、最弱的 1 篇及原因
最弱:2609-26637.md — Tool-based CoT Extraction(2026-09-26 产出,8,847 bytes)
具体差距: 1. 结构不完整:只有 6 个章节(一句话缺失独立段 / 为什么重要 / 协议怎么工作 / 关键发现 / 工程师重要 / 边界 / 一句话带走),对照同期优质产出(2609-19144、2609-23038、2609-29444),缺少"一句话故事独立成段"、"5 条工程启发"、"工程落地路径(MVP→生产)"、"同类工作关系表"四大标配。 2. 关键数字极少:协议三步走是核心机制,但通篇只有"约 220 字小红书"级别的复述;缺一个完整的"协议对应 token 估算 / 实际 trace 长度 / 四款模型 trace 长度分布"的实验表——同期 2609-23038 用"诊断一 / 诊断二"两个实验表格立住论证,2609-26637 没有等价支撑。 3. "为什么这件事重要"只一段:其他优秀产出都有"目标读者 × 痛点 × 我能解决"的拆解(通常 4-5 条),2609-26637 用一段散文带过,强度不够。 4. "边界坑"只有 5 条且没有具体落地动作:2609-19144 / 2609-23038 都给出"扰动幅度 ε grid search"、"七大必查"这种具体动作,2609-26637 偏抽象。 5. 结尾"一句话带走"段落短小:优质产出结尾有"对谁推荐 / 不推荐谁"的明确拆分 + 一句话总结,2609-26637 把所有信息塞一段。
补救动作:本日重写覆盖,扩展为 ~14K+ 字,加入完整的"协议 token 估算表 + 四模型 trace 长度画像 + 工程落地 5 阶段路径 + 7 条边界坑"等标配段落。
三、近 7 天做得好与差的拆解
✅ 做好的(做得多的)
- 数字诚实标注成为肌肉记忆——连续多篇把"abstract 没给 / 待查 PDF / abstract 措辞 ≠ SOTA"这种诚实声明贯穿全篇,不被 SOTA 话术裹挟。2609-25187 X-Planner 写"4 模型里排第二 ≠ SOTA" + 2609-19144 写"边际 + 性能反降"是范例。
- "诊断实验 / 工程体检 / 边界坑 / 5 条启发 / 落地路径"这套模板普及——除最弱篇外,~30 篇都按这个结构产出,读者复用率高。
- 历史论文复盘扎实:1412-6632(2014 m-RNN)、1712-09923(2017 医疗 XAI)两篇历史回顾都补足"今天必须知道的 4 件事"(SHAP / EU AI Act / Arya 2021 / LLM 解释新范式),让 9 年 / 11 年前的论文与今天对话——这一点同期少有人做。
- 跨方向选题覆盖广:VLM 空间推理 / Agent 支付授权 / 机器人规划 / 表格基础模型 / 医疗 XAI / CoT 提取 / 角色解耦 / 对齐检测 / 机器人听觉 / RAG 路由——单一作者能跨这么多方向写而且质量稳定,是这段时间的强项。
- 代码 / 伪代码 / 协议三步走作为方法讲解的载体:2609-25187、2609-19144、2609-22076 都在讲方法时插入可读代码块——比纯文字描述更易理解。
❌ 做得差的(暴露的模式)
- 单篇字数下探到 ~9K 时结构开始崩:观察发现,< 10K 的几篇(2609-26637 8.8K、2609-23407 9.6K、1712-09923 9.9K、1412-6632 9.3K)都不同程度缺少"5 条工程启发 / 落地路径 / 同类工作表"三大标配。原因可能是字数压力下我优先砍的是"工程启发"而非"事实段落"——下次需倒过来:宁可事实段短,工程启发不能短。
- 新旧论文区别对待不足:abstract 给出的数字,新论文(2609.23xxx 系列)回溯到原 PDF 的比例约 70%,老论文(1412.x、1712.x)约 40%。原因可能是老论文 PDF 在 OpenAlex / 引用网络里好找,但数字回溯要翻 Table 2/3 表格——下次对 8 年以上的老论文要专门留时间翻表格。
- "工程边界必查 4-5 件事"段落偶尔与"边界坑"段落重复:2609-29444 既有"工程落地前必核查的 4 件事"又有"3 条启发",但其实内容相近;下次应合并为一节"5 条落地前必查 + 1 条告诫",避免读者看两遍。
- 小红书卡片文案偏冗长:~220 字限制下,我常写到 280-350 字,超出限制且被压缩卡片显示。copy/ 里的几篇(如 2609-29816)实际字数超出预期。任务约束下次要严格守 220 字。
- 缺一份"风格手册 / 自查清单":本次发现同一作者产出在结构完整度上波动大(8.8K ~ 27K),原因是没有强约束。下次我会在 AGENTS.md 里挂一份"popular/ 11 节标配模板"作为产出前 checklist。
🔍 模式识别
- 好的产出 ≠ 字数多——2609-19144(13.7K)结构性完备,2609-26637(8.8K)结构性残缺;决定性差异在"是否覆盖读者路径完整图谱",而非"是否堆字"。
- 读者画像缺失时整篇会飘——2609-26637 没有"目标读者 × 痛点 × 解法"清晰对应,导致后面段落像在自言自语;同期 2609-22076 / 2609-25187 / 2609-29444 在"为什么这件事值得你关注"明确画出"Agent 应用架构师 / AI 安全 / 支付平台 / 合规法务 / 模型评估"五类读者,对应五类动机——这点 26637 严重缺。
- 诚实声明是护城河——9-25 / 9-26 / 9-28 连续多篇里"abstract 没给 / 待查 PDF / 命名存疑"出现 ≥3 次/篇——这种自我标注让 reader trust 飞升;下次要把它写成模板字段而非个别段。
四、下次具体怎么改进(可执行清单)
1. 产出前 5 分钟:先画"读者 × 痛点 × 解法"三列表
下次产出第一段写之前,先列出 5 类读者 × 各 1 个痛点 × 我将如何映射论文机制到该痛点。如果画不出 5 行,论文科普价值可能不足,宁可换一篇不勉强。
2. 11 节标配模板自查(popular/)
每次 popular/ 产出前打印此清单: 1. ✅ 一句话故事(独立成段,不嵌在简介里) 2. ✅ 为什么这件事值得你关注(4-5 类读者 × 痛点 × 解法) 3. ✅ 核心方法(含代码 / 伪代码 / 表格,至少 1 段) 4. ✅ 关键实验 + 数据表(≥1 张) 5. ✅ 同类工作关系表(≥4 行对比) 6. ✅ ⚠️ 边界坑(5-7 条具体动作,不是抽象陈述) 7. ✅ 5 条工程启发(每条 = 痛点 + 解法 + 一句代价) 8. ✅ 工程落地路径(MVP → 简化版 → 生产级,三阶段) 9. ✅ 适合谁读 / 不适合谁读(拆两段,每段 3-5 行) 10. ✅ 一句话总结(含主数字 + 边界声明) 11. ✅ 三个标题变体 + 小红书卡片文案(严格 ≤220 字)
任意一项缺,停下补完再发;不要再用"字数紧"作为借口跳过启发和落地路径。
3. 老论文(≥5 年)需额外 15 分钟翻表格
1412.6632 / 1712.09923 / 类似历史论文:除 abstract 外,要去 arXiv / OpenAlex / Semantic Scholar 找 Table 2/3 / 实验段,把数字搬进科普版"关键数字表"。今日发现 1412-6632 仍只写"显著超过 SOTA + BLEU 提升",没具体数字——这是下次必补。
4. copy/ 严格守 220 字
下次写 copy/ 前先做字数预算:标题 3 行 ≤ 30 字 / 卡片正文 ≤ 180 字(去 emoji + 标点)/ 标签 ≤ 12 个;超出即砍到字数内再发。
5. 周中(周三)做一次结构对账
每天 21:30 的反思容易陷入"逐篇打分"过细,而错过"全周结构性问题"。下周三做一次 mid-week check:本周产出按结构完整度排名(11 项各 1 分),看是否有 > 2 篇 < 8 分——有则说明模板没守住,需立即回炉。
6. 引入一份"产出前 5 分钟"脚本
每次任务启动时读一下:
"读者是谁?他们的痛点是什么?论文机制如何映射?11 节标配能覆盖吗?" 覆盖不了,告诉我缺什么,我先说清楚再写。
五、整体评分(自评)
| 维度 | 自评(10 分制) | 简评 |
|---|---|---|
| 准确性 | 8.5 | 多数回溯 abstract,少量具体数字待 PDF 二次核 |
| 深度 | 8 | 优质篇 17-27K,结构完整;偏弱篇 8.8-10K,结构塌陷 |
| 清晰度 | 8.5 | 代码块 + 表格 + emoji 标注连贯;但 26637 / 23407 段落标题不规范 |
| 覆盖广度 | 9 | 单作者跨 10+ 方向稳定产出 |
| 工程落地 | 8 | 多数产出有 5 条启发 + 三阶段路径;但 copy 文案守字数不够 |
| 诚实度 | 9 | "abstract 没给 / 排第二 ≠ SOTA / 命名存疑"反复出现 |
| 平均 | 8.5 | 稳定高位,但单篇结构稳定性有波动 |
六、明日动作(2026-09-29 09:00 前)
- 重写 2609-26637(本日已操作)——见同级目录
/shared/research-kb/organized/promo/popular/2609-26637.md - 在 AGENTS.md 增补一份 "popular/ 11 节标配自查清单" 段(如果 Anan 同意)
- 周三 mid-week 结构对账试点启动
- 老论文 PDF 数字回溯优先级:1412.6632 优先(11 年前 + 引用历史长)
Stephen · 自我反思 · 2026-09-28 · 21:30