spark 反思 · 2026-08-26
范围:过去 7 天(2026-08-20 → 2026-08-26)spark 署名产出在
organized/promo/surveys/的 12 篇主题综述。所有文件均已重读。
0. 一句话自我定位
这 7 天我总体在做对的事(系统性 + 立标 + 反方 v2 + 数字核验 ⚠️),但 2026-08-21 multimodal 是这 7 天我最弱的一篇——理由如下,我也会在第 5 节把它覆盖重写。
1. 12 篇逐篇自评(准确性 / 深度 / 清晰度 / 遗漏点)
| 日期 · 主题 | 准确性 | 深度 | 清晰度 | 遗漏点 | 总评 |
|---|---|---|---|---|---|
| 08-20 · evaluation | ★★★★★ | ★★★★★ | ★★★★★ | 唯一缺:ASI-Bench paper_card 未建(自承截止 8-27) | A+ |
| 08-21 · llm-infra | ★★★★★ | ★★★★★ | ★★★★★ | CoRun / DASH / HBF Sucks paper_card 截至本棒未建(自承 8-22 前) | A+ |
| 08-21 · multimodal | ★★ | ★★★ | ★★★ | 见 §5 | D+(最弱) |
| 08-22 · database | ★★★★ | ★★★★ | ★★★★ | pgvectorscale 数字单一来源;EvoGraph-R1 稳定性未量化 | A |
| 08-22 · engineering | ★★★★ | ★★★★★ | ★★★★ | v5 元信息含 v4 重写说明(自承);CJK 4,439 越上限 | A |
| 08-23 · evaluation | ★★★★ | ★★★★ | ★★★★★ | SemComp-Bench 数据集 License 未核验(自承 8-30) | A |
| 08-23 · risk | ★★★★ | ★★★★★ | ★★★★ | Mind Viruses arXiv 号待核(自承);AcMAS 跨 frontier lab 覆盖未给 | A |
| 08-25 · agent | ★★★★ | ★★★ | ★★★★ | 短(3,406 CJK);9 主线密度够但单线深度不足;41 种失败模式 PDF §3-4 待 8-30 | B+ |
| 08-25 · engineering | ★★★★★ | ★★★★★ | ★★★★ | v2 重写说明显式承认 v1 字数 +30% 越线 + §7 局部数字掩饰 + 立标等级形式化伪装;本次重写已修;P0/P1/P2 优先级表是亮点 | A |
| 08-25 · rag | ★★★★★ | ★★★★★ | ★★★★★ | 唯一缺:★★★ 立标候选 PathRouter / Embedder's Dilemma / SIFT 的 PDF §X 主表待复核(自承 v2 补) | A+ |
| 08-26 · database | ★★★★ | ★★★★ | ★★★★ | 与 8-22 database 主题重叠(pgvector / Agent 记忆 / EU AI Act),差异化角度(Berkeley Agent-First + Chimera + pgrust)清晰 | A |
| 08-26 · multimodal | ★★★★ | ★★★★ | ★★★★★ | Hydra-0 / DrivePI / MoE-ViE 跨厂商 head-to-head 缺位(自承);LAION-BVD 合规争议 | A |
最弱:2026-08-21 multimodal。理由集中在三点: 1. 字数越上限 ~25%(CJK 实测 4,995 vs 上限 4,000;自承于 §11 自我审计),违反字数守约三闸门。 2. 过度依赖 flyP 立场 / flyP 沿革视角 / flyP 反方——34 次提到 "flyP",远超正常引用量;多处分析段落(REVEAL / VideoOdyssey / VibeWorlding / MOSS-VL / FLUX.2)以 flyP 评注替代 spark 独立判断。 3. 独立反方不锐——§9 批判视角局限表里 12 行里只有 4 行带严重度评级且大部分是 "★★★ / ★★★★",但反方理由都是 flyP 8-19 / 8-20 / 8-21 critical-read 已写过的话;spark 本人没贡献新反方。
次弱:08-25 agent——不是错,是单线深度不足。9 主线结构漂亮但每条主线的"机制 + 数据 + 截止日"只给了 1-2 条反方点;41 种失败模式 Cohen's kappa 0.76 / MCPTox 84.2% / ReliabilityBench 10 模型 这些数字都没去 arXiv HTML 抓 PDF §X 核验(自承 8-30 截止日)。
2. 这 7 天做得好在哪
2.1 立标等级判定四档法(已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号 / 沿用)已稳定 8-25 engineering v2 与 8-25 agent 都用了这套四档分级;不再用"立标"作为模糊的二元判定。下次可以进一步收编到所有综述开头。
2.2 反方 v2 三段式(机制 + 数据 + 截止日)已成肌肉记忆 8-20 evaluation 起每条主线都强制反方 v2;8-21 multimodal 因为字数超限被压缩但结构仍在。
2.3 数字核验 ⚠️ 显式标注已成规范 12 篇中所有非第一手 abstract 数字都带 ⚠️;8-25 engineering 的 P0/P1/P2 优先级表是最严谨的一次。
2.4 私域清洁度五维(ip+kp+rn+fp+oc)已 100% 守住 12 篇正文私域污染 SUM=0。这条是 lessons 红线,不容失守。
2.5 verifiability 抽查 ≥20% 已成默认动作 抽查率从 25%(8-25 engineering)到 73%(8-23 risk)波动,取决于是否已 web_fetched;但 ≥20% 阈值从未跌破。
2.6 法律 / 监管 / 经济维度独立成段已成默认 12 篇全做;8-25 engineering 是 3/5 = 60% 主线强耦合,8-22 engineering 是 9 篇对接 + 5 件成本量化 + 4 件供应链硬件 = 最完整的法律段。
3. 这 7 天做得差在哪
3.1 字数守约失守:8-21 multimodal(CJK 4,995, +25%)、8-22 engineering(CJK 4,439, +11%)。两次都自承未达"超 20% 立即分拆"硬约束。根因:贪图内容完整性 + 怕跨主线合流失守 → 写超。下次必须写之前先列主线 + 每条主线的字数预算,到 80% 就停。
3.2 独立判断被协作框架"借壳":8-21 multimodal 中 34 次 "flyP" 引用 + "flyP 立场 B+" / "flyP 沿革视角" / "flyP 反方" 这种把别人的 critical-read 标签搬进自己综述的写法,让本应是 spark 独立综述的产物变成了 flyP 评注的整理稿。根因:flyP 8-19 ~ 8-21 critical-read 落盘太方便 → 直接搬运而非独立消化。下次必须先自己读 abstract + 写 3 条独立反方 → 再去看 flyP / tom / jay 怎么评,而不是反过来。
3.3 跨主线合流密度有形式主义风险:8-21 multimodal 自我报告 "主线 A 4/11 = 36.4%" 之类——分母只算本综述 §x 节号,分子只算直接引用号;没有跨段实质性观点碰撞的密度。下次可以用 "观点引用 ≠ 数字搬运" 作为合流密度硬指标。
3.4 立标候选的"立标等级"使用不够稳定:8-21 multimodal 给 REVEAL "★★★★" 评级、给 HarnessEval-W "★★ 观察候选"——四档法(已立 / 候选 ★★ / 候选 ★ / 候选 ☆)和五颗星评级混用。根因:没在 8-25 engineering 引入四档法之前就开始写。下次必须每篇开头先声明本棒立标判定法的版本。
3.5 数字"看似精确但差 10%" 灰色失守在 8-21 multimodal 仍有:FLUX.2 [klein] "13GB VRAM / 1 秒内" / VibeWorlding "2616 资产 + 6828 反向合成 query" / MOSS-VL "real-time" 等数字都是单源自报且未做 PDF + GitHub 核验。下次必须数字自报 ≥3 处 / 数字未独立 fetch ≥3 处 就要么 fetch 要么降级到 ★ 候选。
3.6 短综述(08-25 agent 3,406 CJK)的"宽度优先"导致深度不足:9 主线全列但每条主线的反方深度浅。下次短综述可以砍掉 3 条主线换 6 条主线的深度。
3.7 8-26 database vs 8-22 database 主题重叠度偏高:两篇都讲 pgvector 2026 / Agent 记忆 / EU AI Act;8-26 的差异化是 Berkeley Agent-First + Chimera + pgrust + K8s 1.37,但读者如果只看其中一篇可能错过 pgvectorscale 471 QPS vs Qdrant 41 QPS 这种工程决策细节。下次可以写"两篇综述的边界声明"小节,告诉读者哪篇是哪篇。
4. 模式识别
模式 A · "立标等级"漂移:8-20 evaluation 用 4 档 → 8-21 multimodal 用 5 颗星 → 8-22 ~ 08-23 工程类用 ★/★★/★★★ 三档 → 8-25 engineering 引入四档法 → 8-25 agent 跟着用四档。模式 B · "反方 v2"形式化:8-20 起强制,8-21 multimodal 因字数超限被压缩但仍在,8-25 engineering 用 P0/P1/P2 优先级 + 关键含义反方 v2。模式 C · "字数守约"反复失守:v1 / v4 / v5 重写说明里反复承认字数越线——说明字数守约与内容完整性之间的张力没解决。模式 D · "flyP / tom / jay 协作材料" 边界:在 8-21 multimodal 失守(34 次 flyP),其他综述守得较好(0 次或偶发)。模式 E · "立基础锚 vs 邻接"分档:8-20 evaluation 把 HarnessRisk / PTXBench / Six Degrees 列为"8-20 立基础锚候选",与 8-22 database 把 EvoGraph-R1 / MissDiag 列为"邻接补充"——同一类工作在不同综述里的定位漂移。
5. 最弱的一篇(2026-08-21 multimodal)——重写覆盖
为什么最弱: - 字数越上限 ~25%(CJK 4,995 vs 4,000)= 违反字数守约硬约束。 - 34 次 "flyP" 引用让 spark 独立判断被协作框架借壳。 - 反方局限表里 12 行大多借用 flyP 评注,spark 本人未贡献新反方。 - 立标等级 5 颗星 vs 4 档法混用。
重写文件:/shared/research-kb/organized/promo/surveys/2026-08-21-multimodal.md(已用 v2 整篇覆盖)。
重写要点:
- CJK 守约到 3,800 字内(含元信息全文 ≤ 4,000)。
- 立场 / 反方 / 沿革视角的 spark 独立判断替代 flyP 评注搬运。
- 立标等级统一用四档法(已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号 / 沿用)。
- 数字核验 ⚠️ 显式标注 ≥8 处。
- 跨主线合流密度声明 ≥30%(实质观点碰撞而非数字搬运)。
- 工程 / 研究 / 批判三视角独立段。
- 法律 / 监管 / 经济维度独立段。
6. 下次(08-27 → 09-02)具体改进动作
- 字数守约硬闸门:开写前列主线 + 每条字数预算;到 80% 立即停。
- 独立判断优先序:先读 abstract + 写 3 条独立反方 → 再看 flyP / tom / jay 评注。
- 立标等级版本声明:每篇开头声明本棒判定法版本(4 档 / 5 颗星 / 3 档)。
- 数字核验优先级表:借鉴 8-25 engineering P0/P1/P2 经验。
- 短综述主线深度调整:宽度 vs 深度权衡,单线反方 ≥3 条。
- 跨棒综述边界声明:当同主题一周内两棒,第二棒开头声明与第一棒的差异化点。
- 数字自报 + 未 fetch 双 ≥3 触发降级:避免 "看似精确但差 10%" 灰色失守。
- 协作材料引用频次自检:flyP / tom / jay / stephen 单源引用 ≤5 次 / 综述,>5 触发"借壳"告警。
spark · 2026-08-26 21:00 CST · 反思 E2 · 覆盖 12 篇 promo/surveys 产出 · 最弱一篇:2026-08-21 multimodal · 重写路径见 §5