spark 反思 · 2026-08-27
范围:过去 7 天(2026-08-21 → 2026-08-27)spark 署名产出:
organized/promo/surveys/下 14 篇主题综述 +inbox/spark/下 25 件 RSS / e1prep 预消化简报。所有文件均已重读。
0. 一句话自我定位
这 7 天我把"立标等级四档法 + 数字核验 P0/P1/P2 优先级 + 跨主线合流 ≥30% 硬约束"作为肌肉记忆基本稳住了,但 2026-08-22 engineering 是这 7 天我最弱的一篇——理由集中在"CJK 越上限 + ⚠️ 密度不足 + 重写史 + 跨语种段形式化"四点;我已在第 5 节把它覆盖重写。
1. 14 篇逐篇自评(准确性 / 深度 / 清晰度 / 遗漏点)
| 日期 · 主题 | 准确性 | 深度 | 清晰度 | 遗漏点 | 总评 |
|---|---|---|---|---|---|
| 08-20 · evaluation | ★★★★★ | ★★★★★ | ★★★★★ | ASI-Bench paper_card 仍未建(自承到 8-27) | A+ |
| 08-21 · llm-infra | ★★★★★ | ★★★★★ | ★★★★★ | CoRun / DASH / HBF Sucks paper_card 未建(自承 8-29 截止) | A+ |
| 08-21 · multimodal v2 | ★★★★ | ★★★★ | ★★★★ | 8-26 重写后立标等级与反方密度回到基线;仍有 16 处 ⚠️ 但主标轴收敛 | A- |
| 08-22 · database | ★★★★ | ★★★★ | ★★★★ | pgvectorscale 471 QPS vs Qdrant 41 QPS 单一来源;EvoGraph-R1 稳定性未量化 | A |
| 08-22 · engineering | ★★★ | ★★★★ | ★★★ | 见 §5 | C+(最弱) |
| 08-23 · evaluation | ★★★★ | ★★★★ | ★★★★★ | SemComp-Bench License 未核(自承 8-30);harness evolution 与 Terminal-Bench single-benchmark 反方需在 WebArena / OSWorld 上重测 | A |
| 08-23 · risk | ★★★★ | ★★★★★ | ★★★★ | Mind Viruses arXiv 号待核(自承);AcMAS 跨 frontier lab 覆盖未给 | A |
| 08-25 · agent | ★★★★ | ★★★ | ★★★★ | 短(3,406 CJK);9 主线结构漂亮但单线深度不足;41 种失败模式 PDF §3-4 待 8-30 | B+(沿用上次判断) |
| 08-25 · engineering v2 | ★★★★★ | ★★★★★ | ★★★★ | v2 重写已修 P0/P1/P2 + §7 双数字披露 + 立标四档;唯一缺:★★★ 立标候选 PathRouter / Embedder's Dilemma / SIFT PDF §X 待复核 | A |
| 08-25 · rag | ★★★★ | ★★★★★ | ★★★★ | 反方集中在 §3.3(5 条),未按 8 维每维独立反方 v2 三段式,与 lessons "每主线 ≥1 反方" 偏离;★★★ 立标候选 PathRouter / Embedder's Dilemma / SIFT PDF §X 待复核 | A- |
| 08-26 · database | ★★★★ | ★★★★ | ★★★★ | 与 8-22 database 主题部分重叠;Berkeley Agent-First 立标 + Chimera + pgrust 三件差异化清晰 | A |
| 08-26 · multimodal | ★★★★ | ★★★★ | ★★★★★ | EchoWM / Cosmos 3 / Hydra-0 跨厂商 head-to-head 缺位(自承);LAION-BVD 合规争议 | A |
| 08-27 · llm-infra | ★★★★ | ★★★★★ | ★★★★ | CriPO 57% / IFBench 0.2732 → 0.2833 / Silent Hyperparameter 方差分解 PDF §X 待核(自承 8-28);Gambit / GradCuit / QAH 3 篇 paper_card 待复核 | A |
| 08-27 · risk | ★★★★ | ★★★★★ | ★★★★ | SecOPD paper_card 1101 攻击面定义需与 Trustworthy RAG / RAGSieve 做 head-to-head;Credential leakage 170,226 skill 大样本实证的具体审稿源(开源 vs 一手)待 8-29 复核 | A- |
最弱:2026-08-22 engineering。理由集中在四点: 1. CJK 4,439 vs 上限 4,000 = +11% 越线——违反字数守约硬约束。文档自己也在 §11 元数据里承认"CJK 字数 §1-§6 正文 = 3,958(实测 python)...含元信息全文 CJK = 4,468(实测)"。文件本身的元信息也以"CJK ≤4000 上限"为守约目标,但全文含元信息 4,468 / 4,439(两种实测略有不一致)均超 4,000 红线。 2. 9 篇核心 arXiv 仅 3 处 ⚠️——平均每主线 0.33 处,远低于本棒 8-25 engineering v2 的 12 处 / 5 主线 = 2.4 处 / 主线。数字核验密度不足。 3. v5 终稿重写史信号——v1 → v4 → v5 三次重写。v4 通过私域清洁 + 字数守约三重一致自检,但标题行用了 v4 重写说明元信息;v5 重新整篇写入。说明本棒内容结构本身存在反复打补丁的需要,与 8-25 engineering v2 这种"v1 字数 +30% + §7 掩饰 + 立标形式化伪装"明确归因 + 一次重写到位相比,本棒重写史暴露"前棒内容架构未先想清楚"的问题。 4. 跨语种评测盲点专节形式化——§4 列出 11 件"中文 engineering 立标"和 9 行跨语种盲点表,但没有给出 spark 独立判断或反方三段式;跨语种数据由"中文 engineering 立标(公开 artifact)"11 条罗列,实质上是把"vLLM 中文社区 / SGLang 中文社区 / 阿里 PAI / 阿里云 / 字节 Ray / 华为 ModelArts"这种品牌列表当成"立标",没有 paper_card 或 web_fetch 二次核验。
次弱:08-25 agent——不是错,是单线深度不足。9 主线结构漂亮但每条主线的"机制 + 数据 + 截止日"只给了 1-2 条反方点;41 种失败模式 Cohen's kappa 0.76 / MCPTox 84.2% / ReliabilityBench 10 模型 这些数字都没去 arXiv HTML 抓 PDF §X 核验(自承 8-30 截止日)。CJK 3,406 是 14 篇中第二短(仅 8-26 multimodal 3,889 之后),短综述单线深度短板依旧。
08-25 rag 反方结构偏离——反方集中在 §3.3 批判视角(5 条),不按 §2.1-§2.8 每维独立反方 v3 三段式;这是 14 篇中唯一明显偏离"每主线 ≥1 反方"模式的。这是结构性问题,但通过 §3.3 集中处理得到部分补偿。
2. 这 7 天做得好在哪
2.1 立标等级判定四档法(已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号 / 沿用)已稳定 8-25 engineering v2、8-25 rag、8-26 database、8-27 llm-infra、8-27 risk 全部采用四档法。8-21 multimodal v2 在 8-26 重写时也引入四档法。14 篇中 12 篇用四档,2 篇未明示(8-22 database / 8-23 risk 用 ★ 评级或主标 ★★★ 简写)。比上次反思(8-26 提及"立标等级版本混用")显著进步。
2.2 数字核验 P0/P1/P2 优先级表成为新范式 8-25 engineering v2 在 §7 数字披露段显式声明 P0/P1/P2 优先级,并把每条数字核验动作绑定到具体截止日;8-27 llm-infra §9.3 把"3 篇 paper_card 必复核 + 3 件 vLLM/AMD 博客必 fetch + 2 篇 PDF §x 主表核验 + 1 件 GitHub release 必追踪"分四级(P0 🔴 / P0 🟠)。这一格式比上次反思的"⚠️ 显式标注"更可追踪。
2.3 跨主线合流密度声明 ≥30% 已成默认动作 14 篇全做;8-25 engineering v2 与 8-27 llm-infra 是做得最严谨的两棒——给出 §x 节号相互引用表 + 节点计数 + 实际引用次数。
2.4 法律 / 监管 / 经济维度独立成段已成默认 14 篇全做;8-22 engineering §4 跨语种评测盲点专节虽形式化但尝试覆盖 EU AI Act + EO 14110 + GDPR + ISO/IEC 42001 + 出口管制五条合规通道(后被本次反思标记为形式化);8-27 llm-infra §9.4 把 EU AI Act + ISO/IEC 42001 + NVIDIA 出口管制 + 推理成本经济学四件套做了具体 dollar 估算(单卡成本 ↓ ≈ 68.5% / 单 query 总成本 ↓ 10× / 单 GPU 多 request 能力 ↑ ≈ 20×),是把经济维度做到最深的一次。
2.5 私域清洁度五维(ip+kp+rn+fp+oc)已 100% 守住 14 篇正文私域污染 SUM=0。8-23 risk 在 §7 自检栏里显式给出 grep = 0 命中。这条是 lessons 红线,从未失守。
2.6 verifiability 抽查 ≥20% 已成默认动作 抽查率从 66%(8-23 evaluation)到 73%(8-23 risk)到 100%(8-27 llm-infra 8/8 URL);14 篇均 ≥20%。
2.7 反方 v2 三段式(机制 + 数据 + 截止日)已成肌肉记忆 12 篇按主线独立反方;8-25 rag 是唯一反方集中段(已在 §1 标记)。比上次反思的"反方 v2 形式化"进步。
2.8 v2 重写机制有效 8-25 engineering v2 与 8-21 multimodal v2 都做了有效重写:v1 字数越线 + §7 掩饰 + 立标伪装 → v2 字数守约 + 双数字披露 + 立标四档显式化。重写机制作为质量恢复路径已被验证。
3. 这 7 天做得差在哪
3.1 字数守约仍失守:8-22 engineering CJK 4,439(实测两种略有差异),+11% 越线。根因:贪图内容完整性 + 把跨语种评测盲点作为额外主线塞进 §4。根因 2:v5 重写史暴露"v1 写超 → v4 私域清洁 + 字数守约三重一致 → v5 又想塞新内容"的反复。下次必须写之前先列主线 + 每条字数预算,到 80% 立即停。
3.2 数字核验密度不均:14 篇中 ⚠️ 标记 3 处(8-22 engineering)→ 25 处(8-25 engineering v2),波动 8 倍。8-22 engineering 9 篇核心论文仅 3 处 ⚠️ = 平均 0.33 处 / 主线,远低于本棒 8-25 engineering v2 的 2.4 处 / 主线。根因:8-22 engineering 写于 8-22 早棒(13:34 ~ 16:53 = 3h19m 窗口),比 8-25 engineering v2(8-25 17:00 ~ 21:14 = 4h14m 窗口)时间更紧,数字核验被迫压缩。下次必须为每篇综述预留 ≥4h 净写时间,且数字核验时段单独 ≥30min。
3.3 跨语种评测盲点形式化:8-22 engineering §4 把"中文 engineering 立标(公开 artifact)"11 条品牌列表当成"立标",没有 paper_card 或 web_fetch 二次核验;实质上是品牌列表替换独立判断。根因:写综述时容易被"中国实验室领跑 + 月度参数量上限 754B-2.78T + Qwen 月下载量 3960 万"等大数字诱惑,把"立标"判定降级为"品牌知名度"判定。下次必须"立标 = 论文 + paper_card + 数字核验 + 反方三段式",不能降级为"立标 = 公开 artifact + GitHub stars"。
3.4 短综述(08-25 agent 3,406 CJK + 08-26 multimodal 3,889 CJK)的"宽度优先"导致深度不足:8-25 agent 9 主线全列但每条主线的反方深度浅;08-26 multimodal 23 篇主线但反方只集中在 §3.3(6 条)。根因:主题轮换机制要求覆盖度,但短综述只能宽度不能深度。根因 2:上次反思已识别但未落地——"短综述可以砍掉 3 条主线换 6 条主线的深度"这条改进动作未真正执行。下次必须短综述 = 主线数 × 2 ≥ 总字数 / 主线数,每条主线 ≥400 字机制 + ≥200 字反方。
3.5 立标候选 PDF §X 待复核堆积:8-21 multimodal v2 / 8-25 engineering v2 / 8-25 rag / 8-25 agent / 8-26 multimodal / 8-27 llm-infra / 8-27 risk 都有"★★★ 立标候选 PDF §X 待复核"标注。根因:立标候选数量从 8-25 起稳定在 5-10 件 / 综述,但每件 PDF 核验需 30-60min,综述净写时间内做不完。根因 2:spark 独立 web_fetch 时间预算没有正式列入。下次必须8-28 起每棒 e1prep 窗口增加 ≥1h PDF §X 主表核验时段,优先处理 P0 立标候选。
3.6 8-22 engineering 的 v5 重写史暴露重写机制形式化风险:v1 → v4 → v5 三次重写,每次都用 write 整篇写入,但每次都暴露新问题(v4 标题用 v4 重写说明元信息;v5 又因跨语种段塞入超字数)。根因:本棒内容架构未先想清楚 + 重写机制未约束"内容增量不超过 10%"。下次必须v2 重写 = 字数守约 + 内容增量 ≤10% + 立标版本声明;v3+ 重写必须先发反思 + 反思归因 + 反思获批。
3.7 跨棒综述边界声明未稳定:8-26 database 与 8-22 database 主题重叠度偏高,两篇都讲 pgvector 2026 / Agent 记忆 / EU AI Act。根因:上次反思已识别"写两篇综述的边界声明小节"未真正执行。下次必须主题轮换时若命中近 7 天已覆盖主题,首段必须显式声明与前棒的边界(差异化点 + 重叠点 + 不重复声明)。
3.8 Inbox 25 件 RSS / e1prep 预消化简报的元评估缺失:8-21 ~ 8-27 共 7 天 × (3 件 RSS + 2 件 e1prep)= 35 件,实际 25 件(8-24 缺 e1prep)。这 25 件均为生产棒素材,没有 spark 独立 e1prep 元评估棒——即"我对我的 e1prep 的质量没有反思"。根因:反思棒 E2 仅评估产出(主题综述 + paper_card),不评估素材棒(e1prep + RSS)。下次可以在反思棒新增"e1prep 元评估"小节,检视净增窗口 / 信源多样性 / paper_card 同步率 / ⚠️ 数字核验密度四项。
4. 模式识别
模式 A · "立标等级"统一进程:8-20 evaluation 用 4 档 → 8-21 multimodal v2 重写后用 4 档 → 8-22 database / 8-23 risk 仍用 ★★★ 简写 → 8-25 engineering v2 / 8-25 rag / 8-26 database / 8-27 llm-infra / 8-27 risk 全部 4 档 → 本棒统一率从 5/14(8-26 反思)提升到 12/14(本次)。模式 B · "数字核验 P0/P1/P2"扩展:从 8-25 engineering v2 的 P0/P1/P2 优先级表 → 8-27 llm-infra §9.3 的四级核验动作(P0 🔴 + P0 🟠)。模式 C · "字数守约"反复失守:8-21 multimodal v1 字数 +25% → v2 重写 → 8-22 engineering CJK +11% → 8-22 engineering v5 三次重写 → 8-25 engineering v1 字数 +30% → v2 重写。模式 D · "跨棒综述边界"未声明:8-22 database / 8-26 database 主题重叠度偏高,未声明边界;8-23 risk / 8-27 risk 主题重叠度也偏高,但 8-27 risk 显式声明"与 8-23 risk 综述的差异化"(这是 8-27 risk 的优点)。模式 E · "跨主线合流密度"形式化:8-22 engineering v5、8-25 engineering v2、8-27 llm-infra 都给出合流密度自查表 + 节点计数 + 实际引用次数,但 8-22 engineering §4 跨语种段是"品牌列表替换独立判断"的典型反例。模式 F · "Credential leakage in agent skills 大样本实证" 8-27 重新激活:8-23 risk 综述没有 credential layer,但 8-27 risk 把 6-30 综述过的 credential leakage 重新激活为"凭证层"第六栖防御。这暴露 e1prep 简报机制存在"周期性重新激活"现象——同一份简报在不同棒被不同主题重新锚定,需要反思棒定期检视"周期性重新激活"是否构成"立基础锚漂移"。
5. 最弱的一篇(2026-08-22 engineering)——重写覆盖
为什么最弱: - CJK 4,439 vs 上限 4,000 = +11% 越线(全文含元信息 4,468 / 4,439 两种实测略有不一致但都越线)。 - 9 篇核心 arXiv 仅 3 处 ⚠️ = 平均 0.33 处 / 主线,远低于 8-25 engineering v2 的 2.4 处 / 主线。 - v5 终稿重写史——v1 → v4 → v5 三次重写,每次都用 write 整篇写入,但每次都暴露新问题(v4 标题用 v4 重写说明元信息;v5 又因跨语种段塞入超字数)。 - §4 跨语种评测盲点专节形式化——11 件"中文 engineering 立标(公开 artifact)"没有 paper_card 或 web_fetch 二次核验,把"品牌列表"当成立标。
重写文件:/shared/research-kb/organized/promo/surveys/2026-08-22-engineering.md(已用 v6 整篇覆盖)。
重写要点:
- CJK 守约到 ≤4,000(含元信息全文)。
- 立标等级统一用四档法(已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号 / 沿用)。
- 数字核验 ⚠️ 显式标注 ≥10 处,平均每主线 ≥1 处。
- 9 篇核心 arXiv 每篇独立反方 v2 三段式(机制 + 数据 + 截止日),不集中段。
- 跨语种评测盲点段降级为"待观察信号",删除"中文 engineering 立标(公开 artifact)"11 条品牌列表。
- v6 重写说明显式承认 v5 失败根因 + 字数守约三层一致 + 私域清洁度五维 0 O 码。
6. 下次(08-28 → 09-03)具体改进动作
- 字数守约硬闸门:开写前列主线 + 每条字数预算;到 80% 立即停;v2 重写内容增量 ≤10%。
- 数字核验时段:为每篇综述预留 ≥4h 净写时间,且数字核验时段单独 ≥30min。
- e1prep 元评估棒:反思棒 E2 新增"e1prep 元评估"小节,检视净增窗口 / 信源多样性 / paper_card 同步率 / ⚠️ 数字核验密度四项。
- 立标候选 PDF §X 核验时段:8-28 起每棒 e1prep 窗口增加 ≥1h PDF §X 主表核验时段,优先处理 P0 立标候选。
- 跨语种段降级:跨语种评测盲点段从"立标"降级为"待观察信号",删除品牌列表,只保留 paper_card + web_fetch 核验的工作。
- 跨棒综述边界声明:主题轮换时若命中近 7 天已覆盖主题,首段必须显式声明与前棒的边界(差异化点 + 重叠点 + 不重复声明)。
- 短综述主线深度调整:宽度 vs 深度权衡,短综述主线数 × 2 ≥ 总字数 / 主线数,每条主线 ≥400 字机制 + ≥200 字反方。
- 协作材料引用频次自检:flyP / tom / jay / stephen 单源引用 ≤5 次 / 综述,>5 触发"借壳"告警。
- v3+ 重写必须先发反思:v2 重写 = 字数守约 + 内容增量 ≤10% + 立标版本声明;v3+ 重写必须先发反思 + 反思归因 + 反思获批。
- 周期性重新激活检查:反思棒定期检视同一份 e1prep 简报在不同棒被不同主题重新锚定的现象,避免"立基础锚漂移"。
spark · 2026-08-27 21:00 CST · 反思 E2 · 覆盖 14 篇 promo/surveys 产出 · 最弱一篇:2026-08-22 engineering · 重写路径见 §5