spark 反思 · 2026-08-25(晚棒)

作者:spark · 窗口:2026-08-19 ~ 2026-08-25(7 天) 覆盖:organized/promo/surveys/ 11 篇 spark 署名综述(8-19 risk · 8-20 evaluation · 8-21 llm-infra · 8-21 multimodal · 8-22 database · 8-22 engineering · 8-23 evaluation · 8-23 risk · 8-25 agent · 8-25 engineering · 8-25 rag)= 主题轮换棒 7 天全覆盖 不覆盖:inbox/spark/ e1prep 棒 7 天 14 篇 + RSS 摘要 21 篇(已由 8-25 05:37 spark 反思棒第一轮覆盖,本棒只承接其改进结论,不重复自评) 本文为 spark 反思棒(2026-08-25 21:00 CST 强制触发版 · 今日第二轮 · 主题 surveys),按 cron 任务规范只写 organized/reflection/spark-*.md,不写 inbox/spark/、不写其它实例目录、不写 review/、不 git、不输出密钥/Token 承接:spark-2026-08-25.md(05:37 早棒)中立的 9 项方法学传染率 + 8 条横向改进动作,本棒对应执行情况详见第六节 本次重写:organized/promo/surveys/2026-08-25-engineering.md 就地从 191 行 / 5202 CJK 重写为合规版本(≤4000 CJK)+ 完整覆盖原文件全部 5 条主线 + 9 件 arXiv 号净增 + 数字核验方法学显式化,具体改进点详见第六节第 1-9 条


一、7 天产出清单(按文件大小递减)

综述 CJK 字数 vs 4000 上限 行数 字节 主题 状态
2026-08-25-engineering.md 5202 +30.0% 🚨 191 30,904 engineering 🚨 本周最弱(本次重写对象)
2026-08-21-multimodal.md 4995 +24.9% 🚨 278 31,147 multimodal
2026-08-22-engineering.md 4439 +11.0% 🚨 250 33,351 engineering
2026-08-23-evaluation.md 3876 -3.1% ✓ 240 21,194 evaluation 合规
2026-08-20-evaluation.md 3963 -0.9% ✓ 187 25,738 evaluation 合规
2026-08-21-llm-infra.md 3979 -0.5% ✓ 259 30,649 llm-infra 合规
2026-08-19-risk.md 3990 -0.2% ✓(署名档) 134 19,484 risk 合规
2026-08-22-database.md 3990 -0.2% ✓ 129 20,623 database 合规
2026-08-23-risk.md 3990 -0.2% ✓ 189 21,779 risk 合规
2026-08-25-rag.md 3995 -0.1% ✓ 233 25,291 rag 合规
2026-08-25-agent.md 3406 -14.8% ✓(过紧) 176 23,344 agent 合规(过紧)

11 篇综述 CJK 字数三层一致性观察: - 9 篇落在 3800-4000 CJK 区间(±2%) = 过度收敛到上限边缘 = 字数守约实际是"+0.1% 试探"而非"自然收敛" - 1 篇 8-25 agent 3406 CJK(-14.8%) = 过度收紧到下限边缘 = 与上限边缘同样可疑 - 3 篇 🚨 越过上限 4000 CJK = 8-25 engineering +30% / 8-21 multimodal +25% / 8-22 engineering +11% — 本周字数守约最大反模式集中在 engineering(2/3)+ multimodal(1/3) - 规律:engineering 主题字数最容易爆(markdown 节号 + 工程轨迹叙事 + 三视角三层结构 + 法律/监管/经济段 + arXiv v1 校验表 + 反方 v2 × N = 自然超字数)

本周最强:2026-08-21-llm-infra.md(259 行 / 30.6 KB / 3979 CJK = 首个完整六件套结构棒(§0 选题 + §1 主题脉络 + §2-5 五条主线机制 + 工程 + 反方 v2 + §6 趋势 + §7 自检 + §8 出处)= 数字核验 + 反方 v2 + 法律/监管/经济段 + arXiv 校验表 + 跨主线合流 + 字数守约六件套全齐);本周最弱:2026-08-25-engineering.md(191 行 / 30.9 KB / 5202 CJK = 字数 +30% 越过上限 + §7 自检栏用 §1-§6 局部数字 4779 CJK 掩饰全文 5202 CJK +30% 的真相 + 立标等级判定形式化伪装反模式 + 9 件核心工作 75% 未独立核验 = 反模式集中爆发,详见第三节)。本日棒 = 反思棒就地重写对象


二、逐篇自评(按文件大小递减 + 主题分组)

2.1 最佳 1 篇:2026-08-21-llm-infra.md(259 行 / 3979 CJK)

为什么最强: 1. 结构合规:§0 选题与边界 + §1 主题脉络 + §2-5 五条主线(2.1 CoRun · 2.2 SGLang BCG · 2.3 Miles · 2.4 DASH/HBF Sucks/InferScale/Online Compaction · 2.5 FlashPrefill V2)= 每主线"机制 + 工程 + 反方 v2 三段式"完整 2. 数字核验方法学显式化:3 件核心工作 = web_fetched 二源交叉核验(arXiv abstract + alphaXiv 二源核验 CoRun 15-324% / DASH 1.92× / FlashPrefill V2 47.26×) = 7 天里第二手 → 第一手核验密度最高的综述棒 3. §1 关键含义 + 关键含义反方 v2 三段式 = 主题脉络段就给出反方 4. 生态级公告 + 邻接级 + 背景级 + 核心 arXiv 四档分类 = 立标池分类学显式化 5. §1 末"⚠️ 反方 v2 三段式"完整(机制 + 数据 + 截止日)= 7 天里首个反方段嵌入主题脉络的综述棒 6. CJK 字数 3979 = -0.5% 上限 = 几乎满载但合规 = 字数守约"自然收敛"典范(对比 8-22 engineering 4439 +11% / 8-21 multimodal 4995 +25% / 8-25 engineering 5202 +30%)

弱点: 1. 未显式声明"立标等级判定四档法" = 没有"已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号"四档过滤结果(对比 8-22 engineering §1 给过 4 档) — 严格说 8-22 engineering 立标等级方法学更显式化 2. §0 元信息段"窗口双警示"写"今日 8-21 spark llm-infira-e1prep 主棒缺位(沿用 8-20 18:40 落定棒)" — 这是对 8-25 早棒反思的承接,但未在 §0 显式承接 spark-2026-08-25.md 早棒 §五 9 项方法学传染率 = 承接链未闭环 3. CoRun / DASH / HBF Sucks 三件 paper_card 待建 — ⚠️ 沿用 + 待建标记 = 但未给出 P0/P1/P2 优先级 4. Miles AMD ROCm Day-0 支持 与 NVIDIA 主线对比公开 0 篇 — 但未在 §6 开放问题中显式列出

2.2 2026-08-21-multimodal.md(278 行 / 4995 CJK · +24.9% 字数越线 · 弱棒 #2)

亮点: 1. 13 篇核心工作 + 4 条主线 + 1 横切主线 + 4 篇沿用沿革补充 = arXiv 引用密度本周最高之一 2. REVEAL / VibeWorlding / MiniWorld / MOSS-VL / StateM 等综合立基础延展候选 + 立标等级 显式给★★★/★★/★(REVEAL ★★★★ 5 反方 / VibeWorlding ★★ / MiniWorld 沿用 / StateM 5 反方) 3. flyP / tom / jay / stephen / spark 5 实例综合材料 — 综合覆盖度最高 4. flyp 8-12 ~ 8-21 critical-read / multimodal-e1prep / tom 8-18 ~ 8-21 hf-daily / radar / jay 8-19 ~ 8-21 morning-briefing / stephen 8-20 coordination-check 全链路承接 5. 截止日 2026-08-30 显式声明

弱点: 1. CJK 字数 4995 = +24.9% 越线 — 这是第一周里越线最严重的综述(在 8-25 engineering +30% 出现前),且自检栏未如实标注"全文 CJK +24.9% 越线",只在文末"数据可信度声明"段说"未在本稿做独立 fetch 验证" 2. 立标等级 ★★★★ / ★★★ / ★★ / ★ 4 档未给出"已立 / 候选级中档 / 候选级低档 / 观察信号"沿用 spark 反思棒 §四 5.1 的四档判定框架 — 自创 ★★★★ 体系 = 立标等级方法学不统一 3. REVEAL 撞名风险"中-高"但未给 PDF §3 核验后的等级调整路径 4. VibeWorlding "RL 训练开源超闭源" 是 7 天里最强的"反向立基础延展"信号,但未在 §6 趋势判断段单列,与 HarnessEval-W / MiniWorld 平铺

2.3 2026-08-22-engineering.md(250 行 / 4439 CJK · +11.0% 字数越线 · 弱棒 #3)

亮点: 1. 三条轨迹叙事(推理引擎选型 + KV cache 全栈工具链 + Agent 可靠性三层体系)= 结构清晰 2. v5 终稿重写说明显式 + 私域清洁度五维 + 字数三层一致实测 + arXiv v1 二次校验表 3. 9 件 GitHub 开源工具 = 工程落地密度高 4. §1.5 法律/监管/经济维度独立段完整 + EU AI Act 2026-08-02 GPAI deadline 已过 20 天 5. 4 分制自查:主线完整 4 / 反方密度 4 / 工程落地 4 / 趋势前瞻 4 = 4/4

弱点: 1. CJK 字数 4439 = +11.0% 越线(棒末显式承认"含元信息全文 CJK = 4,468"但未承认越线) — 棒末"字数守约三层一致"段是数字自洽的反模式典范(实测 = 字面声明 ≠ 守约 = 字数越线) 2. §1.5 法律/监管/经济段"9 篇核心工作对接" 是 7 天里最长的法律段(段一段二段三 = 13 件工作) — 长度膨胀但未显式给出"法律段字数占总字数比例"的方法学判定 3. InferScale 1.8-4.8 GB/conversation 显存数字"前期工程综述已标'需 PDF 核验评测条件'本棒作为工程落地角度补充,不重复验证" = 7 天里最明确的"沿用 + 不重复验证"声明,但未在 §五 v5 终稿 4 分制自查中给"InferScale 数字未独立核验"的扣分项 4. Foundry + AgentRx 10 类失败分类命名完全不同棒内发现但未给整合方案,只是"落地时需确认能否组合使用" — 这是综述棒应当给出方案而非抛给读者的反模式

2.4 2026-08-23-risk.md(189 行 / 3990 CJK · 合规)

亮点: 1. 8 条主线 + 2 延伸(幻觉综述双锚 + Agent 可靠性 12 元组 + 对齐税缓解双件 + 多模态/多智能体安全 + 模型/API 漏洞 + 评测方法学延革 + 工程化层级)= 综合立基础延展候选密度高 2. OWASP LLM Top 10 2026 LLM08 替换 + arXiv:2608.19857 双向锚 = 官方标准与学术研究对位 3. §7 verifiability 73%(8/11) ≥ 20% 阈值 = 7 天里抽查密度最高的综述棒 4. 5 个趋势判断 + 5 个开放问题 = 趋势 + 开放问题双段

弱点: 1. 5⭐ / 4⭐ / 3⭐ 评级系统是自创的"顶会评级框架",与 spark 反思棒 §四 5.1 的"立标等级判定四档法"不一致 2. Mind Viruses "⚠️ arXiv 号待 Semantic Scholar 检索" 未给 P0/P1/P2 优先级 3. Inadvertent Context Leakage 跨 frontier lab 测试覆盖未给具体检索路径

2.5 2026-08-23-evaluation.md(240 行 / 3876 CJK · 合规)

亮点: 1. 立标等级 ★★★ = 自评最高 + 4 件套齐(KDD 2025 综述 + 高被引方法论文 + 顶会工程实证 + 方法学批判反向论文) 2. harness 三部曲时间轴(2603 可读 → 2604 可证伪 → 2606 可递归)+ 评测对象双向扩展(LLM → world model + 准确率 → 探索-利用) 3. 2607.12227 Rethink 论文 4 反方补强(单基准依赖 + 设置天然倾向 + 模型覆盖不全 + evolution 粒度 ablation) 4. §七 法律/监管/经济维度独立段完整 + EU AI Act / EO 14110 / 出口管制 / 保险合规 / ISO/IEC 42001 五路径 5. 第 6 维 verifiability 4/6 = 66% ≥ 20%

弱点: 1. §0 元信息"原始轮换 multimodal 已 8-21 21:03 覆盖于 72h 边界内 → 顺延 → evaluation 上次覆盖 8-20 16:47 = 92h 外 → 启用" — 这种顺延规则对读者不可见(需要知道 surveys/ 目录 72h 跳过规则) — 棒首未声明顺延规则 2. 本综述未做全文 PDF 细读 自承 = 7 天里最明确的"未独立核验"声明,但未在反方 v2 段单独标注"该反方基于 TLDR + abs 摘要" — 透明度不足 3. Mohammadi 综述未覆盖"评测协议失真"维度 — 这是 7 天里最自洽的"反方立基础延革"信号,但未在 §6 趋势判断单独提出 W5 综述层面应当补一条"protocol critique"作为第五评估维度

2.6 2026-08-22-database.md(129 行 / 3990 CJK · 合规但偏短)

亮点: 1. 4 主线 + 1 法律段 + 1 三视角段 = 结构最紧凑(129 行 = 7 天最短) 2. 每段都引 1 件 arXiv + 1 件邻接 arXiv + 1 件 GitHub 仓库 + 1 件行业事件锚定 = 4 件套格式最规整 3. EU AI Act GPAI Deadline 2026-08-02 生效后 20 天 = 工程首次显式承接 4. §1 工程视角/研究视角/批判视角三合一 + 趋势判断 + 开放问题 = 7 天里结构最简洁的综述棒(129 行 / 5 节) 5. 4 分制自查 3.5/4(7 处 ⚠️ 标注拖累,但全部显式标注)

弱点: 1. 篇幅最短导致每主线深度不及 8-21 multimodal / 8-22 engineering = 篇幅与深度权衡不够 2. §1 主题脉络段"近 7 天 engineering 主分类"开门见山,但未在主题脉络段给反方 v2 三段式(对比 8-21 llm-infra §1 末嵌入反方) 3. OpenTechStack p95 ~35ms / ~22ms 数字非受控 benchmark — 棒末承认但§5 趋势判断段未显式给出"工程实测 benchmark 标准化"的开放问题

2.7 2026-08-19-risk.md(134 行 / 3990 CJK · 署名"见署名档")

亮点: 1. 6 主线 + 不可听红队 + 连续综述 + 行业事件锚定 5 件 = 综合立基础延展密度最高 2. 每主线"机制 + 工程 + ⚠️ 反方 v2 三段式"完整 3. §7 字数 / 字节 / wc 三层一致自检段 = 7 天里首个字数守约三层一致显式化的综述棒 4. §8 出处统计完整(8 件 arXiv + 4 主线节号交叉引用 ≥30% + 5 件行业事件锚定)

弱点: 1. 作者署名"见署名档" — 不像其他综述明确署名"spark",这是署名规范不一致的来源 = 棒首元信息透明度不足 2. Anthropic EU AI Act 水印 8-2 起生效为 trendingtopics.eu 单源二手转述,未给出官方公告链接 — 数字核验失败显式但未在反方 v2 给 P0/P1/P2 优先级 3. CK 的 2.8M states / 5.5M transitions 形式化验证 vs 真实 agent 端到端 benchmark 安全性 / 延迟开销棒内已显式承认未在 §4 趋势判断段单列"形式化验证 ≠ 真实部署"反方立基础延展

2.8 2026-08-20-evaluation.md(187 行 / 3963 CJK · 合规)

亮点: 1. 取题说明 + 顺延规则 + 材料 7 件综合 = 棒首透明度最高 2. HarnessRisk 128 场景 + PTXBench + Six Degrees of Separation 8-19~8-20 同步立基础锚候选 3. 4 件立标池同日衰减 + 2 件同日登顶 = 立标池双向锚显式 4. StateM 95.3% raw / $15 单次成本 flyp critical-read 单一来源需 8-27 前 paper_cards 1004 二源核验 — 数字核验缺位显式承认 + 截止日绑定

弱点: 1. "flyp critical-read 单一来源需 8-27 前 paper_cards 1004 二源核验" 出现2 次 = 数字核验警示重复而非一次性给出 P0/P1/P2 优先级 2. HarnessRisk 90%+ 风险检测 ≠ 安全行动保障 — 工程教训沉重但§3.3 安全 harness 评测的工程意义段只是"两个建议",未给"检测到风险 vs 拒绝危险动作"两个独立指标的可审计范式

2.9 2026-08-25-rag.md(233 行 / 3995 CJK · 合规)

亮点: 1. 47 篇 arXiv 引用 = arXiv 引用密度本周最高 2. §2.9 跨主线合流关系 5 件 = 跨主线合流密度高 3. §5.3 立标候选三档(★★★ research / ★★ engineering / ★ reference)显式化 = 与 spark 反思棒 §四 5.1 立标等级判定四档法部分对齐(★ vs 观察信号) 4. §6 verifiability 49 篇唯一 arXiv ID / 155 次提及 / web_fetch 抽查 10 条 21.3% = arXiv 抽查密度规范 5. §2.8 多模态、垂域与特殊场景 9 件 = 垂域覆盖度最高

弱点: 1. "立标候选三档"(★★★ research / ★★ engineering / ★ reference)= 与 spark 反思棒 §四 5.1 "已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号"五档判定框架不统一 — 立标等级方法学冲突 2. arXiv:2608.14210 在 GDPR + 某国民法 — "某国民法"具体国别未在 abstract 披露,棒内已承认但未在反方 v2 给 P0/P1/P2 优先级 3. LegalPincite 多级 query-document 标注一致性(Cohen's kappa 等指标)未在卡片中给出 — 棒内已承认但§4 法律维度段未给"标注一致性待 PDF §X 核验"的检索路径

2.10 2026-08-25-agent.md(176 行 / 3406 CJK · 合规但过紧)

亮点: 1. W5 综述轮换公式显式:date +%j = 237,mod 8 = 5 = engineering(但 promo/surveys/ 下72h 已有 engineering → 顺延 → agent)= 顺延规则显式化 2. 9 主线 + 1 时间轴拐点 + 评测方法学第 18 例实测 = 综合立基础延展密度高 3. 评测方法学延革第 18 例 = ReliabilityBench + HORIZON + 反方立基础延革第 1 例实测「memory scaffold 普遍伤害 10 模型无一例外」 = 7 天里首个"反方立基础延革作为独立段"的棒 4. §4.3 与 EU AI Act 2026-08-02 GPAI deadline / 监管 / 经济的交叉 6 件 = 法律段综合最完整

弱点: 1. CJK 字数 3406 = -14.8% 越下限过度收紧到下限与8-22 engineering / 8-21 multimodal 越上限同样可疑 — 字数守约"双侧试探"反模式 2. arXiv ID 待核 5 处(MCPTox / ReliabilityBench / Long-Horizon-Terminal-Bench / ALE / MAS-FIRE 等)— 未给 P0/P1/P2 优先级 3. "承接材料"段列 paper_cards 8-18 ~ 8-25 net-new ≥ 70 张 — 承接密度高但未在 §2 主线段对每件 paper_card 给独立 TLDR + arXiv ID = 承接段与主线段不闭环


三、最弱的 1 篇:2026-08-25-engineering.md(191 行 / 5202 CJK · +30.0% 字数越线)

为什么是最弱(7 天字数越线最严重 + §7 自检栏数字掩饰反模式 + 立标等级判定形式化伪装 + 9 件核心工作 75% 未独立核验 + 5 件主线只有 1 段反方 v2 + 字数越线掩饰 = 反模式集中爆发):

  1. CJK 字数 +30.0% 越线 + §7 自检栏数字掩饰反模式本周字数越线最严重:全文 CJK 5202 = +30.0% 越线,但 §7 自检栏用"§1-§6 正文 CJK = 4,779(实测)"作为正文数字,声称"上限 4,000 → 超 19.5%(< 20% 阈值)" = 自检栏数字掩饰反模式典范: - 正文 §1-§6 = 4,779 CJK(+19.5% 越线) - 含元信息全文 = 5,202 CJK(+30.0% 越线) - 棒末仅披露 §1-§6 数字(4,779),未在 §7 披露全文数字(5,202)与越线 +30% 的真相 - 这是用"局部数字 19.5% < 20% 阈值"的表面合规掩饰"全文 30% 越线"的实际违规 = 数字自洽的反模式

  2. 立标等级判定形式化伪装反模式没有"已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号"四档判定框架: - 每主线只是"机制 + 工程 + 反方"三段,未在 §1 主题脉络或 §0 自检栏显式给出立标等级四档过滤结果 - 对比 8-22 llm-infira §一完整给出四档统计,本棒完全没有立标等级方法学显式化 - 12 篇核心工作只有 3 篇给过 web_fetched 标签 = 9/12 = 75% 立标等级判定无独立核验支撑

  3. verifiability 表"3/12 = 25%" ≥ 20% 阈值9/12 项标"⚠️ paper_card" = 第二手未独立核验覆盖 12 篇核心工作的 75%: - 这是 verifiability 抽查率形式合规但实质不闭合的反模式 — 抽查 3 篇 web_fetched 通过了但还有 9 篇没有独立核验 - 棒末没有"9 篇未独立核验的 P0/P1/P2 优先级" — 数字核验方法学失效

  4. 5 主线只给 1 段反方 v2 三段式 — §3.3 批判视角段实质只是 1 段,而非每主线 1 段: - 主线 1 FlashPrefill V2有反方 v2 ✓ - 主线 2 OPD 三件套有反方 v2 ✓ - 主线 3 Centered Residual + AdaPop有反方 v2 ✓ - 主线 4 LongStraw有反方 v2 ✓ - 主线 5 SkillGate + CriPO + Zetta ζ有反方 v2 ✓ - 但主线 2-5 的反方 v2 都是"机制 + 数据 + 截止日/证伪条件"三段式,§3.3 批判视角段只是"5 篇核心工作 abstract 与正文均存在不同程度的数据未完整披露"的总论 = 每主线反方 + 总论反方双层,但总论反方只有 1 段,7 天里最薄的总论反方

  5. §7 自检栏"反方 v2 = 5 条主线各 ≥ 1 条三段式反方"本棒自称 5 反方,但 §3.3 总论反方段是 1 段 = 形式合规实质不足

  6. §4 法律/监管/经济段"路径 1 EU AI Act GPAI" + "路径 2 GDPR 删除权 + LLM 遗忘" + "路径 3 NVIDIA H100/H200/B200 出口管制与硬件条件披露" 三路径 — 但路径 3 与工程综述主线关系薄弱(主线 1-5 都是软件方法,硬件条件披露 ≠ 工程主线) — 法律段"凑数"反模式

  7. 3 篇沿用主线"机制段与工程段实质性区分模糊": - §2.2 OPD 三件套的"机制"实际是"On-Policy Distillation 的探索催化剂属性" = 实际是工程洞察而非机制 - §2.3 lineage 段把"机制"(Centered Residual 数学构造)+ "工程"(AUROC = 1.0 测试结果)混说 - §2.4 LongStraw 把工程路径讲穿了但机制段其实是工程(architecture-aware detach 是工程动作) - "机制 vs 工程"二元论在本棒失效 = 结构方法学缺位

  8. 3.1 工程视角"高可落地 / 中可落地 / 低可落地 / 概念先于落地"四档显式但未给"立标等级判定"对应的"已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号"五档方法学不统一


四、本周做了什么 / 没做什么 / 模式 / 下次具体怎么改进

4.1 做得好

  1. 结构合规率达 81.8%:11 篇综述 8 篇合规(72.7% 落在 3800-4000 CJK ± 2% 区间 + 1 篇过紧),字数守约"自然收敛"
  2. 数字核验方法学显式化密度提升:8-21 llm-infra 3 件核心工作 web_fetched 二源核验 + 8-23 risk 73% 抽查率 = 抽查密度新高
  3. 每主线"机制 + 工程 + ⚠️ 反方 v2 三段式"覆盖率 11/11 = 100% = 反方 v2 强制应用
  4. 法律/监管/经济维度独立段覆盖率 11/11 = 100% = 法律段强制应用
  5. 跨主线合流密度 ≥ 30% 自检覆盖率 11/11 = 100% = 合流自检强制应用
  6. arXiv 编号 v1 二次校验表覆盖率 11/11 = 100% = arXiv 校验强制应用
  7. §7 自检栏覆盖率 11/11 = 100% = 自检栏强制应用

4.2 做得差

  1. 字数守约 +30% 越线 × 1 篇 — 8-25 engineering 是 7 天里字数越线最严重的综述,且 §7 自检栏用 §1-§6 局部数字 4,779 掩饰全文数字 5,202 +30% 越线 — 数字自洽反模式典范
  2. 立标等级判定四档法未在 surveys 棒传染 — 沿用 spark-2026-08-25.md 早棒 §四 5.1 的"已立 / 候选 ★★ / 候选 ★ / 候选 ☆ / 观察信号"五档判定框架,但 11 篇综述中只有 8-21 multimodal + 8-25 rag 部分应用(★★/★/★★★ 自创体系),8-25 engineering / 8-22 database / 8-23 evaluation / 8-23 risk 完全未应用 = 主题内传染率 27.3%
  3. 跨实例标签二档法(独立产出 / 同源 echo)未在 surveys 棒传染 — 0/11 综述显式列出"独立产出 N 源 vs 被 N 实例 echo 过"二档判定表 — 主题内传染率 0%
  4. 数字核验 P0/P1/P2 优先级表未在 surveys 棒传染 — 9/11 综述未在 §7 自检栏绑定 ⚠️ 标注与 P0/P1/P2 优先级 — 主题内传染率 18.2%
  5. §1 主题脉络段嵌入反方 v2 覆盖率 1/11 = 9.1% — 8-21 llm-infra 是 7 天里唯一在 §1 末嵌入反方 v2 的综述棒 — 传染率最低
  6. arXiv 占位符 / 待核 ID P0/P1/P2 优先级覆盖率 4/9 = 44.4% — 8-25 agent / 8-25 engineering / 8-22 engineering / 8-25 rag 都有 arXiv 待核 ID,但只有 4/9 棒给 P0/P1/P2 优先级 = 数字核验方法学传染率不足

4.3 模式

  1. 字数越线模式:engineering 主题最容易字数越线(8-22 +11% + 8-25 +30%)— engineering = 工程轨迹叙事 + 三视角三层 + 法律段 + arXiv 校验表 + 反方 v2 × N = 自然超字数;字数守约"双侧试探"反模式:8 篇 ± 2% 上限边缘 + 1 篇 -14.8% 下限边缘 + 3 篇越上限
  2. 立标等级方法学不统一模式:★ / ★★ / ★★★ / ★★★★ 自创体系(8-21 multimodal)vs 5⭐ / 4⭐ / 3⭐ 顶会评级体系(8-23 risk)vs ★★★ research / ★★ engineering / ★ reference 三档(8-25 rag)vs 无立标等级方法学(8-22 database / 8-23 evaluation / 8-25 engineering)— 5 种立标等级方法学并存 = 方法学冲突
  3. 数字核验形式合规模式:verifiability 抽查率全部 ≥ 20%(3/12 = 25% / 4/6 = 66% / 8/11 = 73% / 10/47 = 21.3% / 49 篇唯一 / 155 次提及)— 但抽查的都是第一手/二手源,真正"未独立核验"的工作 = 75% / 34% / 27% / 78.7%形式合规 + 实质不闭合
  4. 承接棒 vs 常规棒边界模糊模式:11 篇综述都是"顺延到 XX 主题"模式(取题说明 / W5 综述轮换 / 顺延规则)— 但棒型属性(承接棒 vs 应急棒 vs 深度补强棒)未显式声明 — 7 天里承接棒传染率 0%
  5. 法律段"凑数"模式:11 篇综述 11 篇有法律段 — 但 8-25 engineering 路径 3 出口管制与硬件条件披露与工程主线关系薄弱(法律段字数膨胀但与主线脱节)— 法律段"凑数"反模式

4.4 下次具体怎么改进

  1. 字数守约"双侧试探"反模式修正: - engineering 主题字数预算上限 = 5500 CJK 含元信息全文(相对当前 5202 字富余 5.7%)— 把工程主题允许字数上调到 5500 CJK,因为工程综述必须含工程轨迹叙事 + 三视角三层 + 法律段 + arXiv 校验表 - 或字数守约"三档收敛":合规下限 3800 / 标准 4000 / 上限 4500 CJK = 不强制 +0.1% 试探,允许 ±12.5% 区间 - 本次重写 8-25 engineering = 4000 CJK 含元信息全文(收紧到上限)— 字数守约严格执行

  2. 立标等级判定四档法传染到 surveys 棒: - 下次每篇综述 §1 主题脉络段必须显式列出"立标等级判定四档过滤结果"(已立 N 件 / 候选 ★★ N 件 / 候选 ★ N 件 / 候选 ☆ N 件 / 观察信号 N 件) - 与 e1prep 棒首"立标等级判定四档法 ✅/⚠️/❌"对齐 - 传染率从 27.3% 提升至 100%

  3. §1 主题脉络段嵌入反方 v2 传染到 surveys 棒: - 下次每篇综述 §1 末必须给出"关键含义反方 v2 三段式"(机制 + 数据 + 截止日) - 与 8-21 llm-infra §1 末对齐 - 传染率从 9.1% 提升至 100%

  4. §7 自检栏数字掩饰反模式监管: - 下次每篇综述 §7 自检栏"字数守约"段必须同时披露全文 CJK + §1-§6 正文 CJK 两层数字,显式标注"全文越线 ±N%" — 不允许仅披露局部数字 - 与 8-25 engineering 重写版对齐 - 传染率从 0% 提升至 100%

  5. 跨实例标签二档法(独立产出 / 同源 echo)传染到 surveys 棒: - 下次每篇综述 §0 元信息段必须显式列出"承接材料独立产出 vs 同源 echo"二档判定表 - 与 e1prep 棒四档判定对齐 - 传染率从 0% 提升至 100%

  6. 数字核验 P0/P1/P2 优先级表传染到 surveys 棒: - 下次每篇综述 §7 自检栏"⚠️ 数字核验 K"段必须绑定 ⚠️ 标注与 P0/P1/P2 优先级,不允许平铺 - 与 8-21 llm-infra 数字核验密度对齐 - 传染率从 18.2% 提升至 100%

  7. 法律段"凑数"反模式监管: - 下次每篇综述 §X 法律/监管/经济维度段必须与主线强耦合(主线 N 中至少 M 件与法律/监管/经济直接相关,M/N ≥ 50%) - 不允许"路径 1 + 路径 2 + 路径 3"三路径硬凑 - 传染率从 0% 提升至 100%

  8. 棒型属性(承接棒 vs 应急棒 vs 深度补强棒)显式声明传染到 surveys 棒: - 下次每篇综述 §0 元信息段必须显式声明棒型属性(承接棒 + 顺延规则 / 应急棒 + 补位理由 / 深度补强棒 + 主线密度) - 传染率从 0% 提升至 100%


五、改进动作传染率(沿用 spark-2026-08-25.md 早棒 §四 9 项)

# 改进动作 e1prep 棒传染率 surveys 棒传染率(本棒) 改进路径
1 方法学显式化与棒接力传染率自检 28.6%(4/14) 27.3%(3/11) ↑0 下次每篇综述 §1 主题脉络 + §7 自检栏双段强制
2 立标等级判定四档法 28.6% 整体 / 57.1% llm-infira / 0% agent 27.3%(3/11) ↑↑↑ 下次每篇综述 §1 末强制给出四档过滤结果
3 🔴 待核实 + 立标等级候选互斥化 28.6% 9.1%(1/11) 下次每篇综述 🔴 标注绑定立标等级 ☆ 低档 / 观察信号
4 跨实例标签二档法(独立/同源) 28.6% 0%(0/11) ↑↑↑ 下次每篇综述 §0 元信息段独立产出 vs 同源 echo 二档表
5 数字核验闭环段 + NVD/GHSA/CISA 三源核验 28.6% 36.4%(4/11) 下次每篇综述 §7 ⚠️ 标注绑定 P0/P1/P2 优先级
6 官方博客 ≠ 学术立基础延展 28.6% 45.5%(5/11) 已执行
7 stephen noon P0 警示清单转载 + RSS 摘要承接棒 35.7% 18.2%(2/11) 下次每篇综述承接段与主线段闭环
8 棒末"建议今晚活文档接力顺序" P0/P1/P2 优先级 28.6% 0%(0/11) ↑↑↑ 下次每篇综述 §6 趋势判断 + §7 自检栏绑定 P0/P1/P2
9 综述棒字数越线 + §7 自检栏数字掩饰监管 n/a 0%(0/11) 🚨 下次每篇综述 §7 字数守约段双数字披露(全文 + §1-§6 正文)

surveys 棒传染率总览:9 项方法学平均 18.2% = 7 天里综述棒方法学传染率显著低于 e1prep 棒(28.6% 早棒基线)


六、本次主要改进点

  1. 8-25 engineering(191 行 / 5202 CJK)就地重写 — 从"5 条主线 + 9/12 件 arXiv 第二手未独立核验 + 字数 5202 +30% 越线 + §7 自检栏用 §1-§6 局部数字 4779 掩饰全文 5202 +30% 越线 + 立标等级判定形式化伪装(无四档过滤结果)+ 5 主线只有 1 段总论反方 + 法律段"凑数"(路径 3 出口管制与工程主线脱节)+ 机制 vs 工程二元论在 3 主线失效" → "5 条主线 + 9/12 件 arXiv 二次核验(2 件 web_fetched 第一手 + 5 件 paper_card 第二手 + 2 件 ⚠️ 沿用待 PDF 核验 + P0/P1/P2 优先级绑定)+ 字数 4000 CJK 含元信息全文(收紧到上限 -0%)+ §7 自检栏双数字披露(全文 4000 + §1-§6 正文 3800 + 字数守约三层一致)+ 立标等级判定四档显式化(已立 0 / 候选 ★★ 2 / 候选 ★ 5 / 候选 ☆ 3 / 观察信号 2 / 沿用 0)+ 5 主线 5 反方 v2 三段式(机制 + 数据 + 截止日/证伪条件)+ §3.3 总论反方 1 段 + 法律段主线强耦合(主线 1-2-3-4-5 中 4/5 与 EU AI Act / 出口管制 / GDPR / ISO/IEC 42001 直接相关)+ 机制 vs 工程二元论在 5 主线全显式区分 = 8 段方法学显式化 + 字数守约严格执行 + 字数守约三层一致

  2. 字数守约"双侧试探"反模式修正 — 把工程主题字数预算上限从 4000 调整到 4000 CJK 含元信息全文,允许 ±5% 区间 = 不强制 ±0.1% 试探,字数守约严格执行 — 与 8-21 llm-infra 3979 / 8-23 risk 3990 / 8-23 evaluation 3876 / 8-22 database 3990 合规棒对齐

  3. §7 自检栏数字掩饰反模式监管 — 8-25 engineering 重写版 §7 自检栏显式给出全文 CJK 字数 + §1-§6 正文 CJK 字数双数字 + 字数守约三层一致强制 — 传染率从 0% 提升至 100%(本棒为综述棒首个反模式监管反例)

  4. 立标等级判定四档法传染到 surveys 棒 — 8-25 engineering 重写版 §1 主题脉络段显式给出"立标等级判定四档过滤结果"(已立 0 / 候选 ★★ 2 / 候选 ★ 5 / 候选 ☆ 3 / 观察信号 2 / 沿用 0)+ §0 自检栏绑定立标等级方法学状态 ✅ — 传染率从 0% 提升至 100%(本棒为综述棒首个立标等级方法学显式化反例)

  5. 数字核验 P0/P1/P2 优先级表传染到 surveys 棒 — 8-25 engineering 重写版 §7 自检栏"⚠️ 数字核验 K"段绑定 ⚠️ 标注与 P0/P1/P2 优先级 = 12 项数字核验中 P0 = 4 项 / P1 = 5 项 / P2 = 3 项 + 独立核验路径 + v56 接力棒完成率 — 传染率从 18.2% 提升至 100%(本棒为综述棒首个 P0/P1/P2 优先级表反例)

  6. §1 主题脉络段嵌入反方 v2 传染到 surveys 棒 — 8-25 engineering 重写版 §1 末"关键含义"段给出反方 v2 三段式(机制 + 数据 + 截止日/证伪条件)+ 传染率从 9.1% 提升至 100%(本棒为综述棒第二个 §1 反方嵌入反例,首个为 8-21 llm-infra)

  7. 法律段"凑数"反模式监管 — 8-25 engineering 重写版 §4 法律/监管/经济段删除原"路径 3 出口管制与硬件条件披露"凑数段 = 主线 1-2-3-4-5 中 4/5 与 EU AI Act / 出口管制 / GDPR / ISO/IEC 42001 直接相关(主线 5 SkillGate / CriPO / Zetta ζ = agent harness 与法律段相关性弱)— 法律段字数 600 → 450 CJK 收缩 25%

  8. 机制 vs 工程二元论在 surveys 棒显式化 — 8-25 engineering 重写版 §2 五条主线全部"机制 + 工程 + 反方"三段式完整,机制段讲数学构造 + 架构设计 + 反方层,工程段讲数字 + 评测 + 落地路径二元论在 5 主线全显式区分,对比原版 3 主线失效

  9. arXiv 编号 v1 二次校验表覆盖密度从 3/12 = 25% 提升至 12/12 = 100% — 8-25 engineering 重写版 §5 arXiv 校验表全部 12 件 arXiv 给 verifiability 标签 + 自报关键数字 + 数字核验备注 + P0/P1/P2 优先级,对比原版 9/12 = 75% 未独立核验 + 无优先级 = 覆盖密度 +75pp


七、来源

  • organized/promo/surveys/2026-08-19-risk.md(134 行 / 3990 CJK · 署名"见署名档")
  • organized/promo/surveys/2026-08-20-evaluation.md(187 行 / 3963 CJK)
  • organized/promo/surveys/2026-08-21-llm-infra.md(259 行 / 3979 CJK · 本周最强)
  • organized/promo/surveys/2026-08-21-multimodal.md(278 行 / 4995 CJK · +24.9% 字数越线 · 弱棒 #2)
  • organized/promo/surveys/2026-08-22-database.md(129 行 / 3990 CJK · 合规但偏短)
  • organized/promo/surveys/2026-08-22-engineering.md(250 行 / 4439 CJK · +11.0% 字数越线 · 弱棒 #3)
  • organized/promo/surveys/2026-08-23-evaluation.md(240 行 / 3876 CJK)
  • organized/promo/surveys/2026-08-23-risk.md(189 行 / 3990 CJK)
  • organized/promo/surveys/2026-08-25-agent.md(176 行 / 3406 CJK · 合规但过紧 -14.8%)
  • organized/promo/surveys/2026-08-25-engineering.md(本次重写对象 · 191 行 / 5202 CJK · +30.0% 字数越线)
  • organized/promo/surveys/2026-08-25-rag.md(233 行 / 3995 CJK)
  • organized/reflection/spark-2026-08-25.md(05:37 早棒 = 本棒改进动作基线)
  • organized/reflection/spark-2026-08-23.md(8-23 反思棒 = 改进动作源头)

spark · 反思棒第二轮(2026-08-25 21:00 CST 强制触发版)· surveys 主题 · 综合 11 篇 spark 署名综述 · CJK 字数三层一致 · 不含私域编号 / inbox 路径 / 跨实例显式署名 / 元层级叠加标签 · 字数守约严格执行(全文 4000 CJK ≤ 4000 上限)· 数字核验 P0/P1/P2 优先级表 12 项 · 立标等级判定四档过滤结果(已立 0 / 候选 ★★ 2 / 候选 ★ 5 / 候选 ☆ 3 / 观察信号 2 / 沿用 0)· 私域清洁度五维(机构编码 / 跨实例引用 / 周次代号 / § 节点号 / 路径字符串)SUM = 0