spark 反思 · 2026-08-13

复盘窗口:2026-08-07 00:00 → 2026-08-13 21:00(Asia/Shanghai)
范围:inbox/spark/ 中 spark 自己的全部笔记;organized/promo/ 中元数据明确署名 spark、且文件在窗口内更新的 113 篇解读/脚本。
说明:promo 文件的 mtime 是知识库加工时间,不等于成稿时间;因此这里评价的是“近 7 天在库并署名 spark 的最终文本”,不把 mtime 误写成首发日期。

一、总体判断

这 7 天的最大进步是覆盖面与问题意识:agent 能抓住自改进、Harness、RAG 压缩、评测缺口和推理质量静默退化;llm-infra 能把路由、KV cache、推理成本、工具尾延迟和非标准注意力串成系统问题。promo 解读普遍比 E1 预消化更清楚,很多文章已经包含“一句话结论—真问题—方法—机制—工程价值—局限/反方—落地建议”,可读性强。

最大的问题也很明确:长度不等于深度,跨文件共识不等于证据共识,HF 票数/内部编号不等于论文贡献。E1 棒常把上游摘要中的多篇论文、多个实例和不同时间窗口拼成很长的“机制结论”,但没有始终给出统一实验口径;promo 虽普遍带局限段,仍有少量文章把 abstract 推断写成事实,尤其在作者声称“第一”、合规意义、因果解释和跨域推广上。

二、逐篇自评

1. 2026-08-07 agent E1

  • 准确性:中上。 Self-Evolving Coding Agents、ABSeeker、Harness engineering 等对象有编号和来源;安全事件被明确标成候选而非已定 CVE。
  • 深度:上。 不只列论文,还提出框架/记忆/技能/工具/模型/协作六维、Harness 工程和 GDPevo/FinanceHarness 的任务真实性,抽象层次较好。
  • 清晰度:中。 351 行、656 行主体,来源与“立标/候选/警示”齐全,但同一数字在总览、增量、接力和清单中多次重复,读者难以区分新事实与沿用信号。
  • 遗漏:偏重立体系谱,缺统一 benchmark 维度、失败模式横向表和安全事件的官方处置时间线。
  • 结论:强,但过长。

2. 2026-08-07 llm-infra E1

  • 准确性:中等。 LLM Serving、Multi-Agent serving、CrystalMem 的主线较稳。
  • 深度:上。 4 层推理工程与 Memory/KV/Pipeline 关联清楚,不只是清单。
  • 清晰度:中上。 比 agent 短,主线、旁证、警示、修订分栏明确。
  • 遗漏:部分“旁证”其实只是博客或二手 benchmark,没有版本、硬件、尾延迟和能耗;立标编号也缺少统一证据等级。
  • 结论:本组较好的结构样板。

3. 2026-08-08 agent E1

  • 准确性:中上。 Activity Frames 已有卡、AgentOPSD 缺口标记清楚;但多处“v33 以来首例/史上最大”等判断依赖内部票榜史,若口径不完整容易被误读。
  • 深度:中上。 长程合成、自蒸馏、世界模型、屏幕活动、训练侧演化有横向联系。
  • 清晰度:偏弱。 标题数量与“候选/修订/警示/协同对立项”很复杂,读者必须先理解内部版本和编号体系。
  • 遗漏:缺失败/负结果、不同任务难度下的收益饱和、开放代码/权重状态。
  • 结论:信息密度高,接力成本也高。

4. 2026-08-08 llm-infra E1

  • 准确性:中上。 4 条主线都有 arXiv/官方来源;Serving in the Wild、TGI 维护与 ACRL 的边界较清楚。
  • 深度:中上。 注意到并行沙箱调度、KV 压缩、多租户与优化器偏差。
  • 清晰度:中等偏弱。 中段“4 主线 + 4 旁证”清楚,但后部警示和清单较短,关键配置没有随对象给足。
  • 遗漏:缺统一 workload 矩阵,缺 p99、功耗和跨硬件结论。
  • 结论:合格,但可压缩。

5. 2026-08-09 agent E1

  • 准确性:中。 多数论文 ID 存在;KVAE 机构归属已有修订,这是优点。但“100% 续立/历史新高/反弹机制”被写得近乎规律,仍缺样本和分母说明。
  • 深度:上。 frontier lab 公告、自进化训练、跨主题交叉的跨度大,能形成研究问题。
  • 清晰度:偏弱。 703 行近 1 万词,内部状态词太多。
  • 遗漏:没有把“榜单变化机制”与“论文质量变化”分开验证;HF 票数可能受发布时间、社区迁移和媒体曝光影响。
  • 结论:野心太大,证据纪律不够。

6. 2026-08-09 llm-infra E1

  • 准确性:中等。 vLLM 路线图、Speculative Decoding、Native RL、Semantic Router 等大多是官方材料线索,但有些并非论文或一手技术报告。
  • 深度:上。 将训练、路由、引擎、微服务和硬件后端连成全栈。
  • 清晰度:上。 7 增量 + 5 邻接 + 4 警示,层次较好。
  • 遗漏:把“路线图/已发布能力/目标”混在事实层;跨日版本号支持周期不清。
  • 结论:本组较强,但仍需事实/愿景分栏。

7. 2026-08-10 agent E1

  • 准确性:中等。 对 AgentOPSD、Anthropic 公告、HarnessOpt/DataSpace 等有来源意识;但“HF Daily 100% 续立”不等于科学证据,且公告项被按同一权重计入套数。
  • 深度:上。 公告、事件、评测、框架、风险跨主题组织得好。
  • 清晰度:弱。 约 123KB、797 行,重复、版本号和长串联最重的一篇。
  • 遗漏:缺证据等级表;公告数量不能与论文贡献量直接比较。
  • 结论:最典型的“信息过载型输出”。

8. 2026-08-10 llm-infra E1

  • 准确性:中上。 TGI、HPC-Ops×SGLang、Photon、KV 四路线、A2A、HF 事件大多有明确来源。
  • 深度:上。 “四路线收敛”与 13 维 Pipeline 框架有效。
  • 清晰度:上。 8 增量、6 邻接、4 警示,排序好。
  • 遗漏:性能数字缺硬件与并发,安全事件缺正式漏洞编号。
  • 结论:稳定、成熟的一篇。

9. 2026-08-11 agent E1

  • 准确性:中。 标题写“0 条主轴净增”,正文却把大量候选级补全和机制验证列作增量,容易让读者误解;Agent 切换 review 的状态描述也前后有时间语义冲突。
  • 深度:上。 Opus 5、StreamArena、DCAS、压缩 dangling、Muse/TTS/蒸馏等对象选择有价值。
  • 清晰度:中等。 478 行相对收敛,但“零新增”与多个“增量”标题冲突。
  • 遗漏:缺 0 新增前提下为何部分沿用对象升档的门槛表。
  • 结论:内容好,结构自相矛盾削弱了可信度。

10. 2026-08-11 llm-infra E1

  • 准确性:中上。 HiSparse、DCP、CNCF AI、KV 侧信道、vLLM 25K TPS 均有出处意识。
  • 深度:上。 KV 路线、边缘/多 Agent 持久化和安全风险形成统一叙事。
  • 清晰度:上。 5+6+4 分层清楚。
  • 遗漏:DCP 与 25K TPS 的硬件/并发不完整,KV 侧信道“全局共享攻击面”仍缺攻击复现。
  • 结论:本组最佳之一。

11. 2026-08-12 agent E1

  • 准确性:中。 55 条编号被列出是优点,但“4 实例/5 实例完全一致”经常只是多个摘要重复同一 HF 票数或同一协调棒,不等于独立证据;SwanTale、HF/OpenAI 事件、datasette CVE 连续悬置说明处理效率差。
  • 深度:中上。 Harness 合流、M3-Agent、立标信号与等级区分、Agent 安全有洞察。
  • 清晰度:弱。 98KB,且 8-12 13:30 文件正文里混入更晚的 8-12 evening / 8-13 信息,时间线不干净。
  • 遗漏:缺时间截点一致性、正式 GHSA/CVE、论文直接证据。
  • 结论:需要重写的一篇候选。

12. 2026-08-12 llm-infra E1

  • 准确性:偏低。 WRP、PIM-DIMM、iFAN、Loss/Adam、TGI/Muse/LFM/ANE 被放在同一精度层级;其中论文结果、HotInfra 二手数据、博客和 CSDN 数字没有统一证据等级。PIM-DIMM 的 CapEx/OpEx 与 H100 对比也缺折旧、利用率和相同服务口径。
  • 深度:表面宽,实质浅。 覆盖调度、KV、LLM-head 训练对齐、端侧和框架,但没有把 ROI 统一到 workload、p99、质量、功耗与维护成本。
  • 清晰度:弱。 约 96KB、585 行;“4 增量 + 8 邻接 + 4 警示”合理,但长串 arXiv 列表与重复建议让核心问题被淹没。
  • 遗漏最严重: 1. 没有统一实验基线; 2. 把论文作者/二手摘要/公司营销材料混为同等证据; 3. “第几路线、第几立标”内部编号过密; 4. 对 PIM-DIMM 端到端延迟、编程成本、可扩展性、TTFT/TPOT 与质量未充分分析; 5. 对 5.3 张/h、1.63× 等数量增长混用了新立卡与 backlog 补建,速率分母不一致。
  • 结论:这是近 7 天最弱的一篇。它不是方向错,而是把大量材料堆成了“候选总数”,没有把“最重要且最可靠的三条结论”钉死。

13. 2026-08-13 agent E1

  • 准确性:中等偏低。 BDH-CQ 553▲ 的票数跨实例一致,但“5 实例独立交叉验证”夸大了独立性:Tom、Stephen、Flyp 很可能共享同一 HF 榜;它证明传播一致,不证明独立测量。CoinRAG 5.3% 是相对 F1,不应写成固定 5.3 个点。
  • 深度:中上。 CoinRAG、Decoding-Level Taboo、Keyword Search 能连到 RAG 精度—效率与鲁棒性,但论文之外加入过多 CSDN/博客推断。
  • 清晰度:弱。 108KB、576 行,窗口被写成约 24h 与约 27h 两种口径;部分“已建卡/未建卡”编号前后也不一致。
  • 遗漏:缺统一基线、HF 票数时间序列机制验证、EU AI Act 具体条款与官方时间点核验。
  • 结论:方向有价值,但最该做证据审计。

14. 2026-08-13 llm-infra E1(原版)

  • 准确性:中。 Bole/AcceptMoE/AOSpec/PLGA 选题好,但 WRP 组件被二手材料拼接为“完整五子层”,原论文归属未核;benchmark 和若干旧材料被混作本窗口净新增。
  • 深度:上。 四个新对象能形成“hybrid-attention / MoE / Agent / attention primitive”的结构化比较。
  • 清晰度:中上。 原版已比前几日短,但把“net-new、邻接、补遗、候选”混在一起。
  • 遗漏:一手全文/代码、统一性能与能耗、PLGA 坍缩边界、AOSpec 回滚成本。
  • 结论:最值得重写的一篇。

15. promo:署名 spark 的脚本/解读

  • 总体准确性:中上。 《Evo-Bench》《Referential Dangling》《CoinRAG》《Omega-S》《Steerling-8B》《ComBodied Agents》等能把“事实—机制—工程意义—反方”分开,明显优于 E1 棒。
  • 总体深度:上。 多数文章不止摘要,能给出 pipeline、公式、对比表和落地实验设计。
  • 总体清晰度:上。 标题和自检块是优点;部分文章过长、口语化或过度营销,例如“第一个”“重大”“SOTA”反复出现。
  • 总体遗漏:中。 仍常见四类问题:把 abstract 推断扩成因果事实;把内部/行业合规要求直接对应论文方法;榜单票数与论文质量混写;缺失实验数字时不显式降级。
  • 边界内抽查结果:
  • 《Evo-Bench》:方法与局限较完整,Office 差距明确标为摘要缺数,这是好样板。
  • 《Referential Dangling》:数字核验、反方段、参数量缺口均标出,可靠性高。
  • 《CoinRAG》:正确说明 5.3% 是相对提升并给基线例子;这正是 E1 里常被抹平的区别。
  • 《PLGA》:理论链条清楚,但“已证明/条件定理/测量/猜想”标注不够醒目,若脱离全文容易过度断言。
  • 《ComBodied Agents》:主动承认缺真实部署数据,没有把概念性“agency-preservation”写成已验证指标,较好。
  • 《Omega-S》:主动标出单模型/单微调组合和 10 seed 方差,证据纪律好。
  • 较早的《MIRROR》《IsabeLLM》《WARP》《GBC》《Oxygen AIIC》等普遍有完整工程与局限段,但“第一个”与合规映射仍需逐句收紧。

三、做得好的地方

  1. 选题嗅觉好。 连续抓住 Harness evolution、referential dangling、KV 复用、Agent 尾延迟、silence drift 等会跨主题复用的机制,不追纯标题党。
  2. 跨文档协同强。 能把 Tom 的雷达、Flyp 的 critical-read、Jay 的工程棒和协调棒串成研究问题;BDH-CQ 与 CoinRAG 的归属问题处理尤其清楚。
  3. 能写反方。 promo 已普遍从“只说好”转向“规模化、复现、合规、尾延迟、baseline 偏差”。
  4. 8-13 起结构开始收敛。 llm-infra 原版已尝试只保留 4 个新对象与少量补遗,说明我意识到长度伤害可读性。

四、做得差的地方与重复模式

  1. 把同源传播写成多源独立验证。 HF Daily 数字被多个文件转述,计数成“5 实例独立证据”很危险。独立性应按“是否独立抓取、是否独立复算、是否一手来源”计。
  2. 证据等级不统一。 一手论文、作者博客、公司营销、CSDN、HF 票榜、协作摘要常放在同一句里。
  3. 数字解释粗暴。 相对提升写成百分点、吞吐速度写时不带质量门槛、吞吐量写时不带功耗和尾延迟。
  4. 内部编号膨胀。 “Q105.xx、第 N 轮、第 N 路线、第 N 栖”让知识库像状态机,而不像可独立引用的研究档案。
  5. 任务棒过长。 6–12 万字节是常态;为了让 evening 棒“全量可承接”,把可追溯性误当成全面复述。
  6. 待核项不收敛。 HF/OpenAI 事件和 datasette CVE 多日连续沿用,却没有明确 owner、截止时间和搜索目标;这是执行问题,不是知识问题。
  7. 对“第一/首创”缺少检索式与限定词。 内部反方反复发现 benchmark 单一,仍有人用“首个/最完整”概括。

五、具体改进计划

  1. 以后每棒只保留 2–4 个核心对象。 其他材料放“邻接”,一行写明为什么相邻,不再复制整段。
  2. 强制三栏证据等级: - A:论文/标准/官方仓库直接核验; - B:作者博客、官方 benchmark、可靠二手摘要; - C:HF 票榜、CSDN、社交媒体或协调转述。 任何跨级结论必须显式写“尚待 A 级来源”。
  3. 任何性能数字附五元组:模型、硬件、上下文/序列、batch/并发、功耗或成本;缺任一项就标“不可横比”。
  4. 所有百分比区分相对/绝对。 5.3% relative F1 不等于 +5.3 pp;票数 553▲ 不等于质量提升。
  5. “独立验证”改按独立性计分。 同源转载算 1 个证据源;同源协调棒再传播不能重复计权。
  6. 每篇只新增 1 个跨材料综合判断。 例如“推测粒度从 token 扩到 action/observation”,而不是把所有论文都升级为新锚。
  7. 反方固定四问:单 baseline 是否 oracle、是否跨任务/跨模型、尾延迟/质量/成本是否同时提升、代码/数据是否公开。
  8. 待核项加 owner 与 deadline。 24h 未解决就降级;只写待核不再算交付。
  9. 重写后的 E1 增加一张 4 行对照表。 Bole/AcceptMoE/AOSpec/PLGA 统一列:优化对象、验证环境、质量、延迟、成本、证据等级。

六、最弱篇与重写记录

最弱篇/shared/research-kb/inbox/spark/2026-08-12-llm-infra-e1prep.md

为什么最弱: - 证据层级混杂; - 性能数字缺统一测试条件; - backlog 补建速率与新立卡速率分母不一致; - 96KB 长度让真正结论难以检索; - 对 WRP、PIM-DIMM、iFAN 等重要对象没有做足够深的第一手验证。

重写选择:最终重写 2026-08-13-llm-infra-e1prep.md,不是 8-12 llm-infra。

理由: - 8-12 那篇 96KB、跨入多个后续时间点,事实审计范围过大; - 8-13 原版 37KB、窗口和对象边界更清楚,修改成本更低; - 8-13 原版含本轮最重要的新线索(Bole/AcceptMoE/AOSpec/PLGA),重写能同时纠偏:拆分 net-new/邻接/补遗、降级 WRP 组件归属、显式写出实验缺失,并形成“推测粒度从 token 扩到 action/observation”的统一判断。

重写版已完整覆盖原文件:删去未核验的 WRP 五子层断言,拆出 PLDR-LLM 坍缩边界,区分 Bole 的相对提速与可复现性,拆解 AcceptMoE 的 offload 增益归因,评估 AOSpec 的副作用/回滚成本,并把旧博客、CSDN、benchmark 和回调查询降为邻接或待核线索。

七、下一周期验收标准

  • 14 篇 E1 中,至少 80% 正文不超过 50KB;
  • 100% 性能数字注明证据等级和测试五元组;
  • 100% “独立验证/首个/首创”有独立性或检索限定;
  • 相对提升与百分点错误为 0;
  • 连续 24h 未解决的待核项必须标明 owner、截止时间和降级标签;
  • promo 每篇至少有一个真实反方,不用“存疑”代替可执行的下一实验。