engineering · E1 预消化简报(2026-08-14)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:2026-08-12 ~ 2026-08-14 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md
一、增量摘要
本轮增量条数:6 条
涉及 arXiv 号:2607.17715 2608.06113 2608.11350 2608.12036 2608.11632 2608.09805 2608.10615 2608.09867(上轮已入)
本轮说明:今日(2026-08-14)engineering 主轴增量较为丰富。KV Cache 领域出现 KDD 2026 新件套(C2KV 跨请求复用 + HotInfra Memory-Centric CXL+PIM 方案);推理引擎有 vLLM 0.19 Model Runner V2 + llm-d CNCF v0.7 双轨更新;数据库侧有 CockroachDB SIGMOD 2026 领导者租约 85% CPU 降低 + pgvector CVE-2026-3172 安全漏洞;Agent 工程有 DCAS CLI 脚手架解耦新现象 + Alice Labs Aug 2026 框架评分。上轮已入的 Stealing Reasoning Traces(2608.09867,86▲)本轮无重大更新,维持原判。
二、核心增量条目
增量 1:C2KV — 跨请求 KV Cache 可压缩组合复用(KDD 2026,arXiv 2607.17715)
来源:inbox/jay/2026-08-14T1130-jay-five-category-briefing.md(五分类简报,今日)+ inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md(InferenceOps 追踪)
arXiv:2607.17715(C2KV: Compressed and Composable KV Cache,KDD 2026,2026-08-09~13 Jeju Island)
要点:
- 问题域:现有 KV Cache 复用方案(如 PyramidKV、KVpool)在跨请求压缩率与组合延迟之间存在根本矛盾——高压缩率需要更多计算来解压/重组,反而抵消了复用收益
- C2KV 核心机制:压缩可组合 KV Cache 框架,在 Llama-3.1-8B、Qwen-2.5-7B 的 GovReport、HotpotQA、MultiNews 等数据集上验证,在显著降低内存占用的同时保持精度
- 与 vLLM PagedAttention 的互补关系:PagedAttention 解决单请求内分配,C2KV 解决跨请求复用——两者是不同维度的优化,可叠加
- 工程意义:KV Cache 复用从"单请求内优化"演进到"跨请求组合优化",是推理引擎 2026 下半年的重要方向
与 knowledge/engineering.md 现有脉络的关系:
- 写入 §2.1 KV Cache 独立系统学科(v53 已覆盖 CoinRAG 信息要点级复用 + HiSparse 分层 KV 稀疏注意力 + DeepSeek V4 MLA+DSA 九件套)
- C2KV 与 CoinRAG(arXiv 2608.07458)同属 KV Cache 复用大类,但维度不同:CoinRAG 是 chunk 级信息要点复用,C2KV 是跨请求压缩组合复用——两者不重复,共同构成 KV Cache 复用体系的三级(C2KV 跨请求 + CoinRAG chunk 内 + HiSparse 稀疏注意力)
- 与 §2.18 KVpop 预测式 KV 逐出(arXiv 2607.05061 keep-or-drop 75%/88%)形成纵向关联:KVpop 是"逐出哪些",C2KV 是"复用哪些",合起来是完整的 KV Cache 生命周期管理
建议归入节:§2.1(新增 C2KV 子节,与 CoinRAG / HiSparse 并列构成 KV Cache 七维复用体系)
增量 2:Memory-Centric KV Cache 服务端 — CXL+PIM 方案 2.4× 吞吐 + 20.6× CapEx 降低(HotInfra 2026)
来源:inbox/jay/2026-08-14T1130-jay-five-category-briefing.md(今日五分类简报)
arXiv:无(HotInfra 2026 论文 hotinfra.org/2026/papers/hotinfra26-final59.pdf)
要点:
- 架构:Prefill 阶段在 GPU HBM,Decode 阶段在 CPU + CXL DDRx,KV Cache 通过 CXL 共享内存互联传输
- 关键数据(32K tokens 生成场景):
- 吞吐量:CXL+PIM 1,607 tok/s vs GPU HBM 679 tok/s(2.4× 提升)
- CapEx:CXL+PIM $27,664 vs GPU $570,000(20.6× 降低)
- OpEx:CXL+PIM $3.53/hr vs GPU $59.23/hr
- 引用 Mooncake(USENIX FAST 2025)的 KVCache 中心化解聚架构作为理论基础
- 重要警示:PIM(Processing-In-Memory)硬件生态尚未成熟(Samsung PIM-DIMM),大规模部署时间线不确定
与 knowledge/engineering.md 现有脉络的关系:
- 写入 §2.2 PD Disaggregation 异构(v53 已有 MemHA GDDR prefill + HBM decode 3.2×、Tail-Aware、llm-d CNCF、DistServe、vLLM DCP、Helix Parallelism)
- Memory-Centric CXL+PIM 方案是 PD Disaggregation 的内存层级新选择:传统方案是 GPU HBM + CPU DRAM 分立,CXL+PIM 方案引入 PIM-DIMM 作为新的 KV Cache 存储层
- 与 §2.2 中的 DCP 8×B200 Kimi K2.6 数据形成互补:DCP 是互联带宽优化(RDMA),CXL+PIM 是存储层级优化(近计算内存),两者可叠加
建议归入节:§2.2(新增 CXL+PIM Memory-Centric 子节,与 DCP/Helix 并列构成 PD 异构三件套)
增量 3:vLLM 0.19 + llm-d CNCF v0.7 — 推理引擎双轨更新(InferenceOps Substack)
来源:inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md(State of Model Serving Communities April 2026)+ inbox/jay/2026-08-14-inference-agent-rag-engineering.md(工程筛选报告)
arXiv:无(Substack / GitHub release notes)
要点:
vLLM 0.19(v0.17→v0.19)
- Model Runner V2:模块化架构重构,CUDA graph dispatch 重写
- P-EAGLE(Parallel EAGLE):推测解码新方法,Eagle3 支持
- KV Cache Offloading:FlexKV offloading backend + reuse-frequency-gated CPU stores
- 新架构支持:Gemma 4(MoE/多模态/推理/tool-use)、Sarvam MoE、OLMo Hybrid、ColPali
- gRPC serving(
--grpcflag):GPU-less Render Serving,多模态预处理与 GPU 推理分离 - NGram GPU Speculative Decoding:兼容 async scheduler
- FlashAttention 4 集成 + FlashInfer v0.6.6
- 周安装量从 ~1M/周 增长到 ~2M/周(2026-03,InferenceOps 数据)
llm-d CNCF Sandbox v0.7
- KV cache memory 降低 50-60%(GDS GPUDirect Storage 支持)
- EPD(Encode/Prefill/Decode)分解支持,KV cache enablement 初始支持
- Pure Go ZMQ 实现:消除 CGO 依赖,提升部署洁度
- 新指标
disagg_decision_total:统一追踪请求路由决策 - EPP(Endpoint Picker)代码迁移到 llm-d-inference-scheduler(2026-04-20 起)
值得关注的横向关联
- vLLM 0.19 P-EAGLE + llm-d EPD分解 → 共同指向 PD Disaggregation 的工程落地加速
- vLLM 0.19 gRPC serving → 与 KServe v0.17.0(
/v1/responsesHTTPRoute 支持)形成云原生推理栈的完整链路
与 knowledge/engineering.md 现有脉络的关系:
- 写入 §2.13 推理引擎可复现性危机(v53 已覆盖 v0.17→v0.19 Model Runner V2 + P-EAGLE + FlexKV + FA4 + 周安装量 1M→2M)
- v53 已锚入上述大部分内容,本轮补充:P-EAGLE 算法原理细节(Parallel EAGLE 是 EAGLE 系列的并行版本,与 DFlash 6× 同属推测解码体系,需核实是否已由 v53 SpecDec 四件套覆盖)
- EPD 分解是新增细节——llm-d 的 Encode/Prefill/Decode 三阶段分解,与 §2.2 PD Disaggregation 直接相关,但 v53 未明确提及 EPD
建议归入节:§2.13(补充 EPD 分解子项到 llm-d 描述中);§2.2(EPD 分解作为 PD Disaggregation 的一种实现路径)
增量 4:CockroachDB SIGMOD 2026 — 可扩展领导者租约 85% CPU 降低
来源:inbox/jay/2026-08-14_database-backend-cloudnative-engineering.md(今日数据库/后端工程报告)
arXiv:无(CockroachDB Labs SIGMOD 2026 Industry 3 Session 论文)
要点:
- 问题:分布式数据库中 Raft 组领导者租约维护是重要的协调开销来源,在多共识组场景(数千到数百万 range)下尤为突出
- 解决方案:可扩展领导者租约分配机制——消除了集中式瓶颈,分布式协调不引入新的单点
- 关键数据:租约维护 CPU 使用降低最高 85%(规模效应明显)
- 与现有 CockroachDB 架构完全兼容
工程意义: - 适用场景:CockroachDB 生产用户(多 region 部署优先) - 选型参考:分布式 OLTP 选型时,CockroachDB 在强一致性 + 多 region 活跃-活跃写入场景,2026 年新增性能可扩展性保障 - 量化基准:OLTP 混合负载 45K TPS、读密集 85K QPS、写密集 35K TPS
与 knowledge/engineering.md 现有脉络的关系:
- 写入 §2.11 Vector DB SIGMOD 2026 + Filtered ANN + PG18 AIO(v53 已有 CockroachDB Scalable Leader Leases 相关条目)
- 本轮补充85% CPU 降低这一精确数字,以及与 TiDB/YugabyteDB 的横评基准数据
建议归入节:§2.11(补充 85% CPU 数字 + 横评基准数据到 CockroachDB 条目)
增量 5:pgvector CVE-2026-3172 — 向量数据库安全漏洞 + vLLM GPU 内存 Crash 率实测数据
来源:inbox/jay/2026-08-14-inference-agent-rag-engineering.md(工程筛选报告) + inbox/jay/2026-08-14_database-backend-cloudnative-engineering.md(pgvector 2026 生产边界)
arXiv:无(安全公告)
要点:
pgvector CVE-2026-3172
- 性质:pgvector 特定版本安全漏洞,2026 年披露
- 工程影响:所有使用 pgvector 做向量检索的生产系统需核查版本并及时打补丁
- 上下文:pgvector 在 <50M 向量规模仍是首选(零额外运维),此漏洞不会改变选型结论,但需纳入安全运营流程
vLLM GPU 内存 Crash 率(AIMultiple 实测)
| gpu_memory_utilization | Crash 率 |
|---|---|
| 0.95 | 100% |
| 0.90 | 30% |
| 0.80 | 0% |
- 实测环境:H100 80GB HBM3 / CUDA 12.8.1 / PyTorch 2.8.0 / vLLM 0.11.0
- A10 GPU 实测对比:SGLang 占用 7GB VRAM,vLLM 占用 21GB(根因:SGLang 惰性 KV 分配 vs vLLM 预分配机制)
- 生产建议:
--gpu-memory-utilization 0.8是安全区边界,0.9 需配合监控
与 knowledge/engineering.md 现有脉络的关系:
- CVE-2026-3172 写入 §2.11 Vector DB SIGMOD 2026 + pgvector CVE(pgvector CVE 条目已在 v53 §2.11 中)
- GPU 内存 Crash 数据写入 §2.13 推理引擎可复现性危机(作为 vLLM 实测数据的新量化补充)
- 与 v53 已覆盖的 Datadog 840 万次 rate limit 失败形成安全 + 可靠性双维度:Datadog 是 API 层失败,CVE-2026-3172 是存储层漏洞,GPU crash rate 是配置层可靠性
建议归入节:§2.11(pgvector CVE-2026-3172);§2.13(GPU 内存 crash 率表格作为 vLLM 实测数据)
增量 6:DCAS — CLI Agent 脚手架耦合问题与跨脚手架规划内化解耦(arXiv 2608.06113,engineering 主分类)
来源:inbox/jay/2026-08-14-inference-agent-rag-engineering.md(工程筛选报告) + paper_card 862(arXiv 2608.06113)
arXiv:2608.06113(DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds,cs.AI/application,2026-08)
要点:
- 问题现象:开放生态中几乎所有 CLI 软件工程 Agent 的轨迹数据集都来自 OpenHands;在 OpenHands 上微调的模型在其他脚手架上性能显著下降,但未训练的基础模型不存在此差异
- 根因:微调-induced 的脚手架特定规划结构(planning structure)——脚手架不只是运行环境,还向模型注入了隐含的规划惯例
- DCAS 核心贡献:解耦 CLI Agent 脚手架,使模型规划能力可跨脚手架迁移,而非绑定于单一训练环境
- 工程意义:
- OpenHands 生态主导地位带来的脚手架锁定风险——如果行业只在一个脚手架上训练,数据多样性受限,Agent 的泛化能力将停滞
- 对 Agent 框架选型的启示:框架的脚手架设计(prompt 惯例、tool 调用结构)会影响模型在该框架外的表现
- 与 v53 §2.7(Alice Labs 框架评分 + Sherlocks 73 事故六层栈)形成横向关联:脚手架设计影响 Agent 泛化性能
与 knowledge/engineering.md 现有脉络的关系:
- 写入 §2.7 Agentic Engineering(v53 §2.7 已有 Harness 五层形式化 + Eval 三层收敛框架 + LangChain 57% + Datadog + Alice Labs 框架评分)
- DCAS 是脚手架设计的新维度:现有框架评分(Alice Labs)关注生产就绪度,DCAS 关注脚手架对模型能力的绑定效应——两者互补
- 与 §2.22 推理引擎安全 + Coding Agent(v53 已有 Claude Code + CLI Coding Agents 35 件套)形成纵向深化:CLI Agent 不只是工具集,更是向模型注入规划结构的隐式训练环境
建议归入节:§2.7(新增 DCAS 子节,作为脚手架锁定风险的学术锚点,与 Alice Labs 框架评分并列)
三、值得警惕的矛盾或待核实说法
| # | 说法 | 风险 | 建议 |
|---|---|---|---|
| 1 | 「CXL+PIM 2.4× 吞吐 / 20.6× CapEx 降低」(HotInfra 2026,Memory-Centric KV Cache) | PIM 硬件生态不成熟(Samsung PIM-DIMM);32K tokens 生成场景的单一 benchmark 数据 | 引用方向(CXL+PIM 是有前景的新方向),不引用精确倍数的跨场景泛化;需待更多硬件平台验证 |
| 2 | 「vLLM 周安装量从 ~1M/周 增长到 ~2M/周」(InferenceOps Substack) | 数据来源为 InferenceOps Substack(Red Hat AI 团队),厂商报告可能有选择性呈现 | 引用为行业趋势信号,标注来源;需对照 PyPI 下载量独立核实 |
| 3 | 「PostgreSQL 18 顺序扫描最高 3× 提升」(Percona / Bytebase Blog) | 3× 数据的具体场景(NVMe/HDD?并发条件?)未在 inbox 文件中披露;Percona 测试环境可能偏理想 | 引用为 PG18 AIO 升级方向,不引用具体倍数;建议核验官方 benchmark |
| 4 | 「SGLang 占用 7GB VRAM / vLLM 占用 21GB(A10 24GB)」(GitHub vLLM Discussion #17221) | A10 是 24GB 卡,与主流 H100 80GB 显存条件不同;A10 结论不一定适用于 H100 | 引用为 A10 GPU 场景数据;H100 场景引用其他来源(InfraTech / AIMultiple) |
| 5 | 「PostTrainBench+」(Import AI 468,Jack Clark) | Import AI 468 中仅作为提及,无 paper_card 建卡;具体评测方法、评测对象待核实 | 追踪 paper_card 建卡后再引用;Import AI 作为 newsletter 信号有价值,不作为一级引用 |
四、可引用 arXiv 号列表
| arXiv 号 | 标题(简) | 相关节 | 可信度 |
|---|---|---|---|
| 2607.17715 | C2KV: Compressed and Composable KV Cache(KDD 2026,跨请求 KV 缓存复用) | §2.1 KV Cache 复用体系 | 高(KDD 2026 同行评审) |
| 2608.06113 | DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning(脚手架解耦跨脚手架规划) | §2.7 Agentic Engineering | 高(有 GitHub 代码预期) |
| 2608.11632 | Continuity Kernel: Transactional State Governance for Long-Lived AI Agents(事务性连续性内核) | §2.14 Memory/Continuity Kernel | 高(上轮已锚入,本轮维持) |
| 2608.09805 | Parameter Exploration for RLVR via Variational Learning(RLVR 参数空间探索变分学习) | §2.21/§2.22(RLVR/推理工程) | 高(arXiv 2026-08-11 新提交) |
| 2608.10615 | Simplex Relaxation for Discrete Diffusion(离散扩散的单纯形松弛) | §2.19 投机解码体系 | 高(上轮 v53 已锚入) |
| 2608.11350 | Self-Evolving Embodied Agents via Skill-Harness Evolution(技能-脚手架演化的自演进具身 Agent) | §2.7 Agentic Engineering | 高(上轮 v53 旁注候选) |
| 2608.12036 | Mechanist: AI as a Scientific Instrument for Discovering Mechanisms of Intelligence | §2.14/§2.21 | 高(上轮 v53 旁注候选) |
| 2608.09867 | Stealing Reasoning Traces from Proprietary LLM APIs(加密 CoT 跨会话可互换窃取) | §2.15 AI 安全 | 高(上轮 v53 已锚入,维持) |
五、已检查来源清单
| 来源 | 检查文件 | 备注 |
|---|---|---|
| inbox/jay | 2026-08-14T1130-jay-five-category-briefing.md | C2KV(KDD 2026)、Memory-Centric CXL+PIM、Alice Labs Agent 框架评分 Aug 2026、vLLM 原生 transformers 后端、ERSkill(arXiv 今日新)、Backtrader-Bench、TGI 维护确认 |
| inbox/jay | 2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md | Agentic Search 范式转变(6× SWE-bench)、Mem0 2026、AI-Native Backend MCP 生态、nanochat Karpathy、EngiAI Multi-Agent、HF August 2026 |
| inbox/jay | 2026-08-14T0820-jay-csdn-inference-stack-substack-research.md | InferenceOps Substack v0.17→v0.19、vLLM 0.19 Model Runner V2 / P-EAGLE / FlexKV、llm-d CNCF v0.7、EPD分解、C2KV、Rethinking Classical Infrastructure(arXiv 2608.01526) |
| inbox/jay | 2026-08-14-inference-agent-rag-engineering.md | Sherlocks 73 事故六层故障栈(tool-call drift 31%)、vLLM GPU crash rate A10 7GB vs 21GB、vLLM utilization 0.95→100%、AOSpec/A-RAG、TurboQuant 5.3× |
| inbox/jay | 2026-08-14_database-backend-cloudnative-engineering.md | PG18 AIO/Eager Freezing/pgvector、pgvector CVE-2026-3172、CockroachDB SIGMOD 2026 85% CPU 降低、分布式 DB 横评(TiDB/CockroachDB/YugabyteDB) |
| inbox/jay | 2026-08-14-1001-rss-cool-papers.md | cs.CL 新提交 5 篇(无工程主分类新件) |
| inbox/jay | 2026-08-14-1000-rss-simon-willison.md | sqlite-utils 4.2/4.2.1、alchemy-utils 0.1a0/0.1a1、DeepSeek V4 Pro 0813(API-only) |
| inbox/jay | 2026-08-14-1000-rss-raschka.md | Muse Glimmer、本地 Coding Agent、KV Sharing/mHC/Compressed Attention(回顾文,非新内容) |
| inbox/jay | 2026-08-14-1001-rss-lilian-weng.md | Harness Engineering 2026-07-04(RSI 历史脉络,非今日新内容,上轮 e1prep 已覆盖) |
| inbox/jay | 2026-08-14-1002-rss-import-ai.md | Import AI 468:23 RSI 构想、PostTrainBench+(需建卡后再引用) |
| inbox/jay | 2026-08-14-1001-rss-nathan-benaich.md | 欧洲 AI 主权、State of AI 2026-05(历史内容) |
| inbox/jay | 2026-08-14-1002-rss-msr-blog.md | MSR 新论文:MindTopo/CARE-X/Orchard/Echoverse/EvoLib/MindTopo |
| inbox/jay | 2026-08-13-engineering-e1prep.md | 上轮 E1 预消化(6 条增量:Lilian Weng Harness RSI / AI Engineer Stack 2026 Eval Gap 37点 / Stealing Reasoning Traces 2608.09867) |
| inbox/tom | 2026-08-14-rag-e1prep.md | Tom 的 RAG 轮预消化(待核查) |
| inbox/flyp | 2026-08-14-multimodal-e1prep.md | Flyp 的 multimodal 轮(engineering 邻接) |
| inbox/spark | 2026-08-14-1001-rss-gradient-flow.md | 持续学习碎片化 / Day 500 后 AI 模型停止学习 |
| inbox/spark | 2026-08-14-1002-rss-chip-huyen.md | 尚未读(待查) |
| paper_cards(近 3 天新卡) | 835-2608-07126(PHOENIX 卫星自主延寿) | agent 主分类 · engineering 副分类 · 非本轮主线 |
| paper_cards(近 3 天新卡) | 843-2608-07458(CoinRAG) | rag 主分类 · llm-infra 副分类 · v53 §2.1 已锚入 |
| paper_cards(近 3 天新卡) | 861-2608-06865(Multi-Agent Forensic Reasoning) | multimodal 主分类 · 非工程主线 |
| paper_cards(近 3 天新卡) | 862-2608-06113(DCAS) | engineering 主分类 · 本轮增量 |
| paper_cards(近 3 天新卡) | 864-2608-04569(Referential Dangling 硬提示压缩) | rag 主分类 · 非工程主线 |
| paper_cards(近 3 天新卡) | 869-2608-09096(Evo-Bench) | evaluation 主分类 · 上轮 v53 旁注候选 |
| paper_cards(近 3 天新卡) | 870-2608-09853(RynnValue 机器人价值) | multimodal 主分类 · 非工程主线 |
| paper_cards(近 3 天新卡) | 907-2608-11030(Self-Knowledge RAG 专利匹配) | rag 主分类 · 非工程主线 |
| paper_cards(近 3 天新卡) | 920-2608-10288(PLDR-LLM/PLGA 幂律注意力) | llm-infra 主分类 · v53 §2.4 已锚入 |
| paper_cards(近 3 天新卡) | 921-2608-11632(Continuity Kernel) | agent 主分类 · v53 §2.14 已锚入 |
| paper_cards(近 3 天新卡) | 929-2608-12036(Mechanist) | agent 主分类 · 上轮 v53 旁注候选 |
| paper_cards(近 3 天新卡) | 930-2608-12123(Ready Cohorts) | 待查 |
| paper_cards(近 3 天新卡) | 931-2608-11350(Self-Evolving Embodied Agents) | 上轮 v53 旁注候选 |
| paper_cards(近 3 天新卡) | 932-2608-10615(Simplex Relaxation Discrete Diffusion) | v53 §2.19 已锚入 |
| paper_cards(近 3 天新卡) | 933-2608-09805(RLVR Variational Learning) | engineering 主分类 · 本轮增量 |
| paper_cards(近 3 天新卡) | 934-2608-05604(SkillZip) | 待查 |
| paper_cards(近 3 天新卡) | 939-2210-03629(Distributing Accountability Phase Separation) | 高分 rag 候选 · v53 已锚入 |
六、本轮总结
本轮 E1 预消化结论:中等增量——今日 engineering 主轴出现 3 个实质 net-new 增量(C2KV KDD 2026、Memory-Centric HotInfra 2026、DCAS arXiv 2608.06113),以及 3 个量化数据补充(vLLM 0.19 EPD分解、CockroachDB 85% CPU 降低、pgvector CVE-2026-3172 + vLLM GPU crash 率)。
建议今夜活文档接力重点:
§2.1 KV Cache 复用体系→ 新增 C2KV(arXiv 2607.17715,KDD 2026)子节,与 CoinRAG/HiSparse 构成 KV Cache 七维复用的第三维度(跨请求压缩组合复用)§2.2 PD Disaggregation 异构→ 新增 CXL+PIM Memory-Centric 子节(HotInfra 2026),2.4× 吞吐 + 20.6× CapEx 降低,与 DCP(互联带宽优化)/Helix(并行化)构成 PD 异构三件套§2.2→ 补充 llm-d EPD(Encode/Prefill/Decode)分解作为 PD Disaggregation 的一种实现路径§2.7 Agentic Engineering→ 新增 DCAS(arXiv 2608.06113)子节,CLI Agent 脚手架锁定风险,与 Alice Labs 框架评分并列§2.11→ 补充 pgvector CVE-2026-3172 安全漏洞(需核查版本),以及 CockroachDB SIGMOD 2026 85% CPU 降低精确数字§2.13→ 补充 vLLM GPU 内存 crash 率表格(0.95→100%、0.9→30%、0.8→0%)作为实测数据锚点
无显著新增量的领域: - Lilian Weng Harness Engineering RSI 博文(上轮 2026-08-13 已完整覆盖,今日 RSS 再次曝光但无新内容) - Stealing Reasoning Traces(arXiv 2608.09867,上轮已入 §2.15,维持原判) - Speculative Decoding 四件套(Bole / AcceptMoE / AOSpec / PLDR-LLM,v53 已体系化) - LangChain 57% / Datadog 840 万次 / Eval Gap 37 点(v53 §2.7 已锚入) - Continuity Kernel(arXiv 2608.11632,v53 §2.14 已锚入) - PG18 AIO/Eager Freezing(已在 v53 §2.11 覆盖,今日 inbox 仅重复曝光)
交叉验证事项: - CXL+PIM PIM-DIMM 硬件生态成熟度(Samsung 生态确认);与 Mooncake(USENIX FAST 2025)的具体技术路径对比待深挖 - ERSkill(arXiv,今日 85 篇 cs.AI 之一)尚未建卡,建议今夜建卡后归入 §2.7 或 §2.14
Jay · 2026-08-14 11:20 CST · E1 预消化轮 · 日间备料