engineering · E1 预消化简报(2026-08-14)

日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:2026-08-12 ~ 2026-08-14 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md


一、增量摘要

本轮增量条数:6 条

涉及 arXiv 号:2607.17715 2608.06113 2608.11350 2608.12036 2608.11632 2608.09805 2608.10615 2608.09867(上轮已入)

本轮说明:今日(2026-08-14)engineering 主轴增量较为丰富。KV Cache 领域出现 KDD 2026 新件套(C2KV 跨请求复用 + HotInfra Memory-Centric CXL+PIM 方案);推理引擎有 vLLM 0.19 Model Runner V2 + llm-d CNCF v0.7 双轨更新;数据库侧有 CockroachDB SIGMOD 2026 领导者租约 85% CPU 降低 + pgvector CVE-2026-3172 安全漏洞;Agent 工程有 DCAS CLI 脚手架解耦新现象 + Alice Labs Aug 2026 框架评分。上轮已入的 Stealing Reasoning Traces(2608.09867,86▲)本轮无重大更新,维持原判。


二、核心增量条目


增量 1:C2KV — 跨请求 KV Cache 可压缩组合复用(KDD 2026,arXiv 2607.17715)

来源inbox/jay/2026-08-14T1130-jay-five-category-briefing.md(五分类简报,今日)+ inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md(InferenceOps 追踪)

arXiv2607.17715(C2KV: Compressed and Composable KV Cache,KDD 2026,2026-08-09~13 Jeju Island)

要点

  • 问题域:现有 KV Cache 复用方案(如 PyramidKV、KVpool)在跨请求压缩率与组合延迟之间存在根本矛盾——高压缩率需要更多计算来解压/重组,反而抵消了复用收益
  • C2KV 核心机制:压缩可组合 KV Cache 框架,在 Llama-3.1-8B、Qwen-2.5-7B 的 GovReport、HotpotQA、MultiNews 等数据集上验证,在显著降低内存占用的同时保持精度
  • 与 vLLM PagedAttention 的互补关系:PagedAttention 解决单请求内分配,C2KV 解决跨请求复用——两者是不同维度的优化,可叠加
  • 工程意义:KV Cache 复用从"单请求内优化"演进到"跨请求组合优化",是推理引擎 2026 下半年的重要方向

与 knowledge/engineering.md 现有脉络的关系: - 写入 §2.1 KV Cache 独立系统学科(v53 已覆盖 CoinRAG 信息要点级复用 + HiSparse 分层 KV 稀疏注意力 + DeepSeek V4 MLA+DSA 九件套) - C2KV 与 CoinRAG(arXiv 2608.07458)同属 KV Cache 复用大类,但维度不同:CoinRAG 是 chunk 级信息要点复用,C2KV 是跨请求压缩组合复用——两者不重复,共同构成 KV Cache 复用体系的三级(C2KV 跨请求 + CoinRAG chunk 内 + HiSparse 稀疏注意力) - 与 §2.18 KVpop 预测式 KV 逐出(arXiv 2607.05061 keep-or-drop 75%/88%)形成纵向关联:KVpop 是"逐出哪些",C2KV 是"复用哪些",合起来是完整的 KV Cache 生命周期管理

建议归入节:§2.1(新增 C2KV 子节,与 CoinRAG / HiSparse 并列构成 KV Cache 七维复用体系)


增量 2:Memory-Centric KV Cache 服务端 — CXL+PIM 方案 2.4× 吞吐 + 20.6× CapEx 降低(HotInfra 2026)

来源inbox/jay/2026-08-14T1130-jay-five-category-briefing.md(今日五分类简报)

arXiv:无(HotInfra 2026 论文 hotinfra.org/2026/papers/hotinfra26-final59.pdf)

要点

  • 架构:Prefill 阶段在 GPU HBM,Decode 阶段在 CPU + CXL DDRx,KV Cache 通过 CXL 共享内存互联传输
  • 关键数据(32K tokens 生成场景)
  • 吞吐量:CXL+PIM 1,607 tok/s vs GPU HBM 679 tok/s(2.4× 提升
  • CapEx:CXL+PIM $27,664 vs GPU $570,000(20.6× 降低
  • OpEx:CXL+PIM $3.53/hr vs GPU $59.23/hr
  • 引用 Mooncake(USENIX FAST 2025)的 KVCache 中心化解聚架构作为理论基础
  • 重要警示:PIM(Processing-In-Memory)硬件生态尚未成熟(Samsung PIM-DIMM),大规模部署时间线不确定

与 knowledge/engineering.md 现有脉络的关系: - 写入 §2.2 PD Disaggregation 异构(v53 已有 MemHA GDDR prefill + HBM decode 3.2×、Tail-Aware、llm-d CNCF、DistServe、vLLM DCP、Helix Parallelism) - Memory-Centric CXL+PIM 方案是 PD Disaggregation 的内存层级新选择:传统方案是 GPU HBM + CPU DRAM 分立,CXL+PIM 方案引入 PIM-DIMM 作为新的 KV Cache 存储层 - 与 §2.2 中的 DCP 8×B200 Kimi K2.6 数据形成互补:DCP 是互联带宽优化(RDMA),CXL+PIM 是存储层级优化(近计算内存),两者可叠加

建议归入节:§2.2(新增 CXL+PIM Memory-Centric 子节,与 DCP/Helix 并列构成 PD 异构三件套)


增量 3:vLLM 0.19 + llm-d CNCF v0.7 — 推理引擎双轨更新(InferenceOps Substack)

来源inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md(State of Model Serving Communities April 2026)+ inbox/jay/2026-08-14-inference-agent-rag-engineering.md(工程筛选报告)

arXiv:无(Substack / GitHub release notes)

要点

vLLM 0.19(v0.17→v0.19)

  • Model Runner V2:模块化架构重构,CUDA graph dispatch 重写
  • P-EAGLE(Parallel EAGLE):推测解码新方法,Eagle3 支持
  • KV Cache Offloading:FlexKV offloading backend + reuse-frequency-gated CPU stores
  • 新架构支持:Gemma 4(MoE/多模态/推理/tool-use)、Sarvam MoE、OLMo Hybrid、ColPali
  • gRPC serving--grpc flag):GPU-less Render Serving,多模态预处理与 GPU 推理分离
  • NGram GPU Speculative Decoding:兼容 async scheduler
  • FlashAttention 4 集成 + FlashInfer v0.6.6
  • 周安装量从 ~1M/周 增长到 ~2M/周(2026-03,InferenceOps 数据)

llm-d CNCF Sandbox v0.7

  • KV cache memory 降低 50-60%(GDS GPUDirect Storage 支持)
  • EPD(Encode/Prefill/Decode)分解支持,KV cache enablement 初始支持
  • Pure Go ZMQ 实现:消除 CGO 依赖,提升部署洁度
  • 新指标 disagg_decision_total:统一追踪请求路由决策
  • EPP(Endpoint Picker)代码迁移到 llm-d-inference-scheduler(2026-04-20 起)

值得关注的横向关联

  • vLLM 0.19 P-EAGLE + llm-d EPD分解 → 共同指向 PD Disaggregation 的工程落地加速
  • vLLM 0.19 gRPC serving → 与 KServe v0.17.0(/v1/responses HTTPRoute 支持)形成云原生推理栈的完整链路

与 knowledge/engineering.md 现有脉络的关系: - 写入 §2.13 推理引擎可复现性危机(v53 已覆盖 v0.17→v0.19 Model Runner V2 + P-EAGLE + FlexKV + FA4 + 周安装量 1M→2M) - v53 已锚入上述大部分内容,本轮补充:P-EAGLE 算法原理细节(Parallel EAGLE 是 EAGLE 系列的并行版本,与 DFlash 6× 同属推测解码体系,需核实是否已由 v53 SpecDec 四件套覆盖) - EPD 分解是新增细节——llm-d 的 Encode/Prefill/Decode 三阶段分解,与 §2.2 PD Disaggregation 直接相关,但 v53 未明确提及 EPD

建议归入节:§2.13(补充 EPD 分解子项到 llm-d 描述中);§2.2(EPD 分解作为 PD Disaggregation 的一种实现路径)


增量 4:CockroachDB SIGMOD 2026 — 可扩展领导者租约 85% CPU 降低

来源inbox/jay/2026-08-14_database-backend-cloudnative-engineering.md(今日数据库/后端工程报告)

arXiv:无(CockroachDB Labs SIGMOD 2026 Industry 3 Session 论文)

要点

  • 问题:分布式数据库中 Raft 组领导者租约维护是重要的协调开销来源,在多共识组场景(数千到数百万 range)下尤为突出
  • 解决方案:可扩展领导者租约分配机制——消除了集中式瓶颈,分布式协调不引入新的单点
  • 关键数据:租约维护 CPU 使用降低最高 85%(规模效应明显)
  • 与现有 CockroachDB 架构完全兼容

工程意义: - 适用场景:CockroachDB 生产用户(多 region 部署优先) - 选型参考:分布式 OLTP 选型时,CockroachDB 在强一致性 + 多 region 活跃-活跃写入场景,2026 年新增性能可扩展性保障 - 量化基准:OLTP 混合负载 45K TPS、读密集 85K QPS、写密集 35K TPS

与 knowledge/engineering.md 现有脉络的关系: - 写入 §2.11 Vector DB SIGMOD 2026 + Filtered ANN + PG18 AIO(v53 已有 CockroachDB Scalable Leader Leases 相关条目) - 本轮补充85% CPU 降低这一精确数字,以及与 TiDB/YugabyteDB 的横评基准数据

建议归入节:§2.11(补充 85% CPU 数字 + 横评基准数据到 CockroachDB 条目)


增量 5:pgvector CVE-2026-3172 — 向量数据库安全漏洞 + vLLM GPU 内存 Crash 率实测数据

来源inbox/jay/2026-08-14-inference-agent-rag-engineering.md(工程筛选报告) + inbox/jay/2026-08-14_database-backend-cloudnative-engineering.md(pgvector 2026 生产边界)

arXiv:无(安全公告)

要点

pgvector CVE-2026-3172

  • 性质:pgvector 特定版本安全漏洞,2026 年披露
  • 工程影响:所有使用 pgvector 做向量检索的生产系统需核查版本并及时打补丁
  • 上下文:pgvector 在 <50M 向量规模仍是首选(零额外运维),此漏洞不会改变选型结论,但需纳入安全运营流程

vLLM GPU 内存 Crash 率(AIMultiple 实测)

gpu_memory_utilization Crash 率
0.95 100%
0.90 30%
0.80 0%
  • 实测环境:H100 80GB HBM3 / CUDA 12.8.1 / PyTorch 2.8.0 / vLLM 0.11.0
  • A10 GPU 实测对比:SGLang 占用 7GB VRAM,vLLM 占用 21GB(根因:SGLang 惰性 KV 分配 vs vLLM 预分配机制)
  • 生产建议--gpu-memory-utilization 0.8 是安全区边界,0.9 需配合监控

与 knowledge/engineering.md 现有脉络的关系: - CVE-2026-3172 写入 §2.11 Vector DB SIGMOD 2026 + pgvector CVE(pgvector CVE 条目已在 v53 §2.11 中) - GPU 内存 Crash 数据写入 §2.13 推理引擎可复现性危机(作为 vLLM 实测数据的新量化补充) - 与 v53 已覆盖的 Datadog 840 万次 rate limit 失败形成安全 + 可靠性双维度:Datadog 是 API 层失败,CVE-2026-3172 是存储层漏洞,GPU crash rate 是配置层可靠性

建议归入节:§2.11(pgvector CVE-2026-3172);§2.13(GPU 内存 crash 率表格作为 vLLM 实测数据)


增量 6:DCAS — CLI Agent 脚手架耦合问题与跨脚手架规划内化解耦(arXiv 2608.06113,engineering 主分类)

来源inbox/jay/2026-08-14-inference-agent-rag-engineering.md(工程筛选报告) + paper_card 862(arXiv 2608.06113)

arXiv2608.06113(DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds,cs.AI/application,2026-08)

要点

  • 问题现象:开放生态中几乎所有 CLI 软件工程 Agent 的轨迹数据集都来自 OpenHands;在 OpenHands 上微调的模型在其他脚手架上性能显著下降,但未训练的基础模型不存在此差异
  • 根因:微调-induced 的脚手架特定规划结构(planning structure)——脚手架不只是运行环境,还向模型注入了隐含的规划惯例
  • DCAS 核心贡献:解耦 CLI Agent 脚手架,使模型规划能力可跨脚手架迁移,而非绑定于单一训练环境
  • 工程意义
  • OpenHands 生态主导地位带来的脚手架锁定风险——如果行业只在一个脚手架上训练,数据多样性受限,Agent 的泛化能力将停滞
  • 对 Agent 框架选型的启示:框架的脚手架设计(prompt 惯例、tool 调用结构)会影响模型在该框架外的表现
  • 与 v53 §2.7(Alice Labs 框架评分 + Sherlocks 73 事故六层栈)形成横向关联:脚手架设计影响 Agent 泛化性能

与 knowledge/engineering.md 现有脉络的关系: - 写入 §2.7 Agentic Engineering(v53 §2.7 已有 Harness 五层形式化 + Eval 三层收敛框架 + LangChain 57% + Datadog + Alice Labs 框架评分) - DCAS 是脚手架设计的新维度:现有框架评分(Alice Labs)关注生产就绪度,DCAS 关注脚手架对模型能力的绑定效应——两者互补 - 与 §2.22 推理引擎安全 + Coding Agent(v53 已有 Claude Code + CLI Coding Agents 35 件套)形成纵向深化:CLI Agent 不只是工具集,更是向模型注入规划结构的隐式训练环境

建议归入节:§2.7(新增 DCAS 子节,作为脚手架锁定风险的学术锚点,与 Alice Labs 框架评分并列)


三、值得警惕的矛盾或待核实说法

# 说法 风险 建议
1 「CXL+PIM 2.4× 吞吐 / 20.6× CapEx 降低」(HotInfra 2026,Memory-Centric KV Cache) PIM 硬件生态不成熟(Samsung PIM-DIMM);32K tokens 生成场景的单一 benchmark 数据 引用方向(CXL+PIM 是有前景的新方向),不引用精确倍数的跨场景泛化;需待更多硬件平台验证
2 「vLLM 周安装量从 ~1M/周 增长到 ~2M/周」(InferenceOps Substack) 数据来源为 InferenceOps Substack(Red Hat AI 团队),厂商报告可能有选择性呈现 引用为行业趋势信号,标注来源;需对照 PyPI 下载量独立核实
3 「PostgreSQL 18 顺序扫描最高 3× 提升」(Percona / Bytebase Blog) 3× 数据的具体场景(NVMe/HDD?并发条件?)未在 inbox 文件中披露;Percona 测试环境可能偏理想 引用为 PG18 AIO 升级方向,不引用具体倍数;建议核验官方 benchmark
4 「SGLang 占用 7GB VRAM / vLLM 占用 21GB(A10 24GB)」(GitHub vLLM Discussion #17221) A10 是 24GB 卡,与主流 H100 80GB 显存条件不同;A10 结论不一定适用于 H100 引用为 A10 GPU 场景数据;H100 场景引用其他来源(InfraTech / AIMultiple)
5 「PostTrainBench+」(Import AI 468,Jack Clark) Import AI 468 中仅作为提及,无 paper_card 建卡;具体评测方法、评测对象待核实 追踪 paper_card 建卡后再引用;Import AI 作为 newsletter 信号有价值,不作为一级引用

四、可引用 arXiv 号列表

arXiv 号 标题(简) 相关节 可信度
2607.17715 C2KV: Compressed and Composable KV Cache(KDD 2026,跨请求 KV 缓存复用) §2.1 KV Cache 复用体系 高(KDD 2026 同行评审)
2608.06113 DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning(脚手架解耦跨脚手架规划) §2.7 Agentic Engineering 高(有 GitHub 代码预期)
2608.11632 Continuity Kernel: Transactional State Governance for Long-Lived AI Agents(事务性连续性内核) §2.14 Memory/Continuity Kernel 高(上轮已锚入,本轮维持)
2608.09805 Parameter Exploration for RLVR via Variational Learning(RLVR 参数空间探索变分学习) §2.21/§2.22(RLVR/推理工程) 高(arXiv 2026-08-11 新提交)
2608.10615 Simplex Relaxation for Discrete Diffusion(离散扩散的单纯形松弛) §2.19 投机解码体系 高(上轮 v53 已锚入)
2608.11350 Self-Evolving Embodied Agents via Skill-Harness Evolution(技能-脚手架演化的自演进具身 Agent) §2.7 Agentic Engineering 高(上轮 v53 旁注候选)
2608.12036 Mechanist: AI as a Scientific Instrument for Discovering Mechanisms of Intelligence §2.14/§2.21 高(上轮 v53 旁注候选)
2608.09867 Stealing Reasoning Traces from Proprietary LLM APIs(加密 CoT 跨会话可互换窃取) §2.15 AI 安全 高(上轮 v53 已锚入,维持)

五、已检查来源清单

来源 检查文件 备注
inbox/jay 2026-08-14T1130-jay-five-category-briefing.md C2KV(KDD 2026)、Memory-Centric CXL+PIM、Alice Labs Agent 框架评分 Aug 2026、vLLM 原生 transformers 后端、ERSkill(arXiv 今日新)、Backtrader-Bench、TGI 维护确认
inbox/jay 2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md Agentic Search 范式转变(6× SWE-bench)、Mem0 2026、AI-Native Backend MCP 生态、nanochat Karpathy、EngiAI Multi-Agent、HF August 2026
inbox/jay 2026-08-14T0820-jay-csdn-inference-stack-substack-research.md InferenceOps Substack v0.17→v0.19、vLLM 0.19 Model Runner V2 / P-EAGLE / FlexKV、llm-d CNCF v0.7、EPD分解、C2KV、Rethinking Classical Infrastructure(arXiv 2608.01526)
inbox/jay 2026-08-14-inference-agent-rag-engineering.md Sherlocks 73 事故六层故障栈(tool-call drift 31%)、vLLM GPU crash rate A10 7GB vs 21GB、vLLM utilization 0.95→100%、AOSpec/A-RAG、TurboQuant 5.3×
inbox/jay 2026-08-14_database-backend-cloudnative-engineering.md PG18 AIO/Eager Freezing/pgvector、pgvector CVE-2026-3172、CockroachDB SIGMOD 2026 85% CPU 降低、分布式 DB 横评(TiDB/CockroachDB/YugabyteDB)
inbox/jay 2026-08-14-1001-rss-cool-papers.md cs.CL 新提交 5 篇(无工程主分类新件)
inbox/jay 2026-08-14-1000-rss-simon-willison.md sqlite-utils 4.2/4.2.1、alchemy-utils 0.1a0/0.1a1、DeepSeek V4 Pro 0813(API-only)
inbox/jay 2026-08-14-1000-rss-raschka.md Muse Glimmer、本地 Coding Agent、KV Sharing/mHC/Compressed Attention(回顾文,非新内容)
inbox/jay 2026-08-14-1001-rss-lilian-weng.md Harness Engineering 2026-07-04(RSI 历史脉络,非今日新内容,上轮 e1prep 已覆盖)
inbox/jay 2026-08-14-1002-rss-import-ai.md Import AI 468:23 RSI 构想、PostTrainBench+(需建卡后再引用)
inbox/jay 2026-08-14-1001-rss-nathan-benaich.md 欧洲 AI 主权、State of AI 2026-05(历史内容)
inbox/jay 2026-08-14-1002-rss-msr-blog.md MSR 新论文:MindTopo/CARE-X/Orchard/Echoverse/EvoLib/MindTopo
inbox/jay 2026-08-13-engineering-e1prep.md 上轮 E1 预消化(6 条增量:Lilian Weng Harness RSI / AI Engineer Stack 2026 Eval Gap 37点 / Stealing Reasoning Traces 2608.09867)
inbox/tom 2026-08-14-rag-e1prep.md Tom 的 RAG 轮预消化(待核查)
inbox/flyp 2026-08-14-multimodal-e1prep.md Flyp 的 multimodal 轮(engineering 邻接)
inbox/spark 2026-08-14-1001-rss-gradient-flow.md 持续学习碎片化 / Day 500 后 AI 模型停止学习
inbox/spark 2026-08-14-1002-rss-chip-huyen.md 尚未读(待查)
paper_cards(近 3 天新卡) 835-2608-07126(PHOENIX 卫星自主延寿) agent 主分类 · engineering 副分类 · 非本轮主线
paper_cards(近 3 天新卡) 843-2608-07458(CoinRAG) rag 主分类 · llm-infra 副分类 · v53 §2.1 已锚入
paper_cards(近 3 天新卡) 861-2608-06865(Multi-Agent Forensic Reasoning) multimodal 主分类 · 非工程主线
paper_cards(近 3 天新卡) 862-2608-06113(DCAS) engineering 主分类 · 本轮增量
paper_cards(近 3 天新卡) 864-2608-04569(Referential Dangling 硬提示压缩) rag 主分类 · 非工程主线
paper_cards(近 3 天新卡) 869-2608-09096(Evo-Bench) evaluation 主分类 · 上轮 v53 旁注候选
paper_cards(近 3 天新卡) 870-2608-09853(RynnValue 机器人价值) multimodal 主分类 · 非工程主线
paper_cards(近 3 天新卡) 907-2608-11030(Self-Knowledge RAG 专利匹配) rag 主分类 · 非工程主线
paper_cards(近 3 天新卡) 920-2608-10288(PLDR-LLM/PLGA 幂律注意力) llm-infra 主分类 · v53 §2.4 已锚入
paper_cards(近 3 天新卡) 921-2608-11632(Continuity Kernel) agent 主分类 · v53 §2.14 已锚入
paper_cards(近 3 天新卡) 929-2608-12036(Mechanist) agent 主分类 · 上轮 v53 旁注候选
paper_cards(近 3 天新卡) 930-2608-12123(Ready Cohorts) 待查
paper_cards(近 3 天新卡) 931-2608-11350(Self-Evolving Embodied Agents) 上轮 v53 旁注候选
paper_cards(近 3 天新卡) 932-2608-10615(Simplex Relaxation Discrete Diffusion) v53 §2.19 已锚入
paper_cards(近 3 天新卡) 933-2608-09805(RLVR Variational Learning) engineering 主分类 · 本轮增量
paper_cards(近 3 天新卡) 934-2608-05604(SkillZip) 待查
paper_cards(近 3 天新卡) 939-2210-03629(Distributing Accountability Phase Separation) 高分 rag 候选 · v53 已锚入

六、本轮总结

本轮 E1 预消化结论:中等增量——今日 engineering 主轴出现 3 个实质 net-new 增量(C2KV KDD 2026、Memory-Centric HotInfra 2026、DCAS arXiv 2608.06113),以及 3 个量化数据补充(vLLM 0.19 EPD分解、CockroachDB 85% CPU 降低、pgvector CVE-2026-3172 + vLLM GPU crash 率)。

建议今夜活文档接力重点

  1. §2.1 KV Cache 复用体系 → 新增 C2KV(arXiv 2607.17715,KDD 2026)子节,与 CoinRAG/HiSparse 构成 KV Cache 七维复用的第三维度(跨请求压缩组合复用)
  2. §2.2 PD Disaggregation 异构 → 新增 CXL+PIM Memory-Centric 子节(HotInfra 2026),2.4× 吞吐 + 20.6× CapEx 降低,与 DCP(互联带宽优化)/Helix(并行化)构成 PD 异构三件套
  3. §2.2 → 补充 llm-d EPD(Encode/Prefill/Decode)分解作为 PD Disaggregation 的一种实现路径
  4. §2.7 Agentic Engineering → 新增 DCAS(arXiv 2608.06113)子节,CLI Agent 脚手架锁定风险,与 Alice Labs 框架评分并列
  5. §2.11 → 补充 pgvector CVE-2026-3172 安全漏洞(需核查版本),以及 CockroachDB SIGMOD 2026 85% CPU 降低精确数字
  6. §2.13 → 补充 vLLM GPU 内存 crash 率表格(0.95→100%、0.9→30%、0.8→0%)作为实测数据锚点

无显著新增量的领域: - Lilian Weng Harness Engineering RSI 博文(上轮 2026-08-13 已完整覆盖,今日 RSS 再次曝光但无新内容) - Stealing Reasoning Traces(arXiv 2608.09867,上轮已入 §2.15,维持原判) - Speculative Decoding 四件套(Bole / AcceptMoE / AOSpec / PLDR-LLM,v53 已体系化) - LangChain 57% / Datadog 840 万次 / Eval Gap 37 点(v53 §2.7 已锚入) - Continuity Kernel(arXiv 2608.11632,v53 §2.14 已锚入) - PG18 AIO/Eager Freezing(已在 v53 §2.11 覆盖,今日 inbox 仅重复曝光)

交叉验证事项: - CXL+PIM PIM-DIMM 硬件生态成熟度(Samsung 生态确认);与 Mooncake(USENIX FAST 2025)的具体技术路径对比待深挖 - ERSkill(arXiv,今日 85 篇 cs.AI 之一)尚未建卡,建议今夜建卡后归入 §2.7 或 §2.14


Jay · 2026-08-14 11:20 CST · E1 预消化轮 · 日间备料