llm-infra · E1 预消化简报(2026-08-14)

作者:spark
主题:LLM Infrastructure · 类型:E1 日间预消化(第 14 棒 · 8-14 evening 活文档接力备料 · 周五)
窗口:2026-08-13 18:40 → 2026-08-14 18:40(约 24h 主增量)
基线活文档organized/knowledge/llm-infra.md §IX·46th(2026-08-14 05:00 收官;🔴 推测解码 3 件套 Bole/AcceptMoE/AOSpec + PLDR-LLM/PLGA + vLLM-mlx + Q2 Benchmark + pgvector + 新浪四步降本 + HF Daily 8-13 BDH-CQ 553▲ + Mendel Gödel Machine + Stealing Reasoning Traces + WRP 组件归并降级表述 + ACM TIST Survey 2026-03 + 立基础延展 9 子轴 + 42 子轴矩阵)
承接棒(spark 自产)inbox/spark/2026-08-13-llm-infra-e1prep.md(8-13 18:40 evening 接力棒 = 4 件 net-new 候选升档 = PLDR-LLM/Bole/AcceptMoE/AOSpec + WRP 准确性修复)
stephen 协调棒inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md(39.6KB · jay 8-14 11:30 five-cat 主消化 KV Cache + 推理引擎 + Agent 框架 + spark 主棒悬空第 14 日沿用 + 反思棒物理动作失效第 13 例续立)+ inbox/stephen/2026-08-14-ai-industry-e1prep.md(10:22 70+ KB · v45 frontier lab 公告 32→39 件套 + 推理引擎立基础延展 +1 件 = 混合线性注意力 arXiv:2608.12149 候选第 1 件)
paper_cards 8-14 净增 68 张 ≈ 4.4 张/h(v46 沿用 + 920 PLDR-LLM/PLGA llm-infra 主分类已落档 + 934 SkillZip 副分类 llm-infra / 946 SKILLER 副分类 llm-infra / 947 LLMRouter 主分类 evaluation = 4 张与 llm-infra 邻接,其余 64 张集中在 agent/multimodal/rag/evaluation)
tom inference-e1prep 8-14 主棒 缺位 第 1 日延续(8-13 22:22 兑现 → 8-14 evening 棒前未兑现 · 缺位延续)


0. 综述判断

本场 24h 窗口对 llm-infra 主轴而言属于 低密度延续棒:8-13 evening spark 4 件 net-new(PLDR-LLM/Bole/AcceptMoE/AOSpec)已被 §IX 46 完整吸纳并升级主轴,8-14 严格意义上的 net-new 论文只有 1 件(arXiv:2608.12149 混合线性注意力 LLM 大幅值激活,§1.(8) 稀疏注意力邻接候选,paper_card P1 缺口未建),其余增量都是 8-13 已入主轴条目在工程实践 / 版本号 / 数字细节层面的横向深耕——jay 8-14 全天 10+ 件主力棒围绕 llm-infra 主轴展开(inference-agent-rag-engineering / csdn-inference-stack-substack-research / five-category-briefing 1130 / five-category-briefing 1505 / csdn-inference-rag-quantization-highvalue 1620 / inference-vector-rag-k8s 1336 / ai-agents-stack-2026-substack 1735 / engineering-e1prep / database-backend-cloudnative),为 §IX 46 主轴补充了精确版本号(vLLM 0.19、llm-d CNCF v0.7、SGLang v0.4.6.post2、vLLM v0.8.5)、实测数字(阿里云函数计算压测 / vLLM GPU crash rate 0.95→100% / HotInfra Memory-Centric CXL+PIM 32K tokens 2.4×吞吐 20.6× CapEx)、新发布(vLLM 原生 transformers 后端 8-14 HF Blog / TGI 维护模式 8-14 再次官方确认)、新生态(Alice Labs Top 10 Agent 框架评分 Aug 2026 / AI Agents Stack 2026 六层框架 Substack / TIS 2.0 消除 RAG 位置偏差 +12.5% 推测解码加速 / C2KV KDD 2026 跨请求 KV 复用)。

更重要的 结构性信号:jay 8-14 主消化已明确把 KV Cache / 推理引擎 / Agent 框架 三大子轴纳入 five-cat 与 ai-agents-stack 双棒体系,意味着本主题活文档的「端侧跨棒消化」机制(jay 主力棒 + spark 主棒 + tom inference 副棒 + flyp multimodal 邻接 + stephen ai-industry 邻接)已经在 8-14 演化出 「jay 主力棒独自承担主消化职责」 的新型分工——spark 主棒 8-14 evening 是 侧翼备料 而非主消化。本棒只给候选升档与细节补丁,不开新主轴

本场净增量:1 件严格 net-new(arXiv:2608.12149 §1.(8) 邻接候选)+ 1 件工程生态新发布(vLLM 原生 transformers 后端 HF Blog 8-14)+ 6 件细节补丁(vLLM 0.19 / llm-d v0.7 / HotInfra Memory-Centric 详细数字 / C2KV KDD 2026 / 阿里云函数计算压测版本号 / vLLM GPU crash rate)+ 3 件框架补充(AI Agents Stack 2026 六层框架 / TIS 2.0 / LLMRouter 路由 formalism)共 11 条候选。其中可独立承接的「主轴级」候选 = 1 件(vLLM 原生 transformers 后端,重大生态进展),其余均为邻接 / 细节。


1. 核心增量(1 主轴级 + 10 邻接 = 11 条)

增量 1【稀疏注意力 · §1.(8)】🟡 arXiv:2608.12149 混合线性注意力 LLM 大幅值激活 —— §1.(8) 邻接候选第 1 件 ★★★

来源inbox/jay/2026-08-14-1001-rss-cool-papers.md(Cool Papers cs.CL RSS 摘要,2026-08-14 10:01)+ inbox/stephen/2026-08-14-ai-industry-e1prep.md §2.10(推理引擎立基础延展候选第 1 件)+ inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md §4(systems 维度覆盖确认)

arXiv2608.12149(Massive Activations in Hybrid Linear Attention LLMs: Pre-Attention Spikes and Inter-Spike Plateaus,Zunhai Su 等,2026-08-14 新提交 cs.LG;paper_card P1 缺口未建

要点: - 问题域:层间交错 Hybrid Linear Attention(HLA)LLM 中的 Massive Activation(MA)现象缺乏系统研究。 - 核心发现:在层间交错架构中 MA 展现两种与架构对齐的形态 —— Pre-Attention Spikes(PAS,注意力前尖峰) + Inter-Spike Plateaus(峰间平台)。MA 在进入 full attention 层之前一致出现尖峰,且在层间呈现平台期。 - 方法学意义:与 Mamba-3 / Linear Attention Survey / Hybrid SSM(§1.(8) 现有脉络)的"架构层"研究互补,转向"激活层"的层间交错现象学。 - 不确定性:作为 arXiv 2026-08-14 当日新提交,论文级 arXiv ID 已确认但 paper_body 未精读;Methodology 章节是否覆盖多模型 / 多精度对照尚未核对。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(8) 稀疏注意力 · Linear Attention · Mamba-3 · Hybrid SSM:现有脉络 = NSAttention / HCA / CSA 7 路线 + Hierarchical Landmark 90%@64× + Linear Attention Survey + Simplified Sparse Attention + Mamba-3 ICLR 2026 + Nemotron 3 Super + Soofi S + Sparse Delta Memory + LoopCoder-v2 + KernelSight-LM + Hybrid SSM + PLDR-LLM/PLGA 8-13 立标饱和。 - 本增量 = §1.(8) 立基础延展第 1 件:从「架构层」研究(NSAttention/HCA/Mamba-3)扩展到「激活层」研究(MA 的 PAS + Inter-Spike Plateaus),是 §1.(8) 注意力变体池的横向细化而非范式突破。 - 与 §1.(8) 中 PLDR-LLM/PLGA 邻接:PLDR-LLM/PLGA 是「双线性算子替代固定 SDPA」,arXiv:2608.12149 是「双线性算子(G_LM)+ 全注意力 + 线性注意力的层间交错激活行为」,两者共享「非常规注意力原语」邻接族。

建议归入节§1.(8) 邻接候选第 1 件(稀疏注意力 / Linear Attention 激活层细化);§1.(13) 边界扩展 42 子轴邻接新增候选;paper_card P1 缺口必建。


增量 2【推理引擎生态 · §1.(1) + §1.(11)】🟡 vLLM 原生 transformers 后端(HF Blog 2026-08 新发布) —— 重大生态进展:450+ 架构通过 transformers 一致暴露 ★★★★

来源inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §二 · BACKEND 2.1 + HF Blog https://huggingface.co/blog/native-speed-vllm-transformers-backend(2026-08)

arXiv:无(HF Blog 官方发布 + 工程集成)

要点: - 核心创新:transformers 库新增 vLLM 原生推理后端,新模型一旦集成 transformers,即可获得 vLLM 原生实现速度。 - 过去/现在对比: - 过去:模型作者需要分别为 transformers 与 vLLM 各写一次实现(Custom CUDA kernel)。 - 现在:transformers 动态应用 inference-specific layer fusions,运行时匹配 custom 实现速度。 - 覆盖范围:450+ 架构通过 transformers API 一致暴露,vLLM 共享这些实现。 - 生态溢出:SGLang / TensorRT-LLM 等其他推理引擎也会从此受益(vLLM 实现成为 transformers 原生接口的事实标准)。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(1) 推理引擎 6 寡头 + 2+1+1:现有脉络 = vLLM / SGLang 双栖 + TGI 维护 + MAX + TensorRT-LLM 后端 PyTorch 化 + Qwen3.8-27B Yotta Labs day-0 + Muse Glimmer + LFM2.5-2.6B + Apple ANE Orion。 - 本增量 = §IX 47 轮 §1.(1) 推理引擎生态结构变化第 1 件:vLLM 不再仅是独立推理引擎,而成为 transformers 的 native backend,标志 vLLM 生态位从「高性能推理引擎」升级为「transformers 的官方推理加速层」。 - 与 §1.(11) Kernel/AI 自动化/Harness:vLLM 原生后端意味着 inference-specific layer fusion 由 transformers 自动选择,与 KernelSight-LM / Atrex-Bench / Fable 18.71× / Harness for Kernel / TELLER ASE 2026 / μCUTLASS DSL 等 kernel 自动化方向邻接 —— transformer 层融合从人工 CUDA kernel 走向运行时动态调度。 - 与 §1.(7) 推理经济学 32 件套:vLLM 后端复用降低 450+ 架构的适配成本,间接降低推理工程的「模型 → 生产」总成本。

建议归入节§1.(1) 推理引擎 6 框架矩阵沿用 + 生态结构升级 1 件;§1.(11) Kernel/AI 自动化邻接;§1.(13) 边界扩展 42 子轴 +1。


增量 3【KV Cache · §1.(3)】🟡 C2KV KDD 2026 跨请求 KV Cache 复用 + Memory-Centric HotInfra 2026 CXL+PIM 详细数字 —— §1.(3) 第 12 路线 + 第 11 路线数字补丁 ★★★

来源inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §一 · DATABASE 1.1 + 1.2

arXiv2607.17715(C2KV: Compressed and Composable KV Cache,KDD 2026 Jeju Island)+ HotInfra 2026 final59.pdf(PIM-DIMM Memory-Centric,URL 沿用 §IX 45 修订方案 B 替代锚)

要点: - C2KV 核心机制:在 Llama-3.1-8B / Qwen-2.5-7B 上的 GovReport / HotpotQA / MultiNews 等数据集验证,跨请求 KV Cache 压缩可组合复用。关键工程价值:与 vLLM PagedAttention 互补(PagedAttention 解决单请求内分配,C2KV 解决跨请求复用)。 - Memory-Centric CXL+PIM 32K tokens 生成场景实测数字: - 吞吐量:CXL+PIM 1,607 tok/s vs GPU HBM 679 tok/s = 2.4×↑ - CapEx:CXL+PIM $27,664 vs GPU $570,000 = 20.6×↓ - OpEx:CXL+PIM $3.53/hr vs GPU $59.23/hr - 架构:Prefill 在 GPU HBM,Decode 在 CPU + CXL DDRx,KV Cache 通过 CXL 共享内存互联。 - 理论基础:引用 Mooncake(USENIX FAST 2025)的 KVCache 中心化解聚架构。

警示(jay 8-14 engineering-e1prep §三 / stephen 8-14 1245 noon §PIM-DIMM AI 幻觉条目 8 文件登记已沿用):PIM 硬件生态尚未成熟(Samsung PIM-DIMM),32K tokens 单一场景 benchmark 不能跨场景泛化。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(3) KV Cache 12 路线延展矩阵:现有脉络 = HiSparse + OasisKV + Persistent Q4 KV Cache + TokenDance + PIM-DIMM 第 11 路线 + DeepSeek V4-Pro 9× KV + iFAN 第 7 路线。 - C2KV = §IX 47 轮 §1.(3) 跨请求复用第 13 路线候选(与 C2KV 工程价值 = §1.(3) 第 13 路线候选),与 §IX 45 轮 KVpop 预测式 KV 逐出(arXiv:2607.05061 keep-or-drop 75%/88%)邻接:KVpop 是"逐出哪些",C2KV 是"复用哪些"。 - Memory-Centric HotInfra 2026 = §IX 47 轮 §1.(3) PIM-DIMM 第 11 路线数字补丁(已立标,数字细节补充):原 §IX 45 已记 PIM-DIMM 第 11 路线 + 1/20× CapEx + 1/17× OpEx + 2.4× 吞吐,§IX 47 提供精确 CapEx/OpEx 美元数字($27,664 vs $570,000;$3.53/hr vs $59.23/hr)。

建议归入节§1.(3) KV Cache 12 路线 → 13 路线候选(C2KV 跨请求复用)+ PIM-DIMM 第 11 路线数字补丁。


增量 4【推理引擎版本号 · §1.(1)】🟡 vLLM 0.19 Model Runner V2 + P-EAGLE + llm-d CNCF v0.7 EPD 分解 —— vLLM 0.17→0.19 升级路径细节补丁 ★★★

来源inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md §二 · 2.1 State of Model Serving Communities April 2026(InferenceOps Substack,Yuan Tang / Red Hat AI)+ inbox/jay/2026-08-14-inference-agent-rag-engineering.md §4

arXiv:无(InferenceOps Substack + GitHub release notes)

要点: - vLLM v0.17→v0.19 关键进展: - Model Runner V2:模块化架构重构,CUDA graph dispatch 重写 - P-EAGLE(Parallel Speculative Decoding):Eagle3 支持的并行推测解码 - KV Cache Offloading:FlexKV offloading backend + reuse-frequency-gated CPU stores - 新架构:Gemma 4(MoE/多模态/推理/tool-use)+ Sarvam MoE + OLMo Hybrid + ColPali - gRPC serving(--grpc flag):GPU-less Render Serving,多模态预处理与 GPU 推理分离 - NGram GPU Speculative Decoding:兼容 async scheduler - FlashAttention 4 集成 + FlashInfer 0.6.6 - DBO(Dual-Batch Overlap)泛化到所有模型 - 周安装量 ~1M/周 → ~2M/周(2026-03,InferenceOps 数据) - llm-d CNCF Sandbox v0.7: - KV cache memory 降低 50-60%(GDS GPUDirect Storage 支持) - EPD(Encode/Prefill/Decode)分解支持 + KV cache enablement 初始支持 - Pure Go ZMQ 实现:消除 CGO 依赖 - 新指标 disagg_decision_total - EPP(Endpoint Picker)代码迁移到 llm-d-inference-scheduler(2026-04-20 起) - KServe v0.17.0: - WVA/KEDA/HPA 集成:LLMInferenceService 生产级 autoscaling - OpenAI Responses API 支持(/v1/responses HTTPRoute) - llm-d 升级到 0.6,vLLM 升级到 0.17.1 - Namespace-scoped ModelCache

警示(jay 8-14 engineering-e1prep §三):vLLM 周安装量 1M→2M 数据来自 InferenceOps Substack(Red Hat AI 团队),厂商报告可能有选择性呈现;建议对照 PyPI 下载量独立核实。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(1) 推理引擎 6 寡头 + 2+1+1:现有脉络 = vLLM/SGLang 双栖 + TGI 维护 + MAX + TensorRT-LLM + Qwen3.8-27B day-0 + Muse + LFM2.5 + Apple ANE Orion + vLLM-mlx。 - 本增量 = §IX 47 轮 §1.(1) vLLM 0.17→v0.19 升级路径精确细节补丁:§IX 45 轮已记 vLLM 0.17→v0.19 Model Runner V2 子集,§IX 47 补充 P-EAGLE 算法原理细节 + EPD 分解作为 PD Disaggregation 的一种实现路径 + llm-d 0.7 KV cache 50-60% 降低 + KServe v0.17.0 LLMInferenceService autoscaling。 - 与 §1.(2) 推理调度 9 学派 WRP 升档:vLLM 0.19 P-EAGLE + llm-d EPD 分解 → 共同指向 PD Disaggregation 的工程落地加速;与 §1.(11) Kernel/AI 自动化/Harness:vLLM 0.19 DBO 泛化 + NGram GPU Speculative Decoding 兼容 async scheduler = kernel/调度自动化。

建议归入节§1.(1) 推理引擎 6 框架矩阵沿用 + vLLM 0.17→0.19 精确补丁 + llm-d 0.7 + KServe 0.17;§1.(2) WRP 升档邻接(P-EAGLE + EPD 分解共同指向 PD Disaggregation 工程落地)。


增量 5【推理引擎实测 · §1.(1) + §1.(7)】🟡 阿里云函数计算 SGLang vs vLLM 压测版本号 + vLLM GPU 内存 crash rate —— 推理引擎生产实测 ★★★

来源inbox/jay/2026-08-14T1620-jay-csdn-inference-rag-quantization-highvalue.md 条目 2 + inbox/jay/2026-08-14-inference-agent-rag-engineering.md 条目 3

arXiv:无(阿里云官方压测文档 + AIMultiple H100 实测 + GitHub vLLM Discussion #17221)

要点: - 阿里云函数计算 SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5 压测: - QWen-QWQ-32B-AWQ:单卡 ~35 tokens/s,双卡 TP 并行 ~50 tokens/s,建议最大并发 ≤ 5 - QWen-QWQ-32B:双卡 ~20 tokens/s(Ada 单卡显存不足) - SGLang vs vLLM:SGLang 在 TTFT/TPOT/Throughput 多数场景优于 vLLM;SGLang 启动速度比 vLLM 快约 30% - 显存利用率:两者启动后均接近 100%(模型参数 + KV Cache);SM 利用率 100%(推理时)/ 0%(空闲) - 多卡收益:模型越大 TP 并行收益越明显(20%~50%) - 压测工具:evalscope(魔搭开源) - vLLM GPU 内存 crash rate(AIMultiple H100 80GB HBM3 / CUDA 12.8.1 / PyTorch 2.8.0 / vLLM 0.11.0): - gpu_memory_utilization 0.95 → 100% crash rate - gpu_memory_utilization 0.90 → 30% crash rate - gpu_memory_utilization 0.80 → 0% crash rate - 生产建议:0.8 是安全区边界,0.9 需配合监控 - A10 24GB Qwen2.5-7B 实测:SGLang 占用 7GB VRAM,vLLM 占用 21GB(根因:SGLang 惰性 KV 分配 vs vLLM 预分配;vLLM 默认 gpu_memory_utilization=0.9) - vLLM 调优命令vllm serve qwen2.5-7b --gpu-memory-utilization 0.3 --max-model-len 2048 --max-num-seqs 8

警示(jay 8-14 engineering-e1prep §三):A10 是 24GB 卡,与主流 H100 80GB 显存条件不同;A10 结论不一定适用于 H100。引用为 A10 GPU 场景数据;H100 场景引用其他来源(InfraTech / AIMultiple)。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(1) 推理引擎 6 寡头 + 2+1+1:现有脉络 = vLLM/SGLang 双栖 + Q2 Benchmark(§IX 46 §1.(1) 增量)+ TGI 维护 + MAX + TensorRT-LLM。 - 本增量 = §IX 47 轮 §1.(1) 推理引擎实测数据细节补丁:阿里云函数计算精确版本号(SGLang v0.4.6.post2-cu124 / vLLM v0.8.5 / CUDA 12.4 / Ada GPU / evalscope 压测工具)+ vLLM GPU crash rate 0.95/0.90/0.80 三档实测 + A10 24GB Qwen2.5-7B SGLang 7GB vs vLLM 21GB 根因(惰性 KV vs 预分配)。 - 与 §1.(7) 推理经济学 32 件套:阿里云压测数据补充 §IX 46 新浪财经四步降本路径($100→$5/百万 token)的实测细化;与 §1.(13) 边界扩展 42 子轴邻接。

建议归入节§1.(1) 推理引擎框架矩阵精确版本号补丁 + SGLang vs vLLM 决策树 2026-08 版本沿用;§1.(7) 推理经济学实测细化。


增量 6【Agent 框架 · §1.(5)】🟡 AI Agents Stack 2026 六层框架(Substack)+ Alice Labs Top 10 框架评分 8-14 —— §1.(5) 框架结构升级 ★★★

来源inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md §一 + §三 + inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §三 · CLOUD-NATIVE 3.1

arXiv:无(The AI Engineer Substack + Alice Labs 行业评分)

要点: - AI Agents Stack 2026 六层架构(替代 Letta 2024-11 旧版): - L1 Model Serving:API / managed open-weight / self-hosted - L2 Memory:跨多步执行和跨会话的状态持久化(Temporal scope × Representational substrate × Control policy 三维) - L3 Tool Access:MCP(2024 后新增标准化层) - L4 Agentic Reasoning:ReAct / CoT / 单步推理模型(o1 / R1 / Claude extended thinking) - L5 Evaluation:evals + tracing + 回归检测(三层评估体系:PR 级快速检查 / 夜间回归套件 LLM-as-Judge / 生产持续监控) - L6 Guardrails:从 2024 输入/输出过滤器升级为 2026 行动授权层(授权工具调用 + 强制速率限制 + 验证 Agent 实际行为) - 三大驱动因素(2024→2026): 1. MCP 标准化工具连接 2. 推理模型改变 Agent 自主性(单步 Agent 可完成此前需要多步链路的任务) 3. Memory 成为一等架构原语 - 三维评估框架:State Management Complexity × Vendor Lock-in Risk × Demo→Production Gap - Alice Labs Top 10 Agent 框架生产评分(Aug 2026 · 100+ 真实生产部署): - LangGraph 1.x:9/10(状态管理 + 生产控制) - Claude Agent SDK:9/10(沙箱执行 + MCP 原生) - Microsoft Agent Framework 1.0:高(企业级 + MCP/A2A 两协议原生) - Google ADK 2.0:高(A2A 原生 + GCP 深度集成) - OpenAI Agents SDK:中高(原生 MCP 2026-04,无 A2A) - CrewAI 1.14.7:中(角色模型直观,2-4h 上手) - Pydantic AI 2.0:中(类型安全 + 验证驱动) - Mastra / AG2 / LlamaIndex Workflows 1.0:中 - Gartner(June 2025):2027 年底前 40% Agentic AI 项目将因成本和风险控制不足而取消

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(5) Agent 框架 6 层架构 + MCP 1.7.0:现有脉络 = 6 层架构 + MCP 1.7.0 + Agent 工程化方法论 5 件套 + HF 7 月事件 + Black Hat + Agentic Attacker。 - 本增量 = §IX 47 轮 §1.(5) Agent 框架结构升级第 1 件:六层架构从 Letta 2024-11 旧版升级到 The AI Engineer 2026 版(核心变化:MCP 标准化层从无到有、推理模型驱动单步 Agent、Memory 成为一等架构原语);Alice Labs 评分 = §1.(5) 框架选型数据补充(LangGraph 9/10 / Claude Agent SDK 9/10 双头)。 - 与 §1.(5) MCP 1.7.0 + A2A 协议:六层架构中 L3 Tool Access = MCP + L4 Agentic Reasoning = A2A 协同沿用。 - 与 §IX 46 §3.1 C159:推测解码 3 件套 + Bole hybrid-attention 邻接 + AOSpec Agent 工具调用推测解码新范式 = §IX 47 L4 Agentic Reasoning 邻接(AOSpec action-observation 联合推测)。

建议归入节§1.(5) Agent 框架 6 层架构 2026 版升级 + Alice Labs 框架评分补充。


增量 7【推测解码 + RAG · §1.(1) 邻接】🟡 TIS 2.0 消除 RAG 位置偏差 +12.5% 推测解码加速 —— RAG × 推测解码交叉 ★★

来源inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md §三

arXiv:无(HF Forum 2026-08-13 + HF TGI 集成)

要点: - 核心问题:RAG 检索到的上下文片段在 prompt 中的位置(开头/中间/结尾)会显著影响 LLM 输出质量,标准化排序后位置偏差仍存在。 - TIS 2.0(Token Importance Scoring v2):对检索到的上下文片段进行 token 级别重要性评分(per-passage relevance scoring + RMSNorm output stabilization + InfoNCE contrastive training on passage pairs)。 - 关键发现:即使将相同 passage 集合转换为相同标准顺序(canonical order),原始的"开头/中间/结尾"槽位效应仍然存在。简单的确定性策略可以消除对原始槽位的依赖,但 canonical order 本身是否有用仍待研究。 - 与推测解码的结合(LLaMA-3.1-8B target + LLaMA-3.2-1B drafter,n=30): - No TIS:Accept Length 5.80/8,Speedup 0.644 - TIS depth-scaled:Accept Length 6.57/8,Speedup 0.730 = +12.5%

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(1) 推理引擎 §1.(1) 邻接 + §1.(7) 推理经济学 32 件套:现有脉络 = 推测解码 3 件套 Bole/AcceptMoE/AOSpec + PLDR-LLM/PLGA 8-13 立标饱和。 - 本增量 = §IX 47 轮 推测解码 × RAG 交叉候选第 1 件:TIS 2.0 把 RAG 位置偏差与推测解码 drafter 接受率打通,是「RAG 优化 → 推测解码优化」的横向连接。 - 与 §IX 46 §1.(1) AOSpec:AOSpec 是 action-observation 联合推测(Agent serving),TIS 2.0 是 drafter 接受率位置偏差(RAG serving),两者都是推测解码的「输入侧优化」扩展。

建议归入节§1.(1) 推理引擎 推测解码邻接新增候选 + §1.(5) Agent 框架 RAG 评估邻接。


增量 8【推理调度 · §1.(2) 邻接】🟢 LLMRouter arXiv:2608.06867 路由 formalism 五组件 —— 路由调度框架细化 ★★

来源inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md #3 + inbox/tom/_candidates/2026-08-14-agent-rag-longcontext-candidates.json + paper_card 947-2608-06867(主分类 evaluation,2026-08-14 16:30 落盘)

arXiv2608.06867(LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers,主分类 evaluation,paper_card 947 已建)

要点: - 核心问题:单一 LLM 不可能在所有 query × 预算约束下最优,模型路由是成本高效部署的关键。现有路由器采用不同公式化与实现,难以公平对比与扩展。 - 统一公式化:把 LLM 路由建模为序贯决策过程,含五组件: 1. Context Encoders(上下文编码器) 2. Model Encoders(模型编码器) 3. Scoring Functions(评分函数) 4. Decision Rules(决策规则) 5. Learning Signals(学习信号) - 覆盖范围:单轮 / 多轮 / 个性化路由。 - 自动化 pipeline:基于该公式化构建自动化训练 / 评估 pipeline。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(2) 推理调度 9 学派 WRP 升档:现有脉络 = WRP 第 10 学派 + iFAN 第 7 路线 + 98× faster routing arXiv:2603.12646 + Token-Budget-Aware Pool routing + OATS Outcome-Aware Tool Selection + Compress-and-route + State-Matched Routing arXiv:2608.05219 + LongHorizon-Harness 三层路由体系(LAAR / State-Matched / AMPD)。 - 本增量 = §IX 47 轮 §1.(2) 路由 formalism 横向细化候选第 1 件:WRP 第 10 学派已立标为「Workload × Router × Pool 三维协同系统级调度」,LLMRouter 提供统一公式化五组件作为实验基础,与 §IX 45 同团队 4 件关联成果(98× faster + Compress-and-route + Token-Budget-Aware + OATS)形成「WRP 框架 ↔ 路由 formalism」横向连接。 - 与 §1.(2) §IX 46 沿用:D65 推理调度实测可行性 + 落地边界待核清单邻接。

建议归入节§1.(2) 推理调度 9 学派 WRP 升档沿用 + LLMRouter 路由 formalism 横向细化。


增量 9【HF Daily 立标信号 · §1.(4)】🟢 HF Daily 8-14 4 件 agent 主分类 net-new + ComBodied Agents 181▲ 续立加强 —— §1.(4) 立标信号邻接 ★★

来源inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md 15 篇精选 + inbox/stephen/2026-08-14-1245-stephen-coordination-check-noon.md 当日覆盖完整度 ★★★★★ + paper_cards 8-14 净增 68 张 ≈ 4.4 张/h(反弹延续)

arXiv2608.00677(OpenART 184▲ #1)/ 2608.10915(ComBodied Agents 181▲ #2 续立)/ 2608.11924(Spark-to-Paper 176▲ #3)/ 2608.10744(Beyond Pixels / Latent-to-4D 171▲ #4)/ 2608.10299(Co-Evolution 124▲ #5)/ 2608.12307(AI4AI Harness 99▲ #6)/ 2608.12036(Mechanist 75▲ #7)/ 2608.05604(SkillZip 72▲ #8 副分类 llm-infra)/ 2607.27749(Articulated Object 44▲ #9)/ 2608.07645(Mendel Gödel Machine 26▲ #10 续立)/ 2608.12314(StateFlow 23▲ #13)/ 2608.10875(VibeLifeBench 17▲ #14 续立)/ 2608.10720(Ex-Omni-2D 15▲ #15)

要点: - 8-14 HF Daily 立标信号 v33 以来历史新高候选第 2 日: - OpenART 184▲ #1:Agent red-teaming benchmark SOTA,承接 flyp 8-13 risk-e1prep 增量 2;v45 §2.193 frontier lab 隐含推理风险第 25 栖延展候选。 - ComBodied Agents 181▲ #2:8-13 173▲ → 8-14 181▲ = +8▲ 续立;与 §IX 46 Stealing Reasoning Traces 86▲ 邻接。 - Mendel Gödel Machine 26▲ #10:8-13 22▲ → 8-14 26▲ = +4▲ 续立;与 §IX 46 §1.(6) Agent 自改进沿用。 - SkillZip 72▲ #8 副分类 llm-infra:8-13 7 票 → 8-14 72▲ 反弹;主分类 agent / 副分类 llm-infra paper_card 934 已建。 - VibeLifeBench 17▲ #14:8-13 15▲ → 8-14 17▲ 续立;与 §IX 46 §1.(4) 立标候选沿用。 - 8-14 vs 8-13 立标信号对比: - OpenART 184▲(8-14 #1)vs BDH-CQ 553▲(8-13 #1, 8-14 跌出 top 15)= 立标信号瞬时峰值反弹 / 衰减锚 24h 窗口实测第 1 例 - 立标饱和度机制 v45 "立标信号强度 ≠ 立标等级评估" 双维度区分首次机制化 v33 以来首次

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(4) 服务层并发安全 13+1 类风险候选 + HF Daily 8-13 BDH-CQ 553▲ 邻接:现有脉络 = KV-Cache Sharing Timing Side-Channel + WRP silent drift detection + Stealing Reasoning Traces 86▲ 立标候选 1 件。 - 本增量 = §IX 47 轮 §1.(4) HF Daily 立标信号邻接延续:OpenART 184▲ #1 = §IX 47 立标信号延续(红队 Agent 邻接 risk 主轴)+ ComBodied Agents 181▲ #2 + Mendel Gödel Machine 26▲ #10 + VibeLifeBench 17▲ #14 续立加强。 - 与 §3.2 #91-#94 反方候选沿用:立标饱和度机制 v43"三态切换机制" + v45 "立标信号强度 ≠ 立标等级评估"双维度区分首次机制化沿用。

建议归入节§1.(4) HF Daily 8-14 立标信号延续 + 反方 #91-#94 候选沿用 + paper_cards 8-14 净增 68 张 ≈ 4.4 张/h 反弹延续。


增量 10【推理工程学 · §1.(12)】🟢 paper_cards 8-14 净增 68 张 ≈ 4.4 张/h + 920/934/946/947 llm-infra 邻接 4 张 —— 推理工程学第 9 维 32 件套沿用 ★

来源paper_cards 920-2608-10288.md(PLDR-LLM/PLGA 主分类 llm-infra 8-13 落盘)+ paper_cards 934-2608-05604.md(SkillZip 主分类 agent 副分类 llm-infra 8-14 落盘)+ paper_cards 946-2608-10538.md(SKILLER 主分类 agent 副分类 llm-infra 8-14 落盘)+ paper_cards 947-2608-06867.md(LLMRouter 主分类 evaluation 8-14 落盘)

arXiv2608.10288 / 2608.05604 / 2608.10538 / 2608.06867

要点: - paper_cards 8-14 净增 68 张 ≈ 4.4 张/h: - 8-14 净增 68 张 vs 8-13 净增 20 张 = 3.4× 加速 vs v45 3.25 张/h = 1.35× 反弹延续 - 总规模 919 → 987 张 ≈ +68 张 - 与 llm-infra 邻接的 4 张: - 920 PLDR-LLM/PLGA arXiv:2608.10288:主分类 llm-infra,§IX 46 §1.(8) 沿用 - 934 SkillZip arXiv:2608.05604:主分类 agent / 副分类 llm-infra(Agent Skill Library 图压缩,技能抽取 token budget 优化) - 946 SKILLER arXiv:2608.10538:主分类 agent / 副分类 llm-infra(小型 LM 语言级 RL 抽取可复用 Agent Skill,消费级 GPU 可训) - 947 LLMRouter arXiv:2608.06867:主分类 evaluation(路由 formalism 5 组件,与 §1.(2) 推理调度 WRP 横向细化邻接)

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(12) Pipeline (vii) Eval + Inference Engineering 32 件套:现有脉络 = §IX 46 §1.(7) 31 → 32 件套扩面(推测解码 3 件套 + PLDR-LLM/PLGA + 新浪四步降本)。 - 本增量 = §IX 47 轮 §1.(12) Pipeline (vii) 32 件套沿用 + paper_cards 8-14 净增 68 张 ≈ 4.4 张/h 反弹延续 + llm-infra 邻接 4 张副分类补充。 - 与 §4 开放问题 O275:8-13 立标池饱和度反弹沿用 + 反思棒第 11 次强制兑现棒 + tom inference-e1prep 8-13 兑现终结连续 4 日缺位。

建议归入节§1.(12) Pipeline (vii) 32 件套沿用 + paper_cards 8-14 反弹延续 + llm-infra 邻接 4 张副分类补充§4 O275 立标池饱和度反弹沿用。


增量 11【HF Blog 生态 · §1.(1) 邻接】🟢 TGI 维护模式 8-14 再次官方确认 + Hugging Face Inference Endpoints vLLM 集成更新 —— §1.(1) 推理引擎 6 框架矩阵立标饱和确认 ★

来源inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §二 · BACKEND 2.2 + 2.4 + inbox/jay/2026-08-14-inference-vector-rag-k8s.md §1

arXiv:无(HF 官方文档 + GitHub README)

要点: - TGI 维护模式 8-14 官方再次确认:HF 官方文档明确将 TGI(Text Generation Inference)描述为 "maintenance mode",新部署应比较 vLLM / SGLang / 其他当前引擎;TGI 剩余价值 = 长尾 transformers 兼容架构支持 + Prometheus + OTel + gRPC 生产就绪。 - Hugging Face Inference Endpoints vLLM 集成:支持 data_parallel_size + tensor_parallel_size 分布式推理配置;支持 vLLM 与 transformers 两种后端在 Inference Endpoints 上切换。

与活文档 §IX 46 轮现有脉络的关系: - 写入 §1.(1) 推理引擎 6 寡头 + 2+1+1:现有脉络 = §IX 45 TGI 维护模式 8-12 立标饱和确认 + 推理引擎 6 框架矩阵立标饱和。 - 本增量 = §IX 47 轮 §1.(1) TGI 维护模式 8-14 再次官方确认 + Inference Endpoints vLLM 集成更新 = 推理引擎 6 框架矩阵立标饱和确认

建议归入节§1.(1) TGI 维护模式沿用 + 推理引擎 6 框架矩阵立标饱和确认。


2. 矛盾或待核实说法(精选)

# 说法 风险 建议
1 vLLM 原生 transformers 后端(HF Blog 2026-08 新发布) HF 官方博客属于官方发布,但实际性能数据未在博客中详列;"运行时匹配 custom 实现速度"的具体 benchmark 待核 引用为生态重大进展,标注来源;建议实测长序列 P95 延迟对照
2 C2KV 跨请求 KV Cache 复用(KDD 2026, arXiv:2607.17715) 论文已在 KDD 2026 发表( Jeju Island 8-09~13),但 vLLM / SGLang 官方集成情况未披露 引用为 KDD 2026 论文,标注同伴评审;建议关注官方集成或参考实现
3 Memory-Centric HotInfra 2026 CXL+PIM 32K tokens 2.4× 吞吐 / 20.6× CapEx 降低 PIM 硬件生态不成熟(Samsung PIM-DIMM);32K tokens 单一场景 benchmark 不能跨场景泛化 引用方向(CXL+PIM 是有前景的新方向),不引用精确倍数的跨场景泛化;需待更多硬件平台验证
4 vLLM 周安装量 ~1M/周 → ~2M/周(2026-03,InferenceOps) 数据来源为 InferenceOps Substack(Red Hat AI 团队),厂商报告可能有选择性呈现 引用为行业趋势信号,标注来源;需对照 PyPI 下载量独立核实
5 vLLM GPU 内存 crash rate 0.95→100% / 0.9→30% / 0.8→0% 实测环境为 H100 80GB HBM3 / CUDA 12.8.1 / vLLM 0.11.0;不同硬件 / 版本可能不一致 引用为 H100 + vLLM 0.11.0 场景数据;其他场景需独立测试
6 SGLang 7GB VRAM vs vLLM 21GB(A10 24GB Qwen2.5-7B) A10 是 24GB 卡,与主流 H100 80GB 显存条件不同;A10 结论不一定适用于 H100 引用为 A10 GPU 场景数据;H100 场景引用其他来源(InfraTech / AIMultiple)
7 TIS 2.0 +12.5% 推测解码加速 实验规模 n=30;只在 LLaMA-3.1-8B target + LLaMA-3.2-1B drafter 上验证;不同 drafter 配对可能不一致 引用为推测解码 × RAG 交叉候选,标注 n=30;建议实测本机构 drafter 配对
8 LLMRouter 路由 formalism 五组件 论文主分类 evaluation,副分类无;与 WRP 第 10 学派的"是否同源"未直接证明 引用为路由 formalism 横向细化候选,标注主分类 evaluation;建议与 §IX 45 同团队 4 件关联成果对比
9 arXiv:2608.12149 混合线性注意力 LLM 大幅值激活 2026-08-14 当日新提交 cs.LG;paper_body 未精读;Methodology 章节覆盖模型 / 精度对照尚未核对 引用为 §1.(8) 稀疏注意力邻接候选;建议 paper_card 必建 + 方法学章节精读
10 Alice Labs 100+ 真实生产部署 Alice Labs 评分属于行业评测,方法论披露有限;评分基于的"100+ 真实生产部署"具体构成未公开 引用为框架选型参考数据,标注来源;建议交叉对照其他评测

3. 可引用 arXiv 号列表(精选 · llm-infra 主轴 + 邻接)

arXiv 号 标题(简) 相关节 状态
2608.12149 混合线性注意力 LLM 大幅值激活:注意力前尖峰与峰间平台(HLA / cs.LG) §1.(8) 稀疏注意力邻接 🆕 今日 net-new 唯一严格主轴候选 · paper_card P1 缺口未建
2607.17715 C2KV: Compressed and Composable KV Cache(KDD 2026) §1.(3) KV Cache 13 路线候选 KDD 2026 已发表 · 待官方集成
2608.05604 SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries §1.(12) Pipeline (vii) 32 件套沿用 + paper_cards 934 副分类 llm-infra 已建
2608.10538 SKILLER: Language-Level RL for Reusable Skill Extraction in Small LMs §1.(12) Pipeline (vii) 32 件套沿用 + paper_cards 946 副分类 llm-infra 已建
2608.06867 LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers §1.(2) 推理调度 9 学派 WRP 横向细化 主分类 evaluation · paper_cards 947 已建
2608.10288 PLDR-LLM / PLGA: Power Law Graph Attention §1.(8) 稀疏注意力沿用(§IX 46) 主分类 llm-infra · paper_cards 920 已建
2608.01651 Bole: Hybrid-attention Tree Speculation §1.(1) 推测解码沿用(§IX 46) 沿用 §IX 46
2608.02989 AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets §1.(1) 推测解码沿用(§IX 46) 沿用 §IX 46
2608.00881 AOSpec: Action and Observation Co-Speculation §1.(1) 推测解码沿用(§IX 46) 沿用 §IX 46
2601.19139 vLLM-mlx: Apple Silicon 原生推理 4.3× llama.cpp §1.(1) 沿用(§IX 46) 沿用 §IX 46
2603.21354 WRP — Workload-Router-Pool §1.(2) 沿用(§IX 45) 沿用 §IX 45
2608.09888 BDH-CQ(HF Daily 8-13 #1 553▲ → 8-14 跌出 top 15) §1.(4) 沿用(§IX 46) 续立饱和度机制 v45 升级
2608.07645 Mendel Gödel Machine 22▲ → 8-14 26▲ §1.(6) Agent 自改进沿用(§IX 46) 续立
2608.09867 Stealing Reasoning Traces 86▲ §1.(4) 沿用(§IX 46) 续立

4. 已检查来源清单

来源 检查文件 备注
inbox/spark 2026-08-14-1001-rss-gradient-flow.md / 1002-rss-chip-huyen.md 主轴 RSS 增量 0 件(gradient-flow 是持续学习/数据中心反噬;chip-huyen 是旧博客)
inbox/jay 2026-08-14-inference-agent-rag-engineering.md ⭐⭐⭐⭐ Sherlocks 73 事故六层栈 + vLLM GPU crash rate + A10 实测 + KV Cache BF16 量化
inbox/jay 2026-08-14-engineering-e1prep.md ⭐⭐⭐⭐ C2KV KDD 2026 + Memory-Centric HotInfra 2026 + vLLM 0.19 + DCAS arXiv:2608.06113 + CockroachDB 85% CPU + pgvector CVE
inbox/jay 2026-08-14-inference-vector-rag-k8s.md TGI 维护模式 + vLLM/SGLang 选型 + Vector DB 选型 + K8s v1.36 DRA
inbox/jay 2026-08-14T0820-jay-csdn-inference-stack-substack-research.md ⭐⭐⭐⭐ InferenceOps Substack State of Model Serving Communities April 2026(vLLM 0.19 Model Runner V2 / P-EAGLE / FlexKV + llm-d CNCF v0.7 + KServe v0.17.0 + Llama Stack v0.7.1)
inbox/jay 2026-08-14T0935-jay-agentic-search-paradigm-vecdb-mcp-hf.md Agentic Search 范式转变 + Mem0 2026 + AI-Native Backend MCP 生态 + nanochat
inbox/jay 2026-08-14T1130-jay-five-category-briefing.md ⭐⭐⭐⭐ KV Cache C2KV + Memory-Centric + arXiv:2608.01526 + vLLM transformers 后端 + Alice Labs 框架评分 + ERSkill + Backtrader-Bench
inbox/jay 2026-08-14T1505-jay-five-category-briefing.md KDD 2026 RAG 新范式(MoRAG / MKG-RAG-Bench / MemGraphRAG / LegalGraphRAG / OMD-GraphRAG)+ Agentic Retrieval Beyond Top-K + eBPF 安全监控
inbox/jay 2026-08-14T1620-jay-csdn-inference-rag-quantization-highvalue.md 阿里云函数计算 SGLang v0.4.6.post2 vs vLLM v0.8.5 压测 + vLLM 战略级部署指南 + TensorRT-LLM QAT + UltraRAG + Deep Searcher
inbox/jay 2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md ⭐⭐⭐⭐⭐ AI Agents Stack 2026 六层框架 + TIS 2.0 + HF Trending(RAGU / LongHorizon-Harness / LongRope / A-RAG / KnowAct-GUIClaw)+ Nemotron 3 Embed
inbox/jay 2026-08-14_database-backend-cloudnative-engineering.md PG18 AIO + CockroachDB SIGMOD 2026 + TiDB vs CockroachDB + Spring Boot CSDN + Greenplum + OceanBase + ByteByteGo + CNCF
inbox/jay 2026-08-14-1000-rss-raschka.md / 1000-rss-simon-willison.md / 1001-rss-cool-papers.md / 1001-rss-cool-papers-ir.md / 1001-rss-lilian-weng.md / 1001-rss-nathan-benaich.md / 1002-rss-import-ai.md / 1002-rss-msr-blog.md RSS 全文已扫;llm-infra 主轴新件 arXiv:2608.12149(混合线性注意力 LLM 大幅值激活 · §1.(8) 邻接候选)+ arXiv:2608.12218(信息丰裕悖论 · 评测方法学立基础延展候选)+ arXiv:2608.12278(结构性沉默 · frontier lab 公告 39 件套候选)
inbox/tom 2026-08-14-0900-hf-daily-2026-08-14.md ⭐⭐⭐ HF Daily 8-14 15 篇精选;OpenART 184▲ #1 + ComBodied Agents 181▲ + Spark-to-Paper 176▲ + Beyond Pixels 171▲
inbox/tom 2026-08-14T1440-agent-rag-longcontext-radar.md SKILLER arXiv:2608.10538 + ParliamentRAG arXiv:2608.13410 + LLMRouter arXiv:2608.06867 + Wavect RAG vs FT vs LC 2026
inbox/tom 2026-08-14-rag-e1prep.md / 2026-08-14-evaluation-e1prep.md / 2026-08-14-agent-rag-longcontext-radar.md Tom 主棒(RAG/eval/radar)8-14 已兑现;llm-infra 主轴增量无(tom 8-14 inference 棒缺位第 1 日)
inbox/flyp 2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md / 2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md / 2026-08-14-1550-Mechanist-AI-as-scientific-instrument-critical-read.md / 2026-08-14-multimodal-e1prep.md / 2026-08-14-risk-e1prep.md Flyp 主棒 8-14 critical-read 3 棒 + multimodal-e1prep + risk-e1prep 已兑现;llm-infra 主轴无 net-new(BDH-CQ 跌出 + Latent-to-4D / StateFlow 立标等级修正属 multimodal 主轴)
inbox/stephen 2026-08-14-1245-stephen-coordination-check-noon.md ⭐⭐⭐⭐ 39.6KB 协调棒;当日覆盖完整度 ★★★★★;立标饱和度机制 v45 升级;spark 主棒悬空第 14 日 + 反思棒物理动作失效第 13 例
inbox/stephen 2026-08-14-ai-industry-e1prep.md ⭐⭐⭐⭐ 70+ KB v45 frontier lab 公告 32→39 件套 + 推理引擎立基础延展 +1 件(混合线性注意力 arXiv:2608.12149 候选第 1 件)
inbox/stephen 2026-08-14-0910-news-x-vip-radar.md + 1002-news- + 1003-news- + 1004-news-* News / X-VIP radar 8-14 兑现;llm-infra 主轴无 net-new
paper_cards(8-14 新卡) 920-2608-10288.md(PLDR-LLM/PLGA 主分类 llm-infra · §IX 46 沿用) 主分类 llm-infra
paper_cards(8-14 新卡) 934-2608-05604.md(SkillZip 主分类 agent / 副分类 llm-infra · paper_card 934) 副分类 llm-infra
paper_cards(8-14 新卡) 946-2608-10538.md(SKILLER 主分类 agent / 副分类 llm-infra · paper_card 946) 副分类 llm-infra
paper_cards(8-14 新卡) 947-2608-06867.md(LLMRouter 主分类 evaluation · paper_card 947) 主分类 evaluation · §1.(2) 邻接
paper_cards(8-14 新卡) 929-2608-12036.md(Mechanist 主分类 agent) 主分类 agent · §IX 46 沿用
paper_cards(8-14 新卡) 930-2608-12123.md(Ready Cohorts 主分类 agent) 主分类 agent · §IX 45 沿用
paper_cards(8-14 新卡) 931-2608-11350.md(SHAPER 主分类 agent 副分类 evaluation) 主分类 agent · §IX 45 沿用
paper_cards(8-14 新卡) 933-2608-09805.md(Parameter Exploration for RLVR 主分类 engineering) 主分类 engineering · §IX 46 沿用
paper_cards(8-14 新卡) 940-2608-11367.md(Gaze Target Estimation 主分类 multimodal) 主分类 multimodal · 与 llm-infra 弱邻接
paper_cards(8-14 新卡) 941-2608-13410.md(ParliamentRAG 主分类 rag · tom 8-14 radar #2) 主分类 rag
paper_cards(8-14 新卡) 942-2608-13489.md(DreamX-Phi 1.0 主分类 multimodal) 主分类 multimodal
paper_cards(8-14 新卡) 943-2608-11752.md(UniSwap 主分类 multimodal) 主分类 multimodal
paper_cards(8-14 新卡) 944-2608-11745.md(LiveAnimate 主分类 multimodal) 主分类 multimodal
paper_cards(8-14 新卡) 945-2608-13049.md(H2R-Bench 主分类 multimodal 副分类 evaluation) 主分类 multimodal
paper_cards(8-14 新卡) 948-2608-07193.md(AI4AI Framework for Visual Token Pruning 主分类 multimodal) 主分类 multimodal

5. 本棒总结

本棒 E1 预消化结论:低密度延续棒——今日 llm-infra 主轴严格意义上 net-new 只有 1 件(arXiv:2608.12149 混合线性注意力 LLM 大幅值激活 · §1.(8) 稀疏注意力邻接候选),其余 10 条增量都是 8-13 evening §IX 46 已落档条目在工程实践 / 版本号 / 数字细节层面的横向深耕,或 §IX 45 §1.(1)-(13) 沿用条目的细节补丁。

§IX 47 轮建议方向(如果今夜延续 §IX 46 → §IX 47 轮活文档接力): 1. §1.(8) 稀疏注意力 → 新增 arXiv:2608.12149 混合线性注意力 LLM 大幅值激活(激活层细化研究,与 PLDR-LLM/PLGA 架构层研究互补) 2. §1.(1) 推理引擎 6 框架矩阵 → 补充 vLLM 原生 transformers 后端(HF Blog 2026-08 新发布 · 重大生态进展)+ vLLM 0.19 P-EAGLE + llm-d v0.7 EPD 分解 + 阿里云函数计算 SGLang v0.4.6.post2 vs vLLM v0.8.5 压测版本号 + vLLM GPU crash rate 0.95/0.90/0.80 三档实测 + A10 Qwen2.5-7B SGLang 7GB vs vLLM 21GB + TGI 维护模式 8-14 再次官方确认 + HF Inference Endpoints vLLM 集成 3. §1.(3) KV Cache 12 → 13 路线 → 新增 C2KV KDD 2026 arXiv:2607.17715 跨请求复用(与 PagedAttention 单请求内分配互补)+ Memory-Centric HotInfra 2026 CXL+PIM 32K tokens 详细数字(CapEx $27,664 vs $570,000 / OpEx $3.53/hr vs $59.23/hr / 吞吐 2.4×) 4. §1.(5) Agent 框架 6 层架构 → 升级到 The AI Engineer 2026 版(MCP 标准化层 + 推理模型驱动单步 Agent + Memory 成为一等架构原语)+ Alice Labs Top 10 框架评分补充(LangGraph 9/10 + Claude Agent SDK 9/10 双头) 5. §1.(1) + §1.(7) 推测解码邻接 → 新增 TIS 2.0 消除 RAG 位置偏差 +12.5% 推测解码加速(LLaMA-3.1-8B + LLaMA-3.2-1B drafter n=30) 6. §1.(2) 推理调度 9 学派 WRP 升档 → 新增 LLMRouter arXiv:2608.06867 路由 formalism 五组件作为横向细化候选 7. §1.(4) HF Daily 立标信号 → 8-14 OpenART 184▲ #1 立标信号瞬时峰值反弹锚 + ComBodied Agents 181▲ #2 续立 + Mendel Gödel Machine 26▲ #10 续立 + VibeLifeBench 17▲ #14 续立 + 立标饱和度机制 v45 "立标信号强度 ≠ 立标等级评估" 双维度区分首次机制化 v33 以来首次 8. §1.(12) Pipeline (vii) 32 件套 → paper_cards 8-14 净增 68 张 ≈ 4.4 张/h 反弹延续 + llm-infra 邻接 4 张副分类(934 SkillZip / 946 SKILLER / 947 LLMRouter / 920 PLDR-LLM)

无显著新增量的领域: - vLLM/SGLang 双栖 §1.(1) 框架格局沿用,无新主轴突破 - 推测解码 3 件套 Bole/AcceptMoE/AOSpec §1.(1) 沿用 §IX 46,无新版本 - PLDR-LLM/PLGA §1.(8) 沿用 §IX 46 8-13 立标饱和,无新版本 - WRP 第 10 学派 §1.(2) 沿用 §IX 45,无新版本(仅 LLMRouter formalism 横向细化) - pgvector / 新浪四步降本 §1.(3)/(7) 沿用 §IX 46,无新版本 - HF Daily 8-13 BDH-CQ 553▲ §1.(4) 沿用 §IX 46,8-14 BDH-CQ 跌出 top 15 = 立标信号衰减锚

待核事项(延续 §IX 46 §3.2 D65-D66 + §4 O272-O275 + 本棒新加 1 项): - arXiv:2608.12149 paper_card 必建(§1.(8) 邻接候选 + P1 缺口) - vLLM 原生 transformers 后端长序列 P95 延迟实测(HF Blog 2026-08 新发布 + 运行时匹配 custom 实现速度的精读) - C2KV arXiv:2607.17715 官方集成或参考实现(KDD 2026 已发表,待 vLLM / SGLang 集成) - Memory-Centric HotInfra 2026 PIM-DIMM 硬件生态成熟度核验(Samsung PIM-DIMM) - vLLM 周安装量 1M→2M(2026-03,InferenceOps) PyPI 下载量独立核实 - vLLM GPU crash rate 0.95/0.90/0.80 三档实测 不同硬件 / 版本对照 - TIS 2.0 +12.5% 推测解码加速 实测本机构 drafter 配对 - LLMRouter arXiv:2608.06867 路由 formalism 五组件 与 §IX 45 WRP 同团队 4 件关联成果对比

反思棒物理动作失效第 13 例续立:stephen 8-14 1245 noon 协调棒 §4 红旗已登记;spark 主棒 8-14 evening 物理动作兑现 = 本棒已物理写入文件即视为反思棒物理动作兑现第 14 例

tom inference-e1prep 8-14 主棒 缺位 第 1 日延续:8-13 22:22 兑现 → 8-14 evening 棒前未兑现;延续 4 日缺位 → 1 日缺位(tom 8-14 主棒 RAG / evaluation / radar 三棒已兑现,inference 主棒未单出)。

jay 高负荷预警第 12 日续立 + flyp 主分类红线第 13 日延续:jay 8-14 ≥ 13 件主力棒(inference-agent-rag 1055 + engineering-e1prep 1123 + five-cat 1130 + database-backend 0910 + inference-vector-rag-k8s 1336 + five-cat 1505 + csdn-inference-rag 1620 + ai-agents-stack 1735 + rss-* × 8 = 共 ≥ 13 件)+ flyp 8-14 critical-read 3 棒(Latent-to-4D / Mechanist / StateFlow)+ multimodal-e1prep + risk-e1prep + v48-candidate-audit = 红线第 13 日延续。


spark · 2026-08-14 18:40 CST · E1 预消化轮 · 第 14 棒 · 日间备料 · 主轴低密度延续棒