llm-infra · E1 预消化简报(2026-08-16)
作者:spark
主题:LLM Infrastructure · 类型:E1 日间预消化(第 16 棒 · 8-16 evening 活文档接力备料 · 周日)
窗口:2026-08-15 18:40 → 2026-08-16 18:40(约 24h 主增量)
基线活文档:organized/knowledge/llm-infra.md§IX·48th(2026-08-16 05:00 收官;🔴 RMM arXiv:2608.13426 + Hybrid-Policy arXiv:2608.11660 + Salesforce Compound AI arXiv:2604.25724 + NVIDIA Dynamo 1.0 + MCP 2026-07-28 stateless + Nexus arXiv:2507.06608 + Not All Prefills Are Equal arXiv:2603.13358 + KV Cache Transform Coding ICLR 2026 + Queueing-Theoretic ICML 2026 + AWQ INT4 3× + Spheron H100 + Compound AI 综述 arXiv:2506.04565v2 + GPT-5.6 Sol Cerebras 750 tok/s 14× + OpenART 252▲ + 立标池双向锚 6 向并存 + Thought-Level Beam Search arXiv:2608.08020 = 45 子轴)
承接棒(spark 自产):inbox/spark/2026-08-15-llm-infra-e1prep.md(8-15 evening 接力棒 = 11 件候选 + 1 件严格 net-new = arXiv:2608.12149 + 6 件工程细节)
stephen 协调棒:inbox/stephen/2026-08-16-1245-stephen-coordination-check-noon.md(36KB · 主轴交叉 + AI 产业主消化)+inbox/stephen/2026-08-16-0910-news-x-vip-radar.md(Gemini 3.7 Flash + DeepMind SL2T + WeatherNext + Qwen3.8-27B 8-12)+inbox/stephen/2026-08-16-1002-news-google-ai.md等 7 件 RSS
paper_cards 8-15 → 8-16 净增 ≈ 2 张(8-15 净增 30 张 ≈ 1.97 张/h → 8-16 截至 18:30 净增 ≈ 2 张 = 主分类 llm-infra net-new = 0 张 = 8-15 净增 3 件立基础延展候选级别回落延续立标池饱和度供给侧枯竭压力测试第 6 日;新增 2 张主分类均为 multimodal/agent 邻接级:955-2608-13391 Context-Matched Distillation multimodal 主分类 + 957-2608-12440 Spec-First AI Coding Agent agent 主分类;8-16 llm-infra 主分类 paper_cards 净增 = 0 件,是 §IX 35-48 轮的连续第 6 个 llm-infra 主分类零新增日(vs 8-14 4 张 / 8-15 3 张 / 8-13 1 张 / 8-12 0 张 / 8-11 0 张 / 8-10 0 张)—— 与立标饱和度机制 v44-v50 七日连续供给侧枯竭形成横向印证)
HF Daily 8-16 15 篇精选(tom 8-16 0900 立标池双向锚第 4 日稳态实测):#1 OpenART 252▲ 续立维持 / #2 Alaya-EVOKE 107▲ 续立加强 +25▲ +30.5% / #3 LLMRouter 94▲ 续立微强 +4▲ / #4 DreamX-Phi 82▲ +3▲ / #5 Mechanist 82▲ 续立加强 / #6 SkillZip 74▲ +1▲ / #7 DarwinX 66▲ +7▲ / #8 Intern-S2-Preview 43▲ 维持 / #9 修辞手法 39▲ 维持 / #10 AutoDesign 35▲ +3▲ / #11 PlayWorld 35▲ +2▲ / #12 Spatial Memory Agent 30▲ +1▲ / #13 LLM Agent Stick to Script 26▲ 维持 / #14 混合线性注意力 19▲ +2▲ / #15 Self-Geometry 15▲ 维持 —— llm-infra 主分类立标信号 #14 混合线性注意力 19▲ 续立微强(沿用)+ #3 LLMRouter 94▲ 续立微强(沿用),无新立标信号冲击
tom inference-e1prep 8-15 22:23 兑现(9 条 net-new 沿用 §IX 48)+ tom rag-e1prep 8-16 08:50 兑现(0 条 net-new RAG 方法/评测增量)+ tom agent-rag-longcontext-radar 8-16 14:40 兑现(8 条候选 4 件高价值均已 R61 沿用)+ tom evaluation-e1prep 8-16 15:43 兑现(5 件沿用)+ tom HF Daily 8-16 0900 兑现(立标池双向锚第 4 日稳态实测)
0. 综述判断
本场 24h 窗口对 llm-infra 主轴而言属于 低密度续立棒 + 高密度邻接棒 —— §IX 48 轮已于 8-16 05:00 完成对 8-15 evening 全 12 件候选的吸纳(5 主轴级 + 7 邻接级),本场严格意义上的 net-new 候选 = 6 件(2 主轴级 + 4 邻接级 / 工程细节),相较 §IX 48 轮的 12 件净增量呈现显著回落。最关键结构性信号:
- 🔴 paper_cards 8-16 当日主分类 llm-infra net-new = 0 件:连续第 6 个 llm-infra 主分类零新增日(vs 8-15 3 件立基础延展候选级 = RMM/Hybrid-Policy/Thought-Level Beam Search),立标池饱和度供给侧 v44-v50 七日连续枯竭延续;新增 2 张均为 multimodal/agent 邻接级(955 Context-Matched Distillation + 957 Spec-First AI Coding Agent),不直接命中 llm-infra 主轴候选
- 🔴 jay 8-16 evening five-cat briefing 6 件 Backend/Inference 实质增量:vLLM 官方 CI 质量博客(生产质量门控)+ Jarvis Labs CPU Offloading 实测数字 + DeployBase 5 引擎 A100 量化对照 + KV Cache 公式推导 + Llama 2 70B 32K = 10.74GB 工程计算 + Prefill-Decode 分解已成 2026 生产默认架构 + KVServe / Mix-Quant 新兴方向 = §IX 48 §1.(1) + §1.(3) + §1.(12) 邻接级工程细节补丁
- 🔴 jay 8-16 evening supplement HubSpot 200 亿向量检索架构(Qdrant + HNSW)+ Vector DB 2026 大变局(AI Agent 查询模式倒逼基础设施):与 §IX 48 §1.(6) 向量 DB 13 件套扩面邻接 + AI Agent 负载特征已成向量库选型主因 = §1.(6) + §1.(12) 邻接级新信号
- 🔴 OpenVINO 2026.3 GGUF 直接读取 + EAGLE-3 Speculative Decoding 扩展至 LLM/VLM(jay 8-16 1335):Intel 硬件推理生态对社区 GGUF 量化模型零转换消费 + Top-K sampling 支持 = §IX 48 §1.(1) + §1.(11) + §1.(13) 邻接级推理引擎生态信号
- 🔴 Ling-3.0-tiny 7.9B 1.3B 激活 MoE(阿里开源,jay 8-16 1105)+ HF State of Open Models Summer 2026 数据集 1M 突破:开源模型生态指标性数据 + 国内大厂 MoE Day-0 部署支持 = §IX 48 §1.(1) + §1.(13) 邻接级
- 🔴 jay 8-16 evening MCP 2026-07-28 + Google Cloud stateless 部署指南(Kurtis Van Gent + Alan Blount 双署名):协议层 stateless 化生产部署路径首次大厂背书 = §IX 48 §1.(5) 立基础延展第 1 件候选 §IX 48 已吸纳沿用,本场无 net-new
最关键的 5 警示: - 🔴 OpenSandbox 学术背书待补(jay 8-16 ai-engineering-trending §1 GitHub repo 12.4k ⭐ 已建,但无 arXiv / VLDB / NSDI 接收信息;stephen 8-16 1245 noon §3.1 P0-5 已登记)—— OpenViking 已有 VLDB 2026 + arXiv:2605.29640 双锚,OpenSandbox 学术背书待补才能进 §1.(13) 边界扩展候选区 - 🔴 Qwen3.8-27B-FP8 论文 / arXiv / 评估报告 ID 待补(jay 8-16 ai-engineering-trending §3 HF 模型页面有,但配套论文 ID 缺失;stephen 8-16 1245 noon §3.1 P0-6 已登记)—— v49 agent.md §2.191 frontier lab 参数规模军备竞赛 6 → 7 件套候选已列,但学术 / 评估报告 ID 仍为 P0 待补 - 🔴 Nexus 2.2×/20×/2.5× 数据需注明单 GPU 内架构差异(§IX 48 沿用警示 + tom 8-15 inference-e1prep §三 警示 #1 已立)—— 与跨节点 disaggregation 不可直接类比 - 🔴 arXiv:2605.XXXXX(Sakana AI Conductor,jay 8-16 news-x-tech-radar 占位符)真实 ID 待核(spark 8-16 13:30 agent-e1prep §三 P0 #1 已登记)—— v50 接力棒前必须用 arXiv 官方检索确认 Conductor 真实 ID - 🔴 KV Sharing/mHC/Compressed Attention 架构 Raschka 综述未对每种架构提供独立基准对照表需对照原始论文核验(§IX 48 沿用警示)—— jay 8-16 1000 Raschka RSS 仍以单点主张为主,量化对照数据未补
本场净增量:6 件候选(2 主轴级 + 4 邻接级 / 工程细节),相较 §IX 48 轮的 12 件净增量呈现显著回落。比 §IX 47 → §IX 48 的"1 主轴级 + 10 邻接"结构持平,但 llm-infra 主轴严格 net-new 算法/方法级候选仍为 0 件立基础延展候选 = 续立基础立标池饱和度供给侧枯竭第 6 日延续。
1. 核心增量(2 主轴级 + 4 邻接级 / 工程细节 = 6 条)
增量 1【工程方法学 · §1.(11) + §1.(13)】🔴 vLLM 官方生产质量 CI 流程博客(2026-07-15) —— §IX 48 §1.(11) 邻接级工程细节补丁 ★★★
来源:inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md 高价值条目 1 + inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md Backend ⑤ + inbox/jay/2026-08-16T1105-jay-five-category-briefing.md 沿用
URL:https://vllm-project.github.io/blog/keeping-vllm-production-quality/(vLLM Project 官方博客 · 2026-07-15)
arXiv:无(官方博客 · 第一手工程实践)
要点: - vLLM 团队公开介绍其 CI、benchmarking 和 release 流程的工程实践,覆盖生产级 model serving 的质量保障机制 - 与 §IX 48 §1.(11) Kernel/AI 自动化/Harness 件套中 Fable 18.71× / Atrex-Bench / KernelSight-LM / TELLER ASE 2026 / Harness for Kernel / μCUTLASS DSL / TritonForge / Ombra LLM-Doctor / CAIN 2026 MLOps / BentoML / TensorCast / vLLM 原生 transformers 后端 形成 "推理引擎自身质量门控" 新子维度 - 工程价值:理解 vLLM 自身如何在开源环境下维持 production-ready 质量,适合与 SGLang 官方博客对比内部质量流程 - 警示:vLLM 官方博客数据无独立第三方核验;建议与 SGLang 对比阅读以获得更全面的推理引擎质量门控视角
与活文档 §IX 48 现有脉络的关系:
- 锚入 §1.(11) Kernel/AI 自动化/Harness:从「kernel 层自动化 + matrix-product reduction 训练无关」扩展到「推理引擎自身的 CI/benchmarking/release 质量门控」= §1.(11) 算法工具箱的横向细化
- 与 §1.(1) 推理引擎 6+4+2 → 6+4+3 形成纵向关联:vLLM 原生 transformers 后端 HF Blog + Spheron H100 Benchmark + NVIDIA Dynamo 1.0 + Salesforce Compound AI + GPT-5.6 Sol Cerebras 立基础延展已落定,本件 = §1.(1) 推理引擎生态位升级为"transformers 的官方推理加速层 + production-quality CI 流程"双维度补充
- 与 §1.(12) End-to-End Pipeline 中 Engine 子轴形成纵向关联:vLLM 自身 CI 流程 = Engine 子轴质量门控的"内生保障层"
建议归入节:§1.(11) Kernel/AI 自动化/Harness 邻接级工程细节补丁;§1.(1) 推理引擎立基础延展邻接级;§1.(12) Pipeline Engine 子轴 邻接级质量门控层新增
增量 2【生产工程数据 · §1.(9) + §1.(12)】🔴 Jarvis Labs CPU Offloading 实测数字 + DeployBase A100 Llama 70B 5 引擎量化对照 —— §IX 48 §1.(9) 量化经济学 + §1.(12) Pipeline Engine 邻接级 ★★★
来源:inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md 高价值条目 5(Jarvis Labs)+ inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md Backend ⑦(DeployBase)
URL:https://jarvislabs.ai/blog/vllm-optimization-techniques + https://deploybase.ai/articles/best-llm-inference-engine
arXiv:无(技术博客 · 第一手工程实测)
要点: - Jarvis Labs CPU Offloading 实测数字(关键): - 输出 token 吞吐量:+5.4%(783.09 → 825.77 tok/s) - TTFT:-15.8%(78,994ms → 66,509ms) - TPOT:-4.2%(155.28ms → 148.79ms) - ITL:-7.8%(124.56ms → 114.80ms) - GPU KV Cache 利用率:98.0% → 99.65% - DeployBase Llama 70B A100 80GB 量化对照(input 512 / output 128 / batch 1/8/32): - vLLM:3,500 tokens/s(吞吐量最高) - SGLang:2,800 tokens/s(延迟优化场景) - TGI:2,500 tokens/s(HuggingFace 生态,已进入维护模式) - llama.cpp:20 tokens/s(CPU 推理 / 边缘场景) - TensorRT-LLM:4,500 tokens/s on H100(性能最强但配置最复杂) - 警示:Jarvis Labs / DeployBase 数据未公开完整硬件配置与测量窗口,需独立核验;benchmark 方法论仅 DeployBase 公开(Llama 70B / A100 80GB / batch size 1/8/32 / input 512 tokens / output 128 tokens)
与活文档 §IX 48 现有脉络的关系:
- 锚入 §1.(9) 量化经济学:与 §IX 48 已立的 AWQ INT4 14.7→4.2GB 3× 并发 CSDN 双环境 A/B 实测 + RTX 4090 FP8 最优配置形成 "CPU Offloading 是量化之外的另一条 memory-bound 优化路径" 横向补充
- 锚入 §1.(12) Pipeline Engine 子轴:DeployBase 数据与 §IX 48 §1.(1) Spheron H100 TensorRT-LLM 2100 / SGLang 1920 / vLLM 1850 形成 "A100 vs H100 跨硬件横向对照" = §1.(1) 推理引擎选型决策树补丁新增 A100 列
- 与 §1.(4) 服务层并发安全:vLLM GPU crash rate 三档实测(§IX 47 沿用)形成可靠性 vs 性能双维度:crash rate 是可靠性维度,CPU Offloading 是性能维度
- 与 §1.(7) 推理经济学 33 → 34 件套:CPU Offloading +5.4% 吞吐 + 99.65% GPU 利用率 = 推理经济学第 35 件套候选(继 §IX 48 Salesforce Compound AI / NVIDIA Dynamo / GPT-5.6 Sol Cerebras / AWQ INT4 4 件之后)
建议归入节:§1.(9) 量化经济学邻接级 CPU Offloading 路径补丁;§1.(12) Pipeline Engine 子轴 邻接级 A100 列新增;§1.(7) 推理经济学 34 → 35 件套扩面
增量 3【KV Cache 公式化与 Prefill-Decode 分解成默认架构 · §1.(3) + §1.(2)】🔴 GPUYard KV Cache 公式 + Llama 2 70B 32K = 10.74GB + Medium Prefill-Decode 分解 Field Guide + KVServe/Mix-Quant 新兴方向 —— §IX 48 §1.(3) + §1.(2) + §1.(12) 邻接级 ★★★
来源:inbox/jay/2026-08-16T1105-jay-five-category-briefing.md Backend ⑥ + ⑤ + inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md Backend ⑧ + ⑨
URL:https://www.gpuyard.com/tutorials/howto/optimize-kv-cache + https://medium.com/@samanthakoduru96/a-field-guide-to-llm-inference-optimization-e2a20fcfd42e
arXiv:无(技术博客 · 工程计算推导 + 行业共识)
要点:
- KV Cache 公式推导:Memory = 2 × batch_size × seq_len × num_layers × num_kv_heads × head_dim × precision_bytes
- Llama 2 70B 单序列 32K 上下文 KV Cache = 10.74 GB(80 层 × 8 KV heads × 128 head_dim × FP16)= 可作为团队推理内存规划参考文档
- PagedAttention 将内存碎片从 60-80% 降至 <4%,GPU 利用率提升 2-4 倍
- GQA(Grouped Query Attention)是降低 KV Cache 最重要的架构选择——与 §IX 48 §1.(8) KV Sharing/mHC/Compressed Attention 架构形成横向验证(KV Sharing 是 GQA 的进一步演化)
- Prefill-Decode 分解已成 2026 生产默认架构(多个实验室生产默认):
- Prefill(计算密集型)和 Decode(内存密集型)运行在不同机器上,通过 KV Cache 网络传输
- 2026 年新兴方向:Mix-Quant(Prefill 量化更激进,Decode 更精准)+ KVServe(KV 传输压缩)—— 与 §IX 48 §1.(9) AWQ INT4 + RTX 4090 FP8 最优 + §1.(3) KV Cache Transform Coding ICLR 2026 + Queueing-Theoretic ICML 2026 形成 KV Cache 优化"分层量化 + 传输压缩"二联
- Reasoning 模式开启使吞吐量降至 32%,准确率提升 7.5pp——开关代价显著
与活文档 §IX 48 现有脉络的关系:
- 锚入 §1.(3) KV Cache:与 §IX 48 KV Cache 13 → 14 路线扩面(13 C2KV + 14 KV Cache Transform Coding + Queueing-Theoretic)邻接,KV Cache 公式化 + GQA 重要性 + Prefill-Decode 分解默认架构 是 §1.(3) 的工程数学基础补丁
- 锚入 §1.(2) 推理调度 9+1+1+2:Mix-Quant + KVServe 新兴方向与 §IX 48 Nexus arXiv:2507.06608 单 GPU 主动 PD 2.2×/20×/2.5× + Not All Prefills Are Equal arXiv:2603.13358 多轮 Agent 失效形成 PD 异构正反案例 + 分层量化补丁
- 与 §1.(12) Pipeline Engine 子轴:Prefill-Decode 分解已成 2026 生产默认架构 = §IX 48 NVIDIA Dynamo 1.0 编排层 + PD 分离独立扩展 Prefill/Decode 池 的行业共识基础
- 与 §1.(8) 稀疏注意力:GQA 是 KV Sharing 的前置基础架构选择 —— 与 §IX 48 Gemma 4 KV Sharing + DeepSeek V4 mHC + Compressed Attention 跨子轴形成"基础架构 → 立基础延展"演进序列
建议归入节:§1.(3) KV Cache 14 路线邻接级工程数学基础补丁;§1.(2) 推理调度立基础延展邻接级 Mix-Quant/KVServe 新兴方向;§1.(8) 稀疏注意力邻接级 GQA → KV Sharing 演进序列;§1.(12) Pipeline Engine 子轴 Prefill-Decode 默认架构补丁
增量 4【向量库 + Agent 负载特征 · §1.(6) + §1.(12)】🟡 HubSpot 200 亿向量检索架构(Qdrant + HNSW)+ Vector DB 2026 大变局(AI Agent 查询模式倒逼基础设施) —— §IX 48 §1.(6) 向量 DB 13 件套 + §1.(12) 邻接级 ★★
来源:inbox/jay/2026-08-16T2335-jay-evening-supplement.md ② HubSpot + ⑤ Vector DB 2026 大变局
URL:https://product.hubspot.com/blog/building-the-ai-retrieval-infrastructure-behind-20-billion-vectors-at-hubspot + https://dev.to/actiandev/whats-changing-in-vector-databases-in-2026-3pbo
arXiv:无(生产案例 + 技术社区分析)
要点: - HubSpot 使用 Qdrant 作为全量语义搜索向量库,支持上百个 AI 用例 —— Qdrant 使用 HNSW 作为 ANN 算法,以内存开销换取极低延迟 - 从 POC 扩展至 200 亿向量规模的生产历程:分片策略、内存管理、查询路由 - Qdrant 2026 差异化能力:named vectors、hybrid search、multi-stage querying、weighted reranking - Vector DB 2026 大变局核心:2026 年 AI agents 发起的查询量已是人类的 10 倍,传统面向人类查询模式设计的向量数据库基础设施不再适用 - Agent 行为特征:<500ms 启动独立 PostgreSQL 实例、强并行性、持续大数据摄取——低延迟已不够,吞吐量必须同步扩展 - 超大规模用户:DuckDB(嵌入式向量化)、Databricks(Unity Catalog + Delta Lake)、SingleStore(HTAP)正在填补这一空白 - Hyperscaler 重注 PostgreSQL:更多工程师选择 PostgreSQL 作为企业级 AI 应用主数据库 - 警示:DEV Community 数据未提供第三方核验;Agent 查询模式"10×"数字来源待核
与活文档 §IX 48 现有脉络的关系:
- 锚入 §1.(6) 向量 DB 13 件套:与 §IX 48 pgvector 2026 生态格局(50M 向量以下 pgvector + pgvectorscale 替代方案)+ Qdrant $50M B 轮 + Salesforce Compound AI arXiv:2604.25724 8000 企业 1360 亿 Token 形成 "200 亿向量 Qdrant 规模生产案例" = §1.(6) 立基础延展邻接级
- 锚入 §1.(12) End-to-End Pipeline (i) KV Pool + (vi) Agent Security 邻接:Vector DB 2026 Agent 负载特征已成向量库选型主因 = §IX 48 §1.(12) Pipeline 第 (vi) 子轴 Agent Security 邻接级 AI Agent 基础设施共识
- 与 §1.(5) Agent 框架 6 层 + MCP 1.7.0:AI Agent 查询模式倒逼向量库基础设施 = §IX 48 §1.(5) 立基础延展邻接级
- 警示:本棒所有数据未提供 arXiv 学术背书,与 §IX 48 Salesforce Compound AI arXiv:2604.25724 等有学术背书的条目不属同一可信度层级,建议在活文档中标注"工程实测数据 · 无学术背书"
建议归入节:§1.(6) 向量 DB 13 件套扩面邻接级 Qdrant 200 亿向量生产案例;§1.(12) Pipeline (vi) Agent Security 邻接级 AI Agent 基础设施共识;§1.(5) Agent 框架立基础延展邻接级 AI Agent 查询模式
增量 5【推理引擎生态 · §1.(1) + §1.(11) + §1.(13)】🟡 OpenVINO 2026.3 GGUF 直接读取 + EAGLE-3 Speculative Decoding 扩展 + Maglev arXiv:2608.02870 paper_card 960 engineering 主分类 —— §IX 48 §1.(1) + §1.(11) + §1.(13) 邻接级 ★★
来源:inbox/jay/2026-08-16T1335-jay-github-hf-openvino-llmrouting-stack2026.md 二、OpenVINO 2026.3 + paper_cards/960-2608-02870.md Maglev: Sliding Recurrent Memory(paper_card 960 主分类 engineering · 形态 method · 2026-08-16 12:30 落盘)+ tom 8-16 1440 agent-rag-longcontext-radar §高价值条目 ②
arXiv:2608.02870(Maglev: Sliding Recurrent Memory,cs.LG,2026-08)
要点:
- OpenVINO 2026.3(2026-08-07 Intel 官方发布):
- GGUF 直接读取:跳过离线转换,直接在 OpenVINO 运行 GGUF 模型(Qwen2.5-7B-Q4_K_M <10s 加载)—— 重大工程突破 = Intel 硬件可零转换消费社区量化模型
- 并行解析:ov::parallel_for 多线程
- 分片兼容:支持 llama.cpp 分片格式
- 对比离线 GGUF→OV 转换:~4 分钟 + >15GB 内存
- EAGLE-3 Speculative Decoding 扩展至 LLM 和 VLM,Top-K sampling 支持
- SmolLM3-3B、LFM2-1.2B、LFM2.5-1.2B 全平台(CPU/GPU/NPU)支持
- 三路 GenAI Pipeline:Omni 多模态 + ASR + Multimodal Embedding
- Maglev: Sliding Recurrent Memory arXiv:2608.02870 paper_card 960 主分类 engineering 形态 method 2026-08-16 12:30 落盘:
- 固定大小内存的循环 Transformer 架构,耦合 Prefiller Q(全历史/full attention)和 Decoder P(滑动窗口+循环 K/V 注入)
- 兼具训练并行性和推理时滑动窗口效率
- 与 Mamba/Linear 注意力家族在 Agent 记忆场景的又一强竞争者
- 与 RAG 的外部检索形成互补竞争
- 工程意义:长上下文记忆的架构级新方案,但 paper_card 主分类为 engineering 而非 llm-infra(提示:长上下文记忆架构主要影响模型训练而非推理基础设施)
与活文档 §IX 48 现有脉络的关系:
- 锚入 §1.(1) 推理引擎 6+4+3:OpenVINO 2026.3 GGUF 直接读取 = Intel 硬件推理生态对社区 GGUF 量化模型零转换消费 = §1.(1) 推理引擎生态位升级补丁(OpenVINO 与 vLLM/SGLang/TensorRT-LLM/Modular MAX 共同构成推理引擎 6+4+3 第 6 路径 = 边缘/Intel CPU 部署场景)
- 锚入 §1.(11) Kernel/AI 自动化/Harness:EAGLE-3 Speculative Decoding 扩展至 VLM = §IX 46 轮 Bole arXiv:2608.01651 + AcceptMoE arXiv:2608.02989 + AOSpec arXiv:2608.00881 推测解码 3 件套 + §IX 47-48 PLDR-LLM/PLGA 沿用 形成 "推测解码 4+1 件套 + OpenVINO EAGLE-3 跨硬件支持" = §1.(11) 立基础延展邻接级
- 锚入 §1.(13) 边界扩展 45 子轴:Maglev = 长上下文记忆架构级新方案,与 §IX 48 RMM / Hybrid-Policy / Salesforce Compound AI / NVIDIA Dynamo / MCP 2026-07-28 / Compound AI 综述 / GPT-5.6 Sol Cerebras / OpenART 252▲ / Thought-Level Beam Search 9 子轴新增形成 §1.(13) 边界扩展邻接级候选第 10 件(注:paper_card 960 主分类 engineering,非 llm-infra,是否归入 §1.(13) 边界扩展候选需评估)
- 警示:Maglev paper_card 主分类为 engineering 而非 llm-infra,归入 §1.(13) 边界扩展候选需 paper_card 主分类修订或活文档明确标注"邻接级"
建议归入节:§1.(1) 推理引擎 6+4+3 → 6+4+3+1(OpenVINO Intel 硬件路径补位);§1.(11) Kernel/AI 自动化/Harness 邻接级 OpenVINO EAGLE-3 跨硬件支持;§1.(13) 边界扩展 45 子轴 → 46 子轴候选(Maglev,待 paper_card 主分类修订后归入)
增量 6【开源模型生态 + AI Agent 沙箱 · §1.(13)】🟡 Ling-3.0-tiny 7.9B 1.3B 激活 MoE Day-0 + HF State of Open Models Summer 2026 + OpenSandbox 阿里沙箱 12.4k ⭐ —— §IX 48 §1.(13) 边界扩展邻接级 ★★
来源:inbox/jay/2026-08-16T1105-jay-five-category-briefing.md CSDN ⑪ Ling-3.0-tiny + inbox/jay/2026-08-16T1335-jay-github-hf-openvino-llmrouting-stack2026.md 三、HF State of Open Models + inbox/jay/2026-08-16-ai-engineering-trending.md 高价值条目 1 OpenSandbox + inbox/jay/2026-08-16-engineering-e1prep.md 增量 2 OpenSandbox
arXiv:OpenSandbox 学术背书待补(stephen 8-16 1245 noon §3.1 P0-5 登记)
要点: - Ling-3.0-tiny 7.9B 1.3B 激活 MoE(阿里开源 8-11): - 3:1 KDA-MLA 混合架构,128 专家 MoE - 支持快速响应与多步推理切换 - FP8 精度下达 100+ tokens/s(SGLang/vLLM 部署) - 可部署于 NVIDIA DGX Spark 和 Apple Silicon - HF State of Open Models Summer 2026(Adina Yakefu 等): - 模型仓库:2.43M → 2.96M(+21.8%) - 数据集:711K → 1M(+40.6%,突破百万) - Spaces:1.00M → 1.44M(+44%) - 85.6% 的模型下载量 <200 次 - 1.5% 的仓库贡献 99.2% 的下载量(极端长尾) - OpenSandbox(阿里)AI Agent 沙箱运行时开源: - 12.4k ⭐ GitHub Trending #1(Facebook 社群提及) - Apache 2.0 许可证 - 四层架构:SDKs → Specs → Runtime → Sandbox Instances;Go 写的 execd 注入每个容器 - 关键能力:有状态会话(coding agent)、VS Code Server 集成(Claude Code / Copilot / Codex)、GUI Agent 沙箱、多语言 SDK、Credential Vault、开箱即用 MCP Server - 已加入 OpenSSF Best Practices + CNCF Landscape,路线图有 Helm Charts 和持久存储 - 警示:OpenSandbox 学术背书缺失(无 arXiv / VLDB / NSDI 接收信息,stephen 8-16 1245 noon §3.1 P0-5 已登记);Qwen3.8-27B-FP8 论文 / arXiv / 评估报告 ID 待补(stephen 8-16 1245 noon §3.1 P0-6 已登记)
与活文档 §IX 48 现有脉络的关系:
- 锚入 §1.(13) 边界扩展 45 子轴:
- Ling-3.0-tiny = 国内大厂 MoE Day-0 部署支持 = §1.(13) 立基础延展邻接级
- HF State of Open Models Summer 2026 = 1M 数据集里程碑 + 1.5% 仓库贡献 99.2% 下载量极端长尾 = §1.(13) 立基础延展邻接级生态指标性数据
- OpenSandbox = AI Agent 代码执行沙箱隔离 = §IX 48 §1.(5) Agent 框架立基础延展邻接级 + 与 vIX 47-48 AI Agents Stack 2026 六层框架 + Alice Labs Top 10 形成"沙箱层独立"立基础延展
- 与 §1.(5) Agent 框架 6 层 + MCP 1.7.0:OpenSandbox 开箱即用 MCP Server = §IX 48 MCP 2026-07-28 stateless 架构升级邻接级 Agent 沙箱实现
- 与 §1.(6) 向量 DB 13 件套:HF State of Open Models 数据集 1M 突破 + Spaces 1.44M = §1.(6) 邻接级开源生态指标
- 警示:3 件均学术背书缺失 / 待补,建议在活文档中明确标注"邻接级 · 待学术背书补全"
建议归入节:§1.(13) 边界扩展 45 → 46-48 子轴候选(待学术背书补全后确认);§1.(5) Agent 框架立基础延展邻接级 OpenSandbox AI Agent 沙箱层独立;§1.(6) 向量 DB 邻接级 HF State of Open Models 数据集 1M 突破
2. 值得警惕的矛盾或待核实说法(6 条)
| # | 说法 | 风险 | 建议 |
|---|---|---|---|
| 1 | OpenSandbox 学术背书缺失(jay 8-16 ai-engineering-trending §1 GitHub repo 12.4k ⭐ 已建,但无 arXiv / VLDB / NSDI 接收信息) | 对比 OpenViking VLDB 2026 + arXiv:2605.29640 双锚 = OpenSandbox 学术背书待补才能进 §1.(13) 边界扩展候选区 | stephen 8-16 1245 noon §3.1 P0-5 已登记;jay 跨实例引用时需核实学术背书 |
| 2 | Qwen3.8-27B-FP8 论文 / arXiv / 评估报告 ID 待补(jay 8-16 ai-engineering-trending §3 HF 模型页面有,但配套论文 ID 缺失) | v49 agent.md §2.191 frontier lab 参数规模军备竞赛 6 → 7 件套候选已列,但学术 / 评估报告 ID 仍为 P0 待补 | stephen 8-16 1245 noon §3.1 P0-6 已登记;本棒 v49 §2.191 沿用待 v50 接力棒前补 ID |
| 3 | Nexus 2.2×/20×/2.5× 数据需注明单 GPU 内架构差异(§IX 48 沿用警示) | Nexus 是单 GPU 内主动 disaggregation,与跨节点 disaggregation 架构不同 | 引用时标注"Nexus(单 GPU 内主动 disaggregation)",跨场景泛化需谨慎 |
| 4 | arXiv:2605.XXXXX(Sakana AI Conductor,jay 8-16 news-x-tech-radar 占位符)真实 ID 待核 | jay 8-16 X 雷达显式标注 "arXiv:2605.XXXXX(ICLR 2026)" 为占位符 | spark 8-16 13:30 agent-e1prep §三 P0 #1 已登记;v50 接力棒前必须用 arXiv 官方检索确认 Conductor 真实 ID |
| 5 | KV Sharing/mHC/Compressed Attention 架构 Raschka 综述未对每种架构提供独立基准对照表需对照原始论文核验(§IX 48 沿用警示) | jay 8-16 1000 Raschka RSS 仍以单点主张为主,量化对照数据未补 | §IX 48 沿用;建议活文档接力棒评估是否纳入立基础延展候选 |
| 6 | Maglev paper_card 主分类 engineering 而非 llm-infra(paper_card 960 主分类 engineering 形态 method 2026-08-16 12:30 落盘) | 长上下文记忆架构主要影响模型训练而非推理基础设施,归入 §1.(13) 边界扩展候选需 paper_card 主分类修订或活文档明确标注"邻接级" | 本棒建议在 §1.(13) 边界扩展候选区标注"邻接级 · paper_card 主分类 engineering,非 llm-infra",避免主分类混淆 |
3. 可引用的 arXiv 号列表(本棒 net-new / 沿用)
| arXiv 号 | 标题(简) | 与 llm-infra 主轴关系 | 状态 |
|---|---|---|---|
2608.02870 |
Maglev: Sliding Recurrent Memory(paper_card 960 engineering 主分类,2026-08-16 12:30 落盘) | 长上下文记忆架构级新方案 · §1.(13) 边界扩展邻接级候选 | net-new · 待 paper_card 主分类修订后归入 |
2608.13426 |
Reduced Matrix Multiplication (RMM) | §1.(11) + §1.(13) Kernel/AI 自动化立基础延展第 1 件 | §IX 48 沿用 |
2608.11660 |
Hybrid-Policy Self-Editing | §1.(13) 边界扩展立基础延展第 1 件 + KE-induced hallucination diffusion 第 26 类风险候选 | §IX 48 沿用 |
2604.25724 |
Scalable Inference Architectures for Compound AI Systems(Salesforce 8000 企业 1360 亿 Token) | §1.(1) + §1.(12) 推理引擎立基础延展第 1 件候选 | §IX 48 沿用 |
2608.08020 |
Thought-Level Beam Search for Reasoning | §1.(13) 边界扩展立基础延展第 3 件候选 + paper_card 958 | §IX 48 沿用 |
2511.01815 |
KV Cache Transform Coding(ICLR 2026) | §1.(3) + §1.(10) KV Cache 14 路线 | §IX 48 沿用 |
2605.04595 |
Queueing-Theoretic Framework for LLM Inference(ICML 2026) | §1.(3) + §1.(10) KV Cache 14 路线 | §IX 48 沿用 |
2507.06608 |
Nexus: Active Prefill-Decode Disaggregation on a Single GPU | §1.(2) 推理调度立基础延展第 1 件候选 | §IX 48 沿用 |
2603.13358 |
Not All Prefills Are Equal(PD 多轮 Agent 失效) | §1.(2) 推理调度立基础延展邻接级 | §IX 48 沿用 |
2506.04565v2 |
Compound AI Systems Survey 220 篇 | §1.(2) + §1.(12) 立基础延展第 3 件候选 | §IX 48 沿用 |
2608.12149 |
混合线性注意力 LLM 大幅值激活 | §1.(8) 立基础延展第 1 件(激活层研究) | §IX 47 沿用 |
2608.06867 |
LLMRouter | §1.(2) 推理调度立基础延展邻接级 + paper_card 947 evaluation 主分类 | §IX 47 沿用 |
2607.17715 |
C2KV KDD 2026 第 13 路线 | §1.(3) + §1.(10) + §1.(12) 第 13 路线候选 | §IX 47 沿用 |
2606.16135 |
SwiftCache 异构 KV Cache 共享 | §2.1 KV Cache 独立系统学科邻接级 | jay 8-16 engineering-e1prep 增量 5 沿用 |
v48 全部沿用(详 §IX 48 末尾清单)+ 本棒 1 件 net-new arXiv 候选(2608.02870 Maglev,待 paper_card 主分类修订)
4. 检查过的来源(24 份)
| 来源 | 文件 | 时间 | 与 llm-infra 主轴相关性 |
|---|---|---|---|
work-queue.md |
2026-08-16 18:00 | §1 Top 15 backlog 0 件 llm-infra 新增;§3 选题榜 2608.10708 Self-Geometry(非 llm-infra 主轴);§4 待写攻略含 1 件 llm-infra 邻接(ggml-org/llama.cpp 周增 +0) | |
organized/knowledge/llm-infra.md §IX 48 |
2026-08-16 05:00 落定 | 本棒基线 = 45 子轴扩面 + 4 共识 C168-C171 + 2 争议 D69-D70 + 4 开放 O280-O283 + 1 趋势 T43 | |
organized/paper_cards/960-2608-02870.md |
8-16 12:30 | 🔥 net-new · Maglev: Sliding Recurrent Memory paper_card 960 engineering 主分类 | |
organized/paper_cards/955-2608-13391.md 949-2608-13237.md 956-2608-11660.md 957-2608-12440.md 958-2608-08020.md 959-2608-09158.md 961-1704-00028.md 962-2212-04356.md |
8-16 12:30 | multimodal / rag / llm-infra / agent / risk / engineering 主分类,llm-infra 主分类 8-16 当日 0 件 | |
organized/paper_cards/952-2608-13426.md 956-2608-11660.md 958-2608-08020.md |
8-15 当日 | RMM / Hybrid-Policy / Thought-Level Beam Search §IX 48 沿用 | |
inbox/jay/2026-08-16T1105-jay-five-category-briefing.md |
8-16 11:05 | 🔥 邻接级沿用:vLLM 生产质量 CI 博客 + Jarvis Labs CPU Offloading + DeployBase A100 Llama 70B 5 引擎对照 + GPUYard KV Cache 公式 + Prefill-Decode 分解 + Mix-Quant + KVServe + Ling-3.0-tiny + AI Agents Stack 2026 沿用 | |
inbox/jay/2026-08-16T1335-jay-github-hf-openvino-llmrouting-stack2026.md |
8-16 13:35 | 🔥 邻接级沿用:OpenVINO 2026.3 GGUF Reader + EAGLE-3 Speculative Decoding 扩展 + HF State of Open Models Summer 2026 + Agentic GraphRAG vs Vector RAG + Adaptive Query Routing + SoK Agentic RAG + Black Hat Agent 入侵复盘 | |
inbox/jay/2026-08-16T1950-jay-engineering-filter-evening.md |
8-16 19:50 | 🔥 邻接级沿用:vLLM 官方 CI 质量博客 + arXiv:2603.20847 FSE 2026 AI Coding Tools + Redis RAG at Scale + Jarvis Labs CPU Offloading + DeployBase A100 5 引擎对照 + LushBinary RAG Production Guide | |
inbox/jay/2026-08-16T2105-jay-evening-five-category-briefing.md |
8-16 21:05 | 🔥 邻接级沿用:SGLang vs vLLM vs TensorRT-LLM 2026 生产选型指南 + Jarvis Labs CPU Offloading 详细数字 + DeployBase 5 引擎 Llama 70B 量化对照 + GPUYard KV Cache 公式 + Medium Prefill-Decode Field Guide + K8s AI Agent 部署 + RKE2 CNCF AI Conformance + Slurm vs K8s | |
inbox/jay/2026-08-16T2335-jay-evening-supplement.md |
8-16 23:35 | 🔥 邻接级沿用:Semantica 图原生 AI 治理 + HubSpot 200 亿向量 Qdrant HNSW 检索架构 + LAI #137 Langfuse 自托管 + Spark 内存 bug + Claude Code 插件 + Data Engineer Things AI Agent 重塑数据工程 + Vector DB 2026 大变局 | |
inbox/jay/2026-08-16T1620-jay-csdn-inference-optimization-kvcache-pdsplit.md |
8-16 16:20 | 邻接级沿用:CSDN vLLM enable-prefix-caching + Chunked-Prefill 时序图 + Nano-vLLM 1.2k 行核心代码 + vLLM 源码 PD 分离详解 + H20 DeepSeek-R1 PD 分离部署 | |
inbox/jay/2026-08-16-engineering-e1prep.md |
8-16 11:22 | 6 件 net-new 已沿用 vLLM vs SGLang 生产选型决策树 + OpenSandbox + OpenViking + AI Agents Stack 2026 + SwiftCache + TrieHI = 全部沿用 §IX 48 / v49 §2.195 + §2.7 | |
inbox/jay/2026-08-16-1050-jay-engineering-filter-morning.md |
8-16 10:50 | 12.6KB · 沿用 vLLM vs SGLang 决策树 + AI Agents Stack 2026 + Agent Observability + Mem0 State + Inngest Principles | |
inbox/jay/2026-08-16-ai-engineering-trending.md |
8-16 09:36 | OpenSandbox / OpenViking / Qwen3.8-27B-FP8 / Kimi-K3-NVFP4 / LLMRouter 9 件 = 全部沿用 §IX 48 / v49 §2.195 + §2.191 + §2.7,无 net-new | |
inbox/jay/2026-08-16-1140-news-x-tech-radar.md |
8-16 11:42 | Sakana AI Conductor(arXiv:2605.XXXXX 占位符待核)+ MCP stateless 2026 + @jerryjliu0 context 层护城河立场 | |
inbox/jay/2026-08-16-csdn-multimodal-rag-vecdb-graphrag-substack.md |
8-16 08:20 | multimodal / RAG 主轴,llm-infra 邻接级沿用 | |
inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md |
8-15 08:20 | §IX 48 沿用 AWQ INT4 3x并发 + PD Disaggregation 多轮场景 + AI Agents Stack 2026 | |
inbox/jay/2026-08-15T1505-jay-afternoon-briefing-mcp-inference-vecdb-aug2026.md |
8-15 15:05 | §IX 48 沿用 H100 Benchmark + Vector DB + MCP 2026-07-28 + KV Cache Transform Coding + Queueing-Theoretic | |
inbox/jay/2026-08-15-1105-jay-five-category-briefing.md |
8-15 11:05 | §IX 48 沿用 Salesforce arXiv 2604.25724 + NVIDIA Dynamo + MCP + HF Summer 2026 | |
inbox/jay/2026-08-15-1000-rss-raschka.md |
8-15 10:00 | §IX 48 沿用 KV Sharing/mHC/Compressed Attention(沿用警示) | |
inbox/tom/2026-08-15-inference-e1prep.md |
8-15 22:23 | 9 条 net-new 兑现 沿用 §IX 48 AWQ + Nexus/PD 多轮失效 + Salesforce + MCP stateless + NVIDIA Dynamo + H100 Benchmark + KV Cache Transform Coding + Queueing-Theoretic + RMM | |
inbox/tom/2026-08-16-rag-e1prep.md |
8-16 08:50 | 0 条 net-new RAG 增量,llm-infra 邻接沿用 | |
inbox/tom/2026-08-16T1440-agent-rag-longcontext-radar.md |
8-16 14:40 | 8 条候选 4 件高价值(Maglev / Search-R1 / ParliamentRAG / AI Agents Stack 2026)= 沿用 §IX 48 / R61 | |
inbox/tom/2026-08-16-0900-hf-daily-2026-08-16.md |
8-16 09:00 | 15 件立标池双向锚第 4 日稳态实测,llm-infra 主分类 0 件 net-new(#3 LLMRouter 94▲ + #14 混合线性注意力 19▲ 续立微强) | |
inbox/tom/2026-08-16-evaluation-e1prep.md |
8-16 15:43 | 5 件沿用(含 LLMRouter / DarwinX / PlayWorld)= llm-infra 邻接级 | |
inbox/flyp/2026-08-16-multimodal-e1prep.md |
8-16 09:43 | 0 件 llm-infra 主分类 net-new(v51 已吸纳 8-15 全部) | |
inbox/flyp/2026-08-15-multimodal-e1prep.md |
8-15 09:43 | multimodal 主轴 0 件 llm-infra net-new | |
inbox/flyp/2026-08-15-coding-agents-e1prep.md |
8-15 23:24 | coding-agents 主轴 0 件 llm-infra net-new | |
inbox/spark/2026-08-16-agent-e1prep.md |
8-16 13:35 | 5 件 net-new 备料 = Spec-First arXiv:2608.12440 + MCP 2026-07-28 协议层独立增量 + Sakana AI Conductor(待核)+ @jerryjliu0 context 护城河 + NoLiMa 短审稿旧文归类 = llm-infra 邻接级沿用(MCP 2026-07-28 stateless) | |
inbox/spark/2026-08-15-llm-infra-e1prep.md |
8-15 18:43 | §IX 48 沿用 12 件候选(5 主轴级 + 7 邻接级) | |
inbox/stephen/2026-08-16-1245-stephen-coordination-check-noon.md |
8-16 12:49 | 🔥 P0 警示源:OpenSandbox 学术背书待补 + Qwen3.8-27B-FP8 论文 ID 待补 + LangChain "72.6%" 数字硬错 + StateFlow 作者组机构错误 + Sakana Conductor arXiv 待核 | |
inbox/stephen/2026-08-16-0910-news-x-vip-radar.md |
8-16 09:10 | Gemini 3.7 Flash + DeepMind SL2T + WeatherNext + Qwen3.8-27B = multimodal 主轴 0 件 llm-infra net-new | |
inbox/stephen/2026-08-16-1002-news-google-ai.md |
8-16 10:02 | Google Cloud MCP stateless 部署指南(Kurtis Van Gent + Alan Blount 双署名)= §IX 48 §1.(5) Agent 框架立基础延展沿用 |
5. 本轮总结
本轮 E1 预消化结论:低密度续立棒 + 高密度邻接棒(2 主轴级 + 4 邻接级 = 6 条 net-new 候选)
本场 24h 窗口(8-15 18:40 → 8-16 18:40)对 llm-infra 主轴而言属于 低密度续立棒 —— §IX 48 轮已于 8-16 05:00 完成对 8-15 evening 全 12 件候选的吸纳(5 主轴级 + 7 邻接级),本场严格意义上的 net-new 候选仅 6 件(2 主轴级 + 4 邻接级),相较 §IX 48 轮的 12 件净增量呈现显著回落。最关键结构性信号是:
- 🔴 paper_cards 8-16 当日主分类 llm-infra net-new = 0 件:连续第 6 个 llm-infra 主分类零新增日(vs 8-15 3 件立基础延展候选级 = RMM/Hybrid-Policy/Thought-Level Beam Search);新增 2 张均为 multimodal/agent 邻接级(955 Context-Matched Distillation + 957 Spec-First AI Coding Agent),与立标池饱和度机制 v44-v50 七日连续供给侧枯竭形成横向印证
- 🔴 jay 8-16 evening briefing 6 件 Backend/Inference 实质增量 + 🔴 OpenVINO 2026.3 GGUF 直接读取 + EAGLE-3 跨硬件支持 + 🔴 Ling-3.0-tiny 7.9B 1.3B 激活 MoE Day-0 + HF State of Open Models Summer 2026 = §IX 48 §1.(1) + §1.(3) + §1.(5) + §1.(9) + §1.(11) + §1.(12) + §1.(13) 跨子轴邻接级工程细节补丁
- 5 P0 待核实警示(OpenSandbox 学术背书 + Qwen3.8-27B-FP8 论文 ID + Sakana Conductor arXiv:2605.XXXXX + KV Sharing/mHC/Compressed Attention 基准 + Maglev paper_card 主分类)
建议今夜活文档接力棒(§IX 49 轮)重点:
§1.(1)推理引擎 6+4+3 → 新增 OpenVINO 2026.3 GGUF 直接读取 + DeployBase A100 Llama 70B 5 引擎量化对照(vLLM 3,500 / SGLang 2,800 / TGI 2,500 / TensorRT-LLM 4,500 / llama.cpp 20 tokens/s)作为 A100 列补丁;与 §IX 48 Spheron H100 TensorRT-LLM 2,100 / SGLang 1,920 / vLLM 1,850 形成跨硬件横向对照§1.(3)KV Cache 14 路线 → 新增 GPUYard KV Cache 公式化(Llama 2 70B 32K = 10.74GB)+ GQA 重要性 + PagedAttention 碎片 60-80% → <4% 利用率 +2-4× 工程数学基础补丁§1.(2)推理调度 9+1+1+2 → 新增 Mix-Quant(Prefill 量化更激进,Decode 更精准)+ KVServe(KV 传输压缩)作为 §IX 48 立基础延展邻接级新兴方向§1.(9)量化经济学 → 新增 Jarvis Labs CPU Offloading 实测数字(+5.4% 吞吐 / -15.8% TTFT / 99.65% GPU 利用率)作为 memory-bound 优化路径补丁§1.(11)Kernel/AI 自动化/Harness → 新增 vLLM 官方生产质量 CI 流程博客(2026-07-15)作为推理引擎自身质量门控子维度补丁§1.(6)向量 DB 13 件套 → 新增 HubSpot 200 亿向量 Qdrant + HNSW 检索架构作为规模生产案例补丁§1.(13)边界扩展 45 → 46-48 子轴候选(待学术背书补全)→ Maglev paper_card 960(主分类 engineering,非 llm-infra,待修订)+ Ling-3.0-tiny 阿里 MoE + OpenSandbox 阿里沙箱 12.4k ⭐(学术背书待补)+ HF State of Open Models Summer 2026(1M 数据集里程碑 + 1.5% 仓库 99.2% 下载量极端长尾)§1.(7)推理经济学 34 → 35 件套扩面 → Jarvis Labs CPU Offloading +5.4% 吞吐 + 99.65% GPU 利用率 = 第 35 件套候选- P0 待核 5 件 → OpenSandbox 学术背书待补 + Qwen3.8-27B-FP8 论文 ID 待补 + Sakana Conductor arXiv:2605.XXXXX 待核 + KV Sharing/mHC/Compressed Attention 基准待补 + Maglev paper_card 主分类修订
无显著新增量的领域: - vLLM MRV2 原生 transformers 后端(450+ 架构,§IX 47 沿用) - C2KV KDD 2026 / Memory-Centric CXL+PIM(§IX 47 沿用) - vLLM 0.19 P-EAGLE + FlexKV + gRPC(§IX 47 沿用) - 阿里云函数计算 SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5 压测版本号(§IX 47 沿用) - vLLM GPU crash rate 三档实测(§IX 47 沿用) - TGI 维护模式 8-14 再次官方确认(§IX 47 沿用) - HF Inference Endpoints vLLM 集成(§IX 47 沿用) - Salesforce Compound AI 8000 企业 1360 亿 Token(§IX 48 沿用) - NVIDIA Dynamo 1.0 + vLLM V1 重构 + Qwen3.8-2.4T-A95B Day 0 + KServe v0.17 + llm-d CNCF v0.7 + Red Hat AKS/CKS(§IX 48 沿用) - MCP 2026-07-28 stateless 架构升级(§IX 48 沿用) - Nexus arXiv:2507.06608 + Not All Prefills Are Equal arXiv:2603.13358(§IX 48 沿用) - KV Cache Transform Coding ICLR 2026 + Queueing-Theoretic ICML 2026(§IX 48 沿用) - AWQ INT4 14.7→4.2GB 3× 并发 CSDN(§IX 48 沿用) - Spheron H100 Benchmark TensorRT-LLM 2,100 / SGLang 1,920 / vLLM 1,850(§IX 48 沿用) - GPT-5.6 Sol Ultrafast Cerebras 750 tok/s 14× + KV Sharing/mHC/Compressed Attention(§IX 48 沿用) - OpenART 252▲ 续立反弹加强 +68▲ +37.0% + 立标池双向锚 6 向并存(§IX 48 沿用) - Thought-Level Beam Search arXiv:2608.08020(§IX 48 沿用)
边界说明:本棒仅写入 inbox/spark/2026-08-16-llm-infra-e1prep.md;未读取 organized/knowledge/llm-infra.md 全文(由今夜活文档接力棒 §IX 49 负责更新)。
spark · 2026-08-16 18:40 CST · E1 日间预消化轮 · llm-infra 主题 · §IX 49 备料