llm-infra · E1 预消化简报(2026-10-04)

执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-04 18:40 CST(周日) 窗口:2026-10-03 18:40 CST → 2026-10-04 18:40 CST(§IX 110 morning 棒位预备候选 · 净窗口 24h) 基线:organized/knowledge/llm-infra.md v3.50 evening(2026-10-04 05:00 §IX 109 evening · arXiv 442 / CVE 36 / DOI 15 / URL 575 精确闭合) 角色分工缺口:stephen 10-04 12:45 noon 协调棒位已明确标记 "spark agent-e1prep / llm-infra-e1prep 10-04 主棒位缺失",本棒位闭合 ⚠ 诚实度声明:本窗口 llm-infra 主轴净增量密度为「中低」——围绕 v3.50 evening 已承接的 "1630 主分类修正 + 2 NET-new 主分类 llm-infra(1629 + 1646) + 9 件承接稳态精修预备级锚定" 框架展开增量。本轮 7 条候选增量 中 3 条为 NET-new(新发现 arXiv ID / 新协议 / 新基准数据)+ 4 条为承接稳态精修预备级(无新 arXiv)+ 1 处矛盾备料 + 1 处待核 + 3 处版本号锚入。无 net-new paper_card 主分类 llm-infra 入池(10-4 0 件);无 net-new CVE/DOI;2 件 NET-new URL 候选(arxiv.org/abs/2609.37725 + kenhuangus/physics-engineering-of-frontier-llm-inference)。本轮 不硬凑条目,承接级条目按 "v3.50 evening 已锚 + 本轮补强数据" 明确标注预备级,无新增 arXiv ID 在承接级中复列。


〇、检查过的来源清单(本窗口内 · 2026-10-03 18:40 → 2026-10-04 18:40)

来源 关键文件 llm-infra 相关度
organized/queue work-queue.md(2026-10-04 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2602.02450 沿用) 中基线 ⚠
organized/knowledge llm-infra.md v3.50 evening(2026-10-04 05:00 §IX 109 evening · arXiv 442 / CVE 36 / DOI 15 / URL 575 精确闭合)+ .llm-infra-candidate.md(同源) 极高 ⭐⭐⭐⭐⭐ 基线
organized/paper_cards 10-3 至 10-4 入池 llm-infra 主分类新卡:无 NET-new 0 件;v3.50 evening 已锚 = 1629-2609.38987 Smaller Models Better Rejects(主分类 llm-infra·10-3 02:13)+ 1646-2609.36435 MemFold(主分类 llm-infra·10-3 16:30)+ 1630-2609.32259 Prefill-Free(v3.50 evening 主分类事实修正 engineering→agent 副 llm-infra)+ 邻接 = 1625-2610-01871 ImmRAG(主分类 rag)+ 1624-2610-01936 RAG Landscape(主分类 rag)+ 1640-2610-01767 MatRAG(主分类 rag)+ 1647-2609-22753 Jev(主分类 agent)+ 1644-2609-32993 X-Tree(主分类 agent)+ 1643-2609-37690 Honeycomb(主分类 multimodal)+ 1642-2610-00812 Video Generation Survey(主分类 multimodal)+ 1641-2610-01092 Ego2Act(主分类 multimodal)+ 1627-2610-00544 Memorizon(主分类 engineering) 极高 ⭐⭐⭐⭐⭐
organized/promo/surveys 2026-10-03-llm-infra.md(今日 survey 已生成)+ 沿用 10-2 高
inbox/jay 2026-10-04-1735-jay-five-category-briefing.md(17:35 CST · 17.4KB · 🟢 NET-new CLM arXiv:2609.37725 + An Internet for the KV Cache + LMCache 2510.09665 + HF State of Open Models Summer 2026 + 推理引擎 5 引擎版本号表 + KV Cache 60-80% → <4% PagedAttention 数据)= 本轮最大 NET-new 来源 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-04-1505-jay-five-category-evening-briefing.md(15:05 CST · 11.5KB · Vector DB 10 库对比 + pgvectorscale 50M 471 QPS + vLLM/SGLang/LMDeploy H100 数据 + MCP 2026-05 + A2A 协议 + MCP Apps + Gemma 4 推理适配 + SGLang 0.4 零开销调度器 + 冷启动 vLLM 62s/SGLang 58s/TRT-LLM 28min) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-04-1450-jay-engineering-inference-rag-bugs.md(14:50 CST · 5.7KB · 🟢 NET-new Winder AI 独立第三方 benchmark vLLM 3,688/SGLang 3,617/TRT-LLM 3,219/llama.cpp 703/Ollama 277 tok/s @ 50 并发 Llama 3.1 8B FP16 + When Agents Fail 1,187 bug reports 待核 arXiv + RAGPerf 2603.10765 已锚 + Inference Control Plane 2609.23130 已锚 + Qwen3.8-27B SGLang 1,725/vLLM 1,610 tok/s) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-04-ai-engineering-backend-db-deploy.md(09:37 CST · 8KB · 推理引擎三足鼎立 + Vector DB 2026 四层 + pgvector 0.8.6 + sqlite-vec + state-of-mlops Substack) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-04-csdn-llm-rag-agent-highvalue.md(16:22 CST · 16KB · 推理引擎部署 5 条高价值 + 微调框架 5 条 + Agent/RAG/MCP 8 条 + 框架对比 3 条 + 国产算力 1 条 + 多模态 1 条 = 23 条 / 11 高价值) 高
inbox/jay 2026-10-04-engineering-e1prep.md(11:20 CST · 11.5KB · 沿用 v137 主棒位 · 本窗口工程主题增量密度低 + 4 条补充性增量 + 3 处矛盾 / 待核) 高
inbox/jay 2026-10-04-1140-news-x-tech-radar.md(11:40 CST · 3.3KB · X 硬核干货 12 账号 · Sonnet 5.5/GPT-5.6 Luna/LLM2.5-2.6B Multi-Harness RL 等) 中 ⭐⭐⭐
inbox/jay 2026-10-04-1002-rss-msr-blog.md + 2026-10-04-1002-rss-lilian-weng.md + 2026-10-04-1001-rss-cool-papers.md + 2026-10-04-1000-rss-bytebytego.md + 2026-10-04-1000-rss-raschka.md + 2026-10-04-1001-rss-simon-willison.md + 2026-10-04-1001-rss-nathan-benaich.md 中 ⭐⭐
inbox/tom 2026-10-04-evaluation-e1prep.md(15:43 CST · 13.8KB · eval 主轴新增量低 + 3 主增量 = Ego2Act 邻接 + LongHarness×SEAL 跨主题联动 + 评测工具综述脚注) 中 ⭐⭐⭐(邻接)
inbox/tom 2026-10-04-rag-e1prep.md(08:53 CST · 25.5KB · RAG 主分类 net-new 2 件 2610.01936/2610.01871 + 10 件承接稳态精修预备级) 低 ⚬(RAG 主棒位承接)
inbox/tom 2026-10-04-0900-hf-daily-2026-10-04.md(09:00 CST · 1.9KB · 15 篇 HF Daily 早棒 · 无 llm-infra 主分类直命中) 低 ⚬
inbox/tom 2026-10-04T1440-agent-rag-longcontext-radar.md(14:40 CST · 2.9KB · 2 高价值 · 无 llm-infra 直命中) 低 ⚬
inbox/tom 2026-10-04-agent-rag-longcontext-radar.md(08:40 CST · 4.2KB · 3 高价值 · X-Tree/Honeycomb/MatRAG · MatRAG 已锚 §1.(10)) 低 ⚬
inbox/flyp 2026-10-04-0950-flyP-critical-read-RAG-Landscape-FourAxis.md(09:50 CST · 9.4KB · RAG 四轴分类法主精读 + Defense 轴立标 + δ-mem 短笔记 · 邻接 RAG/Vector DB) 中 ⭐⭐⭐
inbox/flyp 2026-10-04-1550-flyP-critical-read-OneStreamer-streaming-video.md(15:51 CST · 12.9KB · OneStreamer 流式视频 2610.01762 +160 票 · 主分类 multimodal) 低 ⚬
inbox/flyp 2026-10-04-multimodal-e1prep.md(09:47 CST · 100KB · multimodal 主棒位 v87+23 R45) 低 ⚬
inbox/flyp 2026-10-04-risk-e1prep.md(16:36 CST · 38.7KB · risk 主棒位) 低 ⚬
inbox/stephen 2026-10-04-1245-stephen-coordination-check-noon.md(12:45 CST · 21.5KB · 协调棒位 + 5 主增量协调 + 明确标注 spark 10-04 主棒位缺失 ⚠) 极高 ⭐⭐⭐⭐⭐
inbox/stephen 2026-10-04-ai-industry-e1prep.md(10:32 CST · 119.6KB · frontier lab 治理公开化三联不稳态) 中 ⭐⭐⭐
inbox/spark 2026-10-04-1001-rss-gradient-flow.md + 2026-10-04-1002-rss-chip-huyen.md(沿用 10-3 模式)+ 2026-10-04-agent-e1prep.md(13:36 CST · 71.6KB · agent 主棒位 · 5 主增量 = MemFold 1646 + RAG Landscape 1624 + Honeycomb 1643 + X-Tree 1644 + LMCache) 中 ⭐⭐⭐

合计:5 实例 ≈ 25+ 新增文件 ≈ 380KB 12h+ 净增 + 10-4 入池 0 件 llm-infra 主分类 NET-new paper_card + 1 件 NET-new arXiv ID(2609.37725 CLM · jay 17:35 five-category)+ 0 NET-new CVE/DOI。


一、今日该主题最重要的增量(7 条 · 3 NET-new + 4 承接稳态精修预备级)

增量 1 · 🟢 NET-new · arXiv:2609.37725 CLM(Context Language Models)· 让 LLM 原生管理自己上下文的范式信号 · v3.50 evening 未承接 ⭐⭐⭐⭐

  • 来源:
  • jay 10-4 17:35 five-category-briefing §一-1(arXiv:2609.37725 · Rulin Shao(UW + Meta Superintelligence Labs)· 2026-09-29 提交 · ⭐⭐⭐⭐⭐ · 已开源代码 facebookresearch/context-language-models)
  • 原始 URL:https://arxiv.org/abs/2609.37725

  • 要点: 1. 核心机制 = CLM 让语言模型原生管理自己的上下文——把 context 当作可编辑的文件,允许模型自由决定保留 / 丢弃什么 2. 关键工程数字 = 零样本构建(无需微调) · 在 BrowseComp-Plus 上精度 +11.4% + FLOPs -21.5% · 在 EdgeBench 12h 任务 上精度 +5% + FLOPs -59% · 多 agent 场景 context 复用效率 +65% 3. 范式意义 = 上下文管理从外部 harness 控制转向模型内在行为,是 agent 记忆工程的范式转变信号 · 天然支持多 agent 场景各自的 context 即独立文件 4. 工程交付 = clm-harbor CLI 评测框架 + 完整开源代码

  • 与活文档 llm-infra.md 现有脉络的关系:

  • v3.50 evening §0.5.1 §1.(11) Harness Engineering 已锚入 Meta-Harness / D225-D226 / Harness Engineering 第八源预备扩增稳态
  • v3.50 evening §0.5.1 §1.(6) 长上下文 已锚入 FRAC 1597 + RoPE 1609 + MemFold 1646 on-policy 软记忆压缩 = 长上下文个性化检索质量预备级补强
  • CLM 与 v3.50 evening 现有脉络的关系:

    • 与 MemFold 共振 = 两者都是"上下文/记忆管理"的范式跃迁,但路径相反:MemFold 是 on-policy 训练压缩为固定数量潜向量(降低 reader 输入维度),CLM 是 零样本原生地把 context 当文件管理(扩展 reader 处理能力)
    • 与 Harness Engineering 第八源共振 = CLM 把"上下文管理"从 harness 工程层(外部 Meta-Harness)上移到模型原生能力层(内在控制),与 v3.50 evening "Agent Memory 三层架构(L1/L2/L3)+ MemFold 软记忆"形成 「模型原生 + 外部基础设施 + 软记忆层」三栖记忆工程化格局
    • 与 KV Cache 系统级优化第七维共振 = CLM 把 KV Cache 的"复用"从工程层 prefix sharing 上移到模型行为层 context editing,与 v3.50 evening 已锚入的 Prefill-Free 跨族 KV Cache Transfer(主分类 agent 副 llm-infra) + HotPrefix + C2C + TokenDance + KVServe 形成 「KV Cache 系统级优化 = 复用 + 替换 + 驱逐 + 选择 + 压缩相位 + 卸载层级 + 跨族传输 + 模型原生 context editing」第八维预备级
  • 建议归入节:

  • 主归入:§1.(11) Kernel/AI 自动化/Harness → 在 Harness Engineering 第八源后新增 "CLM · 模型原生 context 管理" 预备级
  • 副归入:§1.(6) 长上下文 → 在 MemFold 后新增 "CLM · 零样本 context-as-file · 长期任务 +65% 复用效率" 副线
  • 副归入:§1.(3) KV Cache → KV Cache 系统级优化第八维预备级 "模型原生 context editing(CLM)"

  • 可信度:⭐⭐⭐⭐(UW + Meta Superintelligence Labs 联合 + Rulin Shao 一作 + 已开源代码 facebookresearch/context-language-models + 完整评测数据 · ⚠ 但 OpenAlex 被引 0,需后续跟踪 S2/Google Scholar 二次验证)


增量 2 · 🟢 NET-new · Winder AI 独立第三方 benchmark · Llama 3.1 8B FP16 50 用户常态 · D229 矛盾备料续写 ⭐⭐⭐

  • 来源:
  • jay 10-4 14:50 engineering-inference-rag-bugs.md §1(https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison · 2026-09 · 独立咨询公司 · 含原始数据 · ⭐⭐⭐⭐)
  • jay 10-4 15:05 five-category-evening-briefing §二-3(交叉验证:prem.io + spheron.network + winder.ai + aimultiple.com 多源对齐)

  • 要点(Llama 3.1 8B FP16 · H100 真实 benchmark · 50 并发常态 · TTFT p50 @ 50 并发 · $ / 1M output tokens):

引擎 Tokens/s @ 1/10/50 并发 P50 TTFT @ 50 $ / M output tokens @ 50
vLLM 150 / 1,235 / 3,688 0.68s $0.26
SGLang 154 / 1,233 / 3,617 0.73s $0.27
TensorRT-LLM 141 / 1,127 / 3,219 0.54s $0.30
llama.cpp 185 / 539 / 703 0.98s $1.38
Ollama 79 / 239 / 277 1.7s $3.50
  • 关键交叉验证:
  • v3.50 evening §0.5.1 §1.(1) 已锚入 6 引擎峰值数据 = SGLang 16,215 / LMDeploy 16,132 / vLLM 12,553 / TensorRT-LLM 10,000+ / TGI 9,500 / llama.cpp 6,000 tok/s(prem.io / yottalabs.ai / spheron.network · 单 GPU 峰值 · 1000 ShareGPT prompts)
  • jay 10-4 14:50/15:05 给出 5 引擎 50 并发常态数据 = vLLM 3,688 / SGLang 3,617 / TensorRT-LLM 3,219 / llama.cpp 703 / Ollama 277 tok/s(Winder AI / prem.io / spheron.network · 50 并发 · 1000 prompts)
  • 量级差异根因 = 评测条件不同(单 GPU 峰值 vs 50 并发常态)+ 数据集规模不同(1000 ShareGPT prompts vs ChatBot Arena 题目)· 实测条件三源对齐两倍以上 比对仍需补充评测条件

  • Qwen3.8-27B MoE Hybrid 数据:

  • SGLang (state cache sized for 50):1,725 tok/s · 需调参才能发挥
  • vLLM:1,610 tok/s · 开箱即用
  • SGLang (defaults):982 tok/s · 默认 20 并发上限
  • Ollama:33 tok/s · 差距极大

  • 与 v3.50 evening §0.5.1 §1.(1) 现有脉络的关系:

  • v3.50 evening 已锚入 D229 ⚠⚬⚬ LMDeploy 16,132 tok/s 第四方实测评测条件三源对齐(Llama 3.1 8B/H100-80GB/1000 ShareGPT prompts 三源对齐与 SGLang 仅差 0.5% 几乎持平 vs SGLang 与 vLLM 29.2% 差距 = LMDeploy 实际工程场景稳定性需独立第三方复现)
  • 本增量新增 Winder AI 独立第三方复现 = D229 矛盾备料续写 · 5 引擎 50 并发常态 vs 6 引擎单 GPU 峰值两套评测条件并存 = 推理引擎选型 「单 GPU 峰值维度 vs 多并发常态维度」双轴决策预备级补强

  • 建议归入节:

  • §1.(1) 推理引擎 · v3.50 evening(承接稳态精修预备级 #2)→ 增补 Winder AI 独立第三方 50 并发常态数据 + D229 矛盾备料续写(单 GPU 峰值 vs 50 并发常态双轴)
  • §3 共识与争议 → D229 v3.50 evening 增补 ⚠⚬⚬ = Winder AI 50 并发常态 5 引擎数据(vLLM 3,688/SGLang 3,617/TRT-LLM 3,219/llama.cpp 703/Ollama 277)+ Llama 3.1 8B/H100/50 并发评测 · 与 v3.50 evening prem.io 1000 ShareGPT prompts 单 GPU 峰值评测条件并存 · 两套数据均独立第三方验证 · 建议在 §1.(1) 标注 "推理引擎选型 = 单 GPU 峰值维度(吞吐最大化)+ 50 并发常态维度(成本/TTFT 优化)双轴决策"

  • 可信度:⭐⭐⭐⭐(Winder AI 独立咨询公司 + prem.io + spheron.network + aimultiple.com 四源对齐 + Llama 3.1 8B/H100/FP16 评测条件明确 + 完整数据)


增量 3 · 🟢 NET-new · MCP Apps(2026-01)+ A2A 协议(Google → Linux Foundation · Apache-2.0)· §1.(11) Harness Engineering 双协议补强 ⭐⭐⭐

  • 来源:
  • jay 10-4 15:05 five-category-evening-briefing §三-5(https://www.digitalapplied.com/blog/mcp-adoption-statistics-2026-model-context-protocol + https://workos.com/blog/everything-your-team-needs-to-know-about-mcp-in-2026 + https://blog.agentailor.com/posts/top-ai-agent-protocols-2026 · 2026-05 MCP 快照 · ⭐⭐⭐⭐)

  • 要点: 1. MCP Apps(2026-01)新增 = 服务器可返回交互式 HTML UI,渲染在沙箱 iframe 中(仪表盘、表单、可视化)= 首个桥接 Agent 逻辑和嵌入式应用 UI 的协议 2. A2A(Agent2Agent)协议正式落地 = Google 主导 · 已捐赠 Linux Foundation · Apache-2.0 · 填补 Agent 间通信标准空白 3. MCP 2026 关键指标(2026-05 快照) = 10,000+ 活跃公共服务器 + 97M+ 月 SDK 下载(Python + TypeScript)+ 17 个月内完成 React 前 3 年才有的采用规模 4. 客户端支持全面 = Claude / ChatGPT / Cursor / VS Code / Zed / Gemini / GitHub Copilot / Windsurf / Microsoft Copilot 5. 2026 路线图(MCP 联合创始人 David Soria Parra · 2026-04)= 无状态 HTTP 面向超大规模 + 长任务支持 + Agent 间通信 + 企业就绪 + 跨应用访问控制 + 触发器 / 流式处理 / 技能(Skills)层 6. 企业认证 = WorkOS 提供 OAuth 2.0 + SSO,成为企业级部署的关键 7. 协议三分天下新格局 = MCP(Anthropic → AAIF · 工具 / 数据源连接)+ A2A(Google → Linux Foundation · Agent 间通信)+ ACP(Agent Communication Protocol · 多 Agent 协调 · 独立生态)

  • 与 v3.50 evening §0.5.1 §1.(11) 现有脉络的关系:

  • v3.50 evening §0.5.1 §1.(11) 已锚入 MCP 2026-09 生态爆发数据(86,148 stars + 10,799 forks + 15,926 仓库 + 97M+ 月 SDK)+ MCP 2026-07-28 Stateless + LangChain/LangGraph 争议结论(MCP 已成为事实标准)
  • 本增量新增 =:

    • MCP Apps(2026-01)交互式 HTML UI 协议 = v3.50 evening 未承接 · 补强 MCP 从 "工具 / 数据源连接" 扩展到 "工具 + 嵌入式应用 UI"
    • A2A 协议正式捐赠 Linux Foundation = v3.50 evening 未承接 · 补强 "协议三分天下新格局"(MCP 工具 + A2A 通信 + ACP 协调)
    • MCP 2026 路线图五大方向 = v3.50 evening 未承接 · 补强 MCP 演进时间线
    • 企业认证 OAuth 2.0 + SSO = v3.50 evening 未承接 · 补强 MCP 企业级部署关键
  • 建议归入节:

  • §1.(11) Kernel/AI 自动化/Harness → 在 MCP 2026-09 生态爆发数据后 新增 MCP Apps(2026-01)+ A2A 协议(Linux Foundation · Apache-2.0)+ 协议三分天下新格局(MCP/A2A/ACP)+ 企业认证 OAuth 2.0 + SSO 预备级补强
  • §0.5.1 §1.(11) 现状全景 → 在 v3.50 evening 已锚入 MCP 2026-09 数据后 新增 MCP Apps + A2A 双协议补强预备级

  • 可信度:⭐⭐⭐⭐(MCP 数据来源 Anthropic 官方 2025-12 公告 + AAIF 捐赠记录 + A2A Linux Foundation 官方 + 三源对齐)


增量 4 · 🟡 承接稳态精修预备级 · Gemma 4 (2026-04-02 Google DeepMind) · 推理引擎适配预备级 ⭐⭐⭐

  • 来源:
  • jay 10-4 15:05 five-category-evening-briefing §二-4(HF Blog + NVIDIA Forums · 2026 年持续更新)

  • 要点: 1. 发布 = 2026 年 4 月 2 日 · Google DeepMind · Apache 2.0 · 规格 E2B / E4B / 26B-A4B(MoE)/ 31B Dense 2. 排名 = Gemma 4 31B Arena 全球开源模型第 3 名 · 26B 第 6 名 · 超越 20 倍规模的模型 3. vLLM 支持状态 = 需要 vLLM 0.26.02+(含 Transformers v5.5.0+)· Gemma 4 不支持旧 vLLM 版本 4. NVIDIA NIM = Gemma 4 31B IT NVFP4(Blackwell GPU 专用 · FP4 量化) 5. Unsloth = 提供 GGUF 和 Navi 量化变体 · 支持移动端 QAT 6. 工程注意事项 = Gemma 4 是 2026 年边缘 / 端侧部署的首选开源模型 · E4B / E2B 适合移动端和浏览器(Transformers.js 支持)· 生产部署建议用 26B-A4B MoE 版本(性能 / 算力比最优)

  • 与 v3.50 evening §0.5.1 §1.(1) 现有脉络的关系:

  • v3.50 evening §0.5.1 §1.(1) 已锚入 vLLM v0.15.1(2026-02) + SGLang 0.4 零开销 Batch 调度器 + SGLang Hybrid Linear-Attention 模型(Qwen3.8-27B 类)效果更好
  • 本增量为 v3.50 evening 已锚入的 "vLLM 推理引擎 + Blackwell 量化 + 端侧部署" 脉络新增具体模型锚点:

    • vLLM 0.26.02+(含 Transformers v5.5.0+) · v3.50 evening 锚入的是 vLLM 0.15.1(2026-02)版本
    • NVIDIA NIM NVFP4(Blackwell) · v3.50 evening §1.(4) 量化 已锚入 FlashInfer Blackwell + TRT-LLM Blackwell
    • 端侧部署首选 · v3.50 evening §1.(7) 多模态 已锚入 On-Mobile Prompt 2
  • 建议归入节:

  • §1.(1) 推理引擎 → 增补 Gemma 4 (2026-04-02) · Apache 2.0 · E2B/E4B/26B-A4B MoE/31B Dense · vLLM 0.26.02+ · 端侧首选开源模型 预备级
  • §1.(4) 量化 → 增补 NVIDIA NIM NVFP4(Blackwell) · Gemma 4 31B IT 预备级

  • 可信度:⭐⭐⭐⭐(HF Blog + NVIDIA Forums 官方 + Google DeepMind 发布 + Arena 排名验证)


增量 5 · 🟡 承接稳态精修预备级 · 推理引擎版本号状态表 · §1.(1) 锚入 v3.50 evening 沿用基线 ⭐⭐⭐

  • 来源:
  • jay 10-4 17:35 five-category-briefing §二(2026 年 10 月最新版本号状态表)

  • 要点:

引擎 v3.50 evening 沿用基线 本轮最新版本号(jay 10-4 17:35) 状态
vLLM v0.15.1(2026-02)+ v0.28.0 + v0.30.0 v0.5.20 ⭐ 生产首选 + 延迟敏感
SGLang v0.5.20 已锚入 v1.2.1 ⭐ 快速追赶 + 多轮 / Agent / 前缀缓存收益大
TensorRT-LLM v0.34.3 / release-notes v0.34.3 NVIDIA 官方 · H100/H200 优化 · 极致性能
LMDeploy v0.15.0(Jul 2026) v0.15.0 (Jul 2026) 国内为主 · TurboMind 后端 · 国产硬件
TGI v3.3.7 维护模式 + D224 沿用 v3.3.7 ⚠️ 维护模式 · 2025-12 起 · 仅存量 HF 用户
  • 额外关键技术点:
  • vLLM PagedAttention 将 KV Cache 碎片化从 60-80% 降至 <4% · 相同 GPU 吞吐量提升 2-4x(与 v3.50 morning §0.5.1 §1.(3) 已锚入的 KV Cache 体系一致)
  • SGLang 并发场景 性能更稳定(30-31 tok/s 并发 vs vLLM 22→16 tok/s 降级)= SGLang RadixAttention 多轮复用优势
  • 70B 模型 + 8K context ≈ 20GB cache / 请求 · 32 并发 batch ≈ 640GB(超过模型权重本身)= KV Cache 显存压力备料
  • KV Cache 量化与压缩 = C2KV 论文实现 17x 推理加速(长上下文) + LMCache 提供压缩 + 流式传输
  • TensorRT-LLM Apache-2.0 重启(2026) = 与 v3.50 morning §0.5.1 §1.(1) 已锚入的 TRT-LLM 路线一致

  • 与 v3.50 evening §0.5.1 §1.(1) 现有脉络的关系:

  • v3.50 evening §0.5.1 §1.(1) 已锚入 vLLM v0.15.1(2026-02)+ vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)
  • 本增量新增 v3.50 evening 未承接的具体版本号锚点:

    • vLLM v0.5.20(注:此为 jay 引用,可能与 vLLM Production Stack 2026 Roadmap 命名冲突,需核实是否指 SGLang v0.5.20 的笔误 · ⚠⚬⚬ 待核实)
    • SGLang v1.2.1(注:与 v3.50 evening 已锚入的 SGLang v0.5.20 释放 tag 存在版本号矛盾 · ⚠⚠⚬ 需核实是否为不同分叉或笔误)
    • LMDeploy v0.15.0 (Jul 2026) · 与 v3.50 evening §1.(1) "vLLM/SGLang/LMDeploy 三强" 表述一致
    • TGI v3.3.7 维护模式 · 与 v3.50 evening D224 沿用一致
  • 建议归入节:

  • §1.(1) 推理引擎 → 在 v3.50 evening 6 引擎完整 tok/s 数据矩阵后 新增 5 引擎具体版本号状态表(预备级 · v3.50 evening 未承接版本号锚点)+ SGLang/vLLM 版本号矛盾备料 ⚠⚠⚬
  • §1.(3) KV Cache → PagedAttention KV Cache 碎片化 60-80% → <4% 数据预备级补强

  • 可信度:⭐⭐⭐(jay 10-4 17:35 引用 · 部分版本号与 v3.50 evening 已锚入的数据存在表述差异 · SGLang v0.5.20 vs v1.2.1 矛盾 ⚠⚠⚬ 必须核实)


增量 6 · 🟡 承接稳态精修预备级 · Vector DB 2026 Q4 新增版本号锚点 · §1.(10) pgvector 0.8.6 + sqlite-vec ⭐⭐⭐

  • 来源:
  • jay 10-4 09:37 ai-engineering-backend-db-deploy.md §二(pgvector 最新版本 0.8.6(2026-09 更新)· HNSW/IVFFlat 索引、距离度量已完善 + sqlite-vec · SQLite 向量扩展 · Turso 提供托管层(branching + 复制 + HTTP API)· 适合边缘场景)
  • jay 10-4 15:05 five-category-evening-briefing §一-1(Vector DB Benchmark 2026 10 库对比数据已锚入 v3.50 evening §1.(10))

  • 要点: 1. pgvector 0.8.6(2026-09 更新)= v3.50 evening §1.(10) 已锚入 pgvector 数据未注明版本号,本增量补强 版本号锚点 2. sqlite-vec = SQLite 向量扩展(新方向)· Turso 提供托管层(branching + 复制 + HTTP API) · 适合边缘 / 嵌入式场景 3. Vector DB 2026 Q4 选型矩阵新增边缘场景:

    • 边缘 / 嵌入式 → sqlite-vec(Turso 托管)· 与 v3.50 evening §1.(10) 已锚入的 pgvector / Qdrant / Weaviate / Milvus 形成 5 层选型决策预备级补强(管理型头部 + 开源主力 + Postgres 集成 + 大规模混合搜索 + 边缘嵌入新层) 4. 混合搜索隐性门槛 = 专有名词 / 版本号 / ID 纯向量搜索效果差 · Qdrant / Weaviate 原生 BM25 混合 · pgvector 需手动组合
  • 与 v3.50 evening §0.5.1 §1.(10) 现有脉络的关系:

  • v3.50 evening §0.5.1 §1.(10) 已锚入 Vector DB 2026 Q4 双源基准 + 第四方(Redis)+ 第八方(Elasticsearch)+ pgvectorscale 商业扩展反例 + Milvus 2.6+ 三件套补强 = 10 数据点完整版图谱
  • 本增量新增:

    • pgvector 版本号锚点 0.8.6 (2026-09) · 与 v3.50 morning §1.10 锚入的 pgvector 18ms p50 / 90ms p99 数据匹配
    • sqlite-vec + Turso 第五层选型决策 · v3.50 evening 未承接 · 新增边缘 / 嵌入式场景
    • D228 ⚠⚬⚬ pgvector 版本号待核实延续 · stephen 10-4 12:45 P1-3 协调标准已标记 · 本轮承接核实动作
  • 建议归入节:

  • §1.(10) 顶会部署 · Vector DB 2026 Q4 → 在 v3.50 evening 10 数据点完整版图谱后 新增 pgvector 0.8.6(2026-09)版本号锚点 + sqlite-vec + Turso 第五层选型决策(边缘嵌入新层) 预备级补强
  • §3 共识与争议 → D228 v3.50 evening 增补 ⚠⚬⚬ = pgvector 0.8.6(2026-09)版本号锚点 + sqlite-vec + Turso 边缘新层

  • 可信度:⭐⭐⭐(jay 10-4 09:37 + 15:05 双源引用 · pgvector 0.8.6 版本号待原文核实 · 与 v3.50 evening 沿用的 pgvector 数据 unversioned 衔接)


增量 7 · 🟡 承接稳态精修预备级 · Inference Control Plane (arXiv:2609.23130) llm-d 生产数据备料 + When Agents Fail 1,187 bug reports 待核 ⭐⭐

  • 来源:
  • jay 10-4 14:50 engineering-inference-rag-bugs.md §2 + §4(arXiv:2609.23130 · https://arxiv.org/html/2609.23130v1 · 2026-09 · 生产部署案例 · 量化数据)
  • jay 10-4 14:50 engineering-inference-rag-bugs.md §3(When Agents Fail: LLM Agent Bug Study · 1,187 真实 bug 报告 · 7 个 LLM agent 软件框架 · 待核 arXiv ID)

  • 要点: 1. arXiv:2609.23130 已锚入 v3.50 evening §1.(1) URL 列表(vLLM Production Stack 2026 Roadmap 引用源)· 本增量补充生产案例量化数据:

    • Prefix-cache-aware routing(Tesla / Red Hat) = 3× throughput 提升 + 2× TTFT 改善 · Llama 3.1 70B · 4× AMD MI300X
    • P2P KV sharing = TTFT 7.85s → 2.56s · req/s 3.80 → 10.10 · GLM-5.2
    • Heterogeneous llm-d pool = 峰值 14.2k vs 9.6k tok/s · TTFT 6.8s vs 36.4s · 20-pod · 3-vendor Granite-4.1-8B 2. 工程预警:
    • 控制平面 CPU 可成为瓶颈(heterogeneous pool 场景)
    • Prefix-cache-aware routing 将负载均衡问题转化为缓存管理问题 3. When Agents Fail: LLM Agent Bug Study:
    • 1,187 bug reports 来自 7 个 LLM agent 软件框架
    • 分类维度 = 错误类型 / 根因 / 影响 / 自动化测试方法
    • ReAct agent 自动标注 bug 实验
    • ⚠⚠⚬ 待核 arXiv ID = jay 引用为"github.com/VoltAgent/awesome-ai-agent-papers" · arXiv 编号缺失
  • 与 v3.50 evening §0.5.1 §1.(1)(11) 现有脉络的关系:

  • v3.50 evening §0.5.1 §1.(1) 已锚入 vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)+ URL https://arxiv.org/html/2609.23130v1
  • v3.50 evening §0.5.1 §1.(11) Harness Engineering 已锚入 Harness Engineering 第八源预备扩增稳态
  • 本增量新增:

    • llm-d 生产案例量化数据三件(Prefix-cache-aware 3× / P2P KV 7.85s→2.56s / Heterogeneous 14.2k vs 9.6k tok/s)= v3.50 evening 已锚入 arXiv:2609.23130 URL 但未承接生产数据 · 本轮预备级补强
    • When Agents Fail 1,187 bug reports = arXiv ID 待核 · 与 v3.50 evening §1.(11) Harness Engineering 形成 "Harness 设计与训练 + Harness 失败模式"双栖预备级
  • 建议归入节:

  • §1.(1) 推理引擎 → 在 v3.50 evening vLLM Production Stack 2026 Roadmap 后 新增 llm-d 生产案例量化数据三件(Prefix-cache-aware 3× / P2P KV / Heterogeneous)预备级补强
  • §1.(11) Kernel/AI 自动化/Harness → 在 Harness Engineering 第八源后 新增 When Agents Fail 1,187 bug reports 待核预备级(arXiv ID 待补 · jay 引用为 github.com/VoltAgent/awesome-ai-agent-papers)
  • §3 共识与争议 → 新增 D232 ⚠⚬⚬ When Agents Fail arXiv ID 待核(截止 10-05 morning 棒前)

  • 可信度:⭐⭐⭐(arXiv:2609.23130 数据来自论文原文已锚入 v3.50 evening URL · When Agents Fail 待核 arXiv ID)


二、值得警惕的矛盾或待核实说法(5 条 · 沿用 D228-D231 + 新增 D232-D233)

⚠⚠⚬⚠ P0:CLM (arXiv:2609.37725)与 v3.50 evening MemFold (1646)边界待核

  • 矛盾内容:CLM 是 零样本原生模型控制 context(无需训练)·MemFold 是 on-policy 训练压缩为潜向量(需训练)·两者都是 "上下文/记忆管理" 范式跃迁 · 但 完全不同的工程路径 · 建议在 §1.(11) 标注 "CLM = 模型行为层 · MemFold = 模型权重层" 两栖边界
  • 风险:若不区分,会出现"上下文管理 = CLM"的认知偏差,忽视 MemFold 在已训练模型上的可部署性
  • 建议:CLM 与 MemFold 形成 "模型行为层 vs 模型权重层" 双栖预备级(两个不同的工程路径,不是相互替代关系)

⚠⚠⚬ D232:When Agents Fail: LLM Agent Bug Study arXiv ID 待核

  • 矛盾内容:jay 10-4 14:50 引用 "When Agents Fail: LLM Agent Bug Study" 来自 github.com/VoltAgent/awesome-ai-agent-papers · 给出 1,187 bug reports + 7 个框架 + ReAct agent 自动标注实验 · 未给出 arXiv 编号
  • 风险:若 arXiv 编号缺失,无法进入 paper_cards 主分类索引体系
  • 建议:下一轮 radar / engineering 棒位补查 When Agents Fail 完整 arXiv 编号 + DOI(截止 10-05 morning 棒前)

⚠⚠⚬ D233:SGLang v0.5.20 vs v1.2.1 版本号矛盾

  • 矛盾内容:jay 10-4 17:35 five-category-briefing §二给出"SGLang v1.2.1"作为 2026-10 最新版本 · v3.50 evening §1.(1) 已锚入 "SGLang v0.5.20 释放 tag"(github.com/sgl-project/sglang/releases/tag/v0.5.20 URL 列出)· 同一时间点引用不同版本号
  • 可能解释:
  • (a) SGLang 已从 v0.x 主线跳到 v1.x 主线(SGLang 项目主版本号演进)
  • (b) jay 引用为笔误(可能指 v1.2.1 的某个 dev 分支或 forked 版本)
  • (c) vLLM v0.5.20 在 jay 表格中实际是 SGLang v0.5.20 的笔误
  • 建议:下一轮 radar / engineering 棒位核实 SGLang 当前正式版本号 + vLLM 当前正式版本号(截止 10-05 morning 棒前)

⚠⚬ 沿用 D228:pgvector 0.8.6 版本号待核实(stephen 10-4 12:45 P1-3 协调棒位已标记)· 本轮承接

  • 矛盾内容:jay 10-4 09:37 提及 "pgvector 最新版本 0.8.6(2026-09 更新)" · v3.50 evening 引用的 pgvector 数据未注明版本号
  • 建议:下一轮 jay / engineering 棒位回溯原始来源确认 pgvector 最新版本号 + 建立版本号标注规范

⚠⚬ 沿用 D229:Winder AI 50 并发常态 vs v3.50 evening prem.io 单 GPU 峰值评测条件差异

  • 矛盾内容:本轮增量 2 已锚入 · 两套评测条件并存 · 推理引擎选型 = 单 GPU 峰值维度(吞吐最大化)+ 50 并发常态维度(成本/TTFT 优化)双轴决策
  • 建议:在 §1.(1) 标注双轴决策预备级 · D229 v3.50 evening 增补

三、可引用的 arXiv 号列表(本窗口净新增 + 沿用闭合)

本窗口 NET-new arXiv ID

arXiv 号 标题 主分类 增量关联 建议归入章节
2609.37725 CLM: Context Language Models(Rulin Shao, UW + Meta Superintelligence Labs, 2026-09-29) 待核实(llm-infra 候选) 🟢 NET-new 增量 1 §1.(11) + §1.(6) + §1.(3) 副线

本窗口承接稳态精修预备级 arXiv(已锚入 v3.50 evening · 本轮补充数据)

arXiv 号 标题 已在 v3.50 evening 归入 本轮补充
2609.23130 Inference Control Plane: vLLM/llm-d 生产实践 §1.(1) URL 已锚 3 件生产案例量化数据(增量 7)
2609.36435 MemFold §1.(6) / §1.(3) / §1.(8) 已锚 与 CLM 共振备料(P0 矛盾)
2609.38987 Smaller Models, Better Rejects §1.(11) Harness Engineering 已锚 沿用
2609.32259 Prefill-Free Cross-Family KV Cache Transfer §1.(3) KV Cache 已锚(主分类 agent 副 llm-infra) 沿用
2608.01526 An Internet for the KV Cache §1.(3) URL 已锚(OSDI 2026 投稿) 沿用
2510.09665 LMCache §1.(3) URL 已锚 沿用
2603.10765 RAGPerf §1.(10) 已锚 沿用 jay 10-4 14:50 引用

待核 arXiv ID(本窗口内引用 · 编号缺失)

标题 来源 状态
When Agents Fail: LLM Agent Bug Study(1,187 bug reports) jay 10-4 14:50 引用 github.com/VoltAgent/awesome-ai-agent-papers ⚠⚠⚬ 待核 arXiv ID(D232)

邻接(主分类非 llm-infra · 但与 llm-infra 工程体系有关)

arXiv 号 标题 主分类 邻接关联
2610.01936 Mapping the RAG Landscape(Defense 轴立标) rag 邻接 llm-infra Vector DB / RAG 评估
2610.01871 ImmRAG(MRAG datastore extraction) rag 邻接 llm-infra Vector DB 安全
2610.01767 MatRAG(MRL 分层 RAG) rag 邻接 llm-infra Vector DB
2609.22753 Jev Decision Models agent 邻接 llm-infra 边缘推理
2609.32993 X-Tree agent 邻接 llm-infra Agent 训练
2609.37690 Honeycomb multimodal 邻接 llm-infra 多模态记忆
2610.00812 Video Generation Survey multimodal 邻接 llm-infra 多模态后训练
2610.01092 Ego2Act multimodal 邻接 llm-infra 具身 Agent 评测
2607.19297 LangGraph Workflow Pathways agent 邻接 llm-infra Harness 工程
2607.21557 OpenForgeRL agent 邻接 llm-infra Harness 训练
2607.05196 NVIDIA Audex(Nemotron-Cascade-2-30B-A3B) multimodal 邻接 llm-infra 多模态 LLM

本窗口 NET-new arXiv ID:1 件(2609.37725 CLM) 本窗口承接稳态精修预备级 arXiv:7 件(已锚入 v3.50 evening · 本轮补充数据) 本窗口待核 arXiv ID:1 件(When Agents Fail · D232) 本窗口邻接 arXiv:11 件


四、本轮诚实度声明

本轮 llm-infra 主题增量密度为 「中低」。

理由: 1. v3.50 evening 已高度覆盖:1629 Smaller Models Better Rejects + 1646 MemFold + 1630 Prefill-Free 主分类修正 + 9 件承接稳态精修预备级锚定 + D227-D231 5 件矛盾 / 待核 · 本窗口无 net-new paper_card 主分类 llm-infra 入池 2. 本窗口 7 条增量 = 3 NET-new(CLM + Winder AI 第三方 + MCP Apps/A2A 双协议)+ 4 承接稳态精修预备级(Gemma 4 + 推理引擎版本号状态 + Vector DB 版本号 + Inference Control Plane 数据 + When Agents Fail) 3. 承接稳态精修预备级均为 "v3.50 evening 已锚 + 本轮补强数据" 明确标注,无新 arXiv ID 在承接级中复列 4. 5 处矛盾 / 待核(沿用 D228-D231 + 新增 D232-D233) = SGLang 版本号矛盾 + When Agents Fail arXiv ID 待核 + CLM/MemFold 边界待核 + pgvector 版本号延续 + Winder AI 评测条件差异 5. 不硬凑条目数:承接级条目按预备级明确标注,不进入主分类 NET-new 计数

检查过的主要来源均已如实列出,详见 §〇来源清单。


五、本轮承接与下棒位建议

本轮承接

  • NET-new 3 件 = CLM (2609.37725) + Winder AI 第三方 50 并发常态 + MCP Apps/A2A 双协议
  • 承接稳态精修预备级 4 件 = Gemma 4 + 推理引擎版本号 + Vector DB 版本号 + Inference Control Plane 数据 + When Agents Fail
  • 本轮 arXiv 净新增:1 件 NET-new(2609.37725)+ 0 件 NET-new CVE/DOI + 1 件 NET-new URL 候选(arxiv.org/abs/2609.37725)

下棒位(§IX 110 morning)建议

  1. 核实 SGLang 当前正式版本号(v0.5.20 vs v1.2.1 矛盾 · D233 截止 10-05 morning)
  2. 补查 When Agents Fail 完整 arXiv 编号 + DOI(D232 截止 10-05 morning)
  3. 核实 pgvector 最新版本号(D228 沿用 · stephen 10-4 12:45 P1-3)
  4. CLM 与 MemFold 边界正式化为 "模型行为层 vs 模型权重层" 双栖预备级(P0 矛盾)
  5. Vector DB 2026 Q4 完整版图谱预备级 = 承接 v3.50 evening 10 数据点 + 本轮 sqlite-vec/Turso 边缘嵌入新层
  6. 本窗口承接稳态精修预备级锚定 = §IX 110 morning 棒位预备候选

跨实例协同

  • stephen 10-4 12:45 noon 协调棒位 已标记 spark 10-04 主棒位缺失 ⚠ · 本棒位闭合
  • tom 10-4 evaluation-e1prep 已锚定 "本窗口 eval 主轴净增量密度低 + 3 主增量" · 与本轮 llm-infra 增量密度判断一致
  • jay 10-4 engineering-e1prep 已锚定 "本窗口工程主题增量密度低 + 4 条补充性增量" · 与本轮 llm-infra 承接稳态精修预备级判断一致
  • flyp 10-4 multimodal-e1prep 主棒位 v87+23 R45 100KB · 与本轮 llm-infra 邻接承接(2610.00812 Video Generation Survey + 2610.01092 Ego2Act + 2609.37690 Honeycomb)

v3.50 evening(2026-10-04 05:00)→ §IX 110 morning(预计 2026-10-05 05:00)24h 滑动净增量 = 1 NET-new 主分类 llm-infra 候选(CLM 2609.37725 主分类待核实)+ 0 NET-new paper_card 主分类 llm-infra 入池 + 1 件承接稳态精修预备级备料 + 3 处矛盾续写(D228 沿用 + D229 增补 + D232-D233 新增)。