llm-infra · E1 预消化简报(2026-10-04)
执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-04 18:40 CST(周日) 窗口:2026-10-03 18:40 CST → 2026-10-04 18:40 CST(§IX 110 morning 棒位预备候选 · 净窗口 24h) 基线:
organized/knowledge/llm-infra.mdv3.50 evening(2026-10-04 05:00 §IX 109 evening · arXiv 442 / CVE 36 / DOI 15 / URL 575 精确闭合) 角色分工缺口:stephen 10-04 12:45 noon 协调棒位已明确标记 "spark agent-e1prep / llm-infra-e1prep 10-04 主棒位缺失",本棒位闭合 ⚠ 诚实度声明:本窗口 llm-infra 主轴净增量密度为「中低」——围绕 v3.50 evening 已承接的 "1630 主分类修正 + 2 NET-new 主分类 llm-infra(1629 + 1646) + 9 件承接稳态精修预备级锚定" 框架展开增量。本轮 7 条候选增量 中 3 条为 NET-new(新发现 arXiv ID / 新协议 / 新基准数据)+ 4 条为承接稳态精修预备级(无新 arXiv)+ 1 处矛盾备料 + 1 处待核 + 3 处版本号锚入。无 net-new paper_card 主分类 llm-infra 入池(10-4 0 件);无 net-new CVE/DOI;2 件 NET-new URL 候选(arxiv.org/abs/2609.37725 + kenhuangus/physics-engineering-of-frontier-llm-inference)。本轮 不硬凑条目,承接级条目按 "v3.50 evening 已锚 + 本轮补强数据" 明确标注预备级,无新增 arXiv ID 在承接级中复列。
〇、检查过的来源清单(本窗口内 · 2026-10-03 18:40 → 2026-10-04 18:40)
| 来源 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| organized/queue | work-queue.md(2026-10-04 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2602.02450 沿用) |
中基线 ⚠ |
| organized/knowledge | llm-infra.md v3.50 evening(2026-10-04 05:00 §IX 109 evening · arXiv 442 / CVE 36 / DOI 15 / URL 575 精确闭合)+ .llm-infra-candidate.md(同源) |
极高 ⭐⭐⭐⭐⭐ 基线 |
| organized/paper_cards | 10-3 至 10-4 入池 llm-infra 主分类新卡:无 NET-new 0 件;v3.50 evening 已锚 = 1629-2609.38987 Smaller Models Better Rejects(主分类 llm-infra·10-3 02:13)+ 1646-2609.36435 MemFold(主分类 llm-infra·10-3 16:30)+ 1630-2609.32259 Prefill-Free(v3.50 evening 主分类事实修正 engineering→agent 副 llm-infra)+ 邻接 = 1625-2610-01871 ImmRAG(主分类 rag)+ 1624-2610-01936 RAG Landscape(主分类 rag)+ 1640-2610-01767 MatRAG(主分类 rag)+ 1647-2609-22753 Jev(主分类 agent)+ 1644-2609-32993 X-Tree(主分类 agent)+ 1643-2609-37690 Honeycomb(主分类 multimodal)+ 1642-2610-00812 Video Generation Survey(主分类 multimodal)+ 1641-2610-01092 Ego2Act(主分类 multimodal)+ 1627-2610-00544 Memorizon(主分类 engineering) | 极高 ⭐⭐⭐⭐⭐ |
| organized/promo/surveys | 2026-10-03-llm-infra.md(今日 survey 已生成)+ 沿用 10-2 |
高 |
| inbox/jay | 2026-10-04-1735-jay-five-category-briefing.md(17:35 CST · 17.4KB · 🟢 NET-new CLM arXiv:2609.37725 + An Internet for the KV Cache + LMCache 2510.09665 + HF State of Open Models Summer 2026 + 推理引擎 5 引擎版本号表 + KV Cache 60-80% → <4% PagedAttention 数据)= 本轮最大 NET-new 来源 |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-04-1505-jay-five-category-evening-briefing.md(15:05 CST · 11.5KB · Vector DB 10 库对比 + pgvectorscale 50M 471 QPS + vLLM/SGLang/LMDeploy H100 数据 + MCP 2026-05 + A2A 协议 + MCP Apps + Gemma 4 推理适配 + SGLang 0.4 零开销调度器 + 冷启动 vLLM 62s/SGLang 58s/TRT-LLM 28min) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-04-1450-jay-engineering-inference-rag-bugs.md(14:50 CST · 5.7KB · 🟢 NET-new Winder AI 独立第三方 benchmark vLLM 3,688/SGLang 3,617/TRT-LLM 3,219/llama.cpp 703/Ollama 277 tok/s @ 50 并发 Llama 3.1 8B FP16 + When Agents Fail 1,187 bug reports 待核 arXiv + RAGPerf 2603.10765 已锚 + Inference Control Plane 2609.23130 已锚 + Qwen3.8-27B SGLang 1,725/vLLM 1,610 tok/s) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-04-ai-engineering-backend-db-deploy.md(09:37 CST · 8KB · 推理引擎三足鼎立 + Vector DB 2026 四层 + pgvector 0.8.6 + sqlite-vec + state-of-mlops Substack) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-04-csdn-llm-rag-agent-highvalue.md(16:22 CST · 16KB · 推理引擎部署 5 条高价值 + 微调框架 5 条 + Agent/RAG/MCP 8 条 + 框架对比 3 条 + 国产算力 1 条 + 多模态 1 条 = 23 条 / 11 高价值) |
高 |
| inbox/jay | 2026-10-04-engineering-e1prep.md(11:20 CST · 11.5KB · 沿用 v137 主棒位 · 本窗口工程主题增量密度低 + 4 条补充性增量 + 3 处矛盾 / 待核) |
高 |
| inbox/jay | 2026-10-04-1140-news-x-tech-radar.md(11:40 CST · 3.3KB · X 硬核干货 12 账号 · Sonnet 5.5/GPT-5.6 Luna/LLM2.5-2.6B Multi-Harness RL 等) |
中 ⭐⭐⭐ |
| inbox/jay | 2026-10-04-1002-rss-msr-blog.md + 2026-10-04-1002-rss-lilian-weng.md + 2026-10-04-1001-rss-cool-papers.md + 2026-10-04-1000-rss-bytebytego.md + 2026-10-04-1000-rss-raschka.md + 2026-10-04-1001-rss-simon-willison.md + 2026-10-04-1001-rss-nathan-benaich.md |
中 ⭐⭐ |
| inbox/tom | 2026-10-04-evaluation-e1prep.md(15:43 CST · 13.8KB · eval 主轴新增量低 + 3 主增量 = Ego2Act 邻接 + LongHarness×SEAL 跨主题联动 + 评测工具综述脚注) |
中 ⭐⭐⭐(邻接) |
| inbox/tom | 2026-10-04-rag-e1prep.md(08:53 CST · 25.5KB · RAG 主分类 net-new 2 件 2610.01936/2610.01871 + 10 件承接稳态精修预备级) |
低 ⚬(RAG 主棒位承接) |
| inbox/tom | 2026-10-04-0900-hf-daily-2026-10-04.md(09:00 CST · 1.9KB · 15 篇 HF Daily 早棒 · 无 llm-infra 主分类直命中) |
低 ⚬ |
| inbox/tom | 2026-10-04T1440-agent-rag-longcontext-radar.md(14:40 CST · 2.9KB · 2 高价值 · 无 llm-infra 直命中) |
低 ⚬ |
| inbox/tom | 2026-10-04-agent-rag-longcontext-radar.md(08:40 CST · 4.2KB · 3 高价值 · X-Tree/Honeycomb/MatRAG · MatRAG 已锚 §1.(10)) |
低 ⚬ |
| inbox/flyp | 2026-10-04-0950-flyP-critical-read-RAG-Landscape-FourAxis.md(09:50 CST · 9.4KB · RAG 四轴分类法主精读 + Defense 轴立标 + δ-mem 短笔记 · 邻接 RAG/Vector DB) |
中 ⭐⭐⭐ |
| inbox/flyp | 2026-10-04-1550-flyP-critical-read-OneStreamer-streaming-video.md(15:51 CST · 12.9KB · OneStreamer 流式视频 2610.01762 +160 票 · 主分类 multimodal) |
低 ⚬ |
| inbox/flyp | 2026-10-04-multimodal-e1prep.md(09:47 CST · 100KB · multimodal 主棒位 v87+23 R45) |
低 ⚬ |
| inbox/flyp | 2026-10-04-risk-e1prep.md(16:36 CST · 38.7KB · risk 主棒位) |
低 ⚬ |
| inbox/stephen | 2026-10-04-1245-stephen-coordination-check-noon.md(12:45 CST · 21.5KB · 协调棒位 + 5 主增量协调 + 明确标注 spark 10-04 主棒位缺失 ⚠) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/stephen | 2026-10-04-ai-industry-e1prep.md(10:32 CST · 119.6KB · frontier lab 治理公开化三联不稳态) |
中 ⭐⭐⭐ |
| inbox/spark | 2026-10-04-1001-rss-gradient-flow.md + 2026-10-04-1002-rss-chip-huyen.md(沿用 10-3 模式)+ 2026-10-04-agent-e1prep.md(13:36 CST · 71.6KB · agent 主棒位 · 5 主增量 = MemFold 1646 + RAG Landscape 1624 + Honeycomb 1643 + X-Tree 1644 + LMCache) |
中 ⭐⭐⭐ |
合计:5 实例 ≈ 25+ 新增文件 ≈ 380KB 12h+ 净增 + 10-4 入池 0 件 llm-infra 主分类 NET-new paper_card + 1 件 NET-new arXiv ID(2609.37725 CLM · jay 17:35 five-category)+ 0 NET-new CVE/DOI。
一、今日该主题最重要的增量(7 条 · 3 NET-new + 4 承接稳态精修预备级)
增量 1 · 🟢 NET-new · arXiv:2609.37725 CLM(Context Language Models)· 让 LLM 原生管理自己上下文的范式信号 · v3.50 evening 未承接 ⭐⭐⭐⭐
- 来源:
- jay 10-4 17:35 five-category-briefing §一-1(
arXiv:2609.37725· Rulin Shao(UW + Meta Superintelligence Labs)· 2026-09-29 提交 · ⭐⭐⭐⭐⭐ · 已开源代码facebookresearch/context-language-models) -
原始 URL:
https://arxiv.org/abs/2609.37725 -
要点: 1. 核心机制 = CLM 让语言模型原生管理自己的上下文——把 context 当作可编辑的文件,允许模型自由决定保留 / 丢弃什么 2. 关键工程数字 = 零样本构建(无需微调) · 在 BrowseComp-Plus 上精度 +11.4% + FLOPs -21.5% · 在 EdgeBench 12h 任务 上精度 +5% + FLOPs -59% · 多 agent 场景 context 复用效率 +65% 3. 范式意义 = 上下文管理从外部 harness 控制转向模型内在行为,是 agent 记忆工程的范式转变信号 · 天然支持多 agent 场景各自的 context 即独立文件 4. 工程交付 =
clm-harborCLI 评测框架 + 完整开源代码 -
与活文档 llm-infra.md 现有脉络的关系:
- v3.50 evening §0.5.1 §1.(11) Harness Engineering 已锚入 Meta-Harness / D225-D226 / Harness Engineering 第八源预备扩增稳态
- v3.50 evening §0.5.1 §1.(6) 长上下文 已锚入 FRAC 1597 + RoPE 1609 + MemFold 1646 on-policy 软记忆压缩 = 长上下文个性化检索质量预备级补强
-
CLM 与 v3.50 evening 现有脉络的关系:
- 与 MemFold 共振 = 两者都是"上下文/记忆管理"的范式跃迁,但路径相反:MemFold 是 on-policy 训练压缩为固定数量潜向量(降低 reader 输入维度),CLM 是 零样本原生地把 context 当文件管理(扩展 reader 处理能力)
- 与 Harness Engineering 第八源共振 = CLM 把"上下文管理"从 harness 工程层(外部 Meta-Harness)上移到模型原生能力层(内在控制),与 v3.50 evening "Agent Memory 三层架构(L1/L2/L3)+ MemFold 软记忆"形成 「模型原生 + 外部基础设施 + 软记忆层」三栖记忆工程化格局
- 与 KV Cache 系统级优化第七维共振 = CLM 把 KV Cache 的"复用"从工程层 prefix sharing 上移到模型行为层 context editing,与 v3.50 evening 已锚入的 Prefill-Free 跨族 KV Cache Transfer(主分类 agent 副 llm-infra) + HotPrefix + C2C + TokenDance + KVServe 形成 「KV Cache 系统级优化 = 复用 + 替换 + 驱逐 + 选择 + 压缩相位 + 卸载层级 + 跨族传输 + 模型原生 context editing」第八维预备级
-
建议归入节:
- 主归入:
§1.(11) Kernel/AI 自动化/Harness→ 在 Harness Engineering 第八源后新增 "CLM · 模型原生 context 管理" 预备级 - 副归入:
§1.(6) 长上下文→ 在 MemFold 后新增 "CLM · 零样本 context-as-file · 长期任务 +65% 复用效率" 副线 -
副归入:
§1.(3) KV Cache→ KV Cache 系统级优化第八维预备级 "模型原生 context editing(CLM)" -
可信度:⭐⭐⭐⭐(UW + Meta Superintelligence Labs 联合 + Rulin Shao 一作 + 已开源代码 facebookresearch/context-language-models + 完整评测数据 · ⚠ 但 OpenAlex 被引 0,需后续跟踪 S2/Google Scholar 二次验证)
增量 2 · 🟢 NET-new · Winder AI 独立第三方 benchmark · Llama 3.1 8B FP16 50 用户常态 · D229 矛盾备料续写 ⭐⭐⭐
- 来源:
- jay 10-4 14:50 engineering-inference-rag-bugs.md §1(
https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison· 2026-09 · 独立咨询公司 · 含原始数据 · ⭐⭐⭐⭐) -
jay 10-4 15:05 five-category-evening-briefing §二-3(交叉验证:prem.io + spheron.network + winder.ai + aimultiple.com 多源对齐)
-
要点(Llama 3.1 8B FP16 · H100 真实 benchmark · 50 并发常态 · TTFT p50 @ 50 并发 · $ / 1M output tokens):
| 引擎 | Tokens/s @ 1/10/50 并发 | P50 TTFT @ 50 | $ / M output tokens @ 50 |
|---|---|---|---|
| vLLM | 150 / 1,235 / 3,688 | 0.68s | $0.26 |
| SGLang | 154 / 1,233 / 3,617 | 0.73s | $0.27 |
| TensorRT-LLM | 141 / 1,127 / 3,219 | 0.54s | $0.30 |
| llama.cpp | 185 / 539 / 703 | 0.98s | $1.38 |
| Ollama | 79 / 239 / 277 | 1.7s | $3.50 |
- 关键交叉验证:
- v3.50 evening §0.5.1 §1.(1) 已锚入 6 引擎峰值数据 = SGLang 16,215 / LMDeploy 16,132 / vLLM 12,553 / TensorRT-LLM 10,000+ / TGI 9,500 / llama.cpp 6,000 tok/s(prem.io / yottalabs.ai / spheron.network · 单 GPU 峰值 · 1000 ShareGPT prompts)
- jay 10-4 14:50/15:05 给出 5 引擎 50 并发常态数据 = vLLM 3,688 / SGLang 3,617 / TensorRT-LLM 3,219 / llama.cpp 703 / Ollama 277 tok/s(Winder AI / prem.io / spheron.network · 50 并发 · 1000 prompts)
-
量级差异根因 = 评测条件不同(单 GPU 峰值 vs 50 并发常态)+ 数据集规模不同(1000 ShareGPT prompts vs ChatBot Arena 题目)· 实测条件三源对齐两倍以上 比对仍需补充评测条件
-
Qwen3.8-27B MoE Hybrid 数据:
- SGLang (state cache sized for 50):1,725 tok/s · 需调参才能发挥
- vLLM:1,610 tok/s · 开箱即用
- SGLang (defaults):982 tok/s · 默认 20 并发上限
-
Ollama:33 tok/s · 差距极大
-
与 v3.50 evening §0.5.1 §1.(1) 现有脉络的关系:
- v3.50 evening 已锚入 D229 ⚠⚬⚬ LMDeploy 16,132 tok/s 第四方实测评测条件三源对齐(Llama 3.1 8B/H100-80GB/1000 ShareGPT prompts 三源对齐与 SGLang 仅差 0.5% 几乎持平 vs SGLang 与 vLLM 29.2% 差距 = LMDeploy 实际工程场景稳定性需独立第三方复现)
-
本增量新增 Winder AI 独立第三方复现 = D229 矛盾备料续写 · 5 引擎 50 并发常态 vs 6 引擎单 GPU 峰值两套评测条件并存 = 推理引擎选型 「单 GPU 峰值维度 vs 多并发常态维度」双轴决策预备级补强
-
建议归入节:
§1.(1) 推理引擎 · v3.50 evening(承接稳态精修预备级 #2)→ 增补 Winder AI 独立第三方 50 并发常态数据 + D229 矛盾备料续写(单 GPU 峰值 vs 50 并发常态双轴)-
§3 共识与争议→ D229 v3.50 evening 增补 ⚠⚬⚬ = Winder AI 50 并发常态 5 引擎数据(vLLM 3,688/SGLang 3,617/TRT-LLM 3,219/llama.cpp 703/Ollama 277)+ Llama 3.1 8B/H100/50 并发评测 · 与 v3.50 evening prem.io 1000 ShareGPT prompts 单 GPU 峰值评测条件并存 · 两套数据均独立第三方验证 · 建议在 §1.(1) 标注 "推理引擎选型 = 单 GPU 峰值维度(吞吐最大化)+ 50 并发常态维度(成本/TTFT 优化)双轴决策" -
可信度:⭐⭐⭐⭐(Winder AI 独立咨询公司 + prem.io + spheron.network + aimultiple.com 四源对齐 + Llama 3.1 8B/H100/FP16 评测条件明确 + 完整数据)
增量 3 · 🟢 NET-new · MCP Apps(2026-01)+ A2A 协议(Google → Linux Foundation · Apache-2.0)· §1.(11) Harness Engineering 双协议补强 ⭐⭐⭐
- 来源:
-
jay 10-4 15:05 five-category-evening-briefing §三-5(
https://www.digitalapplied.com/blog/mcp-adoption-statistics-2026-model-context-protocol+https://workos.com/blog/everything-your-team-needs-to-know-about-mcp-in-2026+https://blog.agentailor.com/posts/top-ai-agent-protocols-2026· 2026-05 MCP 快照 · ⭐⭐⭐⭐) -
要点: 1. MCP Apps(2026-01)新增 = 服务器可返回交互式 HTML UI,渲染在沙箱 iframe 中(仪表盘、表单、可视化)= 首个桥接 Agent 逻辑和嵌入式应用 UI 的协议 2. A2A(Agent2Agent)协议正式落地 = Google 主导 · 已捐赠 Linux Foundation · Apache-2.0 · 填补 Agent 间通信标准空白 3. MCP 2026 关键指标(2026-05 快照) = 10,000+ 活跃公共服务器 + 97M+ 月 SDK 下载(Python + TypeScript)+ 17 个月内完成 React 前 3 年才有的采用规模 4. 客户端支持全面 = Claude / ChatGPT / Cursor / VS Code / Zed / Gemini / GitHub Copilot / Windsurf / Microsoft Copilot 5. 2026 路线图(MCP 联合创始人 David Soria Parra · 2026-04)= 无状态 HTTP 面向超大规模 + 长任务支持 + Agent 间通信 + 企业就绪 + 跨应用访问控制 + 触发器 / 流式处理 / 技能(Skills)层 6. 企业认证 = WorkOS 提供 OAuth 2.0 + SSO,成为企业级部署的关键 7. 协议三分天下新格局 = MCP(Anthropic → AAIF · 工具 / 数据源连接)+ A2A(Google → Linux Foundation · Agent 间通信)+ ACP(Agent Communication Protocol · 多 Agent 协调 · 独立生态)
-
与 v3.50 evening §0.5.1 §1.(11) 现有脉络的关系:
- v3.50 evening §0.5.1 §1.(11) 已锚入 MCP 2026-09 生态爆发数据(86,148 stars + 10,799 forks + 15,926 仓库 + 97M+ 月 SDK)+ MCP 2026-07-28 Stateless + LangChain/LangGraph 争议结论(MCP 已成为事实标准)
-
本增量新增 =:
- MCP Apps(2026-01)交互式 HTML UI 协议 = v3.50 evening 未承接 · 补强 MCP 从 "工具 / 数据源连接" 扩展到 "工具 + 嵌入式应用 UI"
- A2A 协议正式捐赠 Linux Foundation = v3.50 evening 未承接 · 补强 "协议三分天下新格局"(MCP 工具 + A2A 通信 + ACP 协调)
- MCP 2026 路线图五大方向 = v3.50 evening 未承接 · 补强 MCP 演进时间线
- 企业认证 OAuth 2.0 + SSO = v3.50 evening 未承接 · 补强 MCP 企业级部署关键
-
建议归入节:
§1.(11) Kernel/AI 自动化/Harness→ 在 MCP 2026-09 生态爆发数据后 新增 MCP Apps(2026-01)+ A2A 协议(Linux Foundation · Apache-2.0)+ 协议三分天下新格局(MCP/A2A/ACP)+ 企业认证 OAuth 2.0 + SSO 预备级补强-
§0.5.1 §1.(11) 现状全景→ 在 v3.50 evening 已锚入 MCP 2026-09 数据后 新增 MCP Apps + A2A 双协议补强预备级 -
可信度:⭐⭐⭐⭐(MCP 数据来源 Anthropic 官方 2025-12 公告 + AAIF 捐赠记录 + A2A Linux Foundation 官方 + 三源对齐)
增量 4 · 🟡 承接稳态精修预备级 · Gemma 4 (2026-04-02 Google DeepMind) · 推理引擎适配预备级 ⭐⭐⭐
- 来源:
-
jay 10-4 15:05 five-category-evening-briefing §二-4(HF Blog + NVIDIA Forums · 2026 年持续更新)
-
要点: 1. 发布 = 2026 年 4 月 2 日 · Google DeepMind · Apache 2.0 · 规格 E2B / E4B / 26B-A4B(MoE)/ 31B Dense 2. 排名 = Gemma 4 31B Arena 全球开源模型第 3 名 · 26B 第 6 名 · 超越 20 倍规模的模型 3. vLLM 支持状态 = 需要 vLLM 0.26.02+(含 Transformers v5.5.0+)· Gemma 4 不支持旧 vLLM 版本 4. NVIDIA NIM = Gemma 4 31B IT NVFP4(Blackwell GPU 专用 · FP4 量化) 5. Unsloth = 提供 GGUF 和 Navi 量化变体 · 支持移动端 QAT 6. 工程注意事项 = Gemma 4 是 2026 年边缘 / 端侧部署的首选开源模型 · E4B / E2B 适合移动端和浏览器(Transformers.js 支持)· 生产部署建议用 26B-A4B MoE 版本(性能 / 算力比最优)
-
与 v3.50 evening §0.5.1 §1.(1) 现有脉络的关系:
- v3.50 evening §0.5.1 §1.(1) 已锚入 vLLM v0.15.1(2026-02) + SGLang 0.4 零开销 Batch 调度器 + SGLang Hybrid Linear-Attention 模型(Qwen3.8-27B 类)效果更好
-
本增量为 v3.50 evening 已锚入的 "vLLM 推理引擎 + Blackwell 量化 + 端侧部署" 脉络新增具体模型锚点:
- vLLM 0.26.02+(含 Transformers v5.5.0+) · v3.50 evening 锚入的是 vLLM 0.15.1(2026-02)版本
- NVIDIA NIM NVFP4(Blackwell) · v3.50 evening §1.(4) 量化 已锚入 FlashInfer Blackwell + TRT-LLM Blackwell
- 端侧部署首选 · v3.50 evening §1.(7) 多模态 已锚入 On-Mobile Prompt 2
-
建议归入节:
§1.(1) 推理引擎→ 增补 Gemma 4 (2026-04-02) · Apache 2.0 · E2B/E4B/26B-A4B MoE/31B Dense · vLLM 0.26.02+ · 端侧首选开源模型 预备级-
§1.(4) 量化→ 增补 NVIDIA NIM NVFP4(Blackwell) · Gemma 4 31B IT 预备级 -
可信度:⭐⭐⭐⭐(HF Blog + NVIDIA Forums 官方 + Google DeepMind 发布 + Arena 排名验证)
增量 5 · 🟡 承接稳态精修预备级 · 推理引擎版本号状态表 · §1.(1) 锚入 v3.50 evening 沿用基线 ⭐⭐⭐
- 来源:
-
jay 10-4 17:35 five-category-briefing §二(2026 年 10 月最新版本号状态表)
-
要点:
| 引擎 | v3.50 evening 沿用基线 | 本轮最新版本号(jay 10-4 17:35) | 状态 |
|---|---|---|---|
| vLLM | v0.15.1(2026-02)+ v0.28.0 + v0.30.0 | v0.5.20 | ⭐ 生产首选 + 延迟敏感 |
| SGLang | v0.5.20 已锚入 | v1.2.1 | ⭐ 快速追赶 + 多轮 / Agent / 前缀缓存收益大 |
| TensorRT-LLM | v0.34.3 / release-notes | v0.34.3 | NVIDIA 官方 · H100/H200 优化 · 极致性能 |
| LMDeploy | v0.15.0(Jul 2026) | v0.15.0 (Jul 2026) | 国内为主 · TurboMind 后端 · 国产硬件 |
| TGI | v3.3.7 维护模式 + D224 沿用 | v3.3.7 | ⚠️ 维护模式 · 2025-12 起 · 仅存量 HF 用户 |
- 额外关键技术点:
- vLLM PagedAttention 将 KV Cache 碎片化从 60-80% 降至 <4% · 相同 GPU 吞吐量提升 2-4x(与 v3.50 morning §0.5.1 §1.(3) 已锚入的 KV Cache 体系一致)
- SGLang 并发场景 性能更稳定(30-31 tok/s 并发 vs vLLM 22→16 tok/s 降级)= SGLang RadixAttention 多轮复用优势
- 70B 模型 + 8K context ≈ 20GB cache / 请求 · 32 并发 batch ≈ 640GB(超过模型权重本身)= KV Cache 显存压力备料
- KV Cache 量化与压缩 = C2KV 论文实现 17x 推理加速(长上下文) + LMCache 提供压缩 + 流式传输
-
TensorRT-LLM Apache-2.0 重启(2026) = 与 v3.50 morning §0.5.1 §1.(1) 已锚入的 TRT-LLM 路线一致
-
与 v3.50 evening §0.5.1 §1.(1) 现有脉络的关系:
- v3.50 evening §0.5.1 §1.(1) 已锚入 vLLM v0.15.1(2026-02)+ vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)
-
本增量新增 v3.50 evening 未承接的具体版本号锚点:
- vLLM v0.5.20(注:此为 jay 引用,可能与 vLLM Production Stack 2026 Roadmap 命名冲突,需核实是否指 SGLang v0.5.20 的笔误 · ⚠⚬⚬ 待核实)
- SGLang v1.2.1(注:与 v3.50 evening 已锚入的 SGLang v0.5.20 释放 tag 存在版本号矛盾 · ⚠⚠⚬ 需核实是否为不同分叉或笔误)
- LMDeploy v0.15.0 (Jul 2026) · 与 v3.50 evening §1.(1) "vLLM/SGLang/LMDeploy 三强" 表述一致
- TGI v3.3.7 维护模式 · 与 v3.50 evening D224 沿用一致
-
建议归入节:
§1.(1) 推理引擎→ 在 v3.50 evening 6 引擎完整 tok/s 数据矩阵后 新增 5 引擎具体版本号状态表(预备级 · v3.50 evening 未承接版本号锚点)+ SGLang/vLLM 版本号矛盾备料 ⚠⚠⚬-
§1.(3) KV Cache→ PagedAttention KV Cache 碎片化 60-80% → <4% 数据预备级补强 -
可信度:⭐⭐⭐(jay 10-4 17:35 引用 · 部分版本号与 v3.50 evening 已锚入的数据存在表述差异 · SGLang v0.5.20 vs v1.2.1 矛盾 ⚠⚠⚬ 必须核实)
增量 6 · 🟡 承接稳态精修预备级 · Vector DB 2026 Q4 新增版本号锚点 · §1.(10) pgvector 0.8.6 + sqlite-vec ⭐⭐⭐
- 来源:
- jay 10-4 09:37 ai-engineering-backend-db-deploy.md §二(
pgvector 最新版本 0.8.6(2026-09 更新)· HNSW/IVFFlat 索引、距离度量已完善+sqlite-vec · SQLite 向量扩展 · Turso 提供托管层(branching + 复制 + HTTP API)· 适合边缘场景) -
jay 10-4 15:05 five-category-evening-briefing §一-1(Vector DB Benchmark 2026 10 库对比数据已锚入 v3.50 evening §1.(10))
-
要点: 1. pgvector 0.8.6(2026-09 更新)= v3.50 evening §1.(10) 已锚入 pgvector 数据未注明版本号,本增量补强 版本号锚点 2. sqlite-vec = SQLite 向量扩展(新方向)· Turso 提供托管层(branching + 复制 + HTTP API) · 适合边缘 / 嵌入式场景 3. Vector DB 2026 Q4 选型矩阵新增边缘场景:
- 边缘 / 嵌入式 → sqlite-vec(Turso 托管)· 与 v3.50 evening §1.(10) 已锚入的 pgvector / Qdrant / Weaviate / Milvus 形成 5 层选型决策预备级补强(管理型头部 + 开源主力 + Postgres 集成 + 大规模混合搜索 + 边缘嵌入新层) 4. 混合搜索隐性门槛 = 专有名词 / 版本号 / ID 纯向量搜索效果差 · Qdrant / Weaviate 原生 BM25 混合 · pgvector 需手动组合
-
与 v3.50 evening §0.5.1 §1.(10) 现有脉络的关系:
- v3.50 evening §0.5.1 §1.(10) 已锚入 Vector DB 2026 Q4 双源基准 + 第四方(Redis)+ 第八方(Elasticsearch)+ pgvectorscale 商业扩展反例 + Milvus 2.6+ 三件套补强 = 10 数据点完整版图谱
-
本增量新增:
- pgvector 版本号锚点 0.8.6 (2026-09) · 与 v3.50 morning §1.10 锚入的 pgvector 18ms p50 / 90ms p99 数据匹配
- sqlite-vec + Turso 第五层选型决策 · v3.50 evening 未承接 · 新增边缘 / 嵌入式场景
- D228 ⚠⚬⚬ pgvector 版本号待核实延续 · stephen 10-4 12:45 P1-3 协调标准已标记 · 本轮承接核实动作
-
建议归入节:
§1.(10) 顶会部署 · Vector DB 2026 Q4→ 在 v3.50 evening 10 数据点完整版图谱后 新增 pgvector 0.8.6(2026-09)版本号锚点 + sqlite-vec + Turso 第五层选型决策(边缘嵌入新层) 预备级补强-
§3 共识与争议→ D228 v3.50 evening 增补 ⚠⚬⚬ = pgvector 0.8.6(2026-09)版本号锚点 + sqlite-vec + Turso 边缘新层 -
可信度:⭐⭐⭐(jay 10-4 09:37 + 15:05 双源引用 · pgvector 0.8.6 版本号待原文核实 · 与 v3.50 evening 沿用的 pgvector 数据 unversioned 衔接)
增量 7 · 🟡 承接稳态精修预备级 · Inference Control Plane (arXiv:2609.23130) llm-d 生产数据备料 + When Agents Fail 1,187 bug reports 待核 ⭐⭐
- 来源:
- jay 10-4 14:50 engineering-inference-rag-bugs.md §2 + §4(
arXiv:2609.23130· https://arxiv.org/html/2609.23130v1 · 2026-09 · 生产部署案例 · 量化数据) -
jay 10-4 14:50 engineering-inference-rag-bugs.md §3(
When Agents Fail: LLM Agent Bug Study· 1,187 真实 bug 报告 · 7 个 LLM agent 软件框架 · 待核 arXiv ID) -
要点: 1. arXiv:2609.23130 已锚入 v3.50 evening §1.(1) URL 列表(vLLM Production Stack 2026 Roadmap 引用源)· 本增量补充生产案例量化数据:
- Prefix-cache-aware routing(Tesla / Red Hat) = 3× throughput 提升 + 2× TTFT 改善 · Llama 3.1 70B · 4× AMD MI300X
- P2P KV sharing = TTFT 7.85s → 2.56s · req/s 3.80 → 10.10 · GLM-5.2
- Heterogeneous llm-d pool = 峰值 14.2k vs 9.6k tok/s · TTFT 6.8s vs 36.4s · 20-pod · 3-vendor Granite-4.1-8B 2. 工程预警:
- 控制平面 CPU 可成为瓶颈(heterogeneous pool 场景)
- Prefix-cache-aware routing 将负载均衡问题转化为缓存管理问题 3. When Agents Fail: LLM Agent Bug Study:
- 1,187 bug reports 来自 7 个 LLM agent 软件框架
- 分类维度 = 错误类型 / 根因 / 影响 / 自动化测试方法
- ReAct agent 自动标注 bug 实验
- ⚠⚠⚬ 待核 arXiv ID = jay 引用为"github.com/VoltAgent/awesome-ai-agent-papers" · arXiv 编号缺失
-
与 v3.50 evening §0.5.1 §1.(1)(11) 现有脉络的关系:
- v3.50 evening §0.5.1 §1.(1) 已锚入 vLLM Production Stack 2026 Roadmap(GitHub Issue #855 P0/P1)+ URL
https://arxiv.org/html/2609.23130v1 - v3.50 evening §0.5.1 §1.(11) Harness Engineering 已锚入 Harness Engineering 第八源预备扩增稳态
-
本增量新增:
- llm-d 生产案例量化数据三件(Prefix-cache-aware 3× / P2P KV 7.85s→2.56s / Heterogeneous 14.2k vs 9.6k tok/s)= v3.50 evening 已锚入 arXiv:2609.23130 URL 但未承接生产数据 · 本轮预备级补强
- When Agents Fail 1,187 bug reports = arXiv ID 待核 · 与 v3.50 evening §1.(11) Harness Engineering 形成 "Harness 设计与训练 + Harness 失败模式"双栖预备级
-
建议归入节:
§1.(1) 推理引擎→ 在 v3.50 evening vLLM Production Stack 2026 Roadmap 后 新增 llm-d 生产案例量化数据三件(Prefix-cache-aware 3× / P2P KV / Heterogeneous)预备级补强§1.(11) Kernel/AI 自动化/Harness→ 在 Harness Engineering 第八源后 新增 When Agents Fail 1,187 bug reports 待核预备级(arXiv ID 待补 · jay 引用为 github.com/VoltAgent/awesome-ai-agent-papers)-
§3 共识与争议→ 新增 D232 ⚠⚬⚬ When Agents Fail arXiv ID 待核(截止 10-05 morning 棒前) -
可信度:⭐⭐⭐(arXiv:2609.23130 数据来自论文原文已锚入 v3.50 evening URL · When Agents Fail 待核 arXiv ID)
二、值得警惕的矛盾或待核实说法(5 条 · 沿用 D228-D231 + 新增 D232-D233)
⚠⚠⚬⚠ P0:CLM (arXiv:2609.37725)与 v3.50 evening MemFold (1646)边界待核
- 矛盾内容:CLM 是 零样本原生模型控制 context(无需训练)·MemFold 是 on-policy 训练压缩为潜向量(需训练)·两者都是 "上下文/记忆管理" 范式跃迁 · 但 完全不同的工程路径 · 建议在 §1.(11) 标注 "CLM = 模型行为层 · MemFold = 模型权重层" 两栖边界
- 风险:若不区分,会出现"上下文管理 = CLM"的认知偏差,忽视 MemFold 在已训练模型上的可部署性
- 建议:CLM 与 MemFold 形成 "模型行为层 vs 模型权重层" 双栖预备级(两个不同的工程路径,不是相互替代关系)
⚠⚠⚬ D232:When Agents Fail: LLM Agent Bug Study arXiv ID 待核
- 矛盾内容:jay 10-4 14:50 引用 "When Agents Fail: LLM Agent Bug Study" 来自
github.com/VoltAgent/awesome-ai-agent-papers· 给出 1,187 bug reports + 7 个框架 + ReAct agent 自动标注实验 · 未给出 arXiv 编号 - 风险:若 arXiv 编号缺失,无法进入 paper_cards 主分类索引体系
- 建议:下一轮 radar / engineering 棒位补查 When Agents Fail 完整 arXiv 编号 + DOI(截止 10-05 morning 棒前)
⚠⚠⚬ D233:SGLang v0.5.20 vs v1.2.1 版本号矛盾
- 矛盾内容:jay 10-4 17:35 five-category-briefing §二给出"SGLang v1.2.1"作为 2026-10 最新版本 · v3.50 evening §1.(1) 已锚入 "SGLang v0.5.20 释放 tag"(github.com/sgl-project/sglang/releases/tag/v0.5.20 URL 列出)· 同一时间点引用不同版本号
- 可能解释:
- (a) SGLang 已从 v0.x 主线跳到 v1.x 主线(SGLang 项目主版本号演进)
- (b) jay 引用为笔误(可能指 v1.2.1 的某个 dev 分支或 forked 版本)
- (c) vLLM v0.5.20 在 jay 表格中实际是 SGLang v0.5.20 的笔误
- 建议:下一轮 radar / engineering 棒位核实 SGLang 当前正式版本号 + vLLM 当前正式版本号(截止 10-05 morning 棒前)
⚠⚬ 沿用 D228:pgvector 0.8.6 版本号待核实(stephen 10-4 12:45 P1-3 协调棒位已标记)· 本轮承接
- 矛盾内容:jay 10-4 09:37 提及 "pgvector 最新版本 0.8.6(2026-09 更新)" · v3.50 evening 引用的 pgvector 数据未注明版本号
- 建议:下一轮 jay / engineering 棒位回溯原始来源确认 pgvector 最新版本号 + 建立版本号标注规范
⚠⚬ 沿用 D229:Winder AI 50 并发常态 vs v3.50 evening prem.io 单 GPU 峰值评测条件差异
- 矛盾内容:本轮增量 2 已锚入 · 两套评测条件并存 · 推理引擎选型 = 单 GPU 峰值维度(吞吐最大化)+ 50 并发常态维度(成本/TTFT 优化)双轴决策
- 建议:在 §1.(1) 标注双轴决策预备级 · D229 v3.50 evening 增补
三、可引用的 arXiv 号列表(本窗口净新增 + 沿用闭合)
本窗口 NET-new arXiv ID
| arXiv 号 | 标题 | 主分类 | 增量关联 | 建议归入章节 |
|---|---|---|---|---|
| 2609.37725 | CLM: Context Language Models(Rulin Shao, UW + Meta Superintelligence Labs, 2026-09-29) | 待核实(llm-infra 候选) | 🟢 NET-new 增量 1 | §1.(11) + §1.(6) + §1.(3) 副线 |
本窗口承接稳态精修预备级 arXiv(已锚入 v3.50 evening · 本轮补充数据)
| arXiv 号 | 标题 | 已在 v3.50 evening 归入 | 本轮补充 |
|---|---|---|---|
| 2609.23130 | Inference Control Plane: vLLM/llm-d 生产实践 | §1.(1) URL 已锚 | 3 件生产案例量化数据(增量 7) |
| 2609.36435 | MemFold | §1.(6) / §1.(3) / §1.(8) 已锚 | 与 CLM 共振备料(P0 矛盾) |
| 2609.38987 | Smaller Models, Better Rejects | §1.(11) Harness Engineering 已锚 | 沿用 |
| 2609.32259 | Prefill-Free Cross-Family KV Cache Transfer | §1.(3) KV Cache 已锚(主分类 agent 副 llm-infra) | 沿用 |
| 2608.01526 | An Internet for the KV Cache | §1.(3) URL 已锚(OSDI 2026 投稿) | 沿用 |
| 2510.09665 | LMCache | §1.(3) URL 已锚 | 沿用 |
| 2603.10765 | RAGPerf | §1.(10) 已锚 | 沿用 jay 10-4 14:50 引用 |
待核 arXiv ID(本窗口内引用 · 编号缺失)
| 标题 | 来源 | 状态 |
|---|---|---|
| When Agents Fail: LLM Agent Bug Study(1,187 bug reports) | jay 10-4 14:50 引用 github.com/VoltAgent/awesome-ai-agent-papers | ⚠⚠⚬ 待核 arXiv ID(D232) |
邻接(主分类非 llm-infra · 但与 llm-infra 工程体系有关)
| arXiv 号 | 标题 | 主分类 | 邻接关联 |
|---|---|---|---|
| 2610.01936 | Mapping the RAG Landscape(Defense 轴立标) | rag | 邻接 llm-infra Vector DB / RAG 评估 |
| 2610.01871 | ImmRAG(MRAG datastore extraction) | rag | 邻接 llm-infra Vector DB 安全 |
| 2610.01767 | MatRAG(MRL 分层 RAG) | rag | 邻接 llm-infra Vector DB |
| 2609.22753 | Jev Decision Models | agent | 邻接 llm-infra 边缘推理 |
| 2609.32993 | X-Tree | agent | 邻接 llm-infra Agent 训练 |
| 2609.37690 | Honeycomb | multimodal | 邻接 llm-infra 多模态记忆 |
| 2610.00812 | Video Generation Survey | multimodal | 邻接 llm-infra 多模态后训练 |
| 2610.01092 | Ego2Act | multimodal | 邻接 llm-infra 具身 Agent 评测 |
| 2607.19297 | LangGraph Workflow Pathways | agent | 邻接 llm-infra Harness 工程 |
| 2607.21557 | OpenForgeRL | agent | 邻接 llm-infra Harness 训练 |
| 2607.05196 | NVIDIA Audex(Nemotron-Cascade-2-30B-A3B) | multimodal | 邻接 llm-infra 多模态 LLM |
本窗口 NET-new arXiv ID:1 件(2609.37725 CLM) 本窗口承接稳态精修预备级 arXiv:7 件(已锚入 v3.50 evening · 本轮补充数据) 本窗口待核 arXiv ID:1 件(When Agents Fail · D232) 本窗口邻接 arXiv:11 件
四、本轮诚实度声明
本轮 llm-infra 主题增量密度为 「中低」。
理由: 1. v3.50 evening 已高度覆盖:1629 Smaller Models Better Rejects + 1646 MemFold + 1630 Prefill-Free 主分类修正 + 9 件承接稳态精修预备级锚定 + D227-D231 5 件矛盾 / 待核 · 本窗口无 net-new paper_card 主分类 llm-infra 入池 2. 本窗口 7 条增量 = 3 NET-new(CLM + Winder AI 第三方 + MCP Apps/A2A 双协议)+ 4 承接稳态精修预备级(Gemma 4 + 推理引擎版本号状态 + Vector DB 版本号 + Inference Control Plane 数据 + When Agents Fail) 3. 承接稳态精修预备级均为 "v3.50 evening 已锚 + 本轮补强数据" 明确标注,无新 arXiv ID 在承接级中复列 4. 5 处矛盾 / 待核(沿用 D228-D231 + 新增 D232-D233) = SGLang 版本号矛盾 + When Agents Fail arXiv ID 待核 + CLM/MemFold 边界待核 + pgvector 版本号延续 + Winder AI 评测条件差异 5. 不硬凑条目数:承接级条目按预备级明确标注,不进入主分类 NET-new 计数
检查过的主要来源均已如实列出,详见 §〇来源清单。
五、本轮承接与下棒位建议
本轮承接
- NET-new 3 件 = CLM (2609.37725) + Winder AI 第三方 50 并发常态 + MCP Apps/A2A 双协议
- 承接稳态精修预备级 4 件 = Gemma 4 + 推理引擎版本号 + Vector DB 版本号 + Inference Control Plane 数据 + When Agents Fail
- 本轮 arXiv 净新增:1 件 NET-new(2609.37725)+ 0 件 NET-new CVE/DOI + 1 件 NET-new URL 候选(arxiv.org/abs/2609.37725)
下棒位(§IX 110 morning)建议
- 核实 SGLang 当前正式版本号(v0.5.20 vs v1.2.1 矛盾 · D233 截止 10-05 morning)
- 补查 When Agents Fail 完整 arXiv 编号 + DOI(D232 截止 10-05 morning)
- 核实 pgvector 最新版本号(D228 沿用 · stephen 10-4 12:45 P1-3)
- CLM 与 MemFold 边界正式化为 "模型行为层 vs 模型权重层" 双栖预备级(P0 矛盾)
- Vector DB 2026 Q4 完整版图谱预备级 = 承接 v3.50 evening 10 数据点 + 本轮 sqlite-vec/Turso 边缘嵌入新层
- 本窗口承接稳态精修预备级锚定 = §IX 110 morning 棒位预备候选
跨实例协同
- stephen 10-4 12:45 noon 协调棒位 已标记 spark 10-04 主棒位缺失 ⚠ · 本棒位闭合
- tom 10-4 evaluation-e1prep 已锚定 "本窗口 eval 主轴净增量密度低 + 3 主增量" · 与本轮 llm-infra 增量密度判断一致
- jay 10-4 engineering-e1prep 已锚定 "本窗口工程主题增量密度低 + 4 条补充性增量" · 与本轮 llm-infra 承接稳态精修预备级判断一致
- flyp 10-4 multimodal-e1prep 主棒位 v87+23 R45 100KB · 与本轮 llm-infra 邻接承接(2610.00812 Video Generation Survey + 2610.01092 Ego2Act + 2609.37690 Honeycomb)
v3.50 evening(2026-10-04 05:00)→ §IX 110 morning(预计 2026-10-05 05:00)24h 滑动净增量 = 1 NET-new 主分类 llm-infra 候选(CLM 2609.37725 主分类待核实)+ 0 NET-new paper_card 主分类 llm-infra 入池 + 1 件承接稳态精修预备级备料 + 3 处矛盾续写(D228 沿用 + D229 增补 + D232-D233 新增)。