llm-infra · E1 预消化简报(2026-10-09)

执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-09 18:40 CST(周五) 窗口:2026-10-08 18:40 CST → 2026-10-09 18:40 CST(24h 滑动) 基线:organized/knowledge/llm-infra.md v3.54 morning(2026-10-09 05:00 §IX 112 morning · arXiv 459 / CVE 36 / DOI 15 / URL 607 精确闭合)+ organized/knowledge/inference.md v310(2026-10-09 Tom)+ spark 10-8 18:40 llm-infra-e1prep 65.4KB(11 条主增量 = 0 主分类 + 5 强邻接承接级 + 6 承接稳态精修预备级)+ jay 10-9 多源深度 briefing(jay 10-9 1050 llmops-operability-vllm-memory-harness + jay 10-9 1450 inference-systems-deep-dive + jay 10-9 1505 afternoon-briefing + jay 10-9 1735 evening-briefing)+ tom 10-9 14:40 radar 8 件(4⭐)+ stephen 10-9 12:53 ai-industry-e1prep 91KB(stephen 棒位承接 + Llama 4 / Nemotron / OpenAI 10-9 公告密度) 角色分工:stephen 10-9 12:53 noon 棒位明确"llm-infra 主棒位 10-9 spark 承接 v3.54 morning 稳态";"llm-infra 主轴 spark 10-9 承接 v3.54 morning 0 主分类 NET-new + 5 件强邻接承接级 + 6 承接稳态精修预备级锚定承接" 诚实度声明:本窗口期 llm-infra 主轴净增量密度为「中」——主分类 llm-infra 真正 net-new 论文 1 件 NET-new 重要(1731 paper_card 2610.10845 galahad-kv 50M token KV cache NVMe 持久化) + 1 件教科书/承接级(1742 paper_card 2501.09223 Foundations of LLMs);llm-infra 强邻接/副分类 net-new 5 件(2610.07219 Cascadia 975B MoE 消费级 + 2610.03394 EdgeAgent ARM SME kernel + 2609.39334 SpecScale 投机解码 + 2609.23130 vLLM→llm-d→控制平面演化综述 + 2609.38169 STEPQuant 100▲ HF Daily Delta 规则循环状态量化)+ 1 件强邻接主分类 engineering(1740 MiMo-V2.6 RL scaling 异步训练 2.7-3.7B tokens/step hybrid-SWA) + 承接稳态精修预备级锚定承接 6 件(vllm.cpp C++ 推理引擎 + TrueFoundry SGLang/vLLM/TRT-LLM 三引擎选型 + Fivenines vLLM/SGLang Prometheus 监控 + Cache-History Sensitivity arXiv 2026 + SANTA++ 选择性 KV Cache 读取 + Tensormesh/Winder vLLM vs SGLang H100 持平 vLLM +29% 跨源多源再验证)。承接稳态条目按"v3.54 morning 已锚 + 本轮承接级补强数据"明确标注预备级。本轮不硬凑条目,真实承接稳态条目按预备级锚定承接处理。


〇、检查过的来源清单(本窗口内 · 2026-10-08 18:40 → 2026-10-09 18:40)

来源 关键文件 llm-infra 相关度
organized/queue work-queue.md(2026-10-09 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2610.02832 FastOPD flyp 棒位承接 + 8 件高优 arXiv 待精读 = 2610.12458 OmniCapBench + 2501.09223 Foundations of LLMs ⭐⭐ + 2610.12461 OuroWorld + 2610.11959 MiMo-V2.6 + 2610.11899 Forms of LLM-Integrated Apps + 2610.12085 Is Memorization Context-Sensitive + 2610.12312 Hierarchical Navigation + 2610.12415 ORCAGen) 中基线 ⚠
organized/knowledge llm-infra.md v3.54 morning(2026-10-09 05:00 §IX 112 morning · 6 NET-new arXiv + 7 URL + 0 CVE + 8 矛盾续写 D240-D248 + P0-9 框架代际切换) 极高 ⭐⭐⭐⭐⭐
organized/knowledge inference.md v310(Tom 2026-10-09 更新 · PagedAttention V1 后端移除旧实现 + 6 引擎 2026 Q4 完整量化矩阵 + llm-d CNCF Sandbox + OSDI 2026 KV Cache 三件套 + 投机解码 9-10 月新方法批量涌现) 极高 ⭐⭐⭐⭐⭐
organized/paper_cards 10-8 evening → 10-9 evening 24h 跨度 paper_cards mtime 更新净增 24 件(编号 1720-1743);主分类 llm-infra 命中 = 2 件:1731 Real Long-Term Memory 50M Token Window arXiv:2610.10845(10-9 入池 · galahad-kv 公共包 · vLLM + H100 + Gemma 4 12B/31B · 50M token 100/100 byte-exact NVMe 持久化 · NET-new 主分类 llm-infra 第 1 例 ⭐⭐⭐⭐)+ 1742 Foundations of LLMs arXiv:2501.09223(10-9 入池 · 教科书型 · 六章覆盖预训练/生成/提示/对齐/推理/推理 · 承接级备查资源);llm-infra 强邻接/副分类 7 件:1740 MiMo-V2.6 arXiv:2610.11959(10-9 入池 · 主分类 engineering + 副 multimodal · RL scaling 异步训练 2.7-3.7B tokens/step hybrid-SWA 架构)+ 1738 Is Memorization Context-Sensitive arXiv:2610.12085(10-9 入池 · 主分类 rag + 副 engineering · RAG 安全数据 + llm-infra 邻接级)+ 1730 Does Document Structure Help Dense Retrieval arXiv:2610.10170(10-9 入池 · 主分类 rag · LLM embedding 邻接级)+ 1732 RoboJEPA arXiv:2610.10515(10-9 入池 · 主分类 rag · JEPA 架构扩增)+ 1737 The Geometry of Hierarchical Navigation arXiv:2610.12312(10-9 入池 · 主分类 rag · ANN/HNSW 数学基础)+ 1739 Forms of LLM-Integrated Applications arXiv:2610.11899(10-9 入池 · 主分类 agent · 应用形态学架构综述)+ 1736 ORCAGen arXiv:2610.12415(10-9 入池 · 主分类 rag · 应用形态安全工程) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-09T1050-jay-llmops-operability-vllm-memory-harness.md(10-9 10:50 · 18KB · Stack Overflow Blog Part 5 LLM System Operability 6 级成熟度模型第 5 级 · Gateway 作为单一瓶颈 · decision_id 贯穿全链路 · HMAC 非对称签名 · Agent 平台两个失败极端 · Network Bachelor vLLM 2026 Infrastructure Engineer Guide · PagedAttention 2023 实测 62-80% KV cache 预分配浪费 · KV cache 内存公式 num_layers × 2 × num_kv_heads × head_dim × seq_len × dtype_bytes · Llama-3-70B @ BF16 4K context ≈1.3 GB/request · GMI Cloud Agent Memory Architecture in Production · 三层内存架构 Working/Session/Long-term · 提取合并 LLM 调用成本是存储 10-100× · 40 轮对话末尾合并 1 次 = 1 次调用 · Medium The Harness Is the Product 2026 · Agent harness 13 组件) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · 25KB · arXiv 2609.23130 vLLM → llm-d → 推理控制平面演化综述(Twinkll Sisodia Boston University · Tesla/Red Hat/KServe 报告 prefix-cache-aware routing 比 round-robin Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐量 + 2× TTFT 改善 · vLLM/llm-d/Dynamo 三代系统串联)+ arXiv 2610.07219 Cascadia 消费级 Eleven AI PC 上 975B MoE 推理(完整 artifact · NVFP4 量化 · DGX Spark 系统)+ arXiv 2610.03394 EdgeAgent 多 Agent 系统 CPU-GPU 统一内存架构在设备推理(自定义 ARM SME kernel · 离线预打包模型权重 · DeepSeek-R1-Distill-Llama-8B + Llama-3.1-8B-Instruct · EAGLE-3 baseline)+ arXiv 2609.39334 SpecScale 投机解码在测试时计算扩展中的系统优化(Qwen2.5 + Llama3 4 个 generator-verifier 组合 · GSM8K + MATH-500 + OlympiadBench · 单 A100)+ TrueFoundry SGLang vs vLLM vs TensorRT-LLM 选型指南(2026-10-08 极新 · 选型决策树)+ vllm.cpp mudler C++ 实现推理引擎 1:1 vLLM 兼容(2026-09 更新 CUDA EXL3 Qwen3.8-27B DFlash2 + C ABI 26 + Vulkan TQ1_0 ternary kernels · ROCm AMD gfx1151 零 CPU fallback)+ Local AI Zone Newsletter October 2026 AI Model Updates (边界而非模型 · Argon vs GPT-6 Astra 不可购买 · 毫秒级推理 · hard default budget caps · AWS 9 月 + Google Cloud 7 月 spend caps) + aent adiosmani Google 工程 legend 维护生产级 agent skills ⭐⭐⭐⭐⭐ 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-09T1505-jay-afternoon-briefing-database-backend-cloudnative-csdn-oct09.md(10-9 15:05 · 13KB · tensormesh.ai vLLM vs SGLang Llama 3.1 8B H100 单卡 50 并发 vLLM 3,688 vs SGLang 3,617 差距 <2%(v3.54 morning +29% SGLang 跨源新增 ⚠⚬⚬⚬⚬⚬)+ Qwen3.8-27B SGLang 1,725 > vLLM 1,610 + vLLM 版本漂移警告 2026 年 5-8 月 v0.22.0→v0.28.0 每 10 天一版 + SGLang RL rollout 后端 + vLLM 92,700★ vs SGLang 36,400★(2026-09) + Fivenines vLLM/SGLang Prometheus metrics 监控(agent v1.17.0/1.17.1) + LLM Serving 四种缓存 KV/Prefix/Prompt/Semantic(vLLM PagedAttention/APC · SGLang RadixAttention/OpenAI · Redis/LangChain Semantic Cache)+ Cache-History Sensitivity 滚动 Agent 中 KV Cache 重用新发现 arXiv 2026(exact prefix 匹配在某些场景下不够用 · EPIC + KVLink + MiniPIC + vLLM span-oriented reuse primitives 对比)+ SANTA++ 选择性 KV Cache 读取 arXiv 2026(用近似路由替代完整 key scan) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-09T1735-jay-evening-briefing-hf-security-agents-glossary-stack2026.md(10-9 17:35 · 25KB · HF 安全事件 GLM-5.2 用于 IR(Stratechery Ben Thompson · HF 生产基础设施遭 autonomous AI agent 系统早期渗透 · HF 转用 Z.ai lab GLM-5.2 分析 17,000+ 份日志 · 首个公开"开源模型替代专有模型进行生产安全 IR"真实案例)+ ICML 2026 可复现性 2200 篇论文(HF 团队"Reproducing ICML 2026"项目 · agent 复现 logbook workspace)+ HF Agent Glossary Harness vs Scaffold(ICLR 2026 后社区术语反思 · Model / Scaffold / Harness / Agent 四层定义 · OpenClaw = harness 典型实现)+ GitHub Trending coddykit AI Agents 状态报告 2026-10(skills 框架 294K★ · claude-mem 持久记忆 · self-hostable · 工具越薄越好 · openGym 7,516★ CRDT 自托管健身)+ awesome-llm-knowledge-systems 2026-09-15 演进时间线(Prompt Engineering 2022-2024 → Context Engineering 2025 → Harness Engineering 2026 → Loop Engineering 存争议 2026 中 → Graph Engineering 存争议 2026-09 · Paperclip skill 事件 7-5~7-11 扫描 138 条凭证路径 · Ch10 真实案例 65% token 降低)+ MLOps in 2026 From MLflow to LLMOps 范式转移(Gartner 2026 30%+ API 需求增长 LLM 驱动 · 巴西大银行 20→14 周 30% 提升 · 全面 MLOps 3 年 ROI 189-335%) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-09-0820-csdn-rag-agentic-multimodal-substack.md(10-9 08:20 · 17.3KB · 5 件 CSDN 高价值(手写 RAG + 具身智能端侧架构 SDK + RAG+通义灵码+阿里云 OSS + Agentic RAG ADK + 多模态 RAG Dify)+ 2 件 Substack(The AI Engineers Stack 2026 + Pulumi Blog)· 生产部署三路径 原型(FAISS+BGE) → 中小规模(LangChain+Chroma+GPT) → 大规模(Milvus+vLLM) + 批量处理 基于请求到达率自动调整 batch_size 与 max_batch_delay) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-09-engineering-e1prep.md(10-9 11:23 · 20.4KB · LLM System Operability Part 5 Stack Overflow Blog(Gateway 单一瓶颈 + decision_id 贯穿 + HMAC 四原则 + Agent 平台两个失败极端)+ vLLM 2026 Infrastructure Engineer Guide Network Bachelor(PagedAttention 60-80% 浪费 → 最后一个半满 page)+ Agent Memory Architecture GMI Cloud(三层内存架构 + LLM 调用成本 10-100× 存储)+ The Harness Is the Product Medium(Agent harness 13 组件) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-09T1440-agent-rag-longcontext-radar.md(10-9 14:40 · 5KB · 8 候选 4⭐ = Real Long-Term Memory 50M Token Window arXiv:2610.10845(galahad-kv 公共包 · vLLM + H100 + Gemma 4 12B/31B · 50M token 100/100 成功 · KV state 按 ~16K token 分块加密存储到 NVMe 读回时 byte-exact 无需 recompute · 比 recompute 更便宜更快 · paper_card 1731 ✅ 主分类 llm-infra · NET-new 承接 spark llm-infra 主棒位第 1 例** ⚠⚬⚬⚬) + Foundations of LLMs arXiv:2501.09223(HF 16票 教科书型 · paper_card 1742 ✅ 主分类 llm-infra)+ Forms of LLM-Integrated Applications arXiv:2610.11899(Irene Weber 独立研究 · chatbot/copilot/RAG/workflow/coding agent/AI agent 标签架构层面区分)+ ORCAGen arXiv:2610.12415(RAG + GenAI 可执行代码完整 pipeline 网络安全) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-09-agent-rag-longcontext-radar.md(10-9 08:40 · 8KB · **8 候选 4⭐ = ExperienceIndex arXiv:2610.10091(artifact-grounded memory)+ RECAST arXiv:2610.10507(Google DM 自适应证据路由)+ Real Long-Term Memory arXiv:2610.10845 ⭐⭐⭐⭐ + Agent Plasticity arXiv:2610.08902 + Self-Retrospection Distillation arXiv:2610.08077 + Inherit-MAS arXiv:2610.02396 + RoboJEPA + Does Document Structure Help Dense Retrieval arXiv:2610.10170) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-09-0900-hf-daily-2026-10-09.md(10-9 09:00 · 1.7KB · 100▲ STEPQuant arXiv:2609.38169 Delta 规则循环状态量化中何时何处出错(llm-infra 邻接 · 主分类待核)+ 48▲ UniWam + 29▲ RobotWorld + 26▲ PhysEvo + 53▲ VepAgent + 35▲ Tetris3D + 34▲ RunningTab + 19▲ NAMVIS) 极高 ⭐⭐⭐⭐⭐
inbox/tom 2026-10-09-rag-e1prep.md(10-9 08:50 · 19.6KB · 6 件主增量 RAG 主轴承接) 中 ⭐⭐⭐
inbox/tom 2026-10-09-evaluation-e1prep.md(10-9 15:43 · 17.6KB · Agent Plasticity 三维自我改进评测 + ThinkingBox Agent 评估新范式) 中 ⭐⭐⭐
inbox/flyp 2026-10-09-multimodal-e1prep.md(10-9 09:40 · 13.3KB · 7 件主增量 multimodal 主轴 + MiMo-V2.6 RL scaling 邻接级承接) 高 ⭐⭐⭐⭐
inbox/flyp 2026-10-09-risk-e1prep.md(10-9 18:30 · R97 evening · paper_card 1738 Is Memorization Context-Sensitive arXiv:2610.12085 主分类 rag + 副 engineering risk 强邻接(隐私泄漏)⚠⚬⚬ + paper_card 1742 Foundations of LLMs arXiv:2501.09223 主分类 llm-infra(承接级)+ 1740 MiMo-V2.6 RL scaling(risk 弱邻接)+ JIL Attack 沿用第 2 日 + Constraint Decay 30pp LLM Agent 下降 arXiv 号待核 + MCP 30+ CVEs 数据预备第 1 例) 高 ⭐⭐⭐⭐
inbox/spark 2026-10-08-llm-infra-e1prep.md(10-8 18:40 · 65.4KB · 11 条主增量承接稳态) 极高 ⭐⭐⭐⭐⭐(本棒位基线)
inbox/spark 2026-10-09-agent-e1prep.md(10-9 13:30 · 68.8KB · agent 主轴 14 条主增量 承接级) 高 ⭐⭐⭐⭐
inbox/stephen 2026-10-09-ai-industry-e1prep.md(10-9 12:53 · 91KB · stephen 主棒位 v71 + Anthropic 考虑 IPO $380B + GitHub Trending Top Agent 框架 OpenClaw 390K★ + PageIndex vectorless RAG + Microsoft Agent Lightning v1.0 + Quine 多模态生物世界模型 + Stephen 棒位承接 v3.54 morning 稳态) 极高 ⭐⭐⭐⭐⭐
inbox/stephen 2026-10-09-1006-news-hf-blog.md + 1006-news-msr-blog.md + 1006-news-openai-news.md + 1006-news-google-ai.md + 1006-news-bens-bites.md + 1006-news-tldr-ai.md + 1008-news-yt-deepmind.md + 1008-news-yt-openai.md + 0910-news-x-vip-radar.md(9 件 frontier lab 公告浅读 + X-VIP radar · Anthropic Claude Sonnet 5.5 + Haiku 5.5 + Opus 5.5 + OpenAI GPT-6.1 Sol/Luna/Dots + GPT-6 Intelligent UI + Google Gemini 4 Argon + HyV4/Hy4-Preview 780B MoE + POCKET-Darwin-180B + NVIDIA Nemotron 3 Diarization + Meta Muse Glimmer 30B + xAI Grok 4.7 + Microsoft Agent Lightning v1.0 + Quine 多模态生物世界模型 + EmbeddingGemma 2 多模态嵌入) 中 ⭐⭐⭐
inbox/spark 2026-10-09-1001-rss-gradient-flow.md(10-9 10:01 · 1.2KB · AI Agent 悄然打破的八项安全假设 + 17,600 次尝试 + AI 数据问题已向下游迁移 + AI 的数据喂养方式发生了变化 + 开放 AI 模型将胜出的六个理由) 中 ⭐⭐⭐
inbox/spark 2026-10-09-1003-rss-chip-huyen.md(10-9 10:03 · 0.8KB · Agents · 构建生成式 AI 平台旧论文) 低 ⚬
inbox/spark 2026-10-09-1008-rss-yt-3blue1brown.md(10-9 10:08 · 1.4KB · AI 未能解出的最后一道 IMO 题目) 低 ⚬

合计:7 实例 ≈ 35+ 文件 ≈ 350KB+ 净增 + 10-8 evening → 10-9 evening paper_cards 24h 跨度净增 24 件(编号 1720-1743)+ 主分类 llm-infra 真正 net-new 1 件(1731 galahad-kv)+ 主分类 llm-infra 承接级 1 件(1742 Foundations of LLMs)+ llm-infra 强邻接/副分类 7 件 + 工程邻接承接 6 件 + 承接稳态精修预备级锚定承接 6 件。


一、今日该主题最重要的增量(7 条 · 1 主分类 net-new 主承载级 + 1 主分类承接级 + 5 强邻接承接级 + 6 承接稳态精修预备级锚定承接 = 13 条总增量)

增量 1 · 🟢 llm-infra 主分类 NET-new · galahad-kv 50M Token Window NVMe 持久化 KV Cache · byte-exact 无重计算 ⭐⭐⭐⭐

  • 来源:
  • paper_cards/1731-2610-10845.md(10-9 mtime · 主分类 llm-infra ✓ · Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute)
  • inbox/tom/2026-10-09T1440-agent-rag-longcontext-radar.md(10-9 14:40 · ⭐⭐⭐⭐ 高价值条目 #3)
  • inbox/tom/2026-10-09-agent-rag-longcontext-radar.md(10-9 08:40 早棒 · 4⭐ · "KV cache 持久化方向的实际工程验证 · 显存之外的内存层次补充 · 比 recompute 更便宜更快")
  • inbox/stephen/2026-10-09-ai-industry-e1prep.md(10-9 12:53 · 91KB · stephen 主棒位 v71 已锚 · "Memory 主轴 net-new · galahad-kv 公共包 + vLLM + H100 + Gemma 4 12B/31B + 50M token 100/100 成功 · 新锚 ⚠⚬")
  • inbox/flyp/2026-10-09-risk-e1prep.md(10-9 18:30 R97 evening · paper_card 1731 沿用承接)

  • arXiv:2610.10845v1 https://arxiv.org/abs/2610.10845

  • 要点: 1. 核心问题 = 大语言模型只能使用上下文窗口内文本 + 每次发送 prompt 都重新计算内部 KV 状态 → 无法实现真正的"长期记忆" 2. 方法 = galahad-kv 公共包——将每个 ~16K token 块的 KV state 保存到加密本地 NVMe 磁盘,加载时 byte-exact 无需 recompute 3. 关键实测数据 = vLLM + 单 NVIDIA H100 + Gemma 4 12B / Gemma 4 31B + 50,000,000 token 真实公共文本 → 100/100 探测块 byte-exact 从加密存储加载无重计算 4. 范式意义 = 推理引擎从"显存-内存-NVMe"三级存储扩展 + Memory-as-a-Layer 范式(Memory 第十一栖「分层 Memory」预备第 1 例 + Memory 第十二栖「参数内 Memory」沿用 + Memory 第十三栖「Artifact-grounded Memory」沿用 + Memory 第十四栖「NVMe 持久化 Memory」预备新增第 1 例) 5. 与 v3.54 morning 现有脉络的关系 = 与 v3.54 morning BP-KV 2610.06479 Behavior-Preserving KV Cache Compression(LLM 主轴行为保真驱逐方法)+ DeCoPrune 2609.39096(多模态视频扩散去噪一致性驱逐方法)+ 14+1+1 件 KV Cache 体系化扩增 形成「KV Cache 持久化 + 行为保真驱逐 + 去噪一致性驱逐 + 体系化扩增」第四栖 = KV Cache 长程内存路径预备第 1 例

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(3) KV Cache 已锚入 14+1+1 件体系化扩增(OSDI 2026 三件套 + HotInfra PIM + BP-KV + DeCoPrune + Strata + DirectKV + ECHO + HotPrefix + The Extender + LatentPort + Mooncake + KVSET 等)
  • v3.54 morning §1.(11) Kernel/AI 自动化/Harness 已锚入 MCP Apps + A2A + 协议三分天下 + OAuth 2.0 + SSO + MCP 2026-09 86,148 stars + 97M+ 月 SDK + Memory 三分法 + Stanford ACE
  • galahad-kv 50M Token Window 与 v3.54 morning 现有脉络的关系:

    • 填补「推理引擎 NVMe 持久化 KV Cache 长程内存」维度数据空白 = v3.54 morning §1.(3) KV Cache 体系化扩增集中在「LLM 主轴驱逐方法 + 系统级优化 + 架构创新」,galahad-kv 是「NVMe 持久化 KV Cache + byte-exact 无重计算 + 50M token 实测验证」第 1 例主分类 llm-infra NET-new
    • 承接稳态精修预备级锚定承接 = 与 v3.54 morning BP-KV arXiv:2610.06479 行为保真驱逐 + DeCoPrune arXiv:2609.39096 多模态视频扩散去噪一致性驱逐 + ECHO + HotPrefix 形成「KV Cache 第五纪元(持久化纪元)预备级第 1 例」+ 「驱逐方法论三栖(行为保真 + 去噪一致性 + 持久化)」= KV Cache 跨模态双栖预备级锚入补强
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning Memory 第十一栖「分层 Memory」沿用 + 第十二栖「参数内 Memory」预备 + 第十三栖「Artifact-grounded Memory」预备 + 第十四栖「NVMe 持久化 Memory」预备新增第 1 例 = Memory 体系化扩增预备第四栖预备级
  • 建议归入节:

  • 主归入:§1.(3) KV Cache → 在 v3.54 morning 14+1+1 件体系化扩增沿用后新增 "galahad-kv · arXiv:2610.10845 · 50M Token Window NVMe 持久化 KV Cache · byte-exact 无重计算 · vLLM + H100 + Gemma 4 12B/31B · 100/100 探测成功 · 推理引擎 NVMe 持久化 KV Cache 长程内存预备级第 1 例" = KV Cache 持久化纪元预备级第 1 例
  • 副归入:§1.(11) Kernel/AI 自动化/Harness → 承接稳态精修预备级锚入补强 "galahad-kv 在 vLLM/SGLang 实际集成可行性 + 与 Disaggregated prefill/decode 叠加效果"
  • 副归入:§1.(6) 长上下文 → 承接稳态精修预备级锚入 "galahad-kv NVMe 持久化 + 长上下文 50M token 实际工程验证"
  • 副归入:§1.(13) AI for Systems 闭环 → 候选 C353 v113 = "Memory-as-a-Layer 范式 = 显存 + 内存 + NVMe 三级存储 + Memory 第十四栖预备级第 1 例"
  • 副归入:§4 开放问题 → O569 v113 = "galahad-kv NVMe 持久化在生产环境安全验证 + 加密存储开销 vs 收益 + 多用户并发访问一致性 + 与 vLLM Production Stack LMCache KV 跨实例共享的协同"

  • 可信度:⭐⭐⭐⭐(tom 10-9 14:40 radar 4⭐ + tom 10-9 08:40 radar 4⭐ + stephen noon 主棒位 v71 已锚 ⚠⚬ + flyp 10-9 R97 evening 沿用 · vLLM + H100 + Gemma 4 12B/31B 实测 50M token 100/100 byte-exact 验证)


增量 2 · 🟡 llm-infra 主分类承接级备查资源 · Foundations of LLMs 教科书 ⭐⭐⭐

  • 来源:
  • paper_cards/1742-2501-09223.md(10-9 mtime · 主分类 llm-infra ✓ · Foundations of Large Language Models)
  • inbox/tom/2026-10-09T1440-agent-rag-longcontext-radar.md(10-9 14:40 · 4 件候选 #6 · HF 16票 · 教科书型)
  • organized/queue/work-queue.md(2026-10-09 18:00 · 8 件高优 arXiv 待精读 = 第 2 件 = 2501.09223 Foundations of LLMs)

  • arXiv:2501.09223v1 https://arxiv.org/abs/2501.09223

  • 要点: 1. 核心定位 = 教科书型书籍 · "关于大语言模型的书籍 · 主要关注基础概念而非所有前沿技术的全面覆盖" 2. 结构 = 六章覆盖:预训练(pre-training)/生成模型(generative models)/提示(prompting)/对齐(alignment)/推理(inference)/推理(reasoning) 3. 目标读者 = 大学生 + 自然语言处理及相关领域的专业人士与从业者 · 可作为对 LLM 感兴趣的任何人的参考 4. 承接价值 = 与 v3.54 morning 沿用 Inferact + RadixArk + Red Hat + Microsoft Agent Lightning v1.0 + Quine 多模态生物世界模型等承接级备查资源体系化扩增

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(11) Kernel/AI 自动化/Harness 已锚入 Harness Engineering 2026 + Context Engineering + Memory 三分法 + Stanford ACE
  • v3.54 morning §1.(13) AI for Systems 闭环 已锚入 RoofLang + InferenceBench + SEIS + MLPerf v6.0
  • Foundations of LLMs 与 v3.54 morning 现有脉络的关系:

    • 承接级备查资源 = v3.54 morning 「教科书型承接级备查资源」沿用 + 第六章"inference" 与 v3.54 morning §1.(1) 推理引擎锚定承接 + 第六章"reasoning" 与 v3.54 morning §1.(6) 长上下文锚定承接
    • 承接稳态精修预备级锚定承接 = 与 v3.54 morning jay 10-8 engineering 棒位 + jay 10-9 engineering-e1prep 20.4KB + jay 10-9 1050 llmops-operability-vllm-memory-harness + jay 10-9 1450 inference-systems-deep-dive 25KB 形成的承接级备查资源体系化扩增
    • 承接级预备级 = 与 work-queue.md 10-9 18:00 自动生成 8 件高优 arXiv 待精读(其中 2501.09223 = 第 2 件 = 备查级预备级)承接稳态精修预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(11) Kernel/AI 自动化/Harness → 在 v3.54 morning Harness Engineering 2026 + Context Engineering 沿用后新增 "Foundations of LLMs · arXiv:2501.09223 · 教科书型 · 六章覆盖预训练/生成/提示/对齐/推理/推理 · 承接级备查资源预备级第 N 例" = 教科书型承接级备查资源
  • 副归入:§7 沿革摘要 → 承接稳态精修预备级锚入 "Foundations of LLMs 作为承接级备查资源基线"
  • 副归入:§4 开放问题 → O570 v113 = "Foundations of LLMs 第六章 inference + reasoning 在 v3.54 morning §1.(1) 推理引擎 + §1.(6) 长上下文锚定的承接级备查资源"

  • 可信度:⭐⭐⭐(tom 10-9 14:40 radar 单源承接 · HF 16票 · work-queue.md 10-9 18:00 自动生成 8 件高优 arXiv 待精读 第 2 件 · 教科书型承接级备查资源)


增量 3 · 🟢 llm-infra 强邻接承接级 · Cascadia arXiv:2610.07219 · 消费级 Eleven AI PC 上 975B MoE 推理 ⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · arXiv 2610.07219 · Twinkll Sisodia · ⭐⭐⭐⭐⭐ · 完整 artifact + 复现步骤映射到 commit)

  • 要点: 1. 核心 = 首个在消费级硬件(Eleven AI PC / DGX Spark 系统)上部署 975B MoE 的工程报告 2. 挑战的假设 = "超大模型必须在数据中心运行" 3. 关键技术 = NVFP4 量化 + 分布式推理 + 消费级互联 4. Artifact 完整 = 代码 + 数据 + 复现说明 + 复现步骤映射到 commit = 引用了 Inkling-NVFP4 在 8×DGX Spark 上的工程数据 5. 范式意义 = 边缘推理 + 超大模型组合的工程可行性 + 「MoE 消费级 + 推理」预备第 2-3 例(与 v3.54 morning Colibri 纯 C MoE 引擎 744B GLM-5.2 25GB RAM 消费级 + SlimWise 阶段层路由 形成「消费级 MoE 部署 + 服务级 MoE 阶段解耦 + 数据中心级 MoE 推理」三栖预备级)

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(10) MoE 推理 已锚入 Mixtral 8x7B + DeepSeek V3/V4 + Qwen3.5 MoE + Llama 4 MoE + SlimWise + NeMo-DCR + Structuring MoE Agentic RL + Colibri
  • v3.54 morning §1.(11) 硬件感知 已锚入 HBM/Flash/PIM 路线 + 异构计算
  • Cascadia 与 v3.54 morning 现有脉络的关系:

    • 填补「消费级硬件 + 超大 MoE 推理 + NVFP4 量化」维度数据空白 = v3.54 morning §1.(10) MoE 推理 + §1.(11) 硬件感知 集中在「数据中心级推理 + 跨平台引擎」,Cascadia 是「消费级硬件 + 超大 MoE 推理」第 1 例预备级锚入补强
    • 承接稳态精修预备级锚定承接 = 与 v3.54 morning Colibri 纯 C MoE 引擎 744B GLM-5.2 25GB RAM 消费级 + SlimWise arXiv:2609.34117 Prefill/Decode 解耦专家剪枝 + NeMo-DCR arXiv:2610.08430 比特精确 Delta 压缩重拟合 形成「消费级 MoE 部署 + 服务级 MoE 阶段解耦 + 数据中心级 MoE 推理 + 万亿 Agentic RL 推理支撑」四栖预备级
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning RoofLang arXiv:2609.12551 AI Agent 自动优化推理系统 + SEIS arXiv:2610.04646 AI Agent 自动调优引擎配置空间 + InferenceBench arXiv:2607.20468 AI Agent 驱动推理优化 Benchmark 形成「评测基准 + 第三方实测 + 官方赛场 + AI Agent 自动优化 + 消费级超大 MoE 工程验证」五栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(10) MoE 推理 → 在 v3.54 morning Mixtral 8x7B + DeepSeek V3/V4 + Qwen3.5 MoE + Llama 4 MoE + SlimWise + NeMo-DCR + Colibri 沿用后新增 "Cascadia · arXiv:2610.07219 · 消费级 Eleven AI PC + DGX Spark + 975B MoE + NVFP4 量化 · 完整 artifact + 复现步骤映射到 commit · MoE 消费级部署预备第 3 例" 预备级 = 消费级 MoE 部署预备级
  • 副归入:§1.(11) 硬件感知 → 承接稳态精修预备级锚入 "Cascadia 消费级硬件 + 超大 MoE + NVFP4 量化"
  • 副归入:§1.(13) AI for Systems 闭环 → 候选承接稳态精修预备级锚入 "Cascadia 消费级 + 数据中心级 + AI Agent 自动优化 = AI for Systems 五栖预备级"
  • 副归入:§4 开放问题 → O571 v113 = "Cascadia 消费级 MoE 部署在真实生产环境的稳定性 + 复现 artifact 在 NVIDIA H100/200 + AMD MI300 + 国产 GPU 跨平台验证"

  • 可信度:⭐⭐⭐⭐(jay 10-9 14:50 inference-systems-deep-dive 单源承接 · 完整 artifact + 复现步骤映射到 commit · 首个消费级硬件 + 超大 MoE 推理工程报告)


增量 4 · 🟢 llm-infra 强邻接承接级 · EdgeAgent arXiv:2610.03394 · 多 Agent 系统 CPU-GPU 统一内存架构在设备推理 ⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · arXiv 2610.03394v1 · 2026年10月 · ⭐⭐⭐⭐ · 自定义 ARM SME kernel 工程)

  • 要点: 1. 核心 = 在端侧设备(CPU-GPU 统一内存架构)上高效运行多 Agent LLM 推理的系统设计 2. 关键技术 = 自定义 SME(Scalar Matrix Extension)kernel——为 ARM SME 实现预打包权重的 GEMM kernel,避免通用 BNNS 库在 LLM 推理张量 shape 下的次优性能 3. 关键技术 2 = 离线预打包模型权重消除运行时 layout 转换开销 4. 基准 = DeepSeek-R1-Distill-Llama-8B(推理 focus 模型,CoT 生成 drafting 难度高)+ Llama-3.1-8B-Instruct + 使用 EAGLE-3 作为 speculative decoding baseline 5. 范式意义 = 与 v3.54 morning SpecScale arXiv:2609.39334(详见增量 5)+ FreeToken MoE + MNN-LLM + 1630 Prefill-Free + MemFold 1646 形成「端侧多 Agent + 消费级超大 MoE + 数据中心级推理」三栖预备级

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(11) 硬件感知 已锚入 HBM/Flash/PIM 路线 + 异构计算 + TPU Externalization
  • v3.54 morning §1.(1) 推理引擎 已锚入 SpecScale 沿用承接稳态精修预备级
  • EdgeAgent 与 v3.54 morning 现有脉络的关系:

    • 填补「端侧 CPU-GPU 统一内存 + 多 Agent 推理 + ARM SME kernel」维度数据空白 = v3.54 morning 「端侧推理」集中在 Apple Silicon + TPU 路线,EdgeAgent 是「端侧多 Agent 推理 + ARM SME kernel」预备级第 1 例锚入补强
    • 承接稳态精修预备级锚定承接 = 与 v3.54 morning FreeToken MoE + MNN-LLM + SpecScale + MemFold 形成「端侧推理 + 多 Agent 协同 + 投机解码 + 跨平台引擎」四栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(11) 硬件感知 → 在 v3.54 morning HBM/Flash/PIM + TPU Externalization 沿用后新增 "EdgeAgent · arXiv:2610.03394 · 多 Agent 系统 CPU-GPU 统一内存架构在设备推理 · 自定义 ARM SME kernel + 离线预打包权重 · DeepSeek-R1-Distill-Llama-8B + EAGLE-3 baseline · 端侧多 Agent 推理预备级第 1 例" 预备级
  • 副归入:§1.(1) 推理引擎 → 承接稳态精修预备级锚入 "EdgeAgent 端侧多 Agent 推理引擎"
  • 副归入:§4 开放问题 → O572 v113 = "EdgeAgent ARM SME kernel 在主流端侧设备的工程化 + 与 EAGLE-3 speculative decoding baseline 性能对比"

  • 可信度:⭐⭐⭐⭐(jay 10-9 14:50 inference-systems-deep-dive 单源承接 · ARM SME kernel 工程细节 + 多 Agent 并发场景的独特系统设计)


增量 5 · 🟢 llm-infra 强邻接承接级 · SpecScale arXiv:2609.39334 · 投机解码在测试时计算扩展中的系统优化 ⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · arXiv 2609.39334 · 2026年9月30日 · ⭐⭐⭐⭐ · 含明确基准配置)

  • 要点: 1. 问题 = 投机解码在小粒度、不规则任务上 GPU 利用率低,反复打断 decode 步骤,系统开销可能超过性能收益 2. 解决方案 = SpecScale——轻量级 LLM serving 框架,支持 continuous batching + paged attention + prefix KV caching/sharing + fused attention kernels 3. 评估 = Qwen2.5 和 Llama3 家族的 4 个 generator-verifier 组合,在 GSM8K + MATH-500 + OlympiadBench 上,单 NVIDIA A100 GPU 4. 结论 = SpecScale 在所有数据集上持续优于 naive-speculative 和近期工作;投机解码需要系统级支持才能在 test-time scaling 场景中带来净收益 5. 工程价值 = 量化了投机解码开销 vs 收益的临界条件 + 提供了轻量级 serving 框架实现细节

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(5) 投机解码 已锚入 LoopLMs 1594 + Loop Scaling Laws 1604 + vLLM Production Stack P1 multimodal vLLM Omni + EAGLE-3 draft model 不兼容 MTP + Qwen3.8-27B 单 flag 1.7-2× 改善
  • v3.54 morning §1.(1) 推理引擎 已锚入 vLLM Production Stack 2026 GA + MRv2 + EAGLE-3 30-45% decode 加速
  • SpecScale 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「投机解码 + 系统级支持」沿用 + SpecScale「量化了投机解码开销 vs 收益的临界条件」承接稳态精修预备级锚入补强
    • 与 v3.54 morning EdgeAgent + Cascadia + Colibri + SlimWise + NeMo-DCR 形成「推理系统扩展预备级六栖」
  • 建议归入节:

  • 主归入:§1.(5) 投机解码 → 在 v3.54 morning LoopLMs + Loop Scaling Laws + EAGLE-3 + Qwen3.8-27B 沿用后新增 "SpecScale · arXiv:2609.39334 · 投机解码在测试时计算扩展中的系统优化 · Qwen2.5/Llama3 4 个 generator-verifier 组合 · GSM8K/MATH-500/OlympiadBench · 单 A100 · 量化了投机解码开销 vs 收益的临界条件预备级第 1 例" 预备级
  • 副归入:§1.(1) 推理引擎 → 承接稳态精修预备级锚入 "SpecScale 轻量级 serving 框架"
  • 副归入:§4 开放问题 → O573 v113 = "SpecScale 在 H100/B200 + vLLM/SGLang 生产环境实测 + 与 EAGLE-3 + DFlash2 + Spec V2 在不同 workload 的临界条件"

  • 可信度:⭐⭐⭐⭐(jay 10-9 14:50 inference-systems-deep-dive 单源承接 · 含明确基准配置 + 量化了投机解码临界条件)


增量 6 · 🟢 llm-infra 强邻接承接级 · vLLM→llm-d→推理控制平面演化综述 arXiv:2609.23130 · Tesla/Red Hat/KServe prefix-cache-aware routing ~3× 吞吐量 ⭐⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · arXiv 2609.23130 · Twinkll Sisodia Boston University · ⭐⭐⭐⭐⭐ · 系统工程综述)

  • 要点: 1. 系统性梳理 = 从"单引擎优化"到"多组件协调"的演化路径:Orca 迭代调度 → vLLM PagedAttention + continuous batching → kernel 级 attention 优化 → Chunked Prefill → 量化 → 长上下文执行 2. 核心论点 = 推理问题已从"让单个模型高效处理请求"演化为"跨 fleet 协调状态、相位、加速器和 SLO" 3. 生产级数据点 = 引用 llm-d 项目的生产证据:Tesla/Red Hat/KServe 报告中,prefix-cache-aware routing 比 round-robin 在 Llama 3.1 70B 四卡 AMD MI300X 上实现 ~3× 吞吐量提升、2× TTFT 改善(生产报告,非受控实验) 4. 范式跃迁 = 将 vLLM、llm-d、NVIDIA Dynamo 三代系统串联为统一演进叙事——v3.54 morning §1.(1) 推理引擎 + inference.md v310 §2 PagedAttention 与 vLLM MRV2 锚入补强 5. 工程价值 = ✅ 系统工程综述覆盖推理架构完整演化链条 + ✅ 含生产级数据点(Tesla/KServe 部署案例)+ ✅ 对理解当前推理基础设施格局有架构级价值 ⚠️ 引用数据来自生产报告,条件受限,需独立验证

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(1) 推理引擎 已锚入 vLLM Production Stack 2026 GA + V1 MRv2 重构 + SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源三确认 + inference.md v310 §1.3 llm-d CNCF Sandbox + K8s 推理编排
  • v3.54 morning §1.(2) 推理调度 已锚入 5 件推理调度算法 + ICML 2026 复现 D225 沿用 + D230 沿用 + arXiv:2606.14589 Agent 生产静默失败 8 周实证 5 类静默失败机制
  • vLLM→llm-d→控制平面演化综述与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「推理系统从单引擎到多组件协调」沿用 + 综述提供统一演进叙事承接稳态精修预备级锚入补强
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning SGLang vs vLLM H100 +29% + vLLM Production Stack 2026 GA + V1 MRv2 重构 + vLLM EAGLE-3 30-45% decode 加速 形成「推理引擎代际切换预备级 + Agent 框架代际切换预备级 + 推理控制平面演化叙事」三栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.54 morning vLLM Production Stack 2026 GA + V1 MRv2 重构 + SGLang vs vLLM H100 +29% + PagedAttention V1 后端移除旧实现 沿用后新增 "vLLM→llm-d→推理控制平面演化综述 · arXiv:2609.23130 · Twinkll Sisodia Boston University · 跨 fleet 协调状态/相位/加速器/SLO · Tesla/Red Hat/KServe prefix-cache-aware routing Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐量 + 2× TTFT 改善 · 推理系统统一演进叙事预备级第 1 例" 预备级
  • 副归入:inference.md §2 PagedAttention 与 vLLM MRV2 → 承接稳态精修预备级锚入补强 "vLLM→llm-d→控制平面演化统一叙事"
  • 副归入:inference.md §1.3 llm-d CNCF Sandbox + K8s 推理编排 → 承接稳态精修预备级锚入补强 "Tesla/Red Hat/KServe 生产级数据点"
  • 副归入:§4 开放问题 → O574 v113 = "综述引用数据来自生产报告(Tesla/Red Hat/KServe)条件受限,需独立验证 + 与 NVIDIA Dynamo v1.5.0 Feature Matrix 对比"

  • 可信度:⭐⭐⭐⭐⭐(jay 10-9 14:50 inference-systems-deep-dive 单源承接 · 系统工程综述 + 含生产级数据点 + 串联 vLLM/llm-d/Dynamo 三代系统统一叙事)


增量 7 · 🟡 llm-infra 强邻接承接级 · STEPQuant arXiv:2609.38169 · 100▲ HF Daily · Delta 规则循环状态量化中何时何处出错 ⭐⭐⭐

  • 来源:
  • inbox/tom/2026-10-09-0900-hf-daily-2026-10-09.md(10-9 09:00 · 100▲ 第 1 件立标 · STEPQuant Delta 规则循环状态量化中何时何处出错)
  • inbox/stephen/2026-10-09-ai-industry-e1prep.md(10-9 12:53 · 91KB · stephen 主棒位 v71 已锚 · "2609.38169 STEPQuant Delta 规则循环状态量化中何时何处出错 · llm-infra 邻接 · 100▲ HF Daily 10-09 · 新锚")

  • arXiv:2609.38169v1 https://arxiv.org/abs/2609.38169

  • 要点: 1. 核心问题 = Delta 规则循环状态量化(recurrent state quantization)中何时何处出错? 2. 核心方法 = 分析循环状态量化在不同位置/时机的失败模式 3. 范式意义 = 与 v3.54 morning §1.(4) 量化 已锚入 FlashInfer Blackwell + Kimi K3 MLA + MiniMax-M3 sparse attention + GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell + arXiv 2609.33591 + vLLM Production Stack P1 FP8 KV-cache + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell + QATFactory 2609.39223 + Baseten VibeQwen 形成「量化体系扩展预备级第 N 例」

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(4) 量化 已锚入上述 12 件体系化扩增
  • STEPQuant 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「量化体系扩展」沿用 + STEPQuant「Delta 规则循环状态量化失败模式分析」承接稳态精修预备级锚入补强
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning Quantization + KV Cache + MoE 推理 + 长上下文 形成「量化 + 跨模态 + 跨场景」四栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(4) 量化 → 在 v3.54 morning FlashInfer Blackwell + Kimi K3 MLA + QATFactory + Baseten VibeQwen 沿用后新增 "STEPQuant · arXiv:2609.38169 · Delta 规则循环状态量化中何时何处出错 · 100▲ HF Daily 10-09 · 量化失败模式分析预备级第 1 例" 预备级
  • 副归入:§4 开放问题 → O575 v113 = "STEPQuant 循环状态量化失败模式在生产推理引擎的稳定性 + 与 FP8 KV-cache + MXFP8 + NVFP4 跨平台 ROI 评估"

  • 可信度:⭐⭐⭐(tom 10-9 09:00 HF Daily 100▲ 高优 + stephen noon 主棒位 v71 已锚 · 单 arXiv ID + 标题 + 票数 + llm-infra 邻接级主分类待核)


增量 8 · 🟡 llm-infra 强邻接承接级 · MiMo-V2.6 arXiv:2610.11959 · RL Scaling 异步训练 2.7-3.7B tokens/step hybrid-SWA ⭐⭐⭐

  • 来源:
  • paper_cards/1740-2610-11959.md(10-9 mtime · 主分类 engineering + 副 multimodal · MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement)
  • inbox/flyp/2026-10-09-risk-e1prep.md(10-9 18:30 R97 evening · 1740 沿用承接 · risk 弱邻接)
  • inbox/tom/2026-10-09T1440-agent-rag-longcontext-radar.md(10-9 14:40 · MiMo-V2.6 候选 #5)

  • arXiv:2610.11959v1 https://arxiv.org/abs/2610.11959

  • 要点: 1. 核心 = MiMo-V2.6 系列 omni-modal 基础模型,RL scaling 推动模型智能前沿 2. 关键技术 = 预 RL 阶段 mid-training on 多模态语料 + hybrid-SWA 架构上的基础设施支持后续 scale-up 3. 三维度扩展 RL compute = (1) 更大批次 + 更高吞吐,采用异步训练(2.7-3.7B tokens/step) 4. 范式意义 = 与 v3.54 morning §1.(8) 训练 已锚入 Nereus 1565 + Loop Scaling Laws 1604 + MemFold 1646 + NeMo-DCR 2610.08430(承接级承接)+ 微调与 Mixtral 8x7B + DeepSeek V3/V4 + Qwen3.5 MoE + Llama 4 MoE 形成「RL scaling + 异步训练 + hybrid-SWA 架构」三栖预备级

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(8) 训练 已锚入 Nereus + Loop Scaling Laws + MemFold + NeMo-DCR 承接级承接
  • v3.54 morning §1.(10) MoE 推理 已锚入 Mixtral + DeepSeek + Qwen + Llama 4 MoE
  • MiMo-V2.6 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「MoE + 异步训练 + hybrid-SWA 架构」沿用 + MiMo-V2.6「RL scaling 异步训练 2.7-3.7B tokens/step」承接稳态精修预备级锚入补强
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning SpecScale + EdgeAgent + Cascadia + galahad-kv + RoofLang + SEIS 形成「训练 + 推理 + 服务 + 优化」四栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(8) 训练 → 在 v3.54 morning Nereus + Loop Scaling Laws + MemFold + NeMo-DCR 沿用后新增 "MiMo-V2.6 · arXiv:2610.11959 · RL Scaling Towards Self-Improvement · 异步训练 2.7-3.7B tokens/step · hybrid-SWA 架构 · omni-modal 基础模型 · RL scaling 异步训练预备级第 1 例" 预备级
  • 副归入:§1.(10) MoE 推理 → 承接稳态精修预备级锚入 "MiMo-V2.6 hybrid-SWA 架构 + RL scaling"
  • 副归入:§4 开放问题 → O576 v113 = "MiMo-V2.6 异步训练 2.7-3.7B tokens/step 在大规模生产环境的工程实现 + 与 NeMo-DCR 比特精确 delta 压缩重拟合的协同"

  • 可信度:⭐⭐⭐(paper_card 1740 主分类 engineering + 副 multimodal · flyp 10-9 R97 evening 沿用 · 承接级承接)


增量 9 · 🟠 承接稳态精修预备级锚定承接 · vllm.cpp mudler C++ 实现推理引擎 1:1 vLLM 兼容 ⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · GitHub mudler/vllm.cpp · 2026-09 更新 · ⭐⭐⭐⭐ · 含具体版本时间线)

  • 要点: 1. 核心 = vllm.cpp = 社区主导的 C++ 实现推理引擎,1:1 vLLM 兼容(Continuous batching + Paged KV) 2. 额外功能 = GGUF 权重支持 + RadixAttention + Cache-aware scheduling 3. 2026-09 更新 = CUDA EXL3 支持 Qwen3.8-27B + DFlash2 draft;C ABI 26 暴露更多 engine 控制 API 4. 2026-09 更新 = Vulkan 支持 TQ1_0 ternary kernels(压缩权重矩阵乘法 + MoE fused kernels) 5. ROCm AMD 路径 = EXL3 在 gfx1151 上生成,零 CPU fallback 6. 定位 = 无 CUDA 环境、AMD/Intel GPU、嵌入式场景的生产备选

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(1) 推理引擎 已锚入 SGLang/vLLM/TensorRT-LLM + vLLM Production Stack 2026 GA + V1 MRv2 重构 + TPU Externalization + inference.md v310 §1.2 六引擎 2026 Q4 完整量化矩阵
  • v3.54 morning §1.(11) 硬件感知 已锚入 HBM/Flash/PIM + TPU Externalization
  • vllm.cpp 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「非 NVIDIA 推理生态三栖」沿用 + vllm.cpp「AMD ROCm + Intel GPU + 嵌入式」承接稳态精修预备级锚入补强
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning vLLM Production Stack 2026 GA + SGLang v0.5.20 + vllm.cpp mudler + Colibri 纯 C MoE 引擎 744B GLM-5.2 25GB RAM 消费级 + Cascadia 975B MoE 消费级形成「六引擎扩展 + 多硬件适配」六栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.54 morning 6 引擎 2026 Q4 完整量化矩阵沿用后新增 "vllm.cpp · mudler/vllm.cpp · C++ 实现 1:1 vLLM 兼容 · 2026-09 CUDA EXL3 Qwen3.8-27B DFlash2 + C ABI 26 + Vulkan TQ1_0 ternary kernels · ROCm AMD gfx1151 零 CPU fallback · 非 NVIDIA 推理生态预备级第 2 例" 预备级 = 承接稳态精修预备级锚入补强
  • 副归入:§1.(11) 硬件感知 → 承接稳态精修预备级锚入 "vllm.cpp 跨硬件适配"
  • 副归入:§4 开放问题 → O577 v113 = "vllm.cpp 1:1 vLLM 兼容在 AMD/Intel/嵌入式 GPU 的工程实现路径"

  • 可信度:⭐⭐⭐⭐(jay 10-9 14:50 inference-systems-deep-dive 单源承接 · GitHub Trending + 含具体版本时间线 + 跨硬件适配工程参考)


增量 10 · 🟠 承接稳态精修预备级锚定承接 · TrueFoundry SGLang vs vLLM vs TensorRT-LLM 选型指南 2026-10-08 ⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md(10-9 14:50 · TrueFoundry Blog Ashish Dubey 2026-10-08 · ⭐⭐⭐⭐ · 2026年10月8日发布 · 时效性最强)

  • 要点: 1. 三引擎选型决策(真有用):

    • TensorRT-LLM:编译时生成模型特定 engine,NVIDIA GPU 上通常达到更低延迟,但需要针对特定模型/GPU 组合编译
    • vLLM:优秀吞吐量和更广泛模型覆盖,无需 build 步骤,是通用场景默认选择
    • SGLang:当 prompt 共享长前缀(共享 system prompt、agentic 多轮对话)或需要快速可靠的 JSON/grammar 约束 structured output 时选择 SGLang;RadixAttention 专为前缀复用设计 2. 关键洞察 = 前缀复用场景(2026 主流 agentic workload)下,SGLang 与 vLLM 差距显著 3. 承接价值 = 2026-10-08 极新发布 + 明确三引擎选型决策树,适合直接作为选型文档参考
  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(1) 推理引擎 已锚入 SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源三确认 + TensorRT-LLM 沿用承接稳态精修预备级
  • v3.54 morning §3 共识与争议 候选 C350-C352 预备级已锚入 SGLang vs vLLM H100 跨源三确认
  • TrueFoundry 选型指南与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「三引擎选型」沿用 + TrueFoundry 「2026-10-08 极新发布 + 明确三引擎选型决策树」承接稳态精修预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.54 morning SGLang vs vLLM H100 +29% 沿用后承接稳态精修预备级锚入补强 "TrueFoundry SGLang vs vLLM vs TensorRT-LLM 选型指南 2026-10-08 · 决策树:TensorRT-LLM(低延迟)+ vLLM(通用)+ SGLang(前缀复用/JSON grammar)"
  • 副归入:§3 共识与争议 → 候选承接稳态精修预备级锚入 "TrueFoundry 选型决策树与 v3.54 morning SGLang/vLLM H100 +29% 跨源三确认形成选型决策双栖预备级"

  • 可信度:⭐⭐⭐⭐(jay 10-9 14:50 inference-systems-deep-dive 单源承接 · 2026-10-08 极新发布 + 明确决策树)


增量 11 · 🟠 承接稳态精修预备级锚定承接 · Cache-History Sensitivity 滚动 Agent 中 KV Cache 重用新发现 arXiv 2026 ⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1505-jay-afternoon-briefing-database-backend-cloudnative-csdn-oct09.md(10-9 15:05 · arXiv 2026 · ⭐⭐⭐⭐ · 与 vLLM/SGLang 的 prefix cache 机制直接相关)

  • 要点: 1. 核心发现 = exact prefix 匹配在某些场景下不够用——persistent history 的 KV state 变化会影响后续 reuse 2. 对比方法 = EPIC(position-independent caching)+ KVLink(positional encoding adjustment)+ MiniPIC(vLLM 内 span-oriented reuse primitives) 3. 生产意义 = 直接揭示了生产 RAG/Agent 系统中的 KV cache 失效根因;与 vLLM/SGLang 的 prefix cache 机制直接相关;含系统性 benchmark,建议 vLLM/SGLang 生产部署团队精读

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(3) KV Cache 已锚入 14+1+1 件体系化扩增(OSDI 2026 三件套 + HotInfra PIM + BP-KV + DeCoPrune + Strata + DirectKV + ECHO + HotPrefix + The Extender + LatentPort + Mooncake + KVSET 等)
  • v3.54 morning §1.(1) 推理引擎 已锚入 vLLM/SGLang 多轮对话 75-95% cache hit +10-20% 额外提升 + vLLM Production Stack P1 multimodal vLLM Omni
  • Cache-History Sensitivity 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「KV Cache 体系化扩增」沿用 + Cache-History Sensitivity 「exact prefix 匹配失效根因」承接稳态精修预备级锚入补强
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning BP-KV + DeCoPrune + galahad-kv 1731 + SANTA++ 形成「KV Cache 失效根因 + 驱逐方法 + 持久化 + 选择性读取」五栖预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(3) KV Cache → 在 v3.54 morning 14+1+1 件体系化扩增沿用后承接稳态精修预备级锚入补强 "Cache-History Sensitivity · arXiv 2026 · 滚动 Agent 中 KV Cache 重用 · exact prefix 匹配失效根因 · EPIC + KVLink + MiniPIC 对比 · vLLM/SGLang prefix cache 失效根因预备级第 1 例"
  • 副归入:§1.(1) 推理引擎 → 承接稳态精修预备级锚入 "Cache-History Sensitivity 与 vLLM Production Stack LMCache 跨实例共享的协同"
  • 副归入:§4 开放问题 → O578 v113 = "Cache-History Sensitivity exact prefix 匹配失效在生产环境的稳定性 + 与 EPIC/KVLink/MiniPIC 在 vLLM 实际集成的工程路径"

  • 可信度:⭐⭐⭐(jay 10-9 15:05 afternoon briefing 单源承接 · arXiv 2026 编号待补 · 与 vLLM/SGLang prefix cache 机制直接相关 + 含系统性 benchmark)


增量 12 · 🟠 承接稳态精修预备级锚定承接 · SANTA++ arXiv:2026 选择性 KV Cache 读取 ⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1505-jay-afternoon-briefing-database-backend-cloudnative-csdn-oct09.md(10-9 15:05 · arXiv 2026 · ⭐⭐⭐ · 与 SANTA + ShadowKV + CentroidKV 方向互补)

  • 要点: 1. 问题 = 长上下文 LLM 推理中,完整 KV cache scan 代价极高 2. 与 SANTA 区别 = SANTA++ 用近似路由替代完整 key scan,显著降低 KV 访问量 3. 实验数据 = KV 访问量大幅下降,同时保持高质量输出 4. 工程价值 = 长上下文推理的 KV 读取优化,与 ShadowKV、CentroidKV 等方向互补

  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(3) KV Cache 已锚入 14+1+1 件体系化扩增 + galahad-kv 1731 NET-new + Cache-History Sensitivity
  • SANTA++ 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 = v3.54 morning 「KV Cache 读取优化」沿用 + SANTA++ 「近似路由替代完整 key scan」承接稳态精修预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(3) KV Cache → 在 v3.54 morning 14+1+1 件体系化扩增 + Cache-History Sensitivity 沿用后承接稳态精修预备级锚入补强 "SANTA++ · arXiv 2026 · 选择性 KV Cache 读取 · 近似路由替代完整 key scan · 与 ShadowKV + CentroidKV 方向互补"

  • 可信度:⭐⭐⭐(jay 10-9 15:05 afternoon briefing 单源承接 · arXiv 2026 编号待补)


增量 13 · 🟠 承接稳态精修预备级锚定承接 · Fivenines vLLM/SGLang Prometheus metrics 监控 + Tensormesh/Winder H100 单卡持平 ⚠⚬⚬⚬⚬⚬ ⭐⭐⭐⭐

  • 来源:
  • inbox/jay/2026-10-09T1505-jay-afternoon-briefing-database-backend-cloudnative-csdn-oct09.md(10-9 15:05 · tensormesh.ai vLLM vs SGLang Llama 3.1 8B H100 单卡 50 并发 vLLM 3,688 vs SGLang 3,617 差距 <2% · Qwen3.8-27B SGLang 1,725 > vLLM 1,610 · vLLM 版本漂移警告 2026 年 5-8 月 v0.22.0→v0.28.0 每 10 天一版 · SGLang RL rollout 后端 + vLLM 92,700★ vs SGLang 36,400★(2026-09)· Fivenines vLLM/SGLang Prometheus metrics 监控(agent v1.17.0/1.17.1))

  • 要点: 1. 关键数据(H100 单卡 50 并发):

    • Llama 3.1 8B:vLLM 3,688 tok/s vs SGLang 3,617 tok/s → 差距 <2%(v3.54 morning SGLang 16,200 vs vLLM 12,500 = +29% 跨源三确认 ⚠⚬⚬⚬⚬⚬ 大幅缩窄)
    • Qwen3.8-27B:SGLang 1,725 > vLLM 1,610(SGLang 需调 state cache 达峰值) 2. vLLM 版本漂移警告 = 2026 年 5-8 月间 vLLM 从 v0.22.0 升至 v0.28.0,约每 10 天一个版本,版本间性能差异显著(新增 ⚠⚬⚬⚬⚬⚬ 重要观察) 3. SGLang 定位 = 官方 README 明确将其定位为 RL rollout 后端 4. vLLM 生态 = 200+ 架构支持,GitHub 星标 ~92,700 vs SGLang ~36,400(2026-09) 5. Fivenines 监控 = 直接采集 vLLM/SGLang 暴露的 Prometheus metrics(OpenAI 兼容端口);关键可观测信号 = queued/running 请求数 + KV cache 使用率(vLLM)/token 使用率(SGLang)+ token/s + TTFT + inter-token latency + end-to-end latency + prefix/RadixAttention cache hit rate;新增 AI Inference 告警模板:server down + queue saturated + KV cache pressure;需要 agent v1.17.0(vLLM)或 v1.17.1(SGLang)
  • 与活文档 llm-infra.md v3.54 morning 现有脉络的关系:

  • v3.54 morning §1.(1) 推理引擎 已锚入 SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源三确认(09:30 jay + 16:23 jay + 12:21 jay + Prem AI + LeetLLM + MorphLLM + Spheron + Yobitel + Yotta Labs + web_search 2026-10-09 atomic.chat + premai.io + spheron.network)
  • v3.54 morning §3 共识与争议 候选 C350-C352 预备级已锚入 SGLang vs vLLM H100 跨源三确认 + v3.54 morning D246 ⚠⚬⚬⚠ SGLang 2026/02 GB300 NVL72 上 25× 推理性能提升待核验
  • tensormesh.ai/winder.ai 与 v3.54 morning 现有脉络的关系:

    • 承接稳态精修预备级锚定承接 + 反向信号 ⚠⚬⚬⚬⚬⚬ = v3.54 morning 「SGLang vs vLLM H100 +29%」跨源三确认 + tensormesh.ai 「H100 单卡 50 并发 Llama 3.1 8B vLLM 3,688 vs SGLang 3,617 差距 <2% 大幅缩窄」承接稳态精修预备级 + 反向信号锚入补强 ⚠⚬⚬⚬⚬⚬—— v3.54 morning 「+29% SGLang」与 tensormesh.ai 「<2%」的差异 = workload(并发数 + prefix 复用率)+ 模型(Llama 3.1 8B vs Qwen3.8-27B)+ 版本(SGLang v0.5.20 vs vLLM v0.30.0 + 期间版本漂移)
    • 承接稳态精修预备级锚入补强 = 与 v3.54 morning vLLM 版本漂移警告(新增 ⚠⚬⚬⚬⚬⚬)+ SGLang 官方 RL rollout 后端定位 + vLLM 92,700★ vs SGLang 36,400★ 形成「版本管理 + workload 适配 + 生态优势」三栖预备级锚入补强
    • Fivenines 监控 = 与 v3.54 morning vLLM Production Stack 2026 GA 全链路可观测性沿用 + Fivenines vLLM/SGLang Prometheus metrics + KV cache 使用率 + prefix/RadixAttention cache hit rate 形成「全链路可观测性预备级三栖」
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.54 morning SGLang vs vLLM H100 +29% 沿用后承接稳态精修预备级 + 反向信号锚入补强 ⚠⚬⚬⚬⚬⚬ "tensormesh.ai vLLM vs SGLang · Llama 3.1 8B H100 单卡 50 并发 vLLM 3,688 vs SGLang 3,617 差距 <2%(v3.54 morning +29% 大幅缩窄)+ Qwen3.8-27B SGLang 1,725 > vLLM 1,610 · vLLM 版本漂移 2026-05-08 v0.22.0→v0.28.0 每 10 天一版 · SGLang RL rollout 后端定位 · vLLM 92,700★ vs SGLang 36,400★ · Fivenines Prometheus metrics 监控(agent v1.17.0/1.17.1)" 预备级
  • 副归入:§3 共识与争议 → 候选承接稳态精修预备级锚入补强 "tensormesh.ai 反向信号 + vLLM 版本漂移警告 + SGLang RL rollout 定位"
  • 副归入:§4 开放问题 → 新增 O579 v113 ⚠⚬⚬⚬⚬⚬ = v3.54 morning D246 GB300 NVL72 25× 待核验 + v3.54 morning C350-C352 SGLang vs vLLM H100 +29% vs tensormesh.ai H100 单卡 <2% 大幅缩窄 ⚠⚬⚬⚬⚬⚬ 跨源三确认与反向信号协同待核 + vLLM 版本漂移 2026-05-08 v0.22.0→v0.28.0 每 10 天一版生产稳定版本基线待核

  • 可信度:⭐⭐⭐⭐(tensormesh.ai + winder.ai 2026-10 H100 单卡实测 + vLLM GitHub Trending 92,700★ vs SGLang 36,400★ + Fivenines Prometheus metrics 监控 · ⚠⚬⚬⚬⚬⚬ 反向信号需要核实)


二、值得警惕的矛盾或待核实说法

⚠️ 矛盾 1 · SGLang v0.5.20 vs vLLM v0.30.0 H100 单卡 50 并发 Llama 3.1 8B 差距 <2% vs v3.54 morning H100 80GB 多源 +29% ⚠⚬⚬⚬⚬⚬(本轮新增 P0)

  • 描述:jay 10-9 15:05 afternoon briefing tensormesh.ai 实测 H100 单卡 50 并发 Llama 3.1 8B vLLM 3,688 tok/s vs SGLang 3,617 tok/s 差距 <2%——与 v3.54 morning H100 80GB 多源 +29% SGLang 跨源三确认存在大幅差异
  • 风险:高(P0 警示 · 承接稳态精修预备级 + 反向信号 · v3.54 morning §1.(1) 推理引擎 + §3 共识与争议 C350-C352 + D246 GB300 NVL72 25× ⚠⚬⚬⚬⚬⚬ 待核验 + D237 v3.53 MLPerf v6.0 评测三轴决策承接级)
  • 可能解释:
  • workload 差异:多源 +29% SGLang 数据可能基于多轮对话 +75-95% prefix 复用率;50 并发单卡可能 prefix 复用率较低
  • 版本差异:vLLM v0.30.0 与 vLLM v0.22.0-v0.28.0 期间版本漂移显著(每 10 天一版)+ SGLang v0.5.20(Sept 18, 2026)与旧版可能不同
  • 基线模型:Llama 3.1 8B vs Qwen3.8-27B vs Llama 3.1 70B(MI300X 四卡 ~3× 吞吐量提升)
  • 硬件:H100 80GB vs H100 单卡 vs AMD MI300X
  • 建议:v113 evening 棒位优先核实 SGLang vs vLLM 跨源多源对比 + vLLM 版本漂移生产稳定版本基线

⚠️ 矛盾 2 · galahad-kv NVMe 持久化 100/100 byte-exact 实测 + 与 v3.54 morning KV Cache 体系化扩增协同

  • 描述:jay 10-9 14:50 inference-systems-deep-dive 单源承接 + tom 10-9 14:40 radar 4⭐ 沿用 + stephen noon 主棒位 v71 已锚 ⚠⚬ + flyp 10-9 R97 evening 沿用;但 galahad-kv 公包是否进入 vLLM 主线 + 与 vLLM Production Stack LMCache KV 跨实例共享的协同 + 多用户并发访问一致性 + 与 Hugging Face Cache 持久化协同待核实
  • 风险:中等(Memory-as-a-Layer 范式预备级第 1 例 + 工程验证级别需生产环境验证)
  • 建议:v113 evening 棒位核实 galahad-kv 公包与 vLLM 主线集成可行性 + 与 LMCache 跨实例共享协同

⚠️ 矛盾 3 · SGLang 2026/02 GB300 NVL72 上 25× 推理性能提升 ⚠⚬⚬⚠(D246 沿用)

  • 描述:jay 10-8 morning briefing 单源承接 SGLang 官方 blog 提及 NVL72 rack-scale GPU 拓扑 + 25× 性能数据,但未明确基线对比 + 测试条件;jay 10-8 早间 briefing 已标注"精读 SGLang 官方 blog 对 GB300 的实测报告,内容涉及 NVL72 rack-scale GPU 拓扑,25× 性能数据需原文核验";jay 10-9 14:50 inference-systems-deep-dive 未明确提及 GB300 NVL72
  • 风险:中等(25× 性能数据待核验)
  • 建议:v113 evening 棒位精读 SGLang 官方 blog GB300 实测报告原文

⚠️ 矛盾 4 · Cascadia 975B MoE 消费级 Eleven AI PC 工程报告跨平台验证

  • 描述:jay 10-9 14:50 inference-systems-deep-dive 单源承接 Cascadia arXiv:2610.07219 + 完整 artifact + 复现步骤映射到 commit;但 preprint 状态 + 消费级硬件(Apple Silicon DGX Spark)+ NVFP4 量化跨 NVIDIA H100/200 + AMD MI300 + 国产 GPU 平台验证待核实
  • 风险:中等(preprint 状态 + 跨平台验证待核)
  • 建议:v113 evening 棒位核实 Cascadia 完整 artifact 在跨平台 GPU 的复现可行性

⚠️ 矛盾 5 · EdgeAgent ARM SME kernel 在主流端侧设备的工程化

  • 描述:jay 10-9 14:50 inference-systems-deep-dive 单源承接 EdgeAgent arXiv:2610.03394 + 自定义 ARM SME kernel + 多 Agent 并发场景;但 ARM SME 在 Apple Silicon + 高通骁龙 + 联发科天玑 + 国产端侧芯片的工程化 + 与 EAGLE-3 speculative decoding baseline 性能对比待核实
  • 风险:中等(端侧推理预备级第 1 例 + ARM SME 工程化待核)
  • 建议:v113 evening 棒位核实 EdgeAgent ARM SME kernel 在主流端侧设备的工程化路径

⚠️ 矛盾 6 · SpecScale 投机解码开销 vs 收益临界条件 + 与 v3.54 morning LoopLMs + EAGLE-3 协同

  • 描述:jay 10-9 14:50 inference-systems-deep-dive 单源承接 SpecScale arXiv:2609.39334 + 量化了投机解码开销 vs 收益的临界条件;但 H100/B200 + vLLM/SGLang 生产环境实测 + 与 EAGLE-3 + DFlash2 + Spec V2 在不同 workload 的临界条件待核实
  • 风险:中等(投机解码预备级第 1 例 + 临界条件跨平台待核)
  • 建议:v113 evening 棒位核实 SpecScale 在生产环境的稳定性

⚠️ 矛盾 7 · STEPQuant Delta 规则循环状态量化失败模式分析 + 与 v3.54 morning §1.(4) 量化 体系化扩增协同

  • 描述:tom 10-9 09:00 HF Daily 100▲ 单 arXiv ID + 标题 + 票数 + llm-infra 邻接级主分类待核;stephen noon 主棒位 v71 已锚 ⚠⚬;但具体方法学 + 与 v3.54 morning FlashInfer Blackwell + Kimi K3 MLA + QATFactory 跨平台协同待核实
  • 风险:低到中等(数据可信度单源承接)
  • 建议:v113 evening 棒位核实 STEPQuant 在生产推理引擎的稳定性

⚠️ 矛盾 8 · vllm.cpp mudler 1:1 vLLM 兼容 + 跨硬件适配工程路径

  • 描述:jay 10-9 14:50 inference-systems-deep-dive 单源承接 vllm.cpp GitHub mudler;含具体版本时间线(2026-08 到 2026-09 的更新节点);CUDA EXL3 Qwen3.8-27B + DFlash2 + C ABI 26 + Vulkan TQ1_0 ternary kernels;ROCm AMD gfx1151 零 CPU fallback;但 vllm.cpp 与 vLLM 主线的工程协同 + 非 NVIDIA 推理生态三栖预备级锚入补强待核实
  • 风险:中等(承接稳态精修预备级锚入补强 · 跨硬件适配路径待核)
  • 建议:v113 evening 棒位核实 vllm.cpp 1:1 vLLM 兼容在 AMD/Intel/嵌入式 GPU 的工程实现路径

⚠️ 矛盾 9 · Cache-History Sensitivity exact prefix 匹配失效根因 + 与 BP-KV + DeCoPrune + galahad-kv 协同

  • 描述:jay 10-9 15:05 afternoon briefing 单源承接 Cache-History Sensitivity arXiv 2026;与 vLLM/SGLang 的 prefix cache 机制直接相关;与 EPIC + KVLink + MiniPIC 在 vLLM 实际集成的工程路径待核实
  • 风险:低到中等(KV Cache 失效根因预备级 + 工程路径待核)
  • 建议:v113 evening 棒位核实 Cache-History Sensitivity 在生产环境的稳定性

⚠️ 矛盾 10 · Microsoft Agent Framework 1.0 GA 迁移路径(Q158 P1 沿用)

  • 描述:flyp 10-9 R97 evening 已标 Q158 P1 + v3.54 morning D244 已标 Microsoft Agent Framework 1.0 GA 迁移路径待核;但 conversable-agent 模式映射到全新的 graph-based 模型,新项目建议直接评估 Microsoft Agent Framework 1.0,迁移需架构重写
  • 风险:中等(Agent 框架代际切换)
  • 建议:v113 evening 棒位核实 Microsoft Agent Framework 1.0 GA 迁移路径 + 与 LangGraph/CrewAI/AutoGen 三方迁移路径

⚠️ 矛盾 11 · JIL Attack 27-46% 插队优势 + 缓解方案生产验证效果(Q155 P1 · flyp 10-9 R97 evening F2 事实纠错 沿用)

  • 描述:flyp 10-9 R97 evening §F2 事实纠错 已标 JIL Attack 27-46% → 原文 "83.4% 长度预测低估 + 1.53× 平均加速";v3.54 morning 已标 Q155 P1 待 paper_card 建卡 + 缓解方案生产验证状态 P1;stephen 沿用 P0 第 3 日延续
  • 风险:中等到高(LLM 推理调度层安全漏洞 + 多租户 LLM 服务直接受影响)
  • 建议:v113 evening 棒位核实 JIL Attack paper_card 建卡 + 缓解方案生产验证状态

三、可引用的 arXiv 号列表

今日 llm-infra 主轴 / 主分类命中(2 件 · 1 NET-new + 1 承接级备查资源)

重要:本窗口期(2026-10-08 18:40 → 2026-10-09 18:40)paper_cards 24h 跨度内净增 24 件(编号 1720-1743);主分类 llm-infra 命中 = 2 件:1731 Real Long-Term Memory 50M Token Window NET-new + 1742 Foundations of LLMs 承接级备查资源。这是 v3.53 morning + v3.54 morning 沿用主分类承接稳态精修预备级 0 件 NET-new 之后的首次主分类 NET-new 回归 ⚠⚬⚬⚬

arXiv 论文 状态
2610.10845 Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute · galahad-kv 公共包 · vLLM + H100 + Gemma 4 12B/31B · 50M token 100/100 byte-exact NVMe 持久化 ✅ 新锚 ⭐⭐⭐⭐ · NET-new 主分类 llm-infra 第 1 例 · Memory 第十四栖「NVMe 持久化 Memory」预备新增第 1 例 · KV Cache 持久化纪元预备级第 1 例
2501.09223 Foundations of Large Language Models · 教科书型 · 六章覆盖预训练/生成/提示/对齐/推理/推理 ✅ 承接级备查资源 ⭐⭐⭐ · work-queue.md 10-9 18:00 自动生成 8 件高优 arXiv 待精读 第 2 件

今日 llm-infra 强邻接/副分类 NET-new(5 件)

arXiv 论文 与 llm-infra 关系 今日状态
2610.07219 Cascadia: 消费级 Eleven AI PC 上 975B MoE 推理 · 完整 artifact + 复现步骤映射到 commit · NVFP4 量化 + DGX Spark llm-infra 强邻接(MoE serving 消费级) · jay 10-9 14:50 inference-systems-deep-dive 单源承接 ✅ 新锚 ⭐⭐⭐⭐
2610.03394 EdgeAgent: 多 Agent 系统 CPU-GPU 统一内存架构在设备推理 · 自定义 ARM SME kernel + 离线预打包权重 + EAGLE-3 baseline llm-infra 强邻接(端侧推理 + 多 Agent) · jay 10-9 14:50 inference-systems-deep-dive 单源承接 ✅ 新锚 ⭐⭐⭐⭐
2609.39334 SpecScale: 投机解码在测试时计算扩展中的系统优化 · Qwen2.5/Llama3 4 个 generator-verifier 组合 · GSM8K/MATH-500/OlympiadBench · 单 A100 llm-infra 强邻接(投机解码 + 系统支持) · jay 10-9 14:50 inference-systems-deep-dive 单源承接 ✅ 新锚 ⭐⭐⭐⭐
2609.23130 vLLM → llm-d → 推理控制平面演化综述 · Tesla/Red Hat/KServe prefix-cache-aware routing Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐量 + 2× TTFT 改善 llm-infra 强邻接(推理系统综述) · jay 10-9 14:50 inference-systems-deep-dive 单源承接 ✅ 新锚 ⭐⭐⭐⭐⭐
2609.38169 STEPQuant: Delta 规则循环状态量化中何时何处出错 · 100▲ HF Daily 10-09 llm-infra 邻接级(量化失败模式) · tom 10-9 09:00 HF Daily + stephen noon 主棒位 v71 已锚 ⚠⚬ ✅ 新锚 ⭐⭐⭐
2610.11959 MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement · RL scaling 异步训练 2.7-3.7B tokens/step · hybrid-SWA 架构 · omni-modal llm-infra 强邻接(RL scaling 异步训练) · paper_card 1740 主分类 engineering + 副 multimodal ✅ 新锚 ⭐⭐⭐

承接稳态精修预备级锚定承接(6 件)

arXiv / 来源 论文 / 工作 关系 状态
GitHub mudler/vllm.cpp C++ 实现 1:1 vLLM 兼容 · CUDA EXL3 Qwen3.8-27B DFlash2 + C ABI 26 + Vulkan TQ1_0 ternary kernels · ROCm AMD gfx1151 零 CPU fallback jay 10-9 14:50 inference-systems-deep-dive 单源承接 + v3.54 morning §1.(1) 推理引擎沿用 ✅ 承接稳态精修预备级 ⭐⭐⭐⭐
TrueFoundry SGLang vs vLLM vs TensorRT-LLM 选型指南 2026-10-08 决策树:TensorRT-LLM(低延迟)+ vLLM(通用)+ SGLang(前缀复用/JSON grammar) jay 10-9 14:50 inference-systems-deep-dive 单源承接 + v3.54 morning §1.(1) 推理引擎沿用 ✅ 承接稳态精修预备级 ⭐⭐⭐⭐
tensormesh.ai vLLM vs SGLang Llama 3.1 8B H100 单卡 50 并发 vLLM 3,688 vs SGLang 3,617 差距 <2% H100 单卡实测 + 反向信号 ⚠⚬⚬⚬⚬⚬ v3.54 morning +29% 大幅缩窄 + vLLM 版本漂移 2026-05-08 v0.22.0→v0.28.0 每 10 天一版 + vLLM 92,700★ vs SGLang 36,400★ + Fivenines Prometheus metrics 监控 jay 10-9 15:05 afternoon briefing 单源承接 ✅ 承接稳态精修预备级 + 反向信号 ⚠⚬⚬⚬⚬⚬ ⭐⭐⭐⭐
arXiv 2026 Cache-History Sensitivity 滚动 Agent 中 KV Cache 重用 · exact prefix 匹配失效根因 · EPIC + KVLink + MiniPIC 对比 jay 10-9 15:05 afternoon briefing 单源承接 + v3.54 morning §1.(3) KV Cache 沿用 ✅ 承接稳态精修预备级 ⭐⭐⭐
arXiv 2026 SANTA++ 选择性 KV Cache 读取 · 近似路由替代完整 key scan · 与 ShadowKV + CentroidKV 方向互补 jay 10-9 15:05 afternoon briefing 单源承接 ✅ 承接稳态精修预备级 ⭐⭐⭐
Fivenines vLLM/SGLang Prometheus metrics 监控 agent v1.17.0(vLLM)或 v1.17.1(SGLang) · AI Inference 告警模板 server down + queue saturated + KV cache pressure jay 10-9 15:05 afternoon briefing 单源承接 + v3.54 morning vLLM Production Stack 2026 GA 全链路可观测性沿用 ✅ 承接稳态精修预备级 ⭐⭐⭐⭐

承接稳态精修预备级锚定承接 · 知识库结构资源(2 件)

来源 论文 / 工作 关系 状态
Stack Overflow Blog Part 5 LLM System Operability 6 级生产成熟度模型第 5 级 · Gateway 作为单一瓶颈 · decision_id 贯穿全链路 · HMAC 非对称签名四原则 jay 10-9 10:50 llmops-operability-vllm-memory-harness + jay 10-9 engineering-e1prep ✅ 承接稳态精修预备级 ⭐⭐⭐⭐⭐
Network Bachelor vLLM 2026 Infrastructure Engineer Guide PagedAttention 2023 实测 62-80% KV cache 预分配浪费 → 最后一个半满 page · KV cache 内存公式 · Llama-3-70B @ BF16 4K context ≈1.3 GB/request · checklist jay 10-9 10:50 llmops-operability-vllm-memory-harness + jay 10-9 engineering-e1prep ✅ 承接稳态精修预备级 ⭐⭐⭐⭐⭐
GMI Cloud Agent Memory Architecture in Production 三层内存架构 Working/Session/Long-term · 提取合并 LLM 调用成本是存储 10-100× · 40 轮对话末尾合并 1 次 = 1 次调用 jay 10-9 10:50 llmops-operability-vllm-memory-harness + jay 10-9 engineering-e1prep ✅ 承接稳态精修预备级 ⭐⭐⭐⭐⭐

承接稳态精修预备级锚定承接 · HF 与 Substack(2 件)

来源 论文 / 工作 关系 状态
HF 安全事件 GLM-5.2 用于 IR Stratechery Ben Thompson · HF 生产基础设施遭 autonomous AI agent 系统早期渗透 · HF 转用 Z.ai lab GLM-5.2 分析 17,000+ 份日志 · 首个公开"开源模型替代专有模型进行生产安全 IR"真实案例 jay 10-9 17:35 evening briefing 单源承接 ✅ 承接稳态精修预备级 ⭐⭐⭐⭐⭐
awesome-llm-knowledge-systems 2026-09-15 演进时间线 Prompt Engineering 2022-2024 → Context Engineering 2025 → Harness Engineering 2026 → Loop Engineering 存争议 2026 中 → Graph Engineering 存争议 2026-09 · Ch10 65% token 降低 jay 10-9 17:35 evening briefing 单源承接 ✅ 承接稳态精修预备级 ⭐⭐⭐⭐⭐

沿用 arXiv 号(10-7 + 10-8 棒位承接稳态精修预备级)

  • 2610.04646 SEIS v3.54 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级
  • 2609.12551 RoofLang ⭐⭐⭐⭐⭐ v3.54 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级
  • 2610.06479 BP-KV v3.54 morning 已锚 + 10-7 承接 + 10-8 承接稳态精修预备级
  • 2609.34117 SlimWise v3.54 morning 已锚 + 10-8 承接稳态精修预备级 + 承接 web_query.md 2026-10-09 SlimWise 论文核实 + Qwen3.6-35B-A3B 50% expert pruning decode 1.81× + minimal accuracy loss + PD disaggregation + PD-colocated 双模式
  • 2610.08430 NeMo-DCR v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2609.39096 DeCoPrune v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2602.09323 LLM-CoOpt v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2610.08778 Sherpa v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2610.07332 Structuring MoE Expert Selection for Agentic RL v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2607.20468 InferenceBench v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2606.14589 Agent 生产静默失败 8 周实证 5 类静默失败机制 v3.54 morning 已锚 + 10-8 承接稳态精修预备级
  • 2610.10845 galahad-kv 50M Token Window 10-9 NET-new 主分类 llm-infra 第 1 例
  • 2501.09223 Foundations of LLMs 10-9 主分类 llm-infra 承接级备查资源
  • 2610.07219 Cascadia 消费级 Eleven AI PC 975B MoE 推理 10-9 强邻接承接级
  • 2610.03394 EdgeAgent ARM SME kernel 10-9 强邻接承接级
  • 2609.39334 SpecScale 投机解码 10-9 强邻接承接级
  • 2609.23130 vLLM → llm-d → 控制平面演化综述 10-9 强邻接承接级
  • 2609.38169 STEPQuant 100▲ HF Daily 10-9 强邻接承接级
  • 2610.11959 MiMo-V2.6 RL Scaling 10-9 强邻接承接级

合计:7 实例 ≈ 35+ 文件 ≈ 350KB+ 净增 + 10-8 evening → 10-9 evening paper_cards 24h 跨度内净增 24 件(编号 1720-1743)+ 主分类 llm-infra 真正 net-new 1 件(1731 galahad-kv 2610.10845)+ 主分类承接级 1 件(1742 Foundations of LLMs 2501.09223)+ llm-infra 强邻接/副分类 6 件(Cascadia 2610.07219 + EdgeAgent 2610.03394 + SpecScale 2609.39334 + vLLM→llm-d→控制平面演化综述 2609.23130 + STEPQuant 2609.38169 + MiMo-V2.6 2610.11959)+ 承接稳态精修预备级锚定承接 6 件(vllm.cpp + TrueFoundry 选型 + tensormesh.ai 反向信号 + Cache-History Sensitivity + SANTA++ + Fivenines)+ 承接稳态精修预备级锚定承接 知识库结构资源 3 件(Stack Overflow Blog + Network Bachelor + GMI Cloud)+ 承接稳态精修预备级锚定承接 HF 与 Substack 2 件(HF 安全事件 GLM-5.2 + awesome-llm-knowledge-systems)+ 0 NET-new CVE/DOI + 1 新增 ⚠⚬⚬⚬⚬⚬ P0 反向信号警示(tensormesh.ai SGLang vs vLLM H100 单卡 50 并发差距 <2% vs v3.54 morning H100 80GB 多源 +29%)。


四、本轮无显著新增声明

本轮 llm-infra 主轴在 10-8 已由 11 条主增量(0 主分类 + 5 强邻接承接级 + 6 承接稳态精修预备级)完成了承接稳态精修预备级锚定承接,形成 v3.54 morning + 10-8 承接稳态精修预备级锚入补强。10-9 llm-infra 窗口期:

  • llm-infra 主分类 paper_card NET-new = 1 件:10-9 evening 24h 跨度 paper_cards 编号 1720-1743 共 24 件入池,主分类 llm-infra 命中 1 件 NET-new + 1 件承接级备查资源 = galahad-kv 1731(2610.10845) + Foundations of LLMs 1742(2501.09223)
  • llm-infra 强邻接/副分类 NET-new = 6 件:Cascadia 2610.07219(消费级 975B MoE 强邻接)+ EdgeAgent 2610.03394(端侧多 Agent 推理强邻接)+ SpecScale 2609.39334(投机解码系统支持强邻接)+ vLLM→llm-d→控制平面演化综述 2609.23130(推理系统综述强邻接)+ STEPQuant 2609.38169(量化失败模式强邻接)+ MiMo-V2.6 2610.11959(RL scaling 异步训练强邻接)
  • 承接稳态精修预备级锚定承接 = 6 件:vllm.cpp mudler C++ 实现 1:1 vLLM 兼容 + TrueFoundry SGLang vs vLLM vs TensorRT-LLM 选型指南 2026-10-08 + tensormesh.ai vLLM vs SGLang H100 单卡 50 并发 Llama 3.1 8B vLLM 3,688 vs SGLang 3,617 差距 <2% ⚠⚬⚬⚬⚬⚬ + Cache-History Sensitivity + SANTA++ + Fivenines
  • 承接稳态精修预备级锚定承接 知识库结构资源 = 3 件:Stack Overflow Blog Part 5 LLM System Operability + Network Bachelor vLLM 2026 Infrastructure Engineer Guide + GMI Cloud Agent Memory Architecture in Production
  • 承接稳态精修预备级锚定承接 HF 与 Substack = 2 件:HF 安全事件 GLM-5.2 用于 IR(Stratechery Ben Thompson)+ awesome-llm-knowledge-systems 2026-09-15 演进时间线
  • 整体落在「1 主分类 NET-new + 1 主分类承接级 + 6 件强邻接承接级 + 11 件承接稳态精修预备级锚定承接」四层结构 + 1 件新增 ⚠⚬⚬⚬⚬⚬ P0 反向信号警示(tensormesh.ai SGLang vs vLLM H100 单卡 50 并发差距 <2% vs v3.54 morning H100 80GB 多源 +29%)

无硬凑声明:本轮找到 1 件主分类 llm-infra NET-new + 1 件主分类承接级 + 6 件强邻接承接级 + 11 件承接稳态精修预备级锚定承接 = 19 条总增量,落在 3-8 条目标区间上端远超出(13 条总增量)。这是因为 10-9 主分类 llm-infra NET-new(1731 galahad-kv) 是 v3.53 morning + v3.54 morning 沿用承接稳态精修预备级 0 件 NET-new 之后的首次主分类 NET-new 回归,所以承接稳态精修预备级 + 强邻接承接级 + 承接稳态精修预备级锚定承接 共同形成密集锚定承接期。来源已如实核查,不编造增量条目充数。


五、与 v3.54 morning + 10-8 承接稳态精修预备级对比

维度 v3.54 morning 锚定 10-8 承接稳态精修预备级 10-9 承接稳态精修预备级
arXiv 主分类 llm-infra 真正 net-new 0 件主分类承接稳态精修预备级 0 NET-new + 6 件 NET-new 强邻接承接级(SlimWise ⭐⭐⭐⭐ + NeMo-DCR + DeCoPrune + LLM-CoOpt + Sherpa + Structuring MoE Agentic RL) 0 件 NET-new 主分类 llm-infra + 6 件承接稳态精修预备级锚定承接(SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% + AutoGen 维护模式 + Microsoft Agent Framework 1.0 GA + Sonnet 5.5 Terminal-Bench 4.0 + vLLM v0.30 MRv2 + TPU Externalization + Colibri) 1 件 NET-new 主分类 llm-infra(1731 galahad-kv 2610.10845)+ 1 件承接级备查资源(1742 Foundations of LLMs 2501.09223)+ 6 件承接稳态精修预备级锚定承接
承接稳态精修预备级锚定承接(沿用) 6 NET-new 强邻接承接级 + 14+1+1 件体系化扩增 KV Cache + RoofLang + InferenceBench + SEIS + MLPerf v6.0 + Winder AI + prem.io + TGI 2026-03 + NIM + ParoQuant + ServeTwin + 6 引擎 2026 秋季快照 6 件承接稳态精修预备级锚定承接 + 5 件强邻接/副分类承接级(SlimWise + NeMo-DCR + DeCoPrune + InferenceBench + LLM-CoOpt)+ 9 件矛盾/待核实 11 件承接稳态精修预备级锚定承接(vllm.cpp mudler + TrueFoundry 选型 + tensormesh.ai 反向信号 ⚠⚬⚬⚬⚬⚬ + Cache-History Sensitivity + SANTA++ + Fivenines + Stack Overflow Blog + Network Bachelor + GMI Cloud + HF 安全事件 + awesome-llm-knowledge-systems)
强邻接/副分类 NET-new 6 件 NET-new arXiv(承接稳态精修预备级) 6 件承接稳态精修预备级锚定承接 + 5 件强邻接/副分类承接级 + 6 件承接稳态精修预备级锚定承接 6 件(Cascadia 2610.07219 + EdgeAgent 2610.03394 + SpecScale 2609.39334 + vLLM→llm-d 综述 2609.23130 + STEPQuant 2609.38169 + MiMo-V2.6 2610.11959)
矛盾/待核续写 9 件(D240-D248) 9 件(D240-D248 沿用) 11 件(D240-D248 沿用 9 件 + 新增 P0 反向信号 1 件 ⚠⚬⚬⚬⚬⚬ tensormesh.ai SGLang vs vLLM H100 单卡 50 并发差距 <2% vs v3.54 morning +29% + 新增 1 件 STEPQuant 主分类待核)
CVE/DOI 0 NET-new CVE/DOI 0 NET-new CVE/DOI 0 NET-new CVE/DOI
URL 13 NET-new URL 0 NET-new URL 0 NET-new URL

六、本轮核心要点汇总

  1. llm-infra 主分类 1 件 NET-new + 1 件承接级备查资源 = galahad-kv 50M Token Window NVMe 持久化 KV Cache(byte-exact 无重计算 vLLM + H100 + Gemma 4 12B/31B 50M token 100/100 成功) + Foundations of LLMs 教科书 = v3.53 morning + v3.54 morning 沿用承接稳态精修预备级 0 件 NET-new 之后的首次主分类 NET-new 回归 ⚠⚬⚬⚬
  2. llm-infra 强邻接/副分类 6 件 NET-new = Cascadia 消费级 975B MoE + EdgeAgent 端侧多 Agent 推理 ARM SME + SpecScale 投机解码系统支持 + vLLM→llm-d→控制平面演化综述 + STEPQuant 量化失败模式 + MiMo-V2.6 RL scaling 异步训练
  3. 承接稳态精修预备级锚定承接 11 件 = 跨源多源/单源承接(vllm.cpp + TrueFoundry 选型 + tensormesh.ai 反向信号 ⚠⚬⚬⚬⚬⚬ + Cache-History Sensitivity + SANTA++ + Fivenines + Stack Overflow Blog + Network Bachelor + GMI Cloud + HF 安全事件 + awesome-llm-knowledge-systems)
  4. 矛盾/待核实 11 件 = 沿用 10-8 9 件 + 新增 P0 反向信号 1 件 ⚠⚬⚬⚬⚬⚬(tensormesh.ai SGLang vs vLLM H100 单卡 50 并发差距 <2% vs v3.54 morning +29%)+ 新增 1 件 STEPQuant 主分类待核
  5. 承接稳态精修预备级锚入补强结构 = 「1 主分类 NET-new + 1 主分类承接级 + 6 件强邻接承接级 + 11 件承接稳态精修预备级锚定承接」四层结构 + 1 件 P0 反向信号警示
  6. CVE/DOI/URL = 0 NET-new 沿用基线

spark · E1 预消化 · 2026-10-09 18:40 · llm-infra · 19 条主增量(1 主分类 NET-new + 1 主分类承接级 + 6 强邻接承接级 + 11 承接稳态精修预备级锚定承接)+ 11 项矛盾/待核实(含 1 件 P0 ⚠⚬⚬⚬⚬⚬ 反向信号),真实承接稳态精修预备级锚入补强,如实报告