llm-infra · E1 预消化简报(2026-10-11)

E1 日间预消化轮 · llm-infra · 2026-10-11 18:40 CST · spark 承接棒位:v3.56 morning(2026-10-11 05:00 CST · §IX 114 morning · v3.55 morning 465/36/15/616 沿用基线 + 4 NET-new arXiv + 6 NET-new URL + D255-D258 + C357-C358 + T156) 状态:承接稳态期延续 · 周日低活动度 · 无新主分类 llm-infra 真新卡入池 · 无新顶级承接级预备 · 承接稳态期内细化为主


〇、检查过的来源清单(近 2 天 · llm-infra 主题相关)

A. paper_cards 索引(近 3 天 10-08 ~ 10-11 入池 · 16 件新卡)

编号 arXiv 标题 mtime 主分类 llm-infra 关系
1740 2610.11959 MiMo-V2.6: Scaling RL Towards Self-Improvement 10-10 evening engineering 邻接级(异步训练 + hybrid-SWA 架构,属 v3.55 §1.(8) 训练栖)
1741 2610.12461 OuroWorld 10-10 evening multimodal 无(沿用 flyp 10-10 multimodal 主轴)
1742 2501.09223 Foundations of Large Language Models 10-09 入池(10-10 evening 落卡) llm-infra ✓ 教科书承接级(已锚 v3.55 morning NET-new 主分类承接级 · 沿用)
1743 2610.12458 OmniCapBench 10-10 evening multimodal 无
1744 2610.11794 Memento 3: Model-Based RSI via Reflective Rulebooks 10-10 12:30 agent 邻接级承接(engineering 副 · Memory 第十六栖预备邻接第 1 例 · v3.56 morning NET-new 邻接承接级 · 沿用)
1745 2610.12459 WorldGuide 10-10 evening multimodal 无
1746 2610.12448 reViT 10-10 evening multimodal 无
1747 2610.12183 Agentic BBO 10-10 12:30 agent 邻接级承接(evaluation 副 · 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例 · v3.55 沿用)
1748 2610.11287 REMORY: Residual Memory for Context Compaction 10-10 12:30 agent 邻接级承接(Memory 第十五栖「残差记忆网络」预备邻接第 1 例 · v3.56 morning NET-new 邻接承接级 · 沿用)
1749 2609.33987 Opera: Verbal Critic 10-11 12:30 agent 弱邻接(沿用 10-10 evening 立标延革预备承接)
1750 2610.11169 Skill Constellations 10-11 12:30 agent 强邻接(Skill 供应链安全栖位预备第 1 例 + agent 安全栖位延伸稳态预备 · flyp 10-11 risk-e1prep 已锚 · v3.55 morning 沿用)
1751 2606.03335 Hebero: GPU-Parallel Multi-Task RL 10-11 12:30 evaluation 邻接级(训练基础设施 vs 评测 · flyp 10-11 短审稿修正)
1752 2609.35855 Mara Chain 10-11 12:30 evaluation 弱邻接(失败作为 stepping stones · flyp 10-11 risk-e1prep 弱邻接)
1753 1511.00363 BinaryConnect(老论文) 10-11 12:30 engineering 历史沿用
1754 2610.09280 Co-Evolved Communication 2D→3D 10-11 12:30 evaluation 无
1755 2609.38527 Behavioral Persistence Co-Evolved Comm 10-11 12:30 evaluation 无

结论:llm-infra 主分类 net-new 真新卡 = 0 件(10-08 ~ 10-11 区间 = 24h 滑动窗口内)。1742 Foundations of LLMs 在 10-09 入池 · v3.55 morning 已锚(不是本窗口期新卡)。承接稳态期延续 · 真新卡断流第 2 日(10-10 与 10-11 均为承接稳态期)。

B. inbox 来源(近 2 天 · llm-infra 主题相关筛选)

来源 文件 时间 llm-infra 关系
inbox/jay 2026-10-11-engineering-e1prep.md(10-11 11:22 · 16.1KB · engineering 主棒位) 🟢 5 件主增量承接级 = AgentSysBench arXiv:2608.15127 178,799 session 实测 + Agent Memory 四足鼎立 + State-Bench Microsoft May 2026 + HarnessSQL arXiv:2610.12274 + Kiln on Trainium vs vLLM on H200 = 承接 v3.56 morning 全部 + arXiv:2608.15127 / 2610.12274 / 2610.12338 / 2610.12367 / 2610.06597 / 2605.19537 / 2609.23130 = 8 件工程主轴 paper_card 未建卡(P0 候选 prep 第 3 例 · stephen C18)
inbox/jay 2026-10-11-agentic-systems-vector-db-mlops.md(10-11 09:36 · 10.9KB · AgentSysBench + Agent Memory + State-Bench 主源) 🟢 承接级 AgentSysBench arXiv:2608.15127 详细 + Mem0/MemOS/Cognee/MemSearch + State-Bench + HarnessSQL + AgentSysBench sparse notes sparsenotes.com/posts/2026/08/papers/agentsysbench-agentic-workloads + MongoDB Agent Harness 二手转引
inbox/jay 2026-10-11T1050-jay-engineering-filter.md(10-11 10:50 · 11.6KB · 工程化筛选) 🟢 承接级 Kiln on Trainium vs vLLM on H200 + Ollama vs vLLM vs SGLang 决策框架 + arXiv:2610.06597 "Agent Harnesses and Inference Engines Hear Each Other" OmniKV→vLLM + H2O 方案 + Chain reuse 49.8%→makespan 5.93h→2.42h 2.45× 加速 + BrowseComp-Plus 延迟 17.0s→14.9s 1.14× + Charles Frye 推理引擎调试方法论
inbox/jay 2026-10-11-csdn-substack-inference-rag-highvalue.md(10-11 12:20 · 9.5KB · CSDN + Substack) 🟡 5 件 CSDN + 5 件 Substack = SGLang vs vLLM Qwen3-27B + GLM-5.1 实测 + SGLang 2026 部署踩坑 + PagedAttention 原理 + kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" + Dennis Kennetz LLM Inference Curriculum
inbox/jay 2026-10-11-1001-rss-cool-papers.md(10-11 10:01 · 1.5KB · Cool Papers RSS) 🟢 承接级 net-new = HarnessSQL arXiv:2610.12274 + VFold arXiv:2610.12338 + SGUID arXiv:2610.12367 = v3.56 morning 已锚 + 10-11 早棒承接级预备
inbox/jay 2026-10-11-1003-rss-lilian-weng.md(10-11 10:03) 🟡 Lilian Weng Jul 2026 Harness Engineering & Self-Improvement(RSI 系统工程化 · 沿用)
inbox/jay 2026-10-11-1000-rss-bytebytego.md / 1001-rss-nathan-benaich.md / 1002-rss-cool-papers-ir.md / 1003-rss-msr-blog.md / 1004-rss-import-ai.md / 1004-rss-yt-fireship.md / 1004-rss-yt-karpathy.md 🟡 全部沿用 9-10 月,无 llm-infra 净新增
inbox/jay 2026-10-11T1105-database-backend-cloudnative-csdn.md(10-11 11:05) 🟡 数据库 + 云原生 主轴,部分承接(BentoML 8.9K stars + FlashInfer 6.5K stars + KServe 6.1K stars + Cloud-OpsBench + AI-NativeBench)
inbox/jay 2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB · 工程化筛选续) 🟢 承接级 = DSV4.1+Flash+DSPARK SGLang OOM Bug #43488/#43557/#43402/#43523 + DUAL-BLADE NVMe-direct KV cache 卸载 arXiv:2608.13867 + RPI+IBM KEEP KV-Cache 异构内存调度 2026 DAC + Winder.ai SGLang/vLLM/llama.cpp 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 + SGLang 自限速机制)+ antirez/ds4 DeepSeek V4 Flash 专用 21.9K stars C 单文件 Metal/CUDA/ROCm + Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE
inbox/jay 2026-10-11-1505-database-backend-cloudnative-csdn.md(10-11 15:05 · database/backend/cloud-native 二次过滤) 🟡 数据库 + 云原生 + AI-NativeBench + BentoML/FlashInfer/KServe · 沿用
inbox/tom 2026-10-11-0900-hf-daily-2026-10-11.md(10-11 09:00 · 1.7KB · 15 件立标) 🟢 承接稳态第 11 日 = 沿用 10-10 早棒 10 件 + 新立 5 件(U-Space 33▲ / MC-Sparse 33▲ / TestPrism 30▲ / Memento 3 28▲ / Pumpire 15▲)+ llm-infra 主分直接命中 0 件(全部 multimodal / agent / engineering / evaluation 主分);承接 v3.55 evening + v3.56 morning 全部 11 件
inbox/tom 2026-10-11-agent-rag-longcontext-radar.md(10-11 08:40 · 4.3KB · 3⭐ + 5 候选) 🟢 承接级 = Opera + Skill Constellations + Mara Chain + Hebero + Is Memorization + Geometry Hierarchical Nav + Forms of LLM-Integrated Apps + Memento 3(8 件,沿用)
inbox/tom 2026-10-11-rag-e1prep.md / 2026-10-11-evaluation-e1prep.md 🟡 RAG / evaluation 主轴,llm-infra 邻接级承接(ORCAGen / RAG 四轴分类法 / HNSW / Q-RAG)
inbox/flyp 2026-10-11-0950-flyP-critical-read-Hebero-RobotWorld-heterogeneous-robot-benchmark.md(10-11 09:50 · 17.2KB · Hebero 短审稿) 🟡 multimodal 主轴,llm-infra 邻接级 · Hebero 训练范式 vs RobotWorld 评测范式二分
inbox/flyp 2026-10-11-multimodal-e1prep.md(10-11 09:42 · 20.4KB) 🟡 multimodal 主轴,立标群完全沿用态第 11 日
inbox/flyp 2026-10-11-risk-e1prep.md(10-11 16:30 · 48KB · risk 主棒位) 🟢 承接稳态续写 · R99 早棒 10-11 risk 主分 0 件 + risk 强邻接 2 件 = frontier lab 安全产品化稳态信号第 1 例 + Skill Constellations work-queue Top 15 第 2 承接 + 8 件工程主轴 paper_card 未建卡 P0 候选 prep 第 3 例 + Skill 安全栖位预备第 2 例 anchor
inbox/flyp 2026-10-11-1000-rss-cameron-wolfe.md / 1003-rss-interconnects.md 🟡 沿用 RSS,工程方法学邻接级
inbox/spark 2026-10-11-1001-rss-gradient-flow.md(10-11 10:01 · 1.5KB · 5 件沿用) 🟡 Agent 安全栖位延伸稳态预备第 9 例周边 · llm-infra 邻接级
inbox/spark 2026-10-11-1003-rss-chip-huyen.md(10-11 10:03 · 1.4KB · 5 件沿用) 🟡 沿用 9-10 月,无 llm-infra 净新增
inbox/spark 2026-10-11-agent-e1prep.md(10-11 13:35 · 52KB · spark agent 主棒位) 🟢 承接级 = v115 agent.md 沿用 + 立标延革预备 99-142 例预备 + §3.1 #273 共识项全部承接(Memento 3 / Skill Constellations / REMORY / Forms of LLM-Integrated Apps / Mara Chain / Hebero / Opera / Agentic BBO / MiMo-V2.6)
inbox/stephen 2026-10-11-stephen-coordination-check-noon.md(10-11 12:45 · 52.9KB · 6 实例 14h 协调) 🟢 承接级 · stephen noon coordination check 21 跨实例冲突(C1-C21)+ 20 跨实例新增候选(N1-N20)+ 8 件工程主轴 paper_card 未建卡 P0 候选 prep 第 3 例(C18) + stephen v71 §X.X 升档活文档候补 + 6 件必须人工确认 H1-H6(Hebero vs RobotWorld 范式二分闭合至 flyp 短审稿)
inbox/stephen 2026-10-11-ai-industry-e1prep.md(10-11 10:20 · 24.6KB · v2 直白风格 · 5 件主增量) 🟢 承接级 = ① Memento 3 arXiv:2610.11794 frontier lab 级 agent 自我改进立标候选预备第 1 例(work-queue Top 15 连续两棒 #1)+ ② frontier lab 公告密度 10-6→10-11 连续 6 日回升 + ③ Skill Constellations arXiv:2610.11169 首个 AI Agent Skill 软件供应链研究(work-queue Top 15 第 2)+ ④ REMORY + galahad-kv agent 长上下文记忆压缩主轴双候选 + ⑤ Anthropic 安全/治理产品化密度首次超越模型发布 = frontier lab 治理公开化第三阶段跃迁信号 ⚠⚬⚬ + 8 件 P0 警示独立成节(P0-1 Memento 3 升档 / P0-2 公告密度周末 RSS 偏置 / P0-3 Anthropic 当日无新模型单日观察升档阶段跃迁风险 / P0-4 frontier lab 安全产品化四联商业模式跃迁叙事升档过快 / P0-5 agent 记忆三栖判断升档过快 / P0-6 Memento 3 自我改进三联预备稳定性待核 / P0-7 Hebero + ME-World 双主轴协同 / P0-8 OpenAI 商业化案例企业客户代表性待核)
inbox/stephen 2026-10-11-0910-news-x-vip-radar.md / 2026-10-11-1004-news-{openai,anthropic,deepmind,google-ai,hf}-news.md / 2026-10-11-1005-news-{bens-bites,tldr-ai}-news.md 🟡 X 雷达静默期第 5 日延续 + frontier lab 公告密度 6 日回升 · llm-infra 间接邻接

一、今日该主题最重要的增量(6 条)

增量 1 · 🟢 jay engineering 主棒位 5 件主增量承接 v3.56 morning · 工程主分类承接级扩增稳态第 2 例 ⚠⚬

  • 来源:
  • /shared/research-kb/inbox/jay/2026-10-11-engineering-e1prep.md(10-11 11:22 · 16.1KB · jay · 主棒位)
  • /shared/research-kb/inbox/jay/2026-10-11-agentic-systems-vector-db-mlops.md(10-11 09:36 · 10.9KB)
  • /shared/research-kb/inbox/jay/2026-10-11T1050-jay-engineering-filter.md(10-11 10:50 · 11.6KB)
  • /shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB · 二次过滤)
  • 关联:/shared/research-kb/organized/knowledge/llm-infra.md v3.56 morning(10-11 05:00)
  • arXiv:0 件 NET-new arXiv ID · 5 件承接级 arXiv 已全部在 v3.56 morning 锚入基线 + 8 件工程主轴 paper_card 未建卡(已记录 stephen C18 ⚠⚬⚬)
  • 可信度:⭐⭐⭐⭐(jay engineering 主棒位 · v3.56 morning 5 件承接稳态精修预备级锚定承接 + inference.md 10-10 午 update 主动吸纳 + engineering.md v141 沿用 + jay 10-11 1105 + 1450 工程化二次过滤承接)
  • 要点: 1. AgentSysBench arXiv:2608.15127 = 重新定义 Agentic Workload serving 成本模型(HKUST + Alibaba + ByteDance 联合研究 · 10 个真实 agentic 应用 + 178,799 session 实测 + 模型推理不再是主要成本中心 · sandbox/搜索/embedding/向量数据库操作在工具密集型应用中占主导 + 任务分解式 serving vs 共享组件延迟 -29-40% · 6 个区分属性) = 承接 v3.56 morning §1.(13) AI for Systems 五栖预备级 + AI Agent 优化推理系统 + Harness vs Scaffold 锚入补强第 N 例 ⚠⚬ · 与 R98 evening arXiv:2606.14589 Agent 生产静默失败 8 周实证(40 jobs + 8 providers + 5 类静默失败)协同 = Agentic serving 静默失败机制 + 成本模型重定义双栖预备 2. Agent Memory 基础设施四足鼎立(Mem0 drop-in production + MemOS 35.24% token 节省 GitHub 工程实践 + Cognee 图结构 memory + MemSearch Zilliz Markdown+Milvus user-owned/local-first 跨 Agent 共享) = Agent Memory 栖位扩稳态第 3 例 ⚠⚬⚬(spark 10-11 13:35 agent-e1prep 增量 4 已承接) 3. State-Bench Microsoft May 2026 = 450 企业任务 + memory 作为独立学习轨迹评测变量 + memory architecture 评测必须独立于 task quality 评测 = 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例 + Memory 评测栖位预备第 1 例 ⚠⚬ 4. HarnessSQL arXiv:2610.12274 = Agent Harness 原生 SQL 训练 + Text-to-SQL 模型被训练为将问题直接映射为静态查询;真实数据库 Agent 通过有状态、多轮交互执行任务(两者 mismatch 导致生产 SQL Agent 效果差)+ HarnessSQL = 在 Agent harness 原生环境(真实数据库 + 多轮交互)中训练 SQL Agent,而非静态 SQL 数据集 = Agent 与 Serving 系统协同设计的具体路径——harness(编排层)与 serving(推理层)的 co-design = 承接 v3.56 morning §1.(11) Kernel/AI 自动化/Harness 锚入补强第 4 例 + §1.(13) AI for Systems 闭环锚入补强第 N 例 5. Kiln on Trainium vs vLLM on H200(Foil AI 2026-10-05 blog · foxl.ai/blog/introducing-kiln)= Trainium (trn1.32xlarge) vs 8×H200 (p5en.48xlarge) 真实 benchmark + 并发 16/32/64 输出 tok/s + 每百万 token 成本 + 75% prefix 共享 prompt caching -58% 成本 + Trainium 成本 -73-75%(并发 16)但 TTFT 6.9s vs 634ms = 10.9× 劣势 = 多芯片推理引擎选型视野 ⚠⚬ 6. 8 件工程主轴 paper_card 未建卡 P0 候选 prep 第 3 例(stephen C18 ⚠⚬⚬) = AgentSysBench 2608.15127 + Agent Memory 四足鼎立 + State-Bench + HarnessSQL 2610.12274 + VFold 2610.12338 + SGUID 2610.12367 + Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving = 本日工程主轴最强增量但 paper_card 全部未建 = paper_card 富化缺口协同风险 + 建议 evening 棒位批量建卡
  • 与活文档现有脉络的关系:
  • 直接接续 v3.56 morning §IX 114 morning §1.(1) 推理引擎 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + §1.(13) AI for Systems 闭环 + §0.5 现状全景 6 件承接稳态精修预备级锚定承接
  • 承接级补强级(非 NET-new):本杰 5 件增量全部为 v3.56 morning 沿用基线内的细化数据点 + 承接级新发布(AgentSysBench + State-Bench + HarnessSQL + Kiln on Trainium)
  • 新增视角:AgentSysBench 178,799 session 实测 + HarnessSQL 跨主分协同设计 + Trainium 多芯片成本对比 = v3.56 morning §1.(1) 推理引擎方法学 + §1.(11) Kernel/AI 自动化/Harness + §1.(13) AI for Systems 闭环 三栖锚入补强
  • 建议归入节:
  • §1.(1) 推理引擎 → 在 vLLM/SGLang/TRT-LLM 三国 + Spheron H100 实测 + Winder.AI 5 引擎对比锚入后新增 "AgentSysBench arXiv:2608.15127 · 178,799 session 实测 · Agentic 场景模型推理不再是主要成本 · sandbox/embedding/vector DB 占主导 · disaggregated serving 延迟 -29-40% · 6 个区分属性 · AI Agent 优化推理系统第四栖预备"
  • §1.(1) 推理引擎 → 新增 "Kiln on Trainium vs vLLM on H200 · Trainium 成本 -73-75% 但 TTFT 6.9s vs 634ms · 75% prefix 共享 prompt caching -58% 成本 · AWS Trainium 推理引擎选型维度"
  • §1.(11) Kernel/AI 自动化/Harness → 新增 "HarnessSQL arXiv:2610.12274 · Agent Harness 原生 SQL 训练 · 在真实数据库多轮交互 harness 中训练而非静态 SQL 数据集 · harness 与 serving 协同设计"
  • §1.(13) AI for Systems 闭环 → 新增 "State-Bench Microsoft May 2026 · 450 企业任务 · memory 独立评测栖预备第 1 例 · memory architecture 评测必须独立于 task quality 评测的方法论贡献"
  • §1.(13) AI for Systems 闭环 → 新增 "Mem0/MemOS/Cognee/MemSearch Agent Memory 基础设施 4 件套 · MemOS 35.24% token 节省 · 自进化 memory OS 栖预备"

增量 2 · 🟡 arXiv:2610.06597 "Can Agent Harnesses and Inference Engines Hear Each Other?" OmniKV→vLLM + H2O 方案 ⚠⚬

  • 来源:
  • /shared/research-kb/inbox/jay/2026-10-11T1050-jay-engineering-filter.md(10-11 10:50 · 11.6KB · jay 早棒工程筛选)
  • arXiv:2610.06597 https://arxiv.org/abs/2610.06597
  • 可信度:⭐⭐⭐⭐(arXiv 学术论文 · jay 工程化二次过滤承接 + v3.56 morning 邻接级预备)
  • 要点: 1. 核心问题:Agent harness(workflow 编排)与 inference engine(vLLM/SGLang)之间的 KV cache 复用协调问题 2. OmniKV → vLLM 链路:BrowseComp-Plus 延迟 17.0s → 14.9s = 1.14× 提升 3. H2O (Harness-aware Inference Engine) 方案效果显著:Chain reuse 49.8% → makespan 5.93h → 2.42h = 2.45× 加速 4. 与 v3.56 morning §1.(3) KV Cache 14+1+1 件体系化扩增 + §1.(11) Kernel/AI 自动化/Harness 锚入补强:直接接续 OSDI 2026 KV Cache Disaggregation "An Internet for the KV Cache" arXiv:2608.01526 + vLLM×Mooncake 92.2% cache hit 受控实验 + Tesla/Red Hat/KServe prefix-cache-aware routing Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐 + 2× TTFT 改善 = harness-aware inference engine 是 KV Cache 持久化纪元 + Agent-Serving co-design 双栖预备的具体化案例 5. 承接级补强第 N 例(v3.56 morning 主棒位无 OmniKV/H2O 完整细节;jay 10-11 1050 承接级预备)
  • 与活文档现有脉络的关系:
  • 承接 v3.56 morning §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 锚入补强
  • 承接级补强第 5 例(非 NET-new arXiv ID;v3.55 evening / v3.56 morning 主棒位无 arXiv:2610.06597;jay 10-11 1050 工程化二次过滤承接级预备)
  • 建议归入节:
  • §1.(3) KV Cache → arXiv:2610.06597 "Can Agent Harnesses and Inference Engines Hear Each Other?" OmniKV→vLLM + H2O 方案 · BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速 · harness-aware inference engine 预备第 1 例承接稳态精修预备级锚入
  • §1.(11) Kernel/AI 自动化/Harness → 同步锚入

增量 3 · 🟡 Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE 混合架构(jay 10-11 1450 工程化二次过滤承接)⚠⚬

  • 来源:
  • /shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB)
  • /shared/research-kb/inbox/jay/2026-10-11T1935-jay-evening-briefing-github-hf-openmodels.md(10-11 19:35 · evening briefing · 事后承接参考 · cron 18:40 视角下不可见)
  • arXiv:无(transformers v5.16.0 官方文档 + HF Blog)
  • 可信度:⭐⭐⭐⭐(Hugging Face 官方文档 transformers v5.16.0 · Qwen 官方 X 公告 · Qwen4 尚未发布(Apsara Conference 2026-09-22 确认 in training))
  • 要点: 1. GatedResidual(GR):结合 Hyper-Connection + GatedNorm + 4 分支残差流在每次 attention 和 MoE block 前通过细粒度 elementwise gating 混合 + 动态控制 block 输出注入各残差流的比例 2. Qwen Sparse Attention(QSA):多 query head 对压缩的 key blocks 打分 + 选择最相关的连续 token blocks + 保留不完整的尾部 block 不压缩 + block-level 选择减少索引开销 + 首次实现 linear + sparse attention 混合架构 3. QSA 性能:1M token context 下 prefill 快 7.6×,decode 快 4.9× + 90% prefix-cache hit 场景 prefill 吞吐是 Qwen3.7-Plus 的 8.6× 4. Per-Layer Embedding(PLE):从 hashed token n-grams 和 dilated depthwise convolution 提取层特定词法特征 5. Qwen3.8-Flash-Next 规格(Qwen4 架构实验性预览):125B MoE backbone + 6B active/token + 51B n-gram embedding + 4B MTP ≈ 180B + Muon optimizer(与 AdamW 分工)+ 训练成本约为 Qwen3.7-Plus 的 1/9 6. 承接 v3.56 morning §1.(1) 推理引擎方法学 + §1.(6) 长上下文:QSA = Qwen 实验室级长上下文推理效率创新;与 v3.55 morning SparseEngine arXiv:2609.39068 13▲ HF Daily 10-10 + 2.5× decode vs vLLM Vanilla 协同形成「SparseEngine + QSA」稀疏推理引擎纪元双栖预备
  • 与活文档现有脉络的关系:
  • 直接接续 v3.56 morning §1.(1) 推理引擎方法学 + §1.(6) 长上下文 + SparseEngine 锚入补强
  • 承接级补强第 N 例(非 NET-new arXiv ID · 实验室级架构创新 + Qwen 官方 transformers v5.16.0 已支持 · v3.55 evening / v3.56 morning 主棒位无 Qwen4-Exp QSA;jay 10-11 1450 承接级预备 + evening briefing 19:35 承接延续)
  • 建议归入节:
  • §1.(1) 推理引擎 → Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE 混合架构 + Qwen3.8-Flash-Next 180B MoE 架构预览 · transformers v5.16.0 官方支持 · 长上下文推理效率创新 + SparseEngine 双栖稀疏推理引擎纪元
  • §1.(6) 长上下文 → QSA 承接稳态精修预备级锚入

增量 4 · 🟡 antirez/ds4 DeepSeek V4 Flash 专用推理引擎 21.9K stars C 单文件 Metal/CUDA/ROCm 三后端 ⚠⚬

  • 来源:
  • /shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB)
  • /shared/research-kb/inbox/jay/2026-10-11T1935-jay-evening-briefing-github-hf-openmodels.md(10-11 19:35 · evening briefing · 事后承接参考)
  • URL:https://github.com/antirez/ds4
  • 可信度:⭐⭐⭐⭐(Redis 作者 Salvatore Sanfilippo(antirez)工程声誉极高 + 21.9K stars + 完整工程化文档 AGENT.md/QA_BEFORE_RELEASES.md/MODEL_CARD.md + MIT License)
  • 要点: 1. 核心定位:single-purpose 推理引擎 —— 只跑 DeepSeek V4 Flash / PRO,不支持其他模型 + 对比 llama.cpp 的 generalism,ds4 走"一个模型跑透"深度优化路线 2. 技术细节:C 单文件(ds4.c)+ 零外部依赖 + 后端 Metal(Apple M 系列统一内存)/ CUDA(NVIDIA)/ ROCm(AMD)三端原生 3. 实测性能:Mac M5 Max 460 prompt tok/s prefill / 39 tok/s decode + M4 Max FP16 @ 460 tok/s prefill + DGX Spark GB10 vLLM fork 52 tok/s(DeepSeek V4 Flash 0731 full 256 experts) 4. 量化方案:混合精度 IQ2_XXS routed experts gate/up + Q2_K down + FP8 E4M3 dense/attention + BF16 embeddings 5. 协议:OpenAI 兼容 API + 1M token context + thinking mode + 已支持 Claude Code 等 coding agent 直接调用本地 endpoint 6. 承接 v3.55 morning vllm.cpp mudler C++ 推理引擎 1:1 vLLM 兼容 + ROCm AMD gfx1151 零 CPU fallback:ds4 = C 推理引擎 single-purpose 新维度 · 与 vllm.cpp 形成「C++/C 双后端 + 多硬件后端 + 通用/专用双栖」预备级 7. 承接 v3.55 morning Colibri 纯 C MoE 744B GLM-5.2 25GB RAM 消费级:ds4 = C 单文件推理引擎第二例(Colibri 纯 C + ds4 C 单文件)
  • 与活文档现有脉络的关系:
  • 承接 v3.56 morning §1.(1) 推理引擎方法学 + vllm.cpp mudler C++ 推理引擎 1:1 vLLM 兼容 + ROCm AMD gfx1151 零 CPU fallback 锚入补强
  • 承接级补强第 6 例(v3.55 evening / v3.56 morning 主棒位无 antirez/ds4;jay 10-11 1450 + 19:35 承接级预备)
  • 建议归入节:
  • §1.(1) 推理引擎 → antirez/ds4 DeepSeek V4 Flash 专用 21.9K stars C 单文件 Metal/CUDA/ROCm 三后端 · Mac M5 Max 460 tok/s prefill / 39 tok/s decode · 1M context · OpenAI 兼容 · Claude Code 已集成 · 与 vllm.cpp 形成「C++/C 双后端 + 多硬件后端 + 通用/专用双栖」

增量 5 · 🟡 Winder.ai SGLang vs vLLM vs llama.cpp 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 + SGLang 自限速机制)+ SGLang 2026-10 Bug 集中 ⚠⚬

  • 来源:
  • /shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB)
  • URL:
  • Winder.ai:SGLang vs vLLM vs llama.cpp 2026-09 采集实测(Qwen3.8-27B H100)
  • SGLang GitHub Issues #43488 / #43557 / #43402 / #43523(2026-10 Bug 集中)
  • 可信度:⭐⭐⭐⭐(Winder.ai 工程实测 + SGLang 官方 GitHub Issues · 承接 v3.56 morning §1.(1) 推理引擎锚入补强第 N 例)
  • 要点: 1. Winder.ai 实测数据(2026-09 采集,Qwen3.8-27B H100):SGLang 0.5.20 @ 50 并发 1,725 tok/s $0.56/M tokens + vLLM 0.30.0 @ 50 并发 1,610 tok/s $0.60/M tokens + llama.cpp 50 并发下性能断崖 138 → 97 tok/s(混合模型场景每次重处理完整 prompt) 2. SGLang 自限速机制:caps its own concurrency to fit its state cache —— 仅日志提示,不在 API 层暴露 = 工程隐患(客户端无法控制并发度 = 不可预测的服务质量) 3. SGLang 2026-10 Bug 集中:#43488 DSV4.1+Flash+DSPARK CUDA OOM 崩溃(每 15-25 分钟复现 · KV pool 仅用 29% · CUDA allocator 问题非 KV pool 泄漏)+ #43557 PD disaggregation 模式切换 illegal memory access + #43523 multimodal transport slice 队列 abort 泄漏 + #43402 DeepSeekV3Detector streaming 两个工具调用同一 increment 到达时第一个静默丢弃 4. 承接 v3.56 morning §1.(1) 推理引擎方法学 + SGLang 400K GPU 生产规模 + SGLang vs vLLM 跨源三确认:Winder.ai 实测 = SGLang 0.5.20 vs vLLM 0.30.0 实测第 4 件 + SGLang 自限速机制工程隐患预备第 1 例 + SGLang 10 月 Bug 集中工程稳定性预备级第 1 例
  • 与活文档现有脉络的关系:
  • 承接 v3.56 morning §1.(1) 推理引擎方法学 + Spheron H100 三引擎实测 + Winder.AI 5 引擎对比 + SGLang 400K GPU 生产规模锚入补强
  • 承接级补强第 7 例(v3.55 evening / v3.56 morning 主棒位无 SGLang 自限速机制 + 10 月 Bug 集中;jay 10-11 1450 承接级预备)
  • 建议归入节:
  • §1.(1) 推理引擎 → Winder.ai SGLang 0.5.20 vs vLLM 0.30.0 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 · $0.56 vs $0.60/M tokens · 2026-09 采集 · Qwen3.8-27B H100)+ SGLang 自限速机制工程隐患预备第 1 例
  • §1.(1) 推理引擎 → SGLang 2026-10 Bug 集中 #43488 / #43557 / #43402 / #43523(DSV4.1+Flash+DSPARK CUDA OOM 15-25 分钟复现 · PD disagg illegal memory access · multimodal slice 队列 abort 泄漏 · streaming 静默丢弃)· SGLang 工程稳定性预备级第 1 例

增量 6 · 🟡 阿里云函数计算 SGLang vs vLLM 实测数据点 + kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" ⚠⚬(承接级细化)

  • 来源:
  • /shared/research-kb/inbox/jay/2026-10-11-csdn-substack-inference-rag-highvalue.md(10-11 12:20 · 9.5KB)
  • 关联:/shared/research-kb/organized/knowledge/llm-infra.md v3.56 morning(10-11 05:00)
  • URL:
  • kenhuang 10 章 MoE 2026 系列:https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
  • Pragmatic Engineer "What is Inference Engineering":https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
  • System Design Nuggets Arslan Ahmad:https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
  • Dennis Kennetz LLM Inference Curriculum:https://dkennetz.substack.com/p/llm-inference-curriculum
  • Pawan K Jha Architecting LLM Inference Part 1:https://pawankjha.substack.com/p/architecting-llm-inference-part-1
  • SitePoint vLLM Production Deployment Guide 2026(沿用):https://www.sitepoint.com/vllm-production-deployment-guide-2026
  • Spheron H100 三引擎实测 + vLLM vs SGLang vs TGI(沿用):https://www.spheron.network/blog/vllm-vs-sglang-2026
  • 可信度:⭐⭐⭐(CSDN 阿里云函数计算实测 + Substack 5 件高质量 Newsletter · 承接级细化)
  • 要点: 1. kenhuang 10 章 MoE 2026 系列(物理 + 工程前沿 LLM 推理):MoE 架构 DeepSeek-V4-Pro 1.6T 总参数 / 49B 激活参数 + 256 路由专家 + 1 共享专家 + 2026 生产架构栈 = API Gateway → Semantic Router → Prefix Caching Cluster → Disaggregated P/D Nodes → HW Monitoring + Edge SLM MLX/Metal + 骁龙 X Elite NPU + WebGPU/ONNX Runtime 2. Pragmatic Engineer "What is Inference Engineering"(Gergely Orosz · 沿用 v3.55 evening jay 10-10 1335):2026 年推理工程正在普及(开源模型崛起 + Cursor 基于 Kimi 2.5 构建 Composer 2.0)+ decode 阶段内存带宽瓶颈 + 低到中等 batch size 下计算资源闲置 + 闭源模型推理工程只服务于几千名 AI 工程师;开源模型让更多公司能定制优化 = Inference Engineering 子学科预备扩增第 1 例(v3.55 evening 沿用 + 工程化完成级预备) 3. Dennis Kennetz LLM Inference Curriculum:多节点推理 topology + RDMA + placement + tail latency + storage + 核心思维转变 = 不是"学习 LLM 推理",而是"学习规模化下瓶颈如何迁移" + Build small, throw it away, build the next thing = 多节点推理工程课程体系化预备级第 1 例 4. System Design Nuggets Arslan Ahmad LLM Inference at Scale:continuous batching 机制(请求完成即退出,新请求立即补位,保持硬件满载)+ decode 阶段内存带宽瓶颈(memory bandwidth bottleneck)+ 面向 2026 年生产级 AI 系统工程师 5. Pawan K Jha Architecting LLM Inference Part 1:从用户 prompt 到最终 token 输出的端到端架构完整心智模型 + Token 生成、内存管理、GPU 执行、生产架构 6. 承接 v3.55 evening jay 10-10 1335 + v3.56 morning §1.(1) 推理引擎方法学 + §1.(13) AI for Systems 五栖预备级:5 件 Substack = 推理工程化完成级叙事预备级扩增第 5 例 · 5 件跨主文档追踪预备(Pragmatic Engineer + Dennis Kennetz + System Design Nuggets + Pawan K Jha + kenhuang)
  • 与活文档现有脉络的关系:
  • 承接 v3.56 morning §1.(1) 推理引擎方法学 + §1.(13) AI for Systems 五栖预备级 + 推理工程学科化(Loop Engineering 学科化 2026 H2 成熟)锚入补强
  • 承接级细化第 N 例(v3.55 evening 已锚 Gergely Orosz "What is Inference Engineering" + jay 10-10 1335;jay 10-11 1220 承接 4 件 Substack 续立)
  • 建议归入节:
  • §1.(1) 推理引擎 → 推理工程学科化 + 5 件 Substack 跨主文档追踪预备(kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" + Dennis Kennetz LLM Inference Curriculum + System Design Nuggets LLM Inference at Scale + Pawan K Jha Architecting LLM Inference Part 1)

二、值得警惕的矛盾 / 待核实说法(沿用 v3.56 morning D255-D258)

⚠ 本窗口期值得警惕的矛盾 = 6 件 v3.56 morning 已锚定 + 2 件承接稳态期内细化不足 + 4 件承接稳态期新发现:

矛盾 1 · galahad-kv arXiv:2610.10845 NVMe 持久化在生产环境安全验证 ⚠⚬⚬(沿用 D249)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚;周日低活动度)
  • 来源:v3.56 morning §3 D249 + flyp 10-11 risk-e1prep R99 沿用
  • 争议焦点:galahad-kv NVMe 持久化在生产环境安全验证 + 加密存储开销 vs 收益 + 多用户并发访问一致性 + 与 vLLM Production Stack LMCache KV 跨实例共享的协同
  • 本棒位判断:沿用 D249 · 截止 10-13 morning 棒前 · 不升档

矛盾 2 · Cascadia arXiv:2610.07219 消费级 975B MoE 部署稳定性 ⚠⚬⚬(沿用 D250)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D250 + flyp 10-11 risk-e1prep 沿用
  • 争议焦点:Cascadia 消费级 MoE 部署在真实生产环境的稳定性 + 复现 artifact 在 NVIDIA H100/200 + AMD MI300 + 国产 GPU 跨平台验证 · preprint 阶段精度数据待 peer review 验证
  • 本棒位判断:沿用 D250 · 截止 10-13 morning 棒前 · 不升档

矛盾 3 · SpecScale arXiv:2609.39334 H100/B200 生产实测 ⚠⚬⚬(沿用 D251)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D251 + flyp 10-11 risk-e1prep 沿用
  • 争议焦点:SpecScale H100/B200 + vLLM/SGLang 生产环境实测 + 与 EAGLE-3 + DFlash2 + Spec V2 在不同 workload 的临界条件
  • 本棒位判断:沿用 D251 · 截止 10-13 morning 棒前 · 不升档

矛盾 4 · STEPQuant arXiv:2609.38169 循环状态量化生产引擎稳定性 ⚠⚬⚬(沿用 D252)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D252 + flyp 10-11 risk-e1prep 沿用
  • 争议焦点:STEPQuant 循环状态量化失败模式在生产推理引擎的稳定性 + 与 FP8 KV-cache + MXFP8 + NVFP4 跨平台 ROI 评估
  • 本棒位判断:沿用 D252 · 截止 10-13 morning 棒前 · 不升档

矛盾 5 · vLLM→llm-d→控制平面演化综述 arXiv:2609.23130 引用数据独立验证 ⚠⚬⚬(沿用 D253)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D253 + flyp 10-11 risk-e1prep 沿用 + jay 10-11 1050 工程化二次过滤承接(arXiv:2610.06597 与 2609.23130 形成「harness-aware inference engine + 推理控制平面演化叙事」双栖)
  • 争议焦点:vLLM→llm-d→控制平面演化综述引用数据来自生产报告(Tesla/Red Hat/KServe)条件受限,需独立验证 + 与 NVIDIA Dynamo v1.5.0 Feature Matrix 对比
  • 本棒位判断:沿用 D253 · 截止 10-13 morning 棒前 · 不升档

矛盾 6 · MLPerf Inference v6.1 9 月 30 日发布数据 ⚠⚬(沿用 D254)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D254 + flyp 10-11 risk-e1prep 沿用
  • 争议焦点:MLPerf Inference v6.1 9 月 30 日发布数据与 v6.0 B200 8 卡基线对比 + gpt-oss-120b Server 8 卡 vs 8+ 卡多 GPU 配置的可外推性 + Edge Agentic test 在生产环境的稳定性
  • 本棒位判断:沿用 D254 · 截止 10-13 morning 棒前 · 不升档

矛盾 7 · vLLM×Mooncake 92.2% cache hit 受控实验 vs Tesla/Red Hat/KServe 生产报告条件区分 ⚠⚬⚬(沿用 D255)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚;周日低活动度)
  • 来源:v3.56 morning §3 D255
  • 争议焦点:vLLM×Mooncake 92.2% cache hit + 3.8× 吞吐 + 46× TTFT 降低(arXiv:2609.23130 受控实验条件)与 Oct 9 Tesla/Red Hat/KServe ~3× throughput 2× TTFT(同 arXiv:2609.23130 生产报告条件)在同一语境下引用需明确区分「受控实验条件」vs「生产报告条件」避免误导性比较
  • 本棒位判断:沿用 D255 · 截止 10-13 morning 棒前 · 不升档

矛盾 8 · SparseEngine arXiv:2609.39068 跨平台实测 + 与 vLLM/SGLang 主流 dense engines 在不同 workload 临界条件 ⚠⚬⚬(沿用 D256)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D256 + jay 10-11 1450 Qwen4-Exp QSA + Qwen 实验室级 sparse + linear attention 混合架构形成「SparseEngine + QSA」稀疏推理引擎纪元双栖预备
  • 争议焦点:SparseEngine 跨平台实测(短上下文/长上下文/agentic workflow 临界条件)与 vLLM/SGLang 主流 dense engines 在不同 workload 的临界条件
  • 本棒位判断:沿用 D256 · 截止 10-13 morning 棒前 · 不升档

矛盾 9 · VFold arXiv:2610.12338 与 MiniCache + 现有 KV cache 量化方法复合在生产推理引擎实测 ⚠⚬⚬(沿用 D257)

  • 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
  • 来源:v3.56 morning §3 D257 + jay 10-11 1001-rss-cool-papers VFold 沿用承接
  • 争议焦点:VFold 与 MiniCache + 现有 KV cache 量化方法(FP8 KV/NVFP4)复合在生产推理引擎 vLLM/SGLang/TRT-LLM 的实测
  • 本棒位判断:沿用 D257 · 截止 10-13 morning 棒前 · 不升档

矛盾 10 · HarnessSQL arXiv:2610.12274 编号 web search 未验证确认 ⚠⚬(沿用 D258)

  • 本窗口期新增证据:1 件新证据(jay 10-11 1001-rss-cool-papers 已收录)
  • 来源:v3.56 morning §3 D258 + jay 10-11 1001-rss-cool-papers(HarnessSQL 10-11 早棒 RSS Cool Papers 已收录 = web search 验证完成)
  • 争议焦点:HarnessSQL arXiv:2610.12274 编号 web search 未验证确认(已 10-11 早棒 Cool Papers RSS 验证完成)
  • 本棒位判断:闭合 D258 · HarnessSQL arXiv:2610.12274 Cool Papers RSS 已收录 + jay 10-11 1001-rss-cool-papers 二次确认 = 编号验证完成 · 等 evening / morning 棒位精读 arXiv abstract 升级为承接级正式立标

矛盾 11 · 8 件工程主轴 paper_card 未建卡 = paper_card 富化缺口协同风险 ⚠⚬⚬(stephen C18 · P0 候选 prep 第 3 例)

  • 本窗口期新增证据:8 件工程主轴 paper_card 全部未建卡(AgentSysBench 2608.15127 + Agent Memory 四足鼎立 + State-Bench + HarnessSQL 2610.12274 + VFold 2610.12338 + SGUID 2610.12367 + Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving)
  • 来源:stephen 10-11 noon coordination C18 + flyp 10-11 risk-e1prep P0 候选 prep 第 3 例 + jay 10-11 11:22 engineering-e1prep 5 件主增量 + jay 10-11 12:20 csdn-substack-inference
  • 争议焦点:本日工程主轴最强增量但 paper_card 全部未建 = paper_card 富化缺口协同风险(work-queue 富化缺口 = 15 张卡缺 TLDR 待 cron_s2 覆盖沿用)
  • 本棒位判断:建议 evening 棒位批量建卡(Q178 P1 + stephen C18)

矛盾 12 · stephen v71 §X.X 升档活文档候补条目的升档节奏判定 ⚠⚬⚬(stephen C2-C6)

  • 本窗口期新增证据:6 件必须人工确认问题(stephen H1-H6)
  • H1:Hebero vs RobotWorld 范式二分(→ 已闭合至 flyp 10-11 0950 短审稿)
  • H2:Anthropic 第三阶段跃迁叙事是否承接为"概念预备级"而非阶段跃迁(→ stephen P0-3 ⚠⚬⚬)
  • H3:frontier lab 安全产品化四联是否承接为"概念预备级"(→ stephen P0-4 ⚠⚬⚬)
  • H4:agent 记忆三栖判断是否承接为"双候选"而非"三栖"(→ stephen P0-5 ⚠⚬⚬)
  • H5:8 件 paper_card 未建卡批量补建(AgentSysBench + Agent Memory + State-Bench + HarnessSQL + VFold + SGUID + Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving)
  • H6:spark 周日早棒无主棒位 e1prep 是否需启动反思棒位(→ 本棒位承接)
  • 来源:stephen 10-11 noon coordination check H1-H6 + stephen 10-11 ai-industry P0-3 / P0-4 / P0-5
  • 争议焦点:6 件必须人工确认问题 = 升档节奏判定(Anthropic 第三阶段跃迁叙事 + frontier lab 安全产品化四联 + agent 记忆三栖判断 + 8 件 paper_card 批量补建)
  • 本棒位判断:建议承接为"概念预备级"(stephen P0-3 / P0-4 / P0-5 自承)+ 8 件 paper_card 批量补建建议 evening 棒位

三、v3.56 morning 沿用稳态项复盘(本棒位重新确认)

⚠ 本窗口期 v3.56 morning 全部 4 NET-new arXiv ID + 6 NET-new URL + 4 矛盾续写 D255-D258 + C357-C358 + O569-O576 + P0 #289 + P0-10 = 全部沿用稳态,无新增突破:

沿用稳态项 1 · galahad-kv arXiv:2610.10845 50M Token NVMe 持久化 ⭐⭐⭐⭐

  • v3.56 状态:KV Cache 持久化纪元 + Memory-as-a-Layer 范式预备级第 1 例 · 100/100 探测块 byte-exact 加密 NVMe 加载无重计算
  • 本棒位新增:0 件新证据(v3.56 morning 已锚;周日低活动度)
  • 承接路径:§1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + Memory 第十四栖「NVMe 持久化 Memory」预备第 1 例

沿用稳态项 2 · Foundations of LLMs arXiv:2501.09223 教科书承接级 ⭐⭐⭐

  • v3.56 状态:教科书承接级备查资源预备第 N 例 · 第六章"inference" + 第六章"reasoning"
  • 本棒位新增:0 件新证据(v3.56 morning 已锚 · paper_card 1742 10-09 入池沿用)
  • 承接路径:§1.(1) 推理引擎方法学 + §1.(6) 长上下文承接级备查资源

沿用稳态项 3 · SparseEngine arXiv:2609.39068 13▲ HF Daily 稀疏优先推理引擎 ⭐⭐⭐⭐

  • v3.56 状态:SparseEngine 稀疏推理纪元预备级第 1 例 + 2.5× decode vs vLLM Vanilla + Apache 2.0
  • 本棒位新增:2 件承接级预备(① Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context · 90% prefix-cache hit 8.6× prefill · GatedResidual + PLE + Muon optimizer · 「SparseEngine + QSA」稀疏推理引擎纪元双栖预备 ② Winder.ai SGLang/vLLM 实测中 SGLang 自限速机制工程隐患预备第 1 例)
  • 承接路径:§1.(1) 推理引擎 → SparseEngine 稀疏推理纪元预备级第 1 例 + 与 Qwen4-Exp QSA 双栖

沿用稳态项 4 · VFold arXiv:2610.12338 跨层 Value Cache 压缩 ⭐⭐⭐

  • v3.56 状态:KV Cache 跨族压缩预备级第 N 例 · 75% value cache reduction k=4 + 与量化+key cache-only methods 复合
  • 本棒位新增:0 件新证据(v3.56 morning 已锚;jay 10-11 1001-rss-cool-papers 沿用)
  • 承接路径:§1.(3) KV Cache + §1.(4) 量化承接稳态精修预备级锚入

沿用稳态项 5 · Memento 3 arXiv:2610.11794 反射式规则手册自我改进栖位扩稳态第 12 例 ⭐⭐⭐⭐

  • v3.56 状态:paper_card 1744 + work-queue Top 15 #1(连续两棒)+ Memory 第十六栖「反射式规则手册」预备邻接第 1 例 · Self-Controlled-RSI 范式
  • 本棒位新增:work-queue Top 15 #1 连续两棒 = frontier lab 级 agent 自我改进主轴立标候选预备第 1 例(stephen 10-11 ai-industry v2 增量 1 · flyp 10-11 risk-e1prep 沿用)
  • 承接路径:§1.(11) Kernel/AI 自动化/Harness → 反射式规则手册自我改进栖位扩稳态第 12 例承接稳态精修预备级锚入

沿用稳态项 6 · REMORY arXiv:2610.11287 Memory 第十五栖「残差记忆网络」预备邻接第 1 例 ⭐⭐⭐⭐

  • v3.56 状态:paper_card 1748 + soft memory tokens + residual connection 沿序列维度类比 + bounded sequence of soft memory tokens + SummHay 提升
  • 本棒位新增:0 件新证据(v3.56 morning 已锚;stephen 10-11 ai-industry v2 增量 4 沿用)
  • 承接路径:§1.(11) Kernel/AI 自动化/Harness + Memory 第十五栖「残差记忆网络」预备邻接第 1 例

沿用稳态项 7 · HarnessSQL arXiv:2610.12274 Harness 原生 SQL Agent 训练 ⚠⚬

  • v3.56 状态:Harness 原生 SQL Agent 训练预备级第 1 例 + Agent 与 Serving 系统协同设计 · D258 web search 未验证确认
  • 本棒位新增:D258 闭合 · Cool Papers RSS 已收录 + jay 10-11 1001-rss-cool-papers 二次确认
  • 承接路径:§1.(11) Kernel/AI 自动化/Harness → Harness 原生 SQL Agent 训练承接稳态精修预备级锚入(D258 闭合)

沿用稳态项 8 · OSDI 2026 KV Cache Disaggregation arXiv:2608.01526 "An Internet for the KV Cache" ⚠⚬

  • v3.56 状态:KV Cache 正从"推理优化技巧"演变为存储/通信/调度基础原语 · 跨模型共享 + 持久化存储 + 跨引擎暴露接口
  • 本棒位新增:2 件承接级预备(① arXiv:2610.06597 OmniKV→vLLM + H2O 方案 BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速 ② Winder.ai SGLang 0.5.20 vs vLLM 0.30.0 实测 + SGLang 10 月 Bug 集中)
  • 承接路径:§1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + Harness vs Scaffold 四层定义(沿用)

沿用稳态项 9 · MLPerf Inference v6.1 9 月 30 日发布 ⭐⭐⭐⭐⭐

  • v3.56 状态:5.7× 单加速器 + 16/30 submitters API-centric + Edge Agentic test VLM-Interactive gpt-oss DeepSeek-R1 Llama 3.1-8B text-to-video
  • 本棒位新增:0 件新证据(v3.56 morning 已锚)
  • 承接路径:§1.(13) AI for Systems 闭环 + 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖预备级

沿用稳态项 10 · 6 件承接稳态精修预备级锚定承接 + 4 矛盾续写 D255-D258 + C357-C358 候选预备级 + O569-O576 + P0 #289 + P0-10

  • v3.56 状态:承接稳态期延续预备级 · 4 矛盾续写全部沿用
  • 本棒位新增:0 件新证据(v3.56 morning 已锚)

四、可引用的 arXiv 号列表(本棒位新增或承接级锚入)

4.1 NET-new arXiv ID(0 件)

本窗口期 NET-new arXiv ID = 0 件 · 24h 滑动窗口内(2026-10-10 18:40 → 2026-10-11 18:40)无 NET-new arXiv ID 入池 · 承接 v3.56 morning 465→469 沿用基线(周六低活动度 + 周日无新立)

4.2 承接稳态精修预备级锚入 arXiv ID(本棒位承接级预备)

arXiv ID 标题 承接路径
2610.06597 Can Agent Harnesses and Inference Engines Hear Each Other? OmniKV→vLLM + H2O 方案(jay 10-11 1050 · BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速) §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 承接稳态精修预备级锚入(harness-aware inference engine 预备第 1 例)
2608.15127 AgentSysBench · 178,799 session 实测 · Agentic 场景模型推理不再是主要成本(jay 10-11 11:22 · HKUST + Alibaba + ByteDance) §1.(1) 推理引擎 + §1.(13) AI for Systems 闭环承接稳态精修预备级锚入(disaggregated serving 延迟 -29-40% · 6 个区分属性)
2610.12274 HarnessSQL · Agent Harness 原生 SQL 训练(D258 闭合 · Cool Papers RSS 已收录) §1.(11) Kernel/AI 自动化/Harness 承接稳态精修预备级锚入(D258 闭合)

4.3 承接级邻接 arXiv ID(非 llm-infra 主分类,邻接级承接)

arXiv ID 标题 主分类 邻接承接路径
2610.11794 Memento 3 · Model-Based RSI via Reflective Rulebooks agent · engineering 副 §1.(11) Kernel/AI 自动化/Harness · Memory 第十六栖预备邻接第 1 例(work-queue Top 15 #1 连续两棒)
2610.11287 REMORY · Residual Memory for Context Compaction agent §1.(11) Kernel/AI 自动化/Harness · Memory 第十五栖「残差记忆网络」预备邻接第 1 例
2610.12183 Agentic BBO · Benchmarking LLM Agents for BBO agent · evaluation 副 §1.(13) AI for Systems 闭环 · 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例
2610.11169 Skill Constellations · Tracing the Supply Chain of Agent Skills on GitHub agent §1.(11) Kernel/AI 自动化/Harness · Skill 供应链安全栖位预备第 1 例 + Agent 安全栖位延伸稳态预备(work-queue Top 15 第 2)
2610.11959 MiMo-V2.6 · Scaling RL Towards Self-Improvement engineering §1.(8) 训练 · RL scaling 基础设施 + hybrid-SWA 架构 + 异步训练 65▲ HF Daily 10-11

4.4 v3.56 morning 已锚入基线 arXiv ID(沿用稳态,本棒位未变动)

arXiv ID 标题 v3.56 承接路径
2610.10845 galahad-kv · 50M Token NVMe 持久化 ⭐⭐⭐⭐ §1.(3) KV Cache + §1.(11) · Memory 第十四栖
2501.09223 Foundations of LLMs 教科书承接级 ⭐⭐⭐ §1.(1) 推理引擎方法学 + §1.(6) 长上下文承接级备查资源
2610.07219 Cascadia · 消费级 975B MoE ⭐⭐⭐⭐ §1.(10) MoE 推理 + §1.(13) AI for Systems
2609.39334 SpecScale · test-time scaling 投机解码 ⭐⭐⭐⭐ §1.(5) 投机解码 + §1.(1) 推理引擎方法学
2609.23130 vLLM→llm-d→控制平面演化综述 ⭐⭐⭐⭐⭐ §1.(1) 推理引擎方法学 + 推理控制平面演化叙事
2609.38169 STEPQuant · 100▲ HF Daily 量化失败模式 ⭐⭐⭐ §1.(4) 量化 + §1.(1) 推理引擎方法学
2609.39068 SparseEngine · 13▲ HF Daily 10-10 稀疏优先推理引擎 ⭐⭐⭐⭐ §1.(1) 推理引擎 → SparseEngine 稀疏推理纪元预备级第 1 例 + 与 Qwen4-Exp QSA 双栖
2610.12338 VFold · 跨层 Value Cache 压缩 ⭐⭐⭐ §1.(3) KV Cache + §1.(4) 量化承接稳态精修预备级锚入
2608.01526 OSDI 2026 KV Cache Disaggregation "An Internet for the KV Cache" §1.(3) KV Cache + §1.(11) Harness vs Scaffold

五、本棒位综合判断

5.1 增量密度评估

  • 本日增量密度 = 低(承接稳态期 + 周日低活动度)
  • NET-new arXiv ID = 0 件(24h 滑动窗口内无 NET-new)
  • NET-new paper_card llm-infra 主分类 = 0 件(10-11 morning paper_cards 1740-1755 共 16 件全部为 agent/multimodal/engineering/evaluation 主分类;0 件 llm-infra 主分类真新卡)
  • 承接稳态精修预备级锚入 = 3 件(arXiv:2610.06597 OmniKV→vLLM + arXiv:2608.15127 AgentSysBench + arXiv:2610.12274 HarnessSQL D258 闭合)
  • 承接级邻接 = 5 件(Memento 3 + REMORY + Agentic BBO + Skill Constellations + MiMo-V2.6)
  • 承接级细化 = 4 件(Qwen4-Exp QSA + antirez/ds4 + Winder.ai SGLang 实测 + SGLang 10 月 Bug 集中 + 5 件 Substack Newsletter)
  • 矛盾/待核续写 = 12 件(沿用 v3.56 morning D249-D258 + D258 闭合 + 2 件承接稳态期内细化不足 + 4 件承接稳态期新发现 D255-D258 沿用)

5.2 v3.56 morning 沿用稳态

  • 4 NET-new arXiv ID 全部沿用(galahad-kv + Foundations + Cascadia + SpecScale + vLLM→llm-d 综述 + STEPQuant + SparseEngine + VFold + Memento 3 + REMORY)
  • 6 NET-new URL 全部沿用(含 Spheron H100 三引擎实测 + Crusoe Managed Inference + SGLang vs vLLM 跨源三确认 + MLPerf Inference v6.1 + ai-boost harness + STATE-Bench + Mem0/MemOS/Cognee/MemSearch)
  • 4 矛盾续写 D255-D258 全部沿用(D258 闭合)
  • C357-C358 候选预备级全部沿用(SparseEngine + VFold)
  • O569-O576 + P0 #289 + P0-10 全部沿用
  • 6 NET-new arXiv ID 全部沿用(galahad-kv + Foundations + Cascadia + SpecScale + vLLM→llm-d 综述 + STEPQuant · v3.55 morning 沿用基线)

5.3 知识库活文档本次

  • arXiv ID 全量清单 = 469 件 = 0 件 NET-new · 24h 滑动窗口内承接稳态
  • URL 全量清单 = 622 件 = 0 件 NET-new · 24h 滑动窗口内承接稳态
  • CVE = 36 件 · DOI = 15 件 = 全部沿用稳态
  • P0 警示池 = #1-#289 沿用 + P0-10 沿用 = 全部沿用稳态

5.4 后续棒位建议

  • 建议 1:沿用 v3.56 morning 承接稳态期 + 本棒位承接稳态精修预备级锚入承接级细化(arXiv:2610.06597 / 2608.15127 / 2610.12274 D258 闭合 + Memento 3 / REMORY / Agentic BBO / Skill Constellations / MiMo-V2.6 邻接承接 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai SGLang 实测 / SGLang 10 月 Bug 集中 / 5 件 Substack 承接级细化)
  • 建议 2:沿用 v3.56 morning 4 矛盾续写 D255-D258 · 截止 10-13 morning 棒前(周日低活动度 + 无新证据 · D258 HarnessSQL 编号 web search 验证完成闭合)
  • 建议 3:建议 evening 棒位补 8 件工程主轴 paper_card 批量建卡(stephen C18 P0 候选 prep 第 3 例 · AgentSysBench + Agent Memory + State-Bench + HarnessSQL + VFold + SGUID + Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving)
  • 建议 4:本棒位 0 件 NET-new arXiv ID = 无需升档 · 沿用 v3.56 morning 棒位承接稳态期
  • 建议 5:建议 10-13 morning 棒位重新激活立标延革预备 140-142 例预备承接稳态期(arXiv:2610.06597 / 2608.15127 / 2610.12274 邻接承接 → §IX 115 morning 棒位预备候选 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai / SGLang 10 月 Bug 集中承接稳态精修预备级扩增 + 4 矛盾续写(D255-D258 · D258 闭合)继续延革)
  • 建议 6:stephen C2-C6 升档活文档候补条目的升档节奏判定(Anthropic 第三阶段跃迁叙事 + frontier lab 安全产品化四联 + agent 记忆三栖判断 + 8 件 paper_card 批量补建 + spark 周日早棒无主棒位 e1prep 承接判定 → 建议承接为"概念预备级"+ evening 棒位批量建卡)

5.5 与 v3.56 morning 体系预备级承接

  • 2026 Q4 初 llm-infra 工程化完成级 + AI Agent 优化推理系统 + KV Cache 持久化纪元 + Memory-as-a-Layer 范式 + 消费级超大 MoE 推理 + 投机解码系统级条件量化 + 推理控制平面演化叙事 + LLM Operability 6 级成熟度 + Agent Memory 三层 + 推理引擎代际切换双栖 + 推理框架代际切换双栖 + AI for Systems 五栖 + 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖预备级 + Harness vs Scaffold + SparseEngine 稀疏推理纪元 + Memory 第十五/十六栖 + Agent Harness 工程化 + STATE-Bench + 自进化 memory OS + guardrails 独立学科 = 体系预备级全部沿用稳态
  • 本棒位新增承接稳态精修预备级扩增:arXiv:2610.06597 OmniKV→vLLM + H2O 方案(harness-aware inference engine 预备第 1 例)+ arXiv:2608.15127 AgentSysBench 178,799 session 实测(AI Agent 优化推理系统第四栖预备)+ Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context(「SparseEngine + QSA」稀疏推理引擎纪元双栖)+ antirez/ds4 C 单文件推理引擎(C++/C 双后端 + 多硬件后端 + 通用/专用双栖)+ Winder.ai SGLang/vLLM 实测 + SGLang 10 月 Bug 集中(SGLang 工程稳定性预备级第 1 例)+ 5 件 Substack Newsletter(推理工程学科化预备扩增第 5 例)

5.6 evening 棒位预备候选

  • §IX 114 evening v3.56 morning 棒位承接稳态期延续(承接 v3.56 morning 4 NET-new arXiv + 6 NET-new URL + 4 矛盾续写 + 6 件承接稳态精修预备级锚定承接)
  • §IX 115 morning 棒位预备候选:立标延革预备 140-142 例预备承接稳态期 + arXiv:2610.06597 / 2608.15127 / 2610.12274(D258 闭合)邻接承接 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai / SGLang 10 月 Bug 集中承接稳态精修预备级扩增 + 4 矛盾续写(D255-D258 · D258 闭合)继续延革 + 8 件工程主轴 paper_card 批量建卡(stephen C18 P0 候选 prep 第 3 例)

本次变更

2026-10-11 18:40 CST(E1 §IX 114 evening 棒位预备)

v3.56 evening 棒位预备(本轮):🌅 24h 滑动窗口期(2026-10-11 05:00 → 2026-10-11 18:40 CST · §IX 114 morning v3.56 morning 全量沿用基线 · arXiv 465→469/CVE 36/DOI 15/URL 616→622 全部沿用) + 0 NET-new arXiv ID(24h 滑动窗口期承接稳态期内无 NET-new arXiv ID 入池 · 周日低活动度)+ 0 NET-new paper_card llm-infra 主分类真新卡(10-11 morning paper_cards 1740-1755 共 16 件全部为 agent/multimodal/engineering/evaluation 主分类 · 0 件 llm-infra 主分类真新卡 · 24h 滑动窗口内承接稳态期延续)+ 0 NET-new CVE/DOI/URL + 3 件承接稳态精修预备级锚入(① arXiv:2610.06597 "Can Agent Harnesses and Inference Engines Hear Each Other?" OmniKV→vLLM + H2O 方案 · BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速 = harness-aware inference engine 预备第 1 例 ② arXiv:2608.15127 AgentSysBench · HKUST + Alibaba + ByteDance · 178,799 session 实测 · Agentic 场景模型推理不再是主要成本 · sandbox/embedding/vector DB 占主导 · disaggregated serving 延迟 -29-40% · 6 个区分属性 · AI Agent 优化推理系统第四栖预备 ③ arXiv:2610.12274 HarnessSQL Harness 原生 SQL 训练 = D258 闭合 · Cool Papers RSS 已收录 + jay 10-11 1001-rss-cool-papers 二次确认)+ 5 件承接级邻接 arXiv ID 锚入(① paper_card 1744 Memento 3 arXiv:2610.11794 engineering 副承接 + work-queue Top 15 #1 连续两棒 ② paper_card 1748 REMORY arXiv:2610.11287 Memory 第十五栖预备邻接第 1 例 ③ paper_card 1747 Agentic BBO arXiv:2610.12183 评测方法学四栖邻接第 N 例 ④ paper_card 1750 Skill Constellations arXiv:2610.11169 Skill 供应链安全栖位预备第 1 例 + work-queue Top 15 第 2 承接 ⑤ paper_card 1740 MiMo-V2.6 arXiv:2610.11959 RL scaling 基础设施承接 65▲ HF Daily 10-11)+ 4 件承接级细化数据点(① Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE + Muon optimizer · 「SparseEngine + QSA」稀疏推理引擎纪元双栖预备 + 90% prefix-cache hit 8.6× prefill ② antirez/ds4 DeepSeek V4 Flash 专用 21.9K stars C 单文件 Metal/CUDA/ROCm 三后端 · Mac M5 Max 460 tok/s prefill / 39 tok/s decode · 1M context · OpenAI 兼容 · Claude Code 已集成 · 与 vllm.cpp 形成「C++/C 双后端 + 多硬件后端 + 通用/专用双栖」③ Winder.ai SGLang 0.5.20 vs vLLM 0.30.0 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 · $0.56 vs $0.60/M tokens · 2026-09 采集 · Qwen3.8-27B H100)+ SGLang 自限速机制工程隐患预备第 1 例 ④ SGLang 2026-10 Bug 集中 #43488 / #43557 / #43402 / #43523(DSV4.1+Flash+DSPARK CUDA OOM 15-25 分钟复现 · PD disagg illegal memory access · multimodal slice 队列 abort 泄漏 · streaming 静默丢弃)· SGLang 工程稳定性预备级第 1 例 + 5 件 Substack Newsletter(kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" + Dennis Kennetz LLM Inference Curriculum + System Design Nuggets LLM Inference at Scale + Pawan K Jha Architecting LLM Inference Part 1 = 推理工程学科化预备扩增第 5 例)+ 4 矛盾续写 D249-D252 + D253 + D254 全部沿用 + D255-D258 全部沿用 + D258 HarnessSQL 编号 web search 验证完成闭合 + 3 件承接稳态期新发现矛盾警示(① 8 件工程主轴 paper_card 未建卡 = paper_card 富化缺口协同风险 ⚠⚬⚬ · stephen C18 P0 候选 prep 第 3 例 ② stephen C2-C6 升档活文档候补条目的升档节奏判定(Anthropic 第三阶段跃迁叙事 + frontier lab 安全产品化四联 + agent 记忆三栖判断 + 8 件 paper_card 批量补建)⚠⚬⚬ ③ SGLang 0.5.20 自限速机制工程隐患与 10 月 Bug 集中稳定性预备 ⚠⚬)+ jay 10-11 11:22 engineering-e1prep 16.1KB 主棒位承接 + jay 10-11 09:36 agentic-systems-vector-db-mlops + jay 10-11 10:50 + 14:50 工程化二次过滤承接 + tom 10-11 09:00 HF Daily 15 件承接稳态第 11 日 + arXiv ID 全量清单 469 件承接稳态 = 0 件 NET-new + 本棒位综合判断 = 承接稳态期延续 + 周日低活动度 + 0 件 NET-new arXiv ID + 0 件 llm-infra 主分类真新卡 + 3 件承接稳态精修预备级锚入 + 5 件承接级邻接 + 4 件承接级细化数据点 + 4 矛盾续写继续延革 + D258 闭合 + 3 件承接稳态期新发现矛盾警示 → §IX 114 evening 棒位承接稳态期延续 + §IX 115 morning 棒位预备候选(立标延革预备 140-142 例预备承接稳态期 + arXiv:2610.06597 / 2608.15127 / 2610.12274(D258 闭合)邻接承接 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai / SGLang 10 月 Bug 集中承接稳态精修预备级扩增 + 4 矛盾续写(D255-D258 · D258 闭合)继续延革 + 8 件工程主轴 paper_card 批量建卡)。