llm-infra · E1 预消化简报(2026-10-11)
E1 日间预消化轮 · llm-infra · 2026-10-11 18:40 CST · spark 承接棒位:v3.56 morning(2026-10-11 05:00 CST · §IX 114 morning · v3.55 morning 465/36/15/616 沿用基线 + 4 NET-new arXiv + 6 NET-new URL + D255-D258 + C357-C358 + T156) 状态:承接稳态期延续 · 周日低活动度 · 无新主分类 llm-infra 真新卡入池 · 无新顶级承接级预备 · 承接稳态期内细化为主
〇、检查过的来源清单(近 2 天 · llm-infra 主题相关)
A. paper_cards 索引(近 3 天 10-08 ~ 10-11 入池 · 16 件新卡)
| 编号 | arXiv | 标题 | mtime | 主分类 | llm-infra 关系 |
|---|---|---|---|---|---|
| 1740 | 2610.11959 | MiMo-V2.6: Scaling RL Towards Self-Improvement | 10-10 evening | engineering | 邻接级(异步训练 + hybrid-SWA 架构,属 v3.55 §1.(8) 训练栖) |
| 1741 | 2610.12461 | OuroWorld | 10-10 evening | multimodal | 无(沿用 flyp 10-10 multimodal 主轴) |
| 1742 | 2501.09223 | Foundations of Large Language Models | 10-09 入池(10-10 evening 落卡) | llm-infra ✓ | 教科书承接级(已锚 v3.55 morning NET-new 主分类承接级 · 沿用) |
| 1743 | 2610.12458 | OmniCapBench | 10-10 evening | multimodal | 无 |
| 1744 | 2610.11794 | Memento 3: Model-Based RSI via Reflective Rulebooks | 10-10 12:30 | agent | 邻接级承接(engineering 副 · Memory 第十六栖预备邻接第 1 例 · v3.56 morning NET-new 邻接承接级 · 沿用) |
| 1745 | 2610.12459 | WorldGuide | 10-10 evening | multimodal | 无 |
| 1746 | 2610.12448 | reViT | 10-10 evening | multimodal | 无 |
| 1747 | 2610.12183 | Agentic BBO | 10-10 12:30 | agent | 邻接级承接(evaluation 副 · 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例 · v3.55 沿用) |
| 1748 | 2610.11287 | REMORY: Residual Memory for Context Compaction | 10-10 12:30 | agent | 邻接级承接(Memory 第十五栖「残差记忆网络」预备邻接第 1 例 · v3.56 morning NET-new 邻接承接级 · 沿用) |
| 1749 | 2609.33987 | Opera: Verbal Critic | 10-11 12:30 | agent | 弱邻接(沿用 10-10 evening 立标延革预备承接) |
| 1750 | 2610.11169 | Skill Constellations | 10-11 12:30 | agent | 强邻接(Skill 供应链安全栖位预备第 1 例 + agent 安全栖位延伸稳态预备 · flyp 10-11 risk-e1prep 已锚 · v3.55 morning 沿用) |
| 1751 | 2606.03335 | Hebero: GPU-Parallel Multi-Task RL | 10-11 12:30 | evaluation | 邻接级(训练基础设施 vs 评测 · flyp 10-11 短审稿修正) |
| 1752 | 2609.35855 | Mara Chain | 10-11 12:30 | evaluation | 弱邻接(失败作为 stepping stones · flyp 10-11 risk-e1prep 弱邻接) |
| 1753 | 1511.00363 | BinaryConnect(老论文) | 10-11 12:30 | engineering | 历史沿用 |
| 1754 | 2610.09280 | Co-Evolved Communication 2D→3D | 10-11 12:30 | evaluation | 无 |
| 1755 | 2609.38527 | Behavioral Persistence Co-Evolved Comm | 10-11 12:30 | evaluation | 无 |
结论:llm-infra 主分类 net-new 真新卡 = 0 件(10-08 ~ 10-11 区间 = 24h 滑动窗口内)。1742 Foundations of LLMs 在 10-09 入池 · v3.55 morning 已锚(不是本窗口期新卡)。承接稳态期延续 · 真新卡断流第 2 日(10-10 与 10-11 均为承接稳态期)。
B. inbox 来源(近 2 天 · llm-infra 主题相关筛选)
| 来源 | 文件 | 时间 | llm-infra 关系 |
|---|---|---|---|
| inbox/jay | 2026-10-11-engineering-e1prep.md(10-11 11:22 · 16.1KB · engineering 主棒位) |
🟢 5 件主增量承接级 = AgentSysBench arXiv:2608.15127 178,799 session 实测 + Agent Memory 四足鼎立 + State-Bench Microsoft May 2026 + HarnessSQL arXiv:2610.12274 + Kiln on Trainium vs vLLM on H200 = 承接 v3.56 morning 全部 + arXiv:2608.15127 / 2610.12274 / 2610.12338 / 2610.12367 / 2610.06597 / 2605.19537 / 2609.23130 = 8 件工程主轴 paper_card 未建卡(P0 候选 prep 第 3 例 · stephen C18) |
|
| inbox/jay | 2026-10-11-agentic-systems-vector-db-mlops.md(10-11 09:36 · 10.9KB · AgentSysBench + Agent Memory + State-Bench 主源) |
🟢 承接级 AgentSysBench arXiv:2608.15127 详细 + Mem0/MemOS/Cognee/MemSearch + State-Bench + HarnessSQL + AgentSysBench sparse notes sparsenotes.com/posts/2026/08/papers/agentsysbench-agentic-workloads + MongoDB Agent Harness 二手转引 |
|
| inbox/jay | 2026-10-11T1050-jay-engineering-filter.md(10-11 10:50 · 11.6KB · 工程化筛选) |
🟢 承接级 Kiln on Trainium vs vLLM on H200 + Ollama vs vLLM vs SGLang 决策框架 + arXiv:2610.06597 "Agent Harnesses and Inference Engines Hear Each Other" OmniKV→vLLM + H2O 方案 + Chain reuse 49.8%→makespan 5.93h→2.42h 2.45× 加速 + BrowseComp-Plus 延迟 17.0s→14.9s 1.14× + Charles Frye 推理引擎调试方法论 | |
| inbox/jay | 2026-10-11-csdn-substack-inference-rag-highvalue.md(10-11 12:20 · 9.5KB · CSDN + Substack) |
🟡 5 件 CSDN + 5 件 Substack = SGLang vs vLLM Qwen3-27B + GLM-5.1 实测 + SGLang 2026 部署踩坑 + PagedAttention 原理 + kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" + Dennis Kennetz LLM Inference Curriculum | |
| inbox/jay | 2026-10-11-1001-rss-cool-papers.md(10-11 10:01 · 1.5KB · Cool Papers RSS) |
🟢 承接级 net-new = HarnessSQL arXiv:2610.12274 + VFold arXiv:2610.12338 + SGUID arXiv:2610.12367 = v3.56 morning 已锚 + 10-11 早棒承接级预备 |
|
| inbox/jay | 2026-10-11-1003-rss-lilian-weng.md(10-11 10:03) |
🟡 Lilian Weng Jul 2026 Harness Engineering & Self-Improvement(RSI 系统工程化 · 沿用) | |
| inbox/jay | 2026-10-11-1000-rss-bytebytego.md / 1001-rss-nathan-benaich.md / 1002-rss-cool-papers-ir.md / 1003-rss-msr-blog.md / 1004-rss-import-ai.md / 1004-rss-yt-fireship.md / 1004-rss-yt-karpathy.md |
🟡 全部沿用 9-10 月,无 llm-infra 净新增 | |
| inbox/jay | 2026-10-11T1105-database-backend-cloudnative-csdn.md(10-11 11:05) |
🟡 数据库 + 云原生 主轴,部分承接(BentoML 8.9K stars + FlashInfer 6.5K stars + KServe 6.1K stars + Cloud-OpsBench + AI-NativeBench) | |
| inbox/jay | 2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB · 工程化筛选续) |
🟢 承接级 = DSV4.1+Flash+DSPARK SGLang OOM Bug #43488/#43557/#43402/#43523 + DUAL-BLADE NVMe-direct KV cache 卸载 arXiv:2608.13867 + RPI+IBM KEEP KV-Cache 异构内存调度 2026 DAC + Winder.ai SGLang/vLLM/llama.cpp 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 + SGLang 自限速机制)+ antirez/ds4 DeepSeek V4 Flash 专用 21.9K stars C 单文件 Metal/CUDA/ROCm + Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE | |
| inbox/jay | 2026-10-11-1505-database-backend-cloudnative-csdn.md(10-11 15:05 · database/backend/cloud-native 二次过滤) |
🟡 数据库 + 云原生 + AI-NativeBench + BentoML/FlashInfer/KServe · 沿用 | |
| inbox/tom | 2026-10-11-0900-hf-daily-2026-10-11.md(10-11 09:00 · 1.7KB · 15 件立标) |
🟢 承接稳态第 11 日 = 沿用 10-10 早棒 10 件 + 新立 5 件(U-Space 33▲ / MC-Sparse 33▲ / TestPrism 30▲ / Memento 3 28▲ / Pumpire 15▲)+ llm-infra 主分直接命中 0 件(全部 multimodal / agent / engineering / evaluation 主分);承接 v3.55 evening + v3.56 morning 全部 11 件 | |
| inbox/tom | 2026-10-11-agent-rag-longcontext-radar.md(10-11 08:40 · 4.3KB · 3⭐ + 5 候选) |
🟢 承接级 = Opera + Skill Constellations + Mara Chain + Hebero + Is Memorization + Geometry Hierarchical Nav + Forms of LLM-Integrated Apps + Memento 3(8 件,沿用) | |
| inbox/tom | 2026-10-11-rag-e1prep.md / 2026-10-11-evaluation-e1prep.md |
🟡 RAG / evaluation 主轴,llm-infra 邻接级承接(ORCAGen / RAG 四轴分类法 / HNSW / Q-RAG) | |
| inbox/flyp | 2026-10-11-0950-flyP-critical-read-Hebero-RobotWorld-heterogeneous-robot-benchmark.md(10-11 09:50 · 17.2KB · Hebero 短审稿) |
🟡 multimodal 主轴,llm-infra 邻接级 · Hebero 训练范式 vs RobotWorld 评测范式二分 | |
| inbox/flyp | 2026-10-11-multimodal-e1prep.md(10-11 09:42 · 20.4KB) |
🟡 multimodal 主轴,立标群完全沿用态第 11 日 | |
| inbox/flyp | 2026-10-11-risk-e1prep.md(10-11 16:30 · 48KB · risk 主棒位) |
🟢 承接稳态续写 · R99 早棒 10-11 risk 主分 0 件 + risk 强邻接 2 件 = frontier lab 安全产品化稳态信号第 1 例 + Skill Constellations work-queue Top 15 第 2 承接 + 8 件工程主轴 paper_card 未建卡 P0 候选 prep 第 3 例 + Skill 安全栖位预备第 2 例 anchor | |
| inbox/flyp | 2026-10-11-1000-rss-cameron-wolfe.md / 1003-rss-interconnects.md |
🟡 沿用 RSS,工程方法学邻接级 | |
| inbox/spark | 2026-10-11-1001-rss-gradient-flow.md(10-11 10:01 · 1.5KB · 5 件沿用) |
🟡 Agent 安全栖位延伸稳态预备第 9 例周边 · llm-infra 邻接级 | |
| inbox/spark | 2026-10-11-1003-rss-chip-huyen.md(10-11 10:03 · 1.4KB · 5 件沿用) |
🟡 沿用 9-10 月,无 llm-infra 净新增 | |
| inbox/spark | 2026-10-11-agent-e1prep.md(10-11 13:35 · 52KB · spark agent 主棒位) |
🟢 承接级 = v115 agent.md 沿用 + 立标延革预备 99-142 例预备 + §3.1 #273 共识项全部承接(Memento 3 / Skill Constellations / REMORY / Forms of LLM-Integrated Apps / Mara Chain / Hebero / Opera / Agentic BBO / MiMo-V2.6) | |
| inbox/stephen | 2026-10-11-stephen-coordination-check-noon.md(10-11 12:45 · 52.9KB · 6 实例 14h 协调) |
🟢 承接级 · stephen noon coordination check 21 跨实例冲突(C1-C21)+ 20 跨实例新增候选(N1-N20)+ 8 件工程主轴 paper_card 未建卡 P0 候选 prep 第 3 例(C18) + stephen v71 §X.X 升档活文档候补 + 6 件必须人工确认 H1-H6(Hebero vs RobotWorld 范式二分闭合至 flyp 短审稿) | |
| inbox/stephen | 2026-10-11-ai-industry-e1prep.md(10-11 10:20 · 24.6KB · v2 直白风格 · 5 件主增量) |
🟢 承接级 = ① Memento 3 arXiv:2610.11794 frontier lab 级 agent 自我改进立标候选预备第 1 例(work-queue Top 15 连续两棒 #1)+ ② frontier lab 公告密度 10-6→10-11 连续 6 日回升 + ③ Skill Constellations arXiv:2610.11169 首个 AI Agent Skill 软件供应链研究(work-queue Top 15 第 2)+ ④ REMORY + galahad-kv agent 长上下文记忆压缩主轴双候选 + ⑤ Anthropic 安全/治理产品化密度首次超越模型发布 = frontier lab 治理公开化第三阶段跃迁信号 ⚠⚬⚬ + 8 件 P0 警示独立成节(P0-1 Memento 3 升档 / P0-2 公告密度周末 RSS 偏置 / P0-3 Anthropic 当日无新模型单日观察升档阶段跃迁风险 / P0-4 frontier lab 安全产品化四联商业模式跃迁叙事升档过快 / P0-5 agent 记忆三栖判断升档过快 / P0-6 Memento 3 自我改进三联预备稳定性待核 / P0-7 Hebero + ME-World 双主轴协同 / P0-8 OpenAI 商业化案例企业客户代表性待核) |
|
| inbox/stephen | 2026-10-11-0910-news-x-vip-radar.md / 2026-10-11-1004-news-{openai,anthropic,deepmind,google-ai,hf}-news.md / 2026-10-11-1005-news-{bens-bites,tldr-ai}-news.md |
🟡 X 雷达静默期第 5 日延续 + frontier lab 公告密度 6 日回升 · llm-infra 间接邻接 |
一、今日该主题最重要的增量(6 条)
增量 1 · 🟢 jay engineering 主棒位 5 件主增量承接 v3.56 morning · 工程主分类承接级扩增稳态第 2 例 ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-11-engineering-e1prep.md(10-11 11:22 · 16.1KB · jay · 主棒位)/shared/research-kb/inbox/jay/2026-10-11-agentic-systems-vector-db-mlops.md(10-11 09:36 · 10.9KB)/shared/research-kb/inbox/jay/2026-10-11T1050-jay-engineering-filter.md(10-11 10:50 · 11.6KB)/shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB · 二次过滤)- 关联:
/shared/research-kb/organized/knowledge/llm-infra.mdv3.56 morning(10-11 05:00) - arXiv:0 件 NET-new arXiv ID · 5 件承接级 arXiv 已全部在 v3.56 morning 锚入基线 + 8 件工程主轴 paper_card 未建卡(已记录 stephen C18 ⚠⚬⚬)
- 可信度:⭐⭐⭐⭐(jay engineering 主棒位 · v3.56 morning 5 件承接稳态精修预备级锚定承接 + inference.md 10-10 午 update 主动吸纳 + engineering.md v141 沿用 + jay 10-11 1105 + 1450 工程化二次过滤承接)
- 要点:
1. AgentSysBench
arXiv:2608.15127= 重新定义 Agentic Workload serving 成本模型(HKUST + Alibaba + ByteDance 联合研究 · 10 个真实 agentic 应用 + 178,799 session 实测 + 模型推理不再是主要成本中心 · sandbox/搜索/embedding/向量数据库操作在工具密集型应用中占主导 + 任务分解式 serving vs 共享组件延迟 -29-40% · 6 个区分属性) = 承接 v3.56 morning §1.(13) AI for Systems 五栖预备级 + AI Agent 优化推理系统 + Harness vs Scaffold 锚入补强第 N 例 ⚠⚬ · 与 R98 evening arXiv:2606.14589 Agent 生产静默失败 8 周实证(40 jobs + 8 providers + 5 类静默失败)协同 = Agentic serving 静默失败机制 + 成本模型重定义双栖预备 2. Agent Memory 基础设施四足鼎立(Mem0 drop-in production + MemOS 35.24% token 节省 GitHub 工程实践 + Cognee 图结构 memory + MemSearch Zilliz Markdown+Milvus user-owned/local-first 跨 Agent 共享) = Agent Memory 栖位扩稳态第 3 例 ⚠⚬⚬(spark 10-11 13:35 agent-e1prep 增量 4 已承接) 3. State-Bench Microsoft May 2026 = 450 企业任务 + memory 作为独立学习轨迹评测变量 + memory architecture 评测必须独立于 task quality 评测 = 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例 + Memory 评测栖位预备第 1 例 ⚠⚬ 4. HarnessSQLarXiv:2610.12274= Agent Harness 原生 SQL 训练 + Text-to-SQL 模型被训练为将问题直接映射为静态查询;真实数据库 Agent 通过有状态、多轮交互执行任务(两者 mismatch 导致生产 SQL Agent 效果差)+ HarnessSQL = 在 Agent harness 原生环境(真实数据库 + 多轮交互)中训练 SQL Agent,而非静态 SQL 数据集 = Agent 与 Serving 系统协同设计的具体路径——harness(编排层)与 serving(推理层)的 co-design = 承接 v3.56 morning §1.(11) Kernel/AI 自动化/Harness 锚入补强第 4 例 + §1.(13) AI for Systems 闭环锚入补强第 N 例 5. Kiln on Trainium vs vLLM on H200(Foil AI 2026-10-05 blog ·foxl.ai/blog/introducing-kiln)= Trainium (trn1.32xlarge) vs 8×H200 (p5en.48xlarge) 真实 benchmark + 并发 16/32/64 输出 tok/s + 每百万 token 成本 + 75% prefix 共享 prompt caching -58% 成本 + Trainium 成本 -73-75%(并发 16)但 TTFT 6.9s vs 634ms = 10.9× 劣势 = 多芯片推理引擎选型视野 ⚠⚬ 6. 8 件工程主轴 paper_card 未建卡 P0 候选 prep 第 3 例(stephen C18 ⚠⚬⚬) = AgentSysBench2608.15127+ Agent Memory 四足鼎立 + State-Bench + HarnessSQL2610.12274+ VFold2610.12338+ SGUID2610.12367+ Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving = 本日工程主轴最强增量但 paper_card 全部未建 = paper_card 富化缺口协同风险 + 建议 evening 棒位批量建卡 - 与活文档现有脉络的关系:
- 直接接续 v3.56 morning §IX 114 morning §1.(1) 推理引擎 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + §1.(13) AI for Systems 闭环 + §0.5 现状全景 6 件承接稳态精修预备级锚定承接
- 承接级补强级(非 NET-new):本杰 5 件增量全部为 v3.56 morning 沿用基线内的细化数据点 + 承接级新发布(AgentSysBench + State-Bench + HarnessSQL + Kiln on Trainium)
- 新增视角:AgentSysBench 178,799 session 实测 + HarnessSQL 跨主分协同设计 + Trainium 多芯片成本对比 = v3.56 morning §1.(1) 推理引擎方法学 + §1.(11) Kernel/AI 自动化/Harness + §1.(13) AI for Systems 闭环 三栖锚入补强
- 建议归入节:
- §1.(1) 推理引擎 → 在 vLLM/SGLang/TRT-LLM 三国 + Spheron H100 实测 + Winder.AI 5 引擎对比锚入后新增 "AgentSysBench
arXiv:2608.15127· 178,799 session 实测 · Agentic 场景模型推理不再是主要成本 · sandbox/embedding/vector DB 占主导 · disaggregated serving 延迟 -29-40% · 6 个区分属性 · AI Agent 优化推理系统第四栖预备" - §1.(1) 推理引擎 → 新增 "Kiln on Trainium vs vLLM on H200 · Trainium 成本 -73-75% 但 TTFT 6.9s vs 634ms · 75% prefix 共享 prompt caching -58% 成本 · AWS Trainium 推理引擎选型维度"
- §1.(11) Kernel/AI 自动化/Harness → 新增 "HarnessSQL
arXiv:2610.12274· Agent Harness 原生 SQL 训练 · 在真实数据库多轮交互 harness 中训练而非静态 SQL 数据集 · harness 与 serving 协同设计" - §1.(13) AI for Systems 闭环 → 新增 "State-Bench Microsoft May 2026 · 450 企业任务 · memory 独立评测栖预备第 1 例 · memory architecture 评测必须独立于 task quality 评测的方法论贡献"
- §1.(13) AI for Systems 闭环 → 新增 "Mem0/MemOS/Cognee/MemSearch Agent Memory 基础设施 4 件套 · MemOS 35.24% token 节省 · 自进化 memory OS 栖预备"
增量 2 · 🟡 arXiv:2610.06597 "Can Agent Harnesses and Inference Engines Hear Each Other?" OmniKV→vLLM + H2O 方案 ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-11T1050-jay-engineering-filter.md(10-11 10:50 · 11.6KB · jay 早棒工程筛选)- arXiv:
2610.06597https://arxiv.org/abs/2610.06597 - 可信度:⭐⭐⭐⭐(arXiv 学术论文 · jay 工程化二次过滤承接 + v3.56 morning 邻接级预备)
- 要点:
1. 核心问题:Agent harness(workflow 编排)与 inference engine(vLLM/SGLang)之间的 KV cache 复用协调问题
2. OmniKV → vLLM 链路:BrowseComp-Plus 延迟 17.0s → 14.9s = 1.14× 提升
3. H2O (Harness-aware Inference Engine) 方案效果显著:Chain reuse 49.8% → makespan 5.93h → 2.42h = 2.45× 加速
4. 与 v3.56 morning §1.(3) KV Cache 14+1+1 件体系化扩增 + §1.(11) Kernel/AI 自动化/Harness 锚入补强:直接接续 OSDI 2026 KV Cache Disaggregation "An Internet for the KV Cache"
arXiv:2608.01526+ vLLM×Mooncake 92.2% cache hit 受控实验 + Tesla/Red Hat/KServe prefix-cache-aware routing Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐 + 2× TTFT 改善 = harness-aware inference engine 是 KV Cache 持久化纪元 + Agent-Serving co-design 双栖预备的具体化案例 5. 承接级补强第 N 例(v3.56 morning 主棒位无 OmniKV/H2O 完整细节;jay 10-11 1050 承接级预备) - 与活文档现有脉络的关系:
- 承接 v3.56 morning §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 锚入补强
- 承接级补强第 5 例(非 NET-new arXiv ID;v3.55 evening / v3.56 morning 主棒位无 arXiv:2610.06597;jay 10-11 1050 工程化二次过滤承接级预备)
- 建议归入节:
- §1.(3) KV Cache → arXiv:2610.06597 "Can Agent Harnesses and Inference Engines Hear Each Other?" OmniKV→vLLM + H2O 方案 · BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速 · harness-aware inference engine 预备第 1 例承接稳态精修预备级锚入
- §1.(11) Kernel/AI 自动化/Harness → 同步锚入
增量 3 · 🟡 Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE 混合架构(jay 10-11 1450 工程化二次过滤承接)⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB)/shared/research-kb/inbox/jay/2026-10-11T1935-jay-evening-briefing-github-hf-openmodels.md(10-11 19:35 · evening briefing · 事后承接参考 · cron 18:40 视角下不可见)- arXiv:无(transformers v5.16.0 官方文档 + HF Blog)
- 可信度:⭐⭐⭐⭐(Hugging Face 官方文档 transformers v5.16.0 · Qwen 官方 X 公告 · Qwen4 尚未发布(Apsara Conference 2026-09-22 确认 in training))
- 要点:
1. GatedResidual(GR):结合 Hyper-Connection + GatedNorm + 4 分支残差流在每次 attention 和 MoE block 前通过细粒度 elementwise gating 混合 + 动态控制 block 输出注入各残差流的比例
2. Qwen Sparse Attention(QSA):多 query head 对压缩的 key blocks 打分 + 选择最相关的连续 token blocks + 保留不完整的尾部 block 不压缩 + block-level 选择减少索引开销 + 首次实现 linear + sparse attention 混合架构
3. QSA 性能:1M token context 下 prefill 快 7.6×,decode 快 4.9× + 90% prefix-cache hit 场景 prefill 吞吐是 Qwen3.7-Plus 的 8.6×
4. Per-Layer Embedding(PLE):从 hashed token n-grams 和 dilated depthwise convolution 提取层特定词法特征
5. Qwen3.8-Flash-Next 规格(Qwen4 架构实验性预览):125B MoE backbone + 6B active/token + 51B n-gram embedding + 4B MTP ≈ 180B + Muon optimizer(与 AdamW 分工)+ 训练成本约为 Qwen3.7-Plus 的 1/9
6. 承接 v3.56 morning §1.(1) 推理引擎方法学 + §1.(6) 长上下文:QSA = Qwen 实验室级长上下文推理效率创新;与 v3.55 morning SparseEngine
arXiv:2609.3906813▲ HF Daily 10-10 + 2.5× decode vs vLLM Vanilla 协同形成「SparseEngine + QSA」稀疏推理引擎纪元双栖预备 - 与活文档现有脉络的关系:
- 直接接续 v3.56 morning §1.(1) 推理引擎方法学 + §1.(6) 长上下文 + SparseEngine 锚入补强
- 承接级补强第 N 例(非 NET-new arXiv ID · 实验室级架构创新 + Qwen 官方 transformers v5.16.0 已支持 · v3.55 evening / v3.56 morning 主棒位无 Qwen4-Exp QSA;jay 10-11 1450 承接级预备 + evening briefing 19:35 承接延续)
- 建议归入节:
- §1.(1) 推理引擎 → Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE 混合架构 + Qwen3.8-Flash-Next 180B MoE 架构预览 · transformers v5.16.0 官方支持 · 长上下文推理效率创新 + SparseEngine 双栖稀疏推理引擎纪元
- §1.(6) 长上下文 → QSA 承接稳态精修预备级锚入
增量 4 · 🟡 antirez/ds4 DeepSeek V4 Flash 专用推理引擎 21.9K stars C 单文件 Metal/CUDA/ROCm 三后端 ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB)/shared/research-kb/inbox/jay/2026-10-11T1935-jay-evening-briefing-github-hf-openmodels.md(10-11 19:35 · evening briefing · 事后承接参考)- URL:
https://github.com/antirez/ds4 - 可信度:⭐⭐⭐⭐(Redis 作者 Salvatore Sanfilippo(antirez)工程声誉极高 + 21.9K stars + 完整工程化文档 AGENT.md/QA_BEFORE_RELEASES.md/MODEL_CARD.md + MIT License)
- 要点: 1. 核心定位:single-purpose 推理引擎 —— 只跑 DeepSeek V4 Flash / PRO,不支持其他模型 + 对比 llama.cpp 的 generalism,ds4 走"一个模型跑透"深度优化路线 2. 技术细节:C 单文件(ds4.c)+ 零外部依赖 + 后端 Metal(Apple M 系列统一内存)/ CUDA(NVIDIA)/ ROCm(AMD)三端原生 3. 实测性能:Mac M5 Max 460 prompt tok/s prefill / 39 tok/s decode + M4 Max FP16 @ 460 tok/s prefill + DGX Spark GB10 vLLM fork 52 tok/s(DeepSeek V4 Flash 0731 full 256 experts) 4. 量化方案:混合精度 IQ2_XXS routed experts gate/up + Q2_K down + FP8 E4M3 dense/attention + BF16 embeddings 5. 协议:OpenAI 兼容 API + 1M token context + thinking mode + 已支持 Claude Code 等 coding agent 直接调用本地 endpoint 6. 承接 v3.55 morning vllm.cpp mudler C++ 推理引擎 1:1 vLLM 兼容 + ROCm AMD gfx1151 零 CPU fallback:ds4 = C 推理引擎 single-purpose 新维度 · 与 vllm.cpp 形成「C++/C 双后端 + 多硬件后端 + 通用/专用双栖」预备级 7. 承接 v3.55 morning Colibri 纯 C MoE 744B GLM-5.2 25GB RAM 消费级:ds4 = C 单文件推理引擎第二例(Colibri 纯 C + ds4 C 单文件)
- 与活文档现有脉络的关系:
- 承接 v3.56 morning §1.(1) 推理引擎方法学 + vllm.cpp mudler C++ 推理引擎 1:1 vLLM 兼容 + ROCm AMD gfx1151 零 CPU fallback 锚入补强
- 承接级补强第 6 例(v3.55 evening / v3.56 morning 主棒位无 antirez/ds4;jay 10-11 1450 + 19:35 承接级预备)
- 建议归入节:
- §1.(1) 推理引擎 → antirez/ds4 DeepSeek V4 Flash 专用 21.9K stars C 单文件 Metal/CUDA/ROCm 三后端 · Mac M5 Max 460 tok/s prefill / 39 tok/s decode · 1M context · OpenAI 兼容 · Claude Code 已集成 · 与 vllm.cpp 形成「C++/C 双后端 + 多硬件后端 + 通用/专用双栖」
增量 5 · 🟡 Winder.ai SGLang vs vLLM vs llama.cpp 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 + SGLang 自限速机制)+ SGLang 2026-10 Bug 集中 ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-11T1450-jay-engineering-filter.md(10-11 14:50 · 14.4KB)- URL:
- Winder.ai:SGLang vs vLLM vs llama.cpp 2026-09 采集实测(Qwen3.8-27B H100)
- SGLang GitHub Issues #43488 / #43557 / #43402 / #43523(2026-10 Bug 集中)
- 可信度:⭐⭐⭐⭐(Winder.ai 工程实测 + SGLang 官方 GitHub Issues · 承接 v3.56 morning §1.(1) 推理引擎锚入补强第 N 例)
- 要点:
1. Winder.ai 实测数据(2026-09 采集,Qwen3.8-27B H100):SGLang 0.5.20 @ 50 并发 1,725 tok/s $0.56/M tokens + vLLM 0.30.0 @ 50 并发 1,610 tok/s $0.60/M tokens + llama.cpp 50 并发下性能断崖 138 → 97 tok/s(混合模型场景每次重处理完整 prompt)
2. SGLang 自限速机制:
caps its own concurrency to fit its state cache—— 仅日志提示,不在 API 层暴露 = 工程隐患(客户端无法控制并发度 = 不可预测的服务质量) 3. SGLang 2026-10 Bug 集中:#43488 DSV4.1+Flash+DSPARK CUDA OOM 崩溃(每 15-25 分钟复现 · KV pool 仅用 29% · CUDA allocator 问题非 KV pool 泄漏)+ #43557 PD disaggregation 模式切换 illegal memory access + #43523 multimodal transport slice 队列 abort 泄漏 + #43402 DeepSeekV3Detector streaming 两个工具调用同一 increment 到达时第一个静默丢弃 4. 承接 v3.56 morning §1.(1) 推理引擎方法学 + SGLang 400K GPU 生产规模 + SGLang vs vLLM 跨源三确认:Winder.ai 实测 = SGLang 0.5.20 vs vLLM 0.30.0 实测第 4 件 + SGLang 自限速机制工程隐患预备第 1 例 + SGLang 10 月 Bug 集中工程稳定性预备级第 1 例 - 与活文档现有脉络的关系:
- 承接 v3.56 morning §1.(1) 推理引擎方法学 + Spheron H100 三引擎实测 + Winder.AI 5 引擎对比 + SGLang 400K GPU 生产规模锚入补强
- 承接级补强第 7 例(v3.55 evening / v3.56 morning 主棒位无 SGLang 自限速机制 + 10 月 Bug 集中;jay 10-11 1450 承接级预备)
- 建议归入节:
- §1.(1) 推理引擎 → Winder.ai SGLang 0.5.20 vs vLLM 0.30.0 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 · $0.56 vs $0.60/M tokens · 2026-09 采集 · Qwen3.8-27B H100)+ SGLang 自限速机制工程隐患预备第 1 例
- §1.(1) 推理引擎 → SGLang 2026-10 Bug 集中 #43488 / #43557 / #43402 / #43523(DSV4.1+Flash+DSPARK CUDA OOM 15-25 分钟复现 · PD disagg illegal memory access · multimodal slice 队列 abort 泄漏 · streaming 静默丢弃)· SGLang 工程稳定性预备级第 1 例
增量 6 · 🟡 阿里云函数计算 SGLang vs vLLM 实测数据点 + kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" ⚠⚬(承接级细化)
- 来源:
/shared/research-kb/inbox/jay/2026-10-11-csdn-substack-inference-rag-highvalue.md(10-11 12:20 · 9.5KB)- 关联:
/shared/research-kb/organized/knowledge/llm-infra.mdv3.56 morning(10-11 05:00) - URL:
- kenhuang 10 章 MoE 2026 系列:
https://kenhuangus.substack.com/p/announcing-the-10-part-series-the - Pragmatic Engineer "What is Inference Engineering":
https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering - System Design Nuggets Arslan Ahmad:
https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching - Dennis Kennetz LLM Inference Curriculum:
https://dkennetz.substack.com/p/llm-inference-curriculum - Pawan K Jha Architecting LLM Inference Part 1:
https://pawankjha.substack.com/p/architecting-llm-inference-part-1 - SitePoint vLLM Production Deployment Guide 2026(沿用):
https://www.sitepoint.com/vllm-production-deployment-guide-2026 - Spheron H100 三引擎实测 + vLLM vs SGLang vs TGI(沿用):
https://www.spheron.network/blog/vllm-vs-sglang-2026 - 可信度:⭐⭐⭐(CSDN 阿里云函数计算实测 + Substack 5 件高质量 Newsletter · 承接级细化)
- 要点: 1. kenhuang 10 章 MoE 2026 系列(物理 + 工程前沿 LLM 推理):MoE 架构 DeepSeek-V4-Pro 1.6T 总参数 / 49B 激活参数 + 256 路由专家 + 1 共享专家 + 2026 生产架构栈 = API Gateway → Semantic Router → Prefix Caching Cluster → Disaggregated P/D Nodes → HW Monitoring + Edge SLM MLX/Metal + 骁龙 X Elite NPU + WebGPU/ONNX Runtime 2. Pragmatic Engineer "What is Inference Engineering"(Gergely Orosz · 沿用 v3.55 evening jay 10-10 1335):2026 年推理工程正在普及(开源模型崛起 + Cursor 基于 Kimi 2.5 构建 Composer 2.0)+ decode 阶段内存带宽瓶颈 + 低到中等 batch size 下计算资源闲置 + 闭源模型推理工程只服务于几千名 AI 工程师;开源模型让更多公司能定制优化 = Inference Engineering 子学科预备扩增第 1 例(v3.55 evening 沿用 + 工程化完成级预备) 3. Dennis Kennetz LLM Inference Curriculum:多节点推理 topology + RDMA + placement + tail latency + storage + 核心思维转变 = 不是"学习 LLM 推理",而是"学习规模化下瓶颈如何迁移" + Build small, throw it away, build the next thing = 多节点推理工程课程体系化预备级第 1 例 4. System Design Nuggets Arslan Ahmad LLM Inference at Scale:continuous batching 机制(请求完成即退出,新请求立即补位,保持硬件满载)+ decode 阶段内存带宽瓶颈(memory bandwidth bottleneck)+ 面向 2026 年生产级 AI 系统工程师 5. Pawan K Jha Architecting LLM Inference Part 1:从用户 prompt 到最终 token 输出的端到端架构完整心智模型 + Token 生成、内存管理、GPU 执行、生产架构 6. 承接 v3.55 evening jay 10-10 1335 + v3.56 morning §1.(1) 推理引擎方法学 + §1.(13) AI for Systems 五栖预备级:5 件 Substack = 推理工程化完成级叙事预备级扩增第 5 例 · 5 件跨主文档追踪预备(Pragmatic Engineer + Dennis Kennetz + System Design Nuggets + Pawan K Jha + kenhuang)
- 与活文档现有脉络的关系:
- 承接 v3.56 morning §1.(1) 推理引擎方法学 + §1.(13) AI for Systems 五栖预备级 + 推理工程学科化(Loop Engineering 学科化 2026 H2 成熟)锚入补强
- 承接级细化第 N 例(v3.55 evening 已锚 Gergely Orosz "What is Inference Engineering" + jay 10-10 1335;jay 10-11 1220 承接 4 件 Substack 续立)
- 建议归入节:
- §1.(1) 推理引擎 → 推理工程学科化 + 5 件 Substack 跨主文档追踪预备(kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" + Dennis Kennetz LLM Inference Curriculum + System Design Nuggets LLM Inference at Scale + Pawan K Jha Architecting LLM Inference Part 1)
二、值得警惕的矛盾 / 待核实说法(沿用 v3.56 morning D255-D258)
⚠ 本窗口期值得警惕的矛盾 = 6 件 v3.56 morning 已锚定 + 2 件承接稳态期内细化不足 + 4 件承接稳态期新发现:
矛盾 1 · galahad-kv arXiv:2610.10845 NVMe 持久化在生产环境安全验证 ⚠⚬⚬(沿用 D249)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚;周日低活动度)
- 来源:v3.56 morning §3 D249 + flyp 10-11 risk-e1prep R99 沿用
- 争议焦点:galahad-kv NVMe 持久化在生产环境安全验证 + 加密存储开销 vs 收益 + 多用户并发访问一致性 + 与 vLLM Production Stack LMCache KV 跨实例共享的协同
- 本棒位判断:沿用 D249 · 截止 10-13 morning 棒前 · 不升档
矛盾 2 · Cascadia arXiv:2610.07219 消费级 975B MoE 部署稳定性 ⚠⚬⚬(沿用 D250)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D250 + flyp 10-11 risk-e1prep 沿用
- 争议焦点:Cascadia 消费级 MoE 部署在真实生产环境的稳定性 + 复现 artifact 在 NVIDIA H100/200 + AMD MI300 + 国产 GPU 跨平台验证 · preprint 阶段精度数据待 peer review 验证
- 本棒位判断:沿用 D250 · 截止 10-13 morning 棒前 · 不升档
矛盾 3 · SpecScale arXiv:2609.39334 H100/B200 生产实测 ⚠⚬⚬(沿用 D251)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D251 + flyp 10-11 risk-e1prep 沿用
- 争议焦点:SpecScale H100/B200 + vLLM/SGLang 生产环境实测 + 与 EAGLE-3 + DFlash2 + Spec V2 在不同 workload 的临界条件
- 本棒位判断:沿用 D251 · 截止 10-13 morning 棒前 · 不升档
矛盾 4 · STEPQuant arXiv:2609.38169 循环状态量化生产引擎稳定性 ⚠⚬⚬(沿用 D252)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D252 + flyp 10-11 risk-e1prep 沿用
- 争议焦点:STEPQuant 循环状态量化失败模式在生产推理引擎的稳定性 + 与 FP8 KV-cache + MXFP8 + NVFP4 跨平台 ROI 评估
- 本棒位判断:沿用 D252 · 截止 10-13 morning 棒前 · 不升档
矛盾 5 · vLLM→llm-d→控制平面演化综述 arXiv:2609.23130 引用数据独立验证 ⚠⚬⚬(沿用 D253)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D253 + flyp 10-11 risk-e1prep 沿用 + jay 10-11 1050 工程化二次过滤承接(
arXiv:2610.06597与2609.23130形成「harness-aware inference engine + 推理控制平面演化叙事」双栖) - 争议焦点:vLLM→llm-d→控制平面演化综述引用数据来自生产报告(Tesla/Red Hat/KServe)条件受限,需独立验证 + 与 NVIDIA Dynamo v1.5.0 Feature Matrix 对比
- 本棒位判断:沿用 D253 · 截止 10-13 morning 棒前 · 不升档
矛盾 6 · MLPerf Inference v6.1 9 月 30 日发布数据 ⚠⚬(沿用 D254)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D254 + flyp 10-11 risk-e1prep 沿用
- 争议焦点:MLPerf Inference v6.1 9 月 30 日发布数据与 v6.0 B200 8 卡基线对比 + gpt-oss-120b Server 8 卡 vs 8+ 卡多 GPU 配置的可外推性 + Edge Agentic test 在生产环境的稳定性
- 本棒位判断:沿用 D254 · 截止 10-13 morning 棒前 · 不升档
矛盾 7 · vLLM×Mooncake 92.2% cache hit 受控实验 vs Tesla/Red Hat/KServe 生产报告条件区分 ⚠⚬⚬(沿用 D255)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚;周日低活动度)
- 来源:v3.56 morning §3 D255
- 争议焦点:vLLM×Mooncake 92.2% cache hit + 3.8× 吞吐 + 46× TTFT 降低(arXiv:2609.23130 受控实验条件)与 Oct 9 Tesla/Red Hat/KServe ~3× throughput 2× TTFT(同 arXiv:2609.23130 生产报告条件)在同一语境下引用需明确区分「受控实验条件」vs「生产报告条件」避免误导性比较
- 本棒位判断:沿用 D255 · 截止 10-13 morning 棒前 · 不升档
矛盾 8 · SparseEngine arXiv:2609.39068 跨平台实测 + 与 vLLM/SGLang 主流 dense engines 在不同 workload 临界条件 ⚠⚬⚬(沿用 D256)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D256 + jay 10-11 1450 Qwen4-Exp QSA + Qwen 实验室级 sparse + linear attention 混合架构形成「SparseEngine + QSA」稀疏推理引擎纪元双栖预备
- 争议焦点:SparseEngine 跨平台实测(短上下文/长上下文/agentic workflow 临界条件)与 vLLM/SGLang 主流 dense engines 在不同 workload 的临界条件
- 本棒位判断:沿用 D256 · 截止 10-13 morning 棒前 · 不升档
矛盾 9 · VFold arXiv:2610.12338 与 MiniCache + 现有 KV cache 量化方法复合在生产推理引擎实测 ⚠⚬⚬(沿用 D257)
- 本窗口期新增证据:0 件新证据(v3.56 morning 已锚)
- 来源:v3.56 morning §3 D257 + jay 10-11 1001-rss-cool-papers VFold 沿用承接
- 争议焦点:VFold 与 MiniCache + 现有 KV cache 量化方法(FP8 KV/NVFP4)复合在生产推理引擎 vLLM/SGLang/TRT-LLM 的实测
- 本棒位判断:沿用 D257 · 截止 10-13 morning 棒前 · 不升档
矛盾 10 · HarnessSQL arXiv:2610.12274 编号 web search 未验证确认 ⚠⚬(沿用 D258)
- 本窗口期新增证据:1 件新证据(jay 10-11 1001-rss-cool-papers 已收录)
- 来源:v3.56 morning §3 D258 + jay 10-11 1001-rss-cool-papers(HarnessSQL 10-11 早棒 RSS Cool Papers 已收录 = web search 验证完成)
- 争议焦点:HarnessSQL
arXiv:2610.12274编号 web search 未验证确认(已 10-11 早棒 Cool Papers RSS 验证完成) - 本棒位判断:闭合 D258 · HarnessSQL
arXiv:2610.12274Cool Papers RSS 已收录 + jay 10-11 1001-rss-cool-papers 二次确认 = 编号验证完成 · 等 evening / morning 棒位精读 arXiv abstract 升级为承接级正式立标
矛盾 11 · 8 件工程主轴 paper_card 未建卡 = paper_card 富化缺口协同风险 ⚠⚬⚬(stephen C18 · P0 候选 prep 第 3 例)
- 本窗口期新增证据:8 件工程主轴 paper_card 全部未建卡(AgentSysBench
2608.15127+ Agent Memory 四足鼎立 + State-Bench + HarnessSQL2610.12274+ VFold2610.12338+ SGUID2610.12367+ Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving) - 来源:stephen 10-11 noon coordination C18 + flyp 10-11 risk-e1prep P0 候选 prep 第 3 例 + jay 10-11 11:22 engineering-e1prep 5 件主增量 + jay 10-11 12:20 csdn-substack-inference
- 争议焦点:本日工程主轴最强增量但 paper_card 全部未建 = paper_card 富化缺口协同风险(work-queue 富化缺口 = 15 张卡缺 TLDR 待 cron_s2 覆盖沿用)
- 本棒位判断:建议 evening 棒位批量建卡(Q178 P1 + stephen C18)
矛盾 12 · stephen v71 §X.X 升档活文档候补条目的升档节奏判定 ⚠⚬⚬(stephen C2-C6)
- 本窗口期新增证据:6 件必须人工确认问题(stephen H1-H6)
- H1:Hebero vs RobotWorld 范式二分(→ 已闭合至 flyp 10-11 0950 短审稿)
- H2:Anthropic 第三阶段跃迁叙事是否承接为"概念预备级"而非阶段跃迁(→ stephen P0-3 ⚠⚬⚬)
- H3:frontier lab 安全产品化四联是否承接为"概念预备级"(→ stephen P0-4 ⚠⚬⚬)
- H4:agent 记忆三栖判断是否承接为"双候选"而非"三栖"(→ stephen P0-5 ⚠⚬⚬)
- H5:8 件 paper_card 未建卡批量补建(AgentSysBench + Agent Memory + State-Bench + HarnessSQL + VFold + SGUID + Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving)
- H6:spark 周日早棒无主棒位 e1prep 是否需启动反思棒位(→ 本棒位承接)
- 来源:stephen 10-11 noon coordination check H1-H6 + stephen 10-11 ai-industry P0-3 / P0-4 / P0-5
- 争议焦点:6 件必须人工确认问题 = 升档节奏判定(Anthropic 第三阶段跃迁叙事 + frontier lab 安全产品化四联 + agent 记忆三栖判断 + 8 件 paper_card 批量补建)
- 本棒位判断:建议承接为"概念预备级"(stephen P0-3 / P0-4 / P0-5 自承)+ 8 件 paper_card 批量补建建议 evening 棒位
三、v3.56 morning 沿用稳态项复盘(本棒位重新确认)
⚠ 本窗口期 v3.56 morning 全部 4 NET-new arXiv ID + 6 NET-new URL + 4 矛盾续写 D255-D258 + C357-C358 + O569-O576 + P0 #289 + P0-10 = 全部沿用稳态,无新增突破:
沿用稳态项 1 · galahad-kv arXiv:2610.10845 50M Token NVMe 持久化 ⭐⭐⭐⭐
- v3.56 状态:KV Cache 持久化纪元 + Memory-as-a-Layer 范式预备级第 1 例 · 100/100 探测块 byte-exact 加密 NVMe 加载无重计算
- 本棒位新增:0 件新证据(v3.56 morning 已锚;周日低活动度)
- 承接路径:§1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + Memory 第十四栖「NVMe 持久化 Memory」预备第 1 例
沿用稳态项 2 · Foundations of LLMs arXiv:2501.09223 教科书承接级 ⭐⭐⭐
- v3.56 状态:教科书承接级备查资源预备第 N 例 · 第六章"inference" + 第六章"reasoning"
- 本棒位新增:0 件新证据(v3.56 morning 已锚 · paper_card 1742 10-09 入池沿用)
- 承接路径:§1.(1) 推理引擎方法学 + §1.(6) 长上下文承接级备查资源
沿用稳态项 3 · SparseEngine arXiv:2609.39068 13▲ HF Daily 稀疏优先推理引擎 ⭐⭐⭐⭐
- v3.56 状态:SparseEngine 稀疏推理纪元预备级第 1 例 + 2.5× decode vs vLLM Vanilla + Apache 2.0
- 本棒位新增:2 件承接级预备(① Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context · 90% prefix-cache hit 8.6× prefill · GatedResidual + PLE + Muon optimizer · 「SparseEngine + QSA」稀疏推理引擎纪元双栖预备 ② Winder.ai SGLang/vLLM 实测中 SGLang 自限速机制工程隐患预备第 1 例)
- 承接路径:§1.(1) 推理引擎 → SparseEngine 稀疏推理纪元预备级第 1 例 + 与 Qwen4-Exp QSA 双栖
沿用稳态项 4 · VFold arXiv:2610.12338 跨层 Value Cache 压缩 ⭐⭐⭐
- v3.56 状态:KV Cache 跨族压缩预备级第 N 例 · 75% value cache reduction k=4 + 与量化+key cache-only methods 复合
- 本棒位新增:0 件新证据(v3.56 morning 已锚;jay 10-11 1001-rss-cool-papers 沿用)
- 承接路径:§1.(3) KV Cache + §1.(4) 量化承接稳态精修预备级锚入
沿用稳态项 5 · Memento 3 arXiv:2610.11794 反射式规则手册自我改进栖位扩稳态第 12 例 ⭐⭐⭐⭐
- v3.56 状态:paper_card 1744 + work-queue Top 15 #1(连续两棒)+ Memory 第十六栖「反射式规则手册」预备邻接第 1 例 · Self-Controlled-RSI 范式
- 本棒位新增:work-queue Top 15 #1 连续两棒 = frontier lab 级 agent 自我改进主轴立标候选预备第 1 例(stephen 10-11 ai-industry v2 增量 1 · flyp 10-11 risk-e1prep 沿用)
- 承接路径:§1.(11) Kernel/AI 自动化/Harness → 反射式规则手册自我改进栖位扩稳态第 12 例承接稳态精修预备级锚入
沿用稳态项 6 · REMORY arXiv:2610.11287 Memory 第十五栖「残差记忆网络」预备邻接第 1 例 ⭐⭐⭐⭐
- v3.56 状态:paper_card 1748 + soft memory tokens + residual connection 沿序列维度类比 + bounded sequence of soft memory tokens + SummHay 提升
- 本棒位新增:0 件新证据(v3.56 morning 已锚;stephen 10-11 ai-industry v2 增量 4 沿用)
- 承接路径:§1.(11) Kernel/AI 自动化/Harness + Memory 第十五栖「残差记忆网络」预备邻接第 1 例
沿用稳态项 7 · HarnessSQL arXiv:2610.12274 Harness 原生 SQL Agent 训练 ⚠⚬
- v3.56 状态:Harness 原生 SQL Agent 训练预备级第 1 例 + Agent 与 Serving 系统协同设计 · D258 web search 未验证确认
- 本棒位新增:D258 闭合 · Cool Papers RSS 已收录 + jay 10-11 1001-rss-cool-papers 二次确认
- 承接路径:§1.(11) Kernel/AI 自动化/Harness → Harness 原生 SQL Agent 训练承接稳态精修预备级锚入(D258 闭合)
沿用稳态项 8 · OSDI 2026 KV Cache Disaggregation arXiv:2608.01526 "An Internet for the KV Cache" ⚠⚬
- v3.56 状态:KV Cache 正从"推理优化技巧"演变为存储/通信/调度基础原语 · 跨模型共享 + 持久化存储 + 跨引擎暴露接口
- 本棒位新增:2 件承接级预备(① arXiv:2610.06597 OmniKV→vLLM + H2O 方案 BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速 ② Winder.ai SGLang 0.5.20 vs vLLM 0.30.0 实测 + SGLang 10 月 Bug 集中)
- 承接路径:§1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + Harness vs Scaffold 四层定义(沿用)
沿用稳态项 9 · MLPerf Inference v6.1 9 月 30 日发布 ⭐⭐⭐⭐⭐
- v3.56 状态:5.7× 单加速器 + 16/30 submitters API-centric + Edge Agentic test VLM-Interactive gpt-oss DeepSeek-R1 Llama 3.1-8B text-to-video
- 本棒位新增:0 件新证据(v3.56 morning 已锚)
- 承接路径:§1.(13) AI for Systems 闭环 + 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖预备级
沿用稳态项 10 · 6 件承接稳态精修预备级锚定承接 + 4 矛盾续写 D255-D258 + C357-C358 候选预备级 + O569-O576 + P0 #289 + P0-10
- v3.56 状态:承接稳态期延续预备级 · 4 矛盾续写全部沿用
- 本棒位新增:0 件新证据(v3.56 morning 已锚)
四、可引用的 arXiv 号列表(本棒位新增或承接级锚入)
4.1 NET-new arXiv ID(0 件)
本窗口期 NET-new arXiv ID = 0 件 · 24h 滑动窗口内(2026-10-10 18:40 → 2026-10-11 18:40)无 NET-new arXiv ID 入池 · 承接 v3.56 morning 465→469 沿用基线(周六低活动度 + 周日无新立)
4.2 承接稳态精修预备级锚入 arXiv ID(本棒位承接级预备)
| arXiv ID | 标题 | 承接路径 |
|---|---|---|
2610.06597 |
Can Agent Harnesses and Inference Engines Hear Each Other? OmniKV→vLLM + H2O 方案(jay 10-11 1050 · BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速) | §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 承接稳态精修预备级锚入(harness-aware inference engine 预备第 1 例) |
2608.15127 |
AgentSysBench · 178,799 session 实测 · Agentic 场景模型推理不再是主要成本(jay 10-11 11:22 · HKUST + Alibaba + ByteDance) | §1.(1) 推理引擎 + §1.(13) AI for Systems 闭环承接稳态精修预备级锚入(disaggregated serving 延迟 -29-40% · 6 个区分属性) |
2610.12274 |
HarnessSQL · Agent Harness 原生 SQL 训练(D258 闭合 · Cool Papers RSS 已收录) | §1.(11) Kernel/AI 自动化/Harness 承接稳态精修预备级锚入(D258 闭合) |
4.3 承接级邻接 arXiv ID(非 llm-infra 主分类,邻接级承接)
| arXiv ID | 标题 | 主分类 | 邻接承接路径 |
|---|---|---|---|
2610.11794 |
Memento 3 · Model-Based RSI via Reflective Rulebooks | agent · engineering 副 | §1.(11) Kernel/AI 自动化/Harness · Memory 第十六栖预备邻接第 1 例(work-queue Top 15 #1 连续两棒) |
2610.11287 |
REMORY · Residual Memory for Context Compaction | agent | §1.(11) Kernel/AI 自动化/Harness · Memory 第十五栖「残差记忆网络」预备邻接第 1 例 |
2610.12183 |
Agentic BBO · Benchmarking LLM Agents for BBO | agent · evaluation 副 | §1.(13) AI for Systems 闭环 · 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例 |
2610.11169 |
Skill Constellations · Tracing the Supply Chain of Agent Skills on GitHub | agent | §1.(11) Kernel/AI 自动化/Harness · Skill 供应链安全栖位预备第 1 例 + Agent 安全栖位延伸稳态预备(work-queue Top 15 第 2) |
2610.11959 |
MiMo-V2.6 · Scaling RL Towards Self-Improvement | engineering | §1.(8) 训练 · RL scaling 基础设施 + hybrid-SWA 架构 + 异步训练 65▲ HF Daily 10-11 |
4.4 v3.56 morning 已锚入基线 arXiv ID(沿用稳态,本棒位未变动)
| arXiv ID | 标题 | v3.56 承接路径 |
|---|---|---|
2610.10845 |
galahad-kv · 50M Token NVMe 持久化 ⭐⭐⭐⭐ | §1.(3) KV Cache + §1.(11) · Memory 第十四栖 |
2501.09223 |
Foundations of LLMs 教科书承接级 ⭐⭐⭐ | §1.(1) 推理引擎方法学 + §1.(6) 长上下文承接级备查资源 |
2610.07219 |
Cascadia · 消费级 975B MoE ⭐⭐⭐⭐ | §1.(10) MoE 推理 + §1.(13) AI for Systems |
2609.39334 |
SpecScale · test-time scaling 投机解码 ⭐⭐⭐⭐ | §1.(5) 投机解码 + §1.(1) 推理引擎方法学 |
2609.23130 |
vLLM→llm-d→控制平面演化综述 ⭐⭐⭐⭐⭐ | §1.(1) 推理引擎方法学 + 推理控制平面演化叙事 |
2609.38169 |
STEPQuant · 100▲ HF Daily 量化失败模式 ⭐⭐⭐ | §1.(4) 量化 + §1.(1) 推理引擎方法学 |
2609.39068 |
SparseEngine · 13▲ HF Daily 10-10 稀疏优先推理引擎 ⭐⭐⭐⭐ | §1.(1) 推理引擎 → SparseEngine 稀疏推理纪元预备级第 1 例 + 与 Qwen4-Exp QSA 双栖 |
2610.12338 |
VFold · 跨层 Value Cache 压缩 ⭐⭐⭐ | §1.(3) KV Cache + §1.(4) 量化承接稳态精修预备级锚入 |
2608.01526 |
OSDI 2026 KV Cache Disaggregation "An Internet for the KV Cache" | §1.(3) KV Cache + §1.(11) Harness vs Scaffold |
五、本棒位综合判断
5.1 增量密度评估
- 本日增量密度 = 低(承接稳态期 + 周日低活动度)
- NET-new arXiv ID = 0 件(24h 滑动窗口内无 NET-new)
- NET-new paper_card llm-infra 主分类 = 0 件(10-11 morning paper_cards 1740-1755 共 16 件全部为 agent/multimodal/engineering/evaluation 主分类;0 件 llm-infra 主分类真新卡)
- 承接稳态精修预备级锚入 = 3 件(arXiv:2610.06597 OmniKV→vLLM + arXiv:2608.15127 AgentSysBench + arXiv:2610.12274 HarnessSQL D258 闭合)
- 承接级邻接 = 5 件(Memento 3 + REMORY + Agentic BBO + Skill Constellations + MiMo-V2.6)
- 承接级细化 = 4 件(Qwen4-Exp QSA + antirez/ds4 + Winder.ai SGLang 实测 + SGLang 10 月 Bug 集中 + 5 件 Substack Newsletter)
- 矛盾/待核续写 = 12 件(沿用 v3.56 morning D249-D258 + D258 闭合 + 2 件承接稳态期内细化不足 + 4 件承接稳态期新发现 D255-D258 沿用)
5.2 v3.56 morning 沿用稳态
- 4 NET-new arXiv ID 全部沿用(galahad-kv + Foundations + Cascadia + SpecScale + vLLM→llm-d 综述 + STEPQuant + SparseEngine + VFold + Memento 3 + REMORY)
- 6 NET-new URL 全部沿用(含 Spheron H100 三引擎实测 + Crusoe Managed Inference + SGLang vs vLLM 跨源三确认 + MLPerf Inference v6.1 + ai-boost harness + STATE-Bench + Mem0/MemOS/Cognee/MemSearch)
- 4 矛盾续写 D255-D258 全部沿用(D258 闭合)
- C357-C358 候选预备级全部沿用(SparseEngine + VFold)
- O569-O576 + P0 #289 + P0-10 全部沿用
- 6 NET-new arXiv ID 全部沿用(galahad-kv + Foundations + Cascadia + SpecScale + vLLM→llm-d 综述 + STEPQuant · v3.55 morning 沿用基线)
5.3 知识库活文档本次
- arXiv ID 全量清单 = 469 件 = 0 件 NET-new · 24h 滑动窗口内承接稳态
- URL 全量清单 = 622 件 = 0 件 NET-new · 24h 滑动窗口内承接稳态
- CVE = 36 件 · DOI = 15 件 = 全部沿用稳态
- P0 警示池 = #1-#289 沿用 + P0-10 沿用 = 全部沿用稳态
5.4 后续棒位建议
- 建议 1:沿用 v3.56 morning 承接稳态期 + 本棒位承接稳态精修预备级锚入承接级细化(arXiv:2610.06597 / 2608.15127 / 2610.12274 D258 闭合 + Memento 3 / REMORY / Agentic BBO / Skill Constellations / MiMo-V2.6 邻接承接 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai SGLang 实测 / SGLang 10 月 Bug 集中 / 5 件 Substack 承接级细化)
- 建议 2:沿用 v3.56 morning 4 矛盾续写 D255-D258 · 截止 10-13 morning 棒前(周日低活动度 + 无新证据 · D258 HarnessSQL 编号 web search 验证完成闭合)
- 建议 3:建议 evening 棒位补 8 件工程主轴 paper_card 批量建卡(stephen C18 P0 候选 prep 第 3 例 · AgentSysBench + Agent Memory + State-Bench + HarnessSQL + VFold + SGUID + Project Greenhouse + Skill Retrieval Augment + Efficient LLM Serving)
- 建议 4:本棒位 0 件 NET-new arXiv ID = 无需升档 · 沿用 v3.56 morning 棒位承接稳态期
- 建议 5:建议 10-13 morning 棒位重新激活立标延革预备 140-142 例预备承接稳态期(arXiv:2610.06597 / 2608.15127 / 2610.12274 邻接承接 → §IX 115 morning 棒位预备候选 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai / SGLang 10 月 Bug 集中承接稳态精修预备级扩增 + 4 矛盾续写(D255-D258 · D258 闭合)继续延革)
- 建议 6:stephen C2-C6 升档活文档候补条目的升档节奏判定(Anthropic 第三阶段跃迁叙事 + frontier lab 安全产品化四联 + agent 记忆三栖判断 + 8 件 paper_card 批量补建 + spark 周日早棒无主棒位 e1prep 承接判定 → 建议承接为"概念预备级"+ evening 棒位批量建卡)
5.5 与 v3.56 morning 体系预备级承接
- 2026 Q4 初 llm-infra 工程化完成级 + AI Agent 优化推理系统 + KV Cache 持久化纪元 + Memory-as-a-Layer 范式 + 消费级超大 MoE 推理 + 投机解码系统级条件量化 + 推理控制平面演化叙事 + LLM Operability 6 级成熟度 + Agent Memory 三层 + 推理引擎代际切换双栖 + 推理框架代际切换双栖 + AI for Systems 五栖 + 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖预备级 + Harness vs Scaffold + SparseEngine 稀疏推理纪元 + Memory 第十五/十六栖 + Agent Harness 工程化 + STATE-Bench + 自进化 memory OS + guardrails 独立学科 = 体系预备级全部沿用稳态
- 本棒位新增承接稳态精修预备级扩增:arXiv:2610.06597 OmniKV→vLLM + H2O 方案(harness-aware inference engine 预备第 1 例)+ arXiv:2608.15127 AgentSysBench 178,799 session 实测(AI Agent 优化推理系统第四栖预备)+ Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context(「SparseEngine + QSA」稀疏推理引擎纪元双栖)+ antirez/ds4 C 单文件推理引擎(C++/C 双后端 + 多硬件后端 + 通用/专用双栖)+ Winder.ai SGLang/vLLM 实测 + SGLang 10 月 Bug 集中(SGLang 工程稳定性预备级第 1 例)+ 5 件 Substack Newsletter(推理工程学科化预备扩增第 5 例)
5.6 evening 棒位预备候选
- §IX 114 evening v3.56 morning 棒位承接稳态期延续(承接 v3.56 morning 4 NET-new arXiv + 6 NET-new URL + 4 矛盾续写 + 6 件承接稳态精修预备级锚定承接)
- §IX 115 morning 棒位预备候选:立标延革预备 140-142 例预备承接稳态期 + arXiv:2610.06597 / 2608.15127 / 2610.12274(D258 闭合)邻接承接 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai / SGLang 10 月 Bug 集中承接稳态精修预备级扩增 + 4 矛盾续写(D255-D258 · D258 闭合)继续延革 + 8 件工程主轴 paper_card 批量建卡(stephen C18 P0 候选 prep 第 3 例)
本次变更
2026-10-11 18:40 CST(E1 §IX 114 evening 棒位预备)
v3.56 evening 棒位预备(本轮):🌅 24h 滑动窗口期(2026-10-11 05:00 → 2026-10-11 18:40 CST · §IX 114 morning v3.56 morning 全量沿用基线 · arXiv 465→469/CVE 36/DOI 15/URL 616→622 全部沿用) + 0 NET-new arXiv ID(24h 滑动窗口期承接稳态期内无 NET-new arXiv ID 入池 · 周日低活动度)+ 0 NET-new paper_card llm-infra 主分类真新卡(10-11 morning paper_cards 1740-1755 共 16 件全部为 agent/multimodal/engineering/evaluation 主分类 · 0 件 llm-infra 主分类真新卡 · 24h 滑动窗口内承接稳态期延续)+ 0 NET-new CVE/DOI/URL + 3 件承接稳态精修预备级锚入(① arXiv:2610.06597 "Can Agent Harnesses and Inference Engines Hear Each Other?" OmniKV→vLLM + H2O 方案 · BrowseComp-Plus 1.14× + Chain reuse 2.45× makespan 加速 = harness-aware inference engine 预备第 1 例 ② arXiv:2608.15127 AgentSysBench · HKUST + Alibaba + ByteDance · 178,799 session 实测 · Agentic 场景模型推理不再是主要成本 · sandbox/embedding/vector DB 占主导 · disaggregated serving 延迟 -29-40% · 6 个区分属性 · AI Agent 优化推理系统第四栖预备 ③ arXiv:2610.12274 HarnessSQL Harness 原生 SQL 训练 = D258 闭合 · Cool Papers RSS 已收录 + jay 10-11 1001-rss-cool-papers 二次确认)+ 5 件承接级邻接 arXiv ID 锚入(① paper_card 1744 Memento 3 arXiv:2610.11794 engineering 副承接 + work-queue Top 15 #1 连续两棒 ② paper_card 1748 REMORY arXiv:2610.11287 Memory 第十五栖预备邻接第 1 例 ③ paper_card 1747 Agentic BBO arXiv:2610.12183 评测方法学四栖邻接第 N 例 ④ paper_card 1750 Skill Constellations arXiv:2610.11169 Skill 供应链安全栖位预备第 1 例 + work-queue Top 15 第 2 承接 ⑤ paper_card 1740 MiMo-V2.6 arXiv:2610.11959 RL scaling 基础设施承接 65▲ HF Daily 10-11)+ 4 件承接级细化数据点(① Qwen4-Exp QSA 7.6× prefill / 4.9× decode @ 1M context + GatedResidual + PLE + Muon optimizer · 「SparseEngine + QSA」稀疏推理引擎纪元双栖预备 + 90% prefix-cache hit 8.6× prefill ② antirez/ds4 DeepSeek V4 Flash 专用 21.9K stars C 单文件 Metal/CUDA/ROCm 三后端 · Mac M5 Max 460 tok/s prefill / 39 tok/s decode · 1M context · OpenAI 兼容 · Claude Code 已集成 · 与 vllm.cpp 形成「C++/C 双后端 + 多硬件后端 + 通用/专用双栖」③ Winder.ai SGLang 0.5.20 vs vLLM 0.30.0 实测(SGLang 1,725 / vLLM 1,610 tok/s @ 50 并发 · $0.56 vs $0.60/M tokens · 2026-09 采集 · Qwen3.8-27B H100)+ SGLang 自限速机制工程隐患预备第 1 例 ④ SGLang 2026-10 Bug 集中 #43488 / #43557 / #43402 / #43523(DSV4.1+Flash+DSPARK CUDA OOM 15-25 分钟复现 · PD disagg illegal memory access · multimodal slice 队列 abort 泄漏 · streaming 静默丢弃)· SGLang 工程稳定性预备级第 1 例 + 5 件 Substack Newsletter(kenhuang 10 章 MoE 2026 系列 + Pragmatic Engineer "What is Inference Engineering" + Dennis Kennetz LLM Inference Curriculum + System Design Nuggets LLM Inference at Scale + Pawan K Jha Architecting LLM Inference Part 1 = 推理工程学科化预备扩增第 5 例)+ 4 矛盾续写 D249-D252 + D253 + D254 全部沿用 + D255-D258 全部沿用 + D258 HarnessSQL 编号 web search 验证完成闭合 + 3 件承接稳态期新发现矛盾警示(① 8 件工程主轴 paper_card 未建卡 = paper_card 富化缺口协同风险 ⚠⚬⚬ · stephen C18 P0 候选 prep 第 3 例 ② stephen C2-C6 升档活文档候补条目的升档节奏判定(Anthropic 第三阶段跃迁叙事 + frontier lab 安全产品化四联 + agent 记忆三栖判断 + 8 件 paper_card 批量补建)⚠⚬⚬ ③ SGLang 0.5.20 自限速机制工程隐患与 10 月 Bug 集中稳定性预备 ⚠⚬)+ jay 10-11 11:22 engineering-e1prep 16.1KB 主棒位承接 + jay 10-11 09:36 agentic-systems-vector-db-mlops + jay 10-11 10:50 + 14:50 工程化二次过滤承接 + tom 10-11 09:00 HF Daily 15 件承接稳态第 11 日 + arXiv ID 全量清单 469 件承接稳态 = 0 件 NET-new + 本棒位综合判断 = 承接稳态期延续 + 周日低活动度 + 0 件 NET-new arXiv ID + 0 件 llm-infra 主分类真新卡 + 3 件承接稳态精修预备级锚入 + 5 件承接级邻接 + 4 件承接级细化数据点 + 4 矛盾续写继续延革 + D258 闭合 + 3 件承接稳态期新发现矛盾警示 → §IX 114 evening 棒位承接稳态期延续 + §IX 115 morning 棒位预备候选(立标延革预备 140-142 例预备承接稳态期 + arXiv:2610.06597 / 2608.15127 / 2610.12274(D258 闭合)邻接承接 + Qwen4-Exp QSA / antirez/ds4 / Winder.ai / SGLang 10 月 Bug 集中承接稳态精修预备级扩增 + 4 矛盾续写(D255-D258 · D258 闭合)继续延革 + 8 件工程主轴 paper_card 批量建卡)。