llm-infra · E1 预消化简报(2026-10-10)
E1 日间预消化轮 · llm-infra · 2026-10-10 18:40 CST · spark 承接棒位:v3.55 morning(2026-10-10 05:00 · §IX 113 morning · arXiv/CVE/DOI/URL 459→465/36/15/607→616) 状态:承接稳态期延续 · 周六低活动度 · 无新主分类 llm-infra 真新卡入池 · 无新顶级承接级预备 · 承接稳态期内细化为主
〇、检查过的来源清单(近 2 天 · llm-infra 主题相关)
| 来源 | 文件 | 与 llm-infra 关系 |
|---|---|---|
inbox/spark/2026-10-10-agent-e1prep.md(10-10 13:35 · 48KB · spark) |
早棒 agent 主轴;§B 引用 v114 立标延革预备 139-142 例;承接 v3.55 全部主棒位 | |
inbox/jay/2026-10-10-engineering-e1prep.md(10-10 11:20 · 19KB · jay) |
engineering 主棒位 · 7 件主增量(Spheron H100 三引擎实测 + SitePoint vLLM 部署命令集 + SGLang vs vLLM 60% 前缀共享阈值 + Stack Overflow Part 6 LLM Operability + OSDI 2026 KV Cache Disaggregation arXiv:2608.01526 + SparseEngine arXiv:2609.39068 + Memento 3 paper_card 1744 承接)· 已全部锚入 jay 10-10 inference.md 接管 |
|
inbox/jay/2026-10-10-ai-engineering-trending-oct.md(10-10 09:35 · 9.2KB) |
GitHub Trending + HF Hub 100 万公开数据集 + 推理引擎横向对比 2026-10(vLLM 3,688 vs SGLang 3,617 vs TRT-LLM 3,219 vs llama.cpp 703 vs Ollama 277 tok/s)+ KV Cache OSDI 2026 arXiv:2608.01526 + KV Cache Survey arXiv:2603.20397 + LMCache arXiv:2510.09665 · 承接 v3.55 全部 arXiv/URL 已含 |
|
inbox/jay/2026-10-10-csdn-inference-rag-multiagent-highfreq.md(10-10 08:20 · 9.8KB) |
9 件 CSDN 高价值 = 推理框架横评 vLLM/TGI/TRT-LLM/SGLang + Qwen3-235B 部署 + vLLM/SGLang 2026 + vLLM/TRT-LLM 调优指南 + RAG 10 大踩坑 + Multi-Agent 五大流派 + 2025-2026 多 Agent 协作全景 · 全部承接 v3.55 + engineering.md v141 沿用 | |
inbox/jay/2026-10-10-1050-engineering-filter-inference-agent-memory.md(10-10 10:50 · 5KB · jay 早棒工程筛选) |
承接级 Spheron H100 + SitePoint vLLM + SGLang RadixAttention + SitePoint Agent Memory + Arize Agent Debugging · 全部 v3.55 沿用 | |
inbox/jay/2026-10-10-1505-jay-five-category-briefing.md(10-10 15:05 · 13.4KB · afternoon briefing) |
5 类目汇总 = Spheron H100 三引擎同框 + Winder.AI 1K ShareGPT + pgvectorscale vs Qdrant + K8s 1.36 + 阿里云函数计算 vLLM vs SGLang SGLang TTFT 比 vLLM 优 15-50% / TPOT 优 10% / 吞吐优 10% / 启动快 30% · 承接 v3.55 全部 + Spheron 决策树补充 | |
inbox/jay/2026-10-10-1335-openmodels-vector-agents-infratech.md(10-10 13:35 · jay) |
承接级 Colibri 纯 C 推理引擎 + Gergely Orosz "What is Inference Engineering" + Data Engineer Things Substack · Inference Engineering 正在成为独立工程学科(Pragmatic Engineer Newsletter ~10 万工程师订阅)= v3.55 工程化完成级叙事预备级第 1 例 | |
inbox/jay/2026-10-10-1001-rss-cool-papers.md(10-10 10:01 · 1.5KB) |
5 件 net-new = 用价值表征预测对齐泛化 arXiv:2610.12410 + Latent Core Tokenizer arXiv:2610.12376 + SGUID arXiv:2610.12367 + VFold 跨层 Value Cache 压缩 arXiv:2610.12338 + HarnessSQL Harness 原生 SQL Agent 训练 arXiv:2610.12274 · 邻接级承接,非 llm-infra 主分类 |
|
inbox/jay/2026-10-10-1000-rss-simon-willison.md / 1000-rss-raschka.md / 1000-rss-bytebytego.md / 1001-rss-nathan-benaich.md / 1001-rss-lilian-weng.md / 1004-rss-yt-karpathy.md / 1004-rss-yt-fireship.md / 1002-rss-import-ai.md |
9 件 RSS 全部沿用 9-10 月,无新 llm-infra 增量 | |
inbox/tom/2026-10-10-0900-hf-daily-2026-10-10.md(10-10 09:00 · 1.8KB · 15 件立标) |
承接稳态第 10 日 · llm-infra 主轴直接命中 1 件 = Foundations of LLMs arXiv:2501.09223 30▲(10-9 paper_card 1742 入池)+ SparseEngine arXiv:2609.39068 13▲ = 稀疏推理引擎维度净新增 · 承接 v3.55 预备级第 1 例 |
|
inbox/tom/2026-10-10-agent-rag-longcontext-radar.md(10-10 08:40 · 4.0KB · 4 高价值 + 4 候选) |
RAG / agent 主轴,llm-infra 主分类 0 件命中 | |
inbox/tom/2026-10-10-evaluation-e1prep.md / 2026-10-10-rag-e1prep.md |
evaluation / RAG 主轴,llm-infra 主分类 0 件命中 | |
inbox/stephen/2026-10-10-ai-industry-e1prep.md(10-10 10:20 · 33KB) |
承接级 §16 引用 OSDI 2026 KV Cache Disaggregation + KV Cache Survey + LMCache = jay engineering-e1prep 已承接 | |
inbox/stephen/2026-10-10-stephen-coordination-check-noon.md(10-10 12:45 · 46.5KB · 6 实例 14h 协调) |
承接级 §4.3 必须人工确认 #6 = engineering 主轴 e1prep 是否在 evening 棒位之前补足 · jay 10-10 11:20 engineering-e1prep 已承接大部分 engineering 主轴 = stephen engineering 主轴 e1prep 缺失影响有限 | |
inbox/flyp/2026-10-10-risk-e1prep.md(10-10 · flyp) |
risk 主轴,llm-infra 主分类承接稳态(R97 已锚 paper_card 1731/1742 + Cascadia 等) | |
inbox/flyp/2026-10-10-multimodal-e1prep.md |
multimodal 主轴,llm-infra 邻接级承接 | |
inbox/spark/2026-10-10-1001-rss-gradient-flow.md / 1002-rss-chip-huyen.md |
5 件 RSS 全部沿用 9-10 月 | |
paper_cards 1700-1752 索引(10-08 ~ 10-10 入池) |
llm-infra 主分类净增 0 件(10-8 ~ 10-10 区间:paper_card 1731 galahad-kv arXiv:2610.10845 + paper_card 1742 Foundations of LLMs arXiv:2501.09223 已在 10-9 入池 v3.55 morning 沿用 = 24h 滑动窗口内新增 0 件 llm-infra 主分类真新卡) |
|
paper_card 1744 Memento 3 arXiv:2610.11794(10-10 12:30 入池 · agent 主分类 · engineering 副) |
与 llm-infra 主轴 间接邻接(frozen LLM agents + external memory + natural-language rulebook = 与 v3.55 Memory 第十一/十二/十三栖 + Memory-as-a-Layer 范式预备级 + Memory 第十四栖「NVMe 持久化 Memory」间接邻接)= Memory 第十五栖「残差记忆网络」预备邻接第 1 例 | |
paper_card 1748 REMORY arXiv:2610.11287(10-10 12:30 · agent 主分类) |
残差记忆网络上下文压缩 · soft memory tokens · residual connection 沿序列维度类比 = 与 v3.55 KV Cache 持久化纪元 + Memory-as-a-Layer 范式间接邻接 = Memory 第十五栖预备邻接第 1 例 · Risk R98 prep 锚定 | |
paper_card 1747 Agentic BBO arXiv:2610.12183(10-10 · agent 主分类 · evaluation 副) |
黑盒优化 LLM Agent 基准测试 · 与 v3.55 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖间接邻接 |
一、今日该主题最重要的增量(7 条)
增量 1 · 🟢 jay engineering 主棒位承接 v3.55 morning · 6 件工程主分类承接级 + inference.md 10-10 主动 update ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-10-engineering-e1prep.md(10-10 11:20 · 19KB · jay · 主棒位)/shared/research-kb/organized/knowledge/inference.md(10-10 午 update · "Oct10午:Spheron三引擎H100/Llama3.3-FP8(1,850/1,920/2,100tok/s@50)+Winder.AI五档×cost+SitePoint部署+Ollama182K;引→477")- 关联:
/shared/research-kb/organized/knowledge/engineering.mdv141 沿用(10-08 09:15) - arXiv:0 件 NET-new arXiv ID · 6 件承接级 arXiv 已全部在 v3.55 morning 锚入基线
- 可信度:⭐⭐⭐⭐(jay 主棒位 · v3.55 morning 6 件承接稳态精修预备级 + engineering.md v141 沿用 + inference.md 10-10 午 update 主动承接)
- 要点:
1. Spheron H100 三引擎同框实测(Llama 3.3 70B FP8 @ 50 并发):vLLM 1,850 tok/s / SGLang 1,920 tok/s / TensorRT-LLM 2,100 tok/s · TTFT p50 = 120 / 112 / ~100ms · 冷启动 ~62s / ~58s / ~55s · 决策树(通用→vLLM;最低 TTFT→TRT-LLM;前缀复用→SGLang)= 承接 v3.55 §1.(1) 推理引擎锚入补强 · vLLM/SGLang/TRT-LLM 三国 + Spheron 实测数据第 4 件
2. Winder.AI 1K ShareGPT 五引擎对比 2026-10:vLLM 3,688 tok/s vs SGLang 3,617 vs TensorRT-LLM 3,219 vs llama.cpp 703 vs Ollama 277 @ 50 并发 · 承接 v3.55 §1.(1) + jay engineering-e1prep 增量 1
3. SitePoint vLLM Production Deployment Guide 2026:docker 安全实践 + TP4 多卡命令 + benchmark_serving.py 实操 + PagedAttention 实际收益量化(7B 30→100+ 并发)= 承接 v3.55 §1.(1) vLLM Production Stack 2026 GA 锚入补强 · 生产级可操作命令参考 · inference.md 10-10 update 已吸纳
4. SGLang vs vLLM 2026(Spheron Blog):60% 前缀共享率 = SGLang 优势启动点 · 80% 共享 + 50 并发下 TTFT p50 从 310ms 降至 195ms(-37%)· vLLM v0.18.0 / SGLang v0.5.9 / cu130 版本明确 · SGLang FP8 部署命令
--mem-fraction-static 0.92= 承接 v3.55 §1.(1) SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 锚入补强 5. Stack Overflow Part 6 LLM System Operability(jay 10-10 11:20 · 10-10 新发布 · 承接 v3.55 Part 5 第 5 级):Platform Design / failure asymmetry / 跨租户隔离 / Gateway 单点 = 承接稳态精修预备级锚入补强第 2 例(Part 5 = 第 5 级;Part 6 = 第 6 级) 6. OSDI 2026 KV Cache DisaggregationarXiv:2608.01526"An Internet for the KV Cache":KV Cache 正从"推理优化技巧"演变为存储/通信/调度基础原语 · 跨模型共享 + 持久化存储 + 跨引擎暴露接口 · LMCache / TensorRT / NVIDIA Dynamo / llm-d 引用项目 = 承接 v3.55 §1.(3) KV Cache 三件套锚入补强第 1 例(v3.55 morning 已锚入 arXiv:2608.01526 入 arXiv ID 全量清单) - 与活文档现有脉络的关系:
- 直接接续 v3.55 morning §IX 113 morning §1.(1) 推理引擎 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化 + §1.(13) AI for Systems 闭环 + §0.5 现状全景 6 件承接稳态精修预备级锚定承接
- 承接级补强级(非 NET-new):本杰 6 件增量全部为 v3.55 沿用基线内的细化数据点 + 承接级新发布(Stack Overflow Part 6)
- 建议归入节:
- §1.(1) 推理引擎 → 在 vLLM/SGLang/TRT-LLM 三国 + MLPerf v6.0 + Dynamo v1.5 Feature Matrix 锚入后新增 "Spheron H100 80GB + Llama 3.3 70B FP8 三引擎 benchmark(vLLM 1,850 / SGLang 1,920 / TRT-LLM 2,100 tok/s @ 50 并发)+ Winder.AI 1K ShareGPT 五引擎对比 + SitePoint vLLM Production Deployment Guide 2026 + SGLang vs vLLM 60% 前缀共享率阈值 + 阿里云函数计算 SGLang TTFT 优 15-50% / TPOT 优 10% / 吞吐 优 10% / 启动快 30%"
- §1.(1) 推理引擎 → Stack Overflow Part 6 LLM System Operability 第 6 级预备级承接稳态精修预备级第 7 例锚入(Part 5 = 第 5 级沿用;Part 6 = 第 6 级新增)
- §1.(3) KV Cache → OSDI 2026 KV Cache Disaggregation "An Internet for the KV Cache"
arXiv:2608.01526锚入补强第 1 例(已入 arXiv 全量清单)
增量 2 · 🟡 SparseEngine arXiv:2609.39068 HF Daily 13▲ · 稀疏优先推理引擎 ⚠⚬
- 来源:
/shared/research-kb/inbox/tom/2026-10-10-0900-hf-daily-2026-10-10.md(10-10 09:00 · 13▲ 第 11 位)/shared/research-kb/inbox/jay/2026-10-10-engineering-e1prep.md(10-10 11:20 · 增量 6 · ⭐⭐⭐)- 关联:
/shared/research-kb/organized/knowledge/engineering.mdv141 §1.1 已锚 QATFactory + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell - arXiv:
2609.39068https://arxiv.org/abs/2609.39068 - 可信度:⭐⭐⭐(HF Daily 13▲ · 工程主分类待建卡后确认)
- 要点: 1. 定位:稀疏优先的推理引擎 · 与当前主流 dense inference engine 不同的设计路线 2. 承接 v3.55:v141 已锚入 QATFactory(量化感知训练)+ NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell;SparseEngine 提供稀疏推理引擎的新维度 3. 与 v141 §1.1 的关系:v141 已锚入 6 引擎量化矩阵(vLLM/SGLang/TRT-LLM/LMDeploy/llama.cpp/Ollama);SparseEngine 是稀疏推理引擎维度的净新增,与 dense 引擎形成互补
- 与活文档现有脉络的关系:
- 承接 v3.55 morning §1.(1) 推理引擎方法学锚入补强
- 承接级补强第 1 例(v3.55 morning 主棒位无 SparseEngine,本杰 10-10 engineering-e1prep 承接新增)
- 建议归入节:§1.(1) 推理引擎 → 在 6 引擎量化矩阵锚入后新增 "SparseEngine
arXiv:2609.39068· 稀疏优先推理引擎 · 13▲ HF Daily 10-10 · 稀疏推理新路线" - 本棒位判断:建议在 evening 棒位统一标注为承接稳态精修预备级(非 NET-new arXiv ID · 非主分类真新卡;HF Daily 10-10 早棒 13▲ = 承接稳态期扩增)
增量 3 · 🟡 VFold arXiv:2610.12338 跨层 Value Cache 压缩 + HarnessSQL arXiv:2610.12274 Harness 原生 SQL Agent 训练 ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-10-1001-rss-cool-papers.md(10-10 10:01 · 5 件 net-new)- arXiv:
2610.12338https://arxiv.org/abs/2610.12338 ·2610.12274https://arxiv.org/abs/2610.12274 - 可信度:⭐⭐⭐(Cool Papers RSS · 10-10 net-new)
- 要点:
1. VFold
arXiv:2610.12338跨层 Value Cache 压缩:承接 v3.55 §1.(3) KV Cache + §1.(4) 量化锚入补强 · 与 v3.55 KV Cache 14+1+1 件体系化扩增间接邻接 2. HarnessSQLarXiv:2610.12274Harness 原生 SQL Agent 训练:承接 v3.55 §1.(11) Kernel/AI 自动化/Harness 锚入补强 · 与 v3.55 HF Agent Glossary Harness vs Scaffold 四层定义(承接稳态精修预备级)间接邻接 3. 其余 3 件 cool-papers net-new(非 llm-infra 主轴):用价值表征预测对齐泛化arXiv:2610.12410+ Latent Core TokenizerarXiv:2610.12376+ SGUIDarXiv:2610.12367 - 与活文档现有脉络的关系:
- 承接 v3.55 §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 锚入补强
- 承接级补强第 2/3 例(非 NET-new arXiv ID;v3.55 主棒位无 VFold/HarnessSQL;Cool Papers 10-10 早棒 net-new 承接级预备)
- 建议归入节:
- §1.(3) KV Cache → VFold
arXiv:2610.12338跨层 Value Cache 压缩承接稳态精修预备级锚入 - §1.(11) Kernel/AI 自动化/Harness → HarnessSQL
arXiv:2610.12274Harness 原生 SQL Agent 训练承接稳态精修预备级锚入
增量 4 · 🟡 Gergely Orosz "What is Inference Engineering?" Pragmatic Engineer Newsletter 承接稳态期 ⚠⚬
- 来源:
/shared/research-kb/inbox/jay/2026-10-10-1335-openmodels-vector-agents-infratech.md(10-10 13:35)/shared/research-kb/organized/knowledge/engineering.mdv141 §1.7 推理工程学科化已锚 "Loop Engineering 学科化 2026 H2 成熟"- URL:https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
- 可信度:⭐⭐⭐(Pragmatic Engineer Newsletter · ~10 万工程师订阅 · 工程社区承接级)
- 要点: 1. 核心论点:Inference Engineering 正在成为独立工程学科:优化模型推理延迟、成本、质量 2. 关键洞察:封闭模型推理工程由模型厂商内部处理;开源模型使企业需要自己的 Inference Engineering 团队 3. 核心技能:模型选型、量化、推理服务(vLLM/SGLang)、Prefix Caching、KV Cache 优化、Batch 调度 4. 承接 v3.55 / v141:v141 §1.7 推理工程学科化已锚 Loop Engineering 学科化 2026 H2 成熟;Orosz Substack = "Inference Engineering" 子学科预备扩增
- 与活文档现有脉络的关系:
- 承接 v3.55 morning §0.5 §1.(13) AI for Systems 闭环 + v141 §1.7 推理工程学科化锚入补强
- 承接级预备第 1 例(v3.55 主棒位无 Orosz Substack;jay 10-10 1335 承接级预备)
- 建议归入节:
- §1.(13) AI for Systems 闭环 + §1.7 推理工程学科化 → Gergely Orosz Substack "What is Inference Engineering" 承接级锚入(子学科预备扩增)
- 后续行动:可考虑追踪 Pragmatic Engineer 作为 AI 工程情报源(v3.55 morning 沿用)
增量 5 · 🟢 paper_card 1744 Memento 3 arXiv:2610.11794 主分类确认 engineering + Memory 第十五栖预备邻接 ⚠⚬⚬
- 来源:
/shared/research-kb/organized/paper_cards/1744-2610-11794.md(10-10 12:30 入池 · 主分类 agent · engineering 副)/shared/research-kb/inbox/jay/2026-10-10-engineering-e1prep.md(10-10 11:20 · 增量 7 · work-queue Top 优先级)/shared/research-kb/inbox/spark/2026-10-10-agent-e1prep.md(10-10 13:35 · 增量 2 · work-queue Top 15 高价值待深度解读 1 件)- arXiv:
2610.11794https://arxiv.org/abs/2610.11794 - 可信度:⭐⭐⭐⭐(work-queue Top 15 高价值待深度解读 1 件 · 24▲ HF Daily 10-10 · 立标延革预备 140 例预备承接稳态)
- 要点: 1. paper_card 1744 主分类确认:agent 主分类 · engineering 副 · work-queue Top 优先级 · 24▲ HF Daily 10-10 早棒第 8 位 2. 核心机制:frozen LLM agents + external memory + natural-language rulebook 持续学习 + revisable hypotheses about environment dynamics + 解决"多世界模型都解释过去但对未见状态有不同预测"问题 = Self-Controlled-RSI 范式 3. 承接 v3.55:接续 v113 SkillForge/UniSkill/PhysEvo/D-OPCD/Retrospection/Inherit-MAS 七件预备级 = Agent 自改进栖位扩稳态第 12 例(沿用 spark 10-10 agent-e1prep §增量 2 标注) 4. 与 v3.55 §1.(1)/§1.(11) 关系:工程相关性涉及推理系统的自我改进机制,与 v3.55 §1.(1) 推理引擎方法学 + v141 §1.7 推理工程学科化 + v141 §1.8 Agentic Engineering 直接邻接
- 与活文档现有脉络的关系:
- 直接接续 v3.55 morning §1.(1) 推理引擎方法学 + §1.(11) Kernel/AI 自动化/Harness 锚入补强
- 承接级补强第 4 例(v3.55 主棒位 paper_card 1731/1742 已锚;本杰 engineering-e1prep 把 paper_card 1744 主分类确认为 engineering + work-queue Top 优先级)
- 建议归入节:
- §1.(11) Kernel/AI 自动化/Harness → Memento 3
arXiv:2610.11794反射式规则手册自我改进栖位扩稳态第 12 例承接稳态精修预备级锚入
增量 6 · 🟡 paper_card 1748 REMORY arXiv:2610.11287 Memory 第十五栖「残差记忆网络」预备邻接第 1 例 ⚠⚬⚬
- 来源:
/shared/research-kb/organized/paper_cards/1748-2610-11287.md(10-10 12:30 入池 · 主分类 agent)/shared/research-kb/inbox/flyp/2026-10-10-risk-e1prep.md(10-10 · Memory 第十五栖预备第 1 例)/shared/research-kb/inbox/jay/2026-10-10-engineering-e1prep.md(10-10 11:20 · engineering 副承接)- arXiv:
2610.11287https://arxiv.org/abs/2610.11287 - 可信度:⭐⭐⭐⭐(10-10 12:30 入池 · Memory 第十五栖预备第 1 例 · Risk R98 prep)
- 要点: 1. 核心机制:REMORY 神经记忆网络 · 长时程智能体压缩历史 + soft memory tokens 沿维度残差连接类比 + bounded sequence of soft memory tokens + 条件化 on summary 2. 承接 v3.55:与 v3.55 KV Cache 持久化纪元 + Memory-as-a-Layer 范式 + Memory 第十一/十二/十三栖 + 第十四栖「NVMe 持久化 Memory」预备第 1 例间接邻接 = Memory 第十五栖「残差记忆网络」预备邻接第 1 例(flyp 10-10 risk-e1prep 锚定) 3. 评测:SummHay 提升(具体数字待 paper_card 后续填)
- 与活文档现有脉络的关系:
- 承接 v3.55 §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 间接邻接
- 承接级邻接第 1 例(v3.55 主棒位 paper_card 1731/1742 已锚;本棒位 paper_card 1748 邻接承接)
- 建议归入节:
- §1.(11) Kernel/AI 自动化/Harness → REMORY
arXiv:2610.11287残差记忆网络上下文压缩承接稳态精修预备级锚入(副 llm-infra · Memory 第十五栖预备邻接第 1 例)
增量 7 · 🟡 阿里云函数计算 vLLM vs SGLang 实测数据点 ⚠⚬(承接级细化)
- 来源:
/shared/research-kb/inbox/jay/2026-10-10-1505-jay-five-category-briefing.md(10-10 15:05 · afternoon briefing · csdn 类别)- 关联:
/shared/research-kb/organized/knowledge/inference.md10-10 午 update - 可信度:⭐⭐⭐(CSDN 阿里云函数计算实测 · 承接级细化)
- 要点: 1. SGLang vs vLLM 阿里云函数计算压测数据:SGLang TTFT 比 vLLM 优 15-50% / TPOT 优 10% / 吞吐优 10% / 启动快 30% 2. 四大框架定位总结(CSDN):vLLM 全能 / SGLang 高并发 + 结构化 / LMDeploy 国产生态 / TensorRT-LLM 吞吐天花板 3. 承接 v3.55:v3.55 §1.(1) SGLang v0.5.20 vs vLLM v0.30.0 H100 +29% 跨源三确认 + SGLang vs vLLM 2026 60% 前缀共享率阈值 + 阿里云函数计算 SGLang 多卡部署 = 三层确认(实验室 H100 / 阿里云函数计算 / Spheron 跨源三确认)预备扩增
- 与活文档现有脉络的关系:
- 承接 v3.55 §1.(1) 推理引擎方法学 + SGLang vs vLLM 跨源锚入补强第 3 例
- 承接级细化第 1 例(v3.55 主棒位已有跨源三确认;本棒位阿里云函数计算 SGLang 启动快 30% 沿用)
- 建议归入节:
- §1.(1) 推理引擎 → 阿里云函数计算 SGLang vs vLLM 压测承接稳态精修预备级锚入(实验室 H100 + 阿里云函数计算 + Spheron 三层确认预备扩增稳态)
二、值得警惕的矛盾 / 待核实说法(沿用 v3.55 morning D249-D254)
⚠ 本窗口期值得警惕的矛盾 = 6 件 v3.55 morning 已锚定 + 1 件承接稳态期内细化不足:
矛盾 1 · galahad-arene arXiv:2610.10845 NVMe 持久化在生产环境安全验证 ⚠⚬⚬(沿用 D249)
- 本窗口期新增证据:0 件新证据(v3.55 morning 已锚;周六低活动度)
- 来源:v3.55 morning §3 D249 + flyp 10-10 risk-e1prep R98 prep + jay 10-10 engineering-e1prep 无新承接
- 争议焦点:galahad-kv NVMe 持久化在生产环境安全验证 + 加密存储开销 vs 收益 + 多用户并发访问一致性 + 与 vLLM Production Stack LMCache KV 跨实例共享的协同
- 本棒位判断:沿用 D249 · 截止 10-12 morning 棒前 · 不升档
矛盾 2 · Cascadia arXiv:2610.07219 消费级 975B MoE 部署稳定性 ⚠⚬⚬(沿用 D250)
- 本窗口期新增证据:0 件新证据(v3.55 morning 已锚)
- 来源:v3.55 morning §3 D250 + flyp 10-10 risk-e1prep 沿用
- 争议焦点:Cascadia 消费级 MoE 部署在真实生产环境的稳定性 + 复现 artifact 在 NVIDIA H100/200 + AMD MI300 + 国产 GPU 跨平台验证 · preprint 阶段精度数据待 peer review 验证
- 本棒位判断:沿用 D250 · 截止 10-12 morning 棒前 · 不升档
矛盾 3 · SpecScale arXiv:2609.39334 H100/B200 生产实测 ⚠⚬⚬(沿用 D251)
- 本窗口期新增证据:0 件新证据(v3.55 morning 已锚)
- 来源:v3.55 morning §3 D251 + flyp 10-10 risk-e1prep 沿用
- 争议焦点:SpecScale H100/B200 + vLLM/SGLang 生产环境实测 + 与 EAGLE-3 + DFlash2 + Spec V2 在不同 workload 的临界条件
- 本棒位判断:沿用 D251 · 截止 10-12 morning 棒前 · 不升档
矛盾 4 · STEPQuant arXiv:2609.38169 循环状态量化生产引擎稳定性 ⚠⚬⚬(沿用 D252)
- 本窗口期新增证据:0 件新证据(v3.55 morning 已锚)
- 来源:v3.55 morning §3 D252 + flyp 10-10 risk-e1prep 沿用
- 争议焦点:STEPQuant 循环状态量化失败模式在生产推理引擎的稳定性 + 与 FP8 KV-cache + MXFP8 + NVFP4 跨平台 ROI 评估
- 本棒位判断:沿用 D252 · 截止 10-12 morning 棒前 · 不升档
矛盾 5 · vLLM→llm-d→控制平面演化综述 arXiv:2609.23130 引用数据独立验证 ⚠⚬⚬(沿用 D253)
- 本窗口期新增证据:0 件新证据(v3.55 morning 已锚)
- 来源:v3.55 morning §3 D253 + flyp 10-10 risk-e1prep 沿用
- 争议焦点:vLLM→llm-d→控制平面演化综述引用数据来自生产报告(Tesla/Red Hat/KServe)条件受限,需独立验证 + 与 NVIDIA Dynamo v1.5.0 Feature Matrix 对比
- 本棒位判断:沿用 D253 · 截止 10-12 morning 棒前 · 不升档
矛盾 6 · MLPerf Inference v6.1 9 月 30 日发布数据 ⚠⚬(沿用 D254)
- 本窗口期新增证据:0 件新证据(v3.55 morning 已锚)
- 来源:v3.55 morning §3 D254 + flyp 10-10 risk-e1prep 沿用
- 争议焦点:MLPerf Inference v6.1 9 月 30 日发布数据与 v6.0 B200 8 卡基线对比 + gpt-oss-120b Server 8 卡 vs 8+ 卡多 GPU 配置的可外推性 + Edge Agentic test 在生产环境的稳定性
- 本棒位判断:沿用 D254 · 截止 10-12 morning 棒前 · 不升档
矛盾 7 · jay engineering 主轴 e1prep 已承接大部分 engineering 主轴 = stephen engineering 主轴 e1prep 缺失影响有限 ⚠⚬⚬(stephen 协调档 §4.3 必须人工确认 #6)
- 本窗口期新增证据:stephen coordination-noon §4.3 必须人工确认 #6 = stephen 仅产出 ai-industry-e1prep + llm-application-e1prep(10-09 沿用),无 engineering 主轴 e1prep;但 jay 10-10 0820 csdn-inference-rag-multiagent-highfreq + ai-engineering-trending-oct + jay-five-category-briefing 三件 + jay 10-10 11:20 engineering-e1prep 19KB 已覆盖大部分 engineering 主轴
- 来源:stephen coordination-noon + jay 10-10 0820 + jay 10-10 0935 + jay 10-10 15:05 + jay 10-10 11:20 engineering-e1prep
- 争议焦点:是否需要补 engineering 主轴 e1prep,或合并到 ai-industry 主轴承接
- 本棒位判断:建议沿用 stephen 协调档 #6 判定 · jay 10-10 11:20 engineering-e1prep 已承接大部分 engineering 主轴 = stephen engineering 主轴 e1prep 缺失影响有限 · evening 棒位之前补或合并到 ai-industry 主轴承接二者择一
三、v3.55 morning 沿用稳态项复盘(本棒位重新确认)
⚠ 本窗口期 v3.55 morning 全部 6 NET-new arXiv ID + 9 NET-new URL + 6 矛盾续写 + C353-C356 候选预备级 + O569-O576 + P0 #289 + P0-10 = 全部沿用稳态,无新增突破:
沿用稳态项 1 · galahad-kv arXiv:2610.10845 50M Token NVMe 持久化 ⭐⭐⭐⭐
- v3.55 状态:KV Cache 持久化纪元 + Memory-as-a-Layer 范式预备级第 1 例 · 100/100 探测块 byte-exact 加密 NVMe 加载无重计算
- 本棒位新增:0 件新证据(v3.55 morning 已锚;周六低活动度)
- 承接路径:§1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness + Memory 第十四栖「NVMe 持久化 Memory」预备第 1 例
沿用稳态项 2 · Foundations of LLMs arXiv:2501.09223 教科书承接级 ⭐⭐⭐
- v3.55 状态:教科书承接级备查资源预备第 N 例 · 第六章"inference" + 第六章"reasoning"
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
- 承接路径:§1.(1) 推理引擎方法学 + §1.(6) 长上下文承接级备查资源
沿用稳态项 3 · Cascadia arXiv:2610.07219 消费级 975B MoE ⭐⭐⭐⭐
- v3.55 状态:消费级硬件 + 超大 MoE 推理 + NVFP4 预备级第 1 例 · 与 v3.54 Colibri + SlimWise + NeMo-DCR 形成「消费级 + 服务级 + 数据中心级 + 万亿 Agentic RL」四栖预备级
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
- 承接路径:§1.(10) MoE 推理 + §1.(13) AI for Systems 五栖预备级
沿用稳态项 4 · SpecScale arXiv:2609.39334 投机解码系统级条件量化 ⭐⭐⭐⭐
- v3.55 状态:投机解码开销 vs 收益临界条件量化预备级第 1 例
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
- 承接路径:§1.(5) 投机解码 + §1.(1) 推理引擎方法学
沿用稳态项 5 · vLLM→llm-d→控制平面演化综述 arXiv:2609.23130 ⭐⭐⭐⭐⭐
- v3.55 状态:推理控制平面演化叙事预备级第 1 例 · Tesla/Red Hat/KServe prefix-cache-aware routing Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐 + 2× TTFT 改善
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
- 承接路径:§1.(1) 推理引擎方法学 + 推理控制平面演化叙事 + 与 vLLM Production Stack + V1 MRv2 + SGLang vs vLLM + llm-d CNCF Sandbox 形成「推理引擎代际切换 + Agent 框架代际切换 + 推理控制平面演化叙事」三栖预备级
沿用稳态项 6 · STEPQuant arXiv:2609.38169 100▲ HF Daily 量化失败模式 ⭐⭐⭐
- v3.55 状态:量化失败模式分析预备级第 1 例
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
- 承接路径:§1.(4) 量化 + §1.(1) 推理引擎方法学
沿用稳态项 7 · MLPerf Inference v6.1 9 月 30 日发布 ⭐⭐⭐⭐⭐
- v3.55 状态:5.7× 单加速器 + 16/30 submitters API-centric + Edge Agentic test VLM-Interactive gpt-oss DeepSeek-R1 Llama 3.1-8B text-to-video
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
- 承接路径:§1.(13) AI for Systems 闭环 + 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖预备级
沿用稳态项 8 · 6 件承接稳态精修预备级锚定承接(Stack Overflow Blog Part 5 + Agent Memory 三层 + vLLM 2026 Infrastructure Engineer Guide + vllm.cpp C++ + HF Agent Glossary + MLPerf v6.1)
- v3.55 状态:6 件承接稳态精修预备级全部沿用
- 本棒位新增:Stack Overflow Part 6 LLM System Operability 第 6 级预备级承接稳态精修预备级第 7 例锚入(jay 10-10 11:20 · 10-10 新发布 · Platform Design / failure asymmetry / 跨租户隔离 / Gateway 单点)
- 承接路径:§1.(1) 推理引擎方法学 + §1.(11) Kernel/AI 自动化/Harness + §1.(13) AI for Systems 闭环
沿用稳态项 9 · 立标延革预备承接稳态 + 立标池第 70→71 日承接稳态 + 6 矛盾续写 D249-D254 + C353-C356 候选预备级 + O569-O576 + P0 #289 + P0-10
- v3.55 状态:承接稳态期延续预备级 · 6 矛盾续写全部沿用
- 本棒位新增:0 件新证据(v3.55 morning 已锚)
四、可引用的 arXiv 号列表(本棒位新增或承接级锚入)
4.1 NET-new arXiv ID(0 件)
本窗口期 NET-new arXiv ID = 0 件 · 24h 滑动窗口内(2026-10-09 18:40 → 2026-10-10 18:40)无 NET-new arXiv ID 入池 · 承接 v3.55 morning 459→465 沿用基线
4.2 承接稳态精修预备级锚入 arXiv ID(本棒位承接级预备)
| arXiv ID | 标题 | 承接路径 |
|---|---|---|
2609.39068 |
SparseEngine · 稀疏优先推理引擎(13▲ HF Daily 10-10) | §1.(1) 推理引擎 → 6 引擎量化矩阵承接稳态精修预备级锚入第 1 例 |
2610.12338 |
VFold · 跨层 Value Cache 压缩(Cool Papers 10-10 net-new) | §1.(3) KV Cache + §1.(4) 量化承接稳态精修预备级锚入 |
2610.12274 |
HarnessSQL · Harness 原生 SQL Agent 训练(Cool Papers 10-10 net-new) | §1.(11) Kernel/AI 自动化/Harness 承接稳态精修预备级锚入 |
2608.01526 |
OSDI 2026 KV Cache Disaggregation "An Internet for the KV Cache"(已入 v3.55 morning arXiv 全量清单) | §1.(3) KV Cache 承接稳态精修预备级锚入补强第 1 例 |
4.3 承接级邻接 arXiv ID(非 llm-infra 主分类,邻接级承接)
| arXiv ID | 标题 | 主分类 | 邻接承接路径 |
|---|---|---|---|
2610.11794 |
Memento 3 · Model-Based RSI via Reflective Rulebooks | agent · engineering 副 | §1.(11) Kernel/AI 自动化/Harness · Memory 第十五栖预备邻接第 1 例 |
2610.11287 |
REMORY · Residual Memory for Context Compaction | agent | §1.(11) Kernel/AI 自动化/Harness · Memory 第十五栖「残差记忆网络」预备邻接第 1 例 |
2610.12183 |
Agentic BBO · Benchmarking LLM Agents for Black-Box Optimization | agent · evaluation 副 | §1.(13) AI for Systems 闭环 · 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖邻接第 N 例 |
2610.12410 |
用价值表征预测对齐泛化 | agent | §1.(11) 邻接 |
2610.12376 |
Latent Core Tokenizer | agent | §1.(11) 邻接 |
2610.12367 |
SGUID 该蒸馏哪个 Skill | agent | §1.(11) 邻接 |
4.4 v3.55 morning 已锚入基线 arXiv ID(沿用稳态,本棒位未变动)
| arXiv ID | 标题 | v3.55 承接路径 |
|---|---|---|
2610.10845 |
galahad-kv · 50M Token NVMe 持久化 ⭐⭐⭐⭐ | §1.(3) KV Cache + §1.(11) · Memory 第十四栖 |
2501.09223 |
Foundations of LLMs 教科书承接级 ⭐⭐⭐ | §1.(1) 推理引擎方法学 + §1.(6) 长上下文承接级备查资源 |
2610.07219 |
Cascadia · 消费级 975B MoE ⭐⭐⭐⭐ | §1.(10) MoE 推理 + §1.(13) AI for Systems |
2609.39334 |
SpecScale · test-time scaling 投机解码 ⭐⭐⭐⭐ | §1.(5) 投机解码 + §1.(1) 推理引擎方法学 |
2609.23130 |
vLLM→llm-d→控制平面演化综述 ⭐⭐⭐⭐⭐ | §1.(1) 推理引擎方法学 + 推理控制平面演化叙事 |
2609.38169 |
STEPQuant · 100▲ HF Daily 量化失败模式 ⭐⭐⭐ | §1.(4) 量化 + §1.(1) 推理引擎方法学 |
五、本棒位综合判断
5.1 增量密度评估
- 本日增量密度 = 低(承接稳态期 + 周六低活动度)
- NET-new arXiv ID = 0 件(24h 滑动窗口内无 NET-new)
- NET-new paper_card = 0 件(10-10 morning 入池 9 件全部为 agent 主分类或 agent 邻接级;0 件 llm-infra 主分类真新卡)
- 承接稳态精修预备级锚入 = 4 件(SparseEngine + VFold + HarnessSQL + Stack Overflow Part 6 LLM Operability)
- 承接级邻接 = 3 件(Memento 3 + REMORY + Agentic BBO)
- 承接级细化 = 1 件(阿里云函数计算 vLLM vs SGLang 实测数据点)
- 矛盾/待核续写 = 6 件(沿用 v3.55 morning D249-D254 + 1 件 stephen 协调档承接判定)
5.2 v3.55 morning 沿用稳态
- 6 NET-new arXiv ID 全部沿用(galahad-kv + Foundations + Cascadia + SpecScale + vLLM→llm-d 综述 + STEPQuant)
- 9 NET-new URL 全部沿用(含 Spheron H100 三引擎实测 + Crusoe Managed Inference + SGLang vs vLLM 跨源三确认 + MLPerf Inference v6.1 等)
- 6 件承接稳态精修预备级全部沿用 + 1 件新增(Stack Overflow Part 6)
- C353-C356 候选预备级全部沿用(galahad-kv KV Cache 持久化纪元 + Cascadia 消费级 975B MoE + vLLM→llm-d 综述 + MLPerf v6.1)
- O569-O576 + P0 #289 + P0-10 全部沿用
- 6 矛盾续写 D249-D254 全部沿用
5.3 知识库活文档本次
- arXiv ID 全量清单 = 465 件 = 0 件 NET-new · 24h 滑动窗口内承接稳态
- URL 全量清单 = 616 件 = 0 件 NET-new · 24h 滑动窗口内承接稳态
- CVE = 36 件 · DOI = 15 件 = 全部沿用稳态
- P0 警示池 = #1-#289 沿用 + P0-10 沿用 = 全部沿用稳态
5.4 后续棒位建议
- 建议 1:沿用 v3.55 morning 承接稳态期 + 本棒位承接稳态精修预备级锚入承接级细化(SparseEngine / VFold / HarnessSQL / Stack Overflow Part 6 + Memento 3 / REMORY / Agentic BBO 邻接承接)
- 建议 2:沿用 v3.55 morning 6 矛盾续写 D249-D254 · 截止 10-12 morning 棒前(周六低活动度 + 无新证据)
- 建议 3:建议 evening 棒位之前补 engineering 主轴 e1prep 或合并到 ai-industry 主轴承接(stephen 协调档 §4.3 必须人工确认 #6 承接判定)
- 建议 4:本棒位 0 件 NET-new arXiv ID = 无需升档 · 沿用 v3.55 morning 棒位承接稳态期
- 建议 5:建议 10-12 morning 棒位重新激活立标延革预备 140-142 例预备承接稳态期(Memento 3 / REMORY / Agentic BBO 邻接承接 → §IX 114 morning 棒位预备候选)
5.5 与 v3.55 morning 体系预备级承接
- 2026 Q4 初 llm-infra 工程化完成级 + AI Agent 优化推理系统 + KV Cache 持久化纪元 + Memory-as-a-Layer 范式 + 消费级超大 MoE 推理 + 投机解码系统级条件量化 + 推理控制平面演化叙事 + LLM Operability 6 级成熟度 + Agent Memory 三层架构 + 推理引擎代际切换双栖 + 推理框架代际切换双栖 + AI for Systems 五栖 + 评测方法学 frontier lab × 第三方 × 官方赛场 × AI Agent 自动四栖预备级 + Harness vs Scaffold 术语统一 = 体系预备级全部沿用稳态
- 本棒位新增承接稳态精修预备级扩增:Stack Overflow Part 6 LLM System Operability 第 6 级 + SparseEngine 稀疏推理引擎维度 + VFold 跨层 Value Cache 压缩 + HarnessSQL Harness 原生 SQL Agent 训练 + Memento 3 / REMORY / Agentic BBO 邻接承接
5.6 evening 棒位预备候选
- §IX 113 evening v3.55 morning 棒位承接稳态期延续(承接 v3.55 morning 6 NET-new arXiv + 9 NET-new URL + 6 矛盾续写 + 6 件承接稳态精修预备级锚定承接)
- §IX 114 morning 棒位预备候选:立标延革预备 140-142 例预备承接稳态期 + Memento 3 / REMORY / Agentic BBO 邻接承接 + 4 件承接稳态精修预备级扩增 + 6 矛盾续写(D249-D254)继续延革
本次变更
2026-10-10 18:40 CST(E1 §IX 113 evening 棒位预备)
v3.55 evening 棒位预备(本轮):🌅 24h 滑动窗口期(2026-10-10 05:00 → 2026-10-10 18:40 CST · §IX 113 morning v3.55 morning 全量沿用基线 · 6 NET-new arXiv 459→465 + 9 NET-new URL 607→616 全部沿用) + 0 NET-new arXiv ID(24h 滑动窗口期承接稳态期内无 NET-new arXiv ID 入池 · 周六低活动度)+ 0 NET-new paper_card llm-infra 主分类真新卡(10-10 morning paper_cards 1744/1747/1748/1750 全部为 agent 主分类或 agent 邻接级)+ 0 NET-new CVE/DOI/URL + 4 件承接稳态精修预备级锚入(① SparseEngine arXiv:2609.39068 13▲ HF Daily 10-10 · 稀疏优先推理引擎 + ② VFold arXiv:2610.12338 跨层 Value Cache 压缩 + ③ HarnessSQL arXiv:2610.12274 Harness 原生 SQL Agent 训练 + ④ Stack Overflow Part 6 LLM System Operability 第 6 级预备级承接稳态精修预备级第 7 例锚入 = Part 5 第 5 级沿用 + Part 6 第 6 级新增)+ 3 件承接级邻接 arXiv ID 锚入(① paper_card 1744 Memento 3 arXiv:2610.11794 engineering 副承接 + ② paper_card 1748 REMORY arXiv:2610.11287 Memory 第十五栖预备邻接第 1 例 + ③ paper_card 1747 Agentic BBO arXiv:2610.12183 评测方法学四栖邻接第 N 例)+ 1 件承接级细化数据点(阿里云函数计算 SGLang vs vLLM 实测:SGLang TTFT 优 15-50% / TPOT 优 10% / 吞吐优 10% / 启动快 30% = 实验室 H100 + 阿里云函数计算 + Spheron 跨源三层确认预备扩增)+ 6 矛盾续写 D249-D254 全部沿用 + 1 件 stephen 协调档承接判定(engineering 主轴 e1prep 已承接大部分 engineering 主轴 = stephen engineering 主轴 e1prep 缺失影响有限)+ j 10-10 11:20 engineering-e1prep 19KB 主棒位承接 + inference.md 10-10 午 update 主动吸纳 + tom 10-10 0900 HF Daily 15 件承接稳态第 10 日 + arXiv ID 全量清单 465 件承接稳态 = 0 件 NET-new + 本棒位综合判断 = 承接稳态期延续 + 周六低活动度 + 0 件 NET-new arXiv ID + 4 件承接稳态精修预备级扩增 + 6 件矛盾续写继续延革 → §IX 113 evening 棒位承接稳态期延续 + §IX 114 morning 棒位预备候选(立标延革预备 140-142 例预备承接稳态期 + Memento 3 / REMORY / Agentic BBO 邻接承接 + 4 件承接稳态精修预备级扩增 + 6 矛盾续写继续延革)。