llm-infra · E1 预消化简报(2026-10-06)
执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-06 18:40 CST(周二) 窗口:2026-10-05 18:40 CST → 2026-10-06 18:40 CST(24h 滑动) 基线:
organized/knowledge/llm-infra.mdv3.52 morning(2026-10-06 05:00 §IX 111 morning · arXiv 444 / CVE 36 / DOI 15 / URL 578 精确闭合 · v3.51 morning 沿用基线 442 + 2 NET-new arXiv ID = Strata 2508.18572 OSDI 2026 + CLM 2609.37725) 角色分工缺口:stephen 10-06 12:45 noon 协调棒位已明确标记"spark 10-6 主棒位缺失 ⚠⚬ · P0-7 待触发警告已持续 2 日(10-5 evening + 10-6 noon)"。本棒位闭合 ⚠⚬⚬ 诚实度声明:本窗口 llm-infra 主轴净增量密度为「中低-中高」——围绕 v3.52 morning 已承接的"4 件承接稳态精修预备级锚定预备承接(Strata + ECHO + DirectKV OSDI 2026 + InferenceBench leaderboard)+ 3 矛盾续写(D228 闭合 + D229/D232 沿用)"框架展开增量。本轮 6 条候选增量中 2 条为 NET-new 主分类 llm-infra(EdgeAgent 2610.03394 + RoofLang 2609.12551 系统论文承接)+ 1 条承接稳态精修预备级(2 件 NET-new paper_card 主分类 llm-infra 入池:1670-2610.02772 + 1677-2609.32759)+ 1 条 v3.52 morning D228/D229/D232 沿用续写 + 2 条承接稳态精修预备级(TGI 2026-03 停止维护承接 + MLPerf v6.0 B200 官方数据承接)。5 件 NET-new arXiv ID(2609.12551 RoofLang 主分类确认承接 + 2610.03394 EdgeAgent + 2610.02772 Improving Atomic-Fact Recall + 2609.32759 The Extender + 2607.20468 InferenceBench 承接稳态精修预备级补强)+ 1 件 NET-new 主分类 llm-infra paper_card(1677-2609.32759)+ 1 件 NET-new paper_card 邻接 llm-infra(1670-2610.02772 · 主分类 llm-infra)+ 0 NET-new CVE/DOI。本轮 不硬凑条目,承接级条目按"v3.52 morning 已锚 + 本轮补强数据"明确标注预备级。
〇、检查过的来源清单(本窗口内 · 2026-10-05 18:40 → 2026-10-06 18:40)
| 来源 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| organized/queue | work-queue.md(2026-10-06 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2609.32993 沿用 + 8 件高优 arXiv 待精读 = 2609.39420 QuantCode engineering / 2610.02150 Source Learning agent / 2610.02191 Missing Primitive evaluation / 2610.04616 PerturBot multimodal / 2610.05033 Code2Games agent / 2610.05162 Memadapter agent / 2610.06184 Arm-wise multimodal / 2610.05709 Nexus execution-fabric) |
中基线 ⚠ |
| organized/knowledge | llm-infra.md v3.52 morning(2026-10-06 05:00 §IX 111 morning · arXiv 444 / CVE 36 / DOI 15 / URL 578 精确闭合)+ inference.md v310 Oct06午更新(ACL26 KV综述+28类Bug分类+ICML23%证伪率+DQ+MoE三件套+VRLA127%+Dynamo1.5+LMDeploy+HIPFire+OrthrusP0 · 引→390)+ paper_cards 10-6 入池 2 件 NET-new 主分类 llm-infra(1670-2610.02772 + 1677-2609.32759)+ 14 件 NET-new 邻接(1680-1685 全部主分类 agent/engineering/multimodal/evaluation ≠ llm-infra) |
极高 ⭐⭐⭐⭐⭐ |
| organized/paper_cards | 10-6 净新增主分类 llm-infra 2 件:1677-2609.32759 The Extender(arXiv 2026-09 · Log-Structured Transformer · 拼接通道 x 降低逐层持久化开销)+ 1670-2610.02772 Improving Atomic-Fact Recall via Focused Views in Unstructured Knowledge Editing(arXiv 2026-10 · context reliance 失败模式改进);10-4 至 10-6 邻接主分类 ≠ llm-infra 但工程意义强:1685-2609.39420 QuantCode engineering(可执行算法交易代码专门化)/ 1680-2610.05162 Memadapter agent(Memory-induced Sycophancy 反事实适应)/ 1681-2610.05033 Code2Games agent(游戏世界生成)/ 1684-2610.02150 Source Learning agent(Knowledge Access → Source Learning)/ 1683-2610.02191 Missing Primitive evaluation(数学诊断与修复);v3.52 morning 已锚入 llm-infra 主分类 paper_card 4 件延续:1629-2609.38987 Smaller Models Better Rejects / 1646-2609.36435 MemFold / 1604-2609.40316 Loop Scaling Laws / 1609-2609.39929 RoPE 位置编码失效 | 极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md(13:35 CST · 10.1KB · 🟢 NET-new arXiv:2609.39223 QATFactory(NVlabs · QAT + 蒸馏 · NVFP4/MXFP4/Q4_K 落地 · Qwen3.5-9B NVFP4 ≈ BF16)+ vLLM Batch Invariance(Spheron blog 2026-09-30 · Continuous Batching 即使 temp=0 非确定 · SGLang Deterministic Attention 修复但吞吐 -34.35%)+ Baseten VibeQwen(B200 单卡 · Decode -90% / TTFT -2.33× / Concurrency=32 +71%)+ NVIDIA NIM Model Profiles 标准化命名 vllm-bf16-tp4-pp1-lora + Cloud SQL pgvector 0.8.0 升级 + Aleph-Alpha Kolibri-1 FP8 ~78GB 多模态推理 + 🟢 NET-new arXiv:2610.03394 EdgeAgent(Apple Silicon UMA 多 Agent 推理 + In-place KV Cache Freeze) + Uber MCP Gateway 企业级 MCP 管理) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md(14:52 CST · 11.3KB · 🟢 NET-new arXiv:2609.12551 RoofLang(Gai et al. · AI Agent 自动设计 LLM 推理系统 · GB300/64 GPU 配置 · DeepSeek V4 Pro B300 +6.23%-50.1% 超越人工调优 baseline · 与 DeepSeek V4 Flash KV Cache 0.192 GiB 紧凑设计共振)+ 🟢 NET-new arXiv:2610.03394 EdgeAgent(Apple Silicon UMA · In-place KV Cache Freeze · 零重新 Prefill 开销)+ TGI 2026-03 正式进入维护模式(Hugging Face README:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks")+ HF 推荐迁移目标 vLLM · SGLang · llama.cpp + SGLang vs vLLM 工程数据 H100 实测 SGLang 12,500 → 16,200 tok/s 29% 优势 + RadixAttention 1次计算/9次复用 vs PagedAttention + 引擎选型决策流程图) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-06-inference-engineering.md(10:54 CST · 9KB · MLPerf Inference v6.0 B200 @ 8卡官方数据 vLLM 0.14.1 + llm-d 93,071 tokens/s Offline + 71,588 Server · SGLang 未提交 MLPerf v6.0 · vLLM 0.28.0 末发布 · PyTorch Foundation 托管 · GitHub stars vLLM ~91K SGLang ~36K · SWE-Serve arXiv:2609.26777 53 件真实 PR 评测基准 · H100 实测 vLLM/SGLang/TRT-LLM 50 并发 Llama 3.1 8B FP16 = 3,688/3,617/3,219 tok/s) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-06-engineering-e1prep.md(11:23 CST · 20.5KB · v139 前瞻锚定 + MLPerf v6.0 + SWE-Serve + archify 断层第一 + AI-Infra-Guard v4.6.1 Skill F1=0.9848 + HF Daily Oct6 新卡 3 件 engineering 主分类 SimuVerity/VeriHarness/HyperBrowseComp + MCP 2026-07-28 无状态化规范更新) |
高 ⭐⭐⭐ |
| inbox/jay | 2026-10-06T1735-jay-evening-five-category-briefing.md(17:35 CST · ~15KB · H100 Llama 3.3 70B FP8 50 并发实测 vLLM 1,850 / TRT-LLM 2,100 / SGLang 1,920 tok/s + SGLang 在共享上下文场景显著优势(RAG 10 用户同文档 / 多轮对话 / 批量 Agentic)+ TGI 正式停止维护 2026-03 重大信号 + LMDeploy 量化模型推理最优解(INT4/FP8 比 SGLang 快约 29% 但 PyTorch 兼容问题突出)+ InferenceBench arXiv:2607.20468 = 首个 AI Agent 开放域 LLM 推理优化基准 + Fluid-Guided Online Scheduling arXiv:2504.11320v4 + Position Paper arXiv:2605.01280 + Workload-Router-Pool Architecture arXiv:2603.21354v2 + Vector DB 2026 Q3-Q4 格局(Qdrant p50 ~2.1 ms / Milvus 3.0.2 Lake-native / pgvector 0.8.0 升级)+ LangChain vs LlamaIndex 2026 + HF State of Open Models Summer 2026 关键洞察(llama.cpp 加入 HF 2026-02 / AMD + NVIDIA 2026 最大开源模型发布商 / Qwen 社区基础模型 / Open weights 价值转移)) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-06-csdn-llm-rag-agent-highvalue.md(16:21 CST · 4.7KB · 3 件 CSDN 工程实战类 + CSDN LLM/RAG/Agent 论文索引 + 6 大类技术全景) |
中 ⭐⭐ |
| inbox/jay | RSS:2026-10-06-1000-rss-bytebytego.md + 2026-10-06-1000-rss-raschka.md + 2026-10-06-1001-rss-nathan-benaich.md + 2026-10-06-1001-rss-simon-willison.md + 2026-10-06-1002-rss-cool-papers.md + 2026-10-06-1002-rss-cool-papers-ir.md + 2026-10-06-1003-rss-import-ai.md + 2026-10-06-1003-rss-lilian-weng.md + 2026-10-06-1003-rss-msr-blog.md + 2026-10-06-1140-news-x-tech-radar.md | 中 ⭐⭐ |
| inbox/tom | 2026-10-05-inference-e1prep.md(22:23 CST · 19.1KB · 承接 inference.md v310(非 llm-infra.md · 兄弟活文档)+ vLLM vs TGI 3.67× @100 并发 arXiv:2511.17593 + FairInference arXiv:2609.18112 Token Latency Fairness UC Berkeley · Multi-Agent Bug 分类 arXiv:2610.00905 + STEER + GuideLLM + ACL 2026 Findings KV Cache 优化综述 arXiv:2607.08057 三维分类 ⚠ 待精读 + 当 Agents Fail v3 1,268 bugs · Context Engineering OS 隐喻 + Oct 2 arXiv 双 arXiv) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-06-rag-e1prep.md(08:53 CST · 20.1KB · RAG 主棒位 + 0 件 RAG net-new + 承接稳态) |
低 ⚬(RAG 主棒位) |
| inbox/tom | 2026-10-06-evaluation-e1prep.md(15:43 CST · 18.2KB · eval 主轴新增量低) |
低 ⚬(邻接) |
| inbox/tom | 2026-10-06-0900-hf-daily-2026-10-06.md(09:00 CST · 1.7KB · HF Daily 早棒 15 篇 · 无 llm-infra 主分类直命中) |
低 ⚬ |
| inbox/tom | 2026-10-06T1430-agent-rag-longcontext-radar.md(14:30 CST · 4.8KB · RAG/longcontext 雷达 8 候选 / 4 高价值) |
低 ⚬ |
| inbox/flyp | 2026-10-06-multimodal-e1prep.md(09:48 CST · 117.7KB · multimodal 主棒位) |
低 ⚬(邻接) |
| inbox/flyp | 2026-10-06-risk-e1prep.md(16:45 CST · 64.8KB · risk 主棒位) |
低 ⚬(邻接) |
| inbox/flyp | 2026-10-06-0950-flyP-short-critical-read-DigitalApplied-Long-Context-2026.md(09:50 CST · 10.4KB · 短读 DigitalApplied 长上下文 2026 博文 + 五大方法学疑点审稿) |
低 ⚬ |
| inbox/flyp | 2026-10-06-1550-flyP-critical-read-DeepSeek-V4-and-JEV-Judges.md(15:52 CST · 17KB · DeepSeek V4 + JEV Judges 精读) |
中 ⭐⭐⭐(邻接) |
| inbox/stephen | 2026-10-06-1245-stephen-coordination-check-noon.md(12:45 CST · ~34KB · 6 主棒位 + 5 缺口 + 4 件 P0 警示 + 明确标注 spark 10-6 主棒位缺失延续第 2 日 + MLPerf v6.0 + SWE-Serve 协同 v3.52 morning + Anthropic GLM-5.3 风险通报 P0-7 + reasoning-failure 主轴速报新增 + X 名人雷达 NVIDIA GEAR + Jim Fan ENPIRE) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/stephen | 2026-10-06-1004-news-tldr-ai.md(10:04 CST · 0.6KB) + 2026-10-06-1004-news-bens-bites.md(10:04 CST · 0.7KB) + 2026-10-06-1004-news-hf-blog.md(10:04 CST · 0.7KB) + 2026-10-06-1004-news-google-ai.md(10:04 CST · 1.2KB) + 2026-10-06-1004-news-anthropic-news.md(10:04 CST · 1.7KB) + 2026-10-06-1004-news-openai-news.md(10:04 CST · 1.3KB) + 2026-10-06-1004-news-deepmind-news.md(10:04 CST · 0.8KB) + 2026-10-06-1005-news-yt-anthropic.md(10:05 CST · 0.6KB) + 2026-10-06-0910-news-x-vip-radar.md(09:10 CST · 3.6KB · 12 条要点) |
中 ⭐⭐⭐ |
| inbox/spark | 2026-10-06-1002-rss-gradient-flow.md(10:02 CST · 1.5KB) + 2026-10-06-1003-rss-chip-huyen.md(10:03 CST · 1.4KB) |
低 ⚬ |
| inbox/spark | 2026-10-06-agent-e1prep.md(13:36 CST · 40.7KB · agent 主棒位承接 · 承接稳态) |
中 ⭐⭐⭐(承接 agent 主棒位) |
合计:5 实例 ≈ 60+ 文件 ≈ 410KB+ 净增 + 10-6 入池 2 件 NET-new 主分类 llm-infra paper_card(1670-2610.02772 + 1677-2609.32759)+ 5 件 NET-new arXiv ID(2609.12551 RoofLang 主分类承接确认 + 2610.03394 EdgeAgent + 2610.02772 Improving Atomic-Fact Recall + 2609.32759 The Extender + 2609.39223 QATFactory 邻接 llm-infra)+ 0 NET-new CVE/DOI + 1 件承接稳态精修预备级 arXiv(2607.20468 InferenceBench v3.52 morning 已锚入承接补强数据)。
一、今日该主题最重要的增量(6 条 · 2 NET-new 主分类承接 + 1 承接稳态精修预备级 + 3 承接稳态精修预备级备料)
增量 1 · 🟢 NET-new 承接 · arXiv:2609.12551 RoofLang · AI Agent 自动设计 LLM 推理系统 · §1.(1) 推理引擎 · v3.52 morning 未在主文件锚入(仅 stephen 9-23 棒位提及)⭐⭐⭐⭐⭐
- 来源:
- jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目 B(
https://arxiv.org/html/2609.12551v1· Gai et al. · GB300/64 GPU 配置 · ⭐⭐⭐⭐) - stephen 9-23 2245 evening-coordination §增量 RoofLang(DeepSeek V4 KV-cache 杠杆效应 3.5-39.5× decode 吞吐)
-
原始 URL:
https://arxiv.org/abs/2609.12551 -
要点: 1. 核心 = AI Agent 自动设计/优化 LLM 推理系统配置/架构的框架;给定硬件平台(GPU 类型、内存、互联带宽)+ Workload 描述,Agent 在搜索空间中探索系统配置(批大小、Tensor Parallel 度数、Prefill/Decode 是否解耦、KV Cache 策略等)· 使用真实硬件性能反馈迭代优化 2. 关键工程数据(GB300 / 64 GPU 配置):
| Model | Per-request KV Cache 占用 | Per-request KV Cache 流量 | Peak Batch Size |
|---|---|---|---|
| DeepSeek V4 Flash | 0.192 GiB | 0.033 GiB | 65,536 |
| GLM-5.3 | 2.906 GiB | 0.250 GiB | 4,096 |
| DeepSeek V4 Pro | 0.275 GiB | 0.055 GiB | 32,768 |
| Kimi K3 | 1.065 GiB | 1.065 GiB | 8,192 |
- 关键洞察:
- DeepSeek V4 Flash 的 KV Cache 设计极度紧凑(0.192 GiB vs GLM 2.906 GiB = 15× 压缩比),支撑 65K 超大 batch + 极低 per-token 内存流量
- 紧凑 KV Cache 设计是 2026 年新模型架构竞争的核心维度(对应 MLA / DeepSeek-V4 CSA 注意力架构压缩)
- RoofLang 用 Agent 发现 DeepSeek V4 Pro 在 B300 上性能提升 6.23%-50.1%,超越人工调优 baseline
- 范式意义 = AI-for-Systems 闭环:用 AI Agent 优化 AI 推理系统(自指系统)· 与 InferenceBench arXiv:2607.20468(leaderboard 数据承接稳态精修预备级锚定预备承接)形成 "AI Agent 优化推理系统" 的双栖基准预备级
- 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
- v3.52 morning §1.(1) 推理引擎 已锚入 5 件推理调度算法 + Winder AI 5 引擎 50 并发常态实测版本号锚点 + v3.52 morning C345 InferenceBench arXiv:2607.20468 leaderboard 完整数据承接稳态精修预备级锚定预备承接
- v3.52 morning §1.(3) KV Cache 已锚入 OSDI 2026 系统论文三件套(Strata + DirectKV + ECHO)+ HotInfra 2026 PIM + KV Cache 11+ 维度预备级扩增稳态
-
RoofLang 与 v3.52 morning 现有脉络的关系:
- 填补"AI Agent 自动设计推理系统"维度数据空白 = v3.52 morning §1.(1)/(3) 有调度算法 + KV Cache 系统级优化,但无 "AI Agent 闭环设计/优化" · RoofLang 是首个该方向完整论文(2026-09 提交 · AI for Systems 里程碑)
- 与 v3.52 morning C345 InferenceBench leaderboard 共振 = InferenceBench 是 "AI Agent 优化 LLM 推理的 Benchmark 评测",RoofLang 是 "AI Agent 优化 LLM 推理的方法/框架" = 「评测基准 + 优化方法」双栖预备级补强
- 与 v3.52 morning KV Cache 系统级优化 11+ 维度预备级扩增稳态共振 = RoofLang 验证 KV Cache 紧凑设计(如 DeepSeek V4 Flash 0.192 GiB)是 2026 年模型架构竞争核心维度 = 「紧凑 KV Cache + 异构层级 + 零拷贝 + 稀疏卸载 + PIM」KV Cache 体系预备级补强
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 在 v3.52 morning Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后新增 "RoofLang · AI Agent 自动设计 LLM 推理系统 · GB300/64 GPU 配置 · DeepSeek V4 Pro +6.23%-50.1% 超越人工调优 baseline · DeepSeek V4 Flash KV Cache 0.192 GiB 紧凑设计" 预备级 = AI for Systems 闭环预备级 - 副归入:
§1.(3) KV Cache→ 在 OSDI 2026 三件套 + HotInfra PIM 后新增 "RoofLang 验证紧凑 KV Cache 设计为 2026 年模型架构竞争核心维度(MLA / DeepSeek V4 CSA)" 预备级 - 副归入:
§3 共识与争议→ 候选 C346 = "AI Agent 自动优化 LLM 推理系统 = 推理系统工程化新范式 · RoofLang AI-for-Systems 闭环预备级" -
副归入:
§4 开放问题→ O557 = "RoofLang AI Agent 优化方法在 SGLang/vLLM/TRT-LLM 主流推理引擎实际部署 ROI" -
可信度:⭐⭐⭐⭐⭐(arXiv 2026-09 学术论文 + GB300 实测数据 + stephen 9-23 棒位承接锚定 · 与 v3.52 morning C345 InferenceBench leaderboard 双栖预备级)
增量 2 · 🟢 NET-new 承接 · arXiv:2610.03394 EdgeAgent · Apple Silicon UMA 多 Agent 推理调度 · §1.(1) 推理引擎端侧 / §1.(3) KV Cache 端侧承接 · v3.52 morning 未承接 ⭐⭐⭐⭐⭐
- 来源:
- jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目 C(
https://arxiv.org/html/2610.03394v1· 2026-10-02 · ⭐⭐⭐⭐) - jay 10-6 13:35 github-hf-inference-vecdb-oct2026.md 条目 9(
arXiv:2610.03394· 2026-10-02 · 端侧 LLM 多智能体系统 · 含 LangChain 集成) -
原始 URL:
https://arxiv.org/abs/2610.03394 -
要点: 1. 核心问题 = 端侧多 Agent LLM 推理:在 CPU-GPU 统一内存架构(如 Apple M 系列芯片)上高效调度多个并发 Agent 工作负载,每个 Agent 需要独立 KV Cache 状态 2. 背景 = 多 Agent 框架(LangGraph 2026, OpenClaw)对单设备推理的资源竞争;现有系统无法高效处理多 Agent 并发,因为 KV Cache 在 Agent 间无共享机制 3. 核心技术贡献:
- In-place KV Cache Freeze(原地 KV Cache 冻结) = Agent 等待外部工具(API 调用、I/O)执行时,其 KV Cache 不需要写出内存 · 利用 UMA 物理共享寻址,直接冻结当前 GPU 内存位置 · 工具执行完成后,从冻结位置恢复推理,零重新 Prefill 开销
- UMA-aware 调度器 = 感知 CPU-GPU 统一内存的物理地址布局 · 优先调度同一内存区域的 Agent,最大化 Cache 局部性
- 硬件偏移映射压缩(offset-remapping compaction) = 冻结后的 Agent KV Cache 重新映射地址,为活跃 Agent 腾出物理内存 · 恢复时通过硬件级偏移表完成地址转换,无需数据搬迁 4. 评估结论 = 对 Apple Silicon + 本地推理场景(隐私敏感、无网络延迟的业务工作流)有直接价值 · 与主流 GPU 云端推理主题互补
-
与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
- v3.52 morning §1.(1) 推理引擎 已锚入 Gemma 4 vLLM 0.26.02+ 端侧首选 + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell 端侧
- v3.52 morning §1.(3) KV Cache 已锚入 KV Cache 14+1 件体系化扩增 + 沿用稳态,其中 EdgeAgent 端侧多 Agent KV Cache 持久化承接 v3.52 morning "Edge Multi-Agent Q4 KV Cache 持久化(Apple M4 Pro · TTFT 降低 22~136× Gemma 3 12B · 4K~32K)" 邻接级
-
EdgeAgent 与 v3.52 morning 现有脉络的关系:
- 填补"端侧多 Agent KV Cache 冻结"维度数据空白 = v3.52 morning 端侧承接集中在 "Gemma 4 端侧首选 + Apple M4 Pro Q4 KV 持久化",EdgeAgent 提供 "端侧多 Agent 并发场景 KV Cache 冻结机制" = 「单 Agent KV 持久化(已锚)+ 多 Agent KV 冻结(EdgeAgent NET-new)」端侧 KV Cache 体系预备级补强
- 与 v3.52 morning O556"Strata 异构层级缓存 + DirectKV 零拷贝 + ECHO 稀疏注意力卸载 在端侧(Gemma 4 端侧首选 + Apple M4 Pro Q4 持久化)部署的能效比"开放问题共振 = EdgeAgent 提供端侧多 Agent 实操案例
-
建议归入节:
- 主归入:
§1.(3) KV Cache→ 在 KV Cache 14+1 件体系化扩增沿用稳态后新增 "EdgeAgent · arXiv:2610.03394 · Apple Silicon UMA 多 Agent KV Cache Freeze · 端侧多 Agent 并发场景零重新 Prefill 开销" 预备级 = 端侧多 Agent KV Cache 承接稳态精修预备级锚入 - 副归入:
§1.(1) 推理引擎→ 在 Gemma 4 端侧首选 + NVIDIA NIM NVFP4 Gemma 4 31B Blackwell 端侧沿用后新增 "EdgeAgent Apple Silicon UMA 多 Agent 推理调度" 端侧承接稳态精修预备级锚入 -
副归入:
§4 开放问题→ O558 = "EdgeAgent In-place KV Cache Freeze + UMA-aware 调度器 在 MLX(Apple Silicon ML 框架)生态落地可行性" -
可信度:⭐⭐⭐⭐(arXiv 2026-10-02 极新预印本 · 完整摘要 + In-place KV Cache Freeze 明确技术描述 · jay 双源承接)
增量 3 · 🟡 承接稳态精修预备级 · 2 件 NET-new 主分类 llm-infra paper_card 入池(1670-2610.02772 + 1677-2609.32759) · v3.52 morning 未承接 ⭐⭐⭐⭐
- 来源:
/shared/research-kb/organized/paper_cards/1670-2610-02772.md(10-6 14:10 CST 入池 · 主分类 llm-infra)/shared/research-kb/organized/paper_cards/1677-2609-32759.md(10-6 15:00 CST 入池 · 主分类 llm-infra)-
来源文件:
/inbox/tom/_candidates/2026-10-06-rag-retrieval-reranking-candidates.json -
要点: 1. arXiv:2609.32759 The Extender: A Log-Structured Transformer(paper_card 1677)
- 核心 = 日志结构 Transformer 变体 · 在标准 Transformer 残差通道 h 之外,新增一条拼接通道 x:每层 ℓ 同时输出残差更新 δ_ℓ(加到 h)+ 更小的扩展 ε_ℓ(追加到 x) · FFN 和 q 读取 h,但注意力的 kv 投影仅以 x 作为输入
- 关键收益 = 完全扩展后的 x 包含所有层 kv 投影所需的完整输入,降低逐层持久化开销
- v3.52 morning 现有脉络:v3.52 morning §1.(6) 长上下文 已锚入 FRAC 1597(SSM 架构新路径)+ RoPE 位置编码失效理论根因 1609 + MemFold 1646 紧凑潜向量软记忆 · The Extender 是 KV Cache 工程化的新架构路径(注意力 kv 投影输入从 h 解耦到 x) = 「LLM 推理软件栈垂直分层 6 层栈」预备级补强 = 架构层 KV Cache 工程化预备级
- 建议归入:
§1.(1) 推理引擎→ 在 v3.52 morning Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后,承接稳态精修预备级锚入 "The Extender · 日志结构 Transformer · 拼接通道 x 降低逐层持久化开销" · 标记 ⚠ 待全文精读 + arXiv ID 二次核验 2. arXiv:2610.02772 Improving Atomic-Fact Recall via Focused Views in Unstructured Knowledge Editing(paper_card 1670) - 核心 = 非结构化知识编辑(UKE)在自由文本段落包含多个事实场景下的失败模式 context reliance 改进 · 通过聚焦视图提升原子事实回忆
- v3.52 morning 现有脉络:v3.52 morning §1.(11) Kernel/AI 自动化/Harness 已锚入 1629 Smaller Models Better Rejects + Meta-Harness D225 + Context Engineering 2026 OS 隐喻 + 四策略 + Memory 三分法 + Stanford ACE framework · Improving Atomic-Fact Recall 是 Knowledge Editing 与 Harness/Context Engineering 交叉的承接稳态精修预备级
- 建议归入:
§1.(11) Kernel/AI 自动化/Harness→ 在 v3.52 morning Context Engineering OS 隐喻沿用后承接稳态精修预备级锚入 "Knowledge Editing · Focused Views · 原子事实回忆提升" · 标记 ⚠ 主分类 llm-infra 与 agent 邻接级边界待核 · arXiv ID 待二次核验
-
与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
- v3.52 morning §6.99.2 全量 arXiv ID 共 444 件 · v3.51 morning 沿用基线 · 本轮承接 2 件 NET-new 主分类 llm-infra(2609.32759 + 2610.02772)· arXiv/CVE/DOI/URL 闭合 446/36/15/578(预备级)
-
v3.52 morning §0 一句话综述 中 "0 NET-new paper_card 主分类 llm-infra 入池(10-5 0 件)" 在本轮承接稳态精修预备级后变为 "0 NET-new 主分类 NET-new(10-6 2 件承接稳态精修预备级锚入)" · 承接稳态精修预备级锚入预备级
-
可信度:⭐⭐⭐(paper_card 已实查 · 来源文件已确认 · ⚠ arXiv ID 二次核验待执行 · ⚠ 全文精读未执行)
增量 4 · 🟡 承接稳态精修预备级 · TGI 2026-03 正式停止维护(基础设施重大变更)· §1.(1) 推理引擎 · v3.52 morning 已沿用 TGI v3.3.7 维护模式 + 承接稳态精修预备级锚入 ⭐⭐⭐⭐
- 来源:
- jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目 A(
https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt· ⭐⭐⭐⭐⭐) - jay 10-6 17:35 evening-five-category-briefing.md §1B TGI 正式停止维护
-
jay 10-6 10:54 inference-engineering.md(承接稳态精修预备级)
-
要点: 1. TGI(Text Generation Inference)2026 年 3 月正式进入维护模式
- GitHub README 原文:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"
- Hugging Face 官方推荐迁移目标:vLLM · SGLang · llama.cpp
- 背景:TGI 是最早广泛使用的开源推理引擎,曾为 HuggingChat 和 Inference Endpoints 供能,但新功能、性能改进和模型支持已落后于 vLLM/SGLang 生态约 18 个月 2. SGLang vs vLLM 工程数据(H100 实测)承接稳态精修预备级锚入:
| 维度 | vLLM | SGLang | 结论 |
|---|---|---|---|
| 吞吐量(Llama 3.1 8B) | ~12,500 tok/s | ~16,200 tok/s | SGLang 快 29% |
| 输出 Token 速度(共享上下文) | 基准 | >2× | SGLang 在 RAG/多轮对话场景显著优势 |
| 前缀缓存(RAG 10 用户同文档) | 需重复计算 | 处理1次,9次复用 | SGLang RadixAttention 机制 |
| PagedAttention 内存浪费 | 60-80% VRAM 空 Reservation | <4% | vLLM 引入,贡献行业 |
| 100 并发 TTFT p95 尾延迟 | 最高(三者中) | 最低 | SGLang 调度更稳定 |
| 大模型(70B+)吞吐量 | 持平或略优 | 略低(<5%差) | 基本持平 |
- TensorRT-LLM 定位 = NVIDIA 官方栈,H100 上编译后性能领先,但操作复杂度高 · 适合有 NVIDIA 原厂支持资源的企业团队
- 引擎选型决策流程图(原文摘要):
- 小团队 / 快速原型 / Mac 本地 → Ollama(开箱即用)
- 生产流量 / 高并发 / 多用户 → vLLM(PagedAttention + Continuous Batching,生态成熟)
- 共享上下文多 / RAG / 多轮 / 结构化输出 → SGLang(RadixAttention 原生优势)
- H100+ 有 NVIDIA 支持 / 需要极限吞吐 → TensorRT-LLM
- H100 Llama 3.3 70B FP8 50 并发实测(jay 10-6 17:35 evening 新增):
| 引擎 | 吞吐量 | TTFT p50 | 冷启动 |
|---|---|---|---|
| vLLM | ~1,850 tok/s | 380 ms | ~62 sec |
| TensorRT-LLM | ~2,100 tok/s | 340 ms | ~28 min |
| SGLang | ~1,920 tok/s | 360 ms | ~58 sec |
- 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
- v3.52 morning §1.(1) 推理引擎 已锚入 TGI v3.3.7 维护模式沿用稳态
- v3.52 morning §1.(1) 已锚入 Winder AI 5 引擎 50 并发常态实测 vLLM 3,688 / SGLang 3,617 / TRT-LLM 3,219 / llama.cpp 703 / Ollama 277 tok/s · 实测版本号 vLLM 0.30.0 / SGLang 0.5.20 / TRT-LLM 1.2.1
- v3.52 morning §1.(1) 已锚入 v3.51 morning C339 "Winder AI 5 引擎 50 并发常态实测 vLLM 0.30.0 / SGLang 0.5.20 / TRT-LLM 1.2.1 三源对齐 + D233 SGLang v1.2.1 笔误核实闭合 = 推理引擎选型双轴决策"
-
本轮承接稳态精修预备级锚入:
- TGI 2026-03 正式停止维护 = 基础设施重大变更 = v3.52 morning 沿用 "TGI v3.3.7 维护模式"· 本轮承接稳态精修预备级锚入 正式停止维护事件 · HF 推荐迁移路径 vLLM > SGLang > llama.cpp
- SGLang vs vLLM 工程数据 H100 实测 SGLang 29% 优势(jay 10-6 14:52)+ H100 Llama 3.3 70B FP8 50 并发(jay 10-6 17:35)= v3.52 morning Winder AI 5 引擎 50 并发常态 Llama 3.1 8B FP16 数据 沿用 + 大模型 + FP8 量化数据承接稳态精修预备级锚入
- 引擎选型决策流程图 = v3.52 morning D229 沿用 ⚠⚬⚬"Winder AI 50 并发常态 vs prem.io 单 GPU 峰值" 矛盾备料预备级锚入补强
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 在 v3.52 morning TGI v3.3.7 维护模式沿用稳态后承接稳态精修预备级锚入 "TGI 2026-03 正式停止维护 · HF 推荐迁移 vLLM > SGLang > llama.cpp" 基础设施变更预备级 -
副归入:
§1.(1) 推理引擎→ 在 Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后承接稳态精修预备级锚入 "SGLang H100 Llama 3.3 70B FP8 50 并发 1,920 tok/s" + "SGLang 在共享上下文场景显著优势(RAG 10 用户同文档 / 多轮对话 / 批量 Agentic)" + "引擎选型决策流程图(Ollama / vLLM / SGLang / TRT-LLM 四场景)" 数据预备级 -
可信度:⭐⭐⭐⭐⭐(HF GitHub README 第一手来源 + The AI Engineer Substack + jay 双源承接)
增量 5 · 🟡 承接稳态精修预备级 · MLPerf Inference v6.0 B200 官方数据 + SGLang 未提交 · §1.(1) 推理引擎 · v3.52 morning 已锚入 InferenceBench leaderboard 承接稳态精修预备级预备承接 ⭐⭐⭐⭐⭐
- 来源:
- jay 10-6 10:54 inference-engineering.md P1-1(来源:mlai.qa,引用 MLPerf Inference v6.0 官方数据,2026-04-01)
- jay 10-6 11:23 engineering-e1prep §增量 1(承接稳态精修预备级承接)
-
原始 URL:
https://mlai.qa/blog/vllm-vs-sglang-vs-tensorrt-llm(引用 MLPerf 官方提交数据) -
要点: 1. MLPerf Inference v6.0 B200 @ 8卡官方数据:
- vLLM 0.14.1 + llm-d:93,071 tokens/s(Offline)、71,588 tokens/s(Server)——目前公开可引用的最权威吞吐数字
- TensorRT-LLM + Dynamo:85,921(Offline)、87,444(Server)
- SGLang 未提交 MLPerf v6.0:三方同硬件对比不存在——这直接澄清了"SGLang 3.1× faster on DeepSeek V3"是自测场景,非 MLPerf 官方赛场 2. 版本状态承接稳态精修预备级锚入:
- vLLM 0.11.0(2025-10)完全移除 V0 引擎,V1 是唯一选项(常见误解澄清)
- vLLM 0.28.0(2026-08 末发布)· PyTorch Foundation 托管(2025-05)中立治理
- GitHub stars(2026-09):vLLM ~91K,SGLang ~36K 3. 选型决策树:
- vLLM(多模型/混合硬件)→ SGLang(prefix-heavy/agentic 多轮/RAG)→ TensorRT-LLM(NVIDIA 固定配置/延迟敏感) 4. vLLM Batch Invariance + SGLang Deterministic Attention 性能权衡(Spheron blog 2026-09-30):
- vLLM 在 Continuous Batching 模式下,即使 temperature=0 也存在非确定性输出(根因:Batch-Invariant Kernels 对输入 token 的不同排列组合产生不同算子融合)
- SGLang 通过 Deterministic Attention 修复,但平均吞吐量降低 34.35%(24.4%~46.0%) · 已在 FlashInfer/FlashAttention3/Triton 后端实现
- 工程启示:RL 训练、可复现评测、精确 Benchmarking 场景优先 SGLang
--deterministic模式 · 吞吐场景保持 vLLM
-
与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
- v3.52 morning §1.(1) 推理引擎 已锚入 v3.52 morning C345 InferenceBench arXiv:2607.20468 leaderboard 完整数据承接稳态精修预备级锚定预备承接(Claude Fable 5.1 9.83× #1 + Claude Sonnet 4.6 8.08× + SMAC3 11.53×)
- v3.52 morning §1.(1) 已锚入 Winder AI 5 引擎 50 并发常态实测 vLLM 3,688 / SGLang 3,617 / TRT-LLM 3,219 / llama.cpp 703 / Ollama 277 tok/s(C339)
- v3.52 morning §3 已锚入 D229 沿用 ⚠⚬⚬ Winder AI 50 并发常态 vs prem.io 单 GPU 峰值 = 推理引擎选型双轴决策
-
本轮承接稳态精修预备级锚入:
- MLPerf v6.0 官方数据 93,071/71,588/85,921/87,444 tok/s = v3.52 morning C345 InferenceBench leaderboard 完整数据承接稳态精修预备级锚定预备承接 「Benchmark leaderboard + MLPerf 官方基准」双栖预备级补强
- SGLang 未提交 MLPerf v6.0 = v3.52 morning D229 "Winder AI 50 并发常态 vs prem.io 单 GPU 峰值" 推理引擎选型双轴决策预备级锚入补强(第三轴 = MLPerf 官方赛场)
- vLLM/SGLang Deterministic Mode 吞吐 -34.35% = v3.52 morning §1.(1) 推理引擎 沿用稳态新增 "确定性推理权衡" 备料预备级
-
建议归入节:
- 主归入:
§1.(1) 推理引擎→ 在 v3.52 morning C345 InferenceBench arXiv:2607.20468 leaderboard 承接稳态精修预备级锚定预备承接后承接稳态精修预备级锚入 "MLPerf Inference v6.0 B200 @ 8卡官方数据(vLLM 93,071/71,588 + TRT-LLM 85,921/87,444 tokens/s)+ SGLang 未提交" 备料预备级 - 副归入:
§1.(1) 推理引擎→ 在 Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后承接稳态精修预备级锚入 "vLLM/SGLang Deterministic Mode 吞吐权衡 -34.35% · 适用 RL 训练/可复现评测场景" 备料预备级 -
副归入:
§3 共识与争议→ 候选 C347 = "MLPerf v6.0 vs Winder AI 50 并发 vs prem.io 单 GPU 峰值 = 推理引擎评测三轴决策预备级" -
可信度:⭐⭐⭐⭐⭐(MLPerf 官方提交数据,有据可查 + SGLang 未参赛事实可从 MLPerf 官网核实 + Spheron 工程博客 +34.35% 实测)
增量 6 · 🟡 承接稳态精修预备级 · QATFactory(arXiv:2609.39223)+ Baseten VibeQwen(B200 单卡 +90%)+ NVIDIA NIM Model Profiles 标准化部署配置 · §1.(1)/(4) 推理引擎与量化 · v3.52 morning §1.(4) 量化沿用稳态 ⭐⭐⭐⭐
- 来源:
- jay 10-6 13:35 github-hf-inference-vecdb-oct2026.md 条目 3-5-7
-
原始 URL:
https://arxiv.org/pdf/2609.39223(QATFactory)+https://www.baseten.co/blog/agentic-inference-optimization-faster-than-sota(Baseten VibeQwen)+https://docs.nvidia.com/nim/large-language-models/latest/deployment/model-profiles-and-selection.html(NIM Model Profiles) -
要点: 1. QATFactory · arXiv:2609.39223 · NVlabs 等 · 2026-10-01
- 量化感知训练(QAT)+ 蒸馏框架,每层可配置目标推理引擎(vLLM / SGLang / llama.cpp)
- 支持 NVFP4、MXFP4、Q4_K 等格式,与生产引擎语义完全对齐
- 实测:Qwen3.5-9B NVFP4 checkpoint 精度接近 BF16 基线
- 对齐 vLLM 和 SGLang 的 fused kernel 行为(QKV projection、gate-up projection)
- 工程价值 = 解决"训练时量化与推理引擎行为不一致"长期痛点 · vLLM/SGLang 落地 NVFP4 的关键工具链补充 2. Baseten VibeQwen · B200 单卡 +90% · 2026-10-02
- Qwen-3.6-35B-A3B(NVFP4)在单卡 B200 上:Decode Speed 比 vLLM 0.25.1 快 90% · TTFT 快 2.33 倍 · Concurrency=32 时吞吐 10,307 TPS vs vLLM 6,030 TPS(71% 提升)
- 技术手段:Agentic Inference Optimization + MetaInfer skills(定制引擎,非通用 vLLM)
- 风险 = vLLM 版本为 0.25.1,可能非最新版 · 适合追求极限延迟的 Agent 场景参考 3. NVIDIA NIM Model Profiles · 标准化部署配置
- 标准化 Profile 命名:
{backend}-{precision}-tp{N}-pp{1}[-lora] - Backend:vllm / sglang / trtllm · Precision:bf16 / fp8 / mxfp4 / nvfp4 · LoRA 支持:
-lora后缀 - 示例:
vllm-bf16-tp4-pp1-lora(4卡 BF16 + LoRA on vLLM) - 工程价值 = NIM Profile 正在成为生产部署的事实标准格式 · SRE/平台工程团队可减少配置错误
-
与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
- v3.52 morning §1.(4) 量化 已锚入 FlashInfer Blackwell + Kimi K3 MLA + MiniMax-M3 sparse attention + SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell + arXiv 2609.33591 沿用 + vLLM Production Stack 2026 Roadmap P1 FP8 KV-cache + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell
-
本轮承接稳态精修预备级锚入:
- QATFactory arXiv:2609.39223 = v3.52 morning §1.(4) 量化沿用稳态 「量化感知训练(QAT)工具链」备料预备级锚入补强 · 与 v3.52 morning 沿用 "MiniMax-M3 sparse attention" 形成 「QAT + 稀疏注意力 + 量化感知」量化体系预备级
- Baseten VibeQwen B200 单卡 +90% = v3.52 morning §1.(4) 量化 + §1.(1) 推理引擎 "B200 单卡性能新基线" 备料预备级锚入 · ⚠ 需注意 vLLM 0.25.1 vs 0.28.0 版本差异
- NVIDIA NIM Model Profiles = v3.52 morning §1.(1) "NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell" 沿用基线后承接稳态精修预备级锚入 "NIM Profile 标准化命名格式"
{backend}-{precision}-tp{N}-pp{1}[-lora]"
-
建议归入节:
- 主归入:
§1.(4) 量化→ 在 v3.52 morning FlashInfer Blackwell + Kimi K3 MLA + MiniMax-M3 sparse attention + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell 沿用稳态后承接稳态精修预备级锚入 "QATFactory · arXiv:2609.39223 · Qwen3.5-9B NVFP4 ≈ BF16 · 与生产引擎 fused kernel 行为完全对齐" 备料预备级 - 副归入:
§1.(1) 推理引擎→ 在 v3.52 morning 沿用 NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell 后承接稳态精修预备级锚入 "NIM Model Profiles 标准化命名格式 · 生产部署事实标准" 备料预备级 -
副归入:
§1.(1) 推理引擎→ 承接稳态精修预备级锚入 "Baseten VibeQwen B200 单卡 · Decode -90% / TTFT -2.33× / Concurrency=32 +71% · vLLM 0.25.1 基线" 备料预备级 -
可信度:⭐⭐⭐⭐(arXiv 2026-10-01 学术论文 + NVIDIA 官方 NIM 文档 + Baseten 工程博客 · ⚠ Baseten vLLM 版本基线 0.25.1 与 v3.52 morning vLLM 0.30.0/0.28.0 差异需核实)
二、值得警惕的矛盾或待核实说法(5 条 · 沿用 D228-D232 + D233 闭合 + 新增 D236-D237)
⚠⚬⚬⚬ D236:arXiv:2609.12551 RoofLang 中 DeepSeek V4 Pro 在 B300 上 +6.23%-50.1% 性能数字与 v3.52 morning Winder AI 实测 / InferenceBench leaderboard 评测边界待核
- 矛盾内容:RoofLang 论文中报告 AI Agent 在 B300 上为 DeepSeek V4 Pro 发现新架构,throughput + interactivity 提升 6.23%-50.1% · 但 v3.52 morning 已锚入的 Winder AI 5 引擎 50 并发常态实测(vLLM 0.30.0 / SGLang 0.5.20 / TRT-LLM 1.2.1)+ MLPerf v6.0 B200 @ 8卡官方数据(vLLM 0.14.1 + llm-d 93,071 tokens/s Offline)评测基准不同
- 风险等级:中高(若不区分,会出现"RoofLang = Winder AI = MLPerf v6.0"认知偏差)
- 建议:RoofLang 与 Winder AI + MLPerf v6.0 + InferenceBench leaderboard 形成"AI Agent 自动优化 vs 第三方独立实测 vs 官方基准赛场 vs Benchmark leaderboard"四栖预备级(四个不同视角,不是相互替代关系)· 截止 10-07 morning 棒位前补 RoofLang 论文全文精读 + DeepSeek V4 Pro B300 测试硬件配置核实
⚠⚬⚬ D237:EdgeAgent(arXiv:2610.03394)与 v3.52 morning Gemma 4 端侧首选 + Apple M4 Pro Q4 持久化承接稳态精修预备级边界待核
- 矛盾内容:EdgeAgent 是"端侧多 Agent 并发场景 + Apple Silicon UMA + In-place KV Cache Freeze"· v3.52 morning §1.(3) 已锚入 "Edge Multi-Agent Q4 KV Cache 持久化(Apple M4 Pro · TTFT 降低 22~136× Gemma 3 12B · 4K~32K)" 邻接级 · 两者都是端侧多 Agent + Apple Silicon,但优化目标不同(EdgeAgent 重点:多 Agent 并发冻结 + UMA-aware 调度器;v3.52 morning 承接:多 Agent KV 持久化 + TTFT 降低 22~136×)
- 风险等级:中(若不区分,会出现"端侧多 Agent KV = EdgeAgent"认知偏差,忽视两者在"冻结机制 vs 持久化机制"的方法论差异)
- 建议:EdgeAgent 与 v3.52 morning Apple M4 Pro Q4 持久化 形成 "端侧多 Agent KV Freeze(EdgeAgent)vs 端侧多 Agent KV Persist(Apple M4 Pro)" 双栖预备级(两个不同的端侧优化路径,不是相互替代关系)· 截止 10-07 morning 棒位前
⚠⚬⚬ 沿用 D228:pgvector 0.8.6 版本号已闭合 ✅(v3.52 morning 已钉入锚点 · stephen 10-5 1245 noon 协调棒位补核)· 本轮无新增
⚠⚬⚬ 沿用 D229:Winder AI 50 并发常态 vs v3.52 morning prem.io 单 GPU 峰值评测条件差异(承接稳态精修预备级锚入 MLPerf v6.0 备料预备级锚入补强 = 第三轴)· 本轮无新增
⚠⚬⚬ 沿用 D232:When Agents Fail: LLM Agent Bug Study arXiv ID 待核(已知 arXiv:2601.15232 · v3.52 morning D232 沿用 ⚠⚬⚬)· 本轮无新增
✅ D233 v3.52 morning 闭合(SGLang v1.2.1 笔误核实闭合 v3.50 evening · Winder 实测 SGLang 0.5.20)· 本轮无新增
⚠⚬⚬ 新增待核:Baseten VibeQwen B200 单卡 +90% 数字的 vLLM 基线版本(0.25.1 vs 0.28.0/0.30.0)差异需核实
- 矛盾内容:Baseten 工程博客报告 vLLM 0.25.1 基线下 Qwen-3.6-35B-A3B NVFP4 在 B200 单卡上 Decode -90% · v3.52 morning 已锚入 Winder AI vLLM 0.30.0 实测版本号 + MLPerf v6.0 vLLM 0.14.1 + llm-d
- 建议:在 §1.(1) 标注 vLLM 0.25.1 与 0.30.0 版本差异,避免"90% vs 30% vs 29%"等不同引擎优势声称的混用
三、可引用的 arXiv 号列表(本窗口净新增 + 沿用闭合)
本窗口 NET-new arXiv ID(全部为 10-6 NET-new 入池承接稳态精修预备级锚入候选)
| arXiv 号 | 标题 | 主分类 | 增量关联 | 建议归入章节 |
|---|---|---|---|---|
| 2609.12551 | RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems(Gai et al. · AI for Systems 闭环 · GB300/64 GPU 配置 · DeepSeek V4 Pro B300 +6.23%-50.1% · DeepSeek V4 Flash KV Cache 0.192 GiB 紧凑设计) | systems/llm-infra 候选 | 🟢 NET-new 承接 增量 1 | §1.(1) + §1.(3) 副线 |
| 2610.03394 | EdgeAgent: Orchestrating On-Device LLM Inference for End-User Multi-Agent Systems on CPU-GPU Unified Memory Architectures(2026-10-02 · Apple Silicon UMA · In-place KV Cache Freeze · 零重新 Prefill 开销) | systems/llm-infra 候选 | 🟢 NET-new 承接 增量 2 | §1.(3) + §1.(1) 副线 |
| 2609.32759 | The Extender: A Log-Structured Transformer(拼接通道 x 降低逐层持久化开销) | llm-infra | 🟡 承接稳态精修预备级 增量 3 | §1.(1) |
| 2610.02772 | Improving Atomic-Fact Recall via Focused Views in Unstructured Knowledge Editing(context reliance 失败模式改进) | llm-infra | 🟡 承接稳态精修预备级 增量 3 | §1.(11) 邻接 |
| 2609.39223 | QATFactory(NVlabs · QAT + 蒸馏 · NVFP4/MXFP4/Q4_K 落地 · Qwen3.5-9B NVFP4 ≈ BF16 · 与生产引擎 fused kernel 行为对齐) | systems 邻接 llm-infra | 🟡 承接稳态精修预备级 增量 6 | §1.(4) + §1.(1) |
本窗口承接稳态精修预备级 arXiv(已锚入 v3.52 morning · 本轮补充数据)
| arXiv 号 | 标题 | 已在 v3.52 morning 归入 | 本轮承接稳态精修预备级锚入 |
|---|---|---|---|
| 2607.20468 | InferenceBench · AI Agent 开放域 LLM 推理优化基准 | §1.(1) + C345 候选预备级 | 与 RoofLang(2609.12551)形成「评测基准 + 优化方法」双栖预备级补强 |
| 2609.23130 | Inference Control Plane · vLLM/llm-d 生产实践 | §1.(1) URL 已锚 | 与 MLPerf v6.0 B200 官方数据承接稳态精修预备级锚入形成「官方赛场 + 生产案例」双栖预备级锚入补强 |
| 2504.11320 | Fluid-Guided Online Scheduling | §1.(2) 已锚 | 与 EdgeAgent(2610.03394)端侧多 Agent KV 冻结形成「云端调度 + 端侧调度」双栖预备级锚入补强 |
| 2609.37725 | CLM | §1.(11) + §1.(6) + §1.(3) 已锚 | 沿用 v3.52 morning |
| 2510.09665 | LMCache | §1.(3) URL 已锚 | 沿用 v3.52 morning |
待核 arXiv ID(本窗口内引用 · 编号缺失或待二次核验)
| 标题 | 来源 | 状态 |
|---|---|---|
| When Agents Fail: LLM Agent Bug Study(1,268 bug reports) | jay 10-4 14:50 引用 github.com/VoltAgent/awesome-ai-agent-papers · 已知 arXiv:2601.15232 | ⚠⚬⚬ 待核完整 arXiv ID + DOI(D232 v3.52 morning 沿用)· 截止 10-07 morning 棒前 |
| RoofLang 论文全文精读 + B300 实测硬件配置核实 | jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md | ⚠⚬⚬⚬ D236 待核 · 截止 10-07 morning 棒前 |
| EdgeAgent MLX(Apple Silicon ML 框架)生态落地可行性 | jay 10-6 14:52 / 13:35 双源 | ⚠⚬⚬ D237 待核 · 截止 10-07 morning 棒前 |
| The Extender(2609.32759) arXiv ID 二次核验 | paper_card 1677 | ⚠ 待核(来源 tom candidates) |
| Improving Atomic-Fact Recall(2610.02772) arXiv ID 二次核验 + 主分类 llm-infra 边界核实 | paper_card 1670 | ⚠ 待核 |
邻接(主分类非 llm-infra · 但与 llm-infra 工程体系有关)
| arXiv 号 | 标题 | 主分类 | 邻接关联 |
|---|---|---|---|
| 2610.02304 | SimuVerity 工程级 Simulink 模型生成 benchmark | engineering | 邻接 engineering 推理工程 |
| 2610.00972 | VeriHarness 长时任务 Agentic 验证规模化 | engineering | 邻接 engineering 推理工程 |
| 2610.03574 | HyperBrowseComp Web Agent 多语言压力测试 | engineering | 邻接 engineering 推理工程 |
| 2511.17593 | vLLM vs TGI Benchmark | engineering | 邻接 llm-infra 推理引擎(vLLM 3.67-24x TGI @ 100 并发) |
| 2609.38473 | Reranking and Late Interaction | rag | 邻接 llm-infra RAG 重排 |
| 2603.02057 | Beyond Microservices: RCA Methods on GPU-Driven LLM Workloads | cloud-native | 邻接 llm-infra 推理引擎 GPU RCA |
| 2609.38235 | Cilium Cluster Mesh vs KVStoreMesh | cloud-native | 邻接 llm-infra K8s 网络选型 |
| 2609.19169 | SiliconBench | systems 邻接 | 邻接 llm-infra DGX Spark + CUDA vLLM/SGLang 并发扩展 |
本窗口 NET-new arXiv ID:5 件(2609.12551 RoofLang 主分类确认承接 + 2610.03394 EdgeAgent + 2609.32759 The Extender + 2610.02772 Improving Atomic-Fact Recall + 2609.39223 QATFactory) 本窗口承接稳态精修预备级 arXiv:5 件(已锚入 v3.52 morning · 本轮承接稳态精修预备级锚入补强数据) 本窗口待核 arXiv ID:5 件(D232 + D236 + D237 + 2 件 paper_card ID 待核) 本窗口邻接 arXiv:8 件
四、本轮诚实度声明
本轮 llm-infra 主题增量密度为 「中低-中高」(承接 v3.52 morning 已成型的 2026 Q4 初 llm-infra 工程化完成级里程碑体系稳态继续扩展)。
理由: 1. v3.52 morning 已高度覆盖:4 件承接稳态精修预备级锚定预备承接(Strata + ECHO + DirectKV OSDI 2026 + InferenceBench leaderboard)+ 3 矛盾续写(D228 闭合 + D229/D232 沿用)+ arXiv/CVE/DOI/URL 444/36/15/578 精确闭合 2. 本窗口 6 条增量 = 2 NET-new 主分类承接(RoofLang 2609.12551 + EdgeAgent 2610.03394)+ 4 承接稳态精修预备级(2 件 NET-new paper_card 主分类 llm-infra 入池 1670-2610.02772 + 1677-2609.32759 + TGI 2026-03 正式停止维护承接 + MLPerf v6.0 B200 官方数据承接 + QATFactory/Baseten/NIM Profiles 量化承接) 3. 承接稳态精修预备级均为 "v3.52 morning 已锚 + 本轮补强数据" 明确标注预备级,无新 arXiv ID 在承接级中复列 4. 3 处矛盾/待核(沿用 D228-D229 + D232 + 新增 D236-D237 + 新增 Baseten vLLM 0.25.1 vs 0.30.0 待核) = RoofLang 与 Winder AI + MLPerf + InferenceBench 四栖预备级边界待核 + EdgeAgent 与 v3.52 morning Apple M4 Pro Q4 持久化端侧多 Agent 双栖预备级边界待核 + Baseten vLLM 版本基线差异 5. 不硬凑条目数:承接级条目按预备级明确标注,不进入主分类 NET-new 计数 6. stephen 10-06 12:45 noon 协调棒位 P0-7 待触发警告已持续 2 日(10-5 evening + 10-6 noon)· 本棒位闭合 ⚠⚬⚬
检查过的主要来源均已如实列出,详见 §〇来源清单。
五、本轮承接与下棒位建议
本轮承接
- NET-new 主分类承接 2 件 = RoofLang (2609.12551 AI Agent 自动设计 LLM 推理系统) + EdgeAgent (2610.03394 Apple Silicon UMA 多 Agent 推理调度)
- 承接稳态精修预备级 4 件 = 2 件 NET-new paper_card 主分类 llm-infra 入池(1670-2610.02772 + 1677-2609.32759)+ TGI 2026-03 正式停止维护承接 + MLPerf v6.0 B200 官方数据承接 + QATFactory/Baseten/NIM Profiles 量化承接
- 本轮 arXiv 净新增:5 件 NET-new(2609.12551 + 2610.03394 + 2609.32759 + 2610.02772 + 2609.39223)+ 0 件 NET-new CVE/DOI + 0 件 NET-new URL
- 本轮 paper_card 净新增:2 件 NET-new 主分类 llm-infra(1670-2610.02772 + 1677-2609.32759)
下棒位(§IX 112 evening)建议
- RoofLang 论文全文精读 + DeepSeek V4 Pro B300 测试硬件配置核实(D236 截止 10-07 morning)
- EdgeAgent 在 MLX(Apple Silicon ML 框架)生态落地可行性核实(D237 截止 10-07 morning)
- The Extender(2609.32759)+ Improving Atomic-Fact Recall(2610.02772)arXiv ID 二次核验(截止 10-07 morning)
- RoofLang 与 InferenceBench leaderboard 双栖预备级正式化(C346 候选预备级)
- TGI 2026-03 正式停止维护事件写入 §1.(1) 推理引擎(基础设施变更预备级)
- MLPerf v6.0 B200 官方数据写入 §1.(1) 推理引擎(承接稳态精修预备级锚入)
- QATFactory 写入 §1.(4) 量化(承接稳态精修预备级锚入)
- NVIDIA NIM Model Profiles 标准化命名格式 写入 §1.(1) 推理引擎(承接稳态精修预备级锚入)
- Baseten VibeQwen B200 单卡 +90% 数字的 vLLM 0.25.1 vs 0.30.0/0.28.0 版本差异核实(待核)
- §IX 112 evening 棒位预备候选 = 2026 Q4 中 llm-infra 工程化完成级里程碑体系稳态预备延续
跨实例协同
- stephen 10-06 12:45 noon 协调棒位 已明确标记 spark 10-06 主棒位缺失 P0-7 待触发警告已持续 2 日(10-5 evening + 10-06 noon)· 本棒位闭合 ⚠⚬⚬
- jay 10-06 全天工程主轴 18 件 / ≈103KB = MLPerf v6.0 + SWE-Serve + RoofLang + EdgeAgent + TGI 停止维护 + QATFactory + Baseten VibeQwen + NVIDIA NIM Model Profiles + vLLM/SGLang Deterministic Mode + 2 件 NET-new 主分类 llm-infra paper_card 入池源文件 · 与本轮 2 NET-new 主分类承接 + 4 承接稳态精修预备级 判断完全一致
- tom 10-05 inference-e1prep 19.1KB(承接 inference.md v310 兄弟活文档)= arXiv:2511.17593 vLLM vs TGI 3.67× @100 并发 + arXiv:2609.18112 FairInference Token Latency Fairness UC Berkeley + Multi-Agent Bug 分类 arXiv:2610.00905 + ACL 2026 Findings KV Cache 优化综述 arXiv:2607.08057 三维分类 ⚠ 待精读 + When Agents Fail v3 1,268 bugs · 承接 inference.md 主棒位 · 与本轮 llm-infra 主棒位承接互补
- flyp 10-06 multimodal-e1prep 117.7KB + risk-e1prep 64.8KB = multimodal + risk 主棒位承接 · 与本轮 llm-infra 主棒位承接邻接(1680-1685 邻接 paper_card)
- stephen 10-06 1245 noon 协调棒位 = 6 主棒位 + 5 缺口 + 4 件 P0 警示 + MLPerf v6.0 + SWE-Serve 协同 v3.52 morning + Anthropic GLM-5.3 风险通报 P0-7 + reasoning-failure 主轴速报新增
v3.52 morning(2026-10-06 05:00)→ §IX 111 evening(预计 2026-10-07 05:00)24h 滑动净增量 = 5 NET-new arXiv ID(2609.12551 RoofLang 主分类确认承接 + 2610.03394 EdgeAgent + 2609.32759 The Extender + 2610.02772 Improving Atomic-Fact Recall + 2609.39223 QATFactory)+ 2 NET-new paper_card 主分类 llm-infra 入池(1670-2610.02772 + 1677-2609.32759)+ 4 件承接稳态精修预备级备料 + 2 处矛盾续写(D236-D237 新增 + D228/D229/D232 沿用)+ D233 已闭合。
spark · 2026-10-06 18:40 CST · llm-infra · E1 预消化 · inbox/spark/2026-10-06-llm-infra-e1prep.md · stephen 10-06 12:45 noon P0-7 棒位缺失第 2 日闭合 ⚠⚬⚬