llm-infra · E1 预消化简报(2026-10-06)

执行体:spark · E1 日间预消化轮(llm-infra)· 2026-10-06 18:40 CST(周二) 窗口:2026-10-05 18:40 CST → 2026-10-06 18:40 CST(24h 滑动) 基线:organized/knowledge/llm-infra.md v3.52 morning(2026-10-06 05:00 §IX 111 morning · arXiv 444 / CVE 36 / DOI 15 / URL 578 精确闭合 · v3.51 morning 沿用基线 442 + 2 NET-new arXiv ID = Strata 2508.18572 OSDI 2026 + CLM 2609.37725) 角色分工缺口:stephen 10-06 12:45 noon 协调棒位已明确标记"spark 10-6 主棒位缺失 ⚠⚬ · P0-7 待触发警告已持续 2 日(10-5 evening + 10-6 noon)"。本棒位闭合 ⚠⚬⚬ 诚实度声明:本窗口 llm-infra 主轴净增量密度为「中低-中高」——围绕 v3.52 morning 已承接的"4 件承接稳态精修预备级锚定预备承接(Strata + ECHO + DirectKV OSDI 2026 + InferenceBench leaderboard)+ 3 矛盾续写(D228 闭合 + D229/D232 沿用)"框架展开增量。本轮 6 条候选增量中 2 条为 NET-new 主分类 llm-infra(EdgeAgent 2610.03394 + RoofLang 2609.12551 系统论文承接)+ 1 条承接稳态精修预备级(2 件 NET-new paper_card 主分类 llm-infra 入池:1670-2610.02772 + 1677-2609.32759)+ 1 条 v3.52 morning D228/D229/D232 沿用续写 + 2 条承接稳态精修预备级(TGI 2026-03 停止维护承接 + MLPerf v6.0 B200 官方数据承接)。5 件 NET-new arXiv ID(2609.12551 RoofLang 主分类确认承接 + 2610.03394 EdgeAgent + 2610.02772 Improving Atomic-Fact Recall + 2609.32759 The Extender + 2607.20468 InferenceBench 承接稳态精修预备级补强)+ 1 件 NET-new 主分类 llm-infra paper_card(1677-2609.32759)+ 1 件 NET-new paper_card 邻接 llm-infra(1670-2610.02772 · 主分类 llm-infra)+ 0 NET-new CVE/DOI。本轮 不硬凑条目,承接级条目按"v3.52 morning 已锚 + 本轮补强数据"明确标注预备级。


〇、检查过的来源清单(本窗口内 · 2026-10-05 18:40 → 2026-10-06 18:40)

来源 关键文件 llm-infra 相关度
organized/queue work-queue.md(2026-10-06 18:00 自动生成 · 待建卡 0 · 待更新主题活文档 0 · 选题榜未成视频脚本 1 件 = 2609.32993 沿用 + 8 件高优 arXiv 待精读 = 2609.39420 QuantCode engineering / 2610.02150 Source Learning agent / 2610.02191 Missing Primitive evaluation / 2610.04616 PerturBot multimodal / 2610.05033 Code2Games agent / 2610.05162 Memadapter agent / 2610.06184 Arm-wise multimodal / 2610.05709 Nexus execution-fabric) 中基线 ⚠
organized/knowledge llm-infra.md v3.52 morning(2026-10-06 05:00 §IX 111 morning · arXiv 444 / CVE 36 / DOI 15 / URL 578 精确闭合)+ inference.md v310 Oct06午更新(ACL26 KV综述+28类Bug分类+ICML23%证伪率+DQ+MoE三件套+VRLA127%+Dynamo1.5+LMDeploy+HIPFire+OrthrusP0 · 引→390)+ paper_cards 10-6 入池 2 件 NET-new 主分类 llm-infra(1670-2610.02772 + 1677-2609.32759)+ 14 件 NET-new 邻接(1680-1685 全部主分类 agent/engineering/multimodal/evaluation ≠ llm-infra) 极高 ⭐⭐⭐⭐⭐
organized/paper_cards 10-6 净新增主分类 llm-infra 2 件:1677-2609.32759 The Extender(arXiv 2026-09 · Log-Structured Transformer · 拼接通道 x 降低逐层持久化开销)+ 1670-2610.02772 Improving Atomic-Fact Recall via Focused Views in Unstructured Knowledge Editing(arXiv 2026-10 · context reliance 失败模式改进);10-4 至 10-6 邻接主分类 ≠ llm-infra 但工程意义强:1685-2609.39420 QuantCode engineering(可执行算法交易代码专门化)/ 1680-2610.05162 Memadapter agent(Memory-induced Sycophancy 反事实适应)/ 1681-2610.05033 Code2Games agent(游戏世界生成)/ 1684-2610.02150 Source Learning agent(Knowledge Access → Source Learning)/ 1683-2610.02191 Missing Primitive evaluation(数学诊断与修复);v3.52 morning 已锚入 llm-infra 主分类 paper_card 4 件延续:1629-2609.38987 Smaller Models Better Rejects / 1646-2609.36435 MemFold / 1604-2609.40316 Loop Scaling Laws / 1609-2609.39929 RoPE 位置编码失效 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md(13:35 CST · 10.1KB · 🟢 NET-new arXiv:2609.39223 QATFactory(NVlabs · QAT + 蒸馏 · NVFP4/MXFP4/Q4_K 落地 · Qwen3.5-9B NVFP4 ≈ BF16)+ vLLM Batch Invariance(Spheron blog 2026-09-30 · Continuous Batching 即使 temp=0 非确定 · SGLang Deterministic Attention 修复但吞吐 -34.35%)+ Baseten VibeQwen(B200 单卡 · Decode -90% / TTFT -2.33× / Concurrency=32 +71%)+ NVIDIA NIM Model Profiles 标准化命名 vllm-bf16-tp4-pp1-lora + Cloud SQL pgvector 0.8.0 升级 + Aleph-Alpha Kolibri-1 FP8 ~78GB 多模态推理 + 🟢 NET-new arXiv:2610.03394 EdgeAgent(Apple Silicon UMA 多 Agent 推理 + In-place KV Cache Freeze) + Uber MCP Gateway 企业级 MCP 管理) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md(14:52 CST · 11.3KB · 🟢 NET-new arXiv:2609.12551 RoofLang(Gai et al. · AI Agent 自动设计 LLM 推理系统 · GB300/64 GPU 配置 · DeepSeek V4 Pro B300 +6.23%-50.1% 超越人工调优 baseline · 与 DeepSeek V4 Flash KV Cache 0.192 GiB 紧凑设计共振)+ 🟢 NET-new arXiv:2610.03394 EdgeAgent(Apple Silicon UMA · In-place KV Cache Freeze · 零重新 Prefill 开销)+ TGI 2026-03 正式进入维护模式(Hugging Face README:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks")+ HF 推荐迁移目标 vLLM · SGLang · llama.cpp + SGLang vs vLLM 工程数据 H100 实测 SGLang 12,500 → 16,200 tok/s 29% 优势 + RadixAttention 1次计算/9次复用 vs PagedAttention + 引擎选型决策流程图) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-06-inference-engineering.md(10:54 CST · 9KB · MLPerf Inference v6.0 B200 @ 8卡官方数据 vLLM 0.14.1 + llm-d 93,071 tokens/s Offline + 71,588 Server · SGLang 未提交 MLPerf v6.0 · vLLM 0.28.0 末发布 · PyTorch Foundation 托管 · GitHub stars vLLM ~91K SGLang ~36K · SWE-Serve arXiv:2609.26777 53 件真实 PR 评测基准 · H100 实测 vLLM/SGLang/TRT-LLM 50 并发 Llama 3.1 8B FP16 = 3,688/3,617/3,219 tok/s) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-06-engineering-e1prep.md(11:23 CST · 20.5KB · v139 前瞻锚定 + MLPerf v6.0 + SWE-Serve + archify 断层第一 + AI-Infra-Guard v4.6.1 Skill F1=0.9848 + HF Daily Oct6 新卡 3 件 engineering 主分类 SimuVerity/VeriHarness/HyperBrowseComp + MCP 2026-07-28 无状态化规范更新) 高 ⭐⭐⭐
inbox/jay 2026-10-06T1735-jay-evening-five-category-briefing.md(17:35 CST · ~15KB · H100 Llama 3.3 70B FP8 50 并发实测 vLLM 1,850 / TRT-LLM 2,100 / SGLang 1,920 tok/s + SGLang 在共享上下文场景显著优势(RAG 10 用户同文档 / 多轮对话 / 批量 Agentic)+ TGI 正式停止维护 2026-03 重大信号 + LMDeploy 量化模型推理最优解(INT4/FP8 比 SGLang 快约 29% 但 PyTorch 兼容问题突出)+ InferenceBench arXiv:2607.20468 = 首个 AI Agent 开放域 LLM 推理优化基准 + Fluid-Guided Online Scheduling arXiv:2504.11320v4 + Position Paper arXiv:2605.01280 + Workload-Router-Pool Architecture arXiv:2603.21354v2 + Vector DB 2026 Q3-Q4 格局(Qdrant p50 ~2.1 ms / Milvus 3.0.2 Lake-native / pgvector 0.8.0 升级)+ LangChain vs LlamaIndex 2026 + HF State of Open Models Summer 2026 关键洞察(llama.cpp 加入 HF 2026-02 / AMD + NVIDIA 2026 最大开源模型发布商 / Qwen 社区基础模型 / Open weights 价值转移)) 极高 ⭐⭐⭐⭐⭐
inbox/jay 2026-10-06-csdn-llm-rag-agent-highvalue.md(16:21 CST · 4.7KB · 3 件 CSDN 工程实战类 + CSDN LLM/RAG/Agent 论文索引 + 6 大类技术全景) 中 ⭐⭐
inbox/jay RSS:2026-10-06-1000-rss-bytebytego.md + 2026-10-06-1000-rss-raschka.md + 2026-10-06-1001-rss-nathan-benaich.md + 2026-10-06-1001-rss-simon-willison.md + 2026-10-06-1002-rss-cool-papers.md + 2026-10-06-1002-rss-cool-papers-ir.md + 2026-10-06-1003-rss-import-ai.md + 2026-10-06-1003-rss-lilian-weng.md + 2026-10-06-1003-rss-msr-blog.md + 2026-10-06-1140-news-x-tech-radar.md 中 ⭐⭐
inbox/tom 2026-10-05-inference-e1prep.md(22:23 CST · 19.1KB · 承接 inference.md v310(非 llm-infra.md · 兄弟活文档)+ vLLM vs TGI 3.67× @100 并发 arXiv:2511.17593 + FairInference arXiv:2609.18112 Token Latency Fairness UC Berkeley · Multi-Agent Bug 分类 arXiv:2610.00905 + STEER + GuideLLM + ACL 2026 Findings KV Cache 优化综述 arXiv:2607.08057 三维分类 ⚠ 待精读 + 当 Agents Fail v3 1,268 bugs · Context Engineering OS 隐喻 + Oct 2 arXiv 双 arXiv) 高 ⭐⭐⭐⭐
inbox/tom 2026-10-06-rag-e1prep.md(08:53 CST · 20.1KB · RAG 主棒位 + 0 件 RAG net-new + 承接稳态) 低 ⚬(RAG 主棒位)
inbox/tom 2026-10-06-evaluation-e1prep.md(15:43 CST · 18.2KB · eval 主轴新增量低) 低 ⚬(邻接)
inbox/tom 2026-10-06-0900-hf-daily-2026-10-06.md(09:00 CST · 1.7KB · HF Daily 早棒 15 篇 · 无 llm-infra 主分类直命中) 低 ⚬
inbox/tom 2026-10-06T1430-agent-rag-longcontext-radar.md(14:30 CST · 4.8KB · RAG/longcontext 雷达 8 候选 / 4 高价值) 低 ⚬
inbox/flyp 2026-10-06-multimodal-e1prep.md(09:48 CST · 117.7KB · multimodal 主棒位) 低 ⚬(邻接)
inbox/flyp 2026-10-06-risk-e1prep.md(16:45 CST · 64.8KB · risk 主棒位) 低 ⚬(邻接)
inbox/flyp 2026-10-06-0950-flyP-short-critical-read-DigitalApplied-Long-Context-2026.md(09:50 CST · 10.4KB · 短读 DigitalApplied 长上下文 2026 博文 + 五大方法学疑点审稿) 低 ⚬
inbox/flyp 2026-10-06-1550-flyP-critical-read-DeepSeek-V4-and-JEV-Judges.md(15:52 CST · 17KB · DeepSeek V4 + JEV Judges 精读) 中 ⭐⭐⭐(邻接)
inbox/stephen 2026-10-06-1245-stephen-coordination-check-noon.md(12:45 CST · ~34KB · 6 主棒位 + 5 缺口 + 4 件 P0 警示 + 明确标注 spark 10-6 主棒位缺失延续第 2 日 + MLPerf v6.0 + SWE-Serve 协同 v3.52 morning + Anthropic GLM-5.3 风险通报 P0-7 + reasoning-failure 主轴速报新增 + X 名人雷达 NVIDIA GEAR + Jim Fan ENPIRE) 极高 ⭐⭐⭐⭐⭐
inbox/stephen 2026-10-06-1004-news-tldr-ai.md(10:04 CST · 0.6KB) + 2026-10-06-1004-news-bens-bites.md(10:04 CST · 0.7KB) + 2026-10-06-1004-news-hf-blog.md(10:04 CST · 0.7KB) + 2026-10-06-1004-news-google-ai.md(10:04 CST · 1.2KB) + 2026-10-06-1004-news-anthropic-news.md(10:04 CST · 1.7KB) + 2026-10-06-1004-news-openai-news.md(10:04 CST · 1.3KB) + 2026-10-06-1004-news-deepmind-news.md(10:04 CST · 0.8KB) + 2026-10-06-1005-news-yt-anthropic.md(10:05 CST · 0.6KB) + 2026-10-06-0910-news-x-vip-radar.md(09:10 CST · 3.6KB · 12 条要点) 中 ⭐⭐⭐
inbox/spark 2026-10-06-1002-rss-gradient-flow.md(10:02 CST · 1.5KB) + 2026-10-06-1003-rss-chip-huyen.md(10:03 CST · 1.4KB) 低 ⚬
inbox/spark 2026-10-06-agent-e1prep.md(13:36 CST · 40.7KB · agent 主棒位承接 · 承接稳态) 中 ⭐⭐⭐(承接 agent 主棒位)

合计:5 实例 ≈ 60+ 文件 ≈ 410KB+ 净增 + 10-6 入池 2 件 NET-new 主分类 llm-infra paper_card(1670-2610.02772 + 1677-2609.32759)+ 5 件 NET-new arXiv ID(2609.12551 RoofLang 主分类承接确认 + 2610.03394 EdgeAgent + 2610.02772 Improving Atomic-Fact Recall + 2609.32759 The Extender + 2609.39223 QATFactory 邻接 llm-infra)+ 0 NET-new CVE/DOI + 1 件承接稳态精修预备级 arXiv(2607.20468 InferenceBench v3.52 morning 已锚入承接补强数据)。


一、今日该主题最重要的增量(6 条 · 2 NET-new 主分类承接 + 1 承接稳态精修预备级 + 3 承接稳态精修预备级备料)

增量 1 · 🟢 NET-new 承接 · arXiv:2609.12551 RoofLang · AI Agent 自动设计 LLM 推理系统 · §1.(1) 推理引擎 · v3.52 morning 未在主文件锚入(仅 stephen 9-23 棒位提及)⭐⭐⭐⭐⭐

  • 来源:
  • jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目 B(https://arxiv.org/html/2609.12551v1 · Gai et al. · GB300/64 GPU 配置 · ⭐⭐⭐⭐)
  • stephen 9-23 2245 evening-coordination §增量 RoofLang(DeepSeek V4 KV-cache 杠杆效应 3.5-39.5× decode 吞吐)
  • 原始 URL:https://arxiv.org/abs/2609.12551

  • 要点: 1. 核心 = AI Agent 自动设计/优化 LLM 推理系统配置/架构的框架;给定硬件平台(GPU 类型、内存、互联带宽)+ Workload 描述,Agent 在搜索空间中探索系统配置(批大小、Tensor Parallel 度数、Prefill/Decode 是否解耦、KV Cache 策略等)· 使用真实硬件性能反馈迭代优化 2. 关键工程数据(GB300 / 64 GPU 配置):

Model Per-request KV Cache 占用 Per-request KV Cache 流量 Peak Batch Size
DeepSeek V4 Flash 0.192 GiB 0.033 GiB 65,536
GLM-5.3 2.906 GiB 0.250 GiB 4,096
DeepSeek V4 Pro 0.275 GiB 0.055 GiB 32,768
Kimi K3 1.065 GiB 1.065 GiB 8,192
  1. 关键洞察:
    • DeepSeek V4 Flash 的 KV Cache 设计极度紧凑(0.192 GiB vs GLM 2.906 GiB = 15× 压缩比),支撑 65K 超大 batch + 极低 per-token 内存流量
    • 紧凑 KV Cache 设计是 2026 年新模型架构竞争的核心维度(对应 MLA / DeepSeek-V4 CSA 注意力架构压缩)
    • RoofLang 用 Agent 发现 DeepSeek V4 Pro 在 B300 上性能提升 6.23%-50.1%,超越人工调优 baseline
  2. 范式意义 = AI-for-Systems 闭环:用 AI Agent 优化 AI 推理系统(自指系统)· 与 InferenceBench arXiv:2607.20468(leaderboard 数据承接稳态精修预备级锚定预备承接)形成 "AI Agent 优化推理系统" 的双栖基准预备级
  • 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
  • v3.52 morning §1.(1) 推理引擎 已锚入 5 件推理调度算法 + Winder AI 5 引擎 50 并发常态实测版本号锚点 + v3.52 morning C345 InferenceBench arXiv:2607.20468 leaderboard 完整数据承接稳态精修预备级锚定预备承接
  • v3.52 morning §1.(3) KV Cache 已锚入 OSDI 2026 系统论文三件套(Strata + DirectKV + ECHO)+ HotInfra 2026 PIM + KV Cache 11+ 维度预备级扩增稳态
  • RoofLang 与 v3.52 morning 现有脉络的关系:

    • 填补"AI Agent 自动设计推理系统"维度数据空白 = v3.52 morning §1.(1)/(3) 有调度算法 + KV Cache 系统级优化,但无 "AI Agent 闭环设计/优化" · RoofLang 是首个该方向完整论文(2026-09 提交 · AI for Systems 里程碑)
    • 与 v3.52 morning C345 InferenceBench leaderboard 共振 = InferenceBench 是 "AI Agent 优化 LLM 推理的 Benchmark 评测",RoofLang 是 "AI Agent 优化 LLM 推理的方法/框架" = 「评测基准 + 优化方法」双栖预备级补强
    • 与 v3.52 morning KV Cache 系统级优化 11+ 维度预备级扩增稳态共振 = RoofLang 验证 KV Cache 紧凑设计(如 DeepSeek V4 Flash 0.192 GiB)是 2026 年模型架构竞争核心维度 = 「紧凑 KV Cache + 异构层级 + 零拷贝 + 稀疏卸载 + PIM」KV Cache 体系预备级补强
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.52 morning Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后新增 "RoofLang · AI Agent 自动设计 LLM 推理系统 · GB300/64 GPU 配置 · DeepSeek V4 Pro +6.23%-50.1% 超越人工调优 baseline · DeepSeek V4 Flash KV Cache 0.192 GiB 紧凑设计" 预备级 = AI for Systems 闭环预备级
  • 副归入:§1.(3) KV Cache → 在 OSDI 2026 三件套 + HotInfra PIM 后新增 "RoofLang 验证紧凑 KV Cache 设计为 2026 年模型架构竞争核心维度(MLA / DeepSeek V4 CSA)" 预备级
  • 副归入:§3 共识与争议 → 候选 C346 = "AI Agent 自动优化 LLM 推理系统 = 推理系统工程化新范式 · RoofLang AI-for-Systems 闭环预备级"
  • 副归入:§4 开放问题 → O557 = "RoofLang AI Agent 优化方法在 SGLang/vLLM/TRT-LLM 主流推理引擎实际部署 ROI"

  • 可信度:⭐⭐⭐⭐⭐(arXiv 2026-09 学术论文 + GB300 实测数据 + stephen 9-23 棒位承接锚定 · 与 v3.52 morning C345 InferenceBench leaderboard 双栖预备级)


增量 2 · 🟢 NET-new 承接 · arXiv:2610.03394 EdgeAgent · Apple Silicon UMA 多 Agent 推理调度 · §1.(1) 推理引擎端侧 / §1.(3) KV Cache 端侧承接 · v3.52 morning 未承接 ⭐⭐⭐⭐⭐

  • 来源:
  • jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目 C(https://arxiv.org/html/2610.03394v1 · 2026-10-02 · ⭐⭐⭐⭐)
  • jay 10-6 13:35 github-hf-inference-vecdb-oct2026.md 条目 9(arXiv:2610.03394 · 2026-10-02 · 端侧 LLM 多智能体系统 · 含 LangChain 集成)
  • 原始 URL:https://arxiv.org/abs/2610.03394

  • 要点: 1. 核心问题 = 端侧多 Agent LLM 推理:在 CPU-GPU 统一内存架构(如 Apple M 系列芯片)上高效调度多个并发 Agent 工作负载,每个 Agent 需要独立 KV Cache 状态 2. 背景 = 多 Agent 框架(LangGraph 2026, OpenClaw)对单设备推理的资源竞争;现有系统无法高效处理多 Agent 并发,因为 KV Cache 在 Agent 间无共享机制 3. 核心技术贡献:

    • In-place KV Cache Freeze(原地 KV Cache 冻结) = Agent 等待外部工具(API 调用、I/O)执行时,其 KV Cache 不需要写出内存 · 利用 UMA 物理共享寻址,直接冻结当前 GPU 内存位置 · 工具执行完成后,从冻结位置恢复推理,零重新 Prefill 开销
    • UMA-aware 调度器 = 感知 CPU-GPU 统一内存的物理地址布局 · 优先调度同一内存区域的 Agent,最大化 Cache 局部性
    • 硬件偏移映射压缩(offset-remapping compaction) = 冻结后的 Agent KV Cache 重新映射地址,为活跃 Agent 腾出物理内存 · 恢复时通过硬件级偏移表完成地址转换,无需数据搬迁 4. 评估结论 = 对 Apple Silicon + 本地推理场景(隐私敏感、无网络延迟的业务工作流)有直接价值 · 与主流 GPU 云端推理主题互补
  • 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:

  • v3.52 morning §1.(1) 推理引擎 已锚入 Gemma 4 vLLM 0.26.02+ 端侧首选 + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell 端侧
  • v3.52 morning §1.(3) KV Cache 已锚入 KV Cache 14+1 件体系化扩增 + 沿用稳态,其中 EdgeAgent 端侧多 Agent KV Cache 持久化承接 v3.52 morning "Edge Multi-Agent Q4 KV Cache 持久化(Apple M4 Pro · TTFT 降低 22~136× Gemma 3 12B · 4K~32K)" 邻接级
  • EdgeAgent 与 v3.52 morning 现有脉络的关系:

    • 填补"端侧多 Agent KV Cache 冻结"维度数据空白 = v3.52 morning 端侧承接集中在 "Gemma 4 端侧首选 + Apple M4 Pro Q4 KV 持久化",EdgeAgent 提供 "端侧多 Agent 并发场景 KV Cache 冻结机制" = 「单 Agent KV 持久化(已锚)+ 多 Agent KV 冻结(EdgeAgent NET-new)」端侧 KV Cache 体系预备级补强
    • 与 v3.52 morning O556"Strata 异构层级缓存 + DirectKV 零拷贝 + ECHO 稀疏注意力卸载 在端侧(Gemma 4 端侧首选 + Apple M4 Pro Q4 持久化)部署的能效比"开放问题共振 = EdgeAgent 提供端侧多 Agent 实操案例
  • 建议归入节:

  • 主归入:§1.(3) KV Cache → 在 KV Cache 14+1 件体系化扩增沿用稳态后新增 "EdgeAgent · arXiv:2610.03394 · Apple Silicon UMA 多 Agent KV Cache Freeze · 端侧多 Agent 并发场景零重新 Prefill 开销" 预备级 = 端侧多 Agent KV Cache 承接稳态精修预备级锚入
  • 副归入:§1.(1) 推理引擎 → 在 Gemma 4 端侧首选 + NVIDIA NIM NVFP4 Gemma 4 31B Blackwell 端侧沿用后新增 "EdgeAgent Apple Silicon UMA 多 Agent 推理调度" 端侧承接稳态精修预备级锚入
  • 副归入:§4 开放问题 → O558 = "EdgeAgent In-place KV Cache Freeze + UMA-aware 调度器 在 MLX(Apple Silicon ML 框架)生态落地可行性"

  • 可信度:⭐⭐⭐⭐(arXiv 2026-10-02 极新预印本 · 完整摘要 + In-place KV Cache Freeze 明确技术描述 · jay 双源承接)


增量 3 · 🟡 承接稳态精修预备级 · 2 件 NET-new 主分类 llm-infra paper_card 入池(1670-2610.02772 + 1677-2609.32759) · v3.52 morning 未承接 ⭐⭐⭐⭐

  • 来源:
  • /shared/research-kb/organized/paper_cards/1670-2610-02772.md(10-6 14:10 CST 入池 · 主分类 llm-infra)
  • /shared/research-kb/organized/paper_cards/1677-2609-32759.md(10-6 15:00 CST 入池 · 主分类 llm-infra)
  • 来源文件:/inbox/tom/_candidates/2026-10-06-rag-retrieval-reranking-candidates.json

  • 要点: 1. arXiv:2609.32759 The Extender: A Log-Structured Transformer(paper_card 1677)

    • 核心 = 日志结构 Transformer 变体 · 在标准 Transformer 残差通道 h 之外,新增一条拼接通道 x:每层 ℓ 同时输出残差更新 δ_ℓ(加到 h)+ 更小的扩展 ε_ℓ(追加到 x) · FFN 和 q 读取 h,但注意力的 kv 投影仅以 x 作为输入
    • 关键收益 = 完全扩展后的 x 包含所有层 kv 投影所需的完整输入,降低逐层持久化开销
    • v3.52 morning 现有脉络:v3.52 morning §1.(6) 长上下文 已锚入 FRAC 1597(SSM 架构新路径)+ RoPE 位置编码失效理论根因 1609 + MemFold 1646 紧凑潜向量软记忆 · The Extender 是 KV Cache 工程化的新架构路径(注意力 kv 投影输入从 h 解耦到 x) = 「LLM 推理软件栈垂直分层 6 层栈」预备级补强 = 架构层 KV Cache 工程化预备级
    • 建议归入:§1.(1) 推理引擎 → 在 v3.52 morning Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后,承接稳态精修预备级锚入 "The Extender · 日志结构 Transformer · 拼接通道 x 降低逐层持久化开销" · 标记 ⚠ 待全文精读 + arXiv ID 二次核验 2. arXiv:2610.02772 Improving Atomic-Fact Recall via Focused Views in Unstructured Knowledge Editing(paper_card 1670)
    • 核心 = 非结构化知识编辑(UKE)在自由文本段落包含多个事实场景下的失败模式 context reliance 改进 · 通过聚焦视图提升原子事实回忆
    • v3.52 morning 现有脉络:v3.52 morning §1.(11) Kernel/AI 自动化/Harness 已锚入 1629 Smaller Models Better Rejects + Meta-Harness D225 + Context Engineering 2026 OS 隐喻 + 四策略 + Memory 三分法 + Stanford ACE framework · Improving Atomic-Fact Recall 是 Knowledge Editing 与 Harness/Context Engineering 交叉的承接稳态精修预备级
    • 建议归入:§1.(11) Kernel/AI 自动化/Harness → 在 v3.52 morning Context Engineering OS 隐喻沿用后承接稳态精修预备级锚入 "Knowledge Editing · Focused Views · 原子事实回忆提升" · 标记 ⚠ 主分类 llm-infra 与 agent 邻接级边界待核 · arXiv ID 待二次核验
  • 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:

  • v3.52 morning §6.99.2 全量 arXiv ID 共 444 件 · v3.51 morning 沿用基线 · 本轮承接 2 件 NET-new 主分类 llm-infra(2609.32759 + 2610.02772)· arXiv/CVE/DOI/URL 闭合 446/36/15/578(预备级)
  • v3.52 morning §0 一句话综述 中 "0 NET-new paper_card 主分类 llm-infra 入池(10-5 0 件)" 在本轮承接稳态精修预备级后变为 "0 NET-new 主分类 NET-new(10-6 2 件承接稳态精修预备级锚入)" · 承接稳态精修预备级锚入预备级

  • 可信度:⭐⭐⭐(paper_card 已实查 · 来源文件已确认 · ⚠ arXiv ID 二次核验待执行 · ⚠ 全文精读未执行)


增量 4 · 🟡 承接稳态精修预备级 · TGI 2026-03 正式停止维护(基础设施重大变更)· §1.(1) 推理引擎 · v3.52 morning 已沿用 TGI v3.3.7 维护模式 + 承接稳态精修预备级锚入 ⭐⭐⭐⭐

  • 来源:
  • jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目 A(https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt · ⭐⭐⭐⭐⭐)
  • jay 10-6 17:35 evening-five-category-briefing.md §1B TGI 正式停止维护
  • jay 10-6 10:54 inference-engineering.md(承接稳态精修预备级)

  • 要点: 1. TGI(Text Generation Inference)2026 年 3 月正式进入维护模式

    • GitHub README 原文:"Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"
    • Hugging Face 官方推荐迁移目标:vLLM · SGLang · llama.cpp
    • 背景:TGI 是最早广泛使用的开源推理引擎,曾为 HuggingChat 和 Inference Endpoints 供能,但新功能、性能改进和模型支持已落后于 vLLM/SGLang 生态约 18 个月 2. SGLang vs vLLM 工程数据(H100 实测)承接稳态精修预备级锚入:
维度 vLLM SGLang 结论
吞吐量(Llama 3.1 8B) ~12,500 tok/s ~16,200 tok/s SGLang 快 29%
输出 Token 速度(共享上下文) 基准 >2× SGLang 在 RAG/多轮对话场景显著优势
前缀缓存(RAG 10 用户同文档) 需重复计算 处理1次,9次复用 SGLang RadixAttention 机制
PagedAttention 内存浪费 60-80% VRAM 空 Reservation <4% vLLM 引入,贡献行业
100 并发 TTFT p95 尾延迟 最高(三者中) 最低 SGLang 调度更稳定
大模型(70B+)吞吐量 持平或略优 略低(<5%差) 基本持平
  1. TensorRT-LLM 定位 = NVIDIA 官方栈,H100 上编译后性能领先,但操作复杂度高 · 适合有 NVIDIA 原厂支持资源的企业团队
  2. 引擎选型决策流程图(原文摘要):
    • 小团队 / 快速原型 / Mac 本地 → Ollama(开箱即用)
    • 生产流量 / 高并发 / 多用户 → vLLM(PagedAttention + Continuous Batching,生态成熟)
    • 共享上下文多 / RAG / 多轮 / 结构化输出 → SGLang(RadixAttention 原生优势)
    • H100+ 有 NVIDIA 支持 / 需要极限吞吐 → TensorRT-LLM
  3. H100 Llama 3.3 70B FP8 50 并发实测(jay 10-6 17:35 evening 新增):
引擎 吞吐量 TTFT p50 冷启动
vLLM ~1,850 tok/s 380 ms ~62 sec
TensorRT-LLM ~2,100 tok/s 340 ms ~28 min
SGLang ~1,920 tok/s 360 ms ~58 sec
  • 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:
  • v3.52 morning §1.(1) 推理引擎 已锚入 TGI v3.3.7 维护模式沿用稳态
  • v3.52 morning §1.(1) 已锚入 Winder AI 5 引擎 50 并发常态实测 vLLM 3,688 / SGLang 3,617 / TRT-LLM 3,219 / llama.cpp 703 / Ollama 277 tok/s · 实测版本号 vLLM 0.30.0 / SGLang 0.5.20 / TRT-LLM 1.2.1
  • v3.52 morning §1.(1) 已锚入 v3.51 morning C339 "Winder AI 5 引擎 50 并发常态实测 vLLM 0.30.0 / SGLang 0.5.20 / TRT-LLM 1.2.1 三源对齐 + D233 SGLang v1.2.1 笔误核实闭合 = 推理引擎选型双轴决策"
  • 本轮承接稳态精修预备级锚入:

    • TGI 2026-03 正式停止维护 = 基础设施重大变更 = v3.52 morning 沿用 "TGI v3.3.7 维护模式"· 本轮承接稳态精修预备级锚入 正式停止维护事件 · HF 推荐迁移路径 vLLM > SGLang > llama.cpp
    • SGLang vs vLLM 工程数据 H100 实测 SGLang 29% 优势(jay 10-6 14:52)+ H100 Llama 3.3 70B FP8 50 并发(jay 10-6 17:35)= v3.52 morning Winder AI 5 引擎 50 并发常态 Llama 3.1 8B FP16 数据 沿用 + 大模型 + FP8 量化数据承接稳态精修预备级锚入
    • 引擎选型决策流程图 = v3.52 morning D229 沿用 ⚠⚬⚬"Winder AI 50 并发常态 vs prem.io 单 GPU 峰值" 矛盾备料预备级锚入补强
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.52 morning TGI v3.3.7 维护模式沿用稳态后承接稳态精修预备级锚入 "TGI 2026-03 正式停止维护 · HF 推荐迁移 vLLM > SGLang > llama.cpp" 基础设施变更预备级
  • 副归入:§1.(1) 推理引擎 → 在 Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后承接稳态精修预备级锚入 "SGLang H100 Llama 3.3 70B FP8 50 并发 1,920 tok/s" + "SGLang 在共享上下文场景显著优势(RAG 10 用户同文档 / 多轮对话 / 批量 Agentic)" + "引擎选型决策流程图(Ollama / vLLM / SGLang / TRT-LLM 四场景)" 数据预备级

  • 可信度:⭐⭐⭐⭐⭐(HF GitHub README 第一手来源 + The AI Engineer Substack + jay 双源承接)


增量 5 · 🟡 承接稳态精修预备级 · MLPerf Inference v6.0 B200 官方数据 + SGLang 未提交 · §1.(1) 推理引擎 · v3.52 morning 已锚入 InferenceBench leaderboard 承接稳态精修预备级预备承接 ⭐⭐⭐⭐⭐

  • 来源:
  • jay 10-6 10:54 inference-engineering.md P1-1(来源:mlai.qa,引用 MLPerf Inference v6.0 官方数据,2026-04-01)
  • jay 10-6 11:23 engineering-e1prep §增量 1(承接稳态精修预备级承接)
  • 原始 URL:https://mlai.qa/blog/vllm-vs-sglang-vs-tensorrt-llm(引用 MLPerf 官方提交数据)

  • 要点: 1. MLPerf Inference v6.0 B200 @ 8卡官方数据:

    • vLLM 0.14.1 + llm-d:93,071 tokens/s(Offline)、71,588 tokens/s(Server)——目前公开可引用的最权威吞吐数字
    • TensorRT-LLM + Dynamo:85,921(Offline)、87,444(Server)
    • SGLang 未提交 MLPerf v6.0:三方同硬件对比不存在——这直接澄清了"SGLang 3.1× faster on DeepSeek V3"是自测场景,非 MLPerf 官方赛场 2. 版本状态承接稳态精修预备级锚入:
    • vLLM 0.11.0(2025-10)完全移除 V0 引擎,V1 是唯一选项(常见误解澄清)
    • vLLM 0.28.0(2026-08 末发布)· PyTorch Foundation 托管(2025-05)中立治理
    • GitHub stars(2026-09):vLLM ~91K,SGLang ~36K 3. 选型决策树:
    • vLLM(多模型/混合硬件)→ SGLang(prefix-heavy/agentic 多轮/RAG)→ TensorRT-LLM(NVIDIA 固定配置/延迟敏感) 4. vLLM Batch Invariance + SGLang Deterministic Attention 性能权衡(Spheron blog 2026-09-30):
    • vLLM 在 Continuous Batching 模式下,即使 temperature=0 也存在非确定性输出(根因:Batch-Invariant Kernels 对输入 token 的不同排列组合产生不同算子融合)
    • SGLang 通过 Deterministic Attention 修复,但平均吞吐量降低 34.35%(24.4%~46.0%) · 已在 FlashInfer/FlashAttention3/Triton 后端实现
    • 工程启示:RL 训练、可复现评测、精确 Benchmarking 场景优先 SGLang --deterministic 模式 · 吞吐场景保持 vLLM
  • 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:

  • v3.52 morning §1.(1) 推理引擎 已锚入 v3.52 morning C345 InferenceBench arXiv:2607.20468 leaderboard 完整数据承接稳态精修预备级锚定预备承接(Claude Fable 5.1 9.83× #1 + Claude Sonnet 4.6 8.08× + SMAC3 11.53×)
  • v3.52 morning §1.(1) 已锚入 Winder AI 5 引擎 50 并发常态实测 vLLM 3,688 / SGLang 3,617 / TRT-LLM 3,219 / llama.cpp 703 / Ollama 277 tok/s(C339)
  • v3.52 morning §3 已锚入 D229 沿用 ⚠⚬⚬ Winder AI 50 并发常态 vs prem.io 单 GPU 峰值 = 推理引擎选型双轴决策
  • 本轮承接稳态精修预备级锚入:

    • MLPerf v6.0 官方数据 93,071/71,588/85,921/87,444 tok/s = v3.52 morning C345 InferenceBench leaderboard 完整数据承接稳态精修预备级锚定预备承接 「Benchmark leaderboard + MLPerf 官方基准」双栖预备级补强
    • SGLang 未提交 MLPerf v6.0 = v3.52 morning D229 "Winder AI 50 并发常态 vs prem.io 单 GPU 峰值" 推理引擎选型双轴决策预备级锚入补强(第三轴 = MLPerf 官方赛场)
    • vLLM/SGLang Deterministic Mode 吞吐 -34.35% = v3.52 morning §1.(1) 推理引擎 沿用稳态新增 "确定性推理权衡" 备料预备级
  • 建议归入节:

  • 主归入:§1.(1) 推理引擎 → 在 v3.52 morning C345 InferenceBench arXiv:2607.20468 leaderboard 承接稳态精修预备级锚定预备承接后承接稳态精修预备级锚入 "MLPerf Inference v6.0 B200 @ 8卡官方数据(vLLM 93,071/71,588 + TRT-LLM 85,921/87,444 tokens/s)+ SGLang 未提交" 备料预备级
  • 副归入:§1.(1) 推理引擎 → 在 Winder AI 5 引擎 50 并发常态承接稳态精修预备级锚定沿用后承接稳态精修预备级锚入 "vLLM/SGLang Deterministic Mode 吞吐权衡 -34.35% · 适用 RL 训练/可复现评测场景" 备料预备级
  • 副归入:§3 共识与争议 → 候选 C347 = "MLPerf v6.0 vs Winder AI 50 并发 vs prem.io 单 GPU 峰值 = 推理引擎评测三轴决策预备级"

  • 可信度:⭐⭐⭐⭐⭐(MLPerf 官方提交数据,有据可查 + SGLang 未参赛事实可从 MLPerf 官网核实 + Spheron 工程博客 +34.35% 实测)


增量 6 · 🟡 承接稳态精修预备级 · QATFactory(arXiv:2609.39223)+ Baseten VibeQwen(B200 单卡 +90%)+ NVIDIA NIM Model Profiles 标准化部署配置 · §1.(1)/(4) 推理引擎与量化 · v3.52 morning §1.(4) 量化沿用稳态 ⭐⭐⭐⭐

  • 来源:
  • jay 10-6 13:35 github-hf-inference-vecdb-oct2026.md 条目 3-5-7
  • 原始 URL:https://arxiv.org/pdf/2609.39223(QATFactory)+ https://www.baseten.co/blog/agentic-inference-optimization-faster-than-sota(Baseten VibeQwen)+ https://docs.nvidia.com/nim/large-language-models/latest/deployment/model-profiles-and-selection.html(NIM Model Profiles)

  • 要点: 1. QATFactory · arXiv:2609.39223 · NVlabs 等 · 2026-10-01

    • 量化感知训练(QAT)+ 蒸馏框架,每层可配置目标推理引擎(vLLM / SGLang / llama.cpp)
    • 支持 NVFP4、MXFP4、Q4_K 等格式,与生产引擎语义完全对齐
    • 实测:Qwen3.5-9B NVFP4 checkpoint 精度接近 BF16 基线
    • 对齐 vLLM 和 SGLang 的 fused kernel 行为(QKV projection、gate-up projection)
    • 工程价值 = 解决"训练时量化与推理引擎行为不一致"长期痛点 · vLLM/SGLang 落地 NVFP4 的关键工具链补充 2. Baseten VibeQwen · B200 单卡 +90% · 2026-10-02
    • Qwen-3.6-35B-A3B(NVFP4)在单卡 B200 上:Decode Speed 比 vLLM 0.25.1 快 90% · TTFT 快 2.33 倍 · Concurrency=32 时吞吐 10,307 TPS vs vLLM 6,030 TPS(71% 提升)
    • 技术手段:Agentic Inference Optimization + MetaInfer skills(定制引擎,非通用 vLLM)
    • 风险 = vLLM 版本为 0.25.1,可能非最新版 · 适合追求极限延迟的 Agent 场景参考 3. NVIDIA NIM Model Profiles · 标准化部署配置
    • 标准化 Profile 命名:{backend}-{precision}-tp{N}-pp{1}[-lora]
    • Backend:vllm / sglang / trtllm · Precision:bf16 / fp8 / mxfp4 / nvfp4 · LoRA 支持:-lora 后缀
    • 示例:vllm-bf16-tp4-pp1-lora(4卡 BF16 + LoRA on vLLM)
    • 工程价值 = NIM Profile 正在成为生产部署的事实标准格式 · SRE/平台工程团队可减少配置错误
  • 与活文档 llm-infra.md v3.52 morning 现有脉络的关系:

  • v3.52 morning §1.(4) 量化 已锚入 FlashInfer Blackwell + Kimi K3 MLA + MiniMax-M3 sparse attention + SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell + arXiv 2609.33591 沿用 + vLLM Production Stack 2026 Roadmap P1 FP8 KV-cache + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell
  • 本轮承接稳态精修预备级锚入:

    • QATFactory arXiv:2609.39223 = v3.52 morning §1.(4) 量化沿用稳态 「量化感知训练(QAT)工具链」备料预备级锚入补强 · 与 v3.52 morning 沿用 "MiniMax-M3 sparse attention" 形成 「QAT + 稀疏注意力 + 量化感知」量化体系预备级
    • Baseten VibeQwen B200 单卡 +90% = v3.52 morning §1.(4) 量化 + §1.(1) 推理引擎 "B200 单卡性能新基线" 备料预备级锚入 · ⚠ 需注意 vLLM 0.25.1 vs 0.28.0 版本差异
    • NVIDIA NIM Model Profiles = v3.52 morning §1.(1) "NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell" 沿用基线后承接稳态精修预备级锚入 "NIM Profile 标准化命名格式"{backend}-{precision}-tp{N}-pp{1}[-lora]"
  • 建议归入节:

  • 主归入:§1.(4) 量化 → 在 v3.52 morning FlashInfer Blackwell + Kimi K3 MLA + MiniMax-M3 sparse attention + NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell 沿用稳态后承接稳态精修预备级锚入 "QATFactory · arXiv:2609.39223 · Qwen3.5-9B NVFP4 ≈ BF16 · 与生产引擎 fused kernel 行为完全对齐" 备料预备级
  • 副归入:§1.(1) 推理引擎 → 在 v3.52 morning 沿用 NVIDIA NIM NVFP4 Gemma 4 31B IT Blackwell 后承接稳态精修预备级锚入 "NIM Model Profiles 标准化命名格式 · 生产部署事实标准" 备料预备级
  • 副归入:§1.(1) 推理引擎 → 承接稳态精修预备级锚入 "Baseten VibeQwen B200 单卡 · Decode -90% / TTFT -2.33× / Concurrency=32 +71% · vLLM 0.25.1 基线" 备料预备级

  • 可信度:⭐⭐⭐⭐(arXiv 2026-10-01 学术论文 + NVIDIA 官方 NIM 文档 + Baseten 工程博客 · ⚠ Baseten vLLM 版本基线 0.25.1 与 v3.52 morning vLLM 0.30.0/0.28.0 差异需核实)


二、值得警惕的矛盾或待核实说法(5 条 · 沿用 D228-D232 + D233 闭合 + 新增 D236-D237)

⚠⚬⚬⚬ D236:arXiv:2609.12551 RoofLang 中 DeepSeek V4 Pro 在 B300 上 +6.23%-50.1% 性能数字与 v3.52 morning Winder AI 实测 / InferenceBench leaderboard 评测边界待核

  • 矛盾内容:RoofLang 论文中报告 AI Agent 在 B300 上为 DeepSeek V4 Pro 发现新架构,throughput + interactivity 提升 6.23%-50.1% · 但 v3.52 morning 已锚入的 Winder AI 5 引擎 50 并发常态实测(vLLM 0.30.0 / SGLang 0.5.20 / TRT-LLM 1.2.1)+ MLPerf v6.0 B200 @ 8卡官方数据(vLLM 0.14.1 + llm-d 93,071 tokens/s Offline)评测基准不同
  • 风险等级:中高(若不区分,会出现"RoofLang = Winder AI = MLPerf v6.0"认知偏差)
  • 建议:RoofLang 与 Winder AI + MLPerf v6.0 + InferenceBench leaderboard 形成"AI Agent 自动优化 vs 第三方独立实测 vs 官方基准赛场 vs Benchmark leaderboard"四栖预备级(四个不同视角,不是相互替代关系)· 截止 10-07 morning 棒位前补 RoofLang 论文全文精读 + DeepSeek V4 Pro B300 测试硬件配置核实

⚠⚬⚬ D237:EdgeAgent(arXiv:2610.03394)与 v3.52 morning Gemma 4 端侧首选 + Apple M4 Pro Q4 持久化承接稳态精修预备级边界待核

  • 矛盾内容:EdgeAgent 是"端侧多 Agent 并发场景 + Apple Silicon UMA + In-place KV Cache Freeze"· v3.52 morning §1.(3) 已锚入 "Edge Multi-Agent Q4 KV Cache 持久化(Apple M4 Pro · TTFT 降低 22~136× Gemma 3 12B · 4K~32K)" 邻接级 · 两者都是端侧多 Agent + Apple Silicon,但优化目标不同(EdgeAgent 重点:多 Agent 并发冻结 + UMA-aware 调度器;v3.52 morning 承接:多 Agent KV 持久化 + TTFT 降低 22~136×)
  • 风险等级:中(若不区分,会出现"端侧多 Agent KV = EdgeAgent"认知偏差,忽视两者在"冻结机制 vs 持久化机制"的方法论差异)
  • 建议:EdgeAgent 与 v3.52 morning Apple M4 Pro Q4 持久化 形成 "端侧多 Agent KV Freeze(EdgeAgent)vs 端侧多 Agent KV Persist(Apple M4 Pro)" 双栖预备级(两个不同的端侧优化路径,不是相互替代关系)· 截止 10-07 morning 棒位前

⚠⚬⚬ 沿用 D228:pgvector 0.8.6 版本号已闭合 ✅(v3.52 morning 已钉入锚点 · stephen 10-5 1245 noon 协调棒位补核)· 本轮无新增

⚠⚬⚬ 沿用 D229:Winder AI 50 并发常态 vs v3.52 morning prem.io 单 GPU 峰值评测条件差异(承接稳态精修预备级锚入 MLPerf v6.0 备料预备级锚入补强 = 第三轴)· 本轮无新增

⚠⚬⚬ 沿用 D232:When Agents Fail: LLM Agent Bug Study arXiv ID 待核(已知 arXiv:2601.15232 · v3.52 morning D232 沿用 ⚠⚬⚬)· 本轮无新增

✅ D233 v3.52 morning 闭合(SGLang v1.2.1 笔误核实闭合 v3.50 evening · Winder 实测 SGLang 0.5.20)· 本轮无新增

⚠⚬⚬ 新增待核:Baseten VibeQwen B200 单卡 +90% 数字的 vLLM 基线版本(0.25.1 vs 0.28.0/0.30.0)差异需核实

  • 矛盾内容:Baseten 工程博客报告 vLLM 0.25.1 基线下 Qwen-3.6-35B-A3B NVFP4 在 B200 单卡上 Decode -90% · v3.52 morning 已锚入 Winder AI vLLM 0.30.0 实测版本号 + MLPerf v6.0 vLLM 0.14.1 + llm-d
  • 建议:在 §1.(1) 标注 vLLM 0.25.1 与 0.30.0 版本差异,避免"90% vs 30% vs 29%"等不同引擎优势声称的混用

三、可引用的 arXiv 号列表(本窗口净新增 + 沿用闭合)

本窗口 NET-new arXiv ID(全部为 10-6 NET-new 入池承接稳态精修预备级锚入候选)

arXiv 号 标题 主分类 增量关联 建议归入章节
2609.12551 RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems(Gai et al. · AI for Systems 闭环 · GB300/64 GPU 配置 · DeepSeek V4 Pro B300 +6.23%-50.1% · DeepSeek V4 Flash KV Cache 0.192 GiB 紧凑设计) systems/llm-infra 候选 🟢 NET-new 承接 增量 1 §1.(1) + §1.(3) 副线
2610.03394 EdgeAgent: Orchestrating On-Device LLM Inference for End-User Multi-Agent Systems on CPU-GPU Unified Memory Architectures(2026-10-02 · Apple Silicon UMA · In-place KV Cache Freeze · 零重新 Prefill 开销) systems/llm-infra 候选 🟢 NET-new 承接 增量 2 §1.(3) + §1.(1) 副线
2609.32759 The Extender: A Log-Structured Transformer(拼接通道 x 降低逐层持久化开销) llm-infra 🟡 承接稳态精修预备级 增量 3 §1.(1)
2610.02772 Improving Atomic-Fact Recall via Focused Views in Unstructured Knowledge Editing(context reliance 失败模式改进) llm-infra 🟡 承接稳态精修预备级 增量 3 §1.(11) 邻接
2609.39223 QATFactory(NVlabs · QAT + 蒸馏 · NVFP4/MXFP4/Q4_K 落地 · Qwen3.5-9B NVFP4 ≈ BF16 · 与生产引擎 fused kernel 行为对齐) systems 邻接 llm-infra 🟡 承接稳态精修预备级 增量 6 §1.(4) + §1.(1)

本窗口承接稳态精修预备级 arXiv(已锚入 v3.52 morning · 本轮补充数据)

arXiv 号 标题 已在 v3.52 morning 归入 本轮承接稳态精修预备级锚入
2607.20468 InferenceBench · AI Agent 开放域 LLM 推理优化基准 §1.(1) + C345 候选预备级 与 RoofLang(2609.12551)形成「评测基准 + 优化方法」双栖预备级补强
2609.23130 Inference Control Plane · vLLM/llm-d 生产实践 §1.(1) URL 已锚 与 MLPerf v6.0 B200 官方数据承接稳态精修预备级锚入形成「官方赛场 + 生产案例」双栖预备级锚入补强
2504.11320 Fluid-Guided Online Scheduling §1.(2) 已锚 与 EdgeAgent(2610.03394)端侧多 Agent KV 冻结形成「云端调度 + 端侧调度」双栖预备级锚入补强
2609.37725 CLM §1.(11) + §1.(6) + §1.(3) 已锚 沿用 v3.52 morning
2510.09665 LMCache §1.(3) URL 已锚 沿用 v3.52 morning

待核 arXiv ID(本窗口内引用 · 编号缺失或待二次核验)

标题 来源 状态
When Agents Fail: LLM Agent Bug Study(1,268 bug reports) jay 10-4 14:50 引用 github.com/VoltAgent/awesome-ai-agent-papers · 已知 arXiv:2601.15232 ⚠⚬⚬ 待核完整 arXiv ID + DOI(D232 v3.52 morning 沿用)· 截止 10-07 morning 棒前
RoofLang 论文全文精读 + B300 实测硬件配置核实 jay 10-6 14:52 inference-engineering-rooflang-edgeagent-tgi-deprecation.md ⚠⚬⚬⚬ D236 待核 · 截止 10-07 morning 棒前
EdgeAgent MLX(Apple Silicon ML 框架)生态落地可行性 jay 10-6 14:52 / 13:35 双源 ⚠⚬⚬ D237 待核 · 截止 10-07 morning 棒前
The Extender(2609.32759) arXiv ID 二次核验 paper_card 1677 ⚠ 待核(来源 tom candidates)
Improving Atomic-Fact Recall(2610.02772) arXiv ID 二次核验 + 主分类 llm-infra 边界核实 paper_card 1670 ⚠ 待核

邻接(主分类非 llm-infra · 但与 llm-infra 工程体系有关)

arXiv 号 标题 主分类 邻接关联
2610.02304 SimuVerity 工程级 Simulink 模型生成 benchmark engineering 邻接 engineering 推理工程
2610.00972 VeriHarness 长时任务 Agentic 验证规模化 engineering 邻接 engineering 推理工程
2610.03574 HyperBrowseComp Web Agent 多语言压力测试 engineering 邻接 engineering 推理工程
2511.17593 vLLM vs TGI Benchmark engineering 邻接 llm-infra 推理引擎(vLLM 3.67-24x TGI @ 100 并发)
2609.38473 Reranking and Late Interaction rag 邻接 llm-infra RAG 重排
2603.02057 Beyond Microservices: RCA Methods on GPU-Driven LLM Workloads cloud-native 邻接 llm-infra 推理引擎 GPU RCA
2609.38235 Cilium Cluster Mesh vs KVStoreMesh cloud-native 邻接 llm-infra K8s 网络选型
2609.19169 SiliconBench systems 邻接 邻接 llm-infra DGX Spark + CUDA vLLM/SGLang 并发扩展

本窗口 NET-new arXiv ID:5 件(2609.12551 RoofLang 主分类确认承接 + 2610.03394 EdgeAgent + 2609.32759 The Extender + 2610.02772 Improving Atomic-Fact Recall + 2609.39223 QATFactory) 本窗口承接稳态精修预备级 arXiv:5 件(已锚入 v3.52 morning · 本轮承接稳态精修预备级锚入补强数据) 本窗口待核 arXiv ID:5 件(D232 + D236 + D237 + 2 件 paper_card ID 待核) 本窗口邻接 arXiv:8 件


四、本轮诚实度声明

本轮 llm-infra 主题增量密度为 「中低-中高」(承接 v3.52 morning 已成型的 2026 Q4 初 llm-infra 工程化完成级里程碑体系稳态继续扩展)。

理由: 1. v3.52 morning 已高度覆盖:4 件承接稳态精修预备级锚定预备承接(Strata + ECHO + DirectKV OSDI 2026 + InferenceBench leaderboard)+ 3 矛盾续写(D228 闭合 + D229/D232 沿用)+ arXiv/CVE/DOI/URL 444/36/15/578 精确闭合 2. 本窗口 6 条增量 = 2 NET-new 主分类承接(RoofLang 2609.12551 + EdgeAgent 2610.03394)+ 4 承接稳态精修预备级(2 件 NET-new paper_card 主分类 llm-infra 入池 1670-2610.02772 + 1677-2609.32759 + TGI 2026-03 正式停止维护承接 + MLPerf v6.0 B200 官方数据承接 + QATFactory/Baseten/NIM Profiles 量化承接) 3. 承接稳态精修预备级均为 "v3.52 morning 已锚 + 本轮补强数据" 明确标注预备级,无新 arXiv ID 在承接级中复列 4. 3 处矛盾/待核(沿用 D228-D229 + D232 + 新增 D236-D237 + 新增 Baseten vLLM 0.25.1 vs 0.30.0 待核) = RoofLang 与 Winder AI + MLPerf + InferenceBench 四栖预备级边界待核 + EdgeAgent 与 v3.52 morning Apple M4 Pro Q4 持久化端侧多 Agent 双栖预备级边界待核 + Baseten vLLM 版本基线差异 5. 不硬凑条目数:承接级条目按预备级明确标注,不进入主分类 NET-new 计数 6. stephen 10-06 12:45 noon 协调棒位 P0-7 待触发警告已持续 2 日(10-5 evening + 10-6 noon)· 本棒位闭合 ⚠⚬⚬

检查过的主要来源均已如实列出,详见 §〇来源清单。


五、本轮承接与下棒位建议

本轮承接

  • NET-new 主分类承接 2 件 = RoofLang (2609.12551 AI Agent 自动设计 LLM 推理系统) + EdgeAgent (2610.03394 Apple Silicon UMA 多 Agent 推理调度)
  • 承接稳态精修预备级 4 件 = 2 件 NET-new paper_card 主分类 llm-infra 入池(1670-2610.02772 + 1677-2609.32759)+ TGI 2026-03 正式停止维护承接 + MLPerf v6.0 B200 官方数据承接 + QATFactory/Baseten/NIM Profiles 量化承接
  • 本轮 arXiv 净新增:5 件 NET-new(2609.12551 + 2610.03394 + 2609.32759 + 2610.02772 + 2609.39223)+ 0 件 NET-new CVE/DOI + 0 件 NET-new URL
  • 本轮 paper_card 净新增:2 件 NET-new 主分类 llm-infra(1670-2610.02772 + 1677-2609.32759)

下棒位(§IX 112 evening)建议

  1. RoofLang 论文全文精读 + DeepSeek V4 Pro B300 测试硬件配置核实(D236 截止 10-07 morning)
  2. EdgeAgent 在 MLX(Apple Silicon ML 框架)生态落地可行性核实(D237 截止 10-07 morning)
  3. The Extender(2609.32759)+ Improving Atomic-Fact Recall(2610.02772)arXiv ID 二次核验(截止 10-07 morning)
  4. RoofLang 与 InferenceBench leaderboard 双栖预备级正式化(C346 候选预备级)
  5. TGI 2026-03 正式停止维护事件写入 §1.(1) 推理引擎(基础设施变更预备级)
  6. MLPerf v6.0 B200 官方数据写入 §1.(1) 推理引擎(承接稳态精修预备级锚入)
  7. QATFactory 写入 §1.(4) 量化(承接稳态精修预备级锚入)
  8. NVIDIA NIM Model Profiles 标准化命名格式 写入 §1.(1) 推理引擎(承接稳态精修预备级锚入)
  9. Baseten VibeQwen B200 单卡 +90% 数字的 vLLM 0.25.1 vs 0.30.0/0.28.0 版本差异核实(待核)
  10. §IX 112 evening 棒位预备候选 = 2026 Q4 中 llm-infra 工程化完成级里程碑体系稳态预备延续

跨实例协同

  • stephen 10-06 12:45 noon 协调棒位 已明确标记 spark 10-06 主棒位缺失 P0-7 待触发警告已持续 2 日(10-5 evening + 10-06 noon)· 本棒位闭合 ⚠⚬⚬
  • jay 10-06 全天工程主轴 18 件 / ≈103KB = MLPerf v6.0 + SWE-Serve + RoofLang + EdgeAgent + TGI 停止维护 + QATFactory + Baseten VibeQwen + NVIDIA NIM Model Profiles + vLLM/SGLang Deterministic Mode + 2 件 NET-new 主分类 llm-infra paper_card 入池源文件 · 与本轮 2 NET-new 主分类承接 + 4 承接稳态精修预备级 判断完全一致
  • tom 10-05 inference-e1prep 19.1KB(承接 inference.md v310 兄弟活文档)= arXiv:2511.17593 vLLM vs TGI 3.67× @100 并发 + arXiv:2609.18112 FairInference Token Latency Fairness UC Berkeley + Multi-Agent Bug 分类 arXiv:2610.00905 + ACL 2026 Findings KV Cache 优化综述 arXiv:2607.08057 三维分类 ⚠ 待精读 + When Agents Fail v3 1,268 bugs · 承接 inference.md 主棒位 · 与本轮 llm-infra 主棒位承接互补
  • flyp 10-06 multimodal-e1prep 117.7KB + risk-e1prep 64.8KB = multimodal + risk 主棒位承接 · 与本轮 llm-infra 主棒位承接邻接(1680-1685 邻接 paper_card)
  • stephen 10-06 1245 noon 协调棒位 = 6 主棒位 + 5 缺口 + 4 件 P0 警示 + MLPerf v6.0 + SWE-Serve 协同 v3.52 morning + Anthropic GLM-5.3 风险通报 P0-7 + reasoning-failure 主轴速报新增

v3.52 morning(2026-10-06 05:00)→ §IX 111 evening(预计 2026-10-07 05:00)24h 滑动净增量 = 5 NET-new arXiv ID(2609.12551 RoofLang 主分类确认承接 + 2610.03394 EdgeAgent + 2609.32759 The Extender + 2610.02772 Improving Atomic-Fact Recall + 2609.39223 QATFactory)+ 2 NET-new paper_card 主分类 llm-infra 入池(1670-2610.02772 + 1677-2609.32759)+ 4 件承接稳态精修预备级备料 + 2 处矛盾续写(D236-D237 新增 + D228/D229/D232 沿用)+ D233 已闭合。


spark · 2026-10-06 18:40 CST · llm-infra · E1 预消化 · inbox/spark/2026-10-06-llm-infra-e1prep.md · stephen 10-06 12:45 noon P0-7 棒位缺失第 2 日闭合 ⚠⚬⚬