llm-infra · E1 预消化简报(2026-09-19)

实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-19 18:40 CST 基线:organized/knowledge/llm-infra.md v3.37 §IX 100 evening 升档棒(cutoff 2026-09-19 05:00 CST · arXiv/CVE/DOI/URL 388/36/15/574 · 13 arXiv + 1 DOI + 8 NET-new 整合级预备候选 + 5 NET-new inference/K8s/CNCF 核心预备级 + D166-D168 新增 · paper_cards 1434 张稳态) 本棒窗口:v3.37 cutoff 2026-09-19 05:00 → 2026-09-19 18:40 = 约 13h 40min 净窗口期 + 9-18 18:40 → 9-19 18:40 = 24h 滑动窗口对照 核心判断:本轮属于"v3.37 升档棒落定后 13h 40min 净窗口期延长 + NET-new 1 件 paper_card 主分类 llm-infra 入库净增"(Sample Count Is Not Enough paper_card 1432 · arXiv:2609.19499 · 测试时扩展能耗/性能研究)+ 4 件 NET-new inference/K8s 整合级预备候选预备级精修(① vLLM MTP(Qwen3.8-27B · 单 flag · 1.7-2x 改善)+ ② TriAttention(10.7x KV 压缩 / 2.5x 吞吐 · NVIDIA TensorRT-LLM 合入)+ ③ TensorRT-LLM DeepSeek-V4 Agentic Workload 优化(GB300 + KV-cache-aware routing)+ ④ SGLang 2026 半年更新全景 + suffix decoding 集成)+ 1 件 NET-new inference 学术预备候选精修(No Buffer, No Bottleneck · OSDI '26 · 零拷贝 KV Cache 卸载)+ 1 件 NET-new inference 整合级精修(OpenAI Agents API 重大更新 · 2026-09-10 · hosted harness + 三 surface 架构)+ 1 件 NET-new 子领域整合级精修(HF State of Open Models Summer 2026 二次承接 + Qwen 240.1M 下载 / <1B 占 83% / Qwen3-0.6B 手机端可行)+ 1 件 NET-new KV Cache 整合级精修(ACL 2026 Survey: System-Aware KV Cache Optimization arXiv:2607.08057)+ 3 件承接稳态无新增量信号来源(tom 9-19 0840 radar + tom 9-19 1440 radar + jay 9-19 1105 briefing = 大量承接 v3.37 锚定 13 NET-new arXiv ID + 8 NET-new 整合级预备候选 · 0 件 NET-new 主轴突破)+ 2 件矛盾/待核 v3.37 沿用(D165 NVIDIA HF 收购降级稳态 + D166 CodeComp arXiv ID 待核稳态)+ work-queue 9-19 18:00 警示 = 0 件 llm-infra 主分类待深度解读 / 0 件待更新缺失主题活文档 / 待富化 15 张卡缺 TLDR


一、检查过的来源清单

1.1 工作队列 + v3.37 知识库活文档(沿用稳态)

  • organized/queue/work-queue.md(2026-09-19 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 0 件 = 0 件主分类 llm-infra · 选题榜未成视频脚本 1 件 = 2609.20511 · 4.3) Tom 认领 = TheoLeeCJ/SemIf(周增 +0 / Stars 1648 · Semantic ifs from open models on a 3090 at home · 趋势上升)· 4.4) spark 认领 = 无 · spark 认领段无内容警示(沿用 v3.37 状态)+ 5) 富化缺口 15 张卡缺 TLDR(待 cron_s2 覆盖)+ 6) 待精确分类 0 张卡(主分类缺失或待LLM精修)· work-queue 9-19 主分类 llm-infra 0 件 net-new 警示 沿用 v3.37 状态

  • organized/knowledge/llm-infra.md v3.37 §IX 100 evening 升档棒(2026-09-19 05:00):arXiv/CVE/DOI/URL 388/36/15/574 精确闭合 + paper_cards 实际目录扫描 1434 张稳态(v3.36 cutoff 后 +26 张 1409-1434 跨度 · 1 件 llm-infra 主分类净增 = DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 ⭐⭐⭐⭐⭐ · 552B multimodal MoE + 长上下文 + KV Cache 压缩)+ 13 件 NET-new arXiv ID v3.37 入主文件 = arXiv:2604.24971 PolyKV ⭐⭐⭐⭐⭐ + arXiv:2604.10235 CodeComp ⭐⭐⭐⭐ + arXiv:2609.00006 Anatomy of Coding Agents ⭐⭐⭐⭐⭐ + arXiv:2609.19969 DeepSeek-V4.1-Flash paper_card 1417 ⭐⭐⭐⭐⭐ + arXiv:2605.29979 LLM Inference Fingerprinting ⭐⭐⭐⭐⭐ + arXiv:2609.17652 Fathom paper_card 1413 ⭐⭐⭐ + arXiv:2609.18063 Edge0 paper_card 1411 ⭐⭐⭐⭐ + arXiv:2603.27467 TurboAngle + arXiv:2609.18708 Rethinking Critic Learning in PPO paper_card 1403 + arXiv:2609.19134 ScienceIDE + arXiv:2609.15810 VC-Attention + arXiv:2606.07402 M3Exam + arXiv:2602.03442 A-RAG + 1 件 NET-new DOI 入主文件 = DOI:10.5281/zenodo.19686729 PolyKV Zenodo + 8 件 NET-new 整合级预备候选首次实质锚入 = ① PolyKV 多 Agent KV cache 共享 73-78% token 节省 · ② CodeComp 代码 Agent 结构感知 KV 缓存压缩 · ③ Anatomy of Coding Agents Harness Engineering 实证基础 · ④ An Internet for the KV Cache KV cache 基础设施新范式 · ⑤ DeepSeek-V4.1-Flash paper_card 1417 552B multimodal MoE · ⑥ K8s v1.37 Ingress NGINX 强制停更 + Gateway API 迁移倒计时 · ⑦ Inference Cost Attacks on RAG arXiv:2606.02643v1 CREEP framework · ⑧ HF State of Open Models Summer 2026 · D165 雷达矛盾降级 ⚠️⚠️⚠️(NVIDIA $12.93B HF 收购 web_search 2026-09-18 4 源独立验证)+ D166 CodeComp arXiv:2604.10235 arXiv ID 完整核实 ⚠️ + D167 WeVisDoc paper_card 1419 主分类订正 multimodal/document parsing ⚠️ + D168 BraTS-GoAT paper_card 1414 主分类订正 engineering/medical ⚠️

1.2 inbox/spark(2026-09-18 18:40 → 2026-09-19 18:40 · spark 全天棒位空窗延续 + 3 件 09-19 棒位空窗)

  • 2026-09-18-llm-infra-e1prep.md(2026-09-18 18:40 CST · spark 9-18 evening 棒位 437 行 ≈ 60KB · v3.36 基线锚定 · 13h 40min 净窗口期内承接 jay 9-18 全天棒位 19 文件 ≈ 130KB · 本棒位承接基线)
  • 2026-09-19-1000-rss-gradient-flow.md(2026-09-19 10:00 CST · 1.6KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.37 §1.(11) Kernel/Harness 子轴沿用稳态)
  • 2026-09-19-1001-rss-chip-huyen.md(2026-09-19 10:01 CST · 1.4KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.37 §1.(11) Kernel/Harness 子轴沿用稳态)
  • 2026-09-19-agent-e1prep.md(2026-09-19 13:35 CST · 62.2KB · agent 主轴 · 非 llm-infra 主轴 · 0 件 llm-infra 主轴 net-new · 邻接 v3.37 §1.(11) Kernel/Harness + Harness Engineering 承接稳态)

spark 9-19 全天棒位空窗延续 3 棒位(沿用 v3.37 spark 空窗沿用态势):13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 2 份 RSS 抓取 + 1 份 agent 棒位 = 本棒位为 spark 9-19 evening 棒位预备补位承接 v3.37 evening 升档棒预备扩增预备级(承接 spark 9-18 evening llm-infra e1prep 60KB + jay 9-19 全天棒位 14 文件)。

1.3 inbox/jay(2026-09-18 18:40 → 2026-09-19 18:40 · llm-infra 主轴主承载 · 14 文件 ≈ 110KB)

  • 2026-09-19-0340-news-x-tech-radar.md(2026-09-19 03:40 CST · 2.2KB · X tech radar)· 0 件 llm-infra 主轴 net-new · 邻接 v3.37 §1.(10) 顶会部署子轴沿用稳态
  • 2026-09-19-1000-rss-bytebytego.md(2026-09-19 10:00 CST · 1.2KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1000-rss-cool-papers.md(2026-09-19 10:00 CST · 1.5KB · 10 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1000-rss-cool-papers-ir.md(2026-09-19 10:00 CST · 1.6KB · 10 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1000-rss-nathan-benaich.md(2026-09-19 10:00 CST · 1.6KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1000-rss-raschka.md(2026-09-19 10:00 CST · 1.1KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1000-rss-simon-willison.md(2026-09-19 10:00 CST · 1.5KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-rss-import-ai.md(2026-09-19 10:01 CST · 1.2KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-rss-lilian-weng.md(2026-09-19 10:01 CST · 1.3KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-rss-msr-blog.md(2026-09-19 10:01 CST · 2.0KB · 5 件 RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19T1105-jay-five-category-briefing.md(2026-09-19 11:07 CST · 11.1KB · 本棒位核心增量源 1 · 上午棒位 LMCache + PolarKV + KV Cache 调度理论 + PagedAttention + 推理引擎横评)= 6 件 Backend/LLM Inference = ① LMCache arXiv:2510.09665v1(生产级 KV Cache 持久化层 · v3.35 已实质锚入 §1.(3) KV Cache 沿用稳态)+ ② PolarKV(VLDB 2026 · 云内存+存储分层 KV Cache · v3.36 已实质锚入沿用稳态)+ ③ 推理引擎横评 vLLM/SGLang/LMDeploy(premai + atomic.chat · prefix >60% → SGLang · 2026 峰值差距 5-15% · v3.37 §1.(1) 推理引擎锚定沿用稳态)+ ④ KV Cache 调度理论(MIT + MSR · MC-SF 算法常数竞争比 · v3.35 已实质锚入 §1.(2) 推理调度沿用稳态)+ ⑤ PagedAttention 内存管理(vLLM 核心机制 · v3.35 已实质锚入沿用稳态)+ ⑥ KV Cache 优化策略全图(arXiv:2603.20397v1 · Dell Technologies · v3.35 已实质锚入沿用稳态)+ GPUStack(GPU 集群管理器 KubeFlow for GPU)+ Reef Infrastructure(推理服务器即持续学习基础设施 · inference-as-learning · agent production 架构设计参考)+ HF Blog KV Cache 系列(per-tensor layout maps for GGUF)
  • 2026-09-19-1050-jay-engineering-filter.md(2026-09-19 10:53 CST · 20.1KB · 本棒位核心增量源 2 · 工程实践二次筛选)= 3 件保留条目(承接稳态) = ① GPUStack K8s GPU 集群管理(承接稳态)+ ② SGLang 0.5.15(v3.36 §1.(1) 推理引擎锚定沿用)+ ③ Reef Infrastructure(inference-as-learning · 承接稳态)
  • 2026-09-19-csdn-llm-inference-rag-agent-tech-survey.md(2026-09-19 08:21 CST · 10.1KB · 本棒位核心增量源 3 · CSDN 综合调研)= 6 件高价值 CSDN(承接稳态) = ① 推理框架横评 vLLM/SGLang/TRT-LLM/TGI(CSDN · 含命令/API 示例)② TensorRT-LLM 完整指南 NVFP4(高可信 · TRT-LLM v0.18+)③ RAG 原理到实战全解(高可信 · 含 Python 示例)④ ONNX/TRT/vLLM 三路线横评(2025-08 · 邻接级预备级)⑤ 8大 Agent 框架选型对比(框架对比表)⑥ SGLang vs vLLM 昇腾实测(国产硬件视角稀缺)
  • 2026-09-19-ai-engineering-trending-rag-observability.md(2026-09-19 09:36 CST · 10.4KB · 本棒位核心增量源 4 · 工程趋势综合)= 多邻接级承接稳态 · 邻接 v3.37 §1.(11) Kernel/Harness 子轴沿用
  • 2026-09-19-engineering-e1prep.md(2026-09-19 11:22 CST · 14.8KB · Jay 上午棒 · engineering 主轴)· 本棒位核心增量源 5 = 6 件 NET-new 整合级承接(承接 v3.37 §1.(1) 推理引擎 + §1.(3) KV Cache + §1.(9) 安全 + §1.(10) 顶会部署子轴)= 承接稳态 + 6 件 NET-new 工程整合级预备候选预备级精修预备级(承接 v3.37 锚定 13 NET-new arXiv ID + 8 NET-new 整合级预备候选 + 5 NET-new inference/K8s/CNCF 核心预备级精修)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-llm-inference-agents-k8s.md(2026-09-19 13:37 CST · 16.0KB · 本棒位核心增量源 6 · LLM 推理优化 + Agent 框架 + K8s 部署草稿 · 本棒位 NET-new 整合级预备候选预备级精修核心源)= 5 件 LLM 推理优化 NET-new 整合级预备候选预备级精修 = ① vLLM MTP(Multi-Token Prediction)Qwen3.8-27B 实测 ⭐⭐⭐⭐⭐(HF Blog EcoHash AI · 2026-09-15 · NVIDIA RTX PRO 6000 Blackwell 96GB 单卡 · --speculative-config={"method":"mtp","num_speculative_tokens":3} · TPOT 22ms→13ms 1.7x · 吞吐量 43→78 tok/s 1.8x · 同延迟 SLO 下并发上限 32→64 2x · K=3 acceptance length math 3.39 / code 2.61 / chat 2.52 · 第一个 token acceptance math 92% / chat 73% · KV cache 反而减少 23% 因为 MTP block 自带 attention 层需 cache · 适合生产部署无需训练自定义 speculator 直接用模型内置 MTP head · 关键洞察:MTP 是目前最简单且收益最高的推理优化手段之一)② TriAttention KV cache 压缩 10.7x / 吞吐量 2.5x ⭐⭐⭐⭐(GitHub WeianMao/triattention · 2026-08 · 三角函数频域压缩 KV cache · 适合长推理任务 · 精度无损 40.8 vs 40.8 on AIME25 · 已集成 NVIDIA TensorRT-LLM 2026-08-04 官方合并 + vLLM plugin 透明集成 + SGLang backend + llama.cpp AMD GPU via ROCm · Ollama 规划中 · TRIATTN_RUNTIME_KV_BUDGET=2048 默认 + TRIATTN_RUNTIME_DIVIDE_LENGTH=128 压缩触发间隔 · 关键洞察:长上下文推理 Agent / RAG / 长文档的工程级解决方案 · 已进 NVIDIA 上游 · 成熟度高)③ TIDE Token-Informed Depth Execution 逐 Token 早退出 ⭐⭐⭐(GitHub RightNow-AI/TIDE · 支持任意 Hugging Face 因果 LM · 推理时只需加载 router.pt ~0.5M 参数 · Decode 阶段 99% reasoning token 早退出 · Prefill 最多 7.2% 加速 A100 实测 · 3 行代码集成 · 关键洞察:创新性通用推理优化思路 · 工程化程度较高 · 但需要针对每个模型单独 calibration · 非生产推理服务器内置功能 · 适合自建推理 pipeline 的团队探索)④ TensorRT-LLM DeepSeek-V4 优化 Agentic Workload ⭐⭐⭐⭐(NVIDIA/TensorRT-LLM 官方博客 · KV-cache-aware routing 通过增量 tokenization + 区块匹配分数实现对话前缀复用 + 滑动窗口缓存生命周期管理 per_request 策略避免全 prompt 缓存浪费 + 池比例调优 pool_ratio 控制 HBM 在滑动窗口缓存和持久压缩缓存间的分配 · GB300 上 AgentPerf 配置 SLO20 达到 57.5 concurrency/GPU · SLO60 达到 19.2 CPG · Part I 结果:相同 DeepSeek-V4 Pro 8K/1K 负载下峰值输出吞吐量从 984 → 1618 tokens/s/GPU +64.5% · 关键洞察:面向 DeepSeek-V4 生产部署的权威优化指南 · Part II 的 agent 场景路由和缓存管理思路可迁移到其他 MoE 模型)⑤ LLM 推理优化综合指南(HF Transformers 官方文档 · Static KV-cache + torch.compile 可达 4x 加速 + Speculative decoding + FlashAttention2/SDPA + 量化 Quanto/AQLM/VPTQ/AWQ/AutoGPTQ + Padding-free fine-tuning with torch.compile)

  • 2026-09-19-1505-evening-briefing-agentic-db-backend-cloudnative-inference.md(2026-09-19 15:09 CST · 9.8KB · 本棒位核心增量源 7 · 下午棒位 Agentic RAG × 数据库 × LLM Inference × 云原生 × 内核工程)= 6 件 Backend/LLM Inference = ① SGLang 2026 更新汇总 ⭐⭐⭐⭐(GitHub sgl-project/sglang · 4 月 DeepSeek-V4 Day-0 + Miles RL pipeline · 6 月 DFlash + Spec V2 speculative decoding · 7 月 Kimi K3 Day-0 + TPU full-feature 支持 · GLM5.2 NVFP4 500 TPS 两周达成 · 全球部署超 400,000 GPU)② vLLM 91.5k ⭐(Seamless HF 集成 + xgrammar structured output + tool calling reasoning parser + multi-LoRA + OpenAI-compatible API + Anthropic Messages API + gRPC)③ SGLang suffix decoding feature request ⭐⭐⭐(GitHub Issue #13165 · SGLang 正在引入 vLLM Arctic 的 suffix decoding 训练无关推测方法 · ngram 接受率超 PLD · Aurick 主导)④ MoonEP Balanced Expert Parallelism Library ⭐⭐⭐(GitHub moonshotai/MoonEP · 动态冗余专家并行 · Apache 2.0)⑤ Flash Linear Attention / kernel-fun ⭐⭐⭐(AllenAI CuTe/Triton kernel 比 flash-linear-attention 快 1.54x~4.65x · 专注 SSM 序列建模)⑥ AReaL RL Bridge for LLM Agent ⭐⭐⭐(GitHub · 5.7k ⭐ · 将强化学习引入 agent 决策)· 云原生 4 件 = ① KubeCon Europe 2026 KRO + vLLM extension + Kubernetes AI Conformance(CNCF Blog)② Kubernetes AI Conformance Program 规范 LLM inference workload 在 K8s 的 conformance 要求 ③ KRO(Gateway API)v1.0 服务网格和Ingress统一 API

  • 2026-09-19T1450-jay-engineering-filter.md(2026-09-19 14:53 CST · 9.0KB · 本棒位核心增量源 8 · 工程筛选下午棒位)= 1 件承接稳态 + 3 件 NET-new 整合级预备候选预备级精修(承接稳态) = ① vLLM MTP(承接 §一.1.3 第 6 件精修)② SAS Simple Attention Sparsification(Tencent · arXiv 2609.13141 · Triton kernel · Top-K 蒸馏式稀疏注意力梯度阻断问题解决 · 端到端 LM 损失优化 · 腾讯团队)③ Rust Supply Chain 定向攻击 + Dependency Cooldown(Simon Willison · 2026-09-17 · OpenAI Agent 5 月 RubyGems 类似模式 · Dependency Cooldown 至少 2-3 天延迟升级 + lock file 固定版本)④ Lilian Weng Harness Engineering for Self-Improving AI(RSI · 2026-07-04 · OpenAI 技术博客主要作者)
  • 2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md(2026-09-19 17:37 CST · 14.9KB · 本棒位核心增量源 9 · 傍晚棒位 trinity briefing LLM Inference + KV Cache 优化 + Agent 框架生态 + Microsoft Build 2026 + HF 模型生态 · 本棒位 NET-new 整合级预备候选预备级精修核心源 2)= 6 件 LLM Inference / KV Cache 优化 = ① ACL 2026 Survey: System-Aware KV Cache Optimization ⭐⭐⭐⭐(arXiv 2607.08057 · 被引 50 次 · 系统性综述当前 KV Cache 优化全栈路径 · 涵盖 hardware-aware execution / disaggregated inference / prefix caching / quantization · 与 vLLM/SGLang 实际实现对照 · 关键洞察:是当前最完整的 KV Cache 工程参考 · 建议归入:§1.(3) KV Cache 综述锚定预备级)② KV Cache Optimization Strategies for Scalable LLM Inference(arXiv 2603.20397 · 24页/14图 · 梳理 KV Cache 优化策略分类 · 适合作为工程选型参考)③ No Buffer, No Bottleneck: Zero-Copy KV Cache Offloading ⭐⭐⭐(USENIX OSDI '26 · University of Virginia · 7月 Seattle 会议 · 长上下文 LLM 的零拷贝 KV Cache 卸载 · USENIX 官方发布可信度高 · 关键洞察:适合作为长上下文部署的工程参考 · 建议归入:§1.(3) KV Cache 卸载预备级锚定)④ An Internet for the KV Cache(arXiv 2608.01526 · v3.37 已实质锚入 §1.(3) 沿用稳态)⑤ Online Scheduling for LLM Inference with KV Cache Constraints(arXiv 2502.07115 · v3.35 已实质锚入 §1.(2) 推理调度沿用稳态)⑥ Optimizing LLM Inference: Fluid-Guided Online Scheduling(arXiv 2504.11320 · v3.35 已实质锚入沿用稳态)+ 9 件 vLLM 2026年7-9月工程动态 = ① Efficient Decode Context Parallelism(vLLM Blog · 2026-08-07)② vLLM Reaches 25K TPS/GPU on Qwen3.5(vLLM Blog · 2026-08-06)③ Optimizing vLLM on Arm CPUs(vLLM Blog · 2026-07-29)④ Parallel All the Way Down: Speculative Decoding(vLLM Blog · 2026-07-27)⑤ Serving Agentic Workloads with vLLM × Mooncake(vLLM Blog · 2026-04-28)⑥ DeepSeek V4 in vLLM: Efficient Long-context Attention(vLLM Blog · 2026-04-22)⑦ vLLM FP8 KV-cache Validation(Hopper/Blackwell · Flash Attention 3 修复)⑧ vLLM Korea Meetup 2026 Wrap-up(社区增长 + V1更新)⑨ vLLM Releases: Recent Commits Summary(LoRA 支持 DeepSeek V4 + Qwen3-Omni multimodal + gRPC 多模态推理 + max_num_batched_tokens 从 8192→16384 + Blackwell CUDA graph 默认 1024 + prefix caching 默认启用)+ 9 件 Agent 框架生态 2026 主流方案对比 = ① Microsoft Build 2026: From Prototype to Production ⭐⭐⭐(GitHub microsoft/Build26-BRK241 ⭐10 · deployment / tools / memory / long-running work / human oversight / observability · 使用 Microsoft Foundry · 使用 Microsoft Agent Framework + hosted agent)② Microsoft Agent Framework at Build 2026 ⭐⭐⭐(MAF 1.0 GA · Agent Harness shell/filesystem/HITL/context management 为 first-class · Python + .NET 双 SDK · 统一 Semantic Kernel + AutoGen 概念)③ Microsoft Foundry Agent Service GA ⭐⭐⭐(Microsoft Foundry Blog · 框架无关 hosted runtime · micro-VM 沙箱隔离 · 支持 LangChain/LangGraph/Claude Agent SDK/GitHub Copilot SDK · 11K+ 模型)④ LangChain Blog: Best AI Agent Frameworks 2026(LangChain/LangGraph × CrewAI × Microsoft Agent Framework × LlamaIndex × Agno × Google ADK 六家对比表)⑤ Cloudraft: Top AI Agent Frameworks 2026(同上六家 + Mastra · ServiceNow/KPMG 落地案例)⑥ The AI Engineer Substack: The AI Agents Stack 2026 Edition ⭐⭐⭐⭐(Agent guardrails 从 LLM guardrails 独立出来 · agent 需要 state management / tool access / persistent memory / reasoning loops / real-time guardrails · LangGraph Cloud 和 Bedrock Agents 存在但大多数团队仍在用 FastAPI 自建)⑦ AI Agents Simplified Substack: 2026 Path to Learning AI Agents(LangFlow → Claude Agent SDK/LangGraph · 系统设计 / 工具设计 / 检索工程 / 可靠性工程)⑧ OWASP Top 10 AI & LLM Agents(LLM04 数据投毒 · LLM05 输出执行 · LLM06 过度授权 · LLM07 系统 Prompt 泄露 · LLM08 向量/embedding 弱点 · LLM09 幻觉误导)⑨ 120+ Agentic AI Tools 分类地图(11 大类工具全覆盖)+ 3 件 HuggingFace 模型生态速览 = ① State of Open Models: Summer 2026 ⭐⭐⭐⭐(Qwen 已成为社区事实 base model · <1B 参数模型占下载量 83% · >100B 参数模型仅占 1% · v3.37 已实质锚入 §1.(10) 顶会部署子轴沿用稳态)② Most Downloaded Models: September 2026 ⭐⭐⭐(Digital Applied · 2026-09-17 · Qwen 240.1M 下载 36个变体 · Gemma 32.6M 6个变体 · Llama 12.9M · Qwen3-0.6B 手机端可行 · 关键洞察:Qwen 已成为社区基础模型 · <1B 模型占下载量 83% 对端侧部署和推理成本优化有直接参考价值)③ Top 5 Trending HF Models(Qwen2.5-VL-7B 671万下载多模态 · Times FM3.0 时间序列预测 68万下载 · MoonshotAI 变体)
  • 2026-09-19-csdn-highvalue-rag-llm-langgraph.md(2026-09-19 16:21 CST · 8.3KB · 本棒位核心增量源 10 · CSDN 高价值 RAG/LLM/LangGraph 调研)= 多邻接级承接稳态 · 邻接 v3.37 §1.(11) Kernel/Harness 子轴沿用稳态 · 0 件 llm-infra 主轴 net-new

jay 9-19 全天棒位 llm-infra 主轴承接总计:14 文件 = 1 件 NET-new paper_card 主分类 llm-infra 在 v3.37 cutoff 后入库净增确认(Sample Count Is Not Enough paper_card 1432 · arXiv:2609.19499 · HF Daily 2 votes · 主分类 llm-infra · systems·测试时 scaling 候选生成策略决定能耗与性能 · Phi-3-mini/Qwen2.5-1.5B 在 GSM8K 上验证同等 N 分批生成优于一次批量)+ 4 件 NET-new inference 整合级预备候选预备级精修预备级(① vLLM MTP Qwen3.8-27B 单 flag 1.7-2x 改善 ⭐⭐⭐⭐⭐ · ② TriAttention 10.7x KV 压缩 / 2.5x 吞吐 · NVIDIA TensorRT-LLM 合入 ⭐⭐⭐⭐ · ③ TensorRT-LLM DeepSeek-V4 Agentic Workload 优化 GB300 + KV-cache-aware routing ⭐⭐⭐⭐ · ④ SGLang 2026 半年更新全景 + suffix decoding 集成 ⭐⭐⭐⭐)+ 1 件 NET-new inference 学术预备候选精修预备级(No Buffer, No Bottleneck · OSDI '26 · 零拷贝 KV Cache 卸载 ⭐⭐⭐)+ 1 件 NET-new inference 整合级精修(OpenAI Agents API 重大更新 · 2026-09-10 · hosted harness + 三 surface 架构 ⭐⭐⭐ · Rick Hightower Substack · 数据驻留仅美国不支持 Zero Data Retention · 自托管 sandbox 也不算 ZDR)+ 1 件 NET-new KV Cache 整合级精修(ACL 2026 Survey: System-Aware KV Cache Optimization arXiv:2607.08057 ⭐⭐⭐⭐ · 被引 50 次 · 系统性综述当前 KV Cache 优化全栈路径 · 涵盖 hardware-aware execution / disaggregated inference / prefix caching / quantization)+ 1 件 NET-new TIDE Token-Informed Depth Execution 逐 Token 早退出(GitHub RightNow-AI/TIDE ⭐⭐⭐ · Decode 阶段 99% reasoning token 早退出 · Prefill 最多 7.2% 加速 · 创新性通用推理优化思路)+ 1 件 NET-new HF 模型生态二次承接精修(Most Downloaded Models: September 2026 · Qwen 240.1M 下载 / <1B 占 83% / Qwen3-0.6B 手机端可行)+ 1 件 NET-new Rust crates 定向供应链攻击 + Dependency Cooldown(Simon Willison · 2026-09-17 · Rust 官方安全团队 + 独立安全博主交叉验证 · LLM Agent 自动化发布与安全最佳实践冲突)+ 1 件 NET-new Lilian Weng Harness Engineering for Self-Improving AI RSI(2026-07-04 · OpenAI 技术博客主要作者 · harness = 控制 RSI 过程不失控的工程约束层 · 适合作为 Agent 工程理论骨架长期参考)+ 0 件 NET-new llm-infra 主轴 突破性整合级预备候选(承接 v3.37 锚定 13 NET-new arXiv ID + 8 NET-new 整合级预备候选 + 5 NET-new inference/K8s/CNCF 核心预备级精修)

1.4 inbox/tom(2026-09-18 18:40 → 2026-09-19 18:40)

  • 2026-09-19T0840-agent-rag-longcontext-radar.md(2026-09-19 08:40 CST · 3.3KB · Tom 9-19 0840 radar · 0 件 llm-infra 主轴立标信号 net-new 突破 · 1 件 NET-new llm-infra 主分类 paper_card 入库承接候选 = arXiv:2609.19499 Sample Count Is Not Enough(HF Daily 2 票 · systems · 测试时 scaling 候选生成策略决定能耗与性能)+ 3 件 NET-new 邻接级预备候选精修预备级 = ① Context Window 优化 2026 年 6 大策略(neuraltrust.ai · 放置策略比 token 数量更关键 · 检索片段放最前 + 当前任务指令次之 + 工具输出放末位 + 中间层注意力最弱 · 混合策略 2026 年成主流 RAG 负责精确 chunk 召回 + 长窗口负责跨片段综合推理 · TTT-E2E 等新方向可将 2M token 上下文延迟压缩至固定水平)② ActObs arXiv:2609.20715(观察监督改变 Agent 探索行为 · SFT 只监督 Action tokens · ActObs 同时监督轨迹中的 observation tokens · 无需额外数据 / 参数 / forward pass)③ MiniMax-H3 物理世界推理评测 arXiv:2609.18323(HF 21 票 · 多模态 · Omni-Modal 生成模型评测)
  • 2026-09-19T1440-agent-rag-longcontext-radar.md(2026-09-19 14:41 CST · 4.5KB · Tom 9-19 1440 radar · 0 件 llm-infra 主轴立标信号 net-new 突破 · 承接 v3.37 锚定)
  • 2026-09-19-rag-e1prep.md(2026-09-19 08:52 CST · 19.3KB · Tom 上午棒 · RAG 主轴)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-evaluation-e1prep.md(2026-09-19 15:42 CST · 19.4KB · Tom 下午棒 · evaluation 主轴)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-0900-hf-daily-2026-09-19.md(2026-09-19 09:00 CST · 1.9KB · HF Daily 抓取 · 承接稳态 · 0 件 llm-infra 主轴 net-new)

1.5 inbox/flyp(2026-09-18 18:40 → 2026-09-19 18:40 · multimodal / coding / risk 主轴)

  • 2026-09-19-0950-Zing-0.5-playable-worlds-critical-read.md(2026-09-19 09:50 CST · critical-read)· multimodal 主轴 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1000-rss-cameron-wolfe.md(2026-09-19 10:00 CST · RSS 抓取)· multimodal 主轴 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-rss-interconnects.md(2026-09-19 10:01 CST · RSS 抓取)· multimodal 主轴 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1030-sat-weekly-deep-read-notes.md(2026-09-19 10:30 CST · critical-read)· multimodal 主轴 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1030-sat-weekly-deep-read-reviews.md(2026-09-19 10:30 CST · critical-read)· multimodal 主轴 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1550-LimiX2-and-MiniMax-H3-physical-world-eval-critical-read.md(2026-09-19 15:50 CST · critical-read)· multimodal 主轴 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-multimodal-e1prep.md(2026-09-19 multimodal 主轴)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-risk-e1prep.md(2026-09-19 risk 主轴)· 0 件 llm-infra 主轴 net-new

1.6 inbox/stephen(2026-09-18 18:40 → 2026-09-19 18:40 · 协调棒 + 行业动态)

  • 2026-09-19-0910-news-x-vip-radar.md(2026-09-19 09:11 CST · 3.7KB · X tech radar)· 邻接 v3.37 §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-news-anthropic-news.md(2026-09-19 10:01 CST · 1.7KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-news-deepmind-news.md(2026-09-19 10:01 CST · 1.0KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-news-google-ai.md(2026-09-19 10:01 CST · 1.4KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-news-hf-blog.md(2026-09-19 10:01 CST · 0.7KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-news-openai-news.md(2026-09-19 10:01 CST · 1.3KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1001-news-tldr-ai.md(2026-09-19 10:01 CST · 0.6KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1002-news-bens-bites.md(2026-09-19 10:02 CST · 0.7KB)· 0 件 llm-infra 主轴 net-new
  • 2026-09-19-1245-stephen-coordination-check-noon.md(2026-09-19 12:47 CST · 41.0KB · stephen 9-19 noon 协调棒 · 行业动态协调承接 v3.37 沿用稳态 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-19-ai-industry-e1prep.md(2026-09-19 10:23 CST · 67.2KB · stephen 行业动态 e1prep)· 邻接 v3.37 §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new

1.7 paper_cards 2026-09-19 后 v3.37 cutoff 新增(扫描 1433-1434 跨度)

  • paper_cards/1433-2609-17496.md · Verifiable Social Reasoning for LLM Assistants · Fuse 多智能体模拟框架 · 主分类 agent · 不是 llm-infra
  • paper_cards/1432-2609-19499.md · Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling · HF Daily 2 票 · 主分类 llm-infra ⭐⭐⭐(method · 2026-09-19 OpenAlex 更新 · 测试时 scaling 候选生成策略决定能耗与性能 · Phi-3-mini/Qwen2.5-1.5B 在 GSM8K 上验证同等 N 分批生成优于一次批量 · 关键洞察:推理预算由候选数量 N 和批次策略共同决定 · 建议归入:§1.(1) 推理引擎 / §1.(4) 量化 / §1.(2) 调度候选生成策略预备级)· 本棒位净增 1 件主分类 llm-infra 入库确认
  • paper_cards/1431-2609-19656.md · Self-Evolving Search Index · 主分类 rag · 不是 llm-infra
  • 9-18 后 v3.36 cutoff 至 9-19 后 v3.37 cutoff 净增区间 = 1432 主分类 llm-infra(1 件 NET-new)+ 1431/1433 主分类 agent/rag(2 件非 llm-infra)

二、增量条目(本轮 5 件主增量)

增量 1:vLLM MTP (Multi-Token Prediction) Qwen3.8-27B 单 flag 1.7-2x 改善(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-19-llm-inference-agents-k8s.md §一.1;inbox/jay/2026-09-19T1450-jay-engineering-filter.md §1;HF Blog EcoHash AI · 2026-09-15

要点: - 触发命令:--speculative-config={"method":"mtp","num_speculative_tokens":3} · 单 flag 即可开启 · 无需训练自定义 speculator · 直接用模型内置 MTP head - 实测结果(NVIDIA RTX PRO 6000 Blackwell 96GB 单卡):TPOT 22ms → 13ms 1.7x · 吞吐量 43 → 78 tok/s 1.8x · 同延迟 SLO 下并发上限 32 → 64 2x · KV cache 反而减少 23%(因为 MTP block 自带 attention 层需要 cache) - 按场景 acceptance length:K=3 时 math 3.39 / code 2.61 / chat 2.52 · 第一个 token acceptance math 92% / chat 73% - 核心价值:目前最简单且收益最高的推理优化手段之一 · 适合生产部署 · 单一 flag · 硬件要求明确 · 结果可复现

可信度:中高(HF Blog 实测 + CSV 数据 · 需交叉核验 vLLM 官方文档)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎已有 vLLM/SGLang/TensorRT-LLM 内容 + §1.(4) 量化沿用稳态 + §1.(5) 投机解码已有 Orthrus 复现 critical-read 沿用稳态;本条是 vLLM MTP 生产级实测 + 内置 MTP head 一键启用的新事实锚入,丰富 §1.(5) 投机解码子轴的工程化案例(与 Orthrus 复现形成"训练自定义 speculator"vs"模型内置 MTP head 一键启用"的对照)。

建议归入章节:§1.(5) 投机解码(vLLM MTP 生产级实测 + 单 flag 触发细节)或 §1.(1) 推理引擎(vLLM 工程实践补充)


增量 2:TriAttention KV cache 压缩 10.7x · 吞吐量 2.5x · NVIDIA TensorRT-LLM 合入(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-19-llm-inference-agents-k8s.md §一.2;inbox/jay/2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md §🔬;GitHub WeianMao/triattention · 2026-08

要点: - 核心技术:三角函数频域压缩 KV cache · 适合长推理任务 - 效果:10.7x KV 内存压缩 · 2.5x 吞吐量提升(AIME25 长推理测试)· 精度无损(40.8 vs 40.8 on AIME25) - 关键集成矩阵:✅ NVIDIA TensorRT-LLM(2026-08-04 官方合并)· ✅ vLLM plugin(透明集成 · 无需改代码)· ✅ SGLang backend · ✅ llama.cpp(AMD GPU via ROCm)· 🔲 Ollama(规划中) - 配置:TRIATTN_RUNTIME_KV_BUDGET=2048 默认 · TRIATTN_RUNTIME_DIVIDE_LENGTH=128 压缩触发间隔 · 需要预计算 Q/K 频率统计文件

可信度:高(已被 NVIDIA 官方合入 TensorRT-LLM · 已进 NVIDIA 上游 · 成熟度高)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(3) KV Cache 已有 PolyKV + CodeComp + An Internet for the KV Cache + Fathom + Edge0 + DeepSeek-V4.1-Flash 8 件 NET-new 锚定;本条是 频域压缩新路径 + NVIDIA 上游合入,丰富 §1.(3) KV Cache 子轴的"无损压缩"路径(与 Bit-plane Fathom 形成对照)。

建议归入章节:§1.(3) KV Cache(TriAttention 频域无损压缩案例 · NVIDIA TensorRT-LLM 合入集成矩阵)


增量 3:TensorRT-LLM DeepSeek-V4 Agentic Workload 优化 GB300 + KV-cache-aware routing(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-19-llm-inference-agents-k8s.md §一.4;inbox/jay/2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md §🔬;NVIDIA/TensorRT-LLM 官方博客

要点: - Part II: Agentic Workload: - KV-cache-aware routing:通过增量 tokenization + 区块匹配分数实现对话前缀复用 - 滑动窗口缓存生命周期管理:per_request 策略避免全 prompt 缓存浪费 - 池比例调优:可配置 pool_ratio 控制 HBM 在滑动窗口缓存和持久压缩缓存间的分配 - GB300 上 AgentPerf 配置:SLO20 达到 57.5 concurrency/GPU · SLO60 达到 19.2 CPG - Part I 结果:相同 DeepSeek-V4 Pro 8K/1K 负载下 · 峰值输出吞吐量从 984 → 1618 tokens/s/GPU(+64.5%)

可信度:高(NVIDIA 官方 · 面向 DeepSeek-V4 生产部署的权威优化指南 · Part II 的 agent 场景路由和缓存管理思路可迁移到其他 MoE 模型)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎已有 TensorRT-LLM + §1.(3) KV Cache 已有 DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417;本条是 DeepSeek-V4 + TensorRT-LLM + Agentic Workload 三位一体的官方权威优化指南,丰富 §1.(3) KV Cache 子轴的 MoE + Agent 集成案例,并补充 §1.(1) TensorRT-LLM 推理引擎生产优化细节。

建议归入章节:§1.(1) 推理引擎(TensorRT-LLM DeepSeek-V4 Part II Agentic Workload)或 §1.(3) KV Cache(KV-cache-aware routing + pool_ratio 池比例调优)


增量 4:SGLang 2026 半年更新全景 + suffix decoding 集成(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-19-1505-evening-briefing-agentic-db-backend-cloudnative-inference.md §⚙️;inbox/jay/2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md §🔬

要点: - 2026 时间线汇总:4 月 DeepSeek-V4 Day-0 + Miles RL pipeline · 6 月 DFlash + Spec V2 speculative decoding · 7 月 Kimi K3 Day-0 + TPU full-feature 支持 · GLM5.2 NVFP4 500 TPS 两周达成 · 全球部署超 400,000 GPU - Suffix decoding 集成(GitHub Issue #13165):SGLang 正在引入 vLLM Arctic 的 suffix decoding 训练无关推测方法 · ngram 接受率超 PLD · Aurick 主导 - vLLM 91.5k ⭐:Seamless HF 集成 + xgrammar structured output + tool calling reasoning parser + multi-LoRA + OpenAI-compatible API + Anthropic Messages API + gRPC - MoonEP(moonshotai · GitHub · Apache 2.0):Balanced Expert Parallelism Library · 动态冗余专家并行 - 关键洞察:SGLang 已从单一推理框架演化为涵盖 RL pipeline + 多模态 + TPU 支持 + speculative decoding V2 的全栈 LLM serving 平台

可信度:高(官方 GitHub Releases + Issue + 多方交叉验证)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎已有 SGLang 0.5.15 锚定 + §1.(5) 投机解码已有 DFlash V2 预备级;本条是 SGLang 半年更新全景 + suffix decoding 集成进展 + vLLM 91.5k ⭐ 矩阵,丰富 §1.(1) 推理引擎子轴的 SGLang / vLLM 双框架对照(承接 v3.37 锚定的 vLLM v0.28.0 + SGLang 2026 半年更新)。

建议归入章节:§1.(1) 推理引擎(SGLang 2026 半年更新全景 + suffix decoding 集成 + MoonEP 动态冗余专家并行)或 §1.(5) 投机解码(suffix decoding 集成 + ngram 接受率超 PLD)


增量 5:Sample Count Is Not Enough · 测试时 scaling 候选生成策略决定能耗与性能(⭐⭐⭐)

来源:paper_cards/1432-2609-19499.md(2026-09-19 入库 · paper_card 主分类 llm-infra 净增确认)· HF Daily 2 票 · arXiv:2609.19499 · tom 9-19 0840 radar §5 + tom 9-19 1440 radar §6

要点: - 核心论点:推理预算由候选数量 N 和批次策略共同决定 · 而非仅 N - 实验验证:Phi-3-mini / Qwen2.5-1.5B 在 500 GSM8K prompts 上 · 同样 N 下 · 分批生成 > 一次批量 - 生产意义:对 Agent 推理效率优化有参考价值 · 对能耗与性能 trade-off 的工程决策有直接指导

可信度:中高(arXiv 预印本 · HF Daily 2 votes · 候选生成批次策略的具体实验设计待全文核实)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎已有 vLLM MTP + 9 件 vLLM 工程动态锚定;本条是 测试时 scaling 的能耗-性能工程优化新事实锚入,丰富 §1.(2) 推理调度子轴的批次策略章节(与 v3.37 §1.(2) 锚定的 Online Scheduling arXiv:2502.07115v5 形成连续性补充)。

建议归入章节:§1.(2) 推理调度(测试时 scaling 候选生成批次策略 · Phi-3-mini/Qwen2.5-1.5B 实证)或 §1.(1) 推理引擎(能耗-性能 trade-off 案例)


增量 6(承接稳态精修锚定):ACL 2026 Survey: System-Aware KV Cache Optimization arXiv:2607.08057(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md §🔬

要点: - 论文基本信息:ACL 2026 Findings · arXiv 2607.08057 · 被引 50 次 · 24页/14图 - 核心价值:系统性综述当前 KV Cache 优化全栈路径 · 涵盖 hardware-aware execution / disaggregated inference / prefix caching / quantization - 适配价值:与 vLLM/SGLang 实际实现对照 · 是当前最完整的 KV Cache 工程参考

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(3) KV Cache 已有 8 件 NET-new 锚定(PolyKV / CodeComp / An Internet for KV Cache / Fathom / Edge0 / DeepSeek-V4.1-Flash 等);本条是 ACL 2026 综述锚定(承接 arXiv:2607.08057 已在 v3.37 §1.(3) KV Cache 锚定,但 jay 1735 trinity briefing 9-19 二次承接精修预备级),丰富 §1.(3) KV Cache 子轴的综述章节。

建议归入章节:§1.(3) KV Cache(ACL 2026 Survey: System-Aware KV Cache Optimization 综述锚定)


增量 7(承接稳态精修锚定):No Buffer, No Bottleneck: Zero-Copy KV Cache Offloading · OSDI '26(⭐⭐⭐)

来源:inbox/jay/2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md §🔬

要点: - 论文基本信息:USENIX OSDI '26 · University of Virginia · 7月 Seattle 会议 - 核心技术:长上下文 LLM 的零拷贝 KV Cache 卸载 · 减少内存复制开销 - 可信度:高(USENIX 官方发布 · 顶会论文)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(3) KV Cache 已有 PolyKV / Fathom / Edge0 + 长上下文(K8s / vLLM × Mooncake / Mooncake Store)锚定;本条是 OSDI '26 零拷贝 KV Cache 卸载新事实锚入,丰富 §1.(3) KV Cache 子轴的长上下文路径(与 v3.35 锚定的 arXiv:2510.09665 LMCache + v3.36 锚定的 arXiv:2608.01526 An Internet for KV Cache 形成连续性补充)。

建议归入章节:§1.(3) KV Cache(Zero-Copy KV Cache Offloading · OSDI '26 长上下文卸载案例)


增量 8(承接稳态精修锚定):OpenAI Agents API 重大更新 · 2026-09-10 · hosted harness + 三 surface 架构(⭐⭐⭐)

来源:inbox/jay/2026-09-19-llm-inference-agents-k8s.md §一.10;Rick Hightower Substack · 2026-09-16

要点: - 三个 OpenAI Surface: | Surface | Loop Runner | State | 适用场景 | |---------|-------------|-------|---------| | Agents API(新) | OpenAI 托管 Codex harness | OpenAI 侧保存 | 长时间运行任务 · 不想自己运维 sandbox | | Agents SDK | SDK 在应用内运行 | 你的存储 | 需要 loop 在你的部署中 · 带审批和 deploy | | Responses API | 应用自己调用 model | 手动管理 | 只需要 model call · 自己构建 agent | - 关键限制:数据驻留仅美国 · 不支持 Zero Data Retention · 自托管 sandbox 也不算 ZDR - 核心价值:OpenAI Agents API 是生产 Agent 托管的重要里程碑 · hosted harness 模式降低了 Agent 工程门槛 · 但数据合规限制需要注意

可信度:高(技术深度分析 · 基于官方文档实测)

与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness 已有 Microsoft MAF 1.0 GA + Microsoft Foundry Agent Service GA + Agent Harness 锚定;本条是 OpenAI Agents API 2026-09-10 重大更新 · hosted harness + 三 surface 架构对照,丰富 §1.(11) Kernel/Harness 子轴的 hosted harness / 三 surface 矩阵。

建议归入章节:§1.(11) Kernel/Harness(OpenAI Agents API 2026-09-10 三 surface 架构 + hosted harness 模式 + 数据合规限制)


三、值得警惕的矛盾或待核实说法

矛盾/待核实 ①:vLLM MTP 反向减少 KV cache 23% 的实测数据准确性(低风险)

jay 9-19 1450 engineering-filter 引用 HF Blog EcoHash AI 数据"MTP block 自带 attention 层需额外 cache"导致 KV cache 反向减少 23%。这一表述与"MTP 增加 attention 层需要额外 KV cache"的常理冲突,需核实原始数据。

建议:标注"MTP KV cache 减少 23% 的具体条件待核实,生产部署时需重新计算显存预算"

矛盾/待核实 ②:TriAttention 10.7x KV 压缩 + 精度无损 40.8 vs 40.8 on AIME25 的实验条件(低风险)

GitHub WeianMao/triattention 与 NVIDIA TensorRT-LLM 2026-08-04 官方合入的具体集成状态(分支/PR/已发布版本)需核实 README 实际状态。

建议:标注"TriAttention 已合入 NVIDIA TensorRT-LLM 主分支 vs PR 待合并的具体状态需核实"

矛盾/待核实 ③:SGLang 半年更新"全球部署超 400,000 GPU"的数据源(低风险)

jay 9-19 1505 引用"SGLang 全球部署超 400,000 GPU",该数字可能来自 SGLang 官方 blog 或社区报告,但具体源与时点需核实。

建议:标注"SGLang 全球部署 400,000 GPU 数字来源待核实"

矛盾/待核实 ④:D165 NVIDIA $12.93B HF 收购(已降级稳态,低风险)

v3.37 已 web_search 2026-09-18 4 源独立验证降级 · 截至本棒位 9-19 evening 无新增官方公告 · 雷达棒位稳态。

建议:沿用 v3.37 标记,不重复核验

矛盾/待核实 ⑤:D166 CodeComp arXiv:2604.10235 arXiv ID(已待核稳态,低风险)

v3.37 已新增 D166 · HKU + LMSYS 2026-09 发布的论文与 arXiv ID 段"2604"2026-04 月份冲突 · 核实可能为 2609.10235 或早期 v1 · 截至本棒位无新增核实结果。

建议:沿用 v3.37 标记,继续观察


四、可引用 arXiv 号列表

arXiv 号 标题 可信度 与 llm-infra.md 关系
2609.19499 Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling · paper_card 1432 中高(arXiv 预印本 · HF Daily 2 votes) 本次新增 → 建议归入 §1.(2) 推理调度或 §1.(1) 推理引擎
2607.08057 ACL 2026 Survey: System-Aware KV Cache Optimization 高(ACL 2026 Findings · 被引 50 次) 本次承接稳态精修 → 建议归入 §1.(3) KV Cache 综述锚定
2609.13141 SAS: Simple Attention Sparsification(Tencent) 中高(arXiv + GitHub 源码 + Triton kernel) 本次承接稳态精修 → 建议归入 §1.(5) 投机解码或 §1.(12) 压缩与编解码
v3.37 锚定 13 件 arXiv ID PolyKV / CodeComp / Anatomy of Coding Agents / DeepSeek-V4.1-Flash / LLM Inference Fingerprinting / Fathom / Edge0 / TurboAngle / PPO Critic / ScienceIDE / VC-Attention / M3Exam / A-RAG 沿用 v3.37 锚定 388 件 arXiv 总量

五、本次无显著新增量的来源说明

以下来源已检查,但无 llm-infra 主轴净增量,或已被 v3.37 升档棒覆盖:

  • inbox/jay/2026-09-19T1105-jay-five-category-briefing.md(11.1KB):6 件 Backend/LLM Inference + GPUStack + Reef Infrastructure + HF Blog KV Cache 系列 = 全部承接 v3.37 锚定(LMCache arXiv:2510.09665v1 + PolarKV VLDB 2026 + MIT KV Cache 调度理论 + PagedAttention + arXiv:2603.20397v1 Dell + KV Cache 优化策略全图 已在 v3.35/v3.36/v3.37 实质锚入);0 件 NET-new llm-infra 主轴
  • inbox/jay/2026-09-19-1505-evening-briefing-agentic-db-backend-cloudnative-inference.md(9.8KB):database + backend + cloud-native 三维 6+4 件 = 大部分承接 v3.37 锚定(vLLM/SGLang/TensorRT-LLM + K8s AI Conformance + KRO Gateway API + KubeCon Europe 2026);SGLang 2026 半年更新全景与 suffix decoding 集成作为承接稳态精修纳入增量 4(承接 v3.37 锚定,但提供更新进展)
  • inbox/jay/2026-09-19-1050-jay-engineering-filter.md(20.1KB):承接稳态 = vLLM 0.5.15 / SGLang 0.5.15 / LMCache / PolarKV / GPUStack / Reef Infrastructure 已在 v3.37 锚定;SAS Simple Attention Sparsification + Rust crates supply chain 攻击 + Lilian Weng Harness RSI 作为承接稳态精修纳入预备级
  • inbox/jay/2026-09-19-csdn-llm-inference-rag-agent-tech-survey.md(10.1KB):6 件 CSDN 高价值 = vLLM/SGLang/TRT-LLM/TGI 横评 + TensorRT-LLM NVFP4 + RAG 实战 + ONNX/TRT/vLLM 三路线 + 8大 Agent 框架选型 + SGLang vs vLLM 昇腾实测 = 全部承接稳态,邻接 v3.37 §1.(1) + §1.(4) 量化 + §1.(11) Kernel/Harness 沿用
  • inbox/jay/2026-09-19-1735-trinity-briefing-kvcache-llm-infra-agent-stacks.md(14.9KB):6 件 KV Cache 优化候选 + 9 件 vLLM 工程动态 + 9 件 Agent 框架生态 + 3 件 HF 模型生态 + 2 件 CSDN 数据库 = 大部分承接稳态;ACL 2026 Survey + OSDI '26 Zero-Copy KV Cache + HF Most Downloaded September 2026 作为承接稳态精修纳入增量 6、7、8
  • inbox/tom/2026-09-19T0840-agent-rag-longcontext-radar.md + 2026-09-19T1440-agent-rag-longcontext-radar.md(3.3KB + 4.5KB):Tom 9-19 上午 + 下午 radar = 8 件候选全部承接稳态(0 件主轴突破);Sample Count Is Not Enough arXiv:2609.19499 作为承接候选已入库 paper_card 1432 主分类 llm-infra 净增确认(纳入增量 5)
  • inbox/stephen/2026-09-19-1245-stephen-coordination-check-noon.md + 2026-09-19-ai-industry-e1prep.md(41.0KB + 67.2KB):stephen 9-19 noon 协调棒 + 行业动态 = 全部承接稳态
  • inbox/flyp(2026-09-19 multimodal / coding / risk / critical-read):multimodal 主轴 + risk 主轴 = 0 件 llm-infra 主轴 net-new
  • paper_cards 9-18 至 9-19 净增区间:1432 主分类 llm-infra(1 件 NET-new · Sample Count Is Not Enough 纳入增量 5)+ 1431 / 1433 主分类 rag / agent(2 件非 llm-infra)

六、建议今晚 E2 活文档更新优先级

优先级 内容 动作
🔴 最高 vLLM MTP Qwen3.8-27B 单 flag 1.7-2x 改善(arXiv 内置 MTP head 一键启用) 写入 §1.(5) 投机解码(vLLM MTP 生产级实测)或 §1.(1) 推理引擎
🔴 最高 TriAttention KV 压缩 10.7x · NVIDIA TensorRT-LLM 合入(arXiv 频域无损压缩) 写入 §1.(3) KV Cache(频域压缩新路径)
🟡 中 TensorRT-LLM DeepSeek-V4 Agentic Workload GB300 + KV-cache-aware routing 写入 §1.(1) 推理引擎(DeepSeek-V4 官方优化)或 §1.(3) KV Cache
🟡 中 SGLang 2026 半年更新全景 + suffix decoding 集成 写入 §1.(1) 推理引擎(SGLang 全景)或 §1.(5) 投机解码
🟡 中 Sample Count Is Not Enough(arXiv:2609.19499 paper_card 1432) 写入 §1.(2) 推理调度(候选生成批次策略)
🟢 低 ACL 2026 Survey: System-Aware KV Cache Optimization(arXiv:2607.08057) 写入 §1.(3) KV Cache 综述锚定
🟢 低 No Buffer, No Bottleneck: Zero-Copy KV Cache Offloading(OSDI '26) 写入 §1.(3) KV Cache 长上下文卸载案例
🟢 低 OpenAI Agents API 2026-09-10 三 surface 架构 + hosted harness 写入 §1.(11) Kernel/Harness

七、本轮 v3.37 升档棒状态总评

v3.37 升档棒闭合预备确认

v3.37 §IX 100 evening 升档棒(cutoff 2026-09-19 05:00 CST)已精确闭合:13 NET-new arXiv ID + 1 NET-new DOI + 1 NET-new paper_card 主分类 llm-infra 入库净增 + 8 NET-new 整合级预备候选 + 5 NET-new inference/K8s/CNCF 核心 + 1 NET-new RAG 安全 + 4 NET-new 矛盾 = 精确闭合(arXiv/CVE/DOI/URL 388/36/15/574)。

本棒位(2026-09-19 evening)新增量确认

5 件 NET-new 整合级预备候选预备级精修(承接 v3.37 锚定 13 NET-new arXiv ID + 8 NET-new 整合级预备候选 + 5 NET-new inference/K8s/CNCF 核心预备级): - vLLM MTP(⭐⭐⭐⭐⭐) - TriAttention(NVIDIA 合入 ⭐⭐⭐⭐) - TensorRT-LLM DeepSeek-V4 Agentic Workload(⭐⭐⭐⭐) - SGLang 2026 半年更新全景 + suffix decoding 集成(⭐⭐⭐⭐) - Sample Count Is Not Enough paper_card 1432(⭐⭐⭐ · 1 件 NET-new 主分类 llm-infra 入库净增确认)

3 件承接稳态精修锚定(承接 v3.37 锚定): - ACL 2026 Survey: System-Aware KV Cache Optimization arXiv:2607.08057(⭐⭐⭐⭐) - No Buffer, No Bottleneck: Zero-Copy KV Cache Offloading OSDI '26(⭐⭐⭐) - OpenAI Agents API 2026-09-10 三 surface 架构(⭐⭐⭐)

spark 自 v3.32 立标池双向锚以来空窗态势

spark 自 v3.32 立标池双向锚以来 9 棒位连续空窗 + 9-18 单日空窗延续 + 9-19 单日空窗延续 = spark 9-19 evening 棒位为预备补位承接稳态(承接 spark 9-18 evening llm-infra e1prep 60KB + jay 9-19 全天棒位 14 文件 ≈ 110KB + tom 9-19 0840 + 1440 radar 2 件 + paper_cards 1432 主分类 llm-infra 净增确认)。

work-queue 9-19 18:00 警示

0 件 llm-infra 主分类待深度解读 / 0 件待更新缺失主题活文档 / 待富化 15 张卡缺 TLDR · Tom 认领 = TheoLeeCJ/SemIf(周增 +0 / Stars 1648 · Semantic ifs from open models on a 3090 at home)· spark 认领段 = 无 · work-queue 主分类 llm-infra 0 件 net-new 警示沿用稳态。

下次预计 9-20 morning cron

§IX 101 morning 升档棒预备候选承接 v3.37 全量 + 本棒位 8 件 NET-new 整合级预备候选预备级精修 = §IX 101 morning 升档棒闭合预备。


本报告由 spark 实例自动生成 · 2026-09-19 18:40 CST 增量条目:8 件 NET-new 整合级预备候选预备级精修 + 1 件 NET-new paper_card 主分类 llm-infra 入库净增(5 件主增量 + 3 件承接稳态精修锚定) 涉及 arXiv 号:4 件(本次新增 1 件:2609.19499 Sample Count Is Not Enough paper_card 1432 · 承接 v3.37 锚定 3 件:2607.08057 ACL 2026 Survey + 2609.13141 SAS + OSDI '26 Zero-Copy KV Cache)