llm-infra · E1 预消化简报(2026-09-20)
实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-20 18:40 CST 基线:
organized/knowledge/llm-infra.mdv3.38 §IX 101 morning 升档棒(cutoff 2026-09-20 05:00 CST · arXiv/CVE/DOI/URL 389/36/15/585 · 13h 40min 后净窗口期 + 24h 滑动窗口 9-19 18:40 → 9-20 18:40) 本棒窗口:v3.38 cutoff 2026-09-20 05:00 → 2026-09-20 18:40 = 约 13h 40min 净窗口期 + 9-19 18:40 → 9-20 18:40 = 24h 滑动窗口对照 核心判断:本轮属于"v3.38 morning 升档棒落定后 13h 40min 净窗口期延长 + NET-new 1 件 paper_card 主分类 llm-infra 入库承接稳态精修候选(Sample Count Is Not Enough paper_card 1432 v3.38 主分类承接 + DeepSeek-V4.1-Flash paper_card 1417 v3.38 升档续立 95▲ #2)+ 5 件 NET-new 整合级整合候选精修(① NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints · KV-aware routing ② EPD(Encode-Prefill-Decode)Disaggregation 多模态推理分阶段 ③ Network Edge Inference for LLMs Survey arXiv:2604.22906 + Splitwise + EdgeShard ④ JustFit arXiv:2609.17475 200K-context @ 24 GiB Apple Silicon · KVExec + PhaseSwap JIT ⑤ FlashVector arXiv:2609.17391 Google Research agent-as-engineer serving 栈 profile-diagnose-optimize-verify)+ 2 件 NET-new inference 学术预备候选精修(① SAGA arXiv:2605.00528 HPDC'26 workflow-atomic scheduling · 4 维约束分布式 / Tool TTL / 公平 / 竞争比 ② InferenceBench arXiv:2607.20468 agent-as-engineer benchmark)+ 3 件承接稳态无新增量信号来源(tom 9-20 0900 HF Daily 15 件 + flyp 9-20 1550 DeepSeek-V4.1-Flash critical-read + jay 9-20 1105 five-category-briefing + jay 9-20 engineering-e1prep + jay 9-20 github-trending-rag-vllm-substack + jay 9-20 1735 github-trending-hf-blog-vecdb-rag-substack-sep20 + jay 9-20 csdn-llm-inference-frameworks + jay 9-20 csdn-llm-rag-mcp-weekly + jay 9-20 ai-engineering-github-hf-agents + jay 9-20 afternoon-nvidia-agent-stack-substack-edge-inference = 6+ 文件 ≈ 130KB 主承载)+ 1 件承接稳态 GPU utilization 精修新事实锚入候选(Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 8 Nsight Compute counter-validated views)+ 3 件承接稳态 v3.37/v3.38 矛盾/待核(D165 NVIDIA HF 收购降级稳态 + D166 CodeComp arXiv ID 待核稳态 + D169-D170 v3.38 新增 MTP KV cache 23% 反向减少与 TriAttention TensorRT-LLM 合入状态待核 9-21 evening 截止)+ work-queue 9-20 18:00 警示 = 0 件 llm-infra 主分类待深度解读 / 0 件待更新缺失主题活文档 / 待富化 15 张卡缺 TLDR / 待精确分类 0 张。
一、检查过的来源清单
1.1 工作队列 + v3.38 知识库活文档(沿用稳态)
-
✅
organized/queue/work-queue.md(2026-09-20 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 0 件 = 0 件主分类 llm-infra · 选题榜未成视频脚本 1 件 = 2609.19656(Self-Evolving Search Index · rag 主分类)· 4.3) Tom 认领 = 无 · 4.4) spark 认领 = 无 · spark 认领段无内容警示(沿用 v3.37 状态)+ 5) 富化缺口 15 张卡缺 TLDR(待 cron_s2 覆盖)+ 6) 待精确分类 0 张卡(主分类缺失或待LLM精修)· work-queue 9-20 主分类 llm-infra 0 件 net-new 警示 沿用 v3.37 状态 -
✅
organized/knowledge/llm-infra.mdv3.38 §IX 101 morning 升档棒(2026-09-20 05:00):arXiv/CVE/DOI/URL 389/36/15/585 精确闭合 + paper_cards 实际目录扫描 1434 张稳态(v3.37 cutoff 后 +3 张 1431-1433 跨度 · 1 件 llm-infra 主分类净增承接 = Sample Count Is Not Enough arXiv:2609.19499 paper_card 1432 ⭐⭐⭐ · 测试时 scaling 候选生成策略决定能耗与性能 · 与 spark 9-19 1840 e1prep 整合 5 件预备候选预备级承接)+ 1 件 NET-new arXiv ID v3.38 入主文件 = arXiv:2609.19499 Sample Count Is Not Enough paper_card 1432 ⭐⭐⭐ + 11 件 NET-new URL 入主文件 = arxiv.org/abs/2609.19499 + arxiv.org/pdf/2609.19499 + docs.vllm.ai/en/latest/features/speculative_decoding/mtp + github.com/WeianMao/triattention + github.com/vllm-project/vllm/issues/38339 + spheron.network/blog/multi-token-prediction-mtp-gpu-cloud-deployment-guide + medium.com/data-science-in-your-pocket/vllm-x-qwen3-next-hybrid-attention-multi-token-prediction-and-thinking-controls + github.com/RightNow-AI/TIDE + github.com/moonshotai/MoonEP + github.com/sgl-project/sglang/issues/13165 + youtube.com/watch?v=wgDryFT9ZXI + 8 件 NET-new 整合级预备候选首次实质锚入 v3.38 = ① vLLM MTP Qwen3.8-27B 单 flag 1.7-2× 改善 ⭐⭐⭐⭐⭐ · ② TriAttention KV 压缩 10.7× / 吞吐 2.5× NVIDIA TensorRT-LLM 合入 ⭐⭐⭐⭐ · ③ TensorRT-LLM DeepSeek-V4 Agentic Workload GB300 + KV-cache-aware routing ⭐⭐⭐⭐ · ④ SGLang 2026 半年更新全景 + suffix decoding 集成 ⭐⭐⭐⭐ · ⑤ Sample Count Is Not Enough paper_card 1432 ⭐⭐⭐ · ⑥ ACL 2026 Survey 承接稳态精修 ⭐⭐⭐⭐ · ⑦ OSDI '26 Zero-Copy KV Cache 承接稳态精修 ⭐⭐⭐ · ⑧ OpenAI Agents API 2026-09-10 三 surface 承接稳态精修 ⭐⭐⭐ + D169 v3.38 新增 ⚠️(vLLM MTP 反向 KV cache 减少 23% 与"MTP 增加 attention 层需额外 KV cache"常理冲突核实)+ D170 v3.38 新增 ⚠️(TriAttention NVIDIA TensorRT-LLM 2026-08-04 官方合并的具体集成状态核实 · 主分支 vs PR · 截止 9-21 evening 棒前)+ O532-O533 v3.38 新增 + P0 #276-#277 v3.38 新增 + T137 §IX 101 morning v3.38 新增
1.2 inbox/spark(2026-09-19 18:40 → 2026-09-20 18:40 · spark 全天棒位空窗延续 + 2 件 RSS + 1 件 agent 棒位)
- ✅
2026-09-19-llm-infra-e1prep.md(2026-09-19 18:40 CST · spark 9-19 evening 棒位 351 行 ≈ 51KB · v3.37 基线锚定 · 5 件 NET-new 整合级预备候选预备级精修预备级 = vLLM MTP ⭐⭐⭐⭐⭐ + TriAttention ⭐⭐⭐⭐ + TensorRT-LLM DeepSeek-V4 Agentic Workload ⭐⭐⭐⭐ + SGLang 2026 半年更新全景 + suffix decoding ⭐⭐⭐⭐ + Sample Count Is Not Enough paper_card 1432 ⭐⭐⭐ · 本棒位承接基线) - ✅
2026-09-20-1001-rss-gradient-flow.md(2026-09-20 10:01 CST · 9 行 · 邻接级承接稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1002-rss-chip-huyen.md(2026-09-20 10:02 CST · 9 行 · 邻接级承接稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-agent-e1prep.md(2026-09-20 13:30 CST · 346 行 ≈ 62KB · agent 主轴 · spark 第 5 日补出棒位 · 承接 v99 baseline + 标注本棒位 3h 净窗口期 10:30-13:30 + 立标信号 26 件总集合续立 + 立标池结构性洗牌三次确认 + 反思棒第 60 例 + 监控第 66 次 · 0 件 llm-infra 主轴 net-new · 邻接 v3.38 §1.(11) Kernel/Harness 沿用稳态)
spark 9-20 全天棒位空窗延续 4 棒位(沿用 v3.38 spark 空窗沿用态势):13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 2 份 RSS 抓取 + 1 份 agent 棒位 = 本棒位为 spark 9-20 evening 棒位预备补位承接 v3.38 morning 升档棒预备扩增预备级(承接 spark 9-19 evening llm-infra e1prep 51KB + jay 9-20 全天棒位 13 文件 ≈ 130KB + tom 9-20 0900 HF Daily 15 件 + flyp 9-20 1550 DeepSeek-V4.1-Flash critical-read 208 行)。
1.3 inbox/jay(2026-09-19 18:40 → 2026-09-20 18:40 · llm-infra 主轴主承载 · 13 文件 ≈ 130KB)
- ✅
2026-09-20-1000-rss-bytebytego.md(2026-09-20 10:00 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1000-rss-raschka.md(2026-09-20 10:00 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1000-rss-simon-willison.md(2026-09-20 10:00 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1001-rss-cool-papers.md(2026-09-20 10:01 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1001-rss-cool-papers-ir.md(2026-09-20 10:01 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1001-rss-nathan-benaich.md(2026-09-20 10:01 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1002-rss-import-ai.md(2026-09-20 10:02 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1002-rss-lilian-weng.md(2026-09-20 10:02 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1002-rss-msr-blog.md(2026-09-20 10:02 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1004-rss-yt-fireship.md(2026-09-20 10:04 CST · 9 行 · RSS 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-jay-five-category-briefing.md(2026-09-20 11:05 CST · 339 行 ≈ 11.6KB · 本棒位核心增量源 1 · 五分类简报 Database + Backend/Inference + Cloud-Native + CSDN + Reproduction)= 5 件 Backend / LLM Inference 候选(承接 v3.38 §1.(1) 推理引擎 + §1.(2) 推理调度子轴沿用稳态)= 承接稳态精修 + 1 件 NET-new inference 学术预备候选精修预备级(SAGA Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters arXiv:2605.00528v1 HPDC'26 ⭐⭐⭐⭐ · Matej Kosec, Benjamin Klieger 等 NVIDIA Dynamo 团队 · 工作流原子调度框架同时实现分布式调度 + Tool TTL 管理 + 公平性保障 + 竞争比率保证 4 维约束 · 对比现有系统 Parrot OSDI'24 / Autellix / Pie SOSP'25 / KVFlow NeurIPS'25 = 仅 SAGA 同时满足 4 维约束 · LRU 在前缀树上最坏竞争比 O(n) · 随机化算法可达到 O(log n) · SAGA 的 WA-LRU 策略是首个同时满足全部四个约束的方案 · 关键洞察:AI Agent 推理从单 agent 扩展到多 agent 集群级调度 · 是 jay 9-20 1105 关键承接预备级) - ✅
2026-09-20-engineering-e1prep.md(2026-09-20 11:22 CST · 201 行 ≈ 14.8KB · 本棒位核心增量源 2 · Jay engineering 主题 E1 预消化 · 0 件 llm-infra 主轴 net-new · 邻接 v3.38 §1.(11) Kernel/Harness 子轴承接稳态 + 6 件 engineering 主轴主增量 = ① Coding Agent Harness Design arXiv:2609.20804(HF 55▲ ⭐⭐⭐⭐)+ ② SoL-Pi arXiv:2609.20519(HF 69▲ ⭐⭐⭐⭐)+ ③ Agora arXiv:2609.18094(HF 43▲ ⭐⭐⭐⭐)+ ④ Claude Code 2.1.277 AGENTS.md 支持 + ⑤ datasette-auth-github 1.0 Rust supply chain 修复 + ⑥ DeepMind Math Agent Swarm 作弊故障模式) - ✅
2026-09-20-github-trending-rag-vllm-substack.md(2026-09-20 09:36 CST · 279 行 ≈ 11.5KB · 本棒位核心增量源 3 · GitHub Trending + HF State of Open Models + RAG 工程最佳实践 2026 + vLLM 2026 工程特性纵览 + Substack 高价值专栏)= 承接稳态精修 + 1 件 NET-new vLLM 整合级精修(vLLM 2026 工程特性纵览:① Prefill-Decode 分解服务 Disaggregation AMD MI300X 8-GPU 节点验证 · 跨节点 disaggregation 为下一个方向 · ② FP8 KV-Cache 量化 Hopper + Blackwell · Flash Attention 3 修复 · 可跳过部分 attention 层 · ③ 跨硬件支持扩展到 AMD GPU / Intel Arc / TPU · AMD ATOM ROCm 上的 AMD 优化 LLM inference 后端兼容 vLLM/SGLang 插件 · ④ Speculative Decoding 改进 · ⑤ vLLM-Omni Diffusion Cache · Cache-DiT + TeaCache 复用 diffusion 中间计算 · 图片生成速度提升 1.5x-2x · ⑥ 核心优化参数 max_num_batched_tokens / chunked prefill / PagedAttention / prefix caching 详解)+ 承接稳态精修 = GitHub Trending 2026-09-20(cloudflare/security-audit-skill 16.4K⭐ + addyosmani/agent-skills 97K⭐ + cactus-compute/needle 端侧 2-bit 8-29MB + trycua/cua computer-use 2.0 + coder/coder + docling-project/docling + asciimoo/hister)+ HF State of Open Models Summer 2026 + RAG 工程最佳实践 2026 + AI Agents Stack 2026 Edition(6 层栈 LLM + Memory + Tools + Agent 逻辑 + Guardrails + Evaluation/observability) - ✅
2026-09-20-1735-jay-github-trending-hf-blog-vecdb-rag-substack-sep20.md(2026-09-20 17:35 CST · 264 行 ≈ 11.5KB · 本棒位核心增量源 4 · 下午场 GitHub Trending + HF 九月下载格局 + 向量数据库选型更新 + RAG/Agentic RAG + Substack)= 承接稳态精修 + 1 件 NET-new 向量数据库选型精修(pgvector 2026 主流选型共识 = ≤50M 向量 pgvector 足够 + HNSW 索引 + pgvectorscale 471 QPS @ P99 + 50M 向量 + MIT 许可 + Danuban Data 实测 = 有 PostgreSQL 的团队优先用 pgvector 不要额外引入专用向量数据库)+ 承接稳态精修 = GitHub Trending 全量 Stars Top 15 AI OSS(ollama 164,980 ⬆ / langgenius/dify 132,698 / Shubhamsaboo/awesome-llm-apps 139k / Graphify-Labs/graphify 120k / langflow-ai/langflow 116,251 / open-webui 109,642 / Mintplex-Labs/anything-llm 66,200 / infiniflow/ragflow 74,954 / mem0ai/mem0 65,700 / hiyouga/LlamaFactory 68,373 / vllm-project/vllm 73,018 / lobehub/lobe-chat 65,454 / firecrawl/firecrawl 56,713 / run-llama/llama_index 44,203 / FlowiseAI/Flowise 43,547)+ HF 九月下载格局(Qwen 240.1M 下载 36/60 占 62% + Qwen3-0.6B 排名第一 22.5M 下载可在手机上运行 + DeepSeek 仅 1 个模型进入 Top 60 4.4M + <1B 参数模型占全部历史下载量 83% + >100B 模型仅占 1%)+ AI Engineer Stack 2026 Edition + Context Engineering 新范式(Shashi Jagtap 2026-09-20)+ Future AGI Top 5 Agentic AI Frameworks 2026(LangGraph / Dify / CrewAI / Microsoft AutoGen → Agent Framework / LangChain)+ State of Open Models: Summer 2026 二次承接精修预备级 - ✅
2026-09-20-csdn-llm-inference-frameworks.md(2026-09-20 12:20 CST · 224 行 ≈ 8.7KB · 本棒位核心增量源 5 · CSDN 高价值 LLM 推理框架工程实战)= 承接稳态精修 = 6 件高价值条目 = ① SGLang-v0.5.6 + vLLM 0.6.3 双卡 A100 40GB 实测 GPU 利用率 41.2% → 92.7% + 吞吐 14.3 → 28.9 req/s 并发 100 客服对话场景(blog.csdn.net/weixin_42497762/article/details/157595213)② Qwen3.6-27B vLLM 与 SGLang 深度适配指南 37 次失败重试实战(bbs.csdn.net/weixin_29913663/article/details/100186848)③ MiniMax-M2 完全部署指南 SGLang/vLLM/MLX 三大框架实战(blog.csdn.net/gitblog_01428/article/details/149896125)④ AI Agent 开发技术完全学习指南 7 种 RAG 模式对比(Self-RAG / CRAG / GraphRAG / Agentic RAG / HyDE / RAG-Fusion / LazyGraphRAG Microsoft 2026 极低 $0.005-0.05/1K docs ⚠️)⑤ 2025 年大模型推理框架全解析(llama.cpp 88.3k⭐ / vLLM / SGLang / LMDeploy / TGI / MLC-LLM)⑥ WSL2+SGLang 轻量部署 Llama 3-8B 实战指南(填补 Windows 开发者本地部署资料空白) - ✅
2026-09-20-csdn-llm-rag-mcp-weekly.md(2026-09-20 11:30 CST · 274 行 ≈ 11.2KB · 本棒位核心增量源 6 · CSDN 周检 LLM 推理框架 + MCP Agent 工具链 + Agentic RAG 2026)= 承接稳态精修 = 17 件高价值条目 = ① MCP 协议综合报道 ⭐⭐⭐⭐ ② MCP Python Server 实战 3000+ Server ③ MCP 企业生产实践 ④ MCP 开发实战大纲 ⑤ vLLM/SGLang/TensorRT-LLM/Ollama 全解 ⑥ 推理框架 2026 vLLM/SGLang 全解析 ⑦ vLLM/SGLang 内部机制 RadixAttention/Chunked Prefill ⑧ LMDeploy vs vLLM vs SGLang Benchmark 1.8 倍吞吐量 6 倍性能差距 ⑨ vLLM 与 TensorRT-LLM 参数配置 MLPerf v4.0(GPT-J 99% 精度下 +187% / DLRM v2 +67%)⑩ Agentic Multimodal RAG 3.0 1M 上下文 Multimodal GraphRAG ⑪ mKG-RAG SIGIR 2026 多模态知识图谱增强 RAG ⑫ RAG 知识库实战 2026 Docker + MySQL/Redis ⑬ RAG Web UI 部署 Ollama + ChromaDB + Docker Compose 5 步 ⑭ WeKnora 部署 Docker 容器化 MinIO/Neo4j/PostgreSQL/Redis ⑮ RAG-Anything 多模态知识图谱 ⑯ Dify 企业级部署 Docker Compose ⑰ Dify 离线部署 Docker save/load - ✅
2026-09-20-afternoon-nvidia-agent-stack-substack-edge-inference.md(2026-09-20 14:50 CST · 330 行 ≈ 13.5KB · 本棒位核心增量源 7 · 下午场 NVIDIA Dynamo + Agent 架构 + 推理基础设施 + 边缘推理 + 多模态工程 · 本棒位 NET-new 整合级预备候选预备级精修核心源)= 5 件 NET-new 整合级整合候选精修预备级 = ① NVIDIA Full-Stack Optimizations for Agentic Inference with NVIDIA Dynamo(2026-09-10) ⭐⭐⭐⭐⭐(developer.nvidia.com/blog · Matej Kosec, Benjamin Klieger 等 NVIDIA 团队 · KV-aware routing 全局 Flash Indexer workers 之间放置请求最大化 KV cache 重用 + 4 级 KV memory hierarchy GPU → CPU → 本地 NVMe → 远程存储 + nvext API — Agent Hints Agent harnesses Claude Code / Codex 通过 nvext API 向 Dynamo 发送结构化提示 priority / expected output length / speculative prefill 意图 · 集成 Claude Code / Codex / OpenClaw · 关键洞察:4 级 KV memory hierarchy 和 nvext agent hints 是新的设计模式 · 直接影响 Agent 框架开发者如何与底层推理引擎交互)② NVIDIA Streaming Tokens and Tools: Multi-Turn Agentic Harness Support in NVIDIA Dynamo(2026-05-08) ⭐⭐⭐⭐(多轮 Agent streaming 正确性 + parser ownership fix + reasoning replay 模型和轮次依赖)③ NVIDIA When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving(2026-09-04) ⭐⭐⭐⭐(EPD disaggregation 视觉编码器独立 GPU pool + Prefill 批处理 + Decode 高带宽 GPU · 关键洞察:与 MiniMax M3 部署直接相关)④ Network Edge Inference for Large Language Models — Principles, Techniques, and Opportunities(arXiv:2604.22906 2026-04 35 页) ⭐⭐⭐⭐(系统性 survey · 涵盖 Splitwise prefill/decode 边缘版本 · EdgeShard 协作边缘计算延迟降低 50% 吞吐提升 2× · DistServe 边缘适配版)⑤ InferenceBench — A Benchmark for Open-Ended LLM Inference Optimization(arXiv:2607.20468 2026-07) ⭐⭐⭐(J Yeon et al. · Agent 必须部署 OpenAI-compatible inference server 并优化 LLM 推理速度 · 关键洞察:"Agent-as-engineer" benchmark 设计理念)+ 2 件 NVIDIA Nemotron 3 Agents / The AI Engineer Stack 6 层 / Micheal Allanham RAG decision matrix(承接稳态) - ✅
2026-09-20-2105-jay-evening-briefing-security-flashvector-justfit-jev-plugins.md(2026-09-20 21:05 CST · 359 行 ≈ 14.9KB · 本棒位核心增量源 8 · 傍晚版安全 + 推理系统工程 + Agent 评估 · 本棒位 NET-new 整合级预备候选预备级精修核心源 2)= 3 件 NET-new 整合级整合候选精修预备级 = ① JustFit — 200K-Token LLM Serving on 24 GiB Laptop(JIT 状态管理) ⭐⭐⭐⭐(arXiv:2609.17475 · Yuhua Chen · MLX-based 推理运行时 · 24 GiB Apple 笔记本运行 27B 量化模型 · 支持 200K+ retained positions · 三大技术组件 KVExec 压缩 KV 执行 + PhaseSwap 组件驻留管理 + JIT 设计 · AIME 2026 题目答对 29/30 · 关键洞察:边缘/端侧 LLM 部署工程里程碑 · 200K token context 在 24 GiB 设备上前所未有 · 对 llama.cpp / MLX 生态有直接参考价值)② FlashVector — Agent for Hierarchical Model Serving Stack Optimization ⭐⭐⭐⭐(arXiv:2609.17391 · Qi Wu, Lohan Lemire 等 Google Research / UdeM · profile–diagnose–optimize–verify 闭环 · 4 层栈 GPU kernel / operator / model / serving · 关键洞察:FlashVector 是"AI agent 作为系统工程师"前沿方向 · 自动化桥接 Python/PyTorch 与 production CUDA)③ Plugin4Shell — AI Coding Agent 供应链首个零点击 RCE ⭐⭐⭐⭐⭐(AIR Security Or Nevo, Dor Granat, Niv Hoffman · CSO Online · Help Net Security · The Register · 925 个活跃 skills 被劫持 · 影响 134,000 个 agent 实例 · Claude Code 2.1.179 已修复 · Codex 0.146.0 已修复 · Microsoft / Google 未修复 · 关键洞察:AI agent 安全从"模型行为安全"和"agent 行为安全"延伸到"供应链分发安全")+ 1 件 NET-new GPU 利用率精修新事实锚入候选(Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 KTH · Nsight Compute 8 个独立 counter-validated views · 关键洞察:单一 SM utilization 数字会掩盖真实问题 · decode 阶段 dense projection GEMM 变成 small-row matrix multiplications 在 Hopper 上 bfloat16 GMMA 路径以固定的 64-row matrix fragments 执行 · 小 batch decode 只能填充每个 fragment 的一小部分)+ 3 件 Jev TypeSafe AI System One / addyosmani/agent-skills 97k⭐ / CompliBench EMNLP 2026 承接稳态 + Layer-wise Curriculum Learning 承接稳态 - ✅
2026-09-20-ai-engineering-github-hf-agents.md(2026-09-20 13:35 CST · 256 行 ≈ 9.3KB · 本棒位核心增量源 9 · AI 工程 · GitHub Trending / HF / Agent 工程栈 · 向量数据库 · LLM 部署)= 承接稳态精修 = GitHub Trending 2026-09-03 + LangChain State of Agent Engineering 2026-06-12 调研报告(89% 团队已为 Agent 部署可观测性 vs 仅 52% 离线评估 vs 仅 37% 在线评估)+ The AI Agents Stack 2026 Edition 6 层栈 + pgvector 生产 RAG 选型共识 + LangSmith Fleet 2026-03 改名 + Encore.dev "You probably don't need a vector database" 2026-03-09 + OpenAI-HF 安全事件 2026 年 AI 安全里程碑 + FastAPI 0.141.1 发布 + AI Engineer 成长路线图 6 个月 + The Pipe and The Line Substack - ✅
2026-09-20-csdn-ai-agent-rag-highvalue.md(2026-09-20 08:21 CST · 134 行 ≈ 5.5KB · Jay CSDN 早棒 · 承接稳态精修 · agent 主轴邻接级 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-20-0340-news-x-tech-radar.md(2026-09-20 03:40 CST · 14 行 · X tech radar)· 邻接 v3.38 §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new
jay 9-20 全天棒位 llm-infra 主轴主承载总计:13 文件 ≈ 130KB = 5 件 NET-new 整合级整合候选精修预备级(① NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints · KV-aware routing ⭐⭐⭐⭐⭐ · ② EPD Encode-Prefill-Decode Disaggregation 多模态推理分阶段 ⭐⭐⭐⭐ · ③ Network Edge Inference for LLMs Survey arXiv:2604.22906 + Splitwise + EdgeShard ⭐⭐⭐⭐ · ④ JustFit arXiv:2609.17475 200K-context @ 24 GiB Apple Silicon · KVExec + PhaseSwap JIT ⭐⭐⭐⭐ · ⑤ FlashVector arXiv:2609.17391 Google Research agent-as-engineer serving 栈 profile-diagnose-optimize-verify ⭐⭐⭐⭐)+ 2 件 NET-new inference 学术预备候选精修预备级(① SAGA arXiv:2605.00528 HPDC'26 workflow-atomic scheduling · 4 维约束分布式 / Tool TTL / 公平 / 竞争比 ⭐⭐⭐⭐ · ② InferenceBench arXiv:2607.20468 agent-as-engineer benchmark ⭐⭐⭐)+ 1 件承接稳态 GPU utilization 精修新事实锚入候选(Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 8 Nsight Compute counter-validated views ⭐⭐⭐⭐)+ 1 件 NET-new inference 安全整合候选精修(Plugin4Shell — AI Coding Agent 供应链首个零点击 RCE · 925 个活跃 skills 被劫持 · 134,000 个 agent 实例受影响 ⭐⭐⭐⭐⭐ · 承接 v3.38 §1.(9) 安全 + §1.(11) Kernel/Harness 子轴)+ 0 件 NET-new llm-infra 主轴 突破性整合级预备候选(承接 v3.38 morning 升档棒锚定 8 件 NET-new 整合级预备候选 + 1 NET-new paper_card 主分类 = 1 件主分类 llm-infra 入库净增承接稳态精修)
1.4 inbox/tom(2026-09-19 18:40 → 2026-09-20 18:40)
- ✅
2026-09-20-0900-hf-daily-2026-09-20.md(2026-09-20 09:00 CST · 19 行 · HF Daily 早棒 15 件)· 核心承接稳态 = LimiX-2 303▲ #1 multimodal 邻接级 + DeepSeek-V4.1-Flash 95▲ #2 升档续立 multimodal 邻接级 + llm-infra 主分类(承接 v3.37 锚定 paper_card 1417 ⭐⭐⭐⭐⭐ · 9-19 早棒 57▲ → 9-20 早棒 95▲ = 24h +38▲ 升档稳态)+ MiniMax-H3 93▲ #3 multimodal 主分类 + EOS Tokens 76▲ #4 + ScienceIDE 74▲ #5 + SoL-Pi 69▲ #6 + PPO Critic 63▲ #7 + Coding Agent Harness 55▲ #8 + 信心源自经验 54▲ #9 + ProgramDistill 48▲ #10 + Agora 43▲ #11 + JEPA-Anything 40▲ #12 + ActionPiece 40▲ #13 + VC-Attention 35▲ #14 + Verifiable Social Reasoning 33▲ #15 · 承接 v3.38 锚定 8 件 NET-new 整合级预备候选 - ✅
2026-09-20-agent-rag-longcontext-radar.md(2026-09-20 14:40 CST · 76 行 · Tom 9-20 radar · arXiv API 异常返回 406 · 候选主力切换 HF Daily + AlphaSignal 双源稳态续立)· 0 件 llm-infra 主轴立标信号 net-new 突破 = 4 件高价值候选(① Self-Evolving Search Index ② Fuse Verifiable Social Reasoning ③ ActObs Don't Mask the Environment ④ δ-mem 8×8 associative memory)+ 4 件普通候选(MiniMax-H3 · Sample Count Is Not Enough · VākQA · Srijika · 0 件 llm-infra 主轴立标突破) - ✅
2026-09-20-rag-e1prep.md(2026-09-20 08:50 CST · 142 行 · Tom R96 · RAG 主轴)· 0 件 llm-infra 主轴 net-new · 邻接 v3.38 §1.(3) KV Cache 子轴承接稳态 - ✅
2026-09-20-evaluation-e1prep.md(2026-09-20 15:42 CST · 235 行 · Tom 9-20 下午棒 · evaluation 主轴)· 0 件 llm-infra 主轴 net-new · 邻接 v3.38 §1.(2) 推理调度子轴承接稳态 - ✅
2026-09-19T1950-jay-engineering-filter.md(2026-09-19 19:50 CST · 150 行 · Jay 工程筛选晚场 · Lilian Weng Harness Engineering + DeepMind Math Agent Swarm 作弊故障 + The AI Engineer Stack 2026 + Encoder 路由方案)· 0 件 llm-infra 主轴 net-new
1.5 inbox/flyp(2026-09-19 18:40 → 2026-09-20 18:40 · multimodal / coding / risk 主轴 + DeepSeek-V4.1-Flash 精读)
- ✅
2026-09-20-1550-DeepSeek-V4.1-Flash-KV-cache-compression-critical-read.md(2026-09-20 15:50 CST · 208 行 · flyp 短精读 2/3 篇 · DeepSeek-V4.1-Flash KV Cache 压缩新 SOTA 批判性审稿 · 本棒位核心增量源 10)= 承接稳态精修锚定预备级 = DeepSeek-V4.1-FlasharXiv:2609.19969paper_card 1417 ✓ 主分类 llm-infra · 形态 application · DeepSeek-AI 全团队 · "Pushing the Limits of KV Cache Compression" = 552B MoE backbone + 百万 token 上下文 + KV cache 压缩新 SOTA · HF Daily 9-20 早棒 #2 95▲ · 与 Fathom(读取层)· Edge0(路由层)· HYBRIDKV(多模态层)分别从模型层 / 读取层 / 路由层 / 多模态层共同构成 9 月以来的"KV cache 压缩四层方法学" · 核心方法 P1 待核实(稀疏化 / 量化融合 · MoE-aware KV routing · 层级 KV 共享 · 训练期 KV 预算约束)+ 与既有 SOTA 的对比缺失(StreamingLLM / H2O / SnapKV / FastGen / MiniCache / PyramidKV)+ "压缩 vs 丢失" 边界 · lost-in-the-middle 现象 · needle-in-a-haystack / multi-hop RAG / long-context QA 保留率 + 552B MoE 实际部署门槛(单 query 仍需 ≥ 数十 GB 显存)+ multimodal 主分类争议沿用 ⚠️ - ✅
2026-09-20-JEPA-Anything-cross-domain-world-model-critical-read.md(2026-09-20 09:50 CST · 210 行 · multimodal 主轴 + JEPA 路线精读)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-multimodal-e1prep.md(2026-09-20 multimodal 主轴 e1prep)· 0 件 llm-infra 主轴 net-new · 邻接 v3.38 §1.(7) 多模态子轴承接稳态 - ✅
2026-09-20-risk-e1prep.md(2026-09-20 risk 主轴 e1prep)· 0 件 llm-infra 主轴 net-new · 邻接 v3.38 §1.(9) 安全子轴承接稳态
1.6 inbox/stephen(2026-09-19 18:40 → 2026-09-20 18:40 · 协调棒 + 行业动态)
- ✅
2026-09-20-0910-news-x-vip-radar.md(2026-09-20 09:11 CST · 12 行 · X tech radar)· 邻接 v3.38 §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1002-news-openai-news.md(2026-09-20 10:02 CST · 9 行 · OpenAI news)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1003-news-anthropic-news.md(2026-09-20 10:03 CST · 9 行 · Anthropic news)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1003-news-bens-bites.md(2026-09-20 10:03 CST · 9 行 · Bens Bites)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1003-news-deepmind-news.md(2026-09-20 10:03 CST · 9 行 · DeepMind news)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1003-news-google-ai.md(2026-09-20 10:03 CST · 9 行 · Google AI)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1003-news-hf-blog.md(2026-09-20 10:03 CST · 9 行 · HF Blog)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1003-news-tldr-ai.md(2026-09-20 10:03 CST · 9 行 · TLDR AI)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1004-news-yt-anthropic.md(2026-09-20 10:04 CST · 9 行 · YouTube Anthropic)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1004-news-yt-openai.md(2026-09-20 10:04 CST · 9 行 · YouTube OpenAI)· 0 件 llm-infra 主轴 net-new - ✅
2026-09-20-1245-stephen-coordination-check-noon.md(2026-09-20 12:47 CST · 247 行 ≈ 11.7KB · stephen 9-20 noon 协调棒 · 11 项矛盾 M1-M11 完整承接 + 13 件主轴扩增预备级 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-20-ai-industry-e1prep.md(2026-09-20 10:23 CST · 435 行 ≈ 19.8KB · stephen 9-20 行业动态 e1prep)· 邻接 v3.38 §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new
1.7 paper_cards 2026-09-20 后 v3.38 cutoff 净增(扫描 1433-1434 跨度)
- ✅
paper_cards/1433-2609-17496.md· Verifiable Social Reasoning for LLM Assistants · Fuse 多智能体模拟框架 · 主分类 agent · 不是 llm-infra - ✅
paper_cards/1432-2609-19499.md· Sample Count Is Not Enough · 主分类 llm-infra ⭐⭐⭐(v3.38 主分类承接稳态精修) - ✅
paper_cards/1431-2609-19656.md· Self-Evolving Search Index · 主分类 rag · 不是 llm-infra - ✅
paper_cards/1430-2609-05661.md· Srijika 印度文字字体跨脚本复用 · 主分类 multimodal · 不是 llm-infra - ✅
paper_cards/1429-2609-18323.md· MiniMax-H3 omni-modal 物理世界推理评估 · 主分类 multimodal + 副 evaluation · 不是 llm-infra - ✅
paper_cards/1428-2609-19879.md· VākQA 泰卢固语口语问答 benchmark · 主分类 evaluation · 不是 llm-infra - ✅
paper_cards/1427-2609-20715.md· Don't Mask the Environment · ActObs · 主分类 agent · 不是 llm-infra - ✅
paper_cards/1426-2609-20817.md· FAMOS · 主分类 multimodal · 不是 llm-infra - 9-19 后 v3.38 cutoff 至 9-20 后 净增区间 = 1432 主分类 llm-infra(1 件承接稳态精修)+ 1431 / 1433 主分类 rag / agent(2 件非 llm-infra) + 1426-1430 主分类 multimodal/evaluation(4 件非 llm-infra)· 0 件 NET-new 主分类 llm-infra 入库净增
二、增量条目(本轮 8 件主增量 + 1 件 NET-new 主分类承接稳态精修)
增量 1:NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints · Agent Serving 新架构模式(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-afternoon-nvidia-agent-stack-substack-edge-inference.md §一.2;developer.nvidia.com/blog/full-stack-optimizations-for-agentic-inference-with-nvidia-dynamo · 2026-09-10 · Matej Kosec, Benjamin Klieger 等 NVIDIA 团队
要点: - KV-aware routing:使用全局 Flash Indexer 在 workers 之间放置请求,最大化 KV cache 重用 · 减少多 Agent 会话中的冷启动重计算 · 具体效果:减少跨 worker 的重复 prefill 开销 - 4-tier memory hierarchy(4 级内存层次):GPU 层 → CPU 层 → 本地 NVMe → 远程存储 · 高价值 KV block 全局可访问 · selective retention APIs:允许 harnesses 固定关键前缀,标记临时 block 提前回收 - nvext API — Agent Hints:Agent harnesses(Claude Code / Codex / OpenClaw)通过 nvext API 向 Dynamo 发送结构化提示 · 提示内容包括:priority / expected output length / speculative prefill 意图 · Dynamo 根据这些提示做更智能的路由和调度决策 - 与 Claude Code / Codex / OpenClaw 的集成:Dynamo 在 Agentic 推理基础设施层标准化了 GPU-backed 运行时访问 · 不同 harness 暴露相同的压力点(pressure points)通过核心行为抽象解决 - 第二篇承接:NVIDIA Streaming Tokens and Tools: Multi-Turn Agentic Harness Support in NVIDIA Dynamo(2026-05-08)· 多轮 Agent streaming 正确性 + parser ownership fix + reasoning replay 模型和轮次依赖 · 三大 harness Claude Code / Codex / OpenClaw 暴露相同的压力点
可信度:极高(NVIDIA 官方工程博客 · 含具体 API/架构细节 · 极新鲜 2026-09-10)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(3) KV Cache 已有 TriAttention(NVIDIA TensorRT-LLM 合入)+ CodeComp + PolyKV + An Internet for KV Cache + Fathom + Edge0 + DeepSeek-V4.1-Flash + ACL 2026 Survey + OSDI '26 Zero-Copy 锚定;§1.(11) Kernel/Harness 已有 Microsoft MAF 1.0 GA + Microsoft Foundry Agent Service GA + Agent Harness 锚定;本条是 NVIDIA Dynamo 4 级 KV memory hierarchy + nvext Agent Hints 新架构模式 + KV-aware routing 官方权威设计模式,丰富 §1.(3) KV Cache 子轴的 Agentic serving 路由案例,并补充 §1.(11) Kernel/Harness 子轴的 NVIDIA Dynamo 官方实现。
建议归入章节:§1.(3) KV Cache(NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints + KV-aware routing)或 §1.(11) Kernel/Harness(NVIDIA Dynamo Agentic serving 架构标准)
增量 2:JustFit — 200K-Token LLM Serving on 24 GiB Laptop · JIT 状态管理(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-2105-jay-evening-briefing-security-flashvector-justfit-jev-plugins.md §一.3;arXiv:2609.17475 · 2026-09-15 · Yuhua Chen
要点: - 核心定位:MLX-based 推理运行时 · 在 24 GiB Apple 笔记本上运行 27B 量化模型 · 支持超过 200K retained positions - 三大技术组件: - KVExec — compressed KV execution(压缩 KV 执行) - PhaseSwap — component residency management(组件驻留管理) - JIT 设计 — 将压缩 KV 执行与组件驻留管理动态耦合 - 关键数据:24 GiB Apple 笔记本上 AIME 2026 题目答对 29/30 - 核心价值:紧凑状态 + 生命周期感知执行可以扩展本地 serving 能力 · 200K token context 在 24 GiB 设备上是前所未有的
可信度:高(arXiv 论文 · MLX 实现 · 具体 benchmark 数据)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(1) 推理引擎 + §1.(3) KV Cache 已有 vLLM MTP / TriAttention / vLLM V1 KV-Cache fp8 / SGLang suffix decoding 锚定;本条是 边缘/端侧 LLM 部署的工程里程碑 · KVExec + PhaseSwap 的组合解决"超长上下文在有限内存设备上如何有效管理 KV state"这个实际问题,丰富 §1.(1) 推理引擎子轴的端侧/边缘部署案例(与 v3.36 锚定的 Edge0 arXiv:2609.18063 形成"端侧 + SSD" vs "端侧 + 内存"对照)。
建议归入章节:§1.(1) 推理引擎(JustFit 端侧 LLM serving · KVExec + PhaseSwap + JIT 设计)或 §1.(3) KV Cache(端侧 KV 压缩与生命周期管理)
增量 3:FlashVector — Agent for Hierarchical Model Serving Stack Optimization(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-2105-jay-evening-briefing-security-flashvector-justfit-jev-plugins.md §一.4;arXiv:2609.17391 · 2026-09-15 · Qi Wu, Lohan Lemire 等(Google Research / UdeM)
要点: - 核心创新:Agentic 系统,能在模型 serving 栈的所有层级自动优化性能 · 核心贡献是实现了 profile–diagnose–optimize–verify 闭环,并将其扩展到完整 serving 栈 - 技术栈各层:硬件层 GPU kernel / 算子层 operator implementation / 模型层 architecture choice / 编排层 serving infrastructure - 关键发现 — Python/PyTorch vs Production 的分裂:Python/PyTorch 是原型开发首选 · Production 系统需要更优性能 · FlashVector 的案例研究本质上是在自动桥接这一分裂:parallel agent workflows 将参考实现(Python)翻译为优化后的 lower-level 代码(CUDA 等) - 相关工作脉络:KernelBench(Ouyang et al., 2025):首个 GPU kernel 优化 benchmark 标准套件 · KernelAgent / KDA:多 agent 系统展示了 profile–diagnose–optimize–verify 循环 · FlashVector 是上述范式的直接扩展
可信度:高(arXiv 论文 · Google Research)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(1) 推理引擎 + §1.(11) Kernel/Harness 已有 InferenceBench arXiv:2607.20468 + KernelBench / KernelAgent / KDA 升档承接稳态;本条是 "AI agent 作为系统工程师"前沿方向 — 不是让 agent 用 LLM 写应用代码,而是让 agent 优化底层 serving 基础设施,丰富 §1.(11) Kernel/Harness 子轴的 agent-as-engineer 范式(与 InferenceBench 形成"agent 优化推理系统 benchmark"vs"agent 自身闭环优化"对照)。
建议归入章节:§1.(11) Kernel/Harness(FlashVector profile-diagnose-optimize-verify 闭环 · Google Research 官方 agent-as-engineer 系统)或 §1.(1) 推理引擎(serving 栈全栈自动优化)
增量 4:EPD Encode-Prefill-Decode Disaggregation · 多模态推理分阶段官方决策指南(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-afternoon-nvidia-agent-stack-substack-edge-inference.md §一.4;developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving · 2026-09-04
要点: - 核心动机:多模态模型(VLM)在处理图像输入时,vision encoder 阶段和 LLM 阶段有不同的计算特征 · 混合部署导致 GPU 利用率低和延迟不稳定 · EPD disaggregation 允许分别优化各阶段资源配置和并行策略 - 技术细节:视觉编码器(vision encoder)通常计算密集适合独立 GPU pool · Prefill 阶段计算注意力权重适合批处理 · Decode 阶段内存带宽受限适合高带宽 GPU · 三个阶段分离后各自优化,减少相互干扰 - 适合场景 vs 不适合场景:高并发多模态推理、图像密集型推理任务 = 适合 · 图像很少或纯文本推理(此时 overhead 大于收益)= 不适合 - 决策指南:"Encode-Prefill-Decode disaggregation" 这个术语和具体决策标准是新的,适合进入多模态推理主题页
可信度:极高(NVIDIA 官方 benchmark 数据 + 使用边界判断)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(7) 多模态 已有 vLLM 多模态 DP / SGLang 混合架构 / AWS SageMaker Hyperpod disaggregated 锚定;§1.(6) 长上下文 已有 PIM-DIMM 2.4× HotInfra '26 / InferLog 锚定;本条是 NVIDIA 官方 EPD 使用决策指南 + 多模态推理三阶段分离的工程化范式,丰富 §1.(7) 多模态子轴的多模态推理优化案例。
建议归入章节:§1.(7) 多模态(EPD Encode-Prefill-Decode Disaggregation · NVIDIA 官方决策指南)
增量 5:Network Edge Inference for LLMs — Principles, Techniques, and Opportunities · 边缘推理 Survey(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-afternoon-nvidia-agent-stack-substack-edge-inference.md §一.6;arXiv:2604.22906 · 2026-04 · Zhixiong Chen, Bingjie Zhu, Jiangzhou Wang, Hyundong Shin, Arumugam Nallanathan, Dusit Niyato · 35 页 · cs.AI / eess.SP
要点: - Survey 核心内容:LLM 边缘推理领域的系统性 survey,覆盖从基础原则到具体技术的完整栈 1. LLM 边缘推理的背景和挑战(资源受限环境下的延迟/内存/能耗问题) 2. 系统架构(Edge-Cloud 协作、模型分区策略) 3. 模型优化技术(量化、剪枝、知识蒸馏) 4. 部署策略(Split Computing、Early Exit、Speculative Decoding 在边缘的应用) 5. 资源管理和调度 - 具体技术覆盖(有价值): - Splitwise:将 LLM 推理的 prefill/decode 阶段分离到不同 GPU pools,联合优化通信和计算(Phase disaggregation 的边缘版本) - EdgeShard:协作边缘计算方法,延迟降低 50%,吞吐量提升 2× - DistServe(边缘适配版):分离 prefill/decode 并为各阶段配置独立资源
可信度:高(arXiv 2026 年 survey · 35 页 · 覆盖边缘推理完整栈)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(6) 长上下文 + §1.(1) 推理引擎 + §1.(11) Kernel/Harness 已有 Edge0 / Splitwise / DistServe / PIM-DIMM 2.4× HotInfra '26 / InferLog 锚定;本条是 边缘推理领域最完整的 survey,丰富 §1.(6) 长上下文子轴的边缘推理案例。
建议归入章节:§1.(6) 长上下文(Network Edge Inference for LLMs Survey 锚定 · Splitwise / EdgeShard / DistServe 边缘适配版精修)
增量 6:SAGA — Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters · HPDC'26(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-jay-five-category-briefing.md §📂 Backend/Inference Engineering;arXiv:2605.00528v1 · HPDC'26
要点: - 核心定位:AI Agent 推理的工作流原子调度框架,在 GPU 集群上同时实现: - 分布式调度 ✓ - Tool TTL 管理 ✓ - 公平性保障 ✓ - 竞争比率保证 ✓ - 对比现有系统:
| 系统 | 会议 | 分布式 | Tool TTL | 公平性 | 竞争比率 |
|---|---|---|---|---|---|
| Parrot (OSDI'24) | OSDI | ✗ | ✗ | ✗ | ✗ |
| Autellix (arXiv'25) | — | ✓ | ✗ | ✗ | ✗ |
| Pie (SOSP'25) | SOSP | ✗ | ✓ | ✗ | ✗ |
| KVFlow (NeurIPS'25) | NeurIPS | ✗ | ✓ | ✗ | ✗ |
| SAGA (HPDC'26) | HPDC | ✓ | ✓ | ✓ | ✓ |
- 核心理论贡献:LRU 驱逐策略在前缀树上最坏竞争比 O(n) · 随机化算法可达到 O(log n) · SAGA 的 WA-LRU 策略是首个同时满足全部四个约束的方案
- 工程意义:Agent 推理系统从"单 agent 内"扩展到"多 agent 集群级" · 四维约束框架是理解该领域的核心概念框架
可信度:高(顶会论文 HPDC'26 · 系统方向)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(2) 推理调度 已有 Online Scheduling arXiv:2502.07115v5 / MC-SF 算法 / Fluid-Guided arXiv:2504.11320 锚定;本条是 多 Agent 集群级调度 · 4 维约束(分布式/TTL/公平/竞争比)统一框架,丰富 §1.(2) 推理调度子轴的集群级多 Agent 调度案例。
建议归入章节:§1.(2) 推理调度(SAGA Workflow-Atomic Scheduling · HPDC'26 · WA-LRU 策略 · 4 维约束框架)
增量 7:Dissecting GPU Utilization for LLM Inference on Nvidia Hopper · 单一 SM utilization 数字掩盖真相(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-2105-jay-evening-briefing-security-flashvector-justfit-jev-plugins.md §一.5;arXiv:2609.12923 · 2026-09-11 · Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic, Marco Chiesa(KTH Royal Institute of Technology)
要点: - 核心问题:单一 SM utilization 数字会掩盖真实问题 · 传统 GPU 利用率指标让 LLM inference 工作负载看起来是 compute-saturated,但实际做的有用工作可能很少 · 问题不在于计数器错误,而在于它把多个不同机制压缩成了一个数字 - 最严重的情形发生在 decode 阶段:每个 request 只贡献一个新 token · dense projection GEMM 变成 small-row matrix multiplications · 在 Hopper 上 bfloat16 GMMA 路径以固定的 64-row matrix fragments 执行 · 小 batch decode 只能填充每个 fragment 的一小部分 - 研究方法:用 vLLM + FlashAttention-3 + cuBLASLt,在 H100 NVL 上进行完整实验 · cold prefill / warm prefill / decode 三个阶段 · sweep sequence length 和 batch size · 用 8 个独立的 Nsight Compute counter-validated views 替代单一利用率数字 · 每个 view 锁定到一个 NCU counter 或显式公式 - 工程价值:"GPU 利用率 80%"可能意味着完全不同的事情,取决于具体工作负载 · 不能只看单一利用率指标做扩缩容决策
可信度:高(KTH 学术论文 · Nsight Compute 实测验证)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(1) 推理引擎 + §1.(12) 压缩与编解码 已有 vLLM V1 KV-Cache fp8 1.6× H100 / NVIDIA NVFP4 Blackwell B200 / vLLM Korea Meetup 2026 Wrap-up / vLLM 25K TPS 锚定;本条是 单一 SM utilization 数字掩盖真相 · 8 个 Nsight Compute counter-validated views 方法学,丰富 §1.(1) 推理引擎子轴的 GPU 利用率测量精度案例。
建议归入章节:§1.(1) 推理引擎(Dissecting GPU Utilization Hopper · 8 Nsight Compute counter-validated views 方法学)或 §1.(10) 顶会部署(GPU 利用率测量精度)
增量 8:Plugin4Shell — AI Coding Agent 供应链首个零点击 RCE(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-2105-jay-evening-briefing-security-flashvector-justfit-jev-plugins.md §一.1;AIR Security(Or Nevo, Dor Granat, Niv Hoffman)· CSO Online · Help Net Security · The Register · 2026-09-17/18
要点: - 核心漏洞机制:AI coding agent 生态系统的首个供应链级零点击漏洞 · 漏洞存在于 agent 对 Git 引用解析的客户端实现中,影响四个主流 AI coding agent - 受影响平台:Claude Code(Anthropic)· Codex(OpenAI)· GitHub Copilot(Microsoft)· Gemini CLI(Google) - 根因:SHA-pinning 机制(设计意图:锁定 plugin 到特定 immutable commit hash,防止供应链攻击)的实现缺陷 - 攻击路径 1 — Branch naming bypass:上游仓库提交一个无害 plugin,审核通过后,攻击者在同一分支上替换为恶意代码 - 攻击路径 2 — FETCH_HEAD confusion:利用 agent 解析 Git ref 时的边界条件绕过 SHA 校验 - 零点击属性:Agent 的 plugin 自动更新功能默认开启,当 pinned commit 被上游替换后,agent 自动拉取恶意版本 - 漏洞影响规模:925 个活跃 skills 被劫持 · 影响 134,000 个 agent 实例 · AIR 称之为"AI agent 生态系统的首个供应链漏洞" - 厂商响应:
| 厂商 | 补丁状态 |
|---|---|
| Anthropic (Claude Code 2.1.179) | ✅ 已修复 |
| OpenAI (Codex 0.146.0) | ✅ 已修复 |
| Microsoft (GitHub Copilot) | ❌ 未修复 |
| Google (Gemini CLI) | ❌ 未修复 |
- 关键洞察:Plugin4Shell 代表了 AI agent 安全从"模型行为安全"和"agent 行为安全"延伸到"供应链分发安全"的重要转变 · 两个仍未修复的厂商(Microsoft/Google)意味着生产环境中的 Copilot 和 Gemini CLI 用户仍处于风险中
可信度:极高(AIR 安全团队 · 已向厂商披露 · 有 PoC)
与活文档 llm-infra.md 现有脉络的关系:v3.38 §1.(9) 安全 + §1.(11) Kernel/Harness 已有 OpenShell NVIDIA GTC 2026 + Detokenization Leaks arXiv:2609.06674 + CoRL arXiv:2609.07529 + HF Agent 突破事件 2026-07-16 + Inference Cost Attacks on RAG CREEP framework + LLM Inference Fingerprinting + OpenAI-HF 安全事件 + Rust crates 定向供应链攻击 锚定;本条是 AI agent 生态系统的首个供应链级零点击漏洞 · 925 skills / 134,000 agent instances 实际影响,丰富 §1.(9) 安全子轴的供应链分发安全维度(与 Rust crates 定向供应链攻击形成"定向投毒 vs SHA-pinning bypass"对照)。
建议归入章节:§1.(9) 安全(Plugin4Shell — AI Coding Agent 供应链首个零点击 RCE · 925 skills 被劫持 · 134,000 agent instances)或 §1.(11) Kernel/Harness(Agent 供应链分发安全)
增量 9(承接稳态精修锚定):DeepSeek-V4.1-Flash · 升档续立 95▲ #2 · KV cache 压缩四层方法学锚定(⭐⭐⭐⭐⭐)
来源:inbox/flyp/2026-09-20-1550-DeepSeek-V4.1-Flash-KV-cache-compression-critical-read.md §〇 §一 §二;tom 9-20 0900 HF Daily #2 95▲(9-19 早棒 57▲ → 9-20 早棒 95▲ = 24h +38▲ 升档稳态);paper_card 1417 ✓ 主分类 llm-infra · 形态 application
要点:
- 正式标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
- arXiv 号:arXiv:2609.19969
- 作者:DeepSeek-AI(DeepSeek 全团队署名)
- 核心定位:DeepSeek 首个以 KV cache 压缩为头号系统卖点的旗舰模型论文 · 核心定位是 input-heavy 长 horizon 智能体工作负载下的 552B MoE backbone + 百万 token 上下文 + KV cache 压缩新 SOTA
- KV cache 压缩四层方法学(锚定):
| 层 | 论文 | 优化对象 |
|---|---|---|
| 模型层 | DeepSeek-V4.1-Flash 2609.19969 |
模型架构本身的 KV 压缩 |
| 读取层 | Fathom 2609.17652 |
per-query read depth |
| 路由层 | Edge0 2609.18063 |
MoE SSD 卸载预路由 |
| 多模态层 | HYBRIDKV 2604.05887 |
multimodal KV 压缩 7.9× |
- 撞名核对:DeepSeek-V4.1-Flash ≠ 上一代 DeepSeek-V3.x 系列,也不是 V4 Flash 蒸馏版 · v4.1-Flash 是 KV cache 压缩专项命名
- 核心问题(input-heavy 长 horizon 智能体场景):prefill 计算昂贵 + large KV cache 持续对 HBM 和 SSD 容量和数据传输带宽构成压力 = 部署成本的主要瓶颈
- 解法哲学:在模型层对 KV cache 做无损/近无损压缩,而不是仅靠系统层(HBM 容量升级 / SSD 卸载)
可信度:🟢 高(arXiv abs 已核实 + HF Daily 热度 + 三源独立验证 + paper_card 已入库)
与活文档 llm-infra.md 现有脉络的关系:v3.37 §1.(1) 推理引擎 + §1.(3) KV Cache 已有 DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 ⭐⭐⭐⭐⭐ 锚定;v3.37 §1.(3) 已有 Fathom / Edge0 / HYBRIDKV 锚定;本条是 v3.37 升档棒落定后承接稳态精修锚定 — KV cache 压缩四层方法学(模型层 + 读取层 + 路由层 + 多模态层)。
建议归入章节:§1.(3) KV Cache(KV cache 压缩四层方法学专题 · DeepSeek-V4.1-Flash 模型层 + Fathom 读取层 + Edge0 路由层 + HYBRIDKV 多模态层)或 §1.(1) 推理引擎(DeepSeek-V4.1-Flash 升档续立锚定)
三、值得警惕的矛盾或待核实说法
矛盾/待核实 ①:DeepSeek-V4.1-Flash 552B MoE + KV cache 压缩新 SOTA 的核心方法待核实(中等风险)
flyp 9-20 1550 critical-read §1.3 推断 4 条可能路线(稀疏化/量化融合 · MoE-aware KV routing · 层级 KV 共享 · 训练期 KV 预算约束)均为推断,具体方法名/公式/实验数据需在论文正式版本中实验获取。本轮 e1prep 仅有 abs 标题级信息。
建议:9-20 evening 棒位前抓 arXiv abs 全文 + 第一版正文,确认核心方法名/公式/实验数据;9-21 morning 库内完成 TLDR + 标签 + 备注更新
矛盾/待核实 ②:DeepSeek-V4.1-Flash 与既有 SOTA 的对比缺失(中等风险)
flyp 9-20 1550 critical-read §2.1 标注:DeepSeek-V4.1-Flash 是否在相同 context window / 相同模型规模下做了 head-to-head(StreamingLLM / H2O / SnapKV / FastGen / MiniCache / PyramidKV)?还是仅仅在 V4.1-Flash 内部对比 V4 / V3.2?
风险:如果仅内部对比,实验说服力打折(模型层压缩 vs 系统层压缩的公平对比缺失)
建议:标注"DeepSeek-V4.1-Flash 与既有 SOTA head-to-head 实验设置待核实"
矛盾/待核实 ③:"压缩" vs "丢失"的边界 — lost-in-the-middle 现象(低-中风险)
flyp 9-20 1550 critical-read §2.2 标注:即使预训练层做了 KV 压缩,prompt 中部信息仍可能丢失 · 对 RAG / deep research / long-context agent 场景,精确 chunk 召回是核心 KPI · DeepSeek-V4.1-Flash 在 needle-in-a-haystack / multi-hop RAG / long-context QA 上的保留率待核实
建议:标注"DeepSeek-V4.1-Flash 压缩 vs 丢失的边界与 RAG 场景精度保留率待核实"
矛盾/待核实 ④:D169 v3.38 新增 vLLM MTP 反向 KV cache 减少 23%(低风险,已锚定稳态)
jay 9-19 1450 engineering-filter 引用 HF Blog EcoHash AI 数据"MTP block 自带 attention 层需额外 cache"导致 KV cache 反向减少 23%。这一表述与"MTP 增加 attention 层需要额外 KV cache"的常理冲突,需核实原始数据。
建议:标注"MTP KV cache 减少 23% 的具体条件待核实,生产部署时需重新计算显存预算"(沿用 v3.38 D169)
矛盾/待核实 ⑤:D170 v3.38 新增 TriAttention NVIDIA TensorRT-LLM 合入状态(低风险,已锚定稳态)
jay 9-19 1450 engineering-filter + jay 9-19 1735 trinity briefing 引用"2026-08-04 官方合并主分支",但 GitHub 实际合并状态需核实 README 最新状态。
建议:标注"TriAttention TensorRT-LLM 合入状态需核实主分支 vs PR 详情"(沿用 v3.38 D170)
矛盾/待核实 ⑥:JustFit arXiv:2609.17475 MLX 实现与 vLLM / llama.cpp 的兼容性(低风险)
JustFit 是 MLX-based 推理运行时,在 24 GiB Apple 笔记本上运行 27B 量化模型。具体支持哪些模型 + 量化格式 + 与 MLX 生态(vs llama.cpp ROCm + vLLM)的兼容性需核实。
建议:9-21 morning 抓 GitHub 仓库,核实模型支持列表 + 量化格式
矛盾/待核实 ⑦:FlashVector arXiv:2609.17391 Google Research 具体实现细节(低风险)
FlashVector 的 parallel agent workflows 将参考实现(Python)翻译为优化后的 lower-level 代码(CUDA 等)具体翻译策略 + CUDA 输出质量保证待核实。
建议:9-21 morning 抓 arXiv 全文,核实 agent workflow 实现细节
矛盾/待核实 ⑧:Plugin4Shell 925 skills / 134,000 agent instances 数字源(低风险)
AIR Security 2026-09-17/18 披露 925 skills 被劫持 / 134,000 agent instances 受影响。具体数字来源(AIR Security 自行统计 vs 厂商披露)和时点需核实。
建议:9-21 morning 抓 AIR Security 原始报告,核实数字源
矛盾/待核实 ⑨:D165 NVIDIA $12.93B HF 收购(已降级稳态,低风险)
v3.37 已 web_search 2026-09-18 4 源独立验证降级 · 截至本棒位 9-20 evening 无新增官方公告 · 雷达棒位稳态。
建议:沿用 v3.37 标记,不重复核验
矛盾/待核实 ⑩:D166 CodeComp arXiv:2604.10235 arXiv ID(已待核稳态,低风险)
v3.37 已新增 D166 · HKU + LMSYS 2026-09 发布的论文与 arXiv ID 段"2604"2026-04 月份冲突 · 核实可能为 2609.10235 或早期 v1 · 截至本棒位无新增核实结果。
建议:沿用 v3.37 标记,继续观察
四、可引用 arXiv 号列表
| arXiv 号 | 标题 | 可信度 | 与 llm-infra.md 关系 |
|---|---|---|---|
| 2609.17475 | JustFit: 200K-Token LLM Serving on 24 GiB Laptop · JIT 状态管理 · KVExec + PhaseSwap(Yuhua Chen 2026-09-15) | 高(arXiv + MLX 实现 + 具体 benchmark 数据) | 本次新增 → 建议归入 §1.(1) 推理引擎(端侧 LLM serving · KVExec + PhaseSwap + JIT 设计)或 §1.(3) KV Cache |
| 2609.17391 | FlashVector: Agent for Hierarchical Model Serving Stack Optimization · profile-diagnose-optimize-verify 闭环(Qi Wu, Lohan Lemire 等 Google Research / UdeM 2026-09-15) | 高(arXiv + Google Research) | 本次新增 → 建议归入 §1.(11) Kernel/Harness(Google Research 官方 agent-as-engineer 系统) |
| 2604.22906 | Network Edge Inference for Large Language Models — Principles, Techniques, and Opportunities · 35 页 Survey(Zhixiong Chen, Bingjie Zhu 等 2026-04 cs.AI / eess.SP) | 高(arXiv 2026 年 survey · 35 页) | 本次新增 → 建议归入 §1.(6) 长上下文(边缘推理 survey 锚定 · Splitwise / EdgeShard / DistServe 边缘适配版) |
| 2605.00528v1 | SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters · HPDC'26 · 4 维约束框架 | 高(顶会论文 HPDC'26 · 系统方向) | 本次新增 → 建议归入 §1.(2) 推理调度(SAGA Workflow-Atomic Scheduling · WA-LRU 策略) |
| 2609.12923 | Dissecting GPU Utilization for LLM Inference on Nvidia Hopper · 8 Nsight Compute counter-validated views(Mohammad Siavashi, Gerald Q. Maguire Jr., Dejan Kostic, Marco Chiesa KTH 2026-09-11 cs.PF / cs.AR / cs.DC / cs.LG) | 高(KTH 学术论文 · Nsight Compute 实测验证) | 本次新增 → 建议归入 §1.(1) 推理引擎(GPU 利用率测量精度 · 8 counter-validated views 方法学)或 §1.(10) 顶会部署 |
| 2609.19969 | DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression · 552B MoE + 百万 token 上下文 + KV cache 压缩新 SOTA(DeepSeek-AI 2026-09) | 高(arXiv abs 已核实 + HF Daily 热度 + paper_card 1417 ✓ + flyp critical-read) | 本次承接稳态精修锚定 → 建议归入 §1.(3) KV Cache(KV cache 压缩四层方法学专题) |
| 2609.13141 | SAS: Simple Attention Sparsification(Tencent · 承接稳态) | 中高(arXiv + GitHub 源码 + Triton kernel) | 本次承接稳态精修 → 建议归入 §1.(5) 投机解码或 §1.(12) 压缩与编解码 |
| v3.38 锚定 8 件 arXiv ID | vLLM MTP / TriAttention / TensorRT-LLM DeepSeek-V4 / SGLang 2026 半年更新 / Sample Count / ACL 2026 Survey / OSDI '26 Zero-Copy / OpenAI Agents API 9-10 | 高 | 沿用 v3.38 morning 升档棒锚定 389 件 arXiv 总量 |
五、本次无显著新增量的来源说明
以下来源已检查,但无 llm-infra 主轴净增量,或已被 v3.38 morning 升档棒覆盖:
- inbox/jay/2026-09-20-jay-five-category-briefing.md(339 行 ≈ 11.6KB):5 件 Backend/LLM Inference 候选(LLM Inference Engine 全方位对比 2026 vLLM/SGLang/LMDeploy/TensorRT-LLM + SAGA 承接稳态 + 3 件 cs.SE 新鲜条目) + 3 件 Database(VLDB 2026 Garnet + TVA + FlowLog)+ 1 件 Cloud-Native(Cilium 1.20 正式发布 eBPF Gateway API ExternalAuth)= 大部分承接 v3.38 锚定;SAGA 纳入增量 6 实质锚入预备扩增预备级
- inbox/jay/2026-09-20-github-trending-rag-vllm-substack.md(279 行 ≈ 11.5KB):vLLM 2026 工程特性纵览 + GitHub Trending 2026-09-20 + HF State of Open Models Summer 2026 + RAG 工程最佳实践 2026 + AI Agents Stack 2026 Edition = 全部承接 v3.38 §1.(1) + §1.(10) + §1.(11) 子轴沿用稳态;vLLM 2026 工程特性纵览作为承接稳态精修纳入 §1.(1) 推理引擎(FP8 KV-Cache 量化 + AMD ATOM + vLLM-Omni Diffusion Cache)
- inbox/jay/2026-09-20-1735-jay-github-trending-hf-blog-vecdb-rag-substack-sep20.md(264 行 ≈ 11.5KB):向量数据库选型更新(pgvector 2026 主流选型共识) + GitHub Trending 全量 Stars Top 15 AI OSS + HF 九月下载格局 + RAG/Agentic RAG + Substack = 全部承接 v3.38 §1.(10) 顶会部署 + §1.(11) Kernel/Harness 子轴沿用稳态;承接稳态精修预备级
- inbox/jay/2026-09-20-csdn-llm-inference-frameworks.md(224 行 ≈ 8.7KB):6 件 CSDN 高价值 = SGLang+vLLM 双卡 A100 40GB 实测 GPU 利用率 41.2% → 92.7% + Qwen3.6-27B vLLM/SGLang 深度适配指南 37 次失败重试实战 + MiniMax-M2 三大框架实战 + 7 种 RAG 模式对比 + 推理框架全解析 + WSL2+SGLang 轻量部署 = 全部承接 v3.38 §1.(1) + §1.(4) 量化 + §1.(11) Kernel/Harness 沿用稳态;承接稳态精修预备级
- inbox/jay/2026-09-20-csdn-llm-rag-mcp-weekly.md(274 行 ≈ 11.2KB):17 件 CSDN 周检高价值 = MCP 协议综合报道 + MCP Python Server 实战 + MCP 企业生产实践 + vLLM/SGLang/TensorRT-LLM/Ollama 全解 + 推理框架内部机制 RadixAttention/Chunked Prefill + LMDeploy vs vLLM vs SGLang Benchmark 1.8 倍吞吐量 + vLLM 与 TensorRT-LLM 参数配置 MLPerf v4.0(GPT-J 99% 精度下 +187%)+ Agentic Multimodal RAG 3.0 + mKG-RAG SIGIR 2026 + Dify 企业级部署 + Dify 离线部署 = 全部承接 v3.38 §1.(1) + §1.(11) 子轴沿用稳态;MLPerf v4.0 TensorRT-LLM GPT-J 99% 精度下 +187% 作为承接稳态精修纳入 §1.(1) 推理引擎 MLPerf 锚定
- inbox/jay/2026-09-20-ai-engineering-github-hf-agents.md(256 行 ≈ 9.3KB):LangChain State of Agent Engineering 2026-06-12 + The AI Agents Stack 2026 Edition 6 层栈 + pgvector 生产 RAG 选型共识 + LangSmith Fleet 2026-03 改名 + Encore.dev "You probably don't need a vector database" 2026-03-09 + OpenAI-HF 安全事件 2026 + FastAPI 0.141.1 发布 = 全部承接 v3.38 §1.(11) Kernel/Harness + §1.(10) 顶会部署 + §1.(9) 安全子轴沿用稳态;承接稳态精修预备级
- inbox/jay/2026-09-20-csdn-ai-agent-rag-highvalue.md(134 行 ≈ 5.5KB):9 件 CSDN 早棒 = RAG 三代架构 + 10 大 Agent 框架选型 + LangGraph/Dify/AutoGen + Multi-Agent 框架对比 + vLLM/TensorRT-LLM 部署 + AI Agent 智能体架构 + SGLang 生产落地 + LLM 系统可靠性护栏 = agent 主轴邻接级,0 件 llm-infra 主轴 net-new
- inbox/jay/2026-09-19T1950-jay-engineering-filter.md(150 行):Lilian Weng Harness Engineering 工具签名 + DeepMind Math Agent Swarm 作弊故障 + The AI Engineer Stack 2026 + Encoder 路由方案 = 0 件 llm-infra 主轴 net-new(承接 v3.38 §1.(11) Kernel/Harness + §1.(1) 推理引擎沿用稳态)
- inbox/tom/2026-09-20-0900-hf-daily-2026-09-20.md(19 行):HF Daily 早棒 15 件 = 承接稳态 + DeepSeek-V4.1-Flash 95▲ #2 升档续立承接 v3.37 paper_card 1417 锚定(纳入增量 9);0 件 llm-infra 主轴立标信号 net-new 突破
- inbox/tom/2026-09-20-agent-rag-longcontext-radar.md + 2026-09-20-rag-e1prep.md + 2026-09-20-evaluation-e1prep.md(76 + 142 + 235 行):Tom 9-20 上午 radar + RAG + 下午 evaluation = 0 件 llm-infra 主轴 net-new(承接稳态)
- inbox/flyp/2026-09-20-1550-DeepSeek-V4.1-Flash-KV-cache-compression-critical-read.md(208 行):DeepSeek-V4.1-Flash 短精读 2/3 篇 = 承接稳态精修锚定预备级(纳入增量 9)
- inbox/stephen/2026-09-20-1245-stephen-coordination-check-noon.md + 2026-09-20-ai-industry-e1prep.md + 13 件 news RSS 抓取(247 + 435 行 + 90 行):stephen 9-20 noon 协调棒 + 行业动态 + 13 件 RSS news = 全部承接稳态,0 件 llm-infra 主轴 net-new
- paper_cards 9-19 至 9-20 净增区间:1432 主分类 llm-infra(1 件承接稳态精修 · Sample Count Is Not Enough 沿用 v3.38)+ 1431 / 1433 主分类 rag / agent(2 件非 llm-infra)+ 1426-1430 主分类 multimodal/evaluation(4 件非 llm-infra);0 件 NET-new 主分类 llm-infra 入库净增
六、建议今晚 E2 活文档更新优先级
| 优先级 | 内容 | 动作 |
|---|---|---|
| 🔴 最高 | NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints(KV-aware routing) | 写入 §1.(3) KV Cache(Agentic serving 路由)或 §1.(11) Kernel/Harness(NVIDIA Dynamo 官方实现) |
| 🔴 最高 | Plugin4Shell — AI Coding Agent 供应链首个零点击 RCE(925 skills / 134,000 agent instances) | 写入 §1.(9) 安全(供应链分发安全)或 §1.(11) Kernel/Harness |
| 🟡 中 | JustFit arXiv:2609.17475 200K-context @ 24 GiB Apple Silicon · KVExec + PhaseSwap JIT | 写入 §1.(1) 推理引擎(端侧 LLM serving)或 §1.(3) KV Cache |
| 🟡 中 | FlashVector arXiv:2609.17391 Google Research agent-as-engineer serving 栈 profile-diagnose-optimize-verify | 写入 §1.(11) Kernel/Harness(Google Research 官方)或 §1.(1) 推理引擎(serving 栈全栈自动优化) |
| 🟡 中 | EPD Encode-Prefill-Decode Disaggregation 多模态推理分阶段官方决策指南(NVIDIA 2026-09-04) | 写入 §1.(7) 多模态(EPD 决策指南) |
| 🟡 中 | Network Edge Inference for LLMs Survey arXiv:2604.22906 · Splitwise / EdgeShard / DistServe | 写入 §1.(6) 长上下文(边缘推理 survey 锚定) |
| 🟡 中 | SAGA arXiv:2605.00528 HPDC'26 workflow-atomic scheduling · 4 维约束分布式/Tool TTL/公平/竞争比 | 写入 §1.(2) 推理调度(SAGA Workflow-Atomic Scheduling · WA-LRU 策略) |
| 🟡 中 | Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 · 8 Nsight Compute counter-validated views | 写入 §1.(1) 推理引擎(GPU 利用率测量精度)或 §1.(10) 顶会部署 |
| 🟢 低 | DeepSeek-V4.1-Flash 升档续立 95▲ #2 · KV cache 压缩四层方法学锚定 | 写入 §1.(3) KV Cache(KV cache 压缩四层方法学专题) |
| 🟢 低 | vLLM 2026 工程特性纵览(FP8 KV-Cache + AMD ATOM + vLLM-Omni Diffusion Cache) | 写入 §1.(1) 推理引擎(vLLM 2026 工程特性精修) |
| 🟢 低 | MLPerf v4.0 TensorRT-LLM GPT-J 99% 精度下 +187% | 写入 §1.(1) 推理引擎(MLPerf v4.0 锚定) |
| 🟢 低 | pgvector 2026 主流选型共识(≤50M 向量 pgvector 足够) | 写入 §1.(11) Kernel/Harness 或 §1.(3) KV Cache 邻接 |
七、本轮 v3.38 morning 升档棒状态总评
v3.38 morning 升档棒闭合预备确认
v3.38 §IX 101 morning 升档棒(cutoff 2026-09-20 05:00 CST)已精确闭合:1 NET-new arXiv ID + 11 NET-new URL + 1 NET-new paper_card 主分类 llm-infra 入库净增 + 8 NET-new 整合级预备候选 + 0 NET-new DOI/CVE + 2 NET-new 矛盾/待核新标记(D169 vLLM MTP KV cache 23% 反向减少与常理冲突 + D170 TriAttention NVIDIA TensorRT-LLM 合入状态核实)= 精确闭合(arXiv/CVE/DOI/URL 389/36/15/585)。
本棒位(2026-09-20 evening)新增量确认
8 件 NET-new 整合级整合候选精修预备级(承接 v3.38 morning 升档棒锚定 8 件 NET-new 整合级预备候选预备级): - ① NVIDIA Dynamo 4-tier KV memory hierarchy + nvext Agent Hints(⭐⭐⭐⭐⭐) - ② JustFit 200K-context @ 24 GiB Apple Silicon · KVExec + PhaseSwap JIT(⭐⭐⭐⭐) - ③ FlashVector Google Research agent-as-engineer serving 栈(⭐⭐⭐⭐) - ④ EPD Encode-Prefill-Decode Disaggregation 多模态推理分阶段(⭐⭐⭐⭐) - ⑤ Network Edge Inference for LLMs Survey arXiv:2604.22906 · Splitwise / EdgeShard / DistServe(⭐⭐⭐⭐) - ⑥ SAGA arXiv:2605.00528 HPDC'26 workflow-atomic scheduling · 4 维约束(⭐⭐⭐⭐) - ⑦ Dissecting GPU Utilization for LLM Inference on Nvidia Hopper arXiv:2609.12923 · 8 Nsight Compute counter-validated views(⭐⭐⭐⭐) - ⑧ Plugin4Shell — AI Coding Agent 供应链首个零点击 RCE · 925 skills / 134,000 agent instances(⭐⭐⭐⭐⭐)
1 件承接稳态精修锚定(承接 v3.37 paper_card 1417): - DeepSeek-V4.1-Flash 升档续立 95▲ #2 · KV cache 压缩四层方法学锚定(⭐⭐⭐⭐⭐)
2 件 NET-new inference 学术预备候选精修预备级(承接 v3.38 morning 升档棒锚定 1 件 NET-new paper_card 主分类 llm-infra 入库净增 = Sample Count Is Not Enough paper_card 1432): - ① SAGA arXiv:2605.00528 HPDC'26 workflow-atomic scheduling · 4 维约束(同时纳入整合级整合候选精修预备级 = 增量 6) - ② InferenceBench arXiv:2607.20468 agent-as-engineer benchmark(承接稳态精修预备级)
spark 自 v3.32 立标池双向锚以来空窗态势
spark 自 v3.32 立标池双向锚以来 9 棒位连续空窗 + 9-18 单日空窗延续 + 9-19 单日空窗延续 + 9-20 单日空窗延续 = spark 9-20 evening 棒位为预备补位承接稳态(承接 spark 9-19 evening llm-infra e1prep 51KB + jay 9-20 全天棒位 13 文件 ≈ 130KB + tom 9-20 0900 HF Daily 15 件 + flyp 9-20 1550 DeepSeek-V4.1-Flash critical-read 208 行)。
work-queue 9-20 18:00 警示
0 件 llm-infra 主分类待深度解读 / 0 件待更新缺失主题活文档 / 待富化 15 张卡缺 TLDR / 待精确分类 0 张 · Tom 认领段 = 无 · spark 认领段 = 无 · work-queue 主分类 llm-infra 0 件 net-new 警示沿用稳态。
下次预计 9-21 morning cron
§IX 102 morning 升档棒预备候选承接 v3.38 morning 全量 + 本棒位 8 件 NET-new 整合级整合候选精修预备级 + 1 件承接稳态精修锚定 = §IX 102 morning 升档棒闭合预备。
本报告由 spark 实例自动生成 · 2026-09-20 18:40 CST 增量条目:8 件 NET-new 整合级整合候选精修预备级 + 1 件承接稳态精修锚定 *涉及 arXiv 号:6 件本次新增 NET-new*(2609.17475 JustFit + 2609.17391 FlashVector + 2604.22906 Network Edge Inference Survey + 2605.00528v1 SAGA + 2609.12923 Dissecting GPU Utilization Hopper + 2609.19969 DeepSeek-V4.1-Flash 承接稳态精修锚定)
本次无 NET-new 主分类 llm-infra paper_card 入库净增(v3.38 morning 主分类承接稳态 Sample Count Is Not Enough paper_card 1432 沿用 · 0 件净增)