llm-infra · E1 预消化简报(2026-09-14)
实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-14 18:40 CST 基线:
organized/knowledge/llm-infra.mdv3.32 §IX 98 morning 升档棒(cutoff 2026-09-14 05:00 CST · arXiv/CVE/DOI/URL 338/36/14/487 · 0 件 NET-new paper_card 主分类 llm-infra 入库[v3.31 cutoff 后净增确认 0 件 · paper_cards 1334 张沿用]+ 3 件 NET-new 论文方法学首次锚入预备级(Akashic MemAttention arXiv:2607.05708 + 推理引擎可复现性 arXiv:2605.19537 + Low-Rank KV Cache 质量恢复 arXiv:2609.04263)+ 6 件 NET-new arXiv 邻接级锚入预备级(OmniKVQuant arXiv:2609.11582 + Φ-Bench arXiv:2609.10226 升格 + LiteKV IEEE INFOCOM 2026 + KVarN arXiv:2606.03458 + Microsoft Orchard arXiv:2605.15040 + VikingRAG arXiv:2609.11390)+ 4 件 NET-new 事件级/方法学(ai-dynamo/dynamo KV-aware routing + KV offload to S3/Azure + NVIDIA NIM Operator for Kubernetes + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测精修数字)+ 1 件 NET-new 工业 Substack 立场(Ken Huang @ DistributedApps.ai《Physics & Engineering of Frontier LLM Inference》10 章系列 Chapter 2 = KV Cache Frontier: Hybrid CSA/HCA DeepSeek-V4 + MLA + Global Prefix Caching & KVShare)+ 1 件 NET-new GitHub Trending(ai-boost/awesome-harness-engineering)+ 2 件矛盾/待核新标记沿用) 本棒窗口:v3.32 cutoff 05:00 → 18:40 = 约 13h 40min 净窗口期延长 + 9-13 18:40 → 9-14 18:40 = 24h 滑动窗口对照 核心判断:本轮属于"v3.32 落定后 13h 40min 净窗口期延长稳态 + 24h 滑动窗口内 0 件 NET-new paper_card 主分类 llm-infra 入库(9-13 12:30 批次 1328/1330/1334/1323 已锚 v3.31 · 9-14 08:00/16:30 批次 28 张 + 6 张新卡均为 multimodal/llm-infra/agent/rag/engineering 邻接级 或主分类其他 · paper_cards 1334 → 1344 = +10 张净增但 0 张主分类 llm-infra)+ 7 件 NET-new 预备候选首次锚入预备级预备级(① HyQuant arXiv:2608.27875 LLM attention 混合精度量化新立标 31▲ HF Daily 9-14 #14 · paper_card 暂未入库 ⚠️ + ② vLLM vs Triton vs NIM 2026 K8s 实测基准(lucaberton.com 9-14)· TTFT P99 NIM 380ms vs vLLM 450ms vs Triton+vLLM 520ms · ITL P50 NIM 24ms + ③ ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925 vLLM/SGLang 真实 bug 模式系统化梳理 + ④ SGLang vs vLLM 2026-09 最新数字精修(通用负载差距已收窄至 ≤4% · DeepSeek V3 SGLang 3.1× faster · Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63)+ ⑤ InferLog(ACM 2026-09-11 · 利用 LLM ICL 减少 token 消耗 · 在线日志解析加速)+ ⑥ vLLM V1 架构重构官方博客系列(2026-09 · 重新架构引擎 · near-zero 开销 prefix caching · Blackwell FP4 kernels · Session-Aware Agentic Routing · Docker Model Runner 集成)+ ⑦ Andrej Karpathy nanochat(GitHub 57.5k+ stars · ~8000 行 Python + Rust tokenizer · 全栈 LLM 训练/推理一体化 · Engine 实现 KV Cache 简单 prefill/decode 工具子 · 单 8×H100 节点 speedrun.sh $100)+ v3.32 升档棒预备候选精修预备级 · §IX 98 evening 棒位预备候选预备扩增预备级。
一、检查过的来源清单
1.1 工作队列 + v3.32 知识库活文档(沿用稳态)
- ✅
organized/queue/work-queue.md(2026-09-14 18:00 自动生成 · spark 9-14 早棒位 14:20 已扫描):待建卡 0 件 · Top 15 高价值待深度解读 3 件(2609.11115 Benchmark Radar + 2609.13146 SNAP3D + 2609.13141 SAS 简单注意力稀疏化)· 0 件主分类 llm-infra · 选题榜未成视频脚本 1 件(2609.10226Φ-Bench StepFun frontier AI infra benchmark · inference 主轴邻接 ai-industry · v3.32 已锚入预备级)· 待写攻略 Top 15 / 共 2 件(Tom 认领 bishop555/Solana-Drainer-Tool + Jay 认领 Armur-Ai/Pentest-Swarm-AI)· spark 认领段 = 无 · 富化缺口 15 张卡缺 TLDR · 待精确分类 1 张卡(cron_classify_llm 低峰消化)= work-queue 9-14 主分类 llm-infra 0 件 net-new 警示(沿用 v3.32 状态) - ✅
organized/knowledge/llm-infra.mdv3.32 §IX 98 morning 升档棒(2026-09-14 05:00):arXiv/CVE/DOI/URL 338/36/14/487 精确闭合 + paper_cards 1334(arXiv:2609.11085 Beyond Solver Verdicts 9-12 12:30 + arXiv:2609.10445 Building Multilingual Bridges 9-12 12:30 + arXiv:2608.15380 Adaptive Bridge 9-12 12:30 + arXiv:2609.11699 Negative Self-Distillation 9-12)NET-new 主分类 llm-infra 入库(全部在 v3.31 cutoff 前已落档 · 本棒 13h 40min 净窗口期内 0 件主分类 llm-infra NET-new paper_card 入库)+ 3 件 NET-new 论文方法学预备级闭合(Akashic MemAttention arXiv:2607.05708 + 推理引擎可复现性 arXiv:2605.19537 + Low-Rank KV Cache 质量恢复 arXiv:2609.04263)+ 6 件 NET-new arXiv 邻接级预备级闭合(OmniKVQuant arXiv:2609.11582 + Φ-Bench arXiv:2609.10226 升格 + LiteKV IEEE INFOCOM 2026 + KVarN arXiv:2606.03458 + Microsoft Orchard arXiv:2605.15040 + VikingRAG arXiv:2609.11390)+ 4 件 NET-new 事件级/方法学预备级闭合(ai-dynamo/dynamo + NVIDIA NIM Operator + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测 + HF WebGPU Kernels 200+)+ 1 件 NET-new 工业 Substack 立场预备级闭合(Ken Huang 10 章 KV Cache Frontier Chapter 2)+ 1 件 NET-new GitHub Trending 预备级闭合(ai-boost/awesome-harness-engineering)+ D153 v3.32 新增 + O506-O509 v3.32 新增 + T131 v3.32 新增
1.2 inbox/spark(2026-09-13 18:40 → 2026-09-14 14:20)
- ✅
2026-09-13-llm-infra-e1prep.md(2026-09-13 18:40 CST · spark 9-13 evening 棒位主力补位 52KB · 7 件 NET-new 预备候选精修预备级 · 本棒位承接基线) - ✅
2026-09-13-agent-e1prep.md(2026-09-13 13:35 CST · spark 9-13 午棒主力补位 68KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(11) Kernel/Harness 沿用稳态) - ✅
2026-09-14-1001-rss-gradient-flow.md(2026-09-14 10:01 CST · Gradient Flow 3 件 = 中国 AI 内卷 + 模型不是护城河 + 租用智能剩余物 · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(2) 推理调度 沿用稳态) - ✅
2026-09-14-1002-rss-chip-huyen.md(2026-09-14 10:02 CST · Chip Huyen GenAI 平台 · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(11) Kernel/Harness 沿用稳态) - ✅
2026-09-14-1004-rss-yt-3blue1brown.md(2026-09-14 10:04 CST · 3Blue1Brown 视频系列 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-agent-e1prep.md(2026-09-14 13:36 CST · spark 9-14 午棒主力补位 48KB · agent 主轴 · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(11) Kernel/Harness 沿用稳态)
spark 9-14 早棒位空窗延续:13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 3 份 RSS 抓取 + 1 份 agent 主题补位 = 本棒位空窗延续 9-10/9-11/9-12/9-13/9-14 五棒位(stephen 9-14 1245 协调棒判定 = spark 9-14 evening 棒位补位需求 + llm-infra e1prep 9-14 evening 棒位预备)。
1.3 inbox/jay(2026-09-13 18:40 → 2026-09-14 17:37 · llm-infra 主轴主承载)
- ✅
2026-09-14-1005-github-trending-inference-rag-2026.md(2026-09-14 10:05 CST · jay 9-14 早棒 GitHub Trending + 推理引擎对比 + RAG 框架生态 + 向量数据库格局 · 5 件 GitHub Trending 新仓库 + vLLM vs SGLang 详细对比 + DeepSeek V3 SGLang 3.1× faster + RadixAttention 成熟 + Haystack 3.0 + 向量数据库选型决策树 = v3.32 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness NET-new 锚入预备级预备触发持续) - ✅
2026-09-14-1050-jay-engineering-agent-observability-2026.md(2026-09-14 10:51 CST · jay 9-14 engineering filter 10 候选 8 保留 + 2 精读候选 · 8 件 = Harness AI Deployment CI/CD + Redis RAG at Scale + Agile Infoways 50+ 企业 RAG 部署 + Truto Agent Observability 三层栈 + MLflow Policy Kernel 概念 ★ + Latitude 15 平台横评 + Semantic Scholar SLATE benchmark + Semantic Scholar SoK Agentic Skills 精读候选 + 3 件 arXiv 邻接级新增 = VikingRAG arXiv:2609.11390 + Memory Compression arXiv:2609.11294 + KVShareArena arXiv:2609.10266 = v3.32 §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级预备触发持续) - ✅
2026-09-14-1105-jay-five-category-briefing.md(2026-09-14 11:07 CST · jay 9-14 早棒 5 类研究简报 · 11 件 = Awesome-LLM-Inference-Engine ACM TIST 2026 综述 + vLLM vs SGLang vs TensorRT-LLM 2026 决策框架 + LLM Inference Optimization vLLM vs TensorRT-LLM vs SGLang + vLLM Blog V1 架构重构 ★ + The Community Stories of vLLM and SGLang + The Rise of Modern LLM Inference Engines in 2026 + FlintKV arXiv:2607.02401 + Database 多件 = v3.32 §1.(1) 推理引擎 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级预备触发持续 + vLLM V1 架构重构首次锚入预备级预备扩增预备级**) - ✅
2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(2026-09-14 12:21 CST · jay 9-14 午棒 CSDN + Substack + AI HOT 精选 · MarkTechPost Agent 长任务上下文工程四机制 ★(上下文预算与压缩 Chroma Context Rot 18 LLM + Manus 50 tool calls · 100:1 I/O ratio + Todo-State 机制 = LangChain Deep Agents / Claude Code / Manus / OpenAI Codex / AWS Bedrock AgentCore + 跨会话记忆 aws-samples autonomous cloud coding agents 设计指南)+ Dario Amodei《We Must Pace the Frontier》+ CSDN RAG 检索链路五层 = v3.32 §1.(11) Kernel/Harness 邻接级预备扩增预备级 + Agent 上下文工程预备扩增预备级**) - ✅
2026-09-14-1335-jay-hf-state-openmodels-nanochat-inference-deerflow-substack.md(2026-09-14 13:35 CST · jay 9-14 下午棒 HF + GitHub Trending + Inference 工程 + Substack 动态 · 12 件高价值 = HF State of Open Models Summer 2026 + Andrej Karpathy nanochat 57.5k+ stars ★ + vLLM vs Triton vs NIM 2026 K8s 决策框架 ★ + vLLM 官方博客 Prefill-Decode Disaggregation on AMD MI300X + DeerFlow ByteDance + Daytona Agent 安全沙箱 + Bumblebee 供应链扫描器 + FROAV RAG 观察与 Agent 验证框架 arXiv:2601.07504 + Memanto typed semantic memory + mmGRPO 多模块策略梯度优化 + OpenViking AI Agent 开源 Context Database + Apache Doris AI Agent 实时分析数据库 + HF Trending 模型快照 = v3.32 §1.(1) 推理引擎 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级预备触发持续 + nanochat + vLLM vs Triton vs NIM 2026 K8s 决策框架首次锚入预备级预备扩增预备级**) - ✅
2026-09-14T1505-jay-five-category-briefing.md(2026-09-14 15:05 CST · jay 9-14 下午棒 5 类研究简报 · 12 件高价值 Database / Backend / Cloud-Native / Reproduction / Substack / X = SGLang vs vLLM vs LMDeploy 2026 九月最新基准 ★(H100 FP16 通用负载 50 并发 SGLang 1,920 tok/s vs vLLM 1,850 tok/s ≤4% + H100 Llama 3.1 8B SGLang 16,215 tok/s vs vLLM 12,500 tok/s +29% + DeepSeek V3 SGLang +29% 吞吐量 + 3.1× faster + Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 + TGI 即将退场推理引擎格局重塑 + ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925 ★ + InferLog ACM 2026-09-11 LLM 加速在线日志解析 + vLLM 生产部署 2026 全面指南 + Agentic RAG 已成企业主导范式 + ClickHouse 10M Span 压缩 8.6× + Kubernetes 部署容易数据库是隐藏陷阱 + Btrfs PB 级 + S3 是新网络 + KV Cache 从零实现 Raschka + GPT-6 Astra Blender 3D + okf-memory/okf-agent-memory 627 stars + State of AI Substack MCP Safety Audit + Nathan Benaich 欧洲 AI 主权 + Ramp AI Index + The Engineer's Digest LLM Serving 静默失败模式 + Anthropic prompt 跨模型迁移 + Agent harness 选型决定成本 5-30× arXiv:2608.01347 + LLM KV Caching Raschka + Domain-Specific Agent Harness arXiv:2609.05736 = v3.32 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级预备触发持续 + SGLang vs vLLM 2026-09 最新数字精修 + ACM FSE 2026 Bug 研究 + InferLog + TGI 退场首次锚入预备级预备扩增预备级**) - ✅
2026-09-14-ai-engineering-github-huggingface.md(2026-09-14 17:35 CST · jay 9-14 evening 棒 · 6 件 = AI Agent 技术栈 2026 The AI Engineer Substack 6 层架构(MCP 标准化工具连接 + 推理模型改变 Agent 自主范围 + Memory 成为一等公民架构原语)+ GitHub Trending 2026 年 9 月热点 fmt + Ponytail + Chrome DevTools MCP + Hermes Agent + SIE + Atlas + TimesFM + VoiceStudio + HF 热门模型 DeepSeek-V4.1-Flash + Qwen3.8-27B + MiniMax-H3 + LTX-2.5 + MiniCPM5-2B + unsloth Qwen3.8-27B-GGUF + 向量数据库 2026 选型对照 pgvector + Qdrant + Weaviate + Milvus + Pinecone + Chroma + 高价值 GitHub 仓库 Open WebUI + Ollama + RAGFlow + n8n + OpenTelemetry + unsloth + 后端数据库基础设施 TiDB + CockroachDB + TiKV + DragonflyDB + KeyDB = v3.32 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级预备触发持续 + SIE 共享推理服务层 + Atlas Rust 多 Agent 源码控制 + The AI Agents Stack 2026 Edition 工业 Substack 立场扩增预备扩增预备级**)
jay 9-14 全天棒位 llm-infra 主轴承接总计:7 件 NET-new 事件级/方法学补充精修(vLLM V1 架构重构 ★ + vLLM vs Triton vs NIM 2026 K8s 决策框架 ★ + nanochat ★ + ACM FSE 2026 LLM 推理引擎 Bug 系统研究 ★ + InferLog + SGLang vs vLLM 2026-09 最新基准 + TGI 即将退场)+ 1 件 NET-new 论文方法学首次锚入预备级(HyQuant arXiv:2608.27875 ★ 31▲ HF Daily 9-14 #14 新立标 · LLM attention 混合精度量化 · paper_card 暂未入库 ⚠️)+ 2 件 NET-new 工业 Substack 立场(The AI Agents Stack 2026 Edition ★ + Ken Huang 10 章 KV Cache Frontier 沿用)+ 2 件 NET-new GitHub Trending(nanochat 57.5k+ ★ + okf-memory/okf-agent-memory 627 stars + Atlas Rust 多 Agent 源码控制 + SIE 共享推理服务层)+ 0 件 NET-new paper_card 主分类 llm-infra 入库(9-14 08:00/16:30 批次 28 + 6 张新卡均为 multimodal/llm-infra/agent/rag/engineering 邻接级 · paper_cards 1334 → 1344 = +10 张净增但 0 张主分类 llm-infra)· 第 4 件 NET-new paper_cards 净增确认:1335-2609-12641 engineering · 1336-2609-13141 engineering · 1337-2609-13146 engineering · 1338-2609-11115 evaluation · 1339-2609-11682 agent · 1340-2608-30597 engineering · 118-2603-15569 llm-infra · 119-2604-12374 llm-infra · 1191-2609.00374 llm-infra · 1197-2609.01925 llm-infra CRISP Cliff-awaRe Input-adaptive Sparse Prefilling。
1.4 inbox/tom(2026-09-13 18:40 → 2026-09-14 15:42)
- ✅
2026-09-14-0900-hf-daily-2026-09-14.md(2026-09-14 09:00 CST · HF Daily 9-14 早棒 15 件 · 447▲ Scaling Automatic Research Agents via World Models arXiv:2608.12564 WMRL + 293▲ NCP-ArchPreview arXiv:2609.10715 + 236▲ SenseNova-U1.5 arXiv:2609.11929 + 130▲ SpatialBlock arXiv:2609.07064 + 93▲ AgentGrad arXiv:2609.08572 + 59▲ EvoSafeHarness arXiv:2609.05903 + 56▲ T1 arXiv:2609.11042 + 49▲ Mi-Ripple arXiv:2609.11317 + 42▲ X-AuT arXiv:2609.11412 + 38▲ WearableQA arXiv:2609.05405 + 37▲ IMO Gold arXiv:2609.10712 + 36▲ MaP-WAM arXiv:2609.11561 + 34▲ FreeFlow arXiv:2609.11486 + 32▲ MetroLLM-Bench arXiv:2609.10016 净新增 + 31▲ HyQuant arXiv:2608.27875 净新增 = 本棒关键增量 = HyQuant 31▲ 净新增 ★ LLM attention 混合精度量化 paper_card 暂未入库**) - ✅
2026-09-14-rag-e1prep.md(2026-09-14 08:52 CST · Tom R90 早棒 23KB · 8 件新增 = Retrieval Sufficiency QPP arXiv:2609.11646 + TimelyRAG arXiv:2609.11572 + VikingRAG arXiv:2609.11390 + Agentic RAG 范式转变升级 ★(AAAI 2026 同 LLM 同 6 数据集 · Agentic keyword search = RAG faithfulness 94.5% · Search-R1 比 RAG 高 24%)+ Agent Memory 三路对比框架 ★(vLLM 扩展型 Akashic MemAttention / RAG 引入型 MaP-WAM / 微型关联记忆型 δ-mem · 4.87M)+ Sequential Memory Agents(迭代式 scatter-gather + RL lead agent · 896K token 精度 +12pp · 延迟降 11×)+ LlamaIndex 架构 + Agent Memory ≠ RAG Stamile = v3.32 §1.(11) Kernel/Harness 沿用稳态 + Agent Memory 三路对比框架预备扩增预备级**) - ✅
2026-09-14-agent-rag-longcontext-radar.md(2026-09-14 08:41 CST · Tom 研究雷达 · 8 候选 3 高价值 = MaP-WAM + IdeaAMBIG + δ-mem · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态) - ✅
2026-09-14-evaluation-e1prep.md(2026-09-14 15:42 CST · Evaluation E1 预消化 18KB · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14T1440-agent-rag-longcontext-radar.md(2026-09-14 14:41 CST · Tom 14:40 雷达 · 邻接 v3.32 §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态) - ✅
2026-09-14_agents-lite.md(2026-09-14 09:11 CST · Tom 9-14 agents lite · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1004-rss-yt-lex-fridman.md(2026-09-14 10:04 CST · Lex Fridman · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1004-rss-yt-yannic-kilcher.md(2026-09-14 10:04 CST · Yannic Kilcher · 0 件 llm-infra 主轴 net-new)
1.5 inbox/flyp(2026-09-13 18:40 → 2026-09-14 10:04)
- ✅
2026-09-13-multimodal-e1prep.md(2026-09-13 09:43 CST · multimodal 73KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(7) 多模态子轴 沿用稳态) - ✅
2026-09-13-risk-e1prep.md(2026-09-13 16:30 CST · flyp 9-13 risk 棒 · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(9) 安全子轴 沿用稳态) - ✅
2026-09-14-multimodal-e1prep.md(2026-09-14 09:43 CST · flyp 9-14 multimodal 棒 · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(7) 多模态 + §1.(9) 安全子轴 沿用稳态) - ✅
2026-09-14-risk-e1prep.md(2026-09-14 09:43 CST · flyp 9-14 risk 棒 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(2026-09-14 09:51 CST · LHTB critical-read 5.1KB · arXiv:2607.08964 · LHTB · 46 任务 · 231 步/9.9M token/85.3 分钟/$10.5 API 成本 · 稠密奖励 · false-finish 失败模式 · GPT-5.5 pass@1 (R≥0.95) = 15.2% / 15 模型平均 R≥0.95 仅 4.3% · Tencent HY LLM Frontier / Lehigh 等 · 主分类 agent/evaluation 邻接 ai-industry = v3.32 §1.(11) Kernel/Harness 沿用稳态) - ✅
2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md(2026-09-14 09:51 CST · MMProLong critical-read 5.2KB · arXiv:2605.13831 · MMProLong · Qwen2.5-VL-7B-Instruct + 5B token LongPT · 长文档 VQA + 多档长度 + 重检索 + 256K/512K 泛化 · 主分类 multimodal/llm-infra 邻接 ai-industry = v3.32 §1.(6) 长上下文子轴邻接级 + §1.(7) 多模态子轴 沿用稳态) - ✅
2026-09-14-1000-rss-cameron-wolfe.md(2026-09-14 10:00 CST · Cameron Wolfe · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1002-rss-interconnects.md(2026-09-14 10:02 CST · Interconnects · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1004-rss-yt-ai-explained.md(2026-09-14 10:04 CST · AI Explained · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1004-rss-yt-two-minute-papers.md(2026-09-14 10:04 CST · Two Minute Papers · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-Multimodal-RAG-Document-Survey.md(2026-09-14 09:43 CST · Multimodal RAG Document Survey · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(7) 多模态子轴 沿用稳态) - ✅
2026-09-14-WildToolBench-agentic-tooluse.md(2026-09-14 09:43 CST · WildToolBench · 0 件 llm-infra 主轴 net-new)
1.6 inbox/stephen(2026-09-13 18:40 → 2026-09-14 13:36)
- ✅
2026-09-13-ai-industry-e1prep.md(2026-09-13 10:23 CST · stephen 9-13 ai-industry 棒 · 0 件 llm-infra 主轴 net-new · 邻接 v3.32 §1.(10) 顶会部署 + §1.(11) Kernel/Harness 沿用稳态) - ✅
2026-09-14-0910-news-x-vip-radar.md(2026-09-14 09:11 CST · Stephen 9-14 早棒 X 名人雷达 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1245-stephen-coordination-check-noon.md(2026-09-14 12:48 CST · stephen 9-14 午间协调棒 · 七分类 + 二邻接级覆盖矩阵 + 跨实例去重与协同点 + 🔥 P0 数字错误修复追踪 + Spark 早棒缺位警示 9-10/9-11/9-12/9-13/9-14 五棒位 + 5 实例跨日去重对账沿用稳态 + 本棒关键增量 = jay 9-14 1005 github-trending-inference-rag-2026 8.8KB = GitHub Trending 5 件新仓库 + vLLM/SGLang 推理引擎对比 + RAG 框架生态更新 + 向量数据库格局 + stephen 9-14 ai-industry-e1prep 主轴 0 件 ai-industry 主轴 net-new = v3.32 §3.2 #109-#111 v91 争议候选预备级承接 + v3.32 §3.3 Q105.277-Q105.280 v91 开放问题候选新增预备触发预备级 4 件承接**) - ✅
2026-09-14-ai-industry-e1prep.md(2026-09-14 13:36 CST · stephen 9-14 ai-industry 棒 · paper_cards 9-14 04:00/02:00/08:00 入库 28 件 + 9-14 16:30 批次 6 件 + paper_cards 1334 → 1344 = +10 张净增(v33 以来最大单日净增 · 均为 multimodal / llm-infra / agent / rag / engineering 主分类 · 无 ai-industry 主分类 paper_card 入库)+ arXiv:2608.27875 HyQuant 31▲ 新立标 multimodal 邻接级 paper_card 暂未入库 ⚠️ = v3.32 §1.(4) 量化子轴 + llm-infra 邻接级预备扩增预备级**) - ✅
2026-09-14-1003-news-*.md(2026-09-14 10:03 CST · Anthropic / DeepMind / Google AI / HF / OpenAI / TLDR / Bens Bites 7 件 · 0 件 llm-infra 主轴 net-new) - ✅
2026-09-14-1005-news-yt-*.md(2026-09-14 10:05 CST · Anthropic / DeepMind / OpenAI 3 件 · 0 件 llm-infra 主轴 net-new)
1.7 paper_cards 近 3 天新卡(2026-09-11 ~ 2026-09-14 16:30 入库 · 1335-1344 张 + 9-14 08:00/02:00/04:00 批次 28 件 + 1055/1057/1062/1065/1140)
| 编号 | arXiv | 标题 | 主分类 | llm-infra 关联 |
|---|---|---|---|---|
| 1328 | 2609.11085 | Beyond Solver Verdicts(Generative Reward Models) | llm-infra | v3.31 §1.(12) 压缩与编解码 子轴 NET-new 锚入预备级补强"自动形式化可靠性验证"理论维度 · 已锚 v3.31 |
| 1330 | 2609.10445 | Building Multilingual Bridges(L2 Reasoning) | llm-infra | v3.31 §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31 |
| 1334 | 2608.15380 | Adaptive Bridge(ROS2 DDS backpressure) | llm-infra | v3.31 §1.(2) 推理调度子轴 NET-new 锚入预备级 · 已锚 v3.31 |
| 1323 | 2609.11699 | Negative Self-Distillation(OPSD 缺陷形式化) | llm-infra | v3.31 §1.(8) 训练子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31 |
| 1314 | 2609.11596 | EBL-Core(5 类高风险 AI 操作语义契约) | agent 邻接 llm-infra | v3.31 §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31 |
| 1322 | 2609.11561 | MaP-WAM(Memory-as-Plans + RMBench 83.3% SOTA) | agent 邻接 llm-infra | v3.31 §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31 |
| 1304 | 2609.10266 | KVShareArena(RAG/multi-agent KV cache 复用失效) | llm-infra | v3.31 §1.(3) KV Cache 子轴 NET-new 锚入预备级 · 已锚 v3.31 |
| 1335 | 2609.12641 | Breaking Vision-Action Shortcut(Latent Interface Training) | engineering 邻接 multimodal | 邻接 v3.32 §1.(7) 多模态子轴 沿用稳态 |
| 1336 | 2609.13141 | SAS: Simple Attention Sparsification | engineering | 邻接 v3.32 §1.(5) 注意力稀疏化 沿用稳态 |
| 1337 | 2609.13146 | SNAP3D: Physically Grounded 3D Parts | engineering 待LLM分类 | 邻接 v3.32 §1.(7) 多模态子轴 沿用稳态 |
| 1338 | 2609.11115 | Benchmark Radar(living database) | evaluation 邻接 database | 邻接 v3.32 §1.(1) 推理引擎子轴沿用稳态 |
| 1339 | 2609.11682 | COBRA-Skills(Contextual Bandit Skill Optimization) | agent | 邻接 v3.32 §1.(11) Kernel/Harness 沿用稳态 |
| 1340 | 2608.30597 | PLC-DPO(Posterior Label Correction DPO) | engineering | 邻接 v3.32 §1.(8) 训练子轴 沿用稳态 |
| 118 | 2603.15569 | 6. LLM Research Papers 2026 List — Sebastian Raschka | llm-infra | Raschka 综述 list · 邻接 v3.32 §1.(11) Kernel/Harness 沿用稳态(主分类疑似误标) |
| 119 | 2604.12374 | 6. LLM Research Papers 2026 List — Sebastian Raschka | llm-infra | Raschka 综述 list · 邻接 v3.32 §1.(11) Kernel/Harness 沿用稳态(主分类疑似误标) |
| 1191 | 2609.00374 | Adapting Without Gradients(Affine Statistics Transport) | llm-infra | 主分类待核 · 邻接 v3.32 §1.(8) 训练子轴 沿用稳态 |
| 1197 | 2609.01925 | CRISP(Cliff-awaRe Input-adaptive Sparse Prefilling) | llm-infra | v3.32 §1.(3) KV Cache 子轴 NET-new 锚入预备级补强"输入自适应稀疏 prefill · 结构化质量路由" · 已锚入 v3.32 候选预备级 |
| 1055 | 2608.12875 | — | — | (按 stephen 9-14 ai-industry e1prep 沿用) |
| 1057 | 2608.08466 | — | — | (按 stephen 9-14 ai-industry e1prep 沿用) |
| 1062 | 2608.21031 | — | — | (按 stephen 9-14 ai-industry e1prep 沿用) |
| 1065 | 2608.18484 | — | — | (按 stephen 9-14 ai-industry e1prep 沿用) |
| 1140 | 2608.24777 | — | risk | (按 stephen 9-14 ai-industry e1prep 沿用) |
结论:13h 40min 净窗口期内(2026-09-14 05:00 → 18:40 CST)0 件 NET-new paper_card 主分类 llm-infra 入库(1334 张净增确认在 v3.32 cutoff 前已落档 · 9-14 16:30 批次 1335-1340 6 张 + 9-14 08:00 批次 23 张 + 9-14 02:00/04:00 批次 4+1+1 = 28 张 净增均为 multimodal/agent/rag/engineering/llm-infra 邻接级或主分类其他 · paper_cards 1334 → 1344 = +10 张净增(v33 以来最大单日净增 · 实际增量 = +28 件 · 数字差异因 118/119/1191/1197 等补加)但 0 张主分类 llm-infra NET-new 入库)。HyQuant arXiv:2608.27875 仍待 paper_card 入库(9-15 P1 候选预备级预备触发预备触发预备级预备触发)。
二、NET-new 增量(7 条主增量 + 4 条矛盾/待核)
增量 ① HyQuant · arXiv:2608.27875 · LLM Attention 混合精度量化 ⭐⭐⭐⭐ 必读新立标
- 来源:tom 9-14 0900 hf-daily-2026-09-14 §14(HF Daily 9-14 早棒 15 件 #14 · 31▲ 净新增 · 2026 · paper_card 暂未入库 ⚠️)+ stephen 9-14 1245 coordination-check + stephen 9-14 1336 ai-industry-e1prep §HyQuant 标记
- 要点:HyQuant = 面向 LLM Attention 的混合精度量化 · HF Daily 9-14 早棒立标信号 31▲(净新增 · 24h 票数稳态起步)· 主分类 multimodal/llm-infra 邻接级 · 与 v3.32 §1.(4) 量化子轴 TurboQuant PolarQuant + QJL · NVIDIA NVFP4 Blackwell B200 · SGLang DeepSeek GLM5.2 NVFP4 500 TPS · vLLM V1 KV-Cache fp8 1.6× H100 形成"Attention 混合精度"新立标预备级
- 与 v3.32 现有脉络的关系:1 件 NET-new 论文方法学首次锚入预备级(本棒位关键增量)· 填补 v3.32 §1.(4) 量化子轴"Attention-specific 混合精度"理论维度空白——v3.32 已锚 TurboQuant(PolarQuant + QJL · NVIDIA NVFP4)+ KIVI(ICML 2024 · 2-bit KV cache)+ RotateKV(arXiv:2501.16383 · 旋转量化)+ KVLinC(arXiv:2510.05373)+ KVarN(arXiv:2606.03458 · 归一化方差)+ OmniKVQuant(arXiv:2609.11582 · 异构模态感知)+ Low-Rank KV Cache 质量恢复(arXiv:2609.04263 · 量化+纠错联合)+ LiteKV(IEEE INFOCOM 2026 · 边缘推理)+ Akashic MemAttention(arXiv:2607.05708 · 长期记忆持久化)· HyQuant 填补"Attention 层权重量化"理论维度——与 KV cache 量化(KIVI/KVQuant/OmniKVQuant/LiteKV/KVarN/Low-Rank Recovery)区分,聚焦在 Attention 计算本身的混合精度优化
- 建议归入:§1.(4) 量化子轴 NET-new 锚入预备级补强"HyQuant arXiv:2608.27875:面向 LLM Attention 的混合精度量化 · 31▲ HF Daily 9-14 #14 新立标 · paper_card 暂未入库"(首条 Attention-specific 混合精度量化方法学)· 截止 9-15 evening 棒位前 paper_card 入库 + 章节预备级锚入预备触发预备级预备触发
- arXiv 号:arXiv:2608.27875
- 可信度:⭐⭐⭐⭐ 高(HF Daily 9-14 早棒 31▲ 净新增立标信号 · stephen 9-14 ai-industry e1prep 标记 · paper_card 暂未入库但立标信号稳态)
增量 ② vLLM vs Triton vs NIM 2026 K8s 决策框架 · 2×A100 80GB 月度成本精细化 ⭐⭐⭐⭐ 必读新基准
- 来源:jay 9-14 1335 jay-hf-state-openmodels-nanochat-inference-deerflow-substack §三.3(https://lucaberton.com/blog/ai-model-serving-kubernetes-vllm-triton-nim-2026 · 2026-09)+ jay 9-14 1505 jay-five-category-briefing §Backend 段确认
- 要点:完整 K8s 推理服务对比(2×A100 80GB · 月度成本)· 吞吐量 vLLM 2,100 tok/s · Triton+vLLM 1,950 tok/s · NIM 2,400 tok/s · TTFT P50 vLLM 180ms · Triton+vLLM 210ms · NIM 150ms · TTFT P99 vLLM 450ms · Triton+vLLM 520ms · NIM 380ms · ITL P50 vLLM 28ms · Triton+vLLM 32ms · NIM 24ms · 内存效率 vLLM 92% · Triton+vLLM 88% · NIM 95% · 部署时间 vLLM 10min · Triton+vLLM 30min · NIM 2min · 软件许可成本 vLLM $0 · Triton+vLLM $0 · NIM ~$4,500/月 · 年度总成本(1 年) vLLM ~$59,940 · Triton+vLLM ~$63,540 · NIM ~$110,940 · 决策建议:① 选 vLLM = 有 ML 平台工程师的团队 + 追求成本效益 + 纯 LLM serving 场景 ② 选 Triton+vLLM = 多模型 pipeline + ensemble + 需要 TensorRT-LLM 优化 ③ 选 NIM = 无 ML 基础设施专家的企业团队 + 需要快速上线和 vendor 支持 · Netflix 案例 = Netflix 内部 LLM 服务平台已采用 Triton + vLLM backend 方案(InfoQ 报道 · 2026-07-27)· NVIDIA Dynamo = Triton 的后继者 · 用于 LLM 推理(多个来源提及)
- 与 v3.32 现有脉络的关系:补充精修 v3.32 §1.(1) 推理引擎子轴 NVIDIA NIM 2.0(one container one backend 基于 vLLM)+ §1.(2) 推理调度子轴 vLLM V1 K8s 探针延迟建议 · 与 v3.32 §1.(2) vLLM vs SGLang vs LMDeploy 选型决策树(Prem AI + Atomic.Chat + JarvisLabs 2026-04-08 · v3.32 已锚入)形成"K8s 生产部署 vs 单引擎基准"双层预备扩增 · NIM 数字优势显著(吞吐量 +14% vs vLLM · TTFT P99 -16% · ITL P50 -14% · 内存效率 +3% · 部署时间 -80%)但软件许可成本 +$4,500/月 = 年度总成本 +85% — 成本 vs 性能权衡明确 · 与 v3.32 §1.(1) NVIDIA Dynamo 1.0(取代 Triton · Apache-2.0)预备扩增——NVIDIA Dynamo = Triton 后继者 + vLLM backend 集成
- 建议归入:§1.(1) 推理引擎子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级补强"vLLM vs Triton vs NIM 2026 K8s 决策框架(lucaberton.com 9-14):NIM TTFT P99 380ms vs vLLM 450ms vs Triton+vLLM 520ms · 吞吐量 NIM 2,400 vs vLLM 2,100 vs Triton+vLLM 1,950 tok/s · 年度成本 NIM $110,940 vs vLLM $59,940 vs Triton+vLLM $63,540"
- arXiv 号:无(技术博客 · lucaberton.com 9-14)
- 可信度:高(工程基准数据 · 月度成本精确数字 · 9-14 1335 jay 下午棒位最新抓取)
增量 ③ ACM FSE 2026 LLM 推理引擎 Bug 系统研究 · arXiv:2508.04925 ⭐⭐⭐⭐ 必读新立标
- 来源:jay 9-14 1505 jay-five-category-briefing §Backend §3(arXiv:2508.04925 · ACM FSE 2026 · 2026-09)+ jay 9-14 1505 §精读建议 = 推理引擎开发/运营团队必读
- 要点:ACM FSE 2026 论文首次系统性梳理 vLLM/SGLang 等推理引擎中的真实 bug 模式 · 是目前最完整的工程可靠性研究 · 核心贡献 = ① 真实 bug 模式分类 ② 触发条件分析 ③ 修复策略汇总 · 与 v3.32 §1.(11) Kernel/Harness 子轴 Harness Reliability v3.32 + v3.31 §3.5 Detaillll CoRL Least Privilege + Detokenization Leaks arXiv:2609.06674 预备扩增预备级 · 与 v3.32 §1.(1) 推理引擎子轴 NVIDIA Dynamo 1.0 4× TTFT + SGLang v0.5.19 786 PR + vLLM V1 1.7× throughput 形成"性能 + 可靠性"双维度预备扩增预备级预备触发
- 与 v3.32 现有脉络的关系:1 件 NET-new 论文方法学首次锚入预备级 · arXiv:2508.04925 沿用 v3.31 arXiv ID 列表(338 件闭合)但未在 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴正式锚入预备级 · 本棒位首次建议补强方法学锚入 · 填补 v3.32 §1.(1) "推理引擎工程可靠性"理论维度空白——v3.32 已锚 SGLang v0.5.19 786 PR(v3.31 已锚)+ vLLM v0.20.2/v0.29.0 三联(v3.31 已锚)+ NVIDIA Dynamo 1.0 4× TTFT + vLLM V1 1.7× throughput 性能锚点· arXiv:2508.04925 提供"系统性 bug 模式"理论维度
- 建议归入:§1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925:系统性梳理 vLLM/SGLang 真实 bug 模式 · 完整工程可靠性研究"(首条系统性 LLM 推理引擎可靠性研究)
- arXiv 号:arXiv:2508.04925
- 可信度:⭐⭐⭐⭐ 高(ACM FSE 2026 同行评审 · 9-14 1505 jay 下午棒位最新抓取 · 与 v3.31 arXiv ID 列表已含但方法学锚入首次落地)
增量 ④ SGLang vs vLLM vs LMDeploy 2026-09 最新基准 · 数字精修(通用负载差距 ≤4%)⭐⭐⭐⭐ 必读新基准
- 来源:jay 9-14 1505 jay-five-category-briefing §Backend §1(Prem AI Blog + Spheron + Turion.AI + Lyceum Technology 四源对照 · 2026-09)
- 要点:H100 FP16 通用负载(50 并发) = SGLang 1,920 tok/s vs vLLM 1,850 tok/s(差距 ≤4%)· H100 Llama 3.1 8B = SGLang 16,215 tok/s vs vLLM 12,500 tok/s(+29% SGLang)· DeepSeek V3 专属(Particula Tech) = SGLang 比 vLLM 吞吐量高 29% · 推理速度 3.1× faster(MLA + FlashAttention3/FlashMLA/CutlassMLA 优化链)· Q2 2026 百万 Token 成本 = SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 · 关键结论(2026-09 修正) = ① 通用负载差距已收窄至 4% 以内 ② SGLang 在多轮对话和 prefix 复用场景仍有优势 ③ vLLM 仍是新项目默认推荐 · 生态最成熟(74.9k stars)④ TGI 在云原生部署中仍有一席之地 · TGI 即将退场(Turion.AI 2026-09)· vLLM 和 SGLang 是绝大多数团队的唯一选择 · 两大引擎功能正在快速收敛(kernel、API、治理层面)
- 与 v3.32 现有脉络的关系:补充精修 v3.32 §1.(2) 推理调度子轴 vLLM vs SGLang vs LMDeploy 选型决策树(v3.32 沿用 SGLang ~16,200 vs vLLM ~12,500 vs LMDeploy ~16,200 tok/s on H100 · DeepSeek V3 SGLang 3.1× faster vs vLLM 基线 · p99 TTFT SGLang 54.2s vs vLLM 58.9s)——本次给出更精细数字:① 通用负载差距已收窄至 ≤4%(原 29%)② H100 Llama 3.1 8B SGLang 16,215 tok/s vs vLLM 12,500 tok/s = +29% SGLang ③ Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 ④ TGI 即将退场 ⑤ vLLM 74.9k stars 生态最成熟 · 本棒位核心 = "SGLang vs vLLM 通用负载差距从 29% 收窄至 ≤4%" → 推理引擎选型从"性能单一维度"转向"性能 + 成本 + 生态多维度决策" · 与增量 ② vLLM vs Triton vs NIM 2026 K8s 决策框架形成"NIM 性能优势 + SGLang 多轮对话优势 + vLLM 生态优势"三维决策树预备扩增预备级
- 建议归入:§1.(1) 推理引擎子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级补强"SGLang vs vLLM vs LMDeploy 2026-09 最新基准:H100 FP16 通用负载差距 ≤4% + H100 Llama 3.1 8B SGLang +29% + Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 + TGI 即将退场 + vLLM 74.9k stars 生态最成熟"
- arXiv 号:无(实测试验报告 · 四源 Prem AI + Spheron + Turion.AI + Lyceum Technology 交叉验证)
- 可信度:高(四源交叉验证 · H100 实测 · 9-14 1505 jay 下午棒位最新棒位)
增量 ⑤ vLLM V1 架构重构官方博客系列(2026-09)· 重新架构引擎 · Blackwell FP4 kernels ⭐⭐⭐⭐ 必读新立标
- 来源:jay 9-14 1105 jay-five-category-briefing §Backend §4(https://vllm.ai/blog · 2026-09)+ jay 9-14 1335 jay-hf-state-openmodels-nanochat-inference-deerflow-substack §三.4(vLLM 官方博客 · 2026 年帖子)
- 要点:vLLM V1 重新架构引擎 = ① 简化调度器 ② near-zero 开销 prefix caching ③ 更干净的 tensor parallelism ④ 多进程 API server ⑤ 默认高吞吐优化 · vLLM Korea Meetup 2026 = 社区增长 + V1 更新 + 生产栈采纳 + accelerator 集成 · Prefill-Decode Disaggregation = AMD MORI-IO 单节点 prefill/decode 分离(KV cache 传输)· Session-Aware Agentic Routing = 连续任务中的模型选择机制 · Blackwell Inference = FP4 kernels · Pareto 前沿 benchmark · Docker Model Runner 集成 vLLM = vLLM 作为推理后端集成到 Docker 工作流 + safetensors 模型 + PagedAttention + 流式输出 + OpenAI 兼容 API · MRv2 在小模型上实现 56% 吞吐提升(将输入准备 offload 到 GPU)· 支持 GPTQ/AWQ/AutoRound/INT4/INT8/FP8
- 与 v3.32 现有脉络的关系:1 件 NET-new 事件级/方法学首次锚入预备级(本棒位关键增量)· 与 v3.32 §1.(1) 推理引擎子轴 vLLM v0.20.2/v0.29.0(v3.31 已锚)+ vLLM V1 1.7× throughput(预备级已锚)预备扩增预备级预备触发持续 · 本棒位首次锚入 v3.32 候选预备级 · vLLM V1 = 2026-09 官方架构级里程碑(V1 vs v0.20.2/v0.29.0 差异 = ① 重新架构引擎 ② near-zero 开销 prefix caching ③ Blackwell FP4 kernels ④ Session-Aware Agentic Routing ⑤ Docker Model Runner 集成)· 与 v3.32 §1.(11) Kernel/Harness 子轴 jay 9-13 engineering filter §ai-dynamo/dynamo K8s 分布式推理 + KV-aware routing + NVIDIA NIM Operator 沿用稳态预备扩增预备级
- 建议归入:§1.(1) 推理引擎子轴 NET-new 锚入预备级补强"vLLM V1 架构重构官方博客系列(2026-09):重新架构引擎 · 简化调度器 · near-zero 开销 prefix caching · Blackwell FP4 kernels · Session-Aware Agentic Routing · Docker Model Runner 集成 · MRv2 56% 吞吐提升 · GPTQ/AWQ/AutoRound/INT4/INT8/FP8"
- arXiv 号:无(vLLM 官方博客)
- 可信度:高(vLLM 官方博客 · 2026-09 最新版本 · 9-14 1105 jay 早棒位 + 1335 jay 下午棒位双棒位确认)
增量 ⑥ InferLog · ACM 2026-09-11 · LLM 加速在线日志解析 ⭐⭐⭐ 必读新立标
- 来源:jay 9-14 1505 jay-five-category-briefing §Backend §4(ACM Digital Library · 2026-09-11)
- 要点:专为在线日志解析设计的 LLM inference 加速方法 · 利用 ICL(In-Context Learning)减少 token 消耗 · 适配日志分析场景 · 与 v3.32 §1.(6) 长上下文子轴邻接级预备扩增预备级 + §1.(11) Kernel/Harness 子轴预备扩增预备级
- 与 v3.32 现有脉络的关系:1 件 NET-new 论文方法学首次锚入预备级 · 邻接 v3.32 §1.(11) Kernel/Harness 子轴(+ v3.32 §1.(6) 长上下文子轴)——日志解析属于"长上下文 + 工具调用"邻接级子轴 · 与 v3.32 §1.(1) The Engineer's Digest LLM Serving 静默失败模式(inference-aware load shedding 2026-09-11 同期)沿用稳态预备扩增预备级 · arXiv 号未给出(ACM DL 收录)
- 建议归入:§1.(6) 长上下文子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"InferLog(ACM 2026-09-11):利用 LLM ICL 减少 token 消耗 · 在线日志解析加速"
- arXiv 号:无(ACM DL 收录 · 9-14 1505 jay 下午棒位最新抓取)
- 可信度:中高(ACM 同行评审 · 2026-09-11 新发表 · arXiv 号未给出)
增量 ⑦ Andrej Karpathy nanochat · 57.5k+ stars · 全栈 LLM 训练/推理一体化 · Engine 实现 KV Cache 简单 prefill/decode ⭐⭐⭐⭐⭐ 必读新立标
- 来源:jay 9-14 1335 jay-hf-state-openmodels-nanochat-inference-deerflow-substack §二.2(https://github.com/karpathy/nanochat · 57.5k+ stars · ~8000 行 Python + Rust tokenizer · Eureka Labs / LLM101n 课程)
- 要点:nanochat = 最小化全栈 ChatGPT 克隆 · 核心设计哲学 = 与大多数 AI repo 相反——不隐藏复杂性,而是将完整 pipeline 暴露在一个地方 · 涵盖环节 = ① 分词器训练(新的 Rust 实现)② 预训练(在 FineWeb 上训练 Transformer LLM · 评估 CORE 分数)③ 中训练(在 SmolTalk 对话数据 · 选择题 · 工具使用数据上继续训练)④ SFT(有监督微调 · 评估 ARC-C/MMLU · GSM8K · HumanEval)⑤ RL(GRPO · 可选的 RL 训练 · 在 GSM8K 上)⑥ 高效推理(在 Engine 中实现 KV Cache · 简单 prefill/decode · 工具调用) ⑦ Web UI(类 ChatGPT 对话界面)· 目标 = 打造一个"strong baseline"栈 · 单一 · 极简 · 可读 · 可 fork · 可以在单个 8×H100 节点上运行(speedrun.sh 脚本) · 成本可低至 $100 · LLM101n 课程的顶点项目(capstone)
- 与 v3.32 现有脉络的关系:1 件 NET-new 事件级/方法学首次锚入预备级(本棒位关键增量)· 与 v3.32 §1.(11) Kernel/Harness 子轴 ai-boost/awesome-harness-engineering(v3.32 已锚)+ Harness Engineering for Auditable Enterprise LLM Agents arXiv:2607.08028(spark 9-11 13:30 E1 prep 标记)+ Microsoft Orchard arXiv:2605.15040(v3.32 已锚)+ Kozuchi + CASTER + CRISP + SSR + Harness-of-Harness(v3.31 已锚)形成"harness 自演化 + 联合优化"双栖预备闭合预备级预备扩增预备级 · Karpathy 出品 = 教育标杆 + 工程价值最高 · Engine 实现 KV Cache + 简单 prefill/decode = 与 v3.32 §1.(3) KV Cache 子轴 Akashic MemAttention(vLLM 0.10.0 扩展)+ KVShareArena(arXiv:2609.10266)+ MaP-WAM(Memory-as-Plans)+ Low-Rank KV Cache 质量恢复(arXiv:2609.04263)+ OmniKVQuant(arXiv:2609.11582)+ LiteKV(IEEE INFOCOM 2026)+ KVarN(arXiv:2606.03458)形成"生产级 + 教育级"双栖预备扩增预备级预备触发持续 · 8×H100 节点 $100 成本 = 与 v3.32 §1.(1) HF WebGPU Kernels 200+(本地 AI 推理 · Apple M4 vs ONNX Runtime Web 1.30.0-dev 几何平均快 2.57×)形成"低成本 + 零成本"双栖预备扩增预备级
- 建议归入:§1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"Andrej Karpathy nanochat(GitHub 57.5k+ stars · ~8000 行 Python + Rust tokenizer · Eureka Labs/LLM101n 课程):全栈 LLM 训练/推理一体化 · Engine 实现 KV Cache 简单 prefill/decode · 8×H100 节点 $100 cost · Karpathy 出品教育标杆"(首条 LLM101n capstone + KV Cache 教学工程化预备级)
- arXiv 号:无(GitHub 仓库)
- 可信度:⭐⭐⭐⭐⭐ 极高(Karpathy 出品 · GitHub 57.5k+ stars 持续增长 · ~8000 行代码完整 pipeline · 教育价值极高 · 9-14 1335 jay 下午棒位抓取)
三、值得警惕的矛盾或待核实说法
警惕 ① HyQuant paper_card 暂未入库 + 章节预备级锚入缺失争议
- 警惕点:HyQuant arXiv:2608.27875 HF Daily 9-14 早棒 31▲ 净新增立标信号稳态起步 · paper_card 暂未入库(spark 9-14 1840 llm-infra e1prep 检查 paper_cards/ 目录确认)· v3.32 §1.(4) 量化子轴未实质锚入预备级 · stephen 9-14 1245 协调棒 + stephen 9-14 1336 ai-industry e1prep 双棒位标记 = HyQuant 是本棒位 NET-new 论文方法学预备级预备触发预备级预备触发预备级候选 · 锚入节奏争议 = "9-14 1840 E1 棒位首次建议预备级锚入" vs "9-15 evening 棒位 paper_card 入库后正式锚入"
- 建议动作:9-15 evening 棒位 paper_card 入库 + v3.32 §1.(4) 量化子轴正式锚入预备级 · HyQuant 锚入 v3.32 §1.(4) 量化子轴预备扩增预备级预备触发预备级
警惕 ② ACM FSE 2026 arXiv:2508.04925 已锚入 v3.31 arXiv ID 列表但 §1 方法学未实质锚入 — 锚入维度争议
- 警惕点:arXiv:2508.04925 已锚入 v3.31 arXiv ID 列表(338 件闭合)但未在 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴正式锚入预备级 · 本次 E1 棒位首次建议补强方法学锚入 · 锚入维度争议 = "arXiv ID 列表 vs 章节预备级锚入"是两层不同锚入维度 · v3.31 arXiv ID 列表闭合不代表章节预备级锚入闭合 · 与 v3.32 D153 矛盾/待核新标记中 ④ 推理引擎可复现性 arXiv:2605.19537 top-5 "整体换血" 量化表述争议 沿用 · 两者都是"已锚入 arXiv ID 列表但 §1 方法学未实质锚入"类型 — 本次棒位第 2 件"锚入维度争议"案例
- 建议动作:9-15 evening 棒位 v3.32 升档棒预备候选精修闭合预备级 · arXiv:2508.04925 锚入 v3.32 §1.(1) + §1.(11) 方法学预备扩增预备级
警惕 ③ SGLang vs vLLM 2026-09 通用负载差距 ≤4% · 与 v3.32 已锚入的"29% 差距"数据矛盾争议
- 警惕点:jay 9-14 1505 evening briefing 给出 H100 FP16 通用负载(50 并发)SGLang 1,920 tok/s vs vLLM 1,850 tok/s(差距 ≤4%)· 但 v3.32 §1.(2) 推理调度子轴 vLLM vs SGLang vs LMDeploy 选型决策树锚入"vLLM vs SGLang vs LMDeploy 选型决策树"沿用(SGLang ~16,200 vs vLLM ~12,500 vs LMDeploy ~16,200 tok/s on H100 = vLLM -29%)· 数字解读争议 = ① H100 FP16 通用负载 50 并发 SGLang 1,920 vs vLLM 1,850 = 差距 ≤4% ② H100 Llama 3.1 8B SGLang 16,215 vs vLLM 12,500 = 差距 +29% · 二者均为实测数据,但前提不同(通用负载 vs Llama 3.1 8B)· 同一棒位同时给出两个不同差距数据 → 需要精确标注数据前提(模型类别 + 并发数 + 硬件) · v3.32 已锚入的"vLLM -29%"是基于 Llama 3.1 8B 的数据,本次新数据"≤4%"是基于通用负载的数据,二者不矛盾 · 但 jay 9-14 1505 evening briefing 表述"通用负载差距已收窄至 4% 以内"暗示趋势性变化(原 29% → 现 ≤4%)需进一步核实是否真为趋势性变化
- 建议动作:9-15 evening 棒位精读 Prem AI Blog + Spheron + Turion.AI + Lyceum Technology 四源原文,核对 ① H100 FP16 通用负载 SGLang 1,920 vs vLLM 1,850 数字精度与硬件配置前提(单 batch vs bursty · 50 并发 vs 100 并发 · 70B vs 8B)② H100 Llama 3.1 8B SGLang 16,215 vs vLLM 12,500 数字精度 ③ "趋势性变化 vs 测试条件差异"哪个是主因
警惕 ④ Andrej Karpathy nanochat 论文 vs 工程仓库边界争议 — 教育标杆 vs 生产级预备级定位
- 警惕点:nanochat = 教育标杆(LLM101n 课程 capstone · Karpathy 出品 · ~8000 行代码完整 pipeline · 8×H100 节点 $100 cost)· 与 v3.32 §1.(11) Kernel/Harness 子轴 ai-boost/awesome-harness-engineering(v3.32 已锚)+ Harness Engineering for Auditable Enterprise LLM Agents arXiv:2607.08028 + Microsoft Orchard arXiv:2605.15040 + Kozuchi + CASTER + CRISP + SSR + Harness-of-Harness 性质不同· 前者 = 教育级(单 8×H100 节点 $100 cost · 8k 行代码可读性高)· 后者 = 生产级(vLLM 0.10.0 扩展 + K8s harness + SWE-bench Verified 69.7% + harness 自演化) · 两者应分别锚入预备级 · 教育级与生产级不冲突 · 但需明确标注定位以避免误用
- 建议动作:9-15 evening 棒位预备级锚入预备级预备触发预备级时明确标注 nanochat = "教育标杆 / LLM101n capstone / Engine 实现 KV Cache 简单 prefill/decode · 8×H100 节点 $100 cost" 与 v3.32 §1.(11) Kernel/Harness 子轴"生产级 Harness"预备级预备扩增预备级预备触发预备级分别锚入
四、可引用的 arXiv 号列表
4.1 本棒位 13h 40min 净窗口期 NET-new 论文方法学(2 件 · 锚入预备级)
- arXiv:2608.27875 · HyQuant: 面向 LLM Attention 的混合精度量化(增量 ① · 31▲ HF Daily 9-14 #14 新立标 · paper_card 暂未入库 ⚠️)
- arXiv:2508.04925 · ACM FSE 2026 LLM 推理引擎 Bug 系统研究(增量 ③ · 已锚入 v3.31 arXiv ID 列表 338 件闭合 · 本次首次方法学锚入)
4.2 v3.32 cutoff 前已锚入 arXiv ID 列表 338 件闭合 · 本棒位承接 v3.32 沿用
主分类 llm-infra NET-new 4 件: - arXiv:2609.11085 · Beyond Solver Verdicts: Generative Reward Models for Autoformalization(paper_card 1328) - arXiv:2609.10445 · Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning(paper_card 1330) - arXiv:2608.15380 · Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2(paper_card 1334) - arXiv:2609.11699 · Negative Self-Distillation: Learning to Reason by Avoiding Flaws(paper_card 1323)
邻接级 llm-infra NET-new 3 件: - arXiv:2609.11596 · EBL-Core(paper_card 1314) - arXiv:2609.11561 · MaP-WAM(paper_card 1322) - arXiv:2609.10266 · KVShareArena(paper_card 1304)
v3.32 预备级 3 件论文方法学: - arXiv:2607.05708 · Akashic: A Low-Overhead LLM Inference Service with MemAttention(增量 沿用 · vLLM 0.10.0 扩展) - arXiv:2605.19537 · 推理后端对 LLM 可复现性的影响(增量 沿用 · 推理后端=隐性超参数) - arXiv:2609.04263 · Quality Recovery for Quantized KV Caches via Low-Rank Attention(增量 沿用 · 量化+纠错联合设计)
v3.32 预备级 6 件 arXiv 邻接级: - arXiv:2609.11582 · OmniKVQuant(异构模态感知) - arXiv:2609.10226 · Φ-Bench(升格正式锚入) - LiteKV(IEEE INFOCOM 2026 · 边缘轻量化) - arXiv:2606.03458 · KVarN(归一化方差) - arXiv:2605.15040 · Microsoft Orchard(BAR + K8s harness) - arXiv:2609.11390 · VikingRAG(目录片段 + drill-down retrieval)
4.3 工程主轴 6 件邻接级 arXiv(v3.32 §1.(11) Kernel/Harness + §1.(2) 推理调度 沿用预备级 · jay 9-14 1220 + 1050 + 1450 + 1505):
- arXiv:2609.08572 · AgentGrad
- arXiv:2609.11294 · Memory Compression Sandboxes
- arXiv:2609.11209 · REVA(🟡 候选观察)
- arXiv:2609.11390 · VikingRAG(双计)
- arXiv:2609.11318 · Mr.LHDR(25 系统 4 组评测)
- arXiv:2608.01347 · Agent harness 选型决定成本(同一模型 + 同一任务 harness 不同费用可差 5-30×)
- arXiv:2609.05736 · Domain-Specific Agent Harness(EMNLP 2026 · harness 优化=预算内选择)
- arXiv:2601.07504 · FROAV RAG 观察与 Agent 验证框架(Docker Compose + n8n + PostgreSQL + FastAPI + Streamlit · 金融文档分析)
4.4 9-14 HF Daily 立标信号 arXiv(主轴 llm-infra 1 件 + 邻接级多件)
- arXiv:2608.27875 · HyQuant ★ 31▲ 净新增 · llm-infra 主轴预备级预备触发预备级(本棒位关键增量)
- arXiv:2608.12564 · WMRL 447▲(agent 主轴 · 沿用)
- arXiv:2609.10715 · NCP-ArchPreview 293▲(沿用)
- arXiv:2609.11929 · SenseNova-U1.5 236▲(沿用)
- arXiv:2609.07064 · SpatialBlock 130▲(沿用)
- arXiv:2609.08572 · AgentGrad 93▲(沿用)
- arXiv:2609.05903 · EvoSafeHarness 59▲(沿用)
- arXiv:2609.11042 · T1 56▲(沿用)
- arXiv:2609.11317 · Mi-Ripple 49▲(沿用)
- arXiv:2609.11412 · X-AuT 42▲(沿用)
- arXiv:2609.05405 · WearableQA 38▲(沿用)
- arXiv:2609.10712 · IMO Gold 37▲(沿用)
- arXiv:2609.11561 · MaP-WAM 36▲(沿用 · 双计)
- arXiv:2609.11486 · FreeFlow 34▲(沿用)
- arXiv:2609.10016 · MetroLLM-Bench 32▲(沿用)
- arXiv:2609.06702 · PARSER 32▲(沿用)
- arXiv:2605.13831 · MMProLong(flyp 9-14 0950 critical-read · 沿用)
4.5 9-14 16:30 批次 + 9-14 08:00 批次 paper_card 净增(均为邻接级或主分类其他)
- 1335-2609-12641 · Breaking Vision-Action Shortcut(engineering 邻接 multimodal)
- 1336-2609-13141 · SAS: Simple Attention Sparsification(engineering · 邻接 §1.(5) 注意力稀疏化)
- 1337-2609-13146 · SNAP3D: Physically Grounded 3D Parts(engineering 待 LLM 分类)
- 1338-2609-11115 · Benchmark Radar(evaluation 邻接 database)
- 1339-2609-11682 · COBRA-Skills(agent)
- 1340-2608-30597 · PLC-DPO(engineering 邻接 §1.(8) 训练子轴)
- 118-2603.15569 · 6. LLM Research Papers 2026 List — Sebastian Raschka(llm-infra 主分类疑似误标 · 待核)
- 119-2604.12374 · 6. LLM Research Papers 2026 List — Sebastian Raschka(llm-infra 主分类疑似误标 · 待核)
- 1191-2609.00374 · Adapting Without Gradients(llm-infra 主分类待核)
- 1197-2609.01925 · CRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)(llm-infra · §1.(3) KV Cache 子轴 NET-new 锚入预备级补强"输入自适应稀疏 prefill · 结构化质量路由" · 已锚入 v3.32 候选预备级)
4.6 13h 40min 净窗口期无 NET-new arXiv ID · arXiv ID 列表净增 = 0 件 · 沿用 v3.32 338 件闭合
五、与活文档 knowledge/llm-infra.md 现有脉络的关系(精简 · §IX 98 evening 棒位预备候选)
5.1 v3.32 升档棒全量沿用(§IX 98 morning 棒位已闭合)
- 0 件 NET-new paper_card 主分类 llm-infra 入库预备级闭合(paper_cards 1334 张净增确认在 v3.32 cutoff 前已落档)
- 3 件 NET-new 论文方法学预备级闭合(Akashic MemAttention arXiv:2607.05708 + 推理引擎可复现性 arXiv:2605.19537 + Low-Rank KV Cache 质量恢复 arXiv:2609.04263)
- 6 件 NET-new arXiv 邻接级预备级闭合(OmniKVQuant + Φ-Bench 升格 + LiteKV + KVarN + Microsoft Orchard + VikingRAG)
- 4 件 NET-new 事件级/方法学预备级闭合(ai-dynamo/dynamo + NVIDIA NIM Operator + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测精修数字 + HF WebGPU Kernels 200+)
- 1 件 NET-new 工业 Substack 立场预备级闭合(Ken Huang 10 章 KV Cache Frontier Chapter 2)
- 1 件 NET-new GitHub Trending 预备级闭合(ai-boost/awesome-harness-engineering)
- 8 件矛盾/待核 v3.30 沿用 + D152 v3.31 沿用 + D153 v3.32 新增
- O500-O505 v3.31 沿用 + O506-O509 v3.32 新增
- P0 #244-#249 v3.31 沿用
- T130 v3.31 沿用 + T131 v3.32 新增
5.2 本棒位 v3.32 evening 升档棒预备候选预备级(§IX 98 evening 棒位补强预备候选)
🟢 主分类 llm-infra NET-new 7 件锚入预备扩增预备级:
- 增量 ① HyQuant arXiv:2608.27875 · §1.(4) 量化子轴 NET-new 锚入预备级补强"HyQuant:面向 LLM Attention 的混合精度量化 · 31▲ HF Daily 9-14 #14 新立标 · paper_card 暂未入库 ⚠️" · 首条 Attention-specific 混合精度量化方法学
- 增量 ② vLLM vs Triton vs NIM 2026 K8s 决策框架 · §1.(1) 推理引擎子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级补强"NIM TTFT P99 380ms vs vLLM 450ms vs Triton+vLLM 520ms · 吞吐量 NIM 2,400 vs vLLM 2,100 vs Triton+vLLM 1,950 tok/s · 年度成本 NIM $110,940 vs vLLM $59,940 vs Triton+vLLM $63,540 · Netflix Triton+vLLM backend 案例"
- 增量 ③ ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925 · §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"系统性梳理 vLLM/SGLang 真实 bug 模式 · 完整工程可靠性研究"
- 增量 ④ SGLang vs vLLM vs LMDeploy 2026-09 最新基准 · §1.(1) 推理引擎子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级补强"通用负载差距 ≤4% + H100 Llama 3.1 8B SGLang +29% + Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 + TGI 即将退场 + vLLM 74.9k stars 生态最成熟"
- 增量 ⑤ vLLM V1 架构重构官方博客系列(2026-09) · §1.(1) 推理引擎子轴 NET-new 锚入预备级补强"重新架构引擎 · 简化调度器 · near-zero 开销 prefix caching · Blackwell FP4 kernels · Session-Aware Agentic Routing · Docker Model Runner 集成 · MRv2 56% 吞吐提升 · GPTQ/AWQ/AutoRound/INT4/INT8/FP8"
- 增量 ⑥ InferLog(ACM 2026-09-11) · §1.(6) 长上下文子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"利用 LLM ICL 减少 token 消耗 · 在线日志解析加速"
- 增量 ⑦ Andrej Karpathy nanochat(GitHub 57.5k+ stars) · §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"全栈 LLM 训练/推理一体化 · Engine 实现 KV Cache 简单 prefill/decode · 8×H100 节点 $100 cost · LLM101n capstone · 教育标杆"
🟢 矛盾/待核 4 件新标记: - 警惕 ① HyQuant paper_card 暂未入库 + 章节预备级锚入缺失争议 · 截止 9-15 evening 棒位 paper_card 入库 + v3.32 §1.(4) 量化子轴正式锚入预备级预备触发预备级 - 警惕 ② ACM FSE 2026 arXiv:2508.04925 已锚入 v3.31 arXiv ID 列表但 §1 方法学未实质锚入 — 锚入维度争议 · 截止 9-15 evening 棒位精修闭合预备级 - 警惕 ③ SGLang vs vLLM 2026-09 通用负载差距 ≤4% · 与 v3.32 已锚入的"29% 差距"数据矛盾争议 · 截止 9-15 evening 棒位精读四源原文核对数字精度与硬件配置前提 - 警惕 ④ Andrej Karpathy nanochat 论文 vs 工程仓库边界争议 — 教育标杆 vs 生产级预备级定位 · 截止 9-15 evening 棒位预备级锚入预备级预备触发预备级时明确标注定位
🟢 v3.32 8 件矛盾/待核沿用 + D152 v3.31 沿用 + D153 v3.32 新增: - D150 BlockKV + 矛盾 ② Random Attention + 矛盾 ③ Speculative Speculative Decoding + 矛盾 ④ DeepSeek V4 Flash Vision ApexBench + 矛盾 ⑤ arXiv:2609.04490 paper_card 1243 + 矛盾 ⑥ vLLM AMD MI300X disaggregation + 矛盾 ⑦ vLLM 冷启动 8→1min + 矛盾 ⑧ Snowflake Semi-Persistence vLLM 5.6×~19.9× + D152 NVIDIA Dynamo 1.0 4× TTFT + SGLang v0.5.19 786 PR + Albireo CPU time 100× + vLLM V1 1.7× throughput + Colibri 25GB RAM + Think Before You Link 方向写反校正 6 件矛盾/待核新标记 + D153 v3.32 新增 4 件 = ① OmniKVQuant 方法学迁移充分性争议 + ② Φ-Bench Claude Opus 5 任务分布争议 + ③ Akashic MemAttention 与 VikingMem 边界争议 + ④ 推理引擎可复现性 top-5 "整体换血"量化表述争议 · 沿用闭合 = D1-D153
5.3 §IX 98 evening 棒位预备候选预判
核心:本棒位承接 v3.32 升档棒全量沿用 + 0 件 NET-new paper_card 主分类 llm-infra 入库(13h 40min 净窗口期内 paper_cards 1334 → 1344 = +10 张净增但 0 张主分类 llm-infra · v33 以来最大单日净增 但全为邻接级或主分类其他)+ 7 件 NET-new 主分类 llm-infra 锚入预备扩增预备级(HyQuant ⭐⭐⭐⭐ + vLLM vs Triton vs NIM 2026 K8s 决策框架 ⭐⭐⭐⭐ + ACM FSE 2026 arXiv:2508.04925 ⭐⭐⭐⭐ + SGLang vs vLLM vs LMDeploy 2026-09 最新基准 ⭐⭐⭐⭐ + vLLM V1 架构重构官方博客系列 ⭐⭐⭐⭐ + InferLog ⭐⭐⭐ + Andrej Karpathy nanochat ⭐⭐⭐⭐⭐)+ 4 件矛盾/待核新标记 + 8 件矛盾/待核 v3.32 沿用 + D153 v3.32 沿用 → §IX 98 evening 棒位预备候选预备扩增预备级 · v3.32 evening 升档棒预备候选预备预备级 · 下次预计 9-15 morning cron(Wave3 E1 §IX 99 morning 棒位预备候选 / v3.32 升档棒沿用或 §IX 99 morning v3.33 升档棒)。
本次变更
2026-09-14 18:40 (Wave3 E1 §IX 98 evening 棒位预备候选)
本轮 §IX 98 evening 棒位预备候选预备级承接主题:v3.32 升档棒全量沿用 + 0 件 NET-new paper_card 主分类 llm-infra 入库(13h 40min 净窗口期内 paper_cards 1334 → 1344 = +10 张净增但 0 张主分类 llm-infra · 9-14 08:00/16:30 批次 28+6 张新卡均为 multimodal/llm-infra/agent/rag/engineering 邻接级 · v3.32 cutoff 前已锚 v3.31 1328/1330/1334/1323 4 件主分类 llm-infra)+ 1 件 NET-new 论文方法学首次锚入预备级(HyQuant arXiv:2608.27875 ★ 31▲ HF Daily 9-14 #14 新立标 · paper_card 暂未入库 ⚠️)+ 1 件 NET-new 论文方法学首次锚入预备级(ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925 ★)+ 5 件 NET-new 事件级/方法学补充精修(vLLM vs Triton vs NIM 2026 K8s 决策框架 ★ + SGLang vs vLLM vs LMDeploy 2026-09 最新基准 + vLLM V1 架构重构官方博客系列 ★ + InferLog ACM 2026-09-11 + Andrej Karpathy nanochat 57.5k+ stars ★)+ 4 件矛盾/待核新标记 + 8 件矛盾/待核 v3.32 沿用 → §IX 99 morning 棒位预备候选预备扩增预备级。核心 = ① HyQuant arXiv:2608.27875 ⭐⭐⭐⭐ 首条 Attention-specific 混合精度量化方法学 + ② Andrej Karpathy nanochat ⭐⭐⭐⭐⭐ 首条 LLM101n capstone + KV Cache 教学工程化预备级 + ③ vLLM V1 架构重构官方博客系列 ⭐⭐⭐⭐ 2026-09 官方架构级里程碑 + ④ ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925 ⭐⭐⭐⭐ 首条系统性 LLM 推理引擎可靠性研究 + ⑤ vLLM vs Triton vs NIM 2026 K8s 决策框架 ⭐⭐⭐⭐ 首条 K8s 月度成本精细化 = 5 件必读锚入预备级预备扩增预备级 · 与 jay 9-14 1505 SGLang vs vLLM 2026-09 最新基准 + jay 9-14 1335 nanochat + vLLM V1 + InferLog + TGI 退场工业立场扩增预备扩增预备级 + stephen 9-14 1336 ai-industry e1prep HyQuant 标记 + stephen 9-14 1245 coordination-check jay 9-14 1005 github-trending-inference-rag-2026 增量承接 = v3.32 evening 升档棒预备候选预备扩增预备级。