知识库简报 · 五大分类整理 · 2026-08-31 下午场(第三次)

实例: Jay 时间: 2026-08-31 15:05 (Asia/Shanghai) 本次简报范围: 2026-08-31 全天已收集草稿(早场 + 午场 + 下午场 + RSS + Tech Radar)


【DATABASE】

⭐⭐⭐ 极高优先级

① KV Cache 优化全景综述(arXiv:2603.20397,Dell Technologies) - 链接:https://arxiv.org/html/2603.20397v1 - 来源:arXiv(cs.LG),Dell Technologies 工业研究 - 发布时间:2026-03 - 核心:5 大优化方向(Cache Eviction / Compression / Hybrid Memory / Novel Attention / Combination);覆盖 2024-2026 年主流技术路线;v0.28.0 tiered offloading 与本文 hybrid memory 方向高度一致 - 关键数据:Llama-2-7B FP16 KV Cache 每 token ≈ 0.5 MiB(A100 80GB) - 标签:KV-Cache 推理优化 混合存储 arXiv - 建议:精读存档;作为「推理引擎 · KV Cache 专题」核心参考文献

② arXiv: Efficient KV Cache Layer for Enterprise LLM Inference(arXiv 2510.09665) - 链接:https://arxiv.org/html/2510.09665v1 - 核心:vLLM page size 16 tokens/layer(20–63 KB);larger page batching 优化传输效率;2026 开源分布式推理栈对比(vLLM Production Stack / NVIDIA Dynamo / AIBrix / llm-d / SGLang / KServe) - 标签:KV-Cache 企业推理 vLLM 分布式 - 建议:精读;加入「推理系统架构」主题页


⭐⭐ 较高优先级

③ Particula: SGLang vs vLLM 架构深度对比 + DeepSeek V3 专项 - 链接:https://particula.tech/blog/sglang-vs-vllm-inference-engineery-comparison - 核心:DeepSeek V3 在 SGLang 达 3.1x faster vs vLLM;RadixAttention 自动复用共享前缀;vLLM PagedAttention 4% 内存浪费管理;Blackwell/GB200 MoE 26,200 prefill tok/s - 标签:推理引擎 SGLang vLLM DeepSeek-V3 - 建议:深度选型参考


【BACKEND】

⭐⭐⭐ 极高优先级

① vLLM v0.28.0 正式发布(2026-08-26) - 链接:https://github.com/vllm-project/vllm/releases/tag/v0.28.0 - 来源:GitHub Release(~47K stars) - 四大方向: 1. Kimi-K3 全栈优化:Decode Context Parallel + Fused Kernels + GEMM-RS;DSpark TTFT 提升约 60% 2. DeepSeek V4 端到端支持:Sparse MLA 完整支持;AMD Quark NVFP4 3. Model Runner V2 E/P/D disaggregation:Embedding/Prefill/Decode 分离;weight offloading;thinking_token_budget 支持 4. 分级 KV Cache 卸载:Disk offloading;out-of-tree secondary tier managers(可插拔存储后端) 5. Rust 前端 + gRPC:standalone renderer;multimodal image inference over gRPC - 标签:推理引擎 vLLM Kimi-K3 DeepSeek-V4 投机解码 KV-Cache-Offloading Rust gRPC - 建议:精读; 2026Q3 推理引擎选型核心参考

② UniBoost:LLM 推理尾延迟感知调度框架(arXiv:2606.18431) - 链接:https://arxiv.org/html/2606.18431v1 - 来源:arXiv(cs.LG) - 核心:软连续优先级塑形 + KV-Cost 感知抢占式驱逐联合设计;仅用轻量可观测信号驱动,无需精确预测;尾延迟(TTLT)显著优于 FCFS 和 vanilla boosting - 标签:推理调度 LLM-Serving 尾延迟 KV-Cache UniBoost - 建议:精读;与 v0.28.0 Model Runner V2 E/P/D 分离对照;调度器开发者必读

③ 推理引擎 Benchmark 深度解析(H100 吞吐 / 延迟百分位 / 并发压力) - 来源:llm-academy.dev、aimultiple.com、inferenceengineering.tech - 核心数据(H100 SXM 80GB,Llama-3.1 70B,TP=4,FP8): - TensorRT-LLM: ~3,400 tok/s(需引擎编译) - SGLang: ~2,900 tok/s(RadixAttention 高并发优势) - vLLM: ~2,800 tok/s(Python 调度器额外开销 200-500 μs/步) - vLLM GPU memory utilization:7B→0.95,13B→0.85,70B→0.90 - DeepSeek V3 3.1x faster on SGLang vs vLLM;EAGLE 投机解码 batch=1 时 1.8x - 标签:推理引擎 vLLM SGLang TensorRT-LLM Benchmark H100 - 建议:精读存档;推理引擎选型必备数据


⭐⭐ 较高优先级

④ arXiv: A First Look at Bugs in LLM Inference Engines(arXiv 2506.09713) - 链接:https://arxiv.org/html/2506.09713v1 - 核心:首个系统性推理引擎 bug 分类(vLLM / DeepSpeed / TRT-LLM);模型转换 Bug / 效率优化 Bug / 资源管理 Bug / 精度 Bug - 标签:推理引擎Bug 系统分析 vLLM DeepSpeed - 建议:精读;加入「推理引擎排障」主题页

⑤ arXiv: Attention to Detail — vLLM 配置能源/性能/精度权衡(arXiv 2607.09172) - 链接:https://arxiv.org/html/2607.09172v2 - 核心:v0.10.2;5 模型族 × 5 数据集;量化(INT8/FP8)对精度影响因模型和任务而异;配置项之间存在相互作用 - 标签:vLLM 配置优化 量化 能源效率 - 建议:生产调优参考

⑥ arXiv: RTP-LLM — Alibaba 高性能推理引擎(arXiv 2605.29639) - 链接:https://arxiv.org/html/2605.29639v1 - 核心:W4A8KV4 量化(weight INT4/activation INT8/KV cache INT8)memory footprint 减半;多模态支持 - 标签:推理引擎 Alibaba 量化 RTP-LLM - 建议:量化实践参考

⑦ Sliding-window Beats Linear Attention(arXiv 2608.28444) - 链接:https://arxiv.org/abs/2608.28444 - 核心:Sliding-window 在 LLM 效率上优于 Linear Attention 改造;边际成本恒定;显存不随序列长度增长 - 标签:LLM-Architecture Attention-Mechanism Sliding-Window - 建议:与 SGLang PR #34602(统一 MHA/SWA KV 视图)对照

⑧ browser-use 突破 111K Stars - 链接:https://github.com/browser-use/browser-use - 核心:Python;AI Agent 操控浏览器;Playwright/Selenium 后端;LangChain 集成 - 标签:AI-Agent Browser-Automation LangChain - 建议:关注;Agent 工具链互补


【CLOUD-NATIVE】

⭐⭐⭐ 极高优先级

① State of Model Serving Communities — April 2026(InferenceOps Substack) - 链接:https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93 - 核心:vLLM v0.17→v0.19 演进路线图;KServe v0.17.0(LLMInferenceService autoscaling / OpenAI Responses API / llm-d 拆分);EPP→llm-d 拆分降低碎片化;SIG-kv-disaggregation 协议标准化进展 - 标签:KServe llm-d MLOps Kubernetes KV-分离 - 建议:精读存档;KServe/llm-d 生产部署参考


⭐⭐ 较高优先级

② AI Agents Stack 2026(Substack · The AI Engineer · Paolo Perrone) - 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 核心 6 大趋势: 1. Guardrails ≠ LLM Filters: 2026 年 = 工具调用授权 + 费率限制 + 行为验证;"Guardrails before action" 模式 2. OWASP MCP Top 10(beta)发布: 首个工具连接型 Agent 安全检查清单 3. 评估基础设施三层收敛: PR 级快速检查 / 夜间回归套件 / 生产持续监控 4. Context Engineering 替代 Prompt Engineering: 架构化信息供给;Memory Blocks 状态管理 5. 新 Benchmark: Context-Bench / Recovery-Bench / Terminal-Bench 6. 部署现状: FastAPI + 自建 infra 仍是主流 - 标签:AI-Agent Guardrails Context-Engineering OWASP MCP Substack - 建议:泛读存档;OWASP MCP Top 10 值得专项追踪


【CSDN】

⭐⭐⭐ 极高优先级

① vLLM 源码解析系列(m0_74825634 + weixin_42479327) - 链接①:https://blog.csdn.net/m0_74825634/article/details/145213319(整体架构 + Prefill/Decode) - 链接②:https://blog.csdn.net/weixin_42479327/article/details/141496484(LLM forward 完整路径) - 核心:vLLM 调度层架构解析;Continuous Batching / PagedAttention;完整 forward 路径五篇结构 - 复现:高;含安装命令、CUDA 版本要求、源码路径 - 标签:推理部署 vLLM 源码解析 Continuous-Batching - 建议:精读;与 CUDA Kernel 层文章三篇联动,构建 vLLM 完整知识链

② vLLM 源码:DP=8 + EP=8 混合并行原理(xzpdxz) - 链接:https://blog.csdn.net/xzpdxz/article/details/153978392 - 核心:CSDN 唯一深度解析 EP(专家并行)+ DP(数据并行)混合并行的文章;MoE 模型特殊处理 - 标签:推理部署 vLLM 专家并行 MoE DP+EP混合并行 - 建议:精读;MoE 部署必备

③ torch.compile 源码解读(qq_38342510) - 链接:https://blog.csdn.net/qq_38342510/article/details/139973021 - 核心:TorchDynamo(安全拦截 Python → FX Graph)+ AOTAutograd(捕获 backward)+ TorchInductor(编译优化生成底层算子) - 标签:PyTorch torch.compile 图编译 TorchDynamo AOTAutograd - 建议:精读;PyTorch 编译栈必读

④ LangChain + bge-m3 + Chroma + Gradio 本地 RAG(j05070415) - 链接:https://blog.csdn.net/j05070415/article/details/157650467 - 核心:完整可运行 RAG 栈;附源码;Windows 端 Python 虚拟环境准备 - 复现:极高;附源码,组件版本明确 - 标签:RAG LangChain bge-m3 Chroma Gradio 本地部署 - 建议:精读存档;源码级参考价值


⭐⭐ 较高优先级

⑤ Ollama + DeepSeek R1 本地部署(m0_59235945 + u010522887) - 链接:https://blog.csdn.net/m0_59235945/article/details/145897537 - 核心:Ollama 安装 / DeepSeek R1 拉取运行 / 多卡 GPU 配置 / 性能优化建议 - 标签:本地部署 Ollama DeepSeek-R1 - 建议:存档;DeepSeek R1 本地部署首选参考

⑥ LangGraph 1.0 实战(weixin_42298164) - 链接:https://blog.csdn.net/weixin_42298164/article/details/160511021 - 核心:LangGraph 1.0 智能体工作流 + Gradio 界面集成;基于 GitHub 项目实战 - 标签:AI-Agent LangGraph Gradio 工作流 - 建议:精读;LangGraph 1.0 最新实战(2026-04)

⑦ PyTorch 内核架构深度解析(honglinonline) - 链接:https://blog.csdn.net/honglinonline/article/details/160210616 - 核心:C10/ATen/torch 三层架构;系统架构图;核心模块组成 - 标签:PyTorch 内核架构 C10 ATen - 建议:泛读存档;架构概览价值高


【REPRODUCTION】

⭐⭐⭐ 极高优先级

① FlashAttention-4:Blackwell GPU ~1600 TFLOPs(Tri Dao,X 推文) - 链接:https://x.com/tri_dao/status/2029569889858646344 - 核心:Blackwell tensor core 极快导致瓶颈转移到 exp2 和 shared memory;FA4 重设计 pipeline 使 softmax 不再制约速度;与 matmul 同速 - 标签:FlashAttention Blackwell GPU Kernel - 建议:关注;FA4 论文已出,建议追踪官方 arXiv

② CODA: LLM 训练 SoL 新方向(Tri Dao,X 推文) - 链接:https://x.com/tri_dao/status/2057640492020469845 - 核心:重新参数化让 memory-bound ops 隐藏在 matmul 阴影里;LLM 可写出接近 SoL 的 CODA kernel - 标签:Kernel CODA Memory-Bound LLM-Training - 建议:关注;CODA 方法论值得追踪

③ StateAct: Long-Horizon Computer-Use Agent 状态漂移修复 - 链接:https://huggingface.co/papers/2607.22... - 核心:40 步以后 agent 从截图中重建状态是 drift 根源;状态外部化让大多数失败模式变得可预期 - 标签:Agent Computer-Use 状态管理 Long-Horizon - 建议:关注;Long-Horizon Agent 工程问题的新思路

④ TrueFoundry TrueForge Agent Harness 踩坑复盘(X 推文) - 链接:https://x.com/omarsar0/status/2090138030296219973 - 核心:"大多数'模型很蠢'的时刻其实是 harness bug";上下文截断顺序 / 工具调用解析 / 重试策略;开放源码让 harness 黑盒变白盒 - 标签:Agent Harness Evaluation Bug - 建议:关注;harness bug 是 Agent 生产落地最常见坑

⑤ Weak-to-Strong GraphRAG: ICIR 2026 投稿(X 推文) - 链接:https://x.com/omarsar0/status/1999881513220100336 - 核心:GraphRAG 本质是黑盒组合搜索(穷举 NP 难);ReG 用 LLM 从候选链中选有效推理链训练 retriever;生产落地思路清晰 - 标签:GraphRAG Retriever RAG ICLR-2026 - 建议:关注;GraphRAG 生产化思路

⑥ LlamaParse Retrieval Harness 三合一推理环(X 推文) - 链接:https://x.com/jerryjliu0/status/2071729856900215261 - 核心:语义搜索 + 服务端 grep + 文件级导航三合一;覆盖 10 文档到 100 万文档的可扩展搜索 - 标签:RAG LlamaParse Harness 语义搜索 - 建议:关注


【SUBSTACK 专题线索】

作者/专栏 主题 核心洞察 优先级
The AI Engineer(Paolo Perrone) AI Agents Stack 2026 Guardrails 独立学科化、评估三层收敛
Alexey On Data(Alexey Grigorev) AI Engineer JD 分析 1000+ JD;95.6% 要求生产经验;Ragas+Phoenix+Langfuse 评估栈
teacherandtask.com Agentic RAG 生产失败模式 30 分钟 Demo → 3 个月生产失败弧线;Agentic RAG token 消耗 3-10×
InferenceOps State of Model Serving KServe v0.17 / llm-d / SIG-kv-disaggregation 进展
AI Engineering Insider 推理工程师面试知识体系 系统性梳理推理工程生产知识

【分类标签总览】

分类 条目数 代表高价值
database 3 KV Cache 综述、Dell 工业研究、Enterprise KV Layer
backend 8 v0.28.0、UniBoost、Benchmark、Inference Bugs、Sliding-Window、browser-use
cloud-native 2 KServe/llm-d、AI Agents Stack 2026
csdn 7 vLLM 源码系列、torch.compile、LangChain+RAG、Ollama 部署
reproduction 6 FA4、CODA、StateAct、TrueForge、GraphRAG、LlamaParse Harness

【建议写入路径】

本次简报路径: /shared/research-kb/inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md

后续精读建议(按优先级): 1. vLLM v0.28.0 Release Notes + UniBoost 调度框架(backend / 推理引擎选型) 2. arXiv 2506.09713 推理引擎 Bug 分类(backend / 排障专题) 3. KV Cache 优化全景综述(database / 推理优化专题) 4. vLLM 源码系列 + torch.compile(csdn / 源码解析专题) 5. KServe v0.17.0 + llm-d 拆分进展(cloud-native / K8s 推理专题)

本轮无 GitHub 写入操作。