知识库简报 · 五大分类整理 · 2026-08-31 下午场(第三次)
实例: Jay 时间: 2026-08-31 15:05 (Asia/Shanghai) 本次简报范围: 2026-08-31 全天已收集草稿(早场 + 午场 + 下午场 + RSS + Tech Radar)
【DATABASE】
⭐⭐⭐ 极高优先级
① KV Cache 优化全景综述(arXiv:2603.20397,Dell Technologies)
- 链接:https://arxiv.org/html/2603.20397v1
- 来源:arXiv(cs.LG),Dell Technologies 工业研究
- 发布时间:2026-03
- 核心:5 大优化方向(Cache Eviction / Compression / Hybrid Memory / Novel Attention / Combination);覆盖 2024-2026 年主流技术路线;v0.28.0 tiered offloading 与本文 hybrid memory 方向高度一致
- 关键数据:Llama-2-7B FP16 KV Cache 每 token ≈ 0.5 MiB(A100 80GB)
- 标签:KV-Cache 推理优化 混合存储 arXiv
- 建议:精读存档;作为「推理引擎 · KV Cache 专题」核心参考文献
② arXiv: Efficient KV Cache Layer for Enterprise LLM Inference(arXiv 2510.09665)
- 链接:https://arxiv.org/html/2510.09665v1
- 核心:vLLM page size 16 tokens/layer(20–63 KB);larger page batching 优化传输效率;2026 开源分布式推理栈对比(vLLM Production Stack / NVIDIA Dynamo / AIBrix / llm-d / SGLang / KServe)
- 标签:KV-Cache 企业推理 vLLM 分布式
- 建议:精读;加入「推理系统架构」主题页
⭐⭐ 较高优先级
③ Particula: SGLang vs vLLM 架构深度对比 + DeepSeek V3 专项
- 链接:https://particula.tech/blog/sglang-vs-vllm-inference-engineery-comparison
- 核心:DeepSeek V3 在 SGLang 达 3.1x faster vs vLLM;RadixAttention 自动复用共享前缀;vLLM PagedAttention 4% 内存浪费管理;Blackwell/GB200 MoE 26,200 prefill tok/s
- 标签:推理引擎 SGLang vLLM DeepSeek-V3
- 建议:深度选型参考
【BACKEND】
⭐⭐⭐ 极高优先级
① vLLM v0.28.0 正式发布(2026-08-26)
- 链接:https://github.com/vllm-project/vllm/releases/tag/v0.28.0
- 来源:GitHub Release(~47K stars)
- 四大方向:
1. Kimi-K3 全栈优化:Decode Context Parallel + Fused Kernels + GEMM-RS;DSpark TTFT 提升约 60%
2. DeepSeek V4 端到端支持:Sparse MLA 完整支持;AMD Quark NVFP4
3. Model Runner V2 E/P/D disaggregation:Embedding/Prefill/Decode 分离;weight offloading;thinking_token_budget 支持
4. 分级 KV Cache 卸载:Disk offloading;out-of-tree secondary tier managers(可插拔存储后端)
5. Rust 前端 + gRPC:standalone renderer;multimodal image inference over gRPC
- 标签:推理引擎 vLLM Kimi-K3 DeepSeek-V4 投机解码 KV-Cache-Offloading Rust gRPC
- 建议:精读; 2026Q3 推理引擎选型核心参考
② UniBoost:LLM 推理尾延迟感知调度框架(arXiv:2606.18431)
- 链接:https://arxiv.org/html/2606.18431v1
- 来源:arXiv(cs.LG)
- 核心:软连续优先级塑形 + KV-Cost 感知抢占式驱逐联合设计;仅用轻量可观测信号驱动,无需精确预测;尾延迟(TTLT)显著优于 FCFS 和 vanilla boosting
- 标签:推理调度 LLM-Serving 尾延迟 KV-Cache UniBoost
- 建议:精读;与 v0.28.0 Model Runner V2 E/P/D 分离对照;调度器开发者必读
③ 推理引擎 Benchmark 深度解析(H100 吞吐 / 延迟百分位 / 并发压力)
- 来源:llm-academy.dev、aimultiple.com、inferenceengineering.tech
- 核心数据(H100 SXM 80GB,Llama-3.1 70B,TP=4,FP8):
- TensorRT-LLM: ~3,400 tok/s(需引擎编译)
- SGLang: ~2,900 tok/s(RadixAttention 高并发优势)
- vLLM: ~2,800 tok/s(Python 调度器额外开销 200-500 μs/步)
- vLLM GPU memory utilization:7B→0.95,13B→0.85,70B→0.90
- DeepSeek V3 3.1x faster on SGLang vs vLLM;EAGLE 投机解码 batch=1 时 1.8x
- 标签:推理引擎 vLLM SGLang TensorRT-LLM Benchmark H100
- 建议:精读存档;推理引擎选型必备数据
⭐⭐ 较高优先级
④ arXiv: A First Look at Bugs in LLM Inference Engines(arXiv 2506.09713)
- 链接:https://arxiv.org/html/2506.09713v1
- 核心:首个系统性推理引擎 bug 分类(vLLM / DeepSpeed / TRT-LLM);模型转换 Bug / 效率优化 Bug / 资源管理 Bug / 精度 Bug
- 标签:推理引擎Bug 系统分析 vLLM DeepSpeed
- 建议:精读;加入「推理引擎排障」主题页
⑤ arXiv: Attention to Detail — vLLM 配置能源/性能/精度权衡(arXiv 2607.09172)
- 链接:https://arxiv.org/html/2607.09172v2
- 核心:v0.10.2;5 模型族 × 5 数据集;量化(INT8/FP8)对精度影响因模型和任务而异;配置项之间存在相互作用
- 标签:vLLM 配置优化 量化 能源效率
- 建议:生产调优参考
⑥ arXiv: RTP-LLM — Alibaba 高性能推理引擎(arXiv 2605.29639)
- 链接:https://arxiv.org/html/2605.29639v1
- 核心:W4A8KV4 量化(weight INT4/activation INT8/KV cache INT8)memory footprint 减半;多模态支持
- 标签:推理引擎 Alibaba 量化 RTP-LLM
- 建议:量化实践参考
⑦ Sliding-window Beats Linear Attention(arXiv 2608.28444)
- 链接:https://arxiv.org/abs/2608.28444
- 核心:Sliding-window 在 LLM 效率上优于 Linear Attention 改造;边际成本恒定;显存不随序列长度增长
- 标签:LLM-Architecture Attention-Mechanism Sliding-Window
- 建议:与 SGLang PR #34602(统一 MHA/SWA KV 视图)对照
⑧ browser-use 突破 111K Stars
- 链接:https://github.com/browser-use/browser-use
- 核心:Python;AI Agent 操控浏览器;Playwright/Selenium 后端;LangChain 集成
- 标签:AI-Agent Browser-Automation LangChain
- 建议:关注;Agent 工具链互补
【CLOUD-NATIVE】
⭐⭐⭐ 极高优先级
① State of Model Serving Communities — April 2026(InferenceOps Substack)
- 链接:https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
- 核心:vLLM v0.17→v0.19 演进路线图;KServe v0.17.0(LLMInferenceService autoscaling / OpenAI Responses API / llm-d 拆分);EPP→llm-d 拆分降低碎片化;SIG-kv-disaggregation 协议标准化进展
- 标签:KServe llm-d MLOps Kubernetes KV-分离
- 建议:精读存档;KServe/llm-d 生产部署参考
⭐⭐ 较高优先级
② AI Agents Stack 2026(Substack · The AI Engineer · Paolo Perrone)
- 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 核心 6 大趋势:
1. Guardrails ≠ LLM Filters: 2026 年 = 工具调用授权 + 费率限制 + 行为验证;"Guardrails before action" 模式
2. OWASP MCP Top 10(beta)发布: 首个工具连接型 Agent 安全检查清单
3. 评估基础设施三层收敛: PR 级快速检查 / 夜间回归套件 / 生产持续监控
4. Context Engineering 替代 Prompt Engineering: 架构化信息供给;Memory Blocks 状态管理
5. 新 Benchmark: Context-Bench / Recovery-Bench / Terminal-Bench
6. 部署现状: FastAPI + 自建 infra 仍是主流
- 标签:AI-Agent Guardrails Context-Engineering OWASP MCP Substack
- 建议:泛读存档;OWASP MCP Top 10 值得专项追踪
【CSDN】
⭐⭐⭐ 极高优先级
① vLLM 源码解析系列(m0_74825634 + weixin_42479327)
- 链接①:https://blog.csdn.net/m0_74825634/article/details/145213319(整体架构 + Prefill/Decode)
- 链接②:https://blog.csdn.net/weixin_42479327/article/details/141496484(LLM forward 完整路径)
- 核心:vLLM 调度层架构解析;Continuous Batching / PagedAttention;完整 forward 路径五篇结构
- 复现:高;含安装命令、CUDA 版本要求、源码路径
- 标签:推理部署 vLLM 源码解析 Continuous-Batching
- 建议:精读;与 CUDA Kernel 层文章三篇联动,构建 vLLM 完整知识链
② vLLM 源码:DP=8 + EP=8 混合并行原理(xzpdxz)
- 链接:https://blog.csdn.net/xzpdxz/article/details/153978392
- 核心:CSDN 唯一深度解析 EP(专家并行)+ DP(数据并行)混合并行的文章;MoE 模型特殊处理
- 标签:推理部署 vLLM 专家并行 MoE DP+EP混合并行
- 建议:精读;MoE 部署必备
③ torch.compile 源码解读(qq_38342510)
- 链接:https://blog.csdn.net/qq_38342510/article/details/139973021
- 核心:TorchDynamo(安全拦截 Python → FX Graph)+ AOTAutograd(捕获 backward)+ TorchInductor(编译优化生成底层算子)
- 标签:PyTorch torch.compile 图编译 TorchDynamo AOTAutograd
- 建议:精读;PyTorch 编译栈必读
④ LangChain + bge-m3 + Chroma + Gradio 本地 RAG(j05070415)
- 链接:https://blog.csdn.net/j05070415/article/details/157650467
- 核心:完整可运行 RAG 栈;附源码;Windows 端 Python 虚拟环境准备
- 复现:极高;附源码,组件版本明确
- 标签:RAG LangChain bge-m3 Chroma Gradio 本地部署
- 建议:精读存档;源码级参考价值
⭐⭐ 较高优先级
⑤ Ollama + DeepSeek R1 本地部署(m0_59235945 + u010522887)
- 链接:https://blog.csdn.net/m0_59235945/article/details/145897537
- 核心:Ollama 安装 / DeepSeek R1 拉取运行 / 多卡 GPU 配置 / 性能优化建议
- 标签:本地部署 Ollama DeepSeek-R1
- 建议:存档;DeepSeek R1 本地部署首选参考
⑥ LangGraph 1.0 实战(weixin_42298164)
- 链接:https://blog.csdn.net/weixin_42298164/article/details/160511021
- 核心:LangGraph 1.0 智能体工作流 + Gradio 界面集成;基于 GitHub 项目实战
- 标签:AI-Agent LangGraph Gradio 工作流
- 建议:精读;LangGraph 1.0 最新实战(2026-04)
⑦ PyTorch 内核架构深度解析(honglinonline)
- 链接:https://blog.csdn.net/honglinonline/article/details/160210616
- 核心:C10/ATen/torch 三层架构;系统架构图;核心模块组成
- 标签:PyTorch 内核架构 C10 ATen
- 建议:泛读存档;架构概览价值高
【REPRODUCTION】
⭐⭐⭐ 极高优先级
① FlashAttention-4:Blackwell GPU ~1600 TFLOPs(Tri Dao,X 推文)
- 链接:https://x.com/tri_dao/status/2029569889858646344
- 核心:Blackwell tensor core 极快导致瓶颈转移到 exp2 和 shared memory;FA4 重设计 pipeline 使 softmax 不再制约速度;与 matmul 同速
- 标签:FlashAttention Blackwell GPU Kernel
- 建议:关注;FA4 论文已出,建议追踪官方 arXiv
② CODA: LLM 训练 SoL 新方向(Tri Dao,X 推文)
- 链接:https://x.com/tri_dao/status/2057640492020469845
- 核心:重新参数化让 memory-bound ops 隐藏在 matmul 阴影里;LLM 可写出接近 SoL 的 CODA kernel
- 标签:Kernel CODA Memory-Bound LLM-Training
- 建议:关注;CODA 方法论值得追踪
③ StateAct: Long-Horizon Computer-Use Agent 状态漂移修复
- 链接:https://huggingface.co/papers/2607.22...
- 核心:40 步以后 agent 从截图中重建状态是 drift 根源;状态外部化让大多数失败模式变得可预期
- 标签:Agent Computer-Use 状态管理 Long-Horizon
- 建议:关注;Long-Horizon Agent 工程问题的新思路
④ TrueFoundry TrueForge Agent Harness 踩坑复盘(X 推文)
- 链接:https://x.com/omarsar0/status/2090138030296219973
- 核心:"大多数'模型很蠢'的时刻其实是 harness bug";上下文截断顺序 / 工具调用解析 / 重试策略;开放源码让 harness 黑盒变白盒
- 标签:Agent Harness Evaluation Bug
- 建议:关注;harness bug 是 Agent 生产落地最常见坑
⑤ Weak-to-Strong GraphRAG: ICIR 2026 投稿(X 推文)
- 链接:https://x.com/omarsar0/status/1999881513220100336
- 核心:GraphRAG 本质是黑盒组合搜索(穷举 NP 难);ReG 用 LLM 从候选链中选有效推理链训练 retriever;生产落地思路清晰
- 标签:GraphRAG Retriever RAG ICLR-2026
- 建议:关注;GraphRAG 生产化思路
⑥ LlamaParse Retrieval Harness 三合一推理环(X 推文)
- 链接:https://x.com/jerryjliu0/status/2071729856900215261
- 核心:语义搜索 + 服务端 grep + 文件级导航三合一;覆盖 10 文档到 100 万文档的可扩展搜索
- 标签:RAG LlamaParse Harness 语义搜索
- 建议:关注
【SUBSTACK 专题线索】
| 作者/专栏 | 主题 | 核心洞察 | 优先级 |
|---|---|---|---|
| The AI Engineer(Paolo Perrone) | AI Agents Stack 2026 | Guardrails 独立学科化、评估三层收敛 | 高 |
| Alexey On Data(Alexey Grigorev) | AI Engineer JD 分析 | 1000+ JD;95.6% 要求生产经验;Ragas+Phoenix+Langfuse 评估栈 | 高 |
| teacherandtask.com | Agentic RAG 生产失败模式 | 30 分钟 Demo → 3 个月生产失败弧线;Agentic RAG token 消耗 3-10× | 中 |
| InferenceOps | State of Model Serving | KServe v0.17 / llm-d / SIG-kv-disaggregation 进展 | 高 |
| AI Engineering Insider | 推理工程师面试知识体系 | 系统性梳理推理工程生产知识 | 中 |
【分类标签总览】
| 分类 | 条目数 | 代表高价值 |
|---|---|---|
| database | 3 | KV Cache 综述、Dell 工业研究、Enterprise KV Layer |
| backend | 8 | v0.28.0、UniBoost、Benchmark、Inference Bugs、Sliding-Window、browser-use |
| cloud-native | 2 | KServe/llm-d、AI Agents Stack 2026 |
| csdn | 7 | vLLM 源码系列、torch.compile、LangChain+RAG、Ollama 部署 |
| reproduction | 6 | FA4、CODA、StateAct、TrueForge、GraphRAG、LlamaParse Harness |
【建议写入路径】
本次简报路径:
/shared/research-kb/inbox/jay/2026-08-31T1505-jay-evening-five-category-briefing.md
后续精读建议(按优先级): 1. vLLM v0.28.0 Release Notes + UniBoost 调度框架(backend / 推理引擎选型) 2. arXiv 2506.09713 推理引擎 Bug 分类(backend / 排障专题) 3. KV Cache 优化全景综述(database / 推理优化专题) 4. vLLM 源码系列 + torch.compile(csdn / 源码解析专题) 5. KServe v0.17.0 + llm-d 拆分进展(cloud-native / K8s 推理专题)
本轮无 GitHub 写入操作。