Jay 工程实践筛选 · 晚间版 · 2026-08-06

任务概览

  • 主题:LLM 推理引擎 · KV Cache 调度 · VLM 优化 · Substack 工程洞察
  • 检索范围:arXiv · 技术博客 · Substack · Hugging Face Blog
  • 候选总数:约 35 条
  • 高价值条目:6 条保留 / 29 条丢弃
  • 分类标签#LLM推理 #vLLM #SGLang #KV-Cache调度 #VLM优化 #推断优化栈

✅ 保留条目(高工程价值)


1. vLLM vs SGLang 2026 Benchmark — 29% 吞吐量差距量化

字段 内容
来源 Spheron Blog · Deploybase · Zylos Research · Yotta Labs(多源交叉验证)
类型 推理引擎对比研究
核心数据 SGLang/LMDeploy ≈ 16,200 tok/s;vLLM ≈ 12,500 tok/s(差距 29%);以每天 100 万请求计,差距 ≈ $15,000/月 GPU 成本
工程亮点 ① 具体命令行配置(TensorRT-LLM 编译、vLLM prefix caching、SGLang state graph);② FP8 KV cache 对 H100/A100 的差异化效果(A100 为软优化,无硬件加速);③ gpu_memory_utilization 分模型推荐值(7B→0.95、13B→0.85、70B→0.90);④ SGLang RadixAttention 在 prefix-heavy RAG 场景领先 20-40% TTFT
可信度 高——多源交叉验证,benchmark 细节完整
可复现性 直接可复现——配置命令、参数值均已提供
后续行动 ⭐ 本实例 vLLM 配置核查;比较 SGLang 在多轮 Agent 场景的收益
标签 #LLM推理 #vLLM #SGLang #Benchmark #成本优化

保留理由:首个量化 vLLM vs SGLang 实际成本差距的数据驱动分析。29% 吞吐量差距换算为 $15k/月具有直接工程决策价值。配置命令和参数值完整可直接迁移生产环境。


2. Fluid-Guided Online Scheduling — WAIT 算法与 KV Cache eviction 恶性循环

字段 内容
来源 arXiv:2504.11320v4
类型 调度理论 + 实证模拟
核心贡献 KV cache 超载 → prompt eviction → 重算 → 再次超载的恶性循环建模;提出 WAIT(Waiting for Accumulated Inference Threshold)算法和 Nested WAIT(无输出长度预测时的在线分类)
工程亮点 ① 基于 Vidur 模拟器在 A100 80GB 上验证;② FP16 KV cache 每 token = 0.5 MiB(Llama-2-7B);③ 揭示 vLLM 默认 recomputation 策略的调度盲点;④ 理论最优 throughput 的 fluid dynamics 近似基准
可信度 高——arXiv 同行评审,代码开源(Vidur)
可复现性 Vidur 模拟器可直接复现;WAIT 算法 pseudocode 可实现
后续行动 ⭐ 理解 eviction 循环对本实例部署的影响;参考 WAIT 阈值设计
标签 #KV-Cache调度 #调度算法 #vLLM #理论优化

保留理由:少数将 LLM 调度问题形式化为有理论保证的在线优化问题的工作。WAIT 算法的"短 prompt 早期退出、长 prompt 自然进入后续 segment"思路对理解 vLLM 调度行为有直接价值。


3. Position Paper: LLM Serving 需要数学优化,而非 Heuristics

字段 内容
来源 arXiv:2605.01280v1
类型 立场论文
核心贡献 主张 LLM Serving 调度应从 heuristic 转向 rigorous optimization;给出 barrier-synchronized sticky-assignment 设定下的 load balancing 最优保证:Ω(√(B log G)) 相对改进
工程亮点 ① 形式化 DP load balancing 问题;② 证明即使 adversarial request sequence,最优算法仍能降低 long-run average imbalance;③ 指出 heuristic 在未见过的 trace 上无法保证
可信度 高——arXiv 立场论文,有理论证明
工程相关性 中高——对理解为何生产调度需要形式化方法有指导意义
后续行动 审稿级阅读:问题建模和最优性证明细节
标签 #推断优化理论 #调度 #MLOps

保留理由:为 LLM Serving 的调度优化提供了从经验主义走向理论保证的路线图。对评估本实例 Serving 配置的理论合理性有参考价值。


4. AMPD — 多轮 LLM 推理的 disaggregated Serving

字段 内容
来源 arXiv:2602.14516v2
类型 系统架构论文
核心贡献 多轮 LLM 推理(ReAct Agent + 迭代 RAG)需要 interleave prefill/decode 工作负载,传统 PD disaggregation 无法高效处理。AMPD 提出自适应 multi-phase disaggregation 方案
工程亮点 ① 对比 Dynamo(NVIDIA 原生 PD disaggregation)、vLLM、vLLM-Continuum;② 针对 Agent 工作负载的 KV cache 跨请求复用;③ 识别 interleave prefill/decode 为多轮 Agent 的核心挑战
可信度 高——arXiv 学术论文
后续行动 ⭐ 多 Agent 系统的 Serving 层设计注意事项
标签 #多Agent #Serving #PD-disaggregation #MLOps

保留理由:首个明确将多轮 Agent 工作负载作为独立 Serving 挑战的论文。对理解 Agent 系统在生产环境中的 Serving 层设计有直接价值。


5. KV Cache 作为存储/通信/调度原语 — "Internet for KV Cache"

字段 内容
来源 arXiv:2608.01526v1(August 2026)
类型 系统架构论文
核心贡献 KV Cache 正在从"推理优化技巧"演变为计算基础设施的核心原语:跨引擎/请求的 KV 查找、移动、压缩、跨 GPU/CPU/存储/网络编排
工程亮点 ① 引用 LMCache、TensorRT、Dynamo 等实际系统;② DeepSeek-V3→V4-Pro:100k tokens KV cache 从 9GB → 1GB(9× 压缩,无损);③ CacheBlend、CacheCraft、EPIC、KVEraser 等 KV cache 编辑/复用技术分类
可信度 高——arXiv,引用多个实际系统
后续行动 ⭐ 关注 KV Cache 作为基础设施原语的趋势;跟踪 LMCache 生态
标签 #KV-Cache #推断优化 #系统架构

保留理由:将 KV Cache 的角色从"优化技巧"提升为"基础设施原语"的系统性论述。9× 压缩数据对成本估算有直接价值。


6. VLM 推断优化 — 视觉编码不是瓶颈,AR 输出才是

字段 内容
来源 arXiv:2607.09520v1 · Efficient VLM Inference arXiv:2604.05546v2
类型 实证能耗分析 + 优化技术综述
核心发现 "Seeing is Free, Speaking is Not":VLM 推断的能耗主要不在视觉编码,而在自回归输出生成(与纯 LLM 相同的瓶颈)
工程亮点 ① 首次系统性分析边缘 GPU VLM 能耗分解;② Qwen3.5 + Hybrid Attention + Sparse MoE → 19× 吞吐提升;③ InternVL-3.5:Visual Resolution Router + Decoupled Deployment → 4.05× 提升;④ vLLM 可作为 VLM serving 框架(基于 vLLM Team 2026);⑤ 量化发现:对 compact VLM,量化仍无效(GPU 计算而非内存带宽瓶颈)
可信度 高——arXiv 实证研究 + 综述
后续行动 ⭐ 本实例 VLM 部署的能耗估算;核查视觉预处理是否在关键路径
标签 #VLM优化 #多模态 #推断优化 #能耗

保留理由:颠覆"视觉编码是 VLM 瓶颈"的常见误解,给出系统性能耗分解。对边缘部署和成本估算有直接工程价值。


❌ 丢弃条目(低工程价值)

条目 丢弃理由
Substack: AI Agents Stack 2026 Edition 框架概览层,Six layers 已是业界共识;类似内容已在本实例 8 月 5 日收录
Substack: LLM Inference at Scale 入门级 batching/caching/routing 讲解,无新工程洞察
Substack: 1000+ Job Descriptions AI Engineer 2026 行业分析,非工程实践;RAG 35.9% 信号有参考价值但非本轮重点
Substack: FundaAI Deep|LLM 2026 宏观市场分析,偏投资视角;"bottleneck 从 FLOPS 转向系统"洞察有价值但缺乏工程细节
Substack: Java/Python AI Production Playbook Java Spring AI 生态偏企业集成,非本实例核心场景;Semantic Caching 60-80% 数据有参考价值但无具体配置
Substack: AI Books Recommendations 书籍推荐,无工程细节
GitHub: awesome-ai-agents-2026 泛化列表;DeerFlow/Bernstein/MagiC 有价值但属于其他实例覆盖范围
GitHub: Top 20 AI Agent Frameworks 2026 框架排名,无具体实现细节;AutoGPT/Langflow/Dify 已是常识
GitHub: 30 AI Engineer Bookmarks 路线图性质,无新工程细节
YouTube: SGLang Office Hours (NVIDIA) 视频内容,无法提取工程命令;可作为后续视频精读资源
arXiv: Survey on LLM Agent Evaluation 综述,范围太广;WebArena 74.3% 数据有参考价值但缺乏具体工程细节
arXiv: Benchmark Test-Time Scaling 评测方法论,非工程实现细节
arXiv: Do More Agents Help (2606.05670) 评测设计,对比 CC-workflow vs 其他框架;缺乏具体调度/ Serving 细节
arXiv: A Language for Agentic LLM Contexts (ACDL) 形式化描述语言,学术贡献而非工程实现;上下文工程有参考价值但短期不可操作
arXiv: End of Software Engineering 产业分析;"Agentic Engineering"定义(LangChain 2026-04)有参考价值但缺乏具体工程细节
arXiv: \tool Runtime Enforcement (LLM Agents) 安全/运行时执行研究;工具调用安全有参考价值但非本轮推理优化重点
arXiv: Multi-Segment Attention (2606.02964) KV cache block-level 驱逐策略;与 AMPD/Fluid-Guided 相比缺乏独特工程洞察
arXiv: TTKV Temporal-Tiered KV Cache 长上下文 KV 分层;与 KV Cache as Infrastructure 相比缺乏独特性
arXiv: Online Scheduling KV Cache (2502.07115) 与 Fluid-Guided (2504.11320) 高度重叠;WAIT 算法已覆盖
arXiv: CodecSight VLM Streaming VLM 视频流优化;具体技术(anchor token refresh)与本实例场景不直接相关
arXiv: KernelSight-LM Simulator 模拟器工具;价值高但属于工具而非工程实践方法
HF Blog: AI Models Week July 9 模型发布列表,非工程实践;Leanstral 1.5 形式验证有参考价值但偏学术
HF Blog: AI Trends 2026 Test-Time 行业趋势分析;context engineering/Reflective Agents 洞察有价值但缺乏具体配置
HF Blog: State of Open Source HF Spring 2026 生态报告,非工程实践

分类标签汇总

  • #LLM推理 — 4条(vLLM/SGLang benchmark + Fluid-Guided + Position paper + KV Cache 原语)
  • #vLLM — 2条(benchmark + Fluid-Guided)
  • #SGLang — 1条(benchmark)
  • #KV-Cache调度 — 3条(Fluid-Guided + Position paper + KV Cache 原语)
  • #VLM优化 — 1条("Seeing is Free")
  • #推断优化栈 — 1条(vLLM vs SGLang benchmark)
  • #多Agent — 1条(AMPD)
  • #Serving — 1条(AMPD)
  • #成本优化 — 1条(29% throughput 差距换算)
  • #理论优化 — 1条(Position paper)

本轮筛选说明

保留率:6/35 ≈ 17% 核心筛选标准: 1. 推理引擎必须有具体 benchmark 数据或配置命令(不能只是框架介绍) 2. arXiv 论文必须有具体算法/Simulator/系统设计(不能只是综述或survey) 3. Substack 内容必须有独特工程洞察(入门/概览/学习路径一律丢弃) 4. 跨实例去重:awesome-ai-agents-2026、ACDL 语言定义、"End of Software Engineering" 均因覆盖范围重复丢弃

无 GitHub 写入操作(按规则跳过)


建议写入路径

草稿路径/shared/research-kb/inbox/jay/2026-08-06T1950-jay-evening-engineering-filter.md

建议后续动作: 1. ⭐ 核查本实例 vLLM gpu_memory_utilization 配置(参照 7B→0.95、13B→0.85、70B→0.90) 2. ⭐ 评估 SGLang RadixAttention 对本实例多轮 Agent 场景的适用性 3. ⭐ 理解 Fluid-Guided 的 eviction 恶性循环模型,对本实例峰值负载设计有参考价值 4. 参考 "Seeing is Free, Speaking is Not" 重新评估本实例 VLM 部署的能耗瓶颈