Jay 工程实践筛选 · 晚间版 · 2026-08-06
任务概览
- 主题:LLM 推理引擎 · KV Cache 调度 · VLM 优化 · Substack 工程洞察
- 检索范围:arXiv · 技术博客 · Substack · Hugging Face Blog
- 候选总数:约 35 条
- 高价值条目:6 条保留 / 29 条丢弃
- 分类标签:
#LLM推理#vLLM#SGLang#KV-Cache调度#VLM优化#推断优化栈
✅ 保留条目(高工程价值)
1. vLLM vs SGLang 2026 Benchmark — 29% 吞吐量差距量化
| 字段 | 内容 |
|---|---|
| 来源 | Spheron Blog · Deploybase · Zylos Research · Yotta Labs(多源交叉验证) |
| 类型 | 推理引擎对比研究 |
| 核心数据 | SGLang/LMDeploy ≈ 16,200 tok/s;vLLM ≈ 12,500 tok/s(差距 29%);以每天 100 万请求计,差距 ≈ $15,000/月 GPU 成本 |
| 工程亮点 | ① 具体命令行配置(TensorRT-LLM 编译、vLLM prefix caching、SGLang state graph);② FP8 KV cache 对 H100/A100 的差异化效果(A100 为软优化,无硬件加速);③ gpu_memory_utilization 分模型推荐值(7B→0.95、13B→0.85、70B→0.90);④ SGLang RadixAttention 在 prefix-heavy RAG 场景领先 20-40% TTFT |
| 可信度 | 高——多源交叉验证,benchmark 细节完整 |
| 可复现性 | 直接可复现——配置命令、参数值均已提供 |
| 后续行动 | ⭐ 本实例 vLLM 配置核查;比较 SGLang 在多轮 Agent 场景的收益 |
| 标签 | #LLM推理 #vLLM #SGLang #Benchmark #成本优化 |
保留理由:首个量化 vLLM vs SGLang 实际成本差距的数据驱动分析。29% 吞吐量差距换算为 $15k/月具有直接工程决策价值。配置命令和参数值完整可直接迁移生产环境。
2. Fluid-Guided Online Scheduling — WAIT 算法与 KV Cache eviction 恶性循环
| 字段 | 内容 |
|---|---|
| 来源 | arXiv:2504.11320v4 |
| 类型 | 调度理论 + 实证模拟 |
| 核心贡献 | KV cache 超载 → prompt eviction → 重算 → 再次超载的恶性循环建模;提出 WAIT(Waiting for Accumulated Inference Threshold)算法和 Nested WAIT(无输出长度预测时的在线分类) |
| 工程亮点 | ① 基于 Vidur 模拟器在 A100 80GB 上验证;② FP16 KV cache 每 token = 0.5 MiB(Llama-2-7B);③ 揭示 vLLM 默认 recomputation 策略的调度盲点;④ 理论最优 throughput 的 fluid dynamics 近似基准 |
| 可信度 | 高——arXiv 同行评审,代码开源(Vidur) |
| 可复现性 | Vidur 模拟器可直接复现;WAIT 算法 pseudocode 可实现 |
| 后续行动 | ⭐ 理解 eviction 循环对本实例部署的影响;参考 WAIT 阈值设计 |
| 标签 | #KV-Cache调度 #调度算法 #vLLM #理论优化 |
保留理由:少数将 LLM 调度问题形式化为有理论保证的在线优化问题的工作。WAIT 算法的"短 prompt 早期退出、长 prompt 自然进入后续 segment"思路对理解 vLLM 调度行为有直接价值。
3. Position Paper: LLM Serving 需要数学优化,而非 Heuristics
| 字段 | 内容 |
|---|---|
| 来源 | arXiv:2605.01280v1 |
| 类型 | 立场论文 |
| 核心贡献 | 主张 LLM Serving 调度应从 heuristic 转向 rigorous optimization;给出 barrier-synchronized sticky-assignment 设定下的 load balancing 最优保证:Ω(√(B log G)) 相对改进 |
| 工程亮点 | ① 形式化 DP load balancing 问题;② 证明即使 adversarial request sequence,最优算法仍能降低 long-run average imbalance;③ 指出 heuristic 在未见过的 trace 上无法保证 |
| 可信度 | 高——arXiv 立场论文,有理论证明 |
| 工程相关性 | 中高——对理解为何生产调度需要形式化方法有指导意义 |
| 后续行动 | 审稿级阅读:问题建模和最优性证明细节 |
| 标签 | #推断优化理论 #调度 #MLOps |
保留理由:为 LLM Serving 的调度优化提供了从经验主义走向理论保证的路线图。对评估本实例 Serving 配置的理论合理性有参考价值。
4. AMPD — 多轮 LLM 推理的 disaggregated Serving
| 字段 | 内容 |
|---|---|
| 来源 | arXiv:2602.14516v2 |
| 类型 | 系统架构论文 |
| 核心贡献 | 多轮 LLM 推理(ReAct Agent + 迭代 RAG)需要 interleave prefill/decode 工作负载,传统 PD disaggregation 无法高效处理。AMPD 提出自适应 multi-phase disaggregation 方案 |
| 工程亮点 | ① 对比 Dynamo(NVIDIA 原生 PD disaggregation)、vLLM、vLLM-Continuum;② 针对 Agent 工作负载的 KV cache 跨请求复用;③ 识别 interleave prefill/decode 为多轮 Agent 的核心挑战 |
| 可信度 | 高——arXiv 学术论文 |
| 后续行动 | ⭐ 多 Agent 系统的 Serving 层设计注意事项 |
| 标签 | #多Agent #Serving #PD-disaggregation #MLOps |
保留理由:首个明确将多轮 Agent 工作负载作为独立 Serving 挑战的论文。对理解 Agent 系统在生产环境中的 Serving 层设计有直接价值。
5. KV Cache 作为存储/通信/调度原语 — "Internet for KV Cache"
| 字段 | 内容 |
|---|---|
| 来源 | arXiv:2608.01526v1(August 2026) |
| 类型 | 系统架构论文 |
| 核心贡献 | KV Cache 正在从"推理优化技巧"演变为计算基础设施的核心原语:跨引擎/请求的 KV 查找、移动、压缩、跨 GPU/CPU/存储/网络编排 |
| 工程亮点 | ① 引用 LMCache、TensorRT、Dynamo 等实际系统;② DeepSeek-V3→V4-Pro:100k tokens KV cache 从 9GB → 1GB(9× 压缩,无损);③ CacheBlend、CacheCraft、EPIC、KVEraser 等 KV cache 编辑/复用技术分类 |
| 可信度 | 高——arXiv,引用多个实际系统 |
| 后续行动 | ⭐ 关注 KV Cache 作为基础设施原语的趋势;跟踪 LMCache 生态 |
| 标签 | #KV-Cache #推断优化 #系统架构 |
保留理由:将 KV Cache 的角色从"优化技巧"提升为"基础设施原语"的系统性论述。9× 压缩数据对成本估算有直接价值。
6. VLM 推断优化 — 视觉编码不是瓶颈,AR 输出才是
| 字段 | 内容 |
|---|---|
| 来源 | arXiv:2607.09520v1 · Efficient VLM Inference arXiv:2604.05546v2 |
| 类型 | 实证能耗分析 + 优化技术综述 |
| 核心发现 | "Seeing is Free, Speaking is Not":VLM 推断的能耗主要不在视觉编码,而在自回归输出生成(与纯 LLM 相同的瓶颈) |
| 工程亮点 | ① 首次系统性分析边缘 GPU VLM 能耗分解;② Qwen3.5 + Hybrid Attention + Sparse MoE → 19× 吞吐提升;③ InternVL-3.5:Visual Resolution Router + Decoupled Deployment → 4.05× 提升;④ vLLM 可作为 VLM serving 框架(基于 vLLM Team 2026);⑤ 量化发现:对 compact VLM,量化仍无效(GPU 计算而非内存带宽瓶颈) |
| 可信度 | 高——arXiv 实证研究 + 综述 |
| 后续行动 | ⭐ 本实例 VLM 部署的能耗估算;核查视觉预处理是否在关键路径 |
| 标签 | #VLM优化 #多模态 #推断优化 #能耗 |
保留理由:颠覆"视觉编码是 VLM 瓶颈"的常见误解,给出系统性能耗分解。对边缘部署和成本估算有直接工程价值。
❌ 丢弃条目(低工程价值)
| 条目 | 丢弃理由 |
|---|---|
| Substack: AI Agents Stack 2026 Edition | 框架概览层,Six layers 已是业界共识;类似内容已在本实例 8 月 5 日收录 |
| Substack: LLM Inference at Scale | 入门级 batching/caching/routing 讲解,无新工程洞察 |
| Substack: 1000+ Job Descriptions AI Engineer 2026 | 行业分析,非工程实践;RAG 35.9% 信号有参考价值但非本轮重点 |
| Substack: FundaAI Deep|LLM 2026 | 宏观市场分析,偏投资视角;"bottleneck 从 FLOPS 转向系统"洞察有价值但缺乏工程细节 |
| Substack: Java/Python AI Production Playbook | Java Spring AI 生态偏企业集成,非本实例核心场景;Semantic Caching 60-80% 数据有参考价值但无具体配置 |
| Substack: AI Books Recommendations | 书籍推荐,无工程细节 |
| GitHub: awesome-ai-agents-2026 | 泛化列表;DeerFlow/Bernstein/MagiC 有价值但属于其他实例覆盖范围 |
| GitHub: Top 20 AI Agent Frameworks 2026 | 框架排名,无具体实现细节;AutoGPT/Langflow/Dify 已是常识 |
| GitHub: 30 AI Engineer Bookmarks | 路线图性质,无新工程细节 |
| YouTube: SGLang Office Hours (NVIDIA) | 视频内容,无法提取工程命令;可作为后续视频精读资源 |
| arXiv: Survey on LLM Agent Evaluation | 综述,范围太广;WebArena 74.3% 数据有参考价值但缺乏具体工程细节 |
| arXiv: Benchmark Test-Time Scaling | 评测方法论,非工程实现细节 |
| arXiv: Do More Agents Help (2606.05670) | 评测设计,对比 CC-workflow vs 其他框架;缺乏具体调度/ Serving 细节 |
| arXiv: A Language for Agentic LLM Contexts (ACDL) | 形式化描述语言,学术贡献而非工程实现;上下文工程有参考价值但短期不可操作 |
| arXiv: End of Software Engineering | 产业分析;"Agentic Engineering"定义(LangChain 2026-04)有参考价值但缺乏具体工程细节 |
| arXiv: \tool Runtime Enforcement (LLM Agents) | 安全/运行时执行研究;工具调用安全有参考价值但非本轮推理优化重点 |
| arXiv: Multi-Segment Attention (2606.02964) | KV cache block-level 驱逐策略;与 AMPD/Fluid-Guided 相比缺乏独特工程洞察 |
| arXiv: TTKV Temporal-Tiered KV Cache | 长上下文 KV 分层;与 KV Cache as Infrastructure 相比缺乏独特性 |
| arXiv: Online Scheduling KV Cache (2502.07115) | 与 Fluid-Guided (2504.11320) 高度重叠;WAIT 算法已覆盖 |
| arXiv: CodecSight VLM Streaming | VLM 视频流优化;具体技术(anchor token refresh)与本实例场景不直接相关 |
| arXiv: KernelSight-LM Simulator | 模拟器工具;价值高但属于工具而非工程实践方法 |
| HF Blog: AI Models Week July 9 | 模型发布列表,非工程实践;Leanstral 1.5 形式验证有参考价值但偏学术 |
| HF Blog: AI Trends 2026 Test-Time | 行业趋势分析;context engineering/Reflective Agents 洞察有价值但缺乏具体配置 |
| HF Blog: State of Open Source HF Spring 2026 | 生态报告,非工程实践 |
分类标签汇总
#LLM推理— 4条(vLLM/SGLang benchmark + Fluid-Guided + Position paper + KV Cache 原语)#vLLM— 2条(benchmark + Fluid-Guided)#SGLang— 1条(benchmark)#KV-Cache调度— 3条(Fluid-Guided + Position paper + KV Cache 原语)#VLM优化— 1条("Seeing is Free")#推断优化栈— 1条(vLLM vs SGLang benchmark)#多Agent— 1条(AMPD)#Serving— 1条(AMPD)#成本优化— 1条(29% throughput 差距换算)#理论优化— 1条(Position paper)
本轮筛选说明
保留率:6/35 ≈ 17% 核心筛选标准: 1. 推理引擎必须有具体 benchmark 数据或配置命令(不能只是框架介绍) 2. arXiv 论文必须有具体算法/Simulator/系统设计(不能只是综述或survey) 3. Substack 内容必须有独特工程洞察(入门/概览/学习路径一律丢弃) 4. 跨实例去重:awesome-ai-agents-2026、ACDL 语言定义、"End of Software Engineering" 均因覆盖范围重复丢弃
无 GitHub 写入操作(按规则跳过)
建议写入路径
草稿路径:/shared/research-kb/inbox/jay/2026-08-06T1950-jay-evening-engineering-filter.md
建议后续动作: 1. ⭐ 核查本实例 vLLM gpu_memory_utilization 配置(参照 7B→0.95、13B→0.85、70B→0.90) 2. ⭐ 评估 SGLang RadixAttention 对本实例多轮 Agent 场景的适用性 3. ⭐ 理解 Fluid-Guided 的 eviction 恶性循环模型,对本实例峰值负载设计有参考价值 4. 参考 "Seeing is Free, Speaking is Not" 重新评估本实例 VLM 部署的能耗瓶颈