工程实践筛选 · Jay · 2026-07-23 19:50 (UTC+8)

筛选轮次: 本轮第3次
检索范围: arXiv (KV cache优化、Multi-Agent benchmark)、HuggingFace Blog (推理优化)、GitHub ML工程、vLLM OOM诊断、Substack RAG架构
本次重点: 可复现步骤、真实性能数据、源码级分析、命令参数


🔴 高价值条目(保留)

条目 1:ArXiv — AsymCache (Multi-Segment Attention) KV Cache 优化

字段 内容
来源 arXiv · 2606.02964v1
链接 https://arxiv.org/html/2606.02964v1
可信度 高 — 学术论文,有量化数据
发布时间 2026-06

核心内容

  • 问题: 现有 KV cache 管理系统的 eviction 策略基于访问频率或位置启发式,未考虑不同 KV cache block 对 GPU attention kernel 执行效率的影响
  • 方案: AsymCache,核心是 Multi-Segment Attention (MSA) + computation-latency-aware eviction policy
  • 关键创新: 1. MSA:高效处理非连续 KV context 2. Cache eviction policy:联合优化 hit rate 和 position-aware recomputation cost 3. Adaptive chunking scheduler:高硬件利用率

真实性能数据

指标 提升幅度
TTFT (Time To First Token) 1.90–2.03× 降低
TPOT (Time Per Output Token) 1.62–1.71× 降低
Agent serving (Continuum) 平均延迟 -18.1%

工程价值判断

  • 保留理由: 有具体性能提升数字,与 GPU attention kernel 行为对齐,是 KV cache eviction 策略的新方向
  • 注意: 需等开源代码 release 后核验实际部署效果
  • 入库建议: 「KV Cache 优化」主题页

条目 2:ArXiv — Kareto: Adaptive Multi-Objective KV Cache 分层存储

字段 内容
来源 arXiv · 2603.08739v1
链接 https://arxiv.org/html/2603.08739v1
可信度 高 — 学术论文,有多目标优化理论
发布时间 2026-03

核心内容

  • 问题: KV cache 从 GPU HBM offload 到外部存储时,如何在 cost/throughput/latency 之间平衡
  • 方案: Kareto — KV-cache Adaptive REsource managemenT Optimizer
  • 关键设计: 1. 多目标优化:Pareto frontier 跨 GPU HBM / host DRAM / disk 三层 2. Fine-grained adaptive tuner:基于 eviction policies 和 KV block access patterns 做 group-specific cache management

工程价值判断

  • 保留理由: 解决了长 context 场景下 KV cache 内存瓶颈问题,有分层存储工程思路
  • 入库建议: 「KV Cache 优化 / 边缘推理」主题页

条目 3:ArXiv — DualPath: Agentic LLM Inference 存储带宽优化

字段 内容
来源 arXiv · 2602.21548v2
链接 https://arxiv.org/html/2602.21548v2
可信度 高 — 学术论文,有基准测试
发布时间 2026-02

核心内容

  • 问题: 多轮 agentic LLM 推理中,KV-Cache storage I/O 成为瓶颈,存储 NIC 在 prefill 引擎侧带宽饱和,decode 引擎侧空闲
  • 方案: DualPath — dual-path KV-Cache loading 1. 传统 storage-to-prefill 路径 2. 新路径 storage-to-decode:KV-Cache load 到 decode 引擎后通过 RDMA transfer 到 prefill 引擎
  • 关键数据: 离线推理吞吐量最高 1.87× 提升

工程价值判断

  • 保留理由: disaggregated 架构下的存储 I/O 优化,有真实 agentic workload 测试
  • 入库建议: 「LLM 推理系统 / 存储优化」主题页

条目 4:GitHub — stas00/ml-engineering 开源书籍

字段 内容
来源 GitHub · stas00/ml-engineering
链接 https://github.com/stas00/ml-engineering
可信度 高 — 开源工程实践书籍
更新时间 2026-01 活跃

核心内容

  • 定位: Machine Learning Engineering Open Book
  • 重点章节(与本轮主题相关):
  • GPU Mode community talk (2026-01-10):Accelerator 性能现实、网络和存储对 ensemble 性能的影响
  • ML 工程弹性技能建设
  • 工程价值: 系统性 ML 工程实践,有真实 GPU 集群和分布式训练内容

工程价值判断

  • 保留理由: 工程导向,开源可复现,适合作为 ML 系统工程参考
  • 入库建议: 「ML 工程实践」资源页

条目 5:vLLM OOM 根因诊断指南

字段 内容
来源 paralleliq.ai
链接 https://www.paralleliq.ai/blog/vllm-oom-errors-root-cause-diagnosis
可信度 中 — 第三方博客,有分类方法论
发布时间 2026

核心内容(OOM 三种模式分类)

OOM 类型 特征 根因
KV Cache Overflow 长 context 请求时 OOM(32K/128K) KV cache 内存超出限制
Startup OOM 启动或首个 batch 时 OOM 模型加载时内存分配问题
Session OOM 推理结束后 OOM 内存释放不完整 / memory leak

关键诊断步骤

  1. 识别 OOM 发生阶段(启动 / 推理中 / 推理后)
  2. 检查 gpu_memory_utilization 设置
  3. 验证 max_model_len 是否与实际请求匹配
  4. 检查 batch size 配置
  5. 考虑量化(INT8/FP8/NVFP4)作为根治手段

工程价值判断

  • 保留理由: 系统性 OOM 分类诊断方法,有别于逐条 Bug 报告的归纳整理
  • 入库建议: 「vLLM 生产调优 / OOM 排障」主题页

条目 6:HuggingFace — EAGLE3 Speculative Decoding (Qwen3-Coder-Next)

字段 内容
来源 HuggingFace Blog
链接 https://huggingface.co/blog/lujangusface/tw-eagle3-qwen3-coder-next
可信度 高 — 官方博客,有开源模型
发布时间 2026-06

核心内容

  • 技术: EAGLE3 speculative decoding
  • 目标模型: Qwen3-Coder-Next — 80B MoE, 512 experts, 10 active per token(Alibaba, 2026-02)
  • 性能数据:
  • Mean single-user throughput: 1.37× 提升
  • SWEBench-Verified peak: 1.52× 提升
  • Draft head 大小:~278 MB(Qwen3-Coder-Next)
  • 工程要点:
  • MoE 架构的 EAGLE3 需要注意:EAGLE3 auxiliary layers 必须从 attention layers 选择,因为 GDN recurrent states 与 speculative decoding 不兼容

工程价值判断

  • 保留理由: 真实的生产级推理加速案例,MoE + speculative decoding 的工程挑战有代表性
  • 入库建议: 「LLM 推理优化 / Speculative Decoding」主题页

🟡 中等价值(降级保留)

条目 7:ArXiv — EngiAI Multi-Agent Benchmark (工程设计 LLM Agent)

字段 内容
来源 arXiv · 2605.19743v1
链接 https://arxiv.org/html/2605.19743v1
可信度 中 — 学术论文,有 benchmark 设计
发布时间 2026-05

核心内容

  • 定位: Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
  • 亮点: 1. LangGraph-based multi-agent reference implementation(拓扑优化 + RAG + HPC orchestration + 3D 打印控制) 2. Gated RAG scoring mechanism(隔离文档检索对参数选择的贡献) 3. HPC benchmark(SLURM 集群上端到端 ML 训练编排)
  • 工程价值: 工程设计场景的 agent benchmark,覆盖 RAG + HPC + 工具调用

入库判断

  • 保留理由: 工程设计场景的具体 benchmark,有 LangGraph 参考实现
  • 入库建议: 「Agent Benchmark / 工程场景」主题页

条目 8:ArXiv — Context Engineering (企业多 Agent 架构)

字段 内容
来源 arXiv · 2603.09619
链接 https://arxiv.org/pdf/2603.09619
可信度 中 — 学术论文,有架构分析
发布时间 2026-03

核心内容

  • 问题: Context Engineering 作为独立学科,设计和管理 AI agent 决策的整个信息环境
  • 架构参考: Google ADK、Anthropic、LangChain vendor architectures
  • 5个生产级上下文质量标准: relevance、sufficiency、isolation、economy、provenance
  • Pyramid 模型: Prompt Engineering → Context Engineering → Agent Engineering 四级成熟度

入库判断

  • 保留理由: 企业级 agent 架构的框架性思考,与 Google ADK / Anthropic 的实际产品对齐
  • 入库建议: 「Agent 架构 / Context Engineering」主题页

条目 9:Substack — Comparative RAG Architectures 2026

字段 内容
来源 micheallanham.substack.com
链接 https://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures
可信度 中 — 技术博客,有架构分类
发布时间 2026-02

核心内容

  • 三种 RAG 架构对比: 1. Pipeline RAG: 单跳问题 baseline,低延迟 2. Agentic RAG: 动态自纠正循环,迭代检索 3. Knowledge Graph RAG (GraphRAG): 实体关系结构,关系查询和全局数据集合成
  • 2026 数据点: 57% 企业已部署多阶段 agents;质量仍是首要生产障碍

入库判断

  • 保留理由: 2026 RAG 架构全景,对生产选型有参考价值
  • 入库建议: 「RAG 架构 / 2026 技术全景」主题页

🔵 已覆盖/丢弃条目

条目 原因
GitHub Issue #12496 (SGLang vs vLLM CUDA OOM) 已在 2026-07-23 14:52 筛选覆盖(H4 条目)
SGLang Troubleshooting 文档 已在 2026-07-23 14:52 筛选覆盖(H1 条目)
vLLM OOM Checklist (sector88) 已在 2026-07-23 14:52 筛选覆盖(H2 条目)
vLLM Production Guide (SitePoint) 已在 2026-07-23 14:52 筛选覆盖(H3 条目)
AliYun ACK K8s 部署 已在 2026-07-23 14:52 筛选覆盖(H5 条目)
arXiv 2603.04428 (Persistent Q4 KV Cache) 已在 2026-07-23 14:52 筛选覆盖(H7 条目)
SGLang vs vLLM Benchmark (particula.tech) 已在 2026-07-23 10:50 筛选覆盖
vLLM v0.25.1 Bugs (#49476, #49460, #49449, #49480) 已在 2026-07-23 10:50 筛选覆盖
SGLang v0.5.15.post1 Bugs (#31995, #31970, #31974, #31972, #31929) 已在 2026-07-23 10:50 筛选覆盖
arXiv KV Cache Optimization Survey 丢弃 — 纯综述,无原创工程数据
GitHub ML Roadmap 2026 (PrinceSinghhub) 丢弃 — 学习路线,非工程实践产出

分类标签

#KV-Cache #推理优化 #AsymCache #Kareto #DualPath #分层存储 #vLLM
#OOM-Diagnosis #Speculative-Decoding #EAGLE3 #MoE #Multi-Agent
#Benchmark #Context-Engineering #RAG-架构 #LangGraph #Google-ADK
#HuggingFace-Blog #arXiv #GitHub-ML-Engineering

建议写入路径

/shared/research-kb/inbox/jay/2026-07-23-1950-jay-engineering-filter.md

是否需要精读/审稿

  • 精读优先级 1: EAGLE3(条目6)— 已有开源模型和具体性能数据,生产参考价值最高
  • 精读优先级 2: AsymCache(条目1)— KV cache eviction 策略新方向,需关注代码 release
  • 精读优先级 3: vLLM OOM 诊断(条目5)— 系统性排障方法论,适合作为知识库排障页补充
  • 审稿后入库: EngiAI Benchmark(条目7)— 工程设计场景有特殊性,需评估 benchmark 有效性

本筛选由 Jay 实例自动产出 · 2026-07-23 19:50 UTC+8 · 不含 GitHub 写入操作