工程实践筛选 · Jay · 2026-07-23 19:50 (UTC+8)
筛选轮次: 本轮第3次
检索范围: arXiv (KV cache优化、Multi-Agent benchmark)、HuggingFace Blog (推理优化)、GitHub ML工程、vLLM OOM诊断、Substack RAG架构
本次重点: 可复现步骤、真实性能数据、源码级分析、命令参数
🔴 高价值条目(保留)
条目 1:ArXiv — AsymCache (Multi-Segment Attention) KV Cache 优化
| 字段 |
内容 |
| 来源 |
arXiv · 2606.02964v1 |
| 链接 |
https://arxiv.org/html/2606.02964v1 |
| 可信度 |
高 — 学术论文,有量化数据 |
| 发布时间 |
2026-06 |
核心内容
- 问题: 现有 KV cache 管理系统的 eviction 策略基于访问频率或位置启发式,未考虑不同 KV cache block 对 GPU attention kernel 执行效率的影响
- 方案: AsymCache,核心是 Multi-Segment Attention (MSA) + computation-latency-aware eviction policy
- 关键创新:
1. MSA:高效处理非连续 KV context
2. Cache eviction policy:联合优化 hit rate 和 position-aware recomputation cost
3. Adaptive chunking scheduler:高硬件利用率
真实性能数据
| 指标 |
提升幅度 |
| TTFT (Time To First Token) |
1.90–2.03× 降低 |
| TPOT (Time Per Output Token) |
1.62–1.71× 降低 |
| Agent serving (Continuum) 平均延迟 |
-18.1% |
工程价值判断
- 保留理由: 有具体性能提升数字,与 GPU attention kernel 行为对齐,是 KV cache eviction 策略的新方向
- 注意: 需等开源代码 release 后核验实际部署效果
- 入库建议: 「KV Cache 优化」主题页
条目 2:ArXiv — Kareto: Adaptive Multi-Objective KV Cache 分层存储
| 字段 |
内容 |
| 来源 |
arXiv · 2603.08739v1 |
| 链接 |
https://arxiv.org/html/2603.08739v1 |
| 可信度 |
高 — 学术论文,有多目标优化理论 |
| 发布时间 |
2026-03 |
核心内容
- 问题: KV cache 从 GPU HBM offload 到外部存储时,如何在 cost/throughput/latency 之间平衡
- 方案: Kareto — KV-cache Adaptive REsource managemenT Optimizer
- 关键设计:
1. 多目标优化:Pareto frontier 跨 GPU HBM / host DRAM / disk 三层
2. Fine-grained adaptive tuner:基于 eviction policies 和 KV block access patterns 做 group-specific cache management
工程价值判断
- 保留理由: 解决了长 context 场景下 KV cache 内存瓶颈问题,有分层存储工程思路
- 入库建议: 「KV Cache 优化 / 边缘推理」主题页
条目 3:ArXiv — DualPath: Agentic LLM Inference 存储带宽优化
| 字段 |
内容 |
| 来源 |
arXiv · 2602.21548v2 |
| 链接 |
https://arxiv.org/html/2602.21548v2 |
| 可信度 |
高 — 学术论文,有基准测试 |
| 发布时间 |
2026-02 |
核心内容
- 问题: 多轮 agentic LLM 推理中,KV-Cache storage I/O 成为瓶颈,存储 NIC 在 prefill 引擎侧带宽饱和,decode 引擎侧空闲
- 方案: DualPath — dual-path KV-Cache loading
1. 传统 storage-to-prefill 路径
2. 新路径 storage-to-decode:KV-Cache load 到 decode 引擎后通过 RDMA transfer 到 prefill 引擎
- 关键数据: 离线推理吞吐量最高 1.87× 提升
工程价值判断
- 保留理由: disaggregated 架构下的存储 I/O 优化,有真实 agentic workload 测试
- 入库建议: 「LLM 推理系统 / 存储优化」主题页
条目 4:GitHub — stas00/ml-engineering 开源书籍
| 字段 |
内容 |
| 来源 |
GitHub · stas00/ml-engineering |
| 链接 |
https://github.com/stas00/ml-engineering |
| 可信度 |
高 — 开源工程实践书籍 |
| 更新时间 |
2026-01 活跃 |
核心内容
- 定位: Machine Learning Engineering Open Book
- 重点章节(与本轮主题相关):
- GPU Mode community talk (2026-01-10):Accelerator 性能现实、网络和存储对 ensemble 性能的影响
- ML 工程弹性技能建设
- 工程价值: 系统性 ML 工程实践,有真实 GPU 集群和分布式训练内容
工程价值判断
- 保留理由: 工程导向,开源可复现,适合作为 ML 系统工程参考
- 入库建议: 「ML 工程实践」资源页
条目 5:vLLM OOM 根因诊断指南
| 字段 |
内容 |
| 来源 |
paralleliq.ai |
| 链接 |
https://www.paralleliq.ai/blog/vllm-oom-errors-root-cause-diagnosis |
| 可信度 |
中 — 第三方博客,有分类方法论 |
| 发布时间 |
2026 |
核心内容(OOM 三种模式分类)
| OOM 类型 |
特征 |
根因 |
| KV Cache Overflow |
长 context 请求时 OOM(32K/128K) |
KV cache 内存超出限制 |
| Startup OOM |
启动或首个 batch 时 OOM |
模型加载时内存分配问题 |
| Session OOM |
推理结束后 OOM |
内存释放不完整 / memory leak |
关键诊断步骤
- 识别 OOM 发生阶段(启动 / 推理中 / 推理后)
- 检查
gpu_memory_utilization 设置
- 验证
max_model_len 是否与实际请求匹配
- 检查 batch size 配置
- 考虑量化(INT8/FP8/NVFP4)作为根治手段
工程价值判断
- 保留理由: 系统性 OOM 分类诊断方法,有别于逐条 Bug 报告的归纳整理
- 入库建议: 「vLLM 生产调优 / OOM 排障」主题页
条目 6:HuggingFace — EAGLE3 Speculative Decoding (Qwen3-Coder-Next)
| 字段 |
内容 |
| 来源 |
HuggingFace Blog |
| 链接 |
https://huggingface.co/blog/lujangusface/tw-eagle3-qwen3-coder-next |
| 可信度 |
高 — 官方博客,有开源模型 |
| 发布时间 |
2026-06 |
核心内容
- 技术: EAGLE3 speculative decoding
- 目标模型: Qwen3-Coder-Next — 80B MoE, 512 experts, 10 active per token(Alibaba, 2026-02)
- 性能数据:
- Mean single-user throughput: 1.37× 提升
- SWEBench-Verified peak: 1.52× 提升
- Draft head 大小:~278 MB(Qwen3-Coder-Next)
- 工程要点:
- MoE 架构的 EAGLE3 需要注意:EAGLE3 auxiliary layers 必须从 attention layers 选择,因为 GDN recurrent states 与 speculative decoding 不兼容
工程价值判断
- 保留理由: 真实的生产级推理加速案例,MoE + speculative decoding 的工程挑战有代表性
- 入库建议: 「LLM 推理优化 / Speculative Decoding」主题页
🟡 中等价值(降级保留)
条目 7:ArXiv — EngiAI Multi-Agent Benchmark (工程设计 LLM Agent)
| 字段 |
内容 |
| 来源 |
arXiv · 2605.19743v1 |
| 链接 |
https://arxiv.org/html/2605.19743v1 |
| 可信度 |
中 — 学术论文,有 benchmark 设计 |
| 发布时间 |
2026-05 |
核心内容
- 定位: Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
- 亮点:
1. LangGraph-based multi-agent reference implementation(拓扑优化 + RAG + HPC orchestration + 3D 打印控制)
2. Gated RAG scoring mechanism(隔离文档检索对参数选择的贡献)
3. HPC benchmark(SLURM 集群上端到端 ML 训练编排)
- 工程价值: 工程设计场景的 agent benchmark,覆盖 RAG + HPC + 工具调用
入库判断
- 保留理由: 工程设计场景的具体 benchmark,有 LangGraph 参考实现
- 入库建议: 「Agent Benchmark / 工程场景」主题页
条目 8:ArXiv — Context Engineering (企业多 Agent 架构)
| 字段 |
内容 |
| 来源 |
arXiv · 2603.09619 |
| 链接 |
https://arxiv.org/pdf/2603.09619 |
| 可信度 |
中 — 学术论文,有架构分析 |
| 发布时间 |
2026-03 |
核心内容
- 问题: Context Engineering 作为独立学科,设计和管理 AI agent 决策的整个信息环境
- 架构参考: Google ADK、Anthropic、LangChain vendor architectures
- 5个生产级上下文质量标准: relevance、sufficiency、isolation、economy、provenance
- Pyramid 模型: Prompt Engineering → Context Engineering → Agent Engineering 四级成熟度
入库判断
- 保留理由: 企业级 agent 架构的框架性思考,与 Google ADK / Anthropic 的实际产品对齐
- 入库建议: 「Agent 架构 / Context Engineering」主题页
条目 9:Substack — Comparative RAG Architectures 2026
| 字段 |
内容 |
| 来源 |
micheallanham.substack.com |
| 链接 |
https://micheallanham.substack.com/p/comparative-analysis-of-rag-architectures |
| 可信度 |
中 — 技术博客,有架构分类 |
| 发布时间 |
2026-02 |
核心内容
- 三种 RAG 架构对比:
1. Pipeline RAG: 单跳问题 baseline,低延迟
2. Agentic RAG: 动态自纠正循环,迭代检索
3. Knowledge Graph RAG (GraphRAG): 实体关系结构,关系查询和全局数据集合成
- 2026 数据点: 57% 企业已部署多阶段 agents;质量仍是首要生产障碍
入库判断
- 保留理由: 2026 RAG 架构全景,对生产选型有参考价值
- 入库建议: 「RAG 架构 / 2026 技术全景」主题页
🔵 已覆盖/丢弃条目
| 条目 |
原因 |
| GitHub Issue #12496 (SGLang vs vLLM CUDA OOM) |
已在 2026-07-23 14:52 筛选覆盖(H4 条目) |
| SGLang Troubleshooting 文档 |
已在 2026-07-23 14:52 筛选覆盖(H1 条目) |
| vLLM OOM Checklist (sector88) |
已在 2026-07-23 14:52 筛选覆盖(H2 条目) |
| vLLM Production Guide (SitePoint) |
已在 2026-07-23 14:52 筛选覆盖(H3 条目) |
| AliYun ACK K8s 部署 |
已在 2026-07-23 14:52 筛选覆盖(H5 条目) |
| arXiv 2603.04428 (Persistent Q4 KV Cache) |
已在 2026-07-23 14:52 筛选覆盖(H7 条目) |
| SGLang vs vLLM Benchmark (particula.tech) |
已在 2026-07-23 10:50 筛选覆盖 |
| vLLM v0.25.1 Bugs (#49476, #49460, #49449, #49480) |
已在 2026-07-23 10:50 筛选覆盖 |
| SGLang v0.5.15.post1 Bugs (#31995, #31970, #31974, #31972, #31929) |
已在 2026-07-23 10:50 筛选覆盖 |
| arXiv KV Cache Optimization Survey |
丢弃 — 纯综述,无原创工程数据 |
| GitHub ML Roadmap 2026 (PrinceSinghhub) |
丢弃 — 学习路线,非工程实践产出 |
分类标签
#KV-Cache #推理优化 #AsymCache #Kareto #DualPath #分层存储 #vLLM
#OOM-Diagnosis #Speculative-Decoding #EAGLE3 #MoE #Multi-Agent
#Benchmark #Context-Engineering #RAG-架构 #LangGraph #Google-ADK
#HuggingFace-Blog #arXiv #GitHub-ML-Engineering
建议写入路径
/shared/research-kb/inbox/jay/2026-07-23-1950-jay-engineering-filter.md
是否需要精读/审稿
- 精读优先级 1: EAGLE3(条目6)— 已有开源模型和具体性能数据,生产参考价值最高
- 精读优先级 2: AsymCache(条目1)— KV cache eviction 策略新方向,需关注代码 release
- 精读优先级 3: vLLM OOM 诊断(条目5)— 系统性排障方法论,适合作为知识库排障页补充
- 审稿后入库: EngiAI Benchmark(条目7)— 工程设计场景有特殊性,需评估 benchmark 有效性
本筛选由 Jay 实例自动产出 · 2026-07-23 19:50 UTC+8 · 不含 GitHub 写入操作