Jay 工程实践筛选 · 2026-09-22 上午批次

筛选主题

Inference Engines / Kernel Optimization / Agent Frameworks / VectorDB

检索范围

  • Tavily: inference engine benchmarks, agent frameworks, vector DB, arXiv kernel optimization, Substack AI engineering
  • 时间范围: 2026年9月近两周
  • 平台: arXiv, vLLM Blog, Hugging Face Blog, Substack, 技术博客

候选条目

🔴 保留 — 高工程价值

1. vLLM vs SGLang vs LMDeploy vs TensorRT-LLM 2026 H100 Benchmark 对比

  • 来源: AIMultiple / Prem AI / Deploybase / Spheron / Jarvis Labs
  • 工程价值: ✅ 真实benchmark数据、环境配置(RunPod H100 HBM3, Docker镜像: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404)、性能数字、命令参数
  • 核心发现:
  • SGLang/LMDeploy ~16,200 tok/s vs vLLM ~12,550 tok/s(H100,29%差距)
  • 差距来自引擎内部orchestration overhead,非kernel本身
  • SGLang的RadixAttention在重复prefix场景领先;unique prompt差距缩小到3.8%
  • TensorRT-LLM冷启动~28min(vs vLLM~62s),但吞吐2,100 tok/s最优
  • 保留理由: 真实H100 benchmark数据,包含Tune gpu_memory_utilization、--max_num_batched_tokens等具体配置参数,可直接用于生产选型决策

2. vLLM Prefill-Decode Disaggregation on AMD MI300X

  • 来源: vllm.ai blog
  • 工程价值: ✅ 生产级架构设计,AMD MORI-IO 8-GPU配置,ITL优化数据
  • 核心发现: 单节点prefill/decode分离,使用AMD MORI-IO传输KV cache,改善ITL稳定性
  • 保留理由: 异构GPU集群部署参考,vLLM生产架构进阶内容

3. vLLM P-EAGLE / DFlash / DSpark Speculative Decoding

  • 来源: vllm.ai blog
  • 工程价值: ✅ 新算法详解,并行drafting超越sequential token generation
  • 核心发现: 3种并行drafting算法对比,生产级 speculative decoding 配置
  • 保留理由: 推理引擎性能优化关键方向,有具体算法描述

4. Kimi K3 Day-0 Support on vLLM

  • 来源: vllm.ai blog
  • 工程价值: ✅ 新模型支持案例,KDA prefix caching + DSpark speculative decoding
  • 保留理由: 国产大模型生产部署参考,H200优化路径

5. RunInfra: StreamIndex / TIDE / AutoMegaKernel / AutoKernel

  • 来源: RunInfra (RightNow research lab)
  • 工程价值: ✅ arXiv 2026论文,真实代码+PDF,有Triton kernel实现
  • 核心发现:
  • StreamIndex: streaming top-k sparse attention, fused Triton kernel
  • TIDE: per-token early exit, token-informed depth signals
  • AutoMegaKernel: 静态检查megakernel合成,自主retargeting
  • AutoKernel: LLM-driven iterative kernel搜索
  • 保留理由: 前沿CUDA kernel研究,有代码仓库可直接复现

6. KernelPro: LLM-Driven GPU Kernel Optimization

  • 来源: arXiv 2606.26453
  • 工程价值: ✅ 完整工具链:cuDNN/nsys/nsys profiling + MCTS + roofline bottleneck classification
  • 核心发现: 4阶段闭环:semantic feedback operator → two-stage tool invocation → domain-adapted MCTS
  • 保留理由: 自动化kernel优化生产级工具链,需要核验profiler集成方案

7. NVIDIA CUDA Optimization Deep Dive for LLM/GenAI

  • 来源: Medium (Vivek Dwivedi)
  • 工程价值: ✅ 具体命令:--spec_decode, VLLM_ROCM_USE_AITER=1, FlashInfer, torch.compile
  • 核心发现:
  • INT4 GQA: H100 1.9x decode speedup
  • AMD MI300X + vLLM AITER: LLaMA 3.1 70B 1.5-1.8x throughput gain
  • 保留理由: 跨厂商GPU优化具体参数,可复现步骤
  • 来源: TechBinary.cloud
  • 工程价值: ✅ 具体配置:single-numa-node policy, cudaMemPool, nvidia-peermem, NVIDIA GPU Operator
  • 核心发现: 多租户LLM inference Kubernetes部署的NUMA/ NVLink对齐方案
  • 保留理由: K8s GPU调度的生产级配置参考

9. AI Agent Frameworks 2026 Production Comparison

  • 来源: Uvik.net / alphacorp.ai / hostkey.com
  • 工程价值: ✅ 多框架横向对比表:LangChain, LangGraph, CrewAI, AutoGen, Claude Agent SDK, LlamaIndex, Mastra, PydanticAI, OpenAI Agents SDK, Google ADK
  • 核心发现:
  • LlamaIndex: RAG-heavy场景最优
  • LangGraph: 复杂工作流+状态管理
  • CrewAI: 多Agent协作
  • PydanticAI: 类型安全+持久化执行
  • 保留理由: 生产Agent选型决策参考,有明确场景对照

10. Vector DB Benchmark: Qdrant ~2.1ms p50 / 1M vectors

  • 来源: Alphacorp.ai / Actian
  • 工程价值: ✅ 真实benchmark数据,Qdrant vs Pinecone vs Weaviate vs pgvector
  • 核心发现:
  • pgvector适合 <2M向量场景(Instacart案例:80%成本节省)
  • Qdrant在50M向量90% recall下:4.74ms p50, 5.79ms p99
  • "vector as a feature"趋势:PostgreSQL + pgvector vs 独立向量库
  • 保留理由: RAG生产选型数据支撑,有具体延迟数字

11. MTEB Retrieval Sub-task for Embedding Selection

  • 来源: Tensoria.fr
  • 工程价值: ✅ embedding选型方法论:MTEB leaderboard筛选, Retrieval sub-score > headline score
  • 保留理由: RAG eval实践指南,避免选型误区

12. Hugging Face smolagents + Tiny Agents

  • 来源: Metacto.com
  • 工程价值: ✅ 轻量级Agent框架(~1000行代码),MCP client集成
  • 保留理由: HF生态Agent工具链更新

13. Substack: "Physics & Engineering of Frontier LLM Inference" 10-part series

  • 来源: DistributedApps.ai (Ken Huang)
  • 工程价值: ✅ 系统工程视角:从memory wall到edge SLM deployment
  • 保留理由: 工程视角LLM inference系统性梳理,待追踪9月4日首发

14. Substack: "What is inference engineering?" Deepdive

  • 来源: Gergely Orosz (Pragmatic Engineer)
  • 工程价值: ✅ 业界定义澄清,inference engineering作为独立学科
  • 保留理由: AI工程化职业发展参考

🟡 需核验 — 有价值但需进一步验证

15. AI's Memory Wall Problem (Spheron)

  • 工程价值: 内存墙分析,MBU%监控方法
  • 待核验: 实际MBU%阈值是否经过生产验证

16. Hugging Face Incident + OpenAI retrospective

  • 工程价值: 安全事件复盘,CoT monitoring机制
  • 待核验: 具体控制措施是否可落地

17. NVIDIA to Acquire Hugging Face ($12.93B)

  • 工程价值: 行业影响分析
  • 待核验: 对HF平台路线图实际影响(反垄断审批)

⚫ 丢弃 — 低工程价值/信息过时

  1. LinkedIn/社交媒体泛泛讨论 — 无具体技术细节,仅职位趋势
  2. Kaneka/AlphaCorp "Best AI Agent Frameworks" — 营销性质内容,无真实benchmark数据
  3. "AI Engineer vs ML Engineer 2026" — 职业讨论,非工程实践
  4. 招聘JD分析类文章 — 趋势描述,无可执行内容

分类标签

inference-engineering kernel-optimization vllm sglang cuda triton agent-frameworks rag vector-db production-benchmark

建议写入路径

/shared/research-kb/inbox/jay/2026-09-22-1050-jay-engineering-filter.md

后续行动

精读优先级(高)

  1. vLLM vs SGLang 2026 H100 Benchmark — 生产选型直接参考,需追踪原始benchmark论文
  2. KernelPro / RunInfra kernel papers — arXiv核验代码仓库可用性
  3. vLLM Prefill-Decode Disaggregation — AMD MI300X生产部署参考

审稿优先级(中)

  1. AI Agent Frameworks comparison — 多源交叉验证框架实际生产案例
  2. Vector DB benchmark — Qdrant/pgvector具体数字需原始来源核验

主题页更新建议

  • inference-engineering: 更新vLLM/SGLang/TensorRT-LLM benchmark表
  • kernel-optimization: 新增StreamIndex/TIDE/AutoKernel论文摘要
  • agent-frameworks: 更新2026框架对比表

附:vLLM Blog 本月更新速览

  • vLLM Korea Meetup 2026: V1架构更新
  • Prefill-Decode Disaggregation: AMD MORI-IO
  • P-EAGLE/DSpark/DSpark: Speculative Decoding新算法
  • Kimi K3 Day-0支持