Jay 工程实践筛选 · 2026-09-22 上午批次
筛选主题
Inference Engines / Kernel Optimization / Agent Frameworks / VectorDB
检索范围
- Tavily: inference engine benchmarks, agent frameworks, vector DB, arXiv kernel optimization, Substack AI engineering
- 时间范围: 2026年9月近两周
- 平台: arXiv, vLLM Blog, Hugging Face Blog, Substack, 技术博客
候选条目
🔴 保留 — 高工程价值
1. vLLM vs SGLang vs LMDeploy vs TensorRT-LLM 2026 H100 Benchmark 对比
- 来源: AIMultiple / Prem AI / Deploybase / Spheron / Jarvis Labs
- 工程价值: ✅ 真实benchmark数据、环境配置(RunPod H100 HBM3, Docker镜像: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404)、性能数字、命令参数
- 核心发现:
- SGLang/LMDeploy ~16,200 tok/s vs vLLM ~12,550 tok/s(H100,29%差距)
- 差距来自引擎内部orchestration overhead,非kernel本身
- SGLang的RadixAttention在重复prefix场景领先;unique prompt差距缩小到3.8%
- TensorRT-LLM冷启动~28min(vs vLLM~62s),但吞吐2,100 tok/s最优
- 保留理由: 真实H100 benchmark数据,包含Tune gpu_memory_utilization、--max_num_batched_tokens等具体配置参数,可直接用于生产选型决策
2. vLLM Prefill-Decode Disaggregation on AMD MI300X
- 来源: vllm.ai blog
- 工程价值: ✅ 生产级架构设计,AMD MORI-IO 8-GPU配置,ITL优化数据
- 核心发现: 单节点prefill/decode分离,使用AMD MORI-IO传输KV cache,改善ITL稳定性
- 保留理由: 异构GPU集群部署参考,vLLM生产架构进阶内容
3. vLLM P-EAGLE / DFlash / DSpark Speculative Decoding
- 来源: vllm.ai blog
- 工程价值: ✅ 新算法详解,并行drafting超越sequential token generation
- 核心发现: 3种并行drafting算法对比,生产级 speculative decoding 配置
- 保留理由: 推理引擎性能优化关键方向,有具体算法描述
4. Kimi K3 Day-0 Support on vLLM
- 来源: vllm.ai blog
- 工程价值: ✅ 新模型支持案例,KDA prefix caching + DSpark speculative decoding
- 保留理由: 国产大模型生产部署参考,H200优化路径
5. RunInfra: StreamIndex / TIDE / AutoMegaKernel / AutoKernel
- 来源: RunInfra (RightNow research lab)
- 工程价值: ✅ arXiv 2026论文,真实代码+PDF,有Triton kernel实现
- 核心发现:
- StreamIndex: streaming top-k sparse attention, fused Triton kernel
- TIDE: per-token early exit, token-informed depth signals
- AutoMegaKernel: 静态检查megakernel合成,自主retargeting
- AutoKernel: LLM-driven iterative kernel搜索
- 保留理由: 前沿CUDA kernel研究,有代码仓库可直接复现
6. KernelPro: LLM-Driven GPU Kernel Optimization
- 来源: arXiv 2606.26453
- 工程价值: ✅ 完整工具链:cuDNN/nsys/nsys profiling + MCTS + roofline bottleneck classification
- 核心发现: 4阶段闭环:semantic feedback operator → two-stage tool invocation → domain-adapted MCTS
- 保留理由: 自动化kernel优化生产级工具链,需要核验profiler集成方案
7. NVIDIA CUDA Optimization Deep Dive for LLM/GenAI
- 来源: Medium (Vivek Dwivedi)
- 工程价值: ✅ 具体命令:--spec_decode, VLLM_ROCM_USE_AITER=1, FlashInfer, torch.compile
- 核心发现:
- INT4 GQA: H100 1.9x decode speedup
- AMD MI300X + vLLM AITER: LLaMA 3.1 70B 1.5-1.8x throughput gain
- 保留理由: 跨厂商GPU优化具体参数,可复现步骤
8. GPU Passthrough for Kubernetes: NVLink Topology + CUDA Memory Pooling
- 来源: TechBinary.cloud
- 工程价值: ✅ 具体配置:single-numa-node policy, cudaMemPool, nvidia-peermem, NVIDIA GPU Operator
- 核心发现: 多租户LLM inference Kubernetes部署的NUMA/ NVLink对齐方案
- 保留理由: K8s GPU调度的生产级配置参考
9. AI Agent Frameworks 2026 Production Comparison
- 来源: Uvik.net / alphacorp.ai / hostkey.com
- 工程价值: ✅ 多框架横向对比表:LangChain, LangGraph, CrewAI, AutoGen, Claude Agent SDK, LlamaIndex, Mastra, PydanticAI, OpenAI Agents SDK, Google ADK
- 核心发现:
- LlamaIndex: RAG-heavy场景最优
- LangGraph: 复杂工作流+状态管理
- CrewAI: 多Agent协作
- PydanticAI: 类型安全+持久化执行
- 保留理由: 生产Agent选型决策参考,有明确场景对照
10. Vector DB Benchmark: Qdrant ~2.1ms p50 / 1M vectors
- 来源: Alphacorp.ai / Actian
- 工程价值: ✅ 真实benchmark数据,Qdrant vs Pinecone vs Weaviate vs pgvector
- 核心发现:
- pgvector适合 <2M向量场景(Instacart案例:80%成本节省)
- Qdrant在50M向量90% recall下:4.74ms p50, 5.79ms p99
- "vector as a feature"趋势:PostgreSQL + pgvector vs 独立向量库
- 保留理由: RAG生产选型数据支撑,有具体延迟数字
11. MTEB Retrieval Sub-task for Embedding Selection
- 来源: Tensoria.fr
- 工程价值: ✅ embedding选型方法论:MTEB leaderboard筛选, Retrieval sub-score > headline score
- 保留理由: RAG eval实践指南,避免选型误区
12. Hugging Face smolagents + Tiny Agents
- 来源: Metacto.com
- 工程价值: ✅ 轻量级Agent框架(~1000行代码),MCP client集成
- 保留理由: HF生态Agent工具链更新
13. Substack: "Physics & Engineering of Frontier LLM Inference" 10-part series
- 来源: DistributedApps.ai (Ken Huang)
- 工程价值: ✅ 系统工程视角:从memory wall到edge SLM deployment
- 保留理由: 工程视角LLM inference系统性梳理,待追踪9月4日首发
14. Substack: "What is inference engineering?" Deepdive
- 来源: Gergely Orosz (Pragmatic Engineer)
- 工程价值: ✅ 业界定义澄清,inference engineering作为独立学科
- 保留理由: AI工程化职业发展参考
🟡 需核验 — 有价值但需进一步验证
15. AI's Memory Wall Problem (Spheron)
- 工程价值: 内存墙分析,MBU%监控方法
- 待核验: 实际MBU%阈值是否经过生产验证
16. Hugging Face Incident + OpenAI retrospective
- 工程价值: 安全事件复盘,CoT monitoring机制
- 待核验: 具体控制措施是否可落地
17. NVIDIA to Acquire Hugging Face ($12.93B)
- 工程价值: 行业影响分析
- 待核验: 对HF平台路线图实际影响(反垄断审批)
⚫ 丢弃 — 低工程价值/信息过时
- LinkedIn/社交媒体泛泛讨论 — 无具体技术细节,仅职位趋势
- Kaneka/AlphaCorp "Best AI Agent Frameworks" — 营销性质内容,无真实benchmark数据
- "AI Engineer vs ML Engineer 2026" — 职业讨论,非工程实践
- 招聘JD分析类文章 — 趋势描述,无可执行内容
分类标签
inference-engineering kernel-optimization vllm sglang cuda triton agent-frameworks rag vector-db production-benchmark
建议写入路径
/shared/research-kb/inbox/jay/2026-09-22-1050-jay-engineering-filter.md
后续行动
精读优先级(高)
- vLLM vs SGLang 2026 H100 Benchmark — 生产选型直接参考,需追踪原始benchmark论文
- KernelPro / RunInfra kernel papers — arXiv核验代码仓库可用性
- vLLM Prefill-Decode Disaggregation — AMD MI300X生产部署参考
审稿优先级(中)
- AI Agent Frameworks comparison — 多源交叉验证框架实际生产案例
- Vector DB benchmark — Qdrant/pgvector具体数字需原始来源核验
主题页更新建议
inference-engineering: 更新vLLM/SGLang/TensorRT-LLM benchmark表kernel-optimization: 新增StreamIndex/TIDE/AutoKernel论文摘要agent-frameworks: 更新2026框架对比表
附:vLLM Blog 本月更新速览
- vLLM Korea Meetup 2026: V1架构更新
- Prefill-Decode Disaggregation: AMD MORI-IO
- P-EAGLE/DSpark/DSpark: Speculative Decoding新算法
- Kimi K3 Day-0支持