Jay · 早间工程情报简报 · 2026-10-08 09:30

主题

推理引擎 vLLM vs SGLang · Agent 框架 2026 格局 · 向量数据库选型 · Substack 高质量专栏 · ArXiv RAG 论文

检索范围

  • GitHub Trending API · vLLM/SGLang 官方文档 · Hugging Face trending models
  • arXiv (LLM inference / RAG / agents)
  • Substack (Simon Willison · Eugene Yan · Cameron R. Wolfe)
  • Vector DB 对比(Benchmarks · 2026 最新数据)
  • Agent 框架格局(AutoGen 维护模式 · LangGraph v0.4 · CrewAI)

🧊 一、LLM 推理引擎格局(2026 Q3-Q4 现状)

🔴 高优先级 · vLLM v0.30.0 vs SGLang v0.5.20 全面对比

来源: - LeetLLM: https://leetllm.com/blog/llm-inference-engine-comparison-2026 - MorphLLM: https://www.morphllm.com/comparisons/sglang-vs-vllm - Spheron: https://www.spheron.network/blog/vllm-vs-sglang-2026 - Yobitel: https://yobitel.com/knowledge-base/sglang - Yotta Labs: https://www.yottalabs.ai/post/what-is-sglang-architecture-performance-and-when-to-use-it

核心数据(H100 80GB,实测 benchmark):

指标 SGLang v0.5.20 vLLM v0.30.0
Llama 3.1 8B 吞吐量 ~16,200 tok/s ~12,500 tok/s
领先幅度 +29% baseline
多轮对话(75-95% cache hit) +10-20% 额外提升 需手动 APC 配置
Spec Decoding 成熟度 较新(Eagle2/DFlash/Spec V2) 更成熟(Eagle3 30-45% decode 加速)
Qwen3.8-27B 兼容性 正常(需调 state cache) 需降 sequence limit
多 LoRA ❌ ✅ 原生支持

RadixAttention vs PagedAttention 架构差异:

  • PagedAttention (vLLM):固定大小 blocks,按需分配,请求结束时释放;KV cache 按 block 组织,跨请求共享需手动 APC 配置
  • RadixAttention (SGLang):radix tree 自动发现跨请求共享前缀,多轮对话/Agent 场景自动复用 KV cache,无需手动配置;SGLang 官方数据:trillions tokens/day,400,000+ GPUs,xAI/Cursor/LinkedIn/AMD/NVIDIA 生产用户

选型建议(综合多个来源 2026 Q3-Q4):

场景 推荐 理由
多轮 Agent / 工具调用 / RL rollout SGLang RadixAttention 自动前缀复用,75-95% cache hit
单轮高并发 / 吞吐优先 vLLM 成熟连续 batching,MRv2 默认启用
需要多 LoRA vLLM SGLang 暂无 LoRA 支持
延迟敏感 + speculative decoding vLLM Eagle3 生态更成熟
复杂结构化输出 / grammar cache SGLang 略优 RadixAttention + schema cache 热身
主流开源模型日常部署 vLLM 风险低 插件生态最广,NVIDIA NIM 也在用

可信度:高(多来源交叉验证,benchmark 数据来自 RunPod H100 SXM 80GB)


🟡 SGLang 2026 技术里程碑(值得记录)

来源:GitHub sgl-project/sglang · SGLang Official Blog

  • 2026/02:GB300 NVL72 上 25x 推理性能提升(与 NVIDIA 合作)
  • 2026/04:DeepSeek-V4 Day 0 支持(SGLang + Miles)
  • 2026/06:Speculative Decoding DFlash + Spec V2 发布(下一代推测解码)
  • 2026/07:Kimi K3 Day 0 支持;GLM5.2 NVFP4 达 500 TPS(两周集成);RadixArk + Google TPU 完整支持
  • v0.5.20(Sept 18, 2026):当前 stable,2-4 周发版节奏

SGLang Speculative Decoding Roadmap 2026 Q2(GitHub Issue #23005): - DFlash:新增 draft method - Spec V2:完全 overlap,移除 wait_for_verify 同步瓶颈 - Adaptive Speculative Decoding:按请求难度动态调整 draft 数 - Parallel Speculative Decoding:多租户 remote drafter - N-gram speculative decoding:持续迭代

建议:精读 SGLang 官方 blog 对 GB300 的实测报告,内容涉及 NVL72 rack-scale GPU 拓扑,25x 性能数据需原文核验


🟡 vLLM v0.30.0 关键更新(Sept 2026)

来源:GitHub vllm-project/vllm/releases · vLLM Docs

  • MRv2(Model Runner V2)全面取代旧版:dense model 默认路径,支持 EVS/realtime embeddings/prefix caching for Mamba
  • PagedAttention V1 后端移除旧实现:Legacy attention deleted,MRv2 + FlashAttention/FlashInfer/TRTLLM-GEN/FlashMLA/Triton 为标准
  • Eagle3 speculative decoding:低并发(1-4 requests)30-45% decode 加速;中并发(10-20)15-20%
  • Disaggregated prefill/decode:prefill-decode 分离,支持 AMD MORI-IO(MI300X)
  • 量化支持扩展:MXFP8/MXFP4/NVFP4/INT8/INT4/GPTQ/AWQ/GGUF/compressed-tensors/ModelOpt/TorchAO
  • 多模态 prefix bidirectional attention:新增支持
  • 前缀缓存 Mamba hybrid models:新增支持

建议:vLLM v0.30 更新幅度大,建议单独建专题页,关注 MRv2 迁移路径和 disagg prefill/decode 实测


🤖 二、Agent 框架 2026 格局(重大变化)

来源: - PECollective: https://pecollective.com/blog/ai-agent-frameworks-compared - TowardsAI: https://pub.towardsai.net/langgraph-vs-crewai-vs-autogen-which-ai-agent-framework-should-your-enterprise-use-in-2026-3a9ebb407b09 - OriginsHQ: https://originshq.com/feeds/ai-agent-frameworks-for-production - Uvik: https://uvik.net/blog/agentic-ai-frameworks - Cordum: https://cordum.io/blog/ai-agent-frameworks-comparison

⚠️ 重大变化:Microsoft AutoGen 宣布进入维护模式

关键事件:2026 年,Microsoft 将 AutoGen + Semantic Kernel 合并为 Microsoft Agent Framework,2026 年 4 月达 v1.0 GA。AutoGen 本身进入 maintenance mode(接收安全修复,不再新功能开发)。

AutoGen → Microsoft Agent Framework 迁移路径: - conversable-agent 模式映射到全新的 graph-based 模型 - 新项目建议直接评估 Microsoft Agent Framework - 现有 AutoGen 系统继续运行,迁移需架构重写

生产选型安全组合(2026 Q1): - AutoGen 1.0.0 + LangGraph 0.3.18 + CrewAI 0.95.x - 以上为大多数生产团队 end of Q1 2026 运行的稳定组合

三大框架现状对比(2026 Q3-Q4)

框架 2026 Q3-Q4 状态 适用场景 生产风险
LangGraph v0.4 ✅ 活跃,状态持久化+HITL checkpoints 复杂有状态工作流,可审计,循环分支 最低(LangChain 生态保障)
CrewAI 0.95.x ✅ 社区活跃,企业级 observability + scheduling 快速原型,角色型 Agent 团队 中(相对小团队,框架风险高于 LangGraph)
AutoGen 0.2 🔴 maintenance,不新功能 已有系统维持 高(无新功能,建议迁移)
Microsoft Agent Framework 1.0 🆕 新,AutoGen+SemanticKernel 合并 Microsoft 生态团队 待观察

2000-run benchmark 关键数据(Uvik, 2026): - LangGraph:延迟最低(5 tasks,100 runs/framework) - LangChain:token 效率最优 - AutoGen:延迟与 LangGraph 相当,token profile 不同 - CrewAI:简单任务 token 消耗约其他框架 3x(one-tool-call flows)

建议:精读 TowardsAI 文章,了解 Microsoft Agent Framework 1.0 架构细节;现有 AutoGen 系统需制定迁移计划


🗄️ 三、向量数据库 2026 Q3-Q4 Benchmark

来源: - ComputingForGeeks: https://computingforgeeks.com/qdrant-weaviate-milvus-pgvector - Kalvium Labs: https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate - Firecrawl: https://www.firecrawl.dev/blog/best-vector-databases - pkgpulse: https://www.pkgpulse.com/guides/pgvector-vs-qdrant-vs-weaviate-vector-databases-2026 - Alpha Corp: https://alphacorp.ai/blog/best-vector-databases-rag-2026-top-7-picks

单节点 Benchmarks(8 vCPU / 16 GB RAM,1.18M vectors):

数据库 版本 索引构建时间 内存占用 查询延迟
Milvus 2.5 ~4.8 min 高 快
Qdrant 1.19 ~6 min 最低内存 sub-ms class
Weaviate 1.27 ~7 min 中 高 recall 优先
pgvector (PostgreSQL 17) ~11 min(HNSW build 617s) 中 <5ms overhead

关键结论(多来源共识):

  1. pgvector:最适合已有 Postgres 基础设施,<50M vectors,无需新服务
  2. Qdrant:自托管 RAG 默认首选,内存占用最小,sub-millisecond 查询,单容器部署
  3. Weaviate:混合搜索(vector + BM25 + metadata filters)最强,适合查询质量优先场景
  4. Milvus:>100M vectors + 分片需求时使用
  5. Pinecone:零运维需求,愿意付费的团队
  6. Chroma/LanceDB:本地快速原型

pgvector 0.7.x 注意事项: - HNSW build 耗时(617s for 1.18M rows),需要预规划 - 适合 <50M vectors,结构化数据与向量共存场景 - COPY 阶段快(45s for 1.18M rows),主要时间在并行 HNSW 构建

建议:向量数据库选型页需更新 2026 Q3 数据;Qdrant 内存效率优势需重点标注


📝 四、Substack 高质量专栏(AI Engineering / ML Research)

来源:eugeneyan.com · PECollective · Cameron R. Wolfe Substack Recommendations

推荐订阅(按质量排序)

1. Eugene Yan(Amazon 应用科学家) - 专栏:https://eugeneyan.com - 覆盖:evals、RAG patterns、系统设计、团队建设 - 特色:ML system design primer posts,reference quality - 推荐理由:写给实践者,避坑指南,工程导向

2. Cameron R. Wolfe(Deep (Learning) Focus) - 专栏:https://cameronrwolfe.substack.com - 覆盖:NLP/ML 前沿论文深度解析,Top AI Papers of the Week - 推荐他关注的:NLP Newsletter(Elvis),AI by Hand(Prof. Tom Yeh) - 推荐理由:ACL/ICML/NeurIPS 论文技术洞察,质量高

3. Simon Willison - 专栏:https://simonw.substack.com - 近期高价值帖:2026 in LLMs (so far) — 涵盖 Claude Opus 5.5、GPT-6 Sol/Luna、价格战 - 推荐理由:AI 实战经验,工具使用,数据隐私视角,Scott Alexander 级别的深度思考

4. Astral Codex Ten(Scott Alexander) - 覆盖:AI safety、AI policy、meta-research - 推荐理由:争议话题的深度辩论,slow thinking 模型

5. LLM Watch(Pascal Biese) - 周更,关注最重要 LLM 论文,人视角解读 - 覆盖:cutting edge AI research,human perspective

6. Almost Timely(Christopher S. Penn) - 覆盖:AI 技术走向,实践指南 - 特色:技术 SEO + AI 工具组合

不推荐(可信度问题):Marcus on AI(Gary Marcus)— 观点偏激但作为对冲有用


📄 五、ArXiv 精选论文(2026 新发表)

#1 InferenceBench: AI Agent 驱动的 LLM 推理优化 Benchmark

  • arXiv: https://arxiv.org/abs/2607.20468
  • 核心:衡量 AI Agent(Claude Code / Codex CLI / OpenCode)对完整 OpenAI-compatible inference server 端到端部署优化的能力
  • 关键发现:Agent 在 vLLM 和 SGLang 上可完成推理优化任务,但结果与 matched-budget 非 Agent 搜索 baseline 比较(而非 ground truth patch)
  • 工程价值:★★★★(评估 AI Agent 自动化运维能力的标准 benchmark)
  • 可信度:arXiv,ACL 2026 相关工作

#2 LIMBO: Agent 推理时记忆与预算优化

  • arXiv: https://arxiv.org/abs/2609.14138
  • 核心:lifelong inference-time memory 和 budget 优化,ICTAI 2026 接收
  • 工程价值:★★★(多轮 Agent 场景的 token 预算控制)
  • 可信度:IEEE ICTAI 2026 同行评审

#3 LLM-CoOpt: 异构平台 LLM 推理 co-design 框架

  • arXiv: https://arxiv.org/abs/2602.09323
  • 核心:Opt-KV(动态 KV cache 量化)+ Opt-GQA(轻量 grouped query attention)+ Opt-Pa(paged attention 优化);throughput +7-12% across LLaMa variants
  • 工程价值:★★★★(HBM 瓶颈缓解的算法-硬件协同设计)
  • 可信度:arXiv,方法论完整

#4 Reason & Verify: 忠实性 RAG 框架

  • arXiv: https://arxiv.org/abs/2603.10143(Canadian AI 2026 接收)
  • 核心:检索-推理对齐,减少 RAG hallucination
  • 工程价值:★★★(RAG 质量提升路径)

#5 DA-RAG: 动态子图检索 RAG

  • arXiv: https://arxiv.org/abs/2602.08545
  • 核心:Embedding-Attributed Community Search,动态子图检索;GraphRAG-Global 平均 win rate 57.34%
  • 工程价值:★★★★(复杂知识图谱 RAG 场景)
  • 可信度:arXiv,消融实验充分

#6 UniversalRAG: 多模态统一 RAG

  • arXiv: https://arxiv.org/abs/2504.20734(ACL 2026 接收)
  • 核心:跨模态/粒度的统一 RAG 框架(text/image/video/table)
  • 工程价值:★★★★(多模态 RAG 系统设计参考)
  • 可信度:ACL 2026,顶会接收

#7 Adaptively Robust LLM Inference Scheduling

  • arXiv: https://arxiv.org/abs/2508.14544
  • 核心:在线多任务 LLM inference 的调度优化,最小化总延迟
  • 工程价值:★★★★(在线推理服务 capacity planning)
  • 理论价值:Jaillet et al. 2025 框架扩展,理论基础扎实

📌 分类标签

LLM推理 vLLM SGLang 向量数据库 Qdrant pgvector Agent框架 LangGraph CrewAI AutoGen MicrosoftAgentFramework RAG ArXiv Substack InferenceBench speculative-decoding RadixAttention PagedAttention


✅ 建议写入路径

草稿路径 内容
2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md 本文件,含推理引擎/Agent框架/向量DB/Substack/ArXiv
2026-10-08-vecdb-benchmark-qdrant-pgvector-2026.md 向量数据库 Benchmark 专题(可独立建页)
2026-10-08-agent-framework-2026-autogen-maintenance-langgraph-crewai.md Agent 框架格局专题

🔍 后续行动建议

  1. 精读:SGLang GB300 25x 性能报告(NVL72 rack-scale);Microsoft Agent Framework 1.0 架构文档
  2. 核验:InferenceBench GitHub repo 验证 benchmark 指标;vLLM v0.30 MRv2 迁移 checklist
  3. 更新:「LLM 推理引擎选型」主题页,整合 vLLM v0.30 / SGLang v0.5.20 对比数据
  4. 订阅补充:Eugene Yan / Cameron R. Wolfe / Simon Willison 加入知识库参考源
  5. 专题页:「Agent 框架 2026 格局」,标注 AutoGen maintenance + Microsoft Agent Framework 崛起

Jay · 2026-10-08 09:30 CST · 第 7 轮早间简报