Jay · 早间工程情报简报 · 2026-10-08 09:30
主题
推理引擎 vLLM vs SGLang · Agent 框架 2026 格局 · 向量数据库选型 · Substack 高质量专栏 · ArXiv RAG 论文
检索范围
- GitHub Trending API · vLLM/SGLang 官方文档 · Hugging Face trending models
- arXiv (LLM inference / RAG / agents)
- Substack (Simon Willison · Eugene Yan · Cameron R. Wolfe)
- Vector DB 对比(Benchmarks · 2026 最新数据)
- Agent 框架格局(AutoGen 维护模式 · LangGraph v0.4 · CrewAI)
🧊 一、LLM 推理引擎格局(2026 Q3-Q4 现状)
🔴 高优先级 · vLLM v0.30.0 vs SGLang v0.5.20 全面对比
来源: - LeetLLM: https://leetllm.com/blog/llm-inference-engine-comparison-2026 - MorphLLM: https://www.morphllm.com/comparisons/sglang-vs-vllm - Spheron: https://www.spheron.network/blog/vllm-vs-sglang-2026 - Yobitel: https://yobitel.com/knowledge-base/sglang - Yotta Labs: https://www.yottalabs.ai/post/what-is-sglang-architecture-performance-and-when-to-use-it
核心数据(H100 80GB,实测 benchmark):
| 指标 | SGLang v0.5.20 | vLLM v0.30.0 |
|---|---|---|
| Llama 3.1 8B 吞吐量 | ~16,200 tok/s | ~12,500 tok/s |
| 领先幅度 | +29% | baseline |
| 多轮对话(75-95% cache hit) | +10-20% 额外提升 | 需手动 APC 配置 |
| Spec Decoding 成熟度 | 较新(Eagle2/DFlash/Spec V2) | 更成熟(Eagle3 30-45% decode 加速) |
| Qwen3.8-27B 兼容性 | 正常(需调 state cache) | 需降 sequence limit |
| 多 LoRA | ❌ | ✅ 原生支持 |
RadixAttention vs PagedAttention 架构差异:
- PagedAttention (vLLM):固定大小 blocks,按需分配,请求结束时释放;KV cache 按 block 组织,跨请求共享需手动 APC 配置
- RadixAttention (SGLang):radix tree 自动发现跨请求共享前缀,多轮对话/Agent 场景自动复用 KV cache,无需手动配置;SGLang 官方数据:trillions tokens/day,400,000+ GPUs,xAI/Cursor/LinkedIn/AMD/NVIDIA 生产用户
选型建议(综合多个来源 2026 Q3-Q4):
| 场景 | 推荐 | 理由 |
|---|---|---|
| 多轮 Agent / 工具调用 / RL rollout | SGLang | RadixAttention 自动前缀复用,75-95% cache hit |
| 单轮高并发 / 吞吐优先 | vLLM | 成熟连续 batching,MRv2 默认启用 |
| 需要多 LoRA | vLLM | SGLang 暂无 LoRA 支持 |
| 延迟敏感 + speculative decoding | vLLM | Eagle3 生态更成熟 |
| 复杂结构化输出 / grammar cache | SGLang 略优 | RadixAttention + schema cache 热身 |
| 主流开源模型日常部署 | vLLM 风险低 | 插件生态最广,NVIDIA NIM 也在用 |
可信度:高(多来源交叉验证,benchmark 数据来自 RunPod H100 SXM 80GB)
🟡 SGLang 2026 技术里程碑(值得记录)
来源:GitHub sgl-project/sglang · SGLang Official Blog
- 2026/02:GB300 NVL72 上 25x 推理性能提升(与 NVIDIA 合作)
- 2026/04:DeepSeek-V4 Day 0 支持(SGLang + Miles)
- 2026/06:Speculative Decoding DFlash + Spec V2 发布(下一代推测解码)
- 2026/07:Kimi K3 Day 0 支持;GLM5.2 NVFP4 达 500 TPS(两周集成);RadixArk + Google TPU 完整支持
- v0.5.20(Sept 18, 2026):当前 stable,2-4 周发版节奏
SGLang Speculative Decoding Roadmap 2026 Q2(GitHub Issue #23005):
- DFlash:新增 draft method
- Spec V2:完全 overlap,移除 wait_for_verify 同步瓶颈
- Adaptive Speculative Decoding:按请求难度动态调整 draft 数
- Parallel Speculative Decoding:多租户 remote drafter
- N-gram speculative decoding:持续迭代
建议:精读 SGLang 官方 blog 对 GB300 的实测报告,内容涉及 NVL72 rack-scale GPU 拓扑,25x 性能数据需原文核验
🟡 vLLM v0.30.0 关键更新(Sept 2026)
来源:GitHub vllm-project/vllm/releases · vLLM Docs
- MRv2(Model Runner V2)全面取代旧版:dense model 默认路径,支持 EVS/realtime embeddings/prefix caching for Mamba
- PagedAttention V1 后端移除旧实现:Legacy attention deleted,MRv2 + FlashAttention/FlashInfer/TRTLLM-GEN/FlashMLA/Triton 为标准
- Eagle3 speculative decoding:低并发(1-4 requests)30-45% decode 加速;中并发(10-20)15-20%
- Disaggregated prefill/decode:prefill-decode 分离,支持 AMD MORI-IO(MI300X)
- 量化支持扩展:MXFP8/MXFP4/NVFP4/INT8/INT4/GPTQ/AWQ/GGUF/compressed-tensors/ModelOpt/TorchAO
- 多模态 prefix bidirectional attention:新增支持
- 前缀缓存 Mamba hybrid models:新增支持
建议:vLLM v0.30 更新幅度大,建议单独建专题页,关注 MRv2 迁移路径和 disagg prefill/decode 实测
🤖 二、Agent 框架 2026 格局(重大变化)
来源: - PECollective: https://pecollective.com/blog/ai-agent-frameworks-compared - TowardsAI: https://pub.towardsai.net/langgraph-vs-crewai-vs-autogen-which-ai-agent-framework-should-your-enterprise-use-in-2026-3a9ebb407b09 - OriginsHQ: https://originshq.com/feeds/ai-agent-frameworks-for-production - Uvik: https://uvik.net/blog/agentic-ai-frameworks - Cordum: https://cordum.io/blog/ai-agent-frameworks-comparison
⚠️ 重大变化:Microsoft AutoGen 宣布进入维护模式
关键事件:2026 年,Microsoft 将 AutoGen + Semantic Kernel 合并为 Microsoft Agent Framework,2026 年 4 月达 v1.0 GA。AutoGen 本身进入 maintenance mode(接收安全修复,不再新功能开发)。
AutoGen → Microsoft Agent Framework 迁移路径: - conversable-agent 模式映射到全新的 graph-based 模型 - 新项目建议直接评估 Microsoft Agent Framework - 现有 AutoGen 系统继续运行,迁移需架构重写
生产选型安全组合(2026 Q1): - AutoGen 1.0.0 + LangGraph 0.3.18 + CrewAI 0.95.x - 以上为大多数生产团队 end of Q1 2026 运行的稳定组合
三大框架现状对比(2026 Q3-Q4)
| 框架 | 2026 Q3-Q4 状态 | 适用场景 | 生产风险 |
|---|---|---|---|
| LangGraph v0.4 | ✅ 活跃,状态持久化+HITL checkpoints | 复杂有状态工作流,可审计,循环分支 | 最低(LangChain 生态保障) |
| CrewAI 0.95.x | ✅ 社区活跃,企业级 observability + scheduling | 快速原型,角色型 Agent 团队 | 中(相对小团队,框架风险高于 LangGraph) |
| AutoGen 0.2 | 🔴 maintenance,不新功能 | 已有系统维持 | 高(无新功能,建议迁移) |
| Microsoft Agent Framework 1.0 | 🆕 新,AutoGen+SemanticKernel 合并 | Microsoft 生态团队 | 待观察 |
2000-run benchmark 关键数据(Uvik, 2026): - LangGraph:延迟最低(5 tasks,100 runs/framework) - LangChain:token 效率最优 - AutoGen:延迟与 LangGraph 相当,token profile 不同 - CrewAI:简单任务 token 消耗约其他框架 3x(one-tool-call flows)
建议:精读 TowardsAI 文章,了解 Microsoft Agent Framework 1.0 架构细节;现有 AutoGen 系统需制定迁移计划
🗄️ 三、向量数据库 2026 Q3-Q4 Benchmark
来源: - ComputingForGeeks: https://computingforgeeks.com/qdrant-weaviate-milvus-pgvector - Kalvium Labs: https://www.kalviumlabs.ai/blog/vector-databases-compared-pgvector-pinecone-qdrant-weaviate - Firecrawl: https://www.firecrawl.dev/blog/best-vector-databases - pkgpulse: https://www.pkgpulse.com/guides/pgvector-vs-qdrant-vs-weaviate-vector-databases-2026 - Alpha Corp: https://alphacorp.ai/blog/best-vector-databases-rag-2026-top-7-picks
单节点 Benchmarks(8 vCPU / 16 GB RAM,1.18M vectors):
| 数据库 | 版本 | 索引构建时间 | 内存占用 | 查询延迟 |
|---|---|---|---|---|
| Milvus | 2.5 | ~4.8 min | 高 | 快 |
| Qdrant | 1.19 | ~6 min | 最低内存 | sub-ms class |
| Weaviate | 1.27 | ~7 min | 中 | 高 recall 优先 |
| pgvector | (PostgreSQL 17) | ~11 min(HNSW build 617s) | 中 | <5ms overhead |
关键结论(多来源共识):
- pgvector:最适合已有 Postgres 基础设施,<50M vectors,无需新服务
- Qdrant:自托管 RAG 默认首选,内存占用最小,sub-millisecond 查询,单容器部署
- Weaviate:混合搜索(vector + BM25 + metadata filters)最强,适合查询质量优先场景
- Milvus:>100M vectors + 分片需求时使用
- Pinecone:零运维需求,愿意付费的团队
- Chroma/LanceDB:本地快速原型
pgvector 0.7.x 注意事项: - HNSW build 耗时(617s for 1.18M rows),需要预规划 - 适合 <50M vectors,结构化数据与向量共存场景 - COPY 阶段快(45s for 1.18M rows),主要时间在并行 HNSW 构建
建议:向量数据库选型页需更新 2026 Q3 数据;Qdrant 内存效率优势需重点标注
📝 四、Substack 高质量专栏(AI Engineering / ML Research)
来源:eugeneyan.com · PECollective · Cameron R. Wolfe Substack Recommendations
推荐订阅(按质量排序)
1. Eugene Yan(Amazon 应用科学家) - 专栏:https://eugeneyan.com - 覆盖:evals、RAG patterns、系统设计、团队建设 - 特色:ML system design primer posts,reference quality - 推荐理由:写给实践者,避坑指南,工程导向
2. Cameron R. Wolfe(Deep (Learning) Focus) - 专栏:https://cameronrwolfe.substack.com - 覆盖:NLP/ML 前沿论文深度解析,Top AI Papers of the Week - 推荐他关注的:NLP Newsletter(Elvis),AI by Hand(Prof. Tom Yeh) - 推荐理由:ACL/ICML/NeurIPS 论文技术洞察,质量高
3. Simon Willison - 专栏:https://simonw.substack.com - 近期高价值帖:2026 in LLMs (so far) — 涵盖 Claude Opus 5.5、GPT-6 Sol/Luna、价格战 - 推荐理由:AI 实战经验,工具使用,数据隐私视角,Scott Alexander 级别的深度思考
4. Astral Codex Ten(Scott Alexander) - 覆盖:AI safety、AI policy、meta-research - 推荐理由:争议话题的深度辩论,slow thinking 模型
5. LLM Watch(Pascal Biese) - 周更,关注最重要 LLM 论文,人视角解读 - 覆盖:cutting edge AI research,human perspective
6. Almost Timely(Christopher S. Penn) - 覆盖:AI 技术走向,实践指南 - 特色:技术 SEO + AI 工具组合
不推荐(可信度问题):Marcus on AI(Gary Marcus)— 观点偏激但作为对冲有用
📄 五、ArXiv 精选论文(2026 新发表)
#1 InferenceBench: AI Agent 驱动的 LLM 推理优化 Benchmark
- arXiv: https://arxiv.org/abs/2607.20468
- 核心:衡量 AI Agent(Claude Code / Codex CLI / OpenCode)对完整 OpenAI-compatible inference server 端到端部署优化的能力
- 关键发现:Agent 在 vLLM 和 SGLang 上可完成推理优化任务,但结果与 matched-budget 非 Agent 搜索 baseline 比较(而非 ground truth patch)
- 工程价值:★★★★(评估 AI Agent 自动化运维能力的标准 benchmark)
- 可信度:arXiv,ACL 2026 相关工作
#2 LIMBO: Agent 推理时记忆与预算优化
- arXiv: https://arxiv.org/abs/2609.14138
- 核心:lifelong inference-time memory 和 budget 优化,ICTAI 2026 接收
- 工程价值:★★★(多轮 Agent 场景的 token 预算控制)
- 可信度:IEEE ICTAI 2026 同行评审
#3 LLM-CoOpt: 异构平台 LLM 推理 co-design 框架
- arXiv: https://arxiv.org/abs/2602.09323
- 核心:Opt-KV(动态 KV cache 量化)+ Opt-GQA(轻量 grouped query attention)+ Opt-Pa(paged attention 优化);throughput +7-12% across LLaMa variants
- 工程价值:★★★★(HBM 瓶颈缓解的算法-硬件协同设计)
- 可信度:arXiv,方法论完整
#4 Reason & Verify: 忠实性 RAG 框架
- arXiv: https://arxiv.org/abs/2603.10143(Canadian AI 2026 接收)
- 核心:检索-推理对齐,减少 RAG hallucination
- 工程价值:★★★(RAG 质量提升路径)
#5 DA-RAG: 动态子图检索 RAG
- arXiv: https://arxiv.org/abs/2602.08545
- 核心:Embedding-Attributed Community Search,动态子图检索;GraphRAG-Global 平均 win rate 57.34%
- 工程价值:★★★★(复杂知识图谱 RAG 场景)
- 可信度:arXiv,消融实验充分
#6 UniversalRAG: 多模态统一 RAG
- arXiv: https://arxiv.org/abs/2504.20734(ACL 2026 接收)
- 核心:跨模态/粒度的统一 RAG 框架(text/image/video/table)
- 工程价值:★★★★(多模态 RAG 系统设计参考)
- 可信度:ACL 2026,顶会接收
#7 Adaptively Robust LLM Inference Scheduling
- arXiv: https://arxiv.org/abs/2508.14544
- 核心:在线多任务 LLM inference 的调度优化,最小化总延迟
- 工程价值:★★★★(在线推理服务 capacity planning)
- 理论价值:Jaillet et al. 2025 框架扩展,理论基础扎实
📌 分类标签
LLM推理 vLLM SGLang 向量数据库 Qdrant pgvector Agent框架 LangGraph CrewAI AutoGen MicrosoftAgentFramework RAG ArXiv Substack InferenceBench speculative-decoding RadixAttention PagedAttention
✅ 建议写入路径
| 草稿路径 | 内容 |
|---|---|
2026-10-08T0930-jay-inference-agents-vecdb-substack-morning-briefing.md |
本文件,含推理引擎/Agent框架/向量DB/Substack/ArXiv |
2026-10-08-vecdb-benchmark-qdrant-pgvector-2026.md |
向量数据库 Benchmark 专题(可独立建页) |
2026-10-08-agent-framework-2026-autogen-maintenance-langgraph-crewai.md |
Agent 框架格局专题 |
🔍 后续行动建议
- 精读:SGLang GB300 25x 性能报告(NVL72 rack-scale);Microsoft Agent Framework 1.0 架构文档
- 核验:InferenceBench GitHub repo 验证 benchmark 指标;vLLM v0.30 MRv2 迁移 checklist
- 更新:「LLM 推理引擎选型」主题页,整合 vLLM v0.30 / SGLang v0.5.20 对比数据
- 订阅补充:Eugene Yan / Cameron R. Wolfe / Simon Willison 加入知识库参考源
- 专题页:「Agent 框架 2026 格局」,标注 AutoGen maintenance + Microsoft Agent Framework 崛起
Jay · 2026-10-08 09:30 CST · 第 7 轮早间简报