Jay 晚间研究简报 · 2026-10-06 · 五类综合

检索范围:GitHub Trending · Hugging Face · arXiv · 技术博客 · Substack · Vector DB 评测 执行实例:Jay 时间:2026-10-06 17:35 (Asia/Shanghai)


一、LLM 推理引擎 · 最新工程基准(晚间补充)

1A. SGLang vs vLLM vs TensorRT-LLM · 2026 决策框架(已覆盖早间,今日补全基准数据)

来源:Spheron Blog · LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang (2026) · Atomic Chat · SGLang vs vLLM (2026) · Deploybase · Best LLM Inference Engines 2026

可信度:⭐⭐⭐⭐⭐ | 工程价值:极高(生产选型直接依据)

核心实测数据(H100 · Llama 3.3 70B FP8 · 50 并发)

引擎 吞吐量 TTFT p50 冷启动 特点
vLLM ~1,850 tok/s 380 ms ~62 sec 最成熟生态、最广模型支持
TensorRT-LLM ~2,100 tok/s 340 ms ~28 min 编译后性能最优但运维复杂
SGLang ~1,920 tok/s 360 ms ~58 sec 多轮/Agentic 场景最优

共享上下文场景(SGLang 显著优势)

场景 SGLang vs vLLM
10 用户同文档 RAG SGLang 计算 1 次前缀,vLLM 需重复
多轮对话(共享 system prompt) SGLang RadixAttention 缓存,vLLM 每次重算
批量 Agentic 请求 SGLang TTFT p95 尾延迟最低

工程结论: - 首次部署生产 LLM → vLLM(稳定 + 文档完善) - 多轮/Agentic/RAG 场景 → SGLang(RadixAttention 随请求量增长优势扩大) - 对延迟极敏感的 H100 场景 → TensorRT-LLM(接受 ~28 min 冷启动代价) - TGI 用户 → 需迁移(2026-03 停止新功能开发,推荐 vLLM/SGLang)


1B. TGI 正式停止维护 · 2026-03 重大信号

来源:The AI Engineer Substack · vLLM vs Ollama vs SGLang vs TensorRT-LLM 2026 · NeuralChainAI · vLLM vs SGLang vs TensorRT-LLM

可信度:⭐⭐⭐⭐⭐ | 工程价值:极高(基础设施重大变更)

关键事实: - Hugging Face TGI GitHub README(2026-03 存档):仅接受 bug 修复 PR,不再接受新功能 - HF 官方推荐迁移路径:vLLM > SGLang > llama.cpp - 背景:TGI 创立于 2021,为 HuggingChat 和 Inference Endpoints 供能,但新功能开发已落后 vLLM/SGLang 约 18 个月

后续行动:排查团队中 TGI 实例,建立 vLLM/SGLang 迁移计划(vLLM 兼容层最完整)


1C. LMDeploy · 量化模型推理最优解

来源:PremAI · vLLM vs SGLang vs LMDeploy 2026 · AIMultiple · LLM Inference Engines

可信度:⭐⭐⭐⭐ | 工程价值:中高(量化部署专项)

核心结论: - 量化模型(INT4/FP8) → LMDeploy(TurboMind 优化)提供比 SGLang 快约 29% 的吞吐 - 但:依赖冲突问题突出(H100 容器 PyTorch 版本与 FlashInfer 不兼容,需 6 小时调试) - 实用建议:量化模型 + 快速上线 → pip install lmdeploy;追求极限性能 + 有工程能力 → SGLang + FlashInfer


二、推理系统工程 · arXiv 新论文

2A. InferenceBench · AI Agent 开放域 LLM 推理优化基准

来源:arXiv:2607.20468 · Yehjeok Yeon, Ben Rank, Maksym Andriushchenko · 2026-05-20

可信度:⭐⭐⭐⭐ | 研究方向:LLM 系统自动化优化

核心内容: - 提出首个由 AI Agent 完成开放域 LLM 推理优化任务的基准 - 测试 AI Agent 对 kernel 调优、编译器配置、框架参数、服务路径的优化能力 - 参考了 MIT HAN Lab (2026) Kernel Design Agents 和 RoofLang (arXiv 2609.12551) 等工作 - 与 LLM 推理调度优化工作(Chen et al. 2026, Long et al. 2026)形成呼应

工程关联: RoofLang(AI 驱动的 LLM 推理系统自动设计)已由今日早间简报覆盖 后续行动:关注 AI Agent 自动化调优系统工程(vs 传统人工调优的范式转变)


2B. Fluid-Guided Online Scheduling · KV Cache 内存约束调度

来源:arXiv:2504.11320v4 · 2026-06-13 更新

可信度:⭐⭐⭐⭐ | 工程方向:KV Cache 回收策略

核心内容: - 研究当总 KV Cache 超出 GPU 内存容量时的调度策略 - 两种主流方案对比: - Swap 到 CPU/SSD(I/O 开销显著,Sheng et al. 2023) - Recomputation(丢弃 KV Cache,从 prefill 重启,vLLM 默认策略) - 聚焦 recomputation 路径,通过 Fluid-Guided 调度算法最小化驱逐 - 与 vLLM PagedAttention 设计高度相关(vLLM Team 2026 引用本文)

后续行动:生产环境遇到 OOM 时优先考虑 recomputation 策略验证;与 vLLM 驱逐策略对比


2C. Position Paper · LLM Serving 需要数学优化,而非启发式

来源:arXiv:2605.01280v1

可信度:⭐⭐⭐⭐ | 研究方向:LLM Serving 理论基础

核心论点: - 当前 LLM Serving 系统过度依赖启发式调度,论文呼吁建立数学优化理论基础 - 引用 Chen et al. (2026) 的 barrier-synchronized, sticky-assignment 数据并行解码问题 - 指出:请求路由和 DP 负载均衡问题的本质是非线性优化(per-step idle time 与 sum of max loads 成线性关系) - 论文认为这需要排队论 + 整数规划而非经验规则

后续行动:了解该论文是否为 peer-reviewed(目前为 arXiv preprints 状态);关注是否被 MLSys/FAST 等会议接收


2D. Workload-Router-Pool Architecture · vLLM 语义路由

来源:arXiv:2603.21354v2 · vLLM Semantic Router Project

可信度:⭐⭐⭐⭐ | 工程方向:Fleet 级别推理优化

核心内容: - 提出三层架构:Workload → Router → Pool - vLLM Semantic Router Team 开发了 MLCommons AI safety classifier 集成 - 引用 Token-budget-aware pool routing(Chen et al. 2026)和 FleetOpt 解析 - 包含 inference-fleet-sim:基于排队论的 Fleet 容量规划工具

后续行动:vLLM 官方语义路由文档;FleetOpt 容量规划工具源码


三、向量数据库 · 2026 Q3-Q4 格局

3A. Qdrant · 2026 秋冬季性能数据

来源:Kunal Ganglani · Milvus vs Qdrant 2026 · Digital Applied · Vector DB for AI Agents 2026 · AlphaCorp AI · Best Vector DB for RAG 2026

可信度:⭐⭐⭐⭐ | 工程价值:高(选型直接依据)

Qdrant 性能数据

规模 p50 p99 QPS
1M 向量 ~2.1 ms ~6.3 ms ~1,200
50M 向量 4.74 ms 5.79 ms —

Qdrant 关键优势: - Rust 实现,内存安全,单二进制/Docker 启动 - Filtered search 性能最优(payload index 集成) - 1.17 版本(2026-07 更新)进一步优化 - 2026 社区共识:多数团队推荐从 Qdrant 开始

Qdrant vs pgvector

维度 Qdrant pgvector
延迟 ~2-6 ms ~25-40 ms
扩展性 成熟分片 适合 <50M 向量
SQL 集成 无 完整 ACID + JOIN
适用场景 纯向量检索 已有 Postgres 团队

3B. Milvus 3.0.2 · 湖原生架构(2026-09)

来源:Tech-Insider.org · Milvus Tutorial 2026 · Salt Technologies AI · Vector DB Benchmark 2026

可信度:⭐⭐⭐⭐ | 工程价值:高(企业级规模选型)

Milvus 3.0 重大更新(2026-07): - Lake-native 架构:原生支持 Parquet、Lance、Iceberg、Vortex 数据直接搜索 - 内置 BM25 全文搜索(替代 Elasticsearch),benchmark 数据显示 400% 更高吞吐 - 2026-09-20 发布 3.0.2 稳定版 - Reddit 340M 向量实测:Milvus 复制扩容优于 Qdrant,摄入和查询负载干扰更小

选型建议: - < 50M 向量 + 无专职 MLOps → Qdrant(操作简单) - 100M+ 向量 + 企业规模 → Milvus(分布式架构成熟) - 已有 Postgres → pgvector + pgvectorscale(零新增组件)


四、RAG 与 Agent 框架 · 2026 工程对比

4A. LangChain vs LlamaIndex 2026 · 生产决策框架

来源:Coworker AI · LangChain vs LlamaIndex 2026 · PremAI · LangChain vs LlamaIndex 2026 · AlphaCorp AI · RAG Frameworks Top 5 2026

可信度:⭐⭐⭐⭐ | 工程价值:极高(生产选型直接依据)

核心数据对比

维度 LangChain/LangGraph LlamaIndex
定位 编排优先(Orchestration-first) 检索优先(Retrieval-first)
GitHub Stars ~119K ~44K
开发效率 企业 RAG 节省 40% 开发时间 文档密集场景检索精度高 35%
多步 Agent LangGraph 支持有状态图 + human-in-the-loop LlamaIndex Workflows(生产风险见下)
可观测性 LangSmith(一站式) Langfuse / Arize Phoenix(集成)
多模态索引 通过集成 原生深度支持
学习曲线 较陡(Agent 场景) 较平(RAG 场景)

LlamaIndex Workflows 生产风险(已文档化)

  • AgentWorkflow 存在 handoff 失败问题(issue #18530, #17745)
  • 并发执行时 tracing 有 span 丢失(Langfuse discussion #4637)
  • 建议:生产环境需充分测试 agent 间 handoff

2026 年生产组合模式

LlamaIndex(检索/索引) + LangGraph(编排/状态) → 主流双框架栈
Haystack(企业默认) → 模块化管道 + 内置评估 + deepset 商业支持
DSPy(Prompt 工程) → 需要 prompt 编译+指标优化时引入

4B. Agent 框架 2026 · 生态地图

来源:Firecrawl Blog · Best AI Agent Frameworks 2026 · LangChain · AI Agent Frameworks Guide · Braintrust · Best AI Agent Frameworks 2026

可信度:⭐⭐⭐⭐ | 工程价值:高(框架选型参考)

主流框架对比

框架 语言 编排模型 多 Agent RAG 学习曲线 生产状态
LangGraph Python 有状态图 ✅ 集成 中等 行业标准
CrewAI Python Role-based ✅ ✅ 低 活跃生产
OpenAI Agents SDK Python/JS Handoff-based ✅ ✅ 低 上升期
Mastra TypeScript 线性 Workflow ✅ ✅ 低 TypeScript 首选
LlamaIndex Workflows Python 检索优先 ✅ 原生 低 ⚠️ 生产验证中
Microsoft Agent Framework 多语言 统一架构 ✅ ✅ 中等 AutoGen/Semantic Kernel 后继
Haystack Python Pipeline ✅ 企业首选 中等 deepset 商业支持

LangChain 2026 Agent 工程调查(1300+ 从业者,2026-06): - 57.3% 已有生产 Agent(2025 年 51%) - 30.4% 正在开发并有明确部署计划 - Top 场景:客服 26.5%,研究数据分析 24.4%


五、Hugging Face 生态 · 2026 秋

5A. State of Open Models · Summer 2026 关键洞察

来源:Hugging Face · State of Open Models: Summer 2026 Observations

可信度:⭐⭐⭐⭐⭐ | 来源级别:HF 官方 Blog

核心信息:

  1. llama.cpp 加入 HF 生态(2026-02) - ggml 团队整体加入 Hugging Face,项目保持开源+社区治理 - 意义:最重要的本地推理项目获得持久资源保障

  2. AMD + NVIDIA 是 2026 年最大开源模型发布商 - 各发布 200+ 仓库,远超其他厂商 - 第三方解读:硬件厂商以开源模型证明芯片能力(硬件即模型)

  3. Qwen 成为社区基础模型 - Llama.cpp 在 Hub 上的优化重点支持 Qwen 系列 - 小模型(<10B)仍是实际落地层

  4. Open weights 价值转移 - 模型权重开源 → 价值积累在 工具链、评估、部署层 - 纯模型下载量 vs 精细化推理服务能力的分化


5B. HF Transformers 5.x · 模型支持更新

来源:Metacto · What is Hugging Face 2026 Guide

可信度:⭐⭐⭐⭐ | 工程价值:中高(技术选型参考)

Transformers 5.x 新增支持(2026): - Google Gemma 4、Qwen 3.6、DeepSeek-V4、EuroBERT(双向注意力多语言编码器)、Mistral VoxtralRealtime 流式 ASR - PyTorch + TensorFlow + JAX 三框架统一 API - Transformers.js(WebGPU/WASM 浏览器端推理)成熟度提升


六、Substack 高价值线索汇总

专栏 条目 核心价值 可信度
AI Engineering Insider Senior LLM Inference Engineer 面试大纲(vLLM/SGLang/TGI/Triton/调度/批量) 面试准备 + 工程知识图谱 ⭐⭐⭐⭐
Ken Huang · DistributedApps.ai 10 章系列《Frontier LLM Inference Physics & Engineering 2026》Ch.6(Disaggregated Serving / Mooncake) 预热-Decode 解耦深度资料 ⭐⭐⭐⭐⭐
The AI Engineer TGI 停止维护 + 引擎选型决策流程图 今日最高价值,工程行动性强 ⭐⭐⭐⭐⭐
Pawan K Jha 《Architecting LLM Inference》系列(含 KV Cache/自注意力/运行时内幕) 教学价值,代码图表丰富 ⭐⭐⭐⭐

七、高价值条目汇总

优先级 条目 来源 关键行动
🔴 极高 TGI 停止维护 + vLLM/SGLang 选型 The AI Engineer Substack 立即行动:排查 TGI 实例,建立迁移计划
🔴 极高 SGLang vs vLLM 生产基准(H100 50 并发) Spheron/Deploybase 对照团队场景选择引擎
🟠 高 Qdrant 性能数据(p50 ~2.1 ms) 多源 2026 Q3-Q4 考虑作为默认向量 DB
🟠 高 Milvus 3.0.2 Lake-native Tech-Insider/Salt 百亿级规模时评估
🟠 高 LangChain + LlamaIndex 双框架栈 多源 2026 评估团队技术栈
🟠 高 llama.cpp 加入 HF(2026-02) HF Blog 本地推理链路关注
🟡 中 InferenceBench(AI Agent 优化基准) arXiv 2607.20468 关注 AI Agent 自动化调优趋势
🟡 中 Fluid-Guided KV Cache 调度 arXiv 2504.11320 OOM 时验证 recomputation 策略
🟡 中 QATFactory 量化框架 arXiv 2609.39223 NVFP4 落地工具链

分类标签

inference-engineering vllm sglang tensorrt-llm tgi-deprecation vector-db qdrant milvus pgvector rag langchain llamaindex agent-framework kvcache hf-ecosystem llamacpp substack arxiv


建议写入路径:/shared/research-kb/inbox/jay/2026-10-06T1735-jay-evening-five-category-briefing.md 是否需要精读:TGI 迁移计划 + SGLang vs vLLM 选型流程(工程行动性强) 建议审稿:是(涉及基础设施重大变更,需验证今日数据准确性) 建议主题页更新:LLM Inference Engines 决策流程图、Vector DB 选型对照表