研究草稿 · 2026-10-04

主题:AI 工程 / 后端 / 数据库 / 部署


一、LLM 推理引擎选型(2026 三足鼎立)

来源:Spheron Blog、DeployBase、Atomic Chat、PremAI、Inference.net

核心结论

引擎 优势场景 劣势
vLLM 生态最成熟,模型兼容最广,单次推理为主 多轮复用场景落后 SGLang ~29%
SGLang 多轮对话/Agent 工作流,RadixAttention 复用 KV cache 生态较新,部分模型需验证
LMDeploy H100 原生性能最优(pip install 即达峰值 99.5%),C++ 后端零 Python 开销 主流模型优化为主,小众模型支持弱

关键技术点

  • PagedAttention(vLLM 发明):将 GPU 显存分页管理,7B 模型可 batch 10-50 请求(原来 2-5),吞吐提升 40%+;Llama 70B 在 A100 80GB 达 3500 tokens/s。
  • RadixAttention(SGLang 发明):自动发现并复用多轮对话中相同前缀(系统 prompt / 工具定义 / 对话历史),多轮吞吐提升 15-25%。
  • Prefix Caching:vLLM 通过 enable_prefix_caching=True 启用,多实例共享相同 system prompt 时收益最大。
  • 混合搜索(生产 RAG 必备):纯向量搜索对专有名词/版本号/ID 检索失败;需与 BM25 混合(Qdrant/Weaviate 原生支持,pgvector 需手动组合)。

决策树

首次部署生产 LLM → vLLM(稳定 + 文档完善)
多轮 Agent / 工具调用 / 长 context → SGLang
H100 最大吞吐 + 量化模型 → LMDeploy
百万级 GPU 部署(百卡以上)→ SGLang(RadisAttention 收益随规模放大)

可信度:高。多个独立来源交叉验证Benchmark数据(DeployBase/PremAI/Inference.net 一致性较好)。


二、向量数据库 2026 格局

来源:Firecrawl、DigitalApplied、Encore、Braintrust、Medium(Pratik Rupareliya 综合 100+ 企业部署经验)

市场格局(四层)

管理型头部     → Pinecone / Vertex Vector(GCP)
开源主力       → Qdrant / Weaviate / Milvus
Postgres 集成  → Chroma / pgvector
大规模混合搜索  → Vespa

选型决策矩阵

场景 推荐 理由
已有 Postgres,<5000 万向量 pgvector 无需引入新服务,ACID + SQL 全支持,p99 <50ms
1 亿向量以上 Milvus(Zilliz Cloud) K8s 原生,GPU 加速,分布式
自托管生产 RAG,灵活过滤 Qdrant Rust 实现,payload filtering 高效,量化节省显存
强混合搜索(向量+关键词) Weaviate 原生 BM25+向量混合,多租户隔离干净
快速原型 / 本地开发 Chroma Python 优先,零配置,笔记本即可跑
边缘 / 嵌入式 sqlite-vec(新) SQLite 扩展,向量搜索能力,轻量级

重要洞察

  • pgvector 最新版本 0.8.6(2026-09 更新),HNSW/IVFFlat 索引、距离度量已完善。
  • sqlite-vec:SQLite 向量扩展,Turso 提供托管层(branching + 复制 + HTTP API),适合边缘场景。
  • 混合搜索是生产 RAG 的隐性门槛:专有名词/版本号/ID 纯向量搜索效果差;推荐 Qdrant/Weaviate 原生方案,或 pgvector+全文索引手动组合。

可信度:中高。多个独立来源收敛,选型矩阵与 100+ 企业部署经验一致。


三、GitHub 高价值项目(2026-10-04 汇总)

⭐ elizaOS/eliza — Agentic OS

  • ⭐ 19,536(今日热点)
  • 描述:TypeScript/Node.js 开源 Agent 操作系统,支持多模型、多渠道(Discord/Telegram/自定义)
  • 标签:AI Agent / TypeScript / 多渠道
  • 链接:https://github.com/elizaOS/eliza
  • 评价:Agent 框架层面规模最大的开源项目之一;适合需要快速搭建多渠道 AI Agent 产品的团队。

⭐ dathere/qsv — 高速数据处理

  • ⭐ 3,802(持续增长)
  • 描述:Rust 实现的 CSV/JSON/Parquet 数据处理工具包(SQLite/AI/pg 集成),自称 "blazing-fast data wrangling"
  • 标签:Data Engineering / Rust / CSV / AI
  • 链接:https://github.com/dathere/qsv
  • 评价:适合 ETL pipeline 加速场景,Rust 实现跨平台无依赖。

🚀 arien-dev/aien-sovereign-core — AI 推理运行时

  • 描述:Rust 原生 AI 推理运行时,支持 Modular MAX bridges,DGX Spark GB10
  • 标签:AI Runtime / Rust / 自托管
  • 链接:https://github.com/aien-dev/aien-sovereign-core

🔧 mobasak/fabrik — AI 基础设施自动化

  • 描述:AI 基础设施部署自动化 CLI
  • 链接:https://github.com/mobasak/fabrik

🔧 doinb666/AegisAgent — 生产级 Agent 编排 + RAG

  • 描述:ReAct/Plan-Execute 架构,混合检索,记忆层次,生产导向
  • 链接:https://github.com/doinb666/AegisAgent

🔧 staff0rd/assist — LLM 确定性工作流

  • 描述:CLI 工具,强制 LLM 开发工作流的确定性(消除 randomness)
  • 链接:https://github.com/staff0rd/assist

四、Substack 研究线索

state-of-mlops(高质量 MLOps 周刊)

  • URL:https://stateofmlops.substack.com/
  • 运营者:Keigo Hattri
  • 近期高价值条目:
  • 「A Guide to AI Inference Engineering」(Jun 2026)— 推理工程实践指南
  • 「DuckDB Internals: Why is DuckDB Fast?」(May 2026)— DuckDB 内部机制分析
  • 「Evaluation-Driven Development (EDD)」(Jun 2026)— 评估驱动开发
  • Uber 内部软件工厂规模化实践(Aug 2026)
  • Google 动态 AI 基础设施容量管理(Aug 2026)
  • Stanford CoT Monitoring 安全分析(Jun 2026)
  • 可信度:高。精选质量稳定,每周更新。
  • 后续行动:DuckDB 内部机制文章值得精读;EDD 方法论与 RAG 评估有重叠价值。

MLOps in Defense(Defense AI 部署视角)

  • URL:https://genxtechwriter.substack.com/p/mlops-in-defense-scaling-secure-ai
  • 核心观点:Defense 场景 MLOps ≠ 速度,而 = 受限环境下的生存能力(air-gapped、forward-deployed、硬件受限)
  • 洞察:与商业云场景的根本差异在于「部署即授权」(authority),不是 PoC。

五、CSDN 高价值线索(待精读验证)

CSDN 需严格筛选,以下为初筛线索,不直接引用原文:

  1. FastAPI 生产部署最佳实践:docker-compose + PostgreSQL + Gunicorn + uvicorn 组合
  2. PostgreSQL 向量搜索实战:pgvector 安装、索引创建、HNSW 参数调优
  3. RAG 工程化:文档分块策略、向量化、检索重排序全流程

⚠️ CSDN 收录标准:必须有版本说明、环境命令、源码分析或真实排障经验;纯概念介绍/翻译类文章不收录。


六、分类标签

#LLM推理引擎 #vLLM #SGLang #LMDeploy #向量数据库 #RAG #pgvector #Qdrant #Weaviate #MLOps #AI工程 #后端 #部署 #DuckDB #Agent #ElizaOS #Rust


七、建议写入路径

  • 主草稿:/shared/research-kb/inbox/jay/2026-10-04-ai-engineering-backend-db-deploy.md(本文)
  • 后续精读文件(建议新建独立条目):
  • LLM 推理引擎选型框架(vLLM vs SGLang vs LMDeploy)
  • 向量数据库 2026 选型矩阵(pgvector / Qdrant / Weaviate / Milvus)
  • DuckDB 内部机制分析(state-of-mlops 引用)
  • EDD(Evaluation-Driven Development)方法论

八、本轮行动建议

优先级 行动 理由
🔴 高 精读 SGLang vs vLLM 2026 对比原文 推理引擎选型直接影响 AI 工程落地质量
🟡 中 关注 pgvector 0.8.6 更新内容 小版本迭代可能有重要索引改进
🟡 中 调研 DuckDB 向量能力(sqlite-vec 新方向) 边缘/嵌入式场景可能需要
🟢 低 CSDN FastAPI + PostgreSQL 部署文章筛选 需现场验证是否满足收录标准