研究草稿 · 2026-10-04
主题:AI 工程 / 后端 / 数据库 / 部署
一、LLM 推理引擎选型(2026 三足鼎立)
来源:Spheron Blog、DeployBase、Atomic Chat、PremAI、Inference.net
核心结论
| 引擎 | 优势场景 | 劣势 |
|---|---|---|
| vLLM | 生态最成熟,模型兼容最广,单次推理为主 | 多轮复用场景落后 SGLang ~29% |
| SGLang | 多轮对话/Agent 工作流,RadixAttention 复用 KV cache | 生态较新,部分模型需验证 |
| LMDeploy | H100 原生性能最优(pip install 即达峰值 99.5%),C++ 后端零 Python 开销 | 主流模型优化为主,小众模型支持弱 |
关键技术点
- PagedAttention(vLLM 发明):将 GPU 显存分页管理,7B 模型可 batch 10-50 请求(原来 2-5),吞吐提升 40%+;Llama 70B 在 A100 80GB 达 3500 tokens/s。
- RadixAttention(SGLang 发明):自动发现并复用多轮对话中相同前缀(系统 prompt / 工具定义 / 对话历史),多轮吞吐提升 15-25%。
- Prefix Caching:vLLM 通过
enable_prefix_caching=True启用,多实例共享相同 system prompt 时收益最大。 - 混合搜索(生产 RAG 必备):纯向量搜索对专有名词/版本号/ID 检索失败;需与 BM25 混合(Qdrant/Weaviate 原生支持,pgvector 需手动组合)。
决策树
首次部署生产 LLM → vLLM(稳定 + 文档完善)
多轮 Agent / 工具调用 / 长 context → SGLang
H100 最大吞吐 + 量化模型 → LMDeploy
百万级 GPU 部署(百卡以上)→ SGLang(RadisAttention 收益随规模放大)
可信度:高。多个独立来源交叉验证Benchmark数据(DeployBase/PremAI/Inference.net 一致性较好)。
二、向量数据库 2026 格局
来源:Firecrawl、DigitalApplied、Encore、Braintrust、Medium(Pratik Rupareliya 综合 100+ 企业部署经验)
市场格局(四层)
管理型头部 → Pinecone / Vertex Vector(GCP)
开源主力 → Qdrant / Weaviate / Milvus
Postgres 集成 → Chroma / pgvector
大规模混合搜索 → Vespa
选型决策矩阵
| 场景 | 推荐 | 理由 |
|---|---|---|
| 已有 Postgres,<5000 万向量 | pgvector | 无需引入新服务,ACID + SQL 全支持,p99 <50ms |
| 1 亿向量以上 | Milvus(Zilliz Cloud) | K8s 原生,GPU 加速,分布式 |
| 自托管生产 RAG,灵活过滤 | Qdrant | Rust 实现,payload filtering 高效,量化节省显存 |
| 强混合搜索(向量+关键词) | Weaviate | 原生 BM25+向量混合,多租户隔离干净 |
| 快速原型 / 本地开发 | Chroma | Python 优先,零配置,笔记本即可跑 |
| 边缘 / 嵌入式 | sqlite-vec(新) | SQLite 扩展,向量搜索能力,轻量级 |
重要洞察
- pgvector 最新版本 0.8.6(2026-09 更新),HNSW/IVFFlat 索引、距离度量已完善。
- sqlite-vec:SQLite 向量扩展,Turso 提供托管层(branching + 复制 + HTTP API),适合边缘场景。
- 混合搜索是生产 RAG 的隐性门槛:专有名词/版本号/ID 纯向量搜索效果差;推荐 Qdrant/Weaviate 原生方案,或 pgvector+全文索引手动组合。
可信度:中高。多个独立来源收敛,选型矩阵与 100+ 企业部署经验一致。
三、GitHub 高价值项目(2026-10-04 汇总)
⭐ elizaOS/eliza — Agentic OS
- ⭐ 19,536(今日热点)
- 描述:TypeScript/Node.js 开源 Agent 操作系统,支持多模型、多渠道(Discord/Telegram/自定义)
- 标签:AI Agent / TypeScript / 多渠道
- 链接:https://github.com/elizaOS/eliza
- 评价:Agent 框架层面规模最大的开源项目之一;适合需要快速搭建多渠道 AI Agent 产品的团队。
⭐ dathere/qsv — 高速数据处理
- ⭐ 3,802(持续增长)
- 描述:Rust 实现的 CSV/JSON/Parquet 数据处理工具包(SQLite/AI/pg 集成),自称 "blazing-fast data wrangling"
- 标签:Data Engineering / Rust / CSV / AI
- 链接:https://github.com/dathere/qsv
- 评价:适合 ETL pipeline 加速场景,Rust 实现跨平台无依赖。
🚀 arien-dev/aien-sovereign-core — AI 推理运行时
- 描述:Rust 原生 AI 推理运行时,支持 Modular MAX bridges,DGX Spark GB10
- 标签:AI Runtime / Rust / 自托管
- 链接:https://github.com/aien-dev/aien-sovereign-core
🔧 mobasak/fabrik — AI 基础设施自动化
- 描述:AI 基础设施部署自动化 CLI
- 链接:https://github.com/mobasak/fabrik
🔧 doinb666/AegisAgent — 生产级 Agent 编排 + RAG
- 描述:ReAct/Plan-Execute 架构,混合检索,记忆层次,生产导向
- 链接:https://github.com/doinb666/AegisAgent
🔧 staff0rd/assist — LLM 确定性工作流
- 描述:CLI 工具,强制 LLM 开发工作流的确定性(消除 randomness)
- 链接:https://github.com/staff0rd/assist
四、Substack 研究线索
state-of-mlops(高质量 MLOps 周刊)
- URL:https://stateofmlops.substack.com/
- 运营者:Keigo Hattri
- 近期高价值条目:
- 「A Guide to AI Inference Engineering」(Jun 2026)— 推理工程实践指南
- 「DuckDB Internals: Why is DuckDB Fast?」(May 2026)— DuckDB 内部机制分析
- 「Evaluation-Driven Development (EDD)」(Jun 2026)— 评估驱动开发
- Uber 内部软件工厂规模化实践(Aug 2026)
- Google 动态 AI 基础设施容量管理(Aug 2026)
- Stanford CoT Monitoring 安全分析(Jun 2026)
- 可信度:高。精选质量稳定,每周更新。
- 后续行动:DuckDB 内部机制文章值得精读;EDD 方法论与 RAG 评估有重叠价值。
MLOps in Defense(Defense AI 部署视角)
- URL:https://genxtechwriter.substack.com/p/mlops-in-defense-scaling-secure-ai
- 核心观点:Defense 场景 MLOps ≠ 速度,而 = 受限环境下的生存能力(air-gapped、forward-deployed、硬件受限)
- 洞察:与商业云场景的根本差异在于「部署即授权」(authority),不是 PoC。
五、CSDN 高价值线索(待精读验证)
CSDN 需严格筛选,以下为初筛线索,不直接引用原文:
- FastAPI 生产部署最佳实践:docker-compose + PostgreSQL + Gunicorn + uvicorn 组合
- PostgreSQL 向量搜索实战:pgvector 安装、索引创建、HNSW 参数调优
- RAG 工程化:文档分块策略、向量化、检索重排序全流程
⚠️ CSDN 收录标准:必须有版本说明、环境命令、源码分析或真实排障经验;纯概念介绍/翻译类文章不收录。
六、分类标签
#LLM推理引擎 #vLLM #SGLang #LMDeploy #向量数据库 #RAG #pgvector #Qdrant #Weaviate #MLOps #AI工程 #后端 #部署 #DuckDB #Agent #ElizaOS #Rust
七、建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-10-04-ai-engineering-backend-db-deploy.md(本文) - 后续精读文件(建议新建独立条目):
- LLM 推理引擎选型框架(vLLM vs SGLang vs LMDeploy)
- 向量数据库 2026 选型矩阵(pgvector / Qdrant / Weaviate / Milvus)
- DuckDB 内部机制分析(state-of-mlops 引用)
- EDD(Evaluation-Driven Development)方法论
八、本轮行动建议
| 优先级 | 行动 | 理由 |
|---|---|---|
| 🔴 高 | 精读 SGLang vs vLLM 2026 对比原文 | 推理引擎选型直接影响 AI 工程落地质量 |
| 🟡 中 | 关注 pgvector 0.8.6 更新内容 | 小版本迭代可能有重要索引改进 |
| 🟡 中 | 调研 DuckDB 向量能力(sqlite-vec 新方向) | 边缘/嵌入式场景可能需要 |
| 🟢 低 | CSDN FastAPI + PostgreSQL 部署文章筛选 | 需现场验证是否满足收录标准 |