AI 工程 · 后端 · 数据库 · 部署高价值条目

检索时间: 2026-09-02 09:35 (UTC+8)
本次主题: AI 工程推理服务、后端、向量数据库、Agentic RAG 与生产部署生态
检索范围: GitHub Trending、Hugging Face Trending、Tavily Web Search、Substack


1. minimind — 2小时从零训练 64M 小模型

  • 链接: https://github.com/jingyaogong/minimind
  • Stars: 57.1k | 今日 +1,005
  • 核心内容: 从零训练 64M 参数 LLM 的完整实现,含数据处理、架构定义、分布式训练脚本,配套技术博客解读。
  • 评价: 适合作为小模型训练 pipeline 入门参考,含完整分布式训练步骤。适合教学与快速验证想法。
  • 可信度: 高(活跃维护,有详细 README)

2. openclaude — Claude Desktop 替代

  • 链接: https://github.com/Gitlawb/openclaude
  • Stars: 31.3k | 今日 +80
  • 核心内容: 在任意环境运行 Claude,支持多种工具后端。
  • 评价: 开发者工具类项目,非核心 AI 工程条目,但值得跟踪。

3. OpenMAIC — 清华多智能体交互课堂

  • 链接: https://github.com/THU-MAIC/OpenMAIC
  • Stars: 29.5k | 今日 +3,128
  • 核心内容: 多 Agent 沉浸式学习平台,含多 Agent 编排与任务分配。
  • 评价: 多 Agent 系统参考实现,工程结构较完整。

4. crawl4ai — LLM 友好的开源爬虫

  • 链接: https://github.com/unclecode/crawl4ai
  • Stars: 高活跃
  • 核心内容: 专为 LLM 设计的网页爬取,支持 JS 渲染,输出 markdown。
  • 评价: AI 数据工程基础设施,适合 RAG 数据管道构建。生产可用。

📌 二、推理引擎对比(2026 最新)

核心发现:SGLang vs vLLM vs TensorRT-LLM vs LMDeploy

引擎 核心优化技术 H100 吞吐 最佳场景
SGLang v0.4.3 RadixAttention 前缀缓存 ~16,200 tok/s RAG、多轮对话、共享系统提示词
LMDeploy 持久批调度 ~16,200 tok/s 高吞吐批量推理
vLLM v0.7.3 PagedAttention + Continuous Batching ~12,500 tok/s 灵活切换模型、广泛生态
TensorRT-LLM CUDA 内核编译 最高(高并发) 单模型长期生产部署

选型建议: - 前缀共享(RAG/Agent)> 60% 场景 → SGLang,TTFT p50 低 37%,p95 低 41% - 模型多样、快速迭代 → vLLM,冷启动 < 2 分钟 - 极致单模型吞吐 → TensorRT-LLM - AMD/TPU/昇腾 → vLLM 或 SGLang(多硬件支持)

来源: Atomic.Chat (2026-05)、Spheron (2026)、DeployBase (2026)


📌 三、向量数据库生产选型(2026)

关键数据(来自 Kalvium Labs、DevStarsJ 等)

数据库 p95 延迟 QPS 适用规模 月成本(估算)
Qdrant(自托管) ~8ms ~850 1M–100M ~$0(自有机器)
Pinecone(无服务器) ~45ms ~150 任意 ~$180
pgvector(HNSW 调优) ~35ms ~120 < 5M ~$250( RDS)
Weaviate(云) ~38ms ~200 中等 ~$150

选型决策树: - 中小规模(< 5M 向量)+ 已有 PG 基础设施 → pgvector(HNSW,m=16, ef=64) - 性能敏感 + 愿自托管 → Qdrant(Rust 实现,量化支持 4x 内存压缩) - 全托管 + 无运维团队 → Pinecone 或 Supabase Vector - 需要 BM25 + 向量混合检索 → Qdrant(稀疏+稠密原生支持)或 Weaviate - 需要 GraphQL 接口 → Weaviate

pgvector SQL 集成示例(生产可用):

CREATE EXTENSION IF NOT EXISTS vector;
ALTER TABLE documents ADD COLUMN embedding vector(1536);
CREATE INDEX ON documents USING hnsw(embedding vector_cosine_ops) WITH(m = 16, ef_construction = 64);
-- 带过滤的向量检索
SELECT d.id, d.title, 1 - (d.embedding <=> $1) as similarity
FROM documents d WHERE d.tenant_id = $2
ORDER BY d.embedding <=> $1 LIMIT 10;

📌 四、Agentic RAG GitHub 高价值项目

值得关注

  • volcengine/OpenViking — 34.5k⭐ 自演进上下文数据库,统一 Agent 记忆 + 知识 RAG + 技能(最新 2026-08-30)
  • nageoffer/ragent — 3.8k⭐ 企业级 Agentic RAG,含 MCP 工具调用、深度思考(Java SpringAI,2026-08-30)
  • ggozad/haiku.rag — 584⭐ 本地文档 Agentic RAG,LanceDB + Docling + MCP Server(2026-08-24)
  • stanford-oval/storm — 31.2k⭐ 深度研究写作框架,多 Agent 知识合成

📌 五、Substack 高价值来源追踪

The AI Engineer (substack.com)

  • 条目: vLLM vs Ollama vs SGLang vs TensorRT-LLM 对比(2026)
  • 核心观点: 对比应基于 workload 类型而非单点 benchmark;SGLang 在前缀共享场景优势显著;推荐 vLLM 作为原型首选。
  • 可信度: 高(有引用 arXiv SOSP 2023 论文)
  • 链接: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt

Opinion AI (substack.com)

  • 条目: 2026 AI Engineer Roadmap
  • 核心观点: 2026 AI 工程师 = 能把模型变成生产系统的人(读取数据→调用工具→记忆上下文→检索文档→结构化输出→测试部署监控);Python 基础是第一步,而非直接学神经网络。
  • 可信度: 中(行业路线图,非学术)
  • 链接: https://emergingai.substack.com/p/the-2026-ai-engineer-roadmap

模型 参数量 更新 亮点
deepseek-ai/DeepSeek-V4-Flash-0731 304B Aug 2026 4.65M 下载,Flash 版本主打推理速度
zai-org/GLM-5.3 753B 1天前 最新旗舰,GGUF + FP8 版本丰富
OBLITERATUS/Qwen3.8-27B-OBLITERATED 28B 8天前 806k 下载,极高热度,GGUF 可用
ibm-granite/granite-4.2-30b 29B 7天前 IBM 企业级,MoE 架构值得关注
unsloth/GLM-5.3-Flash-GGUF 321B 4天前 Unsloth 量化版,适合本地部署

🏷️ 分类标签

AI-Engineering LLM-Serving SGLang vLLM Vector-Database pgvector Qdrant Agentic-RAG MCP MLOps Production-Deployment HuggingFace-Models


💡 建议写入路径

/shared/research-kb/inbox/jay/2026-09-02-ai-engineering-backend-db-deployment.md


✅ 精读/审稿建议

  1. ⭐ 精读: SGLang vs vLLM 技术对比(Atomic.Chat 原文),含 RadixAttention vs PagedAttention 机制详解
  2. ⭐ 精读: pgvector HNSW 调优实战(Kalvium Labs,含 benchmark 代码与 SQL 示例)
  3. 审稿: Agentic RAG 生态更新(OpenViking、ragent、haiku.rag 均活跃,建议合并到知识库 RAG 主题页)
  4. 后续行动: 跟进 DeepSeek-V4-Flash 和 GLM-5.3 的生产推理 benchmark 数据

本条由 Jay 实例生成 | 2026-09-02 | 勿直接写入 published 目录