AI 工程 · 后端 · 数据库 · 部署高价值条目
检索时间: 2026-09-02 09:35 (UTC+8)
本次主题: AI 工程推理服务、后端、向量数据库、Agentic RAG 与生产部署生态
检索范围: GitHub Trending、Hugging Face Trending、Tavily Web Search、Substack
📌 一、GitHub Trending 高价值条目
1. minimind — 2小时从零训练 64M 小模型
- 链接: https://github.com/jingyaogong/minimind
- Stars: 57.1k | 今日 +1,005
- 核心内容: 从零训练 64M 参数 LLM 的完整实现,含数据处理、架构定义、分布式训练脚本,配套技术博客解读。
- 评价: 适合作为小模型训练 pipeline 入门参考,含完整分布式训练步骤。适合教学与快速验证想法。
- 可信度: 高(活跃维护,有详细 README)
2. openclaude — Claude Desktop 替代
- 链接: https://github.com/Gitlawb/openclaude
- Stars: 31.3k | 今日 +80
- 核心内容: 在任意环境运行 Claude,支持多种工具后端。
- 评价: 开发者工具类项目,非核心 AI 工程条目,但值得跟踪。
3. OpenMAIC — 清华多智能体交互课堂
- 链接: https://github.com/THU-MAIC/OpenMAIC
- Stars: 29.5k | 今日 +3,128
- 核心内容: 多 Agent 沉浸式学习平台,含多 Agent 编排与任务分配。
- 评价: 多 Agent 系统参考实现,工程结构较完整。
4. crawl4ai — LLM 友好的开源爬虫
- 链接: https://github.com/unclecode/crawl4ai
- Stars: 高活跃
- 核心内容: 专为 LLM 设计的网页爬取,支持 JS 渲染,输出 markdown。
- 评价: AI 数据工程基础设施,适合 RAG 数据管道构建。生产可用。
📌 二、推理引擎对比(2026 最新)
核心发现:SGLang vs vLLM vs TensorRT-LLM vs LMDeploy
| 引擎 | 核心优化技术 | H100 吞吐 | 最佳场景 |
|---|---|---|---|
| SGLang v0.4.3 | RadixAttention 前缀缓存 | ~16,200 tok/s | RAG、多轮对话、共享系统提示词 |
| LMDeploy | 持久批调度 | ~16,200 tok/s | 高吞吐批量推理 |
| vLLM v0.7.3 | PagedAttention + Continuous Batching | ~12,500 tok/s | 灵活切换模型、广泛生态 |
| TensorRT-LLM | CUDA 内核编译 | 最高(高并发) | 单模型长期生产部署 |
选型建议: - 前缀共享(RAG/Agent)> 60% 场景 → SGLang,TTFT p50 低 37%,p95 低 41% - 模型多样、快速迭代 → vLLM,冷启动 < 2 分钟 - 极致单模型吞吐 → TensorRT-LLM - AMD/TPU/昇腾 → vLLM 或 SGLang(多硬件支持)
来源: Atomic.Chat (2026-05)、Spheron (2026)、DeployBase (2026)
📌 三、向量数据库生产选型(2026)
关键数据(来自 Kalvium Labs、DevStarsJ 等)
| 数据库 | p95 延迟 | QPS | 适用规模 | 月成本(估算) |
|---|---|---|---|---|
| Qdrant(自托管) | ~8ms | ~850 | 1M–100M | ~$0(自有机器) |
| Pinecone(无服务器) | ~45ms | ~150 | 任意 | ~$180 |
| pgvector(HNSW 调优) | ~35ms | ~120 | < 5M | ~$250( RDS) |
| Weaviate(云) | ~38ms | ~200 | 中等 | ~$150 |
选型决策树:
- 中小规模(< 5M 向量)+ 已有 PG 基础设施 → pgvector(HNSW,m=16, ef=64)
- 性能敏感 + 愿自托管 → Qdrant(Rust 实现,量化支持 4x 内存压缩)
- 全托管 + 无运维团队 → Pinecone 或 Supabase Vector
- 需要 BM25 + 向量混合检索 → Qdrant(稀疏+稠密原生支持)或 Weaviate
- 需要 GraphQL 接口 → Weaviate
pgvector SQL 集成示例(生产可用):
CREATE EXTENSION IF NOT EXISTS vector;
ALTER TABLE documents ADD COLUMN embedding vector(1536);
CREATE INDEX ON documents USING hnsw(embedding vector_cosine_ops) WITH(m = 16, ef_construction = 64);
-- 带过滤的向量检索
SELECT d.id, d.title, 1 - (d.embedding <=> $1) as similarity
FROM documents d WHERE d.tenant_id = $2
ORDER BY d.embedding <=> $1 LIMIT 10;
📌 四、Agentic RAG GitHub 高价值项目
值得关注
volcengine/OpenViking— 34.5k⭐ 自演进上下文数据库,统一 Agent 记忆 + 知识 RAG + 技能(最新 2026-08-30)nageoffer/ragent— 3.8k⭐ 企业级 Agentic RAG,含 MCP 工具调用、深度思考(Java SpringAI,2026-08-30)ggozad/haiku.rag— 584⭐ 本地文档 Agentic RAG,LanceDB + Docling + MCP Server(2026-08-24)stanford-oval/storm— 31.2k⭐ 深度研究写作框架,多 Agent 知识合成
📌 五、Substack 高价值来源追踪
The AI Engineer (substack.com)
- 条目: vLLM vs Ollama vs SGLang vs TensorRT-LLM 对比(2026)
- 核心观点: 对比应基于 workload 类型而非单点 benchmark;SGLang 在前缀共享场景优势显著;推荐 vLLM 作为原型首选。
- 可信度: 高(有引用 arXiv SOSP 2023 论文)
- 链接: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
Opinion AI (substack.com)
- 条目: 2026 AI Engineer Roadmap
- 核心观点: 2026 AI 工程师 = 能把模型变成生产系统的人(读取数据→调用工具→记忆上下文→检索文档→结构化输出→测试部署监控);Python 基础是第一步,而非直接学神经网络。
- 可信度: 中(行业路线图,非学术)
- 链接: https://emergingai.substack.com/p/the-2026-ai-engineer-roadmap
📌 六、Hugging Face Trending 模型(工程侧关注)
| 模型 | 参数量 | 更新 | 亮点 |
|---|---|---|---|
deepseek-ai/DeepSeek-V4-Flash-0731 |
304B | Aug 2026 | 4.65M 下载,Flash 版本主打推理速度 |
zai-org/GLM-5.3 |
753B | 1天前 | 最新旗舰,GGUF + FP8 版本丰富 |
OBLITERATUS/Qwen3.8-27B-OBLITERATED |
28B | 8天前 | 806k 下载,极高热度,GGUF 可用 |
ibm-granite/granite-4.2-30b |
29B | 7天前 | IBM 企业级,MoE 架构值得关注 |
unsloth/GLM-5.3-Flash-GGUF |
321B | 4天前 | Unsloth 量化版,适合本地部署 |
🏷️ 分类标签
AI-Engineering LLM-Serving SGLang vLLM Vector-Database pgvector Qdrant Agentic-RAG MCP MLOps Production-Deployment HuggingFace-Models
💡 建议写入路径
/shared/research-kb/inbox/jay/2026-09-02-ai-engineering-backend-db-deployment.md
✅ 精读/审稿建议
- ⭐ 精读: SGLang vs vLLM 技术对比(Atomic.Chat 原文),含 RadixAttention vs PagedAttention 机制详解
- ⭐ 精读: pgvector HNSW 调优实战(Kalvium Labs,含 benchmark 代码与 SQL 示例)
- 审稿: Agentic RAG 生态更新(OpenViking、ragent、haiku.rag 均活跃,建议合并到知识库 RAG 主题页)
- 后续行动: 跟进 DeepSeek-V4-Flash 和 GLM-5.3 的生产推理 benchmark 数据
本条由 Jay 实例生成 | 2026-09-02 | 勿直接写入 published 目录