研究草稿:AI 工程·后端·数据库·推理引擎(2026-09-01 下午)

主题

GitHub Trending 高价值项目 + LLM 推理引擎对比 + 向量数据库选型


⭐⭐⭐ jingyaogong/minimind

标签: LLM训练 / 教育 / 从零理解LLM架构 链接: https://github.com/jingyaogong/minimind

核心内容: - 64M 参数 GPT 语言模型,从零训练仅需 2 小时、约 ¥3(单张 RTX 3090) - 完整管线:Tokenizer → Pretrain → SFT → LoRA → DPO → PPO/GRPO/CISPO → Agentic RL - 架构对齐 Qwen3 / Qwen3-MoE:Dense ~64M、MoE ~198M/A64M - 支持工具调用(Tool Calling)和自适应思考(Adaptive Thinking) - 原生 PyTorch 实现,无第三方抽象层 - 与 vLLM、Ollama、llama.cpp、SGLang、transformers 完全兼容 - 提供 OpenAI 兼容 API 服务器(serve_openai_api.py) - 可集成 FastGPT、Open-WebUI、Dify

技术亮点: - MoE 变体仅需 ~8GB VRAM - 提供预构建数据集(HuggingFace):pretrain corpus、SFT pairs、DPO preference pairs、tool-use examples - Agentic RL 支持多轮工具调用(train_agent.py) - 支持 SwanLab 模型可视化

评价:
对学习和理解 LLM 内部机制的极高价值项目。不只是工具,更是教材,适合想深入理解 RLHF、MoE、对齐训练的工程师。


⭐⭐ Osmantic/ODS

标签: 本地AI推理服务器 / 一体化平台 链接: https://github.com/Osmantic/ODS 语言: Python

核心内容: - 将 PC/Mac/Linux 变成 AI 服务器 - 支持 LLM 推理、Chat UI、语音、Agent、工作流、RAG、图片生成 - 适合本地开发测试或小型团队私有部署

评价:
工程化程度较高,适合需要快速搭建本地 AI 开发环境的场景。


⭐⭐ THU-MAIC/OpenMAIC

标签: 多Agent学习系统 / 教育 链接: https://github.com/THU-MAIC/OpenMAIC 语言: TypeScript

核心内容: - 沉浸式多 Agent 交互学习系统 - 今日 2,824 stars

评价:
多 Agent 系统设计参考价值,研究性质偏强。


⭐⭐ K-Dense-AI/scientific-agent-skills

标签: AI Scientist / Agent Skills / 科学工具库 链接: https://github.com/K-Dense-AI/scientific-agent-skills 语言: Python

核心内容: - 将任意 AI Agent 变成 AI Scientist - 190,000+ 科学家使用 - 165 个已验证技能 + 100+ 科学数据库覆盖生物、化学、医学、药物发现 - 兼容 Cursor、Claude Code、Codex、Pi、Antigravity 等

评价:
面向科研场景的 Agent 工具库,非通用工程场景,但科学 Agent 方向值得关注。


二、LLM 推理引擎对比(2026年)

性能数据基准(H100 GPU)

引擎 Token/s 优势场景 劣势
SGLang ~16,200 多轮对话、RAG、长系统提示、结构化输出 模型覆盖略窄
LMDeploy ~16,200 量化模型部署 主流模型为主
vLLM ~12,500 生态最广、生产稳定、单轮交互 前缀缓存弱
TensorRT-LLM 编译后最优 NVIDIA 生产部署 CLI 变化大、编译耗时长

选型决策树

是否需要生产级稳定性?
├── 是 → vLLM(生态成熟、文档完善)
└── 否 → 继续判断
    是否多轮/RAG/Agent流量?
    ├── 是 → SGLang(RadixAttention 前缀缓存优势明显)
    └── 否 → vLLM 足够

是否部署量化模型?
├── 是 → LMDeploy(TurboMind 优化)
└── 否 → 参考上方决策

是否在 AWS Trainium?
├── 是 → vLLM(唯一支持)
└── 否 → SGLang 或 vLLM

⚠️ 安全注意

  • SGLang Pickle RCE(CVE-2026-3059, CVE-2026-3060):CVSS 9.8,多模态和 disaggregation 模块存在未认证 RCE,2026年3月未修复,禁止将相关端点暴露于不可信输入
  • TensorRT-LLM CLI 废弃trtllm-serve CLI 选项在 v1.0+ 变更,PyTorch 后端现为默认,升级前需查阅 NVIDIA 发布说明

来源: - https://dev.to/jaipalsingh/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026-5h04 - https://www.bestaiweb.ai/how-to-deploy-and-optimize-llm-inference-with-vllm-tensorrt-llm-and-sglang-in-2026 - https://leetllm.com/blog/llm-inference-engine-comparison-2026 - https://techsy.io/en/blog/vllm-vs-sglang


三、向量数据库选型(2026年)

核心对比

数据库 类型 规模上限 亮点 缺点
pgvector Postgres 扩展 ~100M/节点 SQL 统一、ACID、现有 Postgres 用户零迁移 单节点、内存密集型索引
Qdrant 专用向量DB(Rust) 数亿 Payload 过滤强、水平扩展、gRPC 需独立运维
Pinecone 托管 SaaS 十亿+ 零运维、Serverless 闭源、成本高
Milvus 专用向量DB 十亿+ GPU 加速、K8s 原生、社区大 部署复杂
Weaviate 专用向量DB 中等 原生向量化、混合搜索 规模弹性弱

延迟基准(5M向量)

指标 pgvector 0.8 Qdrant 1.8 Pinecone Serverless
p50 延迟 28ms 8ms 25ms
p99 延迟 145ms 45ms 120ms
Recall@10 95% 98% 97%
索引构建 45min 12min N/A
内存占用 38GB 28GB N/A
5M向量月成本 ~$200 ~$150 ~$350

选型建议

  • pgvector:数据已在 Postgres、向量 < 500W、需 ACID 事务
  • Qdrant:向量搜索为主业、需要复杂 metadata 过滤、规模超单机上限
  • Pinecone:完全不想运维、追求快速迭代
  • Milvus:亿级向量、需要 GPU 加速
  • Weaviate:需要原生混合搜索(全文+向量)

来源: - https://rivestack.io/blog/pgvector-vs-qdrant - https://devstarsj.github.io/2026/03/31/vector-databases-pgvector-qdrant-pinecone-production-comparison-2026 - https://encore.dev/articles/best-vector-databases


模型 参数量 类型 亮点
Qwen/Qwen3.8-Flash-Next 180B 图像-文本生成 最新 Qwen3.8 系列
zai-org/GLM-5.3-Flash 321B 文本生成 超大杯
deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 305B 多模态 DeepSeek 最新多模态
unsloth/Qwen3.8-Flash-Next-GGUF 177B 量化版 本地部署友好
BreezeBlue/Breeze-TTS-2 3B TTS 实时语音合成

观察: Qwen3.8 系列占据 HF trending 主流,GGUF 量化版本热度极高(Qwen3.8-27B-GGUF 下载量 9.06M),说明本地部署需求旺盛。


五、分类标签

LLM训练 推理引擎 vLLM SGLang TensorRT-LLM LMDeploy 向量数据库 pgvector Qdrant Pinecone Milvus RAG Agent MoE RLHF 教育工具 开源


六、建议写入路径

/shared/research-kb/inbox/jay/2026-09-01-ai-engineering-backend-db-inference.md

七、后续行动建议

  1. 精读minimind 项目源码,重点关注 GRPO/CISPO 实现和 Agentic RL 管线
  2. 审稿:SGLang CVE 风险评估,确认是否有受影响端点暴露
  3. 主题页更新:建议为 "LLM 推理引擎对比" 和 "向量数据库选型" 创建或更新专题页
  4. Substack 补充:下次检索需纳入 AI 工程类 Substack(如 The Batch、Last Week in AI、The Gradient)