GitHub Trending · Inference Engines · RAG Frameworks 动态
主题: GitHub Trending AI 工程仓库 + vLLM/SGLang 推理引擎对比 + RAG 框架生态更新 时间: 2026-09-14 10:00 (Asia/Shanghai) 实例: Jay
一、GitHub Trending 高价值仓库(2026-09-10 ~ 2026-09-14 新增/更新)
🔥 okf-memory/okf-agent-memory
- ⭐ 627 stars(周内)
- 描述: Git 原生持久化记忆层,为 AI 编码 Agent 实现 Google OKF v0.2 规范。含亚 300μs 内存 BM25 搜索、内嵌 MCP 服务器、渐进式披露。
- 亮点: 零外部数据库依赖,纯 Go 实现,token 膨胀降低 80%
- 链接: https://github.com/okf-memory/okf-agent-memory
- 可信度: 高(周内活跃,627 stars 增长极快)
- 行动建议: 值得原型验证,关注其 MCP server 实现是否可复用于其他 Agent 记忆层
🔧 PG-Circuit/pg-circuit
- ⭐ ~12 stars
- 描述: PostgreSQL 熔断器(circuit breaker)。原生扩展,可基于实时数据库状态 ALLOW/WARN/BLOCK 危险 SQL
- 链接: https://github.com/PG-Circuit/pg-circuit
- 可信度: 中高(新鲜仓库,Apache 2.0)
- 行动建议: 生产 PostgreSQL 防护场景值得关注;等 star 破百再深度审阅
🔧 consize-oss/consize
- ⭐ ~9 stars
- 描述: K8s 成本优化安全引擎,使用 guarded rollouts + SLI 自动化回滚
- 链接: https://github.com/consize-oss/consize
- 可信度: 中(新仓库)
- 行动建议: 观察其与 KEDA/VPA 的差异化定位
🔧 supabase-multitenant/supabase-multitenant
- ⭐ 20 stars
- 描述: 将 Supabase 多租户化,可在任意基础设施自托管,运行在 Coolify/Dokku/Dokploy 或自有环境
- 链接: https://github.com/supabase-multitenant/supabase-multitenant
- 可信度: 中高(基于成熟 Supabase 生态)
- 行动建议: SaaS 多租户 PostgreSQL 场景可直接评估
🔧 danielroe/airspace
- ⭐ 33 stars
- 描述: "The database you already have" — 语义待核实
- 链接: https://github.com/danielroe/airspace
- 可信度: 待确认
- 行动建议: 需进一步核实定位
📊 注:gh search repos 在本环境暂无输出,以上数据来自 GitHub REST API direct query
二、vLLM vs SGLang 推理引擎对比(2026 年 9 月最新)
来源: Particula Tech Blog / Spheron / AIMultiple / Atomic.chat 等技术博客
核心架构差异
| 特性 | vLLM | SGLang |
|---|---|---|
| KV 缓存管理 | PagedAttention | RadixAttention |
| 前缀缓存 | 支持(2026 新增) | 原生支持,更成熟 |
| 投机解码 | EAGLE / Medusa | Multi-Token Prediction via EAGLE |
| 长上下文 | Chunked Prefill | Chunked Prefill + MLA 优化 |
| DeepSeek 模型支持 | 通用 | 深度优化(3.1x 速度优势) |
| 社区规模 | ~47k GitHub stars | ~27k GitHub stars |
性能基准(来源:Spheron, Particula Tech, 2026-06 ~ 2026-09)
通用负载(Unique Prompt): - 并发 1: vLLM 312 tok/s vs SGLang 318 tok/s(+2% SGLang) - 并发 50: vLLM 1,850 vs SGLang 1,920 tok/s(+4% SGLang) - 并发 100: vLLM 2,010 vs SGLang 2,050 tok/s(+2% SGLang) - 结论:通用负载两者差异 ≤4%,实际选择取决于生态和长尾功能
DeepSeek V3 专项(来源:Particula Tech, 2026-08): - SGLang 在 H100 上比 vLLM 吞吐量高 29% - DeepSeek V3 推理速度 3.1x 快于 vLLM(得益于 MLA + FlashAttention3/FlashInfer/FlashMLA/CutlassMLA 优化链) - Multi-Token Prediction:batch=1 时 decode 加速 1.8x,batch=32 时 1.5x
H100 整体(来源:AIMultiple, 2026-04): - Llama 3.1 8B-Instruct on H100,SGLang vs vLLM 吞吐量差异仍在 5% 以内
选择建议
| 场景 | 推荐 |
|---|---|
| 通用推理服务、成熟生态 | vLLM(社区大,文档全,200+ 模型支持) |
| DeepSeek 系列 / 长上下文密集 | SGLang(MLA 优化显著) |
| 前缀共享高的 Agent 对话 | SGLang(RadixAttention 成熟) |
| 需要 TensorRT-LLM / NVIDIA 一体化 | SGLang(NVIDIA 合作紧密) |
| 追求绝对稳定性 / 企业支持 | vLLM |
重要趋势(来源:Medium @ant-oss, 2026)
- 两大引擎功能正在收敛:Continuous Batching、PagedAttention、RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving、CUDA Graphs 均已支持
- 差异化正在转向:特有模型优化(DeepSeek)、生态成熟度、多框架互操作性
链接: - Particula Tech 对比: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison - Spheron 基准: https://www.spheron.network/blog/vllm-vs-sglang-2026 - AIMultiple 三引擎: https://aimultiple.com/inference-engines - LeetLLM 综合对比: https://leetllm.com/blog/llm-inference-engine-comparison-2026 - Atomic.chat 选型: https://atomic.chat/blog/llm-updates/sglang-vs-vllm
三、RAG 框架生态更新(2026 年 7-9 月)
来源: Turing Post / Firecrawl / Olostep / Onyx AI / AlphaCorp
Haystack 3.0(deepset, 2026-07-20 发布)
核心变化: - Agent 为中心:first-class skills、agent-loop hooks、内置 run introspection、预构建 deep research / advanced RAG agents - 核心更轻量:大量集成移至独立发布的包 - 定位:从"管道编排"转向"生产 Agent + RAG"双重定位
许可: Apache 2.0
适用场景: 从 demo 走向生产、需要可测试管道的团队
主流框架 GitHub Stars(2026 年 1 月快照)
| 框架 | Stars | 定位 |
|---|---|---|
| LangChain | ~125k | 编排 + Agent 工作流 |
| Dify | ~114k | 视觉化 LLM 应用平台 |
| RAGFlow | ~70k | 复杂文档处理 |
| LlamaIndex | ~46.5k | 数据摄取 + 检索深度 |
| Haystack | ~24k | 生产 Agent + RAG |
许可证注意(重要)
| 项目 | 许可 | 风险 |
|---|---|---|
| LangChain, LlamaIndex, Haystack | OSI 批准(Apache 2.0 / MIT) | 低 |
| Pathway, Dify | 源码可用,有使用限制 | 中(不应与纯开源混为一谈) |
| Open WebUI | BSD-3 → 2025 年改为限制性许可证 | 高风险 |
选型决策树(综合多个来源)
起点:你的瓶颈是什么?
├── 复杂文档 → RAGFlow
├── 图增强检索 + 多模态 → LightRAG
├── 数据摄取 + 检索设计 → LlamaIndex
├── Agent 编排 + 多步工作流 → LangChain / LangGraph
├── 生产 Agent + RAG → Haystack 3.0
└── 仅实时数据摄取 → Pathway(先确认许可证)
建议始终搭配评估层: Ragas + tracing/observability(如 LangSmith、Agenta)
链接: - Turing Post RAG 工具对比: https://www.turingpost.com/p/rag-tools - Firecrawl 15 框架: https://www.firecrawl.dev/blog/best-open-source-rag-frameworks - Onyx 企业 RAG 平台: https://onyx.app/insights/enterprise-rag-platforms-2026 - AlphaCorp RAG Top 5: https://alphacorp.ai/blog/rag-frameworks-top-5-picks-in-2026
四、向量数据库格局(2026 年最新)
来源: Medium / Firecrawl / Encore / JusDB / Olostep
选型参考(成熟场景)
| 场景 | 推荐 | 理由 |
|---|---|---|
| 现有 PostgreSQL + <5000 万向量 | pgvector + pgvectorscale | 零新基础设施 |
| <1000 万向量,追求免费 | Qdrant Cloud(1GB 永久免费) | 最佳免费层 |
| 需要混合搜索(向量+关键词) | Weaviate | 内置 vectorizer + hybrid search |
| 亿级向量 | Milvus / Zilliz Cloud | GPU 加速,企业级 |
| 原型/本地开发 | ChromaDB | 最轻量 |
| 边缘/嵌入式 | LanceDB | 多模态,serverless |
Qdrant 1.17 新能力(2026-07 更新)
- Payload 过滤在图遍历期间实时应用(非后过滤),显著提升带选择性过滤条件的召回率
- 多语言 SDK(Python/JS/Rust/Go)
关键判断
"你用 RAG 起步的项目很少是你最终交付生产的那个" — 多个来源共识。先用简单方案快速验证,再根据真实瓶颈换数据库。
分类标签
GitHub-Trending Inference-Engine vLLM SGLang RAG Haystack Vector-DB PostgreSQL AI-Engineering Backend
建议写入路径
/shared/research-kb/inbox/jay/2026-09-14-1005-github-trending-inference-rag-2026.md
是否需要精读/审稿/主题页更新
| 项目 | 建议 |
|---|---|
| okf-agent-memory MCP 记忆方案 | 精读源码,评估能否引入 Agent 记忆层主题页 |
| vLLM vs SGLang 对比 | 精读 Particula Tech 原文,补充具体 benchmark 数据来源 |
| Haystack 3.0 发布说明 | 审稿确认与旧版架构差异 |
| 向量数据库选型决策树 | 可纳入 RAG 主题页作为附录 |
| GitHub Trending 仓库清单 | 审稿:部分仓库信息尚需核实 |