GitHub Trending · Inference Engines · RAG Frameworks 动态

主题: GitHub Trending AI 工程仓库 + vLLM/SGLang 推理引擎对比 + RAG 框架生态更新 时间: 2026-09-14 10:00 (Asia/Shanghai) 实例: Jay


🔥 okf-memory/okf-agent-memory

  • ⭐ 627 stars(周内)
  • 描述: Git 原生持久化记忆层,为 AI 编码 Agent 实现 Google OKF v0.2 规范。含亚 300μs 内存 BM25 搜索、内嵌 MCP 服务器、渐进式披露。
  • 亮点: 零外部数据库依赖,纯 Go 实现,token 膨胀降低 80%
  • 链接: https://github.com/okf-memory/okf-agent-memory
  • 可信度: 高(周内活跃,627 stars 增长极快)
  • 行动建议: 值得原型验证,关注其 MCP server 实现是否可复用于其他 Agent 记忆层

🔧 PG-Circuit/pg-circuit

  • ⭐ ~12 stars
  • 描述: PostgreSQL 熔断器(circuit breaker)。原生扩展,可基于实时数据库状态 ALLOW/WARN/BLOCK 危险 SQL
  • 链接: https://github.com/PG-Circuit/pg-circuit
  • 可信度: 中高(新鲜仓库,Apache 2.0)
  • 行动建议: 生产 PostgreSQL 防护场景值得关注;等 star 破百再深度审阅

🔧 consize-oss/consize

  • ⭐ ~9 stars
  • 描述: K8s 成本优化安全引擎,使用 guarded rollouts + SLI 自动化回滚
  • 链接: https://github.com/consize-oss/consize
  • 可信度: 中(新仓库)
  • 行动建议: 观察其与 KEDA/VPA 的差异化定位

🔧 supabase-multitenant/supabase-multitenant

  • ⭐ 20 stars
  • 描述: 将 Supabase 多租户化,可在任意基础设施自托管,运行在 Coolify/Dokku/Dokploy 或自有环境
  • 链接: https://github.com/supabase-multitenant/supabase-multitenant
  • 可信度: 中高(基于成熟 Supabase 生态)
  • 行动建议: SaaS 多租户 PostgreSQL 场景可直接评估

🔧 danielroe/airspace

  • ⭐ 33 stars
  • 描述: "The database you already have" — 语义待核实
  • 链接: https://github.com/danielroe/airspace
  • 可信度: 待确认
  • 行动建议: 需进一步核实定位

📊 注:gh search repos 在本环境暂无输出,以上数据来自 GitHub REST API direct query


二、vLLM vs SGLang 推理引擎对比(2026 年 9 月最新)

来源: Particula Tech Blog / Spheron / AIMultiple / Atomic.chat 等技术博客

核心架构差异

特性 vLLM SGLang
KV 缓存管理 PagedAttention RadixAttention
前缀缓存 支持(2026 新增) 原生支持,更成熟
投机解码 EAGLE / Medusa Multi-Token Prediction via EAGLE
长上下文 Chunked Prefill Chunked Prefill + MLA 优化
DeepSeek 模型支持 通用 深度优化(3.1x 速度优势)
社区规模 ~47k GitHub stars ~27k GitHub stars

性能基准(来源:Spheron, Particula Tech, 2026-06 ~ 2026-09)

通用负载(Unique Prompt): - 并发 1: vLLM 312 tok/s vs SGLang 318 tok/s(+2% SGLang) - 并发 50: vLLM 1,850 vs SGLang 1,920 tok/s(+4% SGLang) - 并发 100: vLLM 2,010 vs SGLang 2,050 tok/s(+2% SGLang) - 结论:通用负载两者差异 ≤4%,实际选择取决于生态和长尾功能

DeepSeek V3 专项(来源:Particula Tech, 2026-08): - SGLang 在 H100 上比 vLLM 吞吐量高 29% - DeepSeek V3 推理速度 3.1x 快于 vLLM(得益于 MLA + FlashAttention3/FlashInfer/FlashMLA/CutlassMLA 优化链) - Multi-Token Prediction:batch=1 时 decode 加速 1.8x,batch=32 时 1.5x

H100 整体(来源:AIMultiple, 2026-04): - Llama 3.1 8B-Instruct on H100,SGLang vs vLLM 吞吐量差异仍在 5% 以内

选择建议

场景 推荐
通用推理服务、成熟生态 vLLM(社区大,文档全,200+ 模型支持)
DeepSeek 系列 / 长上下文密集 SGLang(MLA 优化显著)
前缀共享高的 Agent 对话 SGLang(RadixAttention 成熟)
需要 TensorRT-LLM / NVIDIA 一体化 SGLang(NVIDIA 合作紧密)
追求绝对稳定性 / 企业支持 vLLM

重要趋势(来源:Medium @ant-oss, 2026)

  • 两大引擎功能正在收敛:Continuous Batching、PagedAttention、RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving、CUDA Graphs 均已支持
  • 差异化正在转向:特有模型优化(DeepSeek)、生态成熟度、多框架互操作性

链接: - Particula Tech 对比: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison - Spheron 基准: https://www.spheron.network/blog/vllm-vs-sglang-2026 - AIMultiple 三引擎: https://aimultiple.com/inference-engines - LeetLLM 综合对比: https://leetllm.com/blog/llm-inference-engine-comparison-2026 - Atomic.chat 选型: https://atomic.chat/blog/llm-updates/sglang-vs-vllm


三、RAG 框架生态更新(2026 年 7-9 月)

来源: Turing Post / Firecrawl / Olostep / Onyx AI / AlphaCorp

Haystack 3.0(deepset, 2026-07-20 发布)

核心变化: - Agent 为中心:first-class skills、agent-loop hooks、内置 run introspection、预构建 deep research / advanced RAG agents - 核心更轻量:大量集成移至独立发布的包 - 定位:从"管道编排"转向"生产 Agent + RAG"双重定位

许可: Apache 2.0

适用场景: 从 demo 走向生产、需要可测试管道的团队

主流框架 GitHub Stars(2026 年 1 月快照)

框架 Stars 定位
LangChain ~125k 编排 + Agent 工作流
Dify ~114k 视觉化 LLM 应用平台
RAGFlow ~70k 复杂文档处理
LlamaIndex ~46.5k 数据摄取 + 检索深度
Haystack ~24k 生产 Agent + RAG

许可证注意(重要)

项目 许可 风险
LangChain, LlamaIndex, Haystack OSI 批准(Apache 2.0 / MIT)
Pathway, Dify 源码可用,有使用限制 中(不应与纯开源混为一谈)
Open WebUI BSD-3 → 2025 年改为限制性许可证 高风险

选型决策树(综合多个来源)

起点:你的瓶颈是什么?
├── 复杂文档 → RAGFlow
├── 图增强检索 + 多模态 → LightRAG
├── 数据摄取 + 检索设计 → LlamaIndex
├── Agent 编排 + 多步工作流 → LangChain / LangGraph
├── 生产 Agent + RAG → Haystack 3.0
└── 仅实时数据摄取 → Pathway(先确认许可证)

建议始终搭配评估层: Ragas + tracing/observability(如 LangSmith、Agenta)

链接: - Turing Post RAG 工具对比: https://www.turingpost.com/p/rag-tools - Firecrawl 15 框架: https://www.firecrawl.dev/blog/best-open-source-rag-frameworks - Onyx 企业 RAG 平台: https://onyx.app/insights/enterprise-rag-platforms-2026 - AlphaCorp RAG Top 5: https://alphacorp.ai/blog/rag-frameworks-top-5-picks-in-2026


四、向量数据库格局(2026 年最新)

来源: Medium / Firecrawl / Encore / JusDB / Olostep

选型参考(成熟场景)

场景 推荐 理由
现有 PostgreSQL + <5000 万向量 pgvector + pgvectorscale 零新基础设施
<1000 万向量,追求免费 Qdrant Cloud(1GB 永久免费) 最佳免费层
需要混合搜索(向量+关键词) Weaviate 内置 vectorizer + hybrid search
亿级向量 Milvus / Zilliz Cloud GPU 加速,企业级
原型/本地开发 ChromaDB 最轻量
边缘/嵌入式 LanceDB 多模态,serverless

Qdrant 1.17 新能力(2026-07 更新)

  • Payload 过滤在图遍历期间实时应用(非后过滤),显著提升带选择性过滤条件的召回率
  • 多语言 SDK(Python/JS/Rust/Go)

关键判断

"你用 RAG 起步的项目很少是你最终交付生产的那个" — 多个来源共识。先用简单方案快速验证,再根据真实瓶颈换数据库。


分类标签

GitHub-Trending Inference-Engine vLLM SGLang RAG Haystack Vector-DB PostgreSQL AI-Engineering Backend


建议写入路径

/shared/research-kb/inbox/jay/2026-09-14-1005-github-trending-inference-rag-2026.md


是否需要精读/审稿/主题页更新

项目 建议
okf-agent-memory MCP 记忆方案 精读源码,评估能否引入 Agent 记忆层主题页
vLLM vs SGLang 对比 精读 Particula Tech 原文,补充具体 benchmark 数据来源
Haystack 3.0 发布说明 审稿确认与旧版架构差异
向量数据库选型决策树 可纳入 RAG 主题页作为附录
GitHub Trending 仓库清单 审稿:部分仓库信息尚需核实