学术研究知识库草稿 · Jay · 2026-09-21 17:35

主题

GitHub Trending / Hugging Face / 推理引擎 / Vector DB / AI Agent 生态综合调研(2026年9月第三周)

检索范围

  • GitHub Trending(AI Agent、RAG、Inference 分类)
  • Hugging Face 官方博客 + HF Paper Explorer
  • arXiv(cs.AI / cs.SE / cs.LG)
  • Papers with Code
  • Substack 高质量 newsletter(ByteByteGo、EngineersGuide 等)
  • 工程化技术博客(Spheron、Prem AI、Turion.ai、Atomic Chat、Yotta Labs)

候选条目

一、推理引擎格局(2026年9月)

⭐ 高价值:vLLM vs SGLang 2026 决策框架

来源: - Spheron Blog:LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026) - URL: https://www.spheron.network/blog/llm-inference-optimization-2026 - Prem AI Blog:LLM Inference Servers Compared: vLLM vs TGI vs SGLang vs Triton (2026) - URL: https://www.premai.io/blog/llm-inference-servers-compared-vllm-vs-tgi-vs-sglang-vs-triton-2026 - Turion.ai:vLLM vs SGLang: Inference Engine Comparison 2026 - URL: https://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026 - Yotta Labs:vLLM vs SGLang in 2026: Speed, Throughput, and Cost Compared - URL: https://www.yottalabs.ai/post/vllm-vs-sglang-which-inference-engine-should-you-use-in-2026 - Atomic Chat:SGLang vs vLLM: Which Inference Engine Should You Use? (2026) - URL: https://atomic.chat/blog/llm-updates/sglang-vs-vllm

核心观点摘要: 1. TGI 已死(2025年12月进入维护模式),HF 官方推荐 vLLM 或 SGLang 新部署。 2. vLLM:生产标准,PagedAttention,KV cache 内存浪费 <4%,冷启动约62秒,模型覆盖最广(数百种架构),多厂商硬件支持,是安全默认选择。 3. SGLang:多轮对话专用,RadixAttention 缓存重复前缀,实测 prefix-reuse >60% 时 3-5x prefill 延迟改善;在 Grok 部署中达数十万 GPU 规模。 4. 吞吐量:SGLang 和 LMDeploy 约 16,200 tokens/s (H100),vLLM 约 12,500 tokens/s(差距约29%)。 5. 解离式服务(prefill-decode disaggregation):SGLang 的实现更干净,vLLM 更可配置但也更复杂。 6. 决策矩阵: - 选 vLLM:首产部署、多模型兼容、团队重视稳定性文档、单轮交互为主。 - 选 SGLang:多轮对话为主、构建 Agent、系统 prompt/工具定义重复性高、结构化输出(JSON/XML)关键。 - 选 LMDeploy:量化模型服务、最低 TTFT、NVIDIA 专用。 - 选 TensorRT-LLM:愿意维护编译管道、追求原始吞吐量上限。

可信度:高 | 多方交叉验证,多个独立工程博客数据一致。
后续行动: 建议更新知识库「推理引擎选型 SOP」,当前内容需补充 TGI 废弃说明和 SGLang RadixAttention 基准数据。


二、Vector DB 生产选型 2026

⭐ 高价值:pgvector 崛起与专业 VDB 决策框架

来源: - EngineersGuide (Substack):Best vector databases for production RAG in 2026 - URL: https://engineersguide.substack.com/p/best-vector-databases-rag - 专栏:EngineersGuide(专注 AI 工程化实践,高可信度) - Refonte Learning (Substack):The 2026 Vector Database Shakeout, Explained - URL: https://www.refontelearning.com/blog/vector-database-shakeout-postgres - Medium(pratik-rupareliya):Top 15 Vector Databases in 2026: A Production Decision Guide - URL: https://medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026-a-production-decision-guide-from-100-enterprise-deployments-dd58a04f51a5 - DigitalApplied:Build a Self-Hosted RAG with Postgres pgvector: 2026 Guide - URL: https://www.digitalapplied.com/blog/build-self-hosted-rag-postgres-pgvector-tutorial-2026 - TiDB Blog:Best Vector Database for RAG: Top Picks for 2026 - URL: https://www.pingcap.com/compare/best-vector-database - AlphaCorp AI:Best Vector Databases for RAG 2026: Top 7 Picks - URL: https://alphacorp.ai/blog/best-vector-databases-rag-2026-top-7-picks - Braintrust:Best vector databases for RAG in 2026 - URL: https://www.braintrust.dev/articles/best-vector-databases-rag-2026

核心观点摘要: 1. pgvector 已成主流:2026年 Postgres 提高了引入专用 VDB 的门槛——现在需要 affirmative architecture decision 而非自动选择。50M 向量以内 pgvector 足够,HNSW 重建超50-100M向量时超过6小时。 2. 选型决策树: - <10M 向量 + 现有 Postgres → pgvector(零新基础设施) - 100K-50M 向量 + 混合负载 → pgvector + pgvectorscale(471 QPS @ 99% recall) - 50M-1B 向量 + 毫秒延迟 → Qdrant(P50 ~2.1ms,1200 QPS) - 企业托管 + 零运维 → Pinecone(P50 ~4.2ms,800 QPS,Serverless) - 原生混合检索 + 多租户 → Weaviate(BM25+向量融合,GraphQL) - 亿级向量 + 分布式 → Milvus / Zilliz Cloud 3. 2026年新趋势:pgvector.scale (Warpspeed) 性能已接近专用 VDB,混合检索(向量+关键词)成标配,RAG 系统90天内必然引入混合检索。 4. Core insight:选型已从「哪个 VDB 最快」变成「这个 workload 是否真的需要专用 VDB」,Postgres 重新定义了基准线。

可信度:高 | 多方工程经验汇总,与 Refonte Learning 的「Postgres 赢了」论点相互印证。
后续行动: 建议更新知识库「Vector DB 选型决策树」,补充 pgvector.scale 性能数据和混合检索趋势。


三、GitHub AI Agent 生态 2026 榜单

⭐ 中高价值:Top 20 AI Agent GitHub Repos

来源: - Fungies.io:Top 20 GitHub Repositories for AI Agents in 2026 (Ranked by Stars) - URL: https://fungies.io/top-github-repositories-ai-agent-frameworks-2026 - Undercode Testing:The 2026 Open-Source AI Stack: 12 GitHub Repositories Redefining Agents, RAG, And Local LLMs - URL: https://undercodetesting.com/the-2026-open-source-ai-stack-12-github-repositories-redefining-agents-rag-and-local-llms-video - ByteByteGo Blog (Substack):Top AI GitHub Repositories in 2026 - URL: https://blog.bytebytego.com/p/top-ai-github-repositories-in-2026 - caramaschiHG/awesome-ai-agents-2026 (GitHub) - URL: https://github.com/caramaschiHG/awesome-ai-agents-2026

核心数据(2026年9月快照):

排名 项目 语言 描述 星数
1 langgenius/dify Python/TS 开源 LLM 应用平台,可视化工作流 114k+
2 microsoft/GraphRAG Python 模块化图增强 RAG 32.5k
3 HKUDS/LightRAG Python EMNLP 2025 论文实现 34.2k
4 mem0ai/mem0 Python Agent 通用记忆层 54k
5 RAGFlow Python 深度理解 RAG 引擎 77.2k
6 LangChain Python/TS LLM 应用框架 46.5k+
7 LlamaIndex Python/TS 数据连接框架 46.5k
8 LobeHub TypeScript 多 Agent 协作平台 74.7k
9 MetaGPT Python 多 Agent 软件公司模拟 66.6k
10 topoteretes/cognee Python 6行代码 Agent 记忆引擎 16.7k

Gartner 预测:2026年底40%企业应用将包含任务专用 AI Agent(2025年<5%)。

可信度:中 | 多个独立来源交叉,星数截至2026年9月。
后续行动: 建议知识库补充 Dify 和 LightRAG 的深度条目(Dify 工作流 + LightRAG EMNLP 2025 论文)。


四、Top 10 RAG 框架榜单(2026年1月快照)

来源: - Florinel CHIS (Medium):Top 10 RAG Frameworks on GitHub (By Stars) — January 2026 - URL: https://florinelchis.medium.com/top-10-rag-frameworks-on-github-by-stars-january-2026-e6edff1e0d91

榜单摘要: 1. LangChain(灵活但陡峭学习曲线,适合复杂多步 RAG) 2. Dify(最快增长,可视化低代码) 3. LlamaIndex(专业数据连接,复杂索引策略) 4. RAGFlow(深度理解,文档结构感知) 5. Langflow(LangChain 可视化拖拽) 6. Haystack(企业级,deepset 出品,监管行业) 7. txtai(轻量自包含,嵌入式向量 DB) 8. Pathway(实时数据 RAG,流式) 9. AutoRAG(RAG 自动评估选优) 10. Chroma(原型最快,LLM 应用嵌入式数据库)


五、HF State of Open Models Summer 2026

来源: - Hugging Face 官方博客:State of Open Models: Summer 2026 Observations - URL: https://huggingface.co/blog/state-of-open-models-summer-2026

核心数据: - HF Hub:296万模型(+22% YoY),100万数据集(+41% YoY),144万 Spaces - Qwen 家族:36个 repo,30天下载量 240.1M,是第二名 Gemma(32.6M)的7.3倍 - runtime 层增长最快:gguf +464%,lerobot +194%,Apple MLX +148%,transformers/peft 仅+16% - 模型分布极端:85.6% 模型累计下载<200次,前1.5% repo 占了99.2%下载量 - 关键趋势:本地推理格式爆发(gguf/MLX),边缘运行层增长远超模型核心

可信度:极高 | HF 官方数据,第一手。
后续行动: 建议知识库更新「开源模型格局」章节,Qwen 主导地位数据需同步更新。


六、2026年9月下载量最高的开源 LLM(Hugging Face)

来源: - DigitalApplied:Which Open AI Models People Download: September 2026 Data - URL: https://www.digitalapplied.com/blog/most-downloaded-open-ai-models-hugging-face-september-2026

Top 10 模型家族(30天下载): 1. Qwen(36个 repo)—— 240.1M 2. Gemma(6个 repo)—— 32.6M 3. Ornith(3个 repo)—— 13.5M 4. Llama(2个 repo)—— 12.9M 5. gpt-oss(2个 repo)—— 11.9M 6. OTel(1个 repo)—— 7.4M


七、学术论文(arXiv,2026年9月)

arXiv 新投稿精选

来源: arXiv cs.AI / cs.SE / cs.LG 最新列表(2026-09-21)

  1. Code-as-Auditor: Executable Compliance Reasoning via Regulation-to-Code - 链接:https://arxiv.org/html/2609.19199 - 会议:CIKM 2026(11月,罗马) - 作者:Jisoo Kim 等(首尔国立大学) - 核心:代码级别的合规审计,将法规转化为可执行代码推理 - 分类标签:cs.SE, cs.AI | 代码合规 | 可信 AI

  2. Accelerating Q-learning through Efficient Value-Sharing across Actions - 链接:https://arxiv.org/abs/(待查) - 会议:ICML 2026 Spotlight - 核心:跨动作值共享加速 Q-learning - 分类标签:cs.LG, cs.AI | 强化学习 | 优化

  3. Constraint Decay: The Fragility of LLM Agents in Backend Code Generation - 链接:https://arxiv.org/html/2605.06445 - 核心:LLM Agent 生成后端代码时约束退化问题,测了 Devstral-Small (24B)、Qwen3-Coder-Next (80B)、Qwen3-235B、MiniMax-M2.5、Kimi-K2.5 等 - 分类标签:cs.SE, cs.AI | LLM Agent | 代码生成 | 评估

  4. ENCO: Deploying Production-Scale Engineering Copilots - 链接:https://arxiv.org/pdf/2412.06099 - 会议:KDD 2026(8月9-13日,济州岛) - 核心:微软出品,生产级工程 Copilot 架构,KQL Executor + QA Agent 多 Agent 编排,Azure 生态集成 - 分类标签:cs.SE | KDD 2026 | AI Copilot | 多 Agent | 工程实践

  5. AIPC: Agent-Based Automation for AI Model Deployment with Qualcomm AI Runtime - 链接:https://arxiv.org/html/2604.14661v1 - 核心:基于 Agent 的边缘 AI 部署自动化,ONNX 生态,QAI AppBuilder 开源 - 分类标签:cs.AI | Agent 自动化 | 边缘部署 | ONNX

  6. Engineering a Governance-Aware AI Sandbox - 链接:https://arxiv.org/pdf/2603.03394 - 会议:EASE 2026(格拉斯哥) - 核心:AI 实验沙箱的治理感知设计,SQLite→PostgreSQL 持久层,治理元数据架构 - 分类标签:cs.SE | AI 治理 | 沙箱 | 架构


分类标签

  • inference-engine / vllm / sglang / lmdeploy
  • vector-database / pgvector / pinecone / qdrant / weaviate
  • ai-agents / rag / agentic-rag / multi-agent
  • huggingface / open-source-models / qwen / gemma
  • arxiv / kdd-2026 / icml-2026 / cikm-2026
  • engineering-copilot / code-generation / compliance

建议写入路径

/shared/research-kb/inbox/jay/2026-09-21-1735-jay-ai-engineering-github-hf-inference-vecdb-trending.md


是否需要精读 / 审稿 / 主题页更新

条目 精读优先级 审稿建议 主题页更新
vLLM vs SGLang 决策框架 建议更新「推理引擎选型 SOP」 是,补充 TGI 废弃说明
Vector DB 选型 2026 更新「Vector DB 决策树」 是,pgvector.scale 数据
HF State of Open Models Summer 2026 更新「开源模型格局」 是,Qwen 数据需刷新
Top 20 AI Agent GitHub Repos 新增 Dify + LightRAG 深度条目 条件性
ENCO (KDD 2026) 更新「AI Copilot 工程实践」
Code-as-Auditor (CIKM 2026) 新增「合规 AI」主题页线索 条件性
Constraint Decay arXiv 更新「LLM Agent 代码生成」评估数据
awesome-ai-agents-2026 低-中 作为索引参考 条件性

元数据

  • 实例:Jay
  • 时间:2026-09-21 17:35 (UTC+8)
  • 草稿路径:已写入 /shared/research-kb/inbox/jay/2026-09-21-1735-jay-ai-engineering-github-hf-inference-vecdb-trending.md
  • 状态:草稿,待审稿后合并