dstack 是一个厂商无关的 GPU 供给与编排控制平面,支持在任意 GPU 云、Kubernetes 集群和裸机服务器上统一运行训练、推理和 Agentic 工作负载。它用一套简洁的 YAML 配置(CLI / API / UI)替代了多套云控制台和运维脚本,让 GPU 资源的管理从「到处点鼠标」变成「声明式配置 + 一键部署」。 dstack 原生支持…
仓库攻略
540 篇 · 535 个项目 · LLM 基础设施
LMCache 是一个KV Cache 管理中间件层,专为 LLM 推理场景设计。它的核心思路是把 GPU VRAM 中转瞬即逝的 KV Cache 变成可持久化、可复用、可监控的 AI 原生存储,从而显著降低 TTFT(Time To First Token,首 token 延迟),提升多轮对话和 Agentic Workload 的吞吐量。 典型工作场景…
Memvid 是一个"单文件 AI 记忆层"(singlefile memory layer)项目,目标是把 LLM Agent 需要的"长期记忆 + 检索"打包成一个可拷贝、可分享、可版本管理的 .mv2 文件,从而彻底替代传统 RAG 链路里的向量数据库 + 检索服务。 它用了一种"借鉴视频编码"的有趣思路:把每条记忆存为一个不可变的 Smart Fra…
FinGPT 是由 AI4Finance Foundation 维护的开源金融大语言模型(Financial LLM)项目,目标是把大模型能力下沉到金融领域,覆盖数据采集 → 数据清洗 → 模型微调 → 应用部署的全链路。它不是单一模型,而是一整套生态: FinGPTForecaster:基于新闻 + 价格的个股走势预测机器人,对标道琼斯 30 成分股,附带…
Khoj 是一个开源的个人 AI 助手(自称 "Your AI second brain"),核心功能是让你用自己的文档(PDF、Markdown、Notion、Word、orgmode 等)创建一个可对话的知识库,同时支持连接任意 LLM(本地 Ollama 或云端 GPT/Claude/Gemini/DeepSeek)。它可以部署在个人电脑上完全离线运行…
agenticawesomeskills 是一个可安装的 AI 编程助手 Skill 库,收录 1,946+ 个可复用的 SKILL.md 工作流剧本,支持 Claude Code、Cursor、Codex CLI、Autohand Code、Gemini CLI、Antigravity、Kiro、OpenCode、GitHub Copilot 等主流 AI…
内容待复核
aishwaryanr/awesome-generative-ai-guide · 上手攻略
这是一个由 Aishwarya Naresh Reganti(AWS ML 专家)维护的 Generative AI 综合性学习资源库。它的定位不是某个工具或框架的使用指南,而是一站式 AI 学习路径导航——涵盖大语言模型基础、提示工程、微调、RAG、Agent 开发、模型评估、面试准备、免费课程、论文精读,以及一系列成体系的学习路线图(Roadmap)。 …
Plano 是一个构建在 Envoy 代理之上的 AI 原生数据平面(Data Plane)与代理服务器,专为 Agentic Application(智能体应用)设计。它的核心思路是:把 Agent 开发中反复出现的"管道工作"(路由、编排、安全过滤、可观测性)从业务代码中抽离出来,放到一个独立进程里处理,让你专注在 Agent 的核心业务逻辑上。 简单说…
vLLMOmni 是 vLLM 社区推出的全模式(omnimodality)推理框架,将 vLLM 的高性能 LLM 推理能力扩展到任意到任意的多模态模型——不只是理解图像/视频/音频,而是能同时生成多种模态的输出(文本+图像+视频+音频)。 支持的输出类型: 一句话概括:vLLM 在多模态生成领域的扩展,让研究者和企业能用生产级性能跑 OmniModali…
Onyx 是 LLM 的应用层——一个功能丰富的开源 AI 平台,支持自托管。它让团队通过 RAG(检索增强生成)、深度研究、自定义 Agent、代码执行、Web 搜索、MCP 等高级能力,把 LLM 接入真实工作流。 核心定位:企业级 AI 平台(类 ChatGPT + RAG + Deep Research + Agents),可一键部署,适合需要数据隐…
Kong(Kong Gateway)是云原生、平台无关的可扩展 API & AI 网关,以高性能和通过插件的强扩展性著称。它不仅是传统 API 网关(代理、路由、负载均衡、健康检查、认证),还提供高级 AI 流量管理能力,包括多 LLM 提供商支持、MCP 流量安全与分析,以及 60+ AI 相关功能(语义缓存、语义路由、安全防护等)。 核心定位:统一 AP…
NVIDIA NeMo Speech 是 NVIDIA 推出的专注于语音 AI 的开源框架,支持自动语音识别(ASR)、语音合成(TTS)和语音大模型(Speech LLM)三大方向。它是从原 NVIDIA/NeMo 大一统仓库中拆分出来的独立版本(2026 年 6 月正式发布首个 release),专门面向需要训练和微调语音模型的 연구人员和 PyTorc…
CAI(Cybersecurity AI) 是由西班牙网络安全公司 Alias Robotics 开发的一个开源 Agent 框架,专门用于构建网络安全场景下的 AI 自动化工具。它不是一款"安全扫描器",而是一个用 AI Agent 方式做网络安全任务的开发框架——用户可以用它创建专门的安全 Agent,让 AI 自动完成侦察、漏洞发现、利用验证、CTF …
Colibrì(意大利语"蜂鸟")是一个纯 C 语言编写的轻量推理引擎,可以在只有约 25 GB 内存的消费级机器上运行 GLM5.2——一个 7440 亿参数的混合专家(MoE)大模型。它完全不使用 Python 运行时,不依赖 BLAS 或 GPU,通过磁盘流式加载专家权重将不可能变为可能:仅 9.9 GB 常驻内存,让一台普通电脑跑上前沿级大模型。 项…
Kotaemon 是一个开源的 RAG 文档问答 UI 工具,专注于为文档提供「聊天式问答」体验。它的目标是同时服务两类用户: 核心特点:干净的界面 + 混合检索 + 强引用展示 + 多模态文档支持。 有大量技术文档/论文/合同,想基于这些文档向 AI 提问 需要 AI 的回答有明确的文档来源引用,不能胡编 需要处理包含图表、表格、LaTeX 公式的复杂 P…
FastGPT 是一个基于大语言模型的知识库问答与应用编排平台,提供完整的开箱即用能力:数据处理、RAG 检索、可视化 AI 工作流编排,让用户无需深度配置即可快速开发和部署复杂的问答系统。 它的核心定位是:企业级 RAG 应用平台,强调知识库管理与可视化流程编排的结合。相比单纯的知识库工具,FastGPT 多了工作流编排和 Agent 编排能力;相比纯 A…
atomicagents 是一个以"原子化"为设计哲学的轻量级模块化 Agent 框架,基于 Instructor 和 Pydantic 构建。所有 Agent 组件(Agent、Tool、Context Provider)均为单一职责、可复用、可组合的"原子"单元,通过标准化的输入/输出 Schema 将它们像乐高积木一样拼装成完整 AI 应用,MIT 许…
PentestGPT 是一个由 LLM 驱动的自动化渗透测试 Agentic 框架,源自 2024 年 USENIX Security 顶会论文(86.5% 成功率,104 题基准)。它将渗透测试流程(信息收集→漏洞发现→利用→权限维持)封装为可迭代执行的 AI Agent,支持自主运行(Claude Code 驱动)和人机协作(多 LLM 会话协同)两种模…
SIE(Superlinked Inference Engine)是一个开源推理服务器,在一个统一的 HTTP API 下集成 85+ 预配置模型,覆盖 Embedding 编码、语义重排序、文档转 Markdown(OCR/解析)、结构化信息抽取、内容安全审核和大模型生成五大任务。它替代了过去"每个任务配一个模型服务器"的碎片化架构,让 Agent 开发者…
fffaraz 维护的 C++(及 C)优质框架、库、资源精选列表。灵感来自其他 awesome 项目,是 C++ 领域 Star 数最高的资源列表之一。 覆盖范围极广:从标准库参考、通用框架、AI/ML、异步网络、科学计算,到 GUI、游戏引擎、网络协议、数据库驱动,几乎囊括了现代 C++ 开发生态中所有值得关注的工具。按类别组织,条目均附 GitHub …
一个精选的现代生成式人工智能(Generative AI)项目与服务导航列表,由 steven2358 维护。列表覆盖文本、编程、Agent、图像、视频、音频六大方向,精选收录各领域有代表性的开源模型、商业 API、研究论文和应用项目。 截至目前已收录数百个条目,按主题分类组织,涵盖从 GPT4、DALL·E 3、Sora 等商业巨头的产品,到 Llama、…
llmengineertoolkit 是一个精心整理的 LLM 工具库清单,按功能分类收录了 120+ 个开源 Python 库,涵盖从模型训练、微调、推理、服务化,到 RAG、Agent、数据提取、评测、安全等完整流程的所有环节。 它的定位是"LLM 全栈工程师的工具箱目录"——不是教你某个库怎么用,而是告诉你做某件事有哪些成熟工具可以选择,让你在立项时快…
hamcp 是 Home Assistant 的非官方 MCP(Model Context Protocol)服务器,让 AI 助手(如 Claude、ChatGPT)能够直接与 Home Assistant 智能家居平台交互,从而用自然语言控制灯光、空调、传感器、自动化规则等所有家居设备。截至 2026 年 7 月 Stars 超过 3900,是增长最快的…
RAG_Techniques 是一个专注于 RetrievalAugmented Generation(检索增强生成) 高级技术的开源教程仓库,由 Nir Diamant 维护。目前收录 42+ 个可运行的 Jupyter Notebook,覆盖从基础 RAG 到最新前沿技术的完整知识体系,每个技术都配有详细原理解析、代码实现和论文引用。截至 2026 年 …
whisper.cpp 是 OpenAI Whisper 自动语音识别(ASR)模型的纯 C/C++ 实现,不依赖任何第三方 ML 框架。相比 Python 原版,它可以脱离 Python 环境、在各类硬件上高效运行,从树莓派、手机到 GPU 服务器都能部署。截至 2026 年 7 月最新稳定版为 v1.9.1,Stars 超过 5.1 万,是目前最流行的本…
GPUStack 是一个开源的 GPU 集群管理器,专门面向 AI 模型服务(Model Serving)和 GPU 资源调度场景。它的核心职责是:把多个 GPU 节点组织成一个集群,自动配置 vLLM、SGLang、TensorRTLLM 等推理引擎,然后暴露一个统一的 OpenAI 兼容 API 供上层应用调用。 从定位上看,它介于底层 GPU 运维工具…
Helicone 是一个开源的 LLM 可观测性(Observability)与 AI 网关(AI Gateway)平台,定位是帮助 AI 工程师一站式完成模型调用监控、成本分析、流量路由、Prompt 版本管理和微调数据准备。它诞生于 Y Combinator W23 批次,GitHub Stars 已超过 5,900(数据截至 202607),是 LLM…
LitGPT 是 Lightning AI 出品的开源 LLM 训练与推理框架,定位是「一站式解决从零预训练、微调到上线部署的全部流程」。核心设计理念是无抽象层、全部从零实现、代码可直接调试,不依赖 Transformers 库内部的复杂封装。它支持 20+ 主流大模型(MegaSauna 3、Qwen2.5、Phi4、Llama 3/3.1/3.2/3.3…
MLflow 是全球规模最大的开源 AI 工程平台,服务于 agents、LLM 和传统 ML 模型的全生命周期。每月下载量超过 6000 万次,数千家企业将其用于生产级 AI 部署。 在 2026 年的 MLflow 3.x 版本中,它已演化为真正统一的平台,同时覆盖传统 ML、深度学习和生成式 AI 应用。核心四大能力: Prompt Registry(…
LTX2 是 Lightricks 开源的视频生成模型(当前版本 LTX2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型: 同步音视频生成(4K 视频 + 音频,一次扩散过程完成) 原生 4K 50fps 输出 完整开源…