PromptEngineeringGuideChinese(Prompt 工程师指南中文版)是由 wangxuqi 维护的中文翻译项目,翻译自 DAIR.AI 的英文原版 dairai/PromptEngineeringGuide(Stars 77.3k+)。原版是目前最全面、最活跃的 Prompt 工程开源教程,涵盖从基础概念到高级技巧的完整知识体系。 本…
仓库攻略
71 篇 · 71 个项目 · LLM 基础设施 · tom
MetaMCP 是一个 MCP(Model Context Protocol)代理基础设施,集 MCP 服务器聚合(Aggregator)、编排(Orchestrator)、中间件(Middleware)、网关(Gateway)于一个 Docker 容器。它的核心定位是:让你不必逐个管理多个 MCP 服务器,而是把它们聚合成一个统一端点,再对外暴露。 技术本…
DecryptPrompt 是一个大模型提示词/Agent/RAG/LLM 全栈知识图谱,收录 Prompt 论文、开源模型、推理框架、SFT/RLHF 数据集、AIGC 应用案例等多个维度的资源。更重要的是,作者维护了一个持续更新的"解密Prompt"系列博客(65+ 篇),每篇包含论文串讲+代码实现,覆盖从 Prompt Tuning 到 RLHF、Ag…
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
NVIDIA/GenerativeAIExamples 是 NVIDIA 官方的生成式 AI 参考工作流仓库,针对加速基础设施(GPU/NIM 微服务)做了深度优化,涵盖 RAG 管道、Agentic 工作流、知识图谱、视觉 NIM 工作流、Data Flywheel 完整闭环等场景。当前最新 release 为 v0.8.x(2025 年),目录结构已完成…
OptiLLM 是一个OpenAI API 兼容的推理优化代理(inference proxy),通过在推理时(inferencetime)应用 20+ 种推理优化技术,在不需要任何训练或微调的情况下,将 LLM 在数学、代码、逻辑推理任务上的准确率提升 210 倍。 它的核心思路是:在现有 API 调用层加一层代理,对请求进行后处理(优化推理路径),再转发…
kimik3inc 是一个纯 C99 编写的 Kimi K3 推理引擎,可以在只有 8 GB 内存的单 CPU 机器上运行一个 2.78 万亿参数的 MoE(MixtureofExperts)模型。整个引擎只有 176 KB,无需任何 ML 框架(无 PyTorch、无 BLAS、无 CUDA、无 GPU)。 Kimi K3 是 Moonshot AI 的旗…
9Router 是一个本地智能路由器,串联在你常用的 AI 编码 CLI 工具(如 Claude Code、Codex、Cursor、Cline、Copilot、OpenClaw 等)与各路 LLM API 提供商之间。它解决的核心问题是:订阅浪费、速率限制、格式不兼容、手动切换。 架构上,它是一个跑在本地的 HTTP 代理服务(默认 localhost:2…
TurboFieldfare 是一个用 Swift 6.2 + Metal 4 从零手写的 Gemma 4 26BA4B 推理运行时,专为 Apple Silicon Mac 设计。它的核心目标只有一个:让 8 GB 内存的 M 系列 MacBook Air 也能跑 Gemma 4 26B 大模型。 Gemma 4 26B 是一个 MoE(Mixtureof…
LLM Gateway 是一个开源的 LLM API 网关,作为应用层与多个 LLM 提供商之间的中间件,提供统一的 API 接口。开发者只需集成一次网关,后续可自由切换/混用 OpenAI、Anthropic、Google Vertex AI 等多种模型,无需逐一对接每个提供商的 SDK 和认证体系。 同时,它内置了用量追踪、成本分析和性能监控功能,让团队…
uzu 是 Mirai Labs 用 Rust 从头编写的高性能 AI 推理引擎(v0.5.12 · 20260608),目标是让 AI 模型直接运行在你的应用中——零延迟、完整数据隐私、无推理费用。 它不是又一个 REST API 封装,而是一个真正把模型跑在本地的推理运行时。核心用 Rust 编写保证了性能和安全性,同时提供 Python / TypeS…
envoyproxy/aigateway 是 Envoy 生态下的 AI 网关项目,基于 Envoy Gateway 扩展,专门处理应用客户端到生成式 AI(GenAI)服务的流量。它的本质是一个 Kubernetes 原生的 LLM 流量管理平面,提供路由、认证、限流、弹性Failover等企业级能力。 Envoy 是 CNCF 旗下久经生产验证的代理,M…
anyllm 是 Mozilla AI 团队推出的 Python 库,目标是让你用同一套代码调用任何 LLM 提供商,无需改业务逻辑。 它的核心理念很清晰:LLM 提供商的 API 接口碎片化严重——OpenAI、Anthropic、Azure、Mistral、Ollama……各家参数名、响应格式、错误处理各有差异。anyllm 不重新造轮子,而是封装官方 …
Open Model Zoo 是 Intel 维护的预训练深度学习模型仓库,为 OpenVINO™ Toolkit 提供大量已优化模型和演示程序。包含 200+ 模型,覆盖目标检测、图像分类、图像分割、姿态估计、语音识别、文本转语音等主流 CV 任务,并配有可直接运行的 C++ / Python Demo 示例。 模型分为两大类: Intel 预训练模型(m…
CTranslate2 是 OpenNMT 团队开源的 C++ / Python 高性能推理引擎,专门针对 Transformer 模型做极致优化。它通过权重量化、层融合、批处理重排序、动态内存管理等技术,在 CPU 和 GPU 上实现比原生 PyTorch / TensorFlow 快数倍、内存省几倍的推理性能。 支持三种模型架构: DecoderOnly…
opencodex 是一个轻量级本地代理服务,它的核心职责是把 OpenAI Codex 的 Responses API 请求"翻译"成任意 LLM 提供商能理解的协议,并在请求路径上支持 ChatGPT 账户池化管理。装好之后,你在 Codex CLI/App/SDK 或 Claude Code 里选什么模型,实际上都在走 opencodex 转发到 An…
RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
ChineseLLaMAAlpaca2 是基于 Meta 开源可商用模型 Llama2 开发的中文 LLaMA2 与 Alpaca2 大模型二期项目,由 ymcui 团队维护。它在原版 Llama2 基础上重新设计了中文词表(55,296 个 token),并使用大规模中文语料进行增量预训练和指令精调,显著提升了模型的中文能力。 | 系列 | 模型 | 参数…
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
AwesomeLLMOps 是由 tensorchord 团队维护的 GitHub 精选列表(Awesome List),收录了 LLMOps(Large Language Model Operations)领域的优质工具、项目和资源。截至 2026 年 7 月已累计 5879 Stars,周增 +7,是目前最活跃的 LLMOps 专题列表之一。 LLMOp…
ymcui/ChineseLLaMAAlpaca 是最早一批将 Meta LLaMA 模型中文化并开源的重量级项目。它的核心工作是两件事: 1. 中文词表扩充——原版 LLaMA 词表偏英文,中文编码效率极低(一个汉字 = 多个 subword),该项目将中文词表扩充至约 5 万 token,显著提升中文处理效率 2. 指令精调(Alpaca)——在扩充词表…
MOSS(MultiOmni Scale System)是复旦大学开源的工具增强型对话语言模型,具有 160 亿参数(16B),支持中英双语、多轮对话,以及插件调用能力(搜索、文生图、计算器、解方程)。 该项目开源内容包括: 本质上,这是一个可以调用工具的中文 ChatGPT 风格模型,可以在本地私有部署,参数规模比 GPT4 小但远大于早期开源 7B 模型…
Mooler0410/LLMsPracticalGuide 是一个以Survey Paper 为基础整理的LLM实践指南索引库(而非代码库)。它将大语言模型领域的论文、博客、工具按主题分类组织,帮助研究者和工程师在庞杂的文献中找到"什么场景用什么模型/方法"的最优路径。 核心资产有两块: 1. LLM 演进树(Evolutionary Tree):一张可视化…
karpathy/llm.c 是由知名 AI 研究员 Andrej Karpathy 创建的一个开源项目,目标是用最简单、纯粹的 C/CUDA 代码实现大语言模型(LLM)训练,无需依赖 PyTorch 或 Python 运行时。 核心思想:用原始的 C 代码(~1,000 行)+ CUDA kernel,直接从零实现 GPT2 训练链路,去掉一切不必要的抽…
ncnn 是腾讯开源的高性能神经网络推理框架,专门针对移动端、嵌入式设备和桌面端场景优化。它的核心特点是无第三方运行时依赖(pure C++ 实现)、支持 CPU 和 Vulkan GPU 双后端,可将 PyTorch / ONNX 模型直接部署到手机、PC、浏览器或边缘设备上。 腾讯内部已大规模落地:QQ、Qzone、微信、天天 P 图等产品均在用。 最新…
OpenLLMetry(发音「openLLmetry」)是基于 OpenTelemetry 的开源 LLM 应用可观测性工具,由 Y Combinator 支持的 Traceloop 公司开发和维护(Apache 2.0 许可)。 它的核心思路:用 OpenTelemetry 标准采集 LLM 应用的全链路追踪数据,无需更换你现有的可观测性基础设施(Data…
Dyad 是一个本地运行、开源免费的 AI 应用构建工具(v0 / Lovable / Replit / Bolt 的开源替代)。用户通过自然语言描述需求,Dyad 自动生成完整的全栈应用代码,全程在本地机器运行,不依赖云端平台,不锁死生态,代码完全属于你自己。 支持 macOS 和 Windows,下载即可使用,无需注册。 1. 前往官网下载页面: 2. …
chatanywhere/GPT_API_free 是一个免费中转 API 服务,让国内用户无需科学上网即可调用 OpenAI GPT 系列、DeepSeek、Claude(Anthropic 官方协议)、Gemini、Qwen、Kimi、GLM、Minimax 等主流大模型的 API 接口。项目提供免费 API Key(每日限额),也支持付费 Key 获取…
vLLMOmni 是 vLLM 社区推出的全模式(omnimodality)推理框架,将 vLLM 的高性能 LLM 推理能力扩展到任意到任意的多模态模型——不只是理解图像/视频/音频,而是能同时生成多种模态的输出(文本+图像+视频+音频)。 支持的输出类型: 一句话概括:vLLM 在多模态生成领域的扩展,让研究者和企业能用生产级性能跑 OmniModali…