whichllm 是一个本地大模型硬件适配工具,一条命令帮你找出"在你的电脑上真正能跑且表现最好"的本地 LLM。它不是模型本身,而是一个智能选型引擎:读取你机器的 GPU/CPU/RAM 配置,去 HuggingFace 实时拉模型列表和基准测试数据,然后给你一份排名。 核心哲学:参数量不等于性能。一个 27B Q5 量化模型可能比 32B Q2 更快更准…
仓库攻略
309 篇 · 308 个项目 · 评测基准
LLMEngineersHandbook 是 Packt 出版社配套 GitHub 仓库,支撑一本同名实战书籍(Amazon/ Packt 有售)。与其说是"仓库",不如说是一套完整的 LLM 工程最佳实践参考实现:覆盖数据采集、LLM 训练、RAG 搭建、AWS 生产部署、监控和评测全链路,配有可直接运行的 Python 代码和 ZenML 流水线。 解决…
OpenDataLoader PDF 是一个面向 AI 工作流的高性能 PDF 解析库,核心目标是:把 PDF 转换成 AI 模型可以直接使用的高质量结构化数据,同时提供 PDF 无障碍(accessibility)自动化能力。 两大核心功能: 1. AI 数据提取:从任意 PDF 提取 Markdown、JSON(含 bounding boxes)、HTM…
SkillOpt 是微软研究院发布的文本空间优化器,用训练神经网络的方式为"冻结"的 LLM 智能体(即不修改模型权重)自动迭代优化自然语言技能文档(Markdown 格式的 best_skill.md),让 AI Agent 在执行特定任务时表现越来越好。 核心思路:把技能文档当作"可训练的权重",配合专门的优化器模型(GPT5.5 等)分析轨迹、打分、生…
LangWatch 是一个开源 LLMOps 平台,专注于 LLM 应用的全链路可观测性、评估测试与 Agent 仿真。官方定位是"AI 应用的 ops missing piece"——帮助团队在不自己造轮子的情况下,实现追踪(Trace)→ 数据集(Dataset)→ 评测(Evaluate)→ 优化(Optimize)的完整闭环。 核心能力分为四大模块:…
Opik 是由 Comet 出品的开源 LLM 应用全生命周期管理平台,覆盖从原型开发到生产监控的完整流程。它的核心功能分三大块:可观测性(Observability)、自动化评估(Evaluation)、生产监控(Production Monitoring)。 Opik 脱胎于 Comet 十年在 ML 领域积累的实验管理经验,专门面向 LLM 应用、RA…
Promptfoo 是一个用于评估(Evaluation)和红队(Red Teaming)LLM 应用的 CLI + 库工具。它解决的核心问题是:在 Prompt 工程和 AI 应用迭代过程中,你怎么知道你的改动真的变好了?靠"感觉不错"是不够的。 核心功能三件事: 1. 自动化评估(Eval):用声明式 YAML 配置,自动跑测试用例、对比多个模型的输出,…
Mastra 是一个面向 AI 驱动应用与 Agents 的现代 TypeScript 框架,定位类似 Next.js之于 Web 开发——让 AI 应用的构建从草稿到生产都有一套统一、类型安全、可扩展的基础设施。 核心定位是一站式 AI 应用框架:不只是一个 Agent 库,而是一套包含 Agent、Workflow、Memory、RAG、MCP Serv…
ZML(Z Machine Learning)是一个生产级 AI 推理技术栈,旨在将任意模型部署到任意硬件加速器上,零妥协。 它基于 Zig 语言、MLIR 编译框架和 Bazel 构建系统实现,支持 NVIDIA CUDA、AMD RoCM、Intel OneAPI、Google TPU、AWS Trainium/Inferentia 2 等多种加速器后端…
MiMo Code 是小米 MiMo AI 团队开源的终端原生 AI 编程智能体,基于开源项目 OpenCode 进行二次开发,2026 年 6 月 10 日以 MIT 许可证发布。 它的核心定位是一个"住在你电脑里的 AI 编程搭档"——能读写代码、执行命令、管理 Git,并且通过持久化记忆系统,在多次会话中持续理解项目上下文、自动进化。 MiMo Cod…
Bifrost 是一个高性能企业级 AI Gateway(AI 网关),用 Go 语言编写,核心卖点是通过单一 OpenAI 兼容 API 统一接入 23+ 家 AI 提供商,并自带自适应负载均衡、自动故障转移、语义缓存、Guardrails、MCP Gateway 等企业级功能。 官方宣称在 5,000 RPS 持续压测下,网关额外延迟仅 ~11 µs(t…
T3MP3ST(念作 "tempest")是一个自主红队平台,用多 Agent 协作把 AI 编程助手(Claude Code、Codex、Hermes)变成漏洞猎人。它的核心理念是:你已经在用的 AI 编程 Agent 就是大脑,T3MP3ST 围绕它构建一套攻击性武器库——侦察(Recon)→ 利用(Exploit)→ 报告(Report),一条龙的杀伤…
PageIndex 是一个无向量、基于推理的 RAG(检索增强生成)引擎,由 Vectify AI 开发。其核心理念是:传统向量 RAG 依赖"语义相似度"做检索,但这不等于"真正相关"——尤其在金融报告、法律文书、医疗文献等高度专业化的长文档场景,"相似"和"相关"的差距尤为明显。 PageIndex 模拟人类阅读长文档的方式——先看目录,再顺着结构找答案…
github/awesomecopilot(官网 awesomecopilot.github.com)是 GitHub 官方维护的社区贡献资源库,收录了 GitHub Copilot 的各类扩展定制方案——包括自定义 Agents、Instructions、Skills、Hooks、Workflows 和 Plugins。 GitHub 官方维护这一点的可信…
ResearchPaperWritingSkills 是一个面向 AI 编程助手(Codex、Claude Code、Gemini)的论文写作 Skill 包,将 ML/CV/NLP 学术论文的写作方法论封装为可复用指令集。 它的核心知识来源是彭思达(Prof. Peng Sida)公开的研究笔记仓库 learning_research,本仓库在此基础上做了…
wshobson/agents 是一个面向 AI 编程 Agent 的插件式市场(Plugin Marketplace),特点是从一份 Markdown 源码同时生成五套主流 Agent 平台的原生插件包:一套源码,Claude Code / Codex CLI / Cursor / OpenCode / Gemini CLI / GitHub Copilo…
WeKnora(维娜拉) 是腾讯开源的企业级 LLM 知识管理框架,定位是"让文档活起来":把散落在各处的 PDF、Word、飞书文档、Notion 页面变成可查询、可推理、可持续更新的知识资产。 核心三大能力: | 能力 | 说明 | ||| | RAG 快速问答 | 基于文档知识库的精准问答,适合日常知识查询 | | ReAct Agent | 自主编排…
AgentLearningHub 是 Datawhale 社区维护的一份AI Agent 系统化学习路线,目标是把社区里的优秀分享、官方博客、论文、开源项目和真实工程经验,整理成一份可以照着执行的 AI Agent 学习 todo list。 这不是一个代码工具仓库,而是一个学习导航仓库——README 即全部内容,作者是 Datawhale 成员陈思州(j…
PixelRAG 是一个基于视觉渲染的 RAG(检索增强生成)系统,核心思想:把文档(网页、PDF)渲染成截图切片(screenshot tiles),再对图片做向量检索,而不是解析 HTML 提取文本。传统 RAG 丢掉的表格、图表、排版信息,在 PixelRAG 里完整保留,读者模型可以直接"看"到原始视觉布局。 源自 Berkeley SkyLab、B…
hesreallyhim/awesomeclaudecode 是目前最全面的 Claude Code 生态资源列表,由社区维护,精选收录了与 Anthropic 出品的 AI 编程助手 Claude Code 相关的优质 skills、hooks、slash commands、agent orchestrators、应用与插件。 它不是一个工具,而是一本生态…
PowerInfer 是由上海交大 IPADS 实验室开源的高速 LLM 推理引擎,专为单张消费级 GPU(RTX 4090 等)本地部署设计。其核心技术是利用 LLM 推理中神经元激活的幂律分布特性——少数"热神经元"(hot neurons)在几乎所有输入中都被激活,而大多数"冷神经元"(cold neurons)则随输入变化。 基于这一洞察,Power…
txtai 是由 NeuML 维护的一个一体化 AI 框架,核心理念是把语义搜索、LLM 编排和工作流三大能力整合在同一个 Python 包里。 其核心组件是 Embeddings 数据库——本质上是一个融合了稀疏向量索引、密集向量索引、图网络和关系数据库的统一检索层。这使得 txtai 既能做传统向量检索,也能做 SQL 查询、主题建模、图分析。 架构图:…
SGLang 是一个高性能大语言模型(及多模态模型)推理 serving 框架,由 LMSYS 组织开发维护(Apache2.0 许可证)。它的核心定位是 vLLM 的直接竞争对手,在多项 benchmark 上展示出更高的吞吐量和更低的延迟。SGLang 底层基于 PyTorch,支持 RadixAttention(前缀缓存)、连续批处理(continuo…
Antigravity Awesome Skills 是一个可安装的 AI Agent Skill 仓库,收录了 1,901+ 个面向主流 AI 编码助手(Claude Code、Cursor、Codex CLI、Autohand Code、Gemini CLI、Kiro、OpenCode、GitHub Copilot 等)的结构化操作手册(SKILL.md…
vLLM 是一个高吞吐量、内存高效的 LLM 推理与服务引擎,最初由 UC Berkeley Sky Computing Lab 开发,现已成长为全球最活跃的开源 AI 基础设施项目之一,拥有来自 2000+ 贡献者的社区支持。 核心突破是 PagedAttention 技术——受操作系统虚拟内存分页启发,将 KV Cache 切分成小块动态管理,显著减少显…
OpenCLI 是一个把任意网站变成 CLI 命令的工具,同时支持在你的已登录浏览器上跑 Browser Use,让 AI Agent(Claude Code、Cursor 等)直接操作你浏览器里的网页。 三层核心能力: 1. 现成适配器:B站、知乎、小红书、Twitter/X、Reddit、HackerNews 等 100+ 站点,开箱即用的 CLI 命令…
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
wloc 是一个修改 iOS 网络定位服务(WiFi/基站定位,Apple 内部称为 WLOC)的工具。它能让你在 iPhone 上"虚拟定位"——不是伪造 GPS,而是让 Apple 的网络定位服务返回你指定的坐标,从而影响依赖网络定位的 App(如地图、外卖、社交 App)。 支持 Surge、Quantumult X、Loon、Stash、Shadow…
agentmemory 是给 AI 编码代理用的持久化记忆系统。简单说:让你的 Claude Code、Codex CLI、Cursor 等代理在多次会话之间"记住"项目背景、决策历史、代码规范,不再每次从头解释。 底层基于 iii engine,不需要任何外部数据库,记忆存储在本地文件。代理每次完成任务后,agentmemory 自动把关键信息写入记忆;下…
ds4(DwarfStar)是意大利程序员 Salvatore Sanfilippo(网名 antirez,Redis 作者)用纯 C 语言手写的本地推理引擎,专门针对 DeepSeek V4 Flash 和 V4 PRO 两个权重模型优化。与一般 GGUF 通用加载器不同,它是专为这两款模型定制的闭着眼睛优化路径——不是万金油,而是专精选手。 项目有三大目…