Bionic GPT 是一个自托管(onpremise)的 ChatGPT 替代品,定位企业内部的私有生成式 AI 平台。它用 Rust 写了一个高性能 Web Server,把 RAG、文档解析、模型路由、鉴权、审计、可观测性这些通常要自己拼装的"内部 ChatGPT 必备件"打包成一个可直接落到 Kubernetes 上的完整栈。 它不是单一服务,而是按…
仓库攻略
540 篇 · 535 个项目 · LLM 基础设施
ReplaySSM(JohnnyLiou / Dao AI Lab,2026 年 6 月 15 日发布)是一种让混合状态空间模型(Hybrid SSM)在 vLLM 推理引擎中同时加速自回归解码和推测解码的核内核优化技术。其核心洞察极其简洁: 不要每步都把 SSM recurrent state 写回 HBM——缓存最近的 SSM 输入,需要时再重建状态。 …
koreanlawmcp 是一个基于韩国法制处(법제처)Open API 的 MCP(Model Context Protocol)服务器,同时附带 CLI 工具。它将韩国 42 个官方法律 API 压缩为 10 个核心工具,让 AI 助手(Claude Desktop、Cursor、Windsurf、Zed 等)能够实时查询、验证和分析韩国成文法和判例。 …
NemoClaw for LangChain Deep Agents Blueprint(简称 NemoClaw)是 LangChain 与 NVIDIA 联合发布的企业级 Agent 参考架构,发布时间为 2026 年 7 月 8 日(PRNewswire)。 该 Blueprint 不是一款独立产品,而是把三层开源组件打包成一套可落地、可自托管的完整 A…
jCodeMunch 是一个基于 treesitter AST 解析的 MCP 服务器,专门解决 AI Agent 在代码库探索时「读整个文件找一句话」的 token 浪费问题。它对仓库做一次索引,之后每次检索只返回精确的函数、类、方法、常量符号——实测平均减少 95%+ 的 token 消耗(官方 live benchmark 20260723:15 项任…
NitroStack 是一个用 TypeScript 构建的生产级 MCP(Model Context Protocol)服务器全栈框架。它包含核心 SDK(@nitrostack/core)、脚手架 CLI(@nitrostack/cli)、React UI 组件库(@nitrostack/widgets)以及配套桌面 IDE(NitroStudio),覆…
代表攻略
LlamaParse Retrieval Harness:面向 Agent 的大规模文档遍历框架 · 干货攻略
LlamaParse Retrieval Harness 是 LlamaIndex(LlamaParse 平台)在 2026 年 6 月 29 日正式上线的一套面向 Agent 的文档遍历工具集,被定位为"2026 版 RAG"。它不再将文档检索视为一次性的语义搜索,而是把整个文档语料库暴露为一组类文件系统工具,让 Agent 能在单次推理循环内自由交替调用…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
run-llama/llama_index
Stars 51,547
代表
run-llama/llama_index
Stars 51,547
OmniRoute 是一个自托管 AI 网关,用单一端点聚合 278+ 提供商(含 90+ 免费层)的 500+ 模型,替开发者省去逐一对接每个 AI 提供商的麻烦。它支持自动 fallback 组合、Token 压缩、多策略路由、MCP 服务器、A2A 代理协议、内存持久化、Guardrails 安全过滤、TLS 指纹伪装等企业级特性,同时提供 Web 界…
VibeTrading 是香港大学数据智能实验室(HKUDS)开源的个人量化交易智能体框架,定位为"让任何 AI Agent 都具备完整交易研究能力"的一条命令式工具链。装好后,你的 Agent 可以做市场研究、策略编写、回测、因子分析、Shadow Account 行为诊断、券商账户审计,最终生成可交付的研究报告——覆盖 A 股、港股、美股、加密货币、期货…
opencodex 是一个轻量级本地代理服务,它的核心职责是把 OpenAI Codex 的 Responses API 请求"翻译"成任意 LLM 提供商能理解的协议,并在请求路径上支持 ChatGPT 账户池化管理。装好之后,你在 Codex CLI/App/SDK 或 Claude Code 里选什么模型,实际上都在走 opencodex 转发到 An…
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
Ultralytics YOLOv5 是 YOLO(You Only Look Once)目标检测算法的第五代官方 PyTorch 实现,由 Ultralytics 公司维护。它在原始 YOLOv4 的基础上完全重写,以「极致简洁」为设计核心,集目标检测、实例分割、图像分类三大任务于一体,并在 v7.0(2022年)引入了实时实例分割模型,成为当时全球最快最…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
codereviewgraph(简称 CRG)是一个本地优先的代码智能图谱工具,为 MCP(Model Context Protocol)兼容的 AI 编程助手和 CLI 环境设计。它的核心思路是:先把你的代码库解析成一张结构化的知识图谱(节点 = 函数/类/导入,边 = 调用/继承/测试覆盖),然后在 AI 做代码审查时只喂给它真正相关的文件,而不是把整个…
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
FastDeploy 是百度飞桨(PaddlePaddle)团队推出的"LLM + VLM 推理部署工具包",主打工业级一键部署和国产芯片广覆盖。它的目标不是要替代 vLLM,而是站在 vLLM 接口的肩膀上,把 ERNIE、Qwen3、DeepSeekV3、PaddleOCRVL 等模型在 NVIDIA、昆仑芯 XPU、海光 DCU、天数 GPU、燧原 G…
FastVideo 是 MBZUAI Hao Zhang 实验室主导的"统一视频生成推理 + 后训练(蒸馏/微调)框架"。它不是某个视频生成模型本身,而是一套面向 DiT 类视频扩散模型(Wan、Mochi、Hunyuan、CausalWan 等)的训练蒸馏推理一站式底座,目标是让视频生成既能微调,又能跑得快、跑得便宜。 仓库内同时包含 4 个层次的产出: …
CSGHub 是 OpenCSG 团队开源的"LLM 资产管理平台",定位对标 Hugging Face:把模型(LLM/VLM)、数据集、Space 应用、代码片段当作一等资产,统一在一个平台上做上传、下载、版本管理、权限分发、推理部署和数据处理。整套系统由 Go(Gin)+ Rails 旧版迁移中的 Vue3 前端、PostgreSQL 元数据、Apac…
Direct OnPolicy Distillation(DirectOPD)是清华大学与字节跳动Seed团队提出的一种弱到强泛化方法,核心思路是: 在小模型上跑强化学习(RL),然后只把小模型 RL 产生的"策略方向"迁移给大模型,而不是让大模型直接模仿小模型的最终输出。 官方仓库:BytedTsinghuaSIA/DirectOPD(GitHub)+ H…
Apache Burr(incubating)是一个 Python 状态机框架,用来构建"会做决策的应用"——chatbot、agent、simulation、人机协作工具。它把应用建模成一张 state machine(状态机/流程图): Burr 的关键设计哲学是 "框架无关":它不规定你必须用哪个 LLM SDK、哪个 vector DB、哪个 age…
Apache Hamilton(incubating)是一个轻量的 Python 库,用"Python 函数即节点"的方式构建数据转换 DAG。它的核心思路是:你写普通的 Python 函数,函数参数的名字 = 它依赖的上游节点名,Hamilton 自动把这些函数拼成 DAG、并按依赖顺序执行。 举例: import pandas as pd def sig…
OpenLIT 是一个开源的 AI Engineering 平台,定位是"一站式把 LLM 应用从实验推到生产"。它把 OpenTelemetry 当作统一底座,向上提供 6 类核心能力: 1. 可观测性 SDK(Python / TypeScript / Go):对 50+ LLM provider、VectorDB、Agent 框架、GPU 做自动埋点(…
IFStruct 是 Liquid AI 发布的一个结构化输出合规性评测基准(benchmark),专门测试 LLM 能否在真实用户指令的混乱表达下,生成符合目标 schema 的有效 JSON 或 YAML。官方 Repo:Liquid4All/ifstruct;数据集同步发布于 HuggingFace。 核心理念(来自官方博客):现有结构化输出评测通常将…
iPolloWork 是 Codex 和 Claude Code 的下一代源码开放替代品,定位是"不只是帮你写代码,而是真正完成工作"。 核心特点: 源码可用(SourceAvailable,非 OSI 认可的开源):允许个人免费使用,3 人及以上使用需书面授权 Claude Code 和 Github Copilot workspace 这类产品,本质上还…
《深入理解 AI Agent:设计原理与工程实践》(作者李博杰)是一本系统性阐述 AI Agent 的技术书籍,全书围绕核心公式展开: Agent = LLM + 上下文 + 工具 这个公式是全书的骨架,意思是:一个能用的 Agent,离不开大语言模型(LLM)、对上下文的精细管理、以及可调用的外部工具。三者缺一不可。 十章内容覆盖: | 章节 | 主题 |…
Zvec 是阿里巴巴通义实验室开源的进程内(inprocess)向量数据库,定位为"向量数据库领域的 SQLite"——直接以内嵌库的方式运行在你的应用程序中,无需部署独立的数据库服务进程。它基于阿里生产级 Proxima 向量检索引擎,支持稠密向量 + 稀疏向量 + 全文检索(FTS)混合检索,并内置 WAL 持久化、多进程并发读取等企业级特性。 当前版本…
pentestai(CLI 入口 ptai)是一个 AI 驱动的渗透测试框架。核心创新不是"发现更多漏洞",而是每个漏洞都必须被机器 Oracle 重复验证才能进入最终报告。思路借鉴 TruffleHog:TruffleHog 发现泄露密钥后实际登录验证,ptai 发现 Web 漏洞后实际重新触发一遍。一个 finding 停留在"候选"状态,直到 Orac…
FlashAttention4(FA4)是 Tri Dao 团队发布的第四代 IOaware 精确注意力内核,针对 NVIDIA Blackwell 架构(B200/GB200)全面重新设计,同时保留对 Hopper(H100)的支持。FA4 以 CuTeDSL(NVIDIA CUTLASS DSL)编写,在运行时编译为 PTX/CUBIN,核心定位是解决 …