RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
仓库攻略
231 篇 · 228 个项目 · 多模态
Ultralytics YOLOv5 是 YOLO(You Only Look Once)目标检测算法的第五代官方 PyTorch 实现,由 Ultralytics 公司维护。它在原始 YOLOv4 的基础上完全重写,以「极致简洁」为设计核心,集目标检测、实例分割、图像分类三大任务于一体,并在 v7.0(2022年)引入了实时实例分割模型,成为当时全球最快最…
ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准(arXiv:2604.08538,cs.CV)。 它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agen…
ultralytics/yolov3 是 YOLOv3(You Only Look Once version 3)目标检测模型的 Ultralytics 官方 PyTorch 实现。原始 YOLOv3 由 Joseph Redmon 和 Ali Farhadi 在 2018 年提出(arXiv:1804.02767),Ultralytics 在此基础上添加了…
AOS Community Edition(简称 AOSCE)是 Unicity 公司推出的开源 Agent 操作系统,专为希望拥有可审查、可组合 AI Agent 运行环境的开发者设计。它的核心定位是:Agent 的执行环境(类似容器的隔离运行时)+ 配套的工具链,让 Agent 在其中既能安全运行,又能自我扩展能力。 关键概念拆解: MetaHarnes…
Retrieval Harness 是 LlamaIndex 在 2026 年提出的一种面向 Agent 的持久化检索架构模式,其参考实现为 runllama/legalkb(法律文档知识库 Demo)。 区别于传统的单次向量搜索 RAG,Harness 将文档知识库包装成一组类文件系统 API 工具(retrieve / findFiles / readF…
FastVideo 是 MBZUAI Hao Zhang 实验室主导的"统一视频生成推理 + 后训练(蒸馏/微调)框架"。它不是某个视频生成模型本身,而是一套面向 DiT 类视频扩散模型(Wan、Mochi、Hunyuan、CausalWan 等)的训练蒸馏推理一站式底座,目标是让视频生成既能微调,又能跑得快、跑得便宜。 仓库内同时包含 4 个层次的产出: …
iPolloWork 是 Codex 和 Claude Code 的下一代源码开放替代品,定位是"不只是帮你写代码,而是真正完成工作"。 核心特点: 源码可用(SourceAvailable,非 OSI 认可的开源):允许个人免费使用,3 人及以上使用需书面授权 Claude Code 和 Github Copilot workspace 这类产品,本质上还…
《深入理解 AI Agent:设计原理与工程实践》(作者李博杰)是一本系统性阐述 AI Agent 的技术书籍,全书围绕核心公式展开: Agent = LLM + 上下文 + 工具 这个公式是全书的骨架,意思是:一个能用的 Agent,离不开大语言模型(LLM)、对上下文的精细管理、以及可调用的外部工具。三者缺一不可。 十章内容覆盖: | 章节 | 主题 |…
scrollworld 是一个 AI Agent Skill(技能),运行在 Claude Code、Codex 或任何兼容 SKILL.md 的 AI 编程助手内。它能为一任意品牌或行业构建「滚动穿越3D世界」的沉浸式落地页——访客滚动页面时,摄影机从场景外部俯冲进入内部,再无缝飞入下一场景,全称无剪辑,像 Apple's scrollthrough 产品…
代表攻略
volcengine/OpenViking · 上手攻略
OpenViking 是字节跳动旗下火山引擎(Volcengine)开源的、面向 AI Agent 的「上下文数据库」(Context Database)。它用「文件系统范式(filesystem paradigm)」统一管理 Agent 运行所需的全部上下文:长期记忆(memory)、外部知识与资源(resources)、可调用的技能(skills)。 与…
同类项目 2展开比较
同名 Awesome 仓库已合并展示,原攻略与详情链接均保留。
volcengine/OpenViking
Stars 26,172
代表
volcengine/OpenViking
Stars 26,172
Grok Build 是 xAI(马斯克旗下人工智能公司)发布的终端原生 AI 编程智能体(coding agent),用 Rust 编写,发布于 2026 年 5 月。定位与 GitHub Copilot 的 Claude Code、OpenAI 的 Codex CLI 同类,但打出三模态这张牌:交互式 TUI(满屏鼠标交互)、无头 CLI(脚本/CI 用…
VLMEvalKit(Python 包名 vlmeval)由上海人工智能实验室 OpenCompass 团队开源,是大型视觉语言模型(LVLM / VLM)的事实标准评估工具包。它的口号是 "一命令评测 220+ LVLM、80+ benchmark" —— 用户只写一个 generate_inner(),剩下的数据下载、预处理、推理、metric 全部由框…
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
opendilab/awesomeRLHF 是上海人工智能实验室 OpenDILab 维护的 "RLHF 精选资源列表",延续 awesome 系列的策展风格:把强化学习与人类反馈(Reinforcement Learning from Human Feedback)相关论文、代码库、数据集、博客、图书按时间线(2020 及以前 → 2026)梳理成一份可阅…
rasbt/reasoningfromscratch 是 Sebastian Raschka(Build a Large Language Model (From Scratch) 的作者)出版的第二本 Manning 图书 Build a Reasoning Model (From Scratch) 的官方配套代码仓库。整本书/仓库的目标是:从一个已经预训…
vuejs/awesomevue 是 Vue.js 生态最知名的 Awesome 精选列表,由 Vue.js 官方团队(vuejs/ 组织)维护。它收录了与 Vue.js 相关的优质开源项目、学习资源、社区生态工具,按类别精心组织,目前 GitHub Stars 数超过 73,000(数据来源:20260715 工作队列)。 这是一个纯 curated li…
RunAnywhere 是一个端侧 AI 推理 SDK 套件,让你在 iOS、Android、Flutter、React Native 和浏览器里直接跑 LLM、VLM、语音识别(TTS/STT)和语音合成,无需联网、数据不离设备。它用同一套 API 屏蔽了各平台的底层差异:Apple 设备走 Core ML / Metal,安卓走 llama.cpp 或高…
awesomepretrainedchinesenlpmodels 是一个由个人开发者(lonePatient)维护的 GitHub 精选列表,收录高质量中文预训练模型、大语言模型、多模态模型及其相关资源。截至 2026 年 7 月 Stars 5574,是中文 NLP 领域最全面的开源模型索引之一。 仓库按模型类型和任务类型双重维度分类,涵盖从 2020 …
OpenLLM 是一个开源的 LLM 推理服务框架,让你用一条命令把任何开源大模型(Llama 3.3、Qwen2.5、Mistral、DeepSeek 等)启动为 OpenAI 兼容的 HTTP API,并自带一个 Web Chat UI。它基于 BentoML 构建,支持 Docker 部署和 BentoCloud 云端托管,适合需要自托管 LLM AP…
pandoclatextemplate 是 Wandmalfarbe 维护的 pandoc LaTeX 模板(代号 Eisvogel),目标是让你的 Markdown 直接转出"看起来像正式出版物 / 讲义"的 PDF 或 .tex,免去手写 LaTeX 模板的痛苦。 模板自带: 自定义封面页(可指定背景色、字体色、logo、整页背景图) 整本可读的正文页(…
LaTeXOCR(开源包名 pix2tex)是一个基于深度学习的 OCR 工具,专门把数学公式的图片还原为 LaTeX 代码。输入一张公式截图,输出对应的 LaTeX 文本——支持印刷公式也支持部分手写公式。 它由 ViT(Vision Transformer)编码器 + ResNet 主干网络 + Transformer 解码器 组成,在 im2latex…
内容待复核
BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
这是一份由南京大学 MIG 实验室(NJUMiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。 它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论…
awesomedocker 是一个精选的 Docker 生态资源列表(Awesome List),由 Veggiemonk 维护,收录了与 Docker 容器技术相关的优质开源项目、工具、服务和学习资源。它不是某个具体的软件,而是一份" Docker 生态地图",帮助开发者快速找到适合自己场景的工具。 GitHub Stars 36422(持续增长中),是 …
goabstract/AwesomeDesignTools 是一个设计工具精选列表,由 LisaDziuba 团队维护,2015 年启动,后随 Flawless App 团队加入 Abstract。目前 GitHub 星标数超过 40k,是设计师和产品团队查找工具资源的行业标杆参考。 它不是一款软件,而是一个持续更新的精选目录——收录了来自 Sketch、F…
XcodeBuildMCP 是 Sentry 团队开源的 Model Context Protocol(MCP)服务器 + CLI 工具,专为 AI 编码 agent(Cursor、Claude Code、Codex 等)设计,提供操作 iOS/macOS 项目的工具集——构建、运行、测试、安装应用到模拟器/设备等,全部通过结构化工具接口暴露给 AI。 它有…
kritaaidiffusion 是开发者 Acly 给开源绘图软件 Krita 写的生成式 AI 插件。它把扩散模型(Stable Diffusion 1.5 / XL / Illustrious / Flux、ZImage + ControlNet / IPAdapter)作为 Krita 的"生成式图层工具"暴露出来,强调两件事: 1. 精度与控制:用…
zoterostyle(中文社区里常叫 "Ethereal Style")是作者 MuiseDestiny 用 windingwind/zoteroplugintemplate 写出来的 Zotero 文献管理器样式增强插件。它在 Zotero 的条目列表(item table)上重做 / 新增一批「列」,把文献管理与阅读状态变成视觉化、可一眼扫的东西,包括…
DataJuicer(简称 DJ)是一个为 foundation model 时代打造的数据操作系统,专注于将混乱的原始数据转化为 AI 可用的精炼数据。它把数据处理看成是可组合的基础设施,提供模块化的构建块来完成清洗、合成和分析,覆盖 AI 全生命周期的数据处理需求。 用大白话说:它是一个超大型数据处理工具箱,内置 200+ 算子(Operator),可以…
htmlvideo 是 Open Design 团队出品的"AI 视频生成 metalayer":你跟本地 coding agent 说一句话(或丢一个链接),它把 HTML/CSS/数据变成真实 MP4 视频,全程在你电脑上渲染,不需要云端、不收单次渲染费。 它不绑定某个特定渲染引擎,而是一套适配器接口,render(input, ctx) 契约,任何后端…