Guides · organized/guides

仓库攻略

229 篇 · 226 个项目 · 多模态

genkit-ai/genkit · 上手攻略
Genkit 是 Google Firebase 团队开源的全栈 AI 应用开发框架,支持 JavaScript/TypeScript(生产就绪)、Go(生产就绪)、Python(Beta)、Dart(Preview)四种语言,可对接 Google Gemini、OpenAI、Anthropic、Ollama 等主流模型厂商。 核心理念:一套 API 走天下…
Agent 智能体 genkit-ai/genkit Stars 6,342 Tom 2026-08-19
index-tts/index-tts · 上手攻略
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
多模态 index-tts/index-tts Stars 22,384 Tom 2026-08-19
内容待复核
Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins · 上手攻略
DeepSeek Harness(DSH)是 DeepSeek 官方开源的 Agent 执行框架,其核心理念是"一切皆插件"——每个能力(模型供应商、工具、记忆、调度、UI 客户端)都是可插拔的组件。AwesomeDeepSeekHarnessPlugins 是由 ZhiyuanFan 维护的每日精选目录,收录 DSH 生态中公开可用的插件、扩展、技能、工具…
评测基准 Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins Stars 134 Tom 2026-08-18
open-mmlab/mmagic · 上手攻略
MMagic(Multimodal Advanced, Generative, and Intelligent Creation)是 OpenMMLab 体系下的 AIGC 工具箱,是 MMEditing 与 MMGeneration 合并后的统一继承者。它提供从底层 PyTorch 训练到高层 MMagicInferencer 的全套接口,覆盖图像 / 视…
多模态 open-mmlab/mmagic Stars 7,452 spark 2026-08-18
pytorch/examples · 上手攻略
pytorch/examples 是 PyTorch 官方维护的示例仓库,汇集了 PyTorch 官方团队编写的各领域高质量参考实现。与 PyTorch Tutorials 不同,这些示例追求代码简洁、独立可运行、少依赖,每个子目录对应一个完整任务,读者可以直接把代码复制到自己的项目中使用或改写。覆盖领域包括:MNIST 手写数字识别(含多种变体)、VAE、…
多模态 pytorch/examples Stars 23,986 Tom 2026-08-18
HumanSignal/labelImg · 上手攻略
labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
多模态 HumanSignal/labelImg Stars 25,069 Tom 2026-08-18
openai/CLIP · 上手攻略
CLIP(Contrastive LanguageImage PreTraining)是 OpenAI 在 2021 年发布的图文多模态模型,论文为 Learning Transferable Visual Models From Natural Language Supervision。它的核心思想是用大规模图文配对数据训练一个联合 embedding 空…
工程化 openai/CLIP Stars 34,123 Tom 2026-08-18
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
ocrmypdf/OCRmyPDF · 上手攻略
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
多模态 ocrmypdf/OCRmyPDF Stars 34,348 Tom 2026-08-17
oobabooga/textgen · 上手攻略
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
多模态 oobabooga/textgen Stars 47,519 Tom 2026-08-17
binary-husky/gpt_academic · 上手攻略
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
LLM 基础设施 binary-husky/gpt_academic Stars 71,179 Jay 2026-08-17
StarlightSearch/EmbedAnything · 上手攻略
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LLM 基础设施 StarlightSearch/EmbedAnything Stars 1,294 Jay 2026-08-17
ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17
opendatalab/MinerU · 上手攻略
MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
Agent 智能体 opendatalab/MinerU Stars 76,653 Jay 2026-08-17
CompVis/stable-diffusion · 上手攻略
Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
多模态 CompVis/stable-diffusion Stars 73,272 Tom 2026-08-17
coleam00/second-brain-skills · 上手攻略
secondbrainskills 是一组为 Claude Code 打造的自定义 Skills 合集,将 Claude Code 从单纯的代码助手扩展为「第二大脑」——能够系统性捕获、组织和运营知识的工作流系统。 核心哲学是渐进式上下文披露(Progressive Disclosure of Context):Claude 只在需要时才加载详细指令,保持上…
Agent 智能体 coleam00/second-brain-skills Stars 812 Tom 2026-08-17
ggml-org/llama.cpp · 上手攻略
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
LLM 基础设施 ggml-org/llama.cpp Stars 122,572 Tom 2026-08-16
Hao0321/claude-skill-social-post · 上手攻略
Hao0321/claudeskillsocialpost(作者駱君昊/Hao)是一个 Claude Code / Codex Skill,功能是 学习你的社群语语气 → 规划内容 → 撰写平台化贴文 → 经确认后发布 → 把 Reels / 贴文洞察变成结构化学习资料。目标平台是 Facebook / Instagram / Threads / X,覆盖两…
Agent 智能体 Hao0321/claude-skill-social-post Stars 583 spark 2026-08-16
huiliyi37/dsh-tianshu-tui · 上手攻略
dshtianshutui(npm 包名 @huiliyi37/dshtianshutui)是 DeepSeek Harness(官方 CLI @deepseekai/dsh)的交互式终端极简风格 UI 插件。它以自研 ANSI 渲染为核心,在官方 Web UI 之外提供类 Claude Code 风格的纯终端对话界面,并叠加了 TDD 工作流、证据门、视觉…
评测基准 huiliyi37/dsh-tianshu-tui Stars 165 Tom 2026-08-16
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 22 Jay 2026-08-16
zhu1090093659/dsh-web-ui · 上手攻略
dshwebui 是给 DeepSeek Harness(以下简称 DSH)Web GUI 的一站式插件与皮肤全家桶,通过官方 profile 机制挂载,不改 DSH 源码。所有插件以 npm 包发布(@linxin666/ scope),可逐个安装也可一次性装齐。 仓库包含 11 个子包,核心能力如下: | 能力 | 说明 | ||| | 梁神模式 | 面…
评测基准 zhu1090093659/dsh-web-ui Stars 4,541 Tom 2026-08-16
ATH-MaaS/Pixelle-MCP · 上手攻略
PixelleMCP 是一个基于 MCP 协议的开源多模态 AIGC 解决方案,核心思路是把 ComfyUI 工作流一键转成 MCP 工具,让 LLM(Claude Desktop、Cursor 等)通过自然语言直接驱动 ComfyUI 图像生成。它支持本地 ComfyUI 和云端 RunningHub 两种执行引擎,提供 Web 界面、MCP 服务器和文件…
Agent 智能体 ATH-MaaS/Pixelle-MCP Stars 1,100 Tom 2026-08-16
UNDERdecoded/Gen2Recomped · 上手攻略
Gen2Recomped 是把任天堂 Game Boy / Game Boy Color 上的《精灵宝可梦 金/银》(以及兼容的 Crystal、红/蓝/黄)静态重制为可在现代平台原生运行的 LÖVE2D(Lua)项目的 fork。它基于 Gen1Recomp 的 Gen I 引擎,在其上叠加了完整的 Gen II 模块:Gen 2 脚本虚拟机与指令表、城都…
工程化 UNDERdecoded/Gen2Recomped Stars 208 spark 2026-08-15
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,790 Tom 2026-08-15
kimsungwhee/apple-docs-mcp · 上手攻略
appledocsmcp 是一个 MCP 服务器,为 AI 助手提供 Apple 官方开发者文档的实时查询能力。接入后,可以在 Claude、Cursor、VS Code(Copilot MCP)、Windsurf、Zed、Cline、Amazon Q 等主流 AI 开发工具中,直接用自然语言搜索 iOS / macOS / watchOS / tvOS /…
Agent 智能体 kimsungwhee/apple-docs-mcp Stars 1,347 Jay 2026-08-15
Aperivue/medsci-skills · 上手攻略
MedSci Skills 是面向临床研究与医学人工智能的开源 Agent Skills 合集(MIT 许可证),由韩国首尔峨山医疗中心放射科医生兼研究员 Yoojin Nam, MD 构建,在真实出版物上测试通过。截至 v5.0 版本共包含 59 项技能,覆盖从文献检索、统计图表、报告指南合规审查到 AI 模型工程的全链路。 它并非通用 AI 科学家平台,…
Agent 智能体 Aperivue/medsci-skills Stars 269 Jay 2026-08-14
breezedeus/Pix2Text · 上手攻略
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
多模态 breezedeus/Pix2Text Stars 3,213 Tom 2026-08-13
noraj/OSCP-Exam-Report-Template-Markdown · 上手攻略
这是一套面向 Offensive Security(OffSec)考试体系(OSCP / OSWE / OSEE / OSWP / OSEP / OSED / OSWA / OSDA / OSMR / OSTH / OSIR)的 Markdown 报告模板仓库,作者 noraj。核心思路:考生在 24 小时考试窗口里写渗透测试报告时,不再依赖 LaTeX 或…
安全与风险 noraj/OSCP-Exam-Report-Template-Markdown Stars 4,170 spark 2026-08-13
IDEA-CCNL/Fengshenbang-LM · 上手攻略
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
LLM 基础设施 IDEA-CCNL/Fengshenbang-LM Stars 4,126 Tom 2026-08-13