研究库 实战攻略
Guides · organized/guides

仓库攻略

317 篇 · 311 个项目 · 多模态

pytorch/examples · 上手攻略
pytorch/examples 是 PyTorch 官方维护的示例仓库,汇集了 PyTorch 官方团队编写的各领域高质量参考实现。与 PyTorch Tutorials 不同,这些示例追求代码简洁、独立可运行、少依赖,每个子目录对应一个完整任务,读者可以直接把代码复制到自己的项目中使用或改写。覆盖领域包括:MNIST 手写数字识别(含多种变体)、VAE、…
多模态 pytorch/examples Stars 23,986 Tom 2026-08-18
HumanSignal/labelImg · 上手攻略
labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
多模态 HumanSignal/labelImg Stars 25,069 Tom 2026-08-18
openai/CLIP · 上手攻略
CLIP(Contrastive LanguageImage PreTraining)是 OpenAI 在 2021 年发布的图文多模态模型,论文为 Learning Transferable Visual Models From Natural Language Supervision。它的核心思想是用大规模图文配对数据训练一个联合 embedding 空…
工程化 openai/CLIP Stars 34,123 Tom 2026-08-18
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
ocrmypdf/OCRmyPDF · 上手攻略
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
多模态 ocrmypdf/OCRmyPDF Stars 34,348 Tom 2026-08-17
oobabooga/textgen · 上手攻略
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
多模态 oobabooga/textgen Stars 47,519 Tom 2026-08-17
binary-husky/gpt_academic · 上手攻略
binaryhusky/gpt_academic(GPT Academic)是一个为 GPT / GLM 等大语言模型打造的实用化交互界面,特别针对论文阅读、润色、翻译、写作场景深度优化。项目采用模块化插件设计,支持自定义快捷按钮、Python / C++ 项目剖析、ArXiv 论文翻译总结、LaTeX 全文翻译校对等30+ 功能,并行支持 ChatGPT、…
LLM 基础设施 binary-husky/gpt_academic Stars 71,179 Jay 2026-08-17
StarlightSearch/EmbedAnything · 上手攻略
StarlightSearch/EmbedAnything 是一个用 Rust 构建的高性能、多模态 embedding 管道。它支持从文本、图片、音频、PDF、网站等多种来源生成向量嵌入,并与 Milvus、Weaviate、Elastic、SingleStore 等主流向量数据库无缝对接,核心卖点是零 PyTorch 依赖、低内存占用、流式索引,已在 E…
LLM 基础设施 StarlightSearch/EmbedAnything Stars 1,294 Jay 2026-08-17
ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17
opendatalab/MinerU · 上手攻略
MinerU 是由 OpenDataLab(上海人工智能实验室关联开源组织)开发的高精度文档解析引擎,于 2024 年开源。其核心能力是:将 PDF、DOCX、PPTX、XLSX、图片、网页等复杂文档,转换为 LLM 可直接消费的 Markdown 或 JSON 格式,同时保留阅读顺序、标题层级、表格结构、公式 LaTeX 等语义信息。 MinerU 最早服…
Agent 智能体 opendatalab/MinerU Stars 76,653 Jay 2026-08-17
CompVis/stable-diffusion · 上手攻略
Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
多模态 CompVis/stable-diffusion Stars 73,272 Tom 2026-08-17
coleam00/second-brain-skills · 上手攻略
secondbrainskills 是一组为 Claude Code 打造的自定义 Skills 合集,将 Claude Code 从单纯的代码助手扩展为「第二大脑」——能够系统性捕获、组织和运营知识的工作流系统。 核心哲学是渐进式上下文披露(Progressive Disclosure of Context):Claude 只在需要时才加载详细指令,保持上…
Agent 智能体 coleam00/second-brain-skills Stars 812 Tom 2026-08-17
ggml-org/llama.cpp · 上手攻略
llama.cpp 是一个纯 C/C++ 实现的高性能 LLM 推理框架,核心目标是在各种硬件上以最小化依赖和最优性能跑本地大模型。它基于底层的 ggml 库构建,支持 FP16 和 GGUF 量化格式,Star 122,572(无周增,长期稳定),是本地 LLM 推理领域最活跃的开源项目之一。 核心特点: 纯 C/C++ 实现,无外部依赖(除少量单文件 H…
LLM 基础设施 ggml-org/llama.cpp Stars 122,572 Tom 2026-08-16
Hao0321/claude-skill-social-post · 上手攻略
Hao0321/claudeskillsocialpost(作者駱君昊/Hao)是一个 Claude Code / Codex Skill,功能是 学习你的社群语语气 → 规划内容 → 撰写平台化贴文 → 经确认后发布 → 把 Reels / 贴文洞察变成结构化学习资料。目标平台是 Facebook / Instagram / Threads / X,覆盖两…
Agent 智能体 Hao0321/claude-skill-social-post Stars 583 spark 2026-08-16
huiliyi37/dsh-tianshu-tui · 上手攻略
dshtianshutui(npm 包名 @huiliyi37/dshtianshutui)是 DeepSeek Harness(官方 CLI @deepseekai/dsh)的交互式终端极简风格 UI 插件。它以自研 ANSI 渲染为核心,在官方 Web UI 之外提供类 Claude Code 风格的纯终端对话界面,并叠加了 TDD 工作流、证据门、视觉…
评测基准 huiliyi37/dsh-tianshu-tui Stars 165 Tom 2026-08-16
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 45 Jay 2026-08-16
zhu1090093659/dsh-web-ui · 上手攻略
dshwebui 是给 DeepSeek Harness(以下简称 DSH)Web GUI 的一站式插件与皮肤全家桶,通过官方 profile 机制挂载,不改 DSH 源码。所有插件以 npm 包发布(@linxin666/ scope),可逐个安装也可一次性装齐。 仓库包含 11 个子包,核心能力如下: | 能力 | 说明 | ||| | 梁神模式 | 面…
评测基准 zhu1090093659/dsh-web-ui Stars 4,541 Tom 2026-08-16
ATH-MaaS/Pixelle-MCP · 上手攻略
PixelleMCP 是一个基于 MCP 协议的开源多模态 AIGC 解决方案,核心思路是把 ComfyUI 工作流一键转成 MCP 工具,让 LLM(Claude Desktop、Cursor 等)通过自然语言直接驱动 ComfyUI 图像生成。它支持本地 ComfyUI 和云端 RunningHub 两种执行引擎,提供 Web 界面、MCP 服务器和文件…
Agent 智能体 ATH-MaaS/Pixelle-MCP Stars 1,100 Tom 2026-08-16
UNDERdecoded/Gen2Recomped · 上手攻略
Gen2Recomped 是把任天堂 Game Boy / Game Boy Color 上的《精灵宝可梦 金/银》(以及兼容的 Crystal、红/蓝/黄)静态重制为可在现代平台原生运行的 LÖVE2D(Lua)项目的 fork。它基于 Gen1Recomp 的 Gen I 引擎,在其上叠加了完整的 Gen II 模块:Gen 2 脚本虚拟机与指令表、城都…
工程化 UNDERdecoded/Gen2Recomped Stars 208 spark 2026-08-15
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,918 Tom 2026-08-15
kimsungwhee/apple-docs-mcp · 上手攻略
appledocsmcp 是一个 MCP 服务器,为 AI 助手提供 Apple 官方开发者文档的实时查询能力。接入后,可以在 Claude、Cursor、VS Code(Copilot MCP)、Windsurf、Zed、Cline、Amazon Q 等主流 AI 开发工具中,直接用自然语言搜索 iOS / macOS / watchOS / tvOS /…
Agent 智能体 kimsungwhee/apple-docs-mcp Stars 1,347 Jay 2026-08-15
Aperivue/medsci-skills · 上手攻略
MedSci Skills 是面向临床研究与医学人工智能的开源 Agent Skills 合集(MIT 许可证),由韩国首尔峨山医疗中心放射科医生兼研究员 Yoojin Nam, MD 构建,在真实出版物上测试通过。截至 v5.0 版本共包含 59 项技能,覆盖从文献检索、统计图表、报告指南合规审查到 AI 模型工程的全链路。 它并非通用 AI 科学家平台,…
Agent 智能体 Aperivue/medsci-skills Stars 331 Jay 2026-08-14
breezedeus/Pix2Text · 上手攻略
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
多模态 breezedeus/Pix2Text Stars 3,213 Tom 2026-08-13
noraj/OSCP-Exam-Report-Template-Markdown · 上手攻略
这是一套面向 Offensive Security(OffSec)考试体系(OSCP / OSWE / OSEE / OSWP / OSEP / OSED / OSWA / OSDA / OSMR / OSTH / OSIR)的 Markdown 报告模板仓库,作者 noraj。核心思路:考生在 24 小时考试窗口里写渗透测试报告时,不再依赖 LaTeX 或…
安全与风险 noraj/OSCP-Exam-Report-Template-Markdown Stars 4,170 spark 2026-08-13
IDEA-CCNL/Fengshenbang-LM · 上手攻略
封神榜(FengshenbangLM) 是 IDEA 研究院认知计算与自然语言研究中心(CCNL)主导的中文大模型开源体系,2021 年 11 月由沈向洋在 IDEA 大会上正式发布。定位是"中文认知智能的基础设施",旗下包含 6 大模型系列,覆盖从语言理解到多模态生成的完整 NLP 任务。 三个子项目协同工作: Fengshenbang Model:预训练…
LLM 基础设施 IDEA-CCNL/Fengshenbang-LM Stars 4,126 Tom 2026-08-13
zarazhangrui/youtube-to-ebook · 上手攻略
youtubetoebook 是一个将 YouTube 频道视频自动转成 EPUB 电子书的 Python 工具链。它的工作流是:抓频道最新视频 → 提取字幕 → 丢给 Claude 改写成杂志风文章 → 打包成 EPUB → 可选邮件推送。作为 Claude Code Skill 使用时,对话中一句"Set up YouTube to ebook for …
Agent 智能体 zarazhangrui/youtube-to-ebook Stars 535 Tom 2026-08-13
LearnPrompt/humanize-ppt · 上手攻略
Humanize PPT 是一个 AI Agent Skill(Codex / Claude Code / Hermes 等),核心功能是把任意资料编排成一条"能上台讲"的演讲线,而不是一堆"只能看"的漂亮页面。它不做渲染,而是指挥下游渲染 skill 出图出视频,编排完后跑自动演讲体检,最后交付演讲模式或原生 PPTX。 它的核心理论叫 AST(Audie…
工程化 LearnPrompt/humanize-ppt Stars 866 Tom 2026-08-13
all-in-aigc/sorafm · 上手攻略
sorafm 是一个基于 Next.js 的开源 Sora AI 视频生成 Web 应用,提供可视化界面来管理和展示由 OpenAI Sora 生成的 AI 视频内容。项目支持 Docker 部署,可以在本地或私有服务器上快速搭建一个 Sora 视频展示站点。 技术栈:Next.js(前端框架)+ PostgreSQL(数据库)+ Tailwind CSS(…
多模态 all-in-aigc/sorafm Stars 1,152 Tom 2026-08-12
huangserva/skill-prompt-generator · 上手攻略
skillpromptgenerator 是一个双平台 AI 提示词生成系统: 三种生成模式: ⚠️ README 中提到的 .claude/CLAUDE.md 入口文档实际 fetch 返回 404(仓库根 README 列出的 /blob/main/.claude/CLAUDE.md 路径不可访问,⚠️ 未核验),用户需要直接通过 Skill 名称调用。…
多模态 huangserva/skill-prompt-generator Stars 1,451 spark 2026-08-12