Guides · organized/guides

仓库攻略

124 篇 · 123 个项目 · tom · 多模态

MAC-AutoML/MindPipe · 上手攻略
MindPipe 是一个统一的 LLM/VLM 模型压缩评估框架,用单一 main.py CLI 驱动 11 种量化方法、7 种剪枝方法、压缩微调联合流程,以及 PPL / lmevalharness 零样本 / VLMEvalKit 多模态三类评估。核心设计理念是:一次配置,全流程可复现。 ⚠️ 注意:本仓库同时支持 NVIDIA GPU 和华为昇腾 NP…
LLM 基础设施 MAC-AutoML/MindPipe Stars 1,013 Tom 2026-08-23
FutureUniant/Tailor · 上手攻略
Tailor(中文名:泰勒)是一款本地运行的 AI 视频处理桌面工具,涵盖视频智能裁剪、视频生成和视频优化三大类共 10 种功能。核心特点是点点鼠标即可完成专业级剪辑,无需复杂的命令行操作,特别适合中文用户和短视频创作者。 ⚠️ 平台限制:目前仅支持 Windows。macOS 和 Linux 用户需通过虚拟机或双系统运行。最新版本为 20240807,功能…
多模态 FutureUniant/Tailor Stars 1,107 Tom 2026-08-23
gyoridavid/short-video-maker · 上手攻略
shortvideomaker 是一个开源自动化短视频创作工具,通过文本脚本自动生成 TikTok / Instagram Reels / YouTube Shorts 风格的短视频。它同时暴露 REST API 和 MCP(Model Context Protocol) 接口,既可以配合 n8n 等工作流工具使用,也可以直接 API 调用。 它的定位是不需…
Agent 智能体 gyoridavid/short-video-maker Stars 1,225 Tom 2026-08-23
s1dashu/ip-as-logo-skill · 上手攻略
ipaslogoskill 是一个紧凑的 AI Agent 技能包(Agent Skill),专门用于生成极度简洁、可爱、适合商业使用的 IP 吉祥物图片。它遵循开放 Agent Skills 格式,可接入任何兼容的 AI 编程助手(Codex、Coze、Doubao、YouMind、Manus、Gemini Apps、Replit Agent 等),而非绑…
Agent 智能体 s1dashu/ip-as-logo-skill Stars 3,727 Tom 2026-08-23
PaperDebugger/paperdebugger · 上手攻略
PaperDebugger 是一款面向 Overleaf 的 Chrome 浏览器插件,为学术论文写作提供 AI 辅助——在编辑器内完成研究 → 批评 → 修订的完整工作流。核心驱动力是团队自研的 XtraMCP 编排引擎,通过多步骤推理实现类审稿人的结构化批评,而非简单的聊天式续写。 核心约束:只读不写——从不修改用户项目,仅读取并提供建议,隐私安全优先。…
Agent 智能体 PaperDebugger/paperdebugger Stars 1,522 Tom 2026-08-22
elysia395/dsh-wallpaper-engine · 上手攻略
dshwallpaperengine 是一个 DeepSeek Harness(DSH)bundle(插件),其核心功能是:把你电脑上 Wallpaper Engine 的壁纸"搬"到 DSH 网页界面的后方,让 AI 对话界面自带动态桌面背景。 它的工作方式并非简单地把图片塞进 HTML 背景,而是真正地读取引擎素材——.mp4 视频壁纸直接用 <vide…
工程化 elysia395/dsh-wallpaper-engine Stars 159 Tom 2026-08-21
lifan0127/ai-research-assistant · 上手攻略
Aria(AI Research Assistant,ARIA = "AI Research Assistant" 倒写)是 Zotero 的一个本地插件,用 GPT4 系列模型为你的文献库添加对话式 AI 助手功能。装好后 Zotero 工具栏出现一个按钮,点开就能和当前选中的文献"对话"——问它摘要、方法论、找相关研究、写笔记。 最新版本: Zotero…
Agent 智能体 lifan0127/ai-research-assistant Stars 1,719 Tom 2026-08-21
coding-parrot/pothole-reporter · 上手攻略
potholereporter 是一个纯客户端 Android 应用,用 AI 视觉检测班加罗尔(Bengaluru)道路坑洞,自动关联公共采购记录找到负责官员和承包商,生成一份可编辑的投诉邮件草稿,由你审核后手动发送。 核心特点:没有服务端、不需要账号、不自动发邮件——一切都在本地完成,你掌控每一步。App 扫描约 2,900 份政府合同记录用于关联,检测…
Agent 智能体 coding-parrot/pothole-reporter Stars 116 Tom 2026-08-21
kingyiusuen/image-to-latex · 上手攻略
imagetolatex 是一个将数学公式图像转换为 LaTeX 代码的深度学习项目,使用 ResNet18 作为图像编码器、Transformer 作为解码器,在 im2latex100k 数据集上训练,测试集字符错误率(CER)约为 0.17。项目为独立研究者作品,没有商业依赖,适合学术写作者、科研人员和教育场景快速将印刷或手写的数学公式转为可编辑 La…
多模态 kingyiusuen/image-to-latex Stars 2,160 Tom 2026-08-21
aigc-apps/EasyAnimate · 上手攻略
EasyAnimate 是阿里巴巴 PAI 团队开源的端到端视频生成 Pipeline,基于 Diffusion Transformer(DiT)架构,支持文生视频、图生视频、视频生视频及多种控制条件(姿态/Canny/深度/相机轨迹)。最新版本 V5.1 提供 7B 和 12B 两种规模,支持中英文双语提示词,是目前开源生态中支持控制类型最丰富的视频生成方…
多模态 aigc-apps/EasyAnimate Stars 2,266 Tom 2026-08-21
aigc-apps/VideoX-Fun · 上手攻略
VideoXFun 是阿里巴巴 PAI 团队开源的端到端 AI 视频生成流水线,基于 Diffusion Transformer(DiT)架构,支持文生视频(T2V)、图生视频(I2V)、视频生视频(V2V)、控制视频生成(ControlNet 类)以及 LoRA 微调训练。项目同时支持 CogVideoXFun 系列和 Wan2.1Fun 系列模型,覆盖从…
多模态 aigc-apps/VideoX-Fun Stars 2,192 Tom 2026-08-21
b-nnett/goose · 上手攻略
Goose 是一个本地优先的 WHOOP 5.0 数据项目,核心目标是绕过 WHOOP 昂贵的订阅费($199+/年),直接从设备蓝牙获取原始数据并在本地解析为健康指标。2026 年 6 月 2 日由独立开发者 Bennett(@b_nnett)用 24 小时倒计时挑战从零构建,随后快速获得关注——发布 23.5 小时内已有可用的 app,累计 2,500+…
Agent 智能体 b-nnett/goose Stars 2,679 Tom 2026-08-20
amitshekhariitbhu/ai-engineering-interview-questions · 上手攻略
一份持续更新的 AI 工程面试题库,由印度理工学院(IIT BHU)校友 Amit Shekhar 创建,配套其在线课程平台 Outcome School。仓库收录了 AI Engineer、Gen AI Engineer、LLM Engineer、Agentic AI Engineer、AI Platform Engineer、MLOps/LLMOps E…
工程化 amitshekhariitbhu/ai-engineering-interview-questions Stars 2,543 Tom 2026-08-20
HiLab-git/SSL4MIS · 上手攻略
SSL4MIS(Semi Supervised Learning for Medical Image Segmentation)是一个医学影像分割领域的半监督学习论文与代码汇总仓库,由 HiLab 团队维护。它不是一个可以直接跑起来的框架或工具,而是一个持续更新的文献 + 代码索引库——追踪这个领域从 2019 年至今几乎所有重要的论文及其官方实现。 每一项…
多模态 HiLab-git/SSL4MIS Stars 2,671 Tom 2026-08-20
intel/neural-compressor · 上手攻略
Intel Neural Compressor 是 Intel 开源的模型压缩库,专注于 LLM/VLM 的低比特量化(Lowbit Quantization),覆盖 INT8、FP8、MXFP8、MXFP4、INT4、NVFP4 等多种低精度数据类型,支持 PyTorch、TensorFlow、JAX 三大框架。 其核心定位是:Intel 官方大模型推理优…
LLM 基础设施 intel/neural-compressor Stars 2,697 Tom 2026-08-19
NVIDIA-NeMo/Curator · 上手攻略
NeMo Curator 是 NVIDIA 出品的大规模多模态数据预处理与清洗工具包,专门为 LLM(及其他基础模型)预训练数据构建可复用的 GPU 加速流水线。覆盖文本、图像、视频、音频四种模态,核心能力包括:质量过滤、去重(精确/模糊/子串)、语言检测、分类、合成数据生成(SDG)。它由 RAPIDS(cuDF/cuML/cuGraph)+ Ray 驱动…
LLM 基础设施 NVIDIA-NeMo/Curator Stars 1,723 Tom 2026-08-19
gptme/gptme · 上手攻略
gptme(发音像 "GPTmee")是一个运行在终端里的 AI 编程 Agent,配备本地工具集:写代码、执行命令、浏览网页、操作文件。你可以在自己的笔记本、SSH 会话、tmux、headless 服务器甚至 CI 流水线里运行它。定位是通用型终端 AI Agent,既是一个强大的编程助手,也可以处理各种知识工作。完全开源,支持 Anthropic、Op…
Agent 智能体 gptme/gptme Stars 4,381 Tom 2026-08-19
myYangyunfan/dsh_desktop · 上手攻略
DSH Desktop(DeepSeek Harness Desktop)是将 DeepSeek 官方 CLI 工具 dsh(DeepSeek Harness)封装为开箱即用桌面客户端的项目。打包内置完整 Node.js 运行时 + npm CLI + 全部官方插件,双击即启动 dsh web UI,无需用户自行安装任何环境。适合不想折腾命令行、直接在 Wi…
评测基准 myYangyunfan/dsh_desktop Stars 463 Tom 2026-08-19
OpenBMB/UltraRAG · 上手攻略
UltraRAG 是由清华大学 THUNLP、东北大学 NEUIR、OpenBMB、AI9stars 联合推出的低代码 RAG 开发框架,基于 MCP(Model Context Protocol)架构设计。它将 RAG 的核心组件(检索器 Retriever、生成器 Generation、语料处理 Corpus、评估 Evaluation)拆解为独立的 M…
Agent 智能体 OpenBMB/UltraRAG Stars 5,668 Tom 2026-08-19
aigc-apps/sd-webui-EasyPhoto · 上手攻略
EasyPhoto 是一个 Stable Diffusion WebUI 插件,用于生成 AI 人像写真——上传 5~20 张个人照片训练专属的"数字分身"(LoRA 模型),之后即可用这个分身在任意场景下生成写真图片。 核心能力: 由阿里巴巴 PAI(Platform for AI)团队开发维护,开源于 2023 年,配套有论文(arXiv:2310.04…
多模态 aigc-apps/sd-webui-EasyPhoto Stars 5,153 Tom 2026-08-19
genkit-ai/genkit · 上手攻略
Genkit 是 Google Firebase 团队开源的全栈 AI 应用开发框架,支持 JavaScript/TypeScript(生产就绪)、Go(生产就绪)、Python(Beta)、Dart(Preview)四种语言,可对接 Google Gemini、OpenAI、Anthropic、Ollama 等主流模型厂商。 核心理念:一套 API 走天下…
Agent 智能体 genkit-ai/genkit Stars 6,342 Tom 2026-08-19
index-tts/index-tts · 上手攻略
IndexTTS 是阿里巴巴 Index 团队开源的零样本(ZeroShot)语音克隆系统,用一段参考音频(10~30秒)即可复刻任意人的音色,生成对应文本的语音。当前稳定版为 IndexTTS2.5(2026年8月10日发布),支持中文、英语、日语、西班牙语、阿拉伯语五种语言,并在多语言跨音色任务上达到了开源 SOTA 水平。 核心能力: IndexTTS…
多模态 index-tts/index-tts Stars 22,384 Tom 2026-08-19
内容待复核
Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins · 上手攻略
DeepSeek Harness(DSH)是 DeepSeek 官方开源的 Agent 执行框架,其核心理念是"一切皆插件"——每个能力(模型供应商、工具、记忆、调度、UI 客户端)都是可插拔的组件。AwesomeDeepSeekHarnessPlugins 是由 ZhiyuanFan 维护的每日精选目录,收录 DSH 生态中公开可用的插件、扩展、技能、工具…
评测基准 Zhiyuan-Fan/Awesome-DeepSeek-Harness-Plugins Stars 134 Tom 2026-08-18
pytorch/examples · 上手攻略
pytorch/examples 是 PyTorch 官方维护的示例仓库,汇集了 PyTorch 官方团队编写的各领域高质量参考实现。与 PyTorch Tutorials 不同,这些示例追求代码简洁、独立可运行、少依赖,每个子目录对应一个完整任务,读者可以直接把代码复制到自己的项目中使用或改写。覆盖领域包括:MNIST 手写数字识别(含多种变体)、VAE、…
多模态 pytorch/examples Stars 23,986 Tom 2026-08-18
HumanSignal/labelImg · 上手攻略
labelImg 是一个开源的图形化图像标注工具,由 Tzutalin 开发维护,现归属 HumanSignal(Label Studio 社区)管理。它用 Python + Qt 编写,提供直观的 GUI,让用户通过鼠标框选来标注目标物体,生成标准格式的标注文件。标注结果支持 PASCAL VOC XML、YOLO TXT 和 CreateML JSON …
多模态 HumanSignal/labelImg Stars 25,069 Tom 2026-08-18
openai/CLIP · 上手攻略
CLIP(Contrastive LanguageImage PreTraining)是 OpenAI 在 2021 年发布的图文多模态模型,论文为 Learning Transferable Visual Models From Natural Language Supervision。它的核心思想是用大规模图文配对数据训练一个联合 embedding 空…
工程化 openai/CLIP Stars 34,123 Tom 2026-08-18
JaidedAI/EasyOCR · 上手攻略
EasyOCR 是一个用 PyTorch 开发的通用 OCR(光学字符识别)Python 库,开箱即用,支持 80+ 语言,涵盖 Latin、CJK(简繁体中文、日文、韩文)、Arabic、Devanagari、Cyrillic 等所有主流书写系统,同时处理自然场景文本和文档密集文本。 v1.7.2(2024 年 9 月)是当前最新正式版。自 2020 年起…
多模态 JaidedAI/EasyOCR Stars 29,861 Tom 2026-08-18
ocrmypdf/OCRmyPDF · 上手攻略
OCRmyPDF 是一个为 PDF 添加 OCR 文字层的命令行工具,它调用 Tesseract OCR 引擎,将扫描件、影印件等图片型 PDF 转化为可搜索、可复制文字的 PDF/A(适合长期归档的可移植 PDF 子集)。 它的核心价值在于「精准」——OCR 文字会精确地嵌入到原始图片下方,保证复制粘贴时位置准确,不出现文字错位;输出文件通常比输入更小(经…
多模态 ocrmypdf/OCRmyPDF Stars 34,348 Tom 2026-08-17
oobabooga/textgen · 上手攻略
textgen(全称 oobabooga/textgenerationwebui)是一个开源本地大模型桌面应用,支持文本生成、视觉理解(多模态)、工具调用、网页搜索、LoRA 微调,以及 OpenAI / Anthropic 兼容 API。口号是「100% 离线、零遥测」——不需要任何外部服务,所有模型和数据都在你自己的机器上。 它是原本大名鼎鼎的「text…
多模态 oobabooga/textgen Stars 47,519 Tom 2026-08-17
ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17