研究库 实战攻略
Guides · organized/guides

仓库攻略

72 篇 · 71 个项目 · 多模态 · 多模态

ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17
CompVis/stable-diffusion · 上手攻略
Stable Diffusion 是 CompVis 团队(海德堡大学)开发的潜在扩散模型(Latent Diffusion Model),通过文本提示生成照片级图像。该项目是 Stability AI 和 Runway 合作的产物,在 2022 年 CVPR 以 Oral 论文发表,相关论文 HighResolution Image Synthesis w…
多模态 CompVis/stable-diffusion Stars 73,272 Tom 2026-08-17
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 45 Jay 2026-08-16
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,918 Tom 2026-08-15
breezedeus/Pix2Text · 上手攻略
Pix2Text(简称 P2T)是一个开源 Python 工具,核心功能是把图片(含数学公式、表格、版面布局)识别并转换为 Markdown 格式,定位是 Mathpix 的免费开源替代品。 2025 年 7 月升级到 V1.1.4 后,数学公式检测(MFD)和识别(MFR)模型均已升级到 1.5 版本,版面分析引入 DocLayoutYOLO 模型,整体识…
多模态 breezedeus/Pix2Text Stars 3,213 Tom 2026-08-13
all-in-aigc/sorafm · 上手攻略
sorafm 是一个基于 Next.js 的开源 Sora AI 视频生成 Web 应用,提供可视化界面来管理和展示由 OpenAI Sora 生成的 AI 视频内容。项目支持 Docker 部署,可以在本地或私有服务器上快速搭建一个 Sora 视频展示站点。 技术栈:Next.js(前端框架)+ PostgreSQL(数据库)+ Tailwind CSS(…
多模态 all-in-aigc/sorafm Stars 1,152 Tom 2026-08-12
huangserva/skill-prompt-generator · 上手攻略
skillpromptgenerator 是一个双平台 AI 提示词生成系统: 三种生成模式: ⚠️ README 中提到的 .claude/CLAUDE.md 入口文档实际 fetch 返回 404(仓库根 README 列出的 /blob/main/.claude/CLAUDE.md 路径不可访问,⚠️ 未核验),用户需要直接通过 Skill 名称调用。…
多模态 huangserva/skill-prompt-generator Stars 1,451 spark 2026-08-12
HITsz-TMG/VideoClaw · 上手攻略
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
多模态 HITsz-TMG/VideoClaw Stars 1,685 Tom 2026-08-11
liyue-aigc/female-portrait-director · 上手攻略
femaleportraitdirector 是一个模块化的 Codex Skill(也兼容 Claude Code / Cursor / GitHub Copilot / Gemini CLI),作用是把零散的人像参数——如风格、场景、服装、情绪——转化为一组结构化的、可以直接复制使用的 AI 生图提示词,输出包含最终提示词(5 个完整段落)和独立的负面约…
多模态 liyue-aigc/female-portrait-director Stars 1,336 Jay 2026-08-09
Moonlit-Pages/AIGC-Detector-Rewriter-Skill · 上手攻略
AIGCDetectorRewriterSkill 是一个面向学术论文写作的 AI 生成内容(AIGC)风险检测与最小化改写技能,兼容 OpenClaw 与 HermesAgent。支持英文论文、中文论文(含中文模板化表达检测),针对 Turnitin AI 检测、知网 AIGC 检测等主流工具提供保守改写方案。 核心原则:最小化改写——不重写全文,不过度润…
多模态 Moonlit-Pages/AIGC-Detector-Rewriter-Skill Stars 488 Jay 2026-08-08
facebookresearch/vggt-omega · 上手攻略
VGGTOmega(VGGTΩ)是 Meta AI 与牛津大学视觉几何组(VGG)联合发布的单次前向 3D 重建模型,输入一组图像(单张到数百张),直接输出相机内外参数、深度图、置信度图和场景 token——无需传统 SfM/Colmap 的迭代优化步骤。模型入选 CVPR 2026 Best Paper Finalist,是前作 VGGT(CVPR 202…
多模态 facebookresearch/vggt-omega Stars 3,471 Tom 2026-08-06
dramaclaw/dramaclaw · 上手攻略
DramaClaw 是一套"工业级短剧 AIGC 生产线"的社区版(Community Edition / CE),由 dramaclaw 团队自用后开源。它把"小说 → 知识图谱 → 分集/分镜 → 剧本 → 分镜图与首帧 → 配音 → 合成成片"整条链封装在一个 Docker 编排里,强调"一套跑到底、关掉浏览器也能交付成片",目标是把原本只有大厂才拼得…
多模态 dramaclaw/dramaclaw Stars 3,493 spark 2026-08-06
LiamGvchi/gc-minimal-zine-poster · 上手攻略
gcminimalzineposter 是一个 Codex(OpenAI 官方 AI 编程助手)技能,专门将任意主题、句子、物件、情绪、文章构想、照片或内容简报,转化为一张安静、极简 ZINE 风格编辑海报的提示词,并直接生成对应的位图图像。 它不是通用的图片生成工具——所有输出都围绕一种独特的美学:竖版 3:5 比例、70%–90% 留白、日式/韩式独立 …
多模态 LiamGvchi/gc-minimal-zine-poster Stars 5,385 Tom 2026-08-06
huggingface/transformers · 上手攻略
Transformers 是 Hugging Face 维护的 Python 库,提供超过 1M 个预训练模型检查点的统一加载、微调和推理接口。它覆盖文本(NLP)、计算机视觉、音频、视频和多模态五种模态,是目前最广泛使用的开源模型定义框架。 它的核心定位不是"又一个 PyTorch 工具箱",而是模型定义层的事实标准——如果一个模型在 transforme…
多模态 huggingface/transformers Stars 163,296 Tom 2026-08-04
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
hoainho/img2threejs · 上手攻略
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
多模态 hoainho/img2threejs Stars 4,176 Tom 2026-07-25
oso95/scroll-world · 上手攻略
scrollworld 是一个 AI Agent Skill(技能),运行在 Claude Code、Codex 或任何兼容 SKILL.md 的 AI 编程助手内。它能为一任意品牌或行业构建「滚动穿越3D世界」的沉浸式落地页——访客滚动页面时,摄影机从场景外部俯冲进入内部,再无缝飞入下一场景,全称无剪辑,像 Apple's scrollthrough 产品…
多模态 oso95/scroll-world Stars 7,924 Tom 2026-07-18
EvolvingLMMs-Lab/lmms-eval · 上手攻略
lmmseval(Python 包名 lmmseval,前身为 LMMsEval)是 EvolvingLMMsLab 维护的"统一多模态大模型评估工具包"。目标只有一个:让"同一个模型 + 同一个 benchmark + 同一套参数"在两台机器上跑出来数字一致,并且能覆盖文本、图像、视频、音频四大模态的 100+ 任务、30+ 模型后端。 它脱胎于 Eleu…
多模态 EvolvingLMMs-Lab/lmms-eval Stars 4,382 spark 2026-07-16
lukas-blecher/LaTeX-OCR · 上手攻略
LaTeXOCR(开源包名 pix2tex)是一个基于深度学习的 OCR 工具,专门把数学公式的图片还原为 LaTeX 代码。输入一张公式截图,输出对应的 LaTeX 文本——支持印刷公式也支持部分手写公式。 它由 ViT(Vision Transformer)编码器 + ResNet 主干网络 + Transformer 解码器 组成,在 im2latex…
多模态 lukas-blecher/LaTeX-OCR Stars 16,530 Jay 2026-07-14
内容待复核
BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
这是一份由南京大学 MIG 实验室(NJUMiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。 它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论…
多模态 BradyFU/Awesome-Multimodal-Large-Language-Models Stars 17,977 Tom 2026-07-14
Acly/krita-ai-diffusion · 上手攻略
kritaaidiffusion 是开发者 Acly 给开源绘图软件 Krita 写的生成式 AI 插件。它把扩散模型(Stable Diffusion 1.5 / XL / Illustrious / Flux、ZImage + ControlNet / IPAdapter)作为 Krita 的"生成式图层工具"暴露出来,强调两件事: 1. 精度与控制:用…
多模态 Acly/krita-ai-diffusion Stars 10,449 spark 2026-07-14
nexu-io/html-video · 上手攻略
htmlvideo 是 Open Design 团队出品的"AI 视频生成 metalayer":你跟本地 coding agent 说一句话(或丢一个链接),它把 HTML/CSS/数据变成真实 MP4 视频,全程在你电脑上渲染,不需要云端、不收单次渲染费。 它不绑定某个特定渲染引擎,而是一套适配器接口,render(input, ctx) 契约,任何后端…
多模态 nexu-io/html-video Stars 4,160 Tom 2026-07-14
NVIDIA-NeMo/Speech · 上手攻略
NVIDIA NeMo Speech 是 NVIDIA 推出的专注于语音 AI 的开源框架,支持自动语音识别(ASR)、语音合成(TTS)和语音大模型(Speech LLM)三大方向。它是从原 NVIDIA/NeMo 大一统仓库中拆分出来的独立版本(2026 年 6 月正式发布首个 release),专门面向需要训练和微调语音模型的 연구人员和 PyTorc…
多模态 NVIDIA-NeMo/Speech Stars 18,087 Tom 2026-07-13
Lightricks/LTX-2 · 上手攻略
LTX2 是 Lightricks 开源的视频生成模型(当前版本 LTX2.3,22B 参数,2026 年 3 月 5 日发布),基于 DiT(Diffusion Transformer)架构。它是 2026 年视频生成领域里唯一同时具备以下三个特性的开源模型: 同步音视频生成(4K 视频 + 音频,一次扩散过程完成) 原生 4K 50fps 输出 完整开源…
多模态 Lightricks/LTX-2 Stars 8,560 Jay 2026-07-12
xorbitsai/inference(Xinference)· 上手攻略
Xinference(Xorbits Inference)是 xorbitsai 团队开源的统一推理服务平台,一行代码替换 GPT 为任意开源 LLM。它让你在本地、云端或笔记本上运行开源语言模型、语音模型和多模态模型,通过统一的 OpenAI 兼容 API 提供服务。 Xinference 的核心差异化在于:支持最多的推理引擎(vLLM、SGLang、ll…
多模态 xorbitsai/inference Stars 9,486 Jay 2026-07-11
mudler/LocalAI · 上手攻略
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
多模态 mudler/LocalAI Stars 49,205 Tom 2026-07-10
google-ai-edge/mediapipe · 上手攻略
MediaPipe 是 Google 开源的端侧机器学习框架,专注于在手机(Android/iOS)、Web、桌面、边缘设备和 IoT 上实时运行 ML 模型。它不是训练框架,而是推理框架——帮你把 Google 训练好的模型快速部署到各类设备上,以低延迟处理图像、视频、音频和文本。 Google 于 2023 年将 MediaPipe 主开发文档迁移至 d…
多模态 google-ai-edge/mediapipe Stars 36,566 Tom 2026-07-10