Guides · organized/guides

仓库攻略

30 篇 · 30 个项目 · 多模态 · Agent 智能体

coderonion/awesome-llm-and-aigc · 上手攻略
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
多模态 coderonion/awesome-llm-and-aigc Stars 811 Jay 2026-08-25
LearnPrompt/LearnPrompt · 上手攻略
LearnPrompt 是一个永久免费开源的中文 AI 学习教程仓库,由 B站 up 主"卡尔的AI沃茨"(GitHub @LearnPrompt)维护。它起步于 2023 年的 AIGC 工具教程(ChatGPT、Midjourney、Stable Diffusion),如今已演化为一套面向真实工作场景的 AI Native 教程体系,涵盖 Claude …
多模态 LearnPrompt/LearnPrompt Stars 2,580 Tom 2026-08-20
AIGC-Audio/AudioGPT · 上手攻略
AudioGPT是由 AIGCAudio 团队开源的多模态音频理解和生成框架,发布于 2023 年 4 月(arXiv:2304.12995)。其核心设计思路是:将 LLM(大语言模型)作为音频任务的统一调度层,底层对接各类音频/语音专有的预训练基础模型(Foundation Models),用户通过自然语言 Prompt 控制音频生成与理解任务。 GitH…
多模态 AIGC-Audio/AudioGPT Stars 10,171 Tom 2026-08-18
ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 22 Jay 2026-08-16
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,790 Tom 2026-08-15
huangserva/skill-prompt-generator · 上手攻略
skillpromptgenerator 是一个双平台 AI 提示词生成系统: 三种生成模式: ⚠️ README 中提到的 .claude/CLAUDE.md 入口文档实际 fetch 返回 404(仓库根 README 列出的 /blob/main/.claude/CLAUDE.md 路径不可访问,⚠️ 未核验),用户需要直接通过 Skill 名称调用。…
多模态 huangserva/skill-prompt-generator Stars 1,451 spark 2026-08-12
HITsz-TMG/VideoClaw · 上手攻略
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
多模态 HITsz-TMG/VideoClaw Stars 1,685 Tom 2026-08-11
aldegad/sprite-gen · 上手攻略
spritegen 是一个面向游戏美术的 AI 驱动精灵图(sprite atlas)生成 pipeline,以 Codex/Claude Skill 形式运行。给一张角色基础图,它驱动 AI 图像模型逐动作状态(idle、jump、attack…)生成一行帧图,依次完成去背景、连通分量提取、帧切割、帧级别校正,最后打包出一张含真实 alpha 通道的透明精…
多模态 aldegad/sprite-gen Stars 667 Tom 2026-08-09
Moonlit-Pages/AIGC-Detector-Rewriter-Skill · 上手攻略
AIGCDetectorRewriterSkill 是一个面向学术论文写作的 AI 生成内容(AIGC)风险检测与最小化改写技能,兼容 OpenClaw 与 HermesAgent。支持英文论文、中文论文(含中文模板化表达检测),针对 Turnitin AI 检测、知网 AIGC 检测等主流工具提供保守改写方案。 核心原则:最小化改写——不重写全文,不过度润…
多模态 Moonlit-Pages/AIGC-Detector-Rewriter-Skill Stars 488 Jay 2026-08-08
dramaclaw/dramaclaw · 上手攻略
DramaClaw 是一套"工业级短剧 AIGC 生产线"的社区版(Community Edition / CE),由 dramaclaw 团队自用后开源。它把"小说 → 知识图谱 → 分集/分镜 → 剧本 → 分镜图与首帧 → 配音 → 合成成片"整条链封装在一个 Docker 编排里,强调"一套跑到底、关掉浏览器也能交付成片",目标是把原本只有大厂才拼得…
多模态 dramaclaw/dramaclaw Stars 3,493 spark 2026-08-06
digimata/quill · 上手攻略
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
多模态 digimata/quill Stars 3,763 Jay 2026-08-01
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
hoainho/img2threejs · 上手攻略
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
多模态 hoainho/img2threejs Stars 4,176 Tom 2026-07-25
oso95/scroll-world · 上手攻略
scrollworld 是一个 AI Agent Skill(技能),运行在 Claude Code、Codex 或任何兼容 SKILL.md 的 AI 编程助手内。它能为一任意品牌或行业构建「滚动穿越3D世界」的沉浸式落地页——访客滚动页面时,摄影机从场景外部俯冲进入内部,再无缝飞入下一场景,全称无剪辑,像 Apple's scrollthrough 产品…
多模态 oso95/scroll-world Stars 7,924 Tom 2026-07-18
nexu-io/html-video · 上手攻略
htmlvideo 是 Open Design 团队出品的"AI 视频生成 metalayer":你跟本地 coding agent 说一句话(或丢一个链接),它把 HTML/CSS/数据变成真实 MP4 视频,全程在你电脑上渲染,不需要云端、不收单次渲染费。 它不绑定某个特定渲染引擎,而是一套适配器接口,render(input, ctx) 契约,任何后端…
多模态 nexu-io/html-video Stars 4,160 Tom 2026-07-14
xorbitsai/inference(Xinference)· 上手攻略
Xinference(Xorbits Inference)是 xorbitsai 团队开源的统一推理服务平台,一行代码替换 GPT 为任意开源 LLM。它让你在本地、云端或笔记本上运行开源语言模型、语音模型和多模态模型,通过统一的 OpenAI 兼容 API 提供服务。 Xinference 的核心差异化在于:支持最多的推理引擎(vLLM、SGLang、ll…
多模态 xorbitsai/inference Stars 9,486 Jay 2026-07-11
mudler/LocalAI · 上手攻略
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
多模态 mudler/LocalAI Stars 48,383 Tom 2026-07-10
op7418/guizang-social-card-skill · 上手攻略
guizangsocialcardskill 是一个面向 Claude Code / Codex 等 AI Agent 的图文卡片生成技能(Skill),专门用于从文章、截图、产品笔记、照片或视频素材,自动生成小红书 / Rednote 图文组图、Live Photo 动态卡片,以及公众号 21:9 + 1:1 封面对。 它的核心设计哲学是:把"做一张好看的…
多模态 op7418/guizang-social-card-skill Stars 5,512 Tom 2026-07-08
WUBING2023/PaperSpine · 上手攻略
PaperSpine 是一个以"贡献为先、面向审稿人"为核心理念的学术写作系统,支持 Claude Code、Codex、OpenClaw 和 Hermes CLI 四个 AI Agent 宿主。它将学术论文写作拆解为 12 个有序阶段,每阶段有强制关卡(gate),不允许跳步,必须逐关通过才能进入下一阶段。 V4(当前版本 4.0.0)是重大升级:原本 1…
多模态 WUBING2023/PaperSpine Stars 4,041 Tom 2026-07-08
HBAI-Ltd/Toonflow-app · 上手攻略
Toonflow(动画流)是一款开源一站式 AI 短剧创作工具,将小说或剧本快速转化为动画短剧。集成 AI 编剧(ScriptAgent)、智能分镜(ProductionAgent)、角色管理和视频生成,覆盖"策划 → 编剧 → 分镜 → 出片"全流程,官方称创作效率提升 10 倍以上。 官网: 文档: 内置详细说明) 传统短剧制作流程需要:编剧改编 → 分…
多模态 HBAI-Ltd/Toonflow-app Stars 13,701 Jay 2026-07-08
PaddlePaddle/PaddleOCR · 上手攻略
PaddleOCR 是百度飞桨(PaddlePaddle)团队开源的多功能 OCR 与文档解析工具包,GitHub Stars 超 8.4 万,被 Dify、RAGFlow、Cherry Studio 等主流项目深度集成。它不只是一套光学字符识别引擎,更是一个覆盖"图片→结构化数据"完整流程的文档 AI 基础设施。 当前稳定版本为 PaddleOCR 3.6…
多模态 PaddlePaddle/PaddleOCR Stars 87,395 Jay 2026-07-07
helloianneo/ian-xiaohei-illustrations · 上手攻略
ianxiaoheiillustrations 是一个面向 AI Agent(尤其是 Codex)的中文正文配图生成 Skill。它指导 AI 把中文文章、帖子、博客、方法论内容里的判断、流程、状态和隐喻,转化成一张张白底、手绘、怪诞但清爽的 16:9 正文配图。 核心特点:生成的不是通用插画 prompt,也不是 PPT 信息图模板,而是先理解文章认知锚点…
多模态 helloianneo/ian-xiaohei-illustrations Stars 8,494 Jay 2026-07-07
teamchong/pxpipe · 上手攻略
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
多模态 teamchong/pxpipe Stars 6,425 Tom 2026-07-07
diffusionstudio/lottie · 上手攻略
lottie 是 Diffusion Studio 出品的开源 Skill(工具包),让 Claude Code 或 Codex 等 Coding Agent 通过自然语言指令直接生成可投产级别的 Lottie 动画 JSON 文件。 它的核心工作流是:你在对话中描述想要的动画效果(基于 SVG、截图或真实数据),Agent 调用 diffusionstud…
多模态 diffusionstudio/lottie Stars 5,020 Jay 2026-07-06
Anil-matcha/Open-Generative-AI · 上手攻略
Open Generative AI(简称 OGA)是一个免费的、开源的 AI 图像与视频生成桌面应用,内置 200+ 模型(Flux、Midjourney、Kling、Sora、Veo、Seedance 2.5 等),无内容过滤器、无审查,MIT 协议可自托管,本质上是 MuAPI.ai 的前端桌面封装。 核心定位:绕过商业 AI 视频平台的内容限制,让用…
多模态 Anil-matcha/Open-Generative-AI Stars 26,047 Tom 2026-07-05
ruvnet/RuView · 上手攻略
RuView 是一个基于 WiFi CSI(信道状态信息) 的空间智能感知系统——利用普通路由器发出的无线信号,经墙壁反射后的人体扰动来检测:有人在与否、呼吸频率、心率、跌倒、活动姿态、房间占用情况。全程不需要任何摄像头、麦克风或可穿戴设备。 核心技术:用 ESP32 板子 + Cognitum Seed(边缘 AI 协处理器)读取 WiFi CSI 数据,…
多模态 ruvnet/RuView Stars 89,443 Tom 2026-07-05