研究库 实战攻略
Guides · organized/guides

仓库攻略

43 篇 · 43 个项目 · 多模态 · Agent 智能体

storytold/photocraft · 上手攻略
PhotoCraft 是用纯 Rust 从零实现的开源 Adobe Photoshop 替代品,隶属于 ArtCraft 社区。与依赖 Electron/WebView 的方案不同,它使用 wgpu 作为 GPU 渲染后端,支持 Metal、Vulkan、DX12 和 WebGPU,覆盖 macOS、Windows、Linux、FreeBSD,并可通过 We…
多模态 storytold/photocraft Stars 8,993 Tom 2026-10-07
oil-oil/oil-ui · 上手攻略
oilui 是一个 AI 原生 UI 设计方法论框架,本质上是一套结构化设计流程(不是 Figma 插件,也不是代码库),通过一套明确的步骤让 AI Agent 生成高质量、可交付的网页或 App 界面设计。 它以 Claude Code Skill(或兼容 npx skills 的 Agent)的形式分发,安装后直接把设计任务交给 Agent,Agent …
多模态 oil-oil/oil-ui Stars 581 Tom 2026-10-06
gulelmatthews/Polymarket-Perpetual-Bot · 上手攻略
PolymarketPerpetualBot 是一个面向 Polymarket 预测市场的终端交易机器人,基于 Polymarket 的 Polygon CLOB(Central Limit Order Book)API 构建。它以键盘驱动的 TUI(终端用户界面)呈现,集成了行情浏览、实时订单簿查看、策略引擎和持仓追踪四大模块,支持模拟交易(paper t…
多模态 gulelmatthews/Polymarket-Perpetual-Bot Stars 183 Tom 2026-09-28
timmyy123/LLM-Hub · 上手攻略
§0 自检:1) 公开 README 抓取 ✓ · 2) GitHub 200 OK ✓ · 3) Android/iOS 构建命令均来自 README ✓ · 4) 许可证 PolyForm Noncommercial 1.0.0(README 显式标注)✓ · 5) 反方 v2 三段式按主线分布(见 §6)✓ · 6) 立标候选(主分类:移动端本地多模态…
多模态 timmyy123/LLM-Hub Stars 594 spark 2026-09-26
jankeesvw/omarchy-meeting-recorder · 上手攻略
§0 自检:1) 公开 README 抓取 ✓ · 2) GitHub 200 OK ✓ · 3) 安装/卸载命令均来自 README ✓ · 4) whisper 模型大小 1.6 GB 由 README 给出 ✓ · 5) 反方 v2 三段式按主线分布(见 §6)✓ · 6) 立标候选(主分类: 桌面端会议录制;副分类: 本地 ASR;★ 候选)✓ · …
多模态 jankeesvw/omarchy-meeting-recorder Stars 216 spark 2026-09-26
timoncool/YuE2-Studio · 上手攻略
YuE2Studio 是 YuE2(MAP 团队开源歌曲模型)的桌面工作室。YuE2 是一个约 30 亿参数的音乐生成模型,输入歌词和风格描述,先写一份可编辑的乐谱(ABC 记谱法),再基于乐谱演唱为完整歌曲——含人声、伴奏、节拍结构(引子/主歌/副歌/桥段/尾奏)。 传统 AI 音乐工具生成后无法修改,YuE2Studio 的核心差异化在于乐谱先行、演出可…
多模态 timoncool/YuE2-Studio Stars 275 Tom 2026-09-25
liyupi/ai-model-world · 上手攻略
AI Model World(大模型世界)是一个把 500+ 大模型可视化成像素小镇的互动网站。每个模型是某家厂商"小屋"里的一个像素角色,网站首页八块领奖台分别标注"今日最聪明""最会编程""最划算""最便宜""记性最好""最新发布""国内最强""开源最强",三秒扫完当天格局。背后数据来自 models.dev、Epoch AI、LiveBench、Hug…
多模态 liyupi/ai-model-world Stars 144 Jay 2026-09-20
WenyuChiou/academic-writing-skills · 上手攻略
academicwritingskills 是面向 Claude Code / ChatGPT / Codex / OpenCode / Hermes Agent 等 Agent Skills 兼容客户端的论文写作 skill 套件(MIT 协议,Star ~49、周增 +16)。它把"研究定位 → 论点架构 → 扩展大纲 → 证据驱动的写作 → 双向对齐 …
多模态 WenyuChiou/academic-writing-skills Stars 88 spark 2026-09-16
Vincentwei1021/anything2explainer · 上手攻略
⚠️ 数据来源:仅 GitHub README 原文 + Remotion / Claude Code / Codex 官网(截至 20260913 抓取)。web_search 命中的 X、Instagram、SkillsLLM 等三方页视为不可信,不引用其 stars / forks 数字。本文不下 npm、不跑 Remotion、不发 TTS 调用。 …
多模态 Vincentwei1021/anything2explainer Stars 1,040 spark 2026-09-13
bytedance/Sa2VA · 上手攻略
Sa2VA 是字节跳动 Seed 团队联合 UC Merced / WHU / PKU 在 2026 年开源的 Pixel LLM 系列旗舰仓库,核心论文《Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos》已被 IEEE TPAMI 202…
多模态 bytedance/Sa2VA Stars 1,666 spark 2026-09-08
szczyglis-dev/py-gpt · 上手攻略
PyGPT 是一个开源桌面 AI 助手,用 Python 开发,支持 Linux / Windows 1011 / Mac 三平台。它的工作方式类似 ChatGPT,但完全离线运行在你自己电脑上——API 密钥你自己管,数据不经过任何第三方服务器。 当前版本 2.8.6(build 20260903),支持从 GPT5、GPT4、o1/o3/o4,到 Goo…
多模态 szczyglis-dev/py-gpt Stars 1,904 Tom 2026-09-04
fajarhide/omni · 上手攻略
OMNI 是一个 Rust 写的本地 CLI + host hooks 套件,专为 agent 宿主(Claude Code、Codex CLI、Gemini CLI、OpenClaw、Cursor、Aider、Hermes、Pi、Cline、Roo、Copilot 等)做工具输出瘦身。它有两件普通过滤器做不到的事,下面分别展开。它做两件普通过滤器做不到的事…
多模态 fajarhide/omni Stars 360 spark 2026-09-02
rookiestar28/ComfyUI-OpenClaw · 上手攻略
ComfyUIOpenClaw 是 ComfyUI 的安全优先编排层,将 ComfyUI 从纯生成工具升级为可自动化、可管控的生产级 AI 工厂。核心思路是:在不修改 ComfyUI 本身的前提下,通过自定义节点 + 嵌入式 HTTP API + 独立管理控制台,把 ComfyUI 变成一个可靠的自动化目标。 项目自称"安全第一",体现在:RBAC 权限控制…
多模态 rookiestar28/ComfyUI-OpenClaw Stars 557 Tom 2026-08-27
coderonion/awesome-llm-and-aigc · 上手攻略
coderonion/awesomellmandaigc 是一个 LLM / VLM / VLA / AIGC 领域的精选资源列表(Awesome List),按 Framework(模型/训练/推理/量化/RAG)、Application(IDE/聊天机器人/具身智能/代码助手/知识库等)、Dataset、Learning Resources、Commun…
多模态 coderonion/awesome-llm-and-aigc Stars 811 Jay 2026-08-25
LearnPrompt/LearnPrompt · 上手攻略
LearnPrompt 是一个永久免费开源的中文 AI 学习教程仓库,由 B站 up 主"卡尔的AI沃茨"(GitHub @LearnPrompt)维护。它起步于 2023 年的 AIGC 工具教程(ChatGPT、Midjourney、Stable Diffusion),如今已演化为一套面向真实工作场景的 AI Native 教程体系,涵盖 Claude …
多模态 LearnPrompt/LearnPrompt Stars 2,580 Tom 2026-08-20
AIGC-Audio/AudioGPT · 上手攻略
AudioGPT是由 AIGCAudio 团队开源的多模态音频理解和生成框架,发布于 2023 年 4 月(arXiv:2304.12995)。其核心设计思路是:将 LLM(大语言模型)作为音频任务的统一调度层,底层对接各类音频/语音专有的预训练基础模型(Foundation Models),用户通过自然语言 Prompt 控制音频生成与理解任务。 GitH…
多模态 AIGC-Audio/AudioGPT Stars 10,171 Tom 2026-08-18
ysr666/dsh-vision-router · 上手攻略
dshvisionrouter 是 DeepSeek Harness(DSH)的视觉增强插件,专为"只能处理文本"的 Agent 提供图像理解能力。它的核心思路是:把看图变成一次普通的工具调用,让 Agent 可以用 vision_ground、vision_crop、vision_describe 等 11 个像素级工具按需操作图像,而不是把图片压缩成一段…
多模态 ysr666/dsh-vision-router Stars 841 Tom 2026-08-17
xmutfyh/dsh-plugin-writing-guard · 上手攻略
dshpluginwritingguard 是 DeepSeek Harness(DSH)的论文写作守卫插件,在论文撰写和修改过程中自动检测常见 AI 写作风格、修改残留、防御性表达与机械化句式,同时提供 Scholarship Lock 功能在 AI 润色时保护科研事实(数字、p值、图表编号等核心实体不被悄悄改动)。定位是学术写作 linter——不是"写…
多模态 xmutfyh/dsh-plugin-writing-guard Stars 45 Jay 2026-08-16
NVIDIA-AI-Blueprints/video-search-and-summarization · 上手攻略
NVIDIA Video Search and Summarization(VSS)Blueprint 是一套GPU 加速的视频语义理解和分析参考架构。它将视觉语言模型(VLM,如 NVIDIA Cosmos)、大语言模型(LLM,如 Nemotron)、RAG 和 NVIDIA NIM 微服务整合在一起,实现用自然语言搜索视频内容、实时异常检测、视频问答和…
多模态 NVIDIA-AI-Blueprints/video-search-and-summarization Stars 1,918 Tom 2026-08-15
huangserva/skill-prompt-generator · 上手攻略
skillpromptgenerator 是一个双平台 AI 提示词生成系统: 三种生成模式: ⚠️ README 中提到的 .claude/CLAUDE.md 入口文档实际 fetch 返回 404(仓库根 README 列出的 /blob/main/.claude/CLAUDE.md 路径不可访问,⚠️ 未核验),用户需要直接通过 Skill 名称调用。…
多模态 huangserva/skill-prompt-generator Stars 1,451 spark 2026-08-12
HITsz-TMG/VideoClaw · 上手攻略
HITszTMG/VideoClaw 是一个面向创意视频生产的 AI 导演系统,来自哈尔滨工业大学(深圳)TMG 实验室。它不是单点式的文生视频工具,而是一条覆盖"剧本策划 → 角色/场景设计 → 分镜规划 → 参考图生成 → 视频生成 → 后期剪辑"的全流程生产线。 用户只需给出一句想法或故事梗概,VideoClaw 就会自动拆解为可执行的影视工作流,生成…
多模态 HITsz-TMG/VideoClaw Stars 1,685 Tom 2026-08-11
aldegad/sprite-gen · 上手攻略
spritegen 是一个面向游戏美术的 AI 驱动精灵图(sprite atlas)生成 pipeline,以 Codex/Claude Skill 形式运行。给一张角色基础图,它驱动 AI 图像模型逐动作状态(idle、jump、attack…)生成一行帧图,依次完成去背景、连通分量提取、帧切割、帧级别校正,最后打包出一张含真实 alpha 通道的透明精…
多模态 aldegad/sprite-gen Stars 667 Tom 2026-08-09
Moonlit-Pages/AIGC-Detector-Rewriter-Skill · 上手攻略
AIGCDetectorRewriterSkill 是一个面向学术论文写作的 AI 生成内容(AIGC)风险检测与最小化改写技能,兼容 OpenClaw 与 HermesAgent。支持英文论文、中文论文(含中文模板化表达检测),针对 Turnitin AI 检测、知网 AIGC 检测等主流工具提供保守改写方案。 核心原则:最小化改写——不重写全文,不过度润…
多模态 Moonlit-Pages/AIGC-Detector-Rewriter-Skill Stars 488 Jay 2026-08-08
dramaclaw/dramaclaw · 上手攻略
DramaClaw 是一套"工业级短剧 AIGC 生产线"的社区版(Community Edition / CE),由 dramaclaw 团队自用后开源。它把"小说 → 知识图谱 → 分集/分镜 → 剧本 → 分镜图与首帧 → 配音 → 合成成片"整条链封装在一个 Docker 编排里,强调"一套跑到底、关掉浏览器也能交付成片",目标是把原本只有大厂才拼得…
多模态 dramaclaw/dramaclaw Stars 3,493 spark 2026-08-06
digimata/quill · 上手攻略
quill 是一个超轻量、纯本地运行的 macOS 会议录音 + 自动转写工具。一个菜单栏图标,点击录音,再点停止,自动在机器上完成转写,生成带说话人标签的文本记录。所有数据永不离开本机,无需账户、无需联网、无需订阅。 它名字的灵感来自羽毛(羽毛笔),是 digimata 工具链中的"录音 + 转写"担当(兄弟项目是 parrot)。整个工具是一个 Swif…
多模态 digimata/quill Stars 3,763 Jay 2026-08-01
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
hoainho/img2threejs · 上手攻略
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
多模态 hoainho/img2threejs Stars 4,176 Tom 2026-07-25