Guides · organized/guides

仓库攻略

229 篇 · 226 个项目 · 多模态

dramaclaw/dramaclaw · 上手攻略
DramaClaw 是一套"工业级短剧 AIGC 生产线"的社区版(Community Edition / CE),由 dramaclaw 团队自用后开源。它把"小说 → 知识图谱 → 分集/分镜 → 剧本 → 分镜图与首帧 → 配音 → 合成成片"整条链封装在一个 Docker 编排里,强调"一套跑到底、关掉浏览器也能交付成片",目标是把原本只有大厂才拼得…
多模态 dramaclaw/dramaclaw Stars 3,493 spark 2026-08-06
LiamGvchi/gc-minimal-zine-poster · 上手攻略
gcminimalzineposter 是一个 Codex(OpenAI 官方 AI 编程助手)技能,专门将任意主题、句子、物件、情绪、文章构想、照片或内容简报,转化为一张安静、极简 ZINE 风格编辑海报的提示词,并直接生成对应的位图图像。 它不是通用的图片生成工具——所有输出都围绕一种独特的美学:竖版 3:5 比例、70%–90% 留白、日式/韩式独立 …
多模态 LiamGvchi/gc-minimal-zine-poster Stars 5,385 Tom 2026-08-06
op7418/guizang-ppt-skill · 上手攻略
guizangpptskill 是「歸藏」开源的一个 Agent PPT 生成技能,专为 Claude Code / Codex 等 Agent 环境设计,可以将文章、观点、方法论自动生成精美的单文件 HTML 横向翻页 PPT,配图、封面、多平台封面也能一并生成。 内置两套视觉系统:Style A(电子杂志风)适合叙事和观点表达,Style B(瑞士国际主…
Agent 智能体 op7418/guizang-ppt-skill Stars 23,718 Jay 2026-08-05
kangarooking/cangjie-skill · 上手攻略
cangjieskill 是一个将书籍、长视频、播客、访谈等高价值内容蒸馏成可执行 Agent Skills 的方法论工具包。输入原始文本(书/视频字幕/播客文字稿),输出一个多文件 skill 仓库:包含独立的 SKILL.md 模块、触发条件、适用边界、使用方式和关联关系——而不是一篇总结文章。 作者 Kangarooking 的核心主张:知识看过/收藏…
Agent 智能体 kangarooking/cangjie-skill Stars 7,067 Jay 2026-08-05
msitarzewski/agency-agents · 上手攻略
Agency Agents 是一个面向 AI 编码工具的专家 Agent 人格库,以 Markdown 文件形式提供,每个 Agent 都有独立人格、专长域、可交付成果和工作流程。目前支持 Claude Code、Cursor、Codex、OpenCode、Gemini CLI、OpenClaw 等主流 Coding Agent,另有工程、安全、嵌入式、合规…
Agent 智能体 msitarzewski/agency-agents Stars 138,334 Tom 2026-08-04
huggingface/transformers · 上手攻略
Transformers 是 Hugging Face 维护的 Python 库,提供超过 1M 个预训练模型检查点的统一加载、微调和推理接口。它覆盖文本(NLP)、计算机视觉、音频、视频和多模态五种模态,是目前最广泛使用的开源模型定义框架。 它的核心定位不是"又一个 PyTorch 工具箱",而是模型定义层的事实标准——如果一个模型在 transforme…
多模态 huggingface/transformers Stars 163,296 Tom 2026-08-04
yc-software/qm · 上手攻略
QM 是一个多人 AI 编程智能体平台,设计目标是让一个 AI 编程智能体服务于整个公司,而非仅限于个人助手。与传统单人 Copilot 不同,QM 通过「scope(作用域)」机制实现多用户隔离与协作: 核心:TypeScript / Node.js,HTTP 层用 Fastify Slack 插件:Scaffolded with Bolt Web UI:…
Agent 智能体 yc-software/qm Stars 12,990 Tom 2026-08-02
drumih/turbo-fieldfare · 上手攻略
TurboFieldfare 是一个用 Swift 6.2 + Metal 4 从零手写的 Gemma 4 26BA4B 推理运行时,专为 Apple Silicon Mac 设计。它的核心目标只有一个:让 8 GB 内存的 M 系列 MacBook Air 也能跑 Gemma 4 26B 大模型。 Gemma 4 26B 是一个 MoE(Mixtureof…
LLM 基础设施 drumih/turbo-fieldfare Stars 5,668 Tom 2026-08-02
Vincentwei1021/video-shotcraft · 上手攻略
videoshotcraft 是一个 AI Agent 技能,专门用于让 Claude Code 或 Codex 变身电影感产品宣传片制作工作室。它提供 104 张镜头配方卡(shot recipe cards)、161 条动态预览、161 种运动风格,以及一套经过实战验证的六阶段制作流水线。底层渲染引擎是 Remotion(用 React/TSX 写视频)…
多模态 Vincentwei1021/video-shotcraft Stars 4,535 Jay 2026-08-01
无需微调:LLM Agent 做机器人"大脑",零训练达 4x SOTA · 干货攻略
FAEA(Frontier Agent as Embodied Agent)是一种无需任何演示数据、无需微调的机器人操控新范式——直接把现成的 LLM Agent SDK(如 Claude Agent SDK)当作机器人的"大脑",让 Agent 自己写代码、调试、再尝试,直到任务成功。 核心思路一句话:机器人策略(π)负责动,LLM Agent 负责想,各…
Agent 智能体 robiemusketeer/faea-sim Jay 2026-07-31
waybarrios/vllm-mlx · 上手攻略
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
多模态 waybarrios/vllm-mlx Stars 1,447 Tom 2026-07-31
roboflow/inference · 上手攻略
版本说明:仓库 README 中没有写死顶层版本号,文档站 inference.roboflow.com/using_inference/about 自称 "Inference 1.0",PyPI 上 inferencesdk 的最新轮转版本为 1.3.x(如 1.3.7)——下面的命令以当前 README 与 PyPI 通用写法为准,不写死小版本号,使用 …
LLM 基础设施 roboflow/inference Stars 2,411 spark 2026-07-30
pykeio/ort · 上手攻略
提示:仓库 README、API 文档链接均指向 ort 2.0 系列,本攻略以当前 main 分支为准(最新示例分支标签为 v2.0.0rc.13,来自仓库 docs 与 examples 中给出的克隆命令)。若你看到更新 rc tag,请以 crates.io 与 docs.rs 的最新版为准。 ort 是 Rust 生态里跑 ONNX 模型的主流 cr…
LLM 基础设施 pykeio/ort Stars 2,443 spark 2026-07-30
openvinotoolkit/openvino_notebooks · 上手攻略
提示:上游仓库标识写作 openvinotoolkit/openvino_notebooks(带下划线),按本攻略规则计算的文件 slug 为 openvinotoolkitopenvinonotebooks.md。下文中如出现"OpenVINO 2026.2"等版本号,均来自仓库当前 README,未在外部二次确认。 openvino_notebooks …
LLM 基础设施 openvinotoolkit/openvino_notebooks Stars 3,195 spark 2026-07-30
Sebastian Raschka LLM Architecture Gallery 七月更新:6 款新开源模型架构解析 · 干货攻略
本攻略核验了 Raschka 原帖中每款模型的核心参数,所有数字均来自对应官方来源(HuggingFace 模型卡、官方博客、技术报告)。原帖描述与官方文档一致处已核对;存在差异处以官方为准并作注。 Sebastian Raschka(@rasbt)于 2026 年 7 月底更新了他维护的 LLM Architecture Gallery,一口气收录了 6 …
Jay 2026-07-29
moonshotai/Kimi-K3 · 上手攻略
Kimi K3 是 Moonshot AI(MiniMax)推出的开源权重多模态 Agent 大模型,总参数量 2.8T(激活 104B),是全球首个开放的 3T 级开源模型。K3 基于两项自研架构:Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes),采用 MoE(MixtureofExperts…
LLM 基础设施 MoonshotAI/Kimi-K3 Stars 8,340 Jay 2026-07-29
openvinotoolkit/open_model_zoo · 上手攻略
Open Model Zoo 是 Intel 维护的预训练深度学习模型仓库,为 OpenVINO™ Toolkit 提供大量已优化模型和演示程序。包含 200+ 模型,覆盖目标检测、图像分类、图像分割、姿态估计、语音识别、文本转语音等主流 CV 任务,并配有可直接运行的 C++ / Python Demo 示例。 模型分为两大类: Intel 预训练模型(m…
LLM 基础设施 openvinotoolkit/open_model_zoo Stars 4,415 Tom 2026-07-29
intentee/paddler · 上手攻略
Paddler 是一款用 Rust 写的开源 LLM/VLM 推理负载均衡与服务平台。架构非常克制:只有两个组件——balancer(对外暴露 OpenAI 兼容推理接口、管理面和 Web 控制台)和 agent(真正跑推理,注册到 balancer 上即可上线)。底层直接用 llama.cpp 推理引擎(fork 版本,Paddler 自己实现了 slot…
多模态 intentee/paddler Stars 1,651 spark 2026-07-28
LingBot-World 2.0:开源交互式世界模型的_hour-long_无漂移生成 · 干货攻略
LingBotWorld 2.0(又称 LingBotWorldInfinity)是蚂蚁集团具身智能团队 Robbyant 于 2026 年 7 月 9 日开源发布的交互式世界模型。它能根据用户输入的动作流(摄像头位姿 + 文本指令)逐帧生成视频,充当实时的可交互世界模拟器。 相比 1.0 版本分钟级稳定生成,2.0 实现了小时级连续输出,同时支持 720p…
Robbyant/lingbot-world-v2 Jay 2026-07-27
pytorch/ao · 上手攻略
torchao(即 pytorch/ao 仓库发布的 PyPI 包名)是 PyTorch 官方主推的 原生量化与稀疏化库,主打「训练推理一致」「一行代码改动即可接入」,覆盖从权重量化(int4/int8/fp8/NF4)、激活量化、2:4 稀疏、低比特 optimizer(4bit/8bit/fp8 AdamW)、量化感知训练(QAT),到 float8 预…
LLM 基础设施 pytorch/ao Stars 2,936 spark 2026-07-27
ABot-World-0:单卡消费级 GPU 无限交互世界推演 · 干货攻略
ABotWorld0 是阿里巴巴 AMAP 计算机视觉实验室(Alibaba AMAP CV Lab)发布的一款动作条件视频世界模型,目标是让单个消费级桌面 GPU 也能实现实时、长时、闭环的交互式世界推演——换句话说,把一块 RTX 5090 变成一个可以无限探索的虚拟世界模拟器。 核心技术规格(全部来自 GitHub README 与 arXiv 摘要)…
amap-cvlab/ABot-World Jay 2026-07-27
img2threejs/img2threejs · 上手攻略
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
多模态 img2threejs/img2threejs Stars 10,708 Tom 2026-07-26
tensorchord/envd · 上手攻略
envd(ɪnˈvdɪ,读作 "invideo")是 TensorChord 开源的一个面向 AI/ML 的容器化开发环境构建工具。它用一个声明式的 build.envd 文件描述你的训练/推理环境,然后用一个 envd up 命令把它打包成 OCI 兼容的镜像,并在本地(或远端 K8s 集群)跑起来。 它不是 Dockerfile 的替代品那种简单封装——…
Agent 智能体 tensorchord/envd Stars 2,219 spark 2026-07-26
hoainho/img2threejs · 上手攻略
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
多模态 hoainho/img2threejs Stars 4,176 Tom 2026-07-25
diegosouzapw/OmniRoute · 上手攻略
OmniRoute 是一个自托管 AI 网关,用单一端点聚合 278+ 提供商(含 90+ 免费层)的 500+ 模型,替开发者省去逐一对接每个 AI 提供商的麻烦。它支持自动 fallback 组合、Token 压缩、多策略路由、MCP 服务器、A2A 代理协议、内存持久化、Guardrails 安全过滤、TLS 指纹伪装等企业级特性,同时提供 Web 界…
Agent 智能体 diegosouzapw/OmniRoute Stars 53,672 Tom 2026-07-23
JimLiu/baoyu-design · 上手攻略
baoyudesign 是一个可移植的 Agent Skill(技能包),它把 Claude 官方网页版 claude.ai/design 的设计引擎完整复刻为本地编辑器内的 AI 工作流。装入 Cursor、Claude Code、Codex 或任何支持 skills 的本地 Agent 后,你用自然语言描述需求,Agent 就会按照 Claude Des…
Agent 智能体 JimLiu/baoyu-design Stars 3,029 Tom 2026-07-23
Inkling · 干货攻略
Inkling 是 Thinking Machines Lab(由前 OpenAI CTO Mira Murati 创办)于 2026 年 7 月 15 日发布的首个从零训练的开源权重混合专家模型。官方定位明确:不是最强通用模型,而是最适合拿来定制(finetuning)的开源基础模型。 核心规格(官方 HuggingFace 模型卡): | 指标 | 数值…
thinkingmachines/Inkling Jay 2026-07-22
raullenchai/Rapid-MLX · 上手攻略
RapidMLX 是目前 Apple Silicon 上速度最快的本地 AI 推理引擎,专为 M 系列芯片优化,基于 Apple MLX 框架重写所有核心 kernel,纯 Metal GPU 加速,无任何 llama.cpp 回退或 Python 桥接层。相比同场景的 Ollama,吞吐量提升约 4.2 倍,首 token 时间(TTFT)可低至 0.08…
LLM 基础设施 raullenchai/Rapid-MLX Stars 3,433 Tom 2026-07-22
ultralytics/yolov5 · 上手攻略
Ultralytics YOLOv5 是 YOLO(You Only Look Once)目标检测算法的第五代官方 PyTorch 实现,由 Ultralytics 公司维护。它在原始 YOLOv4 的基础上完全重写,以「极致简洁」为设计核心,集目标检测、实例分割、图像分类三大任务于一体,并在 v7.0(2022年)引入了实时实例分割模型,成为当时全球最快最…
工程化 ultralytics/yolov5 Stars 57,854 Tom 2026-07-22