gcminimalzineposter 是一个 Codex(OpenAI 官方 AI 编程助手)技能,专门将任意主题、句子、物件、情绪、文章构想、照片或内容简报,转化为一张安静、极简 ZINE 风格编辑海报的提示词,并直接生成对应的位图图像。 它不是通用的图片生成工具——所有输出都围绕一种独特的美学:竖版 3:5 比例、70%–90% 留白、日式/韩式独立 …
仓库攻略
48 篇 · 48 个项目 · 多模态 · tom
Transformers 是 Hugging Face 维护的 Python 库,提供超过 1M 个预训练模型检查点的统一加载、微调和推理接口。它覆盖文本(NLP)、计算机视觉、音频、视频和多模态五种模态,是目前最广泛使用的开源模型定义框架。 它的核心定位不是"又一个 PyTorch 工具箱",而是模型定义层的事实标准——如果一个模型在 transforme…
xLLM 是京东开源的高性能 LLM/VLM/DiT/REC 推理引擎,托管于 OpenAtom 基金会,核心定位是在多种国产 AI 加速器上实现企业级高吞吐推理。它于 2025 年 10 月发布技术报告(arXiv:2510.14686),已在京东内部支持客服(JingYan AI)、营销推荐、商品理解等多个核心业务日产环境运行。 架构上分为两层:xLLM…
vllmmlx 是一个专为 Apple Silicon(M 系列芯片)打造的推理服务器,核心思路是:把 vLLM 在 CUDA 硬件上的核心优化(连续批处理、页级 KV 缓存、前缀缓存)移植到苹果的 MLX 框架上,通过 Metal 驱动统一内存直接跑模型,无需任何格式转换。 它同时暴露 OpenAI /v1/ 和 Anthropic /v1/message…
img2threejs 是一个代码优先的图像→3D 重建工具。你给它一张参考图,它生成一段 TypeScript 代码,在浏览器里跑出一个 THREE.Group 工厂函数——所有几何体都由原始几何体(BoxGeometry、CylinderGeometry 等)、程序化着色器和生成式几何拼出来,没有 mesh 文件,没有 GLB 下载,产物天然是"代码"而…
img2threejs 是一个代码驱动式图像→3D 重建工具。它接受一张物体参考图,通过 AI Agent(Claude Code / Codex / OpenCode)驱动一个分阶段质量门控流水线,输出一段 TypeScript Three.js 工厂函数,将该物体用几何体 Primitive、程序化材质和自定义几何重建出来——不是生成 mesh 文件,而…
scrollworld 是一个 AI Agent Skill(技能),运行在 Claude Code、Codex 或任何兼容 SKILL.md 的 AI 编程助手内。它能为一任意品牌或行业构建「滚动穿越3D世界」的沉浸式落地页——访客滚动页面时,摄影机从场景外部俯冲进入内部,再无缝飞入下一场景,全称无剪辑,像 Apple's scrollthrough 产品…
内容待复核
BradyFU/Awesome-Multimodal-Large-Language-Models · 上手攻略
这是一份由南京大学 MIG 实验室(NJUMiG)维护的多模态大语言模型(Multimodal Large Language Models,MLLM)前沿论文合集,截至 2026 年 7 月已收录 17.9k+ Stars,是 MLLM 领域最全面、最活跃的社区驱动的学术索引之一。 它不是代码库,而是一个持续更新的知识库,系统整理了 MLLM 各个子方向的论…
htmlvideo 是 Open Design 团队出品的"AI 视频生成 metalayer":你跟本地 coding agent 说一句话(或丢一个链接),它把 HTML/CSS/数据变成真实 MP4 视频,全程在你电脑上渲染,不需要云端、不收单次渲染费。 它不绑定某个特定渲染引擎,而是一套适配器接口,render(input, ctx) 契约,任何后端…
NVIDIA NeMo Speech 是 NVIDIA 推出的专注于语音 AI 的开源框架,支持自动语音识别(ASR)、语音合成(TTS)和语音大模型(Speech LLM)三大方向。它是从原 NVIDIA/NeMo 大一统仓库中拆分出来的独立版本(2026 年 6 月正式发布首个 release),专门面向需要训练和微调语音模型的 연구人员和 PyTorc…
LocalAI 是一个开源的本地 AI 推理引擎,2026 年 7 月 Stars 约 4.7 万,周增约 +126。核心理念是「小核心 + 按需加载后端」:每个后端(llama.cpp、vLLM、whisper.cpp、stablediffusion、MLX 等)都是独立的 OCI 镜像,只在你需要某类模型时才拉取安装。最新稳定版为 v4.3.0(2026…
MediaPipe 是 Google 开源的端侧机器学习框架,专注于在手机(Android/iOS)、Web、桌面、边缘设备和 IoT 上实时运行 ML 模型。它不是训练框架,而是推理框架——帮你把 Google 训练好的模型快速部署到各类设备上,以低延迟处理图像、视频、音频和文本。 Google 于 2023 年将 MediaPipe 主开发文档迁移至 d…
guizangsocialcardskill 是一个面向 Claude Code / Codex 等 AI Agent 的图文卡片生成技能(Skill),专门用于从文章、截图、产品笔记、照片或视频素材,自动生成小红书 / Rednote 图文组图、Live Photo 动态卡片,以及公众号 21:9 + 1:1 封面对。 它的核心设计哲学是:把"做一张好看的…
PaperSpine 是一个以"贡献为先、面向审稿人"为核心理念的学术写作系统,支持 Claude Code、Codex、OpenClaw 和 Hermes CLI 四个 AI Agent 宿主。它将学术论文写作拆解为 12 个有序阶段,每阶段有强制关卡(gate),不允许跳步,必须逐关通过才能进入下一阶段。 V4(当前版本 4.0.0)是重大升级:原本 1…
pxpipe 是一个本地请求代理,专门用来降低 Claude Code(以及其他基于 Anthropic API 的 Agent)的 token 消耗。它通过将大量文本内容(系统提示词、工具文档、历史记录)渲染为图片,再通过视觉通道传输,从而大幅压缩输入 token 数量。 核心逻辑:一张图片的 token 成本由像素尺寸决定,而不是内容长度。实测 dens…
UnlimitedOCR 是百度开源的多模态文档解析模型,定位是「一键长文档解析」——单张图片、PDF 多页、整本手册均可一次性处理,输出结构化文本。发布于 2026 年 6 月,arXiv 论文编号 2606.23050。 官方将其定位为对 DeepSeekOCR 的进一步推进,核心能力: 传统 OCR + NLP 管道有三个常见痛点: 1. 多步骤串联:…
Open Generative AI(简称 OGA)是一个免费的、开源的 AI 图像与视频生成桌面应用,内置 200+ 模型(Flux、Midjourney、Kling、Sora、Veo、Seedance 2.5 等),无内容过滤器、无审查,MIT 协议可自托管,本质上是 MuAPI.ai 的前端桌面封装。 核心定位:绕过商业 AI 视频平台的内容限制,让用…
RuView 是一个基于 WiFi CSI(信道状态信息) 的空间智能感知系统——利用普通路由器发出的无线信号,经墙壁反射后的人体扰动来检测:有人在与否、呼吸频率、心率、跌倒、活动姿态、房间占用情况。全程不需要任何摄像头、麦克风或可穿戴设备。 核心技术:用 ESP32 板子 + Cognitum Seed(边缘 AI 协处理器)读取 WiFi CSI 数据,…