wuyoscar/GPT-Image2-Skill · 上手攻略
- 仓库:wuyoscar/GPT-Image2-Skill
- 链接:https://github.com/wuyoscar/GPT-Image2-Skill
- 分类:agent-skill · AI-image
- 作者:Jay
- 更新:2026-08-07
这是什么
GPT-Image2-Skill 是一个面向 AI 编程 Agent(Claude Code、Codex、OpenClaw 等)的 GPT Image 2 提示词画廊 + Agent 技能 + CLI 三合一工具。它汇集了大量经过验证的 GPT Image 2 生成提示词,覆盖论文图表、UI 原型、海报、游戏资源、动漫、摄影、字体设计、产品图等二十多个分类,并提供可直接在 Agent 对话中调用的技能文件和独立的命令行工具,让 Agent 能用自然语言生成高质量 AI 图像。
解决的问题: GPT Image 2 能力强大,但好的提示词需要经验积累。这个项目把社区验证过的提示词整理成分类画廊,同时封装成 Agent 技能和 CLI,既节省手工编写提示词的时间,也让 Agent 在编程任务中能自动化调用图像生成能力(如生成论文图、UI 草图、数据可视化等)。
核心组成
| 组成部分 | 说明 |
|---|---|
| Prompt Gallery | 20+ 分类的精选提示词集合,每个提示词附带尺寸、质量参数和来源标注 |
| Agentic Skill | 可安装在 Claude Code / Codex / OpenClaw 等 Agent 运行时,通过自然语言调用 |
| CLI 工具 | gpt-image 命令行工具,不依赖 Agent 即可独立使用 |
| Reference 文档 | 包含 OpenAI 官方 prompt 指南本地副本、craft 检查清单、gallery 路由索引等 |
Gallery 分类(部分):Anime & Manga、Gaming、Retro & Cyberpunk、Cinematic & Animation、Character Design、Typography & Posters、Illustration、Watercolor、Ink & Chinese、Pixel Art、UI/UX Mockups、Research Paper Figures、Product & Food、Photography、Tattoo Design 等。
快速安装
前提检查
command -v gpt-image || true
command -v uv >/dev/null && uv tool list | grep -E '^gpt-image-cli([[:space:]]|$)' || true
test -n "${OPENAI_API_KEY:-}" && echo "OPENAI_API_KEY is already set (value hidden)"
确保 OPENAI_API_KEY 已设置(从进程环境变量、.env 或 ~/.env 按顺序读取)。
Claude Code 插件模式
/plugin marketplace add wuyoscar/gpt_image_2_skill
/plugin install gpt-image@wuyoscar-skills
skills CLI(Claude Code / OpenClaw)
npx --yes skills@latest add wuyoscar/gpt_image_2_skill \
--skill gpt-image --agent codex --copy
# 或 OpenClaw
npx --yes skills@latest add wuyoscar/gpt_image_2_skill \
--skill gpt-image --agent openclaw --copy
手动安装(Agent Skills)
git clone https://github.com/wuyoscar/gpt_image_2_skill.git
cd gpt_image_2_skill
export AGENT_SKILLS_DIR="/path/to/your/agent/skills"
mkdir -p "$AGENT_SKILLS_DIR"
test -e "$AGENT_SKILLS_DIR/gpt-image" && echo "gpt-image skill already exists" && exit 1
ln -s "$PWD/skills/gpt-image" "$AGENT_SKILLS_DIR/gpt-image"
CLI 独立安装
# 方式一:uvx 直接运行(不安装)
uvx --from git+https://github.com/wuyoscar/gpt_image_2_skill gpt-image -p "a cat astronaut"
# 方式二:安装到 PATH
uv tool install git+https://github.com/wuyoscar/gpt_image_2_skill
gpt-image -p "a cat astronaut"
更新
# plugin: Claude Code 内使用 update 流程
# codex skill: 重新运行 installer
# 手动 git clone: cd gpt_image_2_skill && git pull
# CLI: uv tool upgrade gpt-image-cli
核心用法
CLI 基础命令
# 文本 → 图像
gpt-image -p "a photorealistic convenience store at 10pm" \
--size 1k --quality high -f store.png
# 带参考图像的编辑(/v1/images/edits)
gpt-image -p "Make it a winter evening with heavy snowfall" \
-i chess.png --quality high -f chess-winter.png
# 多参考编辑(两个输入图像)
gpt-image -p "Place the dog from image 2 next to the woman in image 1. Match the same lighting, composition, and background. Do not change anything else." \
-i woman.png -i dog.png --size portrait --quality medium -f woman-with-dog.png
# 遮罩局部重绘(mask: opaque=保留, transparent=重绘)
gpt-image -p "replace sky with aurora" \
-i photo.jpg -m sky_mask.png -f aurora.png
完整参数表
| 参数 | 可选值 | 默认值 | 适用 |
|---|---|---|---|
-p, --prompt |
字符串 | 必填 | both |
-f, --file |
路径 | ./fig/YYYY-MM-DD-HH-MM-SS-<slug>.png |
both |
-i, --image |
路径(可重复) | — | edits |
-m, --mask |
PNG 路径 | — | edits |
--size |
1k · 2k · 4k · portrait · landscape · square · wide · tall · 1024x1024 等 |
1024x1024 |
both |
--quality |
auto · low · medium · high |
high |
both |
-n |
整数 | 1 | both |
--background |
auto · opaque |
API 默认 | generations |
--moderation |
auto · low |
low |
generations |
--format |
png · jpeg · webp |
png |
both |
注意:
--input-fidelity参数在gpt-image-2上不被支持,CLI 会自动跳过;该参数仅适用于gpt-image-1/1.5。
Agent 技能调用
安装后,在 Agent 对话中直接用自然语言请求,例如:
生成论文图表:从 skills/gpt-image/references/gallery-research-paper-figures.md
中选择一个适合展示 Transformer 架构的提示词,以 --quality high 输出。
# 或者更直接:
生成 GPT Image 2 风格的 Boston 春季海报(来自 skill gallery 的 typography 分类)
Agent 会自动从附带的 gallery 参考文件中查找匹配的提示词,结合质量参数调用 OpenAI API 生成图像。
OpenAI SDK 用法(Gallery 提示词 → SDK)
from openai import OpenAI
client = OpenAI()
result = client.images.generate(
model="gpt-image-2",
prompt="<从 gallery 选取的 PROMPT>",
size="1024x1536", # portrait 对应 1024x1536
quality="high",
)
质量预算指南
| 场景 | 推荐质量 | 说明 |
|---|---|---|
| 快速探索 / 大批量变体 | low |
便宜,适合风格探路 |
| 常规创作 | medium |
平衡速度与质量 |
| 含图像内文字、密集图表、最终交付物 | high |
细节最丰富 |
生成多个候选时,先用 low 批量探索,确认方向后再用 high 生成最终版本。
典型使用场景
- Agent 编程辅助:在 Claude Code / Codex 中写代码时,用自然语言让 Agent 生成论文示意图、流程图、UI 草图,无需切换到 Midjourney 等独立工具。
- 提示词研究参考:Gallery 中每个提示词都附带生成结果图,可作为 GPT Image 2 能力边界的研究素材。
- 快速原型可视化:用
lowquality 批量生成 UI 布局、图标设计、海报构图的草图,快速验证想法。 - 学术写作插图(注意限制):生成风格参考图或工作流草图,但项目 README 明确提醒不要直接将 AI 生成图用于论文——仅作参考/工作流草图/风格目标。
坑与注意
- API Key 安全:如果不想让 Agent 意外使用你的 OpenAI API Key,在调用 CLI/skill 前运行
unset OPENAI_API_KEY。Codex 用户注意其内置图像生成技能是黑盒,与本 skill 可能冲突或叠加。 - Gallery 精选非海量:项目刻意保持"小而精",不追求收录所有提示词。如果找不到某类场景的示例,可能确实没有收录。
- 多参考编辑注意:多图
-i参数调用的是 OpenAI/v1/images/edits的 multipart form 端点,需确保多图都能被 API 正确接收。 --input-fidelity陷阱:gpt-image-2不支持此参数(该参数仅适用于 1.x 模型),CLI 已做兼容处理,不会报错但也不会生效。- 中文提示词支持:Gallery 中有专门的 Ink & Chinese 分类,但 GPT Image 2 对中文文字的渲染质量(尤其在
mediumquality 下)可能不稳定,建议highquality + 明确文字描述。 - mask 局部重绘限制:mask 文件必须为 PNG,透明区域(alpha=0)= 重绘区域,不透明区域(alpha=255)= 保留区域。
与同类对比
| 方案 | 类型 | 优势 | 不足 |
|---|---|---|---|
| GPT-Image2-Skill | Agent Skill + CLI | 精选提示词 + Agent 集成 + CLI 三合一,针对 Agent 工作流优化 | 依赖 OpenAI API,不支持其他图像生成模型 |
| OpenAI 官方 Cookbook | 文档 | 权威参数说明 | 无 Agent 集成,需手动编写提示词 |
| Midjourney Prompt Book | 社区整理 | 提示词量大 | 非结构化,Agent 无法自动化使用 |
| 纯 API 调用 | 开发者方案 | 完全可控 | 需要自己积累提示词经验 |
一句话推荐
如果你用 Claude Code、Codex 或 OpenClaw 做开发,GPT-Image2-Skill 是让 Agent 具备高质量 AI 图像生成能力的最快路径——Gallery 替你省去写提示词的经验积累,CLI 则让非 Agent 场景也能享受同样的高质量输出。
原始仓库:https://github.com/wuyoscar/GPT-Image2-Skill · 本攻略基于 2026-08-07 公开版本 README 撰写,未 clone 或运行代码。Gallery 提示词数量和分类随项目更新变化,以仓库最新状态为准。