wuyoscar/GPT-Image2-Skill · 上手攻略

  • 仓库:wuyoscar/GPT-Image2-Skill
  • 链接:https://github.com/wuyoscar/GPT-Image2-Skill
  • 分类:agent-skill · AI-image
  • 作者:Jay
  • 更新:2026-08-07

这是什么

GPT-Image2-Skill 是一个面向 AI 编程 Agent(Claude Code、Codex、OpenClaw 等)的 GPT Image 2 提示词画廊 + Agent 技能 + CLI 三合一工具。它汇集了大量经过验证的 GPT Image 2 生成提示词,覆盖论文图表、UI 原型、海报、游戏资源、动漫、摄影、字体设计、产品图等二十多个分类,并提供可直接在 Agent 对话中调用的技能文件和独立的命令行工具,让 Agent 能用自然语言生成高质量 AI 图像。

解决的问题: GPT Image 2 能力强大,但好的提示词需要经验积累。这个项目把社区验证过的提示词整理成分类画廊,同时封装成 Agent 技能和 CLI,既节省手工编写提示词的时间,也让 Agent 在编程任务中能自动化调用图像生成能力(如生成论文图、UI 草图、数据可视化等)。

核心组成

组成部分 说明
Prompt Gallery 20+ 分类的精选提示词集合,每个提示词附带尺寸、质量参数和来源标注
Agentic Skill 可安装在 Claude Code / Codex / OpenClaw 等 Agent 运行时,通过自然语言调用
CLI 工具 gpt-image 命令行工具,不依赖 Agent 即可独立使用
Reference 文档 包含 OpenAI 官方 prompt 指南本地副本、craft 检查清单、gallery 路由索引等

Gallery 分类(部分):Anime & Manga、Gaming、Retro & Cyberpunk、Cinematic & Animation、Character Design、Typography & Posters、Illustration、Watercolor、Ink & Chinese、Pixel Art、UI/UX Mockups、Research Paper Figures、Product & Food、Photography、Tattoo Design 等。

快速安装

前提检查

command -v gpt-image || true
command -v uv >/dev/null && uv tool list | grep -E '^gpt-image-cli([[:space:]]|$)' || true
test -n "${OPENAI_API_KEY:-}" && echo "OPENAI_API_KEY is already set (value hidden)"

确保 OPENAI_API_KEY 已设置(从进程环境变量、.env~/.env 按顺序读取)。

Claude Code 插件模式

/plugin marketplace add wuyoscar/gpt_image_2_skill
/plugin install gpt-image@wuyoscar-skills

skills CLI(Claude Code / OpenClaw)

npx --yes skills@latest add wuyoscar/gpt_image_2_skill \
  --skill gpt-image --agent codex --copy
# 或 OpenClaw
npx --yes skills@latest add wuyoscar/gpt_image_2_skill \
  --skill gpt-image --agent openclaw --copy

手动安装(Agent Skills)

git clone https://github.com/wuyoscar/gpt_image_2_skill.git
cd gpt_image_2_skill

export AGENT_SKILLS_DIR="/path/to/your/agent/skills"
mkdir -p "$AGENT_SKILLS_DIR"
test -e "$AGENT_SKILLS_DIR/gpt-image" && echo "gpt-image skill already exists" && exit 1
ln -s "$PWD/skills/gpt-image" "$AGENT_SKILLS_DIR/gpt-image"

CLI 独立安装

# 方式一:uvx 直接运行(不安装)
uvx --from git+https://github.com/wuyoscar/gpt_image_2_skill gpt-image -p "a cat astronaut"

# 方式二:安装到 PATH
uv tool install git+https://github.com/wuyoscar/gpt_image_2_skill
gpt-image -p "a cat astronaut"

更新

# plugin: Claude Code 内使用 update 流程
# codex skill: 重新运行 installer
# 手动 git clone: cd gpt_image_2_skill && git pull
# CLI: uv tool upgrade gpt-image-cli

核心用法

CLI 基础命令

# 文本 → 图像
gpt-image -p "a photorealistic convenience store at 10pm" \
  --size 1k --quality high -f store.png

# 带参考图像的编辑(/v1/images/edits)
gpt-image -p "Make it a winter evening with heavy snowfall" \
  -i chess.png --quality high -f chess-winter.png

# 多参考编辑(两个输入图像)
gpt-image -p "Place the dog from image 2 next to the woman in image 1. Match the same lighting, composition, and background. Do not change anything else." \
  -i woman.png -i dog.png --size portrait --quality medium -f woman-with-dog.png

# 遮罩局部重绘(mask: opaque=保留, transparent=重绘)
gpt-image -p "replace sky with aurora" \
  -i photo.jpg -m sky_mask.png -f aurora.png

完整参数表

参数 可选值 默认值 适用
-p, --prompt 字符串 必填 both
-f, --file 路径 ./fig/YYYY-MM-DD-HH-MM-SS-<slug>.png both
-i, --image 路径(可重复) edits
-m, --mask PNG 路径 edits
--size 1k · 2k · 4k · portrait · landscape · square · wide · tall · 1024x1024 1024x1024 both
--quality auto · low · medium · high high both
-n 整数 1 both
--background auto · opaque API 默认 generations
--moderation auto · low low generations
--format png · jpeg · webp png both

注意: --input-fidelity 参数在 gpt-image-2 上不被支持,CLI 会自动跳过;该参数仅适用于 gpt-image-1/1.5

Agent 技能调用

安装后,在 Agent 对话中直接用自然语言请求,例如:

生成论文图表:从 skills/gpt-image/references/gallery-research-paper-figures.md 
中选择一个适合展示 Transformer 架构的提示词,以 --quality high 输出。

# 或者更直接:
生成 GPT Image 2 风格的 Boston 春季海报(来自 skill gallery 的 typography 分类)

Agent 会自动从附带的 gallery 参考文件中查找匹配的提示词,结合质量参数调用 OpenAI API 生成图像。

from openai import OpenAI
client = OpenAI()

result = client.images.generate(
    model="gpt-image-2",
    prompt="<从 gallery 选取的 PROMPT>",
    size="1024x1536",   # portrait 对应 1024x1536
    quality="high",
)

质量预算指南

场景 推荐质量 说明
快速探索 / 大批量变体 low 便宜,适合风格探路
常规创作 medium 平衡速度与质量
含图像内文字、密集图表、最终交付物 high 细节最丰富

生成多个候选时,先用 low 批量探索,确认方向后再用 high 生成最终版本。

典型使用场景

  1. Agent 编程辅助:在 Claude Code / Codex 中写代码时,用自然语言让 Agent 生成论文示意图、流程图、UI 草图,无需切换到 Midjourney 等独立工具。
  2. 提示词研究参考:Gallery 中每个提示词都附带生成结果图,可作为 GPT Image 2 能力边界的研究素材。
  3. 快速原型可视化:用 low quality 批量生成 UI 布局、图标设计、海报构图的草图,快速验证想法。
  4. 学术写作插图(注意限制):生成风格参考图或工作流草图,但项目 README 明确提醒不要直接将 AI 生成图用于论文——仅作参考/工作流草图/风格目标。

坑与注意

  1. API Key 安全:如果不想让 Agent 意外使用你的 OpenAI API Key,在调用 CLI/skill 前运行 unset OPENAI_API_KEY。Codex 用户注意其内置图像生成技能是黑盒,与本 skill 可能冲突或叠加。
  2. Gallery 精选非海量:项目刻意保持"小而精",不追求收录所有提示词。如果找不到某类场景的示例,可能确实没有收录。
  3. 多参考编辑注意:多图 -i 参数调用的是 OpenAI /v1/images/edits 的 multipart form 端点,需确保多图都能被 API 正确接收。
  4. --input-fidelity 陷阱gpt-image-2 不支持此参数(该参数仅适用于 1.x 模型),CLI 已做兼容处理,不会报错但也不会生效。
  5. 中文提示词支持:Gallery 中有专门的 Ink & Chinese 分类,但 GPT Image 2 对中文文字的渲染质量(尤其在 medium quality 下)可能不稳定,建议 high quality + 明确文字描述。
  6. mask 局部重绘限制:mask 文件必须为 PNG,透明区域(alpha=0)= 重绘区域,不透明区域(alpha=255)= 保留区域。

与同类对比

方案 类型 优势 不足
GPT-Image2-Skill Agent Skill + CLI 精选提示词 + Agent 集成 + CLI 三合一,针对 Agent 工作流优化 依赖 OpenAI API,不支持其他图像生成模型
OpenAI 官方 Cookbook 文档 权威参数说明 无 Agent 集成,需手动编写提示词
Midjourney Prompt Book 社区整理 提示词量大 非结构化,Agent 无法自动化使用
纯 API 调用 开发者方案 完全可控 需要自己积累提示词经验

一句话推荐

如果你用 Claude Code、Codex 或 OpenClaw 做开发,GPT-Image2-Skill 是让 Agent 具备高质量 AI 图像生成能力的最快路径——Gallery 替你省去写提示词的经验积累,CLI 则让非 Agent 场景也能享受同样的高质量输出。


原始仓库:https://github.com/wuyoscar/GPT-Image2-Skill · 本攻略基于 2026-08-07 公开版本 README 撰写,未 clone 或运行代码。Gallery 提示词数量和分类随项目更新变化,以仓库最新状态为准。