Aug 28, 2026

gpt-image-2-skill:把 OpenAI 图像生成包成 prompt 库、Agent 与 CLI

一份 5k 星标的 skill 与 CLI,把 OpenAI 的 gpt-image-2 模型封装进策展过的 prompt 库、多参考图编辑和遮罩 inpainting 流程——可装进 Claude Code、Codex、OpenClaw、Hermes 或任意支持 skill 的 agent 运行时。

#tutorial#claude-code#creative#developer-tools

多数图像生成工作流最后都在重复造同一个 prompt 库、同一个 retry 循环。wuyoscar/gpt-image2-skill 把 OpenAI 的 gpt-image-2 模型打包成策展过的 prompt 库、CLI、以及可以塞进 Claude Code、Codex、OpenClaw、Hermes 的 skill。你描述场景,skill 或 CLI 选一个 prompt 模式、出图、写 PNG。

为什么这个 skill 重要

仓库一次给到三样东西:策展过的 prompt 库,分成约 25 个类别(anime、gaming、typography、research figures、tattoo design 等),本地分片参考图集(gallery.md 索引 + 每类一份 gallery-*.md 文件);一份 prompt 编写清单(craft.md)和一份缓存好的 OpenAI cookbook(openai-cookbook.md);真正的生成层,通过 OPENAI_API_KEY 调 OpenAI 的 /v1/images/generations/v1/images/edits 端点。

支持 agent:Claude Code、Codex、OpenClaw、Hermes Agent,以及任意"skill-capable agent runtime"。CLI 安装走 uvx --from git+...。预算开关包括 --quality--size 别名。退出码有文档:0 成功、1 API / 拒绝、2 参数错误。

值得知道的限制:--input-fidelitygpt-image-2 上不支持,会被 CLI 静默丢弃;Codex 自带的图像 skill 是黑箱,要切换到本地这个 skill 得显式 opt in;生成的科研配图只能当作参考,不能直接当学术资产用。License 是 MIT。

安装

三种安装路径,按环境挑。

Claude Code(README 推荐路径):

/plugin marketplace add wuyoscar/gpt_image_2_skill
/plugin install gpt-image@wuyoscar-skills

任何会跑 CLI 工具的 agent:

uvx --from git+https://github.com/wuyoscar/gpt_image_2_skill gpt-image -p "a cat astronaut"

手动放到 agent 的 skill 目录:

git clone https://github.com/wuyoscar/gpt_image_2_skill.git
export AGENT_SKILLS_DIR="/path/to/your/agent/skills"
ln -s "$PWD/skills/gpt-image" "$AGENT_SKILLS_DIR/gpt-image"

调用前,export 你的 OpenAI key:

export OPENAI_API_KEY=sk-...

README 警告:拿着 OPENAI_API_KEY 的 agent 可能替你意外消耗它。如果你只想让 key 留在 agent 那边,直接用 CLI 前先 unset。

真实工作流:从一句话意图生成一张写实场景图

你想要一张博客头图:写实风格的夜间便利店。没有设计功底,就一行 prompt。

第一步。在终端跑 CLI:

gpt-image -p "a photorealistic convenience store at 10pm" \
  --size 1k --quality high \
  -f store.png

第二步。CLI 调 /v1/images/generations,模型用 gpt-image-2,把 store.png 写到当前目录。预期是 1024×1024 PNG(1k 别名)。

第三步。打开 PNG。如果构图偏了,把 prompt 加上相机方向或光线提示再试一次,比原样重试更有效——仓库里的 prompt 编写清单(craft.md)列出了真正能影响输出的几个杠杆(主体构图、镜头、色板、情绪锚点)。

第四步。如果想要更精细的质量档位,README 文档化了 --quality 取值和 --size 别名。CLI 成功返回 0、API 错误或拒绝返回 1、参数错误返回 2——如果要包一层脚本可以基于这三个码处理。

真实工作流:基于遮罩的参考图 inpainting

你有一张照片,只想把天空换成极光。skill 通过 /v1/images/edits 配合遮罩输入支持多参考图编辑。

第一步。准备一个工作目录,里面有源图(photo.jpg)和一份二值遮罩(sky_mask.png),白色像素标记要替换的区域。遮罩约定遵循 OpenAI image-edits 端点。

第二步。跑:

gpt-image -p "replace sky with aurora" \
  -i photo.jpg \
  -m sky_mask.png \
  -f aurora.png

第三步。CLI 调 /v1/images/edits,把 inpaint 后的图写到 aurora.png。参考图与 prompt 一起约束结果;prompt 只描述遮罩里的区域(这里就是"极光天空"),不要带上照片其他部分。

第四步。验证遮罩被尊重。如果结果飘到遮罩外,紧一紧 prompt 再跑。prompt 编写清单指出,遮罩驱动的编辑,最稳的是 prompt 的空间范围与遮罩区域对齐。

第五步。如果想把 inpainting 串成多步流(先换天空、再换主体颜色、再调色),多次调用 CLI,每次中间产物作为下一步输入。每步 CLI 调用相互独立;skill 本身不打多步 pipeline。

技巧

  • 常规活儿用 --size 别名(1k2k);只有定稿才上 --quality high
  • prompt 一次只加一个杠杆(光线、镜头、色板),比整段重写更容易 A/B。
  • inpaint prompt 限定到遮罩区域内的空间;描述遮罩外的部分会让模型分心。
  • 只想让 key 留在 agent 那边的话,直接跑 CLI 前先 unset OPENAI_API_KEY
  • 生成的科研配图只能当参考,引用前要回到原论文核对。
  • Codex 用户需要显式 opt in 本地这个 skill;自带图像 skill 是黑箱,可能 shadow 掉它。

何时不要用

如果只是想要一次性图,不打算把 skill 装进 agent,OpenAI 的 Web UI 或单条 curl/v1/images/generations 更快。这个 skill 的设置成本要靠"用策展过的 prompt 库、走 inpainting 流程、让编程助手内联出图"之一来摊平。


leaderboard 查看更多创意类 skill。