Aug 28, 2026
gpt-image-2-skill:把 OpenAI 图像生成包成 prompt 库、Agent 与 CLI
一份 5k 星标的 skill 与 CLI,把 OpenAI 的 gpt-image-2 模型封装进策展过的 prompt 库、多参考图编辑和遮罩 inpainting 流程——可装进 Claude Code、Codex、OpenClaw、Hermes 或任意支持 skill 的 agent 运行时。
多数图像生成工作流最后都在重复造同一个 prompt 库、同一个 retry 循环。wuyoscar/gpt-image2-skill 把 OpenAI 的 gpt-image-2 模型打包成策展过的 prompt 库、CLI、以及可以塞进 Claude Code、Codex、OpenClaw、Hermes 的 skill。你描述场景,skill 或 CLI 选一个 prompt 模式、出图、写 PNG。
为什么这个 skill 重要
仓库一次给到三样东西:策展过的 prompt 库,分成约 25 个类别(anime、gaming、typography、research figures、tattoo design 等),本地分片参考图集(gallery.md 索引 + 每类一份 gallery-*.md 文件);一份 prompt 编写清单(craft.md)和一份缓存好的 OpenAI cookbook(openai-cookbook.md);真正的生成层,通过 OPENAI_API_KEY 调 OpenAI 的 /v1/images/generations 和 /v1/images/edits 端点。
支持 agent:Claude Code、Codex、OpenClaw、Hermes Agent,以及任意"skill-capable agent runtime"。CLI 安装走 uvx --from git+...。预算开关包括 --quality 与 --size 别名。退出码有文档:0 成功、1 API / 拒绝、2 参数错误。
值得知道的限制:--input-fidelity 在 gpt-image-2 上不支持,会被 CLI 静默丢弃;Codex 自带的图像 skill 是黑箱,要切换到本地这个 skill 得显式 opt in;生成的科研配图只能当作参考,不能直接当学术资产用。License 是 MIT。
安装
三种安装路径,按环境挑。
Claude Code(README 推荐路径):
/plugin marketplace add wuyoscar/gpt_image_2_skill
/plugin install gpt-image@wuyoscar-skills
任何会跑 CLI 工具的 agent:
uvx --from git+https://github.com/wuyoscar/gpt_image_2_skill gpt-image -p "a cat astronaut"
手动放到 agent 的 skill 目录:
git clone https://github.com/wuyoscar/gpt_image_2_skill.git
export AGENT_SKILLS_DIR="/path/to/your/agent/skills"
ln -s "$PWD/skills/gpt-image" "$AGENT_SKILLS_DIR/gpt-image"
调用前,export 你的 OpenAI key:
export OPENAI_API_KEY=sk-...
README 警告:拿着 OPENAI_API_KEY 的 agent 可能替你意外消耗它。如果你只想让 key 留在 agent 那边,直接用 CLI 前先 unset。
真实工作流:从一句话意图生成一张写实场景图
你想要一张博客头图:写实风格的夜间便利店。没有设计功底,就一行 prompt。
第一步。在终端跑 CLI:
gpt-image -p "a photorealistic convenience store at 10pm" \
--size 1k --quality high \
-f store.png
第二步。CLI 调 /v1/images/generations,模型用 gpt-image-2,把 store.png 写到当前目录。预期是 1024×1024 PNG(1k 别名)。
第三步。打开 PNG。如果构图偏了,把 prompt 加上相机方向或光线提示再试一次,比原样重试更有效——仓库里的 prompt 编写清单(craft.md)列出了真正能影响输出的几个杠杆(主体构图、镜头、色板、情绪锚点)。
第四步。如果想要更精细的质量档位,README 文档化了 --quality 取值和 --size 别名。CLI 成功返回 0、API 错误或拒绝返回 1、参数错误返回 2——如果要包一层脚本可以基于这三个码处理。
真实工作流:基于遮罩的参考图 inpainting
你有一张照片,只想把天空换成极光。skill 通过 /v1/images/edits 配合遮罩输入支持多参考图编辑。
第一步。准备一个工作目录,里面有源图(photo.jpg)和一份二值遮罩(sky_mask.png),白色像素标记要替换的区域。遮罩约定遵循 OpenAI image-edits 端点。
第二步。跑:
gpt-image -p "replace sky with aurora" \
-i photo.jpg \
-m sky_mask.png \
-f aurora.png
第三步。CLI 调 /v1/images/edits,把 inpaint 后的图写到 aurora.png。参考图与 prompt 一起约束结果;prompt 只描述遮罩里的区域(这里就是"极光天空"),不要带上照片其他部分。
第四步。验证遮罩被尊重。如果结果飘到遮罩外,紧一紧 prompt 再跑。prompt 编写清单指出,遮罩驱动的编辑,最稳的是 prompt 的空间范围与遮罩区域对齐。
第五步。如果想把 inpainting 串成多步流(先换天空、再换主体颜色、再调色),多次调用 CLI,每次中间产物作为下一步输入。每步 CLI 调用相互独立;skill 本身不打多步 pipeline。
技巧
- 常规活儿用
--size别名(1k、2k);只有定稿才上--quality high。 - prompt 一次只加一个杠杆(光线、镜头、色板),比整段重写更容易 A/B。
- inpaint prompt 限定到遮罩区域内的空间;描述遮罩外的部分会让模型分心。
- 只想让 key 留在 agent 那边的话,直接跑 CLI 前先 unset
OPENAI_API_KEY。 - 生成的科研配图只能当参考,引用前要回到原论文核对。
- Codex 用户需要显式 opt in 本地这个 skill;自带图像 skill 是黑箱,可能 shadow 掉它。
何时不要用
如果只是想要一次性图,不打算把 skill 装进 agent,OpenAI 的 Web UI 或单条 curl 调 /v1/images/generations 更快。这个 skill 的设置成本要靠"用策展过的 prompt 库、走 inpainting 流程、让编程助手内联出图"之一来摊平。
在 leaderboard 查看更多创意类 skill。