gpt-image-2

gpt-image-2

完整的 OpenAI 兼容 GPT Image 2 覆盖,涵盖 images/generations、images/edits 以及使用 image_generation 工具的 responses。当一次性图像助手不够用时使用——文本转图像、蒙版编辑、多图像批次、流式传输、partial_images 以及混合文本+图像的 Responses 流程。读取 .env 并尊重进程环境变量;可与任何 OpenAI 兼容网关配合使用。

2Star
0Fork
更新于 2026/6/23
SKILL.md
只读
名称
gpt-image-2
描述

完整的 OpenAI 兼容 GPT Image 2 覆盖,涵盖 images/generations、images/edits 以及使用 image_generation 工具的 responses。当一次性图像助手不够用时使用——文本转图像、蒙版编辑、多图像批次、流式传输、partial_images 以及混合文本+图像的 Responses 流程。读取 .env 并尊重进程环境变量;可与任何 OpenAI 兼容网关配合使用。

GPT Image 2

一个单一的 Python 入口点,覆盖所有 GPT Image 2 路由,并对模型的尺寸、宽高比和功能约束进行严格的预检验证。

工作流程

  1. 打开 references/config.md 选择环境变量和默认值。
  2. 打开 references/api-surface.mdgenerationseditsresponses 之间选择。
  3. 除非用户要求不同的 OpenAI 兼容端点,否则优先使用 OPENAI_BASE_URL=https://api.openai.com/v1
  4. 对于 generationsedits 使用 gpt-image-2;对于 responses 使用支持文本的 Responses 模型,例如 gpt-5.4
  5. 使用三个子命令之一运行 scripts/gpt_image.py
  6. 当负载形状是主要风险时,首先添加 --dry-run
  7. 当需要保留原始 JSON 主体或 SSE 事件流用于调试时,添加 --save-response <path>

命令

通过公共 Images API 进行文本转图像:

python .\skills\gpt-image-2\scripts\gpt_image.py generations `
  --prompt "一个用于开发者工具主页的大胆产品主图" `
  --output .\out\hero.png `
  --size 1536x1024 `
  --quality high `
  --format png

使用文件名模式的多图像批次:

python .\skills\gpt-image-2\scripts\gpt_image.py generations `
  --prompt "夜晚的电影般城市天际线" `
  --output .\out\skyline-{index}.webp `
  --n 3 `
  --format webp `
  --compression 90

带两个输入和蒙版的图像编辑:

python .\skills\gpt-image-2\scripts\gpt_image.py edits `
  --prompt "将两个参考图融合成一个干净的市场营销插图" `
  --image .\refs\subject.png `
  --image .\refs\background.png `
  --mask .\refs\mask.png `
  --output .\out\edit-{index}.png `
  --image-field-style brackets `
  --n 2

带流式传输和部分预览的 Responses API:

python .\skills\gpt-image-2\scripts\gpt_image.py responses `
  --input-text "为 AI 开发者峰会生成一张海报" `
  --model gpt-5.4 `
  --output .\out\poster-{index}.png `
  --stream `
  --partial-images 2 `
  --save-response .\out\poster-events.json

带本地图像和蒙版的 Responses API 编辑:

python .\skills\gpt-image-2\scripts\gpt_image.py responses `
  --input-text "将这张产品照片变成一张干净的演播室广告" `
  --model gpt-5.4 `
  --input-image .\refs\product.png `
  --mask .\refs\mask.png `
  --output .\out\studio.png `
  --action edit

检查构建的请求而不发送:

python .\skills\gpt-image-2\scripts\gpt_image.py generations `
  --prompt "一张极简封面图像" `
  --output .\out\cover.png `
  --dry-run

规则

  • 对于公共文本转图像调用,使用 generations
  • 对于多部分图像编辑和蒙版上传,使用 edits
  • 对于高级流程使用 responses:流式传输、混合文本+图像输入、previous_response_idtool_choiceaction 和可选的 tool_model
  • 进程环境变量覆盖 .env;CLI 标志覆盖两者。
  • 绝不打印机密。
  • --output 接受单个路径或模式,例如多图像或流式传输流程中的 image-{index}.png
  • responses 使用与图像模型分开的顶级 Responses 模型;默认设为 gpt-5.4,除非你需要其他支持文本的模型。
  • Responses 工具流程中的 quality 会被传递,但最终行为仍取决于托管的图像工具。
  • 在 OpenAI GPT 图像模型上,省略 response_format;图像数据已经以 base64 形式返回。
  • 对于不支持的 gpt-image-2 组合快速失败:透明背景、无效尺寸、partial_images 超出 0..3 范围,或在公共 Images 路由上同时使用 stream=truen>1

资源