SKILL.md
只读
名称
gpt-image-2
描述
完整的 OpenAI 兼容 GPT Image 2 覆盖,涵盖 images/generations、images/edits 以及使用 image_generation 工具的 responses。当一次性图像助手不够用时使用——文本转图像、蒙版编辑、多图像批次、流式传输、partial_images 以及混合文本+图像的 Responses 流程。读取 .env 并尊重进程环境变量;可与任何 OpenAI 兼容网关配合使用。
GPT Image 2
一个单一的 Python 入口点,覆盖所有 GPT Image 2 路由,并对模型的尺寸、宽高比和功能约束进行严格的预检验证。
工作流程
- 打开 references/config.md 选择环境变量和默认值。
- 打开 references/api-surface.md 在
generations、edits和responses之间选择。 - 除非用户要求不同的 OpenAI 兼容端点,否则优先使用
OPENAI_BASE_URL=https://api.openai.com/v1。 - 对于
generations和edits使用gpt-image-2;对于responses使用支持文本的 Responses 模型,例如gpt-5.4。 - 使用三个子命令之一运行
scripts/gpt_image.py。 - 当负载形状是主要风险时,首先添加
--dry-run。 - 当需要保留原始 JSON 主体或 SSE 事件流用于调试时,添加
--save-response <path>。
命令
通过公共 Images API 进行文本转图像:
python .\skills\gpt-image-2\scripts\gpt_image.py generations `
--prompt "一个用于开发者工具主页的大胆产品主图" `
--output .\out\hero.png `
--size 1536x1024 `
--quality high `
--format png
使用文件名模式的多图像批次:
python .\skills\gpt-image-2\scripts\gpt_image.py generations `
--prompt "夜晚的电影般城市天际线" `
--output .\out\skyline-{index}.webp `
--n 3 `
--format webp `
--compression 90
带两个输入和蒙版的图像编辑:
python .\skills\gpt-image-2\scripts\gpt_image.py edits `
--prompt "将两个参考图融合成一个干净的市场营销插图" `
--image .\refs\subject.png `
--image .\refs\background.png `
--mask .\refs\mask.png `
--output .\out\edit-{index}.png `
--image-field-style brackets `
--n 2
带流式传输和部分预览的 Responses API:
python .\skills\gpt-image-2\scripts\gpt_image.py responses `
--input-text "为 AI 开发者峰会生成一张海报" `
--model gpt-5.4 `
--output .\out\poster-{index}.png `
--stream `
--partial-images 2 `
--save-response .\out\poster-events.json
带本地图像和蒙版的 Responses API 编辑:
python .\skills\gpt-image-2\scripts\gpt_image.py responses `
--input-text "将这张产品照片变成一张干净的演播室广告" `
--model gpt-5.4 `
--input-image .\refs\product.png `
--mask .\refs\mask.png `
--output .\out\studio.png `
--action edit
检查构建的请求而不发送:
python .\skills\gpt-image-2\scripts\gpt_image.py generations `
--prompt "一张极简封面图像" `
--output .\out\cover.png `
--dry-run
规则
- 对于公共文本转图像调用,使用
generations。 - 对于多部分图像编辑和蒙版上传,使用
edits。 - 对于高级流程使用
responses:流式传输、混合文本+图像输入、previous_response_id、tool_choice、action和可选的tool_model。 - 进程环境变量覆盖
.env;CLI 标志覆盖两者。 - 绝不打印机密。
--output接受单个路径或模式,例如多图像或流式传输流程中的image-{index}.png。responses使用与图像模型分开的顶级 Responses 模型;默认设为gpt-5.4,除非你需要其他支持文本的模型。- Responses 工具流程中的
quality会被传递,但最终行为仍取决于托管的图像工具。 - 在 OpenAI GPT 图像模型上,省略
response_format;图像数据已经以 base64 形式返回。 - 对于不支持的
gpt-image-2组合快速失败:透明背景、无效尺寸、partial_images超出0..3范围,或在公共 Images 路由上同时使用stream=true和n>1。
资源
- 脚本:scripts/gpt_image.py
- 配置参考:references/config.md
- API 表面参考:references/api-surface.md




