GPT Image 2 Official
OpenAI 官方线路的 gpt-image-2-official 文生图、图生图与局部重绘接口
一分钟版本
gpt-image-2-official 走 OpenAI 官方线路,文生图、图生图、局部重绘同一个接口,1K / 2K / 4K 三档分辨率、15 种比例、单次最多 4 张、最多 16 张参考图。
它和 GPT Image 系列其他版本最大的区别在计费:那些按成功图片张数收费,gpt-image-2-official 按 token 收费。同一句提示词,1K 低质量约 200 个输出 token,4K 高质量约 13000 个,两者价差近 70 倍。选档位前先看下面的费用。
请求
POST /v1/images/generations
| 参数 | 类型 | 默认 | 说明 |
|---|---|---|---|
model | string | — | 固定 gpt-image-2-official |
prompt | string | — | 必填,支持中英文 |
n | integer | 1 | 1-4,纯数字不加引号 |
size | string | 1:1 | auto、15 种比例之一,或 <宽>x<高> 像素串 |
resolution | string | 1k | 1k / 2k / 4k |
quality | string | auto | auto / low / medium / high,auto 接近 low |
background | string | auto | auto / opaque / transparent |
output_format | string | png | png / jpeg / webp |
output_compression | integer | — | 0-100,仅对 jpeg、webp 生效 |
moderation | string | auto | auto / low |
image_urls | string[] | — | 参考图,最多 16 张,单张不超过 20MB、合计不超过 256MB,须公网可直接访问 |
mask_url | string | — | 局部重绘遮罩,必须与 image_urls 一起用 |
nsfw_check | boolean | false | 提交前对提示词和参考图做一次内容审核,会增加一点延迟 |
参数细则
prompt:中英文都可以,描述越具体结果越稳。为空或只有空白字符会返回 400,不会产生任何费用。n:1 到 4。每张图各自消耗输出 token,n=4的费用就是单张的四倍。必须写纯数字4;写成字符串"4"会被当作没传,静默按 1 张出图。size:三种写法。auto由服务端按提示词和参考图挑比例,挑不出时用1:1;下表 15 种比例之一;或直接给1881x836这样的像素串(原样转给上游,最终尺寸以返回图片为准)。其他值返回 400。resolution:1k以 1024 为基准、2k以 2048、4k以 3840。三档都支持全部 15 种比例。quality:auto实际接近low。档位同时决定画质和费用——4k+high单张约 13000 输出 token,是1k+low的近 70 倍。background:transparent时输出带 Alpha 通道,且output_format只能是png或webp,配jpeg返回 400。opaque强制不透明,auto由模型判断。output_format:png保真且支持透明,jpeg文件最小但没有 Alpha 通道,webp兼顾体积和透明。output_compression:0 到 100,数值越小压得越狠、文件越小。只对jpeg和webp生效,传给png无效果。超出范围返回 400。moderation:low比默认的auto宽松。这是模型侧的生成审核强度,和nsfw_check是两回事。image_urls:最多 16 张,单张 20MB、合计 256MB 以内。必须是公网能直接下载的稳定地址——带签名有效期的临时链接过期后会导致任务失败。超过 16 张返回 400。mask_url:局部重绘用,白色(不透明)区域保留、透明区域重绘。遮罩图必须带 Alpha 通道,且尺寸与第一张参考图完全一致,否则上游拒单。单独传mask_url而不传image_urls会返回 400。nsfw_check:置true时先用审核模型过一遍提示词和参考图,命中违规直接拒绝。默认false,不发这次审核请求,省一点延迟和成本。
以下情况平台本地就会返回 400,不会提交上游、不产生费用:提示词为空、n 越界、resolution 或 quality 不在枚举内、size 既不是合法比例也不是像素串、参考图超过 16 张、mask_url 缺少 image_urls、透明背景配 jpeg、output_compression 越界、moderation 取值非法。本模型只在 /v1/images/generations 上提供,走 /v1/images/edits 会被拒。
比例与实际像素
size | 1k | 2k | 4k |
|---|---|---|---|
1:1 / auto | 1024x1024 | 2048x2048 | 2880x2880 |
3:2 | 1536x1024 | 2048x1360 | 3520x2336 |
2:3 | 1024x1536 | 1360x2048 | 2336x3520 |
4:3 | 1024x768 | 2048x1536 | 3312x2480 |
3:4 | 768x1024 | 1536x2048 | 2480x3312 |
5:4 | 1280x1024 | 2560x2048 | 3216x2576 |
4:5 | 1024x1280 | 2048x2560 | 2576x3216 |
16:9 | 1536x864 | 2048x1152 | 3840x2160 |
9:16 | 864x1536 | 1152x2048 | 2160x3840 |
2:1 | 2048x1024 | 2688x1344 | 3840x1920 |
1:2 | 1024x2048 | 1344x2688 | 1920x3840 |
3:1 | 1536x512 | 3072x1024 | 3840x1280 |
1:3 | 512x1536 | 1024x3072 | 1280x3840 |
21:9 | 2016x864 | 2688x1152 | 3840x1648 |
9:21 | 864x2016 | 1152x2688 | 1648x3840 |
部分档位会按 16 的倍数和像素上限做近似映射,客户端应以返回图片的真实尺寸为准。
文生图
curl https://api.vibelab.me/v1/images/generations \
-H "Authorization: Bearer $LOOPTOKEN_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2-official",
"prompt": "星空下的古老城堡",
"size": "16:9",
"resolution": "2k",
"quality": "high",
"n": 1
}'响应是同步的 OpenAI Images 格式:
{
"created": 1788012156,
"data": [{ "url": "https://cdn.example.com/image.png" }]
}4K 加 quality=high 单张耗时通常超过 100 秒,请把客户端超时设到 5 分钟以上。
透明背景贴纸
curl https://api.vibelab.me/v1/images/generations \
-H "Authorization: Bearer $LOOPTOKEN_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2-official",
"prompt": "橘猫贴纸,全身,粗白描边,扁平矢量风格,完全透明背景",
"size": "1:1",
"resolution": "1k",
"quality": "medium",
"background": "transparent",
"output_format": "png"
}'图生图与局部重绘
参考图放 image_urls,加 mask_url 就变成局部重绘,只改遮罩覆盖的区域。
curl https://api.vibelab.me/v1/images/generations \
-H "Authorization: Bearer $LOOPTOKEN_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-image-2-official",
"prompt": "把背景换成沙漠日落",
"size": "1:1",
"quality": "medium",
"image_urls": ["https://your-cdn.com/photo.png"],
"mask_url": "https://your-cdn.com/mask.png"
}'费用
费用按三类 token 分别计价,单价见模型列表:
- 文本输入:提示词,通常只有几十个 token,可忽略。
- 图片输入:每张参考图约 1000 个 token(随图片尺寸增加)。它比文本输入贵,因此按 1.6 倍折算成文本输入当量后再按输入单价结算。
- 图片输出:主要成本。实测单张 1K/
low约 196 个、2K/medium约 1413 个、4K/high约 13342 个。
一次调用扣多少,等于三项相加。提交时的冻结额度按所选档位的上限估算,出图后按实际 token 重新结算并退还差额,所以下单瞬间看到的冻结金额通常高于最终扣费。
n 大于 1 时,输出 token 随张数成倍增长;请求失败不产生图片输出费用。