指南Tosea Team12 分钟阅读

GPT Image 2.5 使用指南:Sunburst 与 Flare 实测完全手册

OpenAI 于 2026 年 9 月 8 日发布 GPT Image 2.5。我们用生产口径实测了 sunburst 与 flare:延迟、token、成本,以及那个悄悄下移了两级的画质阶梯。

GPT Image 2.5 使用指南:Sunburst 与 Flare 实测完全手册

2026 年 9 月 8 日,OpenAI 发布了 ChatGPT Images 2.5,同时在 Images API 上线了两个新模型:gpt-image-2.5-flaregpt-image-2.5-sunburst。此前三周,社区一直在争论下一代图像模型究竟叫 GPT Image 2.5 还是 GPT Image 3——我们为此专门做过一份证据追踪。答案是两边都不完全对:产品名是 ChatGPT Images 2.5,而 API 上是两个带后缀的模型 ID,不是一个旗舰。如果你直接调用不带后缀的 gpt-image-2.5,API 会返回 The model 'gpt-image-2.5' does not exist.gpt-image-3 同理。

我们手上还留着今年 4 月 GPT Image 2 发布时写的基准脚本,所以在公告发出几小时内就把它指向了这两个新模型 ID,通过官方 API 跑了 41 次图像生成。这篇指南就是跑出来的结果:OpenAI 到底发了什么、这两个模型的真实成本与耗时,以及一个只换模型字符串就会悄悄改变你账单和出图质量的迁移细节。

由 gpt-image-2.5-sunburst 生成的 16:9 虚构公司封面页,画面是黄昏时的充电站雨棚,衬线大标题,底栏是四个带标签的信息块

9 月 8 日 OpenAI 究竟发了什么

面向消费者的那一半才是这次发布的主体。Images 2.5 当天就推送给了全部 ChatGPT、ChatGPT Work 和 Codex 用户,覆盖桌面端、移动端和网页端,并附带四个产品功能:

  • Sketch —— 直接在 ChatGPT 里手绘,这张草图会成为最终成图的构图参考。输入 @Sketch 调用。
  • 模板(Templates) —— 海报、周边等常见格式的预设起点,你只需填内容,不必面对空白提示框。
  • 图上批注 —— 在生成图的具体位置留一条评论,把编辑范围限定在那一块。
  • 提示词分享 —— 分享图片时可以一并附上提示词,别人能用自己的素材复现同一个创意。

在模型能力的措辞上,OpenAI 反而相当克制:Images 2.5「光照更自然、纹理更丰富,更擅长保留参考照片中的主体,跨多轮编辑时指令遵循也更可靠」。公告里唯一的硬数字是延迟——「相比 Images 2.0,图像生成延迟最多降低 50%」。OpenAI 还披露,ChatGPT Images 与 API 上的 GPT-Image 系列合计每周生成超过 30 亿张图片,并点名 Adobe、Runway、Manus 和 Higgsfield AI 为早期 API 客户。

安全机制没有类型上的变化:提示词与图像双重检查,输出带 C2PA 元数据和不可见水印。如果你的管线会剥离或重写图片元数据,这套行为是从 gpt-image-2 延续下来的,建议重新验证一遍而不是想当然。

两个 API 模型:Sunburst 与 Flare

关于该先用哪个,OpenAI 的定位非常明确。

gpt-image-2.5-flare 被描述为「绝大多数应用的默认选择,以低 50% 的延迟提供比 GPT-Image-2 更高的画质」,面向创作者与社交内容、产品体验、视觉搜索、快速原型和高并发批量生成。

gpt-image-2.5-sunburst 则「为需要精细控制的创意工作提供额外一档精度,代价是更长的生成时间」,定位是可直接投放的品牌创意和精修产品图。

关于这个组合,有两点对做集成的人特别重要。第一,这不是当年 gpt-image-1gpt-image-1-mini 那种大小模型的切分——两个模型单价完全相同,而且在我们的实测中,它们在每一个画质档位上返回的输出 token 数也完全一致。你多付的是时间,不是钱。第二,名字本身给不了任何提示:「flare(耀斑)」是快的那个,「sunburst(日爆)」是慢的那个,和大多数人的直觉恰好相反。建议记在一个你以后找得到的地方。

两个模型都只支持两个端点——POST /v1/images/generationsPOST /v1/images/edits——并且都标注支持 inpainting。截至撰稿时,Responses API 的图像工具还用不了它们。

我们是怎么测的

用一个精巧的提示词跑出来的基准,几乎说明不了生产环境的表现。所以我们直接用了自家管线每天在做的活:把一份结构化大纲变成成品 16:9 幻灯片,并附上品牌模板参考图。

  • 测试负载。 一家虚构充电运营商的五页 deck:封面、目录、三页数字密集的内容页(98.4%、96.1%、4.2 → 5.6、£1.9M、18:00),这些数字模型必须原样渲染,不能编也不能糊。这份 deck 是为本文虚构的,未使用任何客户内容。
  • 调用形态。 POST /v1/images/edits,大纲作为提示词,附 1~3 张品牌模板参考图——与我们生产环境 image 模式的调用完全一致。
  • 分辨率。 主矩阵用 2048x1152(2K,16:9),4K 对照用 3840x2160
  • 通道。 官方 OpenAI API + 一方 key。不走任何聚合网关,因为 token 计量正是我们要测的东西。
  • 重试。 无。以下每个数字都是单发结果,耗时按「发出请求到拿到字节」的墙钟时间计。
  • 样本量。 41 次成功调用、零失败,覆盖 gpt-image-2gpt-image-2.5-sunburstgpt-image-2.5-flare

成本是按每次响应返回的 usage 字段、以 OpenAI 公示单价计算的,而不是按每张图估算。这个区别下面会变得非常关键。

发现一:画质阶梯整体下移了两级

这是全文最重要的一点,而且公告里没写。

gpt-image-2 接受三个显式画质档位——lowmediumhigh——外加 auto。GPT Image 2.5 接受五个:lowmediumhighxhighmax,外加 auto。给 gpt-image-2xhighmax 会得到一条干净的拒绝:The model 'gpt-image-2' does not support quality 'xhigh'.

直觉的理解是:OpenAI 在原有天花板之上加了两档。但事实不是这样。我们测了同一张 2048 × 1152 幻灯片在各档位下返回的输出图像 token 数,结果是两个新档位被插在了下面——于是每一个熟悉的档位名都往下挪了。

对比 gpt-image-2 与 gpt-image-2.5 画质档位输出 token 的示意图,显示 2.5 的 high 等于 gpt-image-2 的 medium、2.5 的 max 等于 gpt-image-2 的 high

qualitygpt-image-2gpt-image-2.5(两个模型一致)
low157 tokens157 tokens
medium1,413 tokens367 tokens
high5,650 tokens1,413 tokens
xhigh直接拒绝2,511 tokens
max直接拒绝5,650 tokens

加粗的两行值得再看一遍。GPT Image 2.5 的 high 花的是 gpt-image-2medium 那份预算;它的 max 才等于 gpt-image-2high 只有 low 档保持了原意。

现实后果是:如果你把模型字符串从 gpt-image-2 换成 gpt-image-2.5-flare,而 quality: "medium" 原封不动,你就从 1,413 token 的渲染悄悄掉到了 367 token——输出预算砍掉 3.8 倍。账单少了大约一半,在控制台里看起来像是赚了;构图变简单了,而这件事除了在图里,别处看不出来。等效保真的替换是 mediumhigh

4K 下同样成立。3840x2160 时,gpt-image-2high 返回 13,342 个输出 token;GPT Image 2.5 的 high 返回 3,336,只有到 max 才同样是 13,342。auto 也不是安全出口:我们的测试中 sunburst 和 flare 五次里有四次落在 1,413 token 这一档,但有一次 flare 返回了 628 个输出 token——这个值在任何显式档位下我们都没见过。如果成本可预测性对你重要,就把 quality 显式写死。

发现二:同样的 token、同样的价格、更短的等待

把阶梯错位修正之后,比较就干净了。下面三个模型都在生成同一张 2048 × 1152 幻灯片的 1,413 输出 token 版本,提示词相同、参考图相同、计费成本同为每页约 $0.059。唯一的变量是时间。每个数字都是五页的均值。

两个对齐 token 预算下的每页墙钟耗时柱状图:gpt-image-2 为 37.3 秒和 82.9 秒,gpt-image-2.5-flare 为 19.7 秒和 33.7 秒

模型quality输出 token平均耗时每页成本
gpt-image-2medium1,41337.3 秒$0.059
gpt-image-2.5-sunbursthigh1,41327.7 秒$0.059
gpt-image-2.5-flarehigh1,41319.7 秒$0.059

在 token 账单完全相同的前提下,flare 比 gpt-image-2 快 47%,sunburst 快 26%。这几乎正好落在 OpenAI 对 flare 宣称的「延迟降低 50%」上——对于一个发布日的营销数字来说,这种吻合程度比通常见到的要罕见。

到阶梯顶端差距还会拉大。同一页的单次 5,650 token 渲染:gpt-image-2high 用了 82.9 秒;sunburst 的 max 用了 59.8 秒,flare 的 max 只用 33.7 秒——快 59%。4K 下,gpt-image-2high 需要 92.4 秒、每张 $0.42,而两个 2.5 模型的 high 只要 27.8~33.8 秒、$0.12——不过按修正后的阶梯看,那是一个更便宜的档位,并非同档对比。

延迟的离散度也更小。五页范围内,flare 落在 17.7~22.3 秒,sunburst 落在 27.1~28.9 秒,而 gpt-image-2 是 35.2~39.2 秒。对于一条并发渲染 20 页 deck 的管线来说,尾部延迟比均值更要命,而尾部确实变短了。

发现三:每一档到底买到了什么

只有产出可用,便宜的档位才有意义。我们把同一张内容页在 sunburst 的四个档位上各渲染一次,并排放在一起。

gpt-image-2.5-sunburst 在 low、medium、high、max 四个画质档位下生成的同一张幻灯片,分别标注输出 token、耗时与成本

四张全部可读、排版正确、没有任何乱码文字——包括 157 token、$0.026 的 low 档。多花的预算买到的不是正确性,而是构图:lowmedium 的配图更平、分割线更简单、更多是常规双栏块;highmax 则出现分层卡片、背景图更深的景深、定制化的编号处理,以及更讲究的字阶层级。

对于一份开完会就扔的投影稿,$0.032 一页的 medium 完全站得住;面向客户的东西,high 才是那个「看起来像设计过」而不是「拼出来」的档位。新增的 mediumxhigh 是实打实有用的补充——原来的阶梯每一级之间是 4 倍的跳跃,中间是空的。

发现四:文字和数字都扛住了

image 模式生成幻灯片之所以可行,起点就是 gpt-image-2 的文字渲染能力。这里但凡有退步就是一票否决,所以我们把每一张生成图都和源大纲逐条核对了。

同一张内容页的三个版本:gpt-image-2 的 medium 档、gpt-image-2.5-sunburst 与 flare 的 high 档,各自标注输出 token、耗时与成本

在对照矩阵的十五张幻灯片中,三个模型把每一个标题、每一条要点、每一个数字都渲染对了——98.4%、96.1%、「4.2 to 5.6」、「18:00」、「2024-vintage」。没有丢小数点,没有编造统计数字,空白 logo 区也没有幻觉出标语。我们在更早一轮用中文跑过同样的提示词,结果一致,包括容易让弱模型翻车的「盯 / 町」这类形近字。

看得见的差别在版面判断力上。gpt-image-2 读完大纲会给你一个合格的栅格。两个 2.5 模型则更常给出一个设计师会认作「决策」的东西:顶部三分之一处一条不对称的图片带、与每条要点语义角色匹配的图标圆章、模板暗示过但从未写明的角标页码。这是主观判断,我们不打算把它包装成基准分——但在五页上、双向都一致,而且是在我们核对文件名之前的盲看里就成立的。

发现五:多轮编辑漂移更小,但依然会漂

OpenAI 关于精确编辑和多轮一致性的说法,对任何在 API 之上做编辑器的人最相关,所以我们直接测了。从同一张成品幻灯片出发,连下三条「只改一处」的指令,每次把上一轮的输出再喂回去:改写一个小标题、把某个数字从 98.4% 改成 99.2%、替换幻灯片另一侧的一句话。

四格图:原始幻灯片加三轮单条指令编辑,每轮改动都准确落地,其余部分保持原样

三个模型在三条链上把三次编辑全部改对了——九比九。这个结果对 gpt-image-2 来说好于我们的预期,值得直说而不是埋起来:这并不是老模型缺失的能力。

差别在于画面其余部分动了多少。以「相对原图、变化超过可察觉阈值的像素占比」衡量:

轮次之后gpt-image-22.5-sunburst2.5-flare
第 1 轮5.6%4.1%3.8%
第 2 轮8.1%6.8%6.7%
第 3 轮11.4%9.9%9.2%

三轮下来,GPT Image 2.5 累积的漂移少约 15~20%,而且它每轮的漂移是递减的(sunburst 为 4.1% → 3.1% → 2.8%),gpt-image-2 则基本持平(5.6% → 4.9% → 4.9%)。这确实是朝 OpenAI 所说的方向改进了。但就这份证据而言,它是渐进式的而不是台阶式的——而且要注意,这些都不是真正的局部编辑。没有 mask 时,每一轮整张画布都会重绘,背景照片会细微地重新生成,轮数够多之后一定会肉眼可见地跑偏。如果你需要一块保证不被碰的区域,还是得用 mask 参数,而不是一句措辞礼貌的提示词。

定价:把它换算成一份 deck

两个模型公示的单价完全相同,而且与 gpt-image-2 也完全相同:

token 类型每 100 万 token 价格
文本输入$5.00
缓存文本输入$1.25
图像输入$8.00
缓存图像输入$2.00
图像输出$30.00

因为单价没动,所有节省都来自阶梯,而不是价目表。按我们实测的 token 数,换算成一份 2048 × 1152、每页附三张参考图的 20 页 deck:

配置每页20 页 deck
gpt-image-2,medium$0.064$1.27
2.5,high (保真对齐)$0.064$1.27
2.5,medium (降一档)$0.032$0.64
2.5,low$0.026$0.51
gpt-image-2,high$0.190$3.81
2.5,max (保真对齐)$0.191$3.81

关于输入还有一点:参考图按每百万 $8 计费、且按像素面积计价,所以三张模板图不论文件多大,每次调用大约都是 1,728 个输入 token。上传前先降采样参考图,仍然是性价比最高的优化之一,2.5 没有改变这个算术。

我们没有找到的东西

在这里,平衡比热情更重要。所以,以下是我们找了但没找到的:

文字渲染没有跃升。 gpt-image-2 在商务文档类内容上早已到了「几乎不出错」的程度。我们没有找到一个 2.5 成功而 2 失败的案例。如果你唯一的诉求是图内文字准确率,这次发布解锁不了任何新东西。

依然没有免 mask 的局部编辑。 精确编辑的改进是真的,但有边界,漂移表已经说明了。指望「只改标题」从此意味着「其他一个像素都不动」的人会失望。

没有降价。 只有当你主动往下走那个被重命名的阶梯时,账面经济性才会改善,而往下走要付出构图质量的代价。不带这个前提就把这次发布说成「成本减半」,是有误导性的。

未覆盖的范围。 我们只测了一种视觉体裁——带品牌参考图的密集商务幻灯片——在两个分辨率下。我们没测写实人像、从个人照片保留主体、透明背景,也没测带显式 mask 的 inpainting 路径,而这些都是 OpenAI 重点提到的、且表现可能完全不同的场景。每个配置的样本是五页、单发,请把延迟均值当作参考值而不是服务等级承诺。

从 gpt-image-2 迁移的清单

如果你已有集成,真正需要动代码的是这几条:

  1. 重新映射 quality,别只换模型 ID。 mediumhighhighmax 才能保住你现在的输出预算。原样不动等于静音降档。
  2. 没有特殊理由就选 flare。 它是 OpenAI 明示的默认项,在我们跑过的每一种配置下都比 sunburst 快,而且同价。只有在多花 8 秒能换来更强控制的主视觉资产上才用 sunburst。
  3. 别再依赖 auto 在其他条件相同的调用之间,它落到了不同的 token 预算上。如果你按次向客户计费,就把 quality 显式写死。
  4. 把超时调下来。 如果你的客户端因为 gpt-image-2 的 4K 需要而等 180 秒,flare 三分之一的时间就跑完了。更短的超时意味着更快发现故障。
  5. 保留 gpt-image-2 作为兜底。 它仍在服务,而一条没有兜底的单供应商图像管线,无论最新模型是谁都是个坏赌注。
  6. 重新验证 C2PA 处理。 水印与来源元数据是延续下来的;如果你会对输出做后处理,确认一下容器里没有变化。

GPT Image 2.5 对 AI 生成幻灯片意味着什么

一个更快的图像模型,本身并不会产出更好的 deck——这一点是大多数发布报道会跳过的区别。图像模型一次渲染一张画布;而一份演示是一串共享同一套视觉语法的论证,由一份模型从未完整读过的源文档构建而来。

GPT Image 2.5 真正帮上忙的地方,是渲染这一步的经济性。在 image 模式的管线里,每一页都是一次独立的 API 调用,所以每页延迟会直接乘进用户盯着进度条的时间。一份 30 页的 deck,从每页 37 秒降到 20 秒,等于在成本不变的前提下少等大约八分半钟——这会改变「重新生成一次」在心理上是否可接受。渲染在时间上便宜时,用户才会迭代;渲染慢时,他们只会将就第一稿。新增的 mediumxhigh 也让分档产出变得现实:先用每页 367 token 把整份 deck 草出来验证叙事,再只对留下来的页面用 high 重渲。

模型仍然做不到的,是决定第 7 页该放什么。解析一份 40 页 PDF、判断哪些结论值得单独成页、让数字忠于原文、并在整份 deck 里保持同一套模板的视觉语言——这些活儿位于图像模型之上的编排层。这正是我们在 HTML 与 image 两种幻灯片生成方式的对比中描述过的分工,也是「一把 Images API key ≠ 一个 document-to-PPT 工具」的原因。导出问题同样还开着:一张生成出来的幻灯片在被还原成可编辑的 PPTX 形状之前,始终只是一张图片。

Tosea.ai 正是坐在那个编排层上——读源文档、搭幻灯片结构、选模板,再把每一页派发给当下在速度与保真之间权衡最合适的图像模型。这类模型发布会改变我们路由到哪个引擎、以及 quality 参数怎么设;但它们不会改变问题中更难的那一半。如果你在只凭底层图像模型来评估一个 AI 演示工具,我们的 PDF 转 PowerPoint 工作流指南更能说明真正的难点在哪里。

常见问题

有没有一个叫 gpt-image-2.5 的模型? 没有。API 暴露的是 gpt-image-2.5-sunburstgpt-image-2.5-flare。不带后缀的 gpt-image-2.5 会返回「模型不存在」,gpt-image-3 同理。

默认该用哪个? flare。OpenAI 把它列为默认项,而在我们测过的每一个画质档位上,它都比 sunburst 快,价格相同、输出 token 数也相同。只有当某个资产值得多花那几秒时才用 sunburst。

GPT Image 2.5 比 GPT Image 2 便宜吗? 按 token 算,不便宜——单价完全相同。按每张图算,只有当你在重命名后的阶梯上往下走时才便宜。在输出预算对齐的前提下,成本差异不到 0.1 美分。

我只改模型字符串,现有代码还能跑吗? 能跑,但 quality: "medium" 买到的输出 token 比原来少 3.8 倍。把 mediumhighhighmax 映射一遍,才能保住现在的保真度。

gpt-image-2 被弃用了吗? OpenAI 没有公布下线时间,模型仍在服务。在多供应商配置里,它仍然是一个合理的兜底。

支持 4K 吗? 支持。两个模型在我们的测试中都接受 3840x2160high 档 3,336 个输出 token,max 档 13,342 个。

和 Nano Banana 2 比如何? 我们还没有用 2.5 重跑那组对照;我们的 Nano Banana 2 对比覆盖的是上一代,等拿到同负载的数据后会更新。

参考来源

继续阅读

查看所有文章