ガイドTosea Team12 分で読めます

GPT Image 2.5 完全ガイド:Sunburst と Flare を実測して分かったこと

OpenAI は 2026 年 9 月 8 日に GPT Image 2.5 を公開。gpt-image-2.5-sunburst と flare を gpt-image-2 と比較実測し、レイテンシ・トークン・コスト、そして静かに移動した品質ラダーを検証しました。

GPT Image 2.5 完全ガイド:Sunburst と Flare を実測して分かったこと

2026 年 9 月 8 日、OpenAIChatGPT Images 2.5 を発表し、同時に Images API へ 2 つの新モデル gpt-image-2.5-flaregpt-image-2.5-sunburst を追加しました。次世代画像モデルの名前が GPT Image 2.5 なのか GPT Image 3 なのか、コミュニティは 3 週間議論してきました。私たちもその件でエビデンス・トラッカーを公開していました。答えはどちらとも少し違う——製品名は ChatGPT Images 2.5、API 側は単一のフラッグシップではなくサフィックス付きの 2 モデルです。サフィックスなしの gpt-image-2.5 を呼ぶと The model 'gpt-image-2.5' does not exist. が返ります。gpt-image-3 も同様です。

4 月の GPT Image 2 リリース時に作ったベンチマーク環境がそのまま残っていたので、発表から数時間で新しい 2 つのモデル ID に向けて 41 回の画像生成を公式 API で実行しました。本ガイドはその結果です。OpenAI が実際に出したもの、2 モデルの実コストと実所要時間、そしてモデル文字列だけを差し替えると請求額と出力品質が静かに変わる移行上の落とし穴を扱います。

gpt-image-2.5-sunburst が生成した 16:9 の架空企業タイトルスライド。夕暮れの充電ステーション、セリフ体の見出し、下部バーに 4 つのラベル付き情報ブロック

9 月 8 日に OpenAI が出したもの

発表の主役はコンシューマー側です。Images 2.5 は同日中に ChatGPT、ChatGPT Work、Codex の全ティアへ、デスクトップ・モバイル・Web で展開され、4 つの機能が付きました。

  • Sketch —— ChatGPT 上で直接手描きし、その線画を最終画像の構図リファレンスにする機能。@Sketch と入力して起動します。
  • テンプレート —— ポスターやグッズなど定番フォーマットの出発点。空のプロンプト欄に向かう代わりに項目を埋めていけます。
  • 画像へのコメント —— 生成画像の特定箇所にコメントを置き、編集範囲をその一点に絞れます。
  • プロンプト共有 —— 画像を共有する際に生成プロンプトも添付でき、受け取った人が自分の素材で同じアイデアを再現できます。

モデル品質についての OpenAI の表現はむしろ控えめです。Images 2.5 は「より自然な光とより豊かな質感を生成し、参照写真の被写体保持に優れ、複数ターンにわたる編集指示への追従がより安定している」。発表内で唯一の具体的な数字はレイテンシで、「Images 2.0 比で画像生成レイテンシを最大 50% 削減」。また ChatGPT Images と API の GPT-Image 系を合わせて週 30 億枚以上の画像が生成されていること、初期 API 顧客として Adobe、Runway、Manus、Higgsfield AI が挙げられました。

安全面の枠組みは変わりません。プロンプトと画像の二重チェックに加え、出力には C2PA メタデータと不可視ウォーターマークが付きます。パイプラインで画像メタデータを削除・書き換えている場合、この挙動は gpt-image-2 から引き継がれているので、当然視せず再確認する価値があります。

2 つの API モデル:Sunburst と Flare

どちらを先に選ぶべきかについて、OpenAI の位置づけは明確です。

gpt-image-2.5-flare は「ほとんどのアプリケーションにとっての既定の選択肢であり、GPT-Image-2 より高品質な画像を 50% 低いレイテンシで提供する」とされ、クリエイター/ソーシャル向けコンテンツ、プロダクト体験、ビジュアル検索、高速プロトタイピング、大量生成に向いています。

gpt-image-2.5-sunburst は「編集全体にわたるより緻密な制御が効く、もう一段上の精度。ただし生成時間は長くなる」とされ、そのまま出稿できるキャンペーンクリエイティブや作り込んだ商品画像が想定用途です。

この組み合わせで、実装する側にとって重要な点が 2 つあります。第一に、これは gpt-image-1gpt-image-1-mini のような大小モデルの分割ではありません両モデルの単価は同一で、私たちの計測ではどの品質設定でも返される出力トークン数も同一でした。追加で支払っているのは時間であって、お金ではありません。第二に、名前から順序は読み取れません。「flare(フレア)」が速い方、「sunburst(サンバースト)」が遅い方で、多くの人の直感とは逆です。後で自分が見つけられる場所にメモしておくことをお勧めします。

両モデルとも利用できるエンドポイントは POST /v1/images/generationsPOST /v1/images/edits の 2 つのみで、いずれも inpainting をサポートと記載されています。執筆時点で Responses API の画像ツールからは利用できません。

検証方法

気の利いたプロンプト 1 本で測ったベンチマークは、本番の挙動をほとんど説明しません。そこで私たち自身のパイプラインが毎日やっている仕事——構造化アウトラインを、ブランドテンプレート画像を添えて 16:9 の完成スライドに変える——をそのまま使いました。

  • ワークロード。 架空の EV 充電事業者の 5 ページ構成:表紙、アジェンダ、そして数値が密な本文 3 ページ(98.4%、96.1%、4.2 → 5.6、£1.9M、18:00)。モデルはこれらを捏造も破綻もさせずに描画する必要があります。この資料は本記事のための創作で、顧客コンテンツは一切使用していません。
  • 呼び出し形態。 POST /v1/images/edits。アウトラインをプロンプトとし、ブランドテンプレート画像を 1〜3 枚参照として添付——本番の image モードとまったく同じ呼び出しです。
  • 解像度。 主要マトリクスは 2048x1152(2K、16:9)、4K 比較は 3840x2160
  • 経路。 ファーストパーティキーによる公式 OpenAI API。トークン計上そのものを測りたいので、アグリゲーターは経由していません。
  • リトライ。 なし。以下の数値はすべて 1 回勝負の結果で、所要時間はリクエスト送信からバイト受領までの実時間です。
  • 件数。 gpt-image-2gpt-image-2.5-sunburstgpt-image-2.5-flare を横断して 41 回成功、失敗ゼロ。

コストは 1 枚あたりの概算ではなく、各レスポンスが返す usage ブロックを OpenAI の公表単価で計算しています。この違いが後で決定的になります。

発見 1:品質ラダーが 2 段下がっていた

本記事で最も重要な点であり、発表には書かれていません。

gpt-image-2 が受け付ける明示的な品質設定は lowmediumhigh の 3 つと auto。GPT Image 2.5 は lowmediumhighxhighmax の 5 つと auto を受け付けます。gpt-image-2xhighmax を渡すと明快に拒否されます:The model 'gpt-image-2' does not support quality 'xhigh'.

素直に読めば「上限の上に 2 段追加された」と思うところですが、実際は違いました。同じ 2048 × 1152 スライドで各設定が返す出力画像トークン数を計測したところ、新しい 2 段はに挿入されており、既存の名前がすべて 1 段ずつ下へずれていました。

gpt-image-2 と gpt-image-2.5 の品質設定を出力画像トークン数で比較した図。2.5 の high が gpt-image-2 の medium、2.5 の max が gpt-image-2 の high に一致することを示す

qualitygpt-image-2gpt-image-2.5(両モデル共通)
low157 トークン157 トークン
medium1,413 トークン367 トークン
high5,650 トークン1,413 トークン
xhigh拒否2,511 トークン
max拒否5,650 トークン

太字の 2 行は二度読む価値があります。GPT Image 2.5 の high は、gpt-image-2medium と同じ予算を使います。maxgpt-image-2high に相当します。 意味が変わらなかったのは low だけです。

実務上の帰結:モデル文字列を gpt-image-2 から gpt-image-2.5-flare に変え、quality: "medium" をそのままにすると、1,413 トークンのレンダリングから 367 トークンへ静かに落ちます——出力予算が 3.8 分の 1 です。請求額は約半分になりダッシュボード上は得をしたように見え、構図は簡素になりますが、それは画像の中でしか分かりません。忠実度を保った移行は mediumhigh です。

4K でも同じ構造です。3840x2160 では gpt-image-2high が 13,342 出力トークンを返したのに対し、GPT Image 2.5 の high は 3,336、同じ 13,342 になるのは max のときだけでした。auto も安全な逃げ道ではありません。今回の実行では sunburst と flare が 5 回中 4 回 1,413 トークンの段に落ちましたが、flare が 1 回だけ 628 出力トークンを返しました——明示設定では一度も観測されなかった値です。コストの予測可能性が重要なら quality は明示してください。

発見 2:同じトークン、同じ価格、短い待ち時間

ラダーのずれを補正すると比較が明快になります。以下では 3 モデルすべてが、同じプロンプトと同じ参照画像から、同じ 2048 × 1152 スライドを 1,413 出力トークンでレンダリングしており、課金額はいずれも 1 ページあたり約 $0.059 です。変数は時間だけ。各数値は 5 ページの平均です。

2 つの揃えたトークン予算における 1 ページあたりの実時間の棒グラフ。gpt-image-2 が 37.3 秒と 82.9 秒、gpt-image-2.5-flare が 19.7 秒と 33.7 秒

モデルquality出力トークン平均所要時間1 ページ単価
gpt-image-2medium1,41337.3 秒$0.059
gpt-image-2.5-sunbursthigh1,41327.7 秒$0.059
gpt-image-2.5-flarehigh1,41319.7 秒$0.059

トークンの請求額が完全に同じ条件で、flare は gpt-image-2 より 47% 速く、sunburst は 26% 速い。これは OpenAI が flare について主張する「50% 低いレイテンシ」にほぼ正確に一致します。ローンチ日のマーケティング数値としては、これほど合致するのはむしろ珍しいことです。

ラダーの上端では差がさらに開きます。同じページの 5,650 トークン 1 回のレンダリングで、gpt-image-2high は 82.9 秒、sunburst の max は 59.8 秒、flare の max は 33.7 秒——59% 短縮です。4K では gpt-image-2high が 92.4 秒・1 枚 $0.42 だったのに対し、2.5 の両モデルは high で 27.8〜33.8 秒・$0.12 でした。ただし補正後のラダーで見ればこれは同格比較ではなく、より安い段です。

レイテンシのばらつきも小さくなりました。5 ページの範囲で flare は 17.7〜22.3 秒、sunburst は 27.1〜28.9 秒、gpt-image-2 は 35.2〜39.2 秒。20 ページの資料を並列でレンダリングするパイプラインでは平均よりテールが効きますが、そのテールが短くなっています。

発見 3:各段で実際に何が買えるのか

安い段は、出力が使い物になって初めて意味を持ちます。同じ本文ページを sunburst の 4 段でレンダリングし、並べました。

gpt-image-2.5-sunburst が品質 low・medium・high・max で生成した同一スライド 4 枚。それぞれ出力トークン・所要時間・コストを表示

4 枚とも可読で、組版も正しく、文字化けもありません——157 トークン・$0.026 の low を含めてです。追加予算が買うのは正しさではなく構図です。lowmedium では写真が平板になり、区切り線は単純に、より定型的な 2 カラムのブロックになります。highmax では階層のあるカード、背景画像の深い被写界深度、独自の番号処理、より練られたタイポグラフィ階層が現れます。

会議室で投影して翌週には捨てる資料なら、1 ページ $0.032 の medium は十分に正当化できます。クライアントの目に触れるものなら、「組み立てた」ではなく「デザインした」と読める段は high です。新設の mediumxhigh は実際に有用な追加です——以前のラダーは段ごとに 4 倍跳んでおり、その間が空いていました。

発見 4:文字と数字は崩れなかった

image モードのスライド生成が成立した出発点は、gpt-image-2 の文字描画でした。ここが後退すれば失格なので、生成した全スライドを元アウトラインと突き合わせました。

同一本文スライドの 3 バージョン:gpt-image-2 の medium、gpt-image-2.5-sunburst と flare の high。それぞれ出力トークン・所要時間・コストを表示

比較マトリクスの 15 枚すべてで、3 モデルとも見出し・箇条書き・数値をすべて正しく描画しました——98.4%、96.1%、「4.2 to 5.6」、「18:00」、「2024-vintage」。小数の欠落も、統計値の捏造も、空のロゴ枠への幻覚タグラインもありません。先行して中国語でも同じプロンプトを実行しましたが結果は同じで、弱いモデルが取り違えがちな字形の近い漢字ペアも含めて正確でした。

目に見える差はレイアウトの判断力です。gpt-image-2 はアウトラインを読んで手堅いグリッドを返します。2.5 の両モデルは、デザイナーが「判断」と認識するものをより高い頻度で返します——上部 3 分の 1 を横切る非対称の写真帯、各箇条書きの意味的役割に合ったアイコンメダリオン、テンプレートが示唆していたが明示していなかった隅のページ番号。これは主観的な判断であり、ベンチマークとして飾るつもりはありません。ただし 5 ページすべてで、双方向に、そしてどのファイルがどれか確認する前のブラインド観察の時点で一貫していました。

発見 5:複数ターン編集のずれは小さいが、ゼロではない

OpenAI の精密編集とマルチターン一貫性の主張は、API の上にエディタを作る人にとって最も重要なので、直接検証しました。完成した 1 枚のスライドから出発し、「1 箇所だけ変更する」指示を 3 回連続で出し、毎回前回の出力を入力に戻しました:見出しを 1 つ書き換える、数値を 98.4% から 99.2% に変える、スライド反対側の一文を差し替える。

元スライドと 3 回の単一指示編集を示す 4 面。各編集が正しく反映され、他の部分はそのまま保たれている

3 モデルとも、3 本のチェーンすべてで 3 回の編集を成功させました——9/9 です。これは gpt-image-2 にとって予想以上の結果であり、埋もれさせずにはっきり書いておきます:これは旧モデルに欠けていた能力ではありません。

差が出るのは、スライドの残りの部分がどれだけ動くかです。元画像に対して、知覚可能な閾値を超えて変化したピクセルの割合で測ると:

経過ターンgpt-image-22.5-sunburst2.5-flare
1 ターン後5.6%4.1%3.8%
2 ターン後8.1%6.8%6.7%
3 ターン後11.4%9.9%9.2%

3 ターンで GPT Image 2.5 の累積ずれは約 15〜20% 小さく、しかもターンごとのずれが減衰します(sunburst で 4.1% → 3.1% → 2.8%)。gpt-image-2 はほぼ横ばいです(5.6% → 4.9% → 4.9%)。OpenAI が主張する方向への実際の改善です。ただしこの証拠の範囲では、段階的な改善であって飛躍ではありません。そして、これらはいずれも真の局所編集ではない点に注意してください。マスクなしでは毎ターン全キャンバスが再生成され、背景写真は微妙に描き直され、回数を重ねれば目に見えて逸れていきます。絶対に触られない領域が必要なら、丁寧な言い回しのプロンプトではなくマスクパラメータが必要です。

料金:資料 1 部に換算すると

2 モデルの公表単価は同一で、しかも gpt-image-2 とも同一です:

トークン種別100 万トークンあたり
テキスト入力$5.00
キャッシュ済みテキスト入力$1.25
画像入力$8.00
キャッシュ済み画像入力$2.00
画像出力$30.00

単価が動いていないため、節約はすべて価格表ではなくラダーから来ます。実測トークン数を使い、2048 × 1152・各ページに参照画像 3 枚を添えた 20 ページの資料に換算すると:

構成1 ページ20 ページ
gpt-image-2、medium$0.064$1.27
2.5、high (忠実度を揃えた場合)$0.064$1.27
2.5、medium (1 段下)$0.032$0.64
2.5、low$0.026$0.51
gpt-image-2、high$0.190$3.81
2.5、max (忠実度を揃えた場合)$0.191$3.81

入力についてもう 1 点:参照画像は 100 万トークンあたり $8 で、ピクセル面積に応じて課金されるため、テンプレート 3 枚はファイルサイズにかかわらず 1 呼び出しあたり約 1,728 入力トークンです。アップロード前に参照画像を縮小するのは依然として最も費用対効果の高い最適化のひとつで、2.5 でもこの算術は変わりません。

見つからなかったもの

ここでは熱意より公平さが大事なので、探したが見つからなかったものを挙げます。

文字描画の飛躍はない。 gpt-image-2 はビジネス文書系のコンテンツでは既にほぼ間違えない水準でした。2.5 が成功し 2 が失敗したケースは見つかりませんでした。画像内テキストの正確さだけが要件なら、このリリースで解ける課題はありません。

マスクなしの局所編集はまだない。 精密編集の改善は本物ですが範囲は限定的で、ずれの表がそれを示しています。「見出しだけ変える」が「他は 1 ピクセルも動かない」を意味するようになったと期待すると落胆します。

値下げではない。 名前が変わったラダーを意図的に下る場合にのみ、見かけの経済性が改善します。そして下れば構図品質を失います。この但し書き抜きに「コスト半減」と表現するのは誤解を招きます。

未検証の領域。 検証したのは 1 つのビジュアル領域——ブランド参照付きの密度の高いビジネススライド——を 2 解像度で、だけです。写実的なポートレート、個人の参照写真からの被写体保持、透明背景、明示マスクを伴う inpainting は検証していません。いずれも OpenAI が強調しており、挙動が異なる可能性があります。各構成のサンプルは 5 ページ・1 回勝負なので、レイテンシの平均値は目安であってサービス水準の保証ではありません。

gpt-image-2 からの移行チェックリスト

既存の実装がある場合、実際にコード差分が必要なのは以下です。

  1. モデル ID を差し替えるだけでなく quality を対応付け直す。 mediumhighhighmax で現在の出力予算を維持できます。文字列を放置すると静かに格下げされます。
  2. 理由がなければ flare を選ぶ。 OpenAI が既定として挙げており、私たちが試したすべての構成で sunburst より速く、価格も同じです。追加の 8 秒でより緻密な制御が買えるヒーローアセットにのみ sunburst を。
  3. auto に依存しない。 他の条件が同じ呼び出しでも異なるトークン予算に落ちました。生成ごとに課金しているなら quality は明示してください。
  4. タイムアウトを短くする。 gpt-image-2 の 4K のためにクライアントが 180 秒待っているなら、flare はその 3 分の 1 で終わります。短いタイムアウトは障害検知を速くします。
  5. gpt-image-2 をフォールバックとして残す。 まだ提供されていますし、最新モデルが何であれ、フォールバックのない単一ベンダー画像パイプラインは悪い賭けです。
  6. C2PA の扱いを再確認する。 ウォーターマークと来歴メタデータは引き継がれます。出力を後処理しているならコンテナに変化がないか確認してください。

GPT Image 2.5 は AI スライド生成に何をもたらすか

速い画像モデルは、それ自体では良い資料を生みません——ローンチ報道が飛ばしがちな区別です。画像モデルは 1 度に 1 枚のキャンバスを描きます。一方プレゼンテーションは、共通の視覚文法を持つ論証の連なりであり、モデルが全体を読むことのないソース文書から組み立てられます。

GPT Image 2.5 が本当に効くのはレンダリング工程の経済性です。image モードのパイプラインでは 1 ページごとに独立した API 呼び出しになるため、1 ページのレイテンシがそのままユーザーが進捗バーを見つめる時間に掛け算されます。30 ページの資料で 37 秒を 20 秒にすれば、同じコストで実時間 8 分半が消えます——これは「作り直す」ことが許容範囲かどうかを変えます。レンダリングが時間的に安ければユーザーは反復し、遅ければ初稿で妥協します。新しい mediumxhigh は段階的な出力も現実的にします:まず 1 ページ 367 トークンで全体を下書きして構成を確認し、生き残ったページだけ high で描き直す。

それでもモデルにできないのは、7 ページ目に何を載せるかを決めることです。40 ページの PDF を解析し、どの知見が 1 ページに値するかを判断し、数値をソースに忠実に保ち、1 つのテンプレートの視覚言語を資料全体で維持する——この仕事は画像モデルの上、オーケストレーション層にあります。HTML と image のスライド生成比較で述べた分担そのものであり、Images API のキー単体が document-to-PPT ツールではない理由でもあります。書き出しの課題も残ります:生成されたスライドは、編集可能な PPTX の図形に戻されるまでは画像のままです。

Tosea.ai はそのオーケストレーション層にあります——ソース文書を読み、スライド構成を作り、テンプレートを選び、各ページをその時点で速度と忠実度のバランスが最適な画像モデルへ振り分ける。今回のようなモデルリリースは、どのエンジンへルーティングするか、quality パラメータをどう設定するかを変えますが、問題の難しい方の半分は変えません。AI プレゼンテーションツールを土台の画像モデルだけで評価しているなら、PDF から PowerPoint へのワークフローガイドの方が、実際の難所がどこにあるかを見るには適しています。

よくある質問

gpt-image-2.5 というモデルはありますか? ありません。API が公開しているのは gpt-image-2.5-sunburstgpt-image-2.5-flare です。サフィックスなしの gpt-image-2.5 はモデル不存在エラーを返し、gpt-image-3 も同様です。

既定でどちらを使うべきですか? flare です。OpenAI が既定として挙げており、私たちが試したすべての品質設定で、同価格・同出力トークン数のまま sunburst より速かった。追加の数秒に見合う資産のときだけ sunburst を使ってください。

GPT Image 2.5 は GPT Image 2 より安いですか? トークン単価では安くありません——同一です。1 枚あたりでは、名前が変わったラダーを下る場合にのみ安くなります。出力予算を揃えれば差は 0.1 セント未満です。

モデル文字列を変えるだけで既存コードは動きますか? 動きますが、quality: "medium" が買う出力トークンは従来の 3.8 分の 1 になります。mediumhighhighmax に対応付け直して現在の忠実度を保ってください。

gpt-image-2 は非推奨ですか? OpenAI は停止日を公表しておらず、モデルは提供中です。マルチベンダー構成のフォールバックとしては依然妥当です。

4K に対応していますか? 対応しています。今回の検証では両モデルとも 3840x2160 を受け付け、high で 3,336、max で 13,342 出力トークンでした。

Nano Banana 2 との比較は? 2.5 での再検証はまだ行っていません。Nano Banana 2 の比較記事は前世代を扱っており、同一ワークロードの数値が揃い次第更新します。

出典