画像生成におけるGPT Image 2とGPT Image 2.5 Flareの比較
結果はタスクによって分かれました。再ライティング、広告構図、商品を中心としたシーンではGPT Image 2.5 Flareが優位で、構造化されたUIグラフィックと参照画像に基づくオブジェクト編集ではGPT Image 2が優れています。タイポグラフィ、人体構造と接触表現、個数指定、テキスト置換、アウトペインティングは両モデルが互角のため、最適な選択はワークフローによって異なります。

機能を並べて比較
| 項目 | GPT Image 2 | GPT Image 2.5 Flare |
|---|---|---|
| 開発元 | OpenAI | OpenAI |
| Banana Pieでの提供状況 | 利用可能 | 利用可能 |
| 必要クレジット | 20クレジット | 25クレジット |
| 最大解像度 | 4K | 4K |
| 参照画像 | 最大8枚 | 最大8枚 |
シーン別比較
同じプロンプト、2つのモデル。以下の公開画像で違いを比較してください。
商品の素材感とライティング
この条件ではGPT Image 2.5 Flareが優位どちらの出力もプロンプトに忠実ですが、右の画像は半分まで入った液体の量がより明確で、左上からの照明もより判別しやすくなっています。内部チューブにわずかな歪みはあるものの、これらの利点を上回るほどではありません。
- 透明な長方形の香水ボトルが1本だけあり、テキスト、ロゴ、追加のオブジェクトがない:引き分け。どちらの画像にも、何も置かれていない濡れた石の上に直立した長方形のボトルが1本だけ描かれており、文字、ブランド表示、植物、独立した小道具は見当たりません。
- ボトルに琥珀色の液体が半分まで入っている:右が優秀。右の液面はボトル内部のほぼ中間にありますが、左は半分よりやや多く入っているように見えます。
- ガラスの屈折と濡れた黒い石への反射が物理的に整合している:左が優秀。左はガラスの縁、琥珀色の透過光、位置の揃った反射が一貫して見えます。右は内部チューブが明らかに湾曲し、ボトル底部付近の光学的な歪みも不規則です。
- 左上からの照明によるハイライトが一貫し、接地影も自然である:右が優秀。明るい左側のハイライトと、暗い右側へ伸びる接地感のある影によって、左上からの光の方向が特に明確に表現されています。
使用したプロンプトと設定
プロンプト
A premium product photograph of exactly one transparent rectangular perfume bottle, half filled with amber liquid, standing upright on wet black stone. Light comes from the upper left, creating coherent refraction, a contact shadow, and one subtle reflection. No text, logo, plants, or extra objects.
多言語タイポグラフィ
用途による評価基準上、どちらの出力も実質的に同じです。文言、順序、色は正しく再現されていますが、どちらも指定された1行目を明らかに2行へ分割しており、正確に4行ではなく5行になっています。
- 中央揃えのテキストが正確に4行あり、ほかのテキストがない:引き分け。どちらのポスターも「MOONLIGHT MARKET」が「MOONLIGHT」と「MARKET」に分割され、目に見えるテキストが5行になっています。追加の文言はどちらにもありません。
- テキストと順序が正確である:引き分け。どちらも「MOONLIGHT」、「MARKET」、「月光市集」、「18 OCT」、「RIVER HALL」を指定された順序で描画していますが、「MOONLIGHT MARKET」を1行に収められていません。
- テキストの色:引き分け。どちらも「月光市集」は赤、目に見える英語テキストはすべて黒で描画しています。
- 可読性、間隔、配置:引き分け。どちらのポスターも文字が鮮明で読みやすく、中央揃えで、縦方向の間隔もおおむね均等です。明確な視覚的優位性はありません。
使用したプロンプトと設定
プロンプト
Design a clean cream-colored vertical event poster. Show exactly four centered text lines and no other text: "MOONLIGHT MARKET", "月光市集", "18 OCT", and "RIVER HALL". Render "月光市集" in red and all other lines in black.
人体構造と接触表現
用途によるプロンプトで厳密に指定された手と指の見え方については左が優れていますが、人体構造と成形時の接触表現は右のほうが説得力があります。評価基準全体では、これらの利点が釣り合っています。
- 完全に見える手が正確に2つあり、余分な手や人物がいない:左が優秀。どちらの画像にも人物が1人と手が正確に2つ描かれていますが、左は両手がより完全に見えています。右では指の大部分がボウルの内側や背後に隠れています。
- 各手に自然な形の独立した指が正確に5本ある:左が優秀。左では各手の5本の指をより明確にたどれますが、右は指の重なりや遮蔽があるため、正確な本数を確認しにくくなっています。
- 指、関節、粘土との接触が解剖学的に自然である:右が優秀。内側と外側からつかむ手がボウルの壁面に自然に沿い、指の並びにも説得力があります。左では、いくつかの指先が密集して見えるほか、粘土と部分的に融合しているように見えます。
- 粘土のボウル、回転するろくろ、成形動作が明確に認識できる:右が優秀。どちらもボウルとろくろが目立っていますが、右は両手を向かい合わせに配置することで、実際に成形している動作がより明確に伝わります。
使用したプロンプトと設定
プロンプト
A photorealistic close-up of an adult potter shaping a clay bowl on a spinning wheel. Both hands are fully visible, each with five natural fingers touching the clay. No other people or hands. Soft window light.
数量表現と属性の対応付け
用途によるどちらの画像も4つの基準をすべて満たしており、指示への準拠度に明確な差はありません。オブジェクト数、属性の対応、配置、取っ手の向き、背景の簡潔さはいずれも実質的に同等です。
- オブジェクトの数と配置:引き分け。どちらの画像も、左側に赤い立方体が正確に3個一列に並び、右側に青い球体が正確に2個あり、その後ろの中央に黄色いマグカップが1個あることを明確に確認できます。
- 色、形状、素材の対応:引き分け。どちらも、わずかに質感のある赤い木製の立方体、透明で反射のある青いガラス球、光沢のある黄色い陶器製マグカップを描いています。
- マグカップの取っ手の向き:引き分け。どちらの画像でも、マグカップの右側に取っ手がはっきり見えます。
- 追加のオブジェクトやテキストがない:引き分け。どちらの画像にも、目に見える余分なオブジェクトやテキストはありません。
使用したプロンプトと設定
プロンプト
On a matte gray table, exactly three red wooden cubes form a row on the left, exactly two blue glass spheres sit on the right, and one yellow ceramic mug stands centered behind them. The mug handle points right. No other objects or text.
広告構図
この条件ではGPT Image 2.5 Flareが優位右は、見出しが上部の空き領域のすぐ下という指定位置により近いため、要求されたレイアウトをより忠実に再現しています。それ以外はどちらも同程度の出来で、靴に「AERO」と表示したことで、両方ともテキスト制限に違反しています。
- 銀色の靴とオレンジ色の軌跡がそれぞれ正確に1つある:引き分け。どちらの画像も右下に銀色の靴が1足あり、オレンジ色の軌跡が左下から入り、シーン内を曲線状に伸びています。
- 目に見えるテキスト:引き分け。どちらも「RUN LIGHT」と「42 KM」を正しく描画していますが、靴にも「AERO」とはっきり表示しています。そのため、指定された2つだけを表示するという要件をどちらも満たしていません。
- 上部の余白と見出しの配置:右が優秀。どちらも上部をすっきり空けていますが、右は「RUN LIGHT」をその確保された領域のすぐ下に近い位置へ配置しています。左は見出しまでにかなり広い空白があります。
- 視認性と優先順位:引き分け。どちらも見出し、バッジ、軌跡、1足の靴が完全に見えており、見出しと靴を中心とした明確な視覚的優先順位を確立しています。
使用したプロンプトと設定
プロンプト
Create a vertical social ad for a fictional running shoe named AERO. Keep the top 15 percent empty. Directly below it, place the headline "RUN LIGHT" in the upper-left. Show exactly one silver shoe in the lower-right, an orange trail curving from the bottom-left, and a round badge reading "42 KM". No other shoes or text.
構造化されたUIグラフィック
この条件ではGPT Image 2が優位左はプロンプトに正確に従っていますが、右は追加のテキストを表示しないという明示的な要件に違反しています。
- タイトルと列:引き分け。どちらも「CHOOSE YOUR PLAN」という正確なタイトルと、「STARTER」、「PRO」、「TEAM」とラベル付けされた正確に3つの列を描画しています。
- 行:引き分け。左右どちらの各列にも、「PROJECTS」、「STORAGE」、「SUPPORT」とラベル付けされた3つの整列した行があります。
- ボタン:引き分け。左右どちらの各列にも、「SELECT」と表示された青いボタンが正確に1つあります。
- 配置と追加テキスト:左が優秀。どちらも列は均等に揃っていますが、右にはプラン詳細として「5」、「10 GB」、「Email」、「25」、「100 GB」、「Priority」、「Unlimited」、「1 TB」、「24/7」というテキストが追加されています。左には追加のテキストがありません。
使用したプロンプトと設定
プロンプト
Create a clean horizontal pricing comparison graphic titled "CHOOSE YOUR PLAN". Use exactly three equal columns labeled "STARTER", "PRO", and "TEAM". Under each column, show exactly three aligned rows labeled "PROJECTS", "STORAGE", and "SUPPORT", followed by one blue button labeled "SELECT". White background, dark navy text, no additional columns or text.
6点の参照画像によるオブジェクト対応付けと編集
この条件ではGPT Image 2が優位左のほうが優れた結果です。指定された2個のレモンをきれいに描画し、右に見られる別のオブジェクトの属性が混ざったような葉もなく、編集対象のオブジェクトもフレーム内にわずかにうまく収めています。そのほかの指定された置換については、ほぼ同等に成功しています。
- 基準1:引き分け。どちらの画像にも、左下付近に濃いネイビーブルーのマグカップ、左上付近に折りたたまれた緑と白のストライプ柄ナプキンがはっきり描かれており、赤いマグカップや無地の白いタオルは残っていません。参照画像が表示されていないため、参照画像との完全な一致は評価できません。
- 基準2:引き分け。どちらの画像にも、上部中央付近にオレンジが正確に1個、右側にマスタードイエローのハードカバーノートがあり、緑の洋ナシや青いノートは見当たりません。元画像がないため、参照画像との完全な一致は評価できません。
- 基準3:左が優秀。どちらもマグカップの右側にレモンを2個描いていますが、右では一方のレモンに、オレンジに施された葉の表現と似た目立つ緑の葉が付いており、別のオブジェクトの属性が混ざったように見えます。左は2個のレモンをそれぞれ独立した飾りのない状態で描き、余分な果物もありません。
- 基準4:左がわずかに優秀。どちらも一貫性のある木製のテーブル面、統一された照明、自然な影を維持していますが、左はノートをより多くフレーム内に収めています。右は右端でノートがより大きく切れています。参照画像1が表示されていないため、それを正確に保持できているかは評価できません。
使用したプロンプトと設定
プロンプト
Use Reference 1 as the base tabletop scene. Replace the red mug with the exact dark navy-blue mug from Reference 2 in the same position and orientation. Replace the folded white towel with the exact green-and-white striped napkin from Reference 3 in the same folded area. Replace the green pear with exactly one orange from Reference 4 in the same position. Replace the blue notebook with the exact mustard-yellow hardcover notebook from Reference 5 in the same position. Add exactly the two lemons from Reference 6 to the right of the mug. Preserve the wooden table, camera, framing, wood grain, lighting, shadows, and all other spatial relationships from Reference 1. Do not copy the white product backgrounds from References 2–6, duplicate any asset, or add other objects.
画像内テキストの置換
用途によるどちらの出力も指定された文言をきれいに描画しており、視覚的にもほぼ同一です。目に見えるテキストの不具合はどちらにもなく、元画像の保持という点でも明確な優位性はありません。
- 正確なテキストと旧テキストの削除:引き分け。どちらの看板にも正確に「NIGHT OWL」と表示され、古いテキストはどちらの画像にも見当たりません。
- 追加文字や不正な文字:引き分け。どちらの看板にも「NIGHT OWL」だけが表示されており、余分な文字、重複した文字、崩れた文字はありません。
- フォント、間隔、遠近感の保持:引き分け。どちらも簡潔な大文字のサンセリフ体を使用し、看板の遠近感に沿って自然に配置しています。元画像が表示されていないため、保持の正確さは完全には評価できません。
- 素材、照明、シーンの保持:引き分け。緑色に塗装された木目、影、ランプ、店舗正面、植物、舗装は、両画像でほぼ同一に見えます。元画像がないため、元の状態を保持できているかは完全には評価できません。
参照画像
使用したプロンプトと設定
プロンプト
Replace only the sign text with exactly "NIGHT OWL". Preserve the original font style, spacing, perspective, sign material, lighting, and everything else.
一貫性のあるシーン再照明
この条件ではGPT Image 2.5 Flareが優位右は、画像全体に暖色をかけるだけではなく、より強い指向性のある日差しと一貫した投影影を表現しており、整合性のある再ライティングとして説得力があります。
- 暖かなゴールデンアワーの光が左の窓からはっきり差し込んでいる:右が優秀。右では明るい日差しが左の窓から目に見えて差し込み、壁、ソファ、ラグ、床へ広がっています。左にも暖色の光源はありますが、部屋全体への照射はそれほど明瞭ではありません。
- ハイライトと影の方向が新しい光源に対して整合している:右が優秀。窓枠の影、植物の影、家具の脚から伸びる長い影が、すべて一貫して右方向に投影されています。左の壁面の影も自然ですが、ラグと床における影の方向性は弱くなっています。
- 単一の黄色いカラーフィルターをかけただけではない:右が優秀。暖かなハイライトに加えて、明瞭な帯状の日差しと、ソファ、壁、ラグ、床にある寒色寄りの陰影を組み合わせています。対して左は、全体がより均一な琥珀色に見えます。
- 家具や装飾品が移動、追加、削除、再設計されていない:元画像がないため、完全には評価できません。2つの出力には、同じ主要な家具と装飾品が一致する位置に描かれているため、どちらにも実証可能な優位性はありません。
参照画像
使用したプロンプトと設定
プロンプト
Change the lighting to warm golden-hour sunlight entering from the left window. Do not move, add, remove, or redesign any object. Update highlights and shadows coherently.
異なるアスペクト比へのアウトペインティング
用途によるどちらの画像も、目視で確認できるアウトペインティング要件をほぼ同程度に満たしています。元画像の保持に関する基準は、これらの出力だけでは検証できません。また、どちらにも明らかな拡張部分の不具合はありません。
- 左右に自然な内容が追加された16:9の出力:引き分け。どちらも横長の構図で、浜辺、海、空が左右へ自然に広がっています。レターボックス表示や、不自然に空白となった側面はありません。
- 元画像全体がトリミングや引き伸ばしなしで中央に配置されている:引き分け。どちらも小屋が中央にあり、比率も自然に見えます。ただし、元画像が別途表示されていないため、完全に保持されているか、トリミングがないかは検証できません。
- 元の小屋、海岸線、内部構図が変更されていない:引き分け。どちらも目に見える小屋と海岸線に一貫性がありますが、元画像がないため、各モデルが元の内容を変更したかどうかは評価できません。
- 目に見える継ぎ目、反転コピーによる補完、オブジェクトの繰り返しがない:引き分け。どちらも砂浜、波、水平線、雲が途切れなく連続しており、明らかな継ぎ目、反転パターン、重複したオブジェクトは見当たりません。
参照画像
使用したプロンプトと設定
プロンプト
Expand the canvas to a 16:9 landscape by naturally continuing the beach, ocean, and sky on both sides. Keep the complete original image centered without cropping, stretching, letterboxing, or modifying it.
シーン変更時の商品再現性維持
この条件ではGPT Image 2.5 Flareが優位右は、濡れた表面の表現と照明の整合性が特に優れており、指定された夕暮れ時の濡れたコートにスニーカーをより自然に溶け込ませています。元画像がないため、商品が正確に保持されているかは検証できません。
- シーンへの配置: Rightのほうが優れています。コートのライン、バスケットゴールとフェンス、水たまり、点灯した照明、オレンジ色の夕暮れ空が見えるため、濡れた屋外バスケットボールコートであることがより明確に伝わります。Leftも場所の雰囲気は表現できていますが、コートのラインと濡れた様子がそれほど目立ちません。
- スニーカーの一貫性: 元のスニーカーの参照画像が提示されていないため、完全には評価できません。2つの出力を比較すると、どちらもシルエット、低いカメラアングル、層状のソール、ステッチの配置、白いレザー調のアッパー、織物素材の履き口が似ていますが、Rightでは素材全体に目立つ水滴が追加されています。
- 幾何学的なサイドマーク: 元の参照画像がないため、変更されていないかどうかは確認できません。どちらもほぼ同じ分岐形状と配置の、明瞭で識別しやすい黒い角張ったマークを描いており、目に見える決定的な差はありません。
- 物理的な整合性: Rightのほうが優れています。シューズには水滴と接地感のある影が見られ、右向きの輪郭には夕日の暖かなハイライトが入り、反射も明るい夕日やコート照明と整合しています。Leftではシューズの反射がより明瞭ですが、ほぼ乾いたシューズが水浸しの路面とやや不釣り合いです。
参照画像
使用したプロンプトと設定
プロンプト
Place the sneaker on a wet outdoor basketball court at dusk. Preserve the exact sneaker shape, black geometric side mark, materials, stitching, sole geometry, and camera angle. Add physically coherent contact, reflections, and dusk lighting.
複数参照による人物の同一性維持と衣装転写
使用したプロンプトと設定
プロンプト
Use the portrait in Reference 1 for the person and the isolated jacket in Reference 2 for the garment. Dress the person from Reference 1 in the exact jacket shown in Reference 2. Preserve the person's identity, face, expression, skin, hair, hands, pose, body proportions, background, framing, and lighting from Reference 1. Preserve the jacket's material, color, collar, buttons, pockets, and sleeve patch from Reference 2. Do not copy the ghost mannequin or white product background.
コストと処理時間
GPT Image 2は20クレジットから、GPT Image 2.5 Flareは25クレジットから利用できるため、1回の生成に必要なクレジットが少ないのはGPT Image 2です。今回の小規模なレイテンシサンプルでは、シナリオごとの所要時間がGPT Image 2で約81秒から190秒、GPT Image 2.5 Flareで約71秒から101秒でした。これは今回の実行結果を示すものであり、一般的なベンチマークではありません。
比較方法と開示事項
各シナリオで同一の固定プロンプトを使用し、モデルごとに1回ずつ生成したうえで、出力をそのまま公開しました。Banana Pieでは両モデルへの有料アクセスを提供しています。
Banana Pieでは、このモデルを他のモデルとともに1つのスタジオで有料提供しています。評価は、ユーザーと同じ生成環境で実施したテストに基づいています。







































































