Gemini Nano Banana 2.1 が公開!思考レベル3段階、参照画像14枚、パノラマ比率の生成を強化

2026年10月6日(現地時間)- Googleは、画像生成・編集モデル「Gemini Nano Banana 2.1」を公開しました。あわせてComfy Orgも、ノードベースの画像・動画生成UI「ComfyUI」のPartner Nodes(外部APIのモデルをComfyUIのノードとして呼び出せる仕組み)から、同モデルを利用できるようになったことを発表しています。

Gemini Nano Banana 2.1とは

Gemini Nano Banana 2.1は、Nano Banana 2(Gemini 3.1 Flash Image)の後継にあたるモデルで、Flashクラスの速度と費用を保ちながら、画質、プロンプトへの忠実さ、複数ターンでのキャラクターの一貫性、テキストの描画、横長・パノラマ比率での生成が改善されました。Gemini APIでは安定版として、モデルID「gemini-nano-banana-2.1」で提供されています。

プロンプトと最大14枚の参照画像を受け付け、最大4K解像度の画像を生成できます。Minimal・Medium・Highの3段階の思考レベル、Google検索によるグラウンディング、指示による部分的な編集にも対応しています。

公開にあわせて、Nano Banana 2(gemini-3.1-flash-image)は非推奨となり、Nano Banana 2.1への移行が更新履歴で案内されています。

また、Gemini APIの料金ページによると、初代のGemini 2.5 Flash Image(Nano Banana)も非推奨となっており、2026年10月2日に提供を終了すると案内されています。

ComfyUIでは、すでにワークフローでNano Banana 2を使っている場合、Gemini Nano Banana 2.1のノードを同じ位置に差し替えるだけで移行できるとComfy Orgは説明しています。解像度の段階(1K・2K・4K)はそのまま引き継がれ、アスペクト比には新たに縦長の9:21が加わったほか、1回の生成あたりの費用も下がっているとのことです。

主な特徴

3段階の思考レベル(Minimal/Medium/High)

生成前にモデルがどれだけ考えるかを、Minimal・Medium・Highの3段階から選べます。Comfy Orgは、アイデア出しで素早く試す段階ではMinimal、文字や要素が密集したレイアウトや、複数の条件を重ねたプロンプトではHigh、その中間ではMediumを使うよう案内しています。レベルを上げるほど生成時間が長くなり、消費するトークンも増えます。Gemini APIのモデルページでは、既定の設定はMediumとされています。

Googleの料金体系では思考のトークンはテキスト出力と同じ単価で課金されるため、ラフ案をMinimalで量産し、採用候補だけHighで仕上げるといった使い分けが良さそうです。

最大14枚の参照画像

1回のプロンプトで、製品、キャラクター、スタイルの参考、背景といった参照画像を最大14枚まで渡すことが可能です。Gemini APIのモデルページでは、その内訳として、一貫性を保てるキャラクターは最大4人、物体は最大10個と案内されています。

Comfy Orgは、それぞれの画像に「何として使うのか」をプロンプトで明確に指定するようすすめています。商品写真を指定の背景と画風に合成する、複数のキャラクターを1枚の構図に並べるといった、広告やキービジュアルの制作に役立ちます。

Google検索によるグラウンディング

モデルがGoogle検索と画像検索から情報を取り込めるため、実在のランドマーク、あまり知られていない物、現実の細かなディテールを描く際に役立ちます。。Gemini APIでは、検索リクエストは月5,000件まで無料(Gemini 3.x系モデルで共有)、それ以降は1,000件あたり14ドルです。ComfyUIのPartner Nodes経由で使う場合の扱いは、参照した発表には書かれていません。

指定どおりに描かれるテキスト

看板、複数行の告知文、英数字の正確な文字列、筆記体の手書き文字、そして日本語も、指定どおりに描画されるようになりました。Comfy Orgは、画像に入れたい文字はすべて一字一句プロンプトに書くようすすめています。

部分編集と複数ターンの編集

色の変更、素材の差し替え、物体の除去、テキストの書き換えといった編集を、画面のほかの部分を崩さずに行えます。さらに、編集を何回かに分けて積み重ねていくことも可能です。マスクを描かずに指示文だけで直せるため、クライアントの修正指示を順に反映していくような作業に向いています。

シームレスなタイリング

Comfy Orgによると、繰り返し使えるテクスチャやパターンを、端がきれいにつながる状態で生成できるとしています。3DCGのマテリアル用テクスチャや、背景用の柄の制作に役立ちます。Googleの公式資料にはこの機能についての説明は見当たりません。

以下が試してみた結果です。プロンプトでも変わる可能性があるので参考程度に。

解像度とアスペクト比

出力は1K・2K・4Kの3段階で、アスペクト比は1:1から21:9、9:21までに加え、バナーや長いパノラマ向けの4:1、1:4、8:1、1:8も選べます。

現時点での限界と注意点

Googleはモデルカードで、Nano Banana 2.1の既知の制約として次の点を挙げています。

小さい文字と長文: 小さなフォントや長い文章の描画はうまくいかないことがあります。キャラクターの一貫性: 入力画像と出力画像の間で、キャラクターの一貫性が完全には保たれない場合があります。マスクや落書きによる編集: マスクや手描きの印を使った編集では、指示に従いきれないことがあります。位置の指定: 画面内の位置関係を取り違えることがあります。知識のカットオフ: 2026年3月まで(一部の分野は2025年1月まで)です。新しい製品やできごとは、検索によるグラウンディングで補う必要があります。

文字入れの精度が上がったとはいえ、パッケージの成分表示や細かな注意書きのような小さい文字は、生成後に確認するか、DTPソフトで仕上げる前提で使うほうが確実です。

料金の目安

ComfyUIのPartner Nodesは、トークン数に応じてクレジットを消費する仕組みです。ただし、ComfyUI公式ドキュメントの料金表には、この記事執筆時点(2026年10月7日)でGemini Nano Banana 2.1はまだ掲載されていません。

Comfy Orgは、Nano Banana 2.1では1回の生成あたりの費用がNano Banana 2より下がるとしています。参考として、GoogleのGemini Developer API(有料枠)での料金を、Nano Banana 2と並べて紹介します。

Nano Banana 2.1Nano Banana 2入力(100万トークンあたり)1.50ドル(テキスト・画像・動画)0.50ドル(テキスト・画像)出力:テキストと思考(100万トークンあたり)7.50ドル3ドル出力:画像(100万トークンあたり)30ドル60ドル1K画像1枚あたり約0.0336ドル約0.067ドル2K画像1枚あたり約0.0504ドル約0.101ドル4K画像1枚あたり約0.0756ドル約0.151ドル無料枠なしなしGemini Developer APIの標準料金。バッチ処理ではいずれも半額。

画像出力の単価が半分になったため、1枚あたりの費用はどの解像度でもおよそ半分になっています。一方で、入力と思考のトークンの単価はNano Banana 2より高く設定されています。

また、Nano Banana 2には0.5K(512ピクセル)の出力がありますが、Nano Banana 2.1の料金表には1K・2K・4Kのみが記載されています。小さいサイズで大量に試す使い方をしていた場合は、この点に注意してください。

利用方法

Partner Nodesはローカルで動くモデルではなく、外部のAPIを呼び出すノードです。ローカル環境のComfyUIから使う場合も、生成はGoogle側のサーバーで行われます。

ComfyUIでの使い方は次のとおりです。

ComfyUIを最新版にアップデートするか、Comfy Cloudを開きます。キャンバスをダブルクリックして「Gemini Nano Banana 2.1」を検索するか、テンプレートライブラリから用意済みのワークフローを読み込みます。解像度、アスペクト比、思考レベルを設定し、プロンプトと参照画像を加えて実行します。

また、Google DeepMindのモデルカードによると、ベースとなっているのはGemini 3.6 Flashで、Geminiアプリ、Google AI Studio、Gemini API、Google検索のAI Mode、Google Ads、Flow、Stitchでも提供されます。

Gemini Nano Banana 2.1 is now available via Partner Nodes

Release notes

Gemini Nano Banana 2.1

Nano Banana 2.1 Model Card

Gemini Developer API の料金