画像生成モデル「Nano Banana 2.1」公開——APIの1K・2K画像は前モデルの半額に — BRIDGE(ブリッジ)

Google は現地時間6日、画像の生成と編集に使うモデル「Nano Banana 2.1」のモデルカードを公開した。

Image Credit: Google

Google は現地時間6日、画像の生成と編集に使うモデル「Nano Banana 2.1」のモデルカードを公開した。

Gemini 3.6 Flash をベースにしたモデルで、Gemini アプリ、Google AI Studio、Gemini API のほか、Google 検索の AI モード、Google 広告、Google Flow、Google Stitch で提供する。

入力はテキストと画像で、コンテキストは最大100万トークン。出力は画像とテキストで、テキストは最大64Kトークンを出力できる。

同社は Nano Banana 2.1 を、Nano Banana 2(Gemini 3.1 Flash Image)の更新版と位置づける。

画質、複数回のやり取りでのキャラクターの一貫性、文字の正確な描画、検索結果に基づく生成を改善し、1K、2K、4K の解像度で画像を出力するとしている。

Gemini API の有料枠での画像出力の料金は、100万トークンあたり30ドル(バッチ処理は15ドル)。

画像1枚あたりに換算すると、1K が0.0336ドル、2K が0.0504ドル、4K が0.113ドルとなる。Nano Banana 2 の画像出力は100万トークンあたり60ドルで、1枚あたりは1K が0.067ドル、2K が0.101ドル、4K が0.151ドル。

1K と2K はおよそ半額、4K は約25%安い。

一方、入力の料金は100万トークンあたり1.50ドルで、Nano Banana 2 の0.50ドルより高い。テキストと思考の出力も7.50ドルと、Nano Banana 2 の3ドルを上回る。無料枠では利用できない。

同社が示した人による比較評価(Elo)では、テキストからの画像生成の総合評価が、思考ありの設定で1050、思考なしで1015だった。

Nano Banana 2(思考あり)は990。インフォグラフィックの事実性の自動評価では、思考ありで0.521と、Nano Banana 2 の0.179を上回った。

同社は、小さな文字や長い段落の描画が不鮮明になる場合があることや、入力画像と生成画像でキャラクターの一貫性が常に保たれるわけではないことを、既知の制約として挙げている。

via Google DeepMind、Google AI for Developers

この記事の企業GGoogle

BRIDGE の記事 315 本・海外

BBRIDGE 編集部

BRIDGE 編集部では、株式会社THE BRIDGEからのお知らせや、プレスリリースサービス「PR TIMES」よりスタートアップ企業の発表情報を厳選し、読みやすく要約した記事を掲載しています(BRIDGEは2018年4月よりPR TIMESのグループメディアとして運営されています)