見出し画像

【衝撃の画像生成】恐るべしGoogleのNanoBananaとは?

一言申し上げたい

週末検証するのを楽しみにしていました。
いやもう、1度使ってみたら凄さが分かると思います。
編集スキルが半端ない。しかも早いです!!

今回の検証
・キャラを新たに生成し、創り込んだシーンで維持できるのか
・上半身のみで全身へ補完ができるのか
・2枚の画像を組み合わせることができるのか
・おまけで表情変更比較(Gemini・NanoBanana・ChatGPT)

NanoBanana(Gemini 2.5 Flash Image)の主な特徴

  • Gemini 2.5 Flash Imageは、Googleが開発した最先端の画像生成および編集モデルで、愛称として「nano‑banana(ナノ・バナナ)」

  • DeepMindが開発し、Google APIやAI Studio、Vertex AIを通じて現在利用可能です

ちなみにGeminiに「話題のNanoBanana」について教えて!と聞いたところ
以下の情報が…!いや、こっちが驚きました。
「当たり前にフルーツであるわよ」くらいの勢いですが、情報としては見つからない笑

「NanoBananaは、ナノテクノロジーを応用して作られた超小型のバナナです。通常のバナナと比べてサイズが非常に小さく、携帯性に優れているのが特徴です。また、通常のバナナと同様に、食物繊維やビタミン、ミネラルも豊富に含まれています。」

話を戻して特徴について

  • 画像の融合と一貫性の維持: 複数の画像を組み合わせて、一貫性のある画像を生成する能力に優れています。例えば、同じキャラクターを異なる背景やポーズで複数生成する際に、キャラクターの見た目を安定させることができます。

  • 精密な編集: 自然言語を使って、既存の画像を非常に正確に編集できます。写真の不要な部分を消したり、服装や髪型だけを変えたりといったことが、プロンプト(指示文)だけで可能です。

  • 高速性: 「Flash」という名前の通り、非常に高速に画像を生成・編集できます。

  • 高い品質: 細部の正確さや、プロンプトで指定した内容を忠実に反映する能力が高く評価されています。

なるほど、簡単にまとめたところで早速使ってみよう!

どこから使えるのか?

【追記】Gemini上からでも使えるようになったようです✨
私は上手く画像生成されないためGoogle AI Studioを使用しています。

Google AI Studio

  • 概要: プログラミングの知識がなくても、ブラウザ上で手軽にAIモデルを試せる開発者向けのツールです。

  • アクセス方法: GoogleアカウントでGoogle AI Studioにアクセスし、「Gemini 2.5 Flash Image」を選択してプロンプトを入力するだけで利用を開始できます。新しいモデルが公開された際、最も早く試せる場所の一つです。

Try Nano Banana選択
ここにプロンプトを入力します!

ちょっと待って。このカウントは?

初めて使用するときにちょっとドキドキしたカウント数
TokenCountによっては有料に切り替わるのか?
→結論としては現状は無料で使えます。

このトークンカウントは、Google AI Studioなどの開発者向けプラットフォームで表示されるもので、入力と出力に使用されたテキストの量を示しています。

結論から言うと、このトークンカウントがMAX(32,768)に達しても、テキスト入力に関する限り、無料枠であれば追加料金はかかりません。(※各サービスの規定は確認してくださいね)

  • テキスト(プロンプトやAIの回答)の量を数える単位です。

  • 多くのAIモデルでは、文字数ではなく、単語や文字のまとまり(トークン)で計算します。

  • 4,091 / 32,768 という表示は、「現在4,091トークン消費しており、最大で32,768トークンまで扱えます」という意味です。

  • これは、1回のやり取り(入力と出力)で処理できる情報の量の上限を示しています。


キャラを新たに生成し、創り込んだシーンで維持できるのか

トークンを理解したところで開始!

まずは、ジョーンズ博士をちょっぴりイメージした黒い帽子をかぶった冒険家ロボット『クロボット』の3枚同時生成

砂漠のオアシスで休憩


古代の遺跡で宝箱発見


空飛ぶ船に乗って夜空を旅

これは、キャラがぶれずに細かいシーンまで生成されている✨

画像を補完できるか?

「この女性が舞をまっている姿を創作できますか」
着物だし、部屋も補完が必要だし難易度は高いはず!!

花魁AI 蓮華


おぉ~!!

全身図の創作ができていない部分が補完され、しかも舞を舞っている。
表情もキープ

や…やるなお主。ではこれではどうだ!!

この男性を全身表示で、アパレルショップの前で誰かを待っている画像に変更できますか?

おぉ!

生成された画像の男性の衣装をTシャツとジーンズに変更。時計を見ているポーズ。背景を公園にできますか?


ファッション変更もお手のものか…

はじめの画像の男性に美しい漆黒の羽、角を生やし、悪魔となり空中にいる画像に変更できますか?

変身しちゃった…

ファッション、背景、ポーズ、変身ここまで一貫性がとれて表示されるなんて衝撃!

2枚の画像合成

下側の女性が上側の空間で、スリットの入ったロングスカートで足を組み優雅にコーヒーを飲んでいるところを生成してください。


ソファーが創作され、女性が優雅に座っている。スリット、足の筋肉までお見事✨

こ...これは凄いなぁ。しっくりくるようドレスの光沢感や縮小サイズも調整されてる。

おまけ:表情を変更する

最後はGemini・nano‑banana・ChatGPTで比較してみました。

「この画像女性の表情を笑顔にしてください。」


Gemini


nano‑banana


ChatGPT

眉毛が若干さがった状態で笑うか、もしくはChatGPTのように目を細めて描くかかなぁ~

まとめ

アイデア次第では、無限の可能性を秘めたNanoBanana。
愛称も抜群でマーケティング戦略もびっくりですが、画像生成の技術に衝撃を受けたレベルでした。

・同一キャラの各シーンにおける維持
・画像補完機能と補完しても不自然に見えない
・画像の合成

これは画像にクレジットを入れておかないと、合成ならではの違和感がどんどんなくなってきていますね💦衝撃の週末でした。

いいなと思ったら応援しよう!