【Gemini-Veo3】今週末限定で1日3本無料?9秒間の世界を演出するには?
Geminiを起動したらVeo3を無料で使えるとアナウンス。
私はまだ無料ユーザーのため、試すことができるのは1日3本の様子✨
Proだと他機能も使えるようです。
本当に極めたり検証しようとすると課金は重要だと思いますが、お財布とシビアな相談が必要だなぁ。
ちなみに私のAI動画創作レベルは超ビギナーです。

Veo3は、Googleが開発した最新のAI動画生成モデル。
テキストや画像を入力するだけで、映像だけでなく、音声(セリフ、効果音、BGM、環境音など)も同時に生成できることが最大の特徴らしい。
ちょっとGeminiに聞いてみました。
Veo3の主な特徴
映像と音声の同時生成: プロンプトに記述した内容に応じて、映像に合ったセリフや効果音、BGMなどが自動で追加されます。高精度なリップシンク(口の動きと音声の同期)にも対応しています。
高品質な動画生成: 高解像度(1080p)の動画を生成できます。物理法則や空間認識に優れており、よりリアルな動きや表現が可能です。
映画的なカメラワーク: プロンプトで「ドリーショット」「ズームイン」「パン」といったカメラワークを細かく指定できます。
プロンプトへの理解力向上: 複雑な指示や詳細な描写にも対応し、思い通りの動画を生成しやすくなっています。
画像からの動画生成: テキストだけでなく、画像を最初のフレームとしてアップロードし、その続きの動画を生成することも可能です。これにより、特定のキャラクターやシーンの一貫性を保ちやすくなります。
多岐にわたる活用例: SNS向けのプロモーション動画、広告クリエイティブ、企業研修用の教育コンテンツ、プレゼンテーション資料、企画段階のイメージ映像など、さまざまな用途で活用できます。
概要をざっくりつかんだら、早速やってみよう!

まずはVibeCodingレベルで
今回は花魁蓮華を試してみます。
添付の写真で、吉原にきたお客様を出迎える花魁蓮華。和の癒し系BGM
「……まぁ……よう言わはりましたなぁ、「月が綺麗ですね」やなんて。……その言の葉……それはまるで、声なき恋文どす。……今宵は「伽羅」にいたしましょ。……恋に似た香り。焚いた夜は、誰もがちょっと切なうなるんどす。」

まずは上記のような画像とプロンプトで試してみました。

できた!
実写に近い💦手は変わった動きだけど、おもてなし感はあるかな?
セリフがない~
でもあの指示文でこれができあがるのかぁと。
これは、なんとなくプロンプトではなく指示文から作成を依頼してみようと振り返り。
Geminiに指示文依頼
承知いたしました。添付のイラストの雰囲気を維持しつつ、お客様を迎える花魁蓮華が、穏やかな和風BGMが流れる中で、優しく語りかける10秒程度の短い動画生成の指示文を作成します。
Veo3 指示文:
プロンプト: 「夜。薄暗い室内。障子からぼんやりと月の光が差し込む中、美しい花魁蓮華が座ってお客様を迎えている。彼女は黒髪にべっ甲のかんざしを挿し、赤と黒を基調とした花柄の着物を着ている。手には扇子を持ち、微笑みを浮かべている。背景には蝋燭の柔らかな光が揺らめき、落ち着いた雰囲気。和風の癒し系BGMが静かに流れる中、彼女が優しく語りかける。カメラは彼女の顔をゆっくりとクローズアップする。」
追加指示:
動画の長さ: 10秒程度
音楽: 穏やかで癒し効果のある日本の伝統音楽(尺八や琴の音色など)を自動生成で付与。
音声: プロンプトにある花魁のセリフ「……まぁ……よう言わはりましたなぁ、「月が綺麗ですね」やなんて。……その言の葉……それはまるで、声なき恋文どす。……今宵は「伽羅」にいたしましょ。……恋に似た香り。焚いた夜は、誰もがちょっと切なうなるんどす。」を、優しく落ち着いた女性の声で生成し、リップシンクさせる。
画風: 添付のイラストの持つ、やや幻想的で柔らかな光の表現、繊細な描写を維持するように。実写のようなリアルすぎる表現は避ける。
できた✨
口の動きとセリフはなんとなく合ってる。
でも話してる!!
プロンプトの描写は細かい方がやっぱりいいのか~
最後の1本は妖精のダンス
スタイルを変更し妖精のダンスに挑戦!
「晴れた日の明るいお花畑。色とりどりの花々が咲き誇り、蝶やミツバチが飛び交っている。そんな中で、それぞれ異なる色の小さな羽を持つ、可愛らしい3匹の妖精たちが楽しそうにダンスをしている。一匹はピンク色の花びらのような羽、もう一匹は水色の透き通った羽、そしてもう一匹は黄色の太陽のような輝きを持つ羽を持っている。彼女たちはくるくると回ったり、手を繋いでスキップしたり、花から花へと飛び移ったりと、自由で優雅な動きを見せている。彼女たちの体は小さく、表情は笑顔で、キラキラとした魔法のような粒子が時折彼女たちの周りを舞っている。背景には、遠くまで続く花畑と、柔らかな光を放つ太陽が描かれている。BGMには、軽快で POPな音楽が流れている。」
色々ツッコミどこをはあるけど楽しそうにダンスしてる😢
外国で好まれそうなお顔だけど、羽の透明感も美しい。
Veo3にはどんな技術が使われているのか?
検証は完了したので、使われている技術について少し深堀り。
体感した上で、Geminiにどんな技術が使われているのか聞いてみました。
Veo3には、主に以下の技術が組み合わされており、これまでの動画生成AIを大きく進化させています。公開されている情報に基づくと、その中心は「マルチモーダル学習」と「物理法則の理解」にあると言えます。
1. マルチモーダル学習と生成
Veo3の最大の特徴は、映像と音声を同時に、かつ密接に関連付けて学習し生成する点です。これは、テキスト(プロンプト)、映像、音声といった複数の種類のデータを同時に扱う「マルチモーダルAI」の技術を応用したものです。
映像と音声の統合: プロンプトに記述された内容(例: 「雨が降る森の中」)から、視覚的な要素(雨粒、木々)だけでなく、聴覚的な要素(雨音、風の音、鳥のさえずり)も同時に生成されます。
リップシンクの精度向上: 人物が話す動画を生成する際、音声と口の動きが自然に同期する「リップシンク」の精度が大幅に向上しました。これにより、よりリアルで説得力のあるキャラクター表現が可能になっています。
2. 物理法則と空間認識の理解
Veo3は、現実世界の物理現象や空間の整合性を高いレベルで再現します。
物理的な挙動の再現: 水の流れや光の反射、重力といった物理法則をモデルが学習しているため、生成される映像がよりリアルに感じられます。例えば、ボールが地面に落ちた際の弾み方や、水たまりに映る景色の反射などが自然に表現されます。
空間の一貫性: 従来のAIモデルが苦手としていた、長い動画での被写体や背景の一貫性を維持する能力が向上しました。これにより、キャラクターの見た目が途中で変わったり、背景のオブジェクトが不自然に動いたりする問題が軽減されています。
3. 高度なプロンプト理解とカメラワークの制御
複雑なプロンプトの解釈: 複雑な指示や抽象的な概念(例: 「ノスタルジックな雰囲気」)を正確に解釈し、映像に反映させる能力が向上しています。
シネマティックな表現: 「ドリーショット」「クローズアップ」といった専門的なカメラワークの指示にも対応しており、プロンプトだけで映画のような演出が可能です。これは、AIがカメラの動きや視点を「物語」の要素として理解していることを示唆しています。
これらの技術は、Googleの親会社であるGoogle DeepMindの研究成果が統合されたものであり、動画生成AIの新たな可能性を切り開くものとして注目されています。
凄い✨
これはプロンプトでもっと詳細に創り込めば、オリジナルの世界が構築できそうですね!
