見出し画像

【これ革命かも❓️】顔がブレない進化系AI「Phantom」徹底解説🔥WAN2.1 FusionXとの融合で爆速&高品質動画が簡単に作れる💡

どうも皆さん!USBを挿す時、必ず2回は裏表を間違えてしまう、あの三度目の正直を信じております、 葉加瀬あい(ハカセアイ) です!

今回のNote記事の内容は 「YouTube動画版」 でも見れますので、こちらからどうぞ!

ということで今回ご紹介するのは、新しい動画生成AIの Phantom ですね!  

新しい動画生成AI「Phantom」ってどんな技術?

こちらのPhantomは、 WAN2.1関連の技術 なんです!
テキストや静止画から、 すごいリアルで、しかも思い通りの動きをあっという間に生み出せる ようになったんです!  

特徴としては、このように、 キャラクターの一貫性とかをかなり、自然に強力に保持できる動画生成AI なんです。

そして今回、このPhantomが WAN2.1 Fusion Xと融合 しまして、本当にすごいことになったんですね!  

PhantomとFusionXの融合による進化

FusionXについては、以前こちらで解説しましたね!

一応知らない方のために軽く説明すると、FusionXは、 5秒くらいの動画が約3分でとてもきれいに生成できるようになる というものでした。

つまり、このWAN2.1とFusionXが融合したPhantomを使えばですね!
同じように 約3分という高速な動画生成もできる んです!

しかも、 生成される動画は綺麗 ですし、 顔の一貫性も保てる なんて、もういうことなしですね!  

その他にも、他にはない すごい特徴 があるので、これは絶対にチェックしておいた方がいいです!

一応、Phantom自体は前からある技術なんですけれども、今まであまり日の目を浴びなかったせいか、知らない方も多いと思うので、今回は、その詳細やどんな技術なのかについてや、具体的な使い方について詳しく解説していきます!  

ということで今回お話しする内容はこんな感じです!

  • ① まるで魔法!動画全体でキャラクターの見た目が変わらない「驚異のID保持技術」の秘密とは?

  • ② 「遅い」は過去の話!高速&超高品質な動画生成を実現する「Phantom」と「WAN2.1 FusionX」の強力タッグ

  • ③ 無料なのにプロレベル!「Phantom」を今すぐ使いこなすためのComfyUI活用術と、無限に広がる未来の可能性

それと、Youtube では note の内容をAIで動画に変換して公開しているので、まだの方は noteのフォローYouTubeのチャンネル登録 もお願いします!

https://note.com/ai_hakase

なお、 全体公開バージョン は動画のレンダリングが終了し次第、こちらのリンクからアクセスできるので、よかったら見てみてください!

それでは、本日もよろしくお願いします!


Phantomの核心技術「クロスモーダルアライメント」

この技術自体は、どんな仕組みで、どんなところが優れているのか、まずご説明したいと思います。

「Phantom」モデルの 一番すごいところ は、「 クロスモーダルアライメント 」という技術を使っていることです。

これは、テキストや画像といった異なる種類の情報と、生成する動画の動きを、AIが 強力に結びつける技術 なんです!

これにより、動画の中でキャラクターや物が「あれ、変わっちゃった?」とならずに、 ずっと同じ姿で動き続けることができる ようになりました!

さらに、カメラの動きやアングルなどを細かく制御できるようです。

これが本当にすごいところなんですね⋯!  

このPhantomの ID保持(一貫性) という技術は、本当に驚くべき点の一つなんです!

動画の被写体が複数登場する場合でも、それぞれのIDをしっかりと保持できるところが素晴らしいんです⋯!

なんと、Phantomでは たった2枚の静止画参照画像 として使うだけで、特定の人物やキャラクターを動画全体を通して登場させることが可能なんですね!

それに加えて、簡単なテキスト指示、つまり プロンプト を使うことで、元の動画にはなかった動きを追加したりすることもできてしまうんです!

動画生成AIに詳しい方の中には、「あれ?この技術、Pikaなどの他のAIと似ている部分があるかも?」と感じる方もいらっしゃるかもしれません!  

無料なのにこの性能!Phantomの評価は?

オープンソースで有料級の品質!

Phantomのすごい点は、 オープンソース(無料) で提供されているにも関わらず、他の 有料動画生成AIレベルの性能 を持っているということなんです!

品質としては、おおよそKiling 1.6と同程度とお考えいただければ分かりやすいかもしれません。

ID保持性能がとっても良いんです!

特に注目していただきたいのが、先ほどもご紹介した ID保持の性能 です!

IDと記載されている部分は、参照画像で指定された人物や商品が、動画内でどれだけ高い精度で反映されるかを示すものです。

実際のところ、他の商用AIと比較すると、まだ全てにおいて完璧というわけではありません。

ですが、Phantomは無料でありながら、これほど高い一貫性を保持できているというのは、本当に素晴らしいことなんです!

もちろん、例えば、プロンプトの指定が意図通りに反映されにくい部分とか、安定性に欠けるすこし部分とか、

複数の被写体が登場する場合に、特徴が混ざってしまう マルチサブジェクトの混同 といった課題も確認されていますが、個人的な感触としては、プロンプトで きちんと細かく指定してあげる ことで、ある程度改善されるように感じています!

気になる動画生成時間問題、どうなったの?

さて、ここまでPhantomの驚くべき技術についてお伝えしてきましたが⋯!
では、なぜ今まであまり皆さんに紹介していなかったかと言いますと、実は 動画生成に少し時間がかかっていた という理由があったんです。

ところが、これが最近、 WAN2.1 FusionXという技術との融合 によって、大きく改善されたんですね!

詳しい情報は、こちらのYouTubeチャンネルや、この動画の元になっているNote記事などで、ぜひチェックしてみてください!

一応簡単にだけ説明しておくと、Wan2.1 FusionXシリーズは、「WAN 2.1」というベースモデルに、「CausVid」や「AccVideo」、「MoviiGen1.1」といった、最新の 研究グレードモデル を複数組み合わせることで作られているんです。

つまり、研究の最前線で開発された、とっても高性能なAIモデルのことなんですね!

これらの素晴らしい技術が組み合わされているからこそ、 非常に高品質かつ高速な動画生成が可能になっている というわけなんですよね!

驚きの生成速度!

なので、Phantomでも、本当に綺麗な動画が、だいたい 5秒くらいの短いものでしたら、2分から3分くらいでつくれてしまう んです⋯! すごくないですか?

実際に私もこんな感じで試してみたんです!

たった2枚の画像から、ちゃんとその特徴を反映させた動画が綺麗に作れました!  

競合技術との比較も!

ちなみに余談なんですけども、WAN2.1の競合であるHunyuan Videoからは、こちらの記事でもご紹介しているHunyuan-Customという機能で、被写体の顔の一貫性を強力に保つことができるモデルがあったんです。

Wan2.1 FusionXは、それの WAN2.1バージョン という風にも考えてもらって大丈夫です!

開発元はどこ?

それで、一応このPhantomについては、開発元とか、結構質問されることが多いんですけども、一応⋯ 主に中国のテクノロジー企業である ByteDance Research が中心となって開発を進めているようです。

ByteDanceといえば、TikTokで有名ですよね!そのほかにも最先端のAI技術を世に送り出すことで知られています。

どうやって使うの?

それで、このファントムなんですけれども、実際にどうやって使えばいいのかとか、気になっている人も多いかと思います。ここからその説明をしていきます!

一応結論から申し上げると、いろいろ使い方とかはあるんですけども、基本的にはこんな感じの ComfyUIという環境から実行していく 雰囲気になります。

もしかしたらここだけ見るとちょっと難しく見えるかもしれないんですけど!

そんなことはありません!

皆さんが設定する部分は、こちらの画像の インプット と、

いつものように生成してほしい内容を ふわっと書いていただくだけ なんです!

たったこれだけで、 後はAIが勝手にそれっぽい内容を考えてくれて、その人間や背景を動画として出力して作ってくれるといった雰囲気 になります!  

それと、本当はclip modelとかVAEとかloraとか、いろんなちょっとめんどくさいファイルのダウンロードがあるんですけど、そこも ワンクリックで自動化しているのでご安心ください

それと、ComfyUIは基本的に無料で使えるんですけども、ちょっとセッティングとかが結構めんどくさいのが正直なところです。

なので、私の方で、またいつものようにこんな感じの ワンクリックインストーラーを使って説明をしていきたい かと思います。

ファイルを実行すると、 こちらの画像のように、ComfyUIを立ち上げることができるんです !とっても簡単ですよね!ぜひぜひ参考にしてみてください!

ということで、ここからは私のNoteメンバーシップ「あいらぼ(Ai-Lab)」にご参加の皆さん向けに、さらに詳しい解説をしていきたいと思います!

この「あいらぼ(Ai-Lab)」には、なんと現在、 400人を超えるAIクリエイターさんたち が集まってくださっているんです!そこでは、最新のAIトレンド情報をいち早くゲットできたり、公式LINEとの連携でAIに関する疑問やお悩みも解決できちゃうんですよ⋯!

今は少し 人数制限 をさせていただいているので、もし「気になるな⋯」と思ってくださった方は、ぜひぜひ! お早めにこちらのリンクから入門して、続きの詳しい解説を見てみてくださいね

さあ!ということで、「あいらぼ(Ai-Lab)」に新しく入門してくださった皆さん!大変お待たせいたしました!早速、 続きの作業を進めていきましょう

先ほどもちょっぴりお見せしました通りですね!

こちらのワークフロー を使って、今回の作業をご説明していきたいと思っています!

ここから先は

8,528字 / 51画像 / 2ファイル

あいらぼ (Ai-Lab) は、NoteとYouTubeを活用して、皆さんを「生成AIを使いこなす側…

🐾あいらぼ:記事|動画|ComfyUI ワークフロープラン

¥1,980 / 月
あと6人募集中

🐾あいらぼ:記事|動画|WF プラン(質問・サポート付き)

¥4,980 / 月
あと8人募集中

この記事が気に入ったらチップで応援してみませんか?