無料なのにRunway/KLING超え!? オープンソースAI「Wan2.1 FusionX」の動画クオリティが異次元すぎた👀
どうも皆さん!洗濯するたびに片方だけ行方不明になる靴下の謎、異次元への扉が洗濯機にあると信じています、 葉加瀬あい(ハカセアイ) です!
今回のNote記事の内容は 「YouTube動画版」 でも見れますので、こちらからどうぞ!
今回は、プロ顔負けのリアルで滑らかな動画を、

最短6ステップで簡単に生成できる、とんでもないAIモデル

「Wan 2.1 FusionX」について徹底解説します!これ、はっきり言って、ヤバすぎます!

超高品質な映像が手に入るだけでなく、オープンソースでありながら、名だたる商用サービスにも負けない、

いえ、むしろ凌駕するほどの 高いクオリティ だなんて、本当に驚きです!

ということで今回お話しする内容はこんな感じです!
① 最短6ステップでプロ級動画!「Wan 2.1 FusionX」が実現する、圧倒的なクオリティと高速生成の秘密に迫る!
② 無料で商用サービスを凌駕!?「Fusion」が生み出す、テキスト&画像からの滑らか動画生成の驚くべき実力とは?
③ ワンクリックで動画クリエイターに!ComfyUIを使った環境構築からプロンプト活用まで、今日から使える実践テクニックを徹底解説!

それと、Youtube では note の内容をAIで動画に変換して公開しているので、まだの方は noteのフォロー や YouTubeのチャンネル登録 もお願いします!

なお、 全体公開バージョン は動画のレンダリングが終了し次第、こちらのリンクからアクセスできるので、よかったら見てみてください!
それでは、本日もよろしくお願いします!
「Fusion」が鍵!モデルの仕組み概要
さて、この「Wan 2.1 FusionX」のすごい仕組みについて、少しだけ触れてみましょう。
このモデルの最大の秘密は、その名前にも含まれている「 Fusion(融合) 」にあるんです!

もともと人気の高かった「Wan 2.1」モデルをベースにして、複数の 最先端技術がギュッと詰め込まれている んです!

そして、これらの技術が絶妙に組み合わさり、まるで最高のオーケストラのようにハーモニーを奏でることで、驚きのクオリティを実現しているんです。

具体的には、以下のような、それはもう素晴らしい技術がギュッと詰まっているんです!
搭載されている素晴らしい技術!
CausVid(コーズビッド)
まずご紹介したいのが、 CausVid(コーズビッド) です。
この技術は、動画のシーンの流れをより自然にしてくれるだけでなく、さらに動画の生成スピードを劇的に速くしてくれるんです! 本当にすごいですよね⋯!

このCausVidという技術については、私も以前、こちらのYouTube動画や記事で詳しくご紹介させていただきました!よろしければご覧になってみてください!
https://note.com/ai_hakase/n/n923915989aaf

AccVideo(アックビデオ)
次に、 AccVideo(アックビデオ) という技術です。
これは、動画の時間的なズレをピタッとなくして、まるで目の前で見ているかのようにリアルに見せてくれる技術なんです。起動もとっても速いですし、動画が驚くほど滑らかに流れるようになるんですね!
MoviiGen1.1(ムービージェン1.1)
そして、 MoviiGen1.1(ムービージェン1.1) も搭載されています。
この技術のおかげで、まるで映画のような滑らかな動きや、プロが作ったような美しい照明効果をプラスすることができるんです。

MPS Reward LoRA
さらに、 MPS Reward LoRA という特別な技術も使われています。
これは、動画のダイナミックな動きや、細かい部分までしっかり調整するのに役立っているんです!
Custom LoRAs(カスタム LoRA)
もちろん、上記以外にも、独自の Custom LoRAs技術が使われています!
この技術によって、動画のテクスチャ(質感)やクリアさ(鮮明さ)、そして人物の顔の表現まで、細かく向上させているそうなんです。

これらの技術が、最初からモデルに「焼き込み済み」(追加でファイルを読み込む手間がいらない状態)になっているので、ダウンロードするだけで 手間なく最高のクオリティが手に入っちゃう んですね!

つまり、これらの多様な技術が 一つのモデルに「融合」 されているんですね! まさに進化版の「Wan 2.1」モデルというイメージです。

テキストから動画を生成(Text-to-Video)
また、「Wan 2.1 FusionX」は、ただ技術が詰まっているだけでなく、文章から動画を生成する 「Text-to-Video(テキストトゥビデオ)」 機能にしっかり対応しています。

画像から動画を生成(Image-to-Video)
さらに、画像から動画を生成する 「Image-to-Video(イメージトゥビデオ)」 機能にも対応しています。

驚異的な性能について
このように、「Wan 2.1 FusionX」の性能は、まさに「驚異的」の一言に尽きます!公開されている情報によると、こんなにすごい結果が出ているんです!
生成スピードがとにかく速い!
なんと、ベースモデルと比べて 最大50%も生成が速くなる そうなんです! これは本当に驚きですよね!
しかも、最低品質であれば、たった 6ステップ で動画が生成できてしまうなんて、信じられますか!? 最高品質を目指す場合でも、8〜10ステップという驚きの速さで、あっという間に動画が完成するんです! 時間をかけずに試せるのは嬉しいポイントです。

私も実際に使ってみたんですけど、こんな感じで5秒くらいの動画が、3分かからないぐらいで生成できています!

プロンプト(AIへの指示テキスト)にしっかり追従!
皆さんの「こうしたい!」というイメージが、プロンプトとして入力した通りに、そのまま動画に反映されやすいのも大きな魅力です。 細かいニュアンスまで汲み取ってくれるのは頼もしいですよね!

WaN 2.1 FusionXのクオリティ向上に注目!
そして何よりも、WaN 2.1 FusionXでは、従来のWaN 2.1モデルから、 生成される動画の品質が格段に向上 しているんです! 特に、動画で人物を表現する能力が飛躍的に上がっていて、オープンソースでありながら、 KLING(クリング) や Runway(ランウェイ) 、 Vidu(ヴィドゥ) といった、名だたる商用サービスよりも 質が高い と評価されているんです!これは本当にすごいことですよね!

一応、こちら私が今回お配りするワークフローで試してみた結果です。

かなり自然に綺麗な動画が作れていると思いませんか?

このレベルの動画が、なんと無料で作り放題なのは、本当に素晴らしいですよね!

誰が開発したの?オープンソースコミュニティの力!
ところで、この素晴らしい技術は、一体誰が開発したのか、気になりますよね。
「Wan 2.1 FusionX」は、特定の企業や研究機関が開発したというよりは、 オープンソースコミュニティ の情熱によって生み出されたモデルなんです!
https://huggingface.co/vrgamedevgirl84/Wan14BT2VFusioniX

特に、Reddit(レディット)の「Comed_Ai_n」さんやHugging Faceでモデルを公開されている「vrgamedevgirl84」さんのような、 有志のクリエイターや開発者の方々 が中心となって、この画期的な技術を世に送り出してくださったんです!

WaN 2.1 FusionXをいますぐ使ってみよう!🚀
さて、このWaN 2.1 FusionXがどれだけすごいかはもうお分かりいただけたかと思いますが、一番気になるのは「どうやったら使えるの!?」ということですよね!
ご安心ください、初めての方でもチャレンジしやすいように、アクセス方法から具体的な使い方までご紹介します!

1. どうやって使うの?アクセス方法をチェック!
このWaN 2.1 FusionXは、Webサービスのようにブラウザで簡単にアクセスして使えるタイプではなく、ご自身のパソコンにAIモデルとそれを動かすためのツールを導入して使うのが基本になります。
少し難しく感じるかもしれませんが、安心してください!ここの手順についても、皆さんが安心して使えるように簡略化して、私の本でハンズオンで解説していきます!

まず大前提としてなんですけども、 ベースとなる環境は「ComfyUI(コンフィユーアイ)」 です!

WaN 2.1 FusionXは、特に ComfyUI というAIのワークフロー構築ツールに最適化されています。ComfyUIは、画像を生成したり、今回のモデルのように動画を生成したりする際に、どんな工程でAIを動かすかを視覚的に組み立てられる、とっても便利なツールなんです!
ご自身のPCにComfyUIを導入し、そこにWaN 2.1 FusionXのモデルファイルを組み込んで使います。
ここで一つポイントなんです!ComfyUIはオープンソース、つまり 誰でも自由に利用・改変できるソフトウェア なので、 無料で利用できる んです!これは嬉しいですよね。

一応、今回はこちらのセッティングの部分だけいじれば動くようになっているので、難しく考える必要はありません!

本当にこちらの画像の赤枠で囲ったように、 画像を一枚 と、「こんな風に動かしたい!」という ふわっとした日本語のプロンプト を入力するだけで、動画が作れちゃうんです!

もし、それでももっとちゃんとComfyUIを理解してから使ってみたいな、という方に関しましては、こちらのYouTube動画などで、サクッと学べるものも用意してあります。よかったら見てみてください!
https://note.com/ai_hakase/n/n5486e3a98997?magazine_key=m574f2e03ca50&from=membership-magazine

ComfyUIの導入、簡単になったんです⋯!
そこで、ComfyUIは、基本的に皆さんのPCか、あるいはクラウドサービスなどを使って、その上にインストールして使うものなんです⋯!
ただ、正直、セットアップが少し面倒に感じることもあるんです⋯!
そこで、私の方で、 入れ物からボタンをポチポチしていくだけ で使えるようにしたものを用意してみました!

ノートブックを使った簡単な導入
基本的には、こちらの ノートブック というものを使って、 ワンクリックで導入 できるんです!

実行はとっても簡単です!
ノートブックを使って、 実行ボタンを押すだけ で⋯

ほら、こんな風に、とても 簡単に開ける ようになっているんです!

ワークフローで準備もラクラク!
開いた後も、とっても簡単なんです!
このように、 ワークフローをドラッグ&ドロップして読み込んでいただく だけでいいんです⋯!

本来であれば、ModelやVAE、Clip Visionなどの色々なモデルをダウンロードしたりといった準備が必要なのですが、こちらのワークフローを使えば、 全て一度にダウンロードできる ようにしてあるんです!

プロンプト作成もAIにお任せ!
それと、動画生成AIのプロンプトって、考えるのが少し長かったりして面倒に感じることもありますよね。そこも考慮して、 画像を1枚選んで、生成してほしい内容を簡単に日本語で入力するだけ で、 AIがプロンプトを考えてくれる ように設計してみたんです!

クラウドでもPCでも使えます!
一応、これらのサービス自体は、 クラウドサービスのPaperspace というものから動かしていく予定です!
Paperspaceの詳しい情報や、今回ComfyUIを動かすときの注意点、それからちょっとしたティップスなどは、 こちらにある記事やYouTube動画 で解説しているので、よかったら見てみてください!
もちろん、 ご自身のPCから使いたい という方も大丈夫です!こちらのノートブックワークフローをドラッグ&ドロップしてインポートしていただくだけなので、簡単に使えるかと思います!

実際に使ってみると…
本当にこれ、使っていただけると驚くと思います! 画像1枚と、適当な日本語のプロンプトの指定だけ で⋯
楽に綺麗な動画が、しかも高速で 作れるんです!びっくりされると思いますので、ぜひ、こちら最後まで確認してみてください!

ということで、ここからは、私のNoteメンバーシップ 「あいらぼ(Ai-Lab)」 にご参加の皆さん向けに、さらに詳しい解説をしていきたいと思います!
「あいらぼ(Ai-Lab)」には、現在、 400人を超えるAIクリエイターさん が参加されていて、最新のトレンドAI情報はもちろん、公式LINEとの連携でAIに関するお悩み解決なども行っているんです!

人数制限 を設けているので、ご興味のある方は、ぜひお早めにこちらのリンクから入門して、続きをご覧ください!
ということで、「あいらぼ(Ai-Lab)」に入門された皆さん、お待たせいたしました!
早速、続きをやっていきましょう!
先ほどもお見せした通り、こんな感じの ワークフロー を使って動かしていきます!

利用環境について
それで利用環境については、ローカル環境、つまり皆さんのPC上でも動くのですが、少し知識が必要なので、基本的には
ここから先は
この記事が気に入ったらチップで応援してみませんか?
