見出し画像

ComfyUIでMiniMax H3のTurbo LoRAを試してみた

MiniMax H3がリリースされてから気づいてみれば3年(3日)の月日が経ちましたね。

かなりの時間がたったので、2年前(2日前)に公開した高速化方法からまた進化したので、試していきます。

4ステップで動画生成をするためのLoRAがリリースされた感じですね。
これを使ってみます。


環境

OS:Windows 11
GPU:GeForce RTX 4090
CPU:i9-13900KF
memory:128G


構築手順

CUDA13は必須ですので、こちらの手順などを参考に、CUDAのバージョンを更新してください。

以下のカスタムノードをインストールして、ComfyUIを最新化してください。

cd ComfyUI\custom_nodes
git clone https://github.com/kijai/ComfyUI-SolAttn_triton.git


モデル

minimax_h3_fl2va_pruned_int8_convrot.safetensorsをダウンロードして「ComfyUI\models\diffusion_models」に配置

qwen3vl_32b_minimax_h3_int8_convrot.safetensorsをダウンロードして「ComfyUI\models\text_encoders」に配置
(50X0シリーズなら、qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsも可)

minimax_h3_video_vae_fp16.safetensorsをダウンロードして「ComfyUI\models\vae」に配置

minimax_h3_video_vae_int8_convrot.safetensorsをダウンロードして「ComfyUI\models\vae」に配置

minimax_h3_turbo_4step_ckpt500_pruned_comfyui.safetensorsをダウンロードして「ComfyUI\models\loras」に配置


ワークフロー

ワークフローは以下です。

ワークフローについては、以下で少しだけ解説しているので、興味があればご覧ください。


生成結果

生成結果は以下です。
生成時間は210秒。
CPUメモリ:75GB
GPUメモリ:67GB(VRAM21GB+共有メモリ46GB)

LoRAなしの20ステップと比較すると以下です。
20ステップは、メモリはほとんど同じですが、生成時間は約10分です。


感想

少なからず劣化は感じますね。音声は壊滅的。
生成速度はいいですね。
最適化ができれば音声も動画もいい感じになる可能性はあると思いますが、現状だと試作品が作れるぐらいですね。


残骸達

結局LoRAの紹介と、しれっとVAEだけ変更にとどまってしまいましたが、触る分には色々触ってます。


唯一使い道がありそうなのは以下です。

以下のカスタムノードをインストールして、VAEを差し替え。

cd ComfyUI\custom_nodes
git clone https://github.com/Saganaki22/ComfyUI-sol-attn.git

qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsをダウンロードして「ComfyUI\models\text_encoders」に配置(4090でも)

生成時間は230秒で、少し遅くなりますが、CPUメモリは60GB、GPUメモリは55GB(VRAM19GB+共有メモリ36GB)となります。
更に高解像度や長い尺の動画を生成するのには向いてそうですね。


あとは、今回は使わなそうなツールたちです。

まずこのカスタムノードですね。
EasyCacheの方が生成速度は軍配。
音声の結果については、マシらしいのですが、そもそも今回のLoRAを使うと音声が崩れるので、いいところなし。

以下にも4ステップLoRAはありますが、中身が同じだったり、pruned向けじゃなかったりで、今回のに落ち着いてます。


追記(20260807)

音声改善版です。

以下のカスタムノードをインストールして、loraを差し替え。

cd ComfyUI\custom_nodes
git clone https://github.com/Larryvrh/ComfyUI-MiniMax-H3-Turbo.git

minimax_h3_turbo_4step_ckpt500.safetensorsをダウンロードして「ComfyUI\models\loras」に配置

生成時間は210秒で、CPUメモリは62GB、GPUメモリは55GB(VRAM19GB+共有メモリ36GB)となります。

音声も問題ないですし、メモリも生成時間も最適なので、これでいい気がしますね。


いいなと思ったら応援しよう!