見出し画像

ComfyUI向けのCUDAをCUDA13に上げてMiniMax H3を試してみた

MiniMax H3の記事を投稿したんですが、なんだか他の方より生成速度が遅いようなので、調査してみました。

どうやらCUDAのバージョンが13以上になると、いろいろ変わってるみたいですね。(これまではCUDA12.8を使っています。)

自分の手元にあるGPUが4090なので、Blackwellアーキテクチャの恩恵は受けられませんが、50X0シリーズは、nvpf4での高速化が期待できそうです。

というわけで、今回はCUDAを13に上げて、生成速度が速くなるのかを確認します。

ComfyUIのpython環境を改造するので、自信のあるかただけ試してください。


環境

OS:Windows 11
GPU:GeForce RTX 4090
CPU:i9-13900KF
memory:128G


設定

以下の設定に変更します。

・Python:3.11.6(変更なし)
・torch:2.11.0+cu130
・triton-windows:3.7.1


手順

以下のコマンドを実行

# ComfyUIポータブル版のフォルダに移動
cd ComfyUI_windows_portable

# コマンドプロンプトをpowershellに変更
powershell


# 0. バックアップ(ポータブル環境の最も確実なロールバック手段。数GBありますが強く推奨)
Copy-Item -Recurse python_embeded python_embeded_backup_cu128

# 1. PyTorch本体をCUDA 13版へ
.\python_embeded\python.exe -m pip install --upgrade torch==2.11.0+cu130 torchvision==0.26.0+cu130 torchaudio==2.11.0+cu130 --extra-index-url https://download.pytorch.org/whl/cu130

# 2. triton-windowsをtorch 2.11対応版へ
.\python_embeded\python.exe -m pip install --upgrade triton-windows==3.7.1.post27

# 3. sageattentionをcu130ビルドに差し替え
.\python_embeded\python.exe -m pip install --force-reinstall --no-deps https://github.com/woct0rdho/SageAttention/releases/download/v2.2.0-windows.post6/sageattention-2.2.0+cu130torch2.10.0andhigher.post6-cp310-abi3-win_amd64.whl

# 4. 旧torch(2.7)向けビルドで確実に壊れるものを削除(ComfyUI本体はPyTorchアテンションに自動フォールバックするので動作に支障なし)
.\python_embeded\python.exe -m pip uninstall -y xformers flash_attn

# 5. 動作確認
.\python_embeded\python.exe -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available(), torch.cuda.get_device_name(0))"

# 期待される確認結果: 2.11.0+cu130 13.0 True NVIDIA GeForce RTX 4090
# 問題が起きた場合のロールバックは、python_embeded を削除して python_embeded_backup_cu128 をリネームして戻す


結果

以下の記事で生成したワークフローを試します。
「--reserve-vram 6.0」はなくしました。

生成結果は以下です。
生成結果自体はどうでもいいですが、生成時間はCUDA12.8の10分程度から変わってます。

生成時間は132秒で、CPUメモリは72GB、GPUメモリは67GB(VRAM22GB+共有メモリ45GB)でした。


感想

はやーい。
オプションもいらなーい。これは速いですねぇ。
他のモデルも早くなるのかねぇ。
色々試さねばならぬ。

いいなと思ったら応援しよう!