ComfyUI向けのCUDAをCUDA13に上げてMiniMax H3を試してみた
MiniMax H3の記事を投稿したんですが、なんだか他の方より生成速度が遅いようなので、調査してみました。
どうやらCUDAのバージョンが13以上になると、いろいろ変わってるみたいですね。(これまではCUDA12.8を使っています。)

自分の手元にあるGPUが4090なので、Blackwellアーキテクチャの恩恵は受けられませんが、50X0シリーズは、nvpf4での高速化が期待できそうです。

というわけで、今回はCUDAを13に上げて、生成速度が速くなるのかを確認します。
ComfyUIのpython環境を改造するので、自信のあるかただけ試してください。
環境
OS:Windows 11
GPU:GeForce RTX 4090
CPU:i9-13900KF
memory:128G
設定
以下の設定に変更します。
・Python:3.11.6(変更なし)
・torch:2.11.0+cu130
・triton-windows:3.7.1
手順
以下のコマンドを実行
# ComfyUIポータブル版のフォルダに移動
cd ComfyUI_windows_portable
# コマンドプロンプトをpowershellに変更
powershell
# 0. バックアップ(ポータブル環境の最も確実なロールバック手段。数GBありますが強く推奨)
Copy-Item -Recurse python_embeded python_embeded_backup_cu128
# 1. PyTorch本体をCUDA 13版へ
.\python_embeded\python.exe -m pip install --upgrade torch==2.11.0+cu130 torchvision==0.26.0+cu130 torchaudio==2.11.0+cu130 --extra-index-url https://download.pytorch.org/whl/cu130
# 2. triton-windowsをtorch 2.11対応版へ
.\python_embeded\python.exe -m pip install --upgrade triton-windows==3.7.1.post27
# 3. sageattentionをcu130ビルドに差し替え
.\python_embeded\python.exe -m pip install --force-reinstall --no-deps https://github.com/woct0rdho/SageAttention/releases/download/v2.2.0-windows.post6/sageattention-2.2.0+cu130torch2.10.0andhigher.post6-cp310-abi3-win_amd64.whl
# 4. 旧torch(2.7)向けビルドで確実に壊れるものを削除(ComfyUI本体はPyTorchアテンションに自動フォールバックするので動作に支障なし)
.\python_embeded\python.exe -m pip uninstall -y xformers flash_attn
# 5. 動作確認
.\python_embeded\python.exe -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.is_available(), torch.cuda.get_device_name(0))"
# 期待される確認結果: 2.11.0+cu130 13.0 True NVIDIA GeForce RTX 4090
# 問題が起きた場合のロールバックは、python_embeded を削除して python_embeded_backup_cu128 をリネームして戻す結果
以下の記事で生成したワークフローを試します。
「--reserve-vram 6.0」はなくしました。
生成結果は以下です。
生成結果自体はどうでもいいですが、生成時間はCUDA12.8の10分程度から変わってます。
生成時間は132秒で、CPUメモリは72GB、GPUメモリは67GB(VRAM22GB+共有メモリ45GB)でした。
MiniMax H3 I2V(CUDA13 記事用) pic.twitter.com/Avt9YZRA3z
— kongo jun / 混合 順 (@jun_kongo) August 3, 2026
感想
はやーい。
オプションもいらなーい。これは速いですねぇ。
他のモデルも早くなるのかねぇ。
色々試さねばならぬ。
