diffusiongemma-26B-A4B-it を VRAM 足りなくたって動かしてみたい
まとめ
CPU で動かすだけ。動いた。それだけ。
とはいえ、モデルカードで提示されている CUDA 前提のビルドになっています。
対象モデル
動かす
環境構築
既存の llama.cpp を git clone したリポジトリにいる前提
rm -fr build
git fetch origin pull/24423/head:diffusiongemma && git checkout diffusiongemma
cmake -B build -DGGML_CUDA=ON
cmake --build build -j --config Release --target llama-diffusion-cli
hf download unsloth/diffusiongemma-26B-A4B-it-GGUF \
--local-dir unsloth/diffusiongemma-26B-A4B-it-GGUF \
--include "*Q4_K_M*"実行
本来は `-ngl 99` で、GPU 利用が提示されているが、これを `-ngl 0` で CPU のみに。
./build/bin/llama-diffusion-cli \
-m unsloth/diffusiongemma-26B-A4B-it-GGUF/diffusiongemma-26B-A4B-it-Q4_K_M.gguf \
-ngl 0 -cnv -n 2048 --diffusion-visual