見出し画像

diffusiongemma-26B-A4B-it を VRAM 足りなくたって動かしてみたい

まとめ

CPU で動かすだけ。動いた。それだけ。

とはいえ、モデルカードで提示されている CUDA 前提のビルドになっています。

対象モデル

動かす

環境構築

既存の llama.cpp を git clone したリポジトリにいる前提

rm -fr build

git fetch origin pull/24423/head:diffusiongemma && git checkout diffusiongemma
 
cmake -B build -DGGML_CUDA=ON

cmake --build build -j --config Release --target llama-diffusion-cli

hf download unsloth/diffusiongemma-26B-A4B-it-GGUF \
  --local-dir unsloth/diffusiongemma-26B-A4B-it-GGUF \
  --include "*Q4_K_M*"

実行

本来は `-ngl 99` で、GPU 利用が提示されているが、これを `-ngl 0` で CPU のみに。

./build/bin/llama-diffusion-cli \
  -m unsloth/diffusiongemma-26B-A4B-it-GGUF/diffusiongemma-26B-A4B-it-Q4_K_M.gguf \
  -ngl 0 -cnv -n 2048 --diffusion-visual


いいなと思ったら応援しよう!