見出し画像

Google、DiffusionGemmaを発表:テキスト生成速度を最大4倍に高速化

3分まとめ

Googleが実験的オープンモデル「DiffusionGemma」を公開。
1トークンずつではなく、文章ブロックを並列生成して反復修正。
専用GPUで最大4倍高速としています。
ただし品質は標準Gemma 4より低め。
AI選びは性能順位ではなく、速度・品質・端末条件の設計になってきました。

何が起きたか

Google DeepMindが、テキスト拡散方式を採用した実験的オープンモデル「DiffusionGemma」を公開した。

一般的なLLMが左から右へ1トークンずつ生成するのに対し、DiffusionGemmaは256トークンのブロックを並列生成し、反復しながら文章全体を整える。専用GPUでは標準的な方式より最大4倍速く、H100で毎秒1,000トークン超、RTX 5090で毎秒700トークン超と説明されている。

モデルは総26BのMixture of Expertsで、推論時に3.8Bパラメータを有効化する。量子化時は18GB VRAM程度で動作し、Apache 2.0で公開された。

ただし、出力品質は標準のGemma 4より低く、本番品質を優先する用途にはGemma 4が推奨されている。高速化の恩恵は専用GPU上の低・中並列処理で大きく、Apple Siliconでは同等の効果が出ない可能性がある。

なぜ重要か

LLMの生成方式そのものを変え、ローカルAIの待ち時間を短縮しようとする重要な実験。

文章全体を見ながら修正できる双方向性は、インライン編集、コード補完、数式構造、アミノ酸配列など、前後関係を同時に扱いたい用途に向く可能性がある。

一方、速度と品質には明確なトレードオフがある。モデル選定では「最も賢いモデル」だけでなく、応答速度、端末条件、用途に必要な品質を分けて考える必要がある。

Study Redesignメモ

高性能GPUがある場合、ローカルの高速文章編集やコード補完を試せる。
機密データを外部へ送らず、低遅延で動く社内補助ツールの研究に使える。
下書きや候補生成はDiffusionGemma、最終品質はGemma 4などの役割分担を検討できる。

URL

https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/

いいなと思ったら応援しよう!

StudyRedesign AI Review 記事が役立ちましたら、応援いただけるとうれしいです。