Google、DiffusionGemmaを発表:テキスト生成速度を最大4倍に高速化
3分まとめ
Googleが実験的オープンモデル「DiffusionGemma」を公開。
1トークンずつではなく、文章ブロックを並列生成して反復修正。
専用GPUで最大4倍高速としています。
ただし品質は標準Gemma 4より低め。
AI選びは性能順位ではなく、速度・品質・端末条件の設計になってきました。
何が起きたか
Google DeepMindが、テキスト拡散方式を採用した実験的オープンモデル「DiffusionGemma」を公開した。
一般的なLLMが左から右へ1トークンずつ生成するのに対し、DiffusionGemmaは256トークンのブロックを並列生成し、反復しながら文章全体を整える。専用GPUでは標準的な方式より最大4倍速く、H100で毎秒1,000トークン超、RTX 5090で毎秒700トークン超と説明されている。
モデルは総26BのMixture of Expertsで、推論時に3.8Bパラメータを有効化する。量子化時は18GB VRAM程度で動作し、Apache 2.0で公開された。
ただし、出力品質は標準のGemma 4より低く、本番品質を優先する用途にはGemma 4が推奨されている。高速化の恩恵は専用GPU上の低・中並列処理で大きく、Apple Siliconでは同等の効果が出ない可能性がある。
なぜ重要か
LLMの生成方式そのものを変え、ローカルAIの待ち時間を短縮しようとする重要な実験。
文章全体を見ながら修正できる双方向性は、インライン編集、コード補完、数式構造、アミノ酸配列など、前後関係を同時に扱いたい用途に向く可能性がある。
一方、速度と品質には明確なトレードオフがある。モデル選定では「最も賢いモデル」だけでなく、応答速度、端末条件、用途に必要な品質を分けて考える必要がある。
Study Redesignメモ
高性能GPUがある場合、ローカルの高速文章編集やコード補完を試せる。
機密データを外部へ送らず、低遅延で動く社内補助ツールの研究に使える。
下書きや候補生成はDiffusionGemma、最終品質はGemma 4などの役割分担を検討できる。
URL
いいなと思ったら応援しよう!
記事が役立ちましたら、応援いただけるとうれしいです。