「DiffusionGemma」は「Gemma 4」をベースに「Gemini Diffusion」の研究成果を組み合わせており、以下の特徴を備える。
・高速な推論 :GPUで最大4倍高速なトークン生成。「NVIDIA H100」1基で1,000トークン/秒超、「GeForce RTX 5090」でも700トークン/秒超を達成
・手頃なハードウェア要件 :基本となる「26B MoE」は、推論時に3.8Bしかアクティブにしない。量子化すればハイエンドコンシューマーGPUのVRAM 18GB以内に収まる
・双方向アテンション :並列生成される256トークンが互いを参照できるため、インライン編集やコードの穴埋め(infilling)、アミノ酸配列、数式グラフといった非線形な領域に強い
・自己修正 :ブロック全体を一度に評価しながら反復的に出力を洗練し、誤りをリアルタイムで修正できる
「DiffusionGemma」は速度と並列生成を優先した実験的モデルであるため、出力品質は標準の「Gemma 4」より低くなる。また、クラウドで大量のリクエストをさばくなら「Gemma 4」に優位がある。しかし、ローカルで多少の品質より速度を重視したいシナリオでは、「DiffusionGemma」に分がある。また、ファインチューニングによって、数独を解くといった自己回帰型モデルが不得手とするタスクに対応させることも可能だ。