Google、Gemma 4 にマルチトークン予測搭載で推論速度を3倍に高速化
Google は、Gemma 4 オープンモデルにマルチトークン予測機能を追加し、テキスト生成速度を最大3倍に加速。小規模な補助モデルが複数トークンを同時に提案し、メインモデルが一度に検証する新技術を採用しました。
Google は本日、オープンソースの Gemma 4 モデルファミリーにマルチトークン予測(Multi-Token Prediction) ドラフター機能を追加しました。この新機能により、テキスト生成の速度を最大3倍に高速化することができます。
マルチトークン予測とは
従来の言語モデルは、1ステップで1つのトークン(単語の一部)を生成していました。一方、Gemma 4 の新しいマルチトークン予測は、小規模な補助モデル(ドラフター)が複数のトークンを一度に提案し、メインモデルがそれらを単一パスで検証する仕組みです。
これは「推測デコード(Speculative Decoding)」の実装で、メインモデルがデータ読み込み中に発生するアイドル時間を活用し、計算効率を大幅に向上させています。
性能と品質
THE DECODER の報告によると、この技術により:
- テキスト生成速度を最大3倍加速
- 品質低下なし(出力の精度・正確性は変わらない)
- Gemma 4 は既に6000万回以上のダウンロード実績を有するほか、エンタープライズと研究コミュニティの両方で採用
提供形式と利用方法
Ars Technica によると、新しいドラフターモデルは Apache 2.0 ライセンスでオープンソース公開されており、以下のプラットフォームで即座に利用可能です:
- Hugging Face
- Kaggle
開発者やエンタープライズユーザーは、これらのプラットフォームから簡単にダウンロード・統合できます。
業界への影響
Gemma 4 のマルチトークン予測は、オープンモデルの推論効率を大きく改善します。クラウドコストの削減、ローカル推論での高速化、エッジデバイスでの実装が可能になる可能性があります。同時に、閉鎖的な商用モデルとの競争力を高め、オープンソース AI エコシステムの実用性をさらに向上させています。
アップデート(2026年7月)
Google は Gemma 4 に対し、Nvidia Hopper GPU での推論を大幅に最適化するステルスアップデートを配信しました。このアップデートには以下の改善が含まれます:
性能の継続的な最適化
- Flash Attention 4 テクノロジーの統合により、時間短縮が最大**31%**に達成
- プロンプト処理速度が25~70%加速
- 通信業界の用例では、ユースケース特有のパフォーマンス向上が**10.1%**を記録
バグ修正と安定性の向上
- ツール呼び出し(Tool Calling) の機能問題を解決
- モデルが不完全な応答を生成する問題(truncated responses)を修正
- これらの修正により、開発者が機能呼び出しを伴うエージェント実装時の信頼性が向上
マルチモーダル処理の拡張
- 画像処理能力が拡張。
max_soft_tokensパラメータの調整(280 → 1,120)により、最大2.51メガピクセルの高解像度画像を処理可能に - すべてのパラメータサイズ(12B、31B、E4B を含む)で改善が適用
開発者への注意
Google は同名「Gemma 4」での更新を配信したため、バージョン管理が複雑化する懸念が開発者コミュニティから指摘されています。本来なら「Gemma 4.1」として表記すべき大型アップデートであり、依存関係の明確化が今後の課題となります。