EmbeddingGemma 2

EmbeddingGemma 2
画像:gpad.tv

スポンサーリンク

グーグルは10月6日(米国時間)、オープンな埋め込みモデル「EmbeddingGemma 2」を公開しました。テキスト、画像、音声、動画、コードを1つのベクトル空間にまとめて扱えるマルチモーダル対応のモデルで、Gemma 4 のアーキテクチャをベースにしています。Google AI Edge チームと Android ML チームは同日、スマートフォンなどの端末上で動かすための対応状況も公開し、Android 向けには ML Kit への対応を数週間以内に予定しているとしています。

■ 主なポイント

  • モデル規模: フル構成で 7.4億パラメーター。テキストのみなら 2.7億パラメーターから利用でき、画像エンコーダー(1.7億)と音声エンコーダー(3億)は必要に応じて追加
  • 入力: テキスト、画像、音声、動画、コードを組み合わせて入力可能。コンテキストは前世代の4倍の 8K トークンで、音声なら約5.5分、画像なら29枚、動画なら58フレームに相当
  • 出力: 768次元のベクトル。Matryoshka 表現学習により 512 / 256 / 128 次元に切り詰めて保存容量を削減可能
  • メモリ: 量子化した状態で、Pixel 11 Pro ではテキスト用の重みが約191MB、マルチモーダルのフル構成で約567MB
  • 性能: コード検索のベンチマーク MTEB Code のスコアが 68.76 から 78.68 に向上(グーグル発表値)
  • ライセンス: Apache 2.0。Hugging Face と Kaggle で配布

■ Android など端末上での使い方

  • ML Kit: 今後数週間で対応予定。NPU が使える端末では NPU で高速化し、モデルは自動更新されるため APK のサイズを増やさずに済む
  • MediaPipe Tasks: Embedder と Semantic Retriever(既存の RAG SDK の新しいインターフェース)、選択肢の判定に使う Decision タスクで EmbeddingGemma 2 を利用可能
  • LiteRT: 単一の .litertlm ファイルで CPU / GPU / NPU に対応。量子化済みのモデルは Hugging Face の LiteRT Community で公開
  • サンプル: Android / iOS 向けの「Google AI Edge Gallery」に、写真や動画を言葉で探す「Instant Media Search」と「Video Moments Finder」のデモを追加

埋め込みモデルは、文章や画像の意味を数値のベクトルに変換し、似た内容を探す検索や、手元のデータを参照して回答する RAG(検索拡張生成)の土台になる技術です。端末内で埋め込みを生成できれば、写真やメモをクラウドに送らずに意味で検索したり、オフラインで動作させたりできます。グーグルは、同じく端末上で動く Gemma 4 と組み合わせることで、全体のメモリ使用量を抑えたオンデバイス RAG を構築できるとしています。

■ 所感

Pixel 11 Pro で 200MB を切るメモリから動く点は、スマートフォンのアプリに組み込むうえで現実的なサイズ感です。ML Kit 経由で提供されれば、開発者はモデルを自分で同梱しなくても済むため、ギャラリーやメモアプリでの「意味で探す」機能が一気に広がるかもしれません。ただし、性能の数値はグーグル自身の発表によるもので、実際の端末での速度は機種ごとの差が大きいと思われます。

■ ソース

スポンサーリンク