← 製品の歩みに戻る
EmbeddingGemma新製品

EmbeddingGemma 2、端末上のマルチモーダル埋め込みに対応

Google DeepMind はテキスト・コード、画像、動画、音声を共通ベクトル空間へ写すEmbeddingGemma 2を公開しました。約740Mパラメータのモジュール構成で、入力は8,192トークンを共有します。

発表日 リリース済み出典を確認 ↓

今回のリリースについて

  • 768次元の出力を512・256・128次元に短縮可能。128次元は主にテキスト用途向け。
  • 270Mのテキスト部分だけでも、視覚・音声エンコーダーを追加しても利用可能。
  • Google公表ではPixel 11 Pro上の量子化テキスト重みは約191MB、全モデルは約567MBのアクティブRAMが必要。当サイトの実測ではありません。

利用条件

Apache 2.0の重みをHugging FaceとKaggleで提供。モデルカードはGemma禁止利用ポリシーの遵守も求めます。Model Gardenは今後提供予定。複数の入力形式は共通のトークン枠を使います。

出典を確認

2

  1. EmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. EmbeddingGemma 2 model cardai.google.dev

このリリースの関連資料

今回の発表に明示的に関連づけたデモ、ローンチページ、議論。

Reldex による整理 · リンク先の原典に基づく