EmbeddingGemma 2、端末上のマルチモーダル埋め込みに対応
Google DeepMind はテキスト・コード、画像、動画、音声を共通ベクトル空間へ写すEmbeddingGemma 2を公開しました。約740Mパラメータのモジュール構成で、入力は8,192トークンを共有します。
今回のリリースについて
- 768次元の出力を512・256・128次元に短縮可能。128次元は主にテキスト用途向け。
- 270Mのテキスト部分だけでも、視覚・音声エンコーダーを追加しても利用可能。
- Google公表ではPixel 11 Pro上の量子化テキスト重みは約191MB、全モデルは約567MBのアクティブRAMが必要。当サイトの実測ではありません。
利用条件
Apache 2.0の重みをHugging FaceとKaggleで提供。モデルカードはGemma禁止利用ポリシーの遵守も求めます。Model Gardenは今後提供予定。複数の入力形式は共通のトークン枠を使います。
出典を確認
2このリリースの関連資料
今回の発表に明示的に関連づけたデモ、ローンチページ、議論。
- google/embeddinggemma-2
原文を確認済み
元のページへ出典確認日
訂正を報告
訂正が必要な情報をお知らせください。確認後に公開内容を修正します。