Google DeepMindは10月6日、EmbeddingGemma 2を公開した。Gemma 4を基にした740Mパラメータのモデルで、ライセンスはApache 2.0。前身のEmbeddingGemmaはテキスト埋め込みとして2000万ダウンロードを超えたが、今回はコード、画像、動画、音声を一つの埋め込み空間にまとめる。
テキストだけなら約270M、画像エンコーダ170M、音声エンコーダ300Mを足す構成に分かれる。出力次元は768から512、256、128へ切り詰められ、同社はローカルのベクトルDBで最大6倍の容量削減になるとしている。コンテキストは8Kトークンで、先代の4倍。音声なら最大5.5分、画像29枚、動画58フレームまでを端末上で扱えるという。
どこで効くか
コード埋め込みのMTEB Codeは68.76から78.68へ、9.92ポイント上がった。ローカルのコード検索や、コーディングエージェントの検索に向く規模だ。量子化した場合、Pixel 11 Proではテキストのみ約191MB、マルチモーダル全体で約567MBのアクティブRAMだとしている。
重みはHugging FaceとKaggleにある。transformers、sentence-transformers、llama.cpp、Ollama、MLX、vLLMのほか、ブラウザではtransformers.jsとWebGPUが案内されている。生成側のGemma 4とトークナイザと音声エンコーダを共有するため、両方を載せる端末内RAGではメモリをまとめやすい。外部の埋め込みAPIへファイルを送っていた処理を、オフラインに戻す候補として先に小さく試せる。