Google lança EmbeddingGemma 2 com suporte multimodal e licença Apache 2.0
Modelo compacto de 740 milhões de parâmetros processa texto, código, imagem e áudio no próprio dispositivo, sem depender de nuvem.
Por que importa. Permite criar sistemas locais de busca vetorial e RAG com baixo consumo de memória, além de eliminar o risco de reindexar bases caso um fornecedor proprietário descontinue sua API.
A Google DeepMind lançou o EmbeddingGemma 2, um modelo aberto voltado para a geração de embeddings multimodais diretamente no dispositivo. Construído sobre a arquitetura do Gemma 4, o modelo reúne texto, código, imagens, áudio e vídeo em um mesmo espaço vetorial, distribuído sob licença comercial permissiva Apache 2.0.
Com 740 milhões de parâmetros na versão multimodal completa, o sistema adota estrutura modular. Segundo o anúncio oficial, tarefas exclusivas de texto podem rodar com uma versão de apenas 270 milhões de parâmetros, adicionando codificadores opcionais de visão (170 milhões) e áudio (300 milhões) conforme a demanda da aplicação. Com quantização, o modelo consome cerca de 191 MB de memória RAM em cargas de texto e 567 MB no formato completo em um smartphone Pixel 11 Pro.
Busca local e eficiência de armazenamento
A nova geração quadruplicou a janela de contexto para 8 mil tokens, o que viabiliza processar até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo em uma única chamada. No benchmark MTEB Code, a pontuação subiu de 68,76 para 78,68 pontos, reforçando o uso na indexação semântica de bases de código para agentes de programação.
Para reduzir custos de banco de dados, o modelo emprega a técnica Matryoshka Representation Learning (MRL), que permite truncar os vetores de 768 dimensões para 512, 256 ou 128 dimensões. A Google afirma que isso pode diminuir o uso de armazenamento em até seis vezes sem perda crítica de precisão. Conforme apurou o The Decoder, consultas no navegador via WebGPU levam entre 20 e 70 milissegundos.
Proteção contra dependência de provedor
O formato aberto e a licença permissiva chamaram a atenção de desenvolvedores. O programador e pesquisador Simon Willison destacou que modelos proprietários de embeddings criam armadilhas de custo, pois a descontinuação de uma API força as empresas a reprocessar milhões de vetores armazenados.
Os pesos do EmbeddingGemma 2 já estão disponíveis para download no Hugging Face e no Kaggle, com suporte a ferramentas de inferência como llama.cpp, vLLM, Ollama e LiteRT.
Fontes
- Google DeepMind: EmbeddingGemma 2: an open, lightweight multimodal embedding model
- Simon Willison: EmbeddingGemma 2
- The Decoder: Google claims EmbeddingGemma 2 outperforms rival embedding models twice its size
Reportagem produzida pela redação do Flipters com apoio de inteligência artificial, a partir das fontes acima. Como trabalhamos.

