Google lança EmbeddingGemma 2, modelo multimodal para dispositivos

Google lança EmbeddingGemma 2, modelo multimodal para dispositivos

O Google DeepMind apresentou em 6 de outubro de 2026 o EmbeddingGemma 2, um modelo aberto de embeddings multimodais projetado para rodar diretamente em dispositivos de consumo. A primeira geração, dedicada apenas a texto, havia sido lançada no ano anterior e acumulou mais de 20 milhões de downloads, segundo a empresa.

A nova versão leva a proposta adiante ao mapear combinações de texto, imagens, áudio e vídeo em um único espaço vetorial. Tem 740 milhões de parâmetros, arquitetura derivada do Gemma 4 e licença Apache 2.0, de uso comercial permissivo.

Do texto ao vídeo em um só espaço vetorial

Segundo o Google DeepMind, o EmbeddingGemma 2 é o modelo mais capaz da categoria para embeddings multimodais em dispositivo. A construção parte da mesma tecnologia que sustenta os modelos de embedding do Gemini.

O modelo permite tarefas como localizar um trecho específico de vídeo a partir de um memorando de voz. Também pesquisa horas de gravações de áudio com uma consulta escrita.

A janela de contexto chega a 8 mil tokens, quatro vezes maior que a da primeira versão. Isso viabiliza o processamento de até 5,5 minutos de áudio, 29 imagens, 58 quadros de vídeo ou combinações intercaladas desses formatos, tudo em hardware local.

Modularidade, memória e armazenamento

O desenho é modular. Cargas de trabalho apenas com texto exigem no mínimo 270 milhões de parâmetros, e os codificadores de visão (170 milhões) e de áudio (300 milhões) são opcionais, acionados somente quando necessário.

O modelo usa Matryoshka Representation Learning (MRL), técnica que permite truncar dinamicamente os vetores de saída de 768 dimensões para 512, 256 ou 128 dimensões. De acordo com o Google DeepMind, isso representa redução de armazenamento de até 6 vezes em bancos de vetores locais e no consumo de memória.

Com quantização, em um Google Pixel 11 Pro, o modelo exige cerca de 191 MB de RAM ativa para os pesos de texto. Na configuração multimodal completa, são aproximadamente 567 MB.

Ganho expressivo em código e desempenho por parâmetro

O EmbeddingGemma 2 mantém o desempenho multilíngue em texto da geração anterior. Registra avanço de 9,92 pontos em código no MTEB (Massive Text Embedding Benchmark), passando de 68,76 para 78,68.

Segundo a empresa, o resultado torna o modelo adequado a indexação local de bases de código, busca semântica em código e recuperação de informação por agentes de programação.

Ainda de acordo com o Google DeepMind, ele lidera entre embedders multimodais com menos de 1 bilhão de parâmetros em benchmarks como o MTEB Code e o MAEB (Massive Audio Embedding Benchmark). Iguala ou supera modelos maiores em tarefas de texto, visão e áudio, chegando a bater modelos especialistas com mais que o dobro do seu tamanho.

As métricas completas estão na model card do EmbeddingGemma 2.

RAG no dispositivo e o que muda para quem desenvolve

Por ser construído sobre o Gemma 4 e compartilhar com ele o tokenizador de texto e o codificador de áudio, o EmbeddingGemma 2 pode rodar no mesmo pipeline de um modelo generativo, com pegada de memória combinada menor.

Isso abre espaço para pipelines de RAG (retrieval augmented generation) que interpretam dados multimodais sem enviar informação a servidores externos. Favorece a privacidade, reduz a latência e permite funcionamento offline.

O Google DeepMind demonstra o uso em aplicações próprias: o Instant Media Search e o Video Moments Finder, no Google AI Edge Gallery, e o Google AI Edge Foresight, que combina recuperação local de arquivos com raciocínio contextual.

Casos de classificação, roteamento e decisão em tempo real aparecem associados à MediaPipe Decision Task API.

Onde baixar e como começar

Os pesos estão disponíveis no Hugging Face e no Kaggle, com chegada prevista ao Gemini Enterprise Agent Platform Model Garden. A comunidade LiteRT mantém versões otimizadas para dispositivo.

Para implantação, a empresa indica o MediaPipe, voltado a tarefas prontas de embedding, recuperação e decisão, e o LiteRT, para integração customizada de modelos. No navegador, há suporte a transformers.js e WebGPU.

Quem quiser entender o passo a passo de busca e RAG local encontra um guia no blog do Google AI Edge.

Fontes e links

Matéria publicada originalmente em Google DeepMind

Últimas Notícias

Anthropic lança CVP ampliado com três níveis de acesso cibernético
Mistral Large 4: modelo de 1 trilhão de parâmetros em preview
Google lança EmbeddingGemma 2, modelo multimodal para dispositivos
Musubi lança PolicyLM-1.7B para moderação em tempo real