← Volver al archivo

Lectura / E

Redacción · IA y apps

Google lanza EmbeddingGemma 2, un modelo abierto para buscar en textos, código, imágenes, audio y vídeo directamente en el móvil

Google lanza EmbeddingGemma 2, un modelo abierto para buscar en textos, código, imágenes, audio y vídeo directamente en el móvil

Google ha presentado EmbeddingGemma 2, un modelo abierto de inteligencia artificial ligero y rápido que permite buscar en textos, código, imágenes, audio y vídeo directamente en el dispositivo. En la práctica, permite buscar objetos o eventos en una colección de archivos multimedia a partir de su descripción textual sin enviar ningún dato a la nube.

Fuente de la imagen: blog.google

Fuente de la imagen: blog.google

El modelo convierte distintos tipos de datos en un formato único: vectores numéricos de 768 valores que reflejan su contenido. Así, una consulta de texto puede relacionarse con una imagen o un sonido aunque el archivo no tenga un nombre ni una descripción adecuados. Es decir, en lugar de coincidir palabras, el sistema compara la proximidad del contenido por su significado.

La principal diferencia de EmbeddingGemma 2 respecto a la primera versión es que va más allá del texto. El nuevo modelo procesa imágenes y sonido de forma directa: ya no hace falta montar un combinado de reconocimiento de voz, generación de pies de foto y un modelo aparte para la búsqueda textual. En el caso del vídeo, se pueden indexar los fotogramas junto con fragmentos de audio y localizar momentos concretos.

El modelo EmbeddingGemma 2 se basa en la arquitectura del abierto Gemma 4 y se distribuye bajo la licencia Apache 2.0, que permite su uso comercial. Con 740 millones de parámetros, se ejecuta sin problemas de forma local en dispositivos de consumo actuales.

En las pruebas específicas MTEB (Massive Text Embedding Benchmark) para código y MAEB (Massive Audio Embedding Benchmark), según el desarrollador, ha logrado los mejores resultados entre los modelos de hasta 1.000 millones de parámetros. EmbeddingGemma 2 no se queda atrás e incluso supera a modelos mucho más grandes en tareas con texto, imágenes y sonido.

egemma2_2.jpg

Una de las características distintivas del modelo es su arquitectura modular: para tareas relacionadas solo con texto necesita únicamente 270 millones de parámetros; para las funciones multimodales y el procesamiento de imágenes hay que añadir codificadores de otros 170 millones de parámetros; para el audio, otros 300 millones. Gracias a la tecnología Matryoshka Representation Learning (MRL), los desarrolladores pueden reducir dinámicamente la dimensionalidad de los vectores de salida de 768 a 512, 256 o 128 elementos, lo que permite recortar hasta seis veces la memoria que ocupan las bases de datos vectoriales.

egemma2_3.jpg

EmbeddingGemma 2 funciona bien incluso con restricciones de recursos severas. En pruebas con el Pixel 11 Pro, la cuantización permitió que el modelo ocupara solo 191 MB de memoria RAM para los pesos correspondientes únicamente al texto; en la variante multimodal, unos 567 MB. Frente al modelo de primera generación, el nuevo mantiene una alta eficiencia con texto multilingüe; en el benchmark MTEB Code ha elevado su resultado de 68,76 a 78,68 puntos. Esto significa que encaja bien en tareas de indexación de bases de código y de búsqueda de información para agentes de IA que escriben código. El funcionamiento local en los dispositivos garantiza a los usuarios la privacidad de sus datos.

egemma2_4.jpg

Combinada con la «mayor» Gemma 4, la auxiliar EmbeddingGemma 2 permite implementar en el dispositivo canalizaciones RAG (Retrieval-Augmented Generation): dado que ambos modelos comparten tokenizador y codificador de audio, pueden funcionar en un mismo entorno con un consumo total de memoria menor. Los pesos de los modelos están disponibles en las plataformas Hugging Face y Kaggle; pronto llegarán a Gemini Enterprise Agent Platform. EmbeddingGemma 2 se ejecuta y se integra con herramientas estándar como transformers, llama.cpp, Ollama, LM Studio y otras.

IA y apps / 03

Sigue leyendo