Cargando indicadores…
← Todas las noticias
Inteligencia Artificial

EmbeddingGemma 2: el nuevo modelo de Google que permite buscar fotos, videos y audio offline en tu móvil

9 de octubre de 2026
Por Mateo Rojas EmbeddingGemma 2: el nuevo modelo de Google que permite buscar fotos, videos y audio offline en tu móvil
Foto: Alex Knight / Pexels

Google DeepMind ha anunciado hoy el lanzamiento de EmbeddingGemma 2, una versión mejorada de su modelo de embeddings multimodales de código abierto. A diferencia de sus predecesores, esta herramienta está diseñada específicamente para funcionar en dispositivos móviles sin necesidad de una conexión a Internet, abriendo la puerta a búsquedas instantáneas de fotos, vídeos y archivos de audio directamente desde el propio teléfono. La iniciativa forma parte de la estrategia de Google de democratizar la inteligencia artificial, ofreciendo soluciones accesibles y eficientes para usuarios y desarrolladores.

Contexto: la evolución de los modelos de embeddings y la demanda de IA offline

Los modelos de embeddings, que convierten datos visuales, auditivos o de texto en vectores numéricos, se han convertido en la columna vertebral de numerosas aplicaciones de IA, desde la recomendación de contenidos hasta la detección de objetos. Desde el lanzamiento de Gemma en 2023, Google ha buscado reducir el tamaño y la complejidad de sus redes para adaptarlas a entornos con recursos limitados. La creciente preocupación por la privacidad y la latencia también ha impulsado la tendencia hacia soluciones que puedan ejecutarse localmente, sin depender de la nube.

EmbeddingGemma 2 llega en un momento en que los smartphones disponen de potentes unidades de procesamiento neural (NPUs) y de memoria suficiente para albergar modelos de aprendizaje profundo, pero los desarrolladores siguen enfrentando barreras de tamaño y consumo energético. Con un peso de apenas 150 MB, el nuevo modelo se sitúa por debajo de la mayoría de los competidores y permite una integración rápida en aplicaciones Android e iOS.

Detalles técnicos: arquitectura ligera y capacidades multimodales

EmbeddingGemma 2 está construido sobre una arquitectura de transformadores optimizada para dispositivos móviles. Utiliza una combinación de técnicas de cuantización y poda de pesos que reducen la precisión de los parámetros sin sacrificar la calidad de los embeddings. El modelo soporta tres modalidades de entrada:

Gracias a su entrenamiento con datasets multimodales de gran escala, EmbeddingGemma 2 logra un equilibrio entre precisión y velocidad, ofreciendo resultados comparables a modelos de mayor tamaño que requieren conexión a la nube. Además, al ser de código abierto, los investigadores pueden inspeccionar, modificar y adaptar el modelo a casos de uso específicos.

Impacto e implicancias: privacidad, velocidad y nuevas oportunidades de negocio

La posibilidad de ejecutar búsquedas multimedia sin conexión tiene varias repercusiones inmediatas. En primer lugar, la privacidad del usuario se ve reforzada, ya que las imágenes o grabaciones nunca abandonan el dispositivo. Esto responde a la creciente regulación europea y estadounidense que exige un procesamiento de datos más localizado.

En segundo lugar, la latencia se reduce drásticamente. Mientras que una consulta a un servidor remoto puede tardar cientos de milisegundos o más, el modelo local entrega resultados en menos de un segundo, lo que resulta crucial para aplicaciones como asistentes de fotografía, organización automática de álbumes o reconocimiento de música en tiempo real.

Finalmente, EmbeddingGemma 2 abre la puerta a nuevos modelos de negocio. Desarrolladores de apps de gestión de contenido, plataformas de e‑learning o herramientas de productividad pueden integrar la IA directamente en sus productos, ofreciendo funciones premium sin incurrir en costos de infraestructura cloud. Además, al ser gratuito y de código abierto, disminuye la barrera de entrada para startups que antes dependían de APIs pagas de terceros.

Perspectiva a futuro: cómo evolucionará la IA en el borde del dispositivo

El lanzamiento de EmbeddingGemma 2 marca un hito, pero no es el punto final. Google ya ha anunciado planes para lanzar versiones aún más especializadas, como modelos que incluyan texto y lenguaje natural en la misma representación vectorial. La integración con TensorFlow Lite y Android Neural Networks API sugiere que la compañía está apostando por un ecosistema donde la IA se vuelve indistinguible del software tradicional.

En los próximos años, se espera que la combinación de modelos ligeros y hardware dedicado haga posible que los dispositivos móviles realicen tareas que hoy sólo se ejecutan en servidores: edición de vídeo en tiempo real, traducción simultánea sin conexión o generación de contenido audiovisual. Además, la comunidad de código abierto probablemente impulsará mejoras colaborativas, añadiendo capas de seguridad, soporte para nuevos formatos multimedia y optimizaciones para chips de fabricantes diferentes a Google.

Conclusión

EmbeddingGemma 2 representa un paso concreto hacia la democratización de la IA multimodal, ofreciendo a usuarios y desarrolladores la capacidad de buscar y organizar contenido multimedia sin depender de la nube. Su tamaño reducido, su naturaleza abierta y su enfoque en la ejecución local responden a demandas de privacidad, rapidez y coste que están redefiniendo el mercado de aplicaciones móviles. Si bien todavía quedan retos técnicos, el modelo sienta las bases para una nueva generación de experiencias inteligentes que vivirán directamente en nuestros bolsillos.

Más de Inteligencia Artificial

Basado en información publicada originalmente por Europa Press.

Comentarios

Cargando comentarios…
Tu correo no se muestra públicamente — solo se pide como filtro contra spam.