Google представила открытую мультимодальную модель EmbeddingGemma 2
По описанию видео на официальном канале Google for Developers, EmbeddingGemma 2 объединяет текст, изображения, видео и аудио в едином пространстве эмбеддингов и рассчитана на работу непосредственно на устройстве.

Google DeepMind представила EmbeddingGemma 2 — открытую модель, которая сопоставляет текст, изображения, видео и аудио в едином пространстве эмбеддингов. Модель содержит 740 миллионов параметров и ориентирована на локальные сценарии. В описании заявлены офлайн-поиск по медиа и поиск нужных моментов в видео, а также RAG-пайплайны, где чувствительные данные не покидают устройство. Среди других направлений указано дообучение модели под конкретные доменные задачи.
Почему это важно
Локальные мультимодальные эмбеддинги могут использоваться для поиска по медиа и RAG-сценариев без передачи чувствительных данных за пределы устройства.