Google открыла EmbeddingGemma 2: локальный поиск по тексту, коду, фото, аудио и видео
Модель на 740 млн параметров кладёт разные типы данных в общее векторное пространство и запускается на обычном устройстве.

6 октября Google DeepMind выпустила EmbeddingGemma 2 — открытую модель эмбеддингов для семантического поиска и RAG-систем. Первая версия работала только с текстом. Вторая переводит в общее пространство текст, код, изображения, аудио и видео.
На практике это поиск через разные форматы: найти видеоклип по голосовой заметке или фрагмент многочасовой записи по текстовому запросу.
Главное
- 740 млн параметров — рассчитана на запуск прямо на устройстве.
- Построена на архитектуре Gemma 4 и использует её токенизатор и аудиокодировщик. В связке с Gemma 4 обе модели занимают меньше памяти.
- Лицензия Apache 2.0 разрешает коммерческое использование.
- Веса опубликованы на Hugging Face и Kaggle.
По данным Google, в бенчмарке MTEB Code оценка выросла с 68,76 до 78,68. Это цифры самого разработчика, независимых проверок пока нет.
Что это значит для вас
Если вы строите поиск по базе знаний, документам или медиатеке, теперь его можно держать целиком на своём железе — данные никуда не отправляются. Это важно для компаний, которым нельзя передавать документы во внешние облака. Как устроена такая система, разобрано в гайде «Как научить нейросеть отвечать по вашим документам».