Google расширяет функционал своей легковесной модели EmbeddingGemma

EmbeddingGemma — это семейство легковесных открытых моделей от Google DeepMind, разработанных специально для создания векторных представлений (эмбеддингов) и оптимизированных для работы на локальных пользовательских устройствах (смартфонах, ноутбуках).
В этой версии линейка EmbeddingGemma выходит за рамки обработки только текста, что было единственной функцией, которую поддерживала модель в первой версии, представленной Google в сентябре 2025 года. Теперь изображения, аудио и видео используют одно пространство для встраивания вместе с текстом. Приложение, созданное на основе новой модели, может, например, взять голосовую заметку и найти соответствующий момент в видео, при этом данные не будут передаваться за пределы смартфона.
«Реакция на оригинальную версию превзошла все наши ожидания», — написали в инженеры-исследователи Google DeepMind Сахил Дуа и Энрике Шехтер Вера.
По их подсчетам, разработчики скачали модель более 20 миллионов раз.
Созданная на основе архитектуры модели Gemma 4, новая версия более чем в два раза превосходит оригинал по размеру, достигнув 740 миллионов параметров. Большая часть прироста приходится на кодировщики изображений и звука, которые могут не использоваться в приложениях, работающих только с текстом. При тестировании на Google Pixel 11 Pro текстовое ядро с 270 миллионами параметров использовало около 191 мегабайта памяти.
Приложение также должно хранить данные, полученные с помощью модели. Каждый «эмбеддинг» или векторное представление — это список из 768 чисел, и каждая проиндексированная фотография, клип или документ добавляет еще одно число в локальную векторную базу данных. Метод обучения под названием Matryoshka Representation Learning позволяет разработчикам сокращать эти списки до 128 чисел, что уменьшает занимаемое ими пространство в шесть раз. При использовании 256 чисел, как указано в руководстве для разработчиков Google, качество изображений, видео и речи сохраняется на уровне 95 %.
Наибольший прирост в бенчмарке показал программный код. EmbeddingGemma 2 набрала 78,68 балла в разделе «Код» бенчмарка Massive Text Embedding Benchmark, что почти на 10 баллов больше, чем у первой версии. Google предлагает этот результат разработчикам, которые создают системы поиска для ИИ-агентов, занимающихся написанием программ. Баллы за многоязычный текст практически не изменились.
Компания Google также заявляет о лучших результатах EmbeddingGemma 2 среди мультимодальных моделей с менее чем 1 миллиардом параметров. По ее словам, эта модель более чем в два раза превосходит некоторые специализированные модели по эффективности работы с изображениями, видео и аудио.
Поскольку EmbeddingGemma 2 использует тот же токенизатор текста и аудиокодер, что и Gemma 4, то для генерации с расширенным поиском на устройстве требуется меньше памяти, чем для двух несвязанных моделей. Десктопное приложение Google AI Edge Foresight для Mac уже использует эту пару моделей. В демонстрационном приложении Google AI Edge Gallery функция Video Moments Finder находит сцену внутри видео по набранному на клавиатуре или произнесенному запросу.
Массивы данных модели EmbeddingGemma 2 теперь доступны на Hugging Face Inc. и в Kaggle от Google под лицензией Apache 2.0, разрешающей коммерческое использование. В Google сообщили, что модель скоро появится в библиотеке моделей Model Garden на платформе Gemini Enterprise Agent Platform, а массивы данных уже работают с инструментами с открытым исходным кодом, такими как vLLM, llama.cpp и Ollama.



