Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Google выпустила мультимодальную модель EmbeddingGemma 2 для локального поиска

Google DeepMind выпустила открытую модель EmbeddingGemma 2, которая преобразует текст, код, изображения, видео и аудио в единое пространство векторных представлений. Модель содержит 740 млн параметров и предназначена для семантического поиска и RAG-систем, работающих непосредственно на пользовательских устройствах.

Google DeepMind 6 октября выпустила EmbeddingGemma 2 — открытую мультимодальную модель для построения векторных представлений. Она создана на архитектуре Gemma 4, распространяется по лицензии Apache 2.0 и поддерживает текст, код, изображения, видео и аудио, включая их комбинации.

Полная модель содержит 740 млн параметров: 270 млн приходятся на текстовую часть, 170 млн — на визуальный кодировщик и 300 млн — на аудиокодировщик. Ненужные модули можно не загружать. Модель формирует 768-мерные векторы, которые разрешается сокращать до 512, 256 или 128 измерений; последний вариант уменьшает объём хранения векторной базы до шести раз.

Контекстное окно составляет 8192 токена и может включать до 29 изображений, 58 кадров видео либо около 5,5 минуты аудио. Локальная обработка позволяет создавать автономные системы семантического поиска и генерации с дополнением из внешних источников (RAG), не отправляя исходные данные в облако.

Согласно карточке модели, результат EmbeddingGemma 2 в тесте поиска по коду MTEB Code вырос с 68,76 до 78,68 балла по сравнению с первым поколением. Веса опубликованы на Hugging Face и Kaggle; Google также заявила поддержку библиотек и сред sentence-transformers, Transformers, MLX, vLLM, llama.cpp, SGLang и Ollama.

Источник: blog.google

Связь с редакцией