Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
07.10.2026
Google DeepMind выпустила открытую модель EmbeddingGemma 2, которая преобразует текст, код, изображения, видео и аудио в единое пространство векторных представлений. Модель содержит 740 млн параметров и предназначена для семантического поиска и RAG-систем, работающих непосредственно на пользовательских устройствах.
Google DeepMind 6 октября выпустила EmbeddingGemma 2 — открытую мультимодальную модель для построения векторных представлений. Она создана на архитектуре Gemma 4, распространяется по лицензии Apache 2.0 и поддерживает текст, код, изображения, видео и аудио, включая их комбинации.
Полная модель содержит 740 млн параметров: 270 млн приходятся на текстовую часть, 170 млн — на визуальный кодировщик и 300 млн — на аудиокодировщик. Ненужные модули можно не загружать. Модель формирует 768-мерные векторы, которые разрешается сокращать до 512, 256 или 128 измерений; последний вариант уменьшает объём хранения векторной базы до шести раз.
Контекстное окно составляет 8192 токена и может включать до 29 изображений, 58 кадров видео либо около 5,5 минуты аудио. Локальная обработка позволяет создавать автономные системы семантического поиска и генерации с дополнением из внешних источников (RAG), не отправляя исходные данные в облако.
Согласно карточке модели, результат EmbeddingGemma 2 в тесте поиска по коду MTEB Code вырос с 68,76 до 78,68 балла по сравнению с первым поколением. Веса опубликованы на Hugging Face и Kaggle; Google также заявила поддержку библиотек и сред sentence-transformers, Transformers, MLX, vLLM, llama.cpp, SGLang и Ollama.
Источник: blog.google