Проект ЦИТадель

Обзоры • курсы • практикумы

Не «что нажать», а «как устроено»
Век живи — век учись

«Яндекс» опубликовал обученную с нуля модель AliceAI Foundation на 80 млрд параметров

«Яндекс» открыл веса базовой языковой модели AliceAI-Foundation-80B-A3B-Base, обученной с нуля на 18 трлн токенов. Она содержит 80 млрд параметров, активирует 3 млрд на каждый токен и распространяется по лицензии Apache 2.0.

«Яндекс» опубликовал веса AliceAI-Foundation-80B-A3B-Base — базовой языковой модели с гибридной архитектурой и слоями MoE (mixture of experts, «смесь экспертов»). Из 80 млрд параметров при обработке каждого токена активируются 3 млрд; длина контекста достигает 262 144 токенов.

По данным компании, объём обучающих данных составил 18 трлн токенов. Модель была создана с нуля: разработчики заново сформировали обучающий корпус, выбрали архитектуру и гиперпараметры, а также подготовили данные для задач на рассуждение и взаимодействия с инструментами.

Модель опубликована с указанием лицензии Apache 2.0. В репозитории доступны веса в формате Safetensors, конфигурация, инструкции по запуску через Transformers и vLLM, а также пример дообучения методом LoRA. Это предварительно обученная модель без этапа постобучения и выравнивания поведения, поэтому перед использованием в прикладных системах ей потребуются дополнительная настройка, тестирование и средства контроля.

Источник: huggingface.co

Связь с редакцией