Alibaba представила мультимодальную модель Qwen3.8-Omni-Flash для ИИ-агентов

Модель принимает текст, изображения, аудио и видео, поддерживает вызов инструментов и контекст до 1 млн токенов. Qwen заявляет результаты, близкие к Gemini 3.8 Flash в аудиовизуальных тестах, при более низкой стоимости API.

Команда Qwen компании Alibaba выпустила Qwen3.8-Omni-Flash — мультимодальную модель для агентных сценариев. Она может совместно обрабатывать текст, изображения, аудио и видео, вызывать пользовательские функции и использовать встроенный веб-поиск; непосредственным результатом работы модели служит текст.

Контекстное окно Qwen3.8-Omni-Flash составляет 1 млн токенов, максимальная длина вывода — 131 072 токена. Для аудио заявлена поддержка 113 языков и диалектов. Модель доступна через Qwen Studio и API Alibaba Cloud Model Studio.

Стоимость обработки миллиона входных токенов заявлена на уровне $0,15, выходных — $0,47. По собственным тестам Qwen, модель приближается к Gemini 3.8 Flash в задачах анализа аудио и видео; сравнение пока основано на результатах разработчика. Открытый набор Qwen-MM-Plugins добавляет агентам функции редактирования и перевода видео, распознавания говорящих и подготовки заметок по медиаматериалам.

Источник: qwen.ai

Связь с редакцией