Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись
2026 г.

Современные LLM: обзор моделей (октябрь 2026)

Проект ЦИТадель

Редакция от 8 октября 2026 года. Обзор помогает выбрать языковую модель и способ её использования: через API разработчика, у стороннего провайдера или на собственном оборудовании. Здесь собраны возможности моделей, условия доступа, цены и ограничения, которые стоит учитывать при выборе. Названия и тарифы меняются быстро, поэтому этот материал вынесен из учебника по большим языковым моделям в отдельную статью.

Если не указано иначе, цены приведены в долларах за миллион текстовых токенов в формате «вход/выход» для стандартного тарифа API. Кэшированный ввод, пакетная обработка, длинный контекст, изображения, звук, поиск и другие инструменты могут оплачиваться по отдельным ставкам. У ряда провайдеров внутренние токены рассуждения входят в оплачиваемый вывод. Доступность API зависит от страны, типа учётной записи и договора; ссылки в обзоре ведут к документации, где можно уточнить условия перед подключением.

Оглавление

  1. Что учитывать при выборе
  2. Коммерческие API
  3. Модели с открытыми весами
  4. Российские модели и платформы
  5. Где запускать модель
  6. Практический выбор

1. Что учитывать при выборе

Название семейства даёт лишь общее представление о модели. Для работы важны точный model ID и endpoint, через который она доступна. Название в чат-приложении может отличаться от идентификатора в API, а у разных провайдеров одна модель может иметь разные ограничения контекста, квантизацию, скорость, инструменты и правила обработки данных.

Затем стоит проверить статус модели. Стабильная версия (GA) обычно предпочтительнее для production: модель в preview могут быстро изменить или отключить. Статус deprecated означает, что модель больше не рекомендуют для новых интеграций; срок её отключения указывается отдельно. Обновляемый alias удобен для экспериментов, а фиксированный snapshot — для воспроизводимых прогонов и контролируемых обновлений.

Контекстное окно определяет технический предел длины запроса, но качество работы с длинным документом приходится проверять отдельно. Модель может по-разному извлекать сведения из начала, середины и конца текста. При выборе важны полнота извлечения, соблюдение инструкций и стоимость обработки документа нужной длины. Подробнее это разобрано в главе о контекстном окне.

У моделей с настраиваемым рассуждением на результат влияет и effort: этот параметр управляет тем, насколько интенсивно модель анализирует задачу, планирует решение и проверяет ответ. Низкий уровень обычно уменьшает задержку и расход токенов; высокий может улучшить результат при решении сложных задач, но увеличивает время и стоимость запроса. Дополнительное рассуждение не гарантирует правильности и не всегда полезно для простых задач.

Параметр effort задаётся для запроса и не ограничивает длину ответа. Например, у OpenAI для reasoning.effort используются уровни none, minimal, low, medium, high, xhigh и max; поддерживаемый набор и значение по умолчанию зависят от модели. За этими названиями не скрывается фиксированное число токенов, и одинаковые уровни у разных моделей и провайдеров нельзя сопоставлять напрямую.

Бенчмарки помогают наметить кандидатов, но результаты зависят от версии набора, способа запуска, бюджета рассуждения, числа попыток и инструментов. Окончательный выбор требует собственной оценки на реальных данных. Для воспроизводимости нужно фиксировать model ID, провайдера и параметры запроса, включая настройки рассуждения.

2. Коммерческие API

OpenAI

Во флагманскую линейку входят GPT-6 Astra, GPT-6.1 Sol и GPT-6 Luna. У всех трёх контекст составляет 1,05 млн токенов, а предел вывода — 128 тыс. Astra принимает текст и изображения; она рассчитана на самые сложные задачи, связанные с рассуждением, программированием, работой с компьютером, исследованиями и созданием документов.

GPT-6.1 Sol, GPT-6 Sol и Luna также принимают текст и изображения и генерируют текст. У всех четырёх нативные аудио- и видеомодальности и fine-tuning не поддерживаются. Инструмент генерации изображений в Responses не означает собственной выходной модальности изображений у языковой модели.

МодельНазначениеВход/выход
gpt-6-astraСамые сложные задачи$10/$50
gpt-6.1-solСложное программирование и профессиональная работа$2/$10
gpt-6-lunaМассовые запросы$0,10/$0,50

GPT-6.1 Sol выпущена 29 сентября. Предыдущая gpt-6-sol, появившаяся 22 сентября вместе с Luna, остаётся доступной за $2/$10: у неё то же контекстное окно в 1,05 млн токенов и предел вывода 128 тыс. токенов. В каталоге она перенесена в раздел предыдущих моделей.

Из семейства GPT-5.6 доступны gpt-5.6-sol ($4/$20), gpt-5.6-terra ($2/$12) и gpt-5.6-luna ($0,20/$1,20). Alias gpt-5.6 указывает на Sol. Промоционный тариф GPT-5.6 Sol действует как минимум до 21 ноября 2026 года. На дату обзора карточки моделей GPT-6 и GPT-5.6 не содержат отдельных датированных ID, поэтому для воспроизведения результатов важно также учитывать дату прогона и изменения в документации.

Стоимость длинных запросов и кэша. При вводе свыше 272 тыс. токенов стоимость ввода, чтения и записи кэша умножается на 2, а вывода — на 1,5 для всего запроса. Эти условия приведены, например, в карточке Astra. У GPT-6.1 Sol кэшированный ввод стоит $0,10, запись — $2,50. До применения длинноконтекстной надбавки чтение/запись кэша у Astra стоят $1/$12,50, у GPT-6 Sol — $0,20/$2,50, у Luna — $0,01/$0,125.

Для GPT-5.6 и более новых моделей срок жизни кэша задаётся через prompt_cache_options.ttl вместо prompt_cache_retention. Поддерживается только 30m: кэш хранится не менее 30 минут после последней записи или повторного использования. Запись стоит 1,25 обычной цены ввода. Каждый входной токен оплачивается по одной категории: обычный ввод, чтение кэша или запись кэша. Ставка записи заменяет обычную ставку для записываемых токенов, а не прибавляется к ней.

Минимальный кэшируемый префикс составляет 1024 видимых входных токена; скрытые инструкции OpenAI в этот минимум не входят. Поддерживаются неявное и явное кэширование. При prompt_cache_options.mode: "explicit" без явного breakpoint запрос не читает и не записывает кэш. Breakpoint после стабильной части позволяет не оплачивать запись постоянно меняющегося окончания. Повторное использование продлевает TTL без новой платы за запись, но общий префикс и действующий TTL сами по себе не гарантируют попадания в кэш.

Рассуждение и инструменты. В API GPT-6 Astra и GPT-6.1 Sol поддерживают low, medium, high, xhigh и max; уровни none и minimal недоступны. Для вызова инструментов нужен Responses API. У GPT-6 Sol и Luna Chat Completions позволяет вызывать функции только при reasoning_effort=none; сочетание рассуждения и инструментов также требует Responses API. Для GPT-6 при effort, отличном от none, следует убрать temperature, top_p и top_logprobs. В Chat Completions также нужно убрать параметр logprobs, а в Responses — значение message.output_text.logprobs из массива include.

Для GPT-5.6 и GPT-6 в Responses API режим рассуждения задаётся независимо от effort: reasoning.mode: "standard" используется по умолчанию, "pro" включает дополнительную работу для сложных задач без смены model ID. В pro токены этой работы агрегируются и оплачиваются по стандартным ставкам выбранной модели. Одинаковая цена миллиона токенов не означает одинаковой стоимости запроса. Для воспроизводимости нужно фиксировать также reasoning.mode.

В Responses max_output_tokens задаёт общий лимит для токенов рассуждения, видимого вывода и невидимых форматирующих токенов. Токены рассуждения занимают место в контексте и оплачиваются как вывод, поэтому 128 тыс. токенов не являются гарантированной длиной видимого ответа. При исчерпании лимита возможен status: "incomplete" с incomplete_details.reason: "max_output_tokens" ещё до появления видимого текста; ввод и выполненное рассуждение при этом уже оплачиваются.

Продолжение диалога. Для GPT-5.6 документированы reasoning.context: "current_turn" и "all_turns"; по умолчанию используется all_turns. Поддержка all_turns также прямо указана для GPT-6.1 Sol. Этот режим требует предыдущих response items, переданных через previous_response_id, conversation или полную ручную историю.

При store: false и Zero Data Retention зашифрованное содержимое reasoning items возвращается по умолчанию, без отдельного запроса через include. При ручном продолжении нужно сохранять все output items, включая reasoning и исходные значения assistant phase. Для цепочки вызовов функций рекомендуется передавать без изменений соответствующие reasoning items, вызовы и результаты с последнего сообщения пользователя. Совместимое рассуждение повторно используется внутри семейства, а не произвольно между семействами; зашифрованные элементы не раскрывают сырое внутреннее рассуждение.

В стандартном одноагентном режиме GPT-6 в Responses API между ответами можно добавлять configuration_update с новым effort, оставляя request-level reasoning.effort неизменным для сохранения кэшируемого префикса. Обновление действует до следующего обновления, но поле reasoning.effort в ответе продолжает показывать настройку запроса. Соседние configuration_update запрещены; механизм несовместим с автоматической компактизацией и автоматическим усечением. Для воспроизводимости нужна также история этих обновлений.

Режим обслуживания и регион. У четырёх перечисленных GPT-6 тарифы Batch и Flex составляют 50% стандартных ставок, Fast — вдвое дороже при условиях применимости из карточки модели. Для GPT-6.1 Sol, GPT-6 Sol и Luna regional processing, где доступен, добавляет 10%. У GPT-6.1 Sol документированы US и EU data residency; Fast недоступен с EU data residency. У GPT-6 Sol и Luna EU data residency указана для Standard, Flex и Batch. Для Astra Fast с EU data residency также исключён; Ultrafast доступен с US data residency и глобальной обработкой, но не с EU и другими неамериканскими региональными endpoints. Тариф Ultrafast следует уточнять отдельно.

Для GPT-6 Luna с 6 октября доступен Decisions API в public beta: POST /v1/decisions. Он предназначен для классификации, маршрутизации и ответов заданного типа по тексту и изображениям. Оплачивается только ввод — $0,10; вывод, чтение и запись кэша отдельно не оплачиваются. Надбавки за регион обработки и длинный контекст сохраняются. Эти ставки относятся только к Decisions API.

Anthropic

Основные модели в линейке Claude различаются ценой и возможностями рассуждения. Fable 5.1, Opus 5.5, Sonnet 5.5 и быстрая Haiku 5.5 имеют контекст 1 млн токенов и предел вывода 128 тыс. Все четыре текущие модели принимают текст и изображения, выдают текст и поддерживают инструменты.

МодельВход/выходЧтение кэша
claude-fable-5-1$10/$50$0,25
claude-opus-5-5$4/$20$0,20
claude-sonnet-5-5$2/$10$0,10
claude-haiku-5-5 (ввод до 100 тыс. токенов включительно)$0,10/$0,50$0,01
claude-haiku-5-5 (ввод свыше 100 тыс. токенов)$0,50/$2,50$0,05

Opus 5.5 выпущена 22 сентября, Sonnet 5.5 — 28 сентября. Haiku 5.5 выпущена 7 октября. У неё ставки ввода, вывода и кэша зависят от длины ввода, как указано в таблице.

Haiku 4.5 (claude-haiku-4-5-20251001) остаётся доступной за $1/$5: контекст 200 тыс. токенов, вывод до 64 тыс. Прежняя claude-opus-5 стоит $5/$25. По тарифам кэша запись с TTL 5 минут стоит 1,25 цены обычного ввода, с TTL 1 час — 2 цены.

Fable, Opus и Sonnet поддерживают адаптивное рассуждение; у Fable 5.1 и Opus 5.5 оно включено постоянно. Effort по умолчанию у Fable 5.1 и Sonnet 5.5 — high, у Opus 5.5 — medium. У Sonnet 5.5 адаптивное рассуждение включено по умолчанию; Haiku 4.5 поддерживает extended thinking, но не effort.

У Haiku 5.5 адаптивное рассуждение включено по умолчанию, effort — medium. Прежний режим extended thinking с budget_tokens, доступный у Haiku 4.5, в новой модели приводит к ошибке 400.

При переходе с Sonnet 5 на Sonnet 5.5 нужно учесть изменения параметров: thinking: {"type":"disabled"} возвращает ошибку 400. Отключение предварительного рассуждения задаётся через thinking: {"type":"between_tools"} и доступно только при effort не выше high. Это отключает рассуждение до вызовов инструментов, а не весь режим рассуждения.

У Opus 5.5 thinking: {"type":"disabled"} и thinking: {"type":"enabled", ...} приводят к ошибке 400: документация рекомендует опустить поле thinking и управлять глубиной через effort. Sonnet 5.5 возвращает 400 при передаче temperature, top_p или top_k со значениями, отличающимися от заданных по умолчанию.

Fable 5.1, Opus 5.5 и Sonnet 5.5 также не допускают принудительного tool_choice со значениями any или tool; в Sonnet 5.5 такой запрос возвращает 400. Начиная с Claude 4.6, идентификаторы без даты являются фиксированными snapshot. Новая версия получает новый ID; автоматически обновляемым alias такой идентификатор не служит. Snapshot закрепляет веса и конфигурацию модели, но маршрутизация, классификаторы безопасности и логика сэмплирования обслуживающей инфраструктуры могут меняться: неизменный ID не гарантирует полного отсутствия наблюдаемых изменений поведения.

История и миграция инструментов. Thinking-блоки Sonnet 5.5 привязаны к модели и истории разговора, а также к учётной записи, которая их создала, или к связанной с ней записи. При передаче из несвязанной записи API удаляет блок, но запрос проходит успешно. В Claude API и Google Cloud не принимается прежний computer_20251124; Advisor tool не позволяет использовать Claude Opus 4.8, Claude Opus 4.7 и Claude Sonnet 5 в качестве советников. Текст между вызовами инструментов возвращается в thinking-блоках, поэтому показ промежуточных сообщений может потребовать настройки display либо between_tools.

У Fable 5.1 для учётных записей, созданных 31 августа 2026 года или позднее, повторная передача thinking-блока после изменения предшествующего system prompt, инструментов или сообщений возвращает 400. Её блоки сохраняются для создавшей их модели либо для более новой модели; при передаче более ранней модели API их удаляет. Эти условия важно учесть при редактировании истории и выборе резервного маршрута.

Данные и реальная стоимость. Fable 5.1, выпущенная 1 сентября 2026 года, требует 30-дневного хранения данных и недоступна при zero data retention без прямо разрешённого Anthropic исключения. По прайс-листу новые Claude используют токенизатор, который для того же текста создаёт примерно на 30% больше токенов, чем прежний; точное изменение зависит от содержимого. У Fable 5.1, Opus 5.5 и Sonnet 5.5 стандартные ставки, кэширование и пакетные скидки действуют во всём миллионном окне. При вводе свыше 100 тыс. токенов у Haiku 5.5 повышаются ставки ввода, вывода и кэша.

Batch API предоставляет скидку 50% на вход и выход. У Sonnet 5.5 в Message Batches API есть beta-режим вывода до 300 тыс. токенов с заголовком output-300k-2026-03-24; стандартный предел остаётся 128 тыс. У Haiku 5.5 также есть beta-предел вывода до 300 тыс. токенов в Batch API.

Режим Fast Opus 5.5 имеет статус research preview и стоит $8/$40: он доступен только в прямом Claude API, но не на Claude Platform on AWS и партнёрских платформах, и не совмещается с Batch.

US-only inference через inference_geo: "us" повышает ставки всех категорий токенной тарификации, включая кэш, на 10%; у Bedrock и Google Cloud собственные региональные цены.

Fable 5.1, Opus 5.5, Sonnet 5.5 и Haiku 5.5 доступны в Claude API, Bedrock, Google Cloud, Microsoft Foundry и Claude Platform on AWS. Bedrock и Claude Platform on AWS — разные варианты обслуживания и биллинга; партнёрские тарифы нужно проверять отдельно. Anthropic рекомендует использовать Opus 5.5 как отправную точку для большинства нагрузок, а Fable рассматривать для сложного рассуждения и длительных агентных задач, в том числе при неудовлетворительных собственных оценках Opus с повышенным effort. Это рекомендация разработчика, а не независимый рейтинг.

Жизненный цикл. 30 сентября 2026 года объявлено о переводе claude-sonnet-4-5-20250929 в статус deprecated; отключение в Claude API назначено на 30 ноября 2026 года, рекомендуемая замена — Sonnet 5.5. Для доступных моделей указаны следующие даты, ранее которых отключения не будет: Fable 5.1 — 1 сентября 2027 года, Opus 5.5 — 22 сентября 2027 года, Sonnet 5.5 — 28 сентября 2027 года, Haiku 5.5 — 7 октября 2027 года, Haiku 4.5 — 15 октября 2026 года. Это нижние границы обязательств, а не назначенные даты отключения.

Google

Стабильная gemini-3.8-flash имеет статус GA, контекст около 1 млн и вывод до 64 тыс. токенов. Уровень рассуждения настраивается: low, medium (по умолчанию) или high. Значение minimal вызывает ошибку. В графике жизненного цикла дата выпуска указана как 2 сентября 2026 года. Карточка модели задаёт максимальный ввод 1 048 576 и вывод 65 536 токенов. Она принимает текст, изображения, видео, звук и PDF, генерирует текст; генерация изображений и звука, а также Live API для этого ID не поддерживаются. Computer use имеет статус Preview, несмотря на GA самой модели.

До конца 2026 года действует вводный тариф $0,75/$3,75; с 1 января 2027 года заявлен $1,50/$7,50. Согласно прайс-листу, reasoning tokens оплачиваются как вывод. Кэшированный ввод стоит $0,075, хранение — $0,50 за миллион токенов в час; с 1 января 2027 года ставки составят $0,15 и $1 соответственно.

В режимах Batch и Flex вход/выход стоят $0,375/$1,875 до 31 декабря 2026 года включительно и $0,75/$3,75 с 1 января 2027 года. Стоимость хранения кэша не снижается вдвое: $0,50 за миллион токенов в час до конца 2026 года и $1 после. В прайс-листе бесплатный тариф допускает использование содержимого для улучшения продуктов, платный — не допускает.

При миграции на Gemini 3.8 Flash нужно заменить thinking_budget на thinking_level. Параметры temperature, top_p и top_k имеют статус deprecated, их следует убрать из запросов. В checklist также требуется удалить candidate_count, не поддерживаемый в Gemini 3 и новее, и заранее заполненные реплики модели. Для диалогов в Interactions API используется серверная цепочка previous_interaction_id. При использовании generateContent API все объекты FunctionResponse должны содержать call_id и name.

В каталоге Gemini API 3.7 Flash уже отнесена к предыдущему поколению. В нём остаются стабильные 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite и 3.1 Flash-Lite. Для gemini-3.1-flash-lite в графике указана самая ранняя возможная дата отключения — 7 мая 2027 года; точную дату Google обещает сообщить пользователям заранее. Рекомендуемая замена — gemini-3.5-flash-lite. У gemini-3.1-pro-preview сохраняется статус preview, который нужно учитывать при выборе для production и планировании миграции.

Переход с 3.1 Flash-Lite на 3.5 Flash-Lite меняет цену: Standard для текстового ввода/вывода — $0,25/$1,50 против $0,30/$2,50. У 3.1 звуковой ввод стоит отдельно $0,50; у 3.5 единая входная ставка $0,30 применяется к тексту, изображениям, видео и звуку.

Amazon

Nova 2 Lite доступна в Amazon Bedrock для массовых задач с текстом, изображениями, документами и видео на входе. Контекст составляет 1 млн токенов, вывод — до 64 тыс. Model ID — amazon.nova-2-lite-v1:0; при межрегиональном обслуживании к нему добавляется префикс, например us., eu., jp. или global.

В карточке модели приведены примеры вызова Converse и InvokeModel через endpoint bedrock-runtime. AWS рекомендует по возможности использовать этот endpoint для новых приложений. OpenAI-совместимые Chat Completions и Responses не поддерживаются. Цена и доступность зависят от региона и режима обслуживания; условия приведены в прайс-листе Bedrock.

Дата запуска в карточке — 2 декабря 2025 года, статус жизненного цикла — Active. Завершение обслуживания возможно не ранее 2 декабря 2026 года; период Legacy должен составлять не менее шести месяцев. Конкретная дата EOL не указана, а Active не означает автоматически статус GA.

Явное кэширование поддерживает до четырёх контрольных точек в system и messages, минимум 1K токенов на точку и TTL в пять минут. Для Amazon Nova указан предел кэширования 20K токенов; миллионное окно не означает возможность кэшировать весь такой запрос. Кэширование предназначено преимущественно для текстовых промптов. На bedrock-runtime поддерживаются потоковый ответ, клиентский вызов инструментов и Guardrails, но не функция Bedrock Structured outputs. Это не означает невозможности получить JSON обычным промптом.

In-Region означает обработку в одном регионе, Geo Cross-Region — маршрутизацию между регионами внутри определённой географии, Global Cross-Region — глобальную маршрутизацию при отсутствии ограничений на географию обработки. При требованиях к месту обработки нужно проверять таблицы исходных и целевых регионов, а не только префикс model ID.

xAI

Флагманской моделью в каталоге API является grok-4.7, выпущенный 21 сентября. Он принимает текст и изображения, поддерживает настраиваемое рассуждение и контекст 500 тыс. токенов. Для текстового вывода отдельного фиксированного предела нет. Прежний grok-4.6 также остаётся доступным.

При вводе менее 200 тыс. токенов стандартный тариф составляет $2/$6, кэшированный ввод стоит $0,50. Начиная с 200 тыс. токенов ставки для всего запроса повышаются до $4/$12 и $1 соответственно.

Effort принимает low, medium, high (по умолчанию) и xhigh. Responses API всегда возвращает reasoning.encrypted_content, даже если это поле не запрошено через include. Полученные элементы reasoning нужно передавать в следующий запрос без изменений.

Документация показывает POST https://api.x.ai/v1/responses; базовый URL OpenAI-клиента — https://api.x.ai/v1. Поддерживаются функции, Web Search, X Search и исполнение кода. Срез обучающих данных — май 2026 года; без включённых поисковых инструментов модель не получает актуальные события и данные. Изображения принимаются в JPEG/JPG и PNG, до 20 MiB каждое; отдельного ограничения их числа каталог не устанавливает. Выход модели — текст.

Чтобы запросы надёжно попадали в кэш, разработчик настоятельно рекомендует prompt_cache_key в Responses: запросы одного диалога направляются на один сервер. Без него возможен холодный кэш и полная цена ввода. Для Chat Completions указан заголовок x-grok-conv-id. Endpoint https://us.api.x.ai/v1 сохраняет инференс в США и добавляет 10% к оплате токенов.

Grok 4.7 Fast — та же модель на более быстрой инфраструктуре, доступная только в Cursor и Grok Build, не в публичном xAI API. Она оплачивается через соответствующий план и не входит в бесплатный уровень Grok Build. Указаны коэффициенты 2× для стандартных токенных ставок и 1,5× для длинноконтекстных запросов.

DeepSeek

DeepSeek V4.1 Flash, выпущенная 10 сентября, нативно обрабатывает текст и изображения. Её актуальный model ID — deepseek-flash, контекст — 1 млн, вывод — до 384 тыс. токенов. Доступны режимы с рассуждением и без него, JSON, вызов инструментов, Responses API и Anthropic-совместимый API.

По прайс-листу, стоимость V4.1 Flash зависит от времени обращения:

ПериодВход без кэша/выходЧтение кэша
Пиковые часы$0,30/$1,20$0,006
Остальное время$0,15/$0,60$0,003

Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу, кроме государственных праздников Китая. В выходные и такие праздники внепиковые ставки действуют весь день.

В API DeepSeek рассуждение по умолчанию включено с effort high. Основные уровни — low, high и max; medium и xhigh преобразуются в high. Для самостоятельного запуска опубликованы веса V4.1 Flash. В этом варианте effort задаётся целым числом от 1 до 100.

В таблице совместимости также указаны преобразования minimal в low и ultra в max. В Chat Completions режим переключается через thinking.type=enabled/disabled, а глубина задаётся reasoning_effort; OpenAI SDK передаёт thinking в extra_body. В Anthropic-совместимом формате используется output_config.effort, в Responses — reasoning.effort, где none отключает рассуждение. Базовые адреса: https://api.deepseek.com для OpenAI-совместимого формата и https://api.deepseek.com/anthropic для Anthropic-совместимого.

При работе с tools нужно возвращать полное reasoning_content предыдущих ответов, иначе API выдаёт ошибку 400. Это относится ко всем предыдущим ходам в режиме рассуждения, включая ходы без фактического вызова инструмента. Без tools передача reasoning_content не требуется; переданное поле игнорируется и не включается в контекст. Для сохранения полей документация предлагает добавлять полное response.choices[0].message, включая content, reasoning_content и tool_calls.

В режиме рассуждения temperature, presence_penalty и frequency_penalty игнорируются, а эффективный диапазон top_p составляет 0,95–1,0: значения ниже 0,95 обрабатываются как 0,95. Без рассуждения top_p фиксирован на 1,0, переданное значение игнорируется.

Для изображений поддерживаются JPEG, PNG, GIF и WebP. Их можно передавать по URL, в base64 или через Files API, как описано в руководстве Vision. Изображения преобразуются в оплачиваемые входные токены.

После преобразования каждое изображение занимает не более 1024 входных токенов; изображения учитываются независимо. detail=low уменьшает изображение до 512×512 для более быстрой и дешёвой обработки без мелких деталей. Предел — 600 изображений на запрос. Отдельное изображение через base64 или внешний URL ограничено 32 MiB, через file_id — 64 MiB. Тело запроса, включая base64, не должно превышать 48 MiB; суммарный размер изображений — 64 MiB без изображений по file_id и 200 MiB с их учётом. В Chat Completions изображения разрешены только в user; в Responses также в developer и результатах инструментов.

Прежние V4 Flash и V4 Flash Vision Exp имеют статус retired. Их ID deepseek-v4-flash и deepseek-v4-flash-vision-exp временно принимаются как alias V4.1 Flash с её тарифами. API V4 Pro, напротив, сохранён после 14 сентября 2026 года с прежней тарификацией. В текущем прайс-листе deepseek-v4-pro соответствует DeepSeek-V4-Pro-0813: $1,32/$3,96 в пиковые часы и $0,66/$1,98 в остальные.

API V4 Pro не поддерживает Vision; контекст 1M и вывод 384K, режимы рассуждения, JSON Output, Tool Calls, Responses API и Anthropic API указаны для обеих API-моделей. Чтение кэша Pro стоит $0,044 в пиковые часы и $0,022 в остальные. Concurrency Limit составляет 2500 для Flash и 500 для Pro; это не число запросов в секунду.

MiniMax

Мультимодальная MiniMax-M3 доступна через API с контекстом 1 млн токенов. По стандартному тарифу при вводе до 512 тыс. токенов она стоит $0,30/$1,20, при большем вводе — $0,60/$2,40. Чтение кэша стоит соответственно $0,06 и $0,12. В прайс-листе Standard обозначен как Permanent 50% off.

Режим Priority включается через service_tier=priority и стоит в 1,5 раза дороже Standard: при вводе до 512 тыс. $0,45/$1,80 и чтение кэша $0,09, при большем вводе $0,90/$3,60 и $0,18. Он предоставляет приоритет при допуске к обработке для более быстрого ответа и повышения надёжности обслуживания.

В документации также представлена MiniMax-M3.1-Flash-Preview для программирования и агентных задач. Это мультимодальная модель в preview с контекстом 1 млн токенов, пока доступная только через M Plan и MiniMax Code. Effort принимает low, medium, high, xhigh и max (по умолчанию). Рассуждение отключить нельзя: disabled и none вызывают ошибку 400. M3 и M3.1-Flash-Preview принимают текст, изображения и видео.

Для обеих моделей рекомендованный предел вывода составляет 131 072, максимальный — 524 288 токенов. В Chat Completions он задаётся через max_completion_tokens, прежний max_tokens имеет статус deprecated. В Messages API по-прежнему используется max_tokens. У M3 рассуждение по умолчанию включено в Chat Completions и выключено в Messages API; в Messages API оно включается через thinking.type=adaptive.

У M3 рассуждение можно отключить через thinking: {"type":"disabled"}. Для preview-модели глубина задаётся reasoning_effort в Chat Completions и output_config.effort в Messages API. В Chat Completions только M3.1-Flash-Preview настраивает глубину через reasoning_effort; остальные перечисленные модели его игнорируют. Preview возвращает рассуждение отдельно в reasoning_content, а reasoning_split=false не поддерживается. Messages API использует блоки thinking; его tool_choice допускает только auto и none.

В актуальном каталоге остаются текстовые MiniMax-M2.7 и MiniMax-M2.7-highspeed с контекстом 204 800 токенов и вызовом инструментов, но без изображений и видео. Обычная M2.7 стоит $0,30/$1,20, highspeed — $0,60/$2,40. У обеих чтение/запись кэша стоят $0,06/$0,375.

Xiaomi

MiMo V2.6 выпущена 22 сентября. В API доступны три варианта; цены приведены по международному тарифу:

МодельВход/выход
mimo-v2.6-pro$0,435/$0,87
mimo-v2.6-flash$0,14/$0,28
mimo-v2.6-pro-ultraspeed (ускоренный вариант)$4,35/$8,70

Чтение кэша в Real-time API стоит $0,0036 у Pro, $0,0028 у Flash и $0,036 у Ultraspeed. Запись временно бесплатна, дата окончания действия этого условия не указана; кэшированный тариф применяется при попадании префикса в Prompt Cache.

В Batch API Pro стоит $0,2175/$0,435 с чтением кэша $0,0018, Flash — $0,07/$0,14 с чтением $0,0014. Ultraspeed, V2.5 Pro и V2.5 не поддерживают Batch. Обычный API Key расходует баланс pay-as-you-go по токенам; баланс и квота Token Plan не взаимозаменяемы.

Pro заявлена как мультимодальная модель рассуждения для сложных проектов, длительных задач, ответственной работы, кибербезопасности и исследований; Flash — для частых вызовов и масштабных задач. Для Ultraspeed разработчик заявляет уровень Pro и ускорение до 20 раз, но это не гарантированная скорость. Обычные цены ввода и вывода Ultraspeed в десять раз выше Pro. Использование web search и web parsing стоит отдельно $5 за 1000 вызовов; прайс-лист сам по себе не устанавливает их поддержку каждым вариантом модели.

Модели mimo-v2.5-pro и mimo-v2.5 отключат 21 октября 2026 года в 10:00 по Пекину. Автоматической замены не предусмотрено: запросы со старыми model ID начнут возвращать ошибку.

Meta*

Muse Spark 1.3, выпущенная 2 сентября, ориентирована на длительные агентные задачи и программирование. В Meta Model API её ID — muse-spark-1.3, контекст — 1 048 576 токенов.

Модель принимает текст, изображения, видео и PDF, генерирует текст. Понимание аудио пока поддерживается не полностью, и качество запросов со звуком может быть снижено; для аудио документация рекомендует Muse Spark 1.2. Базовый URL — https://api.meta.ai/v1; доступны Responses API, Chat Completions API и Anthropic-совместимый Messages API.

На стандартном тарифе модель стоит $1,25/$4,25, кэшированный ввод — $0,15. Запросы и ответы не используются для обучения Meta. Вариант muse-spark-1.3-contributor значительно дешевле: $0,10/$0,20, кэшированный ввод — $0,002, однако данные запросов и ответов могут использоваться для обучения.

Effort max доступен через Muse Code и Meta Model API. В API он поддерживается только на Standard; на Contributor этот уровень недоступен.

Надбавки за длинный контекст нет. Встроенный web_search стоит отдельно $2,50 за 1000 поисковых запросов сверх токенов. Лимиты Standard — 3000 запросов и 4 млн токенов в минуту, Contributor — 100 запросов и 3 млн токенов в минуту. Они применяются к команде, а не к отдельному API-ключу.

Baidu

В международном Qianfan API доступна универсальная текстовая ernie-5.1. Её контекст — 128 тыс. токенов, максимальный ввод — 119 тыс., вывод — 65 536. В тарифе есть порог длины запроса: при вводе до 32 тыс. токенов модель стоит $0,56/$2,53, при большем вводе — $0,84/$3,10.

Для ernie-5.1 лимиты по умолчанию составляют 60 RPM и 150 000 TPM. Повышенная ставка обозначена для 32k < Input ≤ 128k, но технический предел ввода остаётся 119k. Для ernie-5.0 отдельно документированы Visual Understanding и Deep Thinking по $1,40/$5,60. В Deep Thinking указана цепочка рассуждения 60k токенов. У thinking-моделей ERNIE thinking_budget не поддерживается, а max_tokens ограничивает сумму reasoning_content + content, не только окончательный ответ.

Mistral

Mistral Large 4 доступна в API с 6 октября в статусе public preview. Это универсальная мультимодальная MoE-модель с 1,05 трлн параметров, из которых 52 млрд активны. Контекст составляет 1 млн токенов. Model ID — mistral-large-4.

На 8 октября в прайс-листе указаны акционные ставки $0,68/$2,09 и $0,07 за чтение кэша; обычные ставки — $1,36/$4,18 и $0,14 соответственно. Публикация весов запланирована на конец октября.

3. Модели с открытыми весами

Открытые веса позволяют самостоятельно запускать модель, но условия такого использования определяет лицензия. Открытость весов сама по себе не означает открытого исходного кода или отсутствия ограничений. Для развёртывания также важны объём памяти, поддерживаемые форматы и качество квантизаций.

У MoE-моделей ниже указаны общее число параметров и число активных параметров. От активной части в значительной мере зависит объём вычислений на токен, но для размещения нужны все веса. Поэтому модель с небольшой активной частью может требовать большого кластера.

OpenAI gpt-oss

gpt-oss-120b имеет 117 млрд параметров всего и 5,1 млрд активных, gpt-oss-20b — 21 млрд и 3,6 млрд соответственно. Обе модели работают с текстом, поддерживают контекст 131 072 токена, настраиваемое рассуждение и вызов инструментов. Веса распространяются под Apache 2.0.

У обеих effort принимает low, medium и high, максимальный вывод — 131 072 токена; веса допускают дообучение. Карточка gpt-oss-120b заявляет размещение на одной H100, но не устанавливает в этой оценке условия максимального контекста и нагрузки.

Google Gemma 4

В семействе Gemma 4 есть dense-модель 31B и MoE-модель 26B A4B. У второй 25,2 млрд параметров всего и 3,8 млрд активных. Обе принимают текст и изображения, имеют контекст 256 тыс. токенов и лицензию Apache 2.0.

Для более компактного развёртывания доступны Gemma 4 12B Unified с контекстом 256 тыс., а также E4B и E2B с контекстом 128 тыс. токенов. E2B и E4B обозначают эффективное число параметров; с эмбеддингами их полный объём составляет 5,1 и 8 млрд соответственно. E2B, E4B и 12B Unified также принимают звук; все варианты генерируют текст. Семейство поддерживает настраиваемое рассуждение и нативный вызов функций.

DeepSeek V4.1 Flash и V4

Веса мультимодальной V4.1 Flash опубликованы под MIT. Модель использует MoE и архитектуру Causal Encoder–Decoder: в основной сети 552 млрд параметров, ещё 196 млрд находятся в памяти Engram. При обработке входа (prefill) активны 8 млрд параметров на токен, при генерации (decode) — 16 млрд. Контекст достигает 1 млн токенов.

Под MIT по-прежнему доступны и предыдущие веса: V4 Pro с 1,6 трлн параметров всего и 49 млрд активных и V4 Flash с 284 млрд и 13 млрд соответственно. Эти чекпойнты не меняются при перенаправлении API-идентификаторов. Для старых API-идентификаторов deepseek-chat и deepseek-reasoner 24 апреля 2026 года было объявлено прекращение использования с 24 июля 2026 года. В переходный период они указывали соответственно на режимы без рассуждения и с рассуждением у V4 Flash.

Z.ai: GLM

Z.ai опубликовала веса текстовой GLM-5.3 с 753 млрд параметров и мультимодальной GLM-5.3-Flash с 320 млрд параметров всего и 18 млрд активных. Полноразмерная GLM-5.3 использует ту же базовую модель, что и 5.2; улучшения получены на этапе post-training. Flash построена на новой гибридной архитектуре. В API Flash и FlashX принимают текст, изображения, видео и файлы; на выходе — текст.

У полноразмерной модели действует собственная лицензия Z.ai, у Flash — MIT. Через API доступны обе модели, а также FlashX — ускоренный вариант обслуживания Flash со скоростью до 200 токенов в секунду. Для всех трёх заявлены контекст 1 млн и вывод до 128 тыс. токенов. Цены по прайс-листу Z.ai:

Модель APIВход/выходЧтение кэша
glm-5.3$1,40/$4,40$0,26
glm-5.3-flash$0,15/$0,50$0,03
glm-5.3-flashx$0,37/$1,25$0,075

Рассуждение включено постоянно. У Flash и FlashX параметр thinking.type допускает только enabled; у полноразмерной GLM-5.3 reasoning_effort принимает low, high и max (по умолчанию). Бесплатное хранение кэша у GLM-5.3, Flash и FlashX заявлено как временное условие.

У GLM-5.3 thinking.type также допускает только enabled. При миграции запроса с thinking.type: "disabled" документация требует заменить его на enabled и задать reasoning_effort: "low", иначе возникает ошибка. Для Flash/FlashX рекомендован reasoning_effort: "max"; это рекомендация, а не отдельно установленное значение по умолчанию. В карточках перечислены streaming, function calling, кэширование и структурированный вывод, включая JSON.

Для полноразмерной GLM-5.3 есть особенность доступа: учётным записям, которые раньше имели GLM Coding Plan, включая истёкшую подписку, пока доступен только OpenAI-совместимый Chat Completions. В общем перечне её API также указаны Responses и Anthropic-совместимый Messages; переносить этот перечень на Flash/FlashX по их карточке нельзя.

GLM-5.3-Flash доступна в GLM Coding Plan с втрое большей квотой, чем GLM-5.3. FlashX в этом плане пока недоступна, хотя есть в Model API. Квота подписки не означает трёхкратную скидку на токенные цены API.

MiniMax M3

Веса MiniMax M3 распространяются по лицензии MiniMax Community. Это мультимодальная MoE-модель примерно с 428 млрд параметров всего и 23 млрд активных на токен. Заявленный контекст — 1 млн токенов.

Moonshot AI: Kimi

Для Kimi K3 опубликованы код и описание, а также полные веса мультимодальной MoE-модели. В ней 2,8 трлн параметров всего и 104 млрд активных, контекст составляет 1 048 576 токенов. Веса распространяются по собственной лицензии Kimi K3 от Moonshot AI.

Без собственного кластера модель можно использовать через API с ID kimi-k3. Доступ открывается после пополнения счёта не менее чем на $1. Параметр max_completion_tokens по умолчанию равен 131 072; его можно увеличить до 1 048 576. Рассуждение включено постоянно, effort принимает low, high или max (по умолчанию).

Накопленная сумма пополнений определяет уровень аккаунта и ограничения конкурентности, RPM, TPM и TPD; открытие K3 за $1 не означает достаточности лимитов для production. Тарификация K3 не имеет ступеней по длине контекста.

Цены API. По прайс-листу Moonshot AI, K3 стоит $3/$15, чтение кэша — $0,30. В том же каталоге API остаются K2.6 и ориентированные на программирование K2.7 Code. У трёх перечисленных в таблице вариантов K2 контекст 262 144 токена:

МодельВход/выходЧтение кэша
kimi-k2.6$0,95/$4$0,16
kimi-k2.7-code$0,95/$4$0,19
kimi-k2.7-code-highspeed$1,90/$8$0,38

K2.6 принимает текст и визуальный ввод, поддерживает режимы с рассуждением и без него. Для K2.7 Code Highspeed заявлены примерно 180 токенов/с, до 260 токенов/с в коротком контексте; это не SLA. Каталог сообщает, что сопровождение и поддержка kimi-k2.5 и серии moonshot-v1, включая auto и vision-preview, были прекращены 31 августа 2026 года; старых ID kimi-k2 из раздела Deprecated Models — 25 мая, kimi-latest — 28 января. Действующие K2.6 и K2.7 Code не относятся к этому перечню старых ID.

У K3 запись в кэш учитывается отдельной категорией: $3 при TTL 5 минут или $6 при TTL 1 час за миллион токенов. Каждый входной токен оплачивается по одной категории: обычный ввод, чтение из кэша или запись в кэш. По умолчанию применяется TTL 5 минут; попадание в кэш продлевает срок хранения без новой платы за запись. Все приведённые цены Kimi не включают применимые налоги.

В Chat Completions и Responses подходящие префиксы без prompt_cache_options автоматически записываются с TTL 5m; TTL задаётся через prompt_cache_options.ttl, а mode поддерживает только implicit. В Anthropic Messages запись управляется верхнеуровневым cache_control: без него запрос только читает кэш 5m, но не записывает новый; маркер внутри сообщений игнорируется. TTL закрепляется первой записью и меняется после её полного истечения. Неполный блок, который нельзя записать, оплачивается как обычный ввод.

Особенности запросов K3. При продолжении диалога и работе с инструментами нужно передавать полное сообщение assistant, включая поля помимо content. Параметры temperature=1.0, top_p=0.95, n=1, presence_penalty=0 и frequency_penalty=0 фиксированы, их следует опускать в запросе. Изображения передаются в base64 или через ms://<file-id>; общедоступные URL не поддерживаются.

Полное сообщение assistant нужно сохранять без изменений. Видео передаётся через Files API с purpose="video" и ms://<file-id>; для визуального ввода content должен быть массивом объектов, а не сериализованной строкой.

Документирован response_format с json_schema и strict: true: схема ограничивает итоговый message.content, но не reasoning_content. На первом шаге tool_choice="required" требует хотя бы одного вызова инструмента.

Официальный веб-поиск находится в процессе обновления; документация пока не рекомендует его для production. Это ограничение не относится ко всем пользовательским инструментам.

Xiaomi MiMo V2.6

27 сентября под MIT опубликованы обновлённые веса MiMo-V2.6-Pro-MOPD (1,02 трлн параметров основной сети, 42 млрд активных) и MiMo-V2.6-Flash-MOPD (309 млрд и 15 млрд соответственно). Обе модели принимают текст, изображения, видео и звук, генерируют текст и поддерживают контекст до 1 млн токенов.

Эти MOPD-обновления продолжают прежние Pro-RL и Flash-RL. Разработчик сообщает об улучшении качества длительных агентных задач и сокращении повторяющихся вызовов инструментов. В серии есть и компактная MiMo-V2.6-Distill-Qwen-9B: она построена на Qwen3.5-9B, дообучена на данных MiMo и предложена как отправная точка для исследований агентного обучения с подкреплением.

Alibaba: Qwen

Флагманская API-модель Qwen3.8 Max нативно мультимодальна и по умолчанию поддерживает контекст 1 млн токенов. В её основе лежит MoE-модель с 2,4 трлн параметров всего и 95 млрд активных.

Опубликованный чекпойнт Qwen3.8-2.4T-A95B имеет другие возможности: принимает только текст, постоянно использует рассуждение и рассчитан на нативный контекст 262 тыс. токенов, расширяемый до 1 010 000. Веса доступны по собственной лицензии Qwen3.8 Max с дополнительными условиями для крупных сервисов.

У мультимодальной Qwen3.8-Flash-Next, веса которой опубликованы 26 августа, другая архитектура — ранний вариант Qwen4. В основной модели 125 млрд параметров, ещё 51 млрд приходится на N-граммные эмбеддинги и 4 млрд на MTP; на токен активны 6 млрд. Нативный контекст 262 144 токена расширяется до 1 млн.

Qwen Community License 1.0 требует особого внимания при коммерческом использовании Flash-Next. Если компания или её аффилированные лица предоставляют модели как сервис либо выпускают самостоятельные ИИ-продукты для программирования или офисной работы, нужна отдельная лицензия Qwen независимо от выручки. Исключение — внутреннее использование без предоставления модели, её возможностей или результатов третьим лицам.

На QwenCloud модель Qwen3.8-Flash с контекстом 1 млн заявлена по цене $0,15/$0,47; в карточке приведён вызов API с ID qwen3.8-flash и базовым URL https://maas.qwencloudapi.com/compatible-mode/v1 для OpenAI-совместимого интерфейса. Это не подтверждает доступность во всех странах и для всех учётных записей. Модель принимает текст, изображения и видео, выдаёт текст; аудиовход в перечне этой карточки не указан. Максимальный ввод обозначен как 991K, ввод с рассуждением — 983K, максимальный вывод — 131K.

Карточка QwenCloud заявляет совместимость с протоколами OpenAI и Anthropic, перечисляет Chat Completions и Responses; встроенные инструменты зависят от интерфейса. Указаны Function Calling, Structured Outputs, Batch, веб-поиск и кэширование контекста. Попадание в неявный кэш стоит $0,016, создание явного — $0,20, чтение явного — $0,016 за миллион токенов; TTL и отдельную стоимость хранения следует уточнять отдельно.

В Alibaba Cloud Model Studio доступна qwen3.8-omni-flash: текст, изображения, звук и видео на входе, текст на выходе, контекст 1 млн и предел вывода 131 072 токена. Её карточка описывает доступ через API Model Studio, отдельный чекпойнт с весами не указан. Документированы Chat Completions и Responses. Рассуждение включено по умолчанию, интенсивность настраивается; максимальный ввод составляет 991 808 токенов без рассуждения и 983 616 с ним.

Model Studio перечисляет регионы Пекин, Сингапур, Гонконг, Токио, Франкфурт и Вирджиния; требуется API-ключ выбранного региона. Поддерживаются пользовательские инструменты, веб-поиск, автоматический неявный кэш и Session caching в Responses. Для аудио заявлены 113 языков и диалектов и многоканальный пространственный звук, включаемый через use_multichannel в Chat Completions. Цены и протокольные возможности QwenCloud нельзя автоматически переносить на эту модель Model Studio.

Для более простого развёртывания есть Qwen3.6-27B и более новая Qwen3.8-27B: мультимодальные dense-модели на 27 млрд параметров под Apache 2.0. Их нативный контекст составляет 262 144 токена.

Mistral

Medium 3.5 имеет статус GA. Это мультимодальная dense-модель на 128 млрд параметров с контекстом 256 тыс. токенов. В API её ID — mistral-medium-3-5, тариф — $1,50/$7,50.

Разработчик позиционирует Medium 3.5 как модель для агентных задач и программирования; в карточке указана дата 28 апреля 2026 года. В API структурированный вывод и функции доступны через /v1/chat/completions и /v1/conversations, пакетная обработка — через /v1/batch, встроенные инструменты — через /v1/agents и /v1/conversations. Эти сервисные возможности нельзя автоматически переносить на самостоятельное размещение весов.

Веса Medium 3.5 распространяются под Modified MIT. Если консолидированная мировая выручка компании за предыдущий месяц превысила $20 млн, для использования весов нужна отдельная лицензия.

Mistral Small 4 имеет лицензию Apache 2.0. По карточке модели, в ней 119 млрд параметров всего и 6,5 млрд активных; контекст — 256 тыс. токенов. Она принимает текст и изображения, поддерживает настраиваемое рассуждение. В API mistral-small-2603 стоит $0,15/$0,60.

Более крупная Mistral Large 3 тоже распространяется под Apache 2.0: 675 млрд параметров всего, 41 млрд активных и контекст 256 тыс. токенов.

Cohere Command A+

Мультимодальная Command A+ имеет 218 млрд параметров всего и 25 млрд активных на токен. Веса опубликованы под Apache 2.0. Модель поддерживает рассуждение, вызов инструментов и работу на 48 языках.

Она принимает текст и изображения, генерирует текст. В официальной карточке Release Date — 20 мая 2026 года, срез знаний — 1 апреля 2025 года. Для указанных в карточке весов W4A4 заявлено размещение на одном B200 или двух H100; оценку нельзя переносить на другие форматы, любой контекст и нагрузку.

В Cohere API она доступна как command-a-plus-05-2026: контекст 128 тыс., предел вывода 64 тыс. токенов. Публичный API можно бесплатно использовать в пределах rate limits для trial- и production-ключей. Для production-развёртывания Cohere предлагает Model Vault. Карточка перечисляет Chat V2, Chat Completions и Chat V1; можно включать и отключать thinking и управлять бюджетом рассуждения по отдельному руководству.

Условия обработки данных зависят от размещения, платформы и коммерческого соглашения. В большинстве клиентских развёртываний в собственной среде Cohere не имеет доступа к входным данным. В средах Cohere обезличенные данные использования могут применяться в ограниченных случаях, разрешённых настройками и условиями сервиса; нельзя считать любые запросы автоматически исключёнными из обучения. Эти условия следует отличать от Apache 2.0 на опубликованные веса.

StepFun

Step 3.7 Flash — мультимодальная MoE-модель под Apache 2.0. В ней около 198 млрд параметров, включая визуальный энкодер; около 11 млрд активны на токен. Модель принимает текст и изображения, поддерживает контекст 256 тыс. токенов, вызов инструментов и три уровня рассуждения. Опубликованы также веса FP8, NVFP4 и GGUF.

Tencent

Текстовая Hy4 preview рассчитана на программирование, рассуждение и работу с документами. Это MoE-модель с 770 млрд параметров в основной сети и 49 млрд активных на токен; дополнительный слой MTP содержит ещё 10 млрд. Контекст — 1 млн токенов. Выпуск имеет статус preview, веса в обычном формате и FP8 доступны под Apache 2.0.

NVIDIA Nemotron

В семействе Nemotron для рассуждения и агентных задач представлены, в частности, Super 120B A12B и Ultra 550B A55B. Обе поддерживают контекст до 1 млн токенов, но лицензии различаются: NVIDIA Nemotron Open Model License у Super и OpenMDW 1.1 у Ultra.

Ultra принимает и выдаёт текст; в карточке указана версия v1.0 со статусом GA. Доступность на Build.NVIDIA.com и публикация весов на Hugging Face датированы 4 июня 2026 года. Для Ultra NVFP4 минимальная рекомендуемая одноузловая конфигурация составляет четыре B200 для весов и KV-кэша с запасом, без универсальной гарантии миллионного контекста при любой нагрузке. Русского языка в заявленном списке Ultra нет; это не означает невозможности работы на русском, но требует отдельной оценки.

Стартовые команды vLLM и SGLang ограничены 262 144 токенами. Для 1 048 576 токенов vLLM требует VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 и --max-model-len 1048576, SGLang — SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 и --context-length 1048576.

Рассуждение переключается через chat_template_kwargs.enable_thinking; сокращённый режим использует enable_thinking=True и medium_effort=True.

Для работы с инструментами нужен соответствующий parser; при совместном разборе рассуждения и инструментов в SGLang инструкция требует также force_nonempty_content: true при включённом рассуждении. Это параметры описанных серверных конфигураций, а не универсальный интерфейс всех провайдеров. Пробный сервис NVIDIA регулируется отдельными NVIDIA API Trial Terms of Service, а не только лицензией весов.

Для быстрых повторяющихся агентных задач и локального инференса предназначена Nemotron 3.5 Lightning: 30 млрд параметров всего, 3 млрд активных и контекст до 1 млн токенов. Её лицензия — OpenMDW 1.1; доступна квантизация NVFP4.

Nemotron 3 Nano Omni 30B A3B подходит для локальных мультимодальных ассистентов: она принимает текст, изображения, видео и звук, выдаёт текст и поддерживает рассуждение и вызов инструментов. Заявленный язык — английский. В модели около 31 млрд параметров всего и 3 млрд активных, контекст до 256 тыс. токенов. Веса BF16, FP8 и NVFP4 доступны по лицензии NVIDIA Open Model Agreement.

Meta* Muse Glimmer

Мультимодальная Muse Glimmer на 30 млрд параметров предназначена для локальных агентов, программирования и вызова инструментов. Веса опубликованы под Apache 2.0, контекст по умолчанию составляет 128 тыс. токенов. Разработчик также предоставляет варианты с разрядностью около четырёх бит для систем с 24 или 32 ГБ памяти.

Это dense-модель, дистиллированная из Muse Spark: текст и изображения на входе, текст на выходе. Более длинный контекст заявлен, но его максимум на этой странице не указан. Muse Glimmer не обслуживается через Meta Model API; модель запускают самостоятельно. Документация перечисляет vLLM, SGLang, llama.cpp и ExecuTorch.

inclusionAI Ling 3.0

Ling-3.0-flash — универсальная MoE-модель под MIT: 124 млрд параметров всего, 5,1 млрд активных и контекст 256 тыс. токенов.

Для локального запуска с ограниченной памятью интересна Ling-3.0-tiny под той же лицензией. У неё 7,9 млрд параметров всего и 1,3 млрд активных; контекст 131 072 токена расширяется до 262 144 с YaRN. Tiny поддерживает вызов инструментов и переключение между быстрым ответом и рассуждением через enable_thinking. Доступны веса BF16, FP8 и INT4.

IBM Granite

В обеих линейках, Granite 4.1 и 4.2, есть текстовые dense-модели на 3, 8 и 30 млрд параметров под Apache 2.0. Более новая Granite 4.2 опубликована 25 августа. Она рассчитана на локальные задачи рассуждения, программирования и работу агентов. Контекст — 131 072 токена; для 8B также заявлено расширение до 512 тыс.

У Granite 4.2 рассуждение включается и отключается через enable_thinking, а для короткого рассуждения предусмотрен low_effort=True. Предыдущая линейка Granite 4.1 вышла 29 апреля 2026 года и работает без длинных цепочек рассуждений. Она остаётся вариантом для систем, где важны задержка и предсказуемый расход токенов.

Например, Granite 4.1 8B поддерживает контекст 131 072 токена, вызов инструментов, RAG, извлечение и преобразование текста.

Ai2 Olmo 3.1

Для исследований и воспроизводимого дообучения интересны Olmo-3.1-32B-Instruct и Olmo-3.1-32B-Think. Это текстовые модели на 32 млрд параметров под Apache 2.0, прежде всего для английского языка. Think обучена длинному рассуждению; контекст в конфигурациях весов обеих моделей — 65 536 токенов.

Помимо весов Ai2 публикует данные, код предобучения и post-training, а также промежуточные чекпойнты. Эти материалы позволяют изучать процесс обучения модели.

4. Российские модели и платформы

GigaChat

В официальном API Сбера представлены GigaChat 2 Lite, Pro и Max с ID GigaChat-2, GigaChat-2-Pro и GigaChat-2-Max, а также GigaChat 3 Ultra с ID GigaChat-3-Ultra и контекстом 128 тыс. токенов. По состоянию на 1 октября 3 Ultra доступна только физическим лицам в режиме Freemium; доступ для платных физических лиц и организаций ещё не открыт.

Ultra стала доступна во Freemium API 15 июля 2026 года; документированы POST /v1/chat/completions и POST /v2/chat/completions с model: "GigaChat-3-Ultra". Freemium предоставляет на 12 месяцев отдельные квоты: 250 млн токенов для Lite, 40 млн для Pro, 25 млн для Max и 50 млн для Ultra. Сумма 365 млн не является единым свободно расходуемым пулом; генерация выполняется в одном потоке. Увеличение общей квоты зафиксировано в changelog 22 июля 2026 года.

С 6 октября GigaChat 3 Ultra в POST /v2/chat/completions поддерживает параллельные вызовы нескольких функций.

С июля общий endpoint GigaChat API — https://api.giga.chat. Прежний https://gigachat.devices.sberbank.ru/ пока обслуживает существующие подключения, но для новых уже не используется и будет отключён; срок не указан. В changelog переход датирован 16 июля, в справке REST API — 17 июля.

Открытые веса. Под MIT опубликованы GigaChat 3.5 432B-A28B и GigaChat 3.5 Reasoning. У Reasoning 432 млрд параметров всего, 28 млрд активных и контекст 262 144 токена. Это первая GigaChat с полноценным режимом рассуждения, обученная с помощью online RL; она поддерживает вызов инструментов и структурированный вывод.

Разработчик отмечает улучшения Reasoning в математике, программировании и следовании инструкциям относительно GigaChat 3.5 Ultra Instruct. В официальной коллекции доступны FP8, BF16 и GGUF. Публикация весов не подтверждает доступность GigaChat 3.5 Reasoning в публичном API Сбера.

В то же время GigaChat3.5-432B-A28B-Reasoning уже размещена в Foundation Models Cloud.ru: API этой платформы предоставляет контекст 262 тыс. токенов по цене 96,22/288,60 руб. за миллион входных/выходных токенов. Сообщение Cloud.ru от 23 сентября 2026 года подтверждает, что коммерческий API-доступ уже был открыт к моменту публикации; это не дата публикации весов или открытия публичного API Сбера.

Покупка доступа. С 1 сентября новые платные клиенты — физические лица, а также пользователи, раньше не покупавшие пакеты, направляются на Cloud.ru. Это описано в тарифах для физлиц. Продажа пакетов у ООО «СалютДевайсы» завершилась 30 сентября 2026 года; пакеты, приобретённые с 1 сентября, действуют один месяц. Эти изменения касаются канала оплаты; об отключении Freemium API не объявлено.

Yandex Cloud

В каталоге Яндекса доступны Alice AI LLM, Alice AI LLM Flash, YandexGPT Lite 5 и YandexGPT Pro 5.1. Model Gallery также включает модели других разработчиков. В таблице приведены контекст и синхронные тарифы с НДС за миллион токенов:

МодельКонтекст, токеныВход/выход, руб.Чтение кэша, руб.
Alice AI LLM Flash65 536100/20025
Alice AI LLM131 072500/1200500
YandexGPT Pro 5.132 768800/800800
YandexGPT Lite 532 768200/200200

У Alice AI LLM кэшированный ввод стоит столько же, сколько обычный. URI моделей имеет вид gpt://<folder_id>/<model>. Идентификаторы: aliceai-llm, aliceai-llm-flash, yandexgpt-5-lite и yandexgpt-5.1. Кэширование включается автоматически, когда применимо, но не гарантировано и не распространяется на выходные токены.

Отдельная категория токенов встроенных инструментов стоит 25 руб. у Alice AI LLM Flash, 130 руб. у Alice AI LLM и 200 руб. у YandexGPT Pro 5.1 и Lite за миллион с НДС. К ней относятся все некэшированные токены истории при передаче результата встроенного инструмента, но не результаты пользовательских функций. Само обращение к инструменту оплачивается отдельно.

Alias yandexgpt/latest указывает на Pro 5 (yandexgpt-5-pro), а yandexgpt/rc — на Pro 5.1. У Pro 5 контекст 32 768 токенов, синхронный вход/выход и чтение кэша стоят 1200/1200 и 1200 руб. за миллион с НДС. Для воспроизводимости лучше использовать явные URI. У Alice AI LLM Flash доступны только OpenAI-совместимые API; остальные перечисленные модели также поддерживают API генерации текста.

При значительных изменениях модель получает новый URI. После окончания поддержки старый URI возвращает 400 Bad Request, автоматического переключения нет; явный URI нужен вместе с планом миграции.

Открытые веса Яндекса. 21 сентября 2026 года опубликована AliceAI-Foundation-80B-A3B-Base под Apache 2.0. Это обученная с нуля базовая MoE-модель с 80 млрд параметров всего, 3 млрд активных и контекстом до 262 144 токенов. Версия прошла предобучение и предназначена для дальнейшего дообучения; в каталоге API Yandex AI Studio она не указана.

14 сентября Яндекс опубликовал веса Alice AI Search Pretrain. Модель AliceAI-T5-35B-A0.6B также рассчитана на дообучение: это базовая encoder–decoder MoE-модель с контекстом 128 тыс. токенов под Apache 2.0.

Для компактного русскоязычного локального ассистента доступна YandexGPT-5-Lite-8B-instruct: 8 млрд параметров, контекст 32 тыс. токенов и собственная лицензия YandexGPT-5-Lite-8B. Одноимённые семейства в API и опубликованные чекпойнты нужно рассматривать отдельно: наличие весов не подтверждает их обслуживание в Yandex AI Studio.

T-Tech

T-lite-it-2.1 построена на Qwen3-8B, более крупная T-pro-it-2.1 — на Qwen3-32B. Обе русскоязычные модели имеют нативный контекст 32 768 токенов, поддерживают вызов инструментов и распространяются под Apache 2.0. Они работают только без режима рассуждения.

MWS

MWS GPT представляет собой платформу с каталогом развёртываний и OpenAI-совместимым API. При выборе модели на этой платформе нужно смотреть на конкретную размещённую модель.

В model передаётся идентификатор деплоймента, не просто название семейства. Базовый URL привязан к проекту: https://gpt.mwsapis.ru/projects/<имя проекта>/openai/v1, чат вызывается через /chat/completions. Нужен ключ сервисного аккаунта с ролью gpt.inferencer. Отдельные чат-модели принимают изображения; это проверяется для конкретного деплоймента.

Российский хостинг и расчёты в рублях могут упростить закупку и локализацию данных. Для работы с персональными, банковскими, медицинскими и другими чувствительными данными этого недостаточно: соответствие 152-ФЗ и отраслевым требованиям требует проверки договора, места обработки, сроков хранения журналов, использования запросов для улучшения моделей, мер защиты и собственной модели угроз. Качество русского языка также стоит оценивать на корпусе и в жанрах конкретной системы.

5. Где запускать модель

Выбор модели и выбор поставщика связаны: доступные функции, цена и условия обработки данных зависят от того, где она размещена. Основных вариантов четыре.

API разработчика. Обычно он первым получает новые функции, точные идентификаторы и официальную поддержку. Это естественный вариант, если нужны уникальные инструменты модели или прямой договор с её владельцем. При этом система зависит от географии, лимитов, политики deprecation и сроков отключения моделей у одного поставщика.

Шлюз-агрегатор. Он объединяет провайдеров одним интерфейсом, помогает распределять нагрузку и организовывать резервные маршруты. Например, OpenRouter предоставляет OpenAI-совместимые endpoints и настройки выбора провайдера.

provider.order задаёт предпочтение, но при включённых резервных маршрутах запрос может уйти к провайдеру вне списка. Для ограничения используются provider.only либо provider.order с allow_fallbacks=false. Конкретный регион или вариант endpoint требует полного provider slug: базовый slug обычно охватывает несколько endpoints.

provider.require_parameters по умолчанию равен false, и провайдер может проигнорировать неподдерживаемые параметры. Для обязательных параметров, включая структурированный вывод, следует задать require_parameters=true и проверить endpoint. Для tools, response_format и verbosity есть дополнительные предпочтения маршрутизации, но если ни один провайдер модели не поддерживает параметр, при стандартных настройках он всё равно может быть проигнорирован.

По документации OpenRouter, наценки на сам инференс нет. При покупке кредитов картой комиссия Standard составляет 5,5% (минимум $0,80), а Business — 8%. При использовании собственных ключей провайдеров (BYOK) действует комиссия 5% стоимости модели сверх бесплатного лимита. На Standard и Business лимит составляет $25 тыс. инференса в месяц по обычным ценам, на Enterprise определяется индивидуально.

Сам OpenRouter по умолчанию не журналирует содержимое запросов, но передаёт их выбранному провайдеру. Условия хранения данных и использования для обучения у выбранного провайдера нужно проверить и закрепить настройками маршрутизации.

provider.data_collection="deny" фильтрует провайдеров, а provider.zdr=true ограничивает инференс набором endpoints с политикой Zero Data Retention. Эти параметры не отменяют ограничений учётной записи; ZDR-фильтр сам по себе не охватывает серверные backend инструментов. На Business и Enterprise доступна региональная маршрутизация через https://eu.openrouter.ai и https://us.openrouter.ai; в таблице Standard её нет. Договорные SLA указаны только для Enterprise.

Специализированный хостинг открытых моделей. Он берёт на себя управление ускорителями и позволяет подобрать соотношение цены, задержки и пропускной способности. Каталог часто уже, чем у агрегатора. Так, GroqCloud разделяет production- и preview-модели и публикует их скорость, лимиты, цены и сведения о deprecation.

Лимиты хостинга могут отличаться от возможностей весов. Например, qwen/qwen3.8-27b на Groq имеет статус preview, контекст 131 072 и предел вывода 16 384 токена при цене $0,80/$4. Поэтому сравнение провайдеров требует проверки конкретного endpoint. Groq прямо указывает, что preview предназначен только для оценки, не для production; такие модели могут отключить с коротким уведомлением.

На Groq openai/gpt-oss-120b и openai/gpt-oss-20b имеют статус Production и стоят $0,15/$0,60 и $0,075/$0,30 соответственно. У обеих контекст 131 072 и предел вывода 65 536 токенов. Таблица Developer Plan указывает для них 250 тыс. TPM и 1000 RPM; это ограничения обслуживания, а не архитектуры весов.

Самостоятельное размещение. Оно даёт максимальный контроль над весами, журналами и обновлениями. В стоимость входят ускорители и резервирование, энергопотребление, оркестрация, наблюдаемость, обновления движка, проверка квантизации и работа инженеров. Практика локального запуска разобрана в главе 14 учебника.

Для сравнения вариантов полезно собрать условия в один список:

  • точный model ID и ревизия весов, максимальный ввод и вывод, поддерживаемые модальности, инструменты и квантизация;
  • задержки p50 и p95, лимиты запросов и токенов, кэширование;
  • регион обработки, хранение запросов и ответов, SLA;
  • порядок уведомления о смене цены, deprecation и отключении модели.

OpenAI-совместимый API упрощает перенос клиента, но совместимость формата ещё не означает совпадения всех параметров, вызова инструментов и семантики ответов. Эти возможности следует проверить у выбранного провайдера.

6. Практический выбор

Сложное рассуждение и агентное программирование. В начальный список кандидатов могут войти GPT-6 Astra и GPT-6.1 Sol, Claude Fable 5.1, Opus 5.5 и Sonnet 5.5, Gemini 3.8 Flash и 3.1 Pro Preview, Grok 4.7, MiniMax M3.1 Flash Preview и M3, MiMo V2.6 Pro, Muse Spark 1.3, Mistral Large 4, Medium 3.5 и подходящие открытые модели. Порядок в этом списке не отражает качество: итог зависит от задачи и условий запуска.

Здесь имеет смысл сравнивать стоимость успешно завершённой работы с учётом повторов и ручных исправлений. Более дорогой флагман может окупиться, если заметно сокращает ошибки. Для preview-моделей отдельно оценивают риск изменения или отключения перед использованием в production.

Массовая классификация, извлечение и преобразование текста. Для начала подходят недорогие GPT-6 Luna, Claude Haiku 5.5, Gemini Flash, DeepSeek V4.1 Flash, MiMo V2.6 Flash, Amazon Nova 2 Lite, Mistral Small 4 и компактные Qwen. Меньшая модель часто обеспечивает нужное прикладное качество быстрее и дешевле. Переход к крупной оправдан, когда измеримый выигрыш покрывает разницу в цене и задержке.

Изолированный контур. Выбор начинается с доступной инфраструктуры, требуемой длины контекста и качества. Qwen3.6-27B, Qwen3.8-27B, Gemma 4 26B A4B, gpt-oss-20b, Nemotron 3.5 Lightning, Muse Glimmer, T-lite-it-2.1 и компактные Granite 4.2 проще для первого развёртывания, чем DeepSeek V4.1 Flash, V4 Pro, Kimi K3 или Qwen3.8-2.4T-A95B.

У Qwen3.8-Flash-Next, GLM-5.3-Flash и MiniMax M3 небольшая активная часть снижает вычисления на токен, но требования к памяти определяются полным объёмом весов. В регулируемом облачном контуре выбор дополнительно ограничен допустимыми договорами и регионами обработки.

Длинные документы. Помимо размера окна важны доля найденных фактов в разных частях документа, устойчивость к противоречащим фрагментам, задержка и полная стоимость. Иногда RAG с меньшим окном оказывается надёжнее и дешевле загрузки всего архива в один запрос.

Прикладную оценку удобно строить в следующем порядке:

  1. Подобрать реальные задачи, включая редкие и опасные случаи.
  2. Определить критерии правильности и неприемлемые ошибки.
  3. Задать одинаковые инструменты, промпты и бюджеты рассуждения либо обосновать различия.
  4. Измерить качество, задержки p50 и p95 и стоимость успешно решённого случая с учётом повторов, кэша и вызовов инструментов.
  5. Проверить структурированный вывод, инструменты, длинный контекст и целевые языки.
  6. Проверить безопасность, лицензию, обработку данных и доступность по договору.
  7. Повторять оценку при смене модели, snapshot, провайдера или параметров инференса.

Методика таких тестов приведена в главе об оценке качества, а переносимый слой работы с моделями описан в главе об API. Model ID, адрес API и параметры удобно хранить в конфигурации, чтобы обновлять их по мере изменения сервисов. Ограничение расходов и заранее проверенный резервный маршрут помогают поддерживать работу системы при таких изменениях.

* Компания Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.

Связь с редакцией