OpenAI выпустила полнодуплексную голосовую модель GPT-Live-1 в API

GPT-Live-1 может одновременно слушать пользователя и формировать голосовой ответ, обрабатывая паузы и перебивания без переключения между отдельными стадиями диалога. Голосовой слой стоит $0,05 за минуту и может передавать сложные задачи выбранной разработчиком серверной модели.

OpenAI открыла разработчикам доступ к GPT-Live-1 — голосовой модели с полнодуплексной архитектурой. Она непрерывно обрабатывает входящий звук во время генерации ответа, поэтому способна реагировать на паузы, перебивания, фоновую речь и изменение направления разговора.

GPT-Live-1 отвечает за голосовое взаимодействие, а рассуждения, вызов инструментов и выполнение действий может делегировать отдельной текстовой модели — например, GPT-6 Astra или решению стороннего поставщика. Разработчики могут настраивать через системную инструкцию тон, темп и стиль речи агента.

API автоматически предоставляет расшифровку речи и текст ответа, поддерживает распознавание буквенно-цифровых последовательностей, приоритетные ключевые слова и определение границ реплик. Для модели также подготовлены 12 голосов с разными акцентами, диалектами и языковыми особенностями.

По оценкам OpenAI, GPT-Live-1 превосходит GPT-Realtime-2.1 в тесте Full Duplex Bench на 30 процентных пунктов. Стоимость голосового слоя составляет $0,05 за минуту; серверную модель и инструменты для агента разработчик выбирает отдельно.

Источник: openai.com

Связь с редакцией