GPT-Live: голосовые модели ChatGPT научились говорить и слушать одновременно
Раньше голосовой режим ChatGPT работал по очереди - сначала слушал, потом отвечал. GPT-Live слушает и говорит одновременно, как в обычном человеческом разговоре, включая короткие реплики вроде «угу» посреди чужой фразы.
OpenAI выпустила GPT-Live - новое поколение голосовых моделей на полнодуплексной архитектуре, которая может слушать и говорить одновременно, а не по очереди. Во время разговора модель может показывать, что слушает, короткими репликами вроде «угу» или «ага», вступать в быстрый диалог или просто молчать, пока пользователь думает. Есть две версии: GPT-Live-1 mini заменил прежний Advanced Voice Mode и стал версией по умолчанию для бесплатных пользователей, а платные пользователи тарифов Go, Plus и Pro получают более крупную модель GPT-Live-1. Архитектура напрямую интегрируется с GPT-5.5 и другими продвинутыми текстовыми моделями: для вопросов, требующих поиска в интернете, более глубокого рассуждения или сложной работы, GPT-Live делегирует задачу текстовой модели и возвращает результат в разговор, когда он готов. Полнодуплексность делает возможными естественные перебивания и живой перевод в реальном времени, хотя демонстрация перевода на хинди показала проблемы с произношением - языковая оптимизация ещё не завершена для всех языков. С 31 июля 2026 года аудио, сгенерированное через GPT-Live в голосовом режиме ChatGPT и через API, включает водяной знак SynthID, а публичный и API-доступный инструмент проверки OpenAI умеет обнаруживать признаки такого происхождения. Голосовыми функциями ChatGPT пользуются более 150 миллионов человек.
Что такое GPT-Live
GPT-Live - новое поколение голосовых моделей на полнодуплексной архитектуре: модель может слушать и говорить одновременно, а не строго по очереди, как раньше. Во время разговора она может показывать, что слушает, короткими репликами вроде «угу» или «ага», вступать в быстрый обмен репликами или просто молчать, если пользователю нужна пауза на подумать.
Две версии модели
GPT-Live-1 mini заменил прежний Advanced Voice Mode и стал версией по умолчанию для бесплатных пользователей ChatGPT. Платные пользователи тарифов Go, Plus и Pro получают по умолчанию более крупную модель - GPT-Live-1.
Интеграция с текстовыми моделями
Архитектура напрямую интегрируется с GPT-5.5 и другими продвинутыми текстовыми моделями. Для вопросов, требующих поиска в интернете, более глубокого рассуждения или сложной работы, GPT-Live делегирует задачу текстовой модели последнего поколения «за кадром» и возвращает готовый результат обратно в разговор, когда он готов - разговор при этом не прерывается ожиданием.
Живой перевод и границы возможностей
Полнодуплексная архитектура делает возможными естественные перебивания в разговоре и функции вроде живого перевода в реальном времени. При этом демонстрация перевода на хинди показала проблемы с произношением и неестественную манеру речи - это указывает, что языковая оптимизация пока не завершена одинаково для всех языков.
Водяной знак SynthID
С 31 июля 2026 года аудио, сгенерированное через GPT-Live в голосовом режиме ChatGPT и через API OpenAI, включает водяной знак SynthID. Публичный инструмент проверки OpenAI умеет обнаруживать признаки такого происхождения в поддерживаемых аудиофайлах, а разработчики и организации получили доступ к проверке через API, чтобы встроить проверку происхождения в собственные рабочие процессы.
Масштаб использования
Голосовыми функциями ChatGPT пользуются более 150 миллионов человек - это даёт представление о том, насколько массовым стал этот способ взаимодействия с ассистентом, а не только текстовый чат.
Чек-лист
Что учесть при переходе на GPT-Live
Проверено, какая версия модели доступна по умолчанию на вашем тарифе - mini на бесплатном, полная на платных
Для сложных вопросов учтено, что модель делегирует задачу текстовой модели, а не отвечает мгновенно сама
Живой перевод протестирован на нужном языке заранее - качество может отличаться между языками
Учтено наличие водяного знака SynthID при работе со сгенерированным аудио в чувствительных сценариях
Для проверки происхождения аудио использован публичный инструмент или API-доступ OpenAI
Частые вопросы
Что значит «полнодуплексная» голосовая модель?
Модель может слушать и говорить одновременно, а не строго по очереди - это позволяет естественные перебивания и короткие реплики вроде «угу» во время чужой фразы.
Какая версия GPT-Live доступна бесплатно?
GPT-Live-1 mini - она заменила прежний Advanced Voice Mode и стала версией по умолчанию для бесплатных пользователей.
Что получают платные подписчики?
Пользователи тарифов Go, Plus и Pro получают по умолчанию более крупную модель GPT-Live-1.
Как GPT-Live обрабатывает сложные вопросы, требующие поиска или глубокого рассуждения?
Модель делегирует такие задачи текстовой модели последнего поколения вроде GPT-5.5 и возвращает готовый результат обратно в разговор.
С какой даты аудио GPT-Live содержит водяной знак SynthID?
С 31 июля 2026 года - для аудио, сгенерированного через голосовой режим ChatGPT и через API OpenAI.
Одинаково ли хорошо GPT-Live работает на всех языках при живом переводе?
Нет, демонстрация на хинди показала проблемы с произношением и неестественную речь - оптимизация под разные языки ещё не завершена одинаково.