OpenAI запустила GPT-Live: ChatGPT говорит как человек

OpenAI в среду запустила GPT-Live - пару новых голосовых моделей, которые полностью перепроектируют то, как люди разговаривают с ChatGPT. Вместо существующего Advanced Voice Mode компания предлагает архитектуру, которая может слушать и говорить одновременно - как в настоящем человеческом разговоре.

Две модели, GPT-Live-1 и GPT-Live-1 mini, выходят глобально с сегодняшнего дня на iOS, Android и ChatGPT.com. GPT-Live-1 становится голосовой моделью по умолчанию для платных пользователей Go, Plus и Pro, а GPT-Live-1 mini обслуживает бесплатных пользователей. OpenAI также планирует выпустить модели в API - разработчики могут записаться в лист ожидания.

Это третье поколение голосовой технологии ChatGPT примерно за два года - и самая явная попытка OpenAI превратить чат-бота в нечто, что напоминает разговор с коллегой, а не запрос к поисковику.

Full-duplex: почему это меняет всё

Ключевое техническое изменение в GPT-Live - это full-duplex архитектура. В телекоммуникациях full-duplex означает, что оба участника разговора могут говорить и слушать одновременно. В применении к AI это значит, что модель непрерывно обрабатывает входящий звук, даже пока генерирует собственный ответ. Больше не нужно ждать паузы, чтобы понять, закончили ли вы мысль.

«Вместо обработки последовательности отдельных сообщений GPT-Live непрерывно обрабатывает входные данные, генерируя выходные, - пишут OpenAI в исследовательском блоге. - Модель может принимать решения о взаимодействии множество раз в секунду: говорить ли, продолжать слушать, сделать паузу, прервать или вызвать инструмент».

На практике это голосовой ассистент, который может вставлять «мхм», «ага», «понял» пока вы ещё говорите, распознавать естественную паузу не вклиниваясь преждевременно, и справляться с быстрыми перебиваниями, не сбивая весь диалог.

Предыдущий Advanced Voice Mode работал на жёстком обмене репликами. OpenAI признаёт: «определение конца реплики по тишине приводило к тому, что даже короткая пауза или фоновый шум могли быть приняты за окончание - и модель перебивала в неестественные моменты». Один исследователь назвал это «рацией».

Как OpenAI разделила голос и интеллект на два слоя

GPT-Live вводит второе структурное изменение, которое может оказаться не менее важным для enterprise: оно отделяет голосовой слой от слоя рассуждений.

Когда пользователь задаёт простой вопрос, GPT-Live отвечает сам. Но когда запрос требует поиска в вебе, глубоких рассуждений или сложной агентной работы, GPT-Live делегирует задачу frontier-модели на фоне - на старте это GPT-5.5, крупная языковая модель, выпущенная в апреле. При этом GPT-Live продолжает разговор с пользователем, пока вычисления идут асинхронно.

Эта модульная архитектура позволяет OpenAI обновлять интеллект голосового ассистента без переобучения самой голосовой модели. Для бизнеса это значит, что голосовой агент может поддерживать естественную беседу с клиентом, одновременно запрашивая базы данных, ища информацию в интернете или выполняя многошаговые рассуждения - задачи, которые в старой архитектуре вводили несколько секунд мёртвой тишины.

Скандал со Scarlett Johansson: как OpenAI пытается двигаться дальше

Advanced Voice Mode запускался в тени одного из самых болезненных кризисов OpenAI. Во время презентации GPT-4o компания показала голос «Sky», который многие слушатели сочли неотличимым от голоса Скарлетт Йоханссон. Актриса заявила, что отказала CEO OpenAI Сэму Альтману в предложении озвучить систему, и была «в шоке, зла и не верила» когда продукт вышел с голосом, который её собственные друзья не могли отличить от её собственного.

OpenAI удалила голос и извинилась, но инцидент привлёк внимание SAG-AFTRA и членов Конгресса. GPT-Live выглядит попыткой уйти от этих скандалов: OpenAI сообщает, что «переработала девять разных голосов ChatGPT для GPT-Live», а система «спроектирована для разговора, а не для имитации голоса».

Что это значит для бизнеса

OpenAI раскрыла, что более 150 млн человек в неделю общаются с ChatGPT голосом - заметная часть от 900 млн еженедельных активных пользователей платформы. Голос превратился в самостоятельный продукт: практика языка, сказки на ночь, болтовня в дороге, помощь без рук.

Для предпринимателей во Владивостоке и на Дальнем Востоке, которые рассматривают внедрение искусственного интеллекта в клиентский сервис, GPT-Live означает новый стандарт качества. Если раньше голосовые чат-боты звучали как роботы с паузами и неестественными перебиваниями, то теперь разговор с AI приближается к человеческому.

Для бизнеса, который использует чат-ботов для общения с клиентами, это шаг вперёд: улучшение пользовательского опыта прямо влияет на конверсию и лояльность. GPT-Live недоступен в API на старте, но тренд очевиден - голосовые AI-интерфейсы становятся мейнстримом, и компаниям стоит готовиться к этому уже сейчас.

Внедрение искусственного интеллекта в ваш бизнес

Нейросети для бизнеса - не будущее, а сегодняшний инструмент. AG Branding помогает компаниям во Владивостоке внедрять AI-агентов и автоматизацию. Бесплатный аудит ваших процессов.

Получить AI-аудит →