OpenAI показала GPT-Live — полноценный голосовой ИИ, который умеет слушать и говорить одновременно
OpenAI представила новые разговорные модели — флагманскую GPT-Live-1 и облегчённую GPT-Live-1 mini. Главная фишка новинок — поддержка режима Full-Duplex: в отличие от старой схемы, где голос сначала переводился в текст, затем обрабатывался и озвучивался обратно, новые модели умеют слушать и говорить одновременно. Это позволяет пользователю перебивать ИИ прямо во время речи так же естественно, как живого человека, и открывает дорогу для бесшовного синхронного перевода.
OpenAI представила новые разговорные модели — флагманскую GPT-Live-1 и облегчённую GPT-Live-1 mini. Главная фишка новинок — поддержка режима Full-Duplex: в отличие от старой схемы, где голос сначала переводился в текст, затем обрабатывался и озвучивался обратно, новые модели умеют слушать и говорить одновременно. Это позволяет пользователю перебивать ИИ прямо во время речи так же естественно, как живого человека, и открывает дорогу для бесшовного синхронного перевода.
Нынешний продвинутый голосовой режим в ChatGPT по умолчанию заменят на мини-версию, а платным подписчикам откроют доступ к большой модели. Чтобы решать сложные задачи, голосовой движок научили незаметно перенаправлять тяжёлые запросы на мощные текстовые модели вроде GPT-5.5. Кроме того, обновлённый ассистент теперь умеет подолгу молчать, впитывая контекст беседы, пока к нему не обратятся, и выводить информацию на экран в визуальном формате.
Разработчики ориентируют новинку на долгие hands-free сессии: руководитель продукта Этти Элети признался, что сам регулярно общается с ботом по 30-40 минут во время прогулок. В OpenAI верят, что голос станет главным интерфейсом для управления компьютерами и сложной работой ИИ-агентов, что косвенно подтверждает слухи о разработке компанией собственных умных наушников. На этом поле уже вовсю толкаются конкуренты в лице Apple, Amazon и стартапов вроде Sesame. При этом в OpenAI подчёркивают, что создают именно рабочего помощника, а не ИИ-компаньона для романтических привязанностей, поэтому в систему встроили жёсткие протоколы безопасности и цензуры для подростков.
Впрочем, до идеала технологии ещё далеко. На живой демонстрации функции перевода на хинди ассистент выдал неестественные, книжные фразы и говорил с тяжелейшим американским акцентом, отмечает TechCrunch. Разработчики признают проблему и обещают оптимизировать систему под большинство популярных языков мира.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.