OpenAI представила GPT-Live-1 — голосовую модель, которая может одновременно слушать и говорить. Кирилл Пшинник проверил её в реальных звонках: ИИ самостоятельно забронировал столик на пятерых, согласовал условия депозита и попробовал подтвердить участие сотрудника в вебинаре.
Привычный голосовой бот работает по очереди: слушает вопрос, обрабатывает его и только потом отвечает. GPT-Live-1 приближает этот процесс к обычному человеческому разговору. Модель может одновременно слушать и говорить, реагировать на перебивания и сохранять контекст беседы, даже если собеседник меняет тему посреди фразы.
Другое принципиальное отличие — возможность разделить разговор и выполнение задачи. Пока голосовой агент общается с клиентом, отдельная модель может искать информацию, обращаться к базе данных или выполнять действие в подключённом сервисе. Разговор при этом не обязательно останавливать до получения ответа.
Для бизнеса это переход от бота, который последовательно обрабатывает реплики, к агенту, способному поддерживать диалог и одновременно выполнять поручение. Насколько хорошо такая схема работает за пределами демонстрационного интерфейса, Кирилл Пшинник проверил на двух телефонных звонках.
Первым собеседником агента стал администратор ресторана. Кирилл задал модели роль своего ассистента Эмили и поручил забронировать столик на пятерых. Никаких инструкций о стоимости бронирования или порядке внесения депозита не было.
Во время разговора администратор сообщил об обязательном депозите — 1500 рублей с человека. Вместо того чтобы прервать звонок и запросить у Кирилла новую инструкцию, агент предложил собственный вариант (ниже — сокращённая запись разговора, реплики приведены с сохранением смысла):
— Для дня рождения у нас предусмотрен депозит 1500 рублей с человека. На пятерых — 7500.
— Поняла. Скажите, можно оплатить депозит на месте, за полчаса до начала?
— Давайте так и сделаем, приходите чуть пораньше и внесёте.
Эмили согласовала условия и завершила бронирование на имя Кирилла без его вмешательства. Работа голосовой модели за этот разговор обошлась в 8,5 цента — без учёта телефонии и фоновых вызовов.
Ценность здесь не в том, что ИИ произнёс нужные слова. Агент столкнулся с условием, которого не было в исходном задании, сам предложил решение и довёл разговор до результата. Именно эта самостоятельность отличает агента от системы, работающей строго по прописанному сценарию. Однако в коммерческом применении границы самостоятельности необходимо задавать заранее: согласовать время внесения депозита и принять от имени клиента дополнительное финансовое обязательство — не одно и то же.
Во втором эксперименте голосовой агент Софья позвонила сотруднику Егору, чтобы подтвердить его участие в вебинаре. Выполнить задачу с первого звонка не вышло: Егор не смог дать окончательный ответ.
— Сможете подключиться сегодня в 19:00 по Москве?
— Ну я же сказал, что ещё не знаю.
Софья не стала добиваться формального согласия и фиксировать участие как подтверждённое. Вместо этого предложила следить за напоминаниями и датами в боте и завершила разговор. Важно, что это не отказ: сотрудник не отклонил приглашение, а лишь не смог подтвердить участие — и агент оставил статус открытым, а не закрыл его как решённый.
Для клиентского сервиса это не менее показательный результат, чем успешное бронирование. Автоматизация имеет смысл, только если система различает выполненную задачу и просто завершённый контакт. Отправить напоминание, получить согласие, зафиксировать неопределённый ответ — это разные исходы, которые нельзя сводить к одному показателю «обработанных звонков».
В «Зерокодере» уже есть собственный опыт применения ИИ-агентов в продажах. Текстовый консультант «Ульяна» работает на страницах курсов: отвечает на вопросы пользователей, собирает контакты и передаёт заявки в отдел продаж. По данным команды, за месяц система обрабатывает около 120 заявок без расширения штата консультантов, а собрать её силами компании вышло в 3–4 раза дешевле, чем заказывать подрядчику.
В отличие от бота, ограниченного набором готовых ответов, «Ульяна» держит контекст всей беседы, сама ищет ответ в базе знаний курсов, проверяет контакт и отсекает дубли, а диалог ведёт по методологии СПИН-продаж — то есть сама решает, когда уместно перейти к сбору контактов. Отдельно решён вопрос данных, который для голосового канала стоит так же остро: перед отправкой в модель телефон и почта вырезаются из текста и заменяются метками, а реальные контакты подставляются обратно только на нашем сервере в момент передачи заявки. Во внешнюю модель уходит обезличенный диалог.
Но перенос этой логики в телефонию пока остаётся отдельной задачей: голосовой эксперимент Кирилла и действующий текстовый консультант — два самостоятельных решения.
Голосовой слой GPT-Live-1 стоит $0,05 за минуту, но принимать эту цифру за полную себестоимость звонка было бы ошибкой. Отдельно оплачиваются фоновая модель, телефония и инфраструктура, а стоимость конкретного разговора зависит ещё и от его длительности и числа обращений к дополнительным инструментам.
Экономический интерес для бизнеса — не только в цене минуты. ИИ-агент позволяет обрабатывать типовые обращения без пропорционального роста штата операторов, а сотрудникам оставлять задачи, где нужны переговоры, нестандартные решения или личное участие.
Ближайшие сценарии — подтверждение записей и регистраций, первичная квалификация обращений, ответы на типовые вопросы с передачей сложных случаев менеджеру. Эксперимент Кирилла показал выполнение конкретного поручения и попытку получить подтверждение по телефону; эффективность остальных сценариев ещё предстоит проверять в реальных бизнес-процессах.
Здесь важна не сама демонстрация, а то, как новую технологию встроить в работу без риска. В «Зерокодере» для этого есть собственная модель управления — метрикократия, гибрид холакратии и «власти метрик», которую мы развиваем последние три года. Её принцип простой: любое решение о масштабировании принимается не «на глаз», а после честного замера по четырём показателям — ускорение процесса, число проверенных гипотез, индекс удовлетворённости и финансовая отдача.
«Мы охотно берём в работу экспериментальные инструменты вроде GPT-Live-1, но по тем же правилам, что и всё остальное: сначала гипотеза и замер, потом масштаб. Голосовой агент уже показал, что способен сам вести разговор и доводить задачу до результата. Но прежде чем сажать его на реальную линию, я хочу увидеть цифры — насколько он ускоряет обработку звонков, какую долю обращений закрывает без человека и как на него реагируют клиенты. Демонстрация — это ещё не метрика», — комментирует Кирилл Пшинник, сооснователь и CEO «Зерокодера».
Остаются и практические ограничения. В нашем тесте русская речь модели сохраняла лёгкий акцент, а использование OpenAI API из России связано с территориальными ограничениями сервиса. Разнесение голосового и серверного компонентов на разные серверы само по себе эти ограничения не снимает и вопрос обработки персональных данных не решает — в голосовом канале обезличивать контакты сложнее, чем в тексте, где это у нас уже отлажено на «Ульяне». Архитектуру, допустимость использования сервиса и порядок работы с данными клиентов нужно оценивать отдельно.
Два звонка показали разные стороны одной технологии. В ресторане агент сам согласовал условия и выполнил поручение; в разговоре с сотрудником — не получил нужного ответа и не стал подменять его формальным согласием.
Для бизнеса здесь важна не иллюзия оператора, который всегда добивается результата, а возможность передать машине саму работу с типовыми звонками — сохранив контроль над тем, какие решения она вправе принимать и когда должна передать разговор человеку.