Перейти к содержимому

IT&SOFT3 мин чтенияИИ

Голосовые ИИ-агенты в 2026: что уже работает, а что ещё маркетинг

Задержка, перебивание, распознавание в шуме и телефонная линия: где голосовые агенты действительно применимы, а где демо красивее реальности.

Голосовые демо выглядят лучше, чем голосовые внедрения. Причина не в том, что кто-то обманывает: демо снимают в тишине, с хорошим микрофоном, на сценарии, который отрепетирован. Реальность — это шумный склад, телефонная линия 8 кГц и человек, который перебивает на середине фразы.

Что действительно работает

Приём заявок по типовому сценарию. Записать на приём, принять заказ, уточнить адрес. Короткие реплики, ограниченный словарь, понятная цель звонка. Здесь голосовой агент работает и заметно дешевле оператора.

Исходящие подтверждения. Напомнить о записи, подтвердить доставку, спросить про удобное время. Сценарий полностью в руках агента, вариантов ответа немного.

Квалификация входящих. Понять, зачем звонит человек, и перевести на нужного специалиста с уже собранным контекстом. Даже если агент только собирает данные и переводит — это экономит минуты на каждом звонке.

Голосовой ввод там, где руки заняты. Склад, цех, автомобиль. Часто это даже не разговор: человек надиктовывает форму. Работает лучше всего именно такой сценарий.

Что пока держится на маркетинге

Длинная консультация. Пять минут разговора с ветвлениями, возражениями и возвратом к сказанному в начале. Агент теряет нить, человек теряет терпение.

Неотличимость от человека. Заявляется часто. На практике люди понимают, что говорят с роботом, за две-три реплики — по ритму и по слишком ровной интонации. И это нормально: представляться роботом честнее, а разговор от этого не становится хуже.

Эмоциональная работа. Успокоить рассерженного клиента, удержать уходящего. Здесь агент вредит: ощущение «мне даже человека не дали» усиливает конфликт.

Сложные имена и адреса на слух. Фамилии, названия улиц, номера договоров. Ошибки распознавания в этом классе слов остаются высокими, и цена ошибки в адресе доставки — реальные деньги.

Три технических ограничения, которые определяют всё

Задержка. Комфортная пауза в разговоре — до 700 миллисекунд. В неё нужно уложить распознавание речи, работу модели и синтез. Каждое звено добавляет время, и на плохой сети бюджет исчерпывается мгновенно. Отсюда практическое следствие: чем короче реплики агента, тем живее диалог.

Перебивание. Человек начинает говорить, не дослушав. Агент обязан замолчать немедленно и понять сказанное. Реализуется это отдельно от основной логики и является одним из главных отличий рабочей системы от демо.

Телефонный канал. Узкая полоса, компрессия, шум. Модель, отлично работающая на записи с ноутбука, на телефонной линии ошибается заметно чаще. Тестировать надо на реальной линии. Файл с ноутбука ничего не покажет.

Как мы это внедряем

Начинаем с одного сценария и одного номера. Не «голосовой ассистент компании», а «запись на приём по этому номеру». Пишем разговоры, слушаем их целиком первую неделю — не выборочно, целиком. Считаем долю доведённых до цели звонков и долю переводов на человека.

Правило эскалации задаётся с самого начала и звучит просто: две неудачные попытки понять — перевод на оператора. Не пять, не «попробуем ещё раз другими словами». Две.

И отдельно: агент всегда представляется роботом в первой реплике. Это снимает половину раздражения и, по нашим наблюдениям, не снижает долю доведённых звонков.

Когда возвращаться к теме

Если у вас больше сотни однотипных звонков в день, сценарий укладывается в минуту и цена ошибки невелика — сейчас хорошее время. Если звонков десятки или каждый разговор уникален — подождите ещё, ничего не потеряете.

ПоделитьсяTelegramVK
Автор

IT&SOFT

Небольшая команда инженеров. Пишем о том, что делаем руками, и о том, что при этом ломается. Если у вас похожая задача, напишите — разберём её на вашем примере.

Обсудить задачу
Подписаться на новые разборы
Дальше

Похожая задача
у вас?

Опишите её в брифе. В рабочее время вернёмся с оценкой срока и стоимости в течение двух часов.