Vapi, Retell, Bland, Synthflow и ElevenLabs: как выбрать голосового ИИ-агента в 2026
Марк Ингер, CEO — Pleep
Vapi, Retell, Bland, Synthflow и ElevenLabs это не пять версий одного продукта. Vapi и Retell это платформы для разработчиков, на которых вы собираете агента сами. Bland держит весь стек у себя и заточен под большой объём исходящих. Synthflow это no-code конструктор для агентств. ElevenLabs пришёл из качества синтеза речи и добавил агентский слой позже. Если вы продаёте на русском или казахском, или если после звонка разговор должен продолжиться в WhatsApp, ни одна из пяти под это не сделана. Именно эту дыру закрывает Pleep.
Любое сравнение голосовых ИИ-агентов называет одни и те же платформы в одном и том же порядке. Большинство таких материалов заканчивается таблицей функций: задержка, обработка перебиваний, интеграции, цена за минуту. Таблица полезная, и на ней размышление обычно и останавливается.
Есть два вопроса, которые решают исход гораздо чаще, и их почти никто не задаёт.
Первый: на каком языке на самом деле говорят ваши клиенты. Бенчмарки публикуются на английском. Если у вас звонки на русском или казахском, английские цифры почти ничего не говорят о том, что услышит ваш клиент, и ломается это не сообщением об ошибке, а падением доли ответивших, которую никто не связывает с голосовой моделью.
Второй: что происходит, когда звонок закончился. На большинстве рынков звонок это один шаг разговора, который продолжается в другом месте. Если платформа отдаёт вам расшифровку и на этом останавливается, кто-то из команды должен руками перенести контекст в WhatsApp или CRM, и именно на этом переносе лид остывает.
Это сравнение сначала разбирает, в чём каждая платформа действительно сильна, а потом возвращается к этим двум вопросам.
Всё ниже отражает то, как эти продукты позиционируются и документированы на август 2026 года. Тарифы за минуту в этой категории меняются часто, поэтому любую конкретную цифру, включая прочитанную здесь, стоит проверить на странице тарифов самого вендора перед решением.
Пять платформ это три разных продукта
Если правильно их сгруппировать, большая часть работы по выбору отпадает.
Инфраструктура и платформы для разработчиков. Vapi и Retell дают API, набор примитивов и много контроля. Агента собираете вы. Подразумевается инженер.
Готовые системы исходящего обзвона. Bland держит весь стек у себя, а не оркестрирует чужие компоненты. Это осознанная ставка на контроль и стабильность на объёме.
No-code конструкторы. Synthflow сделан для тех, кто никогда не откроет документацию API, с сильным акцентом на агентства, которые перепродают агентов своим клиентам.
Платформы вокруг голоса. ElevenLabs заработал репутацию на качестве синтеза речи и уже оттуда вырос в разговорных агентов.
Отдел продаж из четырёх человек, выбирающий Vapi, потому что бенчмарку понравилась его задержка, это частая и дорогая ошибка. Как и инженерная команда, выбравшая Synthflow и потом воюющая с конструктором ради того, что в API решалось десятью строками.
Vapi
Vapi это слой оркестрации. Он стоит между распознаванием речи, языковой моделью и синтезом, и позволяет менять каждый из этих компонентов независимо. Можно приносить свои ключи провайдеров, выбирать модель под каждого ассистента и детально управлять тем, как агент передаёт очередь в разговоре.
В чём силён. Гибкость и большая поверхность документированного контроля. Если у вас нестандартное требование, именно у Vapi выше всего шанс найти обходной путь. Работа с вызовом функций и переводом на человека зрелая, а сообщество достаточно большое, чтобы почти любую вашу проблему кто-то уже ловил.
Чего это стоит. Инженерного времени, постоянно. У агента появляется владелец: промпты, определения инструментов, цепочка ключей провайдеров. Стоимость складывается из компонентов, а не из одного числа, поэтому прогнозировать её сложнее, чем кажется в первый месяц.
Берите, если у вас есть инженеры, вы хотите контролировать каждый слой, и голос для вас это продуктовая поверхность, а не канал продаж.
Retell AI
Retell тоже платформа для разработчиков, но ближе к эксплуатации. Акцент на том, чтобы надёжно гонять звонки на объёме: аналитика звонков, мониторинг, пакетный обзвон, разбор после разговора и панель, которой ваша операционная команда может пользоваться без разработчика рядом.
В чём силён. В разрыве между прототипом и продакшеном. Собрать демо-агента легко на любой платформе из этого списка. Гонять десять тысяч звонков в неделю и понимать, какие из них провалились и почему, это другая задача, и Retell на неё явно потратил время.
Чего это стоит. Инженерии меньше, чем у Vapi, и больше, чем у конструктора. Вы всё ещё описываете агента в интерфейсе, сделанном для разработчика, и всё ещё сами делаете интеграции с тем, чем уже пользуется команда.
Берите, если вам нужна платформа для разработчиков, но узкое место это эксплуатация обзвона и отчётность, а не экзотическая кастомизация.
Bland AI
Bland держит собственную инфраструктуру, а не оркестрирует компоненты других вендоров. Это центральное решение, из которого следует всё остальное: более предсказуемое поведение под нагрузкой, более плотный контроль задержки и продукт, нацеленный на крупные компании с серьёзным объёмом исходящих.
В чём силён. Объём и предсказуемость на объёме. Когда весь путь это стек одной компании, меньше подвижных частей, которые могут просесть в три часа ночи, и корпоративного покупателя это волнует сильнее, чем возможность поменять провайдера синтеза.
Чего это стоит. Гибкости, намеренно. Вы получаете их стек таким, каким они его сделали. Для команды, у которой задача это ровно исходящий обзвон на объёме, это плюс. Для команды с нестандартным требованием это стена.
Берите, если объём исходящих это и есть вся задача, и вы предпочли бы купить систему, а не собирать её.
Synthflow
Synthflow это no-code вход в категорию. Визуальный конструктор, шаблоны и сильный фокус на агентствах, которые делают агентов для клиентов и хотят white-label, субаккаунты и реселлерскую модель.
В чём силён. Скорость до работающего агента без инженера и коммерческая модель вокруг агентств. Если вы маркетинговое агентство, добавляющее голосовых агентов в услуги, продукт сделан под вас так, как платформы для разработчиков не сделаны.
Чего это стоит. Потолка. Конструкторы прекрасны ровно до момента, когда требование выходит за то, что конструктор предусмотрел, и дальше обходной путь оказывается хуже, чем был бы код.
Берите, если у вас нет инженерного ресурса или вы перепродаёте агентов клиентам как услугу.
ElevenLabs Agents
ElevenLabs это голосовая компания в этом списке. Синтез речи это причина, по которой к ним приходят, и для многих сценариев именно он решает: если агент звучит очевидно синтетически, всё дальше по цепочке страдает.
В чём силён. Качество голоса и управление им, включая клонирование и тонкую настройку подачи. Если ваш бренд зависит от того, как он звучит, это самая сильная отправная точка.
Чего это стоит. Агентский и эксплуатационный слой моложе голосового. Вы покупаете сначала лучший голос, а платформу вокруг него уже во вторую очередь. Для части команд это правильный размен, для части нет.
Берите, если качество самого голоса это то, по чему вас будут судить покупатели.
Где место Pleep и где его нет
Pleep это не голосовая инфраструктурная платформа, и в лобовом инфраструктурном сравнении он проиграет Vapi или Retell. Это ИИ-продавец, а голосовой канал одна из поверхностей, через которые он продаёт.
Различие важное, потому что оно меняет то, подо что продукт оптимизируется. Vapi оптимизируется под то, что вы можете построить. Pleep оптимизируется под то, закроется ли сделка.
Один агент на голос и переписку. Тот же агент, который позвонил клиенту, ведёт WhatsApp, Instagram Direct, Telegram и виджет на сайте из одной базы знаний. Звонок, закончившийся без решения, продолжается в WhatsApp с сохранённым контекстом, а не превращается в расшифровку, которую кто-то должен прочитать и что-то по ней сделать.
Русский и казахский как основные языки. Не «поддерживает 30 языков» в таблице функций, а именно как основной случай. Для тех, кто продаёт в Центральной Азии, это самое большое практическое отличие, и в англоязычных бенчмарках оно не видно вообще.
Локальная коммерческая обвязка. Нативные amoCRM и Bitrix24, Altegio и Google Calendar для записи, МойСклад для остатков и оплата прямо в переписке через Kaspi. Глобальные платформы интегрируются с HubSpot и Salesforce, что правильно для их рынка и бесполезно на этом.
Цена в местной единице. Голос считается по 52 тенге за минуту поверх тарифа по объёму сообщений, который начинается примерно от 42 380 тенге в месяц с 1500 сообщениями. Есть и программа, где вы платите долю от закрытой агентом выручки вместо подписки.
Где Pleep неправильный ответ. Если нужно менять провайдера синтеза, крутить свои модели или встраивать голос в продукт, который вы разрабатываете, берите Vapi или Retell. Если задача это миллионы исходящих звонков на английском, Bland сделан под это, а Pleep нет. Если вы агентство, перепродающее white-label агентов, коммерческая модель Synthflow подходит лучше. Если ваш дифференциатор это сам голос, начинайте с ElevenLabs.
Из чего вы на самом деле выбираете
| Vapi | Retell | Bland | Synthflow | ElevenLabs | Pleep | |
|---|---|---|---|---|---|---|
| Тип продукта | Платформа для разработчиков | Платформа для разработчиков | Готовая система | No-code конструктор | Платформа вокруг голоса | ИИ-продавец |
| Кто это эксплуатирует | Инженер | Инженер и операционист | Операционист | Не технический человек | Инженер или операционист | Отдел продаж |
| Смена модели или синтеза | Да | Частично | Нет | Нет | Внутри их стека | Нет |
| Заточен под объём исходящих | Да | Да | Да, основной фокус | Средне | Средне | Средне |
| Каналы переписки на том же агенте | Нет | Нет | Нет | Нет | Нет | Да |
| Русский и казахский в приоритете | Нет | Нет | Нет | Нет | Частично | Да |
| Нативные amoCRM или Bitrix24 | Делать самим | Делать самим | Делать самим | Через коннекторы | Делать самим | Да |
| Оплата внутри разговора | Нет | Нет | Нет | Нет | Нет | Да, через Kaspi |
| Время до работающего агента | Дни и недели | Дни | Дни и недели | Часы | Дни | Около пяти минут |
Читайте эту таблицу как сравнение форм, а не как турнирную таблицу. Четыре из шести колонок это сильные продукты, проигрывающие строки, которые они и не пытались выиграть.
Языковой вопрос, который рейтинги пропускают
Почти каждое опубликованное сравнение этих платформ оценивает английский. Это логично, там покупатели и там бенчмарки. Это же означает, что цифры не переносятся.
На неанглийском ломаются три вещи, и ломаются они тихо.
Распознавание имён и названий. Клиент называет улицу, район, бренд или свою фамилию. На английском это отрабатывает хорошо. На казахском часто коверкается, а искажённое имя в начале звонка это тот момент, когда человек решает, что говорит с машиной, которая потратит его время впустую.
Переключение языков внутри фразы. В Казахстане люди спокойно смешивают русский и казахский в одном предложении. Системы, которые определяют язык один раз в начале звонка и фиксируются на нём, дают странный и заметно неправильный опыт. Работа со смесью это другая инженерная задача, чем поддержка обоих языков по отдельности.
Числа, даты и деньги. Цены, время и даты несут коммерческую нагрузку продающего звонка. Неправильно прочитанные 42 380 тенге или окно доставки это не косметическая ошибка, а уверенно озвученная неверная цена.
Ничего из этого не видно в таблице функций, потому что любой вендор может честно написать, что язык поддерживается. Единственная осмысленная проверка это ваш собственный скрипт, ваши названия товаров и ваши клиенты, прослушанные от начала до конца. Прогоните её на каждой платформе, которую всерьёз рассматриваете, до того как смотреть на цену.
Второй вопрос: что происходит после звонка
Голосовые платформы обычно считают единицей работы звонок. Он начался, закончился, вы получили запись, расшифровку и структурированное резюме. Для отсечения обращений в поддержку и напоминаний о записи это верная рамка. Для продаж неверная.
В продающем разговоре звонок редко бывает концом. Клиент хочет цену письменно, или ссылку, или время подумать, и следующий шаг происходит в мессенджере. Что случится дальше, и решает, стоил ли звонок того, чтобы его делать.
Команды справляются с этим тремя способами.
Руками. Кто-то читает расшифровку и пишет следующее сообщение. Работает на десяти звонках в день, ненадёжно на сотне, не существует на тысяче.
Автоматизацией на стыках. Расшифровка дёргает вебхук, который отправляет шаблонное сообщение. Это работает, и это же означает, что follow-up не знает о разговоре ничего, кроме тех полей, которые вы заранее догадались извлечь.
Тем же агентом, который продолжает. Агент, сделавший звонок, сам отправляет следующее сообщение, потому что это тот же агент с той же памятью о сказанном, и ответ клиента приходит ему, а не в очередь.
Третий вариант это причина, по которой агент с едиными каналами выигрывает сделки, которые по голосовым характеристикам должен был бы проиграть. Pleep не лучшая чисто голосовая платформа в этом сравнении. Он тот, у кого звонок и последующая переписка это один разговор.
Как на самом деле устроены счета в этой категории
Сравнивать минутные тарифы этих платформ скорее вредно, чем полезно, потому что в каждом случае тариф покрывает разное. Сравнивать надо структуру счёта.
| За что вы платите | Платформы для разработчиков | Готовые системы | Агентские платформы |
|---|---|---|---|
| Платформенная плата или подписка | Обычно да | Обычно да | Да |
| Минуты разговора | Да | Да | Да |
| Модель и синтез речи | Часто отдельно, на ваших ключах | Включено | Включено |
| Номера и телеком | Отдельно | Обычно включено | Отдельно или включено |
| Инженерное время на сборку и поддержку | Значительное и постоянное | Низкое | Низкое |
| Стоимость простоя | Около нуля | Около нуля | Около нуля по голосу |
Две практические заметки.
Модель «принеси свой ключ» у платформ для разработчиков выглядит дешевле на странице тарифов и часто таковой не является, потому что счета за модель и синтез приходят отдельно и падают на другую бюджетную строку. Складывайте их до сравнения.
Инженерное время это реальные расходы, и именно их последовательно забывают в сравнениях, написанных инженерами. Агент, который собирается три недели и требует дня в месяц на поддержку, не дешевле подписки только потому, что у подписки есть видимая цифра.
Для ориентира по локальной стороне: Pleep считает голос по 52 тенге за минуту поверх тарифа по объёму, и звонки не стоят ничего, пока никто не разговаривает.
Работающий чек-лист выбора
Идите по порядку. Большинству команд можно остановиться после третьего пункта.
- Кто будет этим владеть через полгода? Инженер, операционист или продавец. Это отсекает три варианта из шести сразу, ещё до сравнения функций.
- На каком языке реально будут звонки? Если ответ не английский, проверьте этот язык сами на своём скрипте. Не принимайте матрицу поддержки за доказательство.
- Что происходит после звонка? Если в ответе есть мессенджер, единый по каналам агент стоит дороже, чем лучшая задержка.
- Что агент должен знать во время разговора? Цены, остатки, календарь записи, этап сделки клиента. Проверьте, что интеграция нативная, а не та, которую вы будете строить и поддерживать.
- Что происходит, когда он не может ответить? Чистая передача человеку с полным контекстом лучше уверенного неправильного ответа, и это стоит проверять специально, задав кандидату вопрос, которого он знать не может.
- Можете ли вы забрать деньги? Для транзакционных продаж ссылка на оплату внутри разговора убирает шаг, на котором застревает большинство сделок.
- И только теперь сравнивайте минуты. Причём итоговые счета, а не заявленные тарифы.
Что меряют бенчмарки и что они упускают
Опубликованные сравнения этих платформ сходятся на небольшом наборе чисел: время до первого слова, насколько мягко агент переживает, когда его перебивают, и как часто он говорит поверх клиента. Эти числа настоящие и они действительно важны. Ниже примерно секунды задержки разговор ощущается человеческим, выше двух секунд люди начинают сами заполнять паузу, и очерёдность реплик рассыпается.
Числа упускают то, что задержка это порог, а не рейтинг. Как только все платформы в вашем шорт-листе оказались ниже этого порога, дальнейшее улучшение перестаёт быть тем, что клиент способен заметить, и решение целиком уходит в вещи, которых ни один бенчмарк не показывает.
Три из них решают исход чаще, чем задержка.
Что агент знает во время разговора. Агент, который прекрасно говорит, но не может сказать звонящему, есть ли товар в наличии, хуже медленного агента, который может. Это вопрос интеграций, переодетый в голосовой костюм, и именно поэтому нативные связки с CRM и складом из таблицы выше значат больше, чем кажется.
Что он делает, когда не прав. Любой агент рано или поздно встречает вопрос за пределами своих знаний. Тот, который об этом говорит и чисто передаёт человеку, сохраняет клиента. Тот, который уверенно выдумывает, теряет клиента, а если выдумал цену, создаёт коммерческую проблему, которая переживёт сам звонок.
Смотрит ли кто-нибудь звонки. Здесь платформы различаются сильнее всего, и это разница между агентом, который за месяц становится лучше, и агентом, который повторяет одну и ту же ошибку две тысячи раз. Просите показать процесс разбора звонков на пробном периоде, а не на демо.
Практичный способ провести оценку: возьмите пять реальных записанных звонков своей команды, включая два неудачных, и проиграйте эти ситуации против каждого кандидата. Это займёт полдня и скажет вам больше, чем все опубликованные сравнения вместе взятые, включая это.
Согласие и правила для исходящего обзвона
Раздел короткий, потому что правила простые, а игнорировать их дорого.
Обзвон людей, которые не просили им звонить, регулируется почти везде, и регулирование касается вас, а не вашего вендора. Ни одна платформа из этого сравнения не возьмёт на себя ответственность, и ни одна не защитит вас от базы, которую не стоило покупать.
Звоните по своим базам. Тем, кто оставил заявку, покупал раньше или просил связаться. Это не только юридически верная позиция, но и место, где есть конверсия, потому что все остальные и не собирались покупать.
Говорите, что это такое. Агент, представляющийся автоматическим ассистентом в начале звонка, теряет очень немногих и снимает целый класс жалоб, который начинается с того, что человек на середине разговора понимает, что говорил с программой.
Храните записи и согласие. Если разговор записывается, скажите об этом и держите запись привязанной к диалогу, а не в хранилище, где её никто не найдёт. Именно это делает жалобу отвечаемой.
Следите за временем суток. Звонки вне разумных местных часов плохо конвертируются и порождают жалобы, а жалобы в итоге стоят вам номера, а не только сделки.
Ничего из этого не специфично для ИИ. Это та же дисциплина, что и для живой команды обзвона, и ИИ меняет здесь только объём, на котором плохое решение множится.
Двухнедельный пилот, который даёт решение
Большинство оценок в этой категории проваливаются одинаково. Команда записывается на демо, смотрит пять отполированных агентов на пяти отрепетированных диалогах, выбирает того, кто звучал лучше, и узнаёт настоящие ограничения на третий месяц. Короткий структурированный пилот это снимает, и двух недель достаточно.
Дни первый и второй: выберите одну задачу. Не «автоматизировать обзвон», а одну конкретную задачу с цифрой. Квалифицировать входящие заявки за пять минут. Перезванивать всем, кто замолчал после отправки цены. Подтверждать записи на завтра. Пилот с областью «всё» не измеряет ничего.
Дни с третьего по пятый: соберите на двух платформах, а не на пяти. Сначала отсейте по типу продукта чек-листом выше, потом соберите одного и того же агента дважды. Две реальные сборки говорят больше, чем пять демо, и вторая всегда идёт заметно быстрее, потому что вы уже знаете, чего просите.
Дни с шестого по десятый: реальные звонки на реальном языке. Один и тот же список, разбитый случайно, один скрипт, одни часы. Случайность разбиения важна: если одной платформе достанутся свежие заявки, а другой прошлогодние остатки, результат не будет значить ничего.
Дни одиннадцатый и двенадцатый: послушайте двадцать звонков сами. Не резюме, а аудио. Десять с результатом и десять без. Этот шаг команды пропускают, и именно он меняет мнение, потому что провалы слышны, и ни один из них не виден в дашборде.
Дни тринадцатый и четырнадцатый: считайте то, что важно. Не количество звонков. Диалоги, дошедшие до решения человека, назначенные встречи, принятые оплаты и то, что человеку пришлось руками доделывать после. Последняя цифра и отличает платформу, которая экономит работу, от той, которая её перекладывает.
Две вещи стоит решить до старта, потому что решать их потом это способ получить из пилота спор вместо решения: какая цифра заставит вас сказать да и кто имеет право сказать нет.
Частые вопросы
Какая голосовая ИИ-платформа лучшая в целом?
Единого ответа нет, потому что пять ведущих платформ сделаны под разных покупателей. Vapi и Retell это платформы для разработчиков, Bland это готовая система исходящего обзвона, Synthflow это no-code конструктор для агентств, ElevenLabs лидирует по качеству голоса. Правильный вопрос это какая из них совпадает с тем, кто будет её эксплуатировать, и на каком языке говорят ваши клиенты.
Какая лучше работает на русском и казахском?
Глобальные платформы в разной степени поддерживают русский и слабо справляются с казахским, включая смешение обоих языков внутри одной фразы, что для Казахстана нормальная речь. Pleep относится к русскому и казахскому как к основным языкам. Что бы вы ни выбрали, проверьте на своём скрипте, а не на матрице поддержки.
Сколько стоит голосовой ИИ-агент за минуту?
Тарифы в этой категории меняются часто и устроены у вендоров по-разному, поэтому любая цифра осмысленна только рядом с тем, что в неё входит. Платформы для разработчиков часто не включают стоимость модели и синтеза, которые приходят отдельным счётом. Pleep считает голос по 52 тенге за минуту поверх тарифа по объёму, и ничего, пока звонок не идёт.
Может ли ИИ-агент продолжить разговор в WhatsApp после звонка?
На чисто голосовых платформах нет: там единица работы это звонок, и на выходе вы получаете расшифровку. Pleep ведёт голос и переписку одним агентом с одной базой знаний, поэтому follow-up приходит от того же агента, который звонил, с полным контекстом обсуждённого.
Интегрируются ли эти платформы с amoCRM или Bitrix24?
Глобальные платформы нативно интегрируются с HubSpot, Salesforce и подобными, что правильно для их рынка. Для amoCRM или Bitrix24 вы обычно либо строите интеграцию сами, либо платите за коннектор посередине. Pleep поддерживает обе нативно, включая чтение полей сделки обратно, чтобы агент знал, на каком этапе находится клиент.
Хватит ли no-code конструктора?
Для чётко определённой задачи с предсказуемым разговором да, и работать он будет уже на той же неделе. Потолок наступает, когда требование выходит за то, что конструктор предусмотрел. Если вы можете описать весь разговор заранее, конструктор это самый быстрый путь. Если не можете, покупайте агента или стройте на платформе для разработчиков.
Чем автодозвон отличается от голосового ИИ-агента?
Автодозвон проигрывает запись и собирает нажатия клавиш. Голосовой ИИ-агент ведёт разговор, отвечает на вопросы из базы знаний и реагирует на то, что человек действительно сказал. Они отличаются по цене в несколько раз, потому что делают разную работу, и путаница между ними это самая частая ошибка в категории. Локальных провайдеров с обеих сторон мы разбирали в сравнении сервисов автодозвона в Казахстане.
Сколько времени занимает запуск агента?
На no-code конструкторе часы. На платформе для разработчиков дни и недели, в зависимости от объёма кастомизации. С Pleep около пяти минут: дайте ссылку на сайт или загрузите прайс, и он сам соберёт базу знаний и первый скрипт продаж, без промпт-инжиниринга.


