ElevenLabs создает голосовой слой ИИ — модели, которые превращают текст в человеческую речь. Большинство людей сталкиваются с этим в службе поддержки, часто даже не осознавая происходящее. Klarna, например, ведет с помощью этой технологии первую линию телефонной поддержки для 35 миллионов американских клиентов. То же делают Deutsche Telekom, Cisco, Adobe и растущий список правительств. ElevenLabs также продает свои решения создателям контента — для аудиокниг, дубляжа и музыки.

Она в этом не одинока. Фактически она все чаще сталкивается со своими же клиентами, включая Decagon, платформу разговорного ИИ, которая обучила свой голосовой продукт на ElevenLabs, а теперь конкурирует с ней. Но инвесторов это, похоже, не слишком беспокоит. Компания, которая, по ее данным, вышла на $600 млн годовой повторяющейся выручки (ARR), оценивается своими бэккерами в $22 млрд — притом, что ей всего четыре года.
Чтобы понять больше, TechCrunch взял интервью у сооснователя и CEO ElevenLabs Мати Станишевски на Nrth в Торонто, местной конференции по предпринимательству, ранее известной как Elevate. За короткое время удалось обсудить много тем, включая вопрос, стоит ли бизнесу сообщать клиентам, что они говорят с ИИ (он считает, что стоит), и может ли он обсудить валовую маржу компании.
- Вы присоединялись к TechCrunch Disrupt в прошлом году, где сказали, что аудиомодели станут товаром в течение пары лет. Как вы оцените этот прогноз сейчас?
- Работы еще много, и разница в качестве, которую можно достичь только на уровне модели, все еще значительна. Если думать в долгосрочной перспективе, вероятно, через три-пять лет эти различия станут меньше. Что нам хотелось бы сделать и быть первыми - пройти тест Тьюринга для разговорного ИИ. Нужно сочетать интеллект, но также нужен эмоциональный интеллект. Нужно понимать эмоции собеседника, уметь замедлиться или заговорить громче. Это еще не сделано.
- Какой процент бизнеса сейчас приходится на крупных корпоративных клиентов?
- Сейчас у нас $600 млн ARR. Пятьдесят пять с лишним процентов — это крупные корпоративные клиенты, и большая доля оставшихся 45% — малый и средний бизнес, разработчики, создатели.
- Как и все в ИИ, вы все чаще конкурируете со своими клиентами. Decagon обучил свой голосовой продукт на вас, а теперь прогоняет запросы через собственные модели.
- Границы становятся все более размытыми. Когда мы думаем о модельных, платформенных, прикладных компаниях, в прошлом были очень четкие разделения, где одна начинается и заканчивается. Сегодня эта линия более размыта. В случае Anthropic то, что было модельной компанией, определенно стало платформой и все больше — широким набором приложений. Думаю, эта тенденция продолжится.
- Клиенты ElevenLabs могут выбрать, какая ИИ-модель будет обрабатывать их запросы. Что чаще выбирают — модели от флагманских лабораторий или открытые?
- Это не выбор из двух вариантов. В клиентском сервисе все зависит от задачи. Если человек просто звонит узнать информацию, например, часы работы или адрес, и никаких действий выполнять не нужно, тут подойдут многие открытые модели. Потому что в таком случае качество опыта определяется вашей базой знаний, а не мощностью модели. Но если это финансовые услуги, вы хотите аутентифицироваться, получить информацию о транзакции, может быть, возврат. Здесь нет места ошибке. Здесь фронтирные модели по-прежнему лидируют.
- Некоторые из этих открытых моделей — китайские. Правительство США — клиент. Европейские правительства — клиенты. Как выглядят эти разговоры?
- По-разному. В каждом развертывании модели и голоса, которые мы используем, все зависит от кейса. Если мы работаем с польским правительством или бразильским правительством, у них свой набор требований. Это может быть открытая модель, закрытая модель, их собственная дообученная модель. [В Польше] это кейс здравоохранения. Пациенты записываются на прием через государственную систему здравоохранения, и 18% никогда не приходят. Развертывание — это агенты, которые звонят и напоминают. У них был набор моделей, оптимизированных на их знаниях, и мы интегрируем, сохраняя резидентность данных.
- Должен ли бизнес раскрывать, когда человек говорит с агентом?
- Думаю, на данный момент раскрытие должно быть. Сейчас люди к этому не привыкли, и распространенный паттерн — не хотеть чувствовать себя обманутым в этом звонке. Но через пять лет, когда у всех будет свой агент, работающий на их стороне, вы будете звонить и ожидать агента. Тогда, думаю, мы как общество сдвинемся. Есть хорошие способы это делать — если ожидание человека 30 минут, предложить клиенту выбор. Почти во всех случаях они выбирают агента, а потом удивляются, насколько хороший был опыт.
- Какая у вас валовая маржа, учитывая, сколько вы платите за модели и инференс?
- Я дам расплывчатый ответ. Учитывая, что у нас есть исследовательский элемент, мы можем дообучать и ограничивать модели чрезвычайно умными способами. Но если мы можем передать экономию клиенту, мы это делаем. Самое главное — по-прежнему доказывать ценность и быть рядом с клиентом. Так что, если мы можем инвестировать и доказать эту ценность, мы не против, чтобы маржа была ниже, чтобы вместе выиграть по мере создания ценности в следующие пять лет.
- У вас миллионы часов звонков в службу поддержки. Вы обучаетесь на них? Какая часть ваших обучающих данных синтетическая?
- В некоторых компаниях мы создавали модели вместе с ними. Они хотели конкретную модель для своего кейса. В остальном большая часть обучения — это было не столько объем данных, сколько аннотирование данных. У нас тысячи людей внутри на контрактной основе помогают аннотировать не только то, что было сказано, но и когда люди говорили, как они это говорили, какие эмоции использовали. Нам пришлось привлекать тренеров по голосу, чтобы точно определять акценты.
- Сообщалось, что вы рассматриваете 2028 год для IPO. Можете это подтвердить?
- Нам бы хотелось создать компанию, которая выдержит испытание временем. Мы готовим фундамент, чтобы сделать это в ближайшие годы. Но сделаем ли мы это, будет зависеть от времени и места.
- Какова ваша позиция — должны ли фронтирные лаборатории замедлиться?
- Все настроены работать вместе, чтобы найти способ задать темп. Должны ли они говорить об этом публично и насколько это должно вовлекать медийную дискуссию или регулирование — это другая тема. Но да, мы все должны принимать правильные меры предосторожности, развертывая технологию. Мы не обучаем текстовые модели и интеллектуальную сторону моделей, которая является ядром этих дебатов.
- Может ли ElevenLabs быть подвержена тому же, что и Hugging Face?
- Мы на шаг дальше, потому что не развертываем самовоспроизводящиеся или рекуррентные части интеллекта агентов. Наша технология не позволяет агентам создавать других агентов. Риск кибербезопасности — определенно риск для всего мира, но у нас есть хороший набор мер предосторожности.