Поговорите с ботом службы поддержки — и через пару секунд поймёте, что это не человек. Задержка перед ответом, механическая интонация, неспособность перебить или уловить смену темы на лету — все эти мелочи выдают машину быстрее любого пароля. Именно эту проблему решает Smallest.ai, стартап, привлёкший $13 млн в раунде Series A под руководством Seligman Ventures при участии Sierra Ventures и 3one4 Capital. Общая сумма инвестиций перевалила за $21 млн.
Идея компании звучит просто, но идёт вразрез с логикой всей индустрии. Пока конкуренты гонятся за более мощными и быстрыми большими языковыми моделями, основатель Smallest.ai Судершан Камат делает ставку на противоположное — маленькие, узкоспециализированные модели, заточенные исключительно под голос. Разница в подходе к самому процессу общения: обычная LLM ждёт, пока пользователь закончит фразу, затем обрабатывает её целиком — и в текстовом чате это незаметно, а в разговоре голосом даже секундная пауза режет слух неестественностью. Модель Smallest.ai работает иначе — слушает, обрабатывает и формулирует ответ параллельно, имитируя то, как устроено обычное человеческое общение с перебивками и мгновенной реакцией.
Если разговор заходит в область, где узкая модель не разбирается, включается более крупная LLM — примерно так же, как живой оператор ставит звонок на паузу, чтобы уточнить детали. Камат считает, что именно такая связка — быстрая голосовая модель плюс мощный офлайн-мозг для сложных случаев — станет стандартом для всех голосовых ИИ-агентов. Клиенты у стартапа уже реальные: RingCentral и Truecaller используют технологию, а среди потенциальных заказчиков Камат называет любую компанию в сфере поддержки клиентов, включая таких игроков, как Sierra и Decagon. Логика простая: делать голос идеальным — не их профиль, это отвлекает от основного бизнеса.
На рынке у Smallest.ai серьёзная компания: лидер сегмента ElevenLabs, а также Cartesia и региональные игроки вроде Sarvam, ориентированные на локальные языки. Но большинство конкурентов применяют голосовой ИИ для дубляжа или подкастов, тогда как Smallest.ai держит фокус исключительно на разговорах в реальном времени. Цель, по словам основателя, предельно конкретна — тест Тьюринга для голоса. Собеседник должен разговаривать с моделью и не понимать, ИИ перед ним или человек.
Во что углубиться:
- ElevenLabs voice AI Turing test: как лидер рынка голосового ИИ формулирует собственные критерии неразличимости от человека
- Latency в разговорных ИИ-системах: почему задержка в доли секунды разрушает ощущение живого диалога
- Small language models vs large language models: в чём разница подходов и почему индустрия всё чаще выбирает специализацию вместо масштаба
