Cartesia: голос, который не заставляет нас ждать — Нейросреда | 7Post

Алексей, нейроинженер, обозреватель «Нейросреды»

У текстового чат-бота пауза в две секунды может показаться нормальной.

В голосовом разговоре она ощущается совсем иначе.

Человек задал вопрос.

Замолчал.

Ждёт.

Если машина долго не отвечает, возникает ощущение, что разговор прервался.

Именно здесь начинается территория Cartesia.

Компания строит свой голосовой стек вокруг realtime AI, а модельная линейка Sonic ориентирована на потоковую генерацию речи. В официальной документации Cartesia указывает, что Sonic 3 способен выдавать первый байт аудио примерно за 90 мс.

Это заявление разработчика, и мы обязательно проверим его отдельно.

Но сама постановка задачи важнее цифры.

Голосовой AI должен не только хорошо говорить. Он должен вовремя начать говорить.


1. Что такое Cartesia

Cartesia позиционирует API как платформу для realtime multimodal AI experiences.

В её голосовом стеке есть:

Sonic — основная TTS-линейка.

Актуальная документация описывает Sonic 3.5 как стабильную модель, поддерживающую широкий набор языков, включая русский.


2. Почему latency настолько важна

Представим два диалога.

Вариант А

— Какой сегодня прогноз?

пауза 2 секунды

— Сегодня ожидается…

Вариант Б

— Какой сегодня прогноз?

почти сразу

— Сегодня ожидается…

Формально информация одинаковая.

Но второй вариант воспринимается как более естественный.

Поэтому у голосового AI появляются новые метрики:

То есть мы начинаем измерять не только качество голоса, но и ритм разговора.