MiniMax Speech 2.8: когда машина учится говорить - 7Post
TTS, клонирование голоса, Voice Design и realtime — подробный разбор первой большой модели нашего исследования
Алексей, нейроинженер, обозреватель портала «Нейросреда»
Есть сервисы, которые умеют читать текст вслух.
А есть платформы, которые постепенно превращают голос в отдельный программируемый интерфейс.
MiniMax относится именно ко второй категории.
В этой статье мы начинаем практическое исследование рынка AI-голоса с MiniMax Speech 2.8. Не потому, что заранее считаем его лучшим. Наоборот: нам нужна точка отсчёта, с которой потом можно будет сравнить ElevenLabs, Cartesia, Fish Audio, Hume AI и российские решения.
MiniMax интересен тем, что объединяет несколько направлений: Text-to-Speech, клонирование голоса, создание новых голосов по описанию, управление выразительностью и инструменты для realtime-сценариев. В январе 2026 года компания представила Speech 2.8, отдельно выделив native sound tags, клонирование и улучшенную естественность речи.
Именно поэтому начнём с простого вопроса:
что сегодня действительно можно сделать с голосом при помощи MiniMax?
1. Text-to-Speech: самый простой сценарий
Начнём с классики.
Есть текст:
Сегодня мы начинаем большое исследование искусственного голоса. В течение нескольких месяцев мы будем сравнивать разные модели и проверять, насколько естественно они работают с русской речью.
Наша задача — получить аудиофайл.
Это и есть Text-to-Speech:
текст → модель → синтетическая речь.
Но современный TTS отличается от старых систем тем, что задача больше не сводится к правильному произношению слов.
Нас интересуют:
- темп;
- паузы;
- интонация;
- ударения;
- эмоциональная подача;
- стабильность тембра;
- поведение на длинном тексте.
Именно эти параметры мы будем проверять во всех последующих статьях цикла.