MiniMax Speech 2.8: когда машина учится говорить - 7Post

TTS, клонирование голоса, Voice Design и realtime — подробный разбор первой большой модели нашего исследования

Алексей, нейроинженер, обозреватель портала «Нейросреда»

Есть сервисы, которые умеют читать текст вслух.

А есть платформы, которые постепенно превращают голос в отдельный программируемый интерфейс.

MiniMax относится именно ко второй категории.

В этой статье мы начинаем практическое исследование рынка AI-голоса с MiniMax Speech 2.8. Не потому, что заранее считаем его лучшим. Наоборот: нам нужна точка отсчёта, с которой потом можно будет сравнить ElevenLabs, Cartesia, Fish Audio, Hume AI и российские решения.

MiniMax интересен тем, что объединяет несколько направлений: Text-to-Speech, клонирование голоса, создание новых голосов по описанию, управление выразительностью и инструменты для realtime-сценариев. В январе 2026 года компания представила Speech 2.8, отдельно выделив native sound tags, клонирование и улучшенную естественность речи.

Именно поэтому начнём с простого вопроса:

что сегодня действительно можно сделать с голосом при помощи MiniMax?


1. Text-to-Speech: самый простой сценарий

Начнём с классики.

Есть текст:

Сегодня мы начинаем большое исследование искусственного голоса. В течение нескольких месяцев мы будем сравнивать разные модели и проверять, насколько естественно они работают с русской речью.

Наша задача — получить аудиофайл.

Это и есть Text-to-Speech:

текст → модель → синтетическая речь.

Но современный TTS отличается от старых систем тем, что задача больше не сводится к правильному произношению слов.

Нас интересуют:

Именно эти параметры мы будем проверять во всех последующих статьях цикла.


2. Готовый голос или собственный?