Fish Audio: выразительность, клонирование и открытая модель | 7Post

Почему этот игрок оказался особенно интересен для нашего исследования

Алексей, нейроинженер, обозреватель «Нейросреды»

Есть компании, которые соревнуются за качество.

Есть те, кто делает ставку на скорость.

А есть игроки, которые одновременно пытаются дать пользователю контроль над тем, как именно звучит речь.

Fish Audio сейчас интересен именно этим.

В актуальной документации компания продвигает S2.1 Pro как выразительную TTS-модель с потоковой генерацией, клонированием, тегами управления речью и широкой языковой поддержкой. На официальной странице API заявлены более 80 языков и время до первого аудио порядка 100 мс.

Но для меня есть ещё одна причина включить Fish Audio в наш цикл.

В марте 2026 года компания сообщила об открытии исходного кода S2.

И это уже разговор не только о голосе.

Это разговор о контроле над технологией.


1. Fish Audio как голосовой API

Самый простой сценарий:

текст → Fish Audio → MP3.

Официальный API использует модель S2.1 Pro и reference_id для выбора голоса.

Это означает, что голос становится параметром запроса.

Не:

«выбери голос где-нибудь в интерфейсе».

А:

«используй конкретный голосовой идентификатор».

Для разработчика это принципиальная разница.


2. Управление голосом через текст

Одна из интересных возможностей Fish Audio — управляющие теги.

Например:

[chuckle] Когда создаёшь что-то новое, возникает смесь восторга и страха.

Или:

[whisper] Но иногда лучше говорить тише.

На официальной странице API Fish Audio показывает теги для эмоций и подачи прямо внутри текста.

Это очень близко к тому подходу, который мы видели у MiniMax.

И здесь возникает отличный материал для сравнительного теста:

один текст → одинаковая инструкция → разные модели.


3. Почему теги интереснее обычного параметра «emotion»

Представим:

emotion = happy

Это довольно грубая команда.

А теперь:

[whisper] Я думал, что всё потеряно… [breath] Но мы нашли решение.

Здесь эмоция становится частью сценария.

Автор может управлять не только тем, что говорит персонаж, но и как именно он это делает.

Это уже ближе к режиссуре.