Что такое OpenAI TTS и голос gpt-4o-mini-tts в Trackly AI
gpt-4o-mini-tts — модель OpenAI для синтеза речи из текста, часть семейства GPT-4o. По документации OpenAI, это новейшая и наиболее надёжная TTS-модель компании для реального времени, а её особенность — «управляемость»: модель принимает отдельную инструкцию, задающую акцент, темп и тон голоса, а не только сам текст для озвучки.
На Trackly AI модель подключена по прямому ключу OpenAI, без прокси-провайдера. На странице доступны шесть голосов: Coral (тёплый), Alloy (нейтральный), Nova (живой), Onyx (глубокий), Shimmer (мягкий) и Fable (выразительный) — часть палитры голосов OpenAI. Стиль подачи задаёт отдельный блок «Стиль» с тремя пресетами: нейтрально, дружелюбно и как диктор новостей — каждый явно просит модель говорить по-русски.
Пригодится там, где текст нужно превратить в звук без диктора и студии: ролики для соцсетей, черновик подкаста, реплики для видео.
Чем озвучка на OpenAI отличается от обычной «Озвучки текста» на Gemini?
На сайте два инструмента озвучки, и путать их легко: цена и механика общие. Разница — в провайдере, наборе голосов и настройках.
| Параметр | Озвучка текста (OpenAI) | Озвучка текста (Gemini) |
|---|---|---|
| Модель | OpenAI gpt-4o-mini-tts, прямой ключ | Google gemini-2.5-flash-preview-tts |
| Голоса | Coral, Alloy, Nova, Onyx, Shimmer, Fable | Kore, Puck, Charon, Aoede, Leda, Fenrir |
| Управление стилем | пресет «Стиль»: нейтрально / дружелюбно / диктор | нет, только выбор голоса |
| Предпрослушивание голоса | нет | есть, аудиопревью в интерфейсе |
| Цена | 20 токенов | 20 токенов |
Если хочется заранее прослушать голос до генерации — это пока умеет только Gemini-версия на /chat/voiceover. Если важнее готовый пресет интонации (например, дикторский тон для рекламной вставки) — берите OpenAI-версию на этой странице. Технически это два разных облачных TTS, а не два режима одной модели.
Как включить голоса OpenAI без VPN и зарубежной карты?
Зарегистрируйтесь и подтвердите почту — без этого генерация не запустится. Дальше на странице «Озвучка текста (OpenAI)» впишите текст, выберите голос и стиль, нажмите кнопку — аудиофайл придёт в диалог. Всё открывается напрямую из России: VPN и иностранная карта не нужны, сервис работает по прямому ключу OpenAI на нашей стороне, а оплата токенов идёт в рублях.
Сколько стоит одна озвучка текста и как выбрать голос
Одна генерация — 20 токенов, и расчётный запрос к каталогу показывает одну и ту же цену независимо от выбранного голоса и стиля. Голос и стиль поэтому выбираются свободно: Coral и «Дружелюбно» для сторис, Onyx и «Диктор» для делового ролика, Nova и «Нейтрально» для читки статьи — цена не меняется.
Что OpenAI TTS делает плохо?
На странице доступны только три готовых пресета стиля, а не произвольная текстовая инструкция — тонко донастроить интонацию словами, как умеет модель по документации OpenAI, здесь нельзя. Прослушать голос перед генерацией тоже не получится: аудиопревью на этой странице не подключено, в отличие от Gemini-версии. И это TTS, а не клонирование голоса — воспроизвести тембр конкретного человека инструмент не умеет, только шесть готовых голосов из палитры OpenAI.
Кому подойдёт голос OpenAI, а кому — Gemini?
Нужен предсказуемый деловой или рекламный тон и готовые пресеты интонации — берите OpenAI: три стиля закрывают частые сценарии без ручной настройки. Хочется сначала услышать голос и лишь потом тратить токены — обычная «Озвучка текста» на Gemini удобнее за счёт предпрослушивания. По цене и скорости разницы нет, обе стоят 20 токенов. Для текстовых задач тем же прямым ключом OpenAI на сайте отвечает ChatGPT 5, а про подходы к озвучке в целом — статья «Нейросеть для озвучки текста». Другие инструменты — в общем каталоге.
Источники:
- OpenAI. Text-to-speech guide (модели, голоса, параметр instructions) — https://developers.openai.com/api/docs/guides/text-to-speech
- OpenAI. API Pricing — https://developers.openai.com/api/docs/pricing