Клонирование голоса: свой голос для джинглов, объявлений и подкастов
Клонирование голоса: джинглы, объявления и подкасты вашим собственным голосом
В каталоге Tunio давно есть десятки AI-голосов на разных языках — ими озвучиваются джинглы, объявления, прогноз погоды и анонс времени. Но у станции, кафе или фитнес-клуба есть голос, который слушатели узнают лучше любого диктора: голос владельца, ведущего или администратора. Теперь его можно добавить в Tunio. Клонирование голоса работает так: вы загружаете короткий образец речи, подтверждаете, что голос действительно ваш, — и через пару минут он появляется в списке голосов рядом с каталожными.
Зачем радио и бизнесу свой голос
- Узнаваемость. Джингл с голосом ведущего или приветствие голосом владельца заведения работают сильнее любой «нейтральной» озвучки — слушатель понимает, что с ним говорит конкретный человек.
- Без студии и микрофона на каждый ролик. Один раз записали образец — дальше объявления об акциях, режиме работы и событиях озвучиваются из текста за секунды.
- Один голос на всю сеть. Для сети магазинов или салонов свой голос становится частью аудиобренда: везде звучит один и тот же знакомый тембр.
- Любой язык. Клон говорит на том языке, на котором написан текст, — можно озвучить объявление на русском, английском или казахском одним и тем же голосом.
Как загрузить свой голос
Откройте «Профиль» → вкладка «Мои голоса» и нажмите «Загрузить голос». Вкладка появляется в профиле, если функция входит в ваш тариф. Мастер загрузки состоит из трёх шагов.

Шаг 1. Условия использования
Прежде чем что-то загрузить, вы подтверждаете три пункта: что это ваш голос (или у вас есть явное согласие его владельца на клонирование), что вы не будете использовать созданный контент для обмана или выдачи себя за других людей, и что вы согласны на обработку и хранение образца для синтеза речи. Без всех трёх галочек кнопка «Продолжить» неактивна — это осознанное решение, а не формальность.
Шаг 2. Загрузка образца
Здесь три поля:
- Название голоса — как он будет подписан в списках выбора, например «Голос Марины» или «Ведущий утреннего шоу».
- Аудиофайл — 5–90 секунд чистой речи без музыки и шума. Подойдёт запись на телефон, голосовое сообщение или фрагмент с диктофона в любом распространённом формате: MP3, M4A, WAV, WebM. Лучше всего клон получается с 10–30 секунд спокойной, разборчивой речи.
- Текст фразы из образца — дословно то, что произносится в файле. Он нужен не для проверки, а самой модели: она сопоставляет звучание с текстом и так «понимает», как именно вы произносите звуки.
Несколько советов для хорошего клона: записывайтесь в тихом помещении, держите микрофон на одном расстоянии, говорите в том темпе и с той интонацией, с какой хотите слышать себя в эфире. Обрезать паузы и «э-э» не обязательно, но записанная в машине или на улице речь заметно ухудшит результат.
Шаг 3. Подтверждение голоса
Самый важный шаг. На экране появляется случайная короткая фраза — две-три простые фразы о чём-то обыденном, 14–20 слов — и запускается таймер примерно на 45 секунд. Нужно нажать «Записать», прочитать фразу вслух в микрофон, нажать «Стоп», при желании прослушать запись и отправить её кнопкой «Отправить на проверку». Не понравилась фраза или не успели — «Другая фраза» выдаст новую.

Если закрыть окно после второго шага, голос никуда не пропадёт — он останется в списке со статусом «Ждёт подтверждения». Вернуться к записи можно в любой момент через меню действий → «Подтвердить голос».
Как проходит проверка
После отправки голос получает статус «На проверке», затем «Проверяется» — и обычно через пару минут становится «Готов». Страница обновляется сама, ничего перезагружать не нужно.
Внутри проверка состоит из двух независимых частей:
1. Совпадение текста. Запись распознаётся системой распознавания речи, и полученный текст сравнивается с выданной фразой. Так мы убеждаемся, что записан живой человек, который прочитал именно эту фразу именно сейчас.
2. Совпадение голоса. Из записи и из загруженного образца извлекаются голосовые «отпечатки» — числовые представления тембра — и сравниваются между собой. Так мы убеждаемся, что фразу читает тот же человек, чей голос в образце.
Если хотя бы одна часть не пройдена, голос получает статус «Отклонён», а при наведении на статус видна причина: «Прочитанный текст не совпал с фразой» или «Голос в записи не совпал с голосом в образце». Отклонение — не приговор: через «Подтвердить голос» можно получить новую фразу и записать её ещё раз, сколько угодно.
Зачем такая строгость? Без проверки голоса любой мог бы загрузить запись известного человека и прочитать фразу сам. А без одноразовой случайной фразы с таймером можно было бы заранее синтезировать её чужим клоном и просто включить запись. Две проверки вместе закрывают оба сценария — так мы защищаем и владельцев голосов, и слушателей.
Как это устроено внутри
Мы не «обучаем» отдельную модель под каждого пользователя — это долго, дорого и требует часов записей. Вместо этого используется zero-shot клонирование: при каждой генерации модель синтеза речи получает ваш образец вместе с его текстом как эталон и произносит новый текст, копируя тембр, манеру и темп из эталона. Поэтому образец из 10–30 секунд — не ограничение, а достаточное условие: модели нужен не объём, а чистота.
Отсюда и несколько следствий, которые заметит пользователь:
- Клон готов сразу после проверки — никакого «обучение займёт сутки».
- Голос универсален по языку. У каталожных голосов в списке стоит флаг страны, у вашего — значок глобуса 🌐: он озвучит текст на любом из десятков поддерживаемых языков.
- Кнопка прослушивания в списке голосов воспроизводит ваш оригинальный образец — то, что вы загрузили, а не синтезированную речь.
- Обработка идёт на собственных GPU-серверах Tunio. Образец не передаётся сторонним сервисам синтеза голоса.
Где использовать свой голос
Подтверждённый голос появляется в списке выбора голоса с пометкой «Мой» — первым, перед каталожными. Сейчас он доступен:
- В генераторе джинглов — раздел «Джинглы» → вкладка «Генератор джинглов». Напишите текст, выберите свой голос и музыкальную подложку — и джингл с вашим голосом готов.
- В объявлениях — раздел «Объявления» → «Новое объявление». Текст, голос и расписание задаются в одном месте; дальше объявление выходит в эфир между треками по расписанию, озвученное вашим голосом.
- В подкастах — озвучьте выпуск или рубрику своим голосом и поставьте его в эфир через «Расписание стрима»: авторский подкаст без студии и микрофона.
- Через API — для интеграций и собственных сценариев озвучки: подтверждённый голос возвращается в списке голосов вместе с каталожными.
На одном аккаунте можно держать до трёх голосов. Голос принадлежит не только вам: коллеги, работающие с той же библиотекой контента, тоже видят его в списках и могут им озвучивать — так же, как общими джинглами и объявлениями.
Генерация своим голосом тарифицируется так же, как любым голосом из каталога, — дополнительной платы за сам клон нет.
Приватность и контроль
Образец голоса — биометрические данные, и мы обращаемся с ними соответственно:
- Образец хранится ровно до тех пор, пока существует голос. Он и есть ваш клон: без образца синтез невозможен, поэтому удалить его «после обучения» нельзя — обучения не было.
- Удаление в один клик. Меню действий → «Удалить» стирает сам голос, запись подтверждения и превью. Учтите: объявления и расписания, которые использовали этот голос, перестанут им озвучиваться.
- Согласие фиксируется. Мы сохраняем, какую версию условий вы приняли и когда — для каждого голоса отдельно.
- Голос виден только вашей библиотеке контента. Другие аккаунты Tunio не увидят его ни в каталоге, ни в API.
Частые вопросы
Можно ли загрузить голос другого человека — например, ведущего или актёра?
Да, если у вас есть его явное согласие на клонирование — вы подтверждаете это на первом шаге. Но пройти подтверждение должен именно он: фразу нужно прочитать тем же голосом, что и в образце.
На каких языках говорит клон?
На любом из десятков поддерживаемых языков — модель озвучивает текст на том языке, на котором он написан. Образец при этом может быть на любом языке.
Что делать, если голос отклонён?
Посмотрите причину при наведении на статус. Если не совпал текст — читайте фразу целиком, чётко и без пропусков. Если не совпал голос — записывайтесь в тех же условиях, что и образец, и тем же голосом. Затем «Подтвердить голос» → новая фраза → новая запись.
Сколько ждать проверку?
Обычно пару минут. Список голосов обновляется автоматически.
На каком тарифе доступно клонирование голоса?
На тарифах, где включены пользовательские голоса, — вкладка «Мои голоса» появляется в профиле автоматически. Если её нет, посмотрите условия своего тарифа в разделе оплаты.
Попробуйте в своём эфире
Запишите 20 секунд речи, подтвердите голос — и следующий джингл или объявление о скидках выйдет в эфир вашим голосом.