声音克隆:用自己的声音播出台标、通知和播客
声音克隆:用你自己的声音播出台标、通知和播客
Tunio 的目录里早就有几十种不同语言的 AI 声音——台标、通知、天气预报和报时都由它们配音。但无论是电台、咖啡馆还是健身俱乐部,都有一个听众比任何播音员都更熟悉的声音:老板、主持人或前台管理员的声音。现在,你可以把它带进 Tunio。声音克隆的用法很简单:上传一段简短的语音样本,确认这确实是你本人的声音——几分钟后,它就会出现在声音列表里,与目录声音并列。
电台和商家为什么需要自己的声音
- 辨识度。 主持人声音的台标,或老板亲自录的欢迎语,效果远胜任何“中性”配音——听众知道正在和自己说话的是一个具体的人。
- 不必为每条音频进录音室、架麦克风。 样本只需录一次,之后促销、营业时间和活动通知都能在几秒钟内由文字直接配音。
- 整个连锁用同一个声音。 对连锁门店或美容院来说,自己的声音会成为声音品牌的一部分:每家门店都响起同一个熟悉的音色。
- 任何语言。 克隆声音会按文本所用的语言朗读——同一个声音可以播出中文、英文或哈萨克语的通知。
如何上传自己的声音
打开 “个人资料” → “我的声音”标签页,点击 “上传声音”。如果你的套餐包含此功能,该标签页会自动出现在个人资料中。上传向导分为三步。
第 1 步:使用条款
在上传任何内容之前,你需要确认三点:这是你本人的声音(或者你已获得声音所有者对克隆的明确同意);你不会把生成的内容用于欺骗或冒充他人;你同意为语音合成目的处理和存储样本。三个勾选框不全部勾上,“继续” 按钮就无法点击——这是有意为之的设计,而不是走形式。
第 2 步:上传样本
这里有三个字段:
- 声音名称——它在选择列表中显示的名字,例如“玛丽娜的声音”或“早间节目主持人”。
- 音频文件——5–90 秒纯净人声,无音乐和噪音。手机录音、语音消息或录音笔片段都可以,支持常见格式:MP3、M4A、WAV、WebM。用 10–30 秒平稳、清晰的语音,克隆效果最好。
- 样本文字内容——文件中朗读的逐字文本。它不是用来做验证的,而是模型本身需要:模型把发音和文字对应起来,从而“理解”你究竟是怎样发出每个音的。
几条获得优质克隆的建议:在安静的房间录音,让麦克风与嘴保持固定距离,用你希望在节目中听到的语速和语调说话。停顿和“呃”不必剪掉,但在车里或街上录的语音会明显拉低效果。
第 3 步:声音确认
最关键的一步。屏幕上会出现一段随机短语——两三句关于日常事物的简单句子,14–20 个词——同时启动一个大约 45 秒的计时器。你需要点击 “录音”,对着麦克风大声朗读这段短语,点击 “停止”,可以回放试听,然后用 “提交审核” 按钮发送。短语不合心意或没来得及读完?“换一个短语” 会给你一段新的。
如果在第二步之后关闭窗口,声音不会丢失——它会以“待确认”状态留在列表中。随时可以通过操作菜单 → “确认声音” 回来继续录音。
验证是如何进行的
提交后,声音先进入 “审核中” 状态,随后变为 “验证中”——通常几分钟后就会变成 “已就绪”。页面会自动刷新,无需手动重新加载。
在内部,验证由两个相互独立的部分组成:
1. 文本匹配。 录音先经过语音识别,得到的文字再与系统给出的短语进行比对。这样我们就能确认:是一个真人,此时此刻朗读了正是这段短语。
2. 声音匹配。 分别从录音和上传的样本中提取声音“指纹”——音色的数值表示——然后相互比对。这样我们就能确认:朗读短语的人,与样本中的声音是同一个人。
只要有一部分未通过,声音就会变为 “已拒绝” 状态,把鼠标悬停在状态上可以看到原因:“朗读内容与短语不符,请重新录制。”或“录音中的声音与上传的样本不匹配。”被拒绝并非终局:通过 “确认声音” 可以获取新短语再录一次,次数不限。
为什么要这么严格?如果不做声音比对,任何人都可以上传某位名人的录音,然后自己朗读短语。如果没有带计时器的一次性随机短语,就可以事先用别人的克隆声音合成好短语,再直接播放录音。两项检查加在一起,堵住了这两种情形——我们以此同时保护声音的主人和听众。
内部原理
我们不会为每位用户单独“训练”一个模型——那既慢又贵,还需要数小时的录音。取而代之的是 zero-shot(零样本)克隆:每次生成时,语音合成模型都会把你的样本连同其文字一起作为参考,然后朗读新文本,同时复刻参考中的音色、语气和语速。因此 10–30 秒的样本不是限制,而是充分条件:模型需要的不是数量,而是纯净度。
由此带来几个用户能直接感受到的结果:
- 验证通过后克隆立即可用——不存在“训练需要一天”这种事。
- 声音不受语言限制。 列表中的目录声音带有国家旗帜,而你的声音带有地球图标 🌐:它可以朗读数十种受支持语言中任意一种的文本。
- 声音列表中的试听按钮播放的是你的原始样本——也就是你上传的内容,而不是合成语音。
- 处理在 Tunio 自有的 GPU 服务器上完成。 样本不会传给第三方语音合成服务。
自己的声音能用在哪里
通过验证的声音会出现在声音选择列表中,带有 “我的” 标记——排在最前面,位于目录声音之前。目前可以在以下位置使用:
- 在台标生成器中——“台标”板块 → “台标生成器”标签页。写好文字,选择自己的声音和背景音乐——带有你声音的台标就做好了。
- 在通知中——“通知”板块 → “新建通知”。文字、声音和排期在同一处设置;之后通知会按排期在曲目之间播出,用的就是你的声音。
- 在播客中——用自己的声音为一期节目或固定栏目配音,并通过“直播排期”安排播出:无需录音室和麦克风的原创播客。
- 通过 API——用于集成和自定义配音场景:通过验证的声音会与目录声音一起出现在声音列表中。
一个账户最多可以保留 三个声音。声音也不只属于你一个人:使用同一内容库的同事同样能在列表中看到它并用它配音——就像共用的台标和通知一样。
用自己的声音生成内容的计费方式与目录中的任何声音完全相同——克隆本身不收取额外费用。
隐私与控制
声音样本属于生物识别数据,我们也以相应的方式对待它:
- 样本的保存期与声音的存在期完全一致。 它本身就是你的克隆:没有样本就无法合成,因此不存在“训练完成后删除样本”——因为根本没有训练。
- 一键删除。 操作菜单 → “移除”会删除声音本身、确认录音和试听预览。请注意:使用该声音的通知和排期将不再由它配音。
- 同意记录留存。 我们会为每个声音单独保存你接受的是哪一版条款以及接受的时间。
- 声音仅对你的内容库可见。 其他 Tunio 账户无论在目录还是 API 中都看不到它。
常见问题
可以上传其他人的声音吗——比如主持人或配音演员?
可以,前提是你已获得对方对克隆的明确同意——这一点你在第一步就会确认。但确认环节必须由本人完成:短语必须用与样本相同的声音朗读。
克隆声音会说哪些语言?
数十种受支持语言中的任意一种——模型按文本所写的语言朗读。而样本本身可以是任何语言。
声音被拒绝了怎么办?
把鼠标悬停在状态上查看原因。如果是文本不匹配——请完整、清晰、不漏字地朗读短语。如果是声音不匹配——请在与样本相同的环境下、用同一个声音录制。然后 “确认声音” → 新短语 → 重新录音。
验证要等多久?
通常几分钟。声音列表会自动刷新。
哪些套餐包含声音克隆?
启用了自定义声音的套餐——“我的声音”标签页会自动出现在个人资料中。如果没有看到,请在“账单”板块查看你套餐的条款。
在自己的节目里试试
录 20 秒语音,确认声音——下一条台标或折扣通知就会用你自己的声音播出。