AI 语音克隆第一次成功的时候,感觉就像魔法。上传一段录音,输入一句话,就能听到它用你自己的声音说出来。
而当它没成功时,问题通常出在录音上,而不是 AI。克隆会把样本里的一切都学进去:冰箱的嗡嗡声、空房间的回声,还有你急着把稿子念完的那股匆忙。垃圾进,垃圾出。
好消息是,录一段干净的样本并不需要录音棚。本文会讲清房间、麦克风、朗读稿和导出设置,让你的声音克隆拥有最好的起点。
快速检查清单
| 方面 | 这样做 | 避免这样 |
|---|---|---|
| 🏠 房间 | 小一点、软物多、够安静的空间 | 光秃秃的墙面、厨房、开着的窗户 |
| 🎙️ 麦克风 | 距离固定,稍微偏离正对嘴巴的方向 | 来回移动、用笔记本电脑内置麦克风 |
| 📊 电平 | 峰值在 -12 到 -6 dB 左右 | 削波爆音,或者录得太小声、事后再放大 |
| 📜 朗读稿 | 自然的句子,句式多变 | 单调的列表、一个词一个词地念 |
| 🗣️ 表达方式 | 你希望克隆声音使用的语气 | 生活中从来不会用的“念稿腔” |
| 💾 导出 | WAV 或高码率格式,不做后期处理 | 重度降噪、背景音乐、混响 |
💡 经验法则:一段较短但干净的样本,通常胜过一段较长但嘈杂的样本。先把房间的问题解决,再考虑多录几分钟。
按下录音键之前
先确认工具的要求
每款语音克隆工具,对样本时长、文件类型和文件大小都有各自的要求。先查清楚,才能用对格式、录够时长,免得事后返工重录。
只克隆你有权使用的声音
克隆你自己的声音,或者声音主人已明确许可的声音。未经同意克隆他人的声音,可能违反平台规则,在很多地方还可能违法。下文会详细说明。
想清楚克隆声音用在哪里
用平静、缓慢的样本训练出来的克隆,听起来也会平静而缓慢。想想你会把它用在哪里,比如课程旁白、视频配音或播客片头,然后用对应的风格来录。
你真正需要的设备
你不需要昂贵的设备,你需要的是始终如一的设备。
| 配置 | 包含什么 | 效果 |
|---|---|---|
| 📱 最低配置 | 一部较新的智能手机,拿稳,在安静的步入式衣帽间里录 | 足够用来测试 |
| 🎧 推荐配置 | 一支 USB 麦克风、一副耳机、一个防喷罩 | 干净可靠 |
| 🎚️ 进阶配置 | 一支 XLR 麦克风和一台音频接口(声卡) | 接近录音棚水准,但前提是房间也做过声学处理 |
耳机比大多数人想象的更重要。有了它,你在录音过程中就能听到背景噪音,而不是录完才发现。
布置你的房间
房间对样本的影响比麦克风还大。坚硬平整的表面会把你的声音反弹回来,形成回声,而克隆会把这种回声复制到它说出的每一句话里。
- 🧥 找个柔软的地方录:挂满衣服的步入式衣帽间,就是经典的家庭录音间。
- 🪟 消除背景噪音:关好窗户,暂停空调,关掉消息通知,离冰箱远一点。
- 🛋️ 增加柔软的表面:地毯、窗帘、靠垫和毯子都能吸收反射声。
- 🔇 做一次静音测试:什么都不说,录 10 秒空白,戴上耳机回放。如果能听到嗡嗡声,先解决掉再继续。
麦克风技巧
保持稳定的距离
与麦克风保持大约一拃的距离,并在整个录音过程中保持不变。身体一会儿前倾一会儿后仰,音色和音量都会跟着变,克隆就会无所适从。
让麦克风稍微偏离正轴
让麦克风稍微偏向嘴巴的一侧,可以减轻刺耳的“p”“b”爆破音(也就是喷麦),以及气流很重的“s”齿音。加一个防喷罩也有帮助。
电平只设一次,之后别再动
先用你自然状态下最大的音量试读一段。峰值应该落在 -12 到 -6 dB 左右。只要有地方碰到 0 dB,就会削波,这种失真事后是修复不了的。
朗读什么内容
朗读稿决定了克隆声音的说话方式。目标是自然、有变化的句子,而不是机械的列表。
好的朗读稿应该包含:
- ❓ 疑问句和陈述句,让克隆同时学会上扬和下降的语调
- 🔢 数字、日期和名字,尤其是你经常会用到的
- 📏 长短句结合,捕捉自然的停顿和换气
- 🎭 你需要的情绪范围,比如温暖、自信或兴奋
示例朗读段落:
欢迎回到节目。今天我们来聊一件大多数人都做错了的事:怎样才能真正记住读过的内容。你有没有过这样的经历,一本书刚读完,一个星期后就忘得差不多了?别担心,不只你一个人这样。在接下来的十二分钟里,我会跟你分享三个简单的习惯,它们彻底改变了我的学习方式。
就像跟朋友聊天那样读出来。如果念错了,停一下,再把整句话重读一遍。念错的部分之后可以剪掉。
正确导出文件
| 设置 | 建议 |
|---|---|
| 格式 | WAV,或你所用工具支持的最高质量格式 |
| 声道 | 单人声音用单声道就够了 |
| 后期处理 | 越少越好。剪掉开头和结尾的静音,然后就停手 |
| 降噪 | 轻度降噪,或者干脆不降噪。重度降噪会让声音发虚,像隔着水、带着机械感 |
| 音乐和效果 | 一律不加。不要背景音乐、混响或压缩预设 |
创建你的声音克隆
有了干净的音频文件,克隆这一步就很快了。
AnyVoice 是一款 AI 语音克隆工具。上传一段你的声音录音,它会创建一个声音模型,之后输入任意文字,就能听到用这个声音读出来。
一个适用于大多数克隆工具的简单流程:
- 上传你录得最好的一条,并符合工具对时长和格式的要求。
- 给声音起个清楚的名字,比如“我 – 平静旁白”。
- 先生成一句简短的测试语音,再去生成长内容。
- 和你的真实录音做对比。仔细听语气、语速和清晰度。
- 必要时重录。如果听起来不对劲,修改样本通常比跟输出结果较劲更快。
好好测试你的克隆声音
别凭一句话就评判一个克隆。跑一段简短的测试脚本,专门检查容易出问题的地方:
| 测试项 | 示例句子 | 注意听什么 |
|---|---|---|
| 🔢 数字 | “2024 年到 2026 年间,价格上涨了 14.5%。” | 小数和年份是否读对 |
| 🏷️ 名字 | “感谢曾雨桐博士和重庆长乐科技团队的支持。” | 专有名词的发音 |
| ❓ 疑问句 | “那么,这件事真的跟你有关系吗?” | 句尾语调是否上扬 |
| 📏 长句 | 一句六七十字、带两个逗号的长句 | 换气和停顿是否自然 |
| 🎭 情绪 | “说真的,这绝对是今年最好的消息!” | 语气的能量是否与内容相符 |
问题排查
| 问题 | 可能原因 | 解决方法 |
|---|---|---|
| 克隆声音有回声,或听起来很远 | 房间反射声太强 | 换到柔软的空间录,离麦克风近一点 |
| 每句话都带着嘶嘶声或嗡嗡声 | 样本里有噪音 | 做静音测试,消除噪音源后重录 |
| 声音发机械,或像隔着水 | 重度降噪 | 导出时少做或不做处理 |
| 平淡单调 | 朗读稿念得没有感情 | 用你自然的说话方式重录 |
| 峰值刺耳或有破音 | 削波 | 降低输入增益,峰值保持在 -6 dB 以下 |
| 口音或音色对不上 | 混用了不同日期或不同麦克风录的片段 | 同一次录制、同一支麦克风、同一个位置 |
负责任地使用克隆声音
语音克隆的能力很强,正因如此,征得同意才格外重要。
- ✅ 克隆你自己的声音,或者取得说话人的书面许可。
- ✅ 给 AI 生成的音频加上标注,只要你的平台或受众对此有预期。
- ❌ 不要冒充真实人物、公众人物或同事。
- ❌ 不要用克隆声音误导听众、批准付款或通过声纹验证。
克隆声音能用在哪里
每当你需要用自己的声音、却抽不出时间亲自录制时,一个好的克隆能帮你省下好几个小时:
- 🎓 课程内容需要更新时,不必整段重录
- 🎬 视频配音,整个系列保持同一个声音
- 🎙️ 播客片头、片尾和广告口播
- 📚 文章和邮件通讯的有声版,读给你的受众听
需要给克隆声音找点东西来读?TurboCast 的 AI 播客生成器可以把 PDF、文章或你的笔记,变成一份可以直接配音的播客脚本。
常见问题
语音克隆的样本应该录多长?
这取决于具体工具,所以先查看它的要求。一般来说,一段干净、自然的说话录音比时长更重要。如果你的工具支持更长的样本,多录几分钟干净的音频,有助于捕捉你声音里更多的变化。
可以用手机录声音样本吗?
可以,用来测试没问题。在安静、软物多的房间里录,手机拿稳并保持固定距离,关掉所有音频增强功能。如果克隆声音要公开使用,升级一支 USB 麦克风很值得。
为什么我的克隆声音听起来很机械?
常见原因有三个:降噪太重、朗读稿念得太单调,或者房间太吵。换一个更安静的地方,尽量少做后期处理,用你自然的说话方式重录。
可以克隆别人的声音吗?
只有在获得对方明确许可的情况下才可以。未经同意克隆他人的声音,可能违反平台条款,在许多地区还可能触犯隐私权或声音权益相关的法律。
需要把样本里的换气声删掉吗?
保留自然的换气声。把每一次换气都删掉,反而会让克隆听起来不自然。只要避免大口喘气,或者直接对着麦克风呼气就行。
录一次,处处可用
一个出色的克隆,始于 20 分钟的用心准备:柔软的房间、稳定的麦克风、自然的朗读稿,以及干净的导出文件。把这些做好,你的 AI 声音听起来就会像你本人,而不是你房间的复刻版。
声音准备好之后,用任意文档生成一份供它朗读的播客脚本。

