全球首个对话式声音克隆
照着稿子读,只会得到一个没有你本人味道的克隆声音。ListenHub 改用自然对话来克隆你的声音,这些技巧能让结果更像你。

你过去录制过的声音克隆,大概都从同一种方式开始:屏幕上出现一段稿子,你照着念,最后得到的声音从技术上说确实是你的,却一点也不像你本人。
ListenHub 改用一场对话来克隆你的声音。不用读稿,也不用表演。
为什么照稿念永远不像你
基于稿件的克隆要求你完成一件绝大多数人都不擅长的事:毫无准备地对着麦克风演绎别人写好的话。
读错了,于是重来。声音太平,于是重来。五次之后,克隆结果仍然没有生命力——不是读得差,只是一直在“读”。它没有在说话,只是在发音。
我们不断追问,为什么只录三十秒音频也这么难做好。答案其实很明显:人一看到需要朗读的文字,就不再像自己。真正属于你的声音——节奏、呼吸、被某件事惹恼时突然抬高的音调——只会在你和别人交谈时出现。
所以在 2025 年 10 月,我们围绕这一点重做了整个流程。不是上传框,而是一场对话。
大多数产品一天就能上线这个功能:让用户录 10 到 30 秒,或者上传一个文件。我们却为它做了一整套交互式语音对话系统。当时的感觉,就像为了过马路造了一艘飞船。
之所以这么做,是因为你的声音是 ListenHub 上唯一没有其他人能够复制的东西。无论它最终主持播客、为文本转语音轨道配音,还是出现在解说视频里,后面的所有内容都会继承这个声音有多真实。经过两个月开发和一次私测,对话式克隆于 2025 年 12 月上线。据我们所知,此前还没有人这样做过。
通过交谈克隆你的声音
旧流程是:朗读、等待、失望、重来。新流程只有三步:
- 从左侧菜单打开声音克隆。
- 开始对话。
- 像和老朋友打电话一样说话。抱怨午饭,计划一次根本不会去的旅行,争论某部电影。聊什么都可以。
交谈时,系统收集的不只是音节,还会捕捉你的语调、呼吸节奏,以及你不经意间表现出来的情绪范围。最后得到的是放松状态下的你,而不是站在全班面前朗读的那个你。
如果第一次克隆不像你,解决办法是再聊一次,而不是写一份更好的稿子。
开口前先做好准备
交互本身很简单,但两分钟的准备仍然决定了结果只是“能用”,还是足够出色。
使用你手上最好的麦克风
这主要是物理规律:硬件越好,信噪比越高。如果你有播客麦克风,就用它。如果只能在老旧笔记本和口袋里的新手机之间选择,就选手机——ListenHub 支持移动端。
把手机拿到脸边,可以保留声音的质感和呼吸,而两英尺外的笔记本麦克风会把这些细节丢掉。距离是最容易改善的因素。
找一个没有回声的房间
硬地板、空墙和高天花板会让反射声模糊你的声音,克隆模型也会把房间一起学进去。小而铺有地毯的房间、车里,或有柔软家具的角落,都比看起来漂亮的厨房更合适。关窗、关风扇,把狗先放到外面。
两条听起来不对、其实很有效的建议
比你觉得自然的程度再夸张一点
日常说话时,大多数人的音域都很窄。给模型的素材范围很窄,它以后说什么都会像很疲惫。
所以要主动超出平时的表达范围。像在和多年未见的朋友叙旧一样说话,真的有高低起伏。你给它的范围越宽,之后能生成的范围也越宽。夸张一点、模仿一下、玩得开心。很多人最终会惊讶自己有多喜欢结果。
即使之后要生成其他语言,也请用母语录制
这听起来完全相反,却是最能改变结果的一条建议。
假设你想生成英文旁白,但英语不是你的第一语言。如果用犹豫、谨慎的英语克隆,模型学到的正是这种犹豫、谨慎和不自信。输入听起来没有把握,输出也会一样。
请用你最流利的语言交谈。模型会捕捉音色——让你的声音成为“你的声音”的那部分——再把它应用到你之后生成的任何语言中。最后得到的是说话流利、自信的你,而这通常才是你一开始想要的版本。
你的克隆声音接下来能做什么
保存后的声音可以在整个 ListenHub 中使用。让它主持 AI 播客,通过文本转语音朗读文档,或用于解说视频。如果你更想从现成声音开始,可以浏览声音目录;我们关于书面语转口语 TTS 的文章也解释了旁白引擎如何把文字变成值得听的内容。
每个付费方案都包含声音克隆:Basic 可保存 1 个声音,Pro 可保存 4 个,Max 可保存 20 个。当前详情请查看定价页面。
你声音里最好的部分,从来不在小心翼翼的朗读里,而在那句没有预先计划的话里。

