语音克隆
从参考音频克隆出可复用的私有音色,之后在任何需要 ListenHub 音色的地方使用它的 speaker ID。
把 1 到 6 段参考录音变成一个带独立 ID 的私有音色。一经确认,该 ID 就能用在任何需要 ListenHub
音色的地方 — /tts、/podcast、解说视频和幻灯片技能,以及 API。
触发方式
输入 /voice-clone 命令,或使用以下任意短语触发:
| 短语 | 语言 |
|---|---|
clone my voice / voice clone / custom voice | 英文 |
克隆我的声音 / 克隆音色 / 声音克隆 | 中文 |
用我的声音 / 自定义音色 / 复刻声音 | 中文 |
使用前请先安装 ListenHub Skills — 参见快速开始。
快速示例
用 ./recording.m4a 克隆我的声音,并用它读这句:"欢迎回到本期节目。"AI 会完成克隆,播放一段试听,并在留下这个音色之前先问过你 — 「确认」才是可能扣积分的那一步。
你要哪种克隆?
有两个技能都能克隆声音,它们的产出不一样。
/voice-clone | /listenhub-voice | |
|---|---|---|
| 产出 | 一个带 ID 的持久私有音色 | 仅本次请求的音频 |
| 是否存储 | 是 — 占用套餐的一个音色名额 | 不保留任何东西 |
| 可复用 | 任何接受 speaker ID 的技能与 API 调用都能用 | 否 |
| 费用 | 套餐的周期确认次数用完前免费,之后每次确认 300 积分 | 除生成本身外无额外费用 |
| 适用场景 | 你之后还会用这个音色说话 | 你只需要一段音频,别无他求 |
一次克隆怎么跑
提供参考音频
1 到 6 个本地文件 — .mp3、.wav、.m4a、.flac、.ogg、.aac。干净、无背景音乐的人声克隆
效果最好。常见情况是只传一个文件。
确认授权与语言
如果录音不是你本人的声音,本技能会询问你是否已获得被克隆者的授权,没有就停止。然后它会问这段
录音是什么语言 — 登录路径为 zh 或 en。API key 路径支持更多语言,详见 API 参考。
克隆并试听
克隆以任务形式运行,返回一个临时音色的试听。此时不保存任何东西,也不产生任何扣费。
留下,或者不留
只有当你明确说要留下时,本技能才会给音色命名,并把它确认成一个永久音色。未确认的任务 7 天后过期。
使用 speaker ID
本技能会读出新的 speakerInnerId 并交给你。任何需要音色的地方都可以传它。
「确认」才是产生费用的那一步。在套餐的周期配额内免费,超出后每次 300 积分。本技能绝不会自行 确认,也绝不会在没有你明确同意的情况下授权任何积分扣费。
限制
| 项目 | 取值 |
|---|---|
| 参考文件 | 每次克隆 1–6 个 |
| 文件大小 | 通过本技能单个文件 ≤5MB,总计 ≤20MB(API 本身单个文件接受 20MB) |
| 套餐 | 语音克隆需要付费套餐 — 免费账号会在确认这一步收到升级错误 |
| 音色名额 | 套餐限制你同时可保留的克隆音色数量 |
名额用满时,删除一个音色来释放名额。删除只释放名额,已消耗的确认次数不会退回。
管理克隆音色
本技能可以列出你的音色,并带上套餐的名额上限和剩余确认次数,查看其中某一个,重命名或修改性别, 以及删除一个来释放名额。用自然语言说出你的需求即可 — "列出我的克隆音色"、"重命名这个音色"、 "删掉旧的那个"。
克隆音色仅对你的账号私有,列出音色时会与官方音色库一同出现。
授权
克隆他人声音前,你必须已获得被克隆者的授权。如果录音不是你本人的,本技能会询问你是否拥有该授 权,你回答「否」就停止。它没有任何绕过方式,也不会核实你的回答 — 责任在你。
API 参考
接口、任务生命周期、确认扣费以及音色管理调用详见语音克隆 API 参考。