ListenHubDocs

语音克隆

从参考音频克隆出可复用的私有音色,之后在任何需要 ListenHub 音色的地方使用它的 speaker ID。

把 1 到 6 段参考录音变成一个带独立 ID 的私有音色。一经确认,该 ID 就能用在任何需要 ListenHub 音色的地方 — /tts/podcast、解说视频和幻灯片技能,以及 API。

触发方式

输入 /voice-clone 命令,或使用以下任意短语触发:

短语语言
clone my voice / voice clone / custom voice英文
克隆我的声音 / 克隆音色 / 声音克隆中文
用我的声音 / 自定义音色 / 复刻声音中文

使用前请先安装 ListenHub Skills — 参见快速开始

快速示例

用 ./recording.m4a 克隆我的声音,并用它读这句:"欢迎回到本期节目。"

AI 会完成克隆,播放一段试听,并在留下这个音色之前先问过你 — 「确认」才是可能扣积分的那一步。

你要哪种克隆?

有两个技能都能克隆声音,它们的产出不一样。

/voice-clone/listenhub-voice
产出一个带 ID 的持久私有音色仅本次请求的音频
是否存储是 — 占用套餐的一个音色名额不保留任何东西
可复用任何接受 speaker ID 的技能与 API 调用都能用
费用套餐的周期确认次数用完前免费,之后每次确认 300 积分除生成本身外无额外费用
适用场景你之后还会用这个音色说话你只需要一段音频,别无他求

一次克隆怎么跑

提供参考音频

1 到 6 个本地文件 — .mp3.wav.m4a.flac.ogg.aac。干净、无背景音乐的人声克隆 效果最好。常见情况是只传一个文件。

确认授权与语言

如果录音不是你本人的声音,本技能会询问你是否已获得被克隆者的授权,没有就停止。然后它会问这段 录音是什么语言 — 登录路径为 zhen。API key 路径支持更多语言,详见 API 参考。

克隆并试听

克隆以任务形式运行,返回一个临时音色的试听。此时不保存任何东西,也不产生任何扣费。

留下,或者不留

只有当你明确说要留下时,本技能才会给音色命名,并把它确认成一个永久音色。未确认的任务 7 天后过期。

使用 speaker ID

本技能会读出新的 speakerInnerId 并交给你。任何需要音色的地方都可以传它。

「确认」才是产生费用的那一步。在套餐的周期配额内免费,超出后每次 300 积分。本技能绝不会自行 确认,也绝不会在没有你明确同意的情况下授权任何积分扣费。

限制

项目取值
参考文件每次克隆 1–6 个
文件大小通过本技能单个文件 ≤5MB,总计 ≤20MB(API 本身单个文件接受 20MB)
套餐语音克隆需要付费套餐 — 免费账号会在确认这一步收到升级错误
音色名额套餐限制你同时可保留的克隆音色数量

名额用满时,删除一个音色来释放名额。删除只释放名额,已消耗的确认次数不会退回。

管理克隆音色

本技能可以列出你的音色,并带上套餐的名额上限和剩余确认次数,查看其中某一个,重命名或修改性别, 以及删除一个来释放名额。用自然语言说出你的需求即可 — "列出我的克隆音色"、"重命名这个音色"、 "删掉旧的那个"。

克隆音色仅对你的账号私有,列出音色时会与官方音色库一同出现。

授权

克隆他人声音前,你必须已获得被克隆者的授权。如果录音不是你本人的,本技能会询问你是否拥有该授 权,你回答「否」就停止。它没有任何绕过方式,也不会核实你的回答 — 责任在你。

API 参考

接口、任务生命周期、确认扣费以及音色管理调用详见语音克隆 API 参考

相关

本页内容