Comparisons

2026 年最佳文字转语音工具对比

从价格、声音质量和 AI 智能体操控能力对比十一款工具,并完整说明 ListenHub 的 API、MCP 与 Agent Skills、适用场景,以及哪些情况下不应该选择我们。

ListenHub Team发布于 更新于
一张深紫色和洋红色渐变标题卡片,标有 COMPARISON,标题为“最佳文字转语音工具对比”,ListenHub 字标位于 listenhub.ai 上方

这篇文章由 ListenHub 发布。我们提供文字转语音AI 播客声音克隆,也销售订阅,因此我们显然会在意你最后得出什么结论。假装不存在这种利益关系,是最快失去你信任的方式。

这篇文章承担两项任务,值得先分清。第一项,是按照你要完成的工作来分组,直接对比十一款文字转语音产品;每个价格都来自厂商自己的价格页,而不是某篇榜单。第二项,是详细说明 ListenHub 到底能做什么——包括多数人从未见过的开发者与智能体接口——并同样详细地说明哪些情况下我们并不适合。我们不给任何产品打十分制评分,尤其不会给自己打分;靠近文章末尾的一整节,唯一目的就是把你送去竞争对手那里。

直接结论

只读一个部分,就读这一节。

  • 让一个声音优美地朗读长篇脚本ElevenLabs,每月 $6。
  • 需要有规模且预算有限的 APIAmazon PollyGoogle Cloud,每百万字符 $4。
  • 实时语音智能体DeepgramCartesia
  • 经过合规审查的企业在线学习内容WellSaid Labs
  • 在视频时间线上制作旁白Speechify Studio
  • 免费把文档变成私人收听内容NotebookLM
  • 让智能体或代码库自行产出完整音频与视频ListenHub。一个密钥即可覆盖播客、语音、克隆、音乐、图片、幻灯片与视频,可通过 REST、MCP server、Agent Skills、SDK 和 CLI 调用。
  • 从文档直接生成可发布的多声音成品节目ListenHub。最后两项是我们认为自己最合适的工作;下文会解释原因,也会说明我们仍然不足的地方。

一览

价格核对日期为 2026 年 7 月 28 日。各厂商计费单位不同,表格按各自单位列出,不会强行换算成一个虚假的统一单位。

工具最适合免费层付费起点声音克隆API / 智能体访问
ElevenLabs长篇旁白质量每月 10k credits,不含商业使用$6/月有,$6 起REST、SDK、官方 MCP server
Amazon Polly大规模低价 API每月 5M 字符,长期有效按量付费AWS SDK、IAM
Google Cloud TTSAPI 中最广的声音范围每月 4M 字符,长期有效按量付费GCP SDK
OpenAI一个厂商、一个密钥按量付费仅企业版REST、SDK
Deepgram实时智能体一次性 $200 credit按量付费REST、流式 SDK
Cartesia低价低延迟流式输出每月 20k credits,不含商业使用$5/月有,$5 起REST、流式 SDK
Azure AI Speech微软技术栈企业每月 500k neural 字符按量付费有,需审核Azure SDK
WellSaid Labs企业在线学习每月可下载 3 分钟,不含商业使用$19/月REST
Speechify Studio视频时间线旁白600 credits,不含商业使用$19/月有,$19 起REST
NotebookLM免费个人音频概览每天 3 次生成Google AI 订阅
ListenHub完整节目,以及构建节目的智能体每月额度加每日补充$12/月,或年付 $9/月有,所有付费方案REST、MCP server、Agent Skills、SDK、CLI——任何账户均可使用

计费单位之所以需要单独说明,是因为没有两家完全一样:Google、AWS 和 OpenAI 的旧模型按字符计费;ElevenLabs、Cartesia、Speechify 与 ListenHub 使用 credits;WellSaid 按下载分钟;OpenAI 新模型按 token。这些单位不能互换,任何把它们加进同一张总榜的对比都在凭空捏造。

多数对比会漏掉最后一列,但到了 2026 年,它比声音质量更能决定采购。这里的产品都有 REST API。真正不同的是:AI 智能体能否在你尚未编写集成之前直接驱动它,以及一次调用究竟返回什么——音频字节,还是完整内容成品。

我们如何对比,以及无法测试什么

对比了什么、何时对比。 我们在 2026 年 7 月 28 日从每家厂商自己的价格页读取公开价格、免费层限制与商业使用条款,并与其文档交叉核对;同时查看真正影响购买的问题:当前层级能否发布、是否包含声音克隆、有没有发音词典、按什么单位计费。TTS 价格不断变化,请把这里每个数字视为起点,绑卡前重新确认。

为什么没有评分。 十分制评分意味着进行过一套我们并未开展的评分实验。我们说某款工具听起来更好,是基于我们使用这些产品以及构建自家产品的主观看法。请把这些句子当作待测试的候选名单,并用下一节的失败模式作为自己的评分表。拿最糟糕的一段真实文本测试二十分钟,比任何人的排行榜都可靠,包括我们的。

哪些信息无法核实。 部分厂商用 JavaScript 渲染价格,没有稳定的公开数字可引用。Murf 因此会在下文介绍但不列价格;Microsoft 会以文本公布免费层,却在客户端加载付费费率,所以我们只引用免费额度。PlayHT、LOVO 和 MiniMax 被完全移除:第一方价格无法加载,第三方数字彼此矛盾,而且明显沿用了往年信息。我们宁愿介绍十一款有来源的工具,也不凑出十五款无法核实的产品。

哪些功能无法测试。 企业门槛后的功能无法验证——OpenAI 自定义声音需要先与销售沟通,因此我们无法评价效果。我们也没有测试生产负载下的延迟,因为一次请求的计时,无法说明一千条并发流会怎样。

文字转语音究竟为什么会听起来不对

这里几乎所有工具都越过了旧门槛——声音已经不再像机器人。剩余的问题更微妙,但听众会察觉,只是说不出名字。在花钱之前,最值得训练的就是识别这些问题。

语调平淡。 英语通过重音传递含义。“I didn't say she took the money”根据重读哪个词,大约能表达七种意思。模型如果选择统计上最平均的重音模式,就可能把句子读对,却表达错意思。请听对比重音:声音有没有强调真正属于新信息的那个词?

为眼睛写的文本被逐字朗读。 这是最大的问题,而且根本不是声音问题。文档里写着“e.g.”、“Fig. 3”、“$1.2M”、“2026-07-28”、“(see below)”。人类朗读时会无意识地把它们改成“for example”“figure three”“one point two million dollars”。多数引擎只会念字形。项目符号片段更糟:书面列表常常没有动词,念出来就成了一堆彼此断开的名词短语。我们专门做了书面语转口语的改写步骤,因为无论声音质量怎样提升,这种错误都会保留下来。

人名与术语每次都读错。 产品名、非英语姓氏、时而逐字母念、时而当作单词念的缩写——“SQL”“Nginx”“Xiaomi”“José”。最致命的是它始终一致:在四十期节目里,它会用同一种方式读错你的公司名。请确认厂商是否提供可编辑的发音词典,以及它能否在整个工作区生效,还是每个项目都要重新输入。

没有轮流接话。 把两个声音分别渲染再首尾拼接,不等于对话。真实对话会有轻微重叠、回应词;最明显的是,第二位说话者开头的音高会回应第一位结尾的音高。把两段独立渲染拼在一起,只会得到披着风衣的两段独白。

节奏始终一致。 人类朗读列表时会加速,进入结论时会放慢;在段落边界换气,而不是每个逗号都停。每句之间使用固定间隔的引擎,听到两分钟后就会让人疲惫——而十五秒演示很难暴露这个问题。

这也引出了演示陷阱。厂商的示例句本来就是挑选出来表现最好的。不要据此判断任何产品。

视频和课程中的自然旁白

这是最大的买家群体:你已有脚本,需要一个声音朗读,并且需要发布结果的权利。

ElevenLabs——最适合长篇旁白

免费 $0/月、10,000 credits、无商业许可、无克隆 · 付费起点 $6/月 Starter · 单位 credits

真正的起点是每月 $6 的 Starter,而不是免费层:30,000 credits、商业许可和即时声音克隆。Creator 每月 $22,含 121,000 credits 和专业声音克隆;Pro 每月 $99,含 600,000。就长篇旁白而言,它比我们用过的任何工具都更能维持语调——读到章节第三段以后,它最不容易丢失句子的逻辑线索。

优点: 本表最强的长篇语调;最便宜的付费层就提供即时克隆;同一克隆声音的多语言输出很强;文档与集成生态真正成熟。

不足: 免费层既没有商业许可也没有克隆,很多人在免费层评估后直接发布时会踩坑;credits 很难在脑中换算成分钟;超过 Creator 后成本上升很快。

结论: 如果工作就是让一个声音把长篇脚本读好,买 Starter,停止继续挑选。

WellSaid Labs——最适合企业在线学习

免费 每月可下载 3 分钟,无商业权利 · 付费起点 $19/月,或 $120/年 · 单位 下载分钟

WellSaid 面向企业与在线学习团队,并按下载分钟计价,财务团队很容易据此预算。Starter 每月 $19,年付 $120,每月可下载 20 分钟;Pro 每月 $49,年付 $396,可下载 180 分钟。声音比 ElevenLabs 少,也更保守——这正是需要通过合规审核的培训模块想要的。

优点: 分钟是财务团队能理解的单位;声音保守、稳定,经得起法务审核;年付确实有明显折扣,不是四舍五入的小把戏。

不足: 以 2026 年标准看声音目录较小;没有声音克隆;如果每周都生产,20 分钟/月很紧张。

结论: 培训内容采购中最稳妥的答案,也是本表最容易预测账单的产品。

Speechify Studio——最适合在视频剪辑中制作旁白

免费 600 credits,无商业权利 · 付费起点 $19/月 Starter · 单位 credits,每秒旁白 1 credit

Speechify Studio 围绕视频编辑时间线构建,而不是文本框。Starter 每月 $19,提供 7,200 credits、声音克隆和商业权利;Creator 每月 $49,提供 28,800。旁白每秒消耗 1 credit,因此 Starter 相当于两小时成品旁白——这是少数不需要电子表格就能在脑中换算的 credit 系统。

优点: 每秒一个 credit,成本容易推算;旁白与视频剪辑在同一处;入门层即含克隆与商业权利。

不足: 你可能不需要编辑器,却仍在为它付费;长脚本的旁白质量比 ElevenLabs 低一个层级;免费层只适合演示。

结论: 当音频只是视频项目中的一条轨道,而不是最终交付物时,这是正确选择。

Murf——最适合协作式工作室流程

免费 未引用 · 付费起点 未引用 · 单位 未引用

Murf 应该出现在这一组,尤其适合需要共享项目与协作式工作室的团队。我们没有引用价格,因为其价格页由客户端渲染,我们无法读到一个愿意负责的数字。这里其他产品都附有价格;请把缺失理解为我们取证上的空白,而不是对产品的评价。

结论: 团队流程值得考察,但请直接向 Murf 获取当前价格。

可扩展的 API

这一组的关键不再是哪一个声音最漂亮,而是下面四件事。

单位经济性。 每字符、每秒或每项任务要付多少,以及规模扩大后成本曲线是否仍合理。单纯做语音合成,云厂商明确获胜:每百万字符 $4,是任何订阅都无法低于的底线。

延迟与任务形态。 你需要的是为一次对话轮次提供流式 socket,还是提交一个十分钟渲染任务后不管它。它们是不同产品;针对其中一个优化的厂商,通常在另一个场景表现平平。

一次调用返回什么。 这是大家最常忽略的轴。本节多数服务会针对你提供的文本返回音频字节——脚本、分段、多声音组装、字幕时间和封装都由你负责。较少的一组会返回完整成品。这个差别消耗的工程时间,远大于本页任何价格差异。

智能体能否独立驱动。 到了 2026 年,很多调用由编码智能体发起,而不是键盘前的开发者。此时重要的是厂商是否提供智能体能够发现并调用的工具接口——MCP server、Agent Skill、带类型的 SDK——还是必须先有人编写并持续维护集成。

投入前还要考虑:厂商持久性。Google、AWS、Microsoft 与 OpenAI 不会消失。其他产品更年轻,新进入者的价格也已经不止一次变化。

Google Cloud Text-to-Speech——最适合覆盖范围

免费 每月 4M Standard 与 WaveNet 字符、1M Chirp 3 HD,持续提供 · 付费 每 1M 字符 $4–$160 · 单位 字符

这是本表最广且实用的范围。持续免费额度用完后,Standard 与 WaveNet 每百万字符 $4;Neural2 在免费 1 百万之后为 $16;当前旗舰 Chirp 3 HD 在免费 1 百万之后为 $30;Studio 为 $160。更新的 Gemini-TTS 模型按 token 计费,没有免费额度。一个坑是:即使只想使用免费字符,也必须先启用结算。

优点: 持续免费层足够零成本运行真正原型;每种预算都有对应声音类别;数十种语言及区域变体。

不足: 从 $4 到 $160 的价格阶梯,会惩罚不看说明就选择声音类别的人;需要写代码,没有工作室;按 token 计费的 Gemini 模型无法与其他产品直接比较。

结论: 想让一家厂商同时覆盖廉价批量处理与旗舰声音时,它是默认 API 选择。

Amazon Polly——最适合最便宜的永久免费层

免费 每月 5M Standard 字符,持续提供,没有 12 个月截止 · 付费 每 1M 字符 $4–$100 · 单位 字符

低端价格领先者,也是业内最好的免费层。Standard 每百万字符 $4,Neural $16,Generative $30,Long-Form $100。每月 500 万 Standard 字符不会在一年后失效,这一点稀有到足以成为标题。

优点: 唯一真正长期且有规模的免费额度;基础设施应有的可靠与朴素;按字符计费可预测。

不足: 更好的声音类别免费期有限;没有克隆;Standard 声音与 2026 年旗舰相比显得陈旧。

结论: 如果永久免费很重要,而且你会写代码,从这里开始。

OpenAI——最适合已经使用 OpenAI 的团队

免费 无 · 付费 tts-1 每 1M 字符 $15,tts-1-hd $30 · 单位 字符;新模型按 token

如果你的技术栈已经在那里,并希望只用一家厂商和一个密钥,它是显然的选择。旧模型容易理解:tts-1 每百万字符 $15,tts-1-hd 为 $30。更新的 gpt-4o-mini-tts 按 token 而非字符计费,在测量自己的音频 token 输出之前,无法与按字符厂商比较。

优点: 已在使用时,一个密钥、一张账单、一个 SDK;对语气指令的遵循能力强;文档好。

不足: 完全没有免费层——第一次请求就付费;新模型的 token 计费确实难以预测;自定义声音需要先与销售沟通。OpenAI 的使用政策还要求披露声音由 AI 生成。

结论: 便利性就是核心功能。没有人仅仅为了声音而迁移到 OpenAI。

Deepgram——最适合实时智能体

免费 一次性 $200 credit,无需绑卡 · 付费 Aura-2 每 1k 字符 $0.030,Aura-1 $0.0150 · 单位 字符

它为实时与智能体工作负载而设计,此时延迟比声音美感更重要。注册会获得无需绑卡的 $200 credit——这是本表最慷慨的零承诺试用,不过是一次性的,不会每月恢复。

优点: 试用额度足够做出并发布一个原型;延迟针对对话轮次设计;同一家厂商还提供语音转文字。

不足: $200 不会再来;声音目录较窄;并非面向长篇旁白。

结论: 语音智能体的正确答案,有声书的错误答案。

Cartesia——最适合低价流式输出

免费 每月 20k credits,无商业使用 · 付费起点 $5/月 Pro · 单位 credits

针对低延迟流式输出,价格非常激进。Pro 每月仅 $5,提供 100,000 credits——但 Pro 同时也是第一个授予商业许可与即时声音克隆的层级,因此免费层严格来说只是评估沙盒。Startup 每月 $49,1.25 million credits;Scale 每月 $299,8 million。

优点: 本表最低付费起点,每月 $5;该层级即含克隆;延迟确实低。

不足: 免费层输出不能发布;公司比云厂商年轻;目录较小。

结论: 如果正在构建延迟敏感产品,并能接受较小厂商,这是本表每条流成本最好的选择。

Microsoft Azure AI Speech——最适合微软技术栈企业

免费 每月 500k neural 字符,持续提供,限流很重 · 付费 按地区变化 · 单位 字符

Azure 公布持续有效的 F0 免费层:每月 500,000 neural TTS 字符,同时还有 5 小时语音转文字。它限流严重,不面向生产。我们不引用 Azure 付费费率,因为价格表在客户端加载;请在门户中查询所在地区,因为 Azure 的地区差价比本表大多数产品更明显。

优点: 语言与区域覆盖深入;大型企业需要的合规与数据驻留方案;获准客户可以使用 custom neural voice。

不足: 地区定价必须自己查询;免费层限流使其更像演示;控制台非常复杂。

结论: 如果公司已经全面使用 Azure,这个决定其实早就做完了。

ElevenLabs——最适合音频智能体的工具接口

前面已经介绍过它的旁白质量,但这里也必须如实提到:ElevenLabs 提供官方 MCP server,工具面明显比我们的更大——语音、转写、speech-to-speech、音效、音乐、声音设计,以及外呼语音智能体——并支持 Claude Desktop、Cursor、Windsurf 与 OpenAI Agents。

结论: 如果智能体的工作是处理音频原子能力,并希望一个 MCP 连接覆盖最广集合,就安装它。我们下面的方案在音频原子能力上更窄,在完整交付物上更广。

ListenHub——最适合一个密钥同时覆盖音频与视频

免费 每月额度加每日补充,包含 API key · 付费起点 $12/月,或年付 $9/月 · 单位 credits

正是因为我们自己的 API,这一节才会变得更长,所以直接说明真实形态:它不是更便宜的按字符语音合成端点,而是另一种工作单位。一次 POST 会启动一项任务,最后返回完整成品:带成稿脚本的双主持人节目、包含 SRT 字幕的旁白、渲染完成的解说视频、幻灯片、配乐或图片。任务按设计异步执行——先创建任务再轮询——因为十分钟渲染不是一次 HTTP 往返能完成的事。

一个 API key 可以访问全部能力:播客、文字转语音声音克隆、音乐、图片生成、解说视频、幻灯片、AI 视频,以及从 URL 或文件提取内容。视频部分不需要第二家厂商,不需要把音频粘到画面的胶水代码,只用一个 credit 余额和一张账单。完整 API 接口会在下文继续说明。

优点: 返回完整交付物,而非音频字节;一个密钥覆盖音频与视频;提供四种第一方入口(REST、MCP、Agent Skills、SDK/CLI),智能体无需先写集成即可驱动;任何账户都能创建密钥,因此评估零成本;异步任务模型适合长时间渲染;SDK 会自动解包响应并重试限流请求。

不足: credits 比字符更粗,因此单次请求成本不如 Polly 易预测;免费额度远少于 Polly 每月 500 万字符,持续使用需要订阅或 credit packs;ElevenLabs 通过 MCP 暴露的音频工具更多;我们不承诺延迟 SLA,不应把它用于实时语音智能体。

结论: 当你希望智能体或后端产出完整、可发布内容时,它是正确调用;想要廉价批量合成或亚秒级流式输出时,则是错误选择。

完整节目,而不是一段音频

这是另一类产品,只因为用户会这样搜索,所以也被归入“文字转语音”。你没有脚本,只有一份文档,并希望两个人讨论它。

NotebookLM——最适合免费个人收听

免费 任意 Google 账户每天 3 次音频生成 · 付费 通过 Google AI 订阅 · 单位 生成次数

它免费,而且在这件事上非常出色。上传来源后,它会生成双主持人音频概览;Google 自己的支持文档写明,免费方案每天可生成 3 次音频,并有 50 次聊天查询。如果需求只是偶尔、私下使用——例如把一份密集 PDF 变成散步时收听的内容——很难反驳免费。

优点: 真正免费;双主持人对话有说服力;无需设置。

不足: 无法在开口前编辑脚本、选择声音、克隆声音或移除品牌;输出只有一个固定格式;并非为按计划发布而构建。

结论: 免费收听自己文档的最佳方式,但不是生产工具。

ListenHub——最适合可发布的多声音节目

免费 每月额度加每日补充 · 付费起点 $12/月,或年付 $9/月 · 单位 credits

这是我们自己构建的产品,所以请保持应有的怀疑——也请阅读下一节,那里会完整诚实地讲清,包括我们不擅长的部分。一句话版本:NotebookLM 给你音频概览,ListenHub 给你可以编辑、加品牌并发布的节目。

优点: 开口前可编辑脚本;文字转语音声音克隆支持十二种输出语言;书面语转口语改写能修复前面提到的“逐字朗读”问题;一个 credit 余额即可覆盖音频、SRT、视频和幻灯片。

不足: AI 播客格式本身仍只生成英语、中文和日语;脚本编辑、文件导出、克隆与品牌移除都需要付费方案,因此免费层适合收听评估而非发布;我们的单位成本无法接近每百万字符 $4;没有视频剪辑时间线;若只是一个声音朗读一篇长脚本,ElevenLabs 更好。

结论: 当交付物是从源文档构建的完整多声音节目时选择我们。本页其他多数工作,都有另一款产品更合适。

ListenHub 实际能做什么

你带来一份报告、论文、URL 或脚本,希望得到人们真的愿意听的内容。这里会发生四件普通文字转语音文本框做不到的事,也是选择我们的全部理由。

先把书面文本改成口头文本。 这就是书面语转口语步骤,针对本文最大的失败模式。“Fig. 3 shows a 12.4% YoY increase (see Appendix B)”会变成人类真正会说出口的话。项目符号片段会补上动词,缩写会按朗读者习惯展开。如果文本本来就很口语,也可以关闭该步骤并逐字朗读——法律免责声明就应该原样阅读。

写的是对话,不是两段拼起来的独白。 前面提到的轮流接话,在成为语音合成问题之前首先是脚本问题。两位主持人拿到的是按对话写成的脚本,第二位会回应第一位实际说过的内容。

开口之前可以编辑脚本。 这是玩具与工具的区别。你先看到脚本,修正误读产品定位的句子,删掉跑题内容,然后才为音频花 credits。改文字免费,重新渲染音频不免费。脚本编辑从 Basic 起属于订阅功能。

一个余额覆盖全部输出。 带 SRT 字幕的音频、解说视频幻灯片图片——使用相同 credits,无需第二份订阅。文件导出与移除 ListenHub 品牌同样从 Basic 开始,因此免费层适合听产品效果,而不是直接发布。

API 与智能体接口

这半个产品不会出现在常规功能表里,但对开发者而言最有意思。网页应用能做的所有事情都可以编程调用;四种第一方接口使用同一个 API key 认证,并消耗同一份 credit 余额。

REST API。Settings → API keys创建密钥——格式是 lh_sk_…——并调用 https://api.marswave.ai/openapi。响应统一使用 { code, message, data } 包装,非零 code 表示错误。生成按设计异步:创建任务后轮询,因为完整节目或渲染视频需要几分钟,而不是几毫秒。端点覆盖播客生成、文字转语音、用于端到端音频的 ListenHub Voice、音乐、图片生成、解说视频、幻灯片、AI 视频、说话人查询、从 URL 或文件提取内容,以及订阅状态。API 文档提供完整参考;每个端点的参数与语言支持写在那里,而不写死在本文,因为该接口比博客变化得更快。

MCP server。 ListenHub 提供 Model Context Protocol server,因此 MCP 客户端——Claude Desktop、Cursor、Windsurf、VS Code、Zed——可以通过工具调用来生成播客和旁白、浏览声音目录、检查账户,而无需直接发 HTTP 请求。每个工具都包装一个公开 API 端点,所以两套接口保持同步。默认通过 stdio 运行,远程需要时也可使用 HTTP/SSE,并从 LISTENHUB_API_KEY 认证。一个值得注意的细节:create_podcast 会替你轮询直到完成,因此一次工具调用返回完整节目,而不是需要智能体看守的 task id。参见 MCP 文档

Agent Skills。 这是我们首先会推荐给编码智能体的接口:

npx skills add marswaveai/skills

它会把 ListenHub Skills安装到项目中,供任何支持 Agent Skills 的工具使用——Claude Code、Cursor、Windsurf、OpenCode。之后直接用自然语言下达指令:把这篇文章变成解说视频用这三个 URL 制作双主持人播客。智能体会选择声音、驱动生成、轮询完成并返回带链接的成品。声音、播客、文字转语音、解说视频、幻灯片、图片、音乐、转写和内容解析均有独立 skill,因此智能体可以组合流水线,而不必只调用一个巨型端点。

SDK 与 CLI。 @marswave/listenhub-sdk 是官方带类型的 JavaScript/TypeScript 客户端——仅 ESM、自带类型、只有一个运行时依赖、需要 Node 20 或更新版本。它会解包响应并重试 429,无需自行实现。它导出两个客户端,这个区别确实有用:OpenAPIClient 通过 API key 认证,适合服务器、脚本和 CI,并以密钥拥有者身份执行;ListenHubClient 使用 OAuth 用户 token,使每次请求都以具体登录用户身份运行,适合面向用户的产品。@marswave/listenhub-cli 把同一个 SDK 包装成 listenhub 二进制,也保持同样的区分:交互工作先通过 OAuth 浏览器登录后执行 listenhub …,CI 则用密钥执行 listenhub openapi …。参见 SDK 文档CLI 文档

以编程方式挑选声音。 说话人查询不只返回 ID 与名称——每个声音还包含音高、速度、特征、风格、建议场景、口音和描述,并有本地化描述。智能体因此可以根据“温暖的女性有声书旁白”这类要求选择声音,而不是硬编码某个人曾挑过的 ID。对于更愿意读文件而不是调端点的智能体,还有纯文本目录 /voices.txt

需要明确两点。不要求购买方案——任何账户都能创建密钥,因此可以用免费额度、无需绑卡评估 API,一个周末原型无需成本。真正需要的是 credits:API 调用与网页应用消耗相同余额,所以自动化与团队手动使用都从同一个池中扣除;持续规模使用需要订阅或信用包。计费单位是 credits,不是字符,因此比按字符费率更难精确预测。

语言与声音

文字转语音声音克隆均支持十二种语言:英语、普通话、日语、西班牙语、葡萄牙语、法语、德语、土耳其语、韩语、意大利语、泰语和越南语。公开声音目录为每个声音提供标签与描述,可以按语言、性别和表达方式筛选,而不用逐个试听名字。如果要交给智能体读取,也有纯文本目录 /voices.txt

必须准确说明覆盖范围,因为我们见过其他地方夸大:十二种语言适用于文字转语音和克隆。AI 播客格式及其他创作工具仍只生成英语、中文和日语。如果今天需要双主持人西班牙语播客,我们还做不到。

声音克隆

用样本克隆自己的声音,并在目录声音可用的任何位置、任何一种支持语言中使用。所有付费方案都含克隆——Basic 保存 1 个,Pro 4 个,Max 20 个——超过方案额度后,每多保存一个消耗 300 credits。声音克隆指南解释怎样才是好样本;简短答案是:三分钟干净语音胜过三十分钟嘈杂录音。

费用

Basic 每月 $12,或年付折合每月 $9,包含 1,300 credits 和一个声音克隆。Pro 每月 $24,或年付每月 $19,包含 2,700 credits 和四个克隆。Max 每月 $240,或年付每月 $200,包含 30,000 credits 和二十个克隆。API、MCP server 与 Agent Skills 不绑定方案——包括免费层在内,任何账户都可使用,并从现有 credits 扣除。

换算成工作量:5 分钟播客约 24 credits,10 分钟文字转语音约 40,10 页幻灯片约 150。因此,如果 Pro 全部用于语音,一个月约有 11 小时。免费层提供每月额度加少量每日补充;价格页显示当前数字,它变化得较频繁,因此我们宁愿指向那里,也不把它冻结在本文。credits 指南解释三类 credits 如何叠加以及消耗顺序。

我们比上述工具弱的地方

直接说清楚,因为你迟早会发现:

  • 规模化单位成本。 Polly 与 Google 每百万字符 $4。订阅无法竞争,我们不会假装可以。
  • 单声音长篇精致度。 ElevenLabs 在很长的单旁白脚本中更能维持语调。
  • 面向智能体的音频工具广度。 ElevenLabs 的 MCP server 暴露更多音频原子能力——转写、speech-to-speech、音频分离、声音设计、外呼。我们针对的是完整交付物。
  • 没有按字符 API 计量。 你消耗 credits,不是字符,所以单次请求成本比公开的每百万 $4 更难预测;我们的免费额度也只是 Polly 每月 500 万字符的一小部分。
  • 不承诺延迟。 我们没有 SLA,任务模型面向渲染而非实时轮次。不要把我们放进实时语音智能体。
  • 视频编辑。 Speechify 给你时间线,我们给你导出结果。
  • 播客语言。 TTS 与克隆十二种,播客格式三种。
  • 企业采购。 没有 Azure 与 AWS 那类数据驻留保证或定制合同。

免费层对比

免费层的差别在于它是产品还是演示。真正重要的不是大小,而是能否发布产出。

工具免费额度是否持续?免费层可发布?
Amazon Polly每月 5M Standard 字符是,无截止
Google Cloud每月 4M Standard 字符、1M Chirp 3 HD
Azure每月 500k neural 字符是,限流
Deepgram$200 credit否,一次性
NotebookLM每天 3 次生成个人使用
ElevenLabs每月 10k credits
Cartesia每月 20k credits
Speechify600 credits
WellSaid每月可下载 3 分钟
ListenHub每月额度加每日补充否,导出需方案

最后五家对此都非常诚实,但如果你打算发布,它们就完全无用。我们把自己放在这一组而不是凌驾其上,因为无法导出的免费层,无论是谁构建的,都是评估沙盒。请从第一天就为付费起点预算——依次为 $6、$5、$19、$19 和 $12。Polly 更好的声音类别也有时间限制:前 12 个月,Neural 每月 1 百万、Long-Form 500,000、Generative 100,000。

如果“免费”是硬要求,并且你打算发布,候选很短:Polly 与 Google Cloud,而且你需要写代码。

英语以外的语言

云平台在广度上直接获胜。Google、Azure 与 Polly 都覆盖数十种语言,拥有母语者声音和区域变体,并且早在当前浪潮之前就开始建设。ElevenLabs 的优势是同一个声音的多语言输出——同一克隆声音说另一种语言,这是不同且有价值的能力。

营销最模糊的地方,是“支持”与“效果好”之间的差距。很多厂商给出很大的语言数,但多数语言只由一个多语言模型和少数针对英语调优的声音服务。OpenAI 在自己的文档中对此很坦诚。请索取目标语言样本,使用真正面向该语言宣传的声音,并让母语者试听。

按这个标准,我们不凑整地说明自己的位置:文字转语音声音克隆支持十二种语言,每种都使用目录中的对应声音,而不是给英语声音加口音选项;播客格式支持三种。如果需要印地语、阿拉伯语或印尼语旁白,我们无法提供,Google 或 Azure 可以。

应该选哪一款?

你是发布旁白视频的个人创作者。 ElevenLabs Starter,每月 $6。只有还需要剪辑时间线时,再加 Speechify。

你负责 L&D 或培训团队。 WellSaid Labs。分钟是可预算单位,声音也经得起法务审核。

你是需要在产品中加入语音合成的工程师。 Google Cloud 或 Polly。先在持续免费层中做原型,再有意识地选择声音类别——每百万字符 $4 与 $160 的差异,可能只是一个声音类别下拉框。

你在构建语音智能体。 Deepgram 或 Cartesia。延迟与每条流成本才是全部,目录大小不是。

你希望 AI 智能体自行产出完整内容。 ListenHub Skills或我们的 MCP server。执行一次 npx skills add marswaveai/skills,编码智能体无需先写集成,就能把 URL 变成已发布节目或解说视频。开始时无需购买方案——免费账户可获得密钥,超过评估阶段后按 credits 付费。如果智能体需要的是转写、音效、声音设计等音频原子能力,而不是成品,请改装 ElevenLabs MCP server,或两者都装。

你在 CI 中自动化内容流水线。 用 API key 调用我们的 SDK 或 CLI;如果只需要合成,就用云平台。listenhub openapi … 正是为脚本场景设计的。

你是面对密集 PDF 的学生或研究者。 免费使用 NotebookLM。当你开始希望脚本可编辑、输出可发布时,就到了需要换工具的阶段。

你从文档发布节目或内容栏目。 ListenHub。脚本可编辑、多声音输出、无品牌导出,一个余额覆盖音频、视频与幻灯片。

你的要求确实是 $0,而且会写代码。 先 Polly,再 Google Cloud。其他产品的免费层不是禁止发布,就是会用完。

人们真正会问的问题

最好的免费文字转语音工具是什么? 如果会写代码,选 Amazon Polly:每月永久提供 500 万字符,而且允许发布结果。如果不会写代码,NotebookLM 可供免费个人收听。大多数消费级免费层——ElevenLabs、Cartesia、Speechify、WellSaid 与我们——不是禁止商业使用,就是把导出放在付费方案后。

可以在 YouTube 或客户项目中使用 AI 声音吗? 只有授予商业许可的层级可以,而它通常不是免费层。ElevenLabs 从 $6 起授予,Cartesia 从 $5,Speechify 从 $19。检查你实际准备购买的精确层级,而不是它上面的方案。平台规则与厂商许可分开;OpenAI 的政策还要求披露声音由 AI 生成。

声音克隆是什么,需要获得许可吗? 你提供一段声音样本,模型复现其音色,从而让它朗读任意文本。你必须获得声音本人的同意——自己的声音当然算。未经许可克隆他人声音,是最快遇到法律问题的方式,所有信誉可靠的厂商条款都会禁止。

哪款工具的声音最自然? 根据我们的使用经验,让一个声音朗读长篇脚本时是 ElevenLabs。但“自然”更常失败在语调、逐字念符号和读错名字,而不是音色。因此请用自己最糟糕的段落测试,不要相信任何榜单。

大概要花多少钱? 创作者订阅大约每月 $5–$25,API 则每百万字符约 $4–$30。免费层适合评估与个人使用,发布通常从第一个付费层开始。

AI 生成的语音能被检测出来吗? 无法可靠检测,也不应该围绕“检测不出来”来规划。部分平台要求披露合成媒体,部分厂商把它写入条款,而被发现未披露造成的声誉成本,远高于主动披露。

文字转语音与 AI 播客工具有什么区别? 文字转语音拿到脚本并朗读。AI 播客工具拿到源文档,先写脚本——通常是对话——再朗读。如果你已经有文案,就买文字转语音;如果手里是一份报告,希望得到围绕它的对话,那是另一类产品,也是我们构建的产品

我需要 API 还是应用? 如果语音是产品中的一项功能,或规模大到按字符比订阅便宜,就用 API。如果语音本身是交付物,而且不想维护代码,就用应用。为了手工做四十期节目而购买 API,是常见且昂贵的错误。

哪些工具可被 AI 智能体直接使用? ElevenLabs 与 ListenHub 都提供官方 MCP server,因此 Claude Desktop、Cursor 或 Windsurf 中的智能体无需编写集成即可把它们当工具调用。ListenHub 还发布 Agent Skills——npx skills add marswaveai/skills——支持 Claude Code、Cursor、Windsurf 与 OpenCode。本表其他产品都是 REST API,需要你或智能体先包装。实际差异在于调用返回什么:ElevenLabs 把音频原子能力交给智能体,ListenHub 则交付完整节目、视频或幻灯片。

ListenHub API 多少钱,有免费密钥吗? 任何账户都可以创建密钥,包括免费账户——无需购买方案。消耗的是 credits,与网页应用使用同一余额,因此评估免费;持续规模使用需要每月 $12 起的订阅或 credit pack。坦诚的限制是单位:credits 比字符粗,如果必须把每次请求成本预测到美分,Polly 或 Google Cloud 这类按字符厂商更容易建模。

我可以代表自己应用中已登录的用户调用 ListenHub 吗? 可以,这正是两个 SDK 客户端的用途。OpenAPIClient 使用 API key,以密钥拥有者身份执行,适合服务器、脚本与 CI。ListenHubClient 使用 OAuth 用户 token,让每次请求在具体用户账户下运行,适合面向用户的应用。绝不要把 API key 放进浏览器或移动端代码。

ListenHub 支持哪些语言? 文字转语音声音克隆支持十二种:英语、普通话、日语、西班牙语、葡萄牙语、法语、德语、土耳其语、韩语、意大利语、泰语、越南语。AI 播客格式支持三种——英语、中文、日语。对于 API 与 MCP 接口,应逐端点查看参考文档,不要假设与网页应用范围完全相同。

哪些情况下我们会把你推荐给别人

六种情况,直接说明:

你需要一个声音优美地朗读长篇脚本。 买 ElevenLabs。长篇语调是其专长,每月 $6 也不是实际障碍。

你是有规模和预算要求的工程师。 选择 Google Cloud 或 Polly。任何订阅都无法击败每百万字符 $4,持续免费层也意味着原型零成本。

智能体需要音频原子能力,而不是完整成品。 安装 ElevenLabs MCP server。转写、speech-to-speech、音效、声音设计与外呼都在那里,而我们的工具面有意更窄。

你在构建任何实时产品。 Deepgram 或 Cartesia。我们没有延迟 SLA,任务模型面向渲染。

你需要我们不支持的语言,或需要英语、中文、日语以外的双主持人播客。 旁白广度选 Google 或 Azure。我们的播客格式还没有追上声音目录。

你只想把文档变成自己收听的摘要。 用 NotebookLM。它免费而且好用;私人通勤收听不需要脚本编辑、品牌移除或声音克隆。

我们只在两种情况下更合适:你希望从源文档得到完整、可发布的多声音节目,并在开口前编辑脚本;或者你希望智能体或后端通过一个密钥产出这类结果,包括音频与视频。

决定之前,自己跑一次测试

二十分钟能告诉你的,比任何对比文章都多,包括这一篇。

  1. 取出你最糟糕的一段真实文本——产品名、缩写、数字、括号补充。不要用厂商演示文本。
  2. 不做编辑,把它分别放进候选名单中的三款工具。
  3. 戴耳机以 1x 速度从头听到尾。倍速会掩盖节奏问题。
  4. 统计前面列出的失败:重音错误、逐字念符号、名字读坏、接话僵死、间隔一致。
  5. 最后才看价格。无论费率多低,会读错公司名的工具都不便宜。
  6. 检查你实际准备购买的精确层级是否包含商业许可,而不是看它上面的方案。

若想在测试中加入我们,文字转语音AI 播客都可在免费层、无需绑卡运行。如果更愿意在终端而不是浏览器评估,npx skills add marswaveai/skills 会把它交给编码智能体,API 文档也可在付费前公开阅读。

如果竞争对手在你的文本上获胜,那就是它应得的。

返回博客