会先把书面语改成口语再朗读的 TTS
大多数文字转语音会原样朗读你的文字。ListenHub TTS 会先把它改写成口语。五段音频,两组正面对比。

我们做这个功能,起因只是一位用户发来的一封邮件。下面是它要解决的问题,以及五段比任何规格表都更有说服力的音频。
一切始于一篇原本没打算写的教程
ListenHub 于 2025 年 5 月上线后几周内,注册用户就超过了 10,000 人。
其中最让我难忘的是一位年长的先生。他在网上发现了 ListenHub,却不知道该怎么用,于是发邮件询问我们有没有教程。
我的第一反应是:教程?ListenHub 还需要教程?它明明这么简单。
这正是我学到的一课。对于每天都在构建 AI 产品的人来说显而易见的东西,对其他人而言仍然可能真的很难。
于是我回复他说——“我们现在还没有,但我马上写”——然后打开 Notion,写下了我这辈子最直白的一篇教程。

那份初稿后来成为我们至今仍在发布的指南:ListenHub 101。
在随后往来的邮件中,我才知道自己是在为怎样的人写这篇教程。
1957 年,Bill Vick 在美国海军陆战队担任 Force Recon Pathfinder。2025 年他写信给我们时,已经接近九十岁,并在另一条战线上坚持着:多年的特发性肺纤维化和四次中风夺走了他说话的能力。
但他身上的海军陆战队精神没有停下。他创办了 PF Warriors——一个面向该疾病患者的全球互助社区——如今把 ListenHub 当作自己的声音,生成音频与社区分享,帮助经历同样困境的人。
说到底,这就是全部工作:做真正能帮助具体的人使用的东西。
播客是一种让人听见你的方式,却不是唯一方式。因此,我们开始构建一款通用 AI 语音:它既能主持节目,也能讲解论文、发表演讲或朗读小说。它现在就是 ListenHub 文字转语音。
书面语言与口头语言不是一回事
一个合理的问题是:市面上已经有很多文字转语音服务,为什么还要再做一个?
因为读起来流畅的文字,念出来往往很糟;而自然的口语,写在页面上又很少显得合适。学术论文、新闻报道、聊天机器人回答——这些内容全都是为“阅读”而设计的。
多数 TTS 工具会逐字照读你的文本。这就像做演示时把幻灯片上的每个字原样念出来。技术上确实覆盖了材料,但没人能跟得上。
ListenHub TTS 增加了所有人都会跳过的一步:先把书面文本改写成口语,再进行朗读。含义不变,但结构从服务眼睛改为服务耳朵。你也可以关闭改写,得到逐字朗读;对于合同或免责声明,这反而正是你需要的。
这听起来很抽象。不如直接让耳朵来判断。
案例 1:让提纲不再像提纲
AI 工具很喜欢 Markdown。标题、项目符号、嵌套列表——放在屏幕上很有用,变成音频却很机械。
这是测试文本:
# Product Launch Core Outline
## Problem Background
- Spoken and written language are two different forms of expression
- Written text isn't always suitable for audio delivery
- Spoken words aren't always suitable for writing
- Papers, news, AI answers are designed for reading, not speaking
## Market Status
- Existing TTS services only read text literally
- Being "readable" doesn't make it "speakable"
- Lacks a conversion layer from written to spoken language
僵硬、机械,如果不同时看着文本,几乎很难跟上。现在开启改写,使用同一份源文本:
标题变成了过渡句,项目符号变成了完整句子。闭着眼睛也能听懂。
案例 2:一篇真正听得下去的研究论文
论文有意写得信息密集。逐字念出来,几乎无法收听。
我们把《Attention Is All You Need》的开头分别用两种方式处理了一遍。

每位作者的名字、每个机构、每个引用标记,全都按顺序读出。现在开启改写:
听起来像一位读过论文的朋友正在带你理解它。准确,而且不用反复倒回去重听。
人们还会用它做什么
用你自己的克隆声音讲睡前故事。把一份幻灯片变成配套演讲。讲单口喜剧。制作 ASMR:
搭配你自己的声音
再加上声音克隆,输出的就是你的声音,而不是库里的通用声音。朗读小说、讲解论文、录制播客开场、为短视频配旁白——全都不必真的录音。
每个付费方案都包含克隆:Basic 可用一个声音,Pro 可用四个,Max 可用二十个。当前详情请查看价格;如果更愿意直接用现成声音,也可以浏览公开声音目录。
它为什么有效
主要由三点发挥作用:
- 理解上下文。 模型会先理解含义,再开口朗读,因此能判断一段话究竟在说什么,以及听众通常会如何表达它。
- 多模态输入。 不只处理纯文本,也能处理图片和 PDF 文档。
- 智能删减。 广告、代码块、导航杂项和零散字符会被去掉,而不是被念出来。
它还支持流式生成:其余音频仍在生成时就会开始播放,因此你不必盯着进度条等待。
这一切既来自产品和工程团队在构建 ListenHub 过程中积累的经验,也来自大量毫不客气的用户反馈。谢谢你们。
适合谁使用
- 内容创作者:无需安排录音,就能把文章和知识库变成音频。
- 有声书听众:希望旁白听起来更有生命力。
- 企业团队:制作培训材料、产品演示和公告。
- 开发者:为需要或更偏爱音频的读者添加内容的音频版本。
- 教育工作者:把讲义、教材和论文转成学生真正能听完的内容。
试试看
它可以直接在浏览器中的文字转语音使用——粘贴文本、放入链接或上传文件,然后点击生成。ListenHub 的 iOS 和 Android 应用中也有这个功能。
想基于它继续开发?同一套声音也通过我们的 API 提供,包括 MCP 和 Agent Skills 集成。可以从 API 文档开始。
如果你想要的是两位主持人的节目,而不是单人旁白,那就是 AI 播客——它仍然是把一条链接最快变成值得收听内容的方式。

