把你自己的 PDF、文档和链接变成播客
一次最多上传五个来源,包括 PDF、Word 文件、EPUB、图片或链接,ListenHub 会将它们制作成双主持人播客。本文介绍格式、限制和费用。

大多数工具都要求你先提供一个主题。但很多时候,材料其实已经在你手里:一篇一直没读完的研究论文、一份 40 页的供应商报告,或者从三月起就打算看的六个浏览器标签页。
ListenHub 可以直接处理这些材料。把来源放进播客工具,它会阅读全部内容、判断重点,并围绕材料录制一段双主持人对话。本指南会说明支持哪些来源、如何组合多个来源、真正的限制在哪里,以及需要多少费用。
ListenHub 支持什么
单集节目可以自由混合三类来源。
文件。 支持 PDF、DOCX、TXT、MD 和 EPUB,以及 JPG、PNG 和 WEBP 图片。点击创作框右侧的上传图标,或者直接把文件拖进去。请注意,仅支持 DOCX,不支持更早的 DOC 格式;目前也不支持 PPTX、XLSX 或 CSV。
链接。 任何公开的 http 或 https 地址都可以。粘贴链接的对话框会要求输入“来自任意媒体或博客”的链接,并用 YouTube、Substack、Medium、X 和 Reddit 举例,但普通文章网址的处理方式完全一样。本地地址和私有网络地址会被拒绝。
粘贴文本。 单个文本块最多 500,000 个字符。对于 ListenHub 无法直接打开的格式,这是一个通用解决办法:把内容粘贴进来,它就会像其他来源一样参与生成。
混合输入功能于 2025 年 7 月上线,当时的公告比一段文字更直观地说明了它的用法:

最多组合五个来源
一集节目总共可以放入五个来源,文件、链接和粘贴文本合并计数。这个总数值得记住,因为它会改变你可以提出的问题类型。
一个来源通常得到一份总结。多个来源则能得到综合分析,而这往往才是你真正需要的:
- 把课程幻灯片、指定阅读材料和自己杂乱的笔记合成一期复习节目。
- 把竞争对手的定价页、他们的发布文章,以及团队经常引用的分析师 PDF 放在一起。
- 放入两篇观点相反的论文,让主持人在对话中协调它们的分歧。
- 把一份长报告和报道这份报告的新闻文章组合起来,同时听到主张与外界反应。
上传前请给文件使用不同的名称。两个同名来源会被拒绝;当你手里有三个都叫 report.pdf 的文件时,这一点很容易踩坑。
具体限制
| 来源 | 限制 |
|---|---|
| 单个 PDF | 30 MB |
| 任何其他文档(DOCX、TXT、MD、EPUB) | 15 MB |
| 单张图片 | 7 MB |
| 单集节目中所有文件的总大小 | 30 MB |
| 单个粘贴文本块 | 500,000 个字符 |
| 每集来源数 | 5 |
最先被触及的通常是总计 30 MB 的上限。一个 30 MB 的 PDF 单独上传没有问题;同一个 PDF 再加一个较大的文件就不行。
什么样的来源文档效果好
文件大小与节目质量几乎没有关系。两个大小完全相同的文档,生成结果可能截然不同。
连贯正文优于版式。 报告、文章、论文和文档通常效果很好。主要由图表组成、每页只有六个字的幻灯片,留给主持人讨论的内容很少。
PDF 需要有文本层。 对任何文本提取器来说,扫描页面和拍照文档都只是图片。如果你无法在 PDF 阅读器中选中文字,ListenHub 也无法读取。请先对它运行 OCR。
链接必须可以公开阅读。 登录、付费墙或内部 SSO 后面的页面,只会返回匿名访客能看到的内容,往往只是注册提示。如果受限页面很重要,请复制文字并改为粘贴文本。
一集只围绕一个主题。 五个共同回答同一问题的来源会生成聚焦的节目。五份毫无关联的文档则会让节目游移不定,因为主持人必须同时照顾所有主题。
很长或信息密集的文档
以字节计算,文件大小限制很宽松,但与 10 分钟节目相比,一本 300 页的书仍然非常长。内容必须被压缩,而默认情况下,这个取舍由模型决定。
有两种方式可以保留控制权:
缩小输入范围。 提取你真正关心的三个章节,只上传这些内容,不要上传整本书。规模更小但选择更准确的来源,通常始终优于完整来源。
说明你的切入角度。 创作框中的文本框不只是用来输入主题。写明你希望从材料中得到什么,例如“focus on the methodology, skip the literature review”,并同时上传文件。来源决定讨论范围,你的指令决定强调重点。
长度也取决于模式选项。Quick Insight 的目标是 3 到 5 分钟,Deep Dive 是 6 到 10 分钟。对于内容丰富的文档,Deep Dive 更合适,但两者都应视作目标而非硬性上限:信息密集的材料可能会更长。
点击 Create 之后会发生什么
ListenHub 会分析来源、提取要点,然后撰写并录制对话。这是真正的内容转换,而不是朗读。主持人会讨论你的文档、引用其中内容、表达不同意见,并把它与其他来源联系起来,而不是逐行照读。
如果你真正需要的是逐字保留原文——例如合同、脚本,或任何精确措辞很重要的内容——请改用 text to speech。我们的从书面文本到口语化 TTS文章介绍了该引擎如何处理书面文字。
完成后的节目会列出所使用的来源,因此你可以检查某项具体说法来自哪里。生成通常需要一到五分钟。你不必一直盯着页面;关闭标签页后,节目完成时仍会出现在你的内容库中。
费用
系统按照生成的节目收费,而不是按来源数量收费。上传五个文件与上传一个文件的费用相同。真正决定价格的是成品播客的长度和模式。
作为参考,一段五分钟播客大约使用 24 个 credits,模式选择器会在确认之前显示每个选项的费用。所有账户开始时都有一定额度,付费方案还会每月增加额度;定价页列出当前数字,credits 指南则说明月度、永久和限时 credits 的使用顺序。
下一步
- 第一次使用?先阅读创建你的第一期 AI 播客。
- 想让自己的声音主持节目:先使用声音克隆,再到 /voices 浏览预置声音库。
- 想制作供人观看而不是只听的内容:使用解说视频。
最适合第一次尝试的方法:找出下载文件夹里那份一直没读的文档,再加入当初让你保存它的那一个链接,然后点击 Create。听十分钟,你就会知道剩下的 40 页是否值得花掉整个下午。


