内容提取
从任意 URL 提取结构化内容 — 支持文章、视频、推文、PDF 等,可选摘要和长度限制。
从任意 URL 提取结构化内容。支持文章、YouTube 视频、推文、微信公众号文章、PDF 等。可单独使用,也可作为其他 Skill 的预处理步骤。
触发方式
输入 /content-parser 命令,或使用以下任意短语触发:
| 短语 | 语言 |
|---|---|
parse this URL / parse this | 英文 |
extract content / extract from | 英文 |
解析链接 | 中文 |
提取内容 | 中文 |
使用前请先安装 ListenHub Skills — 参见快速开始。
快速示例
解析这篇文章:https://zh.wikipedia.org/wiki/拓扑学AI 提取内容后返回预览,并提供保存或在其他 Skill 中使用的选项。
支持的来源
| 平台 | URL 格式 | 内容类型 |
|---|---|---|
| YouTube | youtube.com/watch?v=、youtu.be/ | 视频字幕 |
| Bilibili | bilibili.com/video/ | 视频字幕 |
| Twitter/X | twitter.com/、x.com/ | 推文(个人主页或单条) |
| 微信 | mp.weixin.qq.com/s/ | 公众号文章 |
直链 .pdf URL | 文档文字 | |
| DOCX | 直链 .docx URL | 文档文字 |
| 图片 | 直链图片 URL | OCR / 描述 |
| 任意网页 | 任意 HTTP(S) URL | 文章正文 |
提取选项
所有选项都是可选的。不设置时,内容提取会按默认上限提取完整正文。AI 会在提取前询问你是否要配置选项,你也可以直接在请求里说明("帮我总结一下"、"取最近 50 条推文")。
| 参数 | 说明 | 默认值 |
|---|---|---|
summarize | 返回生成的摘要,替代完整正文 | false |
maxLength | 最大内容长度(字符数) | 100,000(最大 500,000) |
twitter.count | 获取推文数量 — 仅 Twitter/X 个人主页 | 20(最大 100) |
summarize(摘要) — 当你只想要要点而不是全文时启用。适合长文章或长视频,尤其是要把结果喂给其他 Skill 的场景。启用后,响应里用摘要替代完整的 content。
maxLength(最大长度) — 限制返回和计费的文字量。页面很长时可以调小;默认 100,000 字符已覆盖大多数文章,最高可调到 500,000。
平台处理 — 提取会根据来源自动适配:
- YouTube / Bilibili — 抓取视频字幕,而非页面框架。
- Twitter/X — 单条推文 URL 返回该条推文;个人主页 URL 返回最近的推文,数量由
twitter.count控制(默认 20,最多 100)。 - PDF / DOCX — 从文件直链中提取文档文字。
- 图片 — 对图片直链返回 OCR 文字或图片描述。
常见用法
单独提取
提取这个 YouTube 视频的内容:https://youtube.com/watch?v=...总结长文章
解析这份报告,只给我一个摘要:https://example.com/2026-outlook抓取个人主页推文
提取 https://x.com/elonmusk 最近的 50 条推文提取 + 生成
在一次对话中与其他 Skill 组合使用:
解析这篇文章并做成播客:https://example.com/article提取这个 YouTube 视频的内容,然后做成解说视频更多工作流示例请查看 组合使用 指南。
输出
提取完成后,AI 收到以下结构化数据:
- content — 完整提取的文本内容,受
maxLength限制(默认 100,000 字符) - metadata — 标题、作者、发布时间等页面元数据
- references — 内容中发现的引用 URL
- summary — 启用
summarize时,用摘要替代content返回
默认情况下,AI 还会把两个文件保存到当前工作目录,文件名取自提取到的标题:
{slug}.md— Markdown 格式的提取内容,可直接阅读或编辑{slug}.json— 完整的原始 API 响应,包含 metadata、references 和积分消耗
随后 AI 会展示内容开头部分的预览,并提供把内容传给其他 Skill 的选项,比如 /podcast 或 /tts。
限制
- 付费墙内容可能无法访问
- JavaScript 渲染的内容可能只能部分提取
- 过长的内容可能在
maxLength处被截断 - 部分平台可能会阻止自动化访问
积分消耗
内容提取按实际提取内容长度计费:
| 规则 | 说明 |
|---|---|
| 预扣积分 | 提取开始时预扣 5 积分 |
| 计费标准 | 每 100,000 字符消耗 100 积分;若实扣不足 5 积分,按实扣计算 |
| 默认长度上限 | 100,000 字符(100 积分) |
| 最大长度上限 | 500,000 字符(500 积分) |
| 失败退还 | 提取失败时全额退还预扣积分 |
API 参考
技术细节请查看 内容提取 API 参考。