ListenHubDocs

ListenHub Hypit

端到端复刻一段参考视频 — ListenHub 生成所有素材,hypit 负责组装成片、对齐字幕并在本地渲染,产出一个你可以继续编辑的工程。

ListenHub 的大多数技能只产出一件成品:一期单集、一首曲子、一张图片。listenhub-hypit 产出的是一个 视频工程。它接收一段参考片、一份需求说明,或你自己的素材,推断成片需要什么,通过 ListenHub 生成 所有缺失素材,再把它们组装成一个 hypit 工程 — 在你的机器上渲染出 MP4,而且改掉一句台词之后还能重新 渲染。

动手之前,值得先弄清这里的分工:

  • ListenHub 负责生成与转录。图片、视频镜头、语音、克隆音色、音乐和逐词转录文本都来自 ListenHub 的公开 API,按积分计费。
  • hypit 是一个外部的、安装在本机的 CLI。它分析素材、持有 Script(hypit 对工程里每一句台词、每 个片段和每个时间点的结构化记录)、计算字幕对齐、合成并渲染。它跑在你自己的机器上,运行本身不产生费 用。
  • 内置的 Provider 是两者之间的桥梁:它提供两项 hypit 能力 — 逐词对齐和背景移除 — 底层走 ListenHub,而不是第三方云服务。

无需 HypiHub 账号。工程、渲染和抠像都留在你的机器上;离开本机的只有报价里列出的那些 ListenHub API 调用。

触发方式

/listenhub-hypit 调用本技能,或使用以下任意短语:

短语语言
hypit video / remake this video / reproduce this clip英文
talking pet / character dialogue / keep the original audio英文
用 ListenHub 做 hypit 视频 / 参考片复刻中文
角色对话 / 宠物说话 / 沿用原声中文

使用前请先安装 ListenHub Skills — 参见快速开始

快速示例

Remake this clip with my product in it, keep the original BGM, swap the voiceover to English:
https://example.com/reference.mp4

AI 会探测这段片子、规划成片结构,然后给出一份逐项列明的报价。在你确认之前不会有任何扣费。

它串联了哪些技能

本技能不重新实现生成能力。每项工作都路由给已经负责它的那个 ListenHub 技能,并显式传入模型和参数,而 不是沿用那个技能的默认值。

工作交给谁
角色、人像、产品和机位静图/image-gen,结果落到 assets/
视频镜头/video-gen,限定为 Seedance Pro / Fast 或 MiniMax H3
用内置音色做旁白/tts,Script 每段一次调用
要跨工程复用的音色先跑一次 /voice-clone,再用保存下来的 speakerInnerId/tts
一次性参考音频克隆、多音色、音效/listenhub-voice
原创音乐、分轨、歌词时间轴/music
逐词转录文本与字幕对齐证据内置 Provider → ListenHub 转录
静图抠图内置 Provider → Seedream 5.0 Pro 绿幕重绘,再在本地抠像
复用参考片自带的音频或 BGM本地用 hypit / ffmpeg — 不消耗积分

前置依赖

依赖项说明
Node.js 与 npmNode >= 22.15
listenhub CLI生成类技能通过它调用
ffmpegffprobe用于探测、剪切和提取音频
uv托管运行时需要
一个 ListenHub API Key本机已有 OpenAPI 配置时直接复用

这些都由 AI 自己安装和运行 — 不需要你手敲这些命令。

npx skills add hypit-ai/hypit -g
npm init -y
npm install @hypit/hypit@0.2.1
npm install --install-links <path-to-installed-skill>/listenhub-hypit/provider
npx hypit runtime init

<path-to-installed-skill> 就是你的 AI 安装 ListenHub Skills 的位置 — AI 会自己解析它,下面提到的 templates/ 文件也在同一个目录里。

请在专门的视频工程目录下工作,并且每条 hypit 命令都通过 npx hypit 执行,这样用到的是工程里锁定的版 本,而不是 PATH 上碰巧存在的那个。

hypit runtime init 写入的 profile 指向 HypiHub。在全新的工程里,请用本技能的 templates/hypit.runtime.json 替换它,并在开工之前运行 npx hypit runtime use ./hypit.runtime.json。在已有的工程里,请把模板合并进去而不是整份覆盖 — profile 里可能还有你需要的本地配置。

API Key 通过 hypit 的凭据存储保存,绝不写进 profile 或命令行:

npx hypit auth login listenhub.local --slot apiKey --from /private/temporary/key-file
npx hypit auth status listenhub.local --json

之后请删掉临时文件。在没有桌面密钥环的 Linux 上,hypit 会退回到一个用户私有文件;macOS 和 Windows 使 用系统凭据存储。

渲染需要一套托管运行时(Chrome、OpenCV),新机器上没有:

npx hypit runtime up --runtime ./hypit.runtime.json
npx hypit doctor --runtime ./hypit.runtime.json --json

这些本地安装不消耗积分。MANAGED_PROGRAM_DOWN 报错属于运行时问题,不是生成失败 — 请先修好它,再提交 任何计费调用。

一次制作的流程

敲定成片要求

起点素材、成片条数、时长、画面比例、语言、角色和音色。AI 只会问那些仍然缺失、且会改变结果的信息。

读懂参考片

npx hypit media probetileframes 会呈现镜头结构、节奏、动作和构图,你则去听原声。逐词台词 和时间点来自转录 — 这是一个付费步骤,和其他步骤一样计入报价。如果你要沿用原声且不需要字幕,就跳过它。

先报价再花钱

在扣任何费用之前,每一次计划中的调用都会连同它的价格来源一并列出、汇总,并与你的余额核对。参见 费用

生成缺失素材

静图、镜头、语音和音乐由上表中的技能产出,下载到工程的 assets/,每一项都记录任务 ID、提示词、模型 和积分消耗。

合成与渲染

素材以 asset:Image / asset:Video / asset:Audio 节点进入工程,或作为 .svrun 里的 <file> 候 选项。然后:

npx hypit check narration.svrun --json
npx hypit plan narration.svrun --runtime ./hypit.runtime.json --json
npx hypit build narration.svrun --runtime ./hypit.runtime.json --follow

checkplan 的输出里只应出现本地端点和 listenhub.local

验收成片

播放输出并抽帧检查:画面、字幕同步、音频、抠像边缘、转场。交付物是本地真实的 MP4,外加工程路径、报 价,以及与实际消耗积分之间的差额。

技能自带四个起步模板 — narrationdialogueactioncutout,外加一份共用的 styles.svs。 它们是供你修改的示例,不是固定格式:题材和角色类型都不受限制,同一条时间线里也可以把有台词的段落和纯 动作段落混在一起。

复用参考片的原声

沿用你已经有的声音,是整个流程里最省钱的做法,技能默认这么做,而不是重新生成。

你想要什么怎么做费用
原画面配原声Normalize 保留视频的音轨;把它混进成片免费 — 本地完成
新画面,原声不变用 ffmpeg 或 hypit media:ExtractAudio 提取音轨,再对齐到新画面免费 — 本地完成
只要 BGM,或只要人声源素材本身带分离音轨时直接拆出来;否则走 /music stem计费,单独报价
用原声驱动一段新的表演裁出这段音频,作为参考音频传给 Seedance 或 MiniMax H3按视频生成计费
用相近的音色说新台词通过 /listenhub-voice 做一次性参考克隆,或用 /voice-clone 以便复用计费,单独报价
新配乐/music — 或者干脆不要音乐计费,单独报价

提取音轨会保留其中的一切,台词也在内 — 它不是人声消除。当你用提取出的原声给新画面配乐时,请把生成 视频的 Normalize audio 设为 none,这样旧台词才不会串音或重叠。

对于不是你创作的音频,持有相应权利是你的责任。技能会就此让你确认一次;它不会核实你的回答,也不会代你 处理版权授权。

费用

在你看到报价之前,不会执行任何计费动作。技能会列出每一项计划中的开销 — 静图、每段镜头(含模型与时 长)、TTS 字符计费单位、音乐曲目、转录毫秒数、抠图、音色克隆保存 — 并给出每项价格的来源、总额和你的 余额。

只要存在线上预估接口,价格就取自该接口:

项目预估接口参考文档
视频POST /v1/video-generation/estimate-creditsAI 视频
图片与抠图POST /v1/images/generation/estimate-credits图片生成
余额GET /v1/user/subscription订阅与余额
ListenHub VoicePOST /v1/listenhub-voice/estimate-credits暂无文档
转录POST /v1/audio-transcriptions/estimate-credits暂无文档

视频预估返回的是美元而不是积分,技能会按服务当前的汇率换算,并在报价里同时保留这两个数字。转录按音频 每开始一分钟 1 积分计,在任务结算之前是预留而非扣除。账户还有 Seedream 免费图片额度时,抠图从这个额 度里扣,但预估接口始终返回完整的积分费用 — 所以报价给的是最坏情况,对账才显示实际花掉了多少。

没有预估接口的项目按一份标注了日期的价目表报价,并会注明其来源。已有素材、本地提取、剪切和混音都按零 列出。改一句台词或加一个变体,只会对新增的工作重新报价;只有在账户、范围或预算发生变化时,才需要重新 完整确认一次。

npx hypit pricing 只对 Provider 的转录和抠图调用计价。它不能替代完整报价,Provider 给出的 60 秒费 率样例(usageKnown: false)是单价,不是你这条片子的费用。

每次调用前后都会记录余额,每个任务的 ID、模型和计费产出都会与报价对账。失败退款和尚未结算的预留会单独 列出。

内置 Provider

Provider 只增加两项 hypit 能力,其余一切仍来自各个生成类技能。

能力作用
@hypit/whisperx@1#whisperx-alignment从 16 kHz 单声道 PCM 音频得到逐词转录文本和时间点,作为对齐证据返回
@hypit/background-removal@1#remove-background通过 Seedream 5.0 Pro 把静图在纯绿背景上重绘一遍,再在本地抠像输出带 alpha 通道的 PNG

转录覆盖 zh en ja ko vi th id ms fil hi ar fr de es pt ru it nl sv da fi no el pl cs hu ro bg hr sk。 其他语言的请求会在计划阶段被拒绝,而不是被悄悄转到别处。

你声明的语言用于选择能力;ListenHub 自己检测口语语言,API 不接受语言参数,因此检测到的语言可能与 你指定的不一致。请把返回的文本与实际台词对照检查。

转录按内容幂等:键由 WAV 字节的 SHA-256、语言和 Provider 契约版本组成,因此同一份输入重跑会返回原来 的任务,不会再次预留积分 — 失败的任务也一样。花钱重新转录是带新键的显式动作,绝不会是自动重试。

限制

以下是本技能自己的边界,它不会把话说过头:

  • 不保证还原参考片。 生成的镜头能在多大程度上复现参考片的运动、音色和口型,取决于模型、提示词和源 素材,渲染之前无法预测。请检查结果;任何参考视频都不承诺精确复刻。
  • 分轨是有损的。 从混音音轨里抽出人声或 BGM 会留下瑕疵。在此基础上继续做之前先听一遍结果;任意混 音都不可能干净分离。
  • 抠图是重绘,不是蒙版抠像。 绿幕重绘可能改画细节,而且输出用的是最接近的受支持画幅,而不是源素 材的精确尺寸 — 把尺寸写进工程之前,先读一下输出的真实尺寸。穿绿色的主体,或玻璃等半透明材质的主体, 不适合走这条路径。视频绿幕处理走 ffmpeg,不用这项能力。
  • 参考音频不是原样透传。 用原声驱动生成,得到的是一段新的表演;请检查返回结果的台词、节奏和音色。
  • TTS 台词必须与 Script 完全一致。 一旦朗读的文本与 Script 里的文本出现偏差,逐词对齐就会失败。

本技能及其 Provider 采用 MIT 许可。hypit 是遵循自身许可条款的外部依赖 (hypit-ai/hypit),该许可要求你保持 hypit CLI、Studio、运行报告 和 manifest 中的品牌标识与版权信息完好,也不要把 hypit 作为托管服务或付费产品再分发。

相关

本页内容