ListenHub 接入的全部生成模型。选中进对应工具开始,或拿模型 ID 走 API。
文生 / 图生 / 首尾帧,支持参考视频驱动运镜与节奏;多主体一致性目前最稳的一档,1080p 成片首选。
全部出声工具共用的语音合成引擎。标准音色走自有引擎,Pro 音色接 ElevenLabs,音色是它下面的一层。
画质与文字渲染都稳,多图参考一致性好;日常出图的默认选择。
同系列的快档,出图快、比例支持面最宽,含 1:4 / 8:1 这类极端画幅。
指令跟随强,改图和局部替换听得懂话;参考图最多 4 张。
官方通道,多一档质量选项;高质量与 4K 需要订阅。
中文场景与版式理解好,参考图最多 9 张。
同系列标准档,1K / 2K 出图,成本更低。
精确编辑见长,参考图最多 10 张;比例走像素反算,画幅几乎不受限。
同一模型的低延迟通道,草稿、批量出片和快速试镜头用它;不支持 1080p。
按首尾帧生成,不吃参考图;口型同步与动作模仿两个玩法跑在它上面。
Wan 3.0 的标准档。时长与分辨率上限和 Prime 相同,区别在端到端速度。
人物动作与镜头运动稳定,带原生音频输出;不接受视频输入。
镜头语言丰富,适合叙事片段与运镜明显的画面。
语音演绎模型,按秒计费;工具页叫「AI 声音」。
用一段录音克隆你自己的声音,结果作为「我的音色」出现在 FlowSpeech 里。
给定歌词唱出成品,配套换词重唱、续写和音轨分离;歌已经在了、还要再加工时用它。
一句风格描述就能出整首,歌词可给可不给;加一个开关就是纯音乐。