ListenHub Voice
ListenHub-Voice-1.0 でエンドツーエンドに音声を生成 — 1 つのテキストスクリプトから、ナレーション、効果音、複数ボイスの対話、音声クローン、画像から音声まで。
エンドツーエンドの ListenHub-Voice-1.0 モデルで、テキストスクリプトを完成した音声トラックに変換します。TTS を継ぎ接ぎする方式とは異なり、モデルは 1 本の連続した音声を生成し、その中に効果音、複数の話者、クローンしたボイス、参考画像から導かれたナレーションを含められます。
ListenHub Voice は現在期間限定で無料です。無料期間の終了後は課金が再開されます。詳細は追ってのお知らせをご確認ください。
トリガー
/listenhub-voice でこの Skill を呼び出すか、次のいずれかのフレーズを使用します:
| フレーズ | 言語 |
|---|---|
generate audio / sound effect | 英語 |
end-to-end audio / image to audio | 英語 |
生成音频 / 语音生成 | 中国語 |
端到端音频 / 图片转音频 | 中国語 |
多音色对白 / 参考音频克隆 / 音效生成 | 中国語 |
ListenHub Skills のインストールが必要です — はじめに を参照してください。
簡単な例
Generate a 20-second clip: "Welcome to ListenHub — here is your daily briefing."AI がスクリプト、ボイス、調整値を集めたうえで非同期タスクを 1 つ送信し、音声が完成するまでポーリングします。再生とダウンロードのためのリンクが得られます。
使いどころ
プレーンテキスト / 効果音
スクリプトを読み上げ、その中で描写された効果音もモデルにまとめて合成させます — ボイスの選択は不要です。
単一ボイス
内蔵ボイス 1 つ、またはプラットフォームの voice_type でスクリプトを読み上げます。
複数ボイスの対話
2–3 個のボイスを会話に割り当て、1 行ずつ指定します。
音声クローン
短い参考音声からボイスをクローンし、その声でスクリプトを読み上げます。
画像から音声
参考画像を短いナレーション音声に変換します。
すでに登録済みの ListenHub 話者で単純な単一ボイスのナレーションを行うだけなら、/tts の方が低レイテンシです。効果音、対話、クローン、画像起点の音声を 1 回で仕上げたいときは /listenhub-voice を使ってください。
モード
ボイスも画像も指定しません — モデルがスクリプトと、その中で描写された効果音を合成します。
Generate audio: "Rain patters on the window as a distant train rolls by."1 つのボイスがスクリプト全体を読み上げます — 内蔵の ListenHub ボイス、またはプラットフォームの voice_type です。
Read this in a warm female voice: "Here are today's headlines."2 つまたは 3 つのボイスによる会話です。各行は @音频N の接頭辞で、順番にボイスへ割り当てられます。
Make a two-voice dialogue: @音频1 asks a question, @音频2 answers.複数ボイスのリクエストでは、すべてのボイスが参考音声に対応している必要があります。内蔵の voice_type は単一ボイスのみに対応します。
公開されている短い参考音声からボイスをクローンし、その声でスクリプトを読み上げます。
Clone the voice in https://example.com/host.mp3 and read my intro.参考画像を短いナレーション音声に変換します。画像モードはボイスと排他です。
Describe this image as a 15-second narrated clip.パラメータ
| パラメータ | 選択肢 | デフォルト |
|---|---|---|
| テキスト | 最大 1400 文字 | 必須 |
| ボイス | 内蔵ボイスまたは参考音声を 1–3 個 | なし(プレーンテキスト) |
| 画像 | 参考画像 1 枚(ボイスと排他) | なし |
| 話速 | -50 〜 100 | モデルのデフォルト |
| 音量 | -50 〜 100 | モデルのデフォルト |
| ピッチ | -12 〜 12 | モデルのデフォルト |
| フォーマット | mp3、wav、pcm、ogg_opus | mp3 |
| 長さのヒント | 1 〜 110 秒 | なし |
| ウォーターマーク | オン / オフ | オフ |
ボイスと画像は排他です — 送れるのはどちらか一方までです。内蔵ボイスは API から取得されます。「どんなボイスが使える?」と尋ねると、デモ音声付きの一覧を確認できます。
出力
タスクが success に到達すると、次が得られます:
- 再生リンク — 完成した音声をストリーミング再生します
- 音声のダウンロード — 「download audio」と伝えるとローカルに保存します(拡張子は選択した
formatに従います) - タスク詳細 — ステータス、課金対象の長さ、消費クレジット
生成は非同期です:タスクは pending → generating → uploading → success と遷移します。失敗した場合は理由が報告され、確保されていたクレジットは返還されます。
API リファレンス
内部で使われるエンドポイント、リクエストフィールド、エラーコードについては ListenHub Voice API リファレンス を参照してください。