ListenHubSkills

ListenHub Voice

ListenHub-Voice-1.0 でエンドツーエンドに音声を生成 — 1 つのテキストスクリプトから、ナレーション、効果音、複数ボイスの対話、音声クローン、画像から音声まで。

エンドツーエンドの ListenHub-Voice-1.0 モデルで、テキストスクリプトを完成した音声トラックに変換します。TTS を継ぎ接ぎする方式とは異なり、モデルは 1 本の連続した音声を生成し、その中に効果音、複数の話者、クローンしたボイス、参考画像から導かれたナレーションを含められます。

ListenHub Voice は現在期間限定で無料です。無料期間の終了後は課金が再開されます。詳細は追ってのお知らせをご確認ください。

トリガー

/listenhub-voice でこの Skill を呼び出すか、次のいずれかのフレーズを使用します:

フレーズ言語
generate audio / sound effect英語
end-to-end audio / image to audio英語
生成音频 / 语音生成中国語
端到端音频 / 图片转音频中国語
多音色对白 / 参考音频克隆 / 音效生成中国語

ListenHub Skills のインストールが必要です — はじめに を参照してください。

簡単な例

Generate a 20-second clip: "Welcome to ListenHub — here is your daily briefing."

AI がスクリプト、ボイス、調整値を集めたうえで非同期タスクを 1 つ送信し、音声が完成するまでポーリングします。再生とダウンロードのためのリンクが得られます。

使いどころ

プレーンテキスト / 効果音

スクリプトを読み上げ、その中で描写された効果音もモデルにまとめて合成させます — ボイスの選択は不要です。

単一ボイス

内蔵ボイス 1 つ、またはプラットフォームの voice_type でスクリプトを読み上げます。

複数ボイスの対話

2–3 個のボイスを会話に割り当て、1 行ずつ指定します。

音声クローン

短い参考音声からボイスをクローンし、その声でスクリプトを読み上げます。

画像から音声

参考画像を短いナレーション音声に変換します。

すでに登録済みの ListenHub 話者で単純な単一ボイスのナレーションを行うだけなら、/tts の方が低レイテンシです。効果音、対話、クローン、画像起点の音声を 1 回で仕上げたいときは /listenhub-voice を使ってください。

モード

ボイスも画像も指定しません — モデルがスクリプトと、その中で描写された効果音を合成します。

Generate audio: "Rain patters on the window as a distant train rolls by."

1 つのボイスがスクリプト全体を読み上げます — 内蔵の ListenHub ボイス、またはプラットフォームの voice_type です。

Read this in a warm female voice: "Here are today's headlines."

2 つまたは 3 つのボイスによる会話です。各行は @音频N の接頭辞で、順番にボイスへ割り当てられます。

Make a two-voice dialogue: @音频1 asks a question, @音频2 answers.

複数ボイスのリクエストでは、すべてのボイスが参考音声に対応している必要があります。内蔵の voice_type は単一ボイスのみに対応します。

公開されている短い参考音声からボイスをクローンし、その声でスクリプトを読み上げます。

Clone the voice in https://example.com/host.mp3 and read my intro.

参考画像を短いナレーション音声に変換します。画像モードはボイスと排他です。

Describe this image as a 15-second narrated clip.

パラメータ

パラメータ選択肢デフォルト
テキスト最大 1400 文字必須
ボイス内蔵ボイスまたは参考音声を 1–3 個なし(プレーンテキスト)
画像参考画像 1 枚(ボイスと排他)なし
話速-50100モデルのデフォルト
音量-50100モデルのデフォルト
ピッチ-1212モデルのデフォルト
フォーマットmp3wavpcmogg_opusmp3
長さのヒント1110なし
ウォーターマークオン / オフオフ

ボイスと画像は排他です — 送れるのはどちらか一方までです。内蔵ボイスは API から取得されます。「どんなボイスが使える?」と尋ねると、デモ音声付きの一覧を確認できます。

出力

タスクが success に到達すると、次が得られます:

  • 再生リンク — 完成した音声をストリーミング再生します
  • 音声のダウンロード — 「download audio」と伝えるとローカルに保存します(拡張子は選択した format に従います)
  • タスク詳細 — ステータス、課金対象の長さ、消費クレジット

生成は非同期です:タスクは pendinggeneratinguploadingsuccess と遷移します。失敗した場合は理由が報告され、確保されていたクレジットは返還されます。

API リファレンス

内部で使われるエンドポイント、リクエストフィールド、エラーコードについては ListenHub Voice API リファレンス を参照してください。

このページの内容