ListenHubSkills

ListenHub Voice

ListenHub-Voice-1.0으로 오디오를 엔드투엔드 생성합니다 — 하나의 텍스트 스크립트에서 내레이션, 효과음, 다중 보이스 대화, 음성 클로닝, 이미지에서 오디오까지.

엔드투엔드 ListenHub-Voice-1.0 모델로 텍스트 스크립트를 완성된 오디오 트랙으로 바꿉니다. 조각난 TTS를 이어 붙이는 방식과 달리, 모델은 한 번에 이어지는 오디오를 만들어 내며 그 안에 효과음, 여러 화자, 클로닝된 보이스, 참조 이미지에서 끌어낸 내레이션을 담을 수 있습니다.

ListenHub Voice는 현재 기간 한정 무료입니다. 무료 기간이 끝나면 과금이 재개되며, 자세한 내용은 추후 공지를 따릅니다.

트리거

/listenhub-voice로 이 skill을 호출하거나, 다음 문구 중 아무거나 사용하세요:

문구언어
generate audio / sound effect영어
end-to-end audio / image to audio영어
生成音频 / 语音生成중국어
端到端音频 / 图片转音频중국어
多音色对白 / 参考音频克隆 / 音效生成중국어

ListenHub Skills가 설치되어 있어야 합니다 — 시작하기를 참고하세요.

빠른 예시

Generate a 20-second clip: "Welcome to ListenHub — here is your daily briefing."

AI가 스크립트, 보이스, 조정값을 모은 뒤 비동기 작업 하나를 제출하고 오디오가 완성될 때까지 폴링합니다. 듣기와 다운로드 링크를 받게 됩니다.

언제 쓰나요

일반 텍스트 / 효과음

스크립트를 읽어 주면서, 그 안에 묘사된 효과음까지 모델이 함께 합성합니다 — 보이스를 고를 필요가 없습니다.

단일 보이스

내장 보이스 하나 또는 플랫폼 voice_type으로 스크립트를 읽습니다.

다중 보이스 대화

대화에 2–3개의 보이스를 한 줄씩 배정합니다.

음성 클로닝

짧은 참조 오디오에서 보이스를 클로닝해 그 목소리로 스크립트를 읽습니다.

이미지에서 오디오

참조 이미지를 짧은 내레이션 클립으로 바꿉니다.

이미 등록된 ListenHub 화자로 단순한 단일 보이스 내레이션만 하려면 /tts가 지연이 더 짧습니다. 효과음, 대화, 클로닝, 이미지 기반 오디오를 한 번에 처리하고 싶을 때 /listenhub-voice를 쓰세요.

모드

보이스도 이미지도 지정하지 않습니다 — 모델이 스크립트와 그 안에 묘사된 효과음을 함께 합성합니다.

Generate audio: "Rain patters on the window as a distant train rolls by."

보이스 하나가 스크립트 전체를 읽습니다 — 내장 ListenHub 보이스 또는 플랫폼 voice_type입니다.

Read this in a warm female voice: "Here are today's headlines."

두세 개의 보이스가 대화합니다. 각 줄은 @音频N 접두사로 순서대로 보이스에 배정됩니다.

Make a two-voice dialogue: @音频1 asks a question, @音频2 answers.

다중 보이스 요청에서는 모든 보이스가 참조 오디오를 지원해야 합니다. 내장 voice_type은 단일 보이스만 지원합니다.

공개된 짧은 참조 클립에서 보이스를 클로닝한 뒤, 그 목소리로 스크립트를 읽습니다.

Clone the voice in https://example.com/host.mp3 and read my intro.

참조 이미지를 짧은 내레이션 클립으로 바꿉니다. 이미지 모드는 보이스와 함께 쓸 수 없습니다.

Describe this image as a 15-second narrated clip.

파라미터

파라미터선택지기본값
텍스트최대 1400자필수
보이스내장 보이스 또는 참조 클립 1–3개없음(일반 텍스트)
이미지참조 이미지 1장(보이스와 배타)없음
말하기 속도-50 ~ 100모델 기본값
음량-50 ~ 100모델 기본값
음높이-12 ~ 12모델 기본값
포맷mp3, wav, pcm, ogg_opusmp3
길이 힌트1 ~ 110없음
워터마크켬 / 끔

보이스와 이미지는 함께 쓸 수 없습니다 — 둘 중 하나만 보내세요. 내장 보이스는 API에서 가져옵니다. "어떤 보이스를 쓸 수 있어?"라고 물으면 데모 오디오와 함께 목록을 훑어볼 수 있습니다.

출력

작업이 success에 도달하면 다음을 받습니다:

  • 듣기 링크 — 완성된 오디오를 스트리밍합니다
  • 오디오 다운로드 — "download audio"라고 하면 로컬에 저장합니다(파일 확장자는 선택한 format을 따릅니다)
  • 작업 상세 — 상태, 과금 대상 길이, 차감된 크레딧

생성은 비동기로 진행됩니다: 작업은 pendinggeneratinguploadingsuccess 순으로 넘어갑니다. 실패하면 원인이 보고되고, 예약해 둔 크레딧은 환불됩니다.

API 레퍼런스

내부에서 쓰이는 엔드포인트, 요청 필드, 에러 코드는 ListenHub Voice API 레퍼런스를 참고하세요.

이 페이지의 내용