ListenHub Voice
ListenHub-Voice-1.0으로 오디오를 엔드투엔드 생성합니다 — 하나의 텍스트 스크립트에서 내레이션, 효과음, 다중 보이스 대화, 음성 클로닝, 이미지에서 오디오까지.
엔드투엔드 ListenHub-Voice-1.0 모델로 텍스트 스크립트를 완성된 오디오 트랙으로 바꿉니다. 조각난 TTS를 이어 붙이는 방식과 달리, 모델은 한 번에 이어지는 오디오를 만들어 내며 그 안에 효과음, 여러 화자, 클로닝된 보이스, 참조 이미지에서 끌어낸 내레이션을 담을 수 있습니다.
ListenHub Voice는 현재 기간 한정 무료입니다. 무료 기간이 끝나면 과금이 재개되며, 자세한 내용은 추후 공지를 따릅니다.
트리거
/listenhub-voice로 이 skill을 호출하거나, 다음 문구 중 아무거나 사용하세요:
| 문구 | 언어 |
|---|---|
generate audio / sound effect | 영어 |
end-to-end audio / image to audio | 영어 |
生成音频 / 语音生成 | 중국어 |
端到端音频 / 图片转音频 | 중국어 |
多音色对白 / 参考音频克隆 / 音效生成 | 중국어 |
ListenHub Skills가 설치되어 있어야 합니다 — 시작하기를 참고하세요.
빠른 예시
Generate a 20-second clip: "Welcome to ListenHub — here is your daily briefing."AI가 스크립트, 보이스, 조정값을 모은 뒤 비동기 작업 하나를 제출하고 오디오가 완성될 때까지 폴링합니다. 듣기와 다운로드 링크를 받게 됩니다.
언제 쓰나요
일반 텍스트 / 효과음
스크립트를 읽어 주면서, 그 안에 묘사된 효과음까지 모델이 함께 합성합니다 — 보이스를 고를 필요가 없습니다.
단일 보이스
내장 보이스 하나 또는 플랫폼 voice_type으로 스크립트를 읽습니다.
다중 보이스 대화
대화에 2–3개의 보이스를 한 줄씩 배정합니다.
음성 클로닝
짧은 참조 오디오에서 보이스를 클로닝해 그 목소리로 스크립트를 읽습니다.
이미지에서 오디오
참조 이미지를 짧은 내레이션 클립으로 바꿉니다.
이미 등록된 ListenHub 화자로 단순한 단일 보이스 내레이션만 하려면 /tts가 지연이 더 짧습니다. 효과음, 대화, 클로닝, 이미지 기반 오디오를 한 번에 처리하고 싶을 때 /listenhub-voice를 쓰세요.
모드
보이스도 이미지도 지정하지 않습니다 — 모델이 스크립트와 그 안에 묘사된 효과음을 함께 합성합니다.
Generate audio: "Rain patters on the window as a distant train rolls by."보이스 하나가 스크립트 전체를 읽습니다 — 내장 ListenHub 보이스 또는 플랫폼 voice_type입니다.
Read this in a warm female voice: "Here are today's headlines."두세 개의 보이스가 대화합니다. 각 줄은 @音频N 접두사로 순서대로 보이스에 배정됩니다.
Make a two-voice dialogue: @音频1 asks a question, @音频2 answers.다중 보이스 요청에서는 모든 보이스가 참조 오디오를 지원해야 합니다. 내장 voice_type은 단일 보이스만 지원합니다.
공개된 짧은 참조 클립에서 보이스를 클로닝한 뒤, 그 목소리로 스크립트를 읽습니다.
Clone the voice in https://example.com/host.mp3 and read my intro.참조 이미지를 짧은 내레이션 클립으로 바꿉니다. 이미지 모드는 보이스와 함께 쓸 수 없습니다.
Describe this image as a 15-second narrated clip.파라미터
| 파라미터 | 선택지 | 기본값 |
|---|---|---|
| 텍스트 | 최대 1400자 | 필수 |
| 보이스 | 내장 보이스 또는 참조 클립 1–3개 | 없음(일반 텍스트) |
| 이미지 | 참조 이미지 1장(보이스와 배타) | 없음 |
| 말하기 속도 | -50 ~ 100 | 모델 기본값 |
| 음량 | -50 ~ 100 | 모델 기본값 |
| 음높이 | -12 ~ 12 | 모델 기본값 |
| 포맷 | mp3, wav, pcm, ogg_opus | mp3 |
| 길이 힌트 | 1 ~ 110초 | 없음 |
| 워터마크 | 켬 / 끔 | 끔 |
보이스와 이미지는 함께 쓸 수 없습니다 — 둘 중 하나만 보내세요. 내장 보이스는 API에서 가져옵니다. "어떤 보이스를 쓸 수 있어?"라고 물으면 데모 오디오와 함께 목록을 훑어볼 수 있습니다.
출력
작업이 success에 도달하면 다음을 받습니다:
- 듣기 링크 — 완성된 오디오를 스트리밍합니다
- 오디오 다운로드 — "download audio"라고 하면 로컬에 저장합니다(파일 확장자는 선택한
format을 따릅니다) - 작업 상세 — 상태, 과금 대상 길이, 차감된 크레딧
생성은 비동기로 진행됩니다: 작업은 pending → generating → uploading → success 순으로 넘어갑니다. 실패하면 원인이 보고되고, 예약해 둔 크레딧은 환불됩니다.
API 레퍼런스
내부에서 쓰이는 엔드포인트, 요청 필드, 에러 코드는 ListenHub Voice API 레퍼런스를 참고하세요.