ListenHubOpenAPI

핵심 개념

ListenHub OpenAPI의 Episode, Speaker, 생성 모드, 데이터 흐름.

기본 개념

  • Episode(에피소드) — ListenHub의 기본 콘텐츠 단위입니다. 각 에피소드는 고유한 episodeId를 가지며 오디오, 스크립트, 메타데이터를 포함합니다.
  • Speaker(스피커) — 생성에 사용할 보이스의 특성을 정의합니다. speakerId로 식별되며 언어와 성별 같은 속성을 가집니다. 사용할 수 있는 보이스를 둘러보려면 GET /v1/speakers/list를 호출하거나 스피커 API 레퍼런스를 참고하세요.

생성 모드

모드서브모드설명생성 시간API 엔드포인트
Podcastquick효율을 우선한 빠른 생성. 뉴스 브리핑처럼 시의성이 중요한 콘텐츠에 적합1-2분/v1/podcast/episodes
debate2인 호스트 토론 형식. 의견 논의와 다각도 분석에 적합2-4분
deep콘텐츠 품질이 높은 심층 분석. 전문 지식 공유와 깊이 있는 해설에 적합2-4분
Text to SpeechsmartAI가 콘텐츠를 다듬은 뒤 합성. 어색한 문장과 오타 수정에 적합1-2분/v1/flow-speech/episodes
direct텍스트를 그대로 음성으로 변환. 완성된 대본과 안내 방송에 적합1-2분
Content Extract비동기 URL 콘텐츠 추출. 기사 파싱, 리서치, 콘텐츠 분석에 적합10-30초/v1/content/extract

Podcast 모드는 1-2명의 스피커(1인 또는 2인 호스트)를 지원합니다. debate 모드는 정확히 2명의 스피커가 필요합니다.

출력 종류

생성된 각 에피소드는 스크립트 텍스트와 오디오 파일이라는 두 가지 데이터를 제공합니다.

스크립트 스트림(Server-Sent Events)

오디오가 생성되는 동안, 오디오가 끝나기를 기다리지 않고 SSE로 아웃라인과 스크립트 데이터를 가져올 수 있습니다:

  • Podcast: 생성 후 20-60초 뒤부터 사용 가능
  • Text to Speech: 생성 후 약 3초 뒤부터 사용 가능

오디오 파일

생성이 완료되면 응답에 다음 필드가 포함됩니다:

필드형식설명
audioStreamUrlM3U8스트리밍 재생용. 실시간 용도에 적합
audioUrlMP3전체 파일 다운로드용. 오프라인 용도에 적합

Playground

ListenHub는 코드를 작성하지 않고도 다중 스피커 음성 합성을 테스트할 수 있는 온라인 Playground를 제공합니다.

URL: Multi-speaker TTS Playground

  • 다중 역할 대화 — 한 번의 요청으로 여러 보이스가 담긴 오디오 생성
  • 유연한 배정 — 스크립트의 각 줄마다 다른 스피커 지정
  • 즉시 미리듣기 — 온라인에서 스크립트를 편집하고 바로 결과 확인

오디오북/라디오 드라마 제작, 대화형 콘텐츠 생성, 빠른 제품 데모 제작에 적합합니다.

다음 단계

이 페이지의 내용