핵심 개념
ListenHub OpenAPI의 Episode, Speaker, 생성 모드, 데이터 흐름.
기본 개념
- Episode(에피소드) — ListenHub의 기본 콘텐츠 단위입니다. 각 에피소드는 고유한
episodeId를 가지며 오디오, 스크립트, 메타데이터를 포함합니다. - Speaker(스피커) — 생성에 사용할 보이스의 특성을 정의합니다.
speakerId로 식별되며 언어와 성별 같은 속성을 가집니다. 사용할 수 있는 보이스를 둘러보려면GET /v1/speakers/list를 호출하거나 스피커 API 레퍼런스를 참고하세요.
생성 모드
| 모드 | 서브모드 | 설명 | 생성 시간 | API 엔드포인트 |
|---|---|---|---|---|
| Podcast | quick | 효율을 우선한 빠른 생성. 뉴스 브리핑처럼 시의성이 중요한 콘텐츠에 적합 | 1-2분 | /v1/podcast/episodes |
| debate | 2인 호스트 토론 형식. 의견 논의와 다각도 분석에 적합 | 2-4분 | ||
| deep | 콘텐츠 품질이 높은 심층 분석. 전문 지식 공유와 깊이 있는 해설에 적합 | 2-4분 | ||
| Text to Speech | smart | AI가 콘텐츠를 다듬은 뒤 합성. 어색한 문장과 오타 수정에 적합 | 1-2분 | /v1/flow-speech/episodes |
| direct | 텍스트를 그대로 음성으로 변환. 완성된 대본과 안내 방송에 적합 | 1-2분 | ||
| Content Extract | — | 비동기 URL 콘텐츠 추출. 기사 파싱, 리서치, 콘텐츠 분석에 적합 | 10-30초 | /v1/content/extract |
Podcast 모드는 1-2명의 스피커(1인 또는 2인 호스트)를 지원합니다. debate 모드는 정확히 2명의 스피커가 필요합니다.
출력 종류
생성된 각 에피소드는 스크립트 텍스트와 오디오 파일이라는 두 가지 데이터를 제공합니다.
스크립트 스트림(Server-Sent Events)
오디오가 생성되는 동안, 오디오가 끝나기를 기다리지 않고 SSE로 아웃라인과 스크립트 데이터를 가져올 수 있습니다:
- Podcast: 생성 후 20-60초 뒤부터 사용 가능
- Text to Speech: 생성 후 약 3초 뒤부터 사용 가능
오디오 파일
생성이 완료되면 응답에 다음 필드가 포함됩니다:
| 필드 | 형식 | 설명 |
|---|---|---|
audioStreamUrl | M3U8 | 스트리밍 재생용. 실시간 용도에 적합 |
audioUrl | MP3 | 전체 파일 다운로드용. 오프라인 용도에 적합 |
Playground
ListenHub는 코드를 작성하지 않고도 다중 스피커 음성 합성을 테스트할 수 있는 온라인 Playground를 제공합니다.
URL: Multi-speaker TTS Playground
- 다중 역할 대화 — 한 번의 요청으로 여러 보이스가 담긴 오디오 생성
- 유연한 배정 — 스크립트의 각 줄마다 다른 스피커 지정
- 즉시 미리듣기 — 온라인에서 스크립트를 편집하고 바로 결과 확인
오디오북/라디오 드라마 제작, 대화형 콘텐츠 생성, 빠른 제품 데모 제작에 적합합니다.
다음 단계
- 빠른 시작 — 5분 안에 첫 API 호출 완료
- 인증 — Base URL, API 키, 레이트 리밋
- 팟캐스트 생성 API — 전체 파라미터와 응답 레퍼런스