ListenHubSkills
고급 기능

다중 보이스 대본

JSON 대본으로 각 대사를 어떤 보이스가 읽을지 제어해 다중 캐릭터 대화와 극본 연출을 만듭니다.

기본 TTS는 텍스트 한 덩어리를 보이스 하나가 읽는 방식입니다. 다중 보이스 대본은 그 대신 대사 한 줄 단위로 누가 말할지 제어할 수 있게 해 줍니다 — 3인 토론, 소설 속 대화, 캐릭터마다 자기 보이스와 대사를 갖는 교육 시나리오 등.

요청 시작하기

다중 보이스 대본을 쓰고 싶다고 AI에게 말하세요. AI가 다중 캐릭터 대화를 구성하고 화자마다 서로 다른 보이스를 배정합니다. 이 예시에서는:

  • Su Zhe(차분한 남성 보이스) — 진행자, 오프닝과 핵심 주장 담당
  • Ruo Yun(부드러운 여성 보이스) — 질문자, 긴장 지점을 드러내고 풀어 나가는 역할
  • Yuan Ye(베이징 억양 남성 보이스) — 마무리, 철학적 정리 담당

세 가지 보이스로 다중 보이스 대본 요청 시작하기

대본 구조

생성된 대본은 평범한 JSON 파일입니다. 각 대사는 content(말하는 내용)와 speakerId(그 대사를 읽는 보이스)를 지정하며, 배열 순서대로 읽힙니다:

JSON 대본 구조: 각 대사가 내용과 보이스 ID를 지정한다

이 구조의 핵심은 완전히 결정적이라는 점입니다 — 두 사람이 번갈아 말하는 대화, 3인 라운드테이블, 내레이션이 섞인 독백은 모두 같은 배열을 다르게 배치한 것일 뿐입니다. 대본은 직접 작성해도 되고, 설명만 주고 AI가 생성하게 해도 됩니다.

완성된 대화

제출하고 약 30초가 지나면 3인 대화가 준비됩니다. AI는 청취 링크, 자막 파일, 보이스 구성, 대화 구조를 반환합니다:

다중 보이스 대본 완성: 31초 분량의 3인 대화

FlowTTS와 Script 비교

항목FlowTTS(1인 내레이션)Script(다중 보이스)
제어 단위전체 텍스트, 보이스 하나대사 단위, 여러 보이스
적합한 용도기사 낭독, 긴 텍스트대화, 극본, 오디오북
입력 형식일반 텍스트JSON(scripts 배열)
편성 자유도낮음높음

기반 API는 Text to Speech API 레퍼런스를 참고하세요.

이 페이지의 내용