고급 기능
다중 보이스 대본
JSON 대본으로 각 대사를 어떤 보이스가 읽을지 제어해 다중 캐릭터 대화와 극본 연출을 만듭니다.
기본 TTS는 텍스트 한 덩어리를 보이스 하나가 읽는 방식입니다. 다중 보이스 대본은 그 대신 대사 한 줄 단위로 누가 말할지 제어할 수 있게 해 줍니다 — 3인 토론, 소설 속 대화, 캐릭터마다 자기 보이스와 대사를 갖는 교육 시나리오 등.
요청 시작하기
다중 보이스 대본을 쓰고 싶다고 AI에게 말하세요. AI가 다중 캐릭터 대화를 구성하고 화자마다 서로 다른 보이스를 배정합니다. 이 예시에서는:
- Su Zhe(차분한 남성 보이스) — 진행자, 오프닝과 핵심 주장 담당
- Ruo Yun(부드러운 여성 보이스) — 질문자, 긴장 지점을 드러내고 풀어 나가는 역할
- Yuan Ye(베이징 억양 남성 보이스) — 마무리, 철학적 정리 담당

대본 구조
생성된 대본은 평범한 JSON 파일입니다. 각 대사는 content(말하는 내용)와 speakerId(그 대사를 읽는 보이스)를 지정하며, 배열 순서대로 읽힙니다:

이 구조의 핵심은 완전히 결정적이라는 점입니다 — 두 사람이 번갈아 말하는 대화, 3인 라운드테이블, 내레이션이 섞인 독백은 모두 같은 배열을 다르게 배치한 것일 뿐입니다. 대본은 직접 작성해도 되고, 설명만 주고 AI가 생성하게 해도 됩니다.
완성된 대화
제출하고 약 30초가 지나면 3인 대화가 준비됩니다. AI는 청취 링크, 자막 파일, 보이스 구성, 대화 구조를 반환합니다:

FlowTTS와 Script 비교
| 항목 | FlowTTS(1인 내레이션) | Script(다중 보이스) |
|---|---|---|
| 제어 단위 | 전체 텍스트, 보이스 하나 | 대사 단위, 여러 보이스 |
| 적합한 용도 | 기사 낭독, 긴 텍스트 | 대화, 극본, 오디오북 |
| 입력 형식 | 일반 텍스트 | JSON(scripts 배열) |
| 편성 자유도 | 낮음 | 높음 |
기반 API는 Text to Speech API 레퍼런스를 참고하세요.