2026년 최고의 텍스트 음성 변환 도구 비교
11개 도구를 가격, 음성 품질, AI 에이전트 조작 가능성으로 비교하고 ListenHub의 API, MCP, Agent Skills 전체 기능과 적합하지 않은 경우까지 자세히 설명합니다.

이 글은 ListenHub가 발행합니다. 우리는 텍스트 음성 변환, AI 팟캐스트, 음성 복제를 만들고 구독을 판매하므로 여러분이 어떤 결론을 내리는지에 분명한 이해관계가 있습니다. 이를 모른 척하는 것이 신뢰를 잃는 가장 빠른 방법입니다.
이 글은 두 가지 일을 하며, 지금 어느 쪽을 읽는지 알아 둘 가치가 있습니다. 첫째는 맡기려는 작업별로 묶은 11개 텍스트 음성 변환 제품의 직접 비교입니다. 모든 가격은 목록형 기사 대신 각 공급업체의 가격 페이지에서 확인했습니다. 둘째는 대부분의 사용자가 보지 못하는 개발자 및 에이전트 표면을 포함해 ListenHub가 무엇을 하는지 상세히 설명하고, 우리가 잘못된 선택인 경우도 똑같이 자세히 밝히는 것입니다. 누구에게도 10점 만점 점수를 주지 않으며, 특히 우리 자신에게 주지 않습니다. 아래쪽에는 여러분을 경쟁사로 보내기 위해서만 존재하는 섹션도 있습니다.
먼저 보는 결론
한 섹션만 읽는다면 이것을 읽으세요.
- 한 목소리로 긴 원고를 아름답게 읽기 → ElevenLabs, 월 $6.
- 예산 안에서 대량 처리하는 API → Amazon Polly 또는 Google Cloud, 100만 자당 $4.
- 실시간 음성 에이전트 → Deepgram 또는 Cartesia.
- 규정 검토를 거친 기업용 이러닝 → WellSaid Labs.
- 영상 타임라인 안의 내레이션 → Speechify Studio.
- 문서를 무료 개인 청취물로 변환 → NotebookLM.
- 에이전트나 코드베이스가 완성된 오디오와 영상을 스스로 제작 → ListenHub. 하나의 키로 팟캐스트, 음성, 복제, 음악, 이미지, 슬라이드, 영상을 다루며 REST, MCP server, Agent Skills, SDK, CLI로 접근합니다.
- 문서에서 완성되고 게시 가능한 다중 음성 프로그램 생성 → ListenHub. 마지막 두 가지는 우리가 적합한 답이라고 생각하는 작업입니다. 아래에서 이유와 여전히 부족한 점을 설명합니다.
한눈에 보기
가격 확인일은 2026년 7월 28일입니다. 단위는 공급업체마다 다르므로 가짜 공통 통화로 바꾸지 않고 각 행에 그대로 적었습니다.
| 도구 | 가장 적합한 용도 | 무료 티어 | 유료 시작 | 음성 복제 | API / 에이전트 접근 |
|---|---|---|---|---|---|
| ElevenLabs | 장문 내레이션 품질 | 월 10k credits, 상업적 이용 불가 | 월 $6 | 있음, $6부터 | REST, SDK, 공식 MCP server |
| Amazon Polly | 대규모 저가 API | 월 5M자, 지속 | 사용량 기반 | 없음 | AWS SDK, IAM |
| Google Cloud TTS | API에서 가장 넓은 음성 범위 | 월 4M자, 지속 | 사용량 기반 | 없음 | GCP SDK |
| OpenAI | 한 공급업체, 한 키 | 없음 | 사용량 기반 | Enterprise 전용 | REST, SDK |
| Deepgram | 실시간 에이전트 | $200 credit, 1회 | 사용량 기반 | 없음 | REST, 스트리밍 SDK |
| Cartesia | 저가 저지연 스트리밍 | 월 20k credits, 상업적 이용 불가 | 월 $5 | 있음, $5부터 | REST, 스트리밍 SDK |
| Azure AI Speech | Microsoft 스택 기업 | 월 500k neural자 | 사용량 기반 | 있음, 승인 필요 | Azure SDK |
| WellSaid Labs | 기업 이러닝 | 월 다운로드 3분, 상업적 이용 불가 | 월 $19 | 없음 | REST |
| Speechify Studio | 영상 타임라인 보이스오버 | 600 credits, 상업적 이용 불가 | 월 $19 | 있음, $19부터 | REST |
| NotebookLM | 무료 개인용 오디오 개요 | 하루 3회 생성 | Google AI 구독 | 없음 | 없음 |
| ListenHub | 완성 프로그램과 이를 만드는 에이전트 | 월간 할당량과 일일 보충 | 월 $12, 연간 결제 시 월 $9 | 있음, 모든 유료 플랜 | REST, MCP server, Agent Skills, SDK, CLI — 모든 계정 |
아무도 같은 방식으로 가격을 매기지 않으므로 과금 단위를 짚고 넘어가야 합니다. Google, AWS, OpenAI의 기존 모델은 문자 단위, ElevenLabs, Cartesia, Speechify, ListenHub는 credits, WellSaid는 다운로드한 분, OpenAI의 새 모델은 token 단위입니다. 이 단위는 서로 바꿀 수 없으며 모두 더해 하나의 순위표를 만드는 비교는 숫자를 지어내는 것입니다.
마지막 열은 대부분의 비교에서 빠지지만 2026년에는 음성 품질보다 더 많은 구매를 결정합니다. 여기 있는 모든 제품에는 REST API가 있습니다. 차이는 AI 에이전트가 여러분이 먼저 통합을 작성하지 않고도 조작할 수 있는지, 그리고 한 번 호출했을 때 오디오 바이트가 돌아오는지 완성 콘텐츠가 돌아오는지입니다.
비교 방법과 테스트하지 못한 것
무엇을 언제 비교했는가. 2026년 7월 28일 각 공급업체의 가격 페이지에서 공개 가격, 무료 티어 제한, 상업적 이용 조건을 읽고 문서와 교차 확인했습니다. 또한 실제 구매를 결정하는 질문을 살폈습니다. 해당 티어로 게시할 수 있는지, 음성 복제가 포함되는지, 발음 사전이 있는지, 어떤 단위로 청구하는지입니다. TTS 가격은 계속 바뀌므로 모든 숫자를 출발점으로 보고 카드를 등록하기 전에 다시 확인하세요.
점수가 없는 이유. 10점 만점 평가는 우리가 실행하지 않은 평가 패널이 있었다는 인상을 줍니다. 어떤 도구가 더 좋게 들린다고 말하는 것은 이 제품들을 사용하고 우리 제품을 만든 경험에서 나온 의견입니다. 그런 문장은 직접 테스트할 후보 목록으로 받아들이고 다음 섹션의 실패 유형을 채점표로 쓰세요. 가장 나쁜 실제 문단으로 20분 테스트하는 것이 우리를 포함한 누구의 순위표보다 낫습니다.
확인할 수 없었던 것. 일부 공급업체는 JavaScript로 가격을 렌더링해 인용할 안정적인 공개 수치가 없습니다. 그래서 Murf는 아래에서 숫자 없이 설명합니다. Microsoft는 무료 티어를 텍스트로 공개하지만 유료 요율을 클라이언트에서 불러오므로 무료 할당량만 인용합니다. PlayHT, LOVO, MiniMax는 아예 제외했습니다. 1차 가격 정보가 로드되지 않았고 3차 수치는 서로 충돌하며 이전 연도 값을 재활용한 흔적이 뚜렷했기 때문입니다. 출처를 댈 수 없는 15개보다 출처가 있는 11개를 다루겠습니다.
테스트할 수 없었던 것. Enterprise 제한 기능은 시험하지 못했습니다. OpenAI의 custom voices는 영업 상담이 필요해 품질을 말할 수 없습니다. 또한 실제 운영 부하에서 지연 시간을 벤치마크하지 않았습니다. 요청 하나의 측정값은 동시 스트림 1,000개에 대해 아무것도 알려 주지 않기 때문입니다.
텍스트 음성 변환이 실제로 어색해지는 이유
여기 있는 거의 모든 도구는 예전 기준을 넘었습니다. 더 이상 로봇 음성은 아닙니다. 남은 실패는 더 미묘하며 청중은 이름을 붙이지 못해도 알아챕니다. 돈을 쓰기 전에 귀를 훈련할 가치가 있는 부분입니다.
평평한 운율. 영어는 강세로 의미를 전달합니다. “I didn't say she took the money”는 어느 단어를 강조하느냐에 따라 약 일곱 가지 뜻이 됩니다. 통계적으로 평균적인 강세 패턴을 선택한 모델은 문장을 정확히 읽고도 잘못된 뜻을 전할 수 있습니다. 대비를 들어 보세요. 실제로 새로운 정보인 단어를 강조합니까?
눈을 위해 쓴 글을 그대로 읽음. 가장 큰 문제이며 음성 문제가 아닙니다. 문서에는 “e.g.”, “Fig. 3”, “$1.2M”, “2026-07-28”, “(see below)”가 있습니다. 사람은 소리 내 읽으며 무의식적으로 “for example”, “figure three”, “one point two million dollars”로 고칩니다. 대부분 엔진은 글리프를 그대로 발음합니다. 글머리표 조각은 더 나쁩니다. 문서의 목록에는 동사가 없어 서로 끊긴 명사구 더미로 나옵니다. 음성 품질이 아무리 좋아져도 이 실패는 남기 때문에 우리는 글말을 입말로 바꾸는 단계를 만들었습니다.
이름과 전문 용어를 매번 똑같이 틀림. 제품명, 영어가 아닌 성, 때로 철자를 읽고 때로 단어로 읽는 약어 — “SQL”, “Nginx”, “Xiaomi”, “José”. 일관성이 치명적입니다. 40개 에피소드 모두에서 회사명을 같은 방식으로 잘못 읽습니다. 공급업체가 편집 가능한 발음 사전을 제공하는지, 워크스페이스 전체에 적용되는지 프로젝트마다 다시 넣어야 하는지 확인하세요.
차례 주고받기가 없음. 두 음성을 따로 렌더링해 이어 붙인 것은 대화가 아닙니다. 실제 대화는 조금 겹치고 맞장구가 있으며, 가장 분명하게는 두 번째 화자의 시작 음높이가 첫 번째 화자의 끝 음높이에 반응합니다. 독립 렌더 두 개를 붙이면 트렌치코트를 입은 독백 두 개가 됩니다.
균일한 속도. 사람은 목록에서 빨라지고 결론으로 들어가며 느려지며 쉼표가 아니라 문단 경계에서 숨을 쉽니다. 문장 사이에 고정 간격 하나를 적용하는 엔진은 약 2분이 지나면 듣기 지치게 합니다. 15초 데모에서는 매우 듣기 어려운 문제입니다.
그래서 데모 함정이 생깁니다. 공급업체 샘플 문장은 잘 작동하기 때문에 선택된 것입니다. 그것으로 아무것도 판단하지 마세요.
영상과 강의를 위한 자연스러운 내레이션
가장 큰 구매자 집단입니다. 원고가 있고 이를 읽을 목소리와 결과를 게시할 권리가 필요합니다.
ElevenLabs — 장문 내레이션에 가장 적합
무료 월 $0, 10,000 credits, 상업 라이선스 없음, 복제 없음 · 유료 시작 월 $6 Starter · 단위 credits
실제 시작점은 무료 티어가 아니라 월 $6 Starter입니다. 30,000 credits, 상업 라이선스, instant voice cloning이 포함됩니다. Creator는 월 $22에 121,000 credits와 professional voice cloning, Pro는 월 $99에 600,000입니다. 장문 내레이션에서는 우리가 사용한 무엇보다 운율을 잘 유지합니다. 한 장의 세 번째 문단에 들어가도 문장의 흐름을 잃을 가능성이 가장 낮은 도구입니다.
장점: 이 목록에서 가장 강한 장문 운율, 가장 저렴한 유료 티어부터 instant cloning, 한 복제 음성의 강한 다국어 출력, 실제로 큰 문서와 통합 생태계.
단점: 무료 티어에는 상업 라이선스와 복제가 없어 무료로 평가한 뒤 게시하는 사람이 걸려듭니다. credits를 머릿속에서 분으로 바꾸기 어렵습니다. Creator보다 커지면 비용이 빠르게 증가합니다.
결론: 한 목소리로 긴 원고를 잘 읽는 것이 작업이라면 Starter를 사고 쇼핑을 끝내세요.
WellSaid Labs — 기업 이러닝에 가장 적합
무료 월 다운로드 3분, 상업적 권리 없음 · 유료 시작 월 $19 또는 연 $120 · 단위 다운로드한 분
WellSaid는 기업과 이러닝 팀에 판매하며 다운로드한 분으로 가격을 정합니다. 재무팀이 예산을 세우기 쉬운 단위입니다. Starter는 월 $19 또는 연 $120로 월 20분, Pro는 월 $49 또는 연 $396로 월 180분입니다. 목소리는 ElevenLabs보다 적고 보수적이며, 규정 검토를 받는 교육 모듈이 원하는 바로 그 성격입니다.
장점: 분은 재무팀이 이해하는 단위입니다. 보수적이고 일관된 음성은 법무 검토를 견딥니다. 연간 가격이 반올림 장난이 아니라 실제 할인입니다.
단점: 2026년 기준 작은 카탈로그, 음성 복제 없음, 매주 제작한다면 월 20분은 부족합니다.
결론: 교육 콘텐츠 조달에서 안전한 답이며 이 목록에서 청구액을 가장 쉽게 예측할 수 있습니다.
Speechify Studio — 영상 편집 안의 보이스오버에 가장 적합
무료 600 credits, 상업적 권리 없음 · 유료 시작 월 $19 Starter · 단위 credits, 보이스오버 1초당 1
Speechify Studio는 텍스트 상자가 아니라 영상 편집 타임라인을 중심으로 만들어졌습니다. Starter는 월 $19에 7,200 credits, 음성 복제와 상업적 권리를 제공하며 Creator는 월 $49에 28,800입니다. 보이스오버는 초당 1 credit이므로 Starter는 완성 내레이션 2시간입니다. 스프레드시트 없이 머릿속에서 바꿀 수 있는 드문 credit 체계입니다.
장점: 실제로 계산 가능한 초당 1 credit, 보이스오버와 영상 편집이 한곳, 시작 티어부터 복제와 상업적 권리.
단점: 원하지 않는 편집기에 비용을 낼 수 있습니다. 긴 원고 내레이션 품질은 ElevenLabs보다 한 단계 낮습니다. 무료 티어는 데모입니다.
결론: 오디오가 결과물이 아니라 영상 프로젝트의 한 트랙일 때 적합합니다.
Murf — 협업 스튜디오 작업에 가장 적합
무료 인용 없음 · 유료 시작 인용 없음 · 단위 인용 없음
Murf도 이 그룹에 속하며, 특히 공유 프로젝트가 있는 협업 스튜디오를 원하는 팀에 적합합니다. 가격 페이지가 클라이언트에서 렌더링되어 책임지고 제시할 수 있는 수치를 읽지 못했으므로 가격을 인용하지 않습니다. 여기 다른 모든 제품에는 숫자가 있지만, 이 부재를 제품 평가가 아니라 출처의 공백으로 봐 주세요.
결론: 팀 워크플로라면 살펴볼 가치가 있지만 현재 가격은 Murf에서 직접 확인하세요.
확장 가능한 API
여기서는 어떤 목소리가 가장 예쁜지가 아닙니다. 대신 네 가지가 결정합니다.
단위 경제성. 문자, 초, 작업당 지불액과 규모가 커져도 비용 곡선이 합리적인지입니다. 순수 합성에서는 클라우드가 압도적으로 이깁니다. 100만 자당 $4는 어떤 구독도 밑돌 수 없는 바닥입니다.
지연 시간과 형태. 대화 한 차례를 위한 스트리밍 socket이 필요한지, 10분 렌더를 위한 fire-and-forget 작업이 필요한지입니다. 서로 다른 제품이며 하나에 최적화한 공급업체는 대체로 다른 하나에 평범합니다.
한 번 호출하면 무엇이 돌아오는가. 자주 빠지는 축입니다. 이 섹션 대부분은 여러분이 제공한 텍스트에 대한 오디오 바이트를 반환합니다. 원고, 분할, 다중 음성 조립, 자막 시간, muxing은 여러분 몫입니다. 더 작은 그룹은 완성된 산출물을 반환합니다. 이 차이는 이 페이지의 가격 차이보다 더 많은 엔지니어링 시간을 절약합니다.
에이전트가 도움 없이 조작할 수 있는가. 2026년에는 키보드 앞 개발자보다 코딩 에이전트가 많은 호출을 합니다. 그때 중요한 것은 MCP server, Agent Skill, 타입 SDK처럼 에이전트가 발견하고 호출할 도구 표면을 공급업체가 제공하는지, 아니면 누군가 먼저 통합을 작성하고 유지해야 하는지입니다.
도입 전에 알아 둘 점은 공급업체 지속성입니다. Google, AWS, Microsoft, OpenAI는 사라지지 않을 것입니다. 나머지는 더 젊고 신생 업체의 가격은 이미 두 번 이상 움직였습니다.
Google Cloud Text-to-Speech — 범위에 가장 적합
무료 월 4M Standard 및 WaveNet자, 1M Chirp 3 HD, 반복 · 유료 1M자당 $4–$160 · 단위 문자
이 목록에서 가장 넓고 유용한 범위입니다. 반복 무료 할당량 이후 Standard와 WaveNet은 100만 자당 $4, Neural2는 무료 100만 이후 $16, 현재 플래그십인 Chirp 3 HD는 무료 100만 이후 $30, Studio는 $160입니다. 새 Gemini-TTS 모델은 token으로 청구하며 무료 할당량이 없습니다. 주의할 점은 무료 문자만 사용해도 결제를 활성화해야 한다는 것입니다.
장점: 실제 프로토타입을 0원에 돌릴 만큼 큰 반복 무료 티어, 모든 예산에 맞는 음성 클래스, 지역 변형이 있는 수십 언어.
단점: $4에서 $160까지의 가격 사다리는 읽지 않고 음성 클래스를 고른 사람을 벌합니다. 코드를 써야 하고 스튜디오는 없습니다. token 청구 Gemini는 다른 것과 비교를 깨뜨립니다.
결론: 한 공급업체로 저가 대량 처리와 플래그십 음성을 모두 원할 때 기본 API 선택입니다.
Amazon Polly — 가장 저렴한 영구 무료 티어에 적합
무료 월 5M Standard자, 12개월 절벽 없이 지속 · 유료 1M자당 $4–$100 · 단위 문자
저가 구간의 가격 선두이자 업계 최고의 무료 티어입니다. Standard는 100만 자당 $4, Neural $16, Generative $30, Long-Form $100입니다. 월 500만 Standard자는 1년 뒤 만료되지 않습니다. 제목이 될 만큼 드문 조건입니다.
장점: 대규모에서 진짜 영구적인 유일한 무료 할당량, 인프라가 그래야 하듯 지루한 안정성, 예측 가능한 문자 과금.
단점: 더 좋은 음성 클래스의 무료 기간은 제한됩니다. 복제 없음. Standard는 2026 플래그십 옆에서 오래돼 들립니다.
결론: 영구 무료가 중요하고 코드를 쓸 수 있다면 여기서 시작하세요.
OpenAI — 이미 OpenAI를 쓰는 팀에 가장 적합
무료 없음 · 유료 tts-1 1M자당 $15, tts-1-hd $30 · 단위 문자 또는 새 모델의 token
스택이 이미 OpenAI에 있고 공급업체와 키를 하나로 만들고 싶다면 명백한 선택입니다. 기존 모델은 이해하기 쉽습니다. tts-1은 100만 자당 $15, tts-1-hd는 $30입니다. 새 gpt-4o-mini-tts는 문자가 아닌 token으로 과금하므로 자신의 오디오 token 출력을 측정하기 전에는 문자 기반 공급업체와 비교할 수 없습니다.
장점: 이미 사용 중이면 한 키, 한 청구서, 한 SDK. 톤 지시를 잘 따릅니다. 문서가 좋습니다.
단점: 무료 티어가 전혀 없어 첫 요청부터 비용이 듭니다. 새 모델의 token 과금은 정말 예측하기 어렵습니다. custom voices는 영업 상담 뒤에 있습니다. OpenAI 이용 정책은 음성이 AI 생성임을 공개하도록 요구합니다.
결론: 편의성이 기능입니다. 음성만 보고 OpenAI로 옮기는 사람은 없습니다.
Deepgram — 실시간 에이전트에 가장 적합
무료 $200 credit, 1회, 카드 불필요 · 유료 Aura-2 1k자당 $0.030, Aura-1 $0.0150 · 단위 문자
아름다움보다 지연 시간이 중요한 실시간 및 에이전트 작업용입니다. 가입하면 카드 없이 $200 credit을 받습니다. 여기서 가장 후한 무약정 시험이지만 반복이 아닌 1회입니다.
장점: 프로토타입을 출시할 만큼 큰 시험, 대화 차례에 맞춘 지연, 같은 공급업체의 speech-to-text.
단점: $200은 돌아오지 않습니다. 좁은 음성 카탈로그. 장문 내레이션용이 아닙니다.
결론: 음성 에이전트에는 맞고 오디오북에는 틀립니다.
Cartesia — 저렴한 스트리밍에 가장 적합
무료 월 20k credits, 상업적 이용 불가 · 유료 시작 월 $5 Pro · 단위 credits
저지연 스트리밍에 공격적으로 저렴합니다. Pro는 월 $5에 100,000 credits입니다. 하지만 상업 라이선스와 instant voice cloning을 주는 첫 티어도 Pro이므로 무료 티어는 엄격히 평가 sandbox입니다. Startup은 월 $49에 1.25 million credits, Scale은 월 $299에 8 million입니다.
장점: 이 목록에서 가장 저렴한 월 $5 유료 시작, 해당 티어부터 복제, 실제로 낮은 지연.
단점: 무료 티어 결과는 게시할 수 없습니다. 클라우드보다 젊은 회사. 더 작은 카탈로그.
결론: 지연에 민감한 것을 만들고 작은 공급업체를 감수할 수 있다면 여기서 최고의 스트림당 가격입니다.
Microsoft Azure AI Speech — Microsoft 스택 기업에 가장 적합
무료 월 500k neural자, 반복, 강한 제한 · 유료 지역별 상이 · 단위 문자
Azure는 월 500,000 neural TTS자와 5시간의 speech-to-text를 포함한 반복 F0 무료 티어를 공개합니다. 강하게 제한되며 운영용이 아닙니다. 가격표가 클라이언트에서 요율을 불러오므로 유료 가격은 인용하지 않습니다. Azure는 이 목록 대부분보다 지역별 요금 차이가 크므로 자신의 지역 포털에서 확인하세요.
장점: 깊은 언어 및 지역 범위, 대기업이 원하는 규정 준수와 데이터 레지던시, 승인 고객을 위한 custom neural voice.
단점: 직접 확인해야 하는 지역별 가격, 무료 티어 제한으로 데모에 가까움, 복잡한 콘솔.
결론: 회사가 이미 Azure에서 운영된다면 이 결정은 내려져 있습니다.
ElevenLabs — 오디오 에이전트 도구 표면에 가장 적합
내레이션 품질은 위에서 다뤘지만 여기도 정직하게 들어가야 합니다. ElevenLabs는 공식 MCP server를 제공하며 우리보다 훨씬 큰 도구 표면을 갖습니다. 음성, 전사, speech-to-speech, 음향 효과, 음악, 음성 설계, 아웃바운드 콜 음성 에이전트를 Claude Desktop, Cursor, Windsurf, OpenAI Agents에서 제공합니다.
결론: 에이전트의 일이 오디오 프리미티브이고 하나의 MCP 연결 뒤에 가장 넓은 세트를 원한다면 설치하세요. 아래의 우리 답은 오디오 프리미티브에서는 좁고 완성 산출물에서는 넓습니다.
ListenHub — 하나의 키로 오디오와 영상에 가장 적합
무료 월간 할당량과 일일 보충, API key 포함 · 유료 시작 월 $12 또는 연간 결제 시 월 $9 · 단위 credits
우리 API 때문에 이 섹션이 길어졌으므로 실제 형태를 솔직히 설명하겠습니다. 더 저렴한 문자당 합성 endpoint가 아니라 작업 단위가 다른 제품입니다. 한 번의 POST가 작업을 시작하고 완성 산출물로 돌아옵니다. 작성된 원고가 있는 2인 에피소드, SRT 자막이 있는 내레이션, 렌더링된 설명 영상, 슬라이드 덱, 배경 음악, 이미지입니다. 작업은 의도적으로 비동기입니다. 10분 렌더는 HTTP 왕복이 아니므로 작업을 만들고 poll합니다.
하나의 API key로 팟캐스트, 텍스트 음성 변환, 음성 복제, 음악, 이미지 생성, 설명 영상, 슬라이드, AI 영상, URL이나 파일의 콘텐츠 추출에 접근합니다. 영상 절반을 위한 두 번째 공급업체도, 오디오와 시각물을 붙이는 glue code도 없고 하나의 credit 잔액과 청구서입니다. 전체 API 표면은 아래에서 더 설명합니다.
장점: 오디오 바이트가 아닌 완성 산출물, 한 키 뒤의 오디오와 영상, 네 가지 1차 접근 방식(REST, MCP, Agent Skills, SDK/CLI)으로 통합 없이 에이전트가 조작, 모든 계정이 키를 만들 수 있어 무료 평가, 긴 렌더에 맞는 비동기 작업 모델, 응답 envelope를 풀고 rate limit을 재시도하는 SDK.
단점: credits는 문자보다 거친 단위라 Polly보다 요청 비용을 예측하기 어렵습니다. 무료 할당량은 Polly 월 500만 자보다 작아 지속적인 양에는 구독이나 credit packs가 필요합니다. ElevenLabs가 MCP로 더 많은 오디오 도구를 노출합니다. 지연 SLA를 공개하지 않으며 실시간 음성 에이전트에 쓰면 안 됩니다.
결론: 에이전트나 backend가 완성되고 게시 가능한 콘텐츠를 내야 할 때 맞는 호출입니다. 저렴한 대량 합성이나 1초 미만 스트리밍에는 틀린 호출입니다.
클립이 아니라 완성 프로그램
사람들이 그렇게 검색하기 때문에 “텍스트 음성 변환”으로 분류되지만 다른 제품 범주입니다. 원고가 없고 문서가 있으며 두 사람이 그것을 이야기하길 원합니다.
NotebookLM — 무료 개인 청취에 가장 적합
무료 Google 계정당 하루 3회 오디오 생성 · 유료 Google AI 구독을 통해 · 단위 생성 횟수
무료이며 이 일에 놀라울 정도로 뛰어납니다. 자료를 올리면 두 진행자의 오디오 개요를 만듭니다. Google 지원 문서는 무료 플랜을 하루 3회 오디오 생성과 50회 채팅 질의로 명시합니다. 가끔 개인적으로 밀도 높은 PDF를 산책용으로 바꾸는 필요라면 무료를 반박하기 어렵습니다.
장점: 실제로 무료, 설득력 있는 두 진행자 대화, 설정 없음.
단점: 말하기 전에 원고를 편집하거나 목소리를 고르거나 복제하거나 브랜딩을 제거할 수 없습니다. 결과는 고정된 한 형식입니다. 일정에 맞춘 게시용이 아닙니다.
결론: 자신의 문서를 무료로 듣는 최고의 방법이며 제작 도구는 아닙니다.
ListenHub — 게시 가능한 다중 음성 프로그램에 가장 적합
무료 월간 할당량과 일일 보충 · 유료 시작 월 $12 또는 연간 결제 시 월 $9 · 단위 credits
우리가 만드는 제품이므로 적절히 의심하며 읽고, 우리가 못하는 부분까지 솔직하게 긴 버전으로 설명하는 다음 섹션도 읽으세요. 한 줄 요약은 NotebookLM이 오디오 개요를 주고 ListenHub는 편집하고 브랜딩해 내보낼 수 있는 프로그램을 준다는 것입니다.
장점: 말하기 전에 원고 편집, 텍스트 음성 변환과 음성 복제의 12개 출력 언어, 위의 “글자 그대로 읽기” 실패를 고치는 글말-입말 재작성, 하나의 credit 잔액으로 오디오, SRT, 영상, 슬라이드.
단점: AI 팟캐스트 형식 자체는 여전히 영어, 중국어, 일본어만 생성합니다. 원고 편집, 파일 내보내기, 복제, 브랜딩 제거는 모두 유료 플랜이 필요해 무료 티어는 게시보다 듣기용입니다. 단위 비용은 100만 자당 $4에 못 미칩니다. 영상 편집 타임라인이 없습니다. 한 목소리가 긴 원고 하나를 읽는다면 ElevenLabs가 더 잘합니다.
결론: 결과물이 원본 문서에서 만든 완성 다중 음성 프로그램일 때 우리를 선택하세요. 이 페이지의 다른 대부분 작업에는 다른 도구가 더 나은 답입니다.
ListenHub가 실제로 하는 일
보고서, 논문, URL, 원고를 가져왔고 사람들이 실제로 들을 것을 원합니다. 일반 텍스트 음성 변환 상자가 하지 않는 네 가지가 여기서 일어나며 그것이 우리를 고르는 전부입니다.
먼저 글말을 입말로 다시 씁니다. 글말-입말 단계이며 이 글의 가장 큰 실패를 다룹니다. “Fig. 3 shows a 12.4% YoY increase (see Appendix B)”는 사람이 실제로 소리 내 말할 표현이 됩니다. 글머리표 조각에는 동사가 생기고 약어는 독자가 풀어 말하듯 확장됩니다. 이미 대화체인 글은 끄고 한 단어씩 읽을 수 있습니다. 법적 고지는 정확히 쓰인 대로 읽어야 합니다.
붙인 독백 두 개가 아니라 대화를 씁니다. 앞서 말한 차례 주고받기 문제는 합성 문제 전에 원고 문제입니다. 두 진행자는 대화로 쓴 원고를 받고 두 번째 화자는 첫 번째가 실제로 말한 내용에 반응합니다.
말하기 전에 원고를 편집할 수 있습니다. 장난감과 도구의 차이입니다. 원고를 보고 제품 포지셔닝을 잘못 읽는 문장을 고치고 옆길을 잘라낸 다음에만 오디오에 credits를 씁니다. 텍스트 수정은 무료지만 오디오 재렌더링은 아닙니다. 원고 편집은 Basic부터 구독 기능입니다.
한 잔액으로 전체 출력을 다룹니다. SRT 자막이 있는 오디오, 설명 영상, 슬라이드, 이미지 — 같은 credits이며 두 번째 구독이 없습니다. 파일 내보내기와 ListenHub 브랜딩 제거도 Basic부터이므로 무료 티어는 게시하는 곳이 아니라 소리를 확인하는 곳입니다.
API와 에이전트 표면
기능 표에 나타나지 않는 제품의 절반이며 개발자에게 가장 흥미로운 부분입니다. 웹 앱이 하는 모든 것은 프로그래밍으로 접근할 수 있고, 네 가지 1차 표면이 같은 API key로 인증하며 같은 credit 잔액을 사용합니다.
REST API. Settings → API keys에서 lh_sk_… 형식의 키를 만들고 https://api.marswave.ai/openapi를 호출합니다. 응답은 { code, message, data } envelope를 쓰며 0이 아닌 code가 오류입니다. 생성은 설계상 비동기입니다. 완전한 에피소드나 렌더 영상은 밀리초가 아니라 분이 걸리므로 작업을 만들고 poll합니다. endpoint는 팟캐스트 생성, 텍스트 음성 변환, end-to-end 오디오의 ListenHub Voice, 음악, 이미지 생성, 설명 영상, 슬라이드, AI 영상, 화자 검색, URL 또는 파일의 콘텐츠 추출, 구독 상태를 다룹니다. API 문서에 전체 참고가 있으며 endpoint별 매개변수와 언어 지원은 블로그보다 빠르게 움직이므로 거기에 명시합니다.
MCP server. ListenHub는 Model Context Protocol server를 제공하므로 Claude Desktop, Cursor, Windsurf, VS Code, Zed 같은 MCP 클라이언트가 HTTP를 직접 치지 않고 도구를 호출해 팟캐스트와 내레이션을 만들고 음성 카탈로그를 보고 계정을 확인합니다. 각 도구는 공개 API endpoint를 감싸 두 표면이 맞춰집니다. 기본은 stdio이며 원격이 필요하면 HTTP/SSE로 실행하고 LISTENHUB_API_KEY로 인증합니다. 알아 둘 점은 create_podcast가 대신 완료까지 poll하므로 한 도구 호출이 에이전트가 지켜볼 task id가 아니라 완성 에피소드를 반환한다는 것입니다. MCP 문서를 보세요.
Agent Skills. 코딩 에이전트에 가장 먼저 권할 표면입니다.
npx skills add marswaveai/skills
Agent Skills를 지원하는 Claude Code, Cursor, Windsurf, OpenCode용 ListenHub Skills를 프로젝트에 설치합니다. 이후 명령은 자연어입니다. 이 글을 설명 영상으로 바꿔 줘, 이 세 URL로 두 진행자 팟캐스트를 만들어 줘. 에이전트가 목소리를 고르고 생성을 진행하고 완료를 poll한 뒤 링크와 함께 산출물을 돌려줍니다. 음성, 팟캐스트, 텍스트 음성 변환, 설명 영상, 슬라이드, 이미지, 음악, 전사, 콘텐츠 파싱의 개별 skill이 있어 하나의 거대한 endpoint 대신 파이프라인을 조합합니다.
SDK와 CLI. @marswave/listenhub-sdk는 공식 typed JavaScript/TypeScript 클라이언트입니다. ESM 전용이며 자체 타입, runtime dependency 하나, Node 20 이상을 요구합니다. 응답 envelope를 풀고 429를 재시도해 직접 만들 필요가 없습니다. 두 클라이언트를 내보내며 구분이 실제로 유용합니다. OpenAPIClient는 API key로 서버, 스크립트, CI에서 인증하고 키 소유자로 동작합니다. ListenHubClient는 OAuth user token을 써 각 요청을 로그인한 개별 사용자로 실행하며 사용자용 제품에 맞습니다. @marswave/listenhub-cli는 같은 SDK를 listenhub binary로 감싸 같은 분리를 제공합니다. 대화형 작업은 OAuth 브라우저 로그인 후 listenhub …, CI는 키로 listenhub openapi …를 씁니다. SDK와 CLI 문서가 있습니다.
프로그래밍으로 목소리 고르기. 화자 검색은 ID와 이름 이상을 반환합니다. 각 음성에는 pitch, speed, traits, styles, suggested scenes, accent, description과 현지화 설명이 있습니다. 따라서 에이전트는 한 번 사람이 고른 ID를 하드코딩하지 않고 “오디오북용 따뜻한 여성 내레이터” 같은 brief에서 고를 수 있습니다. endpoint보다 파일을 읽고 싶은 에이전트용 일반 텍스트 카탈로그 /voices.txt도 있습니다.
두 가지를 분명히 하겠습니다. 플랜이 필요하지 않습니다. 모든 계정이 키를 만들 수 있어 카드 없이 무료 할당량으로 API를 평가하고 주말 프로토타입을 무료로 만들 수 있습니다. 필요한 것은 credits입니다. API 호출은 웹 앱과 같은 잔액을 쓰므로 자동 사용과 팀의 수동 사용이 한 통에서 나갑니다. 지속적인 규모에는 구독이나 credit pack이 필요합니다. 단위가 문자보다 거친 credits이므로 문자당 요율보다 예측하기 어렵습니다.
언어와 목소리
텍스트 음성 변환과 음성 복제는 모두 12개 언어를 지원합니다. 영어, 중국어 표준어, 일본어, 스페인어, 포르투갈어, 프랑스어, 독일어, 튀르키예어, 한국어, 이탈리아어, 태국어, 베트남어입니다. 공개 음성 카탈로그는 음성별 태그와 설명을 제공해 이름을 하나씩 시험하지 않고 언어, 성별, 전달 방식으로 필터링할 수 있습니다. 에이전트가 읽을 일반 텍스트 카탈로그 /voices.txt도 있습니다.
무엇을 포함하고 포함하지 않는지 정확히 말해야 합니다. 다른 곳에서 과장되는 것을 봤습니다. 12개 언어는 텍스트 음성 변환과 복제에 적용됩니다. AI 팟캐스트 형식과 다른 제작 도구는 여전히 영어, 중국어, 일본어로 생성합니다. 지금 두 진행자의 스페인어 팟캐스트가 필요하다면 아직 제공하지 못합니다.
음성 복제
샘플에서 자신의 목소리를 복제하고 카탈로그 음성이 작동하는 모든 곳에서 12개 언어로 사용합니다. 모든 유료 플랜에 복제가 포함됩니다. Basic 저장 1개, Pro 4개, Max 20개이며 플랜 허용량을 넘는 저장은 개당 300 credits입니다. 음성 복제 가이드가 좋은 샘플을 설명합니다. 짧게 말하면 잡음 있는 30분보다 깨끗한 3분이 낫습니다.
비용
Basic은 월 $12 또는 연간 결제 시 월 $9에 1,300 credits와 음성 복제 1개입니다. Pro는 월 $24 또는 연간 월 $19에 2,700 credits와 4개입니다. Max는 월 $240 또는 연간 월 $200에 30,000 credits와 20개입니다. API, MCP server, Agent Skills는 플랜에 묶이지 않으며 무료 티어를 포함한 모든 계정에서 가진 credits를 사용합니다.
credits를 작업으로 바꾸면 5분 팟캐스트 약 24 credits, 텍스트 음성 변환 10분 약 40, 10페이지 덱 약 150입니다. Pro를 다른 데 쓰지 않으면 월 약 11시간의 음성입니다. 무료 티어에는 월 할당량과 작은 일일 보충이 있습니다. 가격 페이지의 현재 수치는 자주 움직이므로 여기 고정하지 않고 그쪽을 가리킵니다. credits 가이드는 세 종류 credit이 겹치는 방식과 사용 순서를 설명합니다.
위 도구보다 약한 부분
어차피 알게 될 것이므로 분명히 밝힙니다.
- 대량 단위 비용. Polly와 Google은 100만 자당 $4입니다. 구독은 경쟁할 수 없고 그렇다고 가장하지 않습니다.
- 단일 음성 장문 완성도. ElevenLabs는 매우 긴 한 명 내레이션 원고에서 운율을 더 잘 유지합니다.
- 에이전트용 오디오 도구 폭. ElevenLabs MCP server는 전사, speech-to-speech, 오디오 분리, 음성 설계, 아웃바운드 콜 등 더 많은 오디오 프리미티브를 노출합니다. 우리는 완성 산출물을 목표로 합니다.
- 문자당 API 측정 없음. 문자가 아니라 credits를 써 요청 비용은 공개된 100만 자당 $4보다 예측하기 어렵고 무료 할당량은 Polly 월 500만 자의 일부입니다.
- 지연 약속 없음. SLA를 공개하지 않고 작업 모델은 실시간 차례가 아니라 렌더용입니다. 실시간 음성 에이전트에 넣지 마세요.
- 영상 편집. Speechify는 타임라인, 우리는 내보내기를 줍니다.
- 팟캐스트 언어. TTS와 복제 12개, 팟캐스트 형식 3개.
- 기업 조달. Azure와 AWS가 파는 데이터 레지던시 보장이나 맞춤 계약이 없습니다.
무료 티어 비교
무료 티어는 제품인지 데모인지에서 다릅니다. 중요한 차이는 크기가 아니라 만든 것을 게시할 수 있는지입니다.
| 도구 | 무료 할당량 | 반복? | 무료에서 게시? |
|---|---|---|---|
| Amazon Polly | 월 5M Standard자 | 예, 만료 없음 | 예 |
| Google Cloud | 월 4M Standard자, 1M Chirp 3 HD | 예 | 예 |
| Azure | 월 500k neural자 | 예, 제한 | 예 |
| Deepgram | $200 credit | 아니요, 1회 | 예 |
| NotebookLM | 하루 3회 생성 | 예 | 개인용 |
| ElevenLabs | 월 10k credits | 예 | 아니요 |
| Cartesia | 월 20k credits | 예 | 아니요 |
| Speechify | 600 credits | 예 | 아니요 |
| WellSaid | 월 다운로드 3분 | 예 | 아니요 |
| ListenHub | 월간과 일일 보충 | 예 | 아니요, 내보내기에 플랜 필요 |
아래 다섯 곳은 이를 솔직하게 말하지만 게시하려면 완전히 쓸모없습니다. 우리도 자신을 그 위가 아니라 같은 그룹에 놓았습니다. 내보낼 수 없는 무료 티어는 누가 만들었든 평가 sandbox입니다. 첫날부터 유료 시작 티어를 예산에 넣으세요. 각각 $6, $5, $19, $19, $12입니다. Polly의 더 좋은 음성 클래스도 기간 제한이 있습니다. 첫 12개월만 Neural 월 100만, Long-Form 500,000, Generative 100,000입니다.
“무료”가 절대 조건이고 게시하려면 후보는 Polly와 Google Cloud뿐이며 코드를 작성하게 됩니다.
영어 이외의 언어
폭에서는 클라우드 플랫폼이 완전히 이깁니다. Google, Azure, Polly는 지금의 물결 이전부터 만들어 수십 언어를 원어민 음성과 지역 변형으로 다룹니다. ElevenLabs는 한 음성의 다국어 출력에 강합니다. 같은 복제 음성이 다른 언어를 말하며 별개의 유용한 능력입니다.
마케팅이 미끄러워지는 곳은 지원과 잘함 사이의 틈입니다. 많은 공급업체가 큰 언어 수를 제시하지만 목록 대부분을 하나의 다국어 모델과 영어에 맞춘 소수 음성으로 제공합니다. OpenAI는 자체 문서에서 솔직합니다. 목표 언어용으로 실제 판매되는 음성의 샘플을 요청하고 원어민에게 들어 달라고 하세요.
그 기준에서 반올림하지 않은 우리 위치는 텍스트 음성 변환과 음성 복제 12개 언어입니다. 억양 설정을 붙인 영어 음성이 아니라 카탈로그의 음성을 제공합니다. 팟캐스트 형식은 3개 언어입니다. 힌디어, 아랍어, 인도네시아어 내레이션이 필요하면 우리는 제공하지 않으며 Google 또는 Azure가 합니다.
무엇을 골라야 할까요?
내레이션 영상을 게시하는 1인 크리에이터. ElevenLabs Starter 월 $6. 편집 타임라인도 원할 때만 Speechify를 추가하세요.
L&D 또는 교육 팀을 운영. WellSaid Labs. 분은 예산화할 수 있는 단위이며 음성이 법무 검토를 견딥니다.
제품 안에 합성이 필요한 엔지니어. Google Cloud 또는 Polly. 반복 무료 티어에서 프로토타입을 만들고 음성 클래스를 의도적으로 고르세요. 100만 자당 $4와 $160의 차이는 음성 클래스 dropdown 하나입니다.
음성 에이전트 구축. Deepgram 또는 Cartesia. 지연과 스트림당 비용이 전부이며 카탈로그 크기는 아닙니다.
AI 에이전트가 완성 콘텐츠를 스스로 만들게 함. ListenHub Skills 또는 MCP server. npx skills add marswaveai/skills 한 번이면 코딩 에이전트가 통합을 먼저 작성하지 않고 URL을 게시 에피소드나 설명 영상으로 바꿉니다. 시작에 플랜은 필요 없고 무료 계정이 키를 받으며 평가 이후 credits로 지불합니다. 에이전트가 전사, 음향 효과, 음성 설계 같은 완성물이 아닌 오디오 프리미티브를 원하면 ElevenLabs MCP server를 설치하거나 둘 다 쓰세요.
CI에서 콘텐츠 파이프라인 자동화. API key를 사용하는 SDK 또는 CLI, 합성만 필요하면 클라우드. listenhub openapi …는 이 스크립트 용도로 존재합니다.
밀도 높은 PDF를 다루는 학생 또는 연구자. 무료 NotebookLM. 원고 편집과 게시 가능한 출력이 필요해지는 순간 졸업합니다.
문서에서 쇼나 콘텐츠 프로그램을 게시. ListenHub. 편집 가능한 원고, 다중 음성 출력, 브랜딩 없는 내보내기, 오디오·영상·슬라이드 공통 잔액.
요구가 정말 $0이고 코드를 작성 가능. Polly, 그다음 Google Cloud. 다른 모든 무료 티어는 게시를 금지하거나 소진됩니다.
사람들이 실제로 묻는 질문
최고의 무료 텍스트 음성 변환 도구는 무엇인가요? 코드를 쓸 수 있다면 Amazon Polly입니다. 매월 500만 자가 영구 제공되고 결과를 게시할 수 있습니다. 코드를 못 쓴다면 NotebookLM이 개인 청취에 무료입니다. ElevenLabs, Cartesia, Speechify, WellSaid, 우리를 포함한 대부분 소비자 무료 티어는 상업적 이용을 금지하거나 유료 플랜 뒤에 내보내기를 둡니다.
YouTube나 고객 작업에 AI 음성을 써도 되나요? 상업 라이선스를 주는 티어에서만 가능하며 보통 무료 티어가 아닙니다. ElevenLabs는 $6, Cartesia는 $5, Speechify는 $19부터입니다. 위 티어가 아니라 실제 구매할 정확한 티어의 라이선스를 확인하세요. 플랫폼 규칙은 공급업체 라이선스와 별개이며 OpenAI 정책은 음성이 AI 생성임을 공개하도록 추가로 요구합니다.
음성 복제란 무엇이며 허가가 필요한가요? 목소리 샘플을 제공하면 모델이 음색을 재현해 어떤 텍스트든 읽습니다. 목소리 주인의 동의가 필요하며 자신의 목소리도 포함됩니다. 허가 없이 다른 사람 목소리를 복제하는 것은 법적 문제로 가는 가장 빠른 길이고 모든 신뢰할 만한 공급업체 약관이 금지합니다.
어떤 도구가 가장 자연스러운 목소리를 갖나요? 한 목소리가 긴 원고를 읽는다면 우리의 경험상 ElevenLabs입니다. 하지만 “자연스러움”은 음색보다 운율, 글리프의 문자 그대로 읽기, 망가진 이름에서 더 자주 실패합니다. 누구의 순위도 믿지 말고 자신의 최악 문단을 돌리세요.
얼마를 예상해야 하나요? 크리에이터 구독은 대략 월 $5–$25, API는 100만 자당 $4–$30입니다. 무료 티어는 평가와 개인 이용을 다루고 게시에는 보통 첫 유료 티어가 필요합니다.
AI 생성 음성을 감지할 수 있나요? 신뢰성 있게는 못하며 그것을 전제로 계획하면 안 됩니다. 합성 미디어 공개를 요구하는 플랫폼도, 약관으로 요구하는 공급업체도 있습니다. 공개하지 않았다가 적발될 평판 비용이 공개 비용보다 큽니다.
텍스트 음성 변환과 AI 팟캐스트 도구의 차이는 무엇인가요? 텍스트 음성 변환은 원고를 받아 읽습니다. AI 팟캐스트 도구는 원본 문서를 받아 보통 대화로 원고를 쓴 다음 읽습니다. 이미 단어가 있다면 텍스트 음성 변환을 사고, 보고서가 있고 그것에 대한 대화를 원한다면 다른 제품이며 우리가 만드는 것입니다.
API가 필요한가요, 앱이 필요한가요? 음성이 제품 안의 기능이거나 양이 많아 문자당 가격이 구독보다 싸면 API입니다. 음성이 산출물이고 코드를 유지하고 싶지 않다면 앱입니다. 40개 에피소드를 손으로 만들기 위해 API를 사는 것은 흔하고 비싼 실수입니다.
AI 에이전트가 직접 사용할 수 있는 것은 무엇인가요?
ElevenLabs와 ListenHub는 모두 공식 MCP server를 제공해 Claude Desktop, Cursor, Windsurf 에이전트가 통합 없이 도구로 호출합니다. ListenHub는 Claude Code, Cursor, Windsurf, OpenCode용 Agent Skills — npx skills add marswaveai/skills —도 제공합니다. 나머지는 여러분이나 에이전트가 먼저 감싸야 하는 REST API입니다. 실용적 차이는 반환값입니다. ElevenLabs는 오디오 프리미티브, ListenHub는 완성 에피소드, 영상, 덱을 줍니다.
ListenHub API 비용과 무료 키는 어떻게 되나요? 무료를 포함한 모든 계정이 플랜 없이 키를 만들 수 있습니다. 지출은 웹 앱과 같은 잔액인 credits이며 평가가 무료이고 지속적인 양에는 월 $12부터 구독이나 credit pack이 필요합니다. 솔직한 단점은 단위입니다. credits는 문자보다 거칠어 요청당 비용을 센트까지 예측해야 한다면 Polly나 Google Cloud 같은 문자 공급업체가 모델링하기 쉽습니다.
내 서비스에 로그인한 사용자를 대신해 ListenHub를 호출할 수 있나요?
네. 두 SDK 클라이언트가 이를 위한 것입니다. OpenAPIClient는 API key를 쓰고 키 소유자로 동작해 서버, 스크립트, CI에 맞습니다. ListenHubClient는 OAuth user token을 사용해 각 요청을 개별 사용자 계정에서 실행하며 사용자용 앱에 맞습니다. API key를 브라우저나 모바일 코드에 절대 넣지 마세요.
ListenHub는 어떤 언어를 지원하나요? 텍스트 음성 변환과 음성 복제는 영어, 중국어 표준어, 일본어, 스페인어, 포르투갈어, 프랑스어, 독일어, 튀르키예어, 한국어, 이탈리아어, 태국어, 베트남어 12개입니다. AI 팟캐스트 형식은 영어, 중국어, 일본어 3개입니다. API와 MCP에서는 웹 앱 범위를 가정하지 말고 endpoint별 참고 문서를 확인하세요.
우리가 다른 곳으로 보내는 경우
여섯 가지를 분명히 말합니다.
한 목소리가 긴 원고를 아름답게 읽어야 함. ElevenLabs를 사세요. 장문 운율이 전문이고 월 $6은 실제 장벽이 아닙니다.
규모와 예산이 있는 엔지니어. Google Cloud 또는 Polly로 가세요. 구독 판매자는 100만 자당 $4를 이길 수 없고 반복 무료 티어로 프로토타입이 무료입니다.
에이전트가 완성물이 아니라 오디오 프리미티브를 필요로 함. ElevenLabs MCP server를 설치하세요. 전사, speech-to-speech, 음향 효과, 음성 설계, 아웃바운드 콜이 모두 있고 우리 도구 표면은 의도적으로 더 좁습니다.
실시간인 것을 구축. Deepgram 또는 Cartesia. 우리는 지연 SLA를 공개하지 않으며 작업 모델은 렌더용입니다.
우리가 제공하지 않는 언어나 영어·중국어·일본어 외 두 진행자 팟캐스트가 필요. 내레이션 폭은 Google 또는 Azure. 우리 팟캐스트 형식이 음성 카탈로그를 아직 따라잡지 못했습니다.
문서를 자신만 들을 수 있는 요약으로 변환. NotebookLM을 쓰세요. 무료이고 좋으며 개인 통근 청취에는 원고 편집, 브랜딩 제거, 음성 복제가 필요 없습니다.
우리가 더 나은 답은 두 상황입니다. 원본 문서에서 말하기 전에 원고를 편집할 수 있는 완성되고 게시 가능한 다중 음성 프로그램을 원할 때, 그리고 에이전트나 backend가 하나의 키로 오디오와 영상 모두 그런 출력을 만들길 원할 때입니다.
결정하기 전에 직접 테스트하세요
20분이면 이 글을 포함한 어떤 비교 기사보다 많은 것을 알려 줍니다.
- 제품명, 약어, 숫자, 괄호 속 삽입이 있는 실제 최악의 문단을 고르세요. 공급업체 데모 텍스트는 아닙니다.
- 편집하지 않고 후보 세 도구에 넣으세요.
- 헤드폰으로 1x에서 끝까지 들으세요. 빠른 재생은 속도 문제를 숨깁니다.
- 앞서 나온 실패를 세세요. 잘못된 강세, 글리프 그대로 읽기, 망가진 이름, 죽은 차례 주고받기, 균일한 간격입니다.
- 그다음에만 가격을 보세요. 회사명을 틀리게 읽는 도구는 어떤 요율에서도 싸지 않습니다.
- 위 티어가 아니라 실제 구매할 티어의 상업 라이선스를 확인하세요.
테스트에 우리를 넣으려면 텍스트 음성 변환과 AI 팟캐스트가 카드 없이 무료 티어에서 작동합니다. 브라우저보다 터미널에서 평가하고 싶다면 npx skills add marswaveai/skills로 코딩 에이전트 앞에 둘 수 있으며 API 문서는 결제 전부터 열려 있습니다.
경쟁사가 여러분의 텍스트에서 이긴다면 그들은 그 승리를 얻은 것입니다.