As melhores ferramentas de texto para voz em 2026, comparadas
Onze ferramentas comparadas por preço, qualidade de voz e facilidade de uso por um agente de IA, além de uma análise completa do ListenHub — incluindo API, MCP e Agent Skills — e dos casos em que somos a escolha errada.

O ListenHub publica este artigo. Criamos texto para voz, podcasts com IA e clonagem de voz, e vendemos assinaturas, portanto temos um interesse evidente na conclusão que você tira. Ignorar isso seria a maneira mais rápida de perder sua confiança.
Este artigo cumpre duas tarefas, e vale saber qual é qual. A primeira é uma comparação direta de onze produtos de texto para voz, agrupados pelo trabalho para o qual você os contrataria, com todos os preços lidos na página do próprio fornecedor e não em uma lista genérica. A segunda é um relato detalhado do que o ListenHub faz — incluindo a superfície para desenvolvedores e agentes, a parte que a maioria das pessoas nunca vê — e um relato igualmente detalhado de onde somos a escolha errada. Não damos nota de dez a ninguém, muito menos a nós mesmos, e uma seção perto do fim existe apenas para encaminhar você a um concorrente.
A resposta direta
Se você ler apenas uma seção, leia esta.
- Uma voz lendo um roteiro longo com beleza → ElevenLabs, US$ 6/mês.
- Uma API com volume e orçamento → Amazon Polly ou Google Cloud, US$ 4 por milhão de caracteres.
- Agentes de voz em tempo real → Deepgram ou Cartesia.
- E-learning corporativo revisado por conformidade → WellSaid Labs.
- Narração dentro de uma linha do tempo de vídeo → Speechify Studio.
- Um documento transformado em áudio privado e gratuito → NotebookLM.
- Um agente ou código que produz áudio e vídeo finalizados sozinho → ListenHub. Uma chave cobre podcasts, fala, clonagem, música, imagens, slides e vídeo, acessíveis por REST, MCP server, Agent Skills, SDK e CLI.
- Um programa multivoz pronto para publicar a partir de um documento → ListenHub. Estes dois últimos são os trabalhos em que acreditamos ser a resposta certa; as seções abaixo explicam por quê e onde ainda ficamos aquém.
Visão geral
Preços conferidos em 28 de julho de 2026. As unidades variam por fornecedor e aparecem em cada linha, em vez de serem convertidas em uma moeda comum falsa.
| Ferramenta | Melhor para | Camada gratuita | Entrada paga | Clonagem de voz | Acesso por API / agente |
|---|---|---|---|---|---|
| ElevenLabs | Qualidade de narração longa | 10k credits/mês, sem uso comercial | US$ 6/mês | Sim, a partir de US$ 6 | REST, SDKs, MCP server oficial |
| Amazon Polly | API barata em escala | 5M caracteres/mês, contínuo | Pague conforme o uso | Não | AWS SDK, IAM |
| Google Cloud TTS | Maior variedade de vozes via API | 4M caracteres/mês, contínuo | Pague conforme o uso | Não | GCP SDK |
| OpenAI | Um fornecedor, uma chave | Nenhuma | Pague conforme o uso | Somente Enterprise | REST, SDKs |
| Deepgram | Agentes em tempo real | US$ 200 em crédito, uma vez | Pague conforme o uso | Não | REST, SDKs de streaming |
| Cartesia | Streaming barato e de baixa latência | 20k credits/mês, sem uso comercial | US$ 5/mês | Sim, a partir de US$ 5 | REST, SDKs de streaming |
| Azure AI Speech | Empresas no ecossistema Microsoft | 500k caracteres neural/mês | Pague conforme o uso | Sim, restrito | Azure SDK |
| WellSaid Labs | E-learning corporativo | 3 min de download/mês, sem uso comercial | US$ 19/mês | Não | REST |
| Speechify Studio | Voz em linha do tempo de vídeo | 600 credits, sem uso comercial | US$ 19/mês | Sim, a partir de US$ 19 | REST |
| NotebookLM | Resumos de áudio pessoais e gratuitos | 3 gerações/dia | Assinatura Google AI | Não | Nenhum |
| ListenHub | Programas prontos e agentes que os criam | Franquia mensal mais reposição diária | US$ 12/mês, ou US$ 9/mês anual | Sim, todos os planos pagos | REST, MCP server, Agent Skills, SDK, CLI — qualquer conta |
As unidades de cobrança precisam de explicação porque ninguém precifica da mesma forma: Google, AWS e os modelos antigos da OpenAI cobram por caractere; ElevenLabs, Cartesia, Speechify e ListenHub, em credits; WellSaid, por minutos baixados; os modelos novos da OpenAI, em tokens. Essas unidades não são intercambiáveis, e qualquer comparação que as some em uma classificação única está inventando números.
A última coluna é a que a maioria das comparações omite e, em 2026, decide mais compras que a qualidade da voz. Tudo aqui tem API REST. O que muda é se um agente de IA consegue operar sem você escrever uma integração primeiro e o que uma chamada devolve — bytes de áudio ou uma peça de conteúdo finalizada.
Como comparamos e o que não pudemos testar
O que comparamos e quando. Preços publicados, limites gratuitos e termos de uso comercial, lidos na página de cada fornecedor em 28 de julho de 2026 e confrontados com sua documentação, além das questões que decidem compras reais: se sua camada permite publicar, se inclui clonagem de voz, se há um léxico de pronúncia e em que unidade você é cobrado. Preços de TTS mudam constantemente; trate cada número como ponto de partida e confira novamente antes de cadastrar um cartão.
Por que não há notas. Uma avaliação de dez pontos sugere um painel de testes que não realizamos. Quando dizemos que uma ferramenta soa melhor, essa é nossa opinião após usar esses produtos e criar o nosso. Trate essas frases como uma lista curta para testar e use os modos de falha da próxima seção como sua planilha de avaliação. Vinte minutos com seu pior parágrafo valem mais que qualquer ranking, inclusive o nosso.
O que não pudemos verificar. Alguns fornecedores renderizam preços em JavaScript e não deixam uma cifra pública estável para citar. Por isso o Murf aparece abaixo sem números. A Microsoft publica a camada gratuita em texto, mas carrega as tarifas pagas no cliente, então citamos apenas a franquia grátis. PlayHT, LOVO e MiniMax foram removidos por completo: nenhum preço oficial carregou, e os números de terceiros se contradizem e parecem reciclados de anos anteriores. Preferimos cobrir onze ferramentas com fonte a quinze sem fonte.
O que não pudemos testar. Recursos restritos a Enterprise — as custom voices da OpenAI exigem conversa com vendas, então não podemos dizer como soam. Também não medimos latência sob carga de produção, pois o tempo de uma única solicitação não diz nada sobre mil streams simultâneos.
O que realmente faz o texto para voz soar errado
Quase todas as ferramentas aqui superam o antigo padrão: as vozes já não são robóticas. As falhas restantes são mais sutis e o público percebe sem saber nomeá-las. Esta é a parte em que vale treinar o ouvido antes de gastar dinheiro.
Prosódia plana. Em inglês, a ênfase carrega significado. “I didn't say she took the money” tem cerca de sete sentidos conforme a palavra enfatizada. Um modelo que escolhe o padrão estatisticamente médio pode ler a frase corretamente e expressar a ideia errada. Escute o contraste: a voz destaca a palavra que realmente traz informação nova?
Texto escrito para os olhos, lido literalmente. Este é o maior problema e nem sequer é um problema de voz. Seu documento diz “e.g.”, “Fig. 3”, “$1.2M”, “2026-07-28”, “(see below)”. Uma pessoa lendo em voz alta reescreve tudo silenciosamente — “for example”, “figure three”, “one point two million dollars”. A maioria dos mecanismos pronuncia os glifos. Fragmentos em lista são piores: listas escritas não têm verbos e saem como uma pilha de sintagmas nominais desconectados. Criamos uma etapa de conversão de escrito para falado justamente porque essa falha sobrevive a toda melhoria de qualidade de voz.
Nomes e jargões, errados todas as vezes. Nomes de produto, sobrenomes não ingleses, siglas que às vezes são soletradas e às vezes pronunciadas como palavra — “SQL”, “Nginx”, “Xiaomi”, “José”. A consistência é o que torna isso fatal: o nome da sua empresa será pronunciado errado do mesmo modo nos quarenta episódios. Veja se o fornecedor oferece um léxico de pronúncia editável e se ele vale para todo o workspace ou deve ser repetido por projeto.
Sem alternância de fala. Duas vozes renderizadas separadamente e coladas não formam uma conversa. O diálogo real se sobrepõe um pouco, contém respostas curtas e, sobretudo, o tom inicial da segunda pessoa responde ao tom final da primeira. Una dois renders independentes e você terá dois monólogos em um sobretudo.
Ritmo uniforme. Pessoas aceleram em uma lista e desaceleram na conclusão; respiram entre parágrafos, não em cada vírgula. Mecanismos com uma pausa fixa entre frases geram áudio cansativo depois de cerca de dois minutos — algo difícil de ouvir em uma demonstração de quinze segundos.
Isso leva à armadilha da demo. As frases de exemplo são escolhidas porque funcionam. Não julgue nada por elas.
Narração natural para vídeo e cursos
O maior grupo de compradores: você tem um roteiro, precisa de uma voz para lê-lo e dos direitos de publicar o resultado.
ElevenLabs — melhor para narração longa
Grátis US$ 0/mês, 10.000 credits, sem licença comercial, sem clonagem · Entrada paga Starter, US$ 6/mês · Unidade credits
Starter por US$ 6/mês é a entrada real, não a camada gratuita: 30.000 credits, licença comercial e clonagem instantânea. Creator custa US$ 22/mês por 121.000 credits e clonagem profissional; Pro, US$ 99/mês por 600.000. Em narração longa, mantém a prosódia melhor que qualquer ferramenta que usamos — é a menos propensa a perder o fio de uma frase três parágrafos dentro de um capítulo.
Bom: melhor prosódia longa desta lista; clonagem instantânea na camada paga mais barata; forte saída multilíngue com uma única voz clonada; ecossistema real de documentação e integrações.
Não tão bom: a camada gratuita não permite uso comercial nem clonagem, o que pega quem avalia de graça e depois publica; credits são difíceis de converter em minutos mentalmente; os custos sobem rápido depois de Creator.
Conclusão: se o trabalho é uma voz lendo um roteiro longo e precisa soar certo, compre Starter e pare de procurar.
WellSaid Labs — melhor para e-learning corporativo
Grátis 3 minutos de download/mês, sem direitos comerciais · Entrada paga US$ 19/mês, ou US$ 120/ano · Unidade minutos baixados
WellSaid vende para empresas e equipes de e-learning e cobra por minutos baixados, uma unidade fácil para finanças orçar. Starter custa US$ 19/mês, ou US$ 120/ano, por 20 minutos mensais; Pro custa US$ 49/mês, ou US$ 396/ano, por 180. As vozes são menos numerosas e mais conservadoras que as da ElevenLabs — exatamente o que um módulo de treinamento revisado por conformidade procura.
Bom: minutos são uma unidade compreensível para finanças; vozes conservadoras e consistentes que passam pela revisão jurídica; preço anual com desconto real.
Não tão bom: catálogo pequeno para padrões de 2026; sem clonagem; 20 minutos por mês são poucos para produção semanal.
Conclusão: a escolha segura de compras para treinamento e a conta mais fácil de prever nesta lista.
Speechify Studio — melhor para voz dentro de uma edição de vídeo
Grátis 600 credits, sem direitos comerciais · Entrada paga Starter, US$ 19/mês · Unidade credits, 1 por segundo de voz
Speechify Studio é construído em torno de uma linha do tempo de vídeo, não de uma caixa de texto. Starter custa US$ 19/mês por 7.200 credits, clonagem de voz e direitos comerciais; Creator, US$ 49/mês por 28.800. A voz custa 1 credit por segundo, então Starter representa duas horas de narração pronta — um raro sistema de credits que você converte sem planilha.
Bom: taxa de um credit por segundo fácil de entender; voz e edição de vídeo no mesmo lugar; clonagem e direitos comerciais na entrada.
Não tão bom: você pode pagar por um editor que não quer; a qualidade em roteiros longos fica abaixo da ElevenLabs; a camada gratuita é uma demo.
Conclusão: a escolha certa quando o áudio é uma faixa de um projeto de vídeo, não o entregável.
Murf — melhor para trabalho colaborativo em estúdio
Grátis não citado · Entrada paga não citada · Unidade não citada
Murf pertence a este grupo, sobretudo para equipes que querem um estúdio colaborativo com projetos compartilhados. Não citamos preços porque sua página os renderiza no cliente e não conseguimos ler uma cifra que sustentaríamos. Todo o resto tem número; trate a ausência como uma lacuna de nossas fontes, não como veredito sobre o produto.
Conclusão: vale analisar para fluxos em equipe, mas obtenha o preço atual diretamente com a Murf.
Uma API que escala
Aqui a pergunta não é qual voz é mais bonita. Quatro fatores decidem.
Economia unitária. Quanto você paga por caractere, segundo ou trabalho e se a curva permanece razoável no seu volume. As nuvens vencem na síntese pura: US$ 4 por milhão de caracteres é um piso que nenhuma assinatura consegue atravessar.
Latência e formato. Se você precisa de um socket de streaming para uma fala conversacional ou de um trabalho assíncrono para renderizar dez minutos. São produtos diferentes, e um fornecedor otimizado para um costuma ser mediano no outro.
O que uma chamada devolve. O eixo que as pessoas ignoram. A maior parte desta seção retorna bytes de áudio para o texto fornecido — você cuida do roteiro, segmentação, montagem multivoz, tempo de legendas e muxing. Um grupo menor retorna um artefato terminado. Essa diferença vale mais tempo de engenharia que qualquer diferença de preço desta página.
Se um agente consegue operar sozinho. Em 2026 muitas chamadas são feitas por um agente de programação, não por um desenvolvedor no teclado. Importa se o fornecedor oferece uma superfície descobrível pelo agente — MCP server, Agent Skill, SDK tipado — ou se alguém precisa escrever e manter a integração primeiro.
Também considere a durabilidade do fornecedor. Google, AWS, Microsoft e OpenAI não vão desaparecer. O restante é mais jovem, e novos participantes já alteraram preços mais de uma vez.
Google Cloud Text-to-Speech — melhor por variedade
Grátis 4M caracteres/mês Standard e WaveNet, 1M Chirp 3 HD, recorrente · Pago US$ 4–160 por 1M caracteres · Unidade caracteres
A maior variedade útil da lista. Standard e WaveNet custam US$ 4 por milhão depois da franquia gratuita recorrente; Neural2, US$ 16 depois de um milhão grátis; Chirp 3 HD, o atual modelo principal, US$ 30 depois de um milhão grátis; Studio, US$ 160. Os novos Gemini-TTS cobram em tokens e não têm franquia. Uma pegadinha: é preciso ativar faturamento até para usar os caracteres grátis.
Bom: camada gratuita recorrente suficiente para um protótipo real a custo zero; classe de voz para todo orçamento; dezenas de idiomas com variantes locais.
Não tão bom: a escada de US$ 4 a 160 pune quem escolhe a classe sem ler; exige código e não há estúdio; Gemini por tokens quebra a comparação.
Conclusão: a API padrão quando você quer um fornecedor para volume barato e voz principal.
Amazon Polly — melhor para a camada gratuita permanente mais barata
Grátis 5M caracteres Standard/mês, permanente, sem limite de 12 meses · Pago US$ 4–100 por 1M caracteres · Unidade caracteres
Líder de preço na faixa baixa e melhor camada gratuita do setor. Standard custa US$ 4 por milhão, Neural US$ 16, Generative US$ 30, Long-Form US$ 100. Os cinco milhões de caracteres Standard mensais não expiram depois de um ano, algo raro o bastante para ser o destaque.
Bom: única franquia verdadeiramente permanente e em escala; monótono como infraestrutura deve ser; cobrança previsível por caractere.
Não tão bom: classes melhores têm gratuidade temporária; sem clonagem; vozes Standard soam antigas ao lado dos modelos de 2026.
Conclusão: se grátis para sempre importa e você programa, comece aqui.
OpenAI — melhor para equipes que já usam OpenAI
Grátis nenhum · Pago tts-1 US$ 15, tts-1-hd US$ 30 por 1M caracteres · Unidade caracteres ou tokens nos modelos novos
A escolha óbvia se sua stack já está lá e você quer um fornecedor e uma chave. Os modelos antigos são simples: tts-1 a US$ 15 por milhão, tts-1-hd a US$ 30. O novo gpt-4o-mini-tts cobra em tokens, então você não consegue compará-lo com um fornecedor por caractere antes de medir sua própria saída de tokens de áudio.
Bom: uma chave, uma fatura e um SDK se você já usa; bom seguimento de instruções de tom; boa documentação.
Não tão bom: nenhuma camada gratuita — paga desde a primeira chamada; cobrança em tokens é difícil de prever; custom voices exigem conversa com vendas. As políticas da OpenAI também exigem informar que a voz é gerada por IA.
Conclusão: conveniência é o recurso. Ninguém migra para OpenAI só pelas vozes.
Deepgram — melhor para agentes em tempo real
Grátis US$ 200 em crédito, uma vez, sem cartão · Pago Aura-2 US$ 0,030 por 1k caracteres, Aura-1 US$ 0,0150 · Unidade caracteres
Construído para tempo real e agentes, onde latência importa mais que beleza. O cadastro inclui US$ 200 sem cartão — o teste sem compromisso mais generoso daqui, embora único.
Bom: crédito grande o bastante para lançar um protótipo; latência para turnos de conversa; voz para texto do mesmo fornecedor.
Não tão bom: os US$ 200 não voltam; catálogo estreito; não é voltado a narração longa.
Conclusão: resposta certa para agente de voz, errada para audiolivro.
Cartesia — melhor para streaming barato
Grátis 20k credits/mês, sem uso comercial · Entrada paga Pro, US$ 5/mês · Unidade credits
Agressivamente barata para streaming de baixa latência. Pro custa apenas US$ 5/mês por 100.000 credits — mas também é a primeira camada com licença comercial e clonagem instantânea, então a gratuita é apenas sandbox de avaliação. Startup custa US$ 49/mês por 1,25 million credits; Scale, US$ 299/mês por 8 million.
Bom: entrada paga mais barata, US$ 5; clonagem desde essa camada; latência genuinamente baixa.
Não tão bom: não pode publicar do gratuito; empresa mais jovem que as nuvens; catálogo menor.
Conclusão: melhor preço por stream se você cria algo sensível à latência e aceita um fornecedor menor.
Microsoft Azure AI Speech — melhor para empresas no ecossistema Microsoft
Grátis 500k caracteres neural/mês, recorrente e muito limitado · Pago varia por região · Unidade caracteres
Azure publica uma camada F0 recorrente de 500.000 caracteres TTS neural por mês e 5 horas de voz para texto. É limitada e não serve à produção. Não citamos tarifas pagas porque a tabela as carrega no cliente; consulte o portal da sua região, pois Azure varia geograficamente mais que a maioria.
Bom: cobertura profunda de idiomas e locais; conformidade e residência necessárias a grandes empresas; custom neural voice para clientes aprovados.
Não tão bom: preço regional que você precisa consultar; limite transforma o gratuito em demo; console complexo.
Conclusão: se sua empresa já opera no Azure, a decisão já foi tomada.
ElevenLabs — melhor superfície de ferramentas para agentes de áudio
Já foi abordada por qualidade de narração, mas também pertence aqui: ElevenLabs oferece MCP server oficial com uma superfície bem maior que a nossa — fala, transcrição, speech-to-speech, efeitos, música, design de voz e agentes de chamadas — em Claude Desktop, Cursor, Windsurf e OpenAI Agents.
Conclusão: se o trabalho do agente são primitivas de áudio e você quer o maior conjunto por uma conexão MCP, instale. Nossa resposta é menor em primitivas e maior em entregáveis prontos.
ListenHub — melhor para áudio e vídeo com uma chave
Grátis franquia mensal e reposição diária, API key incluída · Entrada paga US$ 12/mês, ou US$ 9/mês anual · Unidade credits
Nossa API é o motivo de esta seção ter crescido, então esta é sua forma honesta. Não é endpoint de síntese mais barato por caractere, mas outra unidade de trabalho. Um POST inicia um job que volta como artefato pronto: episódio de dois apresentadores com roteiro, narração com SRT, vídeo explicativo renderizado, deck, trilha ou imagem. Jobs são assíncronos — você cria e consulta — porque um render de dez minutos não é uma ida e volta HTTP.
Uma API key acessa tudo: podcasts, texto para voz, clonagem de voz, música, imagens, vídeo explicativo, slides, vídeo IA e extração de URL ou arquivo. Sem segundo fornecedor para vídeo, sem código para colar áudio em visual, um saldo e uma fatura. A superfície completa aparece abaixo.
Bom: entregáveis prontos, não bytes; áudio e vídeo sob uma chave; quatro formas oficiais (REST, MCP, Agent Skills, SDK/CLI) para o agente operar sem integração; qualquer conta cria chave e avalia grátis; modelo assíncrono adequado a renders; SDK abre resposta e repete limites.
Não tão bom: credits são mais grossos que caracteres e o custo é menos previsível que Polly; a franquia gratuita é pequena diante de 5 milhões de caracteres e volume contínuo exige assinatura ou credit packs; ElevenLabs oferece mais ferramentas de áudio no MCP; não publicamos SLA e não deve ser usado em agente de voz em tempo real.
Conclusão: chamada certa para agente ou backend emitir conteúdo pronto e publicável. Errada para síntese massiva barata ou streaming subsegundo.
Um programa pronto, não um clipe
Uma categoria diferente arquivada em “texto para voz” porque as pessoas pesquisam assim. Você não tem roteiro; tem um documento e quer duas pessoas discutindo-o.
NotebookLM — melhor para escuta pessoal gratuita
Grátis 3 gerações de áudio/dia com qualquer conta Google · Pago via assinatura Google AI · Unidade gerações
Grátis e excelente nisso. Você envia fontes e ele cria um resumo com dois apresentadores; os documentos do Google colocam o plano gratuito em 3 gerações por dia e 50 consultas de chat. Se a necessidade é ocasional e pessoal — transformar um PDF denso em algo para caminhar — é difícil competir com grátis.
Bom: realmente grátis; conversa convincente; nenhuma configuração.
Não tão bom: não dá para editar o roteiro antes de falar, escolher vozes, clonar ou remover marca; uma saída fixa; não foi feito para publicar em calendário.
Conclusão: melhor forma gratuita de ouvir seus documentos, não ferramenta de produção.
ListenHub — melhor para programa multivoz publicável
Grátis franquia mensal e reposição diária · Entrada paga US$ 12/mês, ou US$ 9/mês anual · Unidade credits
É o que construímos, então leia com a desconfiança adequada e veja a próxima seção, a versão longa e honesta, inclusive sobre nossas falhas. Em uma linha: NotebookLM dá um resumo; ListenHub dá um programa que você edita, personaliza e publica.
Bom: roteiro editável antes de qualquer fala; doze idiomas em texto para voz e clonagem; reescrita de escrito para falado que corrige leitura literal; áudio, SRT, vídeo e slides com um saldo.
Não tão bom: AI podcast ainda só gera em inglês, chinês e japonês; edição, exportação, clonagem e remoção de marca exigem plano pago, então o gratuito é para ouvir, não publicar; custo não chega a US$ 4 por milhão; sem linha do tempo; ElevenLabs é melhor para uma voz longa.
Conclusão: compre quando o entregável é um programa multivoz pronto a partir de uma fonte. Para a maioria dos outros trabalhos, outra ferramenta é melhor.
O que o ListenHub realmente faz
Você traz relatório, artigo, URL ou roteiro e quer algo que as pessoas realmente escutem. Quatro coisas acontecem aqui que uma caixa TTS simples não faz e são todo o motivo para nos escolher.
Primeiro reescreve texto escrito como fala. É a etapa de escrito para falado e resolve a maior falha do artigo. “Fig. 3 shows a 12.4% YoY increase (see Appendix B)” vira algo que uma pessoa diria. Fragmentos ganham verbos e abreviações são expandidas. Você pode desligar e ler palavra por palavra se o texto já for conversacional — um aviso jurídico deve ser lido como está.
Escreve diálogo, não dois monólogos colados. O problema de alternância é de roteiro antes de síntese. Dois apresentadores recebem um diálogo em que o segundo responde ao que o primeiro realmente disse.
Você edita o roteiro antes de qualquer fala. É a diferença entre brinquedo e ferramenta. Você vê, corrige a frase que entendeu seu posicionamento errado, corta a tangente e só então gasta credits. Corrigir texto é grátis; renderizar áudio novamente não. A edição começa no Basic.
Um saldo cobre tudo. Áudio com SRT, vídeo explicativo, slides, imagens — mesmos credits, sem outra assinatura. Exportação e remoção de marca também começam no Basic, então o gratuito serve para ouvir, não publicar.
Uma API e uma superfície para agentes
É a metade que não aparece em tabela e a mais interessante para desenvolvedores. Tudo que a web faz é programável por quatro superfícies oficiais, com a mesma API key e o mesmo saldo.
API REST. Crie uma chave em Settings → API keys, formato lh_sk_…, e chame https://api.marswave.ai/openapi. Respostas usam { code, message, data }, com code não zero para erro. A geração é assíncrona: crie e consulte a tarefa, pois episódio ou vídeo leva minutos. Endpoints cobrem podcasts, TTS, ListenHub Voice para áudio completo, música, imagens, explicador, slides, vídeo IA, busca de voz, extração de URL/arquivo e assinatura. A documentação tem a referência; parâmetros e idiomas por endpoint ficam lá porque mudam mais rápido que o blog.
MCP server. ListenHub oferece um Model Context Protocol server para clientes — Claude Desktop, Cursor, Windsurf, VS Code, Zed — gerarem podcasts, narração, consultarem vozes e conta por ferramentas em vez de HTTP. Cada ferramenta envolve endpoint público. Roda em stdio ou HTTP/SSE e autentica por LISTENHUB_API_KEY. create_podcast consulta até terminar, então uma chamada devolve episódio pronto, não task id. Veja os documentos MCP.
Agent Skills. A primeira superfície que indicaríamos a um agente de programação:
npx skills add marswaveai/skills
Instala ListenHub Skills em ferramentas com Agent Skills — Claude Code, Cursor, Windsurf, OpenCode. Depois a instrução é natural: transforme este artigo em vídeo, faça podcast de duas pessoas com estas URLs. O agente escolhe vozes, gera, consulta e entrega o artefato com link. Há skills individuais para voz, podcast, TTS, vídeo explicativo, slides, imagens, música, transcrição e parsing, permitindo compor uma pipeline.
SDK e CLI. @marswave/listenhub-sdk é o cliente JavaScript/TypeScript tipado oficial — somente ESM, tipos incluídos, uma dependência, Node 20+. Abre a resposta e repete 429. Exporta dois clientes: OpenAPIClient usa API key para servidores, scripts e CI como dono da chave; ListenHubClient usa tokens OAuth para cada solicitação rodar como usuário conectado, ideal para produtos. @marswave/listenhub-cli envolve o SDK como listenhub: listenhub … após login OAuth para interativo, listenhub openapi … com chave para CI. Documentos do SDK e CLI.
Escolha programática de vozes. A busca devolve ID, nome, pitch, speed, traits, styles, suggested scenes, accent, description e descrições localizadas. Um agente escolhe por um briefing como “narradora feminina calorosa para audiolivro”, em vez de fixar ID. Há catálogo de texto em /voices.txt.
Duas clarezas. Nenhum plano é obrigatório: qualquer conta cria chave e avalia a API na franquia gratuita sem cartão; um protótipo de fim de semana é grátis. Você precisa de credits: API e web gastam o mesmo saldo, então automação e uso manual saem do mesmo pote; volume contínuo exige assinatura ou credit pack. Credits são mais grossos que caracteres e mais difíceis de prever.
Idiomas e vozes
Texto para voz e clonagem funcionam em doze idiomas: inglês, mandarim, japonês, espanhol, português, francês, alemão, turco, coreano, italiano, tailandês e vietnamita. O catálogo público tem etiquetas e descrições para filtrar idioma, gênero e entrega. Também há /voices.txt para agentes.
Seja preciso: doze idiomas valem para TTS e clonagem. AI podcast e as outras ferramentas ainda geram em inglês, chinês e japonês. Se você precisa hoje de podcast em espanhol com dois apresentadores, ainda não chegamos lá.
Clonagem de voz
Clone sua voz de uma amostra e use onde uma voz de catálogo funciona, nos doze idiomas. Todos os planos pagos incluem clonagem — Basic 1, Pro 4, Max 20 — e vozes além do limite custam 300 credits cada. A guia explica a amostra; três minutos limpos vencem trinta ruidosos.
Quanto custa
Basic custa US$ 12/mês, ou US$ 9/mês anual, com 1.300 credits e um clone. Pro custa US$ 24/mês, ou US$ 19/mês anual, com 2.700 e quatro. Max custa US$ 240/mês, ou US$ 200/mês anual, com 30.000 e vinte. API, MCP e Agent Skills não dependem do plano e funcionam até no gratuito, gastando o saldo disponível.
Em trabalho: podcast de 5 minutos custa cerca de 24 credits, 10 minutos de TTS cerca de 40, deck de 10 páginas cerca de 150. Pro dá cerca de 11 horas de fala se usado só nisso. O gratuito tem franquia mensal e recarga diária; a página de preços mostra o número atual, que muda demais para fixar aqui. A guia de credits explica os três tipos e a ordem de gasto.
Onde somos mais fracos
De forma direta, porque você descobrirá:
- Custo em volume. Polly e Google custam US$ 4 por milhão. Assinatura não compete.
- Polimento longo de uma voz. ElevenLabs mantém melhor prosódia em roteiro muito longo.
- Amplitude de áudio para agentes. MCP da ElevenLabs expõe transcrição, speech-to-speech, isolamento, design e chamadas. O nosso visa entregáveis.
- Sem medição por caractere. Você gasta credits, mais difícil de prever que US$ 4/milhão, e a franquia é uma fração de 5 milhões da Polly.
- Sem SLA de latência. Modelo para render, não tempo real. Não use em agente ao vivo.
- Edição de vídeo. Speechify dá timeline; nós, exportação.
- Idiomas de podcast. Doze em TTS/clonagem, três no formato.
- Compras empresariais. Sem garantias de residência ou contratos como Azure/AWS.
Camadas gratuitas comparadas
Uma camada gratuita pode ser produto ou demo. O que importa é poder publicar.
| Ferramenta | Franquia gratuita | Recorrente? | Publicar grátis? |
|---|---|---|---|
| Amazon Polly | 5M caracteres Standard/mês | Sim, sem prazo | Sim |
| Google Cloud | 4M Standard, 1M Chirp 3 HD/mês | Sim | Sim |
| Azure | 500k neural/mês | Sim, limitado | Sim |
| Deepgram | US$ 200 | Não, uma vez | Sim |
| NotebookLM | 3 gerações/dia | Sim | Uso pessoal |
| ElevenLabs | 10k credits/mês | Sim | Não |
| Cartesia | 20k credits/mês | Sim | Não |
| Speechify | 600 credits | Sim | Não |
| WellSaid | 3 min de download/mês | Sim | Não |
| ListenHub | Mensal mais diária | Sim | Não, exportar exige plano |
As cinco últimas são honestas e inúteis se você quer publicar. Nós nos colocamos nesse grupo: gratuito sem exportação é sandbox. Orce a entrada paga desde o primeiro dia — US$ 6, 5, 19, 19 e 12. As melhores vozes da Polly também têm prazo: Neural 1 milhão, Long-Form 500.000, Generative 100.000 por mês, só nos primeiros 12 meses.
Se grátis é requisito rígido e você publicará, escolha Polly ou Google Cloud e escreva código.
Idiomas além do inglês
As nuvens vencem em amplitude. Google, Azure e Polly cobrem dezenas de idiomas com vozes nativas e variantes locais, pois começaram antes da onda atual. ElevenLabs é forte em uma mesma voz falando vários idiomas — uma capacidade diferente e útil.
O marketing escorrega entre suportado e bom. Muitos anunciam muitos idiomas servidos por um modelo multilíngue e poucas vozes ajustadas ao inglês. OpenAI reconhece isso. Peça amostra no idioma alvo com uma voz realmente vendida para ele e peça a um nativo que ouça.
Nesse padrão, nossa posição sem arredondar: doze idiomas em TTS e clonagem, com vozes do catálogo, não uma voz inglesa com sotaque; três no podcast. Se precisa hindi, árabe ou indonésio, nós não servimos e Google/Azure sim.
Qual escolher?
Criador solo publicando vídeo narrado. ElevenLabs Starter, US$ 6/mês. Speechify apenas se quiser timeline.
Equipe de L&D ou treinamento. WellSaid Labs. Minutos são orçáveis e vozes passam no jurídico.
Engenheiro que precisa de síntese no produto. Google Cloud ou Polly. Prototipe no gratuito e escolha a classe conscientemente — US$ 4 versus 160 por milhão é um dropdown.
Construindo agente de voz. Deepgram ou Cartesia. Latência e custo por stream importam; catálogo não.
Agente produzindo conteúdo pronto sozinho. ListenHub Skills ou MCP. npx skills add marswaveai/skills transforma URL em episódio ou vídeo sem integração. Nenhum plano para começar; conta grátis tem chave e depois você gasta credits. Para primitivas, instale MCP da ElevenLabs ou ambos.
Pipeline em CI. Nosso SDK ou CLI com chave, ou nuvens se só precisa síntese. listenhub openapi … existe para scripts.
Estudante ou pesquisador com PDF denso. NotebookLM, grátis. Quando precisar edição e publicação, você o superou.
Programa publicado a partir de documentos. ListenHub. Roteiro editável, multivoz, exportação sem marca, saldo comum.
Requisito realmente US$ 0 e você programa. Polly, depois Google Cloud. Os outros proíbem publicação ou acabam.
Perguntas reais
Qual é a melhor ferramenta gratuita? Amazon Polly se você programa: cinco milhões de caracteres mensais, para sempre, com publicação. Se não programa, NotebookLM para escuta pessoal. As gratuitas de ElevenLabs, Cartesia, Speechify, WellSaid e nossa proíbem uso comercial ou exportação.
Posso usar voz IA no YouTube ou em trabalho de cliente? Somente em camada com licença comercial, normalmente paga. ElevenLabs desde US$ 6, Cartesia US$ 5, Speechify US$ 19. Confira a camada exata. Regras da plataforma são separadas e OpenAI exige divulgar IA.
O que é clonagem e preciso de permissão? Você fornece amostra e o modelo reproduz o timbre para ler qualquer texto. Precisa do consentimento da pessoa — sua própria voz conta. Clonar terceiros sem permissão leva rápido a problema jurídico e fornecedores sérios proíbem.
Qual tem vozes mais naturais? Para uma voz longa, ElevenLabs em nossa experiência. Mas naturalidade falha mais em prosódia, leitura literal e nomes que em timbre; teste seu pior parágrafo.
Quanto devo pagar? Cerca de US$ 5–25/mês por assinatura ou US$ 4–30 por milhão em API. Gratuito cobre avaliação e uso pessoal; publicação costuma começar na primeira camada paga.
Fala gerada por IA pode ser detectada? Não de modo confiável e não planeje contando com isso. Plataformas e fornecedores exigem divulgação, e o dano de esconder é maior que o de declarar.
Diferença entre TTS e podcast IA? TTS lê um roteiro. Podcast IA recebe documento, escreve roteiro — geralmente diálogo — e lê. Se já tem palavras, compre TTS. Se tem relatório e quer conversa, é outro produto, o nosso.
Preciso de API ou aplicativo? API se voz é recurso do produto ou volume torna caracteres mais baratos. Aplicativo se voz é entregável e você não quer manter código. Comprar API para fazer quarenta episódios à mão é erro caro.
Quais um agente usa diretamente?
ElevenLabs e ListenHub têm MCP oficial para Claude Desktop, Cursor e Windsurf. ListenHub também tem Agent Skills — npx skills add marswaveai/skills — para Claude Code, Cursor, Windsurf, OpenCode. Os demais são REST a envolver. ElevenLabs devolve primitivas; ListenHub, episódio, vídeo ou deck pronto.
Quanto custa a API ListenHub e há chave grátis? Qualquer conta cria chave sem plano. Gasta credits da web; avaliação é grátis, volume requer assinatura desde US$ 12 ou credit pack. Credits são mais grossos que caracteres; para prever centavos, Polly/Google são mais fáceis.
Posso chamar pelo usuário logado do meu app?
Sim. OpenAPIClient usa API key como dono para servidor, script e CI. ListenHubClient usa OAuth por usuário para apps. Nunca envie chave no navegador ou mobile.
Quais idiomas o ListenHub suporta? Doze em TTS e clonagem: inglês, mandarim, japonês, espanhol, português, francês, alemão, turco, coreano, italiano, tailandês e vietnamita. Três no podcast: inglês, chinês, japonês. Em API/MCP, veja a referência por endpoint.
Quando mandaríamos você para outro lugar
Seis casos claros:
Uma voz lendo roteiro longo com beleza. Compre ElevenLabs. Prosódia longa é especialidade e US$ 6 não é barreira.
Engenheiro com volume e orçamento. Google Cloud ou Polly. Assinatura não supera US$ 4/milhão e o gratuito faz protótipo grátis.
Agente precisa de primitivas, não peças prontas. MCP da ElevenLabs. Transcrição, speech-to-speech, efeitos, design e chamadas; nossa superfície é menor.
Algo em tempo real. Deepgram ou Cartesia. Sem SLA e nosso modelo é para renders.
Idioma não servido ou podcast de duas pessoas fora de inglês, chinês e japonês. Google ou Azure. Nosso formato não alcançou o catálogo.
Documento transformado em resumo privado. NotebookLM. É grátis e bom; escuta pessoal não precisa edição, remoção de marca ou clonagem.
Somos melhores em duas situações: programa multivoz pronto e publicável a partir de fonte com roteiro editável antes de falar; e agente ou backend produzindo esse tipo de áudio e vídeo com uma chave.
Faça seu teste antes de decidir
Vinte minutos dizem mais que qualquer comparação, inclusive esta.
- Use seu pior parágrafo real — nomes, siglas, números, parênteses. Não a demo.
- Passe sem editar pelas três opções.
- Ouça em 1x com fones até o fim. Velocidade esconde problemas.
- Conte falhas: ênfase errada, símbolos literais, nomes ruins, turnos mortos, pausas iguais.
- Só então veja preço. Uma ferramenta que erra sua empresa não é barata.
- Confira licença comercial da camada exata, não a superior.
Para testar a nossa, texto para voz e AI podcast rodam grátis sem cartão. Se preferir terminal, npx skills add marswaveai/skills coloca diante do agente, e a documentação API é aberta antes de pagar.
E se um concorrente vencer com seu texto, ele mereceu.