Comparisons

Las mejores herramientas de texto a voz de 2026, comparadas

Comparamos once herramientas por precio, calidad de voz y facilidad de uso por un agente de IA, además de explicar todo lo que hace ListenHub —API, MCP y Agent Skills incluidos— y cuándo somos la elección equivocada.

ListenHub TeamPublicado Actualizado
Una tarjeta de título con degradado morado oscuro y magenta, la etiqueta COMPARISON, el titular «Las mejores herramientas de texto a voz, comparadas» y la marca ListenHub sobre listenhub.ai

ListenHub publica este artículo. Creamos texto a voz, pódcast con IA y clonación de voz, y vendemos suscripciones, así que tenemos un interés evidente en la conclusión que saques. Ignorarlo sería la forma más rápida de perder tu confianza.

Este artículo cumple dos funciones, y conviene saber cuál es cuál. La primera es una comparación directa de once productos de texto a voz, agrupados según el trabajo para el que los contratarías, con todos los precios tomados de la página del propio proveedor y no de una lista. La segunda es una explicación detallada de lo que hace ListenHub —incluida la superficie para desarrolladores y agentes, la parte que casi nadie ve— y una explicación igual de detallada de cuándo somos la elección equivocada. No damos a nadie una nota sobre diez, y mucho menos a nosotros mismos; una sección cerca del final existe exclusivamente para enviarte a un competidor.

La respuesta rápida

Si solo lees una sección, que sea esta.

  • Una voz que lea un guion largo con gran calidadElevenLabs, 6 $/mes.
  • Una API con volumen y presupuesto limitadoAmazon Polly o Google Cloud, 4 $ por millón de caracteres.
  • Agentes de voz en tiempo realDeepgram o Cartesia.
  • E-learning empresarial revisado por cumplimientoWellSaid Labs.
  • Narración dentro de una línea de tiempo de vídeoSpeechify Studio.
  • Convertir un documento en una escucha privada y gratuitaNotebookLM.
  • Un agente o repositorio que produzca audio y vídeo terminados por sí soloListenHub. Una clave cubre pódcast, voz, clonación, música, imágenes, diapositivas y vídeo mediante REST, un MCP server, Agent Skills, un SDK y una CLI.
  • Un programa multivoz terminado y publicable a partir de un documentoListenHub. Estos dos últimos son los trabajos para los que creemos ser la respuesta correcta; las secciones siguientes explican por qué y dónde seguimos quedándonos cortos.

De un vistazo

Precios comprobados el 28 de julio de 2026. Las unidades varían por proveedor y aparecen en cada fila, en lugar de convertirse a una falsa moneda común.

HerramientaMejor paraNivel gratuitoEntrada de pagoClonación de vozAcceso API / agentes
ElevenLabsCalidad de narración larga10k credits/mes, sin uso comercial6 $/mesSí, desde 6 $REST, SDK, MCP server oficial
Amazon PollyAPI barata a gran volumen5M caracteres/mes, permanentePago por usoNoAWS SDK, IAM
Google Cloud TTSMayor variedad de voces por API4M caracteres/mes, permanentePago por usoNoGCP SDK
OpenAIUn proveedor y una claveNingunoPago por usoSolo EnterpriseREST, SDK
DeepgramAgentes en tiempo real200 $ de crédito, una vezPago por usoNoREST, SDK de streaming
CartesiaStreaming barato y de baja latencia20k credits/mes, sin uso comercial5 $/mesSí, desde 5 $REST, SDK de streaming
Azure AI SpeechEmpresas con ecosistema Microsoft500k caracteres neural/mesPago por usoSí, restringidoAzure SDK
WellSaid LabsE-learning empresarial3 min de descarga/mes, sin uso comercial19 $/mesNoREST
Speechify StudioVoz en una línea de tiempo de vídeo600 credits, sin uso comercial19 $/mesSí, desde 19 $REST
NotebookLMResúmenes de audio personales y gratuitos3 generaciones/díaSuscripción Google AINoNinguno
ListenHubProgramas terminados y agentes que los creanAsignación mensual más recarga diaria12 $/mes, o 9 $/mes anualSí, todos los planes de pagoREST, MCP server, Agent Skills, SDK, CLI — cualquier cuenta

Las unidades de facturación merecen una aclaración porque nadie cobra igual: Google, AWS y los modelos antiguos de OpenAI cobran por carácter; ElevenLabs, Cartesia, Speechify y ListenHub, en credits; WellSaid, por minutos descargados; los modelos nuevos de OpenAI, por tokens. No son unidades intercambiables, y cualquier comparación que las sume en una clasificación común está inventando los números.

La última columna es la que la mayoría de comparaciones omite, y en 2026 determina más compras que la calidad de voz. Todo lo incluido aquí tiene una API REST. Lo que cambia es si un agente de IA puede utilizarla sin que primero escribas una integración y qué devuelve una llamada: bytes de audio o una pieza de contenido terminada.

Cómo comparamos y qué no pudimos probar

Qué comparamos y cuándo. Precios publicados, límites gratuitos y condiciones de uso comercial, leídos en la página de cada proveedor el 28 de julio de 2026 y contrastados con su documentación, además de las preguntas que deciden compras reales: si tu nivel permite publicar, si incluye clonación de voz, si hay un léxico de pronunciación y en qué unidad se factura. Los precios TTS cambian continuamente; toma cada cifra como punto de partida y vuelve a comprobarla antes de registrar una tarjeta.

Por qué no hay puntuaciones. Una nota sobre diez sugiere un panel de evaluación que no realizamos. Cuando decimos que una herramienta suena mejor, es nuestra opinión tras usar estos productos y construir el nuestro. Trata esas líneas como una lista corta para probar y usa los fallos de la sección siguiente como hoja de evaluación. Veinte minutos con tu peor párrafo valen más que la clasificación de cualquiera, incluida la nuestra.

Qué no pudimos verificar. Algunos proveedores renderizan los precios con JavaScript y no dejan una cifra publicada estable que podamos citar. Por esa razón, Murf aparece más abajo sin números. Microsoft publica el nivel gratuito como texto, pero carga las tarifas de pago en el cliente, así que solo citamos la asignación gratuita. Eliminamos por completo PlayHT, LOVO y MiniMax: no cargó ningún precio de primera mano y las cifras de terceros se contradicen y parecen recicladas de años anteriores. Preferimos cubrir once herramientas con fuentes que quince sin ellas.

Qué no pudimos probar. Las funciones restringidas a Enterprise: las voces personalizadas de OpenAI requieren hablar con ventas, así que no podemos decir cómo suenan. Tampoco medimos la latencia bajo carga de producción, porque el tiempo de una sola petición no dice nada sobre mil streams simultáneos.

Qué hace que el texto a voz suene mal de verdad

Casi todas las herramientas superan ya el antiguo umbral: las voces dejaron de ser robóticas. Los fallos restantes son más sutiles y el público los nota aunque no sepa nombrarlos. Esta es la parte con la que conviene entrenar el oído antes de gastar dinero.

Prosodia plana. En inglés, el acento transmite significado. «I didn't say she took the money» tiene unas siete interpretaciones según la palabra destacada. Un modelo que elija el patrón estadísticamente medio leerá bien la frase y expresará otra cosa. Escucha el contraste: ¿la voz resalta la palabra que realmente aporta información nueva?

Texto escrito para la vista, leído literalmente. Este es el gran problema y ni siquiera es un problema de voz. Tu documento dice «e.g.», «Fig. 3», «$1.2M», «2026-07-28», «(see below)». Una persona que lee en voz alta reescribe todo sin pensarlo: «for example», «figure three», «one point two million dollars». La mayoría de motores pronuncia los símbolos. Los fragmentos con viñetas son peores: las listas escritas no tienen verbos y se convierten en una pila de sintagmas nominales desconectados. Construimos un paso de conversión de escrito a hablado precisamente porque este fallo sobrevive a todas las mejoras de calidad de voz.

Nombres y jerga, mal pronunciados siempre. Nombres de producto, apellidos no ingleses, siglas que a veces se deletrean y otras se pronuncian como palabra: «SQL», «Nginx», «Xiaomi», «José». La consistencia lo hace letal: pronunciará mal el nombre de tu empresa de la misma manera en cuarenta episodios. Comprueba si el proveedor tiene un léxico de pronunciación editable y si se aplica a todo el espacio de trabajo o debe introducirse en cada proyecto.

Sin turnos de palabra. Dos voces renderizadas por separado y unidas no forman una conversación. El diálogo real se solapa un poco, contiene respuestas breves y, sobre todo, el tono inicial del segundo hablante responde al tono final del primero. Une dos renders independientes y tendrás dos monólogos bajo una gabardina.

Ritmo uniforme. Las personas aceleran al recorrer una lista y frenan al llegar a una conclusión; respiran entre párrafos, no en cada coma. Los motores que aplican una pausa fija entre frases producen un audio agotador al pasar de unos dos minutos, y esto casi no se percibe en una demo de quince segundos.

De ahí la trampa de las demostraciones. Las frases de muestra del proveedor se eligen porque funcionan. No juzgues nada por ellas.

Narración natural para vídeo y cursos

El grupo de compradores más grande: ya tienes un guion, necesitas una voz que lo lea y derechos para publicar el resultado.

ElevenLabs — mejor para narración larga

Gratis 0 $/mes, 10.000 credits, sin licencia comercial, sin clonación · Entrada de pago Starter, 6 $/mes · Unidad credits

Starter, por 6 $ al mes, es la entrada real, no el nivel gratuito: 30.000 credits, licencia comercial y clonación instantánea. Creator cuesta 22 $/mes por 121.000 credits y clonación profesional; Pro, 99 $/mes por 600.000. En narración larga mantiene la prosodia mejor que cualquier herramienta que hayamos usado: es la que menos probablemente pierde el hilo de una frase tres párrafos después de comenzar un capítulo.

Bueno: la mejor prosodia larga de la lista; clonación instantánea desde el nivel de pago más barato; sólida salida multilingüe con una sola voz clonada; un ecosistema real de documentación e integraciones.

No tan bueno: el nivel gratuito no permite uso comercial ni clonación, lo que atrapa a quien evalúa gratis y luego publica; cuesta convertir credits a minutos mentalmente; el precio sube rápido por encima de Creator.

Conclusión: si el trabajo es una voz leyendo un guion largo y debe sonar bien, compra Starter y deja de buscar.

WellSaid Labs — mejor para e-learning empresarial

Gratis 3 minutos de descarga/mes, sin derechos comerciales · Entrada de pago 19 $/mes, o 120 $/año · Unidad minutos descargados

WellSaid vende a equipos empresariales y de e-learning y cobra por minutos descargados, una unidad fácil de presupuestar. Starter cuesta 19 $/mes, o 120 $/año, por 20 minutos mensuales; Pro, 49 $/mes, o 396 $/año, por 180. Las voces son menos numerosas y más conservadoras que las de ElevenLabs: exactamente lo que desea un módulo formativo revisado por cumplimiento.

Bueno: los minutos son una unidad que entiende finanzas; voces conservadoras y constantes que superan revisión legal; precio anual con descuento real, no un truco de redondeo.

No tan bueno: catálogo pequeño para 2026; sin clonación de voz; 20 minutos mensuales son pocos si produces cada semana.

Conclusión: la opción segura de compras para contenido formativo y la factura más fácil de prever de esta lista.

Speechify Studio — mejor para voz dentro de una edición de vídeo

Gratis 600 credits, sin derechos comerciales · Entrada de pago Starter, 19 $/mes · Unidad credits, 1 por segundo de voz

Speechify Studio se organiza alrededor de una línea de tiempo de vídeo y no de un cuadro de texto. Starter cuesta 19 $/mes por 7.200 credits, clonación de voz y derechos comerciales; Creator, 49 $/mes por 28.800. La voz consume 1 credit por segundo, así que Starter equivale a dos horas de narración terminada: un sistema de credits que puedes convertir mentalmente sin una hoja de cálculo.

Bueno: una tasa de un credit por segundo fácil de razonar; voz y edición de vídeo juntas; clonación y derechos comerciales en el nivel de entrada.

No tan bueno: pagas por un editor que quizá no quieras; la calidad en guiones largos queda por debajo de ElevenLabs; el nivel gratuito es una demo.

Conclusión: la elección adecuada cuando el audio es una pista de un proyecto de vídeo, no el entregable.

Murf — mejor para trabajo colaborativo de estudio

Gratis sin cifra · Entrada de pago sin cifra · Unidad sin cifra

Murf pertenece a este grupo, especialmente para equipos que buscan un estudio colaborativo con proyectos compartidos. No damos precios porque su página los renderiza en el cliente y no pudimos leer una cifra que estuviéramos dispuestos a respaldar. Todo lo demás tiene un número; interpreta la ausencia como una limitación de nuestras fuentes, no como un juicio del producto.

Conclusión: vale la pena revisarlo para flujos de equipo, pero pide el precio actual directamente a Murf.

Una API que puedes escalar

Aquí la pregunta no es qué voz resulta más bonita. Cuatro factores lo deciden.

Economía unitaria. Cuánto pagas por carácter, segundo o trabajo y si la curva sigue siendo razonable a tu volumen. Las nubes ganan con claridad en síntesis pura: 4 $ por millón de caracteres es un suelo que ninguna suscripción puede rebajar.

Latencia y forma. Si necesitas un socket de streaming para un turno conversacional o un trabajo que lanzas y olvidas para un render de diez minutos. Son productos distintos y un proveedor optimizado para uno suele ser mediocre en el otro.

Qué devuelve una llamada. El eje que suele omitirse. La mayoría de esta sección devuelve bytes de audio para el texto que suministras: tú gestionas el guion, la segmentación, el montaje multivoz, los tiempos de subtítulos y el muxing. Un grupo menor devuelve un artefacto terminado. Esa diferencia vale más horas de ingeniería que cualquier diferencia de precio de esta página.

Si un agente puede manejarla sin ayuda. En 2026 muchas llamadas las realiza un agente de programación, no un desarrollador al teclado. Importa si el proveedor ofrece una superficie que el agente pueda descubrir e invocar —MCP server, Agent Skill, SDK tipado— o si alguien debe escribir y mantener primero la integración.

También conviene considerar la durabilidad del proveedor. Google, AWS, Microsoft y OpenAI no van a desaparecer. El resto de la lista es más joven y los nuevos participantes han cambiado precios más de una vez.

Google Cloud Text-to-Speech — mejor por variedad

Gratis 4M caracteres/mes Standard y WaveNet, 1M Chirp 3 HD, recurrente · Pago 4–160 $ por 1M caracteres · Unidad caracteres

La variedad útil más amplia de la lista. Standard y WaveNet cuestan 4 $ por millón de caracteres después de la asignación gratuita recurrente; Neural2, 16 $ después de un millón gratuito; Chirp 3 HD, el buque insignia actual, 30 $ después de un millón gratuito; Studio, 160 $. Los nuevos modelos Gemini-TTS facturan en tokens y no tienen asignación gratuita. Un inconveniente: debes activar facturación incluso para usar los caracteres gratuitos.

Bueno: un nivel gratuito recurrente suficiente para ejecutar un prototipo real a coste cero; una clase de voz para cada presupuesto; decenas de idiomas con variantes regionales.

No tan bueno: la escala de 4 a 160 $ castiga a quien elige una clase sin leer; hay que programar y no existe estudio; los modelos Gemini por tokens rompen la comparación.

Conclusión: la API predeterminada cuando quieres que un proveedor cubra tanto volumen barato como una voz de primera línea.

Amazon Polly — mejor para el nivel gratuito permanente más barato

Gratis 5M caracteres Standard/mes, permanente sin límite de 12 meses · Pago 4–100 $ por 1M caracteres · Unidad caracteres

Líder de precio en la gama baja y mejor nivel gratuito del sector. Standard cuesta 4 $ por millón de caracteres, Neural 16 $, Generative 30 $, Long-Form 100 $. Los cinco millones de caracteres Standard al mes no caducan al año, algo tan raro que merece ser el titular.

Bueno: la única asignación realmente permanente y a escala; aburrido como debe ser la infraestructura; facturación previsible por carácter.

No tan bueno: las mejores clases tienen gratuidad temporal; sin clonación; las voces Standard suenan antiguas junto a los modelos insignia de 2026.

Conclusión: si «gratis para siempre» importa y sabes programar, empieza aquí.

OpenAI — mejor para equipos que ya usan OpenAI

Gratis ninguno · Pago tts-1 15 $, tts-1-hd 30 $ por 1M caracteres · Unidad caracteres o tokens en modelos nuevos

La opción evidente si tu stack ya está allí y quieres un proveedor y una clave. Los modelos antiguos son fáciles de entender: tts-1 a 15 $ por millón de caracteres y tts-1-hd a 30 $. El nuevo gpt-4o-mini-tts factura en tokens, así que no puede compararse con un proveedor por carácter hasta medir tu propia salida de tokens de audio.

Bueno: una clave, una factura y un SDK si ya estás allí; buen seguimiento de instrucciones de tono; documentación sólida.

No tan bueno: no hay ningún nivel gratuito, pagas desde la primera petición; la facturación por tokens es difícil de prever; las voces personalizadas exigen hablar con ventas. Las políticas de OpenAI también requieren revelar que la voz es generada por IA.

Conclusión: la comodidad es la función. Nadie migra a OpenAI solo por las voces.

Deepgram — mejor para agentes en tiempo real

Gratis 200 $ de crédito, una vez, sin tarjeta · Pago Aura-2 0,030 $ por 1k caracteres, Aura-1 0,0150 $ · Unidad caracteres

Diseñado para cargas en tiempo real y agentes, donde la latencia importa más que la belleza. El registro incluye 200 $ de crédito sin tarjeta, la prueba sin compromiso más generosa, aunque es única y no recurrente.

Bueno: crédito suficiente para lanzar un prototipo; latencia pensada para turnos conversacionales; voz a texto del mismo proveedor.

No tan bueno: los 200 $ no vuelven; catálogo de voces estrecho; no está dirigido a narración larga.

Conclusión: la respuesta correcta para un agente de voz y la equivocada para un audiolibro.

Cartesia — mejor para streaming barato

Gratis 20k credits/mes, sin uso comercial · Entrada de pago Pro, 5 $/mes · Unidad credits

Muy barato para streaming de baja latencia. Pro cuesta solo 5 $/mes por 100.000 credits, pero también es el primer nivel con licencia comercial y clonación instantánea, por lo que el gratuito es estrictamente un sandbox de evaluación. Startup cuesta 49 $/mes por 1,25 million credits; Scale, 299 $/mes por 8 million.

Bueno: la entrada de pago más barata de la lista, 5 $; clonación incluida desde ese nivel; latencia realmente baja.

No tan bueno: no puedes publicar desde el nivel gratuito; empresa más joven que las nubes; catálogo menor.

Conclusión: el mejor precio por stream si construyes algo sensible a la latencia y aceptas un proveedor más pequeño.

Microsoft Azure AI Speech — mejor para empresas en el stack Microsoft

Gratis 500k caracteres neural/mes, recurrente y muy limitado · Pago varía por región · Unidad caracteres

Azure publica un nivel F0 recurrente de 500.000 caracteres TTS neural al mes, junto con 5 horas de voz a texto. Está muy limitado y no es para producción. No citamos tarifas de pago porque la tabla las carga en el cliente; consúltalas en el portal de tu región, ya que Azure varía geográficamente más que casi toda la lista.

Bueno: amplia cobertura de idiomas y regiones; cumplimiento y residencia que necesitan grandes empresas; custom neural voice para clientes aprobados.

No tan bueno: precios regionales que debes buscar; el throttling convierte el nivel gratuito en una demo; consola compleja.

Conclusión: si tu empresa ya funciona sobre Azure, la decisión estaba tomada.

ElevenLabs — mejor superficie de herramientas para agentes de audio

Ya se trató arriba por calidad de narración, pero también pertenece aquí: ElevenLabs ofrece un MCP server oficial con una superficie mucho mayor que la nuestra —voz, transcripción, speech-to-speech, efectos, música, diseño de voz y agentes de llamadas salientes— para Claude Desktop, Cursor, Windsurf y OpenAI Agents.

Conclusión: si el trabajo de tu agente son primitivas de audio y quieres el conjunto más amplio tras una conexión MCP, instala este. Nuestra respuesta es más estrecha en primitivas y más amplia en entregables terminados.

ListenHub — mejor para audio y vídeo con una clave

Gratis asignación mensual más recarga diaria, API key incluida · Entrada de pago 12 $/mes, o 9 $/mes anual · Unidad credits

Nuestra API es la razón por la que esta sección se alargó, así que esta es su forma honesta. No es un endpoint de síntesis por carácter más barato, sino una unidad de trabajo distinta. Un POST inicia una tarea que devuelve un artefacto terminado: episodio de dos presentadores con guion escrito, narración con subtítulos SRT, vídeo explicativo renderizado, presentación, base musical o imagen. Las tareas son asíncronas —creas una tarea y consultas su estado— porque un render de diez minutos no cabe en una ida y vuelta HTTP.

Una API key accede a todo: pódcast, texto a voz, clonación de voz, música, generación de imágenes, vídeo explicativo, diapositivas, vídeo con IA y extracción de contenido de una URL o archivo. Sin segundo proveedor para la mitad de vídeo, sin código de unión entre audio y visuales, un saldo de credits y una factura. La superficie completa se describe más abajo.

Bueno: entregables terminados, no bytes; audio y vídeo con una clave; cuatro vías propias (REST, MCP, Agent Skills, SDK/CLI) para que un agente opere sin integración previa; cualquier cuenta crea una clave y evaluar no cuesta; modelo asíncrono adecuado para renders largos; el SDK abre la envoltura y reintenta límites.

No tan bueno: credits es una unidad más gruesa que caracteres y el coste por petición es menos previsible que Polly; el nivel gratuito es pequeño frente a 5 millones de caracteres de Polly y el volumen sostenido exige suscripción o credit packs; ElevenLabs expone más herramientas de audio por MCP; no publicamos SLA de latencia y no debes construir un agente de voz en tiempo real sobre esto.

Conclusión: la llamada adecuada cuando quieres que un agente o backend emita contenido terminado y publicable. La equivocada para síntesis masiva barata o streaming inferior al segundo.

Un programa terminado, no un clip

Una categoría distinta archivada bajo «texto a voz» porque así la busca la gente. No tienes guion: tienes un documento y quieres que dos personas lo comenten.

NotebookLM — mejor para escucha personal gratuita

Gratis 3 generaciones de audio/día con cualquier cuenta Google · Pago mediante suscripción Google AI · Unidad generaciones

Gratis y extraordinario en esto. Subes fuentes y produce un resumen de audio con dos presentadores; la documentación de Google sitúa el plan gratuito en 3 generaciones diarias y 50 consultas de chat. Si la necesidad es ocasional y privada —convertir un PDF denso en algo para caminar— es difícil discutir con gratis.

Bueno: verdaderamente gratuito; conversación de dos presentadores convincente; sin configuración.

No tan bueno: no puedes editar el guion antes de que hable, elegir voces, clonar o quitar la marca; la salida tiene un formato fijo; no está diseñado para publicar según un calendario.

Conclusión: la mejor forma gratuita de escuchar tus documentos y no una herramienta de producción.

ListenHub — mejor para un programa multivoz publicable

Gratis asignación mensual más recarga diaria · Entrada de pago 12 $/mes, o 9 $/mes anual · Unidad credits

Esto es lo que construimos, así que léelo con la desconfianza apropiada y lee la sección siguiente, la versión larga y honesta que incluye aquello en lo que fallamos. En una línea: NotebookLM entrega un resumen de audio; ListenHub, un programa que puedes editar, marcar y publicar.

Bueno: guion editable antes de pronunciar nada; doce idiomas de salida en texto a voz y clonación de voz; reescritura de escrito a hablado que corrige el fallo de lectura literal; audio, SRT, vídeo y diapositivas con un saldo.

No tan bueno: el formato AI podcast aún genera solo en inglés, chino y japonés; editar el guion, exportar archivos, clonar y quitar la marca requieren plan de pago, por lo que el gratuito sirve para escuchar y no publicar; el coste unitario no se acerca a 4 $ por millón de caracteres; no hay línea de tiempo de vídeo; ElevenLabs es mejor si una voz debe leer un guion largo.

Conclusión: cómpranos cuando el entregable sea un programa multivoz terminado a partir de un documento. Para casi todos los demás trabajos de esta página, otra herramienta será mejor.

Qué hace ListenHub en realidad

Traes un informe, artículo, URL o guion y quieres algo que la gente escuche de verdad. Aquí ocurren cuatro cosas que un cuadro TTS normal no hace, y son toda la razón para elegirnos.

Primero reescribe texto escrito como texto hablado. Es el paso de escrito a hablado y aborda el mayor fallo del artículo. «Fig. 3 shows a 12.4% YoY increase (see Appendix B)» se convierte en algo que una persona diría. Los fragmentos reciben verbos y las abreviaturas se expanden como lo haría un lector. También puedes desactivarlo y leer palabra por palabra si el texto ya es conversacional: un aviso legal debe leerse exactamente como está escrito.

Escribe diálogo, no dos monólogos pegados. El problema de turnos anterior es un problema de guion antes que de síntesis. Los dos presentadores reciben un guion conversacional y el segundo responde a lo que realmente dijo el primero.

Puedes editar el guion antes de que se pronuncie nada. Es la diferencia entre juguete y herramienta. Ves el guion, corriges la frase que interpreta mal el posicionamiento, eliminas la digresión y solo entonces gastas credits en audio. Corregir texto es gratis; volver a renderizar audio no. La edición de guion es una función de suscripción desde Basic.

Un saldo cubre toda la salida. Audio con SRT, un vídeo explicativo, diapositivas, imágenes: los mismos credits, sin otra suscripción. La exportación y eliminación de marca también empiezan en Basic, así que el nivel gratuito sirve para oír la herramienta, no para publicar.

Una API y una superficie para agentes

Es la mitad del producto que no aparece en una tabla de funciones y la más interesante para desarrolladores. Todo lo que hace la aplicación web está disponible mediante cuatro superficies propias que autentican con la misma API key y consumen el mismo saldo.

La API REST. Crea una clave en Settings → API keys —formato lh_sk_…— y llama a https://api.marswave.ai/openapi. Las respuestas usan { code, message, data }, con code distinto de cero para errores. La generación es asíncrona por diseño: creas una tarea y consultas su estado porque un episodio o vídeo tarda minutos, no milisegundos. Los endpoints cubren pódcast, texto a voz, ListenHub Voice para audio de principio a fin, música, imágenes, vídeo explicativo, diapositivas, vídeo IA, búsqueda de voces, extracción desde URL o archivo y estado de suscripción. La documentación API contiene la referencia completa; parámetros e idiomas por endpoint están allí porque cambian más rápido que este artículo.

Un MCP server. ListenHub ofrece un servidor Model Context Protocol para que clientes MCP —Claude Desktop, Cursor, Windsurf, VS Code, Zed— generen pódcast y narraciones, exploren voces y comprueben la cuenta mediante herramientas en vez de HTTP. Cada herramienta envuelve un endpoint público para mantener ambas superficies alineadas. Usa stdio por defecto, o HTTP/SSE en remoto, y autentica con LISTENHUB_API_KEY. Importante: create_podcast consulta hasta terminar, por lo que una llamada devuelve el episodio terminado y no un task id que el agente deba vigilar. Consulta los documentos MCP.

Agent Skills. La superficie que recomendaríamos primero a un agente de programación:

npx skills add marswaveai/skills

Instala ListenHub Skills en un proyecto para herramientas con Agent Skills: Claude Code, Cursor, Windsurf, OpenCode. Después, la instrucción es lenguaje natural: convierte este artículo en un vídeo explicativo, crea un pódcast de dos presentadores con estas tres URL. El agente elige voces, dirige la generación, espera la finalización y entrega el artefacto con enlace. Hay skills individuales para voz, pódcast, texto a voz, vídeo explicativo, diapositivas, imágenes, música, transcripción y análisis de contenido, de modo que un agente compone una canalización en lugar de llamar a un endpoint monolítico.

SDK y CLI. @marswave/listenhub-sdk es el cliente oficial tipado para JavaScript/TypeScript: solo ESM, tipos incluidos, una dependencia en ejecución, Node 20 o posterior. Abre la envoltura y reintenta 429, evitando que lo implementes. Exporta dos clientes con una distinción útil: OpenAPIClient autentica con API key para servidores, scripts y CI y actúa como propietario de la clave; ListenHubClient usa tokens OAuth para que cada petición se ejecute como el usuario conectado, adecuado para productos orientados al usuario. @marswave/listenhub-cli envuelve el SDK como binario listenhub con la misma separación: listenhub … tras login OAuth para trabajo interactivo y listenhub openapi … con clave para CI. Documentación del SDK y la CLI.

Elegir voces por programa. La búsqueda devuelve más que ID y nombre: cada voz incluye pitch, speed, traits, styles, suggested scenes, accent, description y descripciones localizadas. Un agente puede elegir a partir de «narradora cálida para audiolibro» en vez de fijar un ID elegido una vez. También hay un catálogo de texto en /voices.txt para agentes que prefieren leer un archivo.

Dos aclaraciones. No hace falta un plan: cualquier cuenta crea una clave, así que puedes evaluar la API con la asignación gratuita y sin tarjeta; un prototipo de fin de semana no cuesta. Sí hacen falta credits: la API consume el mismo saldo que la web, por lo que automatización y uso manual salen del mismo fondo; el volumen sostenido requiere suscripción o credit pack. La unidad son credits y no caracteres, por lo que es más difícil de prever.

Idiomas y voces

Texto a voz y clonación de voz funcionan en doce idiomas: inglés, chino mandarín, japonés, español, portugués, francés, alemán, turco, coreano, italiano, tailandés y vietnamita. El catálogo público incluye etiquetas y descripciones por voz para filtrar por idioma, género y estilo en lugar de probar nombres uno por uno. También existe /voices.txt para agentes.

Hay que ser preciso, porque hemos visto exageraciones: los doce idiomas se aplican a texto a voz y clonación. El formato AI podcast y las demás herramientas de creación aún generan en inglés, chino y japonés. Si necesitas hoy un pódcast de dos presentadores en español, todavía no llegamos.

Clonación de voz

Clona tu propia voz con una muestra y úsala donde funciona una voz de catálogo, en cualquiera de los doce idiomas. Todos los planes de pago incluyen clonación: Basic guarda 1, Pro 4, Max 20; los guardados por encima del límite cuestan 300 credits cada uno. La guía de clonación explica una buena muestra; en resumen, tres minutos limpios superan treinta con ruido.

Cuánto cuesta

Basic cuesta 12 $/mes, o 9 $/mes anual, por 1.300 credits y un clon. Pro cuesta 24 $/mes, o 19 $/mes anual, por 2.700 credits y cuatro clones. Max cuesta 240 $/mes, o 200 $/mes anual, por 30.000 credits y veinte clones. API, MCP server y Agent Skills no dependen de un plan: funcionan con cualquier cuenta, incluida la gratuita, y gastan los credits disponibles.

Traducido a trabajo: un pódcast de 5 minutos cuesta unos 24 credits, 10 minutos de texto a voz unos 40 y una presentación de 10 páginas unos 150. Pro equivale a unas 11 horas de voz al mes si no gastas en otra cosa. Hay un nivel gratuito con asignación mensual y recarga diaria pequeña; la página de precios muestra la cifra actual, que cambia demasiado para congelarla aquí. La guía de credits explica los tres tipos y el orden de consumo.

Dónde somos peores que las herramientas anteriores

De forma clara, porque lo descubrirás igualmente:

  • Coste unitario a volumen. Polly y Google cuestan 4 $ por millón de caracteres. Una suscripción no compite y no fingiremos lo contrario.
  • Pulido de voz única en largo. ElevenLabs mantiene mejor la prosodia en un guion muy largo con un narrador.
  • Variedad de herramientas de audio para agentes. El MCP server de ElevenLabs expone más primitivas: transcripción, speech-to-speech, aislamiento, diseño de voz, llamadas salientes. El nuestro busca entregables terminados.
  • Sin medición por carácter. Gastas credits y no caracteres, así que cuesta más prever una petición que con una tarifa pública de 4 $ por millón; nuestro nivel gratuito es una fracción de los 5 millones mensuales de Polly.
  • Sin compromiso de latencia. No publicamos SLA y el modelo está hecho para renders, no turnos en tiempo real. No nos uses en un agente de voz en directo.
  • Edición de vídeo. Speechify ofrece una línea de tiempo; nosotros una exportación.
  • Idiomas de pódcast. Doce para TTS y clonación, tres para el formato pódcast.
  • Compras empresariales. Sin garantías de residencia ni contratos personalizados como Azure y AWS.

Niveles gratuitos comparados

Un nivel gratuito puede ser producto o demo. Lo importante no es su tamaño, sino si permite publicar.

HerramientaAsignación gratuita¿Recurrente?¿Publicar gratis?
Amazon Polly5M caracteres Standard/mesSí, sin límite
Google Cloud4M Standard, 1M Chirp 3 HD/mes
Azure500k neural/mesSí, limitado
Deepgram200 $ de créditoNo, una vez
NotebookLM3 generaciones/díaUso personal
ElevenLabs10k credits/mesNo
Cartesia20k credits/mesNo
Speechify600 creditsNo
WellSaid3 min de descarga/mesNo
ListenHubMensual más recarga diariaNo, exportar exige plan

Los cinco últimos son honestos y completamente inútiles si quieres publicar. Nos ponemos en ese grupo y no por encima, porque un nivel sin exportación es un sandbox de evaluación, lo construya quien lo construya. Presupuesta la entrada de pago desde el primer día: 6, 5, 19, 19 y 12 dólares respectivamente. Las mejores clases de Polly también tienen límite temporal: Neural un millón al mes, Long-Form 500.000 y Generative 100.000, solo durante los primeros 12 meses.

Si «gratis» es un requisito rígido y pretendes publicar, la lista es corta: Polly y Google Cloud, y tendrás que programar.

Idiomas más allá del inglés

Las plataformas cloud ganan claramente por amplitud. Google, Azure y Polly cubren decenas de idiomas con voces nativas y variantes regionales, porque empezaron mucho antes de la ola actual. ElevenLabs destaca en salida multilingüe con una sola voz: la misma voz clonada hablando otro idioma, una capacidad distinta y útil.

El marketing se vuelve resbaladizo entre compatible y bueno. Muchos proveedores anuncian muchos idiomas, pero sirven casi todos con un modelo multilingüe y unas pocas voces ajustadas para inglés. OpenAI lo reconoce en su documentación. Pide una muestra en el idioma objetivo con una voz realmente comercializada para él y haz que la escuche un nativo.

Con ese criterio, nuestra posición sin redondear: doce idiomas para texto a voz y clonación de voz, cada uno con voces del catálogo y no una voz inglesa con ajuste de acento; tres idiomas para pódcast. Si necesitas hindi, árabe o indonesio, no lo ofrecemos y Google o Azure sí.

¿Cuál deberías elegir?

Eres un creador individual que publica vídeo narrado. ElevenLabs Starter por 6 $/mes. Añade Speechify solo si también quieres la línea de tiempo.

Diriges un equipo de L&D o formación. WellSaid Labs. Los minutos son presupuestables y las voces superan revisión legal.

Eres ingeniero y necesitas síntesis dentro de un producto. Google Cloud o Polly. Prototipa en el nivel recurrente y elige conscientemente la clase: la diferencia entre 4 y 160 $ por millón está en un selector.

Construyes un agente de voz. Deepgram o Cartesia. Latencia y coste por stream son todo; el tamaño del catálogo no.

Quieres que un agente produzca contenido terminado por sí solo. ListenHub Skills o nuestro MCP server. Un npx skills add marswaveai/skills permite convertir una URL en un episodio publicado o vídeo sin escribir integración. No hace falta plan para empezar: una cuenta gratuita obtiene clave y pagas credits después de evaluar. Si necesita primitivas —transcripción, efectos, diseño de voz— instala el MCP de ElevenLabs o ambos.

Automatizas una canalización de contenido en CI. Nuestro SDK o CLI con API key, o las nubes si solo necesitas síntesis. listenhub openapi … existe para ese caso.

Eres estudiante o investigador con PDF densos. NotebookLM, gratis. Cuando quieras editar el guion y publicar, lo habrás superado.

Publicas un programa desde documentos. ListenHub. Guion editable, multivoz, exportaciones sin marca, un saldo para audio, vídeo y diapositivas.

El requisito es realmente 0 $ y sabes programar. Polly y después Google Cloud. Los demás niveles prohíben publicar o se agotan.

Preguntas que la gente sí hace

¿Cuál es la mejor herramienta gratuita de texto a voz? Amazon Polly si sabes programar: cinco millones de caracteres mensuales para siempre y puedes publicar. Si no programas, NotebookLM es gratis para escucha personal. La mayoría de niveles de consumo —ElevenLabs, Cartesia, Speechify, WellSaid y el nuestro— prohíben uso comercial o bloquean exportaciones tras un plan.

¿Puedo usar voces IA en YouTube o trabajo para clientes? Solo en un nivel con licencia comercial, normalmente no el gratuito. ElevenLabs la concede desde 6 $, Cartesia desde 5 $, Speechify desde 19 $. Comprueba el nivel exacto que comprarás, no el superior. Las reglas de plataforma son independientes y OpenAI además exige revelar que la voz es IA.

¿Qué es clonación de voz y necesito permiso? Das una muestra y el modelo reproduce su timbre para leer cualquier texto. Necesitas consentimiento de la persona: tu propia voz cuenta. Clonar a otra sin permiso es la vía rápida a un problema legal y todos los proveedores serios lo prohíben.

¿Qué herramienta tiene voces más naturales? Para una voz leyendo un guion largo, ElevenLabs según nuestra experiencia. Pero «natural» falla más por prosodia, lectura literal y nombres destrozados que por timbre; prueba tu peor párrafo y no una clasificación.

¿Cuánto debería pagar? Aproximadamente 5–25 $/mes por una suscripción para creadores o 4–30 $ por millón de caracteres en una API. Los niveles gratuitos cubren evaluación y uso personal; publicar suele empezar en el primer nivel de pago.

¿Puede detectarse el habla generada por IA? No de forma fiable y no deberías planificar alrededor de ello. Algunas plataformas exigen revelar medios sintéticos, algunos proveedores lo exigen en sus términos, y el coste reputacional de ocultarlo es mayor que el de declararlo.

¿Qué diferencia hay entre texto a voz y un pódcast IA? Texto a voz recibe un guion y lo lee. Un pódcast IA recibe un documento, escribe un guion —normalmente diálogo— y lo lee. Si ya tienes palabras, compra TTS. Si tienes un informe y quieres una conversación, es otro producto, el que construimos.

¿Necesito API o aplicación? API si la voz es una función de tu producto o el volumen hace más barata la tarifa por carácter. Aplicación si la voz es el entregable y no quieres mantener código. Comprar API para crear cuarenta episodios a mano es un error frecuente y caro.

¿Cuáles puede usar directamente un agente? ElevenLabs y ListenHub ofrecen MCP servers oficiales para que un agente en Claude Desktop, Cursor o Windsurf los invoque sin integración. ListenHub también publica Agent Skills —npx skills add marswaveai/skills— para Claude Code, Cursor, Windsurf y OpenCode. Los demás son REST que debes envolver. La diferencia práctica: ElevenLabs entrega primitivas; ListenHub un episodio, vídeo o presentación terminados.

¿Cuánto cuesta la API de ListenHub y hay clave gratuita? Cualquier cuenta, incluida la gratuita, crea clave sin plan. Gastas credits del mismo saldo de la web, así que evaluar es gratis y el volumen sostenido requiere suscripción desde 12 $/mes o un credit pack. La salvedad es la unidad: credits es más grueso que caracteres; para prever al céntimo, Polly o Google son más fáciles.

¿Puedo llamar a ListenHub por mis propios usuarios conectados? Sí, para eso sirven los dos clientes. OpenAPIClient usa API key y actúa como propietario, correcto para servidores, scripts y CI. ListenHubClient usa tokens OAuth para ejecutar cada petición bajo la cuenta individual, correcto en una app. Nunca envíes una API key en código web o móvil.

¿Qué idiomas admite ListenHub? Doce para texto a voz y clonación: inglés, mandarín, japonés, español, portugués, francés, alemán, turco, coreano, italiano, tailandés y vietnamita. Tres —inglés, chino, japonés— para AI podcast. En API y MCP consulta la referencia por endpoint.

Cuándo te enviaríamos a otra parte

Seis casos, sin rodeos:

Necesitas una voz leyendo un guion largo con belleza. Compra ElevenLabs. La prosodia larga es su especialidad y 6 $/mes no es una barrera real.

Eres ingeniero con volumen y presupuesto. Ve a Google Cloud o Polly. Ninguna suscripción supera 4 $ por millón y los niveles recurrentes hacen gratuito el prototipo.

Tu agente necesita primitivas, no piezas terminadas. Instala el MCP de ElevenLabs. Tiene transcripción, speech-to-speech, efectos, diseño y llamadas; nuestra superficie es deliberadamente menor.

Construyes algo en tiempo real. Deepgram o Cartesia. No publicamos SLA y nuestro modelo es para renders.

Necesitas un idioma que no servimos o un pódcast de dos voces fuera de inglés, chino y japonés. Google o Azure por amplitud. El formato pódcast aún no alcanza al catálogo.

Quieres convertir un documento en un resumen para ti. Usa NotebookLM. Es gratis y bueno, y una escucha privada no necesita edición, eliminación de marca ni clonación.

Somos mejores en dos situaciones: cuando quieres un programa multivoz terminado y publicable a partir de un documento, con guion editable antes de hablar, y cuando quieres que un agente o backend produzca ese tipo de salida —audio y vídeo— con una clave.

Ejecuta tu propia prueba antes de decidir

Veinte minutos te dirán más que cualquier comparación, incluida esta.

  1. Toma tu peor párrafo real: nombres, siglas, números y un inciso. No la demo del proveedor.
  2. Pásalo sin editar por las tres opciones.
  3. Escucha a 1x con auriculares hasta el final. Acelerar oculta problemas de ritmo.
  4. Cuenta los fallos: acento incorrecto, símbolos literales, nombres destrozados, turnos muertos, pausas uniformes.
  5. Solo entonces mira el precio. Una herramienta que pronuncia mal tu empresa no es barata.
  6. Comprueba la licencia comercial del nivel exacto que comprarás, no el superior.

Para incluirnos, texto a voz y AI podcast funcionan gratis y sin tarjeta. Si prefieres el terminal, npx skills add marswaveai/skills lo pone ante tu agente, y la documentación API está abierta antes de pagar.

Y si un competidor gana con tu texto, se lo ha merecido.

Volver al blog