I migliori strumenti text-to-speech del 2026, a confronto
Undici strumenti confrontati per prezzo, qualità delle voci e capacità di essere controllati da un agente IA, con un resoconto completo di ciò che fa ListenHub — API, MCP e Agent Skills inclusi — e dei casi in cui non siamo la scelta giusta.

Questo articolo è pubblicato da ListenHub. Realizziamo strumenti di sintesi vocale, podcast IA e clonazione vocale, e vendiamo abbonamenti: abbiamo quindi un interesse evidente nelle conclusioni che trarrete. Ignorarlo sarebbe il modo più rapido per perdere la vostra fiducia.
L'articolo svolge due compiti, ed è utile sapere quale sia quale. Il primo è un confronto diretto tra undici prodotti text-to-speech, raggruppati in base al lavoro per cui vengono scelti, con ogni prezzo letto dalla pagina ufficiale del fornitore anziché da una classifica. Il secondo è un resoconto dettagliato di ciò che fa ListenHub — compresa la superficie per sviluppatori e agenti, la parte del prodotto che quasi nessuno vede — e un resoconto altrettanto dettagliato dei casi in cui siamo la scelta sbagliata. Non assegniamo voti su dieci a nessuno, tanto meno a noi stessi, e una sezione verso la fine esiste soltanto per indirizzarvi a un concorrente.
La risposta breve
Se leggete una sola sezione, scegliete questa.
- Una voce che legge magnificamente un lungo copione → ElevenLabs, 6 $/mese.
- Un'API per grandi volumi con un budget limitato → Amazon Polly o Google Cloud, 4 $ per milione di caratteri.
- Agenti vocali in tempo reale → Deepgram o Cartesia.
- E-learning aziendale sottoposto a revisione di conformità → WellSaid Labs.
- Narrazione dentro una timeline video → Speechify Studio.
- Un documento trasformato gratuitamente in ascolto privato → NotebookLM.
- Un agente o una codebase che produce autonomamente audio e video finiti → ListenHub. Una sola chiave copre podcast, voce, clonazione, musica, immagini, slide e video, tramite REST, server MCP, Agent Skills, SDK e CLI.
- Un programma multi-voce finito e pubblicabile a partire da un documento → ListenHub. Questi ultimi due sono i lavori per cui pensiamo di essere la risposta giusta; le sezioni successive spiegano perché e dove siamo ancora carenti.
In sintesi
Prezzi verificati il 28 luglio 2026. Le unità cambiano da un fornitore all'altro e sono indicate riga per riga, invece di essere convertite in una falsa valuta comune.
| Strumento | Ideale per | Piano gratuito | Ingresso a pagamento | Clonazione vocale | Accesso API / agente |
|---|---|---|---|---|---|
| ElevenLabs | Qualità della narrazione lunga | 10k crediti/mese, niente uso commerciale | 6 $/mese | Sì, da 6 $ | REST, SDK, server MCP ufficiale |
| Amazon Polly | API economica su grandi volumi | 5M caratteri/mese, continuativo | A consumo | No | AWS SDK, IAM |
| Google Cloud TTS | Gamma di voci più ampia via API | 4M caratteri/mese, continuativo | A consumo | No | GCP SDK |
| OpenAI | Un fornitore, una chiave | Nessuno | A consumo | Solo Enterprise | REST, SDK |
| Deepgram | Agenti in tempo reale | 200 $ di credito, una volta | A consumo | No | REST, SDK streaming |
| Cartesia | Streaming economico a bassa latenza | 20k crediti/mese, niente uso commerciale | 5 $/mese | Sì, da 5 $ | REST, SDK streaming |
| Azure AI Speech | Stack Microsoft aziendali | 500k caratteri neurali/mese | A consumo | Sì, con approvazione | Azure SDK |
| WellSaid Labs | E-learning aziendale | 3 min scaricate/mese, niente uso commerciale | 19 $/mese | No | REST |
| Speechify Studio | Voiceover su timeline video | 600 crediti, niente uso commerciale | 19 $/mese | Sì, da 19 $ | REST |
| NotebookLM | Panoramiche audio personali gratuite | 3 generazioni/giorno | Abbonamento Google AI | No | Nessuno |
| ListenHub | Programmi finiti e agenti che li creano | Quota mensile più giornaliera | 12 $/mese, o 9 $/mese annuale | Sì, tutti i piani a pagamento | REST, server MCP, Agent Skills, SDK, CLI — qualsiasi account |
Le unità di fatturazione, visto che nessuno applica lo stesso sistema: Google, AWS e i modelli legacy di OpenAI fatturano per carattere; ElevenLabs, Cartesia, Speechify e ListenHub in crediti; WellSaid in minuti scaricati; i modelli OpenAI più recenti in token. Queste unità non sono intercambiabili e qualsiasi confronto che le sommi in un'unica classifica sta inventando un'equivalenza.
L'ultima colonna è quella che quasi tutti i confronti omettono e nel 2026 decide più acquisti della qualità vocale. Ogni prodotto qui dispone di un'API REST. A cambiare è la possibilità per un agente IA di pilotarlo senza che dobbiate prima scrivere un'integrazione, e ciò che una chiamata restituisce davvero: byte audio oppure un contenuto finito.
Come abbiamo confrontato e cosa non abbiamo potuto testare
Cosa abbiamo confrontato, e quando. Prezzi pubblicati, limiti dei piani gratuiti e condizioni d'uso commerciale, letti sulla pagina ufficiale di ogni fornitore il 28 luglio 2026 e verificati con la relativa documentazione — oltre alle domande sulle capacità che determinano acquisti reali: il vostro piano consente di pubblicare, include la clonazione vocale, esiste un lessico di pronuncia, in quale unità venite fatturati? I prezzi TTS cambiano continuamente, quindi considerate ogni cifra un punto di partenza e ricontrollatela prima di inserire una carta.
Perché non assegniamo punteggi. Un voto su dieci suggerirebbe un panel con criteri numerici che non abbiamo svolto. Quando diciamo che uno strumento suona meglio, è una nostra opinione basata sull'uso di questi prodotti e sulla costruzione del nostro. Trattate quelle frasi come una shortlist da testare personalmente e usate i difetti della prossima sezione come scheda di valutazione. Venti minuti con il vostro peggior paragrafo valgono più della classifica di chiunque, compresa la nostra.
Cosa non abbiamo potuto verificare. Alcuni fornitori renderizzano i prezzi in JavaScript e non lasciano una cifra pubblica stabile da citare. Per questo Murf è descritto più avanti senza numeri, mentre Microsoft pubblica in testo il piano gratuito ma carica le tariffe a pagamento lato client, quindi riportiamo solo la quota gratuita. PlayHT, LOVO e MiniMax sono stati esclusi del tutto: non si caricava alcun prezzo di prima parte e le cifre di terzi si contraddicevano ed erano chiaramente riciclate da anni precedenti. Preferiamo coprire undici strumenti verificabili invece di quindici che non possiamo documentare.
Cosa non abbiamo potuto testare. Funzioni riservate alle aziende — le voci personalizzate di OpenAI richiedono un colloquio commerciale, quindi non possiamo dirvi come suonano. Non abbiamo neppure misurato la latenza sotto carico di produzione, perché il tempo di una singola richiesta non dice nulla su mille stream concorrenti.
Cosa rende davvero sbagliata una sintesi vocale
Quasi tutti gli strumenti qui superano il vecchio standard: le voci non sono più robotiche. I difetti rimasti sono più sottili, e il pubblico li nota senza riuscire sempre a nominarli. È su questi che conviene allenare l'orecchio prima di spendere.
Prosodia piatta. In inglese l'accento porta significato. “I didn't say she took the money” assume circa sette significati a seconda della parola enfatizzata. Un modello che sceglie lo schema di accento statisticamente medio leggerà correttamente la frase comunicando però il significato sbagliato. Ascoltate il contrasto: la voce sottolinea la parola che contiene davvero l'informazione nuova?
Testo scritto per gli occhi, letto alla lettera. È il problema principale e non riguarda affatto la voce. Nel documento compaiono “e.g.”, “Fig. 3”, “$1.2M”, “2026-07-28”, “(see below)”. Una persona che legge ad alta voce riscrive mentalmente tutto — “for example”, “figure three”, “one point two million dollars”. La maggior parte dei motori vocalizza semplicemente i simboli. I frammenti negli elenchi sono peggio: le liste scritte spesso non hanno verbi e diventano una pila di sintagmi nominali scollegati. Abbiamo creato un passaggio di riscrittura dallo scritto al parlato proprio perché questo difetto sopravvive a ogni miglioramento della qualità vocale.
Nomi e gergo, sbagliati ogni volta. Nomi di prodotto, cognomi non inglesi, acronimi a volte scanditi e a volte pronunciati come parole — “SQL”, “Nginx”, “Xiaomi”, “José”. La costanza è ciò che li rende letali: il nome della vostra azienda verrà pronunciato male nello stesso modo in tutti e quaranta gli episodi. Controllate se il fornitore offre un lessico di pronuncia modificabile e se vale per tutto il workspace o deve essere reinserito in ogni progetto.
Nessuna alternanza reale. Due voci generate separatamente e incollate una dopo l'altra non sono una conversazione. Il dialogo vero presenta lievi sovrapposizioni, segnali di ascolto e — dettaglio più rivelatore — l'intonazione iniziale del secondo interlocutore risponde a quella finale del primo. Unendo due render indipendenti si ottengono due monologhi travestiti da conversazione.
Ritmo uniforme. I lettori umani accelerano in un elenco, rallentano verso una conclusione e respirano ai confini dei paragrafi anziché alle virgole. I motori che inseriscono sempre lo stesso intervallo tra le frasi producono audio estenuante dopo circa due minuti — un difetto difficilissimo da sentire in una demo di quindici secondi.
Da qui la trappola delle demo. Le frasi di esempio dei fornitori sono scelte perché funzionano. Non giudicate nulla su quelle.
Narrazione naturale per video e corsi
Il gruppo di acquirenti più ampio: avete un copione, vi serve una voce che lo legga e vi servono i diritti per pubblicare il risultato.
ElevenLabs — il migliore per la narrazione lunga
Gratis 0 $/mese, 10.000 crediti, nessuna licenza commerciale, nessuna clonazione · Ingresso a pagamento Starter 6 $/mese · Unità crediti
Starter a 6 $/mese è il vero punto d'ingresso, non il piano gratuito: 30.000 crediti, licenza commerciale e clonazione vocale istantanea. Creator costa 22 $/mese per 121.000 crediti e clonazione professionale; Pro 99 $/mese per 600.000. Nella narrazione lunga mantiene la prosodia meglio di qualsiasi altro strumento che abbiamo usato — è quello che meno probabilmente perde il filo di una frase tre paragrafi dentro un capitolo.
Pro: la migliore prosodia lunga di questa lista; clonazione istantanea nel piano a pagamento più economico; forte output multilingue da un'unica voce clonata; vero ecosistema di documentazione e integrazioni.
Contro: il piano gratuito non concede né licenza commerciale né clonazione, e questo sorprende chi prova gratis e poi pubblica; i crediti sono difficili da convertire mentalmente in minuti; i costi salgono rapidamente oltre Creator.
In conclusione: se vi serve una voce che legga bene un lungo copione, acquistate Starter e smettete di cercare.
WellSaid Labs — il migliore per l'e-learning aziendale
Gratis 3 minuti scaricati/mese, nessun diritto commerciale · Ingresso a pagamento 19 $/mese, o 120 $/anno · Unità minuti scaricati
WellSaid vende a team aziendali e di e-learning e fattura in minuti scaricati, un'unità piacevolmente semplice da mettere a budget. Starter costa 19 $/mese, o 120 $/anno con fatturazione annuale, per 20 minuti scaricabili al mese; Pro 49 $/mese, o 396 $/anno, per 180. Le voci sono meno numerose e più prudenti di ElevenLabs — esattamente ciò che desidera un modulo formativo sottoposto a conformità.
Pro: i minuti sono un'unità comprensibile alla finanza; voci prudenti e coerenti che superano la revisione legale; prezzo annuale con uno sconto reale anziché un trucco di arrotondamento.
Contro: catalogo piccolo per gli standard del 2026; nessuna clonazione vocale; 20 minuti al mese sono pochi se producete ogni settimana.
In conclusione: la scelta di approvvigionamento più sicura per la formazione e la fattura più facile da prevedere in questa lista.
Speechify Studio — il migliore per il voiceover dentro un montaggio video
Gratis 600 crediti, nessun diritto commerciale · Ingresso a pagamento Starter 19 $/mese · Unità crediti, 1 per secondo di voiceover
Speechify Studio è costruito attorno a una timeline di montaggio video invece che a una casella di testo. Starter costa 19 $/mese per 7.200 crediti con clonazione vocale e diritti commerciali; Creator 49 $/mese per 28.800. Il voiceover costa 1 credito al secondo, quindi Starter equivale a due ore di narrazione finita — un raro sistema di crediti convertibile a mente senza foglio di calcolo.
Pro: un credito al secondo è una tariffa facile da ragionare; voiceover e montaggio video nello stesso posto; clonazione e diritti commerciali dal piano d'ingresso.
Contro: pagate per un editor che potreste non volere; sui copioni lunghi la qualità narrativa è un gradino sotto ElevenLabs; il piano gratuito è una demo.
In conclusione: la scelta giusta quando l'audio è una traccia di un progetto video e non il prodotto finale.
Murf — il migliore per il lavoro collaborativo in studio
Gratis non indicato · Ingresso a pagamento non indicato · Unità non indicata
Murf appartiene a questo gruppo, soprattutto per i team che desiderano uno studio collaborativo con progetti condivisi. Non riportiamo i prezzi perché la pagina li renderizza lato client e non abbiamo potuto leggere una cifra che saremmo disposti a difendere. Tutto il resto qui ha un numero; considerate l'assenza come una lacuna nelle nostre fonti e non come un giudizio sul prodotto.
In conclusione: vale la pena valutarlo per i flussi di lavoro in team, ma chiedete direttamente a Murf i prezzi aggiornati.
Un'API che può crescere
Qui la domanda non è quale voce sia più bella. A decidere sono quattro fattori diversi.
Economia unitaria. Quanto pagate per carattere, secondo o lavoro, e se la curva resta ragionevole al vostro volume. I cloud vincono nettamente sulla sintesi pura: 4 $ per milione di caratteri è un minimo sotto cui nessun abbonamento può scendere.
Latenza e forma. Vi serve un socket streaming per un turno di conversazione oppure un lavoro asincrono per un render di dieci minuti? Sono prodotti diversi, e un fornitore ottimizzato per uno è generalmente mediocre nell'altro.
Cosa restituisce una chiamata. È l'asse che molti saltano. La maggior parte di questa sezione restituisce byte audio per il testo fornito — copione, segmentazione, montaggio multi-voce, temporizzazione dei sottotitoli e muxing sono a vostro carico. Un gruppo più piccolo restituisce un artefatto finito. La differenza vale più tempo di ingegneria di qualsiasi divario di prezzo su questa pagina.
Se un agente può pilotarlo senza aiuto. Nel 2026 molte chiamate vengono effettuate da un agente di coding anziché da uno sviluppatore alla tastiera. Conta quindi se il fornitore offre una superficie di strumenti che l'agente può scoprire e chiamare — server MCP, Agent Skill, SDK tipizzato — oppure se qualcuno deve prima scrivere e mantenere l'integrazione.
Un altro elemento da conoscere prima di impegnarsi: la solidità del fornitore. Google, AWS, Microsoft e OpenAI non stanno per scomparire. Il resto della lista è più giovane, e i prezzi dei nuovi operatori sono già cambiati più volte.
Google Cloud Text-to-Speech — il migliore per varietà
Gratis 4M caratteri/mese Standard e WaveNet, 1M Chirp 3 HD, ricorrenti · A pagamento 4–160 $ per 1M caratteri · Unità caratteri
La gamma utile più ampia della lista. Standard e WaveNet costano 4 $ per milione di caratteri dopo la quota gratuita ricorrente; Neural2 16 $ dopo 1 milione gratuito; Chirp 3 HD, l'attuale modello di punta, 30 $ dopo 1 milione gratuito; Studio 160 $. I nuovi modelli Gemini-TTS fatturano in token e non hanno quota gratuita. Un dettaglio: bisogna abilitare la fatturazione prima di usare persino i caratteri gratis.
Pro: piano gratuito ricorrente abbastanza ampio da eseguire un vero prototipo a costo zero; una classe di voci per ogni budget; decine di lingue con varianti locali.
Contro: la scala da 4 a 160 $ punisce chi seleziona una classe vocale senza leggere; dovete scrivere codice, non c'è uno studio; i modelli Gemini fatturati in token spezzano il confronto con tutto il resto.
In conclusione: la scelta API predefinita quando volete che un fornitore copra sia grandi volumi economici sia una voce di punta.
Amazon Polly — il migliore piano gratuito permanente ed economico
Gratis 5M caratteri/mese Standard, continuativo senza scadenza a 12 mesi · A pagamento 4–100 $ per 1M caratteri · Unità caratteri
Il leader di prezzo nella fascia bassa e il miglior piano gratuito del settore. Le voci Standard costano 4 $ per milione di caratteri, Neural 16 $, Generative 30 $, Long-Form 100 $. I 5 milioni di caratteri Standard mensili non scadono dopo un anno, fatto abbastanza raro da meritare il titolo.
Pro: l'unica quota gratuita davvero permanente su larga scala; noioso nel modo in cui dovrebbe esserlo un'infrastruttura; fatturazione prevedibile per carattere.
Contro: le classi vocali migliori sono gratuite solo per un periodo; nessuna clonazione; le voci Standard suonano datate accanto ai modelli di punta del 2026.
In conclusione: se il gratis per sempre conta e sapete programmare, iniziate qui.
OpenAI — il migliore per i team già su OpenAI
Gratis nessuno · A pagamento tts-1 15 $, tts-1-hd 30 $ per 1M caratteri · Unità caratteri, oppure token sui modelli più recenti
La scelta ovvia se il vostro stack è già lì e volete un solo fornitore e una sola chiave. I modelli legacy sono facili da capire: tts-1 a 15 $ per milione di caratteri, tts-1-hd a 30 $. Il più recente gpt-4o-mini-tts fattura in token invece che in caratteri, quindi non può essere confrontato con un fornitore a carattere finché non misurate la vostra produzione di token audio.
Pro: una chiave, una fattura, un SDK se siete già clienti; buona aderenza alle istruzioni sul tono; documentazione valida.
Contro: nessun piano gratuito — si paga dalla prima richiesta; la fatturazione in token dei modelli nuovi è davvero difficile da prevedere; le voci personalizzate sono dietro un colloquio commerciale. Le politiche d'uso di OpenAI richiedono inoltre di dichiarare che la voce è generata da IA.
In conclusione: la comodità è la funzione. Nessuno passa a OpenAI soltanto per le voci.
Deepgram — il migliore per gli agenti in tempo reale
Gratis 200 $ di credito, una volta, senza carta · A pagamento Aura-2 0,030 $ per 1k caratteri, Aura-1 0,0150 $ · Unità caratteri
Costruito per carichi in tempo reale e agenti, dove la latenza conta più della bellezza. L'iscrizione include 200 $ di credito senza carta — la prova senza impegno più generosa qui, ma una tantum anziché ricorrente.
Pro: credito sufficiente per portare in produzione un prototipo; latenza pensata per turni conversazionali; speech-to-text dallo stesso fornitore.
Contro: i 200 $ non tornano; catalogo vocale ristretto; non mira alla narrazione lunga.
In conclusione: la risposta giusta per un agente vocale, quella sbagliata per un audiolibro.
Cartesia — il migliore per lo streaming economico
Gratis 20k crediti/mese, niente uso commerciale · Ingresso a pagamento Pro 5 $/mese · Unità crediti
Molto aggressivo sul prezzo dello streaming a bassa latenza. Pro costa soltanto 5 $/mese per 100.000 crediti — ma è anche il primo piano a concedere licenza commerciale e clonazione istantanea, quindi il piano gratuito è esclusivamente un ambiente di valutazione. Startup costa 49 $/mese per 1,25 milioni di crediti; Scale 299 $/mese per 8 milioni.
Pro: ingresso a pagamento più economico della lista, 5 $; clonazione inclusa da quel livello; latenza realmente bassa.
Contro: non si può pubblicare dal piano gratuito; azienda più giovane dei cloud; catalogo più piccolo.
In conclusione: il miglior prezzo per stream se state costruendo qualcosa di sensibile alla latenza e accettate un fornitore più piccolo.
Microsoft Azure AI Speech — il migliore per le aziende nello stack Microsoft
Gratis 500k caratteri neurali/mese, ricorrenti, fortemente limitati · A pagamento tariffa variabile per regione · Unità caratteri
Azure pubblica un livello F0 gratuito e continuativo da 500.000 caratteri TTS neurali al mese, insieme a 5 ore audio di speech-to-text. È limitato e non destinato alla produzione. Non riportiamo le tariffe a pagamento di Azure perché la tabella le carica lato client; leggetele nel portale della vostra regione, dato che i prezzi Azure variano geograficamente più della maggior parte di questa lista.
Pro: ampia copertura di lingue e locali; conformità e residenza necessarie alle grandi imprese; voce neurale personalizzata per clienti approvati.
Contro: prezzi regionali da cercare autonomamente; il throttling rende il piano gratuito una demo; la console è complessa.
In conclusione: se l'azienda gira già su Azure, la decisione è stata presa per voi.
ElevenLabs — la migliore superficie di strumenti audio per agenti
Già trattato per la qualità narrativa, ElevenLabs appartiene anche qui, e va detto con franchezza: il suo server MCP ufficiale espone una superficie di strumenti molto più ampia della nostra — sintesi, trascrizione, speech-to-speech, effetti sonori, musica, progettazione vocale e agenti per chiamate in uscita — in Claude Desktop, Cursor, Windsurf e OpenAI Agents.
In conclusione: se il lavoro del vostro agente riguarda primitive audio e volete il set più ampio dietro una sola connessione MCP, installate questo. La nostra proposta qui sotto è più stretta sulle primitive audio e più ampia sui prodotti finiti.
ListenHub — il migliore per una chiave che copre audio e video
Gratis quota mensile più ricarica quotidiana, chiave API inclusa · Ingresso a pagamento 12 $/mese, o 9 $/mese annuale · Unità crediti
La nostra API è il motivo per cui questa sezione si è allungata, quindi ecco la sua forma onesta. Non è un endpoint di sintesi per carattere più economico: è un'unità di lavoro diversa. Un POST avvia un'attività che torna come artefatto finito: episodio a due conduttori con copione scritto, narrazione con sottotitoli SRT, video esplicativo renderizzato, presentazione, base musicale, immagine. Le attività sono asincrone — si crea un task e lo si interroga — perché un render di dieci minuti non è un singolo viaggio HTTP.
Una chiave API raggiunge tutto: podcast, sintesi vocale, clonazione vocale, musica, immagini, video esplicativi, slide, video IA ed estrazione di contenuti da URL o file. Nessun secondo fornitore per la metà video, nessun codice collante per unire audio e immagini, un saldo crediti e una fattura. La superficie API completa è descritta più avanti.
Pro: prodotti finiti anziché byte audio; audio e video dietro una sola chiave; quattro accessi ufficiali (REST, MCP, Agent Skills, SDK/CLI), così un agente può pilotarlo senza integrazione scritta; qualsiasi account può creare una chiave e valutare gratis; il modello asincrono si adatta ai render lunghi; l'SDK apre l'involucro della risposta e riprova automaticamente dopo i limiti di frequenza.
Contro: i crediti sono più grossolani dei caratteri, perciò il costo per richiesta è meno prevedibile di Polly; la quota gratuita è piccola rispetto ai 5 milioni di caratteri mensili di Polly, quindi volumi continuativi richiedono un abbonamento o pacchetti; ElevenLabs espone più strumenti audio via MCP; non pubblichiamo SLA di latenza e non dovreste costruirci un agente vocale in tempo reale.
In conclusione: la chiamata giusta quando volete che un agente o un backend produca contenuti finiti e pubblicabili. Quella sbagliata per sintesi di massa economica o streaming sotto il secondo.
Un programma finito, non una clip
Una categoria di prodotto diversa che viene archiviata sotto “text to speech” perché così la cercano le persone. Non avete un copione. Avete un documento e volete che due persone ne discutano.
NotebookLM — il migliore per l'ascolto personale gratuito
Gratis 3 generazioni audio/giorno con qualsiasi account Google · A pagamento tramite abbonamento Google AI · Unità generazioni
Gratuito e notevole in questo compito. Caricate fonti e produce una panoramica audio a due conduttori; la documentazione di supporto Google assegna al piano gratuito 3 generazioni audio al giorno insieme a 50 query chat. Se il bisogno è occasionale e personale — trasformare un PDF denso in qualcosa da ascoltare durante una passeggiata — è difficile contestare il gratis.
Pro: davvero gratuito; conversazione a due conduttori convincente; nessuna configurazione.
Contro: non potete modificare il copione prima che venga letto, scegliere le voci, clonare una voce o rimuovere il marchio; un solo formato fisso; non pensato per pubblicare con cadenza.
In conclusione: il miglior modo gratuito per ascoltare i propri documenti, ma non uno strumento di produzione.
ListenHub — il migliore per un programma multi-voce pubblicabile
Gratis quota mensile più ricarica quotidiana · Ingresso a pagamento 12 $/mese, o 9 $/mese annuale · Unità crediti
È ciò che costruiamo, quindi leggete con il sospetto appropriato — e leggete la prossima sezione, la versione lunga e onesta che include anche i nostri punti deboli. In una frase: NotebookLM vi dà una panoramica audio, ListenHub un programma che potete modificare, personalizzare e pubblicare.
Pro: il copione si modifica prima che venga pronunciata una parola; dodici lingue di output per sintesi vocale e clonazione vocale; riscrittura dallo scritto al parlato che corregge la lettura letterale descritta sopra; audio, SRT, video e slide dallo stesso saldo crediti.
Contro: il formato podcast IA genera ancora soltanto in inglese, cinese e giapponese; modifica del copione, esportazioni, clonazione e rimozione del marchio richiedono tutti un piano a pagamento, quindi il gratuito serve ad ascoltare e non a pubblicare; il nostro costo unitario non può toccare 4 $ per milione di caratteri; manca una timeline di montaggio video; per una voce che legge un lungo script ElevenLabs è migliore.
In conclusione: acquistate noi quando il prodotto finale è un programma multi-voce completo creato da un documento fonte. Per la maggior parte degli altri lavori di questa pagina, un altro strumento della pagina è la risposta migliore.
Cosa fa davvero ListenHub
Portate un rapporto, un paper, un URL o un copione. Volete qualcosa che le persone ascolteranno davvero. Qui avvengono quattro cose che una normale casella text-to-speech non fa, e sono l'intero motivo per sceglierci.
Prima riscrive il testo scritto in testo parlato. È il passaggio dallo scritto al parlato, e affronta il principale difetto di questo articolo. “Fig. 3 shows a 12.4% YoY increase (see Appendix B)” diventa qualcosa che una persona direbbe davvero ad alta voce. I frammenti degli elenchi ricevono verbi. Le abbreviazioni vengono espanse come farebbe un lettore. Potete anche disattivarlo e ottenere lettura parola per parola quando il testo è già colloquiale — una dichiarazione legale va letta esattamente come scritta.
Scrive dialoghi, non due monologhi incollati. Il problema dell'alternanza visto prima riguarda il copione prima ancora della sintesi. Due conduttori ricevono un copione scritto come conversazione, in cui il secondo risponde a ciò che il primo ha realmente detto.
Potete modificare il copione prima che venga pronunciato qualcosa. È la differenza tra un giocattolo e uno strumento. Vedete il copione, correggete la frase che interpreta male il posizionamento del prodotto, tagliate la digressione e solo allora spendete crediti in audio. Correggere il testo è gratuito; renderizzare di nuovo l'audio no. La modifica del copione è una funzione in abbonamento, da Basic in su.
Un saldo copre l'intero output. Audio con sottotitoli SRT, video esplicativo, slide, immagini — gli stessi crediti, nessun secondo abbonamento. Le esportazioni e la rimozione del marchio ListenHub iniziano anch'esse da Basic, quindi il piano gratuito è il posto in cui ascoltare il risultato, non pubblicarlo.
Un'API e una superficie per agenti
È la metà del prodotto che non compare nelle griglie di funzioni e, per gli sviluppatori, la parte più interessante. Tutto ciò che l'app web può fare è accessibile programmaticamente attraverso quattro superfici ufficiali che si autenticano con la stessa chiave API e consumano lo stesso saldo crediti.
L'API REST. Create una chiave in Settings → API keys — il formato è lh_sk_… — e chiamate https://api.marswave.ai/openapi. Le risposte usano un unico involucro, { code, message, data }, con code diverso da zero per gli errori. La generazione è asincrona per progetto: si crea un task e lo si interroga, perché un episodio completo o un video renderizzato richiede minuti, non millisecondi. Gli endpoint coprono generazione podcast, text-to-speech, ListenHub Voice per audio end-to-end, musica, immagini, video esplicativi, slide, video IA, ricerca speaker, estrazione di contenuto da URL o file e stato dell'abbonamento. La documentazione API contiene la reference completa; parametri e supporto linguistico sono specificati per endpoint anziché qui, perché questa superficie cambia più velocemente di un post.
Un server MCP. ListenHub offre un server Model Context Protocol, così un client MCP — Claude Desktop, Cursor, Windsurf, VS Code, Zed — può generare podcast e narrazioni, esplorare il catalogo vocale e controllare l'account chiamando strumenti invece di inviare HTTP. Ogni strumento avvolge un endpoint pubblico, mantenendo allineate le due superfici. Funziona su stdio per impostazione predefinita, oppure via HTTP/SSE quando serve da remoto, e si autentica con LISTENHUB_API_KEY. Da sapere: create_podcast attende il completamento per vostro conto, quindi una chiamata restituisce un episodio finito invece di un task id che l'agente deve sorvegliare. Vedi la documentazione MCP.
Agent Skills. La superficie che indicheremmo per prima a un agente di coding:
npx skills add marswaveai/skills
Il comando installa ListenHub Skills in un progetto per qualsiasi strumento con supporto Agent Skills — Claude Code, Cursor, Windsurf, OpenCode. Da lì basta il linguaggio naturale: trasforma questo articolo in un video esplicativo, crea un podcast a due conduttori da questi tre URL. L'agente sceglie le voci, pilota la generazione, attende il completamento e consegna l'artefatto con un link. Esistono skill individuali per voce, podcast, text-to-speech, video esplicativo, slide, immagini, musica, trascrizione e parsing di contenuti, così l'agente può comporre una pipeline invece di chiamare un unico endpoint monolitico.
SDK e CLI. @marswave/listenhub-sdk è il client JavaScript/TypeScript ufficiale e tipizzato — solo ESM, tipi inclusi, una dipendenza runtime, Node 20 o superiore. Apre l'involucro della risposta e riprova i 429, evitando di costruire entrambi i meccanismi. Esporta due client, una distinzione davvero utile: OpenAPIClient si autentica con chiave API per server, script e CI e agisce come proprietario della chiave, mentre ListenHubClient usa token OAuth utente, così ogni richiesta opera come un singolo utente autenticato — la scelta corretta per un'app rivolta agli utenti. @marswave/listenhub-cli avvolge lo stesso SDK in un binario listenhub con la medesima divisione: listenhub … dopo login OAuth nel browser per lavoro interattivo, listenhub openapi … con chiave per CI. Documentazione per SDK e CLI.
Scegliere le voci programmaticamente. La ricerca speaker restituisce più di ID e nome: ogni voce ha altezza, velocità, tratti, stili, scene suggerite, accento e descrizione, oltre a descrizioni localizzate. Un agente può quindi scegliere da un brief come “narratrice calda per un audiolibro” invece di fissare un ID selezionato una volta da una persona. Esiste anche un catalogo in testo semplice su /voices.txt per gli agenti che preferiscono leggere un file anziché chiamare un endpoint.
Due precisazioni. Non è richiesto alcun piano — ogni account può creare una chiave, quindi potete valutare l'API con la quota gratuita senza carta e un prototipo del weekend costa zero. Servono però crediti: le chiamate API spendono lo stesso saldo dell'app web, perciò uso automatico e manuale del team attingono allo stesso fondo, e un volume continuativo richiede un abbonamento o un pacchetto crediti. L'unità è il credito anziché il carattere, più grossolana da prevedere rispetto a una tariffa per carattere.
Lingue e voci
La sintesi vocale e la clonazione vocale funzionano entrambe in dodici lingue: inglese, cinese mandarino, giapponese, spagnolo, portoghese, francese, tedesco, turco, coreano, italiano, thai e vietnamita. Il catalogo vocale pubblico fornisce tag e descrizioni per ogni voce, così potete filtrare per lingua, genere e stile invece di provare nomi uno alla volta. Esiste anche il catalogo testuale /voices.txt per gli agenti.
Siate precisi su ciò che copre e non copre, perché altrove abbiamo visto esagerazioni: le dodici lingue si applicano a text-to-speech e clonazione. Il formato podcast IA e gli altri strumenti creativi generano ancora in inglese, cinese e giapponese. Se oggi vi serve un podcast spagnolo a due conduttori, non ci siamo ancora.
Clonazione vocale
Clonate la vostra voce da un campione e usatela ovunque funzioni una voce del catalogo, in ciascuna delle dodici lingue. Ogni piano a pagamento include la clonazione — Basic 1 clone salvato, Pro 4, Max 20 — e i salvataggi oltre la quota costano 300 crediti ciascuno. La guida alla clonazione vocale spiega come creare un buon campione; in breve, tre minuti di parlato pulito battono trenta minuti rumorosi.
Quanto costa
Basic costa 12 $/mese, o 9 $/mese con fatturazione annuale, per 1.300 crediti e un clone vocale. Pro costa 24 $/mese, o 19 $/mese annuale, per 2.700 crediti e quattro cloni. Max costa 240 $/mese, o 200 $/mese annuale, per 30.000 crediti e venti cloni. API, server MCP e Agent Skills non sono legati a un piano — funzionano con qualsiasi account, incluso quello gratuito, e consumano i crediti disponibili.
Per tradurre i crediti in lavoro: un podcast di 5 minuti costa circa 24 crediti, 10 minuti di sintesi vocale circa 40, un deck di 10 pagine circa 150. Pro equivale quindi a circa 11 ore di parlato al mese se non spendete in altro. Esiste un piano gratuito con quota mensile e piccola ricarica quotidiana; la pagina prezzi mostra il valore attuale, che cambia abbastanza spesso da preferire il link a un numero congelato qui. La guida ai crediti spiega come si sommano i tre tipi e in quale ordine vengono spesi.
Dove siamo più deboli degli strumenti sopra
Detto chiaramente, perché lo scoprirete comunque:
- Costo unitario su grandi volumi. Polly e Google costano 4 $ per milione di caratteri. Un abbonamento non può competere, e non fingeremo il contrario.
- Rifinitura di lunghe letture a voce singola. ElevenLabs mantiene meglio la prosodia su un copione molto lungo con un unico narratore.
- Ampiezza degli strumenti audio per agenti. Il server MCP di ElevenLabs espone più primitive del nostro — trascrizione, speech-to-speech, isolamento audio, progettazione vocale, chiamate in uscita. Il nostro mira ai prodotti finiti.
- Nessuna misurazione API per carattere. Spendete crediti, non caratteri, quindi il costo per richiesta è più difficile da prevedere di una tariffa pubblica da 4 $ per milione — e la nostra quota gratuita è una frazione dei 5 milioni di caratteri mensili di Polly.
- Nessun impegno di latenza. Non pubblichiamo SLA e il modello a task è pensato per render, non turni in tempo reale. Non inseriteci in un agente vocale live.
- Montaggio video. Speechify offre una timeline. Noi un'esportazione.
- Lingue podcast. Dodici per TTS e clonazione, tre per il formato podcast.
- Approvvigionamento aziendale. Nessuna garanzia di residenza o contratto personalizzato del tipo venduto da Azure e AWS.
Confronto dei piani gratuiti
I piani gratuiti differiscono a seconda che siano un prodotto o una demo. La distinzione importante non è la dimensione, ma se potete pubblicare ciò che create.
| Strumento | Quota gratuita | Ricorrente? | Si può pubblicare gratis? |
|---|---|---|---|
| Amazon Polly | 5M caratteri/mese Standard | Sì, senza scadenza | Sì |
| Google Cloud | 4M caratteri/mese Standard, 1M Chirp 3 HD | Sì | Sì |
| Azure | 500k caratteri neurali/mese | Sì, limitato | Sì |
| Deepgram | 200 $ di credito | No, una volta | Sì |
| NotebookLM | 3 generazioni/giorno | Sì | Uso personale |
| ElevenLabs | 10k crediti/mese | Sì | No |
| Cartesia | 20k crediti/mese | Sì | No |
| Speechify | 600 crediti | Sì | No |
| WellSaid | 3 min scaricate/mese | Sì | No |
| ListenHub | Quota mensile più ricarica quotidiana | Sì | No, le esportazioni richiedono un piano |
Gli ultimi cinque sono perfettamente onesti e perfettamente inutili se intendete pubblicare. Abbiamo inserito noi stessi in quel gruppo invece che sopra, perché un piano gratuito da cui non si può esportare è un ambiente di valutazione, chiunque lo abbia costruito. Mettete a budget il primo piano a pagamento fin dal primo giorno — rispettivamente 6 $, 5 $, 19 $, 19 $ e 12 $. Anche le migliori classi vocali di Polly sono limitate nel tempo: Neural 1 milione al mese, Long-Form 500.000, Generative 100.000, ognuna solo per i primi 12 mesi.
Se “gratis” è un requisito assoluto e intendete pubblicare, la shortlist è corta: Polly e Google Cloud, e dovrete scrivere codice.
Lingue oltre l'inglese
Le piattaforme cloud vincono nettamente per ampiezza. Google, Azure e Polly coprono decine di lingue con voci di madrelingua e varianti locali, avendo costruito tutto molto prima dell'ondata attuale. ElevenLabs è forte nell'output multilingue da un'unica voce — la stessa voce clonata che parla un'altra lingua, una capacità diversa e utile.
Il marketing diventa ambiguo nella distanza tra supportato e buono. Molti fornitori annunciano un gran numero di lingue, ma gran parte dell'elenco viene servita da un solo modello multilingue con poche voci ottimizzate per l'inglese. OpenAI lo dichiara chiaramente nella propria documentazione. Chiedete un campione nella lingua target, pronunciato da una voce realmente commercializzata per quella lingua, e fatelo ascoltare a un madrelingua.
Con questo standard, la nostra posizione senza arrotondamenti è: dodici lingue per sintesi vocale e clonazione vocale, ciascuna con voci dal catalogo anziché una voce inglese con impostazione dell'accento — e tre lingue per il formato podcast. Se vi serve narrazione in hindi, arabo o indonesiano, non la offriamo; Google o Azure sì.
Quale dovreste scegliere?
Siete creator indipendenti che pubblicano video narrati. ElevenLabs Starter a 6 $/mese. Aggiungete Speechify soltanto se volete anche la timeline di montaggio.
Gestite un team L&D o formazione. WellSaid Labs. I minuti sono un'unità preventivabile e le voci superano la revisione legale.
Siete ingegneri e vi serve sintesi dentro un prodotto. Google Cloud o Polly. Prototipate nel piano gratuito ricorrente, poi scegliete deliberatamente una classe vocale — tra 4 e 160 $ per milione di caratteri c'è un menu a discesa.
State costruendo un agente vocale. Deepgram o Cartesia. Latenza e costo per stream sono tutto; le dimensioni del catalogo no.
Volete che un agente IA produca autonomamente contenuti finiti. ListenHub Skills o il nostro server MCP. Un npx skills add marswaveai/skills consente a un agente di coding di trasformare un URL in episodio pubblicato o video esplicativo senza un'integrazione scritta prima. Non serve un piano per iniziare — un account gratuito ottiene una chiave, poi si paga in crediti oltre la valutazione. Se all'agente servono primitive audio invece di prodotti finiti — trascrizione, effetti sonori, progettazione vocale — installate il server MCP di ElevenLabs, oppure entrambi.
State automatizzando una pipeline di contenuti in CI. Il nostro SDK o CLI con chiave API, oppure i cloud se serve soltanto sintesi. listenhub openapi … esiste precisamente per il caso scriptato.
Siete studenti o ricercatori con PDF densi. NotebookLM, gratis. Quando inizierete a volere il copione modificabile e l'output pubblicabile, lo avrete superato.
Pubblicate uno show o un programma di contenuti da documenti. ListenHub. Copione modificabile, output multi-voce, esportazioni senza marchio, un saldo per audio, video e slide.
Il requisito è davvero 0 $ e sapete programmare. Polly, poi Google Cloud. I piani gratuiti degli altri vietano la pubblicazione o si esauriscono.
Le domande che le persone fanno davvero
Qual è il miglior strumento di sintesi vocale gratuito? Amazon Polly, se sapete programmare: 5 milioni di caratteri al mese, permanentemente, con possibilità di pubblicare. Se non sapete programmare, NotebookLM è gratuito per ascolto personale. La maggior parte dei piani consumer gratuiti — ElevenLabs, Cartesia, Speechify, WellSaid e il nostro — vieta l'uso commerciale o riserva le esportazioni a un piano a pagamento.
Posso usare voci IA su YouTube o in lavori per clienti? Solo con un piano che concede una licenza commerciale, e di solito non è quello gratuito. ElevenLabs la offre da 6 $, Cartesia da 5 $, Speechify da 19 $. Controllate la licenza del livello esatto che intendete acquistare, non quello superiore. Le regole delle piattaforme sono separate dalla licenza del fornitore, e le politiche OpenAI richiedono inoltre di dichiarare che una voce è generata da IA.
Cos'è la clonazione vocale e mi serve il permesso? Fornite un campione di voce e il modello ne riproduce il timbro per leggere qualsiasi testo. Serve il consenso della persona — la vostra voce va bene. Clonare quella altrui senza permesso è il modo più rapido per creare un problema legale, e i termini di ogni fornitore affidabile lo vietano.
Quale strumento ha le voci più naturali? Per una voce che legge un lungo copione, ElevenLabs secondo la nostra esperienza. Ma il “naturale” fallisce sulla prosodia, sulla lettura letterale dei simboli e sui nomi storpiati molto più che sul timbro, quindi provate il vostro peggior paragrafo invece di fidarvi di una classifica.
Quanto dovrei aspettarmi di spendere? Circa 5–25 $/mese per un abbonamento creator, oppure 4–30 $ per milione di caratteri via API. I piani gratuiti coprono valutazione e uso personale; per pubblicare si parte normalmente dal primo piano a pagamento.
La voce generata da IA può essere rilevata? Non in modo affidabile, e non dovreste pianificare in base a questo. Alcune piattaforme richiedono di dichiarare i media sintetici, alcuni fornitori lo impongono nei termini, e il costo reputazionale di essere scoperti a non dichiararlo è peggiore del costo della dichiarazione.
Qual è la differenza tra text-to-speech e uno strumento per podcast IA? Il text-to-speech prende un copione e lo legge. Uno strumento per podcast IA prende un documento fonte, scrive un copione — di solito come dialogo — e poi lo legge. Se avete già le parole, acquistate sintesi vocale. Se avete un rapporto e volete una conversazione su di esso, è un prodotto diverso, quello che costruiamo.
Mi serve un'API o un'app? Un'API se la voce è una funzione dentro il prodotto, o se il volume rende il prezzo per carattere più conveniente di un abbonamento. Un'app se la voce è il prodotto finale e preferite non mantenere codice. Comprare un'API per creare manualmente quaranta episodi è un errore comune e costoso.
Quali di questi può usare direttamente un agente IA?
ElevenLabs e ListenHub offrono entrambi server MCP ufficiali, quindi un agente in Claude Desktop, Cursor o Windsurf può chiamarli come strumenti senza integrazione scritta. ListenHub pubblica inoltre Agent Skills — npx skills add marswaveai/skills — per Claude Code, Cursor, Windsurf e OpenCode. Tutto il resto della lista è un'API REST che voi o l'agente dovreste prima avvolgere. La differenza pratica è ciò che torna: ElevenLabs consegna primitive audio, ListenHub un episodio, video o deck finito.
Quanto costa l'API ListenHub, ed esiste una chiave gratuita? Qualsiasi account può creare una chiave, incluso quello gratuito — nessun piano richiesto. Si spendono crediti, lo stesso saldo dell'app web, quindi la valutazione è gratuita e volumi continuativi richiedono un abbonamento da 12 $/mese o un pacchetto. Il limite onesto è l'unità: i crediti sono più grossolani dei caratteri; per prevedere al centesimo il costo di una richiesta, un fornitore per carattere come Polly o Google Cloud è più facile da modellare.
Posso chiamare ListenHub per conto dei miei utenti autenticati?
Sì, ed è il motivo dei due client SDK. OpenAPIClient usa una chiave API e agisce come proprietario della chiave — adatto a server, script e CI. ListenHubClient usa token OAuth utente, così ogni richiesta opera sotto l'account di un singolo utente, come serve in un'app rivolta agli utenti. Non distribuite mai una chiave API nel codice browser o mobile.
Quali lingue supporta ListenHub? Dodici per sintesi vocale e clonazione vocale: inglese, cinese mandarino, giapponese, spagnolo, portoghese, francese, tedesco, turco, coreano, italiano, thai, vietnamita. Tre — inglese, cinese, giapponese — per il formato podcast IA. Per le superfici API e MCP, controllate la documentazione di riferimento per endpoint invece di presumere la copertura dell'app web.
Quando vi manderemmo altrove
Sei casi, dichiarati senza giri di parole:
Vi serve una voce che legga magnificamente un lungo copione. Comprate ElevenLabs. La prosodia lunga è la sua specialità e 6 $/mese non è una vera barriera.
Siete ingegneri con volume e budget. Andate su Google Cloud o Polly. Nessun abbonamento può battere 4 $ per milione di caratteri e i piani gratuiti ricorrenti rendono il prototipo gratuito.
Al vostro agente servono primitive audio, non prodotti finiti. Installate il server MCP di ElevenLabs. Trascrizione, speech-to-speech, effetti sonori, progettazione vocale e chiamate in uscita sono tutti presenti, mentre la nostra superficie è volutamente più stretta.
State costruendo qualcosa in tempo reale. Deepgram o Cartesia. Non pubblichiamo SLA di latenza e il nostro modello a task è pensato per render.
Vi serve una lingua che non offriamo, o un podcast a due conduttori fuori da inglese, cinese e giapponese. Google o Azure per ampiezza di narrazione. Il nostro formato podcast non ha ancora raggiunto il catalogo vocale.
Volete trasformare un documento in un riassunto ascoltabile per voi stessi. Usate NotebookLM. È gratuito e valido, e per un ascolto privato durante il tragitto non servono modifica del copione, rimozione del marchio o clonazione.
Siamo la risposta migliore in due situazioni: quando desiderate un programma multi-voce finito e pubblicabile da un documento fonte, con copione modificabile prima che venga pronunciato, e quando volete che un agente o backend produca quel tipo di output — audio e video — dietro una sola chiave.
Fate il vostro test prima di decidere
Venti minuti vi diranno più di qualsiasi articolo comparativo, incluso questo.
- Prendete il vostro peggior paragrafo reale — nomi di prodotto, acronimi, numeri, una parentesi. Non il testo demo del fornitore.
- Passatelo senza modifiche nei tre strumenti della shortlist.
- Ascoltate a 1x in cuffia fino alla fine. L'ascolto accelerato nasconde i problemi di ritmo.
- Contate i difetti descritti prima: accento sbagliato, simboli letti alla lettera, nomi storpiati, alternanza morta, pause uniformi.
- Solo allora guardate il prezzo. Uno strumento che pronuncia male il nome dell'azienda non è economico a nessuna tariffa.
- Controllate la licenza commerciale del livello esatto che intendete acquistare, non quello superiore.
Per provare anche il nostro, sintesi vocale e podcast IA funzionano entrambi nel piano gratuito senza carta. Se preferite valutare da terminale anziché browser, npx skills add marswaveai/skills lo mette a disposizione del vostro agente di coding, e la documentazione API è consultabile prima di pagare.
E se sul vostro testo vince un concorrente, se l'è meritato.