2026年版、最も優れた音声読み上げツールを比較
11のツールを価格、音声品質、AIエージェントからの操作性で比較。ListenHubのAPI、MCP、Agent Skillsを含む全機能と、私たちを選ぶべきではない場面も詳しく説明します。

この記事は ListenHub が公開しています。私たちは音声読み上げ、AIポッドキャスト、ボイスクローンを提供し、サブスクリプションも販売しています。したがって、読者がどんな結論を出すかに明らかな利害があります。それを無視することが、信頼を失う最短経路です。
この記事には二つの役割があり、どちらを読んでいるのか知っておく価値があります。一つ目は、依頼したい仕事ごとに分類した11の音声読み上げ製品の直接比較です。価格はまとめ記事ではなく、各ベンダー自身の料金ページから取得しました。二つ目は、ListenHubが何をするのかを詳しく説明することです。多くの人が目にしない開発者・エージェント向けの面も含め、同じくらい詳しく、どんな場面で私たちが不適切な選択かも説明します。どの製品にも10点満点の採点はせず、特に自社には付けません。記事の下部には、読者を競合へ案内することだけを目的とした節さえあります。
先に結論
一つの節しか読まないなら、ここを読んでください。
- 一つの声で長い原稿を美しく読む → ElevenLabs、月額$6。
- 予算を抑えて大量処理できるAPI → Amazon Polly または Google Cloud、100万文字あたり$4。
- リアルタイム音声エージェント → Deepgram または Cartesia。
- コンプライアンス審査を通す企業eラーニング → WellSaid Labs。
- 動画タイムライン内のナレーション → Speechify Studio。
- 文書を無料で個人的なリスニング用に変換 → NotebookLM。
- エージェントやコードベースが完成した音声・動画を自動制作 → ListenHub。一つのキーでポッドキャスト、音声、クローン、音楽、画像、スライド、動画を扱い、REST、MCP server、Agent Skills、SDK、CLIから利用できます。
- 文書から完成済みで公開可能な複数音声番組を作る → ListenHub。最後の二つは、私たちが適切な答えだと考える仕事です。以下で理由と、まだ不足している点を説明します。
一覧
価格は2026年7月28日に確認しました。単位はベンダーごとに異なるため、偽の共通通貨に換算せず、各行でそのまま示します。
| ツール | 最適な用途 | 無料枠 | 有料の入口 | ボイスクローン | API / エージェントアクセス |
|---|---|---|---|---|---|
| ElevenLabs | 長尺ナレーション品質 | 月10k credits、商用利用不可 | 月$6 | あり、$6から | REST、SDK、公式MCP server |
| Amazon Polly | 大量処理向け低価格API | 月5M文字、継続 | 従量課金 | なし | AWS SDK、IAM |
| Google Cloud TTS | APIで最も広い音声範囲 | 月4M文字、継続 | 従量課金 | なし | GCP SDK |
| OpenAI | 1ベンダー、1キー | なし | 従量課金 | Enterpriseのみ | REST、SDK |
| Deepgram | リアルタイムエージェント | $200 credit、1回限り | 従量課金 | なし | REST、ストリーミングSDK |
| Cartesia | 低価格・低遅延ストリーミング | 月20k credits、商用利用不可 | 月$5 | あり、$5から | REST、ストリーミングSDK |
| Azure AI Speech | Microsoft基盤の企業 | 月500k neural文字 | 従量課金 | あり、審査制 | Azure SDK |
| WellSaid Labs | 企業eラーニング | 月3ダウンロード分、商用利用不可 | 月$19 | なし | REST |
| Speechify Studio | 動画タイムラインのナレーション | 600 credits、商用利用不可 | 月$19 | あり、$19から | REST |
| NotebookLM | 無料の個人向け音声概要 | 1日3回生成 | Google AIサブスクリプション | なし | なし |
| ListenHub | 完成番組と、それを作るエージェント | 月次枠+毎日の追加 | 月$12、年払いなら月$9 | あり、全有料プラン | REST、MCP server、Agent Skills、SDK、CLI——全アカウントで利用可能 |
誰も同じ方法で価格を付けないので、課金単位を補足します。Google、AWS、OpenAIの旧モデルは文字単位、ElevenLabs、Cartesia、Speechify、ListenHubはcredits、WellSaidはダウンロード分数、OpenAIの新しいモデルはtoken単位です。これらは互換ではなく、一つのランキングに足し合わせる比較は数字を作り上げています。
最後の列は多くの比較が省く項目ですが、2026年には音声品質以上に購入を左右します。ここにあるすべての製品にはREST APIがあります。異なるのは、AIエージェントが先に統合コードを書かなくても操作できるか、そして一度の呼び出しから音声バイトが返るのか、完成コンテンツが返るのかです。
比較方法と、確認できなかったこと
何を、いつ比較したか。 2026年7月28日に各ベンダー自身の料金ページから公開価格、無料枠の上限、商用利用条件を読み、文書と照合しました。さらに、実際の購入を決める質問も確認しました。現在のプランで公開できるか、ボイスクローンが含まれるか、発音辞書があるか、何を単位に課金されるかです。TTSの価格は絶えず動くため、ここにある数字は出発点と考え、カードを登録する前に再確認してください。
採点しない理由。 10点満点の評価は、実施していない採点パネルがあったことを暗示します。あるツールの音が良いと言う場合、それはこれらの製品を使い、自社製品を作ってきた私たちの意見です。その文は自分で試す候補一覧として扱い、次節の失敗パターンを採点表にしてください。自分の最も難しい段落を20分試すほうが、私たちを含む誰のランキングより有効です。
確認できなかったこと。 JavaScriptで価格を描画し、引用できる安定した公開数字がないベンダーがあります。そのためMurfは下で説明しますが数字を付けません。Microsoftは無料枠を文章で公開する一方、有料料金はクライアント側で読み込むため、無料分だけを記載します。PlayHT、LOVO、MiniMaxは完全に除外しました。一次情報の価格が読み込めず、第三者の数字は矛盾し、明らかに過去年度から再利用されていたためです。出典を示せない15製品より、示せる11製品を扱います。
テストできなかったこと。 Enterprise限定機能は試せません。OpenAIのカスタム音声は営業との相談が必要なため、品質を説明できません。また、本番負荷での遅延ベンチマークも実施していません。単一リクエストの計測では、1,000の同時ストリームについて何も分からないからです。
音声読み上げが不自然に聞こえる本当の理由
ここにあるほぼすべてのツールは昔の基準を超え、もはやロボット音声ではありません。残る失敗はより微妙で、聞き手は名前を付けられなくても気づきます。お金を使う前に耳を鍛えるなら、この部分が重要です。
平坦な韻律。 英語では強勢が意味を運びます。「I didn't say she took the money」は、どの単語を強く読むかでおよそ7通りの意味になります。統計的に平均的な強勢を選ぶモデルは、文を正しく読んでも意味を誤ります。対比を聞いてください。本当に新しい情報である単語を強調しているでしょうか。
目のために書かれた文章を、そのまま読む。 これが最大の問題で、そもそも声の問題ではありません。文書には「e.g.」「Fig. 3」「$1.2M」「2026-07-28」「(see below)」と書かれています。人間は声に出す際、無意識に「for example」「figure three」「one point two million dollars」へ変えます。多くのエンジンは記号をそのまま読みます。箇条書きの断片はさらに悪く、書かれたリストには動詞がないため、無関係な名詞句の山になります。この失敗は音声品質が向上しても残るため、私たちは書き言葉から話し言葉への書き換えを専用に作りました。
名前と専門用語を毎回同じように間違える。 製品名、英語以外の姓、文字ごとに読む場合と単語として読む場合がある略語——「SQL」「Nginx」「Xiaomi」「José」。一貫性が致命的です。40話すべてで会社名を同じように誤読します。編集できる発音辞書があるか、ワークスペース全体に適用されるか、プロジェクトごとに入れ直す必要があるかを確認してください。
話者交替がない。 二つの音声を別々に生成して連結しても会話にはなりません。本当の会話にはわずかな重なりや相づちがあり、何より二人目の最初の音高が、一人目の終わり方に反応します。独立した二つのレンダリングをつなぐと、トレンチコートを着た二つの独白になります。
速度が均一。 人間はリストで速くなり、結論に入ると遅くなります。コンマではなく段落の境界で息をします。文と文の間に常に同じ間隔を置くエンジンは、約2分を超えると聞き手を疲れさせます。15秒のデモでは非常に見抜きにくい問題です。
ここからデモの罠も分かります。ベンダーのサンプル文は、うまくいくから選ばれています。それだけで何も判断しないでください。
動画とコース向けの自然なナレーション
最大の購入層です。原稿があり、それを読む声が必要で、完成物を公開する権利も必要です。
ElevenLabs——長尺ナレーションに最適
無料 $0/月、10,000 credits、商用ライセンスなし、クローンなし · 有料の入口 月$6 Starter · 単位 credits
本当の入口は無料枠ではなく、月$6のStarterです。30,000 credits、商用ライセンス、即時ボイスクローンが含まれます。Creatorは月$22で121,000 creditsとプロフェッショナルボイスクローン、Proは月$99で600,000です。長尺ナレーションでは、私たちが使ったどの製品より韻律を保ちます。章の3段落目に入っても文の流れを失いにくいツールです。
良い点: この一覧で最も強い長尺韻律。最安の有料層から即時クローン。同一クローン音声の多言語出力が強い。文書と統合の本格的なエコシステム。
良くない点: 無料枠には商用ライセンスもクローンもなく、無料で評価してそのまま公開する人がつまずく。creditsを頭の中で分数へ変換しにくい。Creatorを超えると費用が急増する。
結論: 一つの声で長い原稿を正しく読みたいなら、Starterを買って比較を終えてください。
WellSaid Labs——企業eラーニングに最適
無料 月3ダウンロード分、商用権利なし · 有料の入口 月$19、または年$120 · 単位 ダウンロード分数
WellSaidは企業とeラーニングチーム向けで、ダウンロード分数に基づき価格を付けています。財務部門が予算化しやすい単位です。Starterは月$19、年払いなら年$120で月20分。Proは月$49、年払いなら年$396で月180分です。音声はElevenLabsより少なく控えめですが、それこそコンプライアンス審査を受ける研修モジュールが求めるものです。
良い点: 分数は財務が理解できる単位。保守的で一貫した音声は法務審査に耐える。年払いが端数調整ではなく実質的な割引。
良くない点: 2026年の基準では小さなカタログ。ボイスクローンなし。毎週制作するなら月20分は少ない。
結論: 研修コンテンツで安全な調達案であり、この一覧で最も請求額を予測しやすい製品です。
Speechify Studio——動画編集内のナレーションに最適
無料 600 credits、商用権利なし · 有料の入口 月$19 Starter · 単位 credits、ナレーション1秒あたり1
Speechify Studioはテキストボックスではなく、動画編集タイムラインを中心に作られています。Starterは月$19で7,200 credits、ボイスクローン、商用権利。Creatorは月$49で28,800です。ナレーションは1秒1 creditなので、Starterは完成ナレーション2時間分です。表計算なしで頭の中で換算できる珍しいcredit制度です。
良い点: 1秒1 creditで理解しやすい。ナレーションと動画編集が一か所。入口プランにクローンと商用権利。
良くない点: 不要な編集機能にも費用を払う可能性がある。長い原稿のナレーション品質はElevenLabsより一段下。無料枠はデモ。
結論: 音声が完成物ではなく動画プロジェクト内の1トラックなら適切です。
Murf——共同スタジオ作業に最適
無料 引用なし · 有料の入口 引用なし · 単位 引用なし
Murfもこのグループに入ります。特に共有プロジェクトを持つ共同スタジオを求めるチーム向けです。料金ページがクライアント側で描画され、責任を持って示せる数字を読めなかったため、価格は引用しません。他の製品には数字がありますが、この欠落は製品への評価ではなく、私たちの出典上の空白です。
結論: チーム作業なら検討に値しますが、現在価格はMurfから直接入手してください。
拡張できるAPI
ここでは、どの声が最も美しいかは問題ではありません。代わりに四つが決め手になります。
単位あたりの経済性。 文字、秒、仕事単位でいくら払うか、量が増えても曲線が妥当か。純粋な音声合成ではクラウドが完全に勝ちます。100万文字あたり$4は、どのサブスクリプションも下回れない床です。
遅延と形。 会話の一往復にストリーミングsocketが必要なのか、10分のレンダリングを投げて待つジョブが必要なのか。別の製品であり、一方に最適化したベンダーは通常、もう一方では平凡です。
1回の呼び出しが返すもの。 見落とされる軸です。この節の多くは、渡したテキストに対する音声バイトを返します。原稿、分割、複数音声の組み立て、字幕タイミング、muxingは自分で担います。少数の製品は完成物を返します。この差が節約する開発時間は、このページの価格差より大きいものです。
エージェントが単独で操作できるか。 2026年には、キーボードの前の開発者より、コーディングエージェントが多くの呼び出しを行います。その場合、MCP server、Agent Skill、型付きSDKのように、エージェントが発見して呼び出せるツール面をベンダーが提供するか、それとも誰かが先に統合を書き、保守する必要があるかが重要です。
採用前に知るべきもう一つは、ベンダーの耐久性です。Google、AWS、Microsoft、OpenAIはなくなりません。他は若く、新規参入企業の価格はすでに複数回動いています。
Google Cloud Text-to-Speech——範囲に最適
無料 月4M文字のStandardとWaveNet、1M Chirp 3 HD、継続 · 有料 1M文字あたり$4–$160 · 単位 文字
この一覧で最も広く実用的な範囲です。継続無料枠の後、StandardとWaveNetは100万文字$4。Neural2は無料100万文字の後に$16。現在の旗艦Chirp 3 HDは無料100万文字の後に$30。Studioは$160です。新しいGemini-TTSモデルはtoken課金で、無料枠はありません。注意点は、無料文字だけを使う場合でも請求を有効にする必要があることです。
良い点: 実用的なプロトタイプをゼロ費用で動かせる継続無料枠。あらゆる予算に音声クラス。数十言語とロケール変種。
良くない点: $4から$160までの階段は、説明を読まず音声クラスを選ぶ人を直撃する。コードが必要でスタジオはない。token課金のGeminiは他との比較を崩す。
結論: 安価な大量処理と旗艦音声を一社で賄いたい場合の標準API選択です。
Amazon Polly——最も安い恒久無料枠に最適
無料 月5M Standard文字、12か月で終わらず継続 · 有料 1M文字あたり$4–$100 · 単位 文字
低価格帯のリーダーであり、業界最高の無料枠です。Standardは100万文字$4、Neural $16、Generative $30、Long-Form $100。月500万Standard文字は1年後も失効しません。見出しにするほど珍しい条件です。
良い点: 大規模で本当に恒久的な唯一の無料枠。インフラらしい退屈な安定性。予測可能な文字課金。
良くない点: 高品質音声クラスの無料期間は限定。クローンなし。Standardは2026年の旗艦と比べ古く聞こえる。
結論: 永久無料が重要でコードを書けるなら、ここから始めてください。
OpenAI——すでにOpenAIを使うチームに最適
無料 なし · 有料 tts-1は1M文字$15、tts-1-hdは$30 · 単位 文字、新しいモデルはtoken
既存スタックがOpenAIにあり、1ベンダー・1キーにしたいなら当然の選択です。旧モデルは分かりやすく、tts-1が100万文字$15、tts-1-hdが$30です。新しいgpt-4o-mini-ttsは文字ではなくtoken課金なので、自分の音声token出力を測るまで文字課金ベンダーと比較できません。
良い点: すでに使っているなら1キー、1請求、1 SDK。トーン指示への追従が強い。文書が良い。
良くない点: 無料枠がまったくなく、最初のリクエストから課金。新モデルのtoken課金は本当に予測しにくい。カスタム音声は営業相談の後。OpenAIの利用ポリシーは、AI生成音声であることの開示も求める。
結論: 便利さが機能です。音声だけを理由にOpenAIへ移る人はいません。
Deepgram——リアルタイムエージェントに最適
無料 $200 credit、1回限り、カード不要 · 有料 Aura-2は1k文字$0.030、Aura-1は$0.0150 · 単位 文字
美しさより遅延が重要な、リアルタイムとエージェント負荷向けです。登録時にカードなしで$200 creditが付きます。ここで最も大きな無条件試用ですが、継続ではなく1回限りです。
良い点: プロトタイプを完成させるのに十分な試用。会話ターン向けの遅延。同じベンダーのspeech-to-text。
良くない点: $200は戻らない。音声カタログが狭い。長尺ナレーション向けではない。
結論: 音声エージェントには正解、オーディオブックには不正解です。
Cartesia——低価格ストリーミングに最適
無料 月20k credits、商用利用不可 · 有料の入口 月$5 Pro · 単位 credits
低遅延ストリーミングに対して非常に安価です。Proは月$5で100,000 credits。ただし、商用ライセンスと即時ボイスクローンを初めて得られるのもProなので、無料枠は完全に評価用sandboxです。Startupは月$49で1.25 million credits、Scaleは月$299で8 millionです。
良い点: この一覧で最安の有料入口、月$5。その層からクローン。実際に低遅延。
良くない点: 無料枠から公開できない。クラウドより若い企業。カタログが小さい。
結論: 遅延重視の製品を作り、小さなベンダーを許容できるなら、ここで最もストリーム単価が良い選択です。
Microsoft Azure AI Speech——Microsoft基盤の企業に最適
無料 月500k neural文字、継続、強いスロットル · 有料 地域により変動 · 単位 文字
Azureは、月500,000 neural TTS文字と5時間のspeech-to-textを含む継続F0無料層を公開しています。強く制限され、本番向けではありません。有料料金はクライアント側で読み込まれるため引用しません。Azureはこの一覧の大半より地域差が大きいので、自分の地域のポータルで確認してください。
良い点: 深い言語・ロケール対応。大企業が必要とするコンプライアンスとデータ所在。承認顧客向けcustom neural voice。
良くない点: 地域別価格を自分で調べる必要がある。無料層の制限でデモに近い。コンソールが重い。
結論: 会社がすでにAzure上なら、この選択は決まっています。
ElevenLabs——音声向けエージェントツール面に最適
ナレーション品質は上で扱いましたが、ここにも正直に入れる必要があります。ElevenLabsは公式MCP serverを提供し、私たちより大幅に広いツール面を持ちます。音声、文字起こし、speech-to-speech、効果音、音楽、音声設計、発信型音声エージェントを、Claude Desktop、Cursor、Windsurf、OpenAI Agentsで利用できます。
結論: エージェントの仕事が音声プリミティブで、一つのMCP接続に最大範囲を求めるなら、これを導入してください。以下の私たちの答えは音声プリミティブでは狭く、完成物では広いものです。
ListenHub——一つのキーで音声と動画に最適
無料 月次枠+毎日の追加、API keyを含む · 有料の入口 月$12、年払いなら月$9 · 単位 credits
自社APIのためこの節が長くなったので、正直な形を示します。これは文字単価の安い合成endpointではなく、仕事の単位が異なります。一度のPOSTでジョブを開始し、完成物を返します。執筆済み脚本を持つ2人番組、SRT字幕付きナレーション、レンダリング済み解説動画、スライド、音楽、画像です。ジョブは非同期で、タスクを作成してpollします。10分のレンダリングはHTTP往復では終わらないためです。
一つのAPI keyで、ポッドキャスト、音声読み上げ、ボイスクローン、音楽、画像生成、解説動画、スライド、AI動画、URLやファイルからのコンテンツ抽出を扱えます。動画部分のための別ベンダーも、音声と映像をつなぐglue codeも不要で、一つのcredit残高と一つの請求です。全API面は下でさらに説明します。
良い点: 音声バイトではなく完成物。1キーで音声と動画。4つの第一方入口(REST、MCP、Agent Skills、SDK/CLI)により、統合なしでエージェントが操作可能。どのアカウントもキーを作れ、評価は無料。非同期タスクモデルは長いレンダリング向き。SDKがレスポンスenvelopeを展開し、rate limitを再試行。
良くない点: creditsは文字より粗く、リクエスト費用はPollyより予測しにくい。無料枠はPollyの月500万文字より小さく、継続量にはサブスクリプションかcredit packsが必要。ElevenLabsはMCP上の音声ツールが多い。遅延SLAを公開せず、リアルタイム音声エージェントには使うべきではない。
結論: エージェントやbackendから完成済みで公開可能なコンテンツを出したい場合の正解。安い大量合成や1秒未満ストリーミングには不正解です。
クリップではなく、完成番組
「音声読み上げ」と検索されるため同じ分類に入りますが、別の製品カテゴリです。原稿はなく、文書があり、二人にそれを議論してほしい場合です。
NotebookLM——無料の個人リスニングに最適
無料 Googleアカウントで1日3回音声生成 · 有料 Google AIサブスクリプション経由 · 単位 生成回数
無料で、この用途には驚くほど優れています。ソースをアップロードすると2人の音声概要を作ります。Google自身のサポート文書では、無料プランは1日3回の音声生成と50回のチャットです。時々、個人的に密度の高いPDFを散歩用へ変えたいだけなら、無料に勝つ議論は困難です。
良い点: 本当に無料。2人の会話に説得力がある。設定不要。
良くない点: 話す前に脚本を編集できず、声を選べず、クローンやブランド削除もできない。出力は一つの固定形式。予定に沿った公開向けではない。
結論: 自分の文書を無料で聞く最良の方法ですが、制作ツールではありません。
ListenHub——公開可能な複数音声番組に最適
無料 月次枠+毎日の追加 · 有料の入口 月$12、年払いなら月$9 · 単位 credits
これは私たちが作る製品なので、適切に疑って読んでください。そして、不得意な部分まで含む正直な長文の次節も読んでください。一行で言えば、NotebookLMは音声概要を渡し、ListenHubは編集、ブランド設定、公開ができる番組を渡します。
良い点: 話す前に脚本を編集可能。音声読み上げとボイスクローンは12出力言語。前述の「そのまま読む」失敗を直す書き言葉から話し言葉への変換。1つのcredit残高で音声、SRT、動画、スライド。
良くない点: AIポッドキャスト形式自体は英語、中国語、日本語のみ。脚本編集、ファイル出力、クローン、ブランド削除には有料プランが必要で、無料枠は公開より試聴向け。単位価格は100万文字$4に届かない。動画編集タイムラインなし。1つの声で長い原稿を読むならElevenLabsが上。
結論: ソース文書から完成した複数音声番組を作ることが成果物なら、私たちを選んでください。このページの他の多くの仕事には、他の製品が適しています。
ListenHubが実際にすること
レポート、論文、URL、原稿を持ち込み、人が本当に聞くものを求めています。通常の音声読み上げ欄にはない四つが起こり、それが私たちを選ぶ理由です。
最初に書き言葉を話し言葉へ変える。 書き言葉から話し言葉への工程であり、この記事最大の失敗に対処します。「Fig. 3 shows a 12.4% YoY increase (see Appendix B)」は人間が実際に口にする表現になります。箇条書きの断片には動詞が付き、略語は読み手がするように展開されます。すでに会話的ならオフにして逐語読みも可能です。法的免責はそのまま読むべきです。
二つの独白をつなぐのではなく、対話を書く。 先ほどの話者交替は、合成問題である前に脚本問題です。二人の司会には会話として書かれた脚本が渡され、二人目は一人目が実際に言ったことへ応答します。
話す前に脚本を編集できる。 おもちゃと道具の違いです。脚本を見て、製品の位置付けを誤読した文を直し、脱線を切り、その後で初めて音声にcreditsを使います。文章の修正は無料ですが、音声再生成は無料ではありません。脚本編集はBasic以上の機能です。
一つの残高が全出力を覆う。 SRT字幕付き音声、解説動画、スライド、画像——同じcreditsで、二つ目のサブスクリプションは不要です。ファイル出力とListenHubブランド削除もBasicからなので、無料枠は公開場所ではなく、音を聞く場所です。
APIとエージェント向けインターフェース
機能表に出ない半分で、開発者には最も興味深い部分です。Webアプリでできることはすべてプログラムから到達でき、四つの第一方インターフェースが同じAPI keyで認証し、同じcredit残高を使います。
REST API。 Settings → API keysでキーを作成します。形式はlh_sk_…です。https://api.marswave.ai/openapiを呼び出します。レスポンスは{ code, message, data }の共通envelopeで、非ゼロcodeがエラーです。生成は意図的に非同期で、タスクを作りpollします。完成エピソードやレンダリング動画にはミリ秒ではなく数分かかるためです。endpointには、ポッドキャスト生成、音声読み上げ、end-to-end音声のListenHub Voice、音楽、画像生成、解説動画、スライド、AI動画、話者検索、URLまたはファイルからのコンテンツ抽出、サブスクリプション状態が含まれます。APIドキュメントに全リファレンスがあります。endpointごとのパラメーターと言語対応は、ブログより速く変わるためそちらに記載します。
MCP server。 ListenHubはModel Context Protocol serverを提供します。Claude Desktop、Cursor、Windsurf、VS Code、ZedなどのMCPクライアントが、HTTPを直接叩かずにツールとして、ポッドキャストやナレーションを生成し、音声カタログを見て、アカウントを確認できます。各ツールは公開API endpointを包むため、二つの面は同期します。既定はstdio、remote用途ではHTTP/SSEで動き、LISTENHUB_API_KEYで認証します。重要なのは、create_podcastが完了まで代わりにpollすることです。一度のツール呼び出しで、エージェントが監視するtask idではなく完成エピソードが返ります。MCP文書を参照してください。
Agent Skills。 コーディングエージェントに最初に勧める面です。
npx skills add marswaveai/skills
これにより、Agent Skills対応ツール——Claude Code、Cursor、Windsurf、OpenCode——向けにListenHub Skillsがプロジェクトへ入ります。その後は自然言語で、この記事を解説動画にして、この三つのURLから2人ポッドキャストを作ってと指示します。エージェントが声を選び、生成を操作し、完了をpollし、リンク付き完成物を返します。音声、ポッドキャスト、音声読み上げ、解説動画、スライド、画像、音楽、文字起こし、コンテンツ解析の個別skillがあり、一つの巨大endpointではなくパイプラインを構成できます。
SDKとCLI。 @marswave/listenhub-sdkは公式の型付きJavaScript/TypeScriptクライアントです。ESM専用、型同梱、runtime依存は一つ、Node 20以上です。レスポンスenvelopeを展開し、429を再試行するため、自作不要です。二つのクライアントを公開し、この違いは実用的です。OpenAPIClientはAPI keyで認証し、サーバー、スクリプト、CI向けでキー所有者として動きます。ListenHubClientはOAuth user tokenを使い、各リクエストを個々のログインユーザーとして実行します。ユーザー向け製品に適した選択です。@marswave/listenhub-cliは同じSDKをlistenhub binaryとして包み、同じ分割を持ちます。対話作業はOAuthブラウザログイン後にlistenhub …、CIはキーでlistenhub openapi …を使います。SDKとCLIの文書があります。
プログラムから声を選ぶ。 話者検索はIDと名前だけを返しません。各声にpitch、speed、traits、styles、suggested scenes、accent、descriptionと、ローカライズされた説明があります。そのためエージェントは、一度人が選んだIDを固定する代わりに、「オーディオブック向けの温かい女性ナレーター」のようなbriefから選べます。endpointよりファイルを読みたいエージェント向けに、/voices.txtのプレーンテキストカタログもあります。
二点を明確にします。プランは不要です。どのアカウントもキーを作れ、カードなしで無料枠上のAPIを評価できます。週末の試作は無料です。必要なのはcreditsです。API呼び出しはWebアプリと同じ残高を使うため、自動処理とチームの手動利用が同じ財布から出ます。継続量にはサブスクリプションかcredit packが必要です。単位は文字より粗いcreditsで、文字単価より予測しにくいものです。
言語と声
音声読み上げとボイスクローンはいずれも12言語で動きます。英語、中国語(標準語)、日本語、スペイン語、ポルトガル語、フランス語、ドイツ語、トルコ語、韓国語、イタリア語、タイ語、ベトナム語です。公開音声カタログには声ごとのタグと説明があり、名前を一つずつ試さず、言語、性別、話し方で絞れます。エージェント向けのプレーンテキストカタログ/voices.txtもあります。
何を含むか、含まないかを正確にしてください。別の場所で過大に宣伝されているのを見ました。12言語は音声読み上げとクローンに適用されます。AIポッドキャスト形式と他の制作ツールは、今も英語、中国語、日本語で生成します。今日スペイン語の2人ポッドキャストが必要なら、まだ対応できません。
ボイスクローン
サンプルから自分の声をクローンし、カタログ音声が使える場所なら12言語すべてで利用できます。全有料プランにクローンが含まれ、Basicは保存1件、Proは4件、Maxは20件です。プランの上限を超える保存は1件300 creditsです。ボイスクローンガイドが良いサンプルを説明します。短く言えば、雑音のある30分より、きれいな3分です。
料金
Basicは月$12、年払いなら月$9で、1,300 creditsと1ボイスクローン。Proは月$24、年払いなら月$19で、2,700 creditsと4クローン。Maxは月$240、年払いなら月$200で、30,000 creditsと20クローンです。API、MCP server、Agent Skillsはプランにひも付きません。無料枠を含む全アカウントで動き、持っているcreditsから使います。
作業量に換算すると、5分ポッドキャストは約24 credits、10分の音声読み上げは約40、10ページの資料は約150です。Proをすべて音声に使えば、月約11時間になります。無料枠には月次分と小さな毎日の追加があります。料金ページの現在値は頻繁に動くため、ここで固定せずそちらへ案内します。creditsガイドは三つのcredit種類がどう重なり、どの順で使われるかを説明します。
上記ツールより弱い点
いずれ分かることなので、明確に述べます。
- 大量時の単位価格。 PollyとGoogleは100万文字$4です。サブスクリプションは競えず、競えるふりもしません。
- 一人声の長尺仕上がり。 ElevenLabsは非常に長い一人ナレーションでも韻律をより保ちます。
- エージェント向け音声ツールの幅。 ElevenLabsのMCP serverは、文字起こし、speech-to-speech、音声分離、音声設計、発信など、私たちより多くの音声プリミティブを公開します。私たちは完成物向けです。
- 文字単位API計測なし。 文字ではなくcreditsを使うので、リクエスト費用は公開された100万文字$4より予測しにくく、無料枠もPollyの月500万文字の一部です。
- 遅延保証なし。 SLAを公開せず、タスクモデルはリアルタイムターンではなくレンダリング向けです。ライブ音声エージェントに入れないでください。
- 動画編集。 Speechifyはタイムライン、私たちは書き出しを提供します。
- ポッドキャスト言語。 TTSとクローンは12、ポッドキャスト形式は3。
- 企業調達。 AzureやAWSが提供するデータ所在保証やカスタム契約はありません。
無料枠の比較
無料枠は製品かデモかで異なります。重要なのは大きさではなく、作ったものを公開できるかです。
| ツール | 無料分 | 継続? | 無料から公開? |
|---|---|---|---|
| Amazon Polly | 月5M Standard文字 | はい、期限なし | はい |
| Google Cloud | 月4M Standard文字、1M Chirp 3 HD | はい | はい |
| Azure | 月500k neural文字 | はい、制限あり | はい |
| Deepgram | $200 credit | いいえ、1回 | はい |
| NotebookLM | 1日3回生成 | はい | 個人利用 |
| ElevenLabs | 月10k credits | はい | いいえ |
| Cartesia | 月20k credits | はい | いいえ |
| Speechify | 600 credits | はい | いいえ |
| WellSaid | 月3ダウンロード分 | はい | いいえ |
| ListenHub | 月次+毎日の追加 | はい | いいえ、出力にプランが必要 |
下の五つは正直ですが、公開するなら役に立ちません。私たち自身も上に置かず同じグループにしました。出力できない無料枠は、誰が作っても評価sandboxです。初日から有料入口の予算を組んでください。それぞれ$6、$5、$19、$19、$12です。Pollyの高品質音声クラスも期間限定で、最初の12か月のみNeural月100万、Long-Form 500,000、Generative 100,000です。
「無料」が絶対条件で公開したいなら、候補はPollyとGoogle Cloudだけで、コードを書くことになります。
英語以外の言語
幅ではクラウドが完全に勝ちます。Google、Azure、Pollyはいずれも、現在の波よりずっと前から作り、数十言語を母語話者の声とロケール別変種でカバーします。ElevenLabsは一つの声による多言語出力に強く、同じクローン音声が別言語を話します。これは別の有用な能力です。
マーケティングが曖昧になるのは、対応と良いの差です。多くのベンダーは大きな言語数を示しますが、大半を一つの多言語モデルと英語向けに調整した少数の声で提供しています。OpenAIは自社文書で率直です。対象言語向けとして実際に販売される声のサンプルを求め、母語話者に聞いてもらってください。
その基準で、切り上げなしの私たちの位置は、音声読み上げとボイスクローンで12言語です。アクセント設定付き英語音声ではなく、カタログの声があります。ポッドキャスト形式は3言語です。ヒンディー語、アラビア語、インドネシア語のナレーションが必要なら、私たちは対応せず、GoogleやAzureが対応します。
どれを選ぶべきか
ナレーション動画を公開する個人クリエイター。 ElevenLabs Starter、月$6。編集タイムラインも欲しい場合だけSpeechifyを追加します。
L&Dまたは研修チーム。 WellSaid Labs。分数は予算化でき、声は法務審査に耐えます。
製品内に合成を必要とするエンジニア。 Google CloudまたはPolly。継続無料枠で試作し、音声クラスを意識して選んでください。100万文字$4と$160の差は音声クラスのdropdown一つです。
音声エージェントを構築する。 DeepgramまたはCartesia。遅延とstreamあたり費用がすべてで、カタログサイズではありません。
AIエージェントに完成コンテンツを自動制作させたい。 ListenHub SkillsまたはMCP server。npx skills add marswaveai/skills一つで、コーディングエージェントは統合を書く前にURLを公開済みエピソードや解説動画へ変えられます。開始にプランは不要で、無料アカウントがキーを持ち、評価後はcreditsで払います。文字起こし、効果音、音声設計のような完成物ではなく音声プリミティブが必要なら、ElevenLabsのMCP serverを入れるか、両方入れてください。
CIでコンテンツパイプラインを自動化する。 API key付きのSDKまたはCLI。合成だけならクラウドです。listenhub openapi …はそのスクリプト用途のためにあります。
密度の高いPDFを扱う学生・研究者。 NotebookLMを無料で。脚本編集と公開可能な出力が欲しくなった時点で、卒業です。
文書から番組やコンテンツ企画を公開する。 ListenHub。編集可能な脚本、複数音声出力、ブランドなしの書き出し、音声・動画・スライド共通残高です。
本当に$0が条件でコードを書ける。 Polly、次にGoogle Cloud。他の無料枠は公開禁止か、使い切ります。
実際によくある質問
最も優れた無料の音声読み上げツールは? コードを書けるならAmazon Pollyです。月500万文字が永久にあり、結果を公開できます。コードを書けないならNotebookLMが個人リスニングに無料です。ElevenLabs、Cartesia、Speechify、WellSaid、私たちを含む多くの消費者向け無料枠は、商用利用を禁じるか、有料プランの後ろに書き出しを置きます。
YouTubeや顧客案件でAI音声を使える? 商用ライセンスを与える層だけで、通常それは無料層ではありません。ElevenLabsは$6、Cartesiaは$5、Speechifyは$19からです。上位ではなく、買う予定の正確な層のライセンスを確認してください。プラットフォーム規則はベンダーライセンスと別で、OpenAIのポリシーはAI生成音声であることの開示も求めます。
ボイスクローンとは何で、許可が必要? 声のサンプルを渡し、モデルが音色を再現して任意の文章を読めるようにします。その声の人の同意が必要で、自分の声も含まれます。無断で他人の声をクローンするのは法的問題への最短経路で、信頼できるベンダーの規約はすべて禁止します。
最も自然な声はどのツール? 一つの声で長い原稿を読むなら、私たちの経験ではElevenLabsです。ただし「自然さ」は音色より、韻律、記号の逐語読み、名前の誤読で失敗します。ランキングではなく、自分の最悪の段落を試してください。
いくら払う想定? クリエイター向けサブスクリプションは月約$5–$25、APIは100万文字あたり$4–$30です。無料枠は評価と個人利用をカバーし、公開は通常最初の有料層からです。
AI生成音声は検出できる? 確実にはできず、それを前提に計画すべきではありません。合成メディアの開示を求めるプラットフォームや、規約で求めるベンダーがあります。開示しなかったと判明した際の評判コストは、開示のコストを上回ります。
音声読み上げとAIポッドキャストの違いは? 音声読み上げは原稿を受け取り、読みます。AIポッドキャストはソース文書を受け取り、通常は対話として脚本を書き、それを読みます。すでに言葉があるなら音声読み上げを買い、レポートから会話を作りたいなら別製品で、それが私たちの製品です。
APIとアプリ、どちらが必要? 音声が製品内の機能ならAPI、または量が多く文字課金がサブスクリプションより安いならAPIです。音声自体が成果物で、コードを保守したくないならアプリです。40話を手作業するためにAPIを買うのは、よくある高価な間違いです。
AIエージェントが直接使えるのは?
ElevenLabsとListenHubは公式MCP serverを提供し、Claude Desktop、Cursor、Windsurfのエージェントが統合なしにツールとして呼べます。ListenHubはさらにClaude Code、Cursor、Windsurf、OpenCode向けAgent Skills——npx skills add marswaveai/skills——を公開します。他はREST APIで、先に自分かエージェントが包む必要があります。実用上の差は戻り値で、ElevenLabsは音声プリミティブ、ListenHubは完成エピソード、動画、資料を渡します。
ListenHub APIの費用と無料キーは? 無料を含むどのアカウントもキーを作れ、プラン不要です。支払うのはWebアプリと共通のcreditsで、評価は無料、継続量は月$12からのサブスクリプションかcredit packです。正直な注意点は単位で、creditsは文字より粗いため、リクエスト単価を1セント単位で予測するならPollyやGoogle Cloudの文字課金が容易です。
自分のサインインユーザーを代表してListenHubを呼べる?
はい。そのために二つのSDKクライアントがあります。OpenAPIClientはAPI keyを使いキー所有者として動き、サーバー、スクリプト、CI向けです。ListenHubClientはOAuth user tokenで個人ユーザーのアカウントとして各リクエストを実行し、ユーザー向けアプリに適します。API keyをブラウザやモバイルコードへ置かないでください。
ListenHubはどの言語に対応? 音声読み上げとボイスクローンは12言語、英語、中国語(標準語)、日本語、スペイン語、ポルトガル語、フランス語、ドイツ語、トルコ語、韓国語、イタリア語、タイ語、ベトナム語です。AIポッドキャスト形式は英語、中国語、日本語の3言語です。APIとMCPは、Webアプリの範囲を仮定せず、endpointごとにリファレンス文書を確認してください。
私たちが他社を勧める場面
六つを率直に示します。
一つの声で長い原稿を美しく読みたい。 ElevenLabsを買ってください。長尺韻律が専門で、月$6は実質的な障壁ではありません。
量と予算を持つエンジニア。 Google CloudまたはPollyへ。サブスクリプションは100万文字$4に勝てず、継続無料枠で試作も無料です。
エージェントに完成物ではなく音声プリミティブが必要。 ElevenLabsのMCP serverを入れてください。文字起こし、speech-to-speech、効果音、音声設計、発信が揃い、私たちのツール面は意図的に狭いものです。
リアルタイムのものを作る。 DeepgramまたはCartesia。私たちは遅延SLAを公開せず、タスクモデルはレンダリング向けです。
非対応言語、または英語・中国語・日本語以外の2人ポッドキャストが必要。 ナレーションの幅ならGoogleかAzure。ポッドキャスト形式は音声カタログにまだ追いついていません。
文書を自分用の聞ける要約にしたい。 NotebookLMを使ってください。無料で良く、通勤中の個人リスニングに脚本編集、ブランド削除、ボイスクローンは不要です。
私たちがより良いのは二つです。ソース文書から、話す前に脚本を編集できる、完成済みで公開可能な複数音声番組を求める場合。そして、エージェントやbackendに一つのキーで、音声・動画を含むその種の出力を作らせる場合です。
決める前に自分でテストする
20分で、この記事を含むどの比較記事より多く分かります。
- 製品名、略語、数字、括弧の補足を含む、実際の最も難しい段落を用意します。ベンダーのデモ文は使いません。
- 編集せず、候補の三つへ通します。
- ヘッドホンで1x、最初から最後まで聞きます。倍速は速度の問題を隠します。
- 前述の失敗を数えます。誤った強勢、記号の逐語読み、崩れた名前、死んだ話者交替、均一な間隔です。
- その後で価格を見ます。会社名を誤読するツールは、どんな単価でも安くありません。
- 上位ではなく、実際に買う層の商用ライセンスを確認します。
私たちも試すなら、音声読み上げとAIポッドキャストはカードなしの無料枠で動きます。ブラウザより端末で評価したければ、npx skills add marswaveai/skillsでコーディングエージェントへ渡せます。API文書も支払い前から公開されています。
競合があなたの文章で勝ったなら、その製品が勝つに値したということです。