Product

文章を話し言葉に書き換えてから読む TTS

一般的な音声読み上げは文章をそのまま読みます。ListenHub TTS はまず話し言葉へ書き換えます。5つの音声を、2組の直接比較で紹介します。

ListenHub Team公開日 更新日
PRODUCT と表示された濃い紫のグラデーション表紙。「耳で聞くために書き換える TTS」という見出し、ListenHub のワードマーク、listenhub.ai が入っている

この機能を作るきっかけは、あるユーザーから届いた1通のメールでした。ここでは、この機能が解決する問題と、どんな仕様書よりも違いをよく伝える5つの音声を紹介します。

書く予定のなかったチュートリアルから始まった

2025年5月に ListenHub を公開してから数週間で、登録ユーザーは10,000人を超えました。

その中で最も記憶に残っているのは、ある高齢の男性です。オンラインで ListenHub を見つけたものの使い方が分からず、チュートリアルはないかとメールをくれました。

最初に思ったのは、「チュートリアル? ListenHub に? こんなに簡単なのに」ということでした。

それが教訓でした。毎日 AI を作っている人には自明に見える製品でも、それ以外の人には本当に難しいことがあります。

そこで「まだありませんが、今から書きます」と返信し、Notion を開いて、これまでで一番平易なチュートリアルを書きました。

ピンクとオレンジのグラデーション上に表示された ListenHub 101 チュートリアル。初めて使うユーザーにホーム画面と「Write down what you want the AI to talk about」入力欄を案内している

その下書きが、現在も公開している ListenHub 101 のガイドになりました。

その後のメールのやり取りを通じて、誰のために書いていたのかが分かりました。

1957年、Bill Vick は米国海兵隊で Force Recon Pathfinder として任務に就いていました。2025年に私たちへ連絡をくれたとき、彼は80代後半で、別の戦いに向き合っていました。長年の特発性肺線維症と4度の脳卒中によって、話す能力を失っていたのです。

それでも、彼の中の海兵隊員は止まりませんでした。病気と生きる人々の世界的な支援コミュニティ PF Warriors を設立し、今では ListenHub を自分の声として使っています。音声を生成してコミュニティに共有し、同じ状況にいる人たちを助けています。

結局のところ、仕事の本質はそれです。実際の人を助けるものを作ること。

声を届ける方法の一つがポッドキャストですが、それだけではありません。そこで、番組の司会、論文の解説、スピーチ、そして小説の朗読までできる汎用 AI 音声を作ることにしました。それが ListenHub 音声読み上げ です。

書き言葉と話し言葉は別のもの

もっともな疑問があります。音声読み上げサービスはすでにたくさんあるのに、なぜもう一つ作るのでしょうか。

読んで分かりやすい文章でも、声にするとひどく聞こえることがあり、自然な話し言葉はページ上では不自然に見えることが多いからです。学術論文、ニュース記事、チャットボットの回答は、どれも基本的に「読む」ために設計されています。

ほとんどの TTS ツールは、入力された文章をそのまま読みます。それはスライドの文字を一語ずつ読み上げて発表するようなものです。内容は一応網羅できますが、誰もついてこられません。

ListenHub TTS は、誰もが省きがちな工程を追加します。書き言葉を話し言葉へ書き換え、それから読み上げます。意味は同じまま、目ではなく耳に合う構成へ変えます。書き換えをオフにして逐語的に読むこともでき、契約書や免責事項ではそのほうが適しています。

抽象的な説明より、実際に耳で判断してください。

ケース1:アウトラインらしく聞こえないアウトライン

AI ツールは Markdown が大好きです。見出し、箇条書き、入れ子のリストは画面では便利ですが、音声にすると機械的です。

テスト用の文章はこちらです。

# Product Launch Core Outline

## Problem Background
- Spoken and written language are two different forms of expression
- Written text isn't always suitable for audio delivery
- Spoken words aren't always suitable for writing
- Papers, news, AI answers are designed for reading, not speaking

## Market Status
- Existing TTS services only read text literally
- Being "readable" doesn't make it "speakable"
- Lacks a conversion layer from written to spoken language
逐語的な読み上げ — ページ上のアウトラインをそのまま読む

硬く、機械的で、文章を一緒に見ていなければ追いにくい音声です。次は同じ原文で書き換えをオンにします。

耳向けに書き換え — 同じアウトラインを話し言葉に

見出しはつなぎの言葉に、箇条書きは文になりました。目を閉じても内容を追えます。

ケース2:実際に聞ける研究論文

論文は意図的に情報密度が高く書かれています。逐語的に読み上げると、ほとんど聞いていられません。

「Attention Is All You Need」の冒頭を、両方の方法で処理しました。

研究論文「Attention Is All You Need」の1ページ目。タイトル、8人の著者、密度の高い学術的な文章で書かれた要旨の冒頭が表示されている

逐語的な読み上げ — ページ上の要旨をそのまま読む

著者名、所属、引用記号をすべて順番どおりに読みます。次は書き換えをオンにします。

耳向けに書き換え — 同じ論文を声で解説

論文を読んだ友人が、内容を順に説明してくれているように聞こえます。正確で、巻き戻す必要もありません。

ほかにどんな使い方があるか

自分のクローン音声で読む就寝前の物語。スライド資料を、それに合わせた講演へ変換。スタンドアップコメディ。ASMR も作れます。

ASMR 音声

自分の声と組み合わせる

ボイスクローンを追加すれば、出力は既成の音声ではなく自分の声になります。小説を読み、論文を説明し、ポッドキャストのイントロを録り、ショート動画にナレーションを付ける作業を、実際に録音せずに行えます。

クローンはすべての有料プランに含まれます。Basic は1音声、Pro は4音声、Max は20音声です。現在の詳細は料金で確認できます。既成の音声を使いたい場合は、公開ボイスカタログも利用できます。

なぜうまくいくのか

主に次の3点が効果を支えています。

  1. 文脈理解。 モデルは読み上げる前に意味を読み取るため、その文章が実際に何を伝えているか、聞き手ならどう表現するかを判断できます。
  2. マルチモーダル入力。 プレーンテキストだけでなく、画像や PDF 文書も扱えます。
  3. 賢い削除。 広告、コードブロック、ナビゲーションの不要部分、余計な文字は読み上げずに除外します。

ストリーミングにも対応しています。残りの音声を生成している途中から再生が始まるため、プログレスバーを見続ける必要はありません。

これらはすべて、ListenHub を作る中でプロダクトチームとエンジニアリングチームが学んだこと、そして率直なユーザーフィードバックから生まれました。ありがとうございます。

どんな人に向いているか

  • コンテンツ制作者:録音セッションを行わず、記事やナレッジベースを音声に変換したい人。
  • オーディオブックのリスナー:もっと生き生きしたナレーションを求める人。
  • ビジネスチーム:研修資料、製品ウォークスルー、告知を作るチーム。
  • 開発者:音声を必要とする、または好む読者のためにコンテンツの音声版を追加する人。
  • 教育者:講義ノート、教科書、論文を、学生が最後まで聞ける形へ変える人。

試してみる

ブラウザの音声読み上げで使えます。文章を貼り付ける、リンクを入れる、またはファイルをアップロードして、生成を押すだけです。ListenHub の iOS と Android アプリにも搭載されています。

これを使って開発したい場合は、同じ音声を API からも利用でき、MCP と Agent Skills の連携にも対応しています。まずは API ドキュメントをご覧ください。

1人のナレーターではなく2人の司会による番組を作りたいなら、AI ポッドキャストがあります。リンクから聞く価値のある音声へ変える最速の方法であることは変わりません。

ブログに戻る

関連記事