世界初の会話型ボイスクローン
台本を読むだけでは、あなたらしさのないクローンになります。ListenHub は普通の会話から声を複製します。自然に仕上げるためのコツも紹介します。

これまで録音したボイスクローンは、おそらくどれも同じように始まったはずです。画面に台本が表示され、それを声に出して読み、返ってきたものは技術的には自分の声なのに、自分らしさがまったくありません。
ListenHub は代わりに会話から声をクローンします。読むものも、演じるものもありません。
台本を読むと、なぜ自分らしく聞こえないのか
台本型のクローンは、ほとんどの人が苦手なことを求めます。初見で他人の言葉をマイクに向かって演じることです。
つまずいて録り直す。平坦に聞こえて録り直す。5回目でもクローンには生気がありません。下手に読んでいるのではなく、ただ読んでいるからです。話しているのではなく、発音しているだけです。
なぜ30秒の音声を録るだけなのに、これほど難しいのかを何度も考えました。答えは明白でした。人は読むものを渡された瞬間、自分らしい話し方をやめます。本当の声、つまりリズム、呼吸、何かに腹を立てたときに音程が跳ねる感じは、誰かと話しているときにしか現れません。
そこで2025年10月、私たちはその事実を中心にフロー全体を作りました。アップロード欄ではなく、会話です。
多くの製品なら、この機能は1日で出せます。10〜30秒録音してもらうか、ファイルを受け取ればよいからです。私たちは完全な対話型音声システムを作りました。当時は、道を渡るために宇宙船を組み立てているような気分でした。
それでも作ったのは、あなたの声こそ、ListenHub 上でほかの誰にもコピーできないものだからです。その声がポッドキャストを進行しても、テキスト読み上げを担当しても、解説動画に使われても、その先のすべては声のリアルさを受け継ぎます。2か月の開発と非公開ベータを経て、会話型クローンは2025年12月に公開されました。確認できた範囲では、これを先に実現した製品はありませんでした。
会話をして声をクローンする
以前は、読む、待つ、がっかりする、やり直す、という流れでした。今回は3ステップです。
- 左メニューからボイスクローンを開きます。
- 会話を開始します。
- 昔からの友人と電話するように話します。昼食への不満でも、行かない旅行の計画でも、映画についての議論でも構いません。内容は何でも大丈夫です。
会話中、システムが集めるのは音節だけではありません。抑揚、呼吸のリズム、無意識に使っている感情の幅まで捉えます。返ってくるのは、教室の前で朗読する声ではなく、リラックスした自分の声です。
最初のクローンが自分らしくなければ、必要なのは良い台本ではなく、もう一度の会話です。
話す前の準備
操作は簡単ですが、2分の準備で、使えるクローンと優れたクローンの差が生まれます。
手元で最も良いマイクを使う
これはほとんど物理の問題です。良い機材ほど信号対雑音比が高くなります。ポッドキャスト用マイクがあれば、それを使ってください。古いノートパソコンと新しいスマートフォンなら、スマートフォンを選びましょう。ListenHub はモバイルでも使えます。
顔の近くに持ったスマートフォンは、2フィート離れたノートパソコンのマイクが捨ててしまう声の質感や息遣いを拾います。距離は最も安く改善できる要素です。
反響しない部屋を探す
硬い床、何もない壁、高い天井は、反射音で声をにじませます。クローンは部屋の響きまで学習してしまいます。小さなカーペット敷きの部屋、車内、柔らかい家具のある隅のほうが、見栄えの良いキッチンより適しています。窓を閉め、扇風機を止め、犬は外に出しておきましょう。
間違って聞こえるけれど正しい2つのコツ
自然だと思うより大げさに話す
日常の話し声は、多くの場合かなり狭い範囲に収まります。狭い範囲だけをモデルに与えると、何を言わせても疲れたようなクローンになります。
いつもの声域を超えてください。何年も会っていなかった友人と再会したように、本物の高低差をつけて話します。与える幅が広いほど、後で生成できる幅も広がります。少し芝居がかっても、物まねをしても構いません。楽しんでください。仕上がりを予想以上に気に入る人が多くいます。
別の言語で生成する場合でも、母語で話す
逆に思えるこのコツが、最も大きく結果を変えます。
たとえば英語のナレーションが必要でも、英語が第一言語ではないとします。ためらいながら慎重に話す英語でクローンすると、モデルが学ぶのも、そのためらい、慎重さ、自信のなさです。入力が不安そうなら、出力も不安そうになります。
最も流暢な言語で会話してください。モデルは声色、つまり声をあなたのものにしている部分を捉え、その後に生成するどの言語にも適用します。結果として、流暢で自信のある自分の声になります。多くの場合、それこそ最初から欲しかった声です。
クローンした声の使い道
保存した声は ListenHub 全体で使えます。AI ポッドキャストのホストにしたり、テキスト読み上げで文書を読ませたり、解説動画に使ったりできます。既成の声から始めたい場合はボイスカタログを閲覧できます。書き言葉を話し言葉に変える TTS の記事では、ナレーションエンジンが文章を聞く価値のある音声へ変える方法を説明しています。
ボイスクローンはすべての有料プランに含まれます。Basic は1音声、Pro は4音声、Max は20音声です。最新情報は料金ページで確認してください。
あなたの声の一番良い部分は、慎重な朗読の中ではなく、予定していなかった一文の中にあります。

