Product

세계 최초의 대화형 음성 복제

대본을 읽으면 정작 당신다운 모습이 빠진 복제 음성이 나옵니다. ListenHub는 평범한 대화로 목소리를 복제하며, 이 팁을 따르면 더 자연스럽게 만들 수 있습니다.

ListenHub Team게시일 업데이트
짙은 보라색과 자홍색 그라데이션 위에 PRODUCT 라벨과 “The world's first chat voice cloning”이라는 큰 흰색 제목이 있고 왼쪽 아래에 ListenHub 워드마크와 listenhub.ai가 있는 표지

지금까지 녹음해 본 음성 복제는 아마 모두 같은 방식으로 시작했을 것입니다. 화면에 대본이 나타나고, 그것을 소리 내어 읽은 뒤, 기술적으로는 내 목소리지만 정작 나다운 면은 전혀 없는 결과를 받습니다.

ListenHub는 대신 대화에서 목소리를 복제합니다. 읽을 것도, 연기할 것도 없습니다.

대본을 읽으면 왜 나답게 들리지 않을까요

대본 기반 복제는 거의 누구도 잘하지 못하는 일을 요구합니다. 준비 없이 다른 사람이 쓴 문장을 마이크 앞에서 연기해야 합니다.

버벅여서 다시 시작합니다. 평평하게 들려서 다시 시작합니다. 다섯 번을 시도해도 복제 음성은 여전히 생기가 없습니다. 못 읽은 것이 아니라 그저 읽고 있기 때문입니다. 말하는 것이 아니라 발음만 하고 있습니다.

우리는 30초짜리 오디오를 녹음하는 일이 왜 이렇게 어려운지 계속 물었습니다. 답은 너무나 명확했습니다. 사람은 읽을 것이 생기는 순간 자신답게 말하지 않습니다. 진짜 목소리, 즉 리듬과 호흡, 무언가에 짜증이 날 때 음높이가 뛰는 방식은 누군가와 이야기할 때만 나타납니다.

그래서 2025년 10월, 우리는 전체 흐름을 그 사실에 맞춰 만들었습니다. 업로드 상자가 아니라 대화입니다.

대부분의 제품은 이 기능을 하루 만에 내놓습니다. 10~30초 녹음을 요청하거나 업로드 파일을 받으면 됩니다. 우리는 완전한 상호작용형 음성 대화 시스템을 만들었습니다. 당시에는 길 하나 건너기 위해 우주선을 만드는 기분이었습니다.

그렇게 한 이유는 당신의 목소리가 ListenHub에서 다른 누구도 복사할 수 없는 유일한 것이기 때문입니다. 그 목소리가 팟캐스트를 진행하든, 텍스트 음성 변환 트랙을 읽든, 설명 영상에 쓰이든, 이후의 모든 결과는 목소리의 현실감을 물려받습니다. 두 달의 개발과 비공개 베타를 거쳐 대화형 복제는 2025년 12월 출시되었습니다. 우리가 확인한 범위에서는 누구도 먼저 해내지 못한 방식이었습니다.

대화로 목소리 복제하기

예전 방식은 읽고, 기다리고, 실망하고, 반복하는 것이었습니다. 이번 방식은 세 단계입니다.

  1. 왼쪽 메뉴에서 음성 복제를 엽니다.
  2. 대화를 시작합니다.
  3. 오래된 친구와 전화하듯 말하세요. 점심을 불평해도 되고, 실제로 가지 않을 여행을 계획해도 되며, 영화에 대해 논쟁해도 됩니다. 내용은 중요하지 않습니다.

대화하는 동안 시스템은 음절만 수집하지 않습니다. 억양, 호흡 리듬, 생각하지 않고 사용하는 감정의 범위까지 포착합니다. 결과로 돌아오는 것은 교실 앞에서 소리 내어 읽는 목소리가 아니라 편안한 상태의 목소리입니다.

첫 복제 음성이 나답지 않다면 더 좋은 대본이 아니라 또 한 번의 대화가 해결책입니다.

말하기 전 준비

상호작용은 간단하지만, 2분의 준비가 쓸 만한 복제 음성과 훌륭한 복제 음성의 차이를 만듭니다.

가지고 있는 가장 좋은 마이크 사용하기

대부분 물리의 문제입니다. 하드웨어가 좋을수록 신호 대 잡음비가 좋아집니다. 팟캐스트용 마이크가 있다면 그것을 쓰세요. 오래된 노트북과 주머니 속 최신 휴대전화 중 하나를 골라야 한다면 휴대전화를 선택하세요. ListenHub는 모바일에서 작동합니다.

얼굴 가까이 든 휴대전화는 두 피트 떨어진 노트북 마이크가 놓치는 목소리의 질감과 숨소리를 담습니다. 거리는 가장 저렴하게 고칠 수 있는 요소입니다.

울림이 없는 방 찾기

단단한 바닥, 비어 있는 벽, 높은 천장은 반사음으로 목소리를 흐리고 복제 모델은 방의 소리까지 함께 배웁니다. 카펫이 깔린 작은 방, 자동차 안, 부드러운 가구가 있는 구석이 보기 좋은 주방보다 낫습니다. 창문을 닫고, 선풍기를 끄고, 강아지는 잠시 밖에 두세요.

틀린 것처럼 들리지만 맞는 두 가지 팁

자연스럽다고 느끼는 것보다 더 극적으로 말하기

대부분은 일상에서 상당히 좁은 범위로 말합니다. 모델에 좁은 범위만 주면 무엇을 말해도 피곤하게 들리는 복제 음성이 나옵니다.

평소 음역을 넘어 보세요. 몇 년 만에 만난 친구와 근황을 나누듯 실제 높낮이를 넣어 말하세요. 더 넓은 범위를 주면 나중에 생성할 수 있는 범위도 넓어집니다. 과장하고, 흉내도 내고, 즐기세요. 결과를 예상보다 훨씬 좋아하는 사람이 많습니다.

다른 언어로 생성할 예정이어도 모국어로 말하기

거꾸로 들리지만 결과를 가장 많이 바꾸는 팁입니다.

영어 내레이션이 필요하지만 영어가 모국어가 아니라고 가정해 보겠습니다. 머뭇거리고 조심스러운 영어로 자신을 복제하면 모델은 바로 그것, 즉 망설임과 조심스러움, 자신감 부족을 배웁니다. 입력이 불확실하면 출력도 불확실하게 들립니다.

가장 유창한 언어로 대화하세요. 모델은 목소리를 당신답게 만드는 음색을 포착하고, 이후 생성하는 어떤 언어에도 적용합니다. 그러면 유창하고 자신감 있는 자신의 목소리를 얻게 됩니다. 대개 처음부터 원했던 모습입니다.

복제한 목소리의 다음 사용처

저장한 음성은 ListenHub 전반에서 사용할 수 있습니다. AI 팟캐스트를 진행하고, 텍스트 음성 변환으로 문서를 읽고, 설명 영상에 목소리를 입힐 수 있습니다. 준비된 음성으로 시작하고 싶다면 음성 카탈로그를 둘러보세요. 문어를 구어로 바꾸는 TTS 글에서는 내레이션 엔진이 글을 들을 가치가 있는 음성으로 만드는 방식을 설명합니다.

음성 복제는 모든 유료 플랜에 포함됩니다. Basic은 1개, Pro는 4개, Max는 20개의 음성을 제공합니다. 현재 세부 사항은 요금 페이지에 있습니다.

당신 목소리의 가장 좋은 모습은 조심스러운 낭독에 있지 않습니다. 계획하지 않았던 문장에 있습니다.

블로그로 돌아가기

관련 글