Công nghệ nhân bản giọng nói bằng hội thoại đầu tiên trên thế giới
Đọc kịch bản tạo ra bản sao không còn nét riêng của bạn. ListenHub nhân bản giọng nói từ một cuộc trò chuyện bình thường, và các mẹo này giúp kết quả tự nhiên hơn.

Mọi bản sao giọng nói bạn từng ghi có lẽ đều bắt đầu theo cùng một cách. Một kịch bản hiện trên màn hình, bạn đọc thành tiếng, và thứ nhận lại về mặt kỹ thuật là giọng của bạn nhưng chẳng còn nét nào của bạn trong đó.
ListenHub thay vào đó nhân bản giọng nói từ một cuộc trò chuyện. Không cần đọc, không cần diễn.
Vì sao đọc kịch bản không bao giờ nghe giống bạn
Nhân bản dựa trên kịch bản đòi hỏi điều hầu như không ai làm tốt: ứng diễn lời của người khác trước micro mà không chuẩn bị.
Bạn vấp nên bắt đầu lại. Giọng đều đều nên bắt đầu lại. Sau năm lần, bản sao vẫn vô hồn — không phải vì đọc tệ, mà vì nó chỉ đang đọc. Nó không nói chuyện. Nó phát âm.
Chúng tôi cứ hỏi vì sao việc ghi đúng ba mươi giây âm thanh lại khó đến vậy, và câu trả lời hóa ra quá rõ. Con người ngừng nghe giống chính mình ngay khi có thứ phải đọc. Giọng thật của bạn — nhịp điệu, hơi thở, cách cao độ bật lên khi điều gì đó làm bạn bực — chỉ xuất hiện khi bạn nói chuyện với một người khác.
Vì vậy vào tháng 10 năm 2025, chúng tôi xây dựng toàn bộ quy trình quanh điều đó. Không phải hộp tải lên. Là một cuộc trò chuyện.
Phần lớn sản phẩm phát hành tính năng này trong một ngày: yêu cầu bản ghi 10 đến 30 giây hoặc nhận tệp tải lên. Chúng tôi xây cả một hệ thống đối thoại giọng nói tương tác, khi ấy giống như chế tạo tàu vũ trụ chỉ để qua đường.
Chúng tôi làm vậy vì giọng của bạn là thứ duy nhất trên ListenHub không ai khác có thể sao chép. Dù sau đó nó dẫn podcast, đọc một bản chuyển văn bản thành giọng nói hay lồng tiếng video giải thích, mọi thứ phía sau đều kế thừa mức độ chân thật của giọng này. Sau hai tháng phát triển và một đợt beta kín, tính năng nhân bản bằng hội thoại ra mắt tháng 12 năm 2025. Theo những gì chúng tôi tìm hiểu, chưa ai làm điều đó trước đây.
Nhân bản giọng nói bằng một cuộc trò chuyện
Vòng lặp cũ là đọc, chờ, thất vọng rồi lặp lại. Cách mới có ba bước:
- Mở Nhân bản giọng nói từ menu bên trái.
- Bắt đầu cuộc trò chuyện.
- Nói như khi gọi điện với một người bạn cũ. Phàn nàn về bữa trưa. Lên kế hoạch cho chuyến đi bạn sẽ không thực hiện. Tranh luận về một bộ phim. Chủ đề không quan trọng.
Trong khi bạn nói, hệ thống không chỉ thu thập âm tiết. Nó ghi lại ngữ điệu, nhịp thở và dải cảm xúc bạn dùng mà không cần suy nghĩ. Kết quả là phiên bản thư giãn của giọng bạn, không phải phiên bản đọc to trước lớp.
Nếu bản sao đầu tiên không giống bạn, cách sửa là một cuộc trò chuyện khác chứ không phải kịch bản tốt hơn.
Chuẩn bị trước khi nói
Tương tác rất đơn giản. Tuy vậy, hai phút chuẩn bị vẫn tạo nên khác biệt giữa một bản sao dùng được và một bản sao xuất sắc.
Dùng micro tốt nhất bạn có
Điều này chủ yếu là vật lý: phần cứng tốt hơn cho tỷ lệ tín hiệu trên nhiễu tốt hơn. Nếu có micro podcast, hãy dùng nó. Nếu phải chọn giữa laptop cũ và điện thoại mới nhất trong túi, hãy chọn điện thoại — ListenHub hoạt động trên thiết bị di động.
Điện thoại đặt gần mặt thu được độ hạt và hơi thở mà micro laptop cách xa sáu mươi centimet bỏ mất. Khoảng cách là yếu tố rẻ nhất để khắc phục.
Tìm một căn phòng không vang
Sàn cứng, tường trống và trần cao làm giọng bị nhòe bởi phản xạ, và bản sao học cả căn phòng cùng với bạn. Một phòng nhỏ có thảm, trong ô tô hoặc một góc có đồ nội thất mềm đều tốt hơn căn bếp đẹp. Đóng cửa sổ, tắt quạt và đưa chó ra ngoài.
Hai mẹo nghe có vẻ sai nhưng không sai
Thể hiện mạnh hơn mức bạn thấy tự nhiên
Trong đời thường, phần lớn chúng ta nói trong một dải khá hẹp. Cung cấp dải hẹp cho mô hình và bạn sẽ có bản sao nghe mệt mỏi trong mọi câu.
Hãy vượt khỏi âm vực bình thường. Nói như đang gặp lại người bạn nhiều năm chưa thấy, với những lên xuống rõ ràng. Dải bạn cung cấp càng rộng, dải mô hình có thể tạo sau này càng rộng. Cường điệu một chút, bắt chước ai đó và tận hưởng. Mọi người thường bất ngờ vì mình thích kết quả đến mức nào.
Nói tiếng mẹ đẻ dù bạn sẽ tạo bằng ngôn ngữ khác
Điều này nghe ngược đời, nhưng là mẹo làm thay đổi kết quả nhiều nhất.
Giả sử bạn muốn lời kể tiếng Anh nhưng tiếng Anh không phải ngôn ngữ đầu tiên. Nếu nhân bản bản thân bằng tiếng Anh do dự, cẩn trọng, mô hình sẽ học đúng những thứ đó: sự do dự, thận trọng và thiếu tự tin. Đầu ra nghe không chắc chắn vì đầu vào cũng vậy.
Hãy trò chuyện bằng ngôn ngữ bạn thành thạo nhất. Mô hình ghi lại âm sắc — điều khiến giọng nói là của riêng bạn — rồi áp dụng vào bất kỳ ngôn ngữ nào bạn tạo sau đó. Bạn sẽ có phiên bản giọng nói lưu loát và tự tin của chính mình, thường chính là phiên bản bạn muốn ngay từ đầu.
Dùng bản sao của bạn ở đâu tiếp theo
Giọng đã lưu hoạt động trên toàn ListenHub. Dùng nó dẫn podcast AI, đọc tài liệu qua văn bản thành giọng nói hoặc lồng tiếng video giải thích. Nếu muốn bắt đầu bằng giọng có sẵn, hãy xem danh mục giọng nói. Bài viết về TTS chuyển văn viết thành lời nói giải thích cách công cụ tường thuật biến chữ viết thành nội dung đáng nghe.
Nhân bản được bao gồm trong mọi gói trả phí: một giọng ở Basic, bốn ở Pro và hai mươi ở Max. Trang giá có thông tin hiện tại.
Phiên bản hay nhất của giọng bạn chưa bao giờ nằm trong cách đọc cẩn thận. Nó nằm trong câu bạn không hề lên kế hoạch.

