Product

TTS viết lại văn bản để nghe như lời nói

Hầu hết công cụ chuyển văn bản thành giọng nói đọc nguyên từng chữ bạn viết. ListenHub TTS viết lại thành ngôn ngữ nói trước. Năm đoạn âm thanh, hai màn so sánh trực tiếp.

ListenHub TeamĐăng ngày Cập nhật ngày
Thẻ bìa chuyển sắc tím đậm có nhãn PRODUCT, tiêu đề “TTS viết lại cho đôi tai”, biểu trưng ListenHub và listenhub.ai

Chúng tôi xây dựng tính năng này vì một email duy nhất từ một người dùng duy nhất. Đây là vấn đề nó giải quyết, cùng năm đoạn âm thanh chứng minh rõ hơn bất kỳ bảng thông số nào.

Mọi chuyện bắt đầu từ một hướng dẫn chúng tôi chưa từng định viết

Chỉ vài tuần sau khi ra mắt ListenHub vào tháng 5 năm 2025, số người dùng đăng ký đã vượt 10.000.

Người đáng nhớ nhất là một quý ông lớn tuổi. Ông tìm thấy ListenHub trên mạng, không biết cách sử dụng và gửi email hỏi chúng tôi có bài hướng dẫn hay không.

Suy nghĩ đầu tiên của tôi là: hướng dẫn ư? Cho ListenHub sao? Nó đơn giản mà.

Đó chính là bài học. Một sản phẩm có vẻ hiển nhiên với những người xây dựng AI cả ngày vẫn có thể thực sự khó đối với mọi người khác.

Vì vậy, tôi trả lời: “Chúng tôi chưa có, nhưng tôi sẽ viết ngay bây giờ”, mở Notion và viết bài hướng dẫn đơn giản nhất trong đời mình.

Hướng dẫn ListenHub 101 trên nền chuyển sắc hồng và cam đưa người dùng lần đầu qua màn hình chính và ô “Write down what you want the AI to talk about”

Bản nháp đó trở thành hướng dẫn mà chúng tôi vẫn xuất bản với tên ListenHub 101.

Qua những email sau đó, tôi biết mình đã viết nó cho ai.

Năm 1957, Bill Vick phục vụ với vai trò Force Recon Pathfinder trong Thủy quân lục chiến Hoa Kỳ. Khi viết cho chúng tôi vào năm 2025, ông đã ở cuối tuổi tám mươi và chiến đấu trên một mặt trận khác: nhiều năm mắc xơ phổi vô căn cùng bốn lần đột quỵ đã lấy đi khả năng nói của ông.

Người lính thủy quân lục chiến trong ông vẫn không dừng lại. Ông thành lập PF Warriors, cộng đồng hỗ trợ toàn cầu cho những người sống chung với căn bệnh này, và giờ dùng ListenHub làm tiếng nói của mình — tạo âm thanh để chia sẻ với cộng đồng và giúp những người khác đang trải qua điều tương tự.

Suy cho cùng, toàn bộ công việc là vậy: xây dựng những thứ giúp ích cho con người thật.

Podcast là một cách để được lắng nghe, nhưng không phải cách duy nhất. Vì thế, chúng tôi bắt tay xây dựng một giọng nói AI đa dụng có thể dẫn chương trình, giải thích bài nghiên cứu, đọc diễn văn hoặc đọc tiểu thuyết. Tính năng đó được cung cấp dưới tên ListenHub chuyển văn bản thành giọng nói.

Ngôn ngữ viết và ngôn ngữ nói là hai thứ khác nhau

Một câu hỏi hợp lý: đã có rất nhiều dịch vụ chuyển văn bản thành giọng nói. Tại sao phải tạo thêm một dịch vụ nữa?

Vì văn bản dễ đọc thường nghe rất tệ khi đọc thành tiếng, còn lời nói tự nhiên hiếm khi trông đúng trên trang giấy. Bài nghiên cứu, tin tức, câu trả lời của chatbot — tất cả đều được thiết kế để đọc.

Hầu hết công cụ TTS đọc văn bản đúng như những gì được viết. Điều đó giống như thuyết trình bằng cách đọc to từng chữ trên slide. Về kỹ thuật, nội dung được nói hết, nhưng không ai theo kịp.

ListenHub TTS bổ sung bước mọi người thường bỏ qua: viết lại văn bản thành ngôn ngữ nói, rồi mới đọc phiên bản đó. Ý nghĩa không đổi, nhưng cấu trúc dành cho tai thay vì mắt. Bạn cũng có thể tắt tính năng viết lại để đọc nguyên từng chữ, phù hợp với hợp đồng hoặc tuyên bố miễn trừ trách nhiệm.

Mô tả này còn trừu tượng. Hãy để đôi tai của bạn phán xét.

Trường hợp 1: dàn ý không còn nghe như dàn ý

Công cụ AI rất thích Markdown. Tiêu đề, dấu đầu dòng, danh sách lồng nhau — hữu ích trên màn hình nhưng máy móc khi nghe.

Đây là văn bản thử nghiệm:

# Product Launch Core Outline

## Problem Background
- Spoken and written language are two different forms of expression
- Written text isn't always suitable for audio delivery
- Spoken words aren't always suitable for writing
- Papers, news, AI answers are designed for reading, not speaking

## Market Status
- Existing TTS services only read text literally
- Being "readable" doesn't make it "speakable"
- Lacks a conversion layer from written to spoken language
Đọc nguyên văn — dàn ý lấy thẳng từ trang

Cứng nhắc, máy móc và khó theo dõi nếu bạn không đọc cùng. Bây giờ là cùng một văn bản nguồn khi bật viết lại:

Viết lại cho đôi tai — cùng dàn ý dưới dạng lời nói

Tiêu đề biến thành câu chuyển ý. Dấu đầu dòng biến thành câu hoàn chỉnh. Bạn có thể theo dõi khi nhắm mắt.

Trường hợp 2: một bài nghiên cứu bạn thực sự có thể nghe

Bài nghiên cứu được viết dày đặc có chủ đích. Khi đọc nguyên văn thành tiếng, chúng gần như không thể nghe nổi.

Chúng tôi xử lý phần mở đầu của “Attention Is All You Need” theo cả hai cách.

Trang đầu của bài nghiên cứu “Attention Is All You Need” hiển thị tiêu đề, tám tác giả và phần mở đầu tóm tắt bằng văn phong học thuật dày đặc

Đọc nguyên văn — phần tóm tắt lấy thẳng từ trang

Mọi tên tác giả, mọi cơ quan, mọi ký hiệu trích dẫn được đọc theo thứ tự. Bây giờ bật viết lại:

Viết lại cho đôi tai — cùng bài nghiên cứu được giải thích thành lời

Nó nghe như một người bạn đã đọc bài nghiên cứu và đang dẫn bạn qua từng ý. Chính xác mà không cần tua lại.

Mọi người còn dùng nó vào việc gì

Truyện trước giờ ngủ bằng chính giọng nói được nhân bản của bạn. Biến một bộ slide thành bài nói đi kèm. Nội dung hài độc thoại. ASMR:

Một bản ASMR

Kết hợp với giọng nói của chính bạn

Thêm nhân bản giọng nói, đầu ra sẽ là giọng của bạn chứ không phải giọng có sẵn. Đọc tiểu thuyết, giải thích bài nghiên cứu, ghi phần mở đầu podcast hoặc thuyết minh reel mà không cần tự thu bất kỳ nội dung nào.

Nhân bản được bao gồm trong mọi gói trả phí: một giọng ở Basic, bốn ở Pro và hai mươi ở Max. Xem chi tiết hiện tại tại bảng giá, hoặc duyệt danh mục giọng nói công khai nếu bạn muốn dùng giọng có sẵn.

Tại sao nó hiệu quả

Ba yếu tố đảm nhận phần lớn công việc:

  1. Hiểu ngữ cảnh. Mô hình đọc để hiểu nghĩa trước khi phát thành tiếng, nhờ đó có thể xác định đoạn văn thực sự muốn nói gì và người nói sẽ diễn đạt cho người nghe ra sao.
  2. Đầu vào đa phương thức. Không chỉ văn bản thuần — nó còn xử lý hình ảnh và tài liệu PDF.
  3. Cắt gọn thông minh. Quảng cáo, khối mã, phần thừa của điều hướng và ký tự rời được bỏ đi thay vì đọc lên.

Nó cũng phát trực tuyến: âm thanh bắt đầu chạy trong khi phần còn lại vẫn đang được tạo, nên bạn không phải nhìn chằm chằm vào thanh tiến trình.

Tất cả điều này xuất phát từ những gì đội ngũ sản phẩm và kỹ thuật học được khi xây dựng ListenHub, cùng rất nhiều phản hồi thẳng thắn của người dùng. Cảm ơn bạn vì điều đó.

Dành cho ai

  • Người sáng tạo nội dung chuyển bài đăng và kho kiến thức thành âm thanh mà không cần buổi thu âm.
  • Người nghe sách nói muốn giọng kể có sức sống hơn.
  • Đội ngũ doanh nghiệp sản xuất tài liệu đào tạo, hướng dẫn sản phẩm và thông báo.
  • Nhà phát triển thêm phiên bản âm thanh của nội dung cho độc giả cần hoặc thích nghe.
  • Nhà giáo dục chuyển ghi chú bài giảng, sách giáo khoa và bài nghiên cứu thành nội dung học viên sẽ nghe hết.

Dùng thử

Tính năng chạy trong trình duyệt tại chuyển văn bản thành giọng nói — dán văn bản, thả liên kết hoặc tải tệp lên rồi nhấn tạo. Nó cũng có trong ứng dụng ListenHub cho iOS và Android.

Muốn xây dựng dựa trên tính năng này? Các giọng tương tự được cung cấp qua API, bao gồm tích hợp MCP và Agent Skills. Hãy bắt đầu với tài liệu API.

Còn nếu bạn muốn chương trình có hai người dẫn thay vì một người kể, hãy dùng AI podcast — vẫn là cách nhanh nhất để biến một liên kết thành nội dung đáng nghe.

Quay lại blog

Bài viết liên quan