Comparisons

So sánh các công cụ chuyển văn bản thành giọng nói tốt nhất năm 2026

So sánh 11 công cụ về giá, chất lượng giọng nói và mức độ một tác nhân AI có thể điều khiển chúng, kèm mô tả đầy đủ về những gì ListenHub làm được — gồm API, MCP và Agent Skills — cũng như những trường hợp chúng tôi không phải lựa chọn phù hợp.

ListenHub TeamĐăng ngày Cập nhật ngày
Thẻ tiêu đề chuyển sắc tím đậm và hồng tím, có nhãn COMPARISON và dòng “The best text-to-speech tools, compared”, với logo ListenHub phía trên listenhub.ai

ListenHub xuất bản bài viết này. Chúng tôi xây dựng công cụ chuyển văn bản thành giọng nói, podcast AInhân bản giọng nói, đồng thời bán gói thuê bao, nên rõ ràng chúng tôi có lợi ích liên quan đến kết luận của bạn. Phớt lờ điều đó là cách nhanh nhất để đánh mất niềm tin của bạn.

Bài viết này thực hiện hai nhiệm vụ, và cần phân biệt rõ. Thứ nhất là so sánh trực tiếp 11 sản phẩm text-to-speech, được nhóm theo công việc bạn thuê chúng thực hiện, với mọi mức giá lấy từ trang giá chính thức của nhà cung cấp thay vì một bài xếp hạng. Thứ hai là giải thích chi tiết những gì ListenHub làm — gồm cả bề mặt dành cho nhà phát triển và tác nhân, phần mà đa số người dùng không bao giờ thấy — đồng thời trình bày đầy đủ những trường hợp chúng tôi là lựa chọn sai. Chúng tôi không chấm ai trên thang mười, đặc biệt không tự chấm mình, và một phần gần cuối chỉ tồn tại để hướng bạn sang đối thủ.

Câu trả lời ngắn

Nếu chỉ đọc một phần, hãy đọc phần này.

  • Một giọng đọc hay cho kịch bản dàiElevenLabs, 6 USD/tháng.
  • API cho khối lượng lớn với ngân sách thấpAmazon Polly hoặc Google Cloud, 4 USD cho mỗi triệu ký tự.
  • Tác nhân giọng nói thời gian thựcDeepgram hoặc Cartesia.
  • E-learning doanh nghiệp đã qua rà soát tuân thủWellSaid Labs.
  • Lời thuyết minh ngay trong timeline videoSpeechify Studio.
  • Biến tài liệu thành nội dung nghe cá nhân miễn phíNotebookLM.
  • Tác nhân hoặc codebase tự tạo âm thanh và video hoàn chỉnhListenHub. Một khóa bao phủ podcast, giọng nói, nhân bản, âm nhạc, hình ảnh, slide và video qua REST, máy chủ MCP, Agent Skills, SDK và CLI.
  • Chương trình nhiều giọng hoàn chỉnh, có thể xuất bản từ một tài liệuListenHub. Đây là hai công việc mà chúng tôi tin mình là đáp án phù hợp; các phần dưới giải thích lý do và nơi chúng tôi vẫn còn thiếu.

Tổng quan

Giá được kiểm tra ngày 28 tháng 7 năm 2026. Đơn vị khác nhau theo nhà cung cấp và được nêu riêng từng dòng thay vì quy đổi sang một đơn vị chung giả tạo.

Công cụPhù hợp nhất choGói miễn phíMức trả phí đầu tiênNhân bản giọng nóiTruy cập API / tác nhân
ElevenLabsChất lượng kể chuyện dài10k tín dụng/tháng, không dùng thương mại6 USD/thángCó, từ 6 USDREST, SDK, máy chủ MCP chính thức
Amazon PollyAPI rẻ khi dùng khối lượng lớn5M ký tự/tháng, liên tụcTrả theo mức dùngKhôngAWS SDK, IAM
Google Cloud TTSDải giọng rộng nhất qua API4M ký tự/tháng, liên tụcTrả theo mức dùngKhôngGCP SDK
OpenAIMột nhà cung cấp, một khóaKhông cóTrả theo mức dùngChỉ EnterpriseREST, SDK
DeepgramTác nhân thời gian thực200 USD tín dụng, một lầnTrả theo mức dùngKhôngREST, SDK streaming
CartesiaStreaming độ trễ thấp, giá rẻ20k tín dụng/tháng, không dùng thương mại5 USD/thángCó, từ 5 USDREST, SDK streaming
Azure AI SpeechHệ thống Microsoft doanh nghiệp500k ký tự neural/thángTrả theo mức dùngCó, cần phê duyệtAzure SDK
WellSaid LabsE-learning doanh nghiệp3 phút tải xuống/tháng, không dùng thương mại19 USD/thángKhôngREST
Speechify StudioVoiceover trong timeline video600 tín dụng, không dùng thương mại19 USD/thángCó, từ 19 USDREST
NotebookLMTổng quan âm thanh cá nhân miễn phí3 lần tạo/ngàyThuê bao Google AIKhôngKhông có
ListenHubChương trình hoàn chỉnh và tác nhân tạo ra chúngHạn mức tháng cộng phần hằng ngày12 USD/tháng, hoặc 9 USD/tháng khi trả nămCó, mọi gói trả phíREST, máy chủ MCP, Agent Skills, SDK, CLI — mọi tài khoản

Về đơn vị tính phí, vì không ai định giá giống nhau: Google, AWS và các mô hình cũ của OpenAI tính theo ký tự; ElevenLabs, Cartesia, Speechify và ListenHub theo tín dụng; WellSaid theo phút tải xuống; các mô hình mới của OpenAI theo token. Những đơn vị này không thể hoán đổi, và bất kỳ so sánh nào cộng chúng vào một bảng xếp hạng chung đều đang bịa ra sự tương đương.

Cột cuối là điều phần lớn bài so sánh bỏ qua, nhưng năm 2026 nó quyết định nhiều giao dịch hơn cả chất lượng giọng. Mọi sản phẩm ở đây đều có REST API. Điểm khác nhau là tác nhân AI có thể điều khiển mà bạn không phải viết tích hợp trước hay không, và một lệnh gọi thực sự trả về gì — byte âm thanh hay nội dung hoàn chỉnh.

Cách chúng tôi so sánh và những gì không thể kiểm thử

Chúng tôi so sánh gì, vào lúc nào. Giá công bố, giới hạn gói miễn phí và điều khoản sử dụng thương mại, được đọc trên trang giá của từng nhà cung cấp ngày 28 tháng 7 năm 2026 và đối chiếu với tài liệu — cộng các câu hỏi năng lực quyết định việc mua thật: gói của bạn có cho phép xuất bản không, có nhân bản giọng nói không, có từ điển phát âm không, bạn bị tính theo đơn vị nào? Giá TTS thay đổi liên tục, vì vậy hãy coi mọi con số ở đây là điểm bắt đầu và kiểm tra lại trước khi nhập thẻ.

Vì sao không có điểm số. Điểm trên mười ngụ ý một hội đồng chấm điểm mà chúng tôi không thực hiện. Khi nói một công cụ nghe tốt hơn, đó là ý kiến từ việc sử dụng các sản phẩm này và xây dựng sản phẩm của mình. Hãy coi các nhận xét đó là danh sách rút gọn để tự thử và dùng các dạng lỗi ở phần tiếp theo làm phiếu chấm. Hai mươi phút với đoạn văn tệ nhất của chính bạn đáng giá hơn bảng xếp hạng của bất kỳ ai, kể cả chúng tôi.

Những gì không thể xác minh. Một số nhà cung cấp render giá bằng JavaScript nên không có con số công bố ổn định để trích dẫn. Vì vậy Murf được mô tả bên dưới mà không có số; Microsoft công bố gói miễn phí bằng văn bản nhưng tải giá trả phí phía client, nên chúng tôi chỉ nêu hạn mức miễn phí. PlayHT, LOVO và MiniMax bị loại hoàn toàn: không tải được giá chính chủ, còn số liệu bên thứ ba mâu thuẫn và rõ ràng tái sử dụng từ các năm trước. Chúng tôi thà đưa 11 công cụ có thể dẫn nguồn hơn 15 công cụ không thể.

Những gì không thể kiểm thử. Các tính năng bị khóa cho doanh nghiệp — giọng tùy chỉnh của OpenAI đòi hỏi trao đổi với bộ phận bán hàng, nên chúng tôi không thể nói chúng nghe thế nào. Chúng tôi cũng không benchmark độ trễ dưới tải production, vì thời gian của một yêu cầu không nói gì về một nghìn luồng đồng thời.

Điều gì thực sự khiến text-to-speech nghe sai

Gần như mọi công cụ ở đây đã vượt ngưỡng cũ — giọng không còn giống robot. Những lỗi còn lại tinh tế hơn, và người nghe nhận thấy dù không gọi tên được. Đây là phần đáng luyện tai trước khi chi tiền.

Ngữ điệu phẳng. Trong tiếng Anh, trọng âm mang ý nghĩa. “I didn't say she took the money” có khoảng bảy nghĩa tùy từ được nhấn. Mô hình chọn mẫu nhấn trung bình theo thống kê có thể đọc đúng câu nhưng truyền sai nghĩa. Hãy nghe sự tương phản: giọng có nhấn từ chứa thông tin mới thực sự không?

Văn bản viết để nhìn bị đọc nguyên xi. Đây là lỗi lớn nhất và không hẳn là vấn đề giọng. Tài liệu ghi “e.g.”, “Fig. 3”, “$1.2M”, “2026-07-28”, “(see below)”. Người đọc thành tiếng tự viết lại chúng trong đầu — “for example”, “figure three”, “one point two million dollars”. Hầu hết engine chỉ phát âm các ký hiệu. Mảnh câu trong danh sách còn tệ hơn: danh sách viết thường không có động từ nên biến thành chồng cụm danh từ rời rạc. Chúng tôi xây dựng bước viết lại từ văn viết sang văn nói chính vì lỗi này tồn tại qua mọi cải thiện về chất lượng giọng.

Tên và thuật ngữ, lần nào cũng sai. Tên sản phẩm, họ không phải tiếng Anh, chữ viết tắt lúc đánh vần lúc đọc thành từ — “SQL”, “Nginx”, “Xiaomi”, “José”. Sự nhất quán khiến nó nguy hiểm: tên công ty bạn sẽ bị đọc sai y hệt trong cả 40 tập. Hãy kiểm tra nhà cung cấp có từ điển phát âm chỉnh sửa được không, và nó áp dụng toàn workspace hay phải nhập lại mỗi dự án.

Không có lượt lời tự nhiên. Hai giọng được render riêng rồi nối đuôi không phải cuộc hội thoại. Đối thoại thật chồng nhẹ, có phản hồi nghe và — rõ nhất — cao độ mở đầu của người thứ hai phản ứng với cao độ kết thúc của người thứ nhất. Ghép hai render độc lập lại, bạn có hai độc thoại khoác chung một chiếc áo.

Nhịp đều tăm tắp. Người đọc tăng tốc qua danh sách, chậm lại trước kết luận và thở ở ranh giới đoạn thay vì dấu phẩy. Engine dùng khoảng nghỉ cố định giữa các câu tạo âm thanh gây mệt sau khoảng hai phút — điều rất khó nghe ra trong demo 15 giây.

Đó là bẫy demo. Câu mẫu của nhà cung cấp được chọn vì chúng hoạt động tốt. Đừng đánh giá dựa trên chúng.

Giọng kể tự nhiên cho video và khóa học

Nhóm người mua lớn nhất: bạn có kịch bản, cần một giọng đọc và cần quyền xuất bản kết quả.

ElevenLabs — tốt nhất cho nội dung dài

Miễn phí 0 USD/tháng, 10.000 tín dụng, không có giấy phép thương mại, không nhân bản · Mức trả phí đầu tiên Starter 6 USD/tháng · Đơn vị tín dụng

Starter 6 USD/tháng mới là điểm vào thực, không phải gói miễn phí: 30.000 tín dụng, giấy phép thương mại và nhân bản giọng tức thì. Creator là 22 USD/tháng cho 121.000 tín dụng và nhân bản chuyên nghiệp; Pro 99 USD/tháng cho 600.000. Với nội dung dài, nó giữ ngữ điệu tốt hơn mọi thứ chúng tôi từng dùng — ít có khả năng đánh mất mạch câu nhất khi đã đi sâu ba đoạn vào một chương.

Tốt: ngữ điệu dài tốt nhất danh sách; nhân bản tức thì ở gói trả phí rẻ nhất; đầu ra đa ngôn ngữ mạnh từ một giọng nhân bản; hệ sinh thái tài liệu và tích hợp thực sự.

Chưa tốt: gói miễn phí không có giấy phép thương mại hay nhân bản, khiến người thử miễn phí rồi xuất bản dễ mắc lỗi; khó quy đổi tín dụng sang phút trong đầu; chi phí tăng nhanh sau Creator.

Kết luận: nếu công việc là một giọng đọc kịch bản dài và phải nghe đúng, hãy mua Starter rồi ngừng tìm.

WellSaid Labs — tốt nhất cho e-learning doanh nghiệp

Miễn phí 3 phút tải xuống/tháng, không có quyền thương mại · Mức trả phí đầu tiên 19 USD/tháng, hoặc 120 USD/năm · Đơn vị phút tải xuống

WellSaid bán cho đội ngũ doanh nghiệp và e-learning, định giá theo phút tải xuống — đơn vị rất dễ lập ngân sách. Starter 19 USD/tháng, hoặc 120 USD/năm khi trả theo năm, cho 20 phút tải xuống mỗi tháng; Pro 49 USD/tháng, hoặc 396 USD/năm, cho 180 phút. Giọng ít hơn và thận trọng hơn ElevenLabs — đúng điều mô-đun đào tạo qua rà soát tuân thủ cần.

Tốt: phút là đơn vị bộ phận tài chính hiểu; giọng ổn định, thận trọng, vượt rà soát pháp lý; giá năm giảm thật thay vì mẹo làm tròn.

Chưa tốt: danh mục nhỏ theo chuẩn 2026; không nhân bản giọng; 20 phút/tháng ít nếu sản xuất hằng tuần.

Kết luận: lựa chọn mua an toàn cho nội dung đào tạo và hóa đơn dễ dự báo nhất danh sách.

Speechify Studio — tốt nhất cho voiceover trong chỉnh sửa video

Miễn phí 600 tín dụng, không có quyền thương mại · Mức trả phí đầu tiên Starter 19 USD/tháng · Đơn vị tín dụng, 1 cho mỗi giây voiceover

Speechify Studio được xây quanh timeline chỉnh sửa video thay vì hộp văn bản. Starter 19 USD/tháng cho 7.200 tín dụng, có nhân bản và quyền thương mại; Creator 49 USD/tháng cho 28.800. Voiceover tốn 1 tín dụng mỗi giây, nên Starter tương đương hai giờ lời kể hoàn chỉnh — một hệ tín dụng hiếm hoi có thể tính nhẩm mà không cần bảng tính.

Tốt: giá một tín dụng mỗi giây dễ hiểu; voiceover và chỉnh sửa video trong một nơi; nhân bản và quyền thương mại từ gói đầu.

Chưa tốt: bạn trả tiền cho trình biên tập có thể không cần; chất lượng kể chuyện dài thấp hơn ElevenLabs một bậc; gói miễn phí chỉ là demo.

Kết luận: đúng khi âm thanh là một track trong dự án video, không phải sản phẩm cuối.

Murf — tốt nhất cho công việc studio cộng tác

Miễn phí không trích dẫn · Mức trả phí đầu tiên không trích dẫn · Đơn vị không trích dẫn

Murf thuộc nhóm này, đặc biệt với đội muốn studio cộng tác và dự án chia sẻ. Chúng tôi không nêu giá vì trang giá render phía client và không đọc được con số đủ chắc để bảo vệ. Mọi sản phẩm khác ở đây đều có số; hãy coi chỗ trống là giới hạn nguồn của chúng tôi, không phải phán quyết về sản phẩm.

Kết luận: đáng xem cho quy trình nhóm, nhưng hãy lấy giá hiện tại trực tiếp từ Murf.

Một API có thể mở rộng

Ở đây câu hỏi không phải giọng nào đẹp nhất. Bốn yếu tố khác quyết định.

Kinh tế đơn vị. Bạn trả bao nhiêu mỗi ký tự, giây hoặc tác vụ, và đường chi phí còn hợp lý ở khối lượng của bạn không. Cloud thắng tuyệt đối về tổng hợp thô: 4 USD mỗi triệu ký tự là sàn mà thuê bao không thể thấp hơn.

Độ trễ và hình dạng công việc. Bạn cần socket streaming cho một lượt hội thoại hay tác vụ gửi rồi chờ cho render mười phút? Đây là hai sản phẩm khác nhau, và nhà cung cấp tối ưu một loại thường chỉ trung bình ở loại kia.

Một lệnh gọi trả về gì. Đây là trục nhiều người bỏ qua. Phần lớn dịch vụ ở đây trả byte âm thanh cho văn bản bạn cung cấp — bạn chịu trách nhiệm kịch bản, phân đoạn, ghép nhiều giọng, thời gian phụ đề và muxing. Một nhóm nhỏ hơn trả sản phẩm hoàn chỉnh. Khác biệt đó đáng giá nhiều thời gian kỹ thuật hơn mọi chênh lệch giá trên trang.

Tác nhân có thể điều khiển một mình không. Năm 2026 nhiều lệnh gọi đến từ coding agent thay vì nhà phát triển ở bàn phím. Khi đó điều quan trọng là nhà cung cấp có giao diện công cụ mà tác nhân tự khám phá và gọi được — máy chủ MCP, Agent Skill, SDK có kiểu — hay ai đó phải viết và duy trì tích hợp trước.

Một điều cũng đáng biết trước khi cam kết: độ bền nhà cung cấp. Google, AWS, Microsoft và OpenAI sẽ không biến mất. Phần còn lại trẻ hơn, và giá của các công ty mới đã thay đổi nhiều lần.

Google Cloud Text-to-Speech — tốt nhất về độ đa dạng

Miễn phí 4M ký tự/tháng Standard và WaveNet, 1M Chirp 3 HD, lặp lại · Trả phí 4–160 USD mỗi 1M ký tự · Đơn vị ký tự

Dải hữu dụng rộng nhất danh sách. Standard và WaveNet giá 4 USD mỗi triệu ký tự sau hạn mức miễn phí lặp lại; Neural2 16 USD sau 1 triệu miễn phí; Chirp 3 HD, mẫu đầu bảng hiện tại, 30 USD sau 1 triệu miễn phí; Studio 160 USD. Các mẫu Gemini-TTS mới tính bằng token và không có hạn mức miễn phí. Một điểm cần lưu ý: phải bật thanh toán trước khi dùng cả ký tự miễn phí.

Tốt: gói miễn phí lặp lại đủ lớn để chạy nguyên mẫu thật với chi phí 0; lớp giọng cho mọi ngân sách; hàng chục ngôn ngữ với biến thể locale.

Chưa tốt: thang giá 4–160 USD trừng phạt người chọn lớp giọng mà không đọc; bạn phải viết mã, không có studio; Gemini tính token làm vỡ so sánh với phần còn lại.

Kết luận: lựa chọn API mặc định khi muốn một nhà cung cấp bao phủ cả khối lượng rẻ lẫn giọng đầu bảng.

Amazon Polly — tốt nhất cho gói miễn phí vĩnh viễn rẻ nhất

Miễn phí 5M ký tự Standard/tháng, liên tục không có mốc 12 tháng · Trả phí 4–100 USD mỗi 1M ký tự · Đơn vị ký tự

Dẫn đầu giá ở phân khúc thấp và có gói miễn phí tốt nhất thị trường. Giọng Standard 4 USD mỗi triệu ký tự, Neural 16 USD, Generative 30 USD, Long-Form 100 USD. 5 triệu ký tự Standard mỗi tháng không hết sau một năm, hiếm đến mức xứng đáng là điểm chính.

Tốt: hạn mức miễn phí quy mô lớn thực sự vĩnh viễn duy nhất; nhàm chán theo cách hạ tầng nên như vậy; tính phí mỗi ký tự dễ dự đoán.

Chưa tốt: lớp giọng tốt hơn chỉ miễn phí có thời hạn; không nhân bản; giọng Standard nghe cũ cạnh mẫu đầu bảng 2026.

Kết luận: nếu miễn phí vĩnh viễn quan trọng và bạn viết mã được, bắt đầu ở đây.

OpenAI — tốt nhất cho đội đã dùng OpenAI

Miễn phí không có · Trả phí tts-1 15 USD, tts-1-hd 30 USD mỗi 1M ký tự · Đơn vị ký tự, hoặc token ở mô hình mới

Lựa chọn hiển nhiên nếu stack đã ở đó và bạn muốn một nhà cung cấp, một khóa. Mô hình cũ dễ tính: tts-1 15 USD mỗi triệu ký tự, tts-1-hd 30 USD. gpt-4o-mini-tts mới tính bằng token thay vì ký tự, nên không thể so với nhà cung cấp theo ký tự trước khi đo đầu ra token âm thanh của bạn.

Tốt: một khóa, một hóa đơn, một SDK nếu đã ở đó; làm theo chỉ dẫn về sắc thái tốt; tài liệu tốt.

Chưa tốt: hoàn toàn không có gói miễn phí — trả từ yêu cầu đầu tiên; tính token ở mô hình mới thật sự khó dự báo; giọng tùy chỉnh yêu cầu trao đổi bán hàng. Chính sách sử dụng OpenAI còn yêu cầu công bố giọng do AI tạo.

Kết luận: tiện lợi là tính năng. Không ai chuyển sang OpenAI chỉ vì giọng.

Deepgram — tốt nhất cho tác nhân thời gian thực

Miễn phí 200 USD tín dụng, một lần, không cần thẻ · Trả phí Aura-2 0.030 USD mỗi 1k ký tự, Aura-1 0.0150 USD · Đơn vị ký tự

Được xây cho thời gian thực và tác nhân, nơi độ trễ quan trọng hơn vẻ đẹp. Đăng ký có 200 USD tín dụng không cần thẻ — thử nghiệm không cam kết hào phóng nhất ở đây, dù một lần thay vì lặp lại.

Tốt: tín dụng đủ lớn để đưa nguyên mẫu ra dùng; độ trễ thiết kế cho lượt hội thoại; speech-to-text từ cùng nhà cung cấp.

Chưa tốt: 200 USD không quay lại; danh mục giọng hẹp; không hướng tới nội dung dài.

Kết luận: đúng cho tác nhân giọng nói, sai cho sách nói.

Cartesia — tốt nhất cho streaming giá rẻ

Miễn phí 20k tín dụng/tháng, không dùng thương mại · Mức trả phí đầu tiên Pro 5 USD/tháng · Đơn vị tín dụng

Rất rẻ cho streaming độ trễ thấp. Pro chỉ 5 USD/tháng cho 100.000 tín dụng — nhưng cũng là gói đầu tiên cấp giấy phép thương mại và nhân bản tức thì, nên gói miễn phí chỉ là sandbox đánh giá. Startup 49 USD/tháng cho 1,25 triệu; Scale 299 USD/tháng cho 8 triệu.

Tốt: mức trả phí đầu tiên rẻ nhất danh sách, 5 USD; nhân bản từ mức đó; độ trễ thực sự thấp.

Chưa tốt: không thể xuất bản từ gói miễn phí; công ty trẻ hơn cloud; danh mục nhỏ hơn.

Kết luận: giá mỗi stream tốt nhất ở đây nếu xây thứ nhạy độ trễ và chấp nhận nhà cung cấp nhỏ hơn.

Microsoft Azure AI Speech — tốt nhất cho doanh nghiệp dùng hệ Microsoft

Miễn phí 500k ký tự neural/tháng, lặp lại, bị giới hạn mạnh · Trả phí khác theo vùng · Đơn vị ký tự

Azure công bố gói F0 miễn phí liên tục với 500.000 ký tự TTS neural mỗi tháng cùng 5 giờ âm thanh speech-to-text. Nó bị giới hạn và không dành cho production. Chúng tôi không nêu giá trả phí Azure vì bảng tải phía client; hãy đọc trong portal cho vùng của bạn, do giá Azure biến đổi theo địa lý hơn phần lớn danh sách.

Tốt: độ phủ ngôn ngữ và locale sâu; câu chuyện tuân thủ và lưu trú dữ liệu mà doanh nghiệp lớn cần; custom neural voice cho khách được duyệt.

Chưa tốt: phải tự tra giá theo vùng; giới hạn khiến gói miễn phí chỉ là demo; console phức tạp.

Kết luận: nếu công ty đã chạy trên Azure, quyết định này đã được đưa ra thay bạn.

ElevenLabs — bề mặt công cụ âm thanh tốt nhất cho tác nhân

Đã nói ở trên về chất lượng kể chuyện, nhưng ElevenLabs cũng thuộc phần này và cần nói thẳng: máy chủ MCP chính thức có bề mặt công cụ lớn hơn chúng tôi đáng kể — speech, transcription, speech-to-speech, hiệu ứng âm thanh, âm nhạc, thiết kế giọng và tác nhân gọi ra — trên Claude Desktop, Cursor, Windsurf và OpenAI Agents.

Kết luận: nếu công việc tác nhân là các primitive âm thanh và bạn muốn bộ rộng nhất sau một kết nối MCP, hãy cài nó. Câu trả lời của chúng tôi dưới đây hẹp hơn về primitive âm thanh, rộng hơn về sản phẩm hoàn chỉnh.

ListenHub — tốt nhất cho một khóa trên cả âm thanh video

Miễn phí hạn mức tháng cộng phần hằng ngày, gồm API key · Mức trả phí đầu tiên 12 USD/tháng, hoặc 9 USD/tháng khi trả năm · Đơn vị tín dụng

API của chúng tôi là lý do phần này dài hơn, nên đây là hình dạng thật. Nó không phải endpoint tổng hợp theo ký tự rẻ hơn — mà là đơn vị công việc khác. Một POST bắt đầu tác vụ trả về sản phẩm hoàn chỉnh: tập hai người dẫn có kịch bản, lời kể với phụ đề SRT, video giải thích đã render, bộ slide, nhạc nền, hình ảnh. Tác vụ bất đồng bộ — bạn tạo task rồi poll — vì render mười phút không phải một vòng HTTP.

Một API key truy cập tất cả: podcast, text-to-speech, voice cloning, âm nhạc, tạo ảnh, video giải thích, slide, AI video và trích xuất nội dung từ URL hoặc tệp. Không cần nhà cung cấp thứ hai cho nửa video, không cần glue code nối âm thanh với hình, một số dư tín dụng và một hóa đơn. Toàn bộ bề mặt API được mô tả dưới đây.

Tốt: sản phẩm hoàn chỉnh thay vì byte âm thanh; âm thanh và video sau một khóa; bốn đường chính chủ (REST, MCP, Agent Skills, SDK/CLI) để tác nhân điều khiển mà không cần tích hợp viết sẵn; mọi tài khoản tạo khóa được nên đánh giá miễn phí; mô hình task bất đồng bộ hợp render dài; SDK mở response envelope và retry rate limit.

Chưa tốt: tín dụng là đơn vị thô hơn ký tự, nên chi phí mỗi yêu cầu khó dự đoán hơn Polly; hạn mức miễn phí nhỏ cạnh 5 triệu ký tự/tháng của Polly, vì vậy khối lượng bền vững cần thuê bao hoặc gói tín dụng; ElevenLabs có nhiều công cụ âm thanh qua MCP hơn; chúng tôi không công bố SLA độ trễ và bạn không nên xây tác nhân giọng thời gian thực trên đây.

Kết luận: đúng khi muốn tác nhân hoặc backend phát ra nội dung hoàn chỉnh, có thể xuất bản. Sai khi muốn tổng hợp hàng loạt giá rẻ hoặc streaming dưới một giây.

Một chương trình hoàn chỉnh, không phải đoạn clip

Một loại sản phẩm khác được xếp dưới “text to speech” vì người dùng tìm như vậy. Bạn không có kịch bản. Bạn có tài liệu và muốn hai người thảo luận về nó.

NotebookLM — tốt nhất cho nghe cá nhân miễn phí

Miễn phí 3 lần tạo âm thanh/ngày với mọi tài khoản Google · Trả phí qua thuê bao Google AI · Đơn vị lần tạo

Miễn phí và xuất sắc ở việc này. Bạn tải nguồn lên, nó tạo tổng quan âm thanh hai người dẫn; tài liệu hỗ trợ Google nói gói miễn phí có 3 lần tạo âm thanh/ngày cùng 50 truy vấn chat. Nếu nhu cầu thỉnh thoảng và cá nhân — biến PDF dày thành thứ nghe khi đi bộ — khó phản đối miễn phí.

Tốt: thực sự miễn phí; hội thoại hai người dẫn thuyết phục; không cần thiết lập.

Chưa tốt: không thể sửa kịch bản trước khi đọc, chọn giọng, nhân bản hay xóa thương hiệu; đầu ra một định dạng cố định; không xây cho lịch xuất bản.

Kết luận: cách miễn phí tốt nhất để nghe tài liệu của chính bạn, nhưng không phải công cụ production.

ListenHub — tốt nhất cho chương trình nhiều giọng có thể xuất bản

Miễn phí hạn mức tháng cộng phần hằng ngày · Mức trả phí đầu tiên 12 USD/tháng, hoặc 9 USD/tháng khi trả năm · Đơn vị tín dụng

Đây là thứ chúng tôi xây, nên hãy đọc với sự nghi ngờ phù hợp — và đọc phần tiếp theo, bản dài trung thực gồm cả điểm yếu. Nói trong một câu: NotebookLM cho bạn tổng quan âm thanh, ListenHub cho chương trình có thể sửa, gắn thương hiệu và phát hành.

Tốt: kịch bản sửa được trước khi phát âm; 12 ngôn ngữ đầu ra cho text-to-speechvoice cloning; bước viết lại văn viết thành văn nói sửa lỗi đọc nguyên xi ở trên; âm thanh, SRT, video và slide từ một số dư.

Chưa tốt: định dạng AI podcast vẫn chỉ tạo bằng Anh, Trung và Nhật; sửa kịch bản, xuất tệp, nhân bản và xóa thương hiệu đều cần gói trả phí, nên miễn phí dành để nghe chứ không phải xuất bản; chi phí đơn vị không thể chạm 4 USD mỗi triệu ký tự; không có timeline chỉnh video; nếu một giọng đọc kịch bản dài, ElevenLabs tốt hơn.

Kết luận: chọn chúng tôi khi sản phẩm là chương trình nhiều giọng hoàn chỉnh từ tài liệu nguồn. Với hầu hết việc khác trên trang, một công cụ khác ở đây là đáp án tốt hơn.

ListenHub thực sự làm gì

Bạn mang đến báo cáo, bài nghiên cứu, URL hoặc kịch bản. Bạn muốn thứ mọi người thực sự nghe. Bốn việc xảy ra ở đây mà hộp text-to-speech thông thường không làm, và đó là toàn bộ lý do chọn chúng tôi.

Nó viết lại văn bản thành lời nói trước. Đây là bước chuyển từ văn viết sang văn nói, xử lý lỗi lớn nhất bài này. “Fig. 3 shows a 12.4% YoY increase (see Appendix B)” trở thành điều con người thực sự nói thành tiếng. Mảnh câu bullet có động từ. Chữ viết tắt được mở rộng như người đọc sẽ làm. Bạn cũng có thể tắt và đọc từng từ khi văn bản đã hội thoại — tuyên bố pháp lý nên được đọc đúng nguyên văn.

Nó viết hội thoại, không phải hai độc thoại ghép lại. Vấn đề lượt lời trước đó là vấn đề kịch bản trước khi là vấn đề tổng hợp. Hai người dẫn nhận kịch bản viết như cuộc trò chuyện, người thứ hai phản hồi điều người thứ nhất thực sự nói.

Bạn sửa kịch bản trước khi bất kỳ điều gì được nói. Đây là khác biệt giữa đồ chơi và công cụ. Bạn thấy kịch bản, sửa câu hiểu sai định vị sản phẩm, cắt phần lan man, rồi mới tiêu tín dụng cho âm thanh. Sửa chữ miễn phí; render âm thanh lại thì không. Sửa kịch bản là tính năng thuê bao từ Basic.

Một số dư bao phủ toàn bộ đầu ra. Âm thanh với phụ đề SRT, video giải thích, slide, hình ảnh — cùng tín dụng, không thuê bao thứ hai. Xuất tệp và xóa thương hiệu ListenHub cũng bắt đầu từ Basic, nên gói miễn phí là nơi nghe thử chứ không phải nơi xuất bản.

Một API và bề mặt dành cho tác nhân

Đây là nửa sản phẩm không xuất hiện trong bảng tính năng và với nhà phát triển là phần thú vị nhất. Mọi thứ ứng dụng web làm được đều truy cập bằng chương trình qua bốn bề mặt chính chủ, xác thực bằng cùng API key và dùng cùng số dư tín dụng.

REST API. Tạo khóa tại Settings → API keys — định dạng lh_sk_… — rồi gọi https://api.marswave.ai/openapi. Phản hồi dùng một envelope, { code, message, data }, với code khác 0 cho lỗi. Việc tạo bất đồng bộ theo thiết kế: bạn tạo task rồi poll, vì một tập hoàn chỉnh hay video render mất phút chứ không phải mili giây. Endpoint bao phủ tạo podcast, text-to-speech, ListenHub Voice cho âm thanh đầu-cuối, âm nhạc, hình ảnh, video giải thích, slide, AI video, tra cứu người nói, trích nội dung từ URL/tệp và trạng thái thuê bao. Tài liệu API có reference đầy đủ; tham số và ngôn ngữ được chỉ rõ theo endpoint ở đó thay vì ở đây vì bề mặt này đổi nhanh hơn blog.

Máy chủ MCP. ListenHub cung cấp máy chủ Model Context Protocol, để client MCP — Claude Desktop, Cursor, Windsurf, VS Code, Zed — tạo podcast và lời kể, duyệt danh mục giọng và kiểm tra tài khoản bằng cách gọi tool thay vì HTTP. Mỗi tool bọc endpoint công khai nên hai bề mặt đồng bộ. Nó chạy qua stdio mặc định, hoặc HTTP/SSE khi cần remote, và xác thực từ LISTENHUB_API_KEY. Điều cần biết: create_podcast poll đến hoàn tất thay bạn, nên một tool call trả tập hoàn chỉnh thay vì task id tác nhân phải trông. Xem tài liệu MCP.

Agent Skills. Bề mặt chúng tôi sẽ chỉ cho coding agent đầu tiên:

npx skills add marswaveai/skills

Lệnh này cài ListenHub Skills vào dự án cho mọi công cụ hỗ trợ Agent Skills — Claude Code, Cursor, Windsurf, OpenCode. Sau đó chỉ dẫn bằng ngôn ngữ thường: biến bài này thành video giải thích, tạo podcast hai người dẫn từ ba URL này. Tác nhân chọn giọng, điều khiển tạo, poll đến xong và trả sản phẩm cùng liên kết. Có skill riêng cho giọng, podcast, text-to-speech, video giải thích, slide, hình, nhạc, phiên âm và phân tích nội dung, nên tác nhân ghép pipeline thay vì gọi endpoint nguyên khối.

SDK và CLI. @marswave/listenhub-sdk là client JavaScript/TypeScript chính thức có kiểu — chỉ ESM, kèm type, một dependency runtime, Node 20 trở lên. Nó mở envelope và retry 429, nên bạn không phải tự viết. Nó xuất hai client, một phân biệt thực sự hữu ích: OpenAPIClient xác thực bằng API key cho server, script và CI và hành động như chủ khóa, còn ListenHubClient dùng OAuth user token để mỗi yêu cầu chạy dưới một người dùng đã đăng nhập — phù hợp nếu xây sản phẩm hướng người dùng. @marswave/listenhub-cli bọc cùng SDK thành binary listenhub với phân chia tương tự: listenhub … sau đăng nhập OAuth trên trình duyệt cho việc tương tác, listenhub openapi … với khóa cho CI. Tài liệu SDKCLI.

Chọn giọng bằng chương trình. Tra cứu người nói trả nhiều hơn ID và tên — mỗi giọng có cao độ, tốc độ, đặc điểm, phong cách, bối cảnh gợi ý, giọng vùng, mô tả và mô tả đã bản địa hóa. Tác nhân có thể chọn từ brief như “nữ dẫn chuyện ấm áp cho sách nói” thay vì hard-code ID con người từng chọn. Cũng có danh mục văn bản thuần tại /voices.txt cho tác nhân thích đọc tệp hơn gọi endpoint.

Hai điều cần nói rõ. Không cần gói thuê bao — mọi tài khoản tạo khóa được, nên đánh giá API bằng hạn mức miễn phí không cần thẻ và nguyên mẫu cuối tuần không tốn gì. Nhưng cần tín dụng: API tiêu cùng số dư với web app, nên dùng tự động và dùng thủ công của đội lấy từ một quỹ, khối lượng bền vững cần thuê bao hoặc gói tín dụng. Đơn vị là tín dụng thay vì ký tự, khó dự báo thô hơn giá theo ký tự.

Ngôn ngữ và giọng

Text-to-speechvoice cloning đều chạy bằng 12 ngôn ngữ: Anh, Trung phổ thông, Nhật, Tây Ban Nha, Bồ Đào Nha, Pháp, Đức, Thổ Nhĩ Kỳ, Hàn, Ý, Thái và Việt. Danh mục giọng công khai có tag và mô tả mỗi giọng để lọc theo ngôn ngữ, giới tính và cách thể hiện thay vì nghe từng tên. Cũng có danh mục thuần văn bản tại /voices.txt cho tác nhân.

Hãy chính xác điều này bao phủ và không bao phủ gì, vì chúng tôi thấy nơi khác nói quá: 12 ngôn ngữ áp dụng cho text-to-speech và nhân bản. Định dạng AI podcast và các công cụ tạo khác vẫn chỉ tạo bằng Anh, Trung và Nhật. Nếu hôm nay cần podcast Tây Ban Nha hai người dẫn, chúng tôi chưa làm được.

Nhân bản giọng nói

Nhân bản giọng của bạn từ mẫu và dùng ở bất kỳ đâu giọng danh mục hoạt động, trong bất kỳ ngôn ngữ nào trong 12 ngôn ngữ. Mọi gói trả phí gồm nhân bản — Basic 1 bản lưu, Pro 4, Max 20 — và lưu vượt hạn mức tốn 300 tín dụng mỗi giọng. Hướng dẫn nhân bản giọng giải thích mẫu tốt; ngắn gọn là ba phút nói sạch tốt hơn ba mươi phút có tạp âm.

Chi phí

Basic 12 USD/tháng, hoặc 9 USD/tháng trả năm, cho 1.300 tín dụng và một giọng nhân bản. Pro 24 USD/tháng, hoặc 19 USD/tháng trả năm, cho 2.700 tín dụng và bốn giọng. Max 240 USD/tháng, hoặc 200 USD/tháng trả năm, cho 30.000 tín dụng và 20 giọng. API, máy chủ MCP và Agent Skills không buộc vào gói — hoạt động trên mọi tài khoản gồm miễn phí và trừ tín dụng hiện có.

Quy đổi tín dụng thành công việc: podcast 5 phút khoảng 24 tín dụng, text-to-speech 10 phút khoảng 40, deck 10 trang khoảng 150. Vì vậy Pro tương đương khoảng 11 giờ lời nói mỗi tháng nếu không tiêu vào thứ khác. Có gói miễn phí với hạn mức tháng và phần cộng hằng ngày nhỏ; trang giá có số hiện tại, thay đổi đủ thường để chúng tôi dẫn tới đó thay vì đóng băng ở đây. Hướng dẫn tín dụng giải thích ba loại tín dụng cộng lại thế nào và thứ tự bị dùng.

Nơi chúng tôi yếu hơn các công cụ trên

Nói thẳng vì đằng nào bạn cũng phát hiện:

  • Chi phí đơn vị ở khối lượng lớn. Polly và Google là 4 USD mỗi triệu ký tự. Thuê bao không thể cạnh tranh, và chúng tôi không giả vờ ngược lại.
  • Độ tinh tế dài với một giọng. ElevenLabs giữ ngữ điệu tốt hơn trong kịch bản rất dài chỉ một người kể.
  • Độ rộng công cụ âm thanh cho tác nhân. Máy chủ MCP ElevenLabs có nhiều primitive hơn — phiên âm, speech-to-speech, tách âm, thiết kế giọng, gọi ra. Của chúng tôi hướng sản phẩm hoàn chỉnh.
  • Không đo API theo ký tự. Bạn tiêu tín dụng, không phải ký tự, nên chi phí yêu cầu khó dự báo hơn mức công bố 4 USD mỗi triệu — và hạn mức miễn phí chỉ là phần nhỏ của 5 triệu ký tự/tháng của Polly.
  • Không cam kết độ trễ. Chúng tôi không công bố SLA và mô hình task xây cho render, không cho lượt thời gian thực. Đừng đặt chúng tôi vào tác nhân giọng trực tiếp.
  • Chỉnh sửa video. Speechify cho timeline. Chúng tôi cho tệp xuất.
  • Ngôn ngữ podcast. 12 cho TTS và nhân bản, 3 cho định dạng podcast.
  • Mua sắm doanh nghiệp. Không có đảm bảo lưu trú hay hợp đồng tùy chỉnh như Azure và AWS bán.

So sánh gói miễn phí

Gói miễn phí khác nhau ở việc là sản phẩm hay demo. Điều quan trọng không phải kích thước — mà là bạn có được xuất bản thứ tạo ra không.

Công cụHạn mức miễn phíLặp lại?Xuất bản từ miễn phí?
Amazon Polly5M ký tự Standard/thángCó, không hết
Google Cloud4M ký tự Standard/tháng, 1M Chirp 3 HD
Azure500k ký tự neural/thángCó, bị giới hạn
Deepgram200 USD tín dụngKhông, một lần
NotebookLM3 lần tạo/ngàyDùng cá nhân
ElevenLabs10k tín dụng/thángKhông
Cartesia20k tín dụng/thángKhông
Speechify600 tín dụngKhông
WellSaid3 phút tải xuống/thángKhông
ListenHubHạn mức tháng cộng phần hằng ngàyKhông, xuất tệp cần gói

Năm mục cuối hoàn toàn trung thực về điều này và hoàn toàn vô dụng nếu bạn định xuất bản. Chúng tôi đặt mình trong nhóm đó thay vì phía trên, vì gói miễn phí không xuất được chỉ là sandbox đánh giá bất kể ai xây. Hãy dự trù gói trả phí đầu tiên từ ngày một — lần lượt 6, 5, 19, 19 và 12 USD. Lớp giọng tốt hơn của Polly cũng có thời hạn: Neural 1 triệu/tháng, Long-Form 500.000, Generative 100.000, mỗi loại chỉ trong 12 tháng đầu.

Nếu “miễn phí” là yêu cầu cứng và bạn định xuất bản, danh sách rất ngắn: Polly và Google Cloud, và bạn sẽ phải viết mã.

Các ngôn ngữ ngoài tiếng Anh

Nền tảng cloud thắng tuyệt đối về độ rộng. Google, Azure và Polly đều bao phủ hàng chục ngôn ngữ với giọng bản ngữ và biến thể locale, vì đã xây từ lâu trước làn sóng hiện tại. ElevenLabs mạnh ở đầu ra đa ngôn ngữ từ một giọng — cùng giọng nhân bản nói ngôn ngữ khác, một năng lực khác và hữu ích.

Marketing trở nên mơ hồ ở khoảng cách giữa được hỗ trợtốt. Nhiều nhà cung cấp nêu số ngôn ngữ lớn nhưng phần lớn dùng một mô hình đa ngôn ngữ và vài giọng tối ưu cho tiếng Anh. OpenAI nói thẳng điều này trong tài liệu. Hãy yêu cầu mẫu bằng ngôn ngữ mục tiêu, được nói bởi giọng thực sự quảng bá cho ngôn ngữ đó, rồi nhờ người bản ngữ nghe.

Theo tiêu chuẩn đó, vị trí thật của chúng tôi không làm tròn: 12 ngôn ngữ cho text-to-speechvoice cloning, mỗi ngôn ngữ có giọng từ danh mục thay vì giọng Anh với tùy chọn accent — và 3 ngôn ngữ cho podcast. Nếu cần lời kể Hindi, Ả Rập hoặc Indonesia, chúng tôi không có; Google hoặc Azure có.

Bạn nên chọn công cụ nào?

Bạn là creator độc lập xuất bản video có lời kể. ElevenLabs Starter 6 USD/tháng. Chỉ thêm Speechify nếu muốn cả timeline chỉnh sửa.

Bạn vận hành đội L&D hoặc đào tạo. WellSaid Labs. Phút là đơn vị dự toán được và giọng qua rà soát pháp lý.

Bạn là kỹ sư cần tổng hợp trong sản phẩm. Google Cloud hoặc Polly. Làm nguyên mẫu trong gói miễn phí lặp lại, rồi chủ động chọn lớp giọng — chênh lệch 4 và 160 USD mỗi triệu ký tự chỉ là một dropdown.

Bạn xây tác nhân giọng nói. Deepgram hoặc Cartesia. Độ trễ và giá mỗi stream là toàn bộ trò chơi; kích thước danh mục không phải.

Bạn muốn tác nhân AI tự tạo nội dung hoàn chỉnh. ListenHub Skills hoặc máy chủ MCP của chúng tôi. Một npx skills add marswaveai/skills để coding agent biến URL thành tập đã xuất bản hoặc video giải thích mà không cần tích hợp viết trước. Không cần gói để bắt đầu — tài khoản miễn phí có khóa, và bạn trả tín dụng sau giai đoạn đánh giá. Nếu tác nhân cần primitive âm thanh thay vì sản phẩm hoàn chỉnh — phiên âm, hiệu ứng, thiết kế giọng — hãy cài MCP ElevenLabs hoặc cả hai.

Bạn tự động hóa pipeline nội dung trong CI. SDK hoặc CLI của chúng tôi với API key, hoặc cloud nếu chỉ cần tổng hợp. listenhub openapi … tồn tại chính cho trường hợp script.

Bạn là sinh viên hoặc nhà nghiên cứu có PDF dày. NotebookLM, miễn phí. Khi muốn kịch bản sửa được và đầu ra xuất bản được, đó là lúc bạn vượt qua nó.

Bạn xuất bản show hoặc chương trình nội dung từ tài liệu. ListenHub. Kịch bản sửa được, nhiều giọng, xuất không thương hiệu, một số dư cho âm thanh, video và slide.

Yêu cầu thật sự là 0 USD và bạn viết mã được. Polly, rồi Google Cloud. Gói miễn phí của mọi bên khác hoặc cấm xuất bản hoặc cạn.

Những câu hỏi người dùng thực sự hỏi

Công cụ text-to-speech miễn phí tốt nhất là gì? Amazon Polly nếu bạn viết mã được: 5 triệu ký tự mỗi tháng, vĩnh viễn, và được xuất bản kết quả. Nếu không viết mã được, NotebookLM miễn phí cho nghe cá nhân. Hầu hết gói miễn phí tiêu dùng — ElevenLabs, Cartesia, Speechify, WellSaid và của chúng tôi — cấm dùng thương mại hoặc khóa xuất tệp sau gói trả phí.

Tôi có thể dùng giọng AI trên YouTube hoặc cho khách hàng không? Chỉ ở gói cấp giấy phép thương mại, thường không phải miễn phí. ElevenLabs từ 6 USD, Cartesia từ 5 USD, Speechify từ 19 USD. Kiểm tra giấy phép của đúng gói định mua, không phải gói phía trên. Quy tắc nền tảng tách khỏi giấy phép nhà cung cấp, và chính sách OpenAI còn yêu cầu công bố giọng do AI tạo.

Nhân bản giọng là gì, có cần cho phép không? Bạn cung cấp mẫu giọng và mô hình tái tạo âm sắc để đọc mọi văn bản. Cần sự đồng ý của chủ giọng — giọng của bạn được tính. Nhân bản giọng người khác không phép là đường nhanh nhất đến rắc rối pháp lý, và điều khoản của mọi nhà cung cấp uy tín đều cấm.

Công cụ nào có giọng tự nhiên nhất? Theo kinh nghiệm của chúng tôi, ElevenLabs cho một giọng đọc kịch bản dài. Nhưng “tự nhiên” thất bại ở ngữ điệu, đọc ký hiệu nguyên xi và tên bị làm hỏng thường xuyên hơn âm sắc, nên hãy chạy đoạn tệ nhất của bạn thay vì tin bảng xếp hạng.

Tôi nên dự kiến trả bao nhiêu? Khoảng 5–25 USD/tháng cho thuê bao creator, hoặc 4–30 USD mỗi triệu ký tự qua API. Gói miễn phí phục vụ đánh giá và cá nhân; xuất bản thường bắt đầu ở gói trả phí đầu tiên.

Có phát hiện được lời nói do AI tạo không? Không đáng tin cậy, và bạn không nên lập kế hoạch dựa vào đó. Một số nền tảng yêu cầu công bố media tổng hợp, một số nhà cung cấp yêu cầu trong điều khoản, và chi phí danh tiếng khi bị phát hiện không công bố tệ hơn chi phí công bố.

Text-to-speech khác công cụ AI podcast thế nào? Text-to-speech nhận kịch bản và đọc. Công cụ AI podcast nhận tài liệu nguồn, viết kịch bản — thường dạng hội thoại — rồi đọc. Nếu đã có lời, hãy mua text-to-speech. Nếu có báo cáo và muốn cuộc trò chuyện về nó, đó là sản phẩm khác, sản phẩm chúng tôi xây.

Tôi cần API hay ứng dụng? API nếu lời nói là tính năng trong sản phẩm, hoặc khối lượng làm giá mỗi ký tự rẻ hơn thuê bao. Ứng dụng nếu lời nói là sản phẩm cuối và bạn không muốn duy trì mã. Mua API để làm tay 40 tập là lỗi phổ biến và đắt.

Công cụ nào tác nhân AI dùng trực tiếp được? ElevenLabs và ListenHub đều có máy chủ MCP chính thức, nên tác nhân trong Claude Desktop, Cursor hoặc Windsurf gọi như tool mà không cần tích hợp viết trước. ListenHub còn xuất bản Agent Skills — npx skills add marswaveai/skills — cho Claude Code, Cursor, Windsurf và OpenCode. Mọi thứ còn lại là REST API bạn hoặc tác nhân phải bọc trước. Khác biệt thực tế là thứ lệnh gọi trả: ElevenLabs đưa primitive âm thanh, ListenHub đưa tập, video hoặc deck hoàn chỉnh.

API ListenHub giá bao nhiêu, có khóa miễn phí không? Mọi tài khoản tạo khóa được, kể cả miễn phí — không cần gói. Bạn tiêu tín dụng, cùng số dư web app dùng, nên đánh giá miễn phí còn khối lượng bền vững cần thuê bao từ 12 USD/tháng hoặc gói tín dụng. Cảnh báo thật là đơn vị: tín dụng thô hơn ký tự; nếu cần dự báo chi phí mỗi yêu cầu đến cent, nhà cung cấp mỗi ký tự như Polly hay Google Cloud dễ mô hình hơn.

Tôi có thể gọi ListenHub thay mặt người dùng đã đăng nhập của mình không? Có, và đó là lý do có hai SDK client. OpenAPIClient dùng API key và hành động như chủ khóa — đúng cho server, script và CI. ListenHubClient dùng OAuth user token để mỗi yêu cầu chạy dưới tài khoản một người dùng, phù hợp ứng dụng hướng người dùng. Không bao giờ đưa API key vào mã trình duyệt hoặc di động.

ListenHub hỗ trợ ngôn ngữ nào? 12 cho text-to-speechvoice cloning: Anh, Trung phổ thông, Nhật, Tây Ban Nha, Bồ Đào Nha, Pháp, Đức, Thổ Nhĩ Kỳ, Hàn, Ý, Thái, Việt. Ba — Anh, Trung, Nhật — cho AI podcast. Với API và MCP, kiểm tra tài liệu tham chiếu theo endpoint thay vì giả định phạm vi web app.

Khi nào chúng tôi sẽ hướng bạn sang nơi khác

Sáu trường hợp, nói thẳng:

Bạn cần một giọng đọc kịch bản dài thật hay. Mua ElevenLabs. Ngữ điệu dài là chuyên môn của họ và 6 USD/tháng không phải rào cản thật.

Bạn là kỹ sư có khối lượng và ngân sách. Chọn Google Cloud hoặc Polly. Không thuê bao nào thắng 4 USD mỗi triệu ký tự, và gói miễn phí lặp lại làm nguyên mẫu không tốn tiền.

Tác nhân cần primitive âm thanh, không phải sản phẩm hoàn chỉnh. Cài máy chủ MCP ElevenLabs. Phiên âm, speech-to-speech, hiệu ứng, thiết kế giọng và gọi ra đều có; bề mặt chúng tôi cố ý hẹp hơn.

Bạn xây bất kỳ thứ gì thời gian thực. Deepgram hoặc Cartesia. Chúng tôi không công bố SLA độ trễ và mô hình task xây cho render.

Bạn cần ngôn ngữ chúng tôi không phục vụ, hoặc podcast hai người dẫn ngoài Anh, Trung và Nhật. Google hoặc Azure cho độ rộng lời kể. Định dạng podcast chưa bắt kịp danh mục giọng.

Bạn muốn biến tài liệu thành tóm tắt để tự nghe. Dùng NotebookLM. Nó miễn phí và tốt; nghe riêng trên đường đi không cần sửa kịch bản, xóa thương hiệu hay nhân bản.

Chúng tôi là đáp án tốt hơn trong hai tình huống: khi bạn muốn chương trình nhiều giọng hoàn chỉnh, xuất bản được từ tài liệu nguồn, với kịch bản sửa trước khi đọc; và khi muốn tác nhân hoặc backend tạo loại đầu ra đó — cả âm thanh lẫn video — sau một khóa.

Tự chạy thử trước khi cam kết

Hai mươi phút sẽ cho biết nhiều hơn mọi bài so sánh, kể cả bài này.

  1. Lấy đoạn thực tế tệ nhất — tên sản phẩm, chữ viết tắt, số, ngoặc. Không phải câu demo của nhà cung cấp.
  2. Chạy nguyên văn qua ba công cụ trong danh sách rút gọn.
  3. Nghe ở tốc độ 1x bằng tai nghe đến hết. Nghe nhanh che vấn đề nhịp.
  4. Đếm lỗi đã nêu: nhấn sai, đọc ký hiệu nguyên xi, tên bị làm hỏng, lượt lời chết, khoảng nghỉ đều.
  5. Chỉ sau đó xem giá. Công cụ đọc sai tên công ty không rẻ ở bất kỳ mức nào.
  6. Kiểm tra giấy phép thương mại của đúng gói định mua, không phải gói phía trên.

Nếu muốn thử chúng tôi trong bài kiểm tra đó, text-to-speechAI podcast đều chạy ở gói miễn phí không cần thẻ. Nếu muốn đánh giá từ terminal thay vì trình duyệt, npx skills add marswaveai/skills đưa nó tới coding agent, và tài liệu API mở để đọc trước khi trả tiền.

Và nếu đối thủ thắng trên văn bản của bạn, họ đã xứng đáng.

Quay lại blog