Âm thanh thành văn bản · Bản ghi và video
Tải âm thanh hoặc video lên, ngôn ngữ được nhận diện sẵn. Xong thì sao chép, tải TXT, hoặc xuất phụ đề SRT nếu cần. Mỗi tệp tối đa 2 giờ hoặc 50 MB.
Chưa có bản chép lời
Các dự án âm thanh thành văn bản gần đây sẽ xuất hiện tại đây.
Kéo tệp âm thanh hoặc video vào: hỗ trợ AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA và WMV, mỗi tệp tối đa 2 giờ hoặc 50 MB. Định dạng, dung lượng và thời lượng đều được kiểm tra trước khi bắt đầu tải lên.
Không bắt buộc, nhưng đáng bỏ ra vài giây cho những gì một mô hình phổ thông chưa từng nghe: tên người, thương hiệu, từ viết tắt, thuật ngữ nội bộ. Tối đa 50 mục, được ghi nhớ trên thiết bị này cho lần tải lên sau.
Việc chép lời chạy trên máy chủ của chúng tôi, nên bạn có thể đóng tab rồi quay lại sau. Trang kết quả hiển thị thời lượng và số từ ngay trên phần văn bản đầy đủ, sẵn sàng để sao chép, tải về dạng TXT UTF-8 hoặc xuất thành phụ đề SRT.
Có ngay bản ghi chép trích dẫn được của buổi phỏng vấn, rồi tìm câu bạn chỉ nhớ một nửa thay vì tua đi tua lại đoạn ghi âm.
Chuyển bản ghi cuộc họp thành một bản chép lời liền mạch để dán vào tài liệu dự án và gửi cho người vắng mặt.
Đọc lại một buổi học hay bài nói theo nhịp của bạn, giữ những đoạn dày thuật ngữ dưới dạng văn bản có thể chú thích.
Xuất tệp SRT dựng từ mốc thời gian của từng câu và nạp thẳng vào phần mềm dựng, khỏi gõ tay từng dòng phụ đề.
Công nghệ nhận dạng giọng nói nghe hết bản ghi rồi viết lại những gì đã nói. Nó thay cho việc ngồi gõ tay toàn bộ, nên một giờ âm thanh trở thành tài liệu đọc và tra cứu được trong thời gian ngắn hơn nhiều.
Mười bảy định dạng âm thanh và video: AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA và WMV. Video tải lên nguyên trạng, không cần tách sẵn phần tiếng.
Mỗi lần một tệp, tối đa 2 giờ và 50 MB. Cả hai giới hạn đều được kiểm tra trước ngay trên trình duyệt, nên tệp quá lớn bị chặn ngay chứ không phải sau một lượt tải lên dài.
Không. Ngôn ngữ nói được nhận diện từ chính bản ghi, nên tệp không nhất thiết phải cùng ngôn ngữ với giao diện.
Có. Mỗi câu được lưu kèm thời điểm bắt đầu và kết thúc, nên cùng một kết quả vừa xuất được bản chép lời TXT UTF-8 vừa xuất được tệp phụ đề SRT. Nếu bản ghi không cho ra mốc thời gian dùng được, tùy chọn SRT sẽ bị tắt thay vì đoán bừa.
Mỗi phút đã bắt đầu của bản ghi gốc tính 1 credit, nên tệp dài 90 giây tốn 2 credit. Mức ước tính hiện trên nút gửi trước khi bắt đầu, và nếu chép lời thất bại thì không trừ gì cả.
Điều đó tùy vào bản ghi. Giọng rõ, mỗi lúc một người nói và ít tiếng ồn nền sẽ cho kết quả tốt nhất. Chỗ hay sai thường là tên riêng, thương hiệu và thuật ngữ chuyên ngành — đó chính là việc mà ô từ vựng tham chiếu sinh ra để xử lý.