音频转文字 · 录音与视频转写
上传音频或视频,语言自动识别。转完可以直接复制、下载 TXT,需要字幕就导出 SRT。单个文件最长 2 小时、50 MB。
还没有转写稿
最近的音频转文字项目会显示在这里。
把音频或视频文件拖进来即可,支持 AAC、AMR、AVI、FLAC、FLV、M4A、MKV、MOV、MP3、MP4、MPEG、OGG、OPUS、WAV、WEBM、WMA 和 WMV,单个文件最长 2 小时、最大 50 MB。格式、大小和时长在开传之前就先校验。
选填,但人名、品牌、缩写和公司内部黑话值得花几秒填一下——这些正是通用模型最容易听错的词。最多 50 条,本设备会记住,下次上传自动带上。
转写跑在服务器上,页面关掉再回来照样能看结果。完成页在全文上方给出时长和字数,可以直接复制、下载成 UTF-8 TXT,或者导出成 SRT 字幕。
把采访录音变成能直接引用的文字稿,想找那句只记得一半的话,搜一下就有,不用来回拖进度条。
把会议录音转成一份连续的文字稿,贴进项目文档,也能直接发给没到场的人。
按自己的节奏把课堂或演讲读一遍,术语密集的段落留成文字,方便标注。
用句级时间轴导出 SRT,直接拖进剪辑软件,不用一句一句手打。
语音识别会把整段录音听一遍,把说过的话写成文字,替掉人工听打。原本要占掉一下午的一小时录音,这样很快就变成一份能读、能搜的文档。
17 种音视频格式:AAC、AMR、AVI、FLAC、FLV、M4A、MKV、MOV、MP3、MP4、MPEG、OGG、OPUS、WAV、WEBM、WMA 和 WMV。视频可以原样上传,不用先把音轨抽出来。
一次一个文件,最长 2 小时、最大 50 MB。两个上限都先在浏览器里校验,超了当场就提示,不会让你白等一次上传。
不需要,语言从录音本身识别。所以录音的语言和你界面用的语言对不上,也不影响转写。
可以。每句话都存了起止时间,所以同一份结果除了 UTF-8 TXT,还能导出成 SRT 字幕文件。如果这段录音没能产出可用的句级时间轴,SRT 入口会置灰,而不是编一条时间轴给你。
按原始录音算,每开始 1 分钟扣 1 积分,所以 90 秒的文件是 2 积分。提交前按钮上就写着预计消耗;转写失败不扣费。
要看录音本身:吐字清楚、不抢话、背景噪音小的录音效果最好。最容易出错的是人名、品牌和专业术语,参考词汇就是用来兜这类词的。