Áudio para texto · Gravações e vídeo
Envie o áudio ou o vídeo e o idioma é detectado sozinho. No fim, copie o texto, baixe um TXT ou exporte legendas SRT. Um arquivo de até 2 horas ou 50 MB.
Ainda não há transcrições
Seus projetos recentes de áudio para texto aparecerão aqui.
Arraste um arquivo de áudio ou vídeo: valem AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA e WMV, com até 2 horas ou 50 MB. Formato, tamanho e duração são conferidos antes de o envio começar.
É opcional, mas vale os poucos segundos para tudo que um modelo genérico nunca ouviu: nomes de pessoas, marcas, siglas e jargão interno. Até 50 termos, guardados neste dispositivo para o próximo envio.
A transcrição roda nos nossos servidores, então dá para fechar a aba e voltar depois. A página final mostra duração e contagem de palavras acima do texto completo, pronto para copiar, baixar em TXT UTF-8 ou exportar como legenda SRT.
Tenha um registro citável da entrevista gravada e procure aquela frase de que você só lembra pela metade, em vez de ficar rebobinando o áudio.
Transforme a gravação de uma reunião em uma transcrição contínua para colar nas notas do projeto e mandar para quem faltou.
Releia uma aula ou palestra no seu ritmo e guarde como texto anotável os trechos cheios de termos técnicos.
Exporte um SRT montado a partir do tempo de cada frase e carregue direto no seu editor, sem digitar legenda por legenda.
O reconhecimento de fala escuta a gravação inteira e escreve o que foi dito. Substitui o trabalho de digitar tudo à mão, então uma hora de áudio vira um documento legível e pesquisável numa fração do tempo.
Dezessete formatos de áudio e vídeo: AAC, AMR, AVI, FLAC, FLV, M4A, MKV, MOV, MP3, MP4, MPEG, OGG, OPUS, WAV, WEBM, WMA e WMV. Vídeos entram do jeito que estão — não precisa extrair a trilha de áudio antes.
Um arquivo por vez, com até 2 horas e 50 MB. Os dois limites são conferidos primeiro no navegador, então um arquivo grande demais é barrado na hora, e não depois de um envio demorado.
Não. O idioma falado é detectado na própria gravação, então o arquivo não precisa estar no mesmo idioma da interface.
Dá. Cada frase é guardada com hora de início e de fim, então o mesmo resultado sai como arquivo de legenda SRT além da transcrição em TXT UTF-8. Se a gravação não render marcações de tempo utilizáveis, a opção SRT fica desativada em vez de ser inventada.
Um crédito por minuto iniciado da gravação original, ou seja, um arquivo de 90 segundos custa 2 créditos. A estimativa aparece no botão de envio antes de começar, e nada é cobrado se a transcrição falhar.
Depende da gravação. Fala clara, uma pessoa por vez e pouco ruído de fundo produzem os melhores resultados. O ponto fraco costuma ser nome próprio, marca e termo técnico — e é exatamente para isso que existe o vocabulário de referência.