Um exemplo de transcrição de áudio em texto mostra como a fala fica no papel: marcações de tempo à esquerda, um bloco para cada vez que alguém fala e identificação do falante sempre que a voz muda. Os dois estilos mais comuns são a transcrição literal editada, que remove vícios de linguagem, e a transcrição literal integral, que preserva cada “hã” e cada início de frase abandonado.
Até aí, todos os guias concordam. O que quase nenhum faz é deixar você ouvir o áudio que deu origem ao exemplo.
Isso importa mais do que parece. Uma transcrição de uma gravação clara em estúdio e outra de quatro pessoas ao redor de uma mesa, com um único microfone no centro, são muito diferentes. Só uma delas talvez se pareça com o arquivo que você tem. Por isso, reunimos três gravações reais: uma reunião, uma entrevista e uma mensagem de correio de voz. Cada uma vem com a transcrição produzida pelo nosso sistema, acompanhando a reprodução palavra por palavra. Nada foi redigitado ou corrigido.
Na reunião, o corpus de origem disponibiliza uma transcrição humana de referência. Por isso, a última seção compara nosso resultado com ela e apresenta a taxa exata de erro. Os áudios e suas transcrições permanecem no inglês original para que você possa conferir a correspondência.
Exemplo 1: uma reunião, três falantes e um microfone distante
Pressione reproduzir. O destaque acompanha a palavra falada, e a identificação muda quando a voz muda.
Escolhemos um caso difícil de propósito. O microfone não está na lapela de ninguém: fica no centro da mesa, captando todas as pessoas à distância e também o som da sala. Três pessoas conversam e se interrompem.
Observe estes pontos, porque eles mostram como uma transcrição de reunião real pode ficar:
Esse último ponto é uma limitação real dos sistemas automáticos em gravações feitas com microfone distante. A seção sobre precisão abaixo quantifica o problema.
Exemplo 2: uma entrevista com microfone próximo
O sistema é o mesmo, mas a experiência de leitura é completamente diferente. Uma pessoa fala de cada vez, o microfone está próximo e não há vozes sobrepostas. As frases aparecem completas, a pontuação acompanha as pausas e não há falas para desembaraçar.
Ao comparar com a reunião anterior, fica clara a informação mais útil sobre precisão: a gravação determina a transcrição. Um microfone de lapela ou um headset costuma melhorar o resultado mais do que qualquer ajuste de software.
Exemplo 3: uma mensagem de correio de voz, um falante e dezesseis segundos
Um áudio curto com uma pessoa falando é o caso mais simples. Ele também mostra o formato mais básico de transcrição: sem identificação de falantes, já que há uma única voz, e com marcações de tempo apenas no início de cada grupo de frases.
Para a maioria dos arquivos do dia a dia, como gravações de voz, aulas ou notas ditadas, é isso que uma transcrição apresenta: uma coluna de tempos e outra de texto.
Transcrição literal editada e transcrição literal integral
Os dois estilos representam o mesmo áudio. A diferença está no que cada um remove.
A transcrição literal integral preserva tudo o que a pessoa disse, inclusive as partes que ela talvez não quisesse ver citadas. Este exemplo permanece no inglês da gravação:
```
0:08 I had to figure out how to how to do the same thing for the
summary, that's how I see it.
```
A repetição “how to how to” não é um erro de transcrição. A pessoa realmente repetiu essas palavras.
A transcrição literal editada remove repetições, vícios de linguagem e inícios de frase abandonados, sem alterar o restante:
```
0:08 I had to figure out how to do the same thing for the summary.
```
A escolha depende da finalidade do texto:
| Uso | Estilo | Motivo || --- | --- | --- || Pesquisa qualitativa, contextos jurídicos e médicos | Literal integral | Hesitações e repetições também são dados || Anotações de reunião e registros internos | Literal editada | Em geral, os tropeços de fala não ajudam a leitura || Publicação, legendas e marketing | Literal editada, seguida de revisão | A legibilidade tem prioridade || Pesquisa de linguagem e fala | Literal integral, com marcações não verbais | Inclui `[pausa]`, `[risos]` e `[inaudível]` |Uma boa regra é fazer a transcrição integral e depois limpar uma cópia. Passar da versão integral para a editada leva poucos minutos. Fazer o caminho inverso exige ouvir toda a gravação novamente.
O formato com vários falantes
Quando mais de uma pessoa fala, a transcrição precisa indicar quem está falando. O padrão é um bloco por intervenção, com a identificação à esquerda ou acima. O exemplo abaixo preserva as falas originais em inglês:
```
Speaker 1 So did you have to write it in the way that they wrote it,
is that what you did?
Speaker 2 Yeah, just search for specific string.
Speaker 1 Fish the data, I was just thinking that, yeah.
```
Três convenções úteis, todas visíveis no exemplo da reunião:
1. Nunca junte dois falantes no mesmo bloco. Um parágrafo com duas vozes dificulta a citação, a codificação em pesquisa e a busca.
2. Identifique quando a voz mudar, não em todas as linhas. Repetir “Falante 1” em seis linhas seguidas torna a leitura cansativa.
3. Renomeie as identificações uma única vez, no final. Sistemas automáticos usam nomes genéricos como `Speaker 1` e `Speaker 2`. Substituí-los pelos nomes reais leva poucos minutos e deve ser feito depois que o texto estiver revisado.
Como é a transcrição de um vídeo
A transcrição de vídeo é feita a partir do áudio: a imagem não acrescenta informações ao texto transcrito. A principal diferença está no uso posterior das marcações de tempo:
Um mesmo arquivo pode gerar os dois resultados. Por isso, exportar em SRT é uma mudança de formato, não uma nova transcrição. Se você precisa de legendas, transcreva primeiro e ajuste a divisão dos blocos depois.
A precisão que quase ninguém publica
É aqui que muitas páginas de exemplos deixam de ajudar. A SpeakWrite afirma ter “99%–100% de precisão”. A TranscribeMe afirma “99%+”. Nenhuma delas publica o áudio que deu origem a esses números nem a transcrição de referência usada na avaliação. Assim, não é possível verificar os resultados nem compará-los entre si.
A reunião acima pode ser conferida porque o corpus AMI inclui uma transcrição humana de referência. Veja a comparação para o trecho de 48 segundos:
| | Referência humana | Nossa transcrição || --- | --- | --- || Palavras | 208 | 163 || Intervenções/segmentos | 20 | 10 || Falantes | 3 | 2 || Reações curtas, como “okay”, “right” e “mm-hmm” | 7 | 2 |Taxa de erro por palavra neste trecho: 30,8%, com 41 substituições, 17 omissões e 6 inserções.
Ao longo da reunião completa de 35 minutos, há 17 janelas comparáveis de 45 segundos. A mediana da taxa de erro entre elas é de 36,8%; a melhor janela apresenta 15,5%.
Esse número revela três coisas — e não permite concluir uma quarta.
Ele mostra que reuniões gravadas com microfone distante são difíceis de transcrever. Um microfone no centro da mesa, três pessoas e falas sobrepostas formam um dos cenários realistas mais difíceis. É por isso que o resultado está tão longe de “99%”.
Ele mostra onde os erros se concentram. Veja a linha dos falantes: havia três vozes na sala, mas apenas duas foram identificadas. A terceira pessoa quase nunca fala uma frase inteira; faz reações como “okay”, “yeah” e “mm-hmm”. Cinco das sete reações curtas do trecho foram completamente omitidas. Os erros não se distribuem de forma uniforme: concentram-se nas intervenções curtas e nas vozes mais baixas.
Ele mostra o que melhorar primeiro. Nesse áudio, nenhum ajuste de software elimina uma diferença de 30%. Um microfone para cada pessoa pode fazer muito mais.
Ele não mostra qual será o resultado do seu arquivo. Ouça a entrevista do segundo exemplo: o sistema é o mesmo, o microfone está próximo e a transcrição flui como um texto. Esse é o caso habitual. A reunião é um teste de dificuldade elevada.
Como transcrever seu próprio áudio
1. Grave o mais perto possível da boca. Um microfone de lapela de £20 pode ajudar mais do que qualquer configuração de software.
2. Informe o idioma do arquivo, se você souber, em vez de deixar a detecção se basear nos primeiros segundos.
3. Ative a identificação de falantes quando houver mais de uma voz, antes de transcrever.
4. Escolha o estilo de transcrição desde o início: integral se as hesitações importarem; editada se não importarem.
5. Confira o primeiro minuto acompanhando o áudio. Nomes, jargões e siglas concentram erros e merecem revisão manual.
Você pode transcrever áudio em texto ou converter MP4 em transcrição diretamente, com identificação de falantes e marcações de tempo, e exportar em SRT quando precisar de legendas.
Perguntas frequentes
Como é uma transcrição de áudio?
Uma coluna de marcações de tempo e outra de texto, com um bloco por intervenção e uma identificação sempre que a voz muda. Áudios com uma só pessoa dispensam essa identificação; com várias pessoas, ela é mantida.
Qual é a diferença entre transcrição literal editada e integral?
A integral preserva cada palavra falada, incluindo hesitações, repetições e inícios de frase abandonados. A editada remove esses elementos sem alterar o restante. Pesquisas e trabalhos jurídicos geralmente exigem a versão integral; anotações de reunião quase nunca precisam dela.
Qual é a precisão da transcrição automática?
Ela depende muito mais da gravação do que do software. Na reunião com microfone distante acima, a taxa de erro em relação à referência humana publicada é de 30,8%. Em falas gravadas com microfone próximo, como a entrevista, o texto fica mais claro, com erros ocasionais em nomes e jargões. Trate como marketing qualquer taxa isolada de precisão apresentada sem o áudio usado para medi-la.
As transcrições incluem os nomes dos falantes?
Sistemas automáticos usam identificações genéricas, como `Speaker 1` e `Speaker 2`, porque o áudio, por si só, não informa quem é cada pessoa. A troca pelos nomes reais é uma etapa manual, preferencialmente feita ao final da revisão.
Posso obter a transcrição de um vídeo?
Sim. Como apenas a faixa de áudio é usada, o processo é o mesmo da transcrição de áudio. O mesmo arquivo também pode ser exportado como legendas.