Uma transcrição de entrevista é o registro escrito de uma conversa em que cada turno é atribuído a um falante identificado. Para ser útil, ela precisa de um cabeçalho com data e participantes, falas identificadas com marcações de tempo e colchetes para indicar o que não é fala.
A definição é simples. O que os guias raramente mostram é o resultado de uma gravação real, com as pequenas imperfeições que ela produz. Muitos exemplos disponíveis online foram escritos para ilustrar regras, não transcritos de um áudio. Por isso parecem impecáveis.
Este guia usa um exemplo real. É uma entrevista de história oral gravada em 5 de janeiro de 1985 com Sally Stapp, que completaria 80 anos naquele ano, pela Sausalito Historical Society. A gravação está em domínio público, sem restrições de uso. Enviamos os primeiros cinco minutos ao nosso sistema com a identificação de falantes ativada. Abaixo está o resultado sem edição.
Um exemplo real de entrevista transcrita
Ouça primeiro. São 36 segundos, e o texto abaixo é exatamente o que nosso sistema gerou para esse arquivo. Você pode conferir cada linha com o áudio. Mantivemos as falas em inglês para permitir essa comparação direta.
Este é o resultado bruto, sem correções nem ajustes:
```
[00:02] SPEAKER_01: Now it's working.
[00:04] SPEAKER_01: Now it's working.
[00:05] SPEAKER_01: This is Sally Stapp and it is January 5th, 1985.
[00:10] SPEAKER_00: I don't know how to run this any better than I know.
[00:12] SPEAKER_01: Okay.
[00:13] SPEAKER_01: Sally, first thing I want to ask is when you when you came to Sausalito?
[00:18] SPEAKER_00: Right after World War II.
[00:20] SPEAKER_01: Where had you been before?
[00:23] SPEAKER_00: Naval Air Station, San Diego, for the duration.
[00:29] SPEAKER_01: Where are you from?
[00:31] SPEAKER_00: I was born in Cleveland, Ohio.
[00:32] SPEAKER_01: Cleveland, Ohio.
[00:33] SPEAKER_00: April 30th, 1905.
```
Quatro detalhes dessas 13 linhas ensinam mais que uma página de recomendações. Como o áudio está disponível, você não precisa apenas confiar na descrição.
“Now it's working” aparece duas vezes. Não é um erro da transcrição: a repetição está na fita. Alguém está mexendo em um gravador que acaba de funcionar e repete a frase. Uma entrevista real pode começar com ajustes no equipamento, não com a primeira pergunta.
O sistema fornece números, não nomes. `SPEAKER_00` e `SPEAKER_01` são os rótulos da identificação de falantes. O sistema consegue distinguir duas vozes e manter essa distinção ao longo da gravação, mas não sabe qual delas é Sally. Atribuir os nomes é uma etapa humana que leva poucos segundos: localize a primeira identificação e renomeie os falantes em toda a transcrição.
“when you when you” não é um erro de transcrição. O entrevistador recomeça a pergunta, e o sistema registra as duas tentativas porque isso faz parte de uma transcrição literal. Ouça 00:13 para conferir. É nesse ponto que a escolha de estilo vira uma decisão concreta: a versão literal mantém a repetição; a limpa remove um dos “when you”. Eliminar a repetição sem avisar e chamar o resultado de literal não representa fielmente a gravação.
Uma atribuição de fala é duvidosa. Em 00:10, *“I don't know how to run this any better than I know”* foi atribuída a `SPEAKER_00`, a participante, mas a frase parece vir de quem ainda está ajustando o gravador. É exatamente o tipo de trecho que precisa ser conferido antes de virar citação. Erros de atribuição tendem a aparecer no início, quando ainda há pouco áudio de cada voz, e perto de interrupções.
Veja o mesmo trecho após a revisão: falantes identificados, repetição sinalizada em vez de apagada, atribuição incerta marcada e um cabeçalho adequado. As falas continuam no idioma da gravação.
```
TRANSCRIÇÃO DE ENTREVISTA
Projeto: Programa de história oral da Sausalito Historical Society
Data: 5 de janeiro de 1985
Local: Sausalito, Califórnia
Participante: Sally Stapp (nascida em 30 de abril de 1905)
Entrevistador: Sausalito Historical Society
Gravação: Lado A, 31 min 36 s (trecho: 00:00–00:35)
Estilo: Literal
Fonte: California Revealed / Internet Archive, domínio público
[00:02] ENTREVISTADOR: Now it's working. [repetido na fita] This is Sally
Stapp and it is January 5th, 1985.
[00:10] NÃO IDENTIFICADO: I don't know how to run this any better than I know.
[atribuição incerta — conferir no áudio]
[00:13] ENTREVISTADOR: Sally, first thing I want to ask is when you when
you came to Sausalito?
[00:18] STAPP: Right after World War II.
[00:20] ENTREVISTADOR: Where had you been before?
[00:23] STAPP: Naval Air Station, San Diego, for the duration.
[00:29] ENTREVISTADOR: Where are you from?
[00:31] STAPP: I was born in Cleveland, Ohio. April 30th, 1905.
```
Observe o que mudou e o que permaneceu. As palavras das falas não foram corrigidas. A repetição foi indicada, não removida sem explicação. As duas linhas consecutivas de Sally foram reunidas em um turno, porque pertencem à mesma fala, que o sistema havia separado em uma pausa. A linha duvidosa foi marcada, em vez de atribuída à pessoa que parecia mais provável.
Essa revisão explica por que uma transcrição de entrevista não é simplesmente o arquivo gerado por uma ferramenta.
O que uma transcrição de entrevista é — e o que não é
Uma transcrição registra o que foi dito, na ordem em que foi dito. Não é uma anotação, um resumo nem uma ata.
A distinção é especialmente importante em pesquisa, jornalismo e contextos jurídicos ou de RH, porque o texto pode ser usado para conferir o que realmente aconteceu. Se a transcrição diverge da gravação, os materiais derivados também ficam comprometidos. Por isso, “ir limpando enquanto transcreve” não é uma boa regra para a primeira versão: primeiro produza um registro fiel, depois prepare o material de que precisa.
Os três estilos de transcrição
Os guias costumam distinguir os mesmos três estilos. Escolher o errado pode desperdiçar tempo ou eliminar dados relevantes.
| Estilo | O que preserva | Quando usar | Limitação |
|---|---|---|---|
| Literal | Todas as palavras, hesitações, falsos começos, repetições e pausas; indicações de [risos], [suspiros] e [pausa] | Análise da conversação, análise do discurso, contexto jurídico e situações em que importa como algo foi dito | Mais demorada de produzir e mais difícil de ler |
| Limpa / literal inteligente | Todo o conteúdo substantivo; remove hesitações e inícios de frase abandonados e corrige pequenos problemas gramaticais | Análise temática, boa parte da pesquisa qualitativa, jornalismo e podcasts | Exige julgamento sobre o que faz parte do conteúdo |
| Editada | O conteúdo central; elimina conversas paralelas e trechos fora do assunto | Publicação, relatórios internos e estudos de caso de marketing | Não é mais um registro completo e não deve ser a única cópia |
A regra prática é: escolha antes de começar e informe no cabeçalho. Sem saber o estilo, o leitor não consegue distinguir uma fala fluente de uma transcrição que removeu as hesitações.
Quantas hesitações aparecem de verdade?
A discussão entre transcrição literal e limpa costuma ocorrer sem dados. Medimos expressões de hesitação em 934 gravações em inglês com dois falantes, um formato semelhante ao de entrevistas de pesquisa, nos nossos dados de produção:
| Expressão em inglês | Média por 1.000 palavras | Em uma entrevista de 4.620 palavras |
|---|---|---|
| um | 2,16 | ≈ 10 |
| uh | 0,92 | ≈ 4 |
| you know | 5,20 | ≈ 24 |
| like | 17,40 | ≈ 80 |
Duas ressalvas importantes: a contagem de “like” não mede apenas vícios de linguagem. Os 17,4 incluem os usos comuns da palavra, que não foram separados. Além disso, são médias entre gravações. A distribuição varia muito entre falantes, e uma única pessoa nervosa pode superar várias vezes a média.
A conclusão útil é que limpar as hesitações de uma entrevista típica remove algo como 40 ocorrências de um texto de aproximadamente 4.500 palavras. A leitura melhora, mas o documento não fica drasticamente menor. Economizar espaço, portanto, não é uma boa razão para escolher a versão limpa. Escolha-a quando sua análise não depender das hesitações. Se elas puderem ser relevantes, mantenha a versão literal.
Formato da transcrição: os três blocos
1. O cabeçalho
Antes do texto, inclua tudo o que um leitor futuro precisa para interpretá-lo:
```
Projeto: [nome do estudo ou programa]
Data: [data da entrevista]
Local: [local ou "remota — Zoom"]
Participante: [nome ou pseudônimo e detalhes relevantes]
Entrevistador: [nome ou iniciais]
Gravação: [nome do arquivo e duração total]
Estilo: [literal / limpa / editada]
Anonimizada: [sim / não]
Consentimento: [referência ao termo de consentimento assinado]
```
Os dois campos mais esquecidos são Estilo e Anonimizada. Sem o primeiro, ninguém sabe se a fluência veio da pessoa ou da edição. Sem o segundo, um leitor seis meses depois não sabe se “Maria” é um nome real.
2. O corpo
As regras mais importantes, começando pelas que mais costumam ser descumpridas:
1. Um falante por parágrafo, sempre. Nunca reúna duas pessoas no mesmo bloco, mesmo que a resposta tenha uma palavra. Esse erro dificulta ou inviabiliza o uso de citações.
2. Rótulo consistente seguido de dois-pontos. Use `ENTREVISTADOR:` e `STAPP:`, ou `E:` e `P1:`. Escolha um padrão e mantenha-o. Programas de análise podem usar esses rótulos para separar as falas.
3. Marcações de tempo em intervalos úteis. Em entrevistas curtas, use cada troca de falante. Nas longas, 30 a 60 segundos costumam bastar. A marcação serve para voltar ao áudio; inserir uma a cada três segundos só polui o texto.
4. Colchetes para o que não é fala. Exemplos: `[risos]`, `[pausa]`, `[telefone toca]`, `[falas sobrepostas]`, `[inaudível 00:14:22]`. Inclua o tempo na indicação de trecho inaudível para poder revisá-lo.
5. Sinalize a dúvida em vez de adivinhar. `[incerto: Kessler?]` é honesto e útil. Uma palavra errada apresentada com certeza não é.
3. Numeração de linhas para pesquisa
Se a transcrição será citada, numere as linhas. Uma referência como “P4, linhas 212–218” só funciona se a numeração for estável. Adicione-a depois da revisão final: renumerar a cada correção pode separar a referência do trecho a que ela deveria apontar.
Organização visual: o que os dados sugerem
As recomendações de apresentação costumam ser estéticas, mas algumas podem ser fundamentadas em dados.
Em 1.248 gravações com dois falantes e pelo menos cinco minutos, a duração mediana foi de 29,9 minutos. Nas 1.030 gravações em que foi possível medir o tempo por pessoa, quem mais falou concentrou uma mediana de 72,4% do tempo de fala. No percentil 90, essa participação chegou a 88,7%.
Isso tem duas consequências práticas.
Sua transcrição terá blocos desiguais, e tudo bem. Em uma entrevista, é comum que o participante fale cerca de três vezes mais que o entrevistador. Se o texto ficou próximo de 50/50, isso diz algo sobre a conversa, não necessariamente sobre a formatação. No trecho de cinco minutos do exemplo em domínio público, a participante concentra 85,8% das falas, contra 14,2% do entrevistador. É uma distribuição compatível com a história oral, em que quem entrevista procura dar espaço à pessoa entrevistada.
Os trechos são curtos e numerosos. A entrevista mediana dos nossos dados tem 391 segmentos. Parágrafos longos e sem quebras geralmente são resultado da formatação, não uma característica natural da fala. Eles também tornam a codificação mais cansativa. Divida em pausas naturais e evite que uma única resposta ocupe uma página inteira sem respiro.
Como digitar a transcrição de uma entrevista
Se você vai transcrever manualmente, este fluxo reduz o retrabalho:
1. Ajuste a reprodução para cerca de 75% da velocidade, em um reprodutor com atalhos de teclado. Para muita gente, isso permite digitar com mais precisão do que tentar acompanhar a velocidade normal e voltar o tempo todo.
2. Configure um pedal ou atalho para voltar cinco segundos. Alcançar o mouse repetidamente é uma das maiores perdas de tempo na transcrição manual.
3. Primeira passagem: registre as palavras. Não formate, não pesquise nomes e não interrompa o fluxo para consultar informações. Marque `[?]` e continue.
4. Segunda passagem: resolva os marcadores `[?]`, nomes, números e termos técnicos, conferindo com o áudio.
5. Terceira passagem: formate. Adicione cabeçalho, rótulos, marcações de tempo e números de linha.
Reserve de quatro a seis horas por hora de áudio para uma transcrição literal cuidadosa. Para a entrevista mediana de 29,9 minutos, isso representa de duas a três horas.
O caminho mais rápido e onde o tempo é gasto
A transcrição automática não elimina o trabalho; ela muda sua distribuição. O sistema produz o texto rapidamente, e você dedica seu tempo à revisão, a parte que sempre teve mais valor.
Medimos o tempo total de 962 gravações concluídas com dois falantes: a mediana entre envio e transcrição pronta foi de 5,5 minutos, aproximadamente 6,5 vezes mais rápido que a duração do áudio. Nove em cada dez ficaram prontas em até 45,5 minutos. Segundo esse levantamento, os casos mais demorados se concentraram no envio de vídeos grandes, e não apenas no processamento.
Em uma entrevista de pesquisa de 30 minutos, portanto, você recebe em poucos minutos um texto com falantes e marcações de tempo e depois faz a revisão. A revisão não deve ser apressada: é nela que você confere a precisão.
Na prática:
1. Envie a gravação com a identificação de falantes ativada.
2. Renomeie `Falante 1` e `Falante 2` com os nomes do entrevistador e do participante. A alteração vale para toda a transcrição.
3. Leia acompanhando o áudio e corrija nomes, números, termos técnicos e sobreposições.
4. Aplique o estilo escolhido: mantenha a versão literal ou remova as hesitações.
5. Exporte em DOCX para editar, TXT para o programa de análise ou PDF para arquivar.
Transcrições de entrevista na pesquisa qualitativa
A transcrição de pesquisa tem exigências que nem sempre aparecem no trabalho jornalístico.
Anonimize de forma consistente. Substitua o nome do participante e também empregadores, colegas, instituições e locais que permitam identificá-lo. Use os mesmos pseudônimos ou códigos do início ao fim, guarde a correspondência em um arquivo separado com acesso controlado e registre a anonimização no cabeçalho. Um erro comum é colocar um pseudônimo no início e manter o empregador real no nono parágrafo.
Mantenha as perguntas completas. Uma pergunta indutiva só fica visível quando sua formulação é preservada. Muitas respostas também perdem o sentido sem a pergunta exata. Como o entrevistador ocupa cerca de 28% do tempo de fala, manter as perguntas acrescenta relativamente pouco texto e preserva a evidência de como as respostas surgiram.
Decida sobre hesitações antes de codificar. Trocar do estilo literal para o limpo no meio do conjunto de entrevistas prejudica a comparação. Uma aparente diferença de hesitação pode ser apenas o efeito da mudança no critério de transcrição.
Confira o formato de importação do programa. ATLAS.ti, NVivo e MAXQDA aceitam DOCX e texto simples. Uma cópia principal em TXT evita problemas de formatação e tem boas chances de continuar acessível no futuro.
Erros comuns
Experimente com a sua entrevista
A transcrição mostrada no início levou cerca de 80 segundos de processamento para um trecho de cinco minutos, com identificação de falantes ativada. Você pode testar sua própria gravação: a prévia dos primeiros cinco minutos é gratuita, sem precisar criar uma conta. Assim, avalia o resultado no seu áudio, não apenas na demonstração escolhida por nós.
Envie áudio ou vídeo, use a detecção de idioma, revise os falantes e escolha um formato de exportação. Identificação de falantes, transcrição completa e formatos como DOCX, PDF, SRT e VTT dependem do plano.
Se quiser ouvir o áudio antes de escolher um formato, veja três exemplos de transcrição que você pode ouvir: reunião, entrevista e mensagem de voz, com taxa de erro medida em relação a uma referência publicada. Se a entrevista foi gravada em vídeo, o guia de MP4 para transcrição explica o que muda. Para melhorar a gravação antes de apertar o botão, leia 10 dicas baseadas em mais de 10 mil entrevistas.
---
*Trecho: “Oral Interview w. Sally Stapp”, Sausalito Historical Society, 5 de janeiro de 1985, disponibilizado por California Revealed e Internet Archive (casauhs_000095). Public Domain Mark 1.0, sem restrições de uso. Transcrito em 2 de agosto de 2026 a partir dos primeiros cinco minutos do lado A, com identificação de falantes ativada. O primeiro trecho de transcrição foi mantido sem edição. Os dados agregados são do ambiente de produção do TranscribeNext, de 9 de outubro de 2025 a 31 de julho de 2026.*