TranscribeNextTranscribeNext.com
BlogGuia prático

Como transcrever gravações de voz

🎧

Equipe TranscribeNext

12 min de leitura
gravações de vozgravação de voz em textoáudio em textotranscriçãoiPhoneMacIA

O Gravador da Apple transcreve diretamente no iPhone 12 ou posterior com iOS 18 e em Macs com Apple Silicon e macOS Sequoia. Se o dispositivo ou o idioma não for compatível, o recurso não aparece. Nesse caso, compartilhe a gravação como arquivo e envie a uma ferramenta de transcrição.

Grátis

Este guia explica os dois caminhos e os requisitos de cada dispositivo. Você também pode ouvir uma gravação real, ler a transcrição sem edição e conferir um teste: comprimir o áudio antes de enviar muda o texto reconhecido?

Transcrição de gravações de voz em resumo

Recurso integrado no iPhoneiPhone 12 ou posterior, iOS 18
Recurso integrado no MacmacOS Sequoia e Apple Silicon; Macs Intel não são compatíveis
Idiomas do recurso integradoCerca de dez; não disponível em todos os países ou regiões
Se o dispositivo não for compatívelCompartilhe e envie o arquivo: não há requisito específico de hardware
Formatos comuns.m4a no iPhone; .m4a, .mp3, .amr ou .3gp no Android
Conversão préviaNão é necessária; a recompressão pode prejudicar o resultado. Veja o teste
Uso gratuitoPrimeiros 5 minutos sem conta; com conta Free, 3 arquivos de até 50 MB por dia
Velocidade0,13× a duração do áudio medido na nuvem; de 0,3 a 5× divulgado para Whisper local

Ouça uma gravação real e acompanhe a transcrição

Dê o play. É uma gravação real em inglês: alguém pensando em voz alta, não lendo um roteiro. A transcrição abaixo do player é o resultado sem edição do nosso processamento desse mesmo arquivo. Clique em qualquer linha para ir ao trecho correspondente.

Ouça uma gravação de voz real e acompanhe a transcrição
Gravação de domínio público · 0:51 · transcrição sem edição
0:00 / 0:50
Fonte: “Timelapse Excess”, da biblioteca Voice Notes de David Blue, publicada em domínio público no archive.org com Public Domain Mark; o repositório do autor também inclui uma declaração Unlicense de dedicação ao domínio público. Recodificamos o arquivo em mono a 48 kbps para a web; o original incluía uma imagem de capa de 4008×4008 e era dez vezes maior. A transcrição é o resultado sem edição do processamento deste exato arquivo. Os tempos das linhas foram medidos; o destaque por palavra é interpolado dentro de cada linha. O áudio e a transcrição original estão em inglês.

O exemplo está aqui porque tem *a espontaneidade e as hesitações de uma gravação de verdade*. A pessoa começa com “Okay, so…” — “Certo, então…” —, interrompe o raciocínio com “I mean, I'm sure the vast majority of people don't use the feature” — “Quer dizer, tenho certeza de que a grande maioria não usa o recurso” — e repete a ideia enquanto encontra o fim da frase: “What a ridiculous idea. What a ridiculous thing to include in the camera app.”

Isso mostra o que uma transcrição realmente entrega: texto fiel, pontuado e pesquisável, mas ainda não são anotações organizadas. Para chegar a elas, há uma segunda etapa.

O Gravador transcreve? Os requisitos que nem sempre ficam claros

Sim, mas dizer que “qualquer celular moderno faz isso automaticamente” não é correto. Essa diferença surpreende muita gente. Os requisitos são:

Dispositivo ou condiçãoRequisitoQuando não há suporte
iPhoneiPhone 12 ou posterior com iOS 18iPhone 11 e anteriores não transcrevem pelo recurso integrado, independentemente do iOS
MacmacOS Sequoia e Apple SiliconMacs Intel não têm o recurso, independentemente do macOS
IdiomaCerca de dez, incluindo português, inglês, espanhol, francês, alemão, italiano, japonês, coreano e chinêsIdiomas não compatíveis não são transcritos
RegiãoA Apple informa que não está disponível em todos os países ou regiõesO recurso pode não aparecer mesmo em hardware compatível
AndroidNão há um único equivalente integrado em todos os aparelhosDepende do aplicativo de gravação

O requisito do Mac é o que mais surpreende e vem da documentação da Apple: é preciso ter macOS Sequoia e um Mac com Apple Silicon. Um Mac Intel com o sistema mais recente compatível continua sem transcrição. Não há uma opção escondida para ativar nem um defeito para corrigir: o recurso não está disponível.

Se você não atende a algum requisito, use o envio do arquivo. Esse caminho funciona também no Android e no Windows, não exige hardware específico e oferece muito mais idiomas.

Como obter a transcrição no Gravador

Em um dispositivo compatível, é o caminho mais rápido: a gravação já está no lugar certo.

1. Abra o Gravador e selecione a gravação.

2. Toque no ícone de transcrição abaixo da forma de onda. No iPhone, deslize para cima nessa área para vê-lo.

3. Leia a transcrição e copie o texto para onde precisar.

Antes de depender do recurso, considere dois limites. A opção integrada entrega texto, sem identificação de falantes nem exportação para documentos ou arquivos de legenda. Além disso, você não pode forçar a escolha de outro idioma: uma gravação em idioma não compatível ou que muda de idioma no meio pode resultar em uma transcrição parcial.

Para reler um lembrete curto, pode bastar. Para uma entrevista, palestra ou gravação em que você precisa localizar citações pelo tempo, uma ferramenta mais completa é mais adequada.

Como transcrever uma gravação que o aplicativo não transcreve

Enviar o arquivo elimina os requisitos específicos anteriores: não é preciso um modelo mínimo de iPhone, uma versão de macOS ou Apple Silicon. Os modelos Whisper oferecem 99 idiomas, em vez de cerca de dez.

1. Obtenha o arquivo. No Gravador, selecione a gravação, toque em Compartilhar e salve em Arquivos. Você terá um `.m4a`. No Android, exporte ou compartilhe pelo aplicativo; o arquivo pode ser `.m4a`, `.mp3`, `.amr` ou `.3gp`.

2. Envie o original. Arraste-o para o formulário no início da página ou para a ferramenta completa de transcrição. Não converta antes: a próxima seção mostra por quê com dados medidos.

3. Defina o idioma, se souber qual é. A detecção automática funciona bem com fala clara em um idioma comum. A seleção manual ajuda em gravações curtas, com sotaques fortes ou ruído.

4. Revise e exporte. Confira nomes e números. Baixe em TXT, Markdown ou JSON ou, nos planos pagos, em DOCX, PDF, SRT ou VTT.

Sobre AMR e 3GP: gravadores Android usam esses formatos há anos. Alguns serviços os recusam e pedem uma conversão prévia para MP3. Aceitamos `.amr`, `.amr-wb`, `.3gp` e `.3g2` diretamente, além de outras 23 extensões. Você não precisa acrescentar uma etapa de conversão.

Não recomprima antes de enviar: medimos a diferença

A recomendação de “converter a gravação para MP3 antes de enviar” não é apenas desnecessária. Testamos o efeito dessa recodificação.

Usamos o áudio de 51 segundos da demonstração e criamos três versões: o original a 320 kbit/s, uma cópia a 96 kbit/s e outra a 48 kbit/s. Todas passaram pelo mesmo mecanismo e pelas mesmas configurações. Os trechos abaixo permanecem em inglês para mostrar exatamente o que foi reconhecido, sem traduzir os erros do modelo.

Início do segmento320 kbit/s, original96 kbit/s48 kbit/s
9 dos 12 segmentos ficaram idênticos nas três versões
0:30…you leave it.…you leave it.…you leave it somewhere.
0:33So I'm like, can't move it…So I'm going to can't move it…Can't move it. Can't use it…
0:38That's insane.It's insane.That's insane.

Há três conclusões, e só a primeira é óbvia.

A compressão não piora a transcrição por igual. Mesmo com uma diferença de 6,7 vezes na taxa de bits, três quartos do texto ficaram idênticos, caractere por caractere. A qualidade não cai de forma uniforme.

As diferenças se concentram onde a fala já era pouco clara. Os três segmentos divergentes ficam nos mesmos oito segundos, de 0:30 a 0:38, justamente quando a pessoa abandona uma frase e recomeça. O restante não mudou.

Cada taxa de bits interpreta as hesitações de um jeito. A versão a 96 kbit/s produziu “So I'm going to can't move it”, uma frase incoerente em inglês; a de 48 kbit/s eliminou o começo interrompido. A recodificação não acrescenta um erro previsível: muda o resultado de forma imprevisível nos trechos ambíguos.

Portanto, envie o arquivo que o celular gravou. Na revisão, dê atenção aos pontos em que você sabe que falou de forma pouco clara. Foram esses os trechos que variaram, e sua memória do que quis dizer ajuda a conferir o áudio.

Quanto demora: nuvem ou computador?

Os dois caminhos funcionam, mas os tempos podem diferir por uma ordem de grandeza. Recomendações de processamento local por privacidade nem sempre explicam esse custo de tempo.

MétodoTempo em relação ao áudioGravação de 1 minutoGravação de 1 hora
Nosso processamento na nuvem0,13×, medidoCerca de 8 segundosCerca de 8 minutos
Audacity + OpenVINO, modelo baseCerca de 0,3×, publicadoCerca de 18 segundosCerca de 18 minutos
Audacity + OpenVINO, large-v3Cerca de 3 a 5×, publicadoDe 3 a 5 minutosDe 3 a 5 horas

O valor de 0,13× é o tempo medido do mecanismo na demonstração: 6,65 segundos para 51,12 segundos de áudio. Os multiplicadores do Audacity são publicados pelo próprio projeto para os tamanhos de modelo do plugin. A coluna de uma hora é uma projeção aritmética, não uma medição. Arquivos reais variam. O tempo na nuvem também exclui o envio, que pode demorar mais que a transcrição em uma gravação longa enviada por dados móveis.

A conclusão é simples: transcrição local pode ser gratuita e preservar a privacidade, mas o modelo maior pode exigir várias horas. Escolha esse caminho quando a confidencialidade justificar, não automaticamente em qualquer situação.

Transcrição gratuita e offline

Se a gravação é confidencial — uma conversa com cliente, uma nota médica ou um assunto jurídico — o principal motivo para processar localmente não é o preço: é manter o áudio no computador.

O Audacity é uma opção gratuita. O efeito OpenVINO Whisper executa o modelo Whisper da OpenAI localmente, com opções para Windows, macOS e Linux, sem assinatura, marca-d'água ou limite de minutos. Há cinco tamanhos de modelo, de `base` a `large-v3`, além de uma variante com separação de falantes e suporte aos 99 idiomas do Whisper. O custo está na configuração e no tempo: instalar o plugin, baixar o modelo e aguardar o processamento descrito na tabela.

O TranscribeNext para Mac oferece esse fluxo sem combinar várias ferramentas: arraste a gravação para o aplicativo, transcreva no Mac com Apple Silicon, adicione identificação de falantes e exporte no formato desejado. A nuvem só é usada se você a escolher explicitamente.

O princípio é o mesmo: se a gravação é sensível e não deve sair do computador, não a envie a nenhum serviço, nem mesmo ao nosso.

Comparação de ferramentas gratuitas na web

Os dados foram publicados pelos fornecedores e verificados em julho de 2026. Eles podem mudar; confirme antes de depender deles.

FerramentaUso gratuitoLimite por arquivoAMR/3GPDemonstração com áudio
TranscribeNextPrimeiros 5 minutos sem conta; 3 arquivos por dia com conta Free50 MB no Free · 2 GB no Plus · 5 GB no PremiumSim, diretamenteSim, nesta página
Happy ScribePrimeiros 10 minutosMais de 45 formatosNão publicadoNão
AudioScribeAté 5 minutos sem cadastro100 MBInforma que não aceita AMRNão
TalkNotes1 minuto sem conta5 MBNão publicadoNão
NoteGPTPlano gratuito; lotes de 20 arquivos5 GBNão publicadoNão
Audacity, offlineGratuito, sem limite de minutosSem limite definido pelo serviçoDepende dos decodificadores da versão instaladaNão

Duas observações. Os 10 minutos gratuitos do Happy Scribe são uma oferta generosa entre essas opções no navegador. O serviço anuncia “até 96% em áudio claro”, mas dados de fornecedores são medidos nos áudios deles e não são diretamente comparáveis. Por isso, incluímos uma gravação que você pode conferir e um teste reproduzível.

Nosso plano gratuito também tem limites: os 5 minutos são uma prévia. DOCX, PDF, SRT e VTT ficam nos planos pagos. Contas Free exportam em TXT, Markdown e JSON.

Da gravação a anotações úteis

Uma transcrição ainda não é um conjunto de anotações. A demonstração mostra isso: há frases interrompidas, interjeições e repetições que ninguém quer reler.

A ordem mais confiável é transcrever e depois organizar. São duas etapas:

1. Transcreva para transformar as palavras em texto pesquisável.

2. Resuma o texto em decisões, tarefas e perguntas em aberto, com IA ou revisão manual.

A ordem importa. Um resumo produzido diretamente do áudio esconde onde aconteceu o erro: no reconhecimento da fala ou na interpretação do conteúdo. Com a transcrição em mãos, você pode conferir uma etapa e depois a outra.

É assim que funciona a promessa de “transformar uma gravação em anotações” em um clique: a ferramenta executa duas etapas em sequência. Sabendo disso, você pode corrigir a transcrição antes que um texto errado dê origem ao resumo.

Onde a transcrição pode errar

Gravações pessoais têm dificuldades diferentes das reuniões. Em geral, você está sozinho, perto do microfone e pensando em voz alta, não fazendo uma apresentação:

  • Frases interrompidas e recomeçadas. São uma das principais causas de trechos estranhos. No teste de compressão, cada versão interpretou de um jeito a mesma frase recomeçada.
  • Finais em voz baixa. A gravação pode terminar no meio de uma ideia, enquanto a voz perde volume. É um trecho difícil de reconhecer.
  • Nomes e números. Um telefone ou nome ditado costuma ser a parte mais valiosa e menos confiável. Confira.
  • Gravações em movimento. Caminhada, direção e vento: notas de voz são feitas em lugares onde reuniões não costumam acontecer.
  • Jargão e abreviações pessoais. Você pode usar uma forma abreviada que nenhum modelo conhece.
  • Idiomas misturados. Uma mudança no meio do áudio pode confundir tanto a detecção automática quanto um modelo configurado para um único idioma.
  • Gravações muito curtas. Cinco segundos oferecem pouco contexto para resolver ambiguidades.
  • Trocar de ferramenta não elimina esses problemas. O hábito mais útil é reler e ouvir os trechos em que você sabe que não foi claro. Isso pode levar poucos segundos.

    Metodologia e resultados do teste

    Data: 27 de julho de 2026

    Áudio de origem: “Timelapse Excess”, da coleção Voice Notes de David Blue. É uma gravação pessoal real publicada em domínio público no archive.org, com Public Domain Mark; o repositório do autor usa a dedicação ao domínio público Unlicense. Duração de 51,1 segundos, mono, originalmente a 48 kHz e 320 kbit/s.

    Arquivo reproduzido: recodificado com ffmpeg para mono a 24 kHz e 48 kbit/s, com 307 KB. O original tinha 2,95 MB, em grande parte por uma imagem de capa incorporada de 4008×4008. O player reproduz essa cópia e mostra a transcrição dela.

    Teste de compressão: a mesma gravação a 320 kbit/s no original e a 96 e 48 kbit/s nas cópias. Configurações idênticas: Whisper large, idioma inglês, separação de falantes desativada e perfil padrão.

    Resultado: 9 dos 12 segmentos idênticos nas três taxas. Os três diferentes ficam entre 0:30 e 0:38, quando a pessoa interrompe e recomeça uma frase. Cada taxa gerou uma leitura diferente.

    Velocidade: 6,65 segundos de processamento do mecanismo para 51,12 segundos de áudio, aproximadamente 0,13× a duração. Não inclui envio.

    Comparação: multiplicadores publicados pelo Audacity para OpenVINO Whisper: cerca de 0,3× com base e de 3 a 5× com large-v3. A coluna de uma hora é um cálculo com essas taxas, não uma medição nossa.

    Transcrição exibida: saída do modelo sem edição. O início e o fim de cada segmento são medidos. O destaque de cada palavra é interpolado dentro da linha, pois o backend retorna marcações por segmento, não por palavra.

    É um único exemplo, não um benchmark. Ele está disponível para você conferir o resultado e repetir o teste.

    Último teste: 27 de julho de 2026

    Perguntas frequentes

    O Gravador da Apple transcreve as gravações? Sim, nos dispositivos compatíveis: iPhone 12 ou posterior com iOS 18 e Mac com Apple Silicon e macOS Sequoia. A documentação da Apple exige ambos os requisitos no Mac e informa que o recurso não está disponível em todos os países ou regiões. Há suporte para cerca de dez idiomas, incluindo português, inglês, espanhol, italiano, francês, alemão, japonês, coreano e chinês.

    Posso transcrever uma gravação em um iPhone antigo ou Mac Intel? Não com a transcrição integrada da Apple. iPhone 11 e anteriores e qualquer Mac Intel ficam fora dos requisitos, independentemente da versão do sistema. Nesses dispositivos, compartilhe a gravação como arquivo e envie a uma ferramenta de transcrição no navegador, que não exige esse hardware específico.

    Como obtenho a transcrição de uma gravação de voz? Em um dispositivo compatível, abra a gravação no Gravador, toque no ícone de transcrição abaixo da forma de onda e copie o texto. Nos demais dispositivos, compartilhe a gravação, salve o .m4a em Arquivos e envie a uma ferramenta de transcrição. A opção no navegador também oferece marcações de tempo e formatos de exportação que o recurso integrado não tem.

    Como transformar uma gravação de voz em texto no Android? Não existe um único equivalente integrado em todo Android: depende do aplicativo de gravação. Exporte ou compartilhe o arquivo, geralmente .m4a, .mp3, .amr ou .3gp, e envie a uma ferramenta de transcrição. Confira o suporte a AMR e 3GP antes: alguns serviços recusam esses formatos e pedem conversão para MP3, acrescentando uma recodificação desnecessária.

    Devo comprimir a gravação antes de enviar? Não: envie o original. Processamos a mesma gravação de 51 segundos em três taxas de bits: 320 kbit/s no original, 96 e 48 kbit/s nas cópias. Nove dos doze segmentos ficaram idênticos. Os outros três estavam no mesmo trecho de oito segundos, com hesitações e frases recomeçadas. A compressão não piora tudo por igual; ela torna ainda mais incertos os trechos já pouco claros.

    Quanto tempo leva para transcrever uma gravação de voz? Na nuvem, o processamento pode levar uma fração da duração do áudio; localmente, pode levar várias vezes essa duração. Nosso mecanismo levou 6,65 segundos para um áudio de 51 segundos, cerca de 0,13× o tempo real. O OpenVINO Whisper do Audacity publica cerca de 0,3× para o modelo base e de 3 a 5× para large-v3. Uma hora de áudio pode levar minutos na nuvem e horas localmente com o modelo maior.

    Existe um aplicativo que transcreve gravações de voz? Em um iPhone compatível, o próprio Gravador faz isso, sem instalar nada. Um aplicativo adicional vale a pena se você quer transcrever todas as gravações automaticamente ou manter áudios confidenciais no dispositivo, sem envio à nuvem. Para conversões ocasionais, um navegador basta.

    Como transformar uma gravação de voz em anotações? Primeiro transcreva, depois organize o texto. A fala de alguém pensando em voz alta tem hesitações, interjeições e repetições; ainda não é uma anotação pronta. Após transcrever, use um resumo com IA para extrair decisões e tarefas ou edite manualmente. São duas etapas distintas, e essa ordem permite conferir o resultado.

    Posso transcrever gravações offline gratuitamente? Sim. O plugin OpenVINO Whisper do Audacity executa Whisper no computador, com opções para Windows, Mac e Linux, sem assinatura ou limite de minutos. O áudio permanece local. Em troca, você precisa instalar o plugin, baixar um modelo e aguardar de 0,3 a 5 vezes a duração da gravação, dependendo do modelo escolhido.

    Quais formatos as gravações de voz usam? O Gravador da Apple salva em .m4a. No Android, são comuns .m4a, .mp3, .amr e .3gp. Não é preciso converter esses formatos antes: o TranscribeNext aceita diretamente 27 extensões de áudio e vídeo, incluindo .amr, .3gp e .3g2.

    Fontes

  • Apple: visualizar a transcrição de uma gravação no Mac — requisitos de macOS Sequoia e Apple Silicon e disponibilidade por região; verificado em 27 de julho de 2026.
  • Apple: visualizar uma transcrição no Gravador do iPhone.
  • Audacity: transcrição — OpenVINO Whisper, processamento offline, tamanhos de modelo, multiplicadores de tempo publicados e 99 idiomas.
  • Happy Scribe, AudioScribe, TalkNotes e NoteGPT — limites gratuitos, tamanhos máximos e formatos publicados nas páginas de gravações de voz, verificados em julho de 2026.
  • David Blue: Voice Notes — coleção em domínio público de onde vem a demonstração.
  • Formatos aceitos pelo TranscribeNext: lista MIME usada pela validação real do envio, não uma página de marketing.
  • Preços e limites dos planos · Recursos · Política de Privacidade · TranscribeNext para Mac.
  • Áudio e tempos medidos: processamento de produção do TranscribeNext em 27 de julho de 2026. Veja a metodologia.
  • Guias relacionados: Correio de voz em texto · Como converter M4A em texto · Como transcrever áudio no Word · Melhores aplicativos de transcrição para Mac.

    Transcreva sua gravação de voz agora

    Se o iPhone for compatível, a transcrição já está no Gravador: abra a gravação e deslize para cima. Caso contrário, compartilhe o arquivo e arraste-o para o formulário no início da página. Os primeiros 5 minutos são gratuitos, sem conta. Para áudios que você prefere não enviar à nuvem, o TranscribeNext para Mac processa no dispositivo.

    As gravações do Gravador são salvas em M4A. Veja as especificações em transcrição de M4A. Para navegar melhor por áudios longos, consulte o guia de marcações de tempo.

    Quer transcrever seu áudio?

    Experimente o TranscribeNext de graça e conheça a transcrição com IA

    Começar de graça — sem cartão de crédito

    © 2026 TranscribeNext.com. Todos os direitos reservados.

    Como transcrever gravações de voz: recursos integrados, online e offline | TranscribeNext