O Gravador da Apple transcreve diretamente no iPhone 12 ou posterior com iOS 18 e em Macs com Apple Silicon e macOS Sequoia. Se o dispositivo ou o idioma não for compatível, o recurso não aparece. Nesse caso, compartilhe a gravação como arquivo e envie a uma ferramenta de transcrição.
Este guia explica os dois caminhos e os requisitos de cada dispositivo. Você também pode ouvir uma gravação real, ler a transcrição sem edição e conferir um teste: comprimir o áudio antes de enviar muda o texto reconhecido?
Transcrição de gravações de voz em resumo
| Recurso integrado no iPhone | iPhone 12 ou posterior, iOS 18 |
| Recurso integrado no Mac | macOS Sequoia e Apple Silicon; Macs Intel não são compatíveis |
| Idiomas do recurso integrado | Cerca de dez; não disponível em todos os países ou regiões |
| Se o dispositivo não for compatível | Compartilhe e envie o arquivo: não há requisito específico de hardware |
| Formatos comuns | .m4a no iPhone; .m4a, .mp3, .amr ou .3gp no Android |
| Conversão prévia | Não é necessária; a recompressão pode prejudicar o resultado. Veja o teste |
| Uso gratuito | Primeiros 5 minutos sem conta; com conta Free, 3 arquivos de até 50 MB por dia |
| Velocidade | 0,13× a duração do áudio medido na nuvem; de 0,3 a 5× divulgado para Whisper local |
- Ouça uma gravação real e acompanhe a transcrição
- O Gravador transcreve? Veja os requisitos
- Como obter a transcrição no Gravador
- Como transcrever quando o aplicativo não oferece o recurso
- Por que não recomprimir: nosso teste
- Quanto demora: nuvem ou computador
- Transcrição gratuita e offline
- Comparação de ferramentas gratuitas na web
- Da gravação a anotações úteis
- Onde a transcrição pode errar
- Metodologia e resultados do teste
- Perguntas frequentes
- Fontes
Ouça uma gravação real e acompanhe a transcrição
Dê o play. É uma gravação real em inglês: alguém pensando em voz alta, não lendo um roteiro. A transcrição abaixo do player é o resultado sem edição do nosso processamento desse mesmo arquivo. Clique em qualquer linha para ir ao trecho correspondente.
O exemplo está aqui porque tem *a espontaneidade e as hesitações de uma gravação de verdade*. A pessoa começa com “Okay, so…” — “Certo, então…” —, interrompe o raciocínio com “I mean, I'm sure the vast majority of people don't use the feature” — “Quer dizer, tenho certeza de que a grande maioria não usa o recurso” — e repete a ideia enquanto encontra o fim da frase: “What a ridiculous idea. What a ridiculous thing to include in the camera app.”
Isso mostra o que uma transcrição realmente entrega: texto fiel, pontuado e pesquisável, mas ainda não são anotações organizadas. Para chegar a elas, há uma segunda etapa.
O Gravador transcreve? Os requisitos que nem sempre ficam claros
Sim, mas dizer que “qualquer celular moderno faz isso automaticamente” não é correto. Essa diferença surpreende muita gente. Os requisitos são:
| Dispositivo ou condição | Requisito | Quando não há suporte |
|---|---|---|
| iPhone | iPhone 12 ou posterior com iOS 18 | iPhone 11 e anteriores não transcrevem pelo recurso integrado, independentemente do iOS |
| Mac | macOS Sequoia e Apple Silicon | Macs Intel não têm o recurso, independentemente do macOS |
| Idioma | Cerca de dez, incluindo português, inglês, espanhol, francês, alemão, italiano, japonês, coreano e chinês | Idiomas não compatíveis não são transcritos |
| Região | A Apple informa que não está disponível em todos os países ou regiões | O recurso pode não aparecer mesmo em hardware compatível |
| Android | Não há um único equivalente integrado em todos os aparelhos | Depende do aplicativo de gravação |
O requisito do Mac é o que mais surpreende e vem da documentação da Apple: é preciso ter macOS Sequoia e um Mac com Apple Silicon. Um Mac Intel com o sistema mais recente compatível continua sem transcrição. Não há uma opção escondida para ativar nem um defeito para corrigir: o recurso não está disponível.
Se você não atende a algum requisito, use o envio do arquivo. Esse caminho funciona também no Android e no Windows, não exige hardware específico e oferece muito mais idiomas.
Como obter a transcrição no Gravador
Em um dispositivo compatível, é o caminho mais rápido: a gravação já está no lugar certo.
1. Abra o Gravador e selecione a gravação.
2. Toque no ícone de transcrição abaixo da forma de onda. No iPhone, deslize para cima nessa área para vê-lo.
3. Leia a transcrição e copie o texto para onde precisar.
Antes de depender do recurso, considere dois limites. A opção integrada entrega texto, sem identificação de falantes nem exportação para documentos ou arquivos de legenda. Além disso, você não pode forçar a escolha de outro idioma: uma gravação em idioma não compatível ou que muda de idioma no meio pode resultar em uma transcrição parcial.
Para reler um lembrete curto, pode bastar. Para uma entrevista, palestra ou gravação em que você precisa localizar citações pelo tempo, uma ferramenta mais completa é mais adequada.
Como transcrever uma gravação que o aplicativo não transcreve
Enviar o arquivo elimina os requisitos específicos anteriores: não é preciso um modelo mínimo de iPhone, uma versão de macOS ou Apple Silicon. Os modelos Whisper oferecem 99 idiomas, em vez de cerca de dez.
1. Obtenha o arquivo. No Gravador, selecione a gravação, toque em Compartilhar e salve em Arquivos. Você terá um `.m4a`. No Android, exporte ou compartilhe pelo aplicativo; o arquivo pode ser `.m4a`, `.mp3`, `.amr` ou `.3gp`.
2. Envie o original. Arraste-o para o formulário no início da página ou para a ferramenta completa de transcrição. Não converta antes: a próxima seção mostra por quê com dados medidos.
3. Defina o idioma, se souber qual é. A detecção automática funciona bem com fala clara em um idioma comum. A seleção manual ajuda em gravações curtas, com sotaques fortes ou ruído.
4. Revise e exporte. Confira nomes e números. Baixe em TXT, Markdown ou JSON ou, nos planos pagos, em DOCX, PDF, SRT ou VTT.
Sobre AMR e 3GP: gravadores Android usam esses formatos há anos. Alguns serviços os recusam e pedem uma conversão prévia para MP3. Aceitamos `.amr`, `.amr-wb`, `.3gp` e `.3g2` diretamente, além de outras 23 extensões. Você não precisa acrescentar uma etapa de conversão.
Não recomprima antes de enviar: medimos a diferença
A recomendação de “converter a gravação para MP3 antes de enviar” não é apenas desnecessária. Testamos o efeito dessa recodificação.
Usamos o áudio de 51 segundos da demonstração e criamos três versões: o original a 320 kbit/s, uma cópia a 96 kbit/s e outra a 48 kbit/s. Todas passaram pelo mesmo mecanismo e pelas mesmas configurações. Os trechos abaixo permanecem em inglês para mostrar exatamente o que foi reconhecido, sem traduzir os erros do modelo.
| Início do segmento | 320 kbit/s, original | 96 kbit/s | 48 kbit/s |
|---|---|---|---|
| 9 dos 12 segmentos ficaram idênticos nas três versões | |||
| 0:30 | …you leave it. | …you leave it. | …you leave it somewhere. |
| 0:33 | So I'm like, can't move it… | So I'm going to can't move it… | Can't move it. Can't use it… |
| 0:38 | That's insane. | It's insane. | That's insane. |
Há três conclusões, e só a primeira é óbvia.
A compressão não piora a transcrição por igual. Mesmo com uma diferença de 6,7 vezes na taxa de bits, três quartos do texto ficaram idênticos, caractere por caractere. A qualidade não cai de forma uniforme.
As diferenças se concentram onde a fala já era pouco clara. Os três segmentos divergentes ficam nos mesmos oito segundos, de 0:30 a 0:38, justamente quando a pessoa abandona uma frase e recomeça. O restante não mudou.
Cada taxa de bits interpreta as hesitações de um jeito. A versão a 96 kbit/s produziu “So I'm going to can't move it”, uma frase incoerente em inglês; a de 48 kbit/s eliminou o começo interrompido. A recodificação não acrescenta um erro previsível: muda o resultado de forma imprevisível nos trechos ambíguos.
Portanto, envie o arquivo que o celular gravou. Na revisão, dê atenção aos pontos em que você sabe que falou de forma pouco clara. Foram esses os trechos que variaram, e sua memória do que quis dizer ajuda a conferir o áudio.
Quanto demora: nuvem ou computador?
Os dois caminhos funcionam, mas os tempos podem diferir por uma ordem de grandeza. Recomendações de processamento local por privacidade nem sempre explicam esse custo de tempo.
| Método | Tempo em relação ao áudio | Gravação de 1 minuto | Gravação de 1 hora |
|---|---|---|---|
| Nosso processamento na nuvem | 0,13×, medido | Cerca de 8 segundos | Cerca de 8 minutos |
| Audacity + OpenVINO, modelo base | Cerca de 0,3×, publicado | Cerca de 18 segundos | Cerca de 18 minutos |
| Audacity + OpenVINO, large-v3 | Cerca de 3 a 5×, publicado | De 3 a 5 minutos | De 3 a 5 horas |
O valor de 0,13× é o tempo medido do mecanismo na demonstração: 6,65 segundos para 51,12 segundos de áudio. Os multiplicadores do Audacity são publicados pelo próprio projeto para os tamanhos de modelo do plugin. A coluna de uma hora é uma projeção aritmética, não uma medição. Arquivos reais variam. O tempo na nuvem também exclui o envio, que pode demorar mais que a transcrição em uma gravação longa enviada por dados móveis.
A conclusão é simples: transcrição local pode ser gratuita e preservar a privacidade, mas o modelo maior pode exigir várias horas. Escolha esse caminho quando a confidencialidade justificar, não automaticamente em qualquer situação.
Transcrição gratuita e offline
Se a gravação é confidencial — uma conversa com cliente, uma nota médica ou um assunto jurídico — o principal motivo para processar localmente não é o preço: é manter o áudio no computador.
O Audacity é uma opção gratuita. O efeito OpenVINO Whisper executa o modelo Whisper da OpenAI localmente, com opções para Windows, macOS e Linux, sem assinatura, marca-d'água ou limite de minutos. Há cinco tamanhos de modelo, de `base` a `large-v3`, além de uma variante com separação de falantes e suporte aos 99 idiomas do Whisper. O custo está na configuração e no tempo: instalar o plugin, baixar o modelo e aguardar o processamento descrito na tabela.
O TranscribeNext para Mac oferece esse fluxo sem combinar várias ferramentas: arraste a gravação para o aplicativo, transcreva no Mac com Apple Silicon, adicione identificação de falantes e exporte no formato desejado. A nuvem só é usada se você a escolher explicitamente.
O princípio é o mesmo: se a gravação é sensível e não deve sair do computador, não a envie a nenhum serviço, nem mesmo ao nosso.
Comparação de ferramentas gratuitas na web
Os dados foram publicados pelos fornecedores e verificados em julho de 2026. Eles podem mudar; confirme antes de depender deles.
| Ferramenta | Uso gratuito | Limite por arquivo | AMR/3GP | Demonstração com áudio |
|---|---|---|---|---|
| TranscribeNext | Primeiros 5 minutos sem conta; 3 arquivos por dia com conta Free | 50 MB no Free · 2 GB no Plus · 5 GB no Premium | Sim, diretamente | Sim, nesta página |
| Happy Scribe | Primeiros 10 minutos | Mais de 45 formatos | Não publicado | Não |
| AudioScribe | Até 5 minutos sem cadastro | 100 MB | Informa que não aceita AMR | Não |
| TalkNotes | 1 minuto sem conta | 5 MB | Não publicado | Não |
| NoteGPT | Plano gratuito; lotes de 20 arquivos | 5 GB | Não publicado | Não |
| Audacity, offline | Gratuito, sem limite de minutos | Sem limite definido pelo serviço | Depende dos decodificadores da versão instalada | Não |
Duas observações. Os 10 minutos gratuitos do Happy Scribe são uma oferta generosa entre essas opções no navegador. O serviço anuncia “até 96% em áudio claro”, mas dados de fornecedores são medidos nos áudios deles e não são diretamente comparáveis. Por isso, incluímos uma gravação que você pode conferir e um teste reproduzível.
Nosso plano gratuito também tem limites: os 5 minutos são uma prévia. DOCX, PDF, SRT e VTT ficam nos planos pagos. Contas Free exportam em TXT, Markdown e JSON.
Da gravação a anotações úteis
Uma transcrição ainda não é um conjunto de anotações. A demonstração mostra isso: há frases interrompidas, interjeições e repetições que ninguém quer reler.
A ordem mais confiável é transcrever e depois organizar. São duas etapas:
1. Transcreva para transformar as palavras em texto pesquisável.
2. Resuma o texto em decisões, tarefas e perguntas em aberto, com IA ou revisão manual.
A ordem importa. Um resumo produzido diretamente do áudio esconde onde aconteceu o erro: no reconhecimento da fala ou na interpretação do conteúdo. Com a transcrição em mãos, você pode conferir uma etapa e depois a outra.
É assim que funciona a promessa de “transformar uma gravação em anotações” em um clique: a ferramenta executa duas etapas em sequência. Sabendo disso, você pode corrigir a transcrição antes que um texto errado dê origem ao resumo.
Onde a transcrição pode errar
Gravações pessoais têm dificuldades diferentes das reuniões. Em geral, você está sozinho, perto do microfone e pensando em voz alta, não fazendo uma apresentação:
Trocar de ferramenta não elimina esses problemas. O hábito mais útil é reler e ouvir os trechos em que você sabe que não foi claro. Isso pode levar poucos segundos.
Metodologia e resultados do teste
Data: 27 de julho de 2026
Áudio de origem: “Timelapse Excess”, da coleção Voice Notes de David Blue. É uma gravação pessoal real publicada em domínio público no archive.org, com Public Domain Mark; o repositório do autor usa a dedicação ao domínio público Unlicense. Duração de 51,1 segundos, mono, originalmente a 48 kHz e 320 kbit/s.
Arquivo reproduzido: recodificado com ffmpeg para mono a 24 kHz e 48 kbit/s, com 307 KB. O original tinha 2,95 MB, em grande parte por uma imagem de capa incorporada de 4008×4008. O player reproduz essa cópia e mostra a transcrição dela.
Teste de compressão: a mesma gravação a 320 kbit/s no original e a 96 e 48 kbit/s nas cópias. Configurações idênticas: Whisper large, idioma inglês, separação de falantes desativada e perfil padrão.
Resultado: 9 dos 12 segmentos idênticos nas três taxas. Os três diferentes ficam entre 0:30 e 0:38, quando a pessoa interrompe e recomeça uma frase. Cada taxa gerou uma leitura diferente.
Velocidade: 6,65 segundos de processamento do mecanismo para 51,12 segundos de áudio, aproximadamente 0,13× a duração. Não inclui envio.
Comparação: multiplicadores publicados pelo Audacity para OpenVINO Whisper: cerca de 0,3× com base e de 3 a 5× com large-v3. A coluna de uma hora é um cálculo com essas taxas, não uma medição nossa.
Transcrição exibida: saída do modelo sem edição. O início e o fim de cada segmento são medidos. O destaque de cada palavra é interpolado dentro da linha, pois o backend retorna marcações por segmento, não por palavra.
É um único exemplo, não um benchmark. Ele está disponível para você conferir o resultado e repetir o teste.
Último teste: 27 de julho de 2026
Perguntas frequentes
O Gravador da Apple transcreve as gravações? Sim, nos dispositivos compatíveis: iPhone 12 ou posterior com iOS 18 e Mac com Apple Silicon e macOS Sequoia. A documentação da Apple exige ambos os requisitos no Mac e informa que o recurso não está disponível em todos os países ou regiões. Há suporte para cerca de dez idiomas, incluindo português, inglês, espanhol, italiano, francês, alemão, japonês, coreano e chinês.
Posso transcrever uma gravação em um iPhone antigo ou Mac Intel? Não com a transcrição integrada da Apple. iPhone 11 e anteriores e qualquer Mac Intel ficam fora dos requisitos, independentemente da versão do sistema. Nesses dispositivos, compartilhe a gravação como arquivo e envie a uma ferramenta de transcrição no navegador, que não exige esse hardware específico.
Como obtenho a transcrição de uma gravação de voz? Em um dispositivo compatível, abra a gravação no Gravador, toque no ícone de transcrição abaixo da forma de onda e copie o texto. Nos demais dispositivos, compartilhe a gravação, salve o .m4a em Arquivos e envie a uma ferramenta de transcrição. A opção no navegador também oferece marcações de tempo e formatos de exportação que o recurso integrado não tem.
Como transformar uma gravação de voz em texto no Android? Não existe um único equivalente integrado em todo Android: depende do aplicativo de gravação. Exporte ou compartilhe o arquivo, geralmente .m4a, .mp3, .amr ou .3gp, e envie a uma ferramenta de transcrição. Confira o suporte a AMR e 3GP antes: alguns serviços recusam esses formatos e pedem conversão para MP3, acrescentando uma recodificação desnecessária.
Devo comprimir a gravação antes de enviar? Não: envie o original. Processamos a mesma gravação de 51 segundos em três taxas de bits: 320 kbit/s no original, 96 e 48 kbit/s nas cópias. Nove dos doze segmentos ficaram idênticos. Os outros três estavam no mesmo trecho de oito segundos, com hesitações e frases recomeçadas. A compressão não piora tudo por igual; ela torna ainda mais incertos os trechos já pouco claros.
Quanto tempo leva para transcrever uma gravação de voz? Na nuvem, o processamento pode levar uma fração da duração do áudio; localmente, pode levar várias vezes essa duração. Nosso mecanismo levou 6,65 segundos para um áudio de 51 segundos, cerca de 0,13× o tempo real. O OpenVINO Whisper do Audacity publica cerca de 0,3× para o modelo base e de 3 a 5× para large-v3. Uma hora de áudio pode levar minutos na nuvem e horas localmente com o modelo maior.
Existe um aplicativo que transcreve gravações de voz? Em um iPhone compatível, o próprio Gravador faz isso, sem instalar nada. Um aplicativo adicional vale a pena se você quer transcrever todas as gravações automaticamente ou manter áudios confidenciais no dispositivo, sem envio à nuvem. Para conversões ocasionais, um navegador basta.
Como transformar uma gravação de voz em anotações? Primeiro transcreva, depois organize o texto. A fala de alguém pensando em voz alta tem hesitações, interjeições e repetições; ainda não é uma anotação pronta. Após transcrever, use um resumo com IA para extrair decisões e tarefas ou edite manualmente. São duas etapas distintas, e essa ordem permite conferir o resultado.
Posso transcrever gravações offline gratuitamente? Sim. O plugin OpenVINO Whisper do Audacity executa Whisper no computador, com opções para Windows, Mac e Linux, sem assinatura ou limite de minutos. O áudio permanece local. Em troca, você precisa instalar o plugin, baixar um modelo e aguardar de 0,3 a 5 vezes a duração da gravação, dependendo do modelo escolhido.
Quais formatos as gravações de voz usam? O Gravador da Apple salva em .m4a. No Android, são comuns .m4a, .mp3, .amr e .3gp. Não é preciso converter esses formatos antes: o TranscribeNext aceita diretamente 27 extensões de áudio e vídeo, incluindo .amr, .3gp e .3g2.
Fontes
Guias relacionados: Correio de voz em texto · Como converter M4A em texto · Como transcrever áudio no Word · Melhores aplicativos de transcrição para Mac.
Transcreva sua gravação de voz agora
Se o iPhone for compatível, a transcrição já está no Gravador: abra a gravação e deslize para cima. Caso contrário, compartilhe o arquivo e arraste-o para o formulário no início da página. Os primeiros 5 minutos são gratuitos, sem conta. Para áudios que você prefere não enviar à nuvem, o TranscribeNext para Mac processa no dispositivo.
As gravações do Gravador são salvas em M4A. Veja as especificações em transcrição de M4A. Para navegar melhor por áudios longos, consulte o guia de marcações de tempo.