TranscribeNext.comTranscribeNext.com
BlogHow-To

Transcrire des mémos vocaux

🎧

Équipe TranscribeNext

12 min de lecture
memos-vocauxvoice-memo-to-textaudio-en-textetranscriptioniphonemacia

L'app Dictaphone d'Apple transcrit seule vos enregistrements : sur iPhone 12 ou plus récent avec iOS 18, et sur Mac uniquement avec macOS Sequoia et une puce Apple. Hors de ces prérequis, et hors de la dizaine de langues prises en charge, la transcription intégrée n'apparaît tout simplement pas, et le mémo se convertit en chargeant le fichier.

Free

Ce guide couvre les deux voies, avec les prérequis énoncés clairement plutôt que résumés par « les téléphones modernes savent faire ». Il contient aussi un vrai mémo vocal que vous pouvez écouter, sa transcription brute, et une réponse mesurée à une question que personne d'autre ne pose : compresser un mémo avant de le charger change-t-il ce qui revient ?

La transcription de mémos vocaux en un coup d'œil

Intégré sur iPhoneiPhone 12 ou plus récent, iOS 18
Intégré sur MacmacOS Sequoia et puce Apple — les Mac Intel sont exclus
Langues intégréesUne dizaine, et pas dans tous les pays ou régions
Si votre appareil est excluPartagez le fichier et chargez-le : aucune exigence matérielle
Format des mémos.m4a sur iPhone ; .m4a, .mp3, .amr ou .3gp sur Android
Conversion préalableAucune — et recompresser nuit réellement, voir le test
Usage gratuit5 premières minutes sans compte ; 3 fichiers/jour de 50 Mo avec un compte gratuit
Vitesse0,13× le temps réel mesuré dans le cloud contre 0,3–5× publié pour Whisper en local

Écoutez un vrai mémo vocal et sa transcription

Appuyez sur lecture. C'est une véritable note vocale — quelqu'un qui pense à voix haute, pas une lecture écrite — et la transcription sous le lecteur est la sortie brute de notre pipeline sur ce fichier précis. Cliquez sur une ligne pour y sauter.

Écoutez un vrai mémo vocal et sa transcription
Note vocale du domaine public · 0:51 · transcription brute
0:00 / 0:50
Source : « Timelapse Excess », issu de la bibliothèque de notes vocales de David Blue, versée au domaine public (archive.org, Public Domain Mark ; le dépôt de l’auteur porte une dédicace au domaine public de type Unlicense). Nous l’avons réencodé en mono 48 kbps pour le web — l’original embarquait une pochette de 4008×4008 et pesait dix fois plus. La transcription est la sortie brute de notre pipeline sur ce fichier précis. Les temps de chaque ligne sont mesurés ; la surbrillance mot à mot est interpolée à l’intérieur de la ligne.

Ce clip est ici parce qu'il est *brouillon comme le sont les vrais mémos*. Le locuteur commence par « Okay, so… », s'interrompt en plein argument avec « I mean, I'm sure the vast majority of people don't use the feature », et répète une phrase le temps d'en trouver la fin : « What a ridiculous idea. What a ridiculous thing to include in the camera app ».

C'est l'image honnête de ce que donne une transcription : fidèle, ponctuée, cherchable — et ce ne sont pas encore des notes. En faire des notes est une seconde étape.

Dictaphone transcrit-il ? Les prérequis que personne n'imprime

Oui, mais « les téléphones modernes font ça tout seuls » est faux, et l'écart piège beaucoup de monde. Voici les prérequis réels :

AppareilPrérequisSi vous en sortez
iPhone / iPadiPhone 12 ou plus récent avec iOS 18Pas de transcription sur iPhone 11 ou antérieur, quel que soit l'iOS
MacmacOS Sequoia et puce ApplePas de transcription sur un Mac Intel, quelle que soit la version de macOS
LangueUne dizaine, dont anglais, espagnol, français, allemand, portugais, italien, japonais, coréen, chinoisPas de transcription dans une langue non prise en charge
RégionApple indique que ce n'est « pas disponible dans tous les pays ou régions »La fonction peut manquer même sur du matériel éligible
AndroidPas d'équivalent intégré uniqueDépend entièrement de votre app d'enregistrement

Le prérequis Mac est celui qui surprend le plus, et il vient directement de la page d'assistance d'Apple : la transcription nécessite macOS Sequoia et un Mac avec puce Apple. Un Mac Intel sous le macOS le plus récent n'affiche toujours aucune transcription. Il n'y a aucun réglage à activer ni rien à dépanner : la fonction est simplement absente.

Si une ligne ci-dessus vous exclut, passez à la voie du chargement. Elle n'impose aucune exigence matérielle, fonctionne sur Android et Windows, et prend en charge bien plus de langues.

Voir la transcription dans l'app Dictaphone

Sur un appareil éligible, c'est la voie la plus rapide, puisque l'enregistrement est déjà au bon endroit :

1. Ouvrez Dictaphone et sélectionnez l'enregistrement.

2. Touchez l'icône de transcription sous la forme d'onde — sur iPhone, balayez vers le haut depuis la zone de la forme d'onde pour la faire apparaître.

3. Lisez la transcription et copiez le texte là où vous en avez besoin.

Deux limites méritent d'être connues avant de compter dessus. La transcription intégrée est du texte seul : pas d'horodatages pour naviguer, pas d'étiquettes de locuteur, pas d'export vers un document ou un fichier de sous-titres. Et c'est tout ou rien : aucun moyen de forcer la langue, donc un mémo enregistré dans une langue non prise en charge, ou qui change de langue en cours de route, ne donne rien plutôt qu'un résultat partiel.

Pour relire un pense-bête, c'est amplement suffisant. Pour un entretien, un cours ou tout ce que vous devez citer par horodatage, non.

Convertir un mémo que l'app ne transcrit pas

La voie du chargement supprime tous les prérequis ci-dessus : pas d'appareil minimum, pas de version de macOS, pas de puce Apple, et 99 langues au lieu de dix.

1. Récupérez le fichier. Dans Dictaphone, touchez l'enregistrement, puis le bouton partager, et enregistrez-le dans Fichiers. Vous obtenez un `.m4a`. Sur Android, exportez ou partagez depuis votre app d'enregistrement : vous pouvez obtenir `.m4a`, `.mp3`, `.amr` ou `.3gp`.

2. Chargez l'original. Déposez-le dans le formulaire en haut de cette page ou dans le formulaire complet. Ne le convertissez pas d'abord : la section suivante en donne la raison mesurée.

3. Fixez la langue si vous la connaissez. La détection automatique convient à un mémo clair dans une langue courante ; une langue fixée vaut mieux en cas d'accent, de bruit ou d'enregistrement court.

4. Relisez et exportez. Corrigez noms et chiffres, puis récupérez le tout en TXT, Markdown, JSON — ou, en formule payante, DOCX, PDF, SRT ou VTT.

À propos d'AMR et 3GP : les enregistreurs Android utilisent ces codecs depuis des années, et plusieurs transcripteurs en ligne les refusent en demandant de convertir en MP3 au préalable. Nous acceptons `.amr`, `.amr-wb`, `.3gp` et `.3g2` directement, avec 23 autres extensions : aucune étape de conversion.

Ne recompressez jamais un mémo avant : nous l'avons mesuré

Le conseil courant « convertissez votre mémo en MP3 avant de le charger » n'est pas seulement inutile. Nous avons mesuré ce qu'il coûte réellement.

Nous avons pris la note vocale de 51 secondes de la démo ci-dessus et produit trois versions du même enregistrement : l'original à 320 kbit/s, une copie à 96 kbit/s et une à 48 kbit/s. Les trois sont passées dans le même moteur avec les mêmes réglages.

Segment à320 kbit/s (original)96 kbit/s48 kbit/s
9 segments sur 12 sont revenus identiques dans les trois cas
0:30…you leave it.…you leave it.…you leave it somewhere.
0:33So I'm like, can't move it…So I'm going to can't move it…Can't move it. Can't use it…
0:38That's insane.It's insane.That's insane.

Trois conclusions en découlent, et seule la première est évidente.

La compression ne dégrade pas la transcription uniformément. Sur une plage de débit de 6,7×, les trois quarts de la transcription étaient identiques au caractère près. Le moteur ne se dégrade pas silencieusement partout quand la qualité baisse.

Les dégâts se concentrent là où le locuteur était déjà peu clair. Les trois divergences tombent dans un passage de huit secondes — de 0:30 à 0:38 — précisément là où il abandonne une phrase et la reprend. Rien d'autre n'a bougé dans le mémo.

Chaque débit lit ce passage différemment. Le 96 kbit/s a produit « So I'm going to can't move it », qui n'est pas une phrase ; le 48 kbit/s a supprimé le faux départ. Réencoder n'ajoute pas une erreur prévisible : cela relance les dés sur le passage ambigu.

Donc : chargez le fichier tel que votre téléphone l'a enregistré. Et en relisant une transcription, concentrez votre attention sur les endroits où vous savez avoir marmonné : c'est là que toutes les versions divergent, et où votre mémoire est la seule source fiable.

Combien de temps : le cloud contre votre portable

Les deux voies fonctionnent. Elles diffèrent d'environ un ordre de grandeur, et les conseils générés par IA qui vous orientent vers un outil local pour la confidentialité mentionnent rarement le coût.

VoieVitesseMémo d'1 minuteMémo d'1 heure
Notre pipeline cloud0,13× le temps réel (mesuré)~8 s~8 min
Audacity + OpenVINO, modèle base~0,3× le temps réel (publié)~18 s~18 min
Audacity + OpenVINO, large-v3~3–5× le temps réel (publié)~3–5 min~3–5 h

Le chiffre de 0,13× est un temps moteur mesuré sur le clip de la démo : 6,65 secondes pour 51,12 secondes d'audio. Les multiplicateurs d'Audacity sont ceux que le projet publie lui-même pour les tailles de modèle du plugin. La colonne « une heure » est une arithmétique sur ces taux, pas une mesure : les fichiers réels varient, et le chiffre cloud exclut le chargement, qui pour un mémo d'une heure en données mobiles peut dépasser la transcription elle-même.

La lecture honnête : la transcription locale est réellement gratuite et réellement privée, et sur le plus gros modèle elle peut occuper votre après-midi. Choisissez-la quand le contenu l'exige, pas par défaut.

Transcrire des mémos hors ligne et gratuitement

Si le mémo est confidentiel — une conversation client, une note médicale, une affaire juridique — l'argument du traitement local n'est pas le prix mais le fait que l'audio ne quitte jamais la machine.

Audacity est la voie gratuite. Son effet OpenVINO Whisper exécute le modèle Whisper d'OpenAI entièrement sur votre ordinateur, sous Windows, Mac et Linux, sans plafond de minutes, sans abonnement et sans filigrane. Il propose cinq tailles de modèle de `base` à `large-v3`, plus une variante avec diarisation des locuteurs, et les 99 langues de Whisper. Le coût, c'est l'installation — un plugin, un modèle à télécharger — et le temps de traitement du tableau ci-dessus.

TranscribeNext pour Mac propose la même idée avec moins de montage : vous déposez un mémo, il est transcrit sur l'appareil avec Apple Silicon, étiquettes de locuteur et formats d'export compris, et le cloud n'est utilisé que si vous le demandez.

Dans les deux cas le principe est le même : pour un enregistrement sensible, ne le téléversez nulle part — y compris ici.

Outils web gratuits comparés

Chiffres publiés par chaque éditeur, vérifiés en juillet 2026. Ils changent : confirmez avant de vous y fier.

Offre gratuitePlafond par fichierAMR / 3GPPreuve écoutable
TranscribeNext5 premières min sans compte ; 3 fichiers/jour avec un compte gratuit50 Mo gratuit · 2 Go PRO · 5 Go BUSINESSOui, en directOui — sur cette page
HappyScribe10 premières minutes gratuites45+ formatsNon publiéNon
AudioScribeJusqu'à 5 min sans inscription100 MoIndique que l'AMR n'est pas pris en chargeNon
TalkNotes1 minute, sans compte5 MoNon publiéNon
NoteGPTOffre gratuite ; lot de 20 fichiers5 Go par fichierNon publiéNon
Audacity (hors ligne)Illimité, gratuitAucunDépend des décodeurs de votre buildNon

Deux remarques. Les 10 minutes gratuites de HappyScribe sont les plus généreuses parmi les outils en navigateur, et l'éditeur publie un chiffre de précision — « jusqu'à 96 % sur un audio clair » — qui, comme tout chiffre d'éditeur, est mesuré sur son propre audio et n'est pas comparable d'un outil à l'autre. C'est pourquoi cette page publie plutôt un clip que vous pouvez vérifier et un test que vous pouvez répéter.

Et notre propre ligne n'est pas illimitée : les 5 minutes gratuites sont une limite d'aperçu, et l'export DOCX/PDF/SRT/VTT relève des formules payantes. Les comptes gratuits obtiennent TXT, Markdown et JSON.

Transformer un mémo vocal en vraies notes

Une transcription n'est pas une prise de notes, et la démo ci-dessus montre exactement pourquoi : reprises, hésitations, une phrase répétée. Personne n'a envie de relire ça.

L'ordre fiable est transcrire, puis structurer — deux étapes, pas une :

1. Transcrivez le mémo pour que les mots existent en texte cherchable.

2. Résumez en décisions, actions et questions ouvertes, avec un résumé par IA ou en réduisant vous-même.

Cet ordre compte. Un résumé généré directement depuis l'audio masque quelle étape a échoué quand le résultat est faux : impossible de savoir s'il vous a mal entendu ou mal compris. Avec la transcription sous les yeux, vous pouvez vérifier l'une puis l'autre.

C'est aussi la réponse honnête à « transformer un mémo vocal en notes » présenté comme une fonction unique : les outils qui la proposent enchaînent ces deux étapes. Le savoir permet de corriger la transcription avant que le résumé ne se construise dessus.

Où la transcription de mémos vocaux échoue

Les mémos vocaux échouent différemment des réunions, parce que vous êtes en général seul, près du micro, et en train de réfléchir plutôt que d'exposer :

  • Reprises et faux départs. La première source de lignes bizarres, comme l'a montré notre test de débit : toutes les versions ont divergé sur la seule phrase que le locuteur a abandonnée.
  • Fins qui s'éteignent. Les mémos se terminent souvent en pleine idée, volume déclinant : l'audio le plus difficile du fichier.
  • Noms et chiffres. Un numéro ou un nom dicté dans un mémo est la partie la plus précieuse et la moins fiable de la transcription. Vérifiez-la.
  • Enregistrer en mouvement. En marchant, en conduisant, dans le vent — les mémos se enregistrent là où les réunions ne se tiennent pas.
  • Jargon et abréviations. On se parle à soi-même en raccourcis qu'aucun moteur n'a entendus.
  • Mélange de langues. Changer en cours de mémo casse à la fois la détection automatique et une langue fixée.
  • Mémos très courts. Une note de cinq secondes ne laisse presque aucun contexte au moteur pour lever les ambiguïtés.
  • Rien de tout cela ne se règle en changeant d'outil. Cela se règle en relisant les passages où vous savez avoir été peu clair — une habitude de cinq secondes, pas un flux de travail.

    Méthodologie et résultats

    Date du test : 27 juillet 2026

    Extrait source : « Timelapse Excess », de la bibliothèque de notes vocales de David Blue — une véritable note vocale enregistrée par lui-même, versée au domaine public (archive.org, Public Domain Mark ; le dépôt de l'auteur porte une dédicace au domaine public de type Unlicense). 51,1 s, mono, à l'origine 48 kHz à 320 kbit/s.

    Fichier servi : réencodé avec ffmpeg en mono 24 kHz à 48 kbit/s (307 Ko). L'original pesait 2,95 Mo, essentiellement à cause d'une pochette intégrée de 4008×4008. Le lecteur ci-dessus sert ce fichier, et la transcription affichée est bien la sienne.

    Test de compression : le même enregistrement encodé à 320 kbit/s (original), 96 kbit/s et 48 kbit/s, chacun transcrit avec des réglages identiques — Whisper large, langue fixée à l'anglais, diarisation désactivée, profil par défaut.

    Résultat : 9 segments sur 12 identiques aux trois débits. Les 3 qui diffèrent tombent tous entre 0:30 et 0:38, le passage où le locuteur abandonne et reprend une phrase. Chaque débit en a produit une lecture différente.

    Vitesse : 6,65 s de temps moteur pour 51,12 s d'audio (≈0,13× le temps réel). Chargement exclu.

    Chiffres de comparaison : multiplicateurs publiés par Audacity pour OpenVINO Whisper, de ~0,3× le temps réel (base) à ~3–5× (large-v3). La colonne « une heure » du tableau de vitesse est une arithmétique sur ces taux publiés, pas notre mesure.

    Transcription affichée : sortie brute du moteur. Les temps de début et de fin de chaque ligne sont mesurés ; la surbrillance mot à mot est interpolée à l'intérieur de chaque ligne mesurée, car notre backend actuel renvoie des temps par segment et non par mot.

    Un extrait, un jour donné. Publié pour que les affirmations puissent être répétées plutôt que crues.

    Dernière vérification : 27 juillet 2026

    FAQ

    Dictaphone transcrit-il les enregistrements ? Oui, sur du matériel compatible. L'app Dictaphone d'Apple transcrit les enregistrements sur iPhone 12 ou plus récent sous iOS 18, et sur un Mac sous macOS Sequoia avec une puce Apple. La page d'assistance d'Apple l'indique sans détour : la transcription nécessite macOS Sequoia et un Mac avec puce Apple, et elle n'est pas disponible dans tous les pays ou régions. Elle est proposée dans une dizaine de langues, dont l'anglais, l'espagnol, le portugais, l'italien, le français, l'allemand, le japonais, le coréen et le chinois.

    Peut-on transcrire un mémo vocal sur un ancien iPhone ou un Mac Intel ? Pas avec la transcription intégrée d'Apple. Un iPhone 11 ou antérieur et tout Mac Intel sortent des prérequis, quelle que soit la version d'iOS ou de macOS installée. Sur ces appareils, partagez le mémo sous forme de fichier et chargez-le dans un outil de transcription dans le navigateur, qui n'impose aucune exigence matérielle.

    Comment obtenir la transcription d'un mémo vocal ? Sur un appareil compatible, ouvrez l'enregistrement dans Dictaphone et touchez l'icône de transcription sous la forme d'onde, puis copiez le texte. Sur tout autre appareil, touchez le bouton de partage de l'enregistrement, enregistrez-le dans Fichiers en .m4a et chargez ce fichier dans un outil de transcription. La voie du navigateur donne en plus des horodatages et des formats d'export que la transcription intégrée ne propose pas.

    Comment convertir un mémo vocal en texte sur Android ? Android n'a pas d'équivalent intégré unique : la méthode dépend de votre app d'enregistrement. Exportez ou partagez l'enregistrement sous forme de fichier — généralement .m4a, .mp3, .amr ou .3gp — et chargez-le dans un outil de transcription. AMR et 3GP méritent une vérification avant de choisir un outil : plusieurs transcripteurs en ligne les refusent et demandent de convertir en MP3, ce qui ajoute un réencodage inutile.

    Faut-il compresser un mémo vocal avant de le charger ? Non, chargez l'original. Nous avons passé la même note vocale de 51 secondes dans notre pipeline à trois débits : l'original à 320 kbit/s, une copie à 96 kbit/s et une à 48 kbit/s. Neuf des douze segments de transcription sont revenus identiques dans les trois cas. Les trois qui diffèrent tombent tous dans le même passage de huit secondes où le locuteur reprend sa phrase, et chaque débit a lu ce marmonnement différemment. La compression ne dégrade pas la transcription uniformément : elle relance les dés sur les passages déjà peu clairs.

    Combien de temps prend la transcription d'un mémo vocal ? La transcription dans le cloud représente une fraction de la durée de l'enregistrement ; en local, elle peut en représenter plusieurs fois la durée. Notre pipeline a mis 6,65 secondes de temps moteur pour un mémo de 51 secondes, soit environ 0,13× le temps réel. Le plugin OpenVINO Whisper d'Audacity publie environ 0,3× le temps réel pour son modèle base et 3–5× pour large-v3 : un mémo d'une heure se compte donc en minutes dans le cloud et potentiellement en heures en local sur le plus gros modèle.

    Existe-t-il une application qui transcrit les mémos vocaux ? Sur un iPhone compatible, l'app Dictaphone est elle-même l'application : rien à installer. Au-delà, installer une app se justifie dans deux cas : quand vous voulez que chaque enregistrement soit transcrit automatiquement plutôt qu'un par un, et quand les enregistrements sont confidentiels et que vous voulez les transcrire sur l'appareil pour ne rien téléverser. Pour des conversions occasionnelles, un navigateur suffit.

    Comment transformer un mémo vocal en notes ? Transcrivez d'abord, structurez ensuite. La transcription brute de quelqu'un qui pense à voix haute n'est pas une prise de notes : elle contient des reprises, des hésitations et des répétitions, comme le montre la démo de cette page. Obtenez la transcription, puis utilisez un résumé par IA pour en extraire décisions et actions, ou réduisez-la vous-même. Transcrire et résumer sont deux étapes distinctes, et c'est cet ordre qui rend le résultat exploitable.

    Puis-je transcrire des mémos vocaux hors ligne et gratuitement ? Oui. Le plugin OpenVINO Whisper d'Audacity exécute le modèle Whisper d'OpenAI entièrement sur votre ordinateur, gratuitement sous Windows, Mac et Linux, sans plafond de minutes ni abonnement, et l'audio ne quitte jamais la machine. La contrepartie, c'est le temps et l'installation : vous installez un plugin, téléchargez un modèle, et le traitement prend environ 0,3× à 5× la durée de l'enregistrement selon le modèle choisi.

    Quels formats utilisent les mémos vocaux ? Dictaphone d'Apple enregistre en .m4a. Les enregistreurs Android varient : .m4a, .mp3, .amr et .3gp sont tous courants. Aucun n'a besoin d'être converti avant transcription — TranscribeNext accepte 27 extensions audio et vidéo, dont .amr, .3gp et .3g2 directement, donc vous pouvez charger ce que votre téléphone a produit.

    Sources

  • Apple — Afficher une transcription dans Dictaphone sur Mac (prérequis macOS Sequoia et puce Apple ; « pas disponible dans tous les pays ou régions ») — consulté le 27 juillet 2026
  • Apple — Afficher une transcription dans Dictaphone sur iPhone
  • Audacity — Transcription (plugin OpenVINO Whisper, fonctionnement hors ligne, tailles de modèle et multiplicateurs publiés, 99 langues)
  • HappyScribe, AudioScribe, TalkNotes, NoteGPT — offres gratuites, plafonds par fichier et formats acceptés tels que publiés sur leurs propres pages mémos vocaux, consultées en juillet 2026
  • David Blue — Voice Notes, la bibliothèque du domaine public dont provient l'extrait
  • Formats de chargement acceptés par TranscribeNext — lus dans la liste blanche de types MIME appliquée par notre validation d'upload, pas sur une page commerciale
  • Tarifs et limites des formules TranscribeNext · fonctionnalités · politique de confidentialité · TranscribeNext pour Mac
  • Tests audio et données de temps : pipeline de production TranscribeNext, 27 juillet 2026 — voir méthodologie
  • Guides associés : Messagerie vocale en texte · Comment convertir un M4A en texte · Comment transcrire un audio dans Word · Meilleures apps Mac pour transcrire de l'audio

    Transcrivez votre mémo vocal maintenant

    Si votre iPhone est éligible, la transcription est déjà dans l'app Dictaphone : ouvrez l'enregistrement et balayez vers le haut. Sinon, partagez le mémo sous forme de fichier et déposez-le dans le formulaire en haut de cette page : les 5 premières minutes sont gratuites et sans compte. Pour les mémos que vous préférez ne pas téléverser, TranscribeNext pour Mac les transcrit sur votre appareil.

    Voice Memos saves as M4A, so M4A transcription has the format specifics.

    Prêt à transcrire votre audio ?

    Essayez TranscribeNext gratuitement et découvrez la transcription par IA

    Démarrer l'essai gratuit — sans carte de crédit

    © 2026 TranscribeNext.com. All rights reserved.

    Transcrire des mémos vocaux : intégré, web gratuit et hors ligne comparés | TranscribeNext