Apples Sprachmemos-App kann Aufnahmen direkt transkribieren — auf dem iPhone 12 oder neuer mit iOS 18 sowie auf Macs mit macOS Sequoia und Apple Silicon. Auf älteren Geräten oder bei einer nicht unterstützten Sprache erscheint die Funktion nicht. In diesem Fall exportieren Sie das Memo als Datei und laden es in ein Transkriptionswerkzeug hoch.
Dieser Leitfaden erklärt beide Wege mit ihren jeweiligen Geräteanforderungen. Außerdem können Sie ein echtes Sprachmemo samt unbearbeitetem Transkript abspielen. Ein eigener Test zeigt, ob zusätzliche Komprimierung vor dem Upload das Ergebnis verändert.
Sprachmemo-Transkription auf einen Blick
| Eingebaut auf iPhone | iPhone 12 oder höher, iOS 18 |
| Eingebaut auf Mac | macOS Sequoia und Apple Silicon — Intel Macs ausgenommen |
| Eingebaute Sprachen | Etwa zehn, und nicht in jedem Land oder jeder Region |
| Bei nicht unterstützten Geräten | Datei teilen und hochladen; keine besondere Hardware erforderlich |
| Dateiformat | M4A auf dem iPhone; häufig M4A, MP3, AMR oder 3GP unter Android |
| Vorherige Konvertierung | Nicht erforderlich; zusätzliche Komprimierung kann schaden, siehe Test |
| Kostenlose Nutzung | Erste fünf Minuten ohne Konto; mit kostenlosem Konto drei Dateien pro Tag bis jeweils 50 MB |
| Geschwindigkeit | Cloud: 0,13-fache Echtzeit im Test; lokales Whisper: veröffentlichte Werte von 0,3- bis 5-facher Echtzeit |
- Hören Sie ein echtes Sprachmemo und sein Transkript
- Unterstützte Geräte und Sprachen
- So erhalten Sie ein Transkript in der Sprachmemos-App
- Sprachmemo außerhalb der Apple-App transkribieren
- Niemals ein Memo neu komprimieren - wir haben gemessen, warum
- Wie lange es dauert: Cloud vs. eigener Laptop
- Transkribieren von Memos offline kostenlos
- Kostenlose Webtools im Vergleich
- Ein Memo in brauchbare Notizen verwandeln
- Wo Memo-Transkription schief geht
- Testmethodik und -ergebnisse
- FAQ
- Quellen
Hören Sie ein echtes Sprachmemo und sein Transkript
Starten Sie die Wiedergabe. Zu hören ist eine echte Sprachnotiz: Jemand denkt laut, statt ein Skript vorzulesen. Das Transkript unter dem Player ist die unbearbeitete Ausgabe unserer Pipeline für genau diese Datei. Mit einem Klick auf eine Zeile springen Sie zur entsprechenden Stelle.
Der Clip ist bewusst nicht geglättet: Echte Sprachnotizen enthalten Satzabbrüche, Wiederholungen und spontane Korrekturen. Genau diese Stellen machen den Unterschied zwischen einem Rohtranskript und fertigen Notizen sichtbar.
So sieht ein realistisches Transkriptionsergebnis aus: nah am Gesprochenen, mit Satzzeichen und durchsuchbar — aber noch nicht als Notiz aufbereitet. Die Strukturierung folgt in einem zweiten Schritt.
Unterstützte Geräte und Sprachen
Die Funktion steht nicht auf jedem aktuellen Gerät zur Verfügung. Es gelten folgende Anforderungen:
| Gerät | Anforderungen | Außerhalb der Anforderungen |
|---|---|---|
| iPhone/iPad | iPhone 12 oder neuer mit iOS 18 | Auf dem iPhone 11 und älteren Modellen erscheint kein Transkript |
| Mac | macOS Sequoia und Apple Silicon | Auf Intel-Macs ist die Funktion unabhängig von der macOS-Version nicht verfügbar |
| Sprache | Etwa zehn, inkl. Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Japanisch, Koreanisch, Chinesisch | Kein Transkript in einer nicht unterstützten Sprache |
| Region | Laut Apple nicht in allen Ländern und Regionen verfügbar | Die Funktion kann auch auf kompatibler Hardware fehlen |
| Android | Keine einheitliche systemweite Lösung | Die Möglichkeiten hängen von der jeweiligen Aufnahme-App ab |
Vor allem die Mac-Anforderung überrascht viele Nutzer. Laut Apple benötigen Sie macOS Sequoia und einen Mac mit Apple Silicon. Auf einem Intel-Mac erscheint die Funktion auch mit einer aktuellen macOS-Version nicht; sie lässt sich dort nicht nachträglich aktivieren.
Erfüllt Ihr Gerät eine dieser Bedingungen nicht, wechseln Sie zur Uploadmethode. Sie funktioniert auch unter Android und Windows und unterstützt deutlich mehr Sprachen.
So erhalten Sie ein Transkript in der Sprachmemos-App
Auf einem unterstützten Gerät ist dies der schnellste Weg, weil die Aufnahme bereits in der richtigen App liegt:
1. Öffnen Sie Sprachmemos und wählen Sie die Aufnahme aus.
2. Tippen Sie auf das Transkriptsymbol unter der Wellenform. Auf dem iPhone müssen Sie den Wellenformbereich gegebenenfalls nach oben wischen.
3. Lesen Sie das Transkript und kopieren Sie den Text in die gewünschte App.
Beachten Sie zwei Einschränkungen. Das integrierte Transkript besteht nur aus Text: Es enthält keine navigierbaren Zeitstempel, keine Sprecherlabels und lässt sich nicht direkt als Dokument oder Untertiteldatei exportieren. Außerdem können Sie die Sprache nicht manuell vorgeben. Bei einer nicht unterstützten oder während der Aufnahme wechselnden Sprache kann das Ergebnis daher unvollständig bleiben.
Für Interviews, Vorlesungen oder andere Aufnahmen, die Sie mit Zeitangaben zitieren möchten, reicht diese Ausgabe meist nicht aus.
Sprachmemo außerhalb der Apple-App transkribieren
Bei der Uploadmethode entfallen die Hardwareanforderungen. Sie funktioniert unabhängig vom iPhone-Modell oder der macOS-Version und unterstützt 99 statt etwa zehn Sprachen.
1. Exportieren Sie die Datei. Tippen Sie in Sprachmemos auf die Aufnahme und anschließend auf Teilen. Speichern Sie sie in Dateien; Apple verwendet dabei M4A. Unter Android erhalten Sie je nach Aufnahme-App häufig M4A, MP3, AMR oder 3GP.
2. Laden Sie das Original hoch. Nutzen Sie das Formular oben oder den vollständigen Uploader. Konvertieren Sie die Datei nicht vorher; der nächste Abschnitt erklärt anhand einer Messung, weshalb.
3. Legen Sie bei Bedarf die Sprache fest. Die automatische Erkennung genügt meist bei klaren Aufnahmen in einer häufig verwendeten Sprache. Bei Akzenten, Hintergrundgeräuschen oder sehr kurzen Memos kann die manuelle Auswahl helfen.
4. Prüfen und exportieren Sie das Ergebnis. Korrigieren Sie insbesondere Namen und Zahlen. TXT und JSON stehen kostenlos zur Verfügung; DOCX, PDF, SRT und VTT gehören zu den kostenpflichtigen Tarifen.
Hinweis zu AMR und 3GP: Android-Recorder verwenden diese Formate seit Jahren. Manche Onlinedienste verlangen deshalb eine vorherige MP3-Konvertierung. TranscribeNext akzeptiert AMR, AMR-WB, 3GP und 3G2 sowie 23 weitere Dateiendungen direkt.
Warum Sie ein Sprachmemo nicht erneut komprimieren sollten
Der häufige Rat, ein Sprachmemo vor dem Upload in MP3 umzuwandeln, ist nicht nur unnötig: Die erneute Komprimierung kann gerade problematische Passagen verändern.
Für den Test haben wir das 51 Sekunden lange Sprachmemo aus der Demo in drei Varianten verarbeitet: das Original mit 320 kbit/s, eine Kopie mit 96 kbit/s und eine weitere mit 48 kbit/s. Modell und Einstellungen blieben identisch.
| Segment bei | 320 kbps (Original) | 96 kbps | 48 kbps |
|---|---|---|---|
| 9 von 12 Segmenten kamen über alle drei identisch zurück | |||
| 0:30 | …Du lässt es. | …Du lässt es. | …Du lässt es irgendwo. |
| 0:33 | Ich dachte also: kann es nicht bewegen... | Also werde ich kann es nicht bewegen... | Kann es nicht bewegen. Kann es nicht benutzen... |
| 0:38 | Das ist wahnsinnig. | Es ist wahnsinnig. | Das ist wahnsinnig. |
Aus dem Ergebnis lassen sich drei Punkte ableiten:
Die Kompression verschlechtert ein Transkript nicht gleichmäßig. Über einen 6,7-fachen Bitratenbereich waren drei Viertel des Transkripts bitidentisch. Die Engine wird nicht überall leise schlechter, wenn die Qualität sinkt.
Die Unterschiede konzentrieren sich auf bereits undeutliche Stellen. Alle drei Abweichungen liegen im acht Sekunden langen Abschnitt von 0:30 bis 0:38, in dem der Sprecher einen Satz abbricht und neu beginnt.
Jede Bitrate kann dieselbe undeutliche Passage anders interpretieren. Bei 96 kbit/s entstand ein unvollständiger Satz; bei 48 kbit/s entfiel der Fehlstart vollständig. Die erneute Kodierung erzeugt also keinen gleichmäßigen Qualitätsverlust, sondern verändert unvorhersehbar die mehrdeutigen Stellen.
Deshalb gilt: Laden Sie die Originaldatei Ihres Smartphones hoch. Prüfen Sie anschließend besonders die Passagen, in denen Sie leise oder undeutlich gesprochen haben. Genau dort wichen die Ergebnisse voneinander ab.
Wie lange es dauert: Cloud vs. eigener Laptop
Beide Wege funktionieren, unterscheiden sich aber deutlich bei Geschwindigkeit und Datenschutz. Lokale Verarbeitung hält die Datei auf dem eigenen Gerät, kann je nach Modell jedoch wesentlich länger dauern.
| Route | Geschwindigkeit | 1-Minuten-Memo | 1-stündiges Memo |
|---|---|---|---|
| Unsere Cloudpipeline | 0,13-fache Echtzeit (gemessen) | ca. 8 s | ca. 8 min |
| Audacity + OpenVINO, Basismodell | ~0,3x Echtzeit (veröffentlicht) | ~18 s | ~18 min |
| Audacity + OpenVINO, Large-v3 | ~3–5x Echtzeit (veröffentlicht) | ~3-5 min | ~3–5 h |
Die 0,13-fache Echtzeit ist die am Democlip gemessene reine Modelllaufzeit: 6,65 Sekunden für 51,12 Sekunden Audio. Die Audacity-Werte stammen aus den veröffentlichten Angaben des Projekts. Die Spalte für eine Stunde ist daraus berechnet und keine eigene Messung. Reale Werte variieren; außerdem ist die Uploadzeit nicht enthalten und kann bei mobilen Daten länger als die eigentliche Transkription dauern.
Lokale Transkription ist kostenlos und schützt vertrauliche Inhalte, kann mit großen Modellen aber mehrere Stunden beanspruchen. Wählen Sie sie deshalb vor allem dann, wenn der Datenschutz wichtiger als die Geschwindigkeit ist.
Transkribieren von Memos offline kostenlos
Bei vertraulichen Memos — etwa Kundengesprächen, medizinischen Notizen oder rechtlichen Angelegenheiten — besteht der Hauptvorteil lokaler Verarbeitung darin, dass die Audiodatei das Gerät nicht verlässt.
Audacity bietet eine kostenlose lokale Lösung. Das OpenVINO-Whisper-Plugin führt OpenAIs Whisper-Modell unter Windows, macOS und Linux vollständig auf Ihrem Computer aus — ohne Minutenlimit, Abonnement oder Wasserzeichen. Es stehen fünf Modellgrößen von `base` bis `large-v3` sowie eine Variante mit Sprechertrennung zur Verfügung. Der Aufwand liegt in der Installation des Plugins und Modells sowie in der längeren Verarbeitungszeit.
TranscribeNext für Mac verfolgt denselben lokalen Ansatz mit weniger Einrichtung: Ziehen Sie das Memo in die App, um es auf Apple Silicon mit Sprecherlabels zu transkribieren und in mehrere Formate zu exportieren. Die Cloud wird nur verwendet, wenn Sie sie ausdrücklich auswählen.
Für sensible Aufnahmen gilt unabhängig vom Werkzeug: Laden Sie sie nicht in einen Onlinedienst hoch, sondern verarbeiten Sie sie lokal.
Kostenlose Webtools im Vergleich
Die Angaben stammen von den jeweiligen Anbietern und wurden im Juli 2026 geprüft. Tarife und Limits können sich ändern.
| Kostenloser Tarif | Dateilimit | AMR / 3GP | Abspielbares Beispiel | |
|---|---|---|---|---|
| TranscribeNext | Erste 5 min, kein Konto; 3 Dateien/Tag mit einem kostenlosen Konto | 50 MB kostenlos · 2 GB Plus · 5 GB Premium | Ja, direkt | Ja — auf dieser Seite |
| HappyScribe | Erste 10 Minuten kostenlos | 45+ Formate | Nicht veröffentlicht | Nein |
| AudioScribe | Bis zu 5 min, keine Anmeldung | 100 MB | AMR laut Anbieter nicht unterstützt | Nein |
| TalkNotes | 1 Minute, kein Konto | 5 MB | Nicht veröffentlicht | Nein |
| NoteGPT | Kostenlose Variante; Stapel mit 20 Dateien | 5 GB pro Datei | Nicht veröffentlicht | Nein |
| Audacity (offline) | Unbegrenzt, kostenlos | Keine | Abhängig von den Decodern Ihres Builds | Nein |
Zwei Hinweise: Die zehn kostenlosen Minuten von HappyScribe sind unter den verglichenen Browsertools am großzügigsten. Der Anbieter nennt außerdem „bis zu 96 %“ Genauigkeit bei klarem Audio. Solche Eigenangaben werden jedoch nicht unter identischen Bedingungen gemessen und sind daher nicht direkt vergleichbar. Auf dieser Seite finden Sie stattdessen einen abspielbaren Clip und einen nachvollziehbaren Test.
Auch unser kostenloses Angebot ist begrenzt: Es umfasst eine Vorschau der ersten fünf Minuten. DOCX, PDF, SRT und VTT sind kostenpflichtig; im kostenlosen Tarif stehen TXT und JSON zur Verfügung.
Ein Sprachmemo in brauchbare Notizen verwandeln
Ein Rohtranskript ist noch keine brauchbare Notiz. Die Demo zeigt typische Satzabbrüche, Füllwörter und Wiederholungen, die vor der weiteren Verwendung strukturiert werden sollten.
Die zuverlässige Reihenfolge lautet: zuerst transkribieren, dann strukturieren.
1. Transkribieren Sie das Memo, damit der Wortlaut als durchsuchbarer Text vorliegt.
2. Fassen Sie Entscheidungen, Aufgaben und offene Fragen zusammen — entweder manuell oder mithilfe einer KI-Zusammenfassung.
Diese Reihenfolge erleichtert die Kontrolle. Bei einer direkt aus dem Audio erzeugten Zusammenfassung bleibt unklar, ob ein Fehler beim Erkennen oder beim Zusammenfassen entstanden ist. Mit dem Transkript können Sie beide Schritte getrennt prüfen.
Werkzeuge, die „Sprachmemos in Notizen“ als einzelne Funktion anbieten, führen im Hintergrund ebenfalls diese beiden Schritte nacheinander aus.
Wo Memo-Transkription schief geht
Bei Sprachmemos treten andere Fehler auf als bei Meetings: Man spricht meist allein und nah am Mikrofon, formuliert seine Gedanken aber spontan.
Ein anderes Werkzeug beseitigt diese Aufnahmeprobleme nicht zuverlässig. Prüfen Sie deshalb gezielt die Stellen, an denen Sie leise, undeutlich oder mitten im Gedanken gesprochen haben.
Testmethodik und -ergebnisse
Prüfdatum: 27. Juli 2026
Quelle: „Timelapse Excess“ aus David Blues Sammlung „Voice Notes“ — eine echte selbst aufgenommene und gemeinfreie Sprachnotiz. Länge: 51,1 s, mono, ursprünglich 48 kHz bei 320 kbit/s.
Ausgangsdatei: 2,95 MB; der größte Teil entfällt auf ein eingebettetes Coverbild mit 4008 × 4008 Pixeln. Der Player und das angezeigte Transkript verwenden genau diese Datei.
Kompressionstest: dieselbe Aufnahme mit 320 kbit/s (Original), 96 kbit/s und 48 kbit/s; identische Einstellungen: Whisper Large, Englisch, keine Sprechertrennung, Standardprofil.
Ergebnis: Alle drei abweichenden Segmente liegen zwischen 0:30 und 0:38 — genau dort, wo der Sprecher einen Satz abbricht und neu beginnt.
Geschwindigkeit: 6,65 s Modelllaufzeit für 51,12 s Audio (etwa 0,13-fache Echtzeit), ohne Upload.
Vergleichswerte: von Audacity veröffentlichte Werte für OpenVINO Whisper: etwa 0,3-fache Echtzeit mit dem Basismodell und 3- bis 5-fache Echtzeit mit Large v3. Die Stundenwerte in der Tabelle sind daraus berechnet und keine eigenen Messungen.
Angezeigtes Transkript: Start- und Endzeiten der Segmente sind gemessen. Die Hervorhebung einzelner Wörter wird innerhalb dieser Segmente interpoliert, weil das Backend derzeit Segment- statt Wortzeitstempel liefert.
Die Daten stammen aus einem einzelnen Clip und sind vollständig angegeben, damit sich der Test nachvollziehen lässt.
Zuletzt geprüft: 27. Juli 2026
FAQ
Transkribiert die Sprachmemos-App Aufnahmen? Ja, auf unterstützter Hardware. Dafür benötigen Sie ein iPhone 12 oder neuer mit iOS 18 beziehungsweise einen Mac mit macOS Sequoia und Apple Silicon. Die Funktion ist nicht in allen Ländern und Regionen verfügbar und unterstützt etwa zehn Sprachen.
Kann ich ein Sprachmemo auf einem älteren iPhone oder Intel-Mac transkribieren? Nicht mit Apples integrierter Funktion. Das iPhone 11 und ältere Modelle sowie alle Intel-Macs erfüllen die Hardwareanforderungen nicht. Sie können die Datei jedoch exportieren und mit einem anderen Werkzeug transkribieren.
Wie erhalte ich ein Transkript eines Sprachmemos? Öffnen Sie die Aufnahme auf einem unterstützten Apple-Gerät und tippen Sie unter der Wellenform auf das Transkriptsymbol. Andernfalls wählen Sie Teilen, speichern die Aufnahme als M4A-Datei und laden sie in ein Transkriptionswerkzeug hoch. Browserdienste bieten häufig zusätzlich Zeitstempel und Exportformate.
Wie wandle ich ein Sprachmemo unter Android in Text um? Exportieren oder teilen Sie die Aufnahme aus Ihrer Recorder-App und laden Sie die Datei in ein Transkriptionswerkzeug hoch. Häufige Formate sind M4A, MP3, AMR und 3GP. Prüfen Sie insbesondere bei AMR und 3GP vorab die Formatunterstützung, um eine unnötige MP3-Konvertierung zu vermeiden.
Soll ich ein Sprachmemo vor dem Upload komprimieren? Nein. Laden Sie die Originaldatei hoch. In unserem Test blieben neun von zwölf Segmenten über drei Bitraten hinweg identisch. Alle Abweichungen lagen in einer bereits undeutlichen Passage. Zusätzliche Komprimierung verschlechtert also nicht jede Stelle gleich, kann aber gerade mehrdeutige Abschnitte verändern.
Wie lange dauert die Transkription eines Sprachmemos? Cloudverarbeitung benötigt meist nur einen Bruchteil der Aufnahmelänge. In unserem Test waren es 6,65 Sekunden Modelllaufzeit für 51 Sekunden Audio. Lokale Verarbeitung kann je nach Modell länger dauern; Audacity nennt für OpenVINO Whisper etwa 0,3-fache Echtzeit mit dem Basismodell und 3- bis 5-fache Echtzeit mit Large v3.
Gibt es eine App, die Sprachmemos transkribiert? Auf einem unterstützten iPhone genügt die vorinstallierte Sprachmemos-App. Eine zusätzliche App lohnt sich vor allem für viele Aufnahmen oder für vertrauliche Inhalte, die ausschließlich lokal verarbeitet werden sollen. Für gelegentliche Konvertierungen reicht meist ein Browserdienst.
Wie kann ich ein Sprachmemo in Notizen umwandeln? Transkribieren Sie zuerst den Wortlaut und strukturieren Sie ihn anschließend. Entfernen Sie Satzabbrüche und Wiederholungen und fassen Sie Entscheidungen, Aufgaben und offene Fragen entweder manuell oder per KI zusammen.
Kann ich Sprachmemos offline kostenlos transkribieren? Ja. Audacitys OpenVINO-Whisper-Plugin läuft kostenlos unter Windows, macOS und Linux und verarbeitet die Datei vollständig lokal. Dafür müssen Sie das Plugin und ein Modell installieren; je nach Modell dauert die Verarbeitung etwa das 0,3- bis 5-Fache der Aufnahmelänge.
Welche Audioformate verwenden Sprachmemos? Apple speichert Sprachmemos in der Regel als M4A. Android-Recorder verwenden häufig M4A, MP3, AMR oder 3GP. TranscribeNext akzeptiert diese Formate direkt; eine vorherige Konvertierung ist nicht erforderlich.
Quellen
Verwandte Anleitungen: Voicemail in Text · Wie konvertiert man M4A in Text · Wie transkribiert man Audio in Word · Beste Mac-Apps für die Transkription von Audio
Sprachmemo jetzt transkribieren
Auf einem unterstützten iPhone finden Sie das Transkript direkt in der Sprachmemos-App. Andernfalls teilen Sie die Aufnahme als Datei und laden sie über das Formular oben hoch. Die ersten fünf Minuten können Sie ohne Konto kostenlos transkribieren.
Apple speichert Sprachmemos als M4A. Weitere Formatdetails finden Sie unter M4A-Transkription. Für lange Aufnahmen hilft außerdem der Leitfaden zur Arbeit mit Zeitstempeln.