TranscribeNextTranscribeNext.com
BlogAnleitung

Sprachmemos transkribieren

🎧

TranscribeNext-Team

12 Min. Lesezeit
Voice-MemosSprachmemo in TextAudio zu TextTranskriptioniphonemacKI

Apples Sprachmemos-App kann Aufnahmen direkt transkribieren — auf dem iPhone 12 oder neuer mit iOS 18 sowie auf Macs mit macOS Sequoia und Apple Silicon. Auf älteren Geräten oder bei einer nicht unterstützten Sprache erscheint die Funktion nicht. In diesem Fall exportieren Sie das Memo als Datei und laden es in ein Transkriptionswerkzeug hoch.

Kostenlos

Dieser Leitfaden erklärt beide Wege mit ihren jeweiligen Geräteanforderungen. Außerdem können Sie ein echtes Sprachmemo samt unbearbeitetem Transkript abspielen. Ein eigener Test zeigt, ob zusätzliche Komprimierung vor dem Upload das Ergebnis verändert.

Sprachmemo-Transkription auf einen Blick

Eingebaut auf iPhoneiPhone 12 oder höher, iOS 18
Eingebaut auf MacmacOS Sequoia und Apple Silicon — Intel Macs ausgenommen
Eingebaute SprachenEtwa zehn, und nicht in jedem Land oder jeder Region
Bei nicht unterstützten GerätenDatei teilen und hochladen; keine besondere Hardware erforderlich
DateiformatM4A auf dem iPhone; häufig M4A, MP3, AMR oder 3GP unter Android
Vorherige KonvertierungNicht erforderlich; zusätzliche Komprimierung kann schaden, siehe Test
Kostenlose NutzungErste fünf Minuten ohne Konto; mit kostenlosem Konto drei Dateien pro Tag bis jeweils 50 MB
GeschwindigkeitCloud: 0,13-fache Echtzeit im Test; lokales Whisper: veröffentlichte Werte von 0,3- bis 5-facher Echtzeit

Hören Sie ein echtes Sprachmemo und sein Transkript

Starten Sie die Wiedergabe. Zu hören ist eine echte Sprachnotiz: Jemand denkt laut, statt ein Skript vorzulesen. Das Transkript unter dem Player ist die unbearbeitete Ausgabe unserer Pipeline für genau diese Datei. Mit einem Klick auf eine Zeile springen Sie zur entsprechenden Stelle.

Eine echte Sprachmemo mit Transkript anhören
Gemeinfreie Sprachmemo · 0:51 · unbearbeitetes Transkript
0:00 / 0:50
Quelle: „Timelapse Excess“ aus David Blues gemeinfreier Voice-Notes-Sammlung (archive.org, Public Domain Mark; das Repository des Autors enthält außerdem eine Unlicense-Freigabe). Für das Web wurde die Datei in Mono mit 48 kbit/s neu codiert. Das Transkript ist die unbearbeitete Ausgabe unserer Verarbeitung dieser Datei. Die Zeilenzeiten wurden gemessen; die Hervorhebung einzelner Wörter wird innerhalb jeder Zeile interpoliert.

Der Clip ist bewusst nicht geglättet: Echte Sprachnotizen enthalten Satzabbrüche, Wiederholungen und spontane Korrekturen. Genau diese Stellen machen den Unterschied zwischen einem Rohtranskript und fertigen Notizen sichtbar.

So sieht ein realistisches Transkriptionsergebnis aus: nah am Gesprochenen, mit Satzzeichen und durchsuchbar — aber noch nicht als Notiz aufbereitet. Die Strukturierung folgt in einem zweiten Schritt.

Unterstützte Geräte und Sprachen

Die Funktion steht nicht auf jedem aktuellen Gerät zur Verfügung. Es gelten folgende Anforderungen:

GerätAnforderungenAußerhalb der Anforderungen
iPhone/iPadiPhone 12 oder neuer mit iOS 18Auf dem iPhone 11 und älteren Modellen erscheint kein Transkript
MacmacOS Sequoia und Apple SiliconAuf Intel-Macs ist die Funktion unabhängig von der macOS-Version nicht verfügbar
SpracheEtwa zehn, inkl. Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Japanisch, Koreanisch, ChinesischKein Transkript in einer nicht unterstützten Sprache
RegionLaut Apple nicht in allen Ländern und Regionen verfügbarDie Funktion kann auch auf kompatibler Hardware fehlen
AndroidKeine einheitliche systemweite LösungDie Möglichkeiten hängen von der jeweiligen Aufnahme-App ab

Vor allem die Mac-Anforderung überrascht viele Nutzer. Laut Apple benötigen Sie macOS Sequoia und einen Mac mit Apple Silicon. Auf einem Intel-Mac erscheint die Funktion auch mit einer aktuellen macOS-Version nicht; sie lässt sich dort nicht nachträglich aktivieren.

Erfüllt Ihr Gerät eine dieser Bedingungen nicht, wechseln Sie zur Uploadmethode. Sie funktioniert auch unter Android und Windows und unterstützt deutlich mehr Sprachen.

So erhalten Sie ein Transkript in der Sprachmemos-App

Auf einem unterstützten Gerät ist dies der schnellste Weg, weil die Aufnahme bereits in der richtigen App liegt:

1. Öffnen Sie Sprachmemos und wählen Sie die Aufnahme aus.

2. Tippen Sie auf das Transkriptsymbol unter der Wellenform. Auf dem iPhone müssen Sie den Wellenformbereich gegebenenfalls nach oben wischen.

3. Lesen Sie das Transkript und kopieren Sie den Text in die gewünschte App.

Beachten Sie zwei Einschränkungen. Das integrierte Transkript besteht nur aus Text: Es enthält keine navigierbaren Zeitstempel, keine Sprecherlabels und lässt sich nicht direkt als Dokument oder Untertiteldatei exportieren. Außerdem können Sie die Sprache nicht manuell vorgeben. Bei einer nicht unterstützten oder während der Aufnahme wechselnden Sprache kann das Ergebnis daher unvollständig bleiben.

Für Interviews, Vorlesungen oder andere Aufnahmen, die Sie mit Zeitangaben zitieren möchten, reicht diese Ausgabe meist nicht aus.

Sprachmemo außerhalb der Apple-App transkribieren

Bei der Uploadmethode entfallen die Hardwareanforderungen. Sie funktioniert unabhängig vom iPhone-Modell oder der macOS-Version und unterstützt 99 statt etwa zehn Sprachen.

1. Exportieren Sie die Datei. Tippen Sie in Sprachmemos auf die Aufnahme und anschließend auf Teilen. Speichern Sie sie in Dateien; Apple verwendet dabei M4A. Unter Android erhalten Sie je nach Aufnahme-App häufig M4A, MP3, AMR oder 3GP.

2. Laden Sie das Original hoch. Nutzen Sie das Formular oben oder den vollständigen Uploader. Konvertieren Sie die Datei nicht vorher; der nächste Abschnitt erklärt anhand einer Messung, weshalb.

3. Legen Sie bei Bedarf die Sprache fest. Die automatische Erkennung genügt meist bei klaren Aufnahmen in einer häufig verwendeten Sprache. Bei Akzenten, Hintergrundgeräuschen oder sehr kurzen Memos kann die manuelle Auswahl helfen.

4. Prüfen und exportieren Sie das Ergebnis. Korrigieren Sie insbesondere Namen und Zahlen. TXT und JSON stehen kostenlos zur Verfügung; DOCX, PDF, SRT und VTT gehören zu den kostenpflichtigen Tarifen.

Hinweis zu AMR und 3GP: Android-Recorder verwenden diese Formate seit Jahren. Manche Onlinedienste verlangen deshalb eine vorherige MP3-Konvertierung. TranscribeNext akzeptiert AMR, AMR-WB, 3GP und 3G2 sowie 23 weitere Dateiendungen direkt.

Warum Sie ein Sprachmemo nicht erneut komprimieren sollten

Der häufige Rat, ein Sprachmemo vor dem Upload in MP3 umzuwandeln, ist nicht nur unnötig: Die erneute Komprimierung kann gerade problematische Passagen verändern.

Für den Test haben wir das 51 Sekunden lange Sprachmemo aus der Demo in drei Varianten verarbeitet: das Original mit 320 kbit/s, eine Kopie mit 96 kbit/s und eine weitere mit 48 kbit/s. Modell und Einstellungen blieben identisch.

Segment bei320 kbps (Original)96 kbps48 kbps
9 von 12 Segmenten kamen über alle drei identisch zurück
0:30…Du lässt es.…Du lässt es.…Du lässt es irgendwo.
0:33Ich dachte also: kann es nicht bewegen...Also werde ich kann es nicht bewegen...Kann es nicht bewegen. Kann es nicht benutzen...
0:38Das ist wahnsinnig.Es ist wahnsinnig.Das ist wahnsinnig.

Aus dem Ergebnis lassen sich drei Punkte ableiten:

Die Kompression verschlechtert ein Transkript nicht gleichmäßig. Über einen 6,7-fachen Bitratenbereich waren drei Viertel des Transkripts bitidentisch. Die Engine wird nicht überall leise schlechter, wenn die Qualität sinkt.

Die Unterschiede konzentrieren sich auf bereits undeutliche Stellen. Alle drei Abweichungen liegen im acht Sekunden langen Abschnitt von 0:30 bis 0:38, in dem der Sprecher einen Satz abbricht und neu beginnt.

Jede Bitrate kann dieselbe undeutliche Passage anders interpretieren. Bei 96 kbit/s entstand ein unvollständiger Satz; bei 48 kbit/s entfiel der Fehlstart vollständig. Die erneute Kodierung erzeugt also keinen gleichmäßigen Qualitätsverlust, sondern verändert unvorhersehbar die mehrdeutigen Stellen.

Deshalb gilt: Laden Sie die Originaldatei Ihres Smartphones hoch. Prüfen Sie anschließend besonders die Passagen, in denen Sie leise oder undeutlich gesprochen haben. Genau dort wichen die Ergebnisse voneinander ab.

Wie lange es dauert: Cloud vs. eigener Laptop

Beide Wege funktionieren, unterscheiden sich aber deutlich bei Geschwindigkeit und Datenschutz. Lokale Verarbeitung hält die Datei auf dem eigenen Gerät, kann je nach Modell jedoch wesentlich länger dauern.

RouteGeschwindigkeit1-Minuten-Memo1-stündiges Memo
Unsere Cloudpipeline0,13-fache Echtzeit (gemessen)ca. 8 sca. 8 min
Audacity + OpenVINO, Basismodell~0,3x Echtzeit (veröffentlicht)~18 s~18 min
Audacity + OpenVINO, Large-v3~3–5x Echtzeit (veröffentlicht)~3-5 min~3–5 h

Die 0,13-fache Echtzeit ist die am Democlip gemessene reine Modelllaufzeit: 6,65 Sekunden für 51,12 Sekunden Audio. Die Audacity-Werte stammen aus den veröffentlichten Angaben des Projekts. Die Spalte für eine Stunde ist daraus berechnet und keine eigene Messung. Reale Werte variieren; außerdem ist die Uploadzeit nicht enthalten und kann bei mobilen Daten länger als die eigentliche Transkription dauern.

Lokale Transkription ist kostenlos und schützt vertrauliche Inhalte, kann mit großen Modellen aber mehrere Stunden beanspruchen. Wählen Sie sie deshalb vor allem dann, wenn der Datenschutz wichtiger als die Geschwindigkeit ist.

Transkribieren von Memos offline kostenlos

Bei vertraulichen Memos — etwa Kundengesprächen, medizinischen Notizen oder rechtlichen Angelegenheiten — besteht der Hauptvorteil lokaler Verarbeitung darin, dass die Audiodatei das Gerät nicht verlässt.

Audacity bietet eine kostenlose lokale Lösung. Das OpenVINO-Whisper-Plugin führt OpenAIs Whisper-Modell unter Windows, macOS und Linux vollständig auf Ihrem Computer aus — ohne Minutenlimit, Abonnement oder Wasserzeichen. Es stehen fünf Modellgrößen von `base` bis `large-v3` sowie eine Variante mit Sprechertrennung zur Verfügung. Der Aufwand liegt in der Installation des Plugins und Modells sowie in der längeren Verarbeitungszeit.

TranscribeNext für Mac verfolgt denselben lokalen Ansatz mit weniger Einrichtung: Ziehen Sie das Memo in die App, um es auf Apple Silicon mit Sprecherlabels zu transkribieren und in mehrere Formate zu exportieren. Die Cloud wird nur verwendet, wenn Sie sie ausdrücklich auswählen.

Für sensible Aufnahmen gilt unabhängig vom Werkzeug: Laden Sie sie nicht in einen Onlinedienst hoch, sondern verarbeiten Sie sie lokal.

Kostenlose Webtools im Vergleich

Die Angaben stammen von den jeweiligen Anbietern und wurden im Juli 2026 geprüft. Tarife und Limits können sich ändern.

Kostenloser TarifDateilimitAMR / 3GPAbspielbares Beispiel
TranscribeNextErste 5 min, kein Konto; 3 Dateien/Tag mit einem kostenlosen Konto50 MB kostenlos · 2 GB Plus · 5 GB PremiumJa, direktJa — auf dieser Seite
HappyScribeErste 10 Minuten kostenlos45+ FormateNicht veröffentlichtNein
AudioScribeBis zu 5 min, keine Anmeldung100 MBAMR laut Anbieter nicht unterstütztNein
TalkNotes1 Minute, kein Konto5 MBNicht veröffentlichtNein
NoteGPTKostenlose Variante; Stapel mit 20 Dateien5 GB pro DateiNicht veröffentlichtNein
Audacity (offline)Unbegrenzt, kostenlosKeineAbhängig von den Decodern Ihres BuildsNein

Zwei Hinweise: Die zehn kostenlosen Minuten von HappyScribe sind unter den verglichenen Browsertools am großzügigsten. Der Anbieter nennt außerdem „bis zu 96 %“ Genauigkeit bei klarem Audio. Solche Eigenangaben werden jedoch nicht unter identischen Bedingungen gemessen und sind daher nicht direkt vergleichbar. Auf dieser Seite finden Sie stattdessen einen abspielbaren Clip und einen nachvollziehbaren Test.

Auch unser kostenloses Angebot ist begrenzt: Es umfasst eine Vorschau der ersten fünf Minuten. DOCX, PDF, SRT und VTT sind kostenpflichtig; im kostenlosen Tarif stehen TXT und JSON zur Verfügung.

Ein Sprachmemo in brauchbare Notizen verwandeln

Ein Rohtranskript ist noch keine brauchbare Notiz. Die Demo zeigt typische Satzabbrüche, Füllwörter und Wiederholungen, die vor der weiteren Verwendung strukturiert werden sollten.

Die zuverlässige Reihenfolge lautet: zuerst transkribieren, dann strukturieren.

1. Transkribieren Sie das Memo, damit der Wortlaut als durchsuchbarer Text vorliegt.

2. Fassen Sie Entscheidungen, Aufgaben und offene Fragen zusammen — entweder manuell oder mithilfe einer KI-Zusammenfassung.

Diese Reihenfolge erleichtert die Kontrolle. Bei einer direkt aus dem Audio erzeugten Zusammenfassung bleibt unklar, ob ein Fehler beim Erkennen oder beim Zusammenfassen entstanden ist. Mit dem Transkript können Sie beide Schritte getrennt prüfen.

Werkzeuge, die „Sprachmemos in Notizen“ als einzelne Funktion anbieten, führen im Hintergrund ebenfalls diese beiden Schritte nacheinander aus.

Wo Memo-Transkription schief geht

Bei Sprachmemos treten andere Fehler auf als bei Meetings: Man spricht meist allein und nah am Mikrofon, formuliert seine Gedanken aber spontan.

  • Satzabbrüche und Neustarts: Sie verursachen besonders häufig unverständliche Transkriptzeilen. Im Bitratentest wichen alle Versionen genau an einer solchen Stelle voneinander ab.
  • Leiser werdende Satzenden. Memos enden oft mitten im Gedanken, bei sinkender Lautstärke, was das härteste Audio in der Datei ist.
  • Namen und Nummern. Eine Telefonnummer oder der Name einer Person, die in ein Memo diktiert wird, ist der wertvollste und am wenigsten zuverlässige Teil des Transkripts.
  • Aufnahmen in Bewegung: Schritte, Fahrgeräusche und Wind treten bei Memos häufiger auf als in Meetings.
  • Jargon und Kurzschrift. Sie sprechen mit sich selbst in Abkürzungen, die kein Modell gehört hat.
  • Sprachwechsel: Ein Wechsel mitten im Memo kann sowohl die automatische Erkennung als auch eine fest eingestellte Sprache überfordern.
  • Sehr kurze Memos: Bei fünf Sekunden Audio fehlt dem Modell oft der nötige Kontext.
  • Ein anderes Werkzeug beseitigt diese Aufnahmeprobleme nicht zuverlässig. Prüfen Sie deshalb gezielt die Stellen, an denen Sie leise, undeutlich oder mitten im Gedanken gesprochen haben.

    Testmethodik und -ergebnisse

    Prüfdatum: 27. Juli 2026

    Quelle: „Timelapse Excess“ aus David Blues Sammlung „Voice Notes“ — eine echte selbst aufgenommene und gemeinfreie Sprachnotiz. Länge: 51,1 s, mono, ursprünglich 48 kHz bei 320 kbit/s.

    Ausgangsdatei: 2,95 MB; der größte Teil entfällt auf ein eingebettetes Coverbild mit 4008 × 4008 Pixeln. Der Player und das angezeigte Transkript verwenden genau diese Datei.

    Kompressionstest: dieselbe Aufnahme mit 320 kbit/s (Original), 96 kbit/s und 48 kbit/s; identische Einstellungen: Whisper Large, Englisch, keine Sprechertrennung, Standardprofil.

    Ergebnis: Alle drei abweichenden Segmente liegen zwischen 0:30 und 0:38 — genau dort, wo der Sprecher einen Satz abbricht und neu beginnt.

    Geschwindigkeit: 6,65 s Modelllaufzeit für 51,12 s Audio (etwa 0,13-fache Echtzeit), ohne Upload.

    Vergleichswerte: von Audacity veröffentlichte Werte für OpenVINO Whisper: etwa 0,3-fache Echtzeit mit dem Basismodell und 3- bis 5-fache Echtzeit mit Large v3. Die Stundenwerte in der Tabelle sind daraus berechnet und keine eigenen Messungen.

    Angezeigtes Transkript: Start- und Endzeiten der Segmente sind gemessen. Die Hervorhebung einzelner Wörter wird innerhalb dieser Segmente interpoliert, weil das Backend derzeit Segment- statt Wortzeitstempel liefert.

    Die Daten stammen aus einem einzelnen Clip und sind vollständig angegeben, damit sich der Test nachvollziehen lässt.

    Zuletzt geprüft: 27. Juli 2026

    FAQ

    Transkribiert die Sprachmemos-App Aufnahmen? Ja, auf unterstützter Hardware. Dafür benötigen Sie ein iPhone 12 oder neuer mit iOS 18 beziehungsweise einen Mac mit macOS Sequoia und Apple Silicon. Die Funktion ist nicht in allen Ländern und Regionen verfügbar und unterstützt etwa zehn Sprachen.

    Kann ich ein Sprachmemo auf einem älteren iPhone oder Intel-Mac transkribieren? Nicht mit Apples integrierter Funktion. Das iPhone 11 und ältere Modelle sowie alle Intel-Macs erfüllen die Hardwareanforderungen nicht. Sie können die Datei jedoch exportieren und mit einem anderen Werkzeug transkribieren.

    Wie erhalte ich ein Transkript eines Sprachmemos? Öffnen Sie die Aufnahme auf einem unterstützten Apple-Gerät und tippen Sie unter der Wellenform auf das Transkriptsymbol. Andernfalls wählen Sie Teilen, speichern die Aufnahme als M4A-Datei und laden sie in ein Transkriptionswerkzeug hoch. Browserdienste bieten häufig zusätzlich Zeitstempel und Exportformate.

    Wie wandle ich ein Sprachmemo unter Android in Text um? Exportieren oder teilen Sie die Aufnahme aus Ihrer Recorder-App und laden Sie die Datei in ein Transkriptionswerkzeug hoch. Häufige Formate sind M4A, MP3, AMR und 3GP. Prüfen Sie insbesondere bei AMR und 3GP vorab die Formatunterstützung, um eine unnötige MP3-Konvertierung zu vermeiden.

    Soll ich ein Sprachmemo vor dem Upload komprimieren? Nein. Laden Sie die Originaldatei hoch. In unserem Test blieben neun von zwölf Segmenten über drei Bitraten hinweg identisch. Alle Abweichungen lagen in einer bereits undeutlichen Passage. Zusätzliche Komprimierung verschlechtert also nicht jede Stelle gleich, kann aber gerade mehrdeutige Abschnitte verändern.

    Wie lange dauert die Transkription eines Sprachmemos? Cloudverarbeitung benötigt meist nur einen Bruchteil der Aufnahmelänge. In unserem Test waren es 6,65 Sekunden Modelllaufzeit für 51 Sekunden Audio. Lokale Verarbeitung kann je nach Modell länger dauern; Audacity nennt für OpenVINO Whisper etwa 0,3-fache Echtzeit mit dem Basismodell und 3- bis 5-fache Echtzeit mit Large v3.

    Gibt es eine App, die Sprachmemos transkribiert? Auf einem unterstützten iPhone genügt die vorinstallierte Sprachmemos-App. Eine zusätzliche App lohnt sich vor allem für viele Aufnahmen oder für vertrauliche Inhalte, die ausschließlich lokal verarbeitet werden sollen. Für gelegentliche Konvertierungen reicht meist ein Browserdienst.

    Wie kann ich ein Sprachmemo in Notizen umwandeln? Transkribieren Sie zuerst den Wortlaut und strukturieren Sie ihn anschließend. Entfernen Sie Satzabbrüche und Wiederholungen und fassen Sie Entscheidungen, Aufgaben und offene Fragen entweder manuell oder per KI zusammen.

    Kann ich Sprachmemos offline kostenlos transkribieren? Ja. Audacitys OpenVINO-Whisper-Plugin läuft kostenlos unter Windows, macOS und Linux und verarbeitet die Datei vollständig lokal. Dafür müssen Sie das Plugin und ein Modell installieren; je nach Modell dauert die Verarbeitung etwa das 0,3- bis 5-Fache der Aufnahmelänge.

    Welche Audioformate verwenden Sprachmemos? Apple speichert Sprachmemos in der Regel als M4A. Android-Recorder verwenden häufig M4A, MP3, AMR oder 3GP. TranscribeNext akzeptiert diese Formate direkt; eine vorherige Konvertierung ist nicht erforderlich.

    Quellen

  • Apple: Transkript einer Aufnahme auf dem Mac anzeigen — Anforderungen für macOS Sequoia und Apple Silicon; geprüft am 27. Juli 2026
  • Apple: Transkript einer Aufnahme auf dem iPhone anzeigen
  • Audacity: Transkription — OpenVINO Whisper, Offlinebetrieb, Modellgrößen, Geschwindigkeitsangaben und 99 Sprachen
  • HappyScribe, AudioScribe, TalkNotes, NoteGPT — kostenlose Tarife, Dateilimits und unterstützte Formate; geprüft im Juli 2026
  • David Blue: Voice Notes — gemeinfreie Quelle des Democlips
  • Unterstützte Uploadformate von TranscribeNext — direkt aus der MIME-Whitelist der Uploadvalidierung
  • Preise und Tariflimits · Funktionen · Datenschutzerklärung · TranscribeNext für Mac
  • Audiotest und Zeitmessung: produktive TranscribeNext-Pipeline, 27. Juli 2026 — siehe Methodik
  • Verwandte Anleitungen: Voicemail in Text · Wie konvertiert man M4A in Text · Wie transkribiert man Audio in Word · Beste Mac-Apps für die Transkription von Audio

    Sprachmemo jetzt transkribieren

    Auf einem unterstützten iPhone finden Sie das Transkript direkt in der Sprachmemos-App. Andernfalls teilen Sie die Aufnahme als Datei und laden sie über das Formular oben hoch. Die ersten fünf Minuten können Sie ohne Konto kostenlos transkribieren.

    Apple speichert Sprachmemos als M4A. Weitere Formatdetails finden Sie unter M4A-Transkription. Für lange Aufnahmen hilft außerdem der Leitfaden zur Arbeit mit Zeitstempeln.

    Bereit, Ihr Audio zu transkribieren?

    Versuchen Sie TranscribeNext kostenlos und erleben Sie KI-gestützte Transkription

    Kostenlos starten — keine Kreditkarte erforderlich

    © 2026 TranscribeNext.com. Alle Rechte vorbehalten.

    Sprachmemos transkribieren: integrierte, webbasierte und Offline-Methoden im Vergleich | TranscribeNext