TranscribeNextTranscribeNext.com
BlogGuida

Esempio di trascrizione da audio a testo: 3 registrazioni reali che puoi riprodurre (2026)

📝

Team di TranscribeNext

12 minuti di lettura
esempio di trascrizioneesempio di trascrizioneaudio in testoetichette dei parlantiparola per parola

Un esempio di trascrizione da audio a testo mostra come si presentano le parole pronunciate una volta messe per iscritto: timestamp a sinistra, un blocco per ogni turno di parola e un’etichetta ogni volta che cambia il parlante. I due stili standard sono il verbatim ripulito, che elimina le interiezioni, e il verbatim integrale, che conserva ogni “ehm” e falsa partenza.

Gratis

Su questo punto tutte le guide concordano. Quasi nessuna, però, permette di ascoltare l’audio da cui proviene l’esempio.

È una differenza importante. La trascrizione di una voce nitida registrata in studio e quella di quattro persone attorno a un tavolo con un solo microfono al centro non si assomigliano affatto. Di seguito trovi tre registrazioni reali — una riunione, un’intervista e un messaggio vocale — ciascuna accompagnata dalla trascrizione prodotta dalla nostra pipeline e sincronizzata parola per parola con la riproduzione. Non abbiamo riscritto né riordinato nulla.

Per la riunione, il corpus di origine mette a disposizione una trascrizione umana di riferimento. Nell’ultima sezione la confrontiamo con il nostro risultato e calcoliamo il tasso di errore esatto.

Esempio 1: una riunione, tre parlanti, un microfono distante

Premi Riproduci. L'evidenziazione segue la parola pronunciata; l'etichetta del parlante cambia quando cambia la voce.

Hear a real meeting and its transcript
AMI corpus · single distant microphone · 3 speakers · 0:48
0:00 / 0:48
Source: meeting EN2002a from the AMI Meeting Corpus (CC BY 4.0), recorded on a single microphone in the middle of the table — the hardest realistic condition, which is why it was chosen. The transcript and speaker labels are the unedited output of our pipeline on this excerpt: 163 words across 10 segments and 2 detected voices, against a human reference of 208 words, 20 utterances and 3 voices. Word error rate on this excerpt is 30.8%. Both line and word timings here are measured, not interpolated — this run returned per-word boundaries.

Questo è volutamente il caso più difficile. Il microfono non è fissato al bavero di nessuno: si trova al centro del tavolo e registra le tre persone da lontano, insieme ai rumori della stanza. I partecipanti si interrompono e parlano uno sopra l’altro.

Ecco alcuni aspetti da osservare, perché mostrano che cosa accade in una vera trascrizione di una riunione:

  • Una riga si ripete. A 0:19 la domanda “Quindi dovevi scriverlo nel modo in cui lo hanno scritto, è quello che hai fatto?” è seguita, a 0:21, da “È quello che hai fatto?” isolato. Nessuno l’ha pronunciata due volte: è l’effetto del parlato sovrapposto sulla trascrizione.
  • La sovrapposizione stessa è scomparsa. Nel riferimento umano, le espressioni si sovrappongono costantemente: una seconda voce inizia prima che la prima si interrompa. Nella nostra trascrizione non si sovrappongono affatto: i segmenti sono disposti uno dopo l'altro, perché l'output deve essere leggibile in una colonna. Ciò che era simultaneo diventa sequenziale.
  • Mancano le reazioni brevi. Nel riferimento, in questi 48 secondi tre persone dicono “okay”, “right”, “okeydoke” e “mm-hmm”. La maggior parte di queste reazioni non compare nella nostra trascrizione.
  • Quest’ultimo punto è un limite concreto di tutti i sistemi automatici quando l’audio viene registrato da lontano. Più avanti lo quantifichiamo con un dato preciso.

    Esempio 2: un'intervista, microfono vicino

    Hear the interview and read its transcript
    Public-domain oral history · 0:36 · unedited transcript
    0:00 / 0:35
    Source: “Oral Interview w. Sally Stapp”, Sausalito Historical Society, 5 January 1985, via California Revealed and the Internet Archive (casauhs_000095) — Public Domain Mark 1.0, “Public domain. No restrictions on use.” We cut the first 36 seconds and re-encoded to 128 kbps stereo for the web. The transcript is the unedited output of our pipeline on this exact file, which is why it reads “when you when you came to Sausalito” — the stutter is on the tape. Both line and word timings here are measured, not interpolated: this clip ran through the V2 backend, which returns per-word boundaries.

    La pipeline è la stessa, ma l’esperienza di lettura è completamente diversa. Parla una persona alla volta, il microfono è vicino e non ci sono voci sovrapposte. Le frasi sono complete, la punteggiatura segue le pause naturali e non c’è nulla da districare.

    Il confronto con la riunione precedente insegna la cosa più utile sull’accuratezza: è la registrazione a determinare la qualità della trascrizione, più ancora del software. Un buon microfono o auricolare incide sul risultato più di qualsiasi impostazione del programma.

    Esempio 3: un messaggio vocale, unico parlante, sedici secondi

    Hear a real voicemail and its transcript
    CC0 recording · re-encoded to telephone quality · 0:16
    0:00 / 0:15
    Source: “Woman Leaving a Phone Message” by Sample_Me (Freesound, CC0 1.0). We re-encoded it to mono 8 kHz through the mu-law codec carriers use, so it sounds like a voicemail rather than a studio recording. The transcript is the unedited output of our pipeline on this exact file. Line timings are measured; the word-level highlight is interpolated inside each line.

    L'audio breve con un solo parlante è il caso più semplice che esista e mostra il formato di trascrizione più semplice: nessuna etichetta del parlante, perché c'è solo una voce, e timestamp solo dove inizia un nuovo gruppo di frasi.

    Per la maggior parte dei file quotidiani — un memo vocale, la registrazione di una lezione o una nota dettata — una trascrizione si presenta proprio così: una colonna per i timestamp e una per il testo.

    Verbatim ripulito o integrale

    Entrambi gli stili descrivono lo stesso audio; cambia ciò che viene conservato o omesso.

    Il verbatim integrale conserva tutto ciò che una persona ha detto, comprese le parti che probabilmente non vorrebbe vedere citate:

    ```

    0:08 I had to figure out how to how to do the same thing for the

    summary, that's how I see it.

    ```

    Il doppio "come fare" non è un errore di trascrizione. Il parlante lo ha detto due volte.

    Il verbatim ripulito elimina ripetizioni, interiezioni e false partenze senza cambiare il significato:

    ```

    0:08 I had to figure out how to do the same thing for the summary.

    ```

    Quello che desideri dipende interamente dallo scopo della trascrizione:

    | Uso | Stile | Perché || --- | --- | --- || Ricerca qualitativa, legale, medica | Testo completo | Esitazione e ripetizione sono dati || Appunti delle riunioni, documenti interni | Verbatim ripulito | Nessuno ha bisogno di rileggere ogni esitazione || Pubblicazione, sottotitoli, marketing | Verbatim ripulito, poi revisionato | La leggibilità viene prima di tutto || Ricerca sul linguaggio e sul discorso | Testo integrale, con indicazioni non verbali | `[pausa]`, `[risate]`, `[non udibile]` |

    Una regola utile: trascrivi prima in forma integrale, poi ripulisci una copia. Passare dalla versione integrale a quella ripulita richiede pochi minuti; fare il contrario significa riascoltare l’intera registrazione.

    Il formato multi-parlante

    Quando parlano più persone, la trascrizione deve indicare chi sta parlando. Il formato standard prevede un blocco per ogni turno di parola, con l'etichetta a sinistra o sopra il testo:

    ```

    Speaker 1 So did you have to write it in the way that they wrote it,

    is that what you did?

    Speaker 2 Yeah, just search for specific string.

    Speaker 1 Fish the data, I was just thinking that, yeah.

    ```

    Tre convenzioni che vale la pena seguire, tutte visibili nell'esempio della riunione sopra:

    1. Non unire mai due parlanti in un unico blocco. Un paragrafo contenente due voci non può essere citato, codificato o ricercato.

    2. Inserisci l’etichetta a ogni turno, non su ogni riga. Ripetere “Parlante 1” su sei righe consecutive rende le trascrizioni automatiche faticose da leggere.

    3. Rinomina le etichette una sola volta, alla fine. I sistemi automatici producono `Parlante 1` e `Parlante 2`. Sostituirle con i nomi reali richiede pochi minuti e conviene farlo quando la trascrizione è definitiva, non durante la prima revisione.

    Come appare la trascrizione di un video

    Una trascrizione video è una trascrizione audio: l'immagine non contribuisce in alcun modo al testo. L'unica vera differenza è ciò che fai con i timestamp in seguito:

  • Trascrizione: timestamp a pause naturali, per la lettura e la ricerca.
  • Sottotitoli (SRT/VTT): le stesse parole vengono suddivise in blocchi da 1-7 secondi, con tempi di inizio e fine e una lunghezza adatta a due righe sullo schermo.
  • Lo stesso file può produrre entrambi i risultati: esportare in SRT significa cambiare formato, non creare una nuova trascrizione. Se ti servono i sottotitoli, trascrivi prima il contenuto e poi suddividilo nei blocchi temporali.

    La precisione che nessuno pubblica

    È qui che molte pagine di esempio smettono di essere utili. SpeakWrite dichiara una “precisione del 99–100%”, mentre TranscribeMe dichiara “oltre il 99%”. Nessuno dei due pubblica l'audio usato per ottenere quei valori né la trascrizione di riferimento con cui è stato confrontato. Di conseguenza, i risultati non sono verificabili né direttamente confrontabili.

    La riunione qui sopra, invece, può essere verificata perché il corpus AMI include una trascrizione umana di riferimento. Ecco il confronto con il nostro risultato per quei 48 secondi:

    | | Riferimento umano | La nostra trascrizione || --- | --- | --- || Parole | 208| 163|| Interventi / segmenti | 20 | 10 || Parlanti | 3| 2|| Reazioni brevi ("ok", "giusto", "mm-hmm") | 7| 2|

    Tasso di errore sulle parole in questo estratto: 30,8% — 41 sostituzioni, 17 eliminazioni e 6 inserimenti.

    Nell’intera riunione di 35 minuti ci sono 17 finestre comparabili di 45 secondi. Il loro tasso di errore medio è del 36,8%; nella finestra migliore scende al 15,5%.

    Quel dato mostra tre cose importanti, ma ce n'è una che non può dirci.

    Dimostra che l'audio di una riunione registrata da lontano è davvero difficile da trascrivere. Un microfono al centro del tavolo, tre persone e voci sovrapposte rappresentano uno dei peggiori casi realistici; ecco perché il risultato è lontano dal “99%”.

    Mostra dove si concentrano gli errori. Guarda la riga dei parlanti: nella stanza ci sono tre voci, ma ne vengono rilevate due. La terza persona non pronuncia quasi mai una frase completa; interviene con “okay”, “sì” e “mm-hmm”. Cinque delle sette reazioni brevi non compaiono affatto. Gli errori non si distribuiscono in modo uniforme: si concentrano sugli interventi brevi e sui parlanti con la voce più bassa.

    Indica anche quale problema risolvere per primo. Nessuna impostazione software può colmare un divario del 30% su quella registrazione; un microfono per ogni parlante può farlo.

    Non prevede, però, il risultato del tuo file. Nell'esempio 2 la pipeline è la stessa, ma il microfono è vicino e la trascrizione si legge come un testo naturale. È questo il caso più comune; la riunione è uno stress test.

    Come ottenere una trascrizione del tuo audio

    1. Registra il più vicino possibile alla bocca. Un microfono lavalier da 20 £ vale più di qualsiasi impostazione del software.

    2. Se conosci la lingua, selezionala manualmente anziché affidarti al rilevamento basato sui primi secondi.

    3. Attiva la separazione dei parlanti per qualsiasi registrazione con più di una voce, prima di avviare la trascrizione.

    4. Scegli in anticipo il tipo di trascrizione: integrale se le esitazioni contano, ripulita in caso contrario.

    5. Leggi il primo minuto confrontandolo con l'audio. Nomi, gergo e acronimi sono i luoghi in cui si accumulano gli errori e vale la pena correggerli manualmente.

    Puoi trascrivere l’audio in testo oppure convertire un MP4 in una trascrizione, aggiungere etichette e timestamp dei parlanti ed esportare il risultato in SRT se ti servono i sottotitoli.

    Domande frequenti

    Che aspetto ha una trascrizione audio?

    Una colonna di timestamp e una di testo, con un blocco per ogni turno di parola e un’etichetta ogni volta che cambia la voce. Con un solo parlante le etichette non servono; con più parlanti vanno mantenute.

    Qual è la differenza tra verbatim ripulito e integrale?

    Il verbatim integrale conserva ogni parola pronunciata, comprese le interiezioni, le ripetizioni e le false partenze. Quello ripulito le elimina senza alterare il significato. La ricerca e il lavoro legale richiedono spesso la versione integrale; per gli appunti delle riunioni, invece, quasi mai.

    Quanto è accurata la trascrizione automatica?

    Dipende molto più dalla registrazione che dal software. Nell'esempio della riunione registrata con un microfono distante, il tasso di errore rispetto al riferimento umano pubblicato è del 30,8%. Con un microfono vicino, come nell'intervista, il testo risulta invece scorrevole e richiede soltanto qualche correzione a nomi e termini specialistici. Considera con cautela qualsiasi percentuale di precisione pubblicata senza l'audio su cui è stata misurata.

    Le trascrizioni includono i nomi dei parlanti?

    I sistemi automatici producono etichette generiche — `Parlante 1`, `Parlante 2` — perché l'audio non indica l'identità delle voci. Rinominarle è un passaggio manuale, da eseguire preferibilmente quando la trascrizione è definitiva.

    Posso ottenere una trascrizione di un video?

    Sì. Viene usata soltanto la traccia audio, quindi il procedimento è identico a quello di un file audio e il risultato può essere esportato anche come sottotitoli.

    Pronto a trascrivere il tuo audio?

    Prova TranscribeNext gratuitamente e sperimenta la trascrizione basata sull'intelligenza artificiale

    Inizia gratuitamente: non è richiesta la carta di credito

    © 2026 TranscribeNext.com. Tutti i diritti riservati.

    Esempio di trascrizione da audio a testo: 3 campioni reali con audio (2026) | TranscribeNext