TranscribeNextTranscribeNext.com
BlogGuida

Trascrizione dell'intervista: formato, layout e un esempio reale

📝

Team di TranscribeNext

14 minuti di lettura
trascrizione dell'intervistaformato della trascrizionericerca qualitativatrascrizionestoria orale

Una trascrizione di un'intervista è la versione scritta di un'intervista orale, in cui ogni intervento viene attribuito al parlante corretto. Una trascrizione utilizzabile comprende un'intestazione con data e partecipanti, il testo suddiviso per parlante con timestamp e note tra parentesi quadre per gli eventi non verbali.

Gratis

Questa definizione è facile. Ciò che le guide raramente ti mostrano è una trascrizione ricavata da una registrazione reale, con il piccolo disordine che una registrazione reale produce. Quasi tutti gli esempi di trascrizione parlata che troverai online sono stati scritti per illustrare le regole piuttosto che trascritti dall'audio, motivo per cui sembrano tutti immacolati.

Quindi questa guida ne utilizza uno reale. Di seguito è riportata un'autentica intervista di storia orale registrata il 5 gennaio 1985: Sally Stapp, allora ottantenne, intervistata dalla Sausalito Historical Society. La registrazione è di pubblico dominio senza limitazioni d'uso, quindi possiamo riporla qui integralmente. Abbiamo caricato i primi cinque minuti nella nostra pipeline con il rilevamento dei parlanti attivo e quello che segue è ciò che è tornato, senza modifiche.

Un esempio di intervista reale trascritta

Ascolta prima l'audio. Dura trentasei secondi e la trascrizione sottostante è esattamente il risultato prodotto dalla nostra pipeline, così puoi verificare ogni riga direttamente con la registrazione.

Hear the interview and read its transcript
Public-domain oral history · 0:36 · unedited transcript
0:00 / 0:35
Source: “Oral Interview w. Sally Stapp”, Sausalito Historical Society, 5 January 1985, via California Revealed and the Internet Archive (casauhs_000095) — Public Domain Mark 1.0, “Public domain. No restrictions on use.” We cut the first 36 seconds and re-encoded to 128 kbps stereo for the web. The transcript is the unedited output of our pipeline on this exact file, which is why it reads “when you when you came to Sausalito” — the stutter is on the tape. Both line and word timings here are measured, not interpolated: this clip ran through the V2 backend, which returns per-word boundaries.

Questo è l'output grezzo. Nessuna correzione, nessun riordino, esattamente come la macchina lo ha prodotto:

```

[00:02] SPEAKER_01: Now it's working.

[00:04] SPEAKER_01: Now it's working.

[00:05] SPEAKER_01: This is Sally Stapp and it is January 5th, 1985.

[00:10] SPEAKER_00: I don't know how to run this any better than I know.

[00:12] SPEAKER_01: Okay.

[00:13] SPEAKER_01: Sally, first thing I want to ask is when you when you came to Sausalito?

[00:18] SPEAKER_00: Right after World War II.

[00:20] SPEAKER_01: Where had you been before?

[00:23] SPEAKER_00: Naval Air Station, San Diego, for the duration.

[00:29] SPEAKER_01: Where are you from?

[00:31] SPEAKER_00: I was born in Cleveland, Ohio.

[00:32] SPEAKER_01: Cleveland, Ohio.

[00:33] SPEAKER_00: April 30th, 1905.

```

Quattro cose in quelle tredici righe valgono più di una pagina di consigli – e poiché l’audio è proprio lì, nessuna di queste deve essere presa per fede.

"Adesso funziona" appare due volte. Non è un bug nella trascrizione: è sul nastro. Qualcuno armeggia con un registratore che ha appena cominciato a funzionare, e lo dice due volte. Una vera trascrizione di un'intervista vera inizia con l'attrezzatura, non con la prima domanda.

La macchina ti dà numeri, non nomi. `SPEAKER_00` e `SPEAKER_01` sono ciò che produce il rilevamento dei parlanti. Può distinguere due voci e tenerle separate per l'intera registrazione; non può sapere quale è Sally. Assegnare i nomi è un passo umano e richiede circa dieci secondi: trovi la prima riga in cui qualcuno si identifica e rinomini entrambi i parlanti ovunque.

“when you when you” non è un errore di trascrizione. L'intervistatore ricomincia la domanda e il sistema registra entrambi i tentativi, come richiede il verbatim integrale. Ascolta il punto 00:13 e lo sentirai. Qui la scelta dello stile indicato nell'intestazione produce una differenza concreta: il verbatim integrale conserva la ripetizione, quello ripulito elimina uno dei due “when you”. Una trascrizione che lo elimina ma si definisce integrale rappresenta in modo scorretto la registrazione.

Una riga è dubbia e puoi vedere quale. Alle 00:10, *"Non so come eseguirlo meglio di quanto so"* è attribuito a `SPEAKER_00`, il partecipante, ma sembra che l'intervistatore sia ancora alle prese con il registratore. Questo è esattamente il tipo di frase da confrontare con l'audio prima di citare. Gli errori di attribuzione si concentrano nel primo minuto di una registrazione, dove le voci non sono ancora state udite abbastanza per essere distinte, e intorno alle interruzioni.

Ecco lo stesso passaggio dopo il passaggio umano: i parlanti nominati, il duplicato contrassegnato anziché cancellato, l'attribuzione dubbia contrassegnata e un'intestazione corretta aggiunta.

```

INTERVIEW TRANSCRIPT

Project: Sausalito Historical Society oral history programme

Date: 5 January 1985

Location: Sausalito, California

Participant: Sally Stapp (b. 30 April 1905)

Interviewer: Sausalito Historical Society

Recording: Side A, 31 min 36 s (excerpt: 00:00–00:35)

Style: Verbatim

Source: California Revealed / Internet Archive, public domain

[00:02] INTERVIEWER: Now it's working. [repeated on tape] This is Sally

Stapp and it is January 5th, 1985.

[00:10] UNCLEAR: I don't know how to run this any better than I know.

[attribution uncertain — check audio]

[00:13] INTERVIEWER: Sally, first thing I want to ask is when you when

you came to Sausalito?

[00:18] STAPP: Right after World War II.

[00:20] INTERVIEWER: Where had you been before?

[00:23] STAPP: Naval Air Station, San Diego, for the duration.

[00:29] INTERVIEWER: Where are you from?

[00:31] STAPP: I was born in Cleveland, Ohio. April 30th, 1905.

```

Osserva che cosa è cambiato e che cosa no. Nessuna parola è stata alterata. La ripetizione è stata conservata e annotata anziché rimossa senza avviso, perché in una trascrizione integrale cancellarla falserebbe, anche se di poco, la registrazione. Le due righe consecutive di Sally sono state unite in un unico intervento, perché costituiscono una frase continua che il sistema aveva diviso in corrispondenza di una pausa. Infine, la riga dubbia è stata segnalata come tale anziché attribuita al parlante ritenuto più probabile.

Questo è l'intero lavoro, ed è il motivo per cui la trascrizione di un'intervista non è semplicemente il risultato di uno strumento di trascrizione.

Cos'è la trascrizione di un'intervista e cosa non lo è

Una trascrizione registra ciò che è stato detto, nell'ordine in cui è stato detto. Non si tratta di appunti, né di un riassunto, né di verbali.

  • Gli appunti raccolgono ciò che ritieni importante durante l'ascolto.
  • Un riepilogo sintetizza il contenuto della conversazione.
  • Una trascrizione è la prova su cui entrambi sono costruiti.
  • La distinzione è più importante nella ricerca, nel giornalismo e in qualsiasi contesto legale o delle risorse umane, perché una trascrizione è l'artefatto a cui puoi essere tenuto. Se la trascrizione dice qualcosa di diverso dalla registrazione, tutto ciò che ne deriva è compromesso. Questo è il motivo per cui "ripuliscilo man mano che procedi" è un cattivo consiglio per un primo passaggio: produci prima una trascrizione fedele, quindi ricava da essa tutto ciò di cui hai bisogno.

    I tre stili di trascrizione

    Ogni guida di stile concorda più o meno sugli stessi tre e scegliere quello sbagliato fa perdere tempo o dati.

    StileCiò che conservaUsalo perCosto
    Verbatim integrale Ogni parola, interiezione, falsa partenza, ripetizione e pausa; segnala [ride], [sospira] e [pausa] Analisi della conversazione e del discorso, ambito legale e tutti i casi in cui conta come è stato detto qualcosa Il più lento da produrre e il più difficile da leggere
    Verbatim ripulito Tutte le informazioni sostanziali; elimina interiezioni e false partenze e corregge piccoli errori grammaticali Analisi tematica, gran parte della ricerca qualitativa, giornalismo e podcast Richiede un giudizio su ciò che conta come sostanziale
    Rielaborato Il contenuto principale; elimina digressioni e passaggi fuori tema Pubblicazioni, report interni e casi di studio di marketing Non più un record completo, mai la tua unica copia

    La regola pratica è: scegli lo stile prima di iniziare e indicalo nell'intestazione. Senza questa informazione, il lettore non può sapere se l'assenza di esitazioni dipenda dal modo di parlare del partecipante o dall'intervento del trascrittore.

    Quanto riempitivo c'è effettivamente?

    Il confronto tra verbatim integrale e ripulito viene spesso affrontato senza dati. Nei nostri dati di produzione abbiamo quindi misurato le interiezioni in 934 registrazioni in inglese con due parlanti, una struttura tipica delle interviste di ricerca:

    EspressioneMedia ogni 1.000 paroleIn un'intervista media di 4.620 parole
    um2,16circa 10
    uh0,92circa 4
    you know5,20circa 24
    like17,40circa 80

    Due precisazioni importanti. Il dato su “like” non misura soltanto l'uso come intercalare: il valore 17,4 comprende anche gli usi ordinari della parola, che non abbiamo separato. Inoltre si tratta di medie tra registrazioni: la frequenza delle interiezioni varia molto da una persona all'altra e un singolo partecipante nervoso può superare di diverse volte la media.

    In una tipica intervista, quindi, la pulizia elimina circa quaranta interiezioni da oltre quattromila parole. Il testo diventa più leggibile, ma non molto più breve. Non scegliere il verbatim ripulito per risparmiare spazio: usalo quando l'analisi non dipende dalle esitazioni; in caso contrario conserva la versione integrale.

    Formato della trascrizione dell'intervista: i tre blocchi

    Tutto ciò di cui un futuro lettore ha bisogno per interpretare il testo, prima che il testo inizi:

    ```

    Project: [study or programme name]

    Date: [date of the interview]

    Location: [place, or "remote — Zoom"]

    Participant: [name or pseudonym, plus any relevant detail]

    Interviewer: [name or initials]

    Recording: [file name, total length]

    Style: [verbatim / clean / edited]

    Anonymised: [yes / no]

    Consent: [reference to the signed consent form]

    ```

    Sono i due campi che le persone tralasciano e poi rimpiangono Stile e Anonimizzato. Senza il primo, nessuno può distinguere un parlante fluente da un trascrittore ordinato. Senza il secondo, un lettore sei mesi dopo non può dire se "Maria" è una persona reale.

    2. Il corpo

    Le regole che contano davvero, in ordine di frequenza con cui vengono infrante:

    1. Un parlante per paragrafo, sempre. Non unire mai due parlanti in un blocco, nemmeno per una risposta di una sola parola. Questo è l'errore di formattazione più comune e rende una trascrizione inutilizzabile per la citazione.

    2. Un'etichetta coerente seguita da due punti. `INTERVIEWER:` e `STAPP:`, o `I:` e `P1:` - scegli uno schema e non modificarlo mai. Il software di analisi si divide su queste etichette.

    3. Timestamp a un intervallo utile. Ogni cambio di parlante è adatto per interviste brevi; ogni 30-60 secondi è sufficiente per quelli lunghi. Esistono timestamp in modo da poter tornare all'audio e uno ogni tre secondi non serve a nessuno.

    4. Parentesi quadre per tutto ciò che non è parlato. `[ride]`, `[pausa]`, `[squilla il telefono]`, `[sovrapposizione]`, `[non udibile 00:14:22]`. Inserisci il timestamp nel marcatore `[non udibile]` per poter tornare facilmente all'audio.

    5. Segna l'incertezza piuttosto che indovinare. `[unclear: Kessler?]` è onesto e utile. Una parola sbagliata sicura non è né l'una né l'altra.

    3. Numerazione delle righe, per la ricerca

    Se la trascrizione verrà citata, numerare le righe. Il lavoro qualitativo cita come "P4, righe 212–218" e quel riferimento non ha significato a meno che la numerazione non sia stabile. Aggiungilo una volta che la trascrizione è definitiva: rinumerarlo dopo ogni correzione è il modo in cui numeri e citazioni si allontanano.

    Layout della trascrizione dell'intervista: cosa suggeriscono i dati

    I consigli sul layout sono solitamente estetici. Una parte di essa può invece essere misurata.

    Nei nostri dati di produzione, analizzati su 1.248 registrazioni con due parlanti e una durata di almeno cinque minuti, l'intervista mediana dura 29,9 minuti. Nei 1.030 casi in cui è stato possibile misurare il tempo di parola di ciascuno, il parlante dominante occupava in mediana il 72,4% della conversazione e, al 90º percentile, l'88,7%.

    Quel numero ha due conseguenze pratiche per il layout.

    La tua trascrizione sarà sbilenca e questo è corretto. In una buona intervista il partecipante parla circa tre volte tanto dell’intervistatore. Se la tua trascrizione è vicina a 50/50, vale la pena notarlo per l'intervista, non per la trascrizione. Il nostro esempio di pubblico dominio qui sopra si attesta all'85,8% di partecipanti rispetto al 14,2% di intervistatore nella clip di cinque minuti - vicino al massimo dell'intervallo normale, che è quello che ti aspetteresti da una storia orale in cui il compito dell'intervistatore è quello di togliersi di mezzo.

    I turni sono brevi e numerosi. L'intervista mediana nei nostri dati si divide in 391 segmenti. I paragrafi lunghi e ininterrotti sono quasi sempre un artefatto di formattazione piuttosto che una caratteristica del discorso, e sono ciò che rende difficile codificare una trascrizione. Pausa in pause naturali; non lasciare che una sola risposta venga pubblicata per una pagina.

    Come scrivere la trascrizione di un'intervista

    Se stai trascrivendo a mano, il flusso di lavoro che fa perdere meno tempo:

    1. Imposta la velocità di riproduzione a circa il 75% in un lettore con controllo da tastiera. La maggior parte delle persone riesce a digitare con precisione a tre quarti della velocità ma non a tutta velocità, e il riavvolgimento costante costa più della riproduzione lenta.

    2. Associa un pedale o una scorciatoia al riavvolgimento di cinque secondi. Cercare ogni volta il punto con il mouse è una delle maggiori perdite di tempo nella trascrizione manuale.

    3. Primo passaggio: trascrivi le parole. Non formattare, non correggere i nomi e non interromperti per fare ricerche. Inserisci `[?]` e prosegui.

    4. Secondo passaggio: risolvi i marcatori `[?]` e verifica con l'audio nomi, numeri e termini tecnici.

    5. Terzo passaggio: formattazione — intestazioni, etichette, timestamp, numeri di riga.

    Metti in conto da quattro a sei ore di lavoro per ogni ora di audio se vuoi una trascrizione integrale accurata. Per un'intervista media di 29,9 minuti, significa circa due o tre ore.

    Il percorso più veloce e dove va effettivamente il tempo

    La trascrizione automatica non elimina il lavoro, ma ne cambia la natura. Il sistema produce rapidamente il testo completo e tu dedichi il tempo alla revisione, la fase in cui il controllo umano è più prezioso.

    Abbiamo misurato i tempi di elaborazione di 962 registrazioni completate con due parlanti: in media sono trascorsi 5,5 minuti dal caricamento alla trascrizione finale, circa 6,5 volte meno della durata dell'audio. Nove registrazioni su dieci sono state completate entro 45,5 minuti. I casi più lenti dipendono soprattutto dal caricamento di file video di grandi dimensioni, non dall'elaborazione.

    Quindi, per una tipica intervista di ricerca di 30 minuti: pochi minuti per una trascrizione con le etichette dei parlanti e i timestamp, quindi il passaggio di revisione. La revisione non diventa più veloce, e non dovrebbe: è da qui che deriva la precisione.

    In pratica la sequenza che funziona:

    1. Carica la registrazione con il rilevamento dei parlanti abilitato.

    2. Rinomina una sola volta `Parlante 1` e `Parlante 2` in "Intervistatore" e "Partecipante": la modifica verrà applicata all'intera trascrizione.

    3. Leggilo confrontandolo con l'audio, correggendo nomi, numeri, termini tecnici ed eventuali sovrapposizioni.

    4. Applica il tuo stile: lascia parola per parola o pulisci il riempitivo.

    5. Esporta come DOCX per modificare, TXT per software di analisi o PDF su file.

    Trascrizioni di interviste nella ricerca qualitativa

    La trascrizione di un'intervista di ricerca comporta requisiti che quella giornalistica non ha.

    Anonimizza in modo coerente. Sostituisci non soltanto il nome del partecipante, ma anche quelli di datori di lavoro, colleghi, istituzioni e piccoli luoghi che potrebbero identificarlo. Usa uno pseudonimo o un codice coerente, conserva la chiave in un file separato e ad accesso controllato e indica nell'intestazione che la trascrizione è stata anonimizzata. Un errore comune è farlo solo in parte, per esempio usando uno pseudonimo nell'intestazione ma lasciando il vero datore di lavoro nel testo.

    Mantieni integralmente le domande dell'intervistatore. Una domanda importante è visibile solo se è stata registrata alla lettera, e una risposta spesso significa poco senza la formulazione esatta che l’ha suggerita. Poiché l’intervistatore occupa solo il 28% circa del tempo di conversazione, conservare le domande costa poco e rimuoverle distrugge l’evidenza di come è stata prodotta ciascuna risposta.

    Decidi il riempitivo prima della codifica, non durante. Passare dal testo letterale al testo pulito a metà del corpus rende le trascrizioni non comparabili e qualsiasi osservazione sull'esitazione diventa un artefatto di quando hai cambiato idea.

    Controlla il formato di importazione del tuo software. ATLAS.ti, NVivo e MAXQDA accettano tutti DOCX e testo semplice. Mantenere un master in testo semplice evita sorprese nella formattazione ed è il formato che con maggiore probabilità sarà ancora disponibile tra dieci anni.

    Errori comuni

  • Unire i parlanti in un unico paragrafo. Rende impossibile la quotazione e interrompe il software di analisi.
  • Eliminare senza avviso le ripetizioni in una trascrizione dichiarata integrale. O è verbatim integrale oppure non lo è.
  • Timestamp su ogni riga. Rumore. Ogni cambio di parlante o ogni 30-60 secondi.
  • Indovinare le parole poco chiare anziché segnalarle. Una parola sbagliata presentata come certa può finire nella citazione pubblicata.
  • Trascrivere una copia compressa inviata tramite un'app di messaggistica anziché la registrazione originale.
  • Lasciare `Parlante 1` e `Parlante 2` nel documento finale. Bastano trenta secondi per trasformare una bozza in una trascrizione rifinita.
  • Nessuna intestazione. Sei mesi dopo, nessuno può dire cosa sta leggendo.
  • Provalo durante il tuo colloquio

    La trascrizione in cima a questa pagina ha richiesto circa ottanta secondi di tempo macchina per un clip di cinque minuti, con il rilevamento del parlante attivo. Puoi eseguire la stessa cosa sulla tua registrazione: i primi cinque minuti sono gratuiti senza account, quindi puoi giudicare l'output sul tuo audio piuttosto che su una demo che abbiamo scelto.

    Carica una registrazione audio o video, lascia che rilevi la lingua, rinomina i parlanti ed esporta come DOCX, TXT, PDF, SRT o VTT.

    Se vuoi ascoltare l'audio associato a una trascrizione prima di scegliere il formato, la pagina con tre esempi di trascrizione riproducibili confronta una riunione, un'intervista e un messaggio vocale con il relativo tasso di errore misurato rispetto a un testo di riferimento. Se l'intervista è stata registrata in video, la guida alla trascrizione di file MP4 spiega che cosa cambia con un contenitore video. Per migliorare la registrazione prima ancora di premere il tasto Rec, consulta i 10 consigli professionali ricavati da oltre 10.000 interviste.

    ---

    *Estratto dell'intervista: "Oral Interview w. Sally Stapp", Sausalito Historical Society, 5 gennaio 1985, tramite California Revealed e Internet Archive (casauhs_000095). Public Domain Mark 1.0 - "Pubblico dominio. Nessuna restrizione d'uso." Trascritto il 2 agosto 2026 dai primi cinque minuti del lato A con il rilevamento del parlante abilitato; l'estratto grezzo sopra non è stato modificato. I dati aggregati provengono dai dati di produzione di TranscribeNext, dal 9 ottobre 2025 al 31 luglio 2026.*

    Pronto a trascrivere il tuo audio?

    Prova TranscribeNext gratuitamente e sperimenta la trascrizione basata sull'intelligenza artificiale

    Inizia gratuitamente: non è richiesta la carta di credito

    © 2026 TranscribeNext.com. Tutti i diritti riservati.

    Formato e layout della trascrizione dell'intervista: con un esempio di trascrizione reale | TranscribeNext