인터뷰 텍스트는 각 발언을 화자에게 연결한 서면 기록입니다. 제대로 된 문서에는 날짜와 참여자 정보가 있는 헤더, 화자별 문단, 타임스탬프, `[웃음]`이나 `[들리지 않음 00:14:22]` 같은 비언어 표시가 있습니다.
실제 변환 예시
아래 데모는 1985년 공개 구술사 인터뷰 일부를 사용합니다. 재생하면 실제 오디오에서 나온 텍스트를 확인할 수 있습니다.
AI가 만든 원시 결과는 다음과 같은 모습입니다.
```text
[00:02] 화자 1: 이제 작동하네요.
[00:04] 화자 1: 이제 작동하네요.
[00:05] 화자 1: 오늘은 1985년 1월 5일이고, 이분은 샐리 스탭입니다.
[00:13] 화자 1: 샐리, 먼저 언제 소살리토에 오셨는지 묻고 싶습니다.
[00:18] 화자 2: 제2차 세계대전 직후였어요.
[00:20] 화자 1: 그전에는 어디에 계셨나요?
[00:23] 화자 2: 전쟁 동안 샌디에이고 해군 항공기지에 있었어요.
```
여기서 사람이 해야 할 일은 분명합니다. 자동 화자 번호를 실제 이름으로 바꾸고, 녹음기 점검 때문에 반복된 문장을 보존할지 정하며, 확신할 수 없는 화자와 고유명사를 오디오로 확인합니다.
권장 헤더
```text
인터뷰 텍스트
프로젝트: 구술사 연구
날짜: 1985년 1월 5일
장소: 미국 캘리포니아주 소살리토
참여자: 샐리 스탭
인터뷰어: 소살리토 역사 협회
녹음 길이: 31분 36초
스타일: 완전 축어
동의/출처: 공개 자료, 사용 제한 없음
```
세 가지 스타일
| 스타일 | 포함하는 내용 | 적합한 용도 || --- | --- | --- || 완전 축어 | 모든 단어, 군더더기, 반복, 말실수, 침묵 | 담화 분석, 법률, 말하는 방식 자체가 자료인 연구 || 정리된 축어 | 의미 있는 모든 말, 군더더기와 재시작 제거 | 주제 분석, 저널리즘, 대부분의 인터뷰 || 편집본 | 핵심 내용만 남기고 잡담과 이탈 제거 | 출판, 내부 보고서, 마케팅 사례 |처음에는 완전한 기록을 보존하고 별도 사본을 정리하는 편이 안전합니다. 삭제된 반복이나 침묵은 나중에 텍스트만으로 복원할 수 없습니다.
화자 표기 규칙
1. 화자가 바뀔 때마다 새 문단을 시작합니다.
2. 같은 사람에게 문서 전체에서 같은 이름을 사용합니다.
3. 두 사람의 말을 한 문단에 합치지 않습니다.
4. 동시에 말하면 `[동시 발화]`를 표시하고 추측으로 한쪽만 남기지 않습니다.
5. 자동 라벨은 마지막 검토에서 한 번에 실제 이름으로 바꿉니다.
비언어와 불확실성
`[웃음]`, `[긴 침묵]`, `[전화벨]`처럼 의미가 있는 소리를 대괄호에 적습니다. 단어가 들리지 않으면 `[들리지 않음 00:14:22]`, 확실하지 않으면 `[추정: 부산?]`처럼 독자가 불확실성을 알 수 있게 하세요.
익명화
연구 설계, 윤리 승인, 동의서가 요구한다면 참여자뿐 아니라 직장, 동료, 기관, 작은 지역도 일관된 가명이나 코드로 바꿉니다. 실제 신원과 코드를 연결하는 키는 텍스트와 분리된 접근 제한 파일에 보관합니다.
파일 형식 선택
결론
AI는 화자별 초안을 빠르게 만들지만 인터뷰의 의미와 연구 품질을 책임지는 것은 검토 과정입니다. 형식을 먼저 정하고 이름, 숫자, 동시 발화, 불확실한 구간을 확인하세요.