녹취록이 필요한 상황과 목적 구분하기
녹취록은 녹음된 대화나 발언을 글로 옮긴 문서입니다. 회사에서는 고객 상담이나 인터뷰 내용을 남길 때, 대학원에서는 연구 면담을 분석할 때, 개인적으로는 계약이나 분쟁과 관련된 통화 내용을 정리해 둘 때 만듭니다. 같은 녹취록이라도 목적에 따라 필요한 정확도와 형식이 크게 다르기 때문에, 작업을 시작하기 전에 어디에 쓸 문서인지부터 정해 두는 것이 좋습니다.
- 개인 기록이나 업무 참고용: 내용 파악이 목적이므로 AI 초안을 한 번 검토하는 정도로 충분한 경우가 많습니다.
- 연구 면담이나 기사 인용용: 인용할 문장은 원본 녹음과 한 글자씩 대조해야 하고, 참여자 이름은 가명 처리하는 경우가 많습니다.
- 법원, 수사기관, 보험사 등 공식 제출용: 형식 요건과 작성 주체가 중요할 수 있으므로 반드시 전문가에게 먼저 확인해야 합니다.
손으로 받아 적는 작업은 생각보다 오래 걸립니다. 재생하고, 멈추고, 되감고, 다시 듣는 과정이 반복되기 때문에 녹음 길이보다 몇 배의 시간이 드는 일이 흔합니다. 그래서 요즘은 음성 인식으로 초안을 먼저 만들고, 사람은 확인과 수정에 집중하는 방식이 널리 쓰입니다.
공식 제출용이라면 전문 업체부터 확인하세요
이 글에서 설명하는 방법은 녹취록의 초안을 효율적으로 만드는 방법입니다. AI로 만든 텍스트가 법적 효력을 갖는지, 증거로 인정되는지에 대해서는 어떤 주장도 하지 않습니다. 법원에 제출하는 녹취록은 속기사무소 같은 전문 업체에 맡기는 경우가 많고, 사건이나 기관에 따라 요구하는 형식, 작성자 표기, 원본 파일 제출 여부 등이 다를 수 있습니다.
녹음 자체의 적법성도 별개의 문제입니다. 자신이 참여하지 않은 다른 사람들의 대화를 몰래 녹음하는 것은 법적으로 문제가 될 수 있다는 점이 널리 알려져 있지만, 구체적인 상황에 대한 판단은 변호사에게 받아야 합니다. 공식 용도가 조금이라도 예상된다면 초안 작업 전에 변호사나 속기사무소에 문의하고, 원본 녹음 파일은 절대 편집하지 말고 그대로 보관해 두세요.
녹음 파일 형식과 음질 먼저 점검하기
초안의 품질은 녹음 상태에 크게 좌우됩니다. 작업 전에 처음 1~2분과 중간 부분을 이어폰으로 들어 보고 다음을 확인하세요.
- 말소리가 배경 소음보다 분명하게 들리는지
- 두 사람의 목소리 크기가 너무 차이 나지 않는지
- 중간에 소리가 끊기거나 찢어지는 구간이 없는지
- 파일 형식이 MP3, WAV, M4A, AAC, OGG, FLAC, WebM 중 하나인지
스마트폰 기본 녹음 앱이나 음성 메모로 녹음한 파일은 대개 M4A라서 그대로 쓸 수 있습니다. 반면 확장자가 .amr인 통화 녹음 파일이나 메신저 음성 메시지에서 나온 .opus 파일은 mydubly에서 받지 않으므로, 믿을 수 있는 변환 프로그램으로 MP3나 M4A로 바꾼 다음 사용해야 합니다. 파일 하나의 최대 길이는 2시간이니, 더 긴 녹음은 미리 나눠 두세요. 통화 녹음 특유의 좁은 음역대가 인식에 어떤 영향을 주는지는 통화 녹음 텍스트 변환 가이드 (영어)에 자세히 정리되어 있습니다.
mydubly으로 녹취록 초안 만들기
mydubly은 브라우저에서 쓰는 웹 앱이고, 화면은 영어로 되어 있습니다. 녹취록 초안을 만드는 순서는 다음과 같습니다.
- 홈 화면의 오디오 작업 공간에 있는 "Drop audio here" 영역에 녹음 파일을 끌어다 놓습니다. 영상으로 녹화한 면담이라면 "Drop a video here"에 넣으면 됩니다.
- "Audio and text output" 토글을 꺼서 "Timestamped transcript only" 상태로 둡니다. 번역 음성이 필요 없으니 이 상태가 가장 저렴합니다.
- 원본 언어는 자동으로 감지되며("Source: Auto detect") 직접 고를 수는 없습니다. 한국어 녹취록이 목적이라면 "Select language"에서 Korean을 고르세요. 번역 없이 말한 그대로 받아 적힙니다.
- "Transcribe audio" 버튼을 누르고, 작업이 끝날 때까지 탭을 닫지 말고 열어 둡니다. 탭을 닫거나 다른 페이지로 이동하면 작업이 취소됩니다.
- 결과가 나오면 "Download timestamped transcript"로 시간 표시가 붙은 파일을, "Download transcript"로 순수 텍스트 파일을 내려받습니다.
음성 인식은 공개 음성 인식 모델인 Whisper를 기반으로 하며, 조용한 구간은 건너뛰고 말소리가 있는 부분만 처리합니다. 오디오는 HTTPS로 전송되고, 업로드한 오디오와 결과물은 작업이 끝난 뒤 30분 안에 서버에서 삭제됩니다. 대신 mydubly이 하지 않는 일도 분명히 알아 두어야 합니다. 화자를 자동으로 구분해 주지 않고, 내용을 요약해 주지 않으며, 앱 안에서 텍스트를 고치는 편집 화면도 없습니다. 법원 제출용 서식을 만들어 주는 기능도 없습니다. 내려받은 텍스트 파일을 한글(HWP)이나 Word 같은 문서 프로그램에 붙여 넣어 직접 다듬어야 합니다. 더 자세한 기능은 음성 텍스트 변환 (영어) 페이지에서 확인할 수 있습니다.
시간 표시를 따라 다시 듣고 고치기
시간 표시가 붙은 파일은 각 줄 앞에 그 문장이 시작되는 시점이 대괄호로 들어가 있습니다. 녹취록 검토에서 가장 중요한 도구가 바로 이 시간 표시입니다. 의심스러운 문장이 보이면 재생 프로그램에서 해당 시점으로 이동해 그 부분만 다시 들으면 되므로, 처음부터 끝까지 전부 다시 들을 필요가 없습니다.
내려받은 줄: [12:41] 그럼 계약금은 삼백만 원으로 하고 잔금은 다음 달 말에 드리는 걸로 ▶ 고친 녹취록: [12:41] 임차인: 그럼 계약금은 300만 원으로 하고, 잔금은 다음 달 말에 드리는 걸로 하겠습니다.
검토할 때는 다음 순서로 보면 효율적입니다.
- 숫자와 금액: 삼백만, 3백만, 300만처럼 표기가 섞이기 쉽고 잘못 들린 숫자는 의미를 완전히 바꿉니다.
- 날짜와 시간: "다음 주 화요일"처럼 상대적인 표현은 녹음 날짜를 기준으로 실제 날짜를 메모해 두면 나중에 읽기 쉽습니다.
- 사람 이름, 회사명, 지명: 음성 인식이 가장 자주 틀리는 부분입니다.
- 말이 겹친 구간: 두 사람이 동시에 말하면 한쪽 말이 빠지거나 섞여 기록될 수 있습니다.
- 끝까지 알아들을 수 없는 부분: 추측해서 채우지 말고 [청취 불가] 같은 표시를 남기세요.
한국어 음성 인식이 어떤 상황에서 약해지는지는 Whisper 한국어 성능 정리를, 교정 요령 전반은 AI 녹취 교정 방법 (영어)을 참고하세요.
화자 표시는 직접 넣어야 합니다
녹취록에서 누가 말했는지는 핵심 정보지만, mydubly은 화자를 자동으로 구분하지 않습니다. 결과 텍스트에는 말한 내용만 순서대로 나오므로 화자 이름은 검토하면서 직접 붙여야 합니다. 두 사람의 대화라면 생각보다 어렵지 않습니다. 질문과 대답이 번갈아 나오기 때문에 맥락만으로도 대부분 구분할 수 있고, 헷갈리는 줄만 시간 표시를 보고 다시 들으면 됩니다.
세 명 이상이 참여한 녹음은 조금 더 손이 갑니다. 처음 5분 정도를 들으며 각자의 목소리 특징을 메모해 두고, 화자 표기 방식을 하나로 정해서 끝까지 지키세요. 실명을 쓸지, "화자1", "화자2"처럼 번호를 쓸지, "상담원", "고객"처럼 역할을 쓸지는 문서 목적에 따라 정하면 됩니다. 연구용이라면 실명 대신 "참여자 A"처럼 가명을 쓰는 것이 일반적입니다. 자동 화자 구분 기술이 어떻게 작동하고 왜 어려운지는 화자 분리 개념 설명 (영어)에서 볼 수 있습니다.
녹취록 문서 서식 갖추기
초안이 정리되면 문서 형태를 갖춥니다. 정해진 양식이 따로 없다면 아래 항목을 맨 위에 넣어 두면 나중에 누가 읽어도 맥락을 알 수 있습니다.
- 녹음 일시
- 2026년 9월 15일 오후 2시 10분
- 녹음 장소 또는 방식
- 사무실 대면 상담 / 전화 통화
- 원본 파일명과 길이
- consult_0915.m4a, 40분
- 참여자
- 상담원 1명, 고객 1명
- 작성자와 작성일
- 홍길동, 2026년 9월 16일
본문은 "화자: 발언" 형식으로 한 발언씩 줄을 나누고, 줄 앞에 시간 표시를 남겨 두면 원본과 대조하기 쉽습니다. 웃음, 긴 침묵, 전화벨 같은 비언어적 소리를 기록할지도 미리 정하세요. "음", "어" 같은 군말과 반복까지 그대로 옮기는 방식과, 의미를 해치지 않는 선에서 다듬는 방식 중 무엇을 쓸지도 중요한 결정입니다. 두 방식의 차이는 그대로 받아쓰기와 정리 받아쓰기 비교 (영어)에 잘 정리되어 있습니다. 회의 녹음을 결정 사항 중심의 문서로 바꾸고 싶다면 녹취록보다는 회의록 녹음 정리 방법이 더 맞는 형식입니다.
비용은 얼마나 드는지 계산해 보기
녹취록 초안은 텍스트만 만드는 작업이라 가장 낮은 요금이 적용됩니다. 시작한 분 단위로 1분에 1크레딧이 들고, 파일 하나당 최소 5크레딧입니다. 구독 없이 크레딧을 미리 충전해서 쓰는 방식이고, 1,000크레딧이 $1입니다.
40분 상담 녹음은 40크레딧($0.04)입니다. 40분 10초처럼 조금이라도 넘기면 시작한 분까지 계산되어 41크레딧이 됩니다. 2시간짜리 인터뷰는 120크레딧($0.12), 3분짜리 짧은 통화는 최소 요금인 5크레딧이 적용됩니다. 가입하면 받는 무료 100크레딧으로 최대 100분 분량을 텍스트로 바꿔 볼 수 있습니다.
실패하거나 취소된 작업에 쓰인 크레딧은 돌려받습니다. 비용보다 더 신경 써야 할 것은 검토 시간입니다. 초안이 빨리 나와도 녹취록의 품질은 결국 사람이 얼마나 꼼꼼히 확인하느냐에 달려 있습니다.
자주 묻는 질문
AI로 만든 녹취록을 법원에 제출해도 되나요?
이 글과 mydubly은 AI 텍스트의 법적 효력이나 증거능력에 대해 어떤 주장도 하지 않습니다. 법원 제출용 녹취록은 형식과 작성 주체가 중요할 수 있어 속기사무소 같은 전문 업체에 맡기는 경우가 많습니다. 제출 계획이 있다면 작업 전에 변호사나 전문 업체에 먼저 확인하세요.
통화 녹음 파일이 .amr인데 바로 넣을 수 있나요?
아니요. mydubly은 .amr 파일과 메신저 음성 메시지의 .opus 파일을 받지 않습니다. 믿을 수 있는 변환 프로그램으로 MP3나 M4A로 바꾼 뒤 넣으면 됩니다. 스마트폰 기본 녹음 앱으로 녹음한 M4A 파일은 그대로 사용할 수 있습니다.
화자를 자동으로 나눠 주나요?
mydubly은 화자 구분 기능이 없어서 말한 내용만 순서대로 나옵니다. 시간 표시 파일을 보면서 헷갈리는 부분만 다시 듣고 화자 이름을 직접 붙이는 방식으로 작업하면 됩니다. 두 사람 대화라면 대부분 맥락만으로도 구분됩니다.
1시간 넘는 녹음도 한 번에 되나요?
파일 하나당 최대 2시간까지 처리할 수 있습니다. 그보다 긴 녹음은 미리 두 개 이상으로 나눠서 각각 처리한 뒤 텍스트를 이어 붙이면 됩니다. 나눌 때는 문장 중간이 아니라 말이 잠시 멈춘 지점에서 자르는 것이 좋습니다.
녹음 내용이 민감한데 서버에 남지 않나요?
오디오는 HTTPS로 전송되며, 업로드한 오디오와 결과물은 작업이 끝난 뒤 30분 안에 서버에서 삭제됩니다. 영상 파일을 넣는 경우에도 영상 자체는 브라우저에 남고 소리만 추출되어 전송됩니다. 회사나 기관의 내부 규정이 있다면 그 기준을 먼저 확인하세요.
사투리가 심한 녹음도 텍스트로 바뀌나요?
한국어로 인식되긴 하지만 억양이 강하거나 지역 어휘가 많으면 틀리는 부분이 늘어날 수 있습니다. 결과는 대체로 표준어에 가까운 표기로 나오기 때문에, 사투리 표현을 그대로 남겨야 하는 녹취록이라면 검토 단계에서 직접 고쳐야 합니다. 정확도를 숫자로 보장할 수는 없습니다.
