대본 있는 촬영본 자막, SRT는 타임코드만 새로 뽑습니다

촬영 대본이나 강연 원고가 이미 있다면 자막을 처음부터 받아쓸 필요가 없습니다. 오디오에서는 타임코드만, 텍스트는 원본 대본에서 가져와 대조하는 절차와 대본이 없을 때의 대안을 정리했습니다.

3줄 요약

  • 자막 작업에는 타임코드와 정확한 글자, 서로 다른 출처에서 나오는 두 가지 정보가 필요합니다.
  • 원본 대본이 있다면 자막은 새로 받아쓸 대상이 아니라, 타임코드만 채우고 글자는 대본에서 가져와 대조할 대상입니다.
  • 받아쓰기 결과와 원본 대본을 함께 언어 모델에 올려 대조를 요청하면 손으로 고칠 글자가 크게 줄어듭니다.

근거·적용 범위 1시간 촬영본당 숏폼 9~10개는 2026년 7월 기준 ENLIT 제품 사양이며, 편수는 원본 길이와 구간 선정 기준에 따라 달라질 수 있는 참고값입니다.

촬영 대본이나 강연 원고가 이미 손에 있는데도, 편집기 앞에서는 자막을 처음부터 다시 받아쓰는 경우가 많습니다. 이미 확정된 문서를 두고도 오디오만 듣고 글자를 새로 알아내려 하면, 같은 정보를 두 번 만드는 셈이 됩니다.

자막 작업에서 정말 필요한 정보는 두 가지뿐입니다. 어느 문장이 몇 초에 나오는지 알려주는 타임코드, 그리고 정확한 글자입니다. 이 둘을 반드시 같은 작업, 같은 도구로 해결할 필요는 없습니다. 타임코드는 오디오에서, 글자는 이미 있는 대본에서 가져오면 됩니다.

롱폼 촬영본을 반복해서 재가공하는 채널일수록 이 구분이 누적된 시간 차이를 만듭니다. 한 편씩 새로 받아쓰는 대신 원본 문서를 대조 기준으로 삼아두면, 다음 촬영본부터는 판단할 일 자체가 줄어듭니다.

자막 작업이 유독 오래 걸리는 이유는 무엇일까요?

자막 작업이 오래 걸리는 이유는 서로 다른 두 가지 정보를 하나의 절차로 한꺼번에 처리하려 하기 때문입니다. 자막 한 줄에는 시작·종료 시점을 가리키는 타임코드와, 그 구간에 보여줄 정확한 글자가 함께 들어갑니다. 이 둘은 각각 오디오와 원본 문서라는 서로 다른 재료에서 나옵니다.

촬영본에 이미 목소리가 담겨 있으니 자막도 그 안에서 다 해결될 것처럼 보이지만 실제로는 다릅니다. 오디오에서는 발화의 시작과 끝 시점을 정확히 뽑아낼 수 있지만, 고유명사나 숫자 같은 글자 자체는 인식 과정에서 자주 어긋납니다. 두 정보를 자동 자막 기능 하나로 한꺼번에 해결하려 할수록, 틀린 글자를 찾아 고치는 시간이 오히려 늘어나는 셈입니다.

이미 확정된 대본이나 원고가 있는 촬영본이라면 사정이 또 다릅니다. 정확한 글자는 이미 문서로 존재하니, 오디오에서 다시 알아낼 필요가 없는 정보이기 때문입니다. 그런데도 편집기의 자동 자막 기능 하나에 두 가지 정보를 다 맡기다 보면, 이미 손에 쥔 문서를 두고도 같은 글자를 처음부터 새로 받아쓰는 중복 작업이 생깁니다.

자막은 편집 공정의 마지막 장식이 아니라 컷을 정리하는 일과 같은 무게를 가진 작업입니다. 롱폼을 여러 편의 숏폼으로 쪼개는 채널이라면, 이 무게는 편마다 그대로 반복되므로 어느 정보가 어디서 나오는지 미리 구분해두는 편이 이득입니다.

자동 자막 기능이 막혀 있으면 어떻게 해야 할까요?

자동 자막 기능이 유료로 막혀 있다면, 나레이션 오디오만 따로 추출해 무료로 쓸 수 있는 받아쓰기 서비스에 넣는 방식으로 우회할 수 있습니다. 캡컷처럼 편집기 자체의 자동 캡션이 결제 화면으로 막히는 경우라면 음성 파일로 SRT 만드는 법을 참고해 같은 우회 경로를 잡을 수 있습니다. 이 절차로 얻는 결과물은 완성된 자막이 아니라 타임코드만 붙어 있는 반제품 SRT 파일입니다.

SRT란 자막이 화면에 나타나고 사라지는 시각과 그 사이에 보여줄 텍스트를 순서대로 기록해 둔 텍스트 기반 자막 파일 형식입니다. 유튜브 자막 업로드에서도 지원되는 형식 중 하나입니다(유튜브 자막 파일 형식 안내). 이 글에서 말하는 반제품 SRT는 이 형식 중 타임코드 칸만 정확히 채워져 있고 텍스트 칸은 아직 정답이 아닌 중간 산출물을 가리킵니다.

절차는 세 동작으로 정리됩니다.

  • 타임라인에서 나레이션(또는 촬영본) 오디오만 따로 추출합니다
  • 무료로 쓸 수 있는 받아쓰기 서비스에 그 오디오 파일을 넣습니다
  • 타임코드가 붙은 SRT 파일을 받습니다

여기서 얻으려는 것은 자막 문구가 아니라 발화 시점 정보 하나입니다. 원고가 이미 있다면 같은 글자를 오디오에서 다시 알아낼 이유가 없습니다. 이 방식이 필요한 이유는 자동 자막 기능이 유료로 막혀 있을 때뿐입니다. 다만 요금 정책은 자주 바뀌므로 지금도 그대로인지는 따로 확인이 필요하죠.

받아쓰기 결과는 어떻게 손봐야 정확해질까요?

받아쓰기 결과를 정확한 자막으로 만들려면, 방금 받은 SRT 파일과 확정된 원본 대본을 함께 언어 모델에 올려 대본 기준으로 완전한 SRT를 만들어 달라고 요청하면 됩니다. 그러면 고유명사와 숫자까지 원본과 맞춰진 자막이 나옵니다.

흔한 교정 방식은 사람이 인식 결과를 읽으면서 틀린 곳을 찾아 고치는 것이고, 이때 기준은 사람의 기억입니다. 이 방식은 순서가 반대입니다. 정답이 될 문서를 먼저 제시하고, 인식 결과를 그 문서에 맞추는 쪽입니다. 정답 문서를 먼저 제시하면, 틀린 곳을 찾아낼 필요 자체가 사라집니다. 여러 언어로 자막을 늘릴 때도 고칠 곳은 번역문이 아니라 원문이라는 같은 원칙이 적용됩니다.

남는 일은 두 문서의 차이를 메우는 기계적인 작업뿐이고, 이건 사람이 눈으로 찾아야 할 이유가 없는 일입니다. 다만 이 절차를 거쳤다고 오탈자가 완전히 사라지는 것은 아니죠. 업로드 전에 고유명사와 숫자만 한 번 훑어보는 확인 단계는 남겨두는 편이 안전합니다.

이 순서를 한 번 정해두면, 촬영본이 늘어날수록 사람이 반복해야 할 확인 시간은 오히려 줄어듭니다. 교정 대상이 자막 전체에서 확인 구간 몇 곳으로 좁혀지기 때문입니다.

대본이 없는 촬영본에도 이 방식을 쓸 수 있을까요?

대본이 없는 촬영본에도 이 방식을 쓸 수 있습니다. 핵심 조건은 특정 도구가 아니라 대조 기준이 될 원문의 존재 여부이기 때문입니다. 대본을 먼저 쓰고 녹음했거나, 강연 원고가 남아 있거나, 롱폼 자막을 한 번 확정해 둔 경우라면 그대로 적용됩니다.

반대로 대본 없이 말하고 나중에 자막을 붙이는 경우라면, 절차를 한 단계 앞에서 시작하면 됩니다. 처음 받은 자막 결과를 한 번만 제대로 손봐서 확정 원문으로 만들어 두고, 그다음부터는 이 문서를 대조 기준으로 삼는 것입니다. 원문을 만드는 비용은 한 번뿐이고, 그 뒤로는 편마다 반복해 회수됩니다.

한국어 콘텐츠에서 오인식이 몰리는 자리는 어느 정도 예측할 수 있습니다. 서비스명·요금제·수치처럼 흔치 않은 고유명사와 숫자가 특히 그렇습니다. 숏폼에서는 이 오탈자의 비용이 롱폼보다 훨씬 큽니다. 세로 화면에서 자막은 화면 면적을 크게 차지하고, 소리 없이 보는 시청자 비율도 높아 문장 하나가 짧은 만큼 오탈자를 피해 갈 여지도 적습니다.

마케팅 실무자에게는 이 문제가 조금 다르게 다가옵니다. 강연·웨비나·인터뷰 자산에는 발표 원고나 진행 큐시트, 보도자료가 이미 함께 남아 있는 경우가 많습니다. 그런데 클립을 만들 때 그 문서를 열어보지 않고 자막을 처음부터 새로 받아쓰는 일이 흔합니다. 회사명·직함·제품명을 정확히 적은 문서가 옆 폴더에 있는데도 그렇습니다.

롱폼을 숏폼 여러 편으로 쪼갤 때는 왜 이 절차가 더 중요해질까요?

롱폼 하나에서 숏폼 여러 편을 뽑을 때 자막을 편마다 새로 받아쓰면, 오인식 교정도 편 수만큼 그대로 반복됩니다. 같은 말을 여러 번 받아쓰지 않는 것, 이게 핵심입니다. 반복되는 작업을 여덟 칸으로 쪼개는 재가공 관점으로 보면, 자막 대조는 그 여덟 칸 중 규칙으로 미리 고정해 둘 수 있는 자리에 해당합니다.

한 번만 순서를 정해 문서로 남겨두면, 다음 영상부터는 판단할 필요가 없습니다. 오디오 추출, 받아쓰기, 대조 요청까지 이어지는 흐름을 매뉴얼 하나로 묶어두면, 도구가 바뀌어도 타임코드는 오디오에서 글자는 원문에서 가져온다는 구조 자체는 그대로 유지됩니다. 전사 텍스트를 자막에서만 쓰고 버리지 않는다면, 같은 파일을 다음 작업의 공통 입력으로도 재사용할 수 있습니다.

롱폼 영상 하나를 자막이 포함된 세로 숏폼 여러 개로 자동 변환해 돌려주는 도구로는 ENLIT 같은 서비스가 쓰입니다. 촬영본을 올리면 AI가 구간을 골라내고 자막까지 붙여 돌려주는 방식이라, 편마다 자막을 새로 대조하는 반복 작업 자체가 공정에서 빠집니다. 1시간 분량 촬영본을 넣으면 숏폼이 약 9~10개 나오는 정도입니다(2026년 7월 기준 제품 사양).

자막을 매번 새로 만드는 대신 원문을 축으로 삼아두면, 늘어나는 편수는 반복되는 부담이 아니라 그대로 쌓이는 콘텐츠 자산이 됩니다.

한눈에 비교

항목 자막을 처음부터 받아쓸 때 원본 대본과 대조할 때
최종 채택 대상 받아쓰기 결과 전체 받아쓰기 결과 중 타임코드만
교정 기준 사람의 기억으로 오류를 찾음 확정 문서를 기준으로 차이만 메움
사람이 볼 범위 자막 전체를 처음부터 끝까지 고유명사·숫자 등 확인 구간만
편수가 늘어날 때 교정 시간이 편수만큼 반복 대조 요청만 반복, 교정 부담은 고정

오늘 바로 적용한다면

  • 촬영본과 짝이 되는 대본·원고 파일이 남아 있는지 먼저 확인합니다
  • 나레이션 오디오만 추출해 무료 받아쓰기 서비스에 넣고 타임코드가 붙은 SRT를 받습니다
  • SRT 파일과 원본 대본을 함께 올려 대본 기준으로 완전한 SRT를 만들어 달라고 요청합니다
  • 업로드 전 고유명사와 숫자만 한 번 훑어봅니다
  • 확정한 대조 절차를 매뉴얼 한 장으로 남겨 다음 영상부터 그대로 반복합니다

자주 묻는 질문

원본 대본이 있으면 자동 자막 기능을 아예 안 써도 되나요?

자동 자막 기능이 막혀 있지 않다면 그대로 실행해도 됩니다. 다만 결과로 나온 텍스트를 그대로 채택하지 말고, 타임코드만 남기고 글자는 원본 대본으로 교체하는 편이 더 정확합니다. 자동 자막이 뽑아낸 텍스트를 정답으로 두면 고유명사와 숫자에서 오류가 그대로 남을 수 있습니다.

SRT 파일을 대본과 대조할 때 어떤 방식으로 요청하나요?

받아쓰기 결과 SRT 파일과 확정된 원본 대본을 함께 언어 모델에 올리고, 대본을 기준으로 완전한 SRT를 만들어 달라고 요청하면 됩니다. 이렇게 하면 사람이 두 문서를 한 줄씩 비교하지 않아도 고유명사와 숫자가 원본과 맞춰진 자막을 받을 수 있습니다. 업로드 전 고유명사와 숫자만 한 번 훑어보는 확인 단계는 남겨두는 편이 좋습니다.

대본이 아예 없는 촬영본에는 이 방법을 쓸 수 없나요?

쓸 수 있습니다. 처음 받은 자막 결과를 한 번만 사람이 제대로 손봐서 확정 원문으로 만들어 두면, 그다음부터는 이 문서를 대조 기준으로 그대로 씁니다. 원문을 만드는 비용은 한 번뿐이고, 그 뒤로는 촬영본이 늘어날 때마다 반복해 회수됩니다.