정돈되지 않은 대본을 읽기 쉬운 텍스트로 전환
YouTube 캡션, Zoom .vtt 파일, 또는 자동 생성된 팟캐스트 내보내기에서 얻은 원시 대본을 붙여넣으면, 타임스탬프, 캡션 큐 번호, “음”과 “어”, “SPEAKER 1:” 레이블, 그리고 반복되는 줄과 같은 불필요한 것들을 제거합니다. 그런 다음 깨진 캡션 조각들을 실제로 읽을 수 있는 단락으로 다시 병합합니다.
이것은 전적으로 브라우저에서 실행됩니다. 대본은 절대 업로드되지 않으므로, 정리하는 대상이 비공개 통화나 미공개 인터뷰일 때 중요합니다.
AI가 아닌 규칙, 그리고 그것이 핵심인 이유
“AI”라는 이름이 붙은 대부분의 도구는 언어 모델을 통해 대본을 정리합니다. 이는 문법을 수정하지만, 모델이 누군가가 말한 내용을 조용히 고쳐 쓸 수도 있다는 의미입니다. 대본의 경우, 그것은 당신이 원하지 않는 한 가지입니다. “개선된” 인용문은 더 이상 인용문이 아닙니다.
이것은 대신 일반 패턴 규칙으로 정리합니다. 당신이 켜는 것만 정확히 제거하고 그 외에는 아무것도 제거하지 않습니다. 문장을 다시 쓰거나, 구두점을 만들어내거나, 어색한 표현을 다듬지 않으므로, 남은 것은 잡음이 없는 화자의 실제 단어입니다.
솔직한 절충안: 규칙 기반이므로 AI가 했을 것처럼 문법을 고치거나 구두점을 추가하지 않습니다. 그것을 원한다면, AI를 사용하여 화자 구조와 가독성을 추가하는 대본 포매터를 나중에 사용하십시오. 먼저 불필요한 것을 제거하고, 광택을 원하면 두 번째로 형식을 지정하십시오. 저는 대부분의 경우(약 80%) 클리너만 사용합니다. 왜냐하면 읽기 쉬운 단락이면 보통 충분하기 때문입니다.
제거되는 것들
이들 각각은 토글 기능이 있어, 원하는 것을 유지하고 나머지는 제거할 수 있습니다.
- 타임스탬프 및 큐. SRT 시퀀스 번호,
00:00:04,500 --> 00:00:08,200와 같은 타이밍 줄,WEBVTT헤더, 그리고[00:05]또는 단순한00:01:32와 같은 인라인 스탬프. 이것은 사람들이 가장 많이 검색하는 “대본에서 타임스탬프 제거” 작업입니다. - 채움말. 명확한 언어 습관: 음, 어, 에, 흠, “있잖아”, “내 말은”. 얼마나 많은 단어가 제거되었는지 세어주므로 녹음이 얼마나 손상되었는지 확인할 수 있습니다.
- 화자 레이블.
SPEAKER 1:,John:,[Interviewer]와 같은 줄 시작 태그, 그리고 Zoom 및 캡션 도구가 삽입하는>>마커. - 반복되는 줄. 자동 캡션은 다시 그릴 때 동일한 줄을 두 번 인쇄하는 경우가 많습니다. 연속된 중복 항목은 하나로 축소됩니다.
- 깨진 줄 간격. 캡션은 몇 단어마다 줄 바꿈이 발생하여 한 문장이 네 줄로 나뉘어 표시됩니다. 병합하면 이들을 다시 연결하고 결과를 단락으로 나눕니다.
주목할 만한 의도적인 선택 하나: “like”, “actually”, “basically”, “so”는 제거하지 않습니다. 이 단어들은 목록에서는 채움말처럼 보이지만, 실제 의미를 충분히 전달하는 경우가 많아 제거하면 문장의 의미가 바뀝니다. 당신이 의도한 바를 편집하는 클리너는 불필요한 “like”를 남기는 클리너보다 나쁘므로, 이 단어들은 남겨둡니다.
YouTube, Zoom, 또는 팟캐스트 대본 정리하기
가장 많은 혼란을 야기하는 세 가지 출처가 바로 이 도구가 가장 잘 처리하는 세 가지입니다.
YouTube 캡션 덤프는 거의 모든 줄에 타임스탬프가 있고 단락이 전혀 없습니다. 복사된 대본을 붙여넣고, 타임스탬프 및 병합 기능을 켜면, 다섯 단어 조각들의 더미 대신 블로그에 바로 사용할 수 있는 텍스트 블록을 얻을 수 있습니다.
Zoom 및 Teams는 큐 번호, 타이밍, 그리고 매 턴마다 화자 레이블이 있는 .vtt 파일을 제공합니다. 파일을 넣으면 깨끗한 대화나 유려한 텍스트로 돌아오며, 화자 이름을 유지할지는 당신의 선택입니다.
팟캐스트 및 인터뷰 대본은 보통 이미 더 깨끗하지만, 사람들이 실제로 그렇게 말하기 때문에 언어적 채움말로 가득합니다. “음”을 제거하고 병합하면, 내용에 손대지 않고도 읽는 시간이 단축됩니다.
Word에서 대본 타임스탬프 제거하는 방법
사람들은 Microsoft Word의 찾기 및 바꾸기 기능을 사용하여 00:00:00와 일치하는 와일드카드 패턴을 사용하려고 시도하기 때문에 이것을 검색합니다. 작동은 하지만 간신히 되고, 패턴이 까다로우며 한 파일에서 다음 파일로 타임스탬프 형식이 바뀌는 순간 깨집니다.
여기에 텍스트를 붙여넣는 것이 지름길입니다. 이것은 일반적인 타임스탬프 형태(SRT, VTT, 그리고 단순한 HH:MM:SS)를 자동으로 인식하므로, 와일드카드 표현식을 작성하거나 네 가지 형식에 대해 네 번 실행할 필요가 없습니다. 여기서 정리하고, 결과를 다시 Word에 붙여넣으십시오.
정리 후
스크립트가 정리되면 다음 단계에는 각자의 도구가 있습니다. AI를 사용하여 적절한 화자 구조와 가독성을 추가하려면 스크립트 포맷터를 사용하세요. 비디오 또는 오디오 파일에서 처음부터 깨끗한 스크립트를 추출하려면 스크립트 생성기가 스크립트를 작성합니다. 그리고 정리된 스크립트를 자막으로 바꾸려면 텍스트-SRT 변환기가 이번에는 의도적으로 타임스탬프를 다시 넣습니다.
자주 묻는 질문
이 스크립트 클리너는 무료인가요?
네, 브라우저에 그대로 유지됩니다. 작업은 서버가 아닌 사용자의 장치에서 이루어지므로, 가입, 업로드, 정리할 스크립트 수에 대한 제한이 없습니다.
제 스크립트를 업로드하거나 저장하나요?
아니요. 정리는 페이지에서 실행되는 일반 JavaScript이므로 텍스트는 브라우저를 벗어나지 않습니다. 아무것도 전송되거나, 저장되거나, 기록되지 않으며, 이것이 비공개 통화나 미공개 인터뷰에 로컬 클리너를 사용하는 이유입니다.
타임스탬프만 제거하고 나머지는 모두 유지하려면 어떻게 해야 하나요?
타임스탬프 토글을 켜고 다른 토글은 끄세요. SRT 및 VTT 타이밍 줄, 시퀀스 번호, 그리고 [00:05]와 같은 인라인 스탬프를 제거하고, 화자 레이블, 필러, 줄바꿈은 원래 그대로 둡니다.
”like”과 “actually”와 같은 필러 단어를 제거하나요?
아니요, 의도적으로 제거하지 않습니다. “um”과 “uh”와 같은 명확한 언어 필러만 제거합니다. “like”, “actually”, “basically”와 같은 단어는 너무 자주 실제 의미를 지니고 있으므로, 이를 제거하면 문장이 변경될 수 있습니다. 클리너는 누군가가 말한 내용을 편집해서는 안 됩니다.
어떤 파일 형식을 정리할 수 있나요?
모든 텍스트를 붙여넣거나 .srt, .vtt, .txt 파일을 드롭하세요. 이 도구는 파일을 로컬에서 읽고 붙여넣은 텍스트와 동일한 방식으로 정리합니다. 약 5MB까지의 파일은 원활하게 작동하며, 그 이상은 텍스트를 붙여넣으세요.
규칙 기반 클리너가 AI 스크립트 클리너보다 더 좋은가요?
서로 다른 작업을 수행합니다. 이와 같은 규칙 기반 클리너는 단어를 변경하지 않고 노이즈를 제거하여 인용문과 기록에 더 안전합니다. AI 클리너는 문법과 구두점도 수정하지만, 말한 내용을 바꿔쓸 수 있습니다. 먼저 여기서 정리한 다음, 다듬기를 원할 경우에만 AI 처리를 실행하세요.