WER로 전사 정확도 측정
정확한 전사본을 한 상자에 붙여넣고 점수를 매길 전사본을 다른 상자에 붙여넣은 다음 단어 오류율(WER)을 읽어보세요. 문자 오류율, 단어 정확도, 그리고 모든 대체, 삭제, 삽입을 표시하는 단어별 차이점도 얻을 수 있습니다. 모든 작업은 브라우저에서 실행되므로 어떤 전사본도 어디에도 업로드되지 않습니다.
WER은 전사본이 얼마나 실제에 가까운지 수치로 나타내는 표준 방법입니다. 음성 인식 논문에서 보고하고, 팀이 하나의 전사 도구를 다른 도구와 비교하는 데 사용하며, 전사본이 배포할 만큼 깨끗한지 또는 한 번 더 검토해야 하는지 결정할 때 사용하는 방법입니다.
단어 오류율이 실제로 측정하는 것
WER은 검사하려는 전사본을 참조본으로 바꾸는 데 필요한 편집 횟수를 세고, 이를 참조본의 길이로 나눕니다.
WER = (S + D + I) / N
S는 잘못된 단어인 대체(substitutions)입니다. D는 전사본에서 빠진 참조 단어인 삭제(deletions)입니다. I는 전사본이 추가한 불필요한 단어인 삽입(insertions)입니다. N은 참조본의 총 단어 수입니다. 이 도구는 두 단어 시퀀스를 정렬하여 가장 작은 편집 세트를 찾는데, 이는 맞춤법 검사기 뒤에 있는 것과 동일한 편집 거리 개념이므로, 단순한 좌우 비교가 아닌 가장 공정한 수치를 얻을 수 있습니다.
WER이 0이면 두 전사본이 단어 하나하나 일치한다는 의미입니다. WER이 0.10이면 참조 단어 10개당 편집이 하나 있다는 의미입니다. WER이 1.0을 넘을 수도 있는데, 사람들은 처음에는 놀라워합니다. 전사본에 참조본보다 훨씬 많은 단어가 채워져 있다면 삽입만으로도 참조 길이를 넘어설 수 있으므로, 120퍼센트의 WER은 실제 결과이지 버그가 아닙니다.
WER 계산 방법
- 정확하다고 알고 있는 전사본인 참조본을 왼쪽 상자에 붙여넣으세요. 이것이 모든 것을 측정하는 기준이므로 신뢰할 수 있는 것이어야 합니다.
- 점수를 매길 전사본을 오른쪽 상자에 붙여넣으세요.
- 대소문자와 구두점 무시 여부를 선택한 다음, WER, CER, 정확도 및 아래에 표시된 차이점을 확인하세요.
차이점은 읽을 가치가 있는 부분입니다. 단일 숫자는 얼마나 나쁜지를 알려주고, 차이점은 어디에서 왜 그랬는지 알려줍니다. 오류가 흩어져 있는 오인인지, 아니면 문장 전체가 통째로 빠진 것인지 한눈에 알 수 있으며, 이는 다음에 무엇을 할지 결정하는 데 도움이 됩니다.
전사본보다 WER이 더 나쁘게 보이는 이유
원시 WER은 실제 오류가 아닌 것들에 대해 가차 없습니다. 구두점과 대소문자를 남겨두면 “Hello.”와 “hello”는 대체로 간주됩니다. “OK”와 “okay”, 또는 “twenty”와 “20”도 마찬가지입니다. 이들 중 어느 것도 의미를 변경하지 않지만, 각 항목은 횟수에 추가됩니다.
이것이 두 가지 토글이 중요한 이유입니다. 대소문자와 구두점 무시는 음성 콘텐츠를 비교하는 일반적인 설정인데, 단어가 맞는지 여부가 중요하고 쉼표가 제대로 찍혔는지 여부는 중요하지 않기 때문입니다. 예를 들어, 대소문자와 구두점이 결과물의 일부인 자막 파일과 같이 서식이 채점 대상일 때는 이들을 끄세요. 단일한 올바른 설정은 없습니다. 솔직한 방법은 하나를 선택하고, 비교하는 모든 전사본에 걸쳐 동일하게 유지하며, 어떤 설정을 사용했는지 밝히는 것입니다.
숫자, 철자로 된 단어, 축약어는 흔히 WER을 부풀리는 다른 요인입니다. 참조본이 “cannot”으로 쓰여 있고 전사본이 “can’t”로 쓰여 있다면, 청자는 전혀 알아채지 못하겠지만 이는 대체로 간주됩니다. 엄격한 벤치마크를 위해서는 먼저 양쪽을 정규화해야 하지만, 빠른 건전성 검사에는 일반적으로 토글만으로도 충분합니다.
WER, CER, 그리고 단어 정확도
단어 정확도는 1 - WER과 같으며, 숫자가 높을수록 좋습니다. 보고서에 더 친숙한 숫자이지만, 동일한 주의사항을 포함하고 있으며, 삽입이 많아지면 전사본이 “모든 단어가 틀린 것”보다 더 나빠질 수 있으므로 0으로 제한됩니다.
문자 오류율(Character Error Rate, CER)은 단어 대신 문자에 대해 동일한 편집 거리 계산을 수행합니다. CER은 단어 경계가 불확실할 때, 영어가 단어를 띄어쓰는 방식이 아닌 언어에서, 또는 거의 올바른 단어에 대해 부분 점수를 원할 때 더 나은 측정 항목입니다. “recognize”와 “recognise”는 WER에서는 완전한 대체이지만 CER에서는 단일 문자 편집이므로, CER은 더 낮게 나타나며 종종 아까운 오타에 대해 더 공정하게 평가됩니다.
영어 음성의 경우 WER을 헤드라인으로 사용하고, 낮은 WER에도 불구하고 아까운 오타에 대해 여전히 너무 가혹하다고 느껴질 때 CER을 확인하며, 오류율에 익숙하지 않은 사람에게 결과를 전달할 때는 단어 정확도를 인용하세요.
누가 단어 오류율을 확인하나요?
전사 서비스 제공업체를 비교하는 팀은 동일한 오디오를 각 서비스에 통과시키고, 클립을 손으로 전사하여 참조 자료로 사용하며, 각 도구의 결과물을 이에 대해 점수를 매깁니다. WER은 “이것이 더 좋게 느껴졌다”를 방어할 수 있는 숫자로 바꿉니다.
음성 인식을 연구하는 연구원과 학생들은 WER을 보고하는데, 이는 WER이 공통된 척도이기 때문입니다. 모델 변경은 보류된 참조 세트에서 WER이 떨어질 때에만 개선으로 간주됩니다.
자막 및 현지화 팀은 전사본이 번역되거나 자막 파일로 가기 전에 WER을 확인합니다. 이 단계에서의 오류는 하류에서 증폭되기 때문입니다. 그리고 전사 서비스 비용을 지불하고 그들이 지불한 것을 받았는지 알고 싶어하는 사람은 누구나 추측하는 대신 여기서 이를 측정할 수 있습니다.
숫자를 얻은 후
점수를 매긴 전사본이 거칠게 나왔고 더 깨끗한 버전으로 시작하고 싶다면, 전사 생성기는 화자 레이블이 포함된 전사본을 생성하며, AI 전사 확인기는 측정할 참조 자료가 없을 때 단일 전사본을 교정합니다. 만족스러운 점수 매긴 전사본을 자막 파일로 변환하려면, 텍스트를 SRT 변환기가 타이밍을 처리합니다.
녹음은 Whisper Large-v3에 의해 전사되며, 정확도 뒤에 있는 모델과 설정은 정확도 페이지에서 확인할 수 있습니다.
FAQ
좋은 단어 오류율이란 무엇인가요?
이는 전적으로 오디오에 따라 다릅니다. 깨끗하고 단일 화자가 읽은 오디오는 한 자리수 초반에 머무를 수 있지만, 시끄럽거나 다중 화자가 있거나 억양이 강한 녹음은 모든 도구에서 훨씬 더 높은 수치를 보입니다. 보편적인 합격 점수는 없습니다. 동일한 오디오와 동일한 참조 자료로 도구들을 비교하고, 다른 데이터셋의 숫자가 아닌 그것에 대해 WER을 판단하세요.
WER은 어떻게 계산되나요?
전사본을 참조 자료에 정렬하여 둘 사이의 가장 적은 편집 횟수를 찾고, 대치, 삭제, 삽입을 세어 그 총합을 참조 자료의 단어 수로 나누는 방식입니다. 이 도구는 사용자 대신 정렬을 수행하고 각 편집을 차이점에서 보여줍니다.
단어 오류율이 100%를 넘을 수 있나요?
네. 전사본이 참조 자료보다 훨씬 더 많은 단어를 추가하면, 삽입만으로도 총 편집 횟수가 참조 자료 길이를 넘어설 수 있으므로 WER이 1.0을 초과합니다. 매우 짧은 참조 자료와 길고 틀린 전사본을 비교할 때 주로 나타나는 현상입니다.
대소문자와 구두점도 포함되나요?
해당 토글을 켜 놓은 경우에만 포함됩니다. 기본적으로 이 도구는 둘 다 무시합니다. 음성 콘텐츠의 경우 대부분의 사람들은 단어가 올바른지 여부에 신경 쓰고 대소문자에는 신경 쓰지 않기 때문입니다. 포맷팅 자체가 평가 기준일 때 켜십시오.
WER과 CER의 차이점은 무엇인가요?
WER은 전체 단어의 오류를 세고, CER은 문자의 오류를 셉니다. CER은 거의 맞는 단어에 대해 부분 점수를 부여하며, 단어를 공백으로 구분하지 않는 언어에 더 적합합니다. 영어 음성의 경우 WER이 일반적인 주요 지표이며 CER은 유용한 보조 지표입니다.
내 스크립트는 비공개인가요?
네, 그렇습니다. 전체 계산은 JavaScript를 사용하여 브라우저에서 수행됩니다. 참조 파일도, 점수를 매기는 스크립트도 서버로 전송되지 않으므로, 아무것도 업로드되거나 저장되거나 기록되지 않습니다.
내 전사 도구의 정확도를 어떻게 측정하나요?
클립을 수동으로 전사하거나, 하나의 스크립트를 신중하게 수정하여 참조로 사용하세요. 테스트 중인 도구에 동일한 오디오를 실행하고 그 결과물을 채점할 스크립트로 붙여넣으세요. WER은 해당 클립에서 해당 도구의 오류율입니다. 신뢰할 수 있는 수치를 얻으려면 여러 클립을 사용하세요.