WER로 전사 정확도 측정
정확한 전사본을 한 상자에 붙여넣고 점수를 매길 전사본을 다른 상자에 붙여넣은 다음 단어 오류율(WER)을 읽어보세요. 문자 오류율, 단어 정확도, 그리고 모든 대체, 삭제, 삽입을 표시하는 단어별 차이점도 얻을 수 있습니다. 모든 작업은 브라우저에서 실행되므로 어떤 전사본도 어디에도 업로드되지 않습니다.
WER은 전사본이 얼마나 실제에 가까운지 수치로 나타내는 표준 방법입니다. 음성 인식 논문에서 보고하고, 팀이 하나의 전사 도구를 다른 도구와 비교하는 데 사용하며, 전사본이 배포할 만큼 깨끗한지 또는 한 번 더 검토해야 하는지 결정할 때 사용하는 방법입니다.
단어 오류율이 실제로 측정하는 것
WER은 검사하려는 전사본을 참조본으로 바꾸는 데 필요한 편집 횟수를 세고, 이를 참조본의 길이로 나눕니다.
WER = (S + D + I) / N
S는 잘못된 단어인 대체(substitutions)입니다. D는 전사본에서 빠진 참조 단어인 삭제(deletions)입니다. I는 전사본이 추가한 불필요한 단어인 삽입(insertions)입니다. N은 참조본의 총 단어 수입니다. 이 도구는 두 단어 시퀀스를 정렬하여 가장 작은 편집 세트를 찾는데, 이는 맞춤법 검사기 뒤에 있는 것과 동일한 편집 거리 개념이므로, 단순한 좌우 비교가 아닌 가장 공정한 수치를 얻을 수 있습니다.
WER이 0이면 두 전사본이 단어 하나하나 일치한다는 의미입니다. WER이 0.10이면 참조 단어 10개당 편집이 하나 있다는 의미입니다. WER이 1.0을 넘을 수도 있는데, 사람들은 처음에는 놀라워합니다. 전사본에 참조본보다 훨씬 많은 단어가 채워져 있다면 삽입만으로도 참조 길이를 넘어설 수 있으므로, 120퍼센트의 WER은 실제 결과이지 버그가 아닙니다.
WER 계산 방법
- 정확하다고 알고 있는 전사본인 참조본을 왼쪽 상자에 붙여넣으세요. 이것이 모든 것을 측정하는 기준이므로 신뢰할 수 있는 것이어야 합니다.
- 점수를 매길 전사본을 오른쪽 상자에 붙여넣으세요.
- 대소문자와 구두점 무시 여부를 선택한 다음, WER, CER, 정확도 및 아래에 표시된 차이점을 확인하세요.
차이점은 읽을 가치가 있는 부분입니다. 단일 숫자는 얼마나 나쁜지를 알려주고, 차이점은 어디에서 왜 그랬는지 알려줍니다. 오류가 흩어져 있는 오인인지, 아니면 문장 전체가 통째로 빠진 것인지 한눈에 알 수 있으며, 이는 다음에 무엇을 할지 결정하는 데 도움이 됩니다.
전사본보다 WER이 더 나쁘게 보이는 이유
원시 WER은 실제 오류가 아닌 것들에 대해 가차 없습니다. 구두점과 대소문자를 남겨두면 “Hello.”와 “hello”는 대체로 간주됩니다. “OK”와 “okay”, 또는 “twenty”와 “20”도 마찬가지입니다. 이들 중 어느 것도 의미를 변경하지 않지만, 각 항목은 횟수에 추가됩니다.
이것이 두 가지 토글이 중요한 이유입니다. 대소문자와 구두점 무시는 음성 콘텐츠를 비교하는 일반적인 설정인데, 단어가 맞는지 여부가 중요하고 쉼표가 제대로 찍혔는지 여부는 중요하지 않기 때문입니다. 예를 들어, 대소문자와 구두점이 결과물의 일부인 자막 파일과 같이 서식이 채점 대상일 때는 이들을 끄세요. 단일한 올바른 설정은 없습니다. 솔직한 방법은 하나를 선택하고, 비교하는 모든 전사본에 걸쳐 동일하게 유지하며, 어떤 설정을 사용했는지 밝히는 것입니다.
숫자, 철자로 된 단어, 축약어는 흔히 WER을 부풀리는 다른 요인입니다. 참조본이 “cannot”으로 쓰여 있고 전사본이 “can’t”로 쓰여 있다면, 청자는 전혀 알아채지 못하겠지만 이는 대체로 간주됩니다. 엄격한 벤치마크를 위해서는 먼저 양쪽을 정규화해야 하지만, 빠른 건전성 검사에는 일반적으로 토글만으로도 충분합니다.
WER, CER, 그리고 단어 정확도
단어 정확도는 1 - WER과 같으며, 숫자가 높을수록 좋습니다. 보고서에 더 친숙한 숫자이지만, 동일한 주의사항을 포함하고 있으며, 삽입이 많아지면 전사본이 “모든 단어가 틀린 것”보다 더 나빠질 수 있으므로 0으로 제한됩니다.
문자 오류율(Character Error Rate, CER)은 단어 대신 문자에 대해 동일한 편집 거리 계산을 수행합니다. CER은 단어 경계가 불확실할 때, 영어가 단어를 띄어쓰는 방식이 아닌 언어에서, 또는 거의 올바른 단어에 대해 부분 점수를 원할 때 더 나은 측정 항목입니다. “recognize”와 “recognise”는 WER에서는 완전한 대체이지만 CER에서는 단일 문자 편집이므로, CER은 더 낮게 나타나며 종종 아까운 오타에 대해 더 공정하게 평가됩니다.
영어 음성의 경우 WER을 헤드라인으로 사용하고, 낮은 WER에도 불구하고 아까운 오타에 대해 여전히 너무 가혹하다고 느껴질 때 CER을 확인하며, 오류율에 익숙하지 않은 사람에게 결과를 전달할 때는 단어 정확도를 인용하세요.
누가 단어 오류율을 확인하나요?
전사 서비스 제공업체를 비교하는 팀은 동일한 오디오를 각 서비스에 통과시키고, 클립을 손으로 전사하여 참조 자료로 사용하며, 각 도구의 결과물을 이에 대해 점수를 매깁니다. WER은 “이것이 더 좋게 느껴졌다”를 방어할 수 있는 숫자로 바꿉니다.
음성 인식을 연구하는 연구원과 학생들은 WER을 보고하는데, 이는 WER이 공통된 척도이기 때문입니다. 모델 변경은 보류된 참조 세트에서 WER이 떨어질 때에만 개선으로 간주됩니다.
자막 및 현지화 팀은 전사본이 번역되거나 자막 파일로 가기 전에 WER을 확인합니다. 이 단계에서의 오류는 하류에서 증폭되기 때문입니다. 그리고 전사 서비스 비용을 지불하고 그들이 지불한 것을 받았는지 알고 싶어하는 사람은 누구나 추측하는 대신 여기서 이를 측정할 수 있습니다.
숫자를 얻은 후
점수를 매긴 전사본이 거칠게 나왔고 더 깨끗한 버전으로 시작하고 싶다면, 전사 생성기는 화자 레이블이 포함된 전사본을 생성하며, AI 전사 확인기는 측정할 참조 자료가 없을 때 단일 전사본을 교정합니다. 만족스러운 점수 매긴 전사본을 자막 파일로 변환하려면, 텍스트를 SRT 변환기가 타이밍을 처리합니다.
녹음은 Whisper Large-v3에 의해 전사되며, 정확도 뒤에 있는 모델과 설정은 정확도 페이지에서 확인할 수 있습니다.


