使用 WER 衡量转录准确性
将正确的文本粘贴到一个框中,将要评分的文本粘贴到另一个框中,然后查看词错误率。您还会获得字符错误率、词准确率,以及一个逐词差异,标记出每个替换、删除和插入。所有这些都在浏览器中运行,因此任何文本都不会被上传到任何地方。
WER 是衡量转录文本与真实情况接近程度的标准方法。它是语音识别论文报告的指标,是团队用于比较不同转录工具的指标,也是您用来决定转录文本是否足够清晰可以发布或需要再次处理的指标。
词错误率实际衡量什么
WER 计算将您正在检查的转录文本转换为参考文本所需的编辑次数,然后除以参考文本的长度:
WER = (S + D + I) / N
S 是替换,即说错的词。D 是删除,即转录文本中漏掉的参考词。I 是插入,即转录文本中额外添加的词。N 是参考文本中的总词数。该工具通过对齐两个词序列来找到这些编辑的最小集合,这与拼写检查器背后的编辑距离思想相同,因此计数是最公平的可能读数,而不是简单的从左到右比较。
WER 为 0 意味着两者逐字匹配。WER 为 0.10 意味着每十个参考词有一个编辑。它可能高于 1.0,这在首次遇到时会让人感到惊讶:如果转录文本比参考文本多出许多词,仅插入的词数就可能超过参考文本的长度,因此 120% 的 WER 是一个真实的结果,而不是一个错误。
如何计算 WER
- 将参考文本(您知道是正确的转录文本)粘贴到左侧框中。这是衡量一切的标准,因此它必须是可信的。
- 将您想要评分的转录文本粘贴到右侧框中。
- 选择是否忽略大小写和标点符号,然后阅读下面的 WER、CER、准确率和标记的差异。
差异是值得阅读的部分。一个数字告诉您有多糟糕,差异告诉您问题出在哪里以及为什么。您可以一目了然地看到错误是零星的听错还是整个句子被遗漏,这会改变您接下来要做的事情。
为什么您的 WER 可能看起来比实际转录文本更差
原始 WER 对那些并非真正错误的事情是毫不留情的。“Hello.”和“hello”在您保留标点和大小写时算作一个替换。同样,“OK”与“okay”,或者“twenty”与“20”也是如此。这些都不会改变含义,但每一个都会增加计数。
这就是为什么这两个切换很重要。忽略大小写和标点符号是比较口语内容的正常设置,因为您关心的是词是否正确,而不是逗号是否落在那里。当格式是您评分的一部分时,例如字幕文件(其中大小写和标点符号是交付物),请关闭它们。没有一个单一的正确设置。诚实的做法是选择一个,在您比较的每个转录文本中保持一致,并说明您使用了哪一个。
数字、拼写出的词和缩写是其他常见的膨胀因素。如果您的参考文本写的是“cannot”而转录文本写的是“can’t”,那也是一个替换,尽管听者永远不会注意到。对于严格的基准测试,您需要先规范化两边;对于快速的健全性检查,这些切换通常就足够了。
WER、CER 和词准确率
词准确率只是 1 - WER,反转过来,所以越高越好。它是一个更友好的报告数字,尽管它带有相同的警告,并且被限制在零,因为一旦插入词堆积起来,转录文本可能比“所有词都错了”更糟糕。
字符错误率对字符而不是词进行相同的编辑距离计数。当词边界不可靠时,CER 是更好的指标,例如对于不像英语那样用空格分隔词的语言,或者当您希望对几乎正确的词给予部分分数时。“recognize”与“recognise”在 WER 下是一个完整的替换,但在 CER 下是一个单字符编辑,因此 CER 读数更低,对于接近的错误通常更公平。
将 WER 用作英语语音的标题,当低 WER 对于接近的错误仍然显得过于严苛时,查看 CER,并在将结果交给不熟悉错误率的人时引用词准确率。
谁来检查词错误率
比较转录供应商的团队会将相同的音频运行通过每个供应商,手动转录一个片段作为参考,并根据该参考对每个工具的输出进行评分。词错误率(WER)将“这个感觉更好”转化为一个他们可以辩护的数字。
从事语音识别的研究人员和学生报告词错误率(WER),因为它是共享的衡量标准。只有当模型在保留的参考数据集上的词错误率(WER)下降时,才算是一种改进。
字幕和本地化团队会在转录本提交给翻译或字幕文件之前检查词错误率(WER),因为在此阶段的错误会在下游被放大。任何支付了转录费用并想知道是否物有所值的人,都可以在这里衡量,而不是猜测。
有了数字之后
如果你正在评分的转录本初稿很粗糙,并且你想要一个更清晰的版本作为起点,转录生成器会生成带有说话人标签的转录本,当你没有参考可供衡量时,AI 转录检查器会校对单个转录本。一旦你对评分后的转录本满意,并想将其转换为字幕文件,文本转SRT转换器会处理时间轴。
录音由 Whisper Large-v3 进行转录,你可以在准确性页面查看准确性背后的模型和设置。


