Calculadora da Taxa de Erro de Palavras

Cole a transcrição correta e a que você quer avaliar, e obtenha a Taxa de Erro de Palavras com as substituições, exclusões e inserções marcadas. Ele funciona no navegador, então nenhuma transcrição é carregada.

Amado por mais de 8.1 milhões de pessoas

Meça a Precisão da Transcrição com WER

Cole a transcrição correta em uma caixa e a transcrição que você quer pontuar na outra, então leia a Taxa de Erro de Palavras. Você também obtém a taxa de erro de caracteres, a precisão de palavras e um diff palavra por palavra que marca cada substituição, exclusão e inserção. Tudo roda no navegador, então nenhuma transcrição é enviada para lugar nenhum.

WER é a forma padrão de quantificar o quão próxima uma transcrição está da verdade. É o que os artigos de reconhecimento de fala relatam, o que as equipes usam para comparar uma ferramenta de transcrição com outra, e o que você usaria para decidir se uma transcrição está limpa o suficiente para ser entregue ou precisa de outra revisão.

O Que a Taxa de Erro de Palavras Realmente Mede

WER conta as edições necessárias para transformar a transcrição que você está verificando na referência, então divide pelo comprimento da referência:

WER = (S + D + I) / N

S são substituições, uma palavra que saiu errada. D são exclusões, uma palavra de referência que a transcrição omitiu. I são inserções, uma palavra extra que a transcrição adicionou. N é o número total de palavras na referência. A ferramenta encontra o menor conjunto dessas edições alinhando as duas sequências de palavras, a mesma ideia de distância de edição por trás dos corretores ortográficos, então a contagem é a leitura mais justa possível, em vez de uma comparação ingênua da esquerda para a direita.

Um WER de 0 significa que os dois correspondem palavra por palavra. Um WER de 0.10 significa uma edição para cada dez palavras de referência. Ele pode ir acima de 1.0, o que surpreende as pessoas pela primeira vez: se a transcrição for preenchida com muito mais palavras do que a referência, as inserções sozinhas podem superar o comprimento da referência, então 120 por cento de WER é um resultado real, não um bug.

Como Calcular o WER

  1. Cole a referência, a transcrição que você sabe que está correta, na caixa da esquerda. É contra isso que tudo é medido, então ela precisa ser a confiável.
  2. Cole a transcrição que você quer pontuar na caixa da direita.
  3. Escolha se deseja ignorar maiúsculas e pontuação, então leia o WER, CER, precisão e o diff marcado abaixo.

O diff é a parte que vale a pena ler. Um único número diz o quão ruim, o diff diz onde e por quê. Você pode ver rapidamente se os erros são falhas de escuta dispersas ou uma sentença inteira omitida, e isso muda o que você faz a seguir.

Por Que Seu WER Pode Parecer Pior do Que a Transcrição Realmente É

O WER bruto é implacável com coisas que não são realmente erros. “Hello.” e “hello” contam como uma substituição se você mantiver pontuação e maiúsculas/minúsculas. O mesmo acontece com “OK” versus “okay”, ou “twenty” versus “20”. Nenhuma dessas coisas muda o significado, mas cada uma adiciona à contagem.

É por isso que os dois interruptores importam. Ignorar maiúsculas e pontuação é a configuração normal para comparar conteúdo falado, porque você se importa se as palavras estão certas, não se uma vírgula caiu. Desligue-os quando a formatação for parte do que você está avaliando, por exemplo, um arquivo de legenda onde maiúsculas/minúsculas e pontuação são o entregável. Não há uma única configuração correta. O passo honesto é escolher uma, mantê-la a mesma em todas as transcrições que você comparar e dizer qual você usou.

Números, palavras soletradas e contrações são os outros infladores comuns. Se sua referência escreve “cannot” e a transcrição escreve “can’t”, isso é uma substituição, mesmo que um ouvinte nunca percebesse. Para um benchmark rigoroso, você normaliza ambos os lados primeiro; para uma verificação rápida de sanidade, os interruptores geralmente são suficientes.

WER, CER e Precisão de Palavras

A precisão de palavras é apenas 1 - WER, invertida para que um valor mais alto seja melhor. É o número mais amigável para um relatório, embora carregue as mesmas ressalvas, e é limitada a zero porque uma transcrição pode ser pior do que “todas as palavras erradas” uma vez que as inserções se acumulam.

A Taxa de Erro de Caracteres (CER) faz a mesma contagem de distância de edição em caracteres em vez de palavras. CER é a melhor métrica quando os limites das palavras são pouco confiáveis, para idiomas que não separam as palavras da mesma forma que o inglês, ou quando você quer crédito parcial para uma palavra que está quase certa. “recognize” versus “recognise” é uma substituição completa sob WER, mas uma edição de um único caractere sob CER, então o CER lê mais baixo e muitas vezes é mais justo para erros próximos.

Use o WER como título para a fala em inglês, consulte o CER quando um WER baixo ainda parecer muito rigoroso em erros próximos, e cite a precisão de palavras quando estiver entregando um resultado a alguém que não vive em taxas de erro.

Quem Verifica a Taxa de Erro de Palavra

Equipes que comparam fornecedores de transcrição executam o mesmo áudio através de cada um, transcrevem um clipe à mão como referência e pontuam a saída de cada ferramenta em relação a ele. O WER transforma “este pareceu melhor” em um número que podem defender.

Pesquisadores e estudantes que trabalham com reconhecimento de fala relatam o WER porque é o padrão de medida compartilhado. Uma mudança de modelo é apenas uma melhoria se o WER cair em um conjunto de referência separado.

Equipes de legendagem e localização verificam o WER antes que uma transcrição vá para a tradução ou para um arquivo de legenda, já que um erro nesta fase é multiplicado adiante. E qualquer pessoa que pagou por transcrição e quer saber se obteve o que pagou pode medi-lo aqui em vez de adivinhar.

Depois de Ter o Número

Se a transcrição que você está pontuando saiu bruta e você quer uma mais limpa para começar, o gerador de transcrições produz a transcrição com rótulos de locutor, e o verificador de transcrições de IA revisa uma única transcrição quando você não tem uma referência para medir. Para transformar uma transcrição pontuada em um arquivo de legenda depois de estar satisfeito com ela, o conversor de texto para SRT cuida da sincronização.

As gravações são transcritas por Whisper Large-v3, e você pode ver os modelos e a configuração por trás da precisão na página de precisão.

Perguntas Frequentes

O que é uma boa Taxa de Erro de Palavra?

Depende inteiramente do áudio. Áudio limpo, lido por um único locutor, pode cair nos dígitos únicos baixos, enquanto gravações ruidosas, com múltiplos locutores ou com sotaque forte, resultam em valores muito mais altos para qualquer ferramenta. Não existe uma marca de aprovação universal. Compare as ferramentas no mesmo áudio com a mesma referência e julgue o WER em relação a isso, não em relação a um número de um conjunto de dados diferente.

Como o WER é calculado?

Alinhando a transcrição com a referência para encontrar o menor número de edições entre elas, contando substituições, deleções e inserções, e dividindo esse total pelo número de palavras na referência. Esta ferramenta faz o alinhamento para você e mostra cada edição na diferença.

A Taxa de Erro de Palavra pode ser superior a 100%?

Sim. Se a transcrição adicionar muitas mais palavras do que a referência possui, as inserções sozinhas podem empurrar o total de edições além do comprimento da referência, então o WER ultrapassa 1.0. Uma referência muito curta contra uma transcrição longa e errada é a forma usual de vê-lo.

A capitalização e a pontuação contam?

Apenas se você deixar esses seletores ativados. Por padrão, a ferramenta ignora ambos, porque para conteúdo falado a maioria das pessoas se importa se as palavras estão corretas, e não com a capitalização. Ligue-os quando a própria formatação for o que você está avaliando.

Qual é a diferença entre WER e CER?

WER conta erros em palavras inteiras, CER os conta em caracteres. CER dá crédito parcial para uma palavra que está quase certa e funciona melhor para idiomas que não separam palavras com espaços. Para a fala em inglês, WER é o indicador principal usual e CER é uma segunda análise útil.

Minha transcrição é privada?

Sim. Todo o cálculo acontece no seu navegador com JavaScript. Nem a referência nem a transcrição que você está pontuando são enviadas para um servidor, então nada é carregado, armazenado ou registrado.

Como meço a precisão da minha ferramenta de transcrição?

Transcreva um clipe manualmente, ou corrija uma transcrição cuidadosamente, e use isso como referência. Execute o mesmo áudio através da ferramenta que você está testando e cole sua saída como a transcrição a ser pontuada. O WER é a taxa de erro dessa ferramenta nesse clipe. Use vários clipes para uma leitura em que você possa confiar.

FAQ

O que é uma boa Taxa de Erro de Palavra?

Depende inteiramente do áudio. Áudio limpo, lido por um único locutor, pode cair nos dígitos únicos baixos, enquanto gravações ruidosas, com múltiplos locutores ou com sotaque forte, resultam em valores muito mais altos para qualquer ferramenta. Não existe uma marca de aprovação universal. Compare as ferramentas no mesmo áudio com a mesma referência e julgue o WER em relação a isso, não em relação a um número de um conjunto de dados diferente. #

Como o WER é calculado?

Alinhando a transcrição com a referência para encontrar o menor número de edições entre elas, contando substituições, deleções e inserções, e dividindo esse total pelo número de palavras na referência. Esta ferramenta faz o alinhamento para você e mostra cada edição na diferença. #

A Taxa de Erro de Palavra pode ser superior a 100%?

Sim. Se a transcrição adicionar muitas mais palavras do que a referência possui, as inserções sozinhas podem empurrar o total de edições além do comprimento da referência, então o WER ultrapassa 1.0. Uma referência muito curta contra uma transcrição longa e errada é a forma usual de vê-lo. #

A capitalização e a pontuação contam?

Apenas se você deixar esses seletores ativados. Por padrão, a ferramenta ignora ambos, porque para conteúdo falado a maioria das pessoas se importa se as palavras estão corretas, e não com a capitalização. Ligue-os quando a própria formatação for o que você está avaliando. #

Qual é a diferença entre WER e CER?

WER conta erros em palavras inteiras, CER os conta em caracteres. CER dá crédito parcial para uma palavra que está quase certa e funciona melhor para idiomas que não separam palavras com espaços. Para a fala em inglês, WER é o indicador principal usual e CER é uma segunda análise útil. #

Minha transcrição é privada?

Sim. Todo o cálculo acontece no seu navegador com JavaScript. Nem a referência nem a transcrição que você está pontuando são enviadas para um servidor, então nada é carregado, armazenado ou registrado. #

Como meço a precisão da minha ferramenta de transcrição?

Transcreva um clipe manualmente, ou corrija uma transcrição cuidadosamente, e use isso como referência. Execute o mesmo áudio através da ferramenta que você está testando e cole sua saída como a transcrição a ser pontuada. O WER é a taxa de erro dessa ferramenta nesse clipe. Use vários clipes para uma leitura em que você possa confiar. #

Resultados Reais de Usuários Reais

Aaron photo

Aaron

Gerente de Projeto

★★★★★

Nossa experiência geral com o ScreenApp tem sido apenas positiva! O suporte deles é fantástico, e o ScreenApp é um ótimo sistema de gravação.

JP photo

JP

Gerente de Operações

★★★★★

Finalmente, um gravador de tela que não coloca marcas d'água em tudo. O plano gratuito me dá 45 minutos de processamento de IA mensalmente - isso é suficiente para a maioria dos meus vídeos de treinamento.

Trina photo

Trina

Fundadora

★★★★★

Eu estava cética sobre outro assistente de notas com IA, mas o nível gratuito generoso do ScreenApp me conquistou completamente. A qualidade é de nível profissional, e os recursos de IA realmente funcionam como anunciado. Agora uso para todas as minhas apresentações com clientes e demos da equipe.

Kelvin photo

Kelvin

Engenheiro de Software

★★★★★

Os aplicativos desktop e mobile são fantásticos. Gravar reuniões enquanto estou em movimento nunca foi tão fácil, e o recurso de ditado economiza muito tempo.

Millie photo

Millie

Diretora

★★★★★

Nossa equipe estava se afogando no feedback dos clientes até encontrarmos o ScreenApp. Agora gravamos toda apresentação e chamada de cliente, e os resumos de IA são perfeitos.

Tanmay photo

Tanmay

Especialista em Marketing

★★★★★

Torna a gravação e o compartilhamento de guias fáceis. Adoro como posso capturar minha tela e transformá-la instantaneamente em guias passo a passo em qualquer formato. Inteligente, simples e um uso brilhante da IA.

Sav photo

Sav

Gerente de Projeto

★★★★★

Os usuários elogiam consistentemente nossa plataforma baseada na web que não requer instalação. Comece a gravar em segundos, não minutos.

Nate photo

Nate

Criador de Vídeo

★★★★★

A capacidade de transcrever e resumir automaticamente gravações economiza muito tempo, transformando conteúdo de vídeo em dados úteis e pesquisáveis.

User
User
User
Junte-se a 8,179,408+ usuários

Pronto para aumentar sua produtividade?

Experimente Calculadora da Taxa de Erro de Palavras e mais de 300 outros recursos alimentados por IA gratuitamente.

Começar Grátis →

Comece a usar em 60 segundos • Sem necessidade de cartão de crédito