Ukur Akurasi Transkripsi dengan WER
Tempelkan transkrip yang benar di satu kotak dan transkrip yang ingin Anda nilai di kotak lainnya, lalu baca Tingkat Kesalahan Kata (Word Error Rate). Anda juga mendapatkan tingkat kesalahan karakter, akurasi kata, dan perbedaan kata per kata yang menandai setiap substitusi, penghapusan, dan penyisipan. Semuanya berjalan di browser, jadi tidak ada transkrip yang diunggah ke mana pun.
WER adalah cara standar untuk mengukur seberapa dekat sebuah transkrip dengan kebenaran. Ini adalah apa yang dilaporkan dalam makalah pengenalan suara, apa yang digunakan tim untuk membandingkan satu alat transkripsi dengan yang lain, dan apa yang akan Anda gunakan untuk memutuskan apakah sebuah transkrip cukup bersih untuk dikirim atau memerlukan pemeriksaan ulang.
Apa yang Sebenarnya Diukur oleh Tingkat Kesalahan Kata
WER menghitung jumlah editan yang diperlukan untuk mengubah transkrip yang Anda periksa menjadi referensi, lalu dibagi dengan panjang referensi:
WER = (S + D + I) / N
S adalah substitusi, kata yang salah. D adalah penghapusan, kata referensi yang dihilangkan oleh transkrip. I adalah penyisipan, kata tambahan yang ditambahkan oleh transkrip. N adalah jumlah total kata dalam referensi. Alat ini menemukan kumpulan editan terkecil dengan menyelaraskan dua urutan kata, ide jarak edit yang sama di balik pemeriksa ejaan, sehingga hitungannya adalah pembacaan seadil mungkin daripada perbandingan sederhana dari kiri ke kanan.
WER 0 berarti keduanya cocok kata per kata. WER 0,10 berarti satu editan untuk setiap sepuluh kata referensi. Ini bisa melebihi 1,0, yang mengejutkan orang pada awalnya: jika transkrip diisi dengan kata-kata yang jauh lebih banyak daripada referensi, penyisipan saja bisa melebihi panjang referensi, jadi WER 120 persen adalah hasil nyata, bukan bug.
Cara Menghitung WER
- Tempelkan referensi, transkrip yang Anda tahu benar, ke dalam kotak kiri. Ini adalah apa yang menjadi acuan pengukuran segalanya, jadi ini harus menjadi yang dapat dipercaya.
- Tempelkan transkrip yang ingin Anda nilai ke dalam kotak kanan.
- Pilih apakah akan mengabaikan huruf kapital dan tanda baca, lalu baca WER, CER, akurasi, dan diff yang ditandai di bawah.
Perbedaannya adalah bagian yang patut dibaca. Satu angka memberi tahu Anda seberapa buruk, perbedaannya memberi tahu Anda di mana dan mengapa. Anda dapat melihat sekilas apakah kesalahan tersebut adalah salah dengar yang tersebar atau satu kalimat utuh yang hilang, dan itu mengubah apa yang akan Anda lakukan selanjutnya.
Mengapa WER Anda Mungkin Terlihat Lebih Buruk daripada Transkrip Sebenarnya
WER mentah tidak memaafkan hal-hal yang sebenarnya bukan kesalahan. “Hello.” dan “hello” dihitung sebagai substitusi jika Anda menyertakan tanda baca dan huruf besar. Demikian juga “OK” versus “okay”, atau “twenty” versus “20”. Tidak ada yang mengubah makna, tetapi setiap satu menambah hitungan.
Itulah mengapa dua tombol pengalih itu penting. Mengabaikan huruf kapital dan tanda baca adalah pengaturan normal untuk membandingkan konten lisan, karena Anda peduli apakah kata-katanya benar, bukan apakah ada koma. Matikan mereka ketika pemformatan adalah bagian dari apa yang Anda nilai, misalnya file subtitle di mana kapitalisasi dan tanda baca adalah hasil yang diharapkan. Tidak ada satu pengaturan yang benar. Langkah jujur adalah memilih satu, menjaganya tetap sama di setiap transkrip yang Anda bandingkan, dan mengatakan yang mana yang Anda gunakan.
Angka, kata-kata yang dieja, dan singkatan adalah pemicu umum lainnya. Jika referensi Anda menulis “cannot” dan transkrip menulis “can’t”, itu adalah substitusi meskipun pendengar tidak akan pernah menyadarinya. Untuk tolok ukur yang ketat, Anda menormalisasi kedua sisi terlebih dahulu; untuk pemeriksaan cepat, tombol pengalih biasanya sudah cukup.
WER, CER, dan Akurasi Kata
Akurasi kata hanyalah `1 - WER`, dibalik sehingga semakin tinggi semakin baik. Ini adalah angka yang lebih ramah untuk laporan, meskipun membawa peringatan yang sama, dan dibatasi pada nol karena transkrip bisa lebih buruk daripada “semua kata salah” setelah penyisipan menumpuk.
Tingkat Kesalahan Karakter (Character Error Rate) melakukan penghitungan jarak edit yang sama pada karakter daripada kata. CER adalah metrik yang lebih baik ketika batas kata tidak dapat diandalkan, untuk bahasa yang tidak memberi spasi antar kata seperti bahasa Inggris, atau ketika Anda ingin kredit parsial untuk kata yang hampir benar. “recognize” versus “recognise” adalah substitusi penuh di bawah WER tetapi editan satu karakter di bawah CER, jadi CER membaca lebih rendah dan seringkali lebih adil untuk kesalahan yang tipis.
Gunakan WER sebagai judul utama untuk ucapan bahasa Inggris, lihat CER ketika WER rendah masih terasa terlalu keras pada kesalahan yang tipis, dan kutip akurasi kata ketika Anda menyerahkan hasil kepada seseorang yang tidak terbiasa dengan tingkat kesalahan.
Siapa yang Memeriksa Tingkat Kesalahan Kata
Tim yang membandingkan vendor transkripsi menjalankan audio yang sama melalui setiap vendor, mentranskripsi klip secara manual sebagai referensi, dan menilai output setiap alat melawannya. WER mengubah “yang ini terasa lebih baik” menjadi angka yang dapat mereka pertahankan.
Peneliti dan mahasiswa yang mengerjakan pengenalan suara melaporkan WER karena ini adalah standar bersama. Perubahan model hanya merupakan peningkatan jika WER turun pada set referensi yang disimpan.
Tim pengkapsionan dan lokalisasi memeriksa WER sebelum transkrip diterjemahkan atau menjadi file subtitle, karena kesalahan pada tahap ini akan berlipat ganda di kemudian hari. Dan siapa pun yang telah membayar transkripsi dan ingin tahu apakah mereka mendapatkan apa yang mereka bayar dapat mengukurnya di sini alih-alih menebak.
Setelah Anda Mendapatkan Angka
Jika transkrip yang Anda nilai keluar kasar dan Anda menginginkan yang lebih bersih untuk memulai, generator transkrip menghasilkan transkrip dengan label pembicara, dan pemeriksa transkrip AI mengoreksi satu transkrip ketika Anda tidak memiliki referensi untuk diukur. Untuk mengubah transkrip yang dinilai menjadi file subtitle setelah Anda puas dengannya, konverter teks ke SRT menangani pengaturan waktu.
Rekaman ditranskripsi oleh Whisper Large-v3, dan Anda dapat melihat model dan pengaturan di balik akurasi di halaman akurasi.
Pertanyaan Umum
Berapa Tingkat Kesalahan Kata yang baik?
Itu sepenuhnya tergantung pada audio. Audio yang bersih, dibaca oleh satu pembicara dapat mencapai angka satu digit rendah, sementara rekaman yang bising, banyak pembicara, atau dengan aksen yang kuat akan jauh lebih tinggi untuk setiap alat. Tidak ada batas kelulusan universal. Bandingkan alat pada audio yang sama dengan referensi yang sama, dan nilai WER berdasarkan itu, bukan berdasarkan angka dari dataset yang berbeda.
Bagaimana WER dihitung?
Dengan menyelaraskan transkrip dengan referensi untuk menemukan jumlah editan paling sedikit di antara keduanya, menghitung substitusi, penghapusan, dan penyisipan, dan membagi total tersebut dengan jumlah kata dalam referensi. Alat ini melakukan penyelarasan untuk Anda dan menunjukkan setiap editan dalam diff.
Bisakah Tingkat Kesalahan Kata lebih dari 100%?
Ya. Jika transkrip menambahkan lebih banyak kata daripada yang dimiliki referensi, penyisipan saja dapat mendorong total editan melewati panjang referensi, sehingga WER melampaui 1.0. Referensi yang sangat pendek dibandingkan dengan transkrip yang panjang dan salah adalah cara umum untuk melihatnya.
Apakah kapitalisasi dan tanda baca dihitung?
Hanya jika Anda membiarkan tombol-tombol tersebut menyala. Secara default alat ini mengabaikan keduanya, karena untuk konten lisan kebanyakan orang peduli apakah kata-katanya benar, bukan kapitalisasinya. Nyalakan jika format itu sendiri yang Anda nilai.
Apa perbedaan antara WER dan CER?
WER menghitung kesalahan dalam kata-kata utuh, CER menghitungnya dalam karakter. CER memberikan nilai parsial untuk kata yang hampir benar dan berfungsi lebih baik untuk bahasa yang tidak memisahkan kata dengan spasi. Untuk ucapan bahasa Inggris, WER adalah metrik utama yang biasa dan CER adalah tinjauan kedua yang berguna.
Apakah transkrip saya bersifat pribadi?
Ya. Seluruh perhitungan terjadi di browser Anda dengan JavaScript. Baik referensi maupun transkrip yang Anda nilai tidak dikirim ke server, jadi tidak ada yang diunggah, disimpan, atau dicatat.
Bagaimana cara mengukur akurasi alat transkripsi saya?
Transkripsikan klip secara manual, atau koreksi satu transkrip dengan cermat, dan gunakan itu sebagai referensi. Jalankan audio yang sama melalui alat yang Anda uji dan tempelkan keluarannya sebagai transkrip untuk dinilai. WER adalah tingkat kesalahan alat tersebut pada klip itu. Gunakan beberapa klip untuk mendapatkan pembacaan yang dapat Anda percaya.