実際に証明できる翻訳の失敗を捕捉する
ソースのトランスクリプトを片側に、翻訳をもう片側に貼り付けると、セグメントごとに比較されます。何が欠落しているか、元の言語のまま残っているか、どの数字が消えたか、字幕のタイミングがどこでずれたかを報告します。すべてブラウザ内で行われるため、未公開のスクリプトはあなたのマシンに保持されます。
これは、機械翻訳が特定の方法で、退屈で、確認可能な形で失敗するためです。つまり、静かにコンテンツを落とします。40のキューがあるファイルが入力され、31のキューで戻ってきても、その過程で何も通知されません。視聴者が気づくまで、誰も気づきません。
何をチェックし、なぜそれらをチェックするのか
ここでのすべてのチェックは、意見ではなく証拠で解決できるものです。
欠落したセグメント。ソースに対する翻訳されたキューの数。翻訳が短い場合、コンテンツがドロップされており、長いファイルではほとんどの場合、最後が欠落しています。これは最も一般的な失敗であり、ファイルの冒頭が完璧に読めるため、目で見て見過ごしやすいものです。
未翻訳の行。テキストがソースと同一のセグメント。ブランド名や変更すべきでない製品用語など、それが正しい場合もあります。多くの場合、翻訳者がその部分をスキップし、原文をそのまま通過させたことを意味します。ツールはそれをフラグ立てし、あなたがどれであるかを判断できるようにします。
消えた数字。各ソースセグメントから数字を抽出し、それらが翻訳に残っているかを確認します。価格、日付、パーセンテージ、バージョン番号。ターゲット言語で流暢に読める文でも、その文の全体的なポイントであった数字が失われていることがあります。
タイミングのずれ。両方のファイルがキューのタイミングを持っている場合、それらを比較します。タイミングがずれた翻訳字幕は、間違った瞬間に表示され、それは多少ぎこちない文章よりも悪い視聴体験となります。
これができないこと、はっきり言えば
翻訳の良し悪しを判断することはありません。
流暢さ、トーン、レジスター、ジョークがうまく伝わったか、専門用語が正しく表現されたか:これらはすべて、異なる言語の2つの文字列を比較してもチェックできません。セグメントはここでのすべてのチェックを通過しても、その言語のネイティブスピーカーだけが気づく方法で間違っている可能性があります。
したがって、これは最後のゲートではなく、最初のゲートとして扱ってください。機械的な失敗を安価かつ大規模に捕捉するため、人間のレビュー担当者はキューを数える代わりに意味に注意を集中できるようになります。レビュー担当者に送る前にこれを実行すべきであり、レビュー担当者の代わりではありません。
長さの比較も同じ理由で最も緩いチェックです。一部の言語ペアは実際に膨張または圧縮することがあり、英語に対するドイツ語がその典型的な例であるため、そこでのフラグは調査を促すものであり、評決ではありません。
文字起こしの精度は別の問題
似て聞こえる2つのことを区別する価値があります。トランスクリプトを、それが作成された音声(同じ言語)と照合することは、文字起こしの精度であり、その尺度は単語誤り率です。単語誤り率計算機はその役割を果たします。同じ言語の2つのバージョンをアラインし、置換、削除、挿入を数えます。
このページはクロス言語版であり、単語は異なるはずなので、単語誤りを数えることはできません。そのため、代わりに構造と完全性を測定します。WERは「文字起こしは正しく聞き取れたか」に、これは「翻訳がすべてを保持したか」に使用してください。
チェックの前と後
翻訳自体がまだ必要な場合、ビデオ翻訳機は吹き替えと字幕を扱い、YouTubeビデオ翻訳機はリンクから直接機能します。そもそもソースのトランスクリプトを生成するには、トランスクリプトジェネレーターを使用してください。そして、翻訳が合格したら、テキストからSRTへの変換が、タイミングを保持した字幕ファイルに変換します。