長文の壁を読みやすい文字起こしに変換
生の文字起こしを貼り付けると、話者ラベル、適切な場所での段落区切り、そして不要な言葉が整理された状態で返されます。ほとんどの自動文字起こしツールは、構造のない切れ目のないテキストブロックを渡しますが、これはそれを読みやすくするためのステップです。
すでにお持ちのテキストに機能します。Otter、Zoom、Google Meet、YouTube字幕、Whisper、または任意のレコーダーからのエクスポートをドロップインするだけで、元の出力が省略した構造を整えます。
生の自動文字起こしが実際にどのように見えるか
会議ツールから文字起こしをエクスポートしたことがあるなら、その問題をご存知でしょう。これが典型的な生の出力の一部です。
そうですね、一番大事なのは、金曜日までにオンボーディングフローをリリースする必要があるということです。ええと、マーケティングのローンチがそれに紐付いているので、もしそれが遅れると、他のすべてが動いてしまいますよね。それから、ジョンがAPI作業を引き受けると言いましたが、彼は火曜日は休みなので、バックアップが必要です。正直、私ができます。
そして、これがフォーマット後の同じ文章です。
話者1: 大事なのは、金曜日までにオンボーディングフローをリリースする必要があるということです。マーケティングのローンチがそれに紐付いているからです。もしそれが遅れると、他のすべてが動きます。
話者2: ジョンがAPI作業を引き受けると言いましたが、彼は火曜日は休みなので、バックアップが必要です。私ができます。
同じ言葉、同じ意味。違いは、後者が読みやすいことです。それがこのツールのすべてです。
修正できること
音声認識の生出力には予測可能な問題があり、これはそれぞれに対応します。
- 段落がない。40分の通話が切れ目のない一つのブロックとして返されます。フォーマッターはトピックや話者が変わる場所で区切りを入れ、目が留まる場所を作ります。
- 話者ラベルがない、または乱雑。声を分離してラベル付けし、インタビューが独り言ではなく対話のように読めるようにします。もし元データに「話者1」のようなマーカーがある場合、それを保持し、整理します。
- フィラーと誤発言。「ええと」、二重になった「the the」、途中でやり直された文など、逐語的な文字起こしを読みにくくするものが、実際に言われたことを変えることなく整理されます。
- 文の区切りが不適切。自動文字起こしは、3つの文を結合したり、1つの文を行の途中で分割したりすることがよくあります。フォーマッターは句点をあるべき場所に戻します。
一つできないこと:音声を文字起こしすることではありません。これはすでにお持ちのテキストをフォーマットします。もし文字起こし自体がまだ必要な場合は、音声からテキストへの変換ツールまたはオンライン文字起こしジェネレーターから始めて、その結果をここに通して整理してください。
文字起こしの元
その混乱は、生成元のツールによって少し異なり、フォーマッターは一般的なものに対応します。
- ZoomとGoogle Meetのエクスポートには通常、タイムスタンプと大まかな話者タグがありますが、段落がないため、1時間の会議が壁のような一つの塊になります。これによって区切りが追加されます。
- OtterとFirefliesは、よりきれいな話者分離を提供しますが、それでも逐語的であり、「ええと」ややり直しがすべて含まれています。これはそれを整理します。
- YouTubeの字幕は、画面表示に合わせてタイミングが設定されているため、読むためではなく、句読点のない短い2、3単語の行で提供されます。これはそれらを文にまとめ直します。
- Whisperと生のASR出力は、多くの場合、句読点のない長い文字列です。これは最も困難な開始点であり、フォーマットが最も役立つ場所です。
きれいな文字起こしがこの手順を踏む価値がある理由
生の状態の文字起こしは技術的には情報を含んでいますが、誰もそれを読みたいとは思いません。そして、それが文字起こしの目的です。フォーマットされたものであれば、実際にざっと目を通したり、引用したり、他の人に渡したりすることができます。構造化された段落を読み進めるスクリーンリーダーは、切れ目のないブロックを突き進むものよりもアクセシビリティが向上するため、読みやすくなります。また、SEOのためにページに公開された文字起こしは、検索エンジンが解析に苦労する単一の区別のない段落である場合よりも、読みやすい散文である場合の方がはるかに大きな効果を発揮します。
トランスクリプトをフォーマットする方法
- 生のトランスクリプトをボックスに貼り付けます。
- 発話者ラベル、段落区切り、および軽いクリーンアップが追加されます。
- 整形されたバージョンをコピーして、すぐに読んだり、共有したり、ドキュメントに挿入したりできます。
インストールするものも、アップロードする音声もありません。テキストを入力すると、よりクリーンなテキストが出力されます。
トランスクリプトをクリーンアップする人
- 生のインタビューの書き出しを、余分な部分を読み飛ばすことなく読み、引用できるものに変換するジャーナリストや研究者。
- ショーノートやキャプション用にトランスクリプトを準備するポッドキャスターやビデオチーム。テキストの塊のようなバージョンでは役に立ちません。
- 会議のメモを持っている人で、ZoomやOtterのトランスクリプトがブロックとして返され、チームと共有する前に構造化する必要がある人。
- 講義のトランスクリプトを、だらだらと続く段落ではなく、学習資料として機能するようにクリーンアップする学生。
フォーマットされたら、次のステップは通常、以下のいずれかです:テキストからSRT変換ツールで字幕に変換するか、トランスクリプトから議事録ツールで決定事項やアクションアイテムを抽出するか、またはAI要約ツールで要約します。
よくある質問
乱れたトランスクリプトをフォーマットするにはどうすればよいですか?
生のトランスクリプトをツールに貼り付けると、発話者ラベルと段落区切りが追加され、余分な部分がクリーンアップされたフォーマット済みのバージョンが返されます。何も再入力したり、手作業で構造を追加したりする必要はありません。
音声を文字起こししますか、それともテキストをフォーマットするだけですか?
テキストをフォーマットするだけです。既にあるトランスクリプトをクリーンアップします。まず録音からトランスクリプトを作成するには、音声からテキストへの変換ツールを使用し、その結果をここでフォーマットしてください。
発言された言葉は変更されますか?
いいえ。それは構造を再構築し、整理し、段落区切りと発話者ラベルを追加し、「えーと」や言い間違いのような余分な部分を削除します。実際のコンテンツを書き換えたり、誰かの口に言葉を押し込んだりすることはありません。
話者を区別できますか?
会話の流れから音声を分離し、ラベル付けします。元のトランスクリプトにすでに話者マーカーがある場合、それを保持し、整形します。後でラベルの名前を変更できるため、「話者1」を実際の名前として設定できます。
YouTubeやOtterのエクスポートで動作しますか?
はい、動作します。YouTubeのキャプションは句読点のない短い行として提供されますが、これを文章にまとめます。Otterなどのツールはフィラーを含む逐語的なテキストを提供しますが、これはそれをトリミングします。ツールが提供したものをそのまま貼り付けてください。
長さ制限はありますか?
長いトランスクリプトも処理できますが、非常に長いものはセクションに分けて作業する方が簡単です。数時間にわたる会議の場合、数回に分けてフォーマットすることで、出力が整った状態を保てます。
無料ですか?
最初のトランスクリプトは無料で試せます。クレジットカードは不要です。その後は、無制限利用が年間プランで月額19ドルになります。
フォーマットされたトランスクリプトで何ができますか?
ドキュメントにコピーしたり、番組のメモや記事に使ったり、テキストからSRT変換ツールで字幕にしたり、議事録ツールに渡して決定事項やアクションアイテムを抽出したりできます。