複数話者の録音を文字起こしし、各話者にラベルを付ける
複数人が話している録音をアップロードするか、リンクを貼り付けると、ScreenAppは各話者にラベルと各行にタイムスタンプが付いた文字起こしに変換します。ブラウザレコーダーまたはiOSおよびAndroidアプリで会話をライブ録音するか、通話用にZoom、Google Meet、Microsoft Teams 用の会議ボットを接続し、ファイルができたらアップロードします。
ラベル付きの文字起こしは、誰が何を言ったかを確認するために録音を何度も聞き直す手間を省きます。
得られるもの:
- 100+言語で話者識別を含む文字起こし
- 任意の録音とのAIチャットにより、文字起こし全体をスキャンする代わりに、特定の話し手が何を言ったかを尋ねることができます
- AIノート:所有者と期限付きのアクションアイテム、および個別にリストされた決定事項
- PDF、DOCX、TXT、SRT、VTTとしてエクスポート
- 無料プラン:最大45分の録音の文字起こし2回、AIチャット付き
複数話者を文字起こしする方法
- アップロードまたはリンクを貼り付け: 音声または動画ファイル(MP4、M4V、MOV、AVI、WEBM、MKV、FLV、TS、MTS、M2TS、3GP、3GPP、3G2、WMV、ASF、VOB、OGV、RM、RMVB、MPG、MPEG、M2V、F4V、MXF)をドラッグするか、リンクを貼り付けます。開始するためにアカウント設定は不要です。
- 文字起こし: 音声がテキストに変換され、各話者が個別の話者ラベルに分割され、すべての文にタイムスタンプが付けられます。
- 確認とエクスポート: ブラウザで文字起こしを読み、必要に応じて話者ラベルの名前を変更し、PDF、DOCX、TXT、SRT、VTTとしてエクスポートします。
精度は音声と話されている言語に依存します。100+のサポートされている言語のうち25は単語レベルの話者ダイアライゼーションをサポートしています。残りの言語は話者ごとのラベルなしでテキストに文字起こしされます。参加者が近くにいてクロストークが少ない単一のマイクも、話者間の最も明確な分離を提供します。精度の測定方法をご覧ください。
複数話者文字起こしと他のアプリの比較
| 機能 | ScreenApp | Otter.ai | Rev | Sonix |
|---|---|---|---|---|
| 無料プラン | 文字起こし2回、各録音最大45分 | 300分/月 | 45分/月 (AI) | 30分トライアル |
| 話者識別 | 含まれる | ベーシック | 含まれる | 含まれる |
| 話者名変更 | 話者ラベルをクリックして名前を変更したり、チームメンバーに一致させたり、単一のセグメントを再割り当てしたりできます | 記載なし | 記載なし | 記載なし |
| AIノート | 含まれる | Pro、年払い$8.33/月、または月払い$16.99 | 記載なし | 記載なし |
| エクスポート形式 | PDF、DOCX、TXT、SRT、VTT | 無料プランでmp3とtxt、Pro以上でpdf、docx、srtも利用でき、Business以上で一括エクスポートに対応 | 記載なし | DOCX、PDF、TXT、SRT、VTT |
| 言語 | 100+ | 6 | 記載なし | 54+ |
| 有料プラン | 年払い$19/月 | 年払い$8.33/月 | 年払い$25.49/月 | $25/月 |
Sources, checked 2026-10-01: screenapp.io/accuracy#languages, screenapp.io/help/how-many-minutes-can-i-record, ScreenApp pricing, otter.ai/pricing, rev.com/pricing, sonix.ai/pricing, Editing speaker labels
- Otter.aiとの比較: Otterの無料プランは月300分に制限されており、無料プランでの話者識別はベーシックです。ScreenAppはすべてのプランで話者ラベルを含み、後からラベルの名前を変更できます。
- Revとの比較: Revの無料プランは月45分のAI文字起こしを提供し、その後はAI文字起こしに$25.49/月(年払い)、または人間による文字起こしに$1.99/分かかります。複数話者の録音を繰り返し行うと、どちらの料金でもすぐに高額になります。
- Sonixとの比較: Sonixは1回限りの30分間のトライアルを提供し、その後は月$25ドルのプランです。ScreenAppの無料プランは1回限りのトライアルではなく、更新されます。
複数話者文字起こしの利用者
ジャーナリストは、複数の情報源とのインタビューやパネルディスカッションを文字起こしし、事実確認のためにタイムスタンプ付きで各話者を直接引用します。
ポッドキャストプロデューサーは、ホストと複数のゲストとのエピソードを文字起こしし、話者ごとに会話を分割して番組ノートやクリップを作成します。
研究者は、グループインタビューやフォーカスグループを文字起こしし、話者ごとに文字起こしを読んで各参加者がどのように答えたかを確認します。
採用および人事チームは、複数の面接官と候補者とのパネルインタビューを文字起こしし、後でファイルを確認する人が誰が何を尋ねたかを確認できるようにします。
法務およびコンプライアンスチームは、証言、複数当事者間の通話、およびどの人物がどのセリフを言ったかを知ることが重要な録音された声明を文字起こしします。
ドキュメンタリーおよびビデオチームは、複数の被写体とのインタビュー映像を文字起こしし、話者ラベルを使用して各時点で誰がカメラに映っているかを記録します。


