文字起こしで話者にラベルを付け、タイムスタンプを取得
複数の話者がいる音声または動画をアップロードするか、そのリンクを貼り付けると、ScreenAppは各話者の発言にタイムスタンプを付けた文字起こしを返します。録音はデバイスからアップロードする必要はありません。Dropbox、Google Drive、またはポッドキャストホストからのリンクも機能します。
ラベル付きの文字起こしがあれば、録音全体を聞き直すことなく、特定の人物が何を言ったかを見つけることができます。
得られるもの:
- 話者ラベルとタイムスタンプ付きの文字起こし(100+言語に対応)
- 話者ラベルをクリックして名前を変更したり、チームメンバーに一致させたり、単一のセグメントを再割り当てしたりできます
- PDF、DOCX、TXT、SRT、VTTとしてエクスポート
- 録音についてAIに質問し、それが起こった瞬間に言及する回答を得る
- 無料プラン:文字起こし2回まで、各録音最長45分の録音(話者ラベルを含む)
システムは、顔や名前を照合するのではなく、声によって話者を割り当てるため、すべての録音は汎用的なラベル(話者1、話者2)で始まり、後で名前を変更できます。
音声で話者を識別する方法
- アップロードまたはリンクを貼り付け: ファイル(MP3、M4A、MP4A、M4B、AAC、WAV、OGG、OPUS、FLAC、AIFF、WMA、WEBMA、MKA、AC3、EAC3、WV、AMR、DSF、DFF、最大2 GB(無料オンラインツールの場合))をドラッグするか、Dropbox、Google Drive、またはポッドキャストホストからのリンクを貼り付けます。
- 文字起こしは話者ごとに分離されます: 各音声には独自のラベルが付けられ、すべての発言にタイムスタンプが付きます。
- 名前を変更してエクスポート: 話者ラベルをクリックして名前を変更したり、チームメンバーに一致させたり、単一のセグメントを再割り当てしたりできます。完成した文字起こしをPDF、DOCX、TXT、SRT、VTTとしてエクスポートします。
クリアな音声で明確な声は最もよく分離され、重なり合う音声は、話者分離システムを混乱させる可能性がありますであるため、可能な限り話者が互いに話し合わないようにしてください。精度がどのように測定されるかを参照してください。
話者ダイアリゼーションと他のアプリの比較
| 機能 | ScreenApp | AssemblyAI | Otter.ai | Notta |
|---|---|---|---|---|
| 無料プラン | 文字起こし2回、45分 | $50クレジット | 300分/月、30分/会話 | 120分/月、3分/会話 |
| 話者ラベル | 含まれる | +$0.02/時アドオン | ベーシックプランから含まれる | 含まれています |
| 言語 | 100+ | 未記載 | 6 | 58 |
| エクスポート形式 | PDF、DOCX、TXT、SRT、VTT | 未記載 | 無料プランでmp3とtxt、Pro以上でpdf、docx、srtも利用でき、Business以上で一括エクスポートに対応 | TXT、DOCX、PDF、またはXLSX |
| 有料プラン | $19/月(年間請求) | $0.15/時間 | $8.33/月(年間請求) | $8.17/月(年間請求) |
Sources, checked 2026-09-24: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, assemblyai.com/pricing, otter.ai/pricing, notta.ai/en/pricing, notta.ai/en, notta.ai/en/lecture-summarizer
- AssemblyAIとの比較: AssemblyAIは開発者APIであり、話者ダイアリゼーションを+$0.02/時のアドオンとして追加した場合、1時間の音声あたり$0.15で、新規アカウントには$50の無料クレジットが付与されます。ScreenAppは完成されたアプリであり、ファイルをアップロードするだけで、ラベル付きの文字起こしが返され、統合は不要です。
- Otter.aiとの比較: Otterの無料プランは月間300分で、1会話あたり30分に制限されており、話者識別はベーシックプランから利用できます。ScreenAppの無料プランは、文字起こし2回まで、各録音最長45分の録音で、話者ラベルは最初から含まれています。
- Nottaとの比較: Nottaの無料プランでは、月間120分(最長3分のクリップ)が提供され、話者識別が含まれています。Nottaは58言語を文字起こしし、ScreenAppは100+言語を文字起こしします。
話者ダイアリゼーションの利用者
ポッドキャスターは、生の音源をアップロードし、ホストとゲストに分割された文字起こしを取得して、番組のメモやエピソードの文字起こしページに貼り付けることができます。
会議やインタビューのメモは、音声だけで誰が何を言ったかがわかる場合に役立ちます。インタビュアーは、話者分割を使用して、聞き直すことなく自分の質問と回答を分離します。
研究者は、フォーカスグループや定性インタビューを実施する際に、一貫した話者ラベルを使用して、誰が何に貢献したかを追跡し、手動で発言にラベルを付ける手間を省きます。
法律および医療専門家は、供述録取書、クライアントとの通話、相談の際に、各発言にタイムスタンプが付いた話者ラベル付きの文字起こしを必要とします。


