在转录稿中标记说话人,获取时间戳
上传包含多位说话人的音频或视频,或粘贴链接,ScreenApp 会返回一份转录稿,其中用时间戳标注了每个说话人的发言。录音无需从您的设备上传:Dropbox、Google Drive 或播客托管平台的链接也同样适用。
一份带标签的转录稿意味着您可以找到特定人物说过的话,而无需重新听取整个录音。
您将获得:
- 一份包含说话人标签和时间戳的转录稿,支持100+种语言
- 点击说话人标签可重命名、匹配团队成员或重新分配单个片段
- 导出为PDF、DOCX、TXT、SRT 和 VTT
- 向AI提问有关录音的问题,并获得指向发生时刻的答案
- 免费计划:2 次转录,每段录音最长 45分钟,包含说话人标签
系统通过声音而非匹配面部或姓名来分配说话人,因此每个录音都以通用标签(说话人1,说话人2)开始,您可以在之后进行重命名。
如何在音频中识别说话人
- 上传或粘贴链接:拖入文件(MP3、M4A、MP4A、M4B、AAC、WAV、OGG、OPUS、FLAC、AIFF、WMA、WEBMA、MKA、AC3、EAC3、WV、AMR、DSF、DFF,最大2 GB(免费在线工具))或粘贴来自 Dropbox、Google Drive 或播客托管平台的链接。
- 转录稿按说话人分离:每个声音都有自己的标签,每次发言都有时间戳。
- 重命名和导出:点击说话人标签可重命名、匹配团队成员或重新分配单个片段。将完成的转录稿导出为PDF、DOCX、TXT、SRT 和 VTT。
清晰且声音分明的音频分离效果最佳,并且重叠的语音可能会混淆说话人分离系统,因此请尽量避免说话人互相打断。请参阅我们如何衡量准确性。
说话人识别与其他应用对比
| 功能 | ScreenApp | AssemblyAI | Otter.ai | Notta |
|---|---|---|---|---|
| 免费计划 | 2 次转录,每段录音最长 45分钟 | $50积分 | 300分钟/月,30分钟/对话 | 120分钟/月,3分钟/对话 |
| 说话人标签 | 包含 | +$0.02/小时附加费 | 从基本版计划开始包含 | 包括 |
| 语言 | 100+ | 未说明 | 6 | 58 |
| 导出格式 | PDF、DOCX、TXT、SRT 和 VTT | 未说明 | 免费版支持 mp3 和 txt,Pro 起增加 pdf、docx 和 srt,Business 起支持批量导出 | TXT、DOCX、PDF 或 XLSX |
| 付费计划 | $19/月(按年计费) | $0.15/小时 | $8.33/月(按年计费) | $8.17/月(按年计费) |
Sources, checked 2026-09-24: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, assemblyai.com/pricing, otter.ai/pricing, notta.ai/en/pricing, notta.ai/en, notta.ai/en/lecture-summarizer
- 对比 AssemblyAI:AssemblyAI 是一个开发者 API,按每小时音频$0.15收费,说话人识别作为+$0.02/小时的附加功能,新账户有$50的免费积分。ScreenApp 是一个完整的应用程序:上传文件即可获得带标签的转录稿,无需集成。
- 对比 Otter.ai:Otter 的免费计划每月300分钟,每次对话最长30分钟,说话人识别从基本版计划开始。ScreenApp 的免费计划是2 次转录,每段录音最长 45分钟,从一开始就包含说话人标签。
- 对比 Notta:Notta 的免费计划每月提供120分钟的片段,每个片段最长3分钟,包含说话人识别。Notta 转录58种语言;ScreenApp 转录100+种语言。
谁使用说话人识别
播客制作者上传原始节目,获取按主持人与嘉宾划分的转录稿,可直接粘贴到节目说明或节目转录页面。
会议和访谈记录在仅有音频的情况下仍能显示谁说了什么,这很有帮助。访谈者使用说话人分离功能将自己的问题与答案分开,而无需重新听取。
研究人员进行焦点小组或定性访谈时,使用一致的说话人标签来追踪谁贡献了什么,而不是手动标记发言。
法律和医疗保健专业人员需要包含说话人标签的证词、客户电话和咨询转录稿,每次发言都附有时间戳。


