在线说话人识别

上传包含多位说话人的录音,获取一份标注了说话人及时间戳的转录稿,您可以搜索和导出。

文件在云端处理。在应用中使用和保存结果需要免费账户。文件下载需要付费套餐。

MP3, WAV, M4A, AAC, OGG, FLAC, AMR, WMA

或粘贴音频链接

YouTube、TikTok、Instagram、Vimeo、Google 云端硬盘、Dropbox、直链

录音在传输和存储时均已加密,不会用于训练 AI 模型。 隐私 · 安全

在转录稿中标记说话人,获取时间戳

上传包含多位说话人的音频或视频,或粘贴链接,ScreenApp 会返回一份转录稿,其中用时间戳标注了每个说话人的发言。录音无需从您的设备上传:Dropbox、Google Drive 或播客托管平台的链接也同样适用。

一份带标签的转录稿意味着您可以找到特定人物说过的话,而无需重新听取整个录音。

您将获得:

系统通过声音而非匹配面部或姓名来分配说话人,因此每个录音都以通用标签(说话人1,说话人2)开始,您可以在之后进行重命名。

如何在音频中识别说话人

  1. 上传或粘贴链接:拖入文件(MP3、M4A、MP4A、M4B、AAC、WAV、OGG、OPUS、FLAC、AIFF、WMA、WEBMA、MKA、AC3、EAC3、WV、AMR、DSF、DFF,最大2 GB(免费在线工具))或粘贴来自 Dropbox、Google Drive 或播客托管平台的链接。
  2. 转录稿按说话人分离:每个声音都有自己的标签,每次发言都有时间戳。
  3. 重命名和导出:点击说话人标签可重命名、匹配团队成员或重新分配单个片段。将完成的转录稿导出为PDF、DOCX、TXT、SRT 和 VTT。

清晰且声音分明的音频分离效果最佳,并且重叠的语音可能会混淆说话人分离系统,因此请尽量避免说话人互相打断。请参阅我们如何衡量准确性。

说话人识别与其他应用对比

功能ScreenAppAssemblyAIOtter.aiNotta
免费计划2 次转录,每段录音最长 45分钟$50积分300分钟/月,30分钟/对话120分钟/月,3分钟/对话
说话人标签包含+$0.02/小时附加费从基本版计划开始包含包括
语言100+未说明658
导出格式PDF、DOCX、TXT、SRT 和 VTT未说明免费版支持 mp3 和 txt,Pro 起增加 pdf、docx 和 srt,Business 起支持批量导出TXT、DOCX、PDF 或 XLSX
付费计划$19/月(按年计费)$0.15/小时$8.33/月(按年计费)$8.17/月(按年计费)

Sources, checked 2026-09-24: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, assemblyai.com/pricing, otter.ai/pricing, notta.ai/en/pricing, notta.ai/en, notta.ai/en/lecture-summarizer

  • 对比 AssemblyAI:AssemblyAI 是一个开发者 API,按每小时音频$0.15收费,说话人识别作为+$0.02/小时的附加功能,新账户有$50的免费积分。ScreenApp 是一个完整的应用程序:上传文件即可获得带标签的转录稿,无需集成。
  • 对比 Otter.ai:Otter 的免费计划每月300分钟,每次对话最长30分钟,说话人识别从基本版计划开始。ScreenApp 的免费计划是2 次转录,每段录音最长 45分钟,从一开始就包含说话人标签。
  • 对比 Notta:Notta 的免费计划每月提供120分钟的片段,每个片段最长3分钟,包含说话人识别。Notta 转录58种语言;ScreenApp 转录100+种语言。

谁使用说话人识别

播客制作者上传原始节目,获取按主持人与嘉宾划分的转录稿,可直接粘贴到节目说明或节目转录页面。

会议和访谈记录在仅有音频的情况下仍能显示谁说了什么,这很有帮助。访谈者使用说话人分离功能将自己的问题与答案分开,而无需重新听取。

研究人员进行焦点小组或定性访谈时,使用一致的说话人标签来追踪谁贡献了什么,而不是手动标记发言。

法律和医疗保健专业人员需要包含说话人标签的证词、客户电话和咨询转录稿,每次发言都附有时间戳。

FAQ

什么是说话人识别?

说话人识别是确定录音中谁在何时说话的过程。系统根据声音对音频进行分组,并为每个片段分配一个说话人标签,因此转录稿会显示为说话人1、说话人2等,每次发言都带有时间戳。

说话人识别的准确性如何?

准确性取决于录音:清晰且声音分明的音频分离效果最佳,并且重叠的语音可能会混淆说话人分离系统。请参阅如何衡量准确性。

它可以识别多少位说话人?

识别功能会为录音中检测到的每个不同的声音分配一个标签,从两位说话人到完整的群组对话。说话人越多,特别是声音相似或语音重叠时,分离难度越大。

它适用于播客吗?

是的。上传节目文件或粘贴播客托管平台的链接,每个主持人与嘉宾都会获得一个单独的说话人标签,您可以在转录稿中重命名。

它能进行实时识别吗?

不能,这是一个上传工具:它在录音完成后处理文件或链接,而不是在录音进行时。对于实时会议,请使用会议录音机,它会在通话进行时进行录音和转录。

它能按姓名识别特定人物吗?

不能自动识别。系统仅根据声音分配通用标签(说话人1,说话人2);它不会将声音与已知身份匹配。之后,点击说话人标签可重命名、匹配团队成员或重新分配单个片段。

有免费套餐吗?

有。2 次转录,每段录音最长 45分钟,包含说话人标签、时间戳和导出功能。按年计费的专业版计划每月$19,取消了录音限制。

真实用户的真实结果

works like a charm, notes have been super helpful alongside chat function. loveeeee
KS
Katharine Suy
Chrome Web Store, October 17, 2024
nice app for important summary
S
SAHIL
Google Play, January 30, 2026

准备好提高您的生产力了吗?

免费开始使用说话人识别。适用使用限制;下载应用需要付费套餐。

免费开始 →

60秒内开始使用