多说话人转录

上传包含多位说话人的录音,或进行实时录音,即可获得一份带有说话人标签和时间戳的转录稿。

支持 MP4、M4V、MOV、AVI、WEBM、MKV、FLV、TS、MTS、M2TS、3GP、3GPP、3G2、WMV、ASF、VOB、OGV、RM、RMVB、MPG、MPEG、M2V、F4V、MXF。免费试用,最长 45 分钟。无需安装。

MP4, MOV, WEBM, MKV, AVI, FLV, MTS, 3GP

或粘贴视频链接

YouTube、TikTok、Instagram、Vimeo、Google 云端硬盘、Dropbox、直链

录音在传输和存储时均已加密,不会用于训练 AI 模型。 隐私 · 安全

说话人识别 AI 笔记和聊天 多种导出格式

转录多说话人录音,并为每位说话人添加标签

上传包含多位说话人对话的录音,或粘贴链接,ScreenApp 会将其转换为一份转录稿,其中每位说话人都有标签,每行都有时间戳。使用浏览器录音机或 iOS 和 Android 应用 实时录制对话,或连接 适用于 Zoom、Google Meet 和 Microsoft Teams 的会议机器人 进行通话,然后在获得文件后上传。

一份带标签的转录稿可以替代反复听录音来弄清谁说了什么。

您将获得:

  • 一份带有 说话人识别 的转录稿,支持 100+ 种语言
  • 与任何录音进行 AI 聊天,因此您可以询问特定说话人说了什么,而无需扫描整个转录稿
  • AI 笔记:包含所有者和截止日期的行动项,以及单独列出的决策
  • 导出为 PDF、DOCX、TXT、SRT 和 VTT
  • 免费套餐:2 次转录,每段录音最长 45 分钟,并附带 AI 聊天功能

如何转录多位说话人

  1. 上传或粘贴链接:拖入音频或视频文件 (MP4、M4V、MOV、AVI、WEBM、MKV、FLV、TS、MTS、M2TS、3GP、3GPP、3G2、WMV、ASF、VOB、OGV、RM、RMVB、MPG、MPEG、M2V、F4V、MXF),或粘贴链接。无需设置账户即可开始。
  2. 开始转录:音频将转换为文本,每个人都将分为自己的说话人标签,每句话都有时间戳。
  3. 审阅和导出:在浏览器中阅读转录稿,如果需要,可以重命名说话人标签,然后导出为 PDF、DOCX、TXT、SRT 和 VTT。

准确性取决于音频和所说的语言。25 种 100+ 种支持的语言 支持词级说话人分离;其余语言仅转录为文本,不带说话人标签。单个麦克风,参与者靠近且串扰有限,也能提供最清晰的说话人分离。请参阅我们如何衡量准确性。

多说话人转录与其他应用对比

功能ScreenAppOtter.aiRevSonix
免费套餐2 次转录,每段录音最长 45 分钟300 分钟/月45 分钟/月 (AI)30 分钟试用
说话人识别包含基本版包含包含
说话人重命名点击说话人标签可重命名、匹配团队成员或重新分配单个片段未说明未说明未说明
AI 笔记包含专业版,$8.33/月(按年计费),或 $16.99/月(按月计费)未说明未说明
导出格式PDF、DOCX、TXT、SRT 和 VTT免费版支持 mp3 和 txt,Pro 起增加 pdf、docx 和 srt,Business 起支持批量导出未说明DOCX、PDF、TXT、SRT、VTT
语言100+6未说明54+
付费套餐$19/月(按年计费)$8.33/月(按年计费)$25.49/月(按年计费)$25/月

Sources, checked 2026-10-01: screenapp.io/accuracy#languages, ScreenApp pricing, screenapp.io/help/how-many-minutes-can-i-record, otter.ai/pricing, rev.com/pricing, sonix.ai/pricing, Editing speaker labels

  • 对比 Otter.ai:Otter 的免费套餐每月限制为 300 分钟,其免费套餐中的说话人识别级别为 基本版。ScreenApp 的所有套餐都包含说话人标签,并允许您事后重命名标签。
  • 对比 Rev:Rev 的免费套餐每月提供 45 分钟的 AI 时间,然后 AI 转录按 $25.49/月(按年计费)收费,人工转录按 $1.99 每分钟收费。无论是哪种费率,一系列重复的多说话人录音都会很快累积起来。
  • 对比 Sonix:Sonix 提供一次性 30 分钟试用,然后是每月 $25 的套餐。ScreenApp 的免费套餐是续订的,而不是一次性试用。

谁使用多说话人转录

记者转录包含多个消息来源的采访和小组讨论,然后直接引用每位说话人的话语并附带时间戳以进行事实核查。

播客制作人转录包含主持人与多位嘉宾的节目,按说话人划分对话以提取节目笔记和片段。

研究人员转录小组访谈和焦点小组,然后按说话人阅读转录稿,以了解每位参与者的回答。

招聘和人力资源团队转录包含多位面试官和一位候选人的小组面试,以便任何稍后审阅文件的人都能看到谁问了什么。

法律和合规团队转录证词、多方通话和录音声明,其中了解哪个人说了哪句话至关重要。

纪录片和视频团队转录包含多位受访者的采访片段,使用说话人标签记录每个时间点谁在镜头前。

FAQ

转录中的“说话人识别”是什么意思?

这意味着转录稿会标记每个时刻是谁在说话,因此您会得到单独的、带标签的行,而不是一整块文本。

ScreenApp 如何识别说话人?

说话人识别 将音频分成不同的声音,并在转录稿中为每个声音添加标签,支持 100+ 种语言。

说话人识别适用于所有语言吗?

不是。词级说话人分离适用于 100+ 种支持语言中的 25 种,在语言列表中用匕首符号标记。其他语言的录音仍会转录为文本,但不带说话人标签。

我可以重命名说话人标签吗?

ScreenApp 如何处理人们互相打断的情况?

重叠的语音可能会混淆说话人分离系统。单个中央麦克风,串扰有限,可以最清晰地分离说话人。

ScreenApp 在转录前会降低背景噪音吗?

不会。ScreenApp 不会应用降噪。与嘈杂的房间相比,安静的录音环境和靠近说话人放置的麦克风会产生更清晰的转录稿。

我可以导出多说话人转录稿吗?

可以,导出为 PDF、DOCX、TXT、SRT 和 VTT,导出的文件中会保留说话人标签和时间戳。

我可以询问特定说话人说了什么吗?

可以,与任何录音进行 AI 聊天 允许您询问讨论内容,并获得指向录音中特定时刻的答案,包括是谁说的。

多说话人录音会保密吗?

录音在传输过程中经过 传输中加密 加密,并使用 AES-256 存储在 SOC 2 Type 2 基础设施上,且 不用于训练 AI 模型。安全控制措施已发布在 信任中心。

First-party usage data

2,167,954

speakers identified

across all transcribed recordings to date. Pulled at build time from the ScreenApp production database. Methodology: see the accuracy page.

First-party production data

What ScreenApp users actually record

Top content types across 73,857 labelled recordings in the last 90 days. Pulled at build time from videometainfo.meetingType in production. Methodology: accuracy page.

14,348

training

19.4% of labelled

14,287

podcast

19.3% of labelled

13,377

call

18.1% of labelled

13,126

meeting

17.8% of labelled

11,010

lecture

14.9% of labelled

3,398

webinar

4.6% of labelled

3,020

presentation

4.1% of labelled

1,291

interview

1.7% of labelled

准备好转录您的内容了吗?

上传包含多位说话人的录音,或进行实时录音,即可获得一份带有说话人标签和时间戳的转录稿。