语音翻译器的功能
这款语音翻译器可在99种语言之间转换语音;翻译质量取决于源语言的词错率。上传录音或在浏览器中实时讲话。无需下载,无需账户,无分钟限制。
拖放音频文件,获得翻译文本。 上传MP3、WAV、M4A、MP4、OGG或FLAC格式的文件。模型会转录源语言,将其翻译成您选择的目标语言,并将结果导出为纯文本、SRT或VTT格式,用于字幕制作。最长3小时的文件可一次性处理。
实时翻译在同一浏览器标签页中运行。 点击麦克风,讲话,翻译文本会在1.5秒内出现。适用于国际支持电话、供应商会议和双语面试等不能等待录音完成的场景(2026年4月延迟基准)。
主要功能:
- 将任何源语言语音翻译成英语,并自动检测
- 实时语音翻译,延迟低于1.5秒
- 上传最长3小时的音频文件(MP3、WAV、M4A、MP4、OGG、FLAC)
- 免费用于会议、通话和演示的实时语音翻译器
- 处理口音、方言和背景噪音;每种语言的WER在准确性页面上
- 语音输出,使翻译作为语音音频播放
- 基于浏览器,无需安装
- 带时间戳的转录本,用于文档和搜索
该工具专为录制会议、播客、采访、客户支持电话和视频内容而设计。使用实时模式进行实时对话,或上传文件进行批量处理,并提供可搜索的转录本。
语言对质量矩阵
翻译质量取决于转录质量。源语言词错率(WER)较低的语言对会产生更清晰的翻译,因为翻译过程中需要解释的乱码输入较少。以下数据来自2026年4月WER重新测试。
| 语言对 | 平均WER(转录) | 翻译质量 | 备注 |
|---|---|---|---|
| en, es | 4-5% | 优秀 | 交易量最高的语言对,训练最多 |
| en, pt | 5-6% | 优秀 | 支持巴西和欧洲变体 |
| en, fr | 5-6% | 优秀 | 涵盖魁北克法语 |
| en, de | 6-7% | 良好 | 复合词处理正确 |
| en, ja | 7-8% | 良好 | 标点符号重构 |
| en, zh | 7-8% | 良好 | 简体和繁体 |
| en, ko | 7-8% | 良好 | 保留敬语级别 |
| es, pt | 5-6% | 优秀 | 互通性高 |
| en, ar | 9-10% | 可接受 | 仅限于现代标准阿拉伯语,方言覆盖有限 |
| en, hi | 9-10% | 可接受 | 处理与英语的语码转换 |
对于未列出的语言对,请在准确度每语言表格中查找源语言的WER,并在WER桶和最终翻译之间大约增加一个质量等级。10%以上WER范围的语言对仍然可以为理解主旨提供有用的翻译,只是需要对专有名词和习语进行更多的润色。
如何使用语音翻译器
无论您是上传录音还是实时讲话,该工具都分三步运行。
- 上传音频文件(MP3、WAV、M4A、MP4、OGG、FLAC)或点击麦克风实时讲话
- AI从100多种选项中自动检测源语言
- 语音转换为您的目标语言,并带有时间戳
- 复制文本或下载翻译后的转录本
支持的语言包括西班牙语、法语、德语、中文、日语、韩语、阿拉伯语、印地语、葡萄牙语、俄语、意大利语和荷兰语,以及90多种其他语言。
实时语音翻译器模式 以低于1.5秒的延迟即时处理对话。它专为商务会议、客户电话、采访和国际演示而设计。在通话过程中点击即可讲话和翻译,无需切换标签页。
麦克风输入 直接在浏览器中捕捉您的讲话。点击麦克风按钮,授予权限并讲话。AI会检测语言,翻译内容并显示结果。在桌面和移动浏览器上均可使用。
语音翻译器与其他工具对比
- 与Maestra对比: Maestra可克隆说话者的声音,用于目标语言的配音播放,这对于视频本地化很有用。其免费试用限制为30分钟。ScreenApp使用通用TTS语音而非克隆,但免费使用无分钟限制,并直接导出SRT/VTT。
- 与Sonix对比: Sonix支持53种语言,30分钟试用后每小时收费22美元。ScreenApp支持99种语言并提供免费翻译,尽管Sonix在长时间会议录音中具有更强的说话者识别标签。
- 与Notta对比: Notta每月提供120分钟的免费使用,支持58种语言,并导出SRT用于视频工作。ScreenApp接受更多文件格式(包括OGG、FLAC),并取消了每月分钟限制,而Notta与Zoom和Google Meet的机器人集成更紧密。
- 与Speechmatics对比: Speechmatics是一个API优先的转录引擎,每小时音频收费0.30美元,每月提供8小时免费使用。它需要开发人员集成才能进行翻译。ScreenApp可在浏览器中运行,无需代码。
- 与Veed.io对比: Veed.io为视频编辑提供AI语音克隆和屏幕字幕样式,每月30分钟免费。ScreenApp专注于音频到文本的翻译路径,跳过了视频编辑,但免费处理更长的文件(3小时对比2 GB)。
带有语音输出的翻译
语音翻译器会返回目标语言的文本转录本和语音音频。将语音转换为文本后,它会使用文本转语音技术播放听起来自然的音频。
语音输出功能:
- 100多种语言语音的自然发音,包括地区口音
- 可调节语速,以减慢或加快翻译音频的速度
- 大多数语言提供男性或女性语音选项
- 实时对话期间即时播放
- 可下载翻译语音的音频文件
在语言学习、辅助功能或任何不方便阅读文本的场景下(例如打电话、开车或免提会议)使用语音输出。语音翻译还有助于发音和语调。
语音翻译器适用人群
负责多语言内容发布的本地化团队将源语言画外音、广告片段和产品教程通过翻译器处理,为每个发布市场生成SRT文件。100多种语言覆盖范围减少了单次发布所需的供应商数量。
采访外语的记者可以在录音当天上传现场录音。转录文本和译文会附带时间戳,这样记者就可以引用00:14:32处的引文,而无需支付单独的联络员费用。
准备双语材料的语言教师可以将播客或新闻片段放入工具中,同时获取源语言转录文本和英文译文。学生可以将两者并排比较,SRT导出文件可插入课堂视频播放器。
处理非英语音频工单的支持团队会翻译不使用团队语言的客户的语音邮件和Zoom录音。客服人员在其帮助台阅读翻译后的转录文本,并以书面形式回复,而无需将工单转至双语队列。
语音翻译中可能丢失的内容
机器语音翻译在理解含义方面表现良好,但在含义周边的细微之处则较弱。习语、讽刺和文字游戏会变得平淡无奇,源语言中依赖双关语的笑话会变成字面意义上、不好笑的句子。这是翻译本身的局限性,而非特指此工具,在您依赖其输出处理任何细微之处之前,这一点值得了解。
名称和技术术语是另一个薄弱环节。模型将姓氏读作普通词时,会被翻译而非保留,而一个小众术语可能会被翻译成其最接近的日常等价词。对于休闲对话,这些都不重要。对于法律或医疗录音,请将机器翻译视为快速初稿,并由人工检查具有实际重要性的部分。