**拖放或粘贴一个音频文件 - MP3、WAV、M4A、AAC、OGG 或 FLAC,每个文件最大2GB - 即可获得即时转录、AI摘要和一个可以提问的聊天框。**上传通过浏览器中的单个拖放区进行;文件一落地,处理即刻开始。输出包括99种语言的带时间戳转录稿、一个可编辑的摘要、一个可分享的播放链接,以及一个基于音频内容训练的AI聊天。只需要转录?请查看转录工具。
上传通过符合GDPR标准的服务器上的AES-256加密运行。默认情况下,每个文件都是私有的,并可选密码保护和自动恶意软件扫描。
音频文件上传服务 - 输入与输出
上传一个音频文件,该服务将返回四项内容:一个流媒体链接、一份完整转录稿、一份AI生成的摘要,以及一个私人聊天窗口,您可以在其中向录音提问(“第二位发言者对预算说了什么?”)。
音频上传流程如何运行:
- 将文件拖入拖放区,点击浏览,或从剪贴板粘贴
- 文件上传到音频文件上传服务,同时转录并行开始
- 转录稿、摘要和可分享链接会出现在仪表板中,对于一小时的录音通常在一分钟内完成
上传服务接受的音频文件输入:
- MP3(任何比特率)
- WAV(PCM,16/24位)
- M4A(MP4容器内的AAC)
- AAC(原始)
- OGG(Vorbis和Opus)
- FLAC(无损)
- 付费计划文件上限2GB,免费计划100MB
音频上传服务在流媒体播放期间保留源比特率,并为转录重新采样一份单独的副本。这两种处理都不会覆盖您上传的原始文件。
**免费在线上传MP3。**无需银行卡,无需为第一个文件注册。将音频文件拖放到页面中,转录稿会在几秒钟内出现。
上传音频文件后您将获得什么
每次上传都会生成一个您可以稍后返回的单个处理记录。该记录一次性包含四项内容:原始文件(可下载)、带有说话人标签和时间戳的转录稿、一个可重新生成或编辑的摘要,以及一个与音频内容相关的聊天线程。
托管播放链接是附加功能,而非主要功能。它在手机和桌面端无需账户即可工作,但音频上传服务的主要价值在于音频现在是可搜索的文本,可通过聊天查询,并可导出为TXT、SRT、VTT、DOCX或JSON格式。
上传音频文件能为您提供:
- 99种语言的带时间戳转录稿
- 指向其引用的时间戳的AI摘要
- 回答关于录音问题的聊天
- 说话人标签(当音频有多个说话人时)
- 用于字幕制作的SRT和VTT字幕文件
- 可分享的播放链接,可选密码保护
- 每文件分析:播放量、地理位置、完成率
音频文件上传服务支持单个拖放、剪贴板粘贴或批量文件(付费计划一次最多50个)。如果您需要处理源视频,视频转链接转换器支持MP4/MOV,而从视频中提取音频则将音频提取出来单独处理。
音频上传如何从浏览器运行到转录稿
当您将MP3文件拖放到页面上时,会发生三件事:浏览器开始分块上传,后端注册转录任务,并打开一个占位符记录,以便您查看进度。在50 Mbps连接下,一小时MP3的典型耗时是10秒上传和60秒转录,大部分时间是并行运行的。
音频文件经过的步骤:
- 拖放区接受文件(拖动、点击浏览或剪贴板粘贴)
- 字节以5MB块流式上传,如果连接中断支持续传
- 转录从第一个块开始,并在最后一个块落地后不久完成
- 转录稿、摘要和聊天都附加到同一记录中
批量上传允许付费用户排队上传多达50个音频文件。队列是并行处理的,而不是串行处理,因此一个包含20个讲座录音的文件夹大约会在最慢的一个录音所需的时间内完成。
每次上传可切换的设置:
- 可分享链接的自定义URL(付费)
- 播放页面上的密码门
- 转录语言(自动检测或选择99种语言之一)
- 说话人标签开或关
- 公开、不公开或私有可见性
- 博客文章的可嵌入播放器代码片段
免费账户每次上传限制为100MB。付费计划将上限扩展到2GB,并解锁优先转录,将文件移到队列前。
**立即体验音频文件上传流程。**无需银行卡,无需为第一个文件注册。立即拖放一个文件。
为什么上传音频文件而不是将其作为附件发送电子邮件?
邮件服务器会拒绝超过25MB的附件,许多企业网关会完全阻止压缩音频。音频上传服务为您提供一个托管链接,收件人可以通过任何浏览器播放,此外还有一个转录稿,他们可以在听之前快速浏览—电子邮件附件只会给他们一个图标,他们必须下载、保存,然后在其他程序中打开。
一个好的音频文件上传服务与普通文件主机有何不同?
一个好的音频文件上传服务能做三件普通文件主机做不到的事情:它能转录文件,它能为转录文本标记说话人,并能让你在音频内容中进行可搜索的聊天。Dropbox或Google Drive只是存储文件;而音频上传服务则将文件转化为你可以阅读、搜索和提问的文本。
音频文件上传服务与Otter、Notta、Sonix、Trint、Descript的比较
| 规格 | ScreenApp | Otter.ai | Notta | Sonix | Trint | Descript |
|---|---|---|---|---|---|---|
| 最大文件大小 | 付费2GB,免费100MB | 5GB(商业版) | 5GB(专业版) | 4GB | 4GB | 5GB |
| 支持格式 | MP3, WAV, M4A, AAC, OGG, FLAC | MP3, WAV, M4A, AIFF | MP3, WAV, M4A, AAC, CAF | MP3, WAV, M4A, AAC, AIFF, FLAC | MP3, WAV, M4A, AIFF, OGG | MP3, WAV, M4A, AAC, FLAC |
| 处理时间(1小时文件) | 约1分钟 | 5-10分钟 | 5-8分钟 | 5-10分钟 | 实时 | 5-15分钟 |
| 免费层时长 | 300分钟/月 | 300分钟/月 | 120分钟/月 | 一次性30分钟 | 无(仅试用) | 60分钟/月 |
| 输出格式 | TXT, SRT, VTT, DOCX, JSON, MP3流 | TXT, DOCX, PDF, SRT | TXT, DOCX, SRT, PDF, XLSX | TXT, DOCX, SRT, VTT, JSON, PDF | TXT, DOCX, SRT, VTT, EDL | TXT, SRT, MP4, MP3 |
| 音频AI聊天 | 是 | Otter Chat(付费) | Notta Chat | 否 | 否 | 否 |
| 语言 | 99 | 仅英语(付费:3种) | 58 | 49 | 40+ | 22 |
各自的定位:
- 对比Otter.ai:Otter的产品主要围绕实时会议捕获和英语通话构建;上传的音频文件在队列后端转换,Otter Chat仅限专业版。这里的音频上传服务将上传文件视为一等公民,并在免费层提供99种语言的AI聊天。
- 对比Notta:Notta支持类似范围的格式并列出58种语言,但免费上传的文件限制为每文件5分钟,每月上限120分钟。这里的300分钟免费额度可以覆盖一个较长的播客或两次讲座录音,才达到限制。
- 对比Sonix:Sonix是一个按小时付费的转录引擎,每小时10美元,没有周期性免费层—你只能获得一次30分钟。Sonix没有AI聊天功能,也没有内置播放链接;这里的上传服务从同一次上传中返回聊天、摘要和托管链接。
- 对比Trint:Trint针对新闻编辑室工作流程,支持EDL导出和逐字模式,但没有免费层,起价为每月80美元。对于偶尔上传采访音频而非常驻办公室的记者来说,这里的每分钟经济成本明显更低。
- 对比Descript:Descript将上传的音频转换为可编辑的转录文本,你可以通过剪切来拼接波形—功能强大,但学习曲线陡峭。这里的上传和处理流程更接近“拖放文件,阅读转录文本”,编辑保持可选。
音频文件上传处理时间按格式分类
处理时间取决于编解码器、时长以及文件是单声道还是立体声。标准处理队列中一小时录音的近似数字:
| 格式 | 典型比特率 | 上传时间(50 Mbps) | 转录实际耗时 |
|---|---|---|---|
| MP3 | 128-320 kbps | 5-15秒 | 45-70秒 |
| WAV (PCM 16位) | 约1411 kbps | 60-90秒 | 45-70秒 |
| M4A | 96-256 kbps | 5-15秒 | 45-70秒 |
| AAC | 96-256 kbps | 5-15秒 | 45-70秒 |
| OGG (Opus) | 64-128 kbps | 3-10秒 | 45-70秒 |
| FLAC | 约900 kbps (无损) | 40-60秒 | 45-70秒 |
一个2GB的WAV文件上传(上限)在典型的家庭网络连接下需要几分钟—转录本身在字节到达时并行运行,因此转录文本通常在最后一个字节到达后一分钟内准备就绪。
文件格式决策矩阵
上方的处理时间表格告诉您每种格式上传和转录所需的时间。下方的矩阵回答了另一个问题:您最初应该使用哪种格式?格式选择取决于您使用什么设备录制以及之后计划如何处理文件。
| 格式 | 最适合 | 压缩 | 建议最大长度 | 备注 |
|---|---|---|---|---|
| MP3 (320 kbps) | 一般音频、播客 | 有损,高质量 | 最长4小时 | 普遍支持 |
| WAV | 专业音频、母带 | 未压缩 | 1-2小时 | 文件大,最佳质量 |
| M4A, AAC | iPhone语音备忘录、现代应用 | 有损,高效 | 4小时以上 | 苹果设备默认格式 |
| FLAC | 存档、发烧友 | 无损 | 4小时以上 | 比WAV小,质量相同 |
| OGG, Opus | 流媒体、语音聊天 | 有损,非常高效 | 可变 | 常见于网络平台 |
| WebM音频 | 网络提取音频 | 有损 | 2-3小时 | 源自视频文件 |
| 3GP | 较旧的手机录音 | 有损 | 1小时 | 上传前转换以获得最佳效果 |
经验法则:如果文件来自手机,您会有M4A格式。如果来自播客DAW,您可能有WAV或MP3。如果来自会议平台的云录音,您很可能有M4A(Zoom)或从MP4中提取的音频(Meet、Teams)。所有这些都可以直接上传。转录流程在将其传递给语音模型之前,会将所有内容标准化为16 kHz单声道PCM内部表示,因此源格式不会改变最终转录的准确性(根据2026年4月WER重测)。
上传后,您可以将结果导入转录工具进行编辑,或者如果您的音频是录制会话的音轨,则将输出交给AI视频摘要器。
谁会使用音频文件上传服务
播客制作者处理录音。 完成的播客节目以立体声WAV或MP3格式保存在硬盘上。将其放入上传服务,即可获得用于节目笔记的转录文本、用于节目描述的摘要,以及在文件到达Apple Podcasts或Spotify之前获取一个托管预览链接。
记者上传采访音频。 记者从新闻发布会带回录音笔后,可以直接从设备上传M4A文件,并在音频仍新鲜时从可搜索的转录文本中提取引文。说话人标签和时间戳意味着90分钟的采访可以在几分钟内快速浏览。
学生上传讲座录音。 手机、录音笔和Zoom录音会生成M4A或MP3文件。上传音频文件会生成一份转录文本,学生可以搜索(“讲师何时提到了焓?”)、高亮显示并粘贴到学习笔记中。
转录员将文件导入流程。 自由转录员和机构使用在线上传MP3端点进行预处理:AI草稿转录文本在一分钟内到达,然后人工转录员进行校正,而不是从头开始打字。带有词级时间戳的JSON输出可以无缝导入现有编辑器。
无障碍团队从纯音频源生成字幕。 公共广播档案、口述历史和呼叫中心录音通常只有音频文件。上传服务会从这些纯音频源生成SRT和VTT文件,以便它们可以与静态波形配对,或作为WCAG 1.2.1下的文本替代方案发布。
音频文件上传服务还处理临床医生的语音备忘录、音乐人寻找唱片公司的Demo曲目,以及合规团队需要纸质记录的培训音频。
常见问题
如何上传音频文件?
将文件拖到放置区,点击放置区打开文件选择器,或从剪贴板粘贴音频。音频文件上传服务支持 MP3、WAV、M4A、AAC、OGG 和 FLAC。文件在第一个数据块到达时立即开始转录 - 您无需等待上传完成即可开始处理。
音频文件上传服务是免费的吗?
每月前 300 分钟免费。免费账户每个文件上传上限为 100MB;付费计划将此上限扩展到 2GB。免费套餐无需绑定银行卡。
上传服务支持哪些音频文件格式?
支持任意比特率的 MP3、16 位或 24 位 PCM 的 WAV、M4A(MP4 容器中的 AAC)、原始 AAC、OGG(Vorbis 或 Opus)以及用于无损音频的 FLAC。如果您的文件格式不常见,服务将拒绝上传,而不是默默地重新编码。
如何无需注册在线上传 MP3?
打开页面,将您的 MP3 拖到放置区,文件将匿名上传并转录。只有当您想保留文件、使用永久链接分享或处理超出每次会话限制的文件时,才需要账户。
上传的音频文件最大能有多大?
免费套餐为 100MB,付费计划为 2GB。2GB 的上限大致可容纳 30 小时的标准 MP3、3 小时的 24 位 WAV 或 8 小时的 FLAC。
上传完成后处理需要多长时间?
对于一个一小时的音频文件大约一分钟。转录与上传并行运行,因此从点击拖放区到阅读转录文本的实际时间,对于典型的讲座或播客,通常不到两分钟。
上传的音频文件是私密的吗?
是的。文件默认是私密的。AES-256 加密在静态和传输过程中都适用,文件在抵达时会经过恶意软件扫描,并且您可以为每个文件添加密码保护或非公开/私密可见性。
我可以一次批量上传多个音频文件吗?
是的。付费计划支持单次批量上传最多 50 个音频文件并并行处理它们。仪表板会显示每个文件的进度行,以便您可以看到哪些转录文本最先准备好。