粘贴视频链接,即可获得MP3或音频文件,最高320kbps,无需下载,无需安装。 复制YouTube、Vimeo、TikTok、Facebook或Twitter网址,或任何直接视频链接,音频将直接从链接中提取并编码为MP3。此工具还可用作网址转MP3转换器、视频链接转音频转换器,并支持处理您机器上已有的音频文件(MP3、WAV、M4A、AAC、OGG或FLAC,本页免费在线工具最大 2 GB)。上传或转换的音频将附带带时间戳的转录稿(支持99种语言)、可编辑的AI摘要、可分享的播放链接以及一个基于音频训练的AI聊天功能。只需要转录?请查看转录工具。
上传内容在符合GDPR的服务器上通过AES-256加密运行。所有文件默认私有,并提供可选密码保护和自动恶意软件扫描。
将链接转换为MP3
粘贴视频网址,即可获取MP3文件。您无需先下载视频,也无需安装任何软件。音频将直接从链接中提取并编码为MP3,最高可达320kbps。
链接转MP3转换的运行方式:
- 从浏览器地址栏复制视频网址
- 将其粘贴到此页面的转换器中
- 选择比特率,然后下载MP3
它也更广泛地用作链接转音频转换器:粘贴视频链接以获取音频,选择MP3或WAV,然后下载。因此,网址转MP3转换器、视频链接转音频转换器和纯链接转MP3都通过同一个框运行。
这适用于YouTube、Vimeo、Facebook、TikTok、Twitter和直接视频网址。对于YouTube,YouTube转MP3转换器专门针对这一个来源进行了优化。如果您想要视频而不是音频,请使用网址转MP4转换器。如果文件已保存在您的机器上,从视频中提取音频可处理MP3、WAV和AAC输出。
免费计划包含 2 次转录(每段录制最长 45 分钟)和 3 次试用上传,注册无需信用卡。之后可通过7 天试用(仅限年付 Pro/Max,需绑定银行卡)或按年付费每月 $19 的 Pro 计划继续使用。
音频文件上传服务 - 输入与输出
上传音频文件后,服务将返回四个成果:一个流媒体链接、一份完整转录稿、一份AI生成的摘要,以及一个私人聊天窗口,您可以在其中询问录音相关问题(“第二位发言者对预算说了什么?”)。
音频上传流程的运行方式:
- 将文件拖入放置区,点击浏览,或从剪贴板粘贴
- 文件上传至音频文件上传服务,同时转录并行开始
- 转录稿、摘要和可分享链接将显示在仪表板中,通常一小时的录音在一分钟内完成
音频上传服务接受的音频文件输入:
- MP3(任何比特率)
- WAV(PCM,16/24位)
- M4A(MP4容器中的AAC)
- AAC(原始)
- OGG(Vorbis和Opus)
- FLAC(无损)
- 本页免费在线工具最大 2 GB,ScreenApp 应用无文件大小限制
音频上传服务在流媒体播放期间保留源比特率,并为转录重新采样一份单独的副本。这两种处理都不会覆盖您上传的原始文件。
免费在线上传MP3。 首个文件无需信用卡,无需注册。将音频文件拖放到页面中,转录稿将在几秒钟内出现。
上传音频文件后您会得到什么
每次上传都会生成一个您可以稍后返回的已处理记录。该记录同时包含四项内容:原始文件(可下载)、带发言人标签和时间戳的转录稿、可重新生成或编辑的摘要,以及一个与音频内容相关的聊天线程。
托管播放链接是次要功能,而非主要卖点。它无需账户即可在手机和桌面设备上使用,但音频上传服务的主要价值在于,音频现在可以转化为可搜索的文本,通过聊天进行查询,并可导出为TXT、SRT、VTT、DOCX或JSON格式。
上传音频文件为您提供:
- 99种语言的带时间戳转录稿
- 引用时间戳的AI摘要
- 回答录音相关问题的聊天功能
- 发言人标签(当音频中有多位发言人时)
- 用于字幕的SRT和VTT字幕文件
- 可选密码保护的可分享播放链接
- 单文件分析:播放次数、地理位置、完成率
音频文件上传服务支持单次拖放、剪贴板粘贴或批量文件(付费计划一次最多50个)。如果您需要传输源视频,视频转链接转换器支持MP4/MOV,而从视频中提取音频可将音频提取出来单独处理。
音频上传如何从浏览器到转录稿
当您将MP3文件拖放到页面上时,会发生三件事:浏览器开始分块上传,后端注册转录任务,并打开一个占位符记录,以便您观察进度。对于一小时的MP3文件,在50 Mbps连接下的典型时间是10秒的上传时间和60秒的转录时间,两者大部分并行运行。
音频文件经历的步骤:
- 放置区接受文件(拖放、点击浏览或剪贴板粘贴)
- 字节以5MB块流式上传,支持连接中断后恢复
- 转录从第一个块开始,并在最后一个块到达后不久完成
- 转录稿、摘要和聊天功能都附加到同一个记录中
批量上传允许付费用户排队最多50个音频文件。队列并行处理,而非串行处理,因此一个包含20个讲座录音的文件夹大约在最慢的一个文件完成所需的时间内完成。
您可以为每次上传切换的设置:
- 可分享链接的自定义URL(付费)
- 播放页面的密码门
- 转录语言(自动检测或选择99种语言之一)
- 发言人标签开启或关闭
- 公开、不公开或私有可见性
- 适用于博客文章的可嵌入播放器代码片段
本页免费在线工具每个文件最大 2 GB,ScreenApp 应用无文件大小限制。付费计划提供更高的转录等额度。
立即尝试音频文件上传流程。 首个文件无需信用卡,无需注册。拖放一个文件即可。
为什么上传音频文件而不是将其附加到电子邮件?
邮件服务器会拒绝大于25MB的附件,许多公司网关会完全阻止压缩音频。音频上传服务为您提供一个托管链接,收件人可以在任何浏览器中播放,以及一份他们在听之前可以快速浏览的转录稿—电子邮件附件给他们的是一个需要下载、保存并在其他程序中打开的图标。
好的音频文件上传服务与普通文件托管有什么区别?
好的音频文件上传服务做三件事是普通托管服务做不到的:它会转录文件,它会为转录稿标记发言人,并提供可搜索的音频内容聊天功能。Dropbox或Google Drive存储文件;音频上传服务将文件转换为您可以阅读、搜索和回答问题的文本。
音频文件上传服务与Otter、Notta、Sonix、Trint、Descript对比
各产品定位:
- 对比 Otter.ai: Otter 的产品围绕实时会议捕捉和英语通话构建;上传的音频文件在队列后端转换,Otter Chat 仅限于专业版。这里的音频上传服务将上传文件视为一等公民,并在免费层级提供 99 种语言的 AI 聊天。
- 对比 Notta: Notta 支持类似范围的格式并列出了 58 种语言,但免费上传限制为每个文件 5 分钟,每月上限 120 分钟。ScreenApp 免费计划包含 2 次转录,每段录制最长 45 分钟。
- 对比 Sonix: Sonix 是一个按需付费的转录引擎,每小时 10 美元,没有循环免费层级—你只能获得一次 30 分钟。Sonix 没有 AI 聊天功能,也没有内置播放链接;这里的上传服务从同一次上传中返回聊天、摘要和一个托管链接。
- 对比 Trint: Trint 针对新闻编辑室工作流程,支持 EDL 导出和逐字模式,但没有免费层级,定价从每月 80 美元起。对于偶尔上传采访音频而非常驻编辑部的记者来说,这里的每分钟经济性明显更低。
- 对比 Descript: Descript 将上传的音频转换为可编辑的文本,你可以剪切以拼接波形—功能强大,但学习曲线陡峭。这里的上传和处理流程更接近”拖放文件,阅读文本”,编辑则保持可选。
按格式划分的音频文件上传处理时间
处理时间取决于编解码器、时长以及文件是单声道还是立体声。标准处理队列中一小时录音的近似数字:
| 格式 | 典型比特率 | 上传时间 (50 Mbps) | 转录耗时 |
|---|---|---|---|
| MP3 | 128-320 kbps | 5-15 秒 | 45-70 秒 |
| WAV (PCM 16-位) | ~1411 kbps | 60-90 秒 | 45-70 秒 |
| M4A | 96-256 kbps | 5-15 秒 | 45-70 秒 |
| AAC | 96-256 kbps | 5-15 秒 | 45-70 秒 |
| OGG (Opus) | 64-128 kbps | 3-10 秒 | 45-70 秒 |
| FLAC | ~900 kbps (无损) | 40-60 秒 | 45-70 秒 |
大型 WAV 文件(例如 2GB)上传在典型的家庭网络上需要几分钟—转录本身在字节到达时并行运行,因此转录文本通常在最后一个字节落地后一分钟内即可准备就绪。
文件格式选择矩阵
上面的处理时间表告诉您每种格式上传和转录所需的时间。下面的矩阵回答了另一个问题:您应该首先使用哪种格式?格式选择取决于您使用什么录制以及之后打算如何处理文件。
| 格式 | 最适合 | 压缩方式 | 建议最大时长 | 备注 |
|---|---|---|---|---|
| MP3 (320 kbps) | 一般音频,播客 | 有损,高质量 | 最长 4 小时 | 普遍支持 |
| WAV | 专业音频,母带 | 未压缩 | 1-2 小时 | 文件大,最佳质量 |
| M4A, AAC | iPhone 语音备忘录,现代应用 | 有损,高效 | 4+ 小时 | Apple 设备默认 |
| FLAC | 存档,发烧友 | 无损 | 4+ 小时 | 比 WAV 小,质量相同 |
| OGG, Opus | 流媒体,语音聊天 | 有损,非常高效 | 可变 | 常见于网络平台 |
| WebM 音频 | 网络提取音频 | 有损 | 2-3 小时 | 来自视频文件 |
| 3GP | 旧手机录音 | 有损 | 1 小时 | 上传前转换以获得最佳效果 |
经验法则:如果文件来自手机,您就有 M4A。如果来自播客 DAW,您可能有 WAV 或 MP3。如果来自会议平台的云录音,您可能有 M4A (Zoom) 或从 MP4 提取的音频 (Meet, Teams)。所有这些都可以直接使用。转录流程在将其传递给语音模型之前,会将所有内容标准化为 16 kHz 单声道 PCM 内部表示,因此源格式不会改变最终转录的准确性(根据 2026 年 4 月 WER 重新测试)。
谁会使用音频文件上传服务
播客制作人处理录音。 完成的播客节目以立体声 WAV 或 MP3 格式保存在硬盘上。将其放入上传服务以获取节目笔记的转录文本、节目描述的摘要以及一个托管预览链接,然后文件才会被上传到 Apple Podcasts 或 Spotify。
记者上传采访音频。 记者从新闻发布会带出录音设备后,可以直接从设备上传 M4A 文件,并在音频”新鲜”时从可搜索的转录文本中提取引语。说话人标签和时间戳意味着 90 分钟的采访可以在几分钟内被快速浏览。
学生上传讲座录音。 手机、录音笔和 Zoom 录音会产生 M4A 或 MP3 文件。上传音频文件会生成一份转录文本,学生可以搜索(“讲师什么时候提到焓?”)、高亮显示并粘贴到学习笔记中。
转录员将文件导入流程。 自由职业转录员和机构将在线 MP3 上传端点用作预处理:AI 草稿转录本在一分钟内生成,人类转录员进行校对而非从头开始打字。带有词级时间戳的 JSON 输出可无缝导入现有编辑器。
辅助功能团队从纯音频源生成字幕。 公共广播档案、口述历史和呼叫中心录音通常仅以音频形式存在。上传服务可以从这些纯音频源生成 SRT 和 VTT 文件,以便它们可以与静态波形配对,或根据 WCAG 1.2.1 作为文本替代发布。
音频文件上传服务还处理临床医生的语音备忘录、音乐人寻求唱片公司的演示音轨,以及合规团队需要书面记录的培训音频。
从粗略录音中获得清晰转录文本
转录文本的质量取决于您上传的音频质量,有些事情比预想的更有帮助。如果录音中有一个声音大一个声音小,那么错误往往集中在声音小的那一方,所以如果可以的话,在上传前平衡一下音量。语音下的背景音乐是另一个杀手,模型会把歌词听成文字。
不过,您不需要录音棚级别的音频。在普通房间用手机录制的语音备忘录转录效果良好。它难以处理的情况是严重的交叉对话、三个人同时说话,以及坚硬空旷房间产生的强烈回声。如果您的文件有上述情况,请预期之后需要手动修正一些说话人标签。上传 WAV 文件而不是压缩的 MP3 文件对边缘音频会有一些帮助,因为压缩时没有先丢弃任何信息。


