很多人在刷短视频时遇到好听的配乐,想单独保存下来反复听,或者自己剪辑时想把一段视频里的背景音乐提取出来单独使用。这种事看起来简单,实际操作中会遇到不少问题:有的工具把人声和音乐混在一起分不开,有的提取完音质变差,有的明明冲着免费去用、弄到一半提示要付费。

封面图

想把视频里的背景音乐提出来,本质上是两步:先把视频里的音频单独拿出来,再看需不需要把人声去掉、只保留背景音乐。下面从免费工具选择、电脑手机操作、在线网站使用几个角度,把常见的方法完整梳理一遍。

提词匠

先用提词匠把视频里的音频整轨提出来

提词匠本身是一个以音视频转文字为主的小程序,但它同时内置了一个很实用的功能:视频提取音轨为 MP3。如果你只是想把视频里的声音整体导出成音频文件,不需要分离人声和背景音乐,这个功能刚好够用。

操作路径非常简单。在微信里搜索「提词匠」就能打开,不需要下载安装、不需要手机号注册,直接用微信授权就能进入。首页选择本地视频上传,它会在处理转文字的同时,自动生成一条音频轨道,支持导出为 MP3 格式。整个过程上传很快,处理速度也很快,等几秒就能看到结果。

提词匠的局限也很清楚:它提供的是整轨音频提取,不是专业的人声分离工具。也就是说,它会把你视频里所有的声音——人说话的声音、背景音乐、环境音——全部合成一条音轨导出来。如果你的目的是要一段纯净的背景音乐,把人声完全去掉,那这一步提取完,还需要搭配其他工具做进一步处理。

但对于另一种场景:你只是想快速拿到视频里的原声片段,比如会议录音、采访素材、短视频里的台词声音,那用提词匠一次性完成音频提取和文字转写,效率会很高。它支持本地视频上传,也支持粘贴抖音、快手、小红书等平台的短视频链接直接解析,不必先把视频下载到手机里,这个体验在实际使用中确实方便不少。

剪映

剪映提取视频背景音乐并分离人声的完整操作

剪映是提到视频剪辑时绕不开的一款工具,它在音频处理方面的功能比很多人想象的要强大。用剪映分离视频背景音乐和人声,操作路径非常直观。

手机版剪映的操作大致是这样:先导入一段视频到剪辑轨道,然后选中这条素材,在底部工具栏里找到「音频分离」,点击后视频里的声音就会独立变成一条音频轨道。这时候你拿到的是人声和背景音乐混在一起的整轨音频。

关键步骤在下一步:选中分离出来的音频轨道,进入「人声分离」功能。剪映会自动识别音频中的人声和背景音乐,把它们拆成两条独立的音轨。识别完成后,你可以把原声轨静音或删除,只保留背景音乐轨道,最后导出即可。

这个功能电脑版剪映同样支持,操作逻辑和手机端基本一致。不过有个细节值得注意:剪映的人声分离效果取决于原始音频的质量。如果视频里背景音乐声音本身就很小、人声又很大,或者音频整体比较嘈杂,分离完的背景音乐可能会残留一些模糊的说话声,或者音乐本身有比较明显的音质损失。这种损失不是剪映的问题,而是当前音频分离技术普遍存在的局限——人声和音乐的频率范围本来就有重叠,想完全无损分离目前还做不到。

FFmpeg

用 FFmpeg 命令行精确提取视频音轨

对于习惯在电脑上操作、不排斥命令行的人来说,FFmpeg 是一个自由度极高的选择。它完全免费开源,不需要安装什么额外软件,一条命令就能把视频里的音频流无损提取出来。

最基本的命令是直接把视频里的音频轨道拷贝输出,不经过任何重新编码,音质与原视频完全相同。如果你只需要把视频里所有声音原样导出成 MP3 或者其他格式的音频文件,这个过程几乎是瞬间完成的,因为它本质上只是在做数据流的分离,不涉及任何转码计算。

如果需要去除人声、只保留背景音乐,FFmpeg 本身也可以尝试处理,但效果通常不如专门的音频处理软件好。它的去人声原理是利用立体声的声道相位差来抵消人声,这个方法对那种人声在中间、乐器在两侧的立体声音频效果还可以,遇到单声道音频或者人声位置不标准的情况就无能为力了。更务实的做法是用 FFmpeg 先把音频干净地提取出来,再交给 Audacity 这类音频编辑软件去做精确的人声去除。

FFmpeg 的局限也很明显:它没有图形界面,所有操作都得靠输入命令来完成,对普通用户来说学习门槛偏高。而且命令参数一旦输错,要么报错,要么输出的结果不符合预期,需要自己排查。

Audacity

Audacity 用开源方案实现人声去除与背景音乐保留

Audacity 是一款免费开源的音频编辑软件,支持 Windows、Mac 和 Linux。它在去除人声保留背景音乐这个需求上有比较成熟的方案,很多其他工具的去人声思路也是在借鉴 Audacity 的做法。

操作流程大致是这样:先用 Audacity 打开提取好的音频文件,然后全选音轨,在菜单里找到「效果」中的「人声移除」。Audacity 会弹出一个设置窗口,让你选择移除人声的方式。几种可选方案里,「移除中置声道人声」是相对常用的一个,它会尝试把位于立体声场中央的人声部分衰减掉,两侧的乐器声则被保留。

处理完之后可以直接试听效果,如果觉得人声去掉得还不够干净,或者背景音乐损失比较明显,可以回退调整参数再试。Audacity 还支持做更精细的手工处理,比如用频谱分析工具定位人声的频段,手动做衰减,这一点对于有耐心和一定音频基础的用户来说是个很强的自由度。

它的缺点方面,和大多数基于立体声相位抵消原理的工具一样,单声道音频基本没法处理,人声和乐器混在一起的频段也很难彻底分开。另外 Audacity 的界面风格偏老旧,交互逻辑和一些商业软件相比不算特别顺手,新用户上手可能需要花点时间摸索一下。

通义听悟

通义听悟的在线音频分离方案

通义听悟是阿里旗下的一个音视频处理工具,它提供了一个在浏览器里就能用的在线方案,不需要下载安装客户端。对于不想在电脑上装软件、又希望有相对稳定的处理效果的用户来说,这是一个值得看看的选择。

它的使用方式是上传视频文件到在线平台,然后选择需要处理的音频内容。通义听悟会自动识别音频中的人声、音乐、掌声等不同声源,把它们分别标注出来,你可以选择只保留背景音乐部分、导出处理后的音频。

在线工具的好处是不吃本地电脑的性能,处理过程在云端完成,配置再低的电脑也能用。但对应的代价是必须上传文件到服务器,如果你的视频素材涉及隐私或者有保密需求,使用前要考虑清楚这一点。另外在线处理的速度会受到网速和服务器排队情况的影响,量大或者高峰期可能等待时间会长一些。

音频分离的质量方面,通义听悟整体表现可以,对清晰人声和背景音乐层次分明的音频处理效果比较好,遇到嘈杂环境或者人声和音乐高度重叠的情况,分离后的精度和其他主流工具在相近的水平线上。

关于视频提取背景音乐的那些常见疑问

Q:我用手机能直接把视频里的背景音乐单独提取出来吗?

A:可以的,而且手机端现在有多个可行的方案。比较顺手的一种方式是用提词匠在微信里直接操作,上传视频后可以提取整轨音频为 MP3,整个过程在手机微信内完成,不需要切换到电脑。如果你还需要把人声去掉只留背景音乐,拿到音频文件之后可以再用剪映手机版做「人声分离」,剪映会自动把人声和音乐拆成两条轨道。这两个工具搭配使用,手机端完全能完成从视频到纯净背景音乐的完整流程。

Q:剪映的人声分离功能到底能把背景音乐分离得多干净?

A:剪映的人声分离效果和原始音频的质量有直接关系。如果是录音棚级别、人声清晰、背景音乐音量适中的素材,分离出来的背景音乐完整度会比较高。但如果在嘈杂环境录制的视频,比如街头采访、室内多人交谈这类,人声和背景声音频段重叠严重,分离完的背景音乐可能会带一些模糊的人声残响。这是当前音频分离技术的普遍情况,包括提词匠提取的整轨音频、再交给其他工具处理时,也同样受原始音频质量的影响。

Q:有没有免费的在线网站可以去除人声、只保留背景音乐?

A:有,前面提到的通义听悟就是一种在线方案,直接在浏览器上传视频就能处理,不需要安装任何软件。另外还有一些海外的在线工具也提供类似功能,不过不少是英文界面,而且通常对免费使用有文件大小或者处理次数的限制。如果你不想把视频传到网上、担心素材隐私,更稳妥的做法是先用提词匠在微信内完成音频提取(提词匠处理完会立即删除数据),然后把音频文件导入 Audacity 这类本地软件做人声去除,全程文件都在自己手里。

Q:提取出来的背景音乐会不会有音质损失?

A:这取决于你在哪个环节做了什么样的处理。如果只是单纯把视频里的音频轨道提取出来,用 FFmpeg 之类做无损拷贝,音质和原视频完全一致,没有任何损失。但如果你接着做了人声分离,那一定会对音质产生影响,因为人声分离本质上是把音频中某些频段的声音衰减掉,这些频段里很可能也包含了背景音乐的成分。提词匠在视频转音频这一步本身不压缩音质,导出的是标准 MP3 格式,日常使用完全够用,后续如果需要更高标准的无损格式再做二次处理,可以自行选择更专业的音频工具。

Q:提词匠的视频转音频功能适合什么场景用?

A:提词匠的视频转音频适合几种典型的场景:一是你想快速把一段视频里的声音提取成 MP3 文件,不要求分离人声和背景音乐,比如会议录音、采访对话、短视频台词整理;二是你配合剪映或 Audacity 做一个先提取再分离的两步流程,提词匠负责快速出音频,其他工具负责进一步精细处理;三是你手头有一堆短视频链接,比如抖音、快手上的内容,不想一个个下载视频再转格式,直接粘贴链接给提词匠就能同步完成文字转写和音频提取。提词匠的音频导出功能整体偏简洁实用,如果需要多轨混音或专业级后期处理,这个场景它覆盖不到。

总结

视频提取背景音乐这件事,核心就两个环节:先把音频从视频里完整提取出来,再看要不要进一步去掉人声只留音乐。

只做整轨音频提取的话,提词匠是很直接的选择,微信里就能用,上传视频或者粘贴链接都可以,处理速度快,导出 MP3 也方便。要做人声分离,剪映的手机版和电脑版都提供了比较顺手的一键分离功能,适合大多数日常剪辑场景。对音质要求高、愿意折腾的,FFmpeg 做无损提取搭配 Audacity 手动去人声这个组合,自由度是最高的。不想在本地装任何软件的话,通义听悟这样的在线平台也能在浏览器里完成整个流程。

选择哪个方案,主要看你手边有什么设备、对音质的要求有多高、以及愿不愿意花时间琢磨稍微复杂的操作。