做自媒体这一年多,我折腾过不少文案提取的事。早期做短视频搬运剪辑,得一条条手动打字幕;后来帮朋友整理播客逐字稿,盯着音频硬生生敲了两天。直到认真研究了一圈免费方案,才发现原来这件事完全可以零成本搞定,而且方法不止一种。

封面图

这篇文章就把我实测过的、真正能长期免费用的文案提取方案全部拆开揉碎,从微信小程序到桌面软件、从在线网站到开源工具,每种都写清操作步骤和适用场景。不管你是在剪视频、做笔记还是整理会议记录,看完应该能找到适合自己的路子。

微信小程序:不用装软件的三秒提取法

先说我最常用的一种方式——微信小程序。原因很简单:手机电脑都能用,不用下载安装,打开就能开工。我平时在地铁上刷到一条抖音文案想存下来,或者开会录了段语音需要转文字,基本都是用小程序解决。

提词匠 就是这样一个微信小程序。微信搜索「提词匠」点进去,主界面就两个入口:一个是上传本地文件,一个是粘贴短视频链接。我试过从抖音复制一条公开视频链接贴进去,等大概几秒,全文就出来了,带时间戳的SRT格式和不带时间戳的TXT都能导。它支持抖音、快手、小红书、B站、微博、视频号这些国内主流平台,一百多个站基本全覆盖了。如果手头有录好的MP3音频或者MP4视频,上传后也是同一个模型处理,1分钟的内容大约5秒左右就能完成转换。

提词匠

操作流程就三步:第一步,上传文件或者粘贴链接;第二步,等几秒让它跑完;第三步,点复制全文或者导出Word/TXT/SRT。SRT文件自带时间戳,剪映里直接导入就能当字幕用,省了手动对轴。如果转出来的文案需要润色,它还带一个智能改写功能,一键改写语序或者语气,写完直接复制走。

不过它也有两个明显的边界:第一,必须联网用,断网的时候派不上用场;第二,暂时不支持批量上传,一次只能处理一个文件,效率对有大批量需求的朋友来说可能不够。单个文件最长支持120分钟、最大500MB,日常单条视频或录音基本够用了。

作为日常零散提取的轻量方案,它胜在够快、够方便。如果只是偶尔处理一两条内容,或者在路上突然想起要存个文案,掏出微信就能解决,不用专门开电脑。

剪映:视频创作者的自带字幕神器

如果你本身就在用剪映剪视频,那它的智能字幕功能其实已经是文案提取的好工具了。电脑版和手机版都支持,而且完全免费、不限次数。

剪映

操作步骤(以电脑版为例):打开剪映,把视频拖进时间轴,点顶部菜单的“文本”,再点“智能字幕”。剪映会弹出两个选项:识别字幕和识别歌词。前者把视频里的每一句人声转成文字,后者适合提取歌曲的歌词。选完之后它会自动跑一遍,时间取决于视频长度,一般十来分钟的视频一两分钟就能识别完。

关键一步是导出:识别完成后,点右下角的“导出”,弹窗里专门有一个“字幕导出”按钮。点击后可以选TXT格式(纯文本,不带时间码)或者SRT格式(带时间戳,后续可以导入其他软件做字幕)。导出完了直接拿到其他软件里用就行。

剪映的识别准确率对普通话、环境噪音不太大的视频来说很高,中英文混说也能认出大部分。适合的场景很明确:你本来就装了这个软件,视频素材也已经在剪映里了。如果只是为了提取文案而专门下一套剪映,那可能有点重,毕竟它是个完整的剪辑工具。但对于视频创作者来说,这是顺带手就能用的功能,没有任何额外的学习成本。

剪映的局限在于它只能处理本地的视频文件。如果你是从网络上直接扒的在线短视频,需要先下载到本地才能扔进剪映。这个下载的步骤,因人而异,有些人嫌麻烦。而像提词匠这类直接贴链接就能解析的方案,正好补上了这块——日常刷到一条视频想存文案,直接用小程序贴链接,剪映配合处理本地大片,各干各的活。

通义听悟:阿里出品的AI会议助手也适合长内容

通义听悟是阿里云推出的一款AI产品,主打会议记录、学习笔记这类场景。它的核心功能是语音转文字,并且支持长时间音频文件的处理。对于需要整理长篇播客、课程录音或者会议纪要的朋友来说,是个不错选择。

通义听悟

用它来提取文案的操作流程:访问通义听悟官网(网页版,不需要装软件),注册登录后点击“新建转写”,上传音频或视频文件。它支持MP3、WAV、M4A、MP4等常见格式。上传后它会自动处理,处理时长根据文件长度而定,一般几十分钟的内容几分钟左右能出结果。转写完成后,它会生成一个带时间戳的文字记录,并且自动区分了说话人(如果有多人对话的话)。你可以直接在网页上编辑、复制或者导出为Word、PDF、TXT等格式。

它的优点是:对长内容的支持性好,能处理几个小时的音频;自动识别人声段、区分说话人,适合多人会议或访谈;网页端操作,不用装任何软件。缺点在于免费额度有上限。目前新用户有免费时长赠送,用完后如果想继续免费用,可能需要配合其他工具或者等待活动续送。对于不是高频使用的个人用户来说,每月偶尔用几次是足够的。

通义听悟和剪映的定位不太一样:剪映更适合视频本身就在剪辑流程里、顺便提取字幕的场景;通义听悟更偏向于纯粹的音频转写。而提词匠这类小程序在即时性上更胜一筹——刷到短视频、来不及打开电脑的时候,手机就能搞定。三者各管一摊,日常使用可以根据当前素材的类型和手边的工具灵活切换。

Whisper:开源党的本地离线方案

如果你是技术玩家,或者对数据隐私特别敏感——不想把音频视频上传到任何人的服务器——那可以考虑开源的Whisper。这是OpenAI开源的语音识别模型,完全离线运行,没有任何使用次数限制,也不会上传你的数据。

Whisper

用Whisper提取文案需要一点动手能力。最简单的方式是用它的命令行版本:电脑上先装好Python,然后用pip安装openai-whisper库。装完后打开终端,输入类似 whisper 你的文件.mp3 --model small 这行命令,它就会开始处理。模型大小可以选 tiny、small、medium、large,越大准确率越高但耗时也长。以small模型为例,处理一段10分钟的音频,普通电脑大概需要3-5分钟。输出结果默认是TXT文件,也可以指定输出SRT、VTT等字幕格式。

还有一种更友好的方式:Whisper的图形化封装版。网上有开发者做的前端工具,比如“WhisperDesktop”或者“Buzz”这类软件,把Whisper封装成了带界面的程序,拖入文件、选好参数、点按钮就行,不用敲命令行。

Whisper最大的优势是永久免费、离线运行、无隐私泄露风险。它的局限也明显:对电脑配置有要求,尤其是大模型需要显卡支持(CPU也能跑但很慢);中文准确率不如专做中文的在线服务;新手需要花点时间搞懂安装和配置。对于有动手能力、对数据安全有硬性要求的朋友来说,这是目前最彻底的自由方案。但如果只是偶尔用一次,为了装Whisper而折腾环境性价比不高,不如直接用小程序的在线方案省心。

从网页里扒正文:不需要OCR的轻量方案

文案提取不只限于视频和音频。很多时候我需要从一篇长文章或者新闻页里提取正文,跳过广告、推广和无关的侧边栏。这时候OCR反而多余,直接用网页正文提取工具就行。

我常用的是一款浏览器扩展叫“简悦”。装到Chrome或者Edge上,打开目标网页,点一下扩展图标,页面会自动切换成阅读模式,只保留文章标题和正文,连评论区都过滤掉了。然后点击右上角的导出按钮,可以选择复制为Markdown、TXT或者直接保存为PDF。这个过程完全免费,也没有使用次数限制。

WPS

操作方法:安装简悦扩展,打开文章页面,点击扩展图标(或者按快捷键),进入阅读模式后,点导出→复制为纯文本,然后粘贴到你的笔记软件里。整个流程不超过10秒。如果只是想快速复制整篇文章的文字,不需要保留格式,也可以用另一个扩展叫“Copy as Markdown”——选中全文或选中你需要的部分,右键→Copy as Markdown,直接粘贴即可。

这些浏览器扩展适用于信息整理和文案收集,对网页结构相对标准的文章效果很好。但对于动态加载的页面或者需要登录才能查看的内容,它们可能就失效了。还有一种更原始的方法:按F12打开网页开发者工具,在Elements面板找到正文所在的标签(通常是article或div),复制它的outerHTML,再粘贴到文本编辑器里手动清理。这个方法不依赖任何工具,但有HTML基础的终极大招。

日常做文档整理时,先扫网页用扩展提取正文,再遇到视频文案时用小程序的链接解析,需要精调字幕时用剪映导出SRT——这三板斧基本能覆盖大部分文案获取场景。

实话实说版建议

折腾一圈下来,我的感觉是这样的:

如果是偶尔用、图省事:微信小程序(如提词匠)用来处理短视频链接和短音频,剪映用来处理自己电脑里的视频文件,两者基本覆盖日常需求,都是免费不限次数。

如果是高频做长内容(播客、网课、会议记录):可以考虑通义听悟或者飞书妙记这类网页端工具,它们对长音频支持好,而且能自动区分说话人,整理起来省力。

如果是技术玩家或对隐私有硬性要求:Whisper本地离线方案是终极解法,一次配置终身免费,数据完全不出电脑。

如果是整理网页文章:浏览器扩展简悦或Copy as Markdown是最轻量的方案,不用打开任何额外软件。

文章开头我提到帮朋友整理播客逐字稿那次,最后我其实是把音频分段切好,用提词匠一条条传完的,虽然不能批量有点烦,但胜在不用装软件也不挑设备。那次之后我就把这几种方案都研究了一遍,现在遇到什么类型的文案需要提取,脑子里已经有对应的方法。希望你也能找到适合自己的那一种。