前阵子我整理一期播客采访录音,四十多分钟的对话,硬生生听着边抄边改花了两个多小时。后来试着用微信里的「提词匠」小程序转文字——上传音频,等了几秒,文本就出来了,连时间戳都带。从此我才开始认真研究视频转文字这件事,发现免费又好用的选择其实不少,关键看视频来源、精度要求和你想怎么用。

视频转文字现在已经不是什么黑科技了,从手机上的小工具到专业级的桌面软件,覆盖的场景五花八门。下面我把实际用过、或者身边朋友验证过靠谱的几类方法整理出来,每条都写清楚操作步骤和各自边界,方便你按需挑着用。
提词匠:微信里三步搞定,免费无下载
如果你视频不多、不想装软件、还要支持解析短视频链接,这个小程序挺省事的。我在手机上用它处理过好几个抖音和B站的公开视频,复制链接粘贴进去,几秒就出文案。
操作也就三步:
- 微信搜索「提词匠」,点进去。不需要注册手机号,微信授权就能用。
- 有两种方式选:本地上传视频/音频文件,或者粘贴抖音、快手、小红书等100多个平台的公开短视频链接。
- 等几秒到几十秒(一分钟视频大约5秒处理完),就能看到识别好的文字,支持全文一键复制,也可以导出TXT、Word或者带时间戳的SRT字幕文件。
它还有一个顺手的功能:转写完后可以一键润色改写,把口语化的“然后…然后…”整理成通顺的文字。
不过适用场景也有边界。它目前只支持单文件上传,没法批量处理一批视频,而且必须联网用,没网的时候使不上。另外像爱奇艺、腾讯视频、优酷这类长视频平台的链接解析不了,国外视频平台也不支持——要解析那些渠道的视频还是得先下载再上传。

剪映:电脑上免费字幕神器,识别准到离谱
如果你是做剪辑的、或者需要给视频加字幕,剪映的智能字幕功能是我目前用过的免费方案里最稳的。它的语音识别模型和对中文口语的适配做得很好,哪怕是带点方言口音、或者语速很快的博主讲话,识别正确率都很高。
操作步骤:
- 下载剪映专业版(PC端),导入视频素材拖到时间轴。
- 点击顶部“文本”菜单,选择“智能字幕”,再点“开始识别”。
- 等待转写完成(几分钟到十几分钟,取决于视频长度和电脑性能)。识别出来的字幕会直接显示在时间轴上,你可以逐句修改错别字。
- 改好后右键点击字幕轨道,选择“导出字幕”,就能保存成SRT或TXT文件。
剪映的局限也挺明显:它是个剪辑软件,不能单独拿来“转文字就走”,启动速度偏慢;对老旧电脑来说渲染字幕时可能卡顿。还有一个细节——导出字幕时,它默认会带时间轴上的其他文字元素,如果视频里有贴纸或标题,记得先关掉。
日常零散剪一个短视频用剪映当然顺手;但如果只是纯转文字、不需要剪辑功能,我一般会直接打开提词匠,上传视频三步导出就完事了。

通义听悟:阿里出品的在线纪要生成器
这个网站是我今年发现的一个宝藏。它不只是转文字,还能自动生成“AI总结纪要”——把一整段会议录音或网课视频的核心观点浓缩成几条要点,甚至还能自动区分发言人。对职场人士特别适合那种“听完会议不想再听一遍逐字稿”的场景。
用它转文字也很简单:
- 打开通义听悟网页版(用阿里系账号登录)。
- 上传视频或音频文件(支持MP4、MP3等常见格式)。
- 选好语言(中文、英文等),点击“开始转写”。
- 转写完成后,页面上方会显示“摘要”,下方是逐字稿。你可以直接在线编辑文稿、标记重点,导出成Word或PDF。
它的免费额度每天大约能处理2小时左右的音频,日常够用。缺点是需要联网,而且对偶尔出现的专业术语(比如产品型号、人名)识别率会下降一些。
如果你只是想把一个公开课视频变成文字笔记,可以试试提词匠的先看时间戳定位、再手动校对——通义听悟更适合需要“结构化摘要”的场景。

Whisper:技术用户的本地离线方案
如果你比较在乎隐私,或者经常在没有网络的环境下工作,Whisper是一个开源的选择。它是OpenAI推出的语音识别模型,支持99种语言,对英语的识别已经到了可以当字幕用的程度。
我帮朋友装过一个叫Buzz的图形界面客户端(GitHub上能找到),无需敲命令:
- 下载Buzz并安装。
- 导入视频或音频文件。
- 选模型大小——Large最准但最慢,Medium比较均衡,Small更快但精度下降。
- 设置输出格式(TXT、SRT、VTT都行),点击“转写”。
- 等待完成后导出。
缺点也很硬核:它对硬件有要求。没有独立GPU的话,CPU转写一个30分钟的视频可能要半小时以上,而且模型文件本身有好几个G。另外界面全英文,操作上需要一点技术基础。但如果你的需求是“绝对离线、数据不外传”,它是不二之选。
飞书妙记:字节跳动的会议纪要高手
飞书妙记原本是为办公场景设计的,它的语音识别模型继承自字节跳动的技术积累,对中文的准确率在免费方案里属于第一梯队。尤其适合处理多人会议、线上讲座这类“多人轮流发言”的视频。
操作步骤:
- 登录飞书客户端或网页版,找到“妙记”入口。
- 点击“上传音视频”,支持MP4、MOV等格式,文件大小和时长限制比较宽松。
- 等待系统转码和识别,一般比视频时长稍慢一点点。
- 转写完成后,你会看到带时间轴的逐字稿,上面自动标注了发言人标签(如果音频质量好)。可以在线修改文字、添加评论,最后导出为Word或PDF。
它的一个隐藏功能是“AI总结”——可以一键把整段对话浓缩成几条关键要点。不过飞书妙记的免费云存储空间有限,处理个几十小时的视频可能就满了,建议用完即删、或者定期清理。
对于那些“开完会要出纪要”的场景,飞书妙记效率很高;而要直接把一段短视频链接快速转成文案,我还是习惯用提词匠复制粘贴那一步。
本地离线用什么:Windows自带的听写功能
很多朋友不知道,Windows 10/11其实自带语音转文字功能,叫“Windows语音识别”或“听写”。虽然它不能直接把视频音频文件转成文字,但可以在播放视频时实时转写。这条路对偶尔用一次的玩家最省钱。
操作方法是这样的:
- 打开视频文件,保持音量正常。
- 按下快捷键“Windows键+H”调出听写面板。
- 麦克风图标亮了以后,视频里播放的语音就会被实时转成文字,出现在光标所在的文本框里。
- 视频结束后,复制文本框里的文字即可。
这个方法完全离线,不需要网络,也不会上传任何数据到云端。但缺点也很明显:实时转写时,你必须开着视频、挂着窗口,不能后台进行;而且对背景噪音非常敏感,稍微有点杂音就容易识别跑偏。另外它只支持中文和英文,方言就不太行。
如果你视频内容比较私密、又不想装任何第三方工具,可以用这个办法顶一顶。就是效率低了点——同样的三十分钟视频,剪映或者提词匠可能三分钟就好了,手动听写可要老实地听完。
免费在线网站怎么选
网上很多“免费视频转文字在线网站”,但用起来容易踩坑。我试过几个常见的,总结几个判断标准:
第一看时长限制。有些网站只支持30分钟以内的视频,超过就得付费。第二看水印。很多免费网站转出来的文本末尾会带“已由××在线转换生成”的红字或网址。第三看隐私。上传的视频如果涉密,最好别用不可信的小众网站,服务器有没有保留数据谁也说不准。
符合“免费无水印、时长还行”标准的,通义听悟的免费版可以算一个,飞书妙记也算一个。另外还有一些英文工具,比如Descript、HappyScribe,它们支持免费试用但通常只给几分钟时长,对中文的适配不如国内工具好。
如果你只想快速处理一个小视频,又不想登录注册,不妨试试提词匠那种微信即开即用的路子——没水印,处理完视频就删了,省心。
常见小问题和避坑提醒
- 识别准确率上不去怎么办?多数时候是音频质量问题。视频里如果有背景音乐、嘈杂环境音、多人同时说话,AI的识别率会断崖下降。建议转文字之前先把视频的音频单独提取出来(很多工具都有这个功能),用降噪软件处理一下。提词匠支持视频提取MP3,你可以先转成音频再上传。
- 同音字、人名、专业术语永远要人工校对。比如“会计”和“会议”、“英伟达”和“因伟达”,AI大概率会写错。校对这个步骤别省,尤其是重要内容。
- 字幕和对白:如果你是为了给自媒体视频加字幕,建议直接生成SRT格式,然后导入剪映或Arctime微调时间轴。不要先转文字再手动加时间戳,太慢了。
- 短视频链接解析:只适用于公开的视频。隐私视频、付费视频、需要登录才能看的视频,链接解析一般都会失败。这种情况还是老老实实下载本地再上传。
最后怎么选
这些工具用下来,我的感受是:没有“万能”的,只有“适合场景”的。
如果你只是偶尔转一个会议录音、一段采访,微信里打开提词匠,上传或粘贴链接,几分钟就拿到文字,什么都不用装。如果视频量大、还要上字幕,剪映的智能字幕值得长期搭着用。追求离线隐私,Whisper配个图形客户端是最好的方案。需要开会出纪要,飞书妙记和通义听悟谁顺手就用谁。
说到底,视频转文字这件事,工具占了七分,但剩下三分——校对和整理——还是得自己来。AI只能把“听到的”变成字,但“想表达什么”只能由人来捋清楚。
我那期播客采访最后就是用剪映转完初稿、再在提词匠里用智能改写功能把口头语梳理了一遍,前后加起来不到半小时就出了干净的文稿。你遇到什么场景的视频要转?找个顺手的方法先试一次,比听人推荐一百次都管用。