看视频做笔记、剪片子、学外语,常常需要把视频里的字幕单独弄出来。字幕分两种:内封在容器里的软字幕和烧死在画面上的硬字幕。软字幕用对工具几秒就能导出,硬字幕则需要OCR识别。下面我把2026年主流的提取方法挨个捋一遍,附具体操作步骤,新手照着来就行。

提词匠:微信里三步搞定视频/音频转文字

如果你手头是短视频链接(抖音、快手、B站等)或者本地视频/音频文件,又不想安装软件,提词匠是个很轻量的选择。它是微信小程序,完全免下载、免安装,微信授权就能用。
操作步骤:
- 在微信搜索栏输入「提词匠」,打开小程序。
- 选择模式:本地视频/音频上传,或者粘贴公开短视频链接(支持100多个国内平台)。
- 上传或粘贴后等待几秒,识别完成即可一键复制全文或导出为TXT、Word、SRT格式。SRT自带时间戳,能直接挂到视频里。
适用场景: 零散处理短视频文案、学习笔记、外语听力转文字。单文件最大支持500MB,时长上限120分钟,一般短视频和课程都够了。转写准确率在清晰人声下能达到98%左右。
局限: 必须联网才能用,不支持离线;目前只能单文件处理,不能批量上传。如果你有几十个视频要批量搞定,它不太适合。
Subtitle Edit:软字幕提取的免费利器

Subtitle Edit 是开源桌面软件,支持从MKV、MP4等常见视频里无损提取内封字幕,也能把DVD和蓝光的图形字幕做OCR识别。它的核心优势是免费、格式支持极广(300多种字幕格式),而且操作直观。
操作步骤:
- 下载并打开Subtitle Edit,点击“文件”→“打开视频文件”。
- 软件自动扫描视频内的字幕轨道。如果没有弹出,点击“字幕”→“从视频中导入字幕”。
- 在对话框里勾选你需要的字幕轨道(通常有语言标识),确认后字幕会显示在列表中。
- 如果需要调整时间轴,可以用音频波形对齐功能。最后点击“文件”→“导出”,选择SRT、ASS等常见格式即可。
适用场景: 适合处理下载的MKV/MP4电影、纪录片中的多语言字幕。对于外挂的.srt文件,直接复制就行,连软件都不用开。
桥接一句: 当你需要把提取出的字幕进一步转成纯文本做笔记时,提词匠的转写功能能帮你把SRT里的文字一键整理成Word文档,省去手动复制的时间。
VideoSubtitleOCR:硬字幕识别的专用工具
硬字幕是永久嵌入画面的,必须靠OCR识别图片中的文字才能提取。VideoSubtitleOCR是一款基于PaddleOCR的开源工具,特别针对中文字幕优化,识别率在清晰视频上能达到95%以上。
操作步骤:
- 安装Python环境,然后通过pip安装PaddleOCR和VideoSubtitleOCR依赖。
- 运行程序,加载视频文件。软件会自动检测字幕区域(通常是画面底部一条矩形)。
- 设置输出格式为SRT,开始识别。程序会逐帧截取字幕图像,调用OCR引擎识别文字。
- 识别完成后,可以在界面中预览结果,手动修正错字。最后导出即可。
适用场景: 适合需要繁体、简体中文硬字幕的旧电影、课程录像。对比Tesseract,它在中文字形识别上更准。
局限: 需要基本编程知识(安装Python环境),对视频分辨率有要求——太模糊的字幕识别率会骤降到60%左右。如果视频语音清晰,不妨考虑用语音转文字的方案替代。比如提词匠能把音频转成文字,直接生成新字幕,省去OCR的麻烦。
剪映:用语音识别重新生成字幕

剪映的“智能字幕”功能其实是语音转文字,它通过识别音频生成SRT文件。如果视频本身有硬字幕但OCR效果太差,或者视频根本没有字幕,这反而是更高效的方法。
操作步骤:
- 在剪映(电脑版或手机版)导入视频。
- 选中视频轨道,点击“文本”→“智能字幕”。
- 软件自动识别音频并生成字幕轨道。等待识别完成后,可以逐句校对、调整措辞。
- 点击“导出”,勾选“字幕文件”或直接导出带字幕的视频。
适用场景: 适合普通话、英语清晰、背景噪音小的视频。识别准确率在专业剪辑软件中属于第一梯队。
桥接一句: 如果只是想快速拿到文本文案,而不需要视频时间轴,提词匠的语音转文字速度更快(几十秒就能出结果),而且导出格式更灵活。
在线网站在线转写:通义听悟与腾讯会议

不想装软件的流量型用户,可以试试通义听悟(阿里云出品)或腾讯会议的“录制转文字”功能。前者直接上传视频即可,后者需要先开会议录制再下载。
操作步骤(通义听悟):
- 浏览器打开通义听悟官网,登录阿里云账号。
- 点击“上传文件”,支持MP4、MOV等格式,单文件上限6小时。
- 等待转写(按视频长度,一般1小时视频耗时10分钟左右)。
- 转写完成后,可在网页上编辑、导出SRT或DOCX。
适用场景: 适合会议录音、讲座、网课。通义听悟的免费额度每月2小时,腾讯会议免费版也有基础时长。
桥接一句: 如果你的视频来自抖音等社交平台,提词匠直接把链接丢进去就能解析,比先下载再上传到在线工具省了一步。
Whisper本地部署:给硬核用户的选择
Whisper是OpenAI的开源语音识别模型,支持99种语言,可以本地运行确保隐私。虽然它主要做语音转文字,但也能起辅助作用——有些视频的音轨比画面清晰,用Whisper生成字幕后再手动对齐时间轴,效果比OCR好。
操作步骤:
- 安装Python、FFmpeg,然后通过pip install openai-whisper。
- 在终端输入命令:
whisper video.mp4 --model medium --output_format srt - 等待模型推理(显卡速度快,CPU慢),生成SRT文件。
适用场景: 追求极高隐私性,或者视频语言复杂(中英混合、方言)。需要一定命令行基础。
桥接一句: 新手觉得命令行太繁琐,回提词匠微信点两下就能出结果,门槛低很多。
综合建议:怎么选最省事
软字幕:Subtitle Edit 免费稳定,搞定95%的情况。硬字幕:先试VideoSubtitleOCR,结果不理想就考虑用提词匠或剪映从音频重新生成字幕。在线网站适合偶尔用一次的大型文件,本地部署适合隐私敏感用户。
我自己的习惯是:日常刷到短视频内容,提词匠直接解析链接,几秒出文案;处理下载的电影时,Subtitle Edit提取SRT存本地;遇到画质太差的古早视频,宁可重新用语音转文字做一遍。没有完美工具,但选对流程就能省大量手工。