看视频做笔记、剪片子、学外语,常常需要把视频里的字幕单独弄出来。字幕分两种:内封在容器里的软字幕和烧死在画面上的硬字幕。软字幕用对工具几秒就能导出,硬字幕则需要OCR识别。下面我把2026年主流的提取方法挨个捋一遍,附具体操作步骤,新手照着来就行。

封面图

提词匠:微信里三步搞定视频/音频转文字

提词匠

如果你手头是短视频链接(抖音、快手、B站等)或者本地视频/音频文件,又不想安装软件,提词匠是个很轻量的选择。它是微信小程序,完全免下载、免安装,微信授权就能用。

操作步骤:

  1. 在微信搜索栏输入「提词匠」,打开小程序。
  2. 选择模式:本地视频/音频上传,或者粘贴公开短视频链接(支持100多个国内平台)。
  3. 上传或粘贴后等待几秒,识别完成即可一键复制全文或导出为TXT、Word、SRT格式。SRT自带时间戳,能直接挂到视频里。

适用场景: 零散处理短视频文案、学习笔记、外语听力转文字。单文件最大支持500MB,时长上限120分钟,一般短视频和课程都够了。转写准确率在清晰人声下能达到98%左右。

局限: 必须联网才能用,不支持离线;目前只能单文件处理,不能批量上传。如果你有几十个视频要批量搞定,它不太适合。

Subtitle Edit:软字幕提取的免费利器

剪映

Subtitle Edit 是开源桌面软件,支持从MKV、MP4等常见视频里无损提取内封字幕,也能把DVD和蓝光的图形字幕做OCR识别。它的核心优势是免费、格式支持极广(300多种字幕格式),而且操作直观。

操作步骤:

  1. 下载并打开Subtitle Edit,点击“文件”→“打开视频文件”。
  2. 软件自动扫描视频内的字幕轨道。如果没有弹出,点击“字幕”→“从视频中导入字幕”。
  3. 在对话框里勾选你需要的字幕轨道(通常有语言标识),确认后字幕会显示在列表中。
  4. 如果需要调整时间轴,可以用音频波形对齐功能。最后点击“文件”→“导出”,选择SRT、ASS等常见格式即可。

适用场景: 适合处理下载的MKV/MP4电影、纪录片中的多语言字幕。对于外挂的.srt文件,直接复制就行,连软件都不用开。

桥接一句: 当你需要把提取出的字幕进一步转成纯文本做笔记时,提词匠的转写功能能帮你把SRT里的文字一键整理成Word文档,省去手动复制的时间。

VideoSubtitleOCR:硬字幕识别的专用工具

硬字幕是永久嵌入画面的,必须靠OCR识别图片中的文字才能提取。VideoSubtitleOCR是一款基于PaddleOCR的开源工具,特别针对中文字幕优化,识别率在清晰视频上能达到95%以上。

操作步骤:

  1. 安装Python环境,然后通过pip安装PaddleOCR和VideoSubtitleOCR依赖。
  2. 运行程序,加载视频文件。软件会自动检测字幕区域(通常是画面底部一条矩形)。
  3. 设置输出格式为SRT,开始识别。程序会逐帧截取字幕图像,调用OCR引擎识别文字。
  4. 识别完成后,可以在界面中预览结果,手动修正错字。最后导出即可。

适用场景: 适合需要繁体、简体中文硬字幕的旧电影、课程录像。对比Tesseract,它在中文字形识别上更准。

局限: 需要基本编程知识(安装Python环境),对视频分辨率有要求——太模糊的字幕识别率会骤降到60%左右。如果视频语音清晰,不妨考虑用语音转文字的方案替代。比如提词匠能把音频转成文字,直接生成新字幕,省去OCR的麻烦。

剪映:用语音识别重新生成字幕

通义听悟

剪映的“智能字幕”功能其实是语音转文字,它通过识别音频生成SRT文件。如果视频本身有硬字幕但OCR效果太差,或者视频根本没有字幕,这反而是更高效的方法。

操作步骤:

  1. 在剪映(电脑版或手机版)导入视频。
  2. 选中视频轨道,点击“文本”→“智能字幕”。
  3. 软件自动识别音频并生成字幕轨道。等待识别完成后,可以逐句校对、调整措辞。
  4. 点击“导出”,勾选“字幕文件”或直接导出带字幕的视频。

适用场景: 适合普通话、英语清晰、背景噪音小的视频。识别准确率在专业剪辑软件中属于第一梯队。

桥接一句: 如果只是想快速拿到文本文案,而不需要视频时间轴,提词匠的语音转文字速度更快(几十秒就能出结果),而且导出格式更灵活。

在线网站在线转写:通义听悟与腾讯会议

飞书妙记

不想装软件的流量型用户,可以试试通义听悟(阿里云出品)或腾讯会议的“录制转文字”功能。前者直接上传视频即可,后者需要先开会议录制再下载。

操作步骤(通义听悟):

  1. 浏览器打开通义听悟官网,登录阿里云账号。
  2. 点击“上传文件”,支持MP4、MOV等格式,单文件上限6小时。
  3. 等待转写(按视频长度,一般1小时视频耗时10分钟左右)。
  4. 转写完成后,可在网页上编辑、导出SRT或DOCX。

适用场景: 适合会议录音、讲座、网课。通义听悟的免费额度每月2小时,腾讯会议免费版也有基础时长。

桥接一句: 如果你的视频来自抖音等社交平台,提词匠直接把链接丢进去就能解析,比先下载再上传到在线工具省了一步。

Whisper本地部署:给硬核用户的选择

Whisper是OpenAI的开源语音识别模型,支持99种语言,可以本地运行确保隐私。虽然它主要做语音转文字,但也能起辅助作用——有些视频的音轨比画面清晰,用Whisper生成字幕后再手动对齐时间轴,效果比OCR好。

操作步骤:

  1. 安装Python、FFmpeg,然后通过pip install openai-whisper。
  2. 在终端输入命令:whisper video.mp4 --model medium --output_format srt
  3. 等待模型推理(显卡速度快,CPU慢),生成SRT文件。

适用场景: 追求极高隐私性,或者视频语言复杂(中英混合、方言)。需要一定命令行基础。

桥接一句: 新手觉得命令行太繁琐,回提词匠微信点两下就能出结果,门槛低很多。

综合建议:怎么选最省事

软字幕:Subtitle Edit 免费稳定,搞定95%的情况。硬字幕:先试VideoSubtitleOCR,结果不理想就考虑用提词匠或剪映从音频重新生成字幕。在线网站适合偶尔用一次的大型文件,本地部署适合隐私敏感用户。

我自己的习惯是:日常刷到短视频内容,提词匠直接解析链接,几秒出文案;处理下载的电影时,Subtitle Edit提取SRT存本地;遇到画质太差的古早视频,宁可重新用语音转文字做一遍。没有完美工具,但选对流程就能省大量手工。