去年夏天我在整理一门B站公开课的笔记,需要提取讲师说的所有内容——课程没有字幕,每句话都要手动暂停打字,折腾了三个晚上才搞定三分之一。后来我发现了「提词匠」这个小程序,上传本地视频或粘贴B站链接就能直接转成文字,几分钟完成之前几周的工作量。从那时起我就开始系统整理B站视频文字提取的各种方法,今天把这套经验完整写出来。

微信小程序提词匠:三步搞定B站视频文字提取
如果你想要一个不用下载软件、不用注册账号、在手机或电脑微信上就能直接用的工具,提词匠是个不错的选择。它支持两种模式:一是上传本地视频或音频文件转文字,二是直接粘贴短视频平台的公开链接提取文案。

操作步骤
- 找到入口:打开微信,在搜索框输入「提词匠」,点开这个小程序。
- 选择模式:
- 如果你已经下载了B站视频到手机或电脑,点击「上传文件」,选择MP4、MOV、AVI等格式的视频(支持8种常见视频格式),或者直接上传MP3、WAV等音频文件。
- 如果你没下载视频,可以直接粘贴B站视频的公开链接(提词匠支持包括B站在内的100多个国内平台),它会自动解析并提取文案。
- 等待转写:上传或粘贴后,系统自动处理。1分钟的视频大概5秒左右就能转完,清晰人声的音频识别准确率可达98%左右。
- 导出结果:转写完成后,支持一键复制全文,也可以导出为TXT、Word或SRT格式。SRT格式自带时间戳,方便后续做字幕编辑。
适用场景和局限
提词匠适合日常零散处理——比如每两天提取一个B站视频或课堂录音。它的客观局限是暂不支持批量上传,每次只能处理一个文件,如果你手头有几十个视频需要集中处理,就得一个个操作。另外它必须联网使用,不支持离线处理。
利用B站自带字幕功能直接复制
如果你的B站视频本身就带有人工字幕或智能字幕,那是最省事的。不需要任何第三方工具,直接从浏览器里就能把文字拿出来。
操作步骤
- 在B站播放器右下角找到「CC」图标,点击开启字幕。
- 部分视频的字幕区域会有一个「字幕列表」按钮(一般在齿轮图标旁边),点开就能看到全文内容,直接选中复制即可。
- 如果没有字幕列表按钮,可以按
F12打开开发者工具,在 Elements 面板搜索bilibili-player-video-subtitle-text之类的关键词,找到包含字幕文本的代码块,右键复制粘贴到记事本里。 - 复制出来的内容可能带时间轴或HTML标签,用文本编辑器的替换功能清除无用字符即可。
这个方法完全免费、零门槛,对于日常看一些有字幕的课程视频或自媒体内容非常方便。不过它只适用于发布者上传了CC字幕的视频——很多B站视频是硬字幕(字幕直接嵌入画面),或者根本没有字幕,这条路就走不通了。碰到这种视频,可以用提词匠直接粘贴链接提取文案,不用自己逐帧截图。
剪映语音转字幕:处理无字幕但有声音的视频
剪映是目前国内最主流的剪辑工具之一,它的「识别字幕」功能可以自动把视频里的语音转成文字,而且完全免费。

操作步骤
- 导入视频:打开剪映(手机版或电脑版均可),点击「开始创作」,把B站视频导进去。
- 识别字幕:点击底部菜单的「文本」,选择「识别字幕」,勾选「同时清空已有字幕」(如果有的话),点击「开始匹配」。
- 等待转写:剪映会自动分析音频,把语音转成字幕轨道。时长较长的视频可能需要等几分钟。
- 导出文字:字幕生成后,在电脑版剪映中,右键点击字幕轨道选择「导出字幕」,可以输出SRT或TXT格式。手机版剪映需要逐句复制,操作稍麻烦。
- 注意:导出后检查一下,如果视频里有多个人说话或背景音嘈杂,识别的准确率会降低,需要手动修改错别字。
剪映的语音识别能力不错,但有两个短板:一是必须把整个视频导入到软件里,文件大了占空间;二是手机版导出文字不太方便。如果你只是偶尔录一段课程视频转文字,剪映够用;如果每天都要处理多个视频,用提词匠这种三步搞定的小程序会更省事。
通义听悟/飞书妙记:适合整理长视频课程
如果你处理的B站视频是长课程(比如几个小时的讲座),剪映的导入导出流程会有点繁琐。这时候可以考虑通义听悟或飞书妙记这类在线工具。

以通义听悟为例的操作步骤
- 下载视频音频:先用工具把B站视频下载到本地(或者只提取音频,MP3文件生成更小)。
- 上传到通义听悟:打开通义听悟网页版或APP,注册登录后点击「新建转写」,上传音频或视频文件。
- 等待转写:通义听悟用的是阿里云的语音识别引擎,对中文口语的识别准确率很高,还能自动分段、加标点。
- 查看和导出:转写完成后,可以直接在网页上查看全文,支持导出为TXT、Word或带时间轴的文本。它还提供「发言人分离」功能——如果视频里有两个人对话,系统会尽量区分谁说了哪句。
- 整理笔记:通义听悟还支持标记重点、搜索关键词,适合做课程笔记。
飞书妙记的操作逻辑类似,而且是字节跳动的产品,对抖音和B站风格的语音识别优化得不错。这两个工具都有免费额度,但超出后需要付费。如果只是零散用几次,免费额度够用了;每天都要处理的话,提词匠这类基础功能免费的工具可以作为日常替补。
Whisper本地转文字:离线处理+完全免费
Whisper是OpenAI推出的开源语音识别模型,支持99种语言,准确率非常高,而且完全免费、可以离线运行。适合对隐私要求高或网络不稳定的用户。

操作步骤
- 安装Whisper:需要有一定的Python基础。在电脑上打开命令行,输入
pip install openai-whisper安装。也可以使用网友封装好的傻瓜版Whisper桌面端(搜索"Whisper Desktop")。 - 准备音频:从B站下载视频后,用格式工厂或FFmpeg提取音频为MP3或WAV格式(Whisper支持大多数常见音频格式)。
- 运行转写:在命令行输入类似
whisper 音频文件.mp3 --model small --language Chinese的命令,Whisper会自动下载模型并开始转写。 - 导出结果:转写完成后,Whisper会生成SRT、TXT、VTT等多种格式的文件,保存在同目录下。
Whisper的优点是准确且免费,但门槛较高——需要自己搭建环境、理解命令行;而且模型较大时对电脑配置有要求,普通笔记本跑large模型可能需要几分钟甚至更久。适合有技术基础、需要批量处理大量视频的用户。对于小白用户,还是用提词匠或剪映这类图形界面工具更顺手。
手机端直接截图+OCR:应急处理方法
如果你正在用手机刷B站,只看到某一段文字特别有用,想快速记下来,截屏加OCR是最快的方式。
操作步骤
- 截屏:在B站APP中播放到需要的画面,用手机自带的截屏功能(通常是电源键+音量减键)截下包含文字的图片。
- OCR识别:
- 苹果手机:进入「照片」App,打开截图,长按文字区域可以直接选中复制(iOS 15以上支持)。
- 安卓手机:很多国产机自带「识屏」或「文字识别」功能,在截图后弹出的工具栏中点「提取文字」即可。
- 通用方法:打开微信,点「发现」→「小程序」,搜索「提词匠」或其他支持图片提取文字的小程序,上传截图即可识别(提词匠主要做音频/视频转文字,但微信内置的图片文字提取功能也可以作为补充)。
- 复制整理:识别后检查一下是否有错别字(尤其是中英文混排的截图),复制到备忘录里。
这种方法只适合提取少量文字,比如一两句台词或弹幕。如果整个视频都需要提取,还是用前面的语音转文字方法更靠谱——毕竟逐帧截图再识别,几十个截图的整理工作比直接转写还累。
常见问题与避坑提醒
Q:B站视频链接为什么有时候解析失败? A:很多在线工具的B站链接解析功能,需要视频是公开的(非付费、非限流)。如果是UP主设置为「仅粉丝可见」或「付费观看」,链接解析可能不成功。这时候可以先缓存或下载视频,再用本地上传模式处理。
Q:口语化视频识别准确率差怎么办? A:带口音、方言或背景噪音的视频,所有工具的识别率都会下降。提词匠在清晰人声场景下准确率较高,但如果遇到录课视频含大量专业术语,建议转写后通读一遍修正——没有哪款工具能做到100%准确。另外,如果视频中有两个以上的人同时说话,很多工具会混乱,尽量选分离度好的方案(如通义听悟的发言人分离功能)。
Q:提取的文字带时间轴,怎么清理?
A:如果你只需要纯文本,导出时选TXT格式会自动去掉时间码;如果只有SRT格式,用文本编辑器的替换功能,把 ^\d+\n[\d:,]+\s-->\s[\d:,]+\n 这类正则表达式替换为空即可(注意备份原文件)。
Q:有没有完全免费的方案? A:剪映的识别字幕、Whisper本地运行、提词匠的基础功能都是免费的。但免费方案通常有使用次数或功能限制(如Whisper需要自己搭建环境、提词匠单次处理一个文件)。根据自己的使用频率选择合适的方案就好。
总结一下我的个人经验:日常碎片化提取(比如每周处理三五个视频),我用提词匠的三步流程最顺手——微信里操作,不用切换App。整理长视频课程笔记时,我会优先用通义听悟,它的发言人分离和笔记整理功能确实方便。如果在外网或离线环境下,Whisper是靠谱的保底方案。B站自带字幕和手机截图OCR则属于应急手段,适合临时救急。各种方法各有适用场景,没有绝对的「最好」,只有「最适合你当下的条件」。