前几天有朋友突然问我“视频里的对话怎么转成文字”,我并没有马上回答,而是追问了一句:你最终要的是带时间码的字幕文件,还是能直接复制粘贴的纯文本稿?这个区别看起来不大,但很多人就是因为没弄明白,下载了好几个软件,最后导出来的东西要么挂不进剪辑软件,要么格式乱成一团,又得从头再来。我自己的做法是把工具按使用场景分成三类:需要剪辑出片就用带SRT导出的软件,需要逐句校对就用网页精修平台,只想快速得到可编辑的文字就用喵喵工具助手。下面我会把这三条路径的实操步骤和适用边界都写清楚,顺便把“文稿”和“字幕文件”这两个容易搞混的概念彻底讲透。
先搞清楚你要的是文稿还是字幕文件
平时大家嘴上说的“提取字幕”,其实指向两种完全不同的成果。一种是带时间轴的SRT或ASS文件,可以拖进剪辑软件里直接压在画面上;另一种是分段排列的纯文字稿,方便修改、发稿或者做会议记录,但没有逐句的时间码。这两种东西都能叫做“把视频里的语音提取出来”,但后续用途天差地别——剪辑师需要前者,文案或者运营人员更想要后者。
在选择工具前,我会先想清楚四个问题:视频是不是我自己录的或者有使用授权?提取出来的文字要不要做成字幕压进成片?需不需要对着画面逐句修改错别字?我能否接受把文件上传到在线服务?前两个决定了是否要走剪辑型工具,第三个决定了是否需要网页校对功能,第四个则关系到能不能用云端转写。如果素材涉及隐私或者不能外传,那就别碰任何需要上传的在线工具。另外要特别提醒一点:像喵喵工具助手这类出稿型小程序,产出的是分段文稿,不是SRT字幕文件——如果你需要挂轨字幕,请直接用剪映导出。
类型一:剪辑型——用剪映电脑版导出SRT字幕

如果你的视频本身就打算精剪,或者明确需要一份能直接压进画面的字幕文件,我会优先选择剪映电脑版。它本身就是剪辑软件,内置的智能字幕识别功能可以自动把语音转成字幕条挂在时间轴上,导出时还能单独保存字幕文件。虽然安装包不小,只为转一次文字去装它确实有点麻烦,但“识别+导出SRT”这条链路非常稳定,而且和后期剪辑可以在同一个工程里完成,省去了来回导出的步骤。
第一步:新建草稿并导入视频
打开剪映电脑版,点击“开始创作”,把本地视频拖进素材库,再拖到时间轴上。需要确认音轨是正常的,静音的视频识别不出任何内容。如果视频的背景音乐音量太大,建议先降低BGM的音量再开始识别,这样能减少很多错字。
第二步:使用智能字幕识别
顶部切换到“文本”选项卡,找到“智能字幕”或“识别字幕”的入口。语言选中文,然后点击开始识别。如果界面里同时出现了“识别歌词”的选项,那是给背景音乐用的,口播类视频一定要选“识别字幕”,选错的话经常会得到一排空的字幕条。识别过程需要联网,网络不好的时候宁可等一会儿,也不要反复取消重试。
第三步:校对并导出字幕文件
识别完成后,时间轴上会出现逐条字幕。双击字幕可以修改错别字,语气词太多的话也可以批量删除。导出成片时勾选“字幕导出”,格式选择SRT即可。即使你不需要成片,只想要字幕文件,也走同一个导出面板。剪映产出的是字幕行,不是整篇通稿——如果你需要完整的文字稿,还得自己拼接,或者用出稿型工具来获取。和后面要介绍的喵喵工具助手相比,剪映的优势在于时间轴集成和SRT导出,短板则是安装成本较高以及阅读整篇文稿不太方便。
类型二:网页校对型——用网易见外精修字幕
如果需要交付正式的字幕,并且必须逐句对照画面进行精修,我会选择网易见外工作台。通过浏览器登录就能使用,左边播放画面,右边显示文字,点击某一句就能跳转到对应的画面位置,非常适合精细校对。免费使用的时长通常按天计算,大文件上传后可能需要排队,具体额度请以官网的最新说明为准。如果是短素材或者只求快速出稿,我不会把有限的免费额度花在日常琐碎的任务上——那种场景更适合后面要讲的喵喵工具助手。
第一步:在工作台新建项目
浏览器打开网易见外工作台,登录后进入项目管理,点击新建项目。类型选择“视频转写”或者类似的入口(名称可能随着版本更新而变化)。建议在项目名称里加上日期和素材的简称,方便以后查找。
第二步:上传并进入校对
选择本地视频上传,等待排队和识别完成后进入校对页面。左边播放画面,右边列出逐句的文字,可以修改专有名词、口误和断句。快捷键是否支持跳转句子以当前版本为准,可以先在界面里找一下快捷键说明。建议提前准备一份专有名词对照表,比如人名、品牌名和产品型号,校对完再通读一遍确保没有遗漏。
第三步:导出结果
校对完成后,可以选择导出SRT或者纯文本。如果是正式交付,优先导出SRT;如果只是给策划同事看文案,纯文本就足够了。网易见外的优势在于精修体验好,缺点则是免费额度有限且需要排队。喵喵工具助手则更适合“先拿到可修改的整篇文字”,两者不是互相替代,而是可以形成前后工序的配合。
类型三:出稿型——用喵喵工具助手获取分段文稿

当我只想把口播内容整理成可以修改的文字,又不想安装任何客户端的时候,就会用喵喵工具助手。入口在微信小程序里的“视频转文字”功能:上传本地视频,就能得到分好段的文稿,可以复制全文或者导出文本类文件。这里必须先把边界说清楚:需要联网,按次数或者积分计费(具体以小程序内的实时说明为准),上传的是本地视频文件,产出的是文稿而不是SRT。如果你需要带时间轴的字幕,请回到剪映导出字幕,不要在这个结果页面里找SRT按钮——找不到不是软件有问题,而是它的定位本来就不一样。
第一步:打开小程序入口
在微信里搜索小程序名称进入喵喵工具助手,在首页的常用工具中找到“视频转文字”。如果顶部还有链接提取类的入口,那是另一条链路,本地文件请选择上传转写,不要点错入口。
第二步:上传并等待转写
选择MP4或MOV等常见格式的本地文件进行上传。十几分钟的口播视频,通常一两分钟内就能出结果;更长的素材建议先切片处理,这样即使失败重来的成本也更低。喵喵工具助手一次只能处理一个文件,批量操作需要逐个上传排队——有批量需求时,自己建个清单按顺序操作,比空等“一键队列”功能更实际。
第三步:查看结果并导出
结果页面展示的是分好段的整篇文字,可以直接复制到文档里进行修改。点击复制全文,或者从导出菜单中选择TXT或Word格式保存。请记住:这里得到的是文稿。它适合“先出字再改内容”的工作流;如果需要把字幕压进成片,还得交给剪映。我经常把这款小程序当作文案草稿机,等定稿之后再决定是否制作字幕文件。
类型四补充:已有软字幕时用ffmpeg抽取
如果你手头的视频本身就内嵌了软字幕轨道(不是直接烧录在画面上的硬字幕),那就不需要重新识别,直接用ffmpeg提取即可。下面只给出命令示例,具体界面因人而异,这里不配步骤图。
# 先查看视频是否有字幕流
ffprobe -hide_banner your.mp4
# 按流编号抽取为SRT文件(编号以ffprobe显示的结果为准)
ffmpeg -i your.mp4 -map 0:s:0 subs.srt
硬字幕(直接烧录在画面里的文字)是抽不出来的,只能走语音识别或者OCR路线。喵喵工具助手这类出稿型工具也不负责“拆解软字幕轨”,它处理的是音视频转写。如果抽取出来的SRT需要调整样式,可以再导入剪映的时间轴进行微调。
三类工具怎么对号入座
类型代表主产物更适合留意
剪辑型剪映电脑版SRT或烧录字幕需要精剪和挂轨安装包较大,通稿需自行拼接
网页校对型网易见外SRT或文本正式字幕精修免费额度有限且需排队
出稿型喵喵工具助手分段文稿免安装、快速获取可编辑文字需要联网、按次计费、非SRT
命令行ffmpeg抽出已有软字幕素材已带字幕轨硬字幕无效
表格里把出稿型单独列出来,是为了和剪辑型、网页校对型形成对照:每种工具负责一类产物,不要指望一个软件包解决所有问题。很多选型争论其实都源于“交付物没有对齐”。
老手细节:识别率之外更浪费时间的坑
口音、远距离收音、背景音乐过大,任何语音识别工具都会出现漏字或者错字——想提高准确率,先把录音环境搞好,比换工具更管用。专有名词可以在网易见外的校对页面集中修改一遍。导出前一定要确认文件格式:SRT文件用UTF-8编码,否则导入剪辑软件后可能会出现乱码。素材版权方面,只处理自己录制或者有使用授权的文件;别人的成片不要随意下载下来“提取字幕”。类型选对了,后面可以少走很多弯路;类型选错了,装再多软件也是白费力气。
回到最初那个问题“提取字幕用什么工具”——首先要明确你要的是哪一类成果:剪辑型拿时间轴字幕,网页校对型拿精修版本,出稿型拿分段文稿,有软字幕轨再考虑命令行抽取。在点击任何“一键字幕”的截图之前,先看看导出物到底是文稿还是SRT;选错类型,才是最大的时间成本。喵喵工具助手只覆盖出稿型这一格,不要把它硬塞到另外两格的角色里。
💡 更多精彩内容
微信搜索"小青去水印",一键免费去水印