想把视频里的台词整理成文字,很多人第一反应是逐帧截图再识别。这条路能走通,但必须先解决两件事:截多大一块、以及要截多少张。
整屏截图为什么不划算
字幕在画面里只占很扁的一条。整屏截图的长边通常是够的,问题在于字幕本身只有几十像素高 —— 一行字挤在整幅画面里,每个字分到的笔画信息太少,识别就会漏字或认错。
正确做法是只框选字幕那一条再截,用 Windows 自带的截图工具或手机截图后的编辑功能都可以。框出来之后字幕占满整张图,字高比例大幅提升;但注意另一头:单独截出的字幕条往往尺寸很小,可能反而低于「图片长边不足 1000 像素容易漏识」这条门槛。所以截完要么适度放大到长边 1000 像素以上再传(放大不产生新信息,只是让每个字占够像素),要么把视频窗口开大一点再截。
半透明底和描边会引入噪声
字幕条通常是半透明黑底 + 白字 + 描边阴影。识别只按明暗分界取字,底条边缘、装饰性阴影和画面里被半透明层压住的背景都可能变成无意义的一行。所以:
- 一行一行看结果,删掉画面里本来就有的背景字(店招、路牌、片尾字幕)
- 不要在同一张截图里放两条字幕(比如双语字幕上下叠),两行会被拼成一行
- 有人名条、台标、进度条的截图,先把它们裁掉
成本现实:本站不做视频和音频转文字
要先说清楚:本站没有视频转文字、也没有音频转文字能力,只能对图片识别。一集 45 分钟的剧大约 400 到 600 条字幕,也就是几百页额度,明显不划算。所以:
- 优先找字幕文件。字幕站、平台自带字幕导出、或对方发来的 srt 与 vtt 文件,都是纯文本,直接可用。
- 只截你要的那几句。做摘录、写引用时,几条截图的成本可以忽略。
- 确实需要整片文字,考虑用带语音识别的专业工具,那是另一类产品。
已经有 srt 文件时怎么清理
srt 里混着序号行、时间轴行和空行。把文件拖进TXT 文本处理(它的接受列表包含 srt 与 vtt),用正则查找替换按顺序清:先删时间轴行,再删纯数字的序号行,最后勾选删除空行。工具会显示每轮命中数,命中为 0 说明该模式没写对或者已经清完。全部在浏览器里完成,不上传服务器、不占次数。
整理好的台词稿要做去重、排序或者比对两版字幕,接着用同一页的去重与排序选项,两版差异用文本比较逐行看。
最后提醒:搬运、翻译他人影视作品涉及版权问题,识别出的文本用于个人学习检索通常没问题,公开发布前请自行确认授权。