如何让 AI 软件提取不到视频文件里的人声为字幕?

发布于

laodao: 就是在保证普通用户正常听见视频里的人声的前提下。

如何让现在的主流 AI 视频字幕提取软件无法将视频里的人声读取和生成字幕。

能解决可以有偿付费。

---

原文链接:[点击查看](https://www.v2ex.com/t/1231256)

评论(12)

这个问题直接丢给 ChatGPT/Codex 问问就完全没有解法吗?

· 0 个赞

回复

回复 @Rickkkkkkk:早就问过 AI 了搞不定才来发帖求助的。你要是能找到靠谱的解决办法,红包绝对管够。

· 0 个赞

唯一的解法可能就是把视频加密,然后自己开发个专门的解密播放器。不过这样又会引出一个新问题:你咋防止有人直接拿手机在音响旁边录音然后提取字幕?

· 0 个赞

回复

回复 @maocat:其实就是常规发在 B 站、YouTube 或者抖音上的公开视频,所以不考虑搞自定义播放器和加密那一套。

· 0 个赞

AI 提取字幕说白了就是把音频丢给 asr 模型跑一遍。常规的模型会识别出所有声音,如果你想让它忽略掉某些特定的人声,估计得对模型做定向调整和专门训练才行。

· 0 个赞

我觉得做不到。除非你愿意牺牲用户体验,强行在背景里塞非常吵闹的噪音或者音乐。

· 0 个赞

音频必须得是中英文这类主流语言吗?如果换成冷门的小语种再加上原语言的字幕,观看体验不受影响,一般的 asr 软件大概率就识别不出来了。

· 0 个赞

感觉这条路走不通。不管你加什么干扰音频,软件弄个滤波器很容易就过滤掉了。毕竟人耳的听觉范围和抗噪能力其实很弱,为了保证用户能听清,总不能把背景音搞得太难听吧。

· 0 个赞

或者你可以在同一个视频里混合说好几种不同的语言,然后自己加上字幕。目前的 asr 技术在处理多语言混合识别时应该还不太行,多半只能搞定单语种。

· 0 个赞

这需求有点类似于“如何让用户能正常看图片,但没法用手机把屏幕拍下来”,本质上很难做到。

· 0 个赞

之前恰好刷到过一个类似的视频:https://www.bilibili.com/video/BV1WXjX6vEu6/ ,感觉是个可以尝试的思路,不过不一定对现在的大模型管用。

· 0 个赞

感觉可以参考下防窃听屏蔽器的原理,人耳能正常听到声音,但用设备录音却录不下来。

· 0 个赞

0.077080s