laodao
V2EX  ›  问与答

如何让 ai 软件提取不到视频文件里的人声为字幕?

  •  
  •   laodao · Jul 31 · 1019 views
    就是在保证普通用户正常听见视频里的人声的前提下。
    如何让现在的主流 ai 视频字幕提取软件无法将视频里的人声读取和生成字幕。
    能解决可以有偿付费。
    18 replies    2026-07-31 23:34:06 +08:00
    Rickkkkkkk
        1
    Rickkkkkkk  
       Jul 31
    这个问题你直接问 codex 无解吗?
    laodao
        2
    laodao  
    OP
       Jul 31
    @Rickkkkkkk 问了,不行才提问的,你可以问问,谁能给出好的解决方案,我可以给的大红包。
    maocat
        3
    maocat  
       Jul 31
    源视频加密,自己开发视频解密播放器
    然后你得问题变为:
    如何防止用户用手机在音响旁边进行录音提取字幕
    laodao
        4
    laodao  
    OP
       Jul 31
    @maocat 就是常规可以上传抖音,哔站或者 youtube 的视频,不考虑加密
    mofish
        5
    mofish  
       Jul 31
    AI 字幕的原理是用音频跑一遍 asr ,正常的 asr 识别会识别所有的声音内容,要忽略背景人声或者这种主讲副讲人声,需要对模型进行定向增强
    jackOff
        6
    jackOff  
       Jul 31
    做不到,除非牺牲用户体验,搞极其吵人的背景音乐
    qczone
        7
    qczone  
       Jul 31
    视频的人声必须是中/英这种常见的语言吗?如果不是可以换成小语种的音频 + 正确语言的字幕,这样不影响观看体验,普通的 asr 不一定能正确识别
    loading
        8
    loading  
       Jul 31 via Android
    应该是无法实现,你做再多干扰,一个滤过器就给你过滤了,不是说滤波器有多强,是人耳实在太弱了,你为人能听,总不能太恶心吧。
    jackOff
        9
    jackOff  
       Jul 31
    或者你一个视频里使用多门语言,在字幕里加上此时的语言是啥,目前 asr 技术识别语言可能都只擅长单语言
    justfindu
        10
    justfindu  
       Jul 31
    这就跟能够让用户查看图片情况下不让他用相机拍下来?
    Puteulanus
        11
    Puteulanus  
       Jul 31
    https://www.bilibili.com/video/BV1WXjX6vEu6/

    之前刷到的,是个思路,不一定对大模型有用
    firefox12
        12
    firefox12  
       Jul 31
    窃听屏蔽器的原理吧, 可以听到 但是录音录不下来
    gaogao321
        13
    gaogao321  
       Jul 31
    @firefox12 有道理啊,发射人类耳朵听不到、但对麦克风传感器具有破坏性的高频超声波,使附近的手机、录音笔等设备录下的音频变成一片无法还原的“嗡嗡”杂音。
    Greenm
        14
    Greenm  
       Jul 31
    反过来应该挺好做的,AI 可以分析人耳不能听到。
    laodao
        15
    laodao  
    OP
       Jul 31
    @gaogao321 对的,核心就是要这种实现方式。就是加入特定波干扰 asr 的识别,但是对正常人来说又没区别。
    laodao
        16
    laodao  
    OP
       Jul 31
    @Puteulanus 感谢,确实是这个思路
    TimePPT
        17
    TimePPT  
       23h 5m ago
    @laodao 这个思路只能解决唤醒词误触发,因为那个在端侧的。现在云端模型没那么傻。
    laodao
        18
    laodao  
    OP
       21h 33m ago
    @TimePPT 我已经找到多篇相关论文,核心原理和这个差不多,更系统的解决这个问题。云端模型可能比这个还傻,比如 openai 的语音模型只要识别到特定音频波暗号,就直接结束识别,后面的内容就不识别了。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2736 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 1797ms · UTC 13:07 · PVG 21:07 · LAX 06:07 · JFK 09:07
    ♥ Do have faith in what you're doing.