首页
看点啥
插画图片
首页 电脑数码 韩国世宗大学与NAVER Cloud揭示高分背后的惊天秘密

韩国世宗大学与NAVER Cloud揭示高分背后的惊天秘密

2026-07-22 0


这项由韩国世宗大学与NAVER Cloud联合开展的研究,以预印本论文形式发布于2026年7月,论文编号为arXiv:2603.29616,有兴趣深入了解的读者可通过该编号查询完整原文。

假设你正在评估一个声称能"读懂视频"的AI系统,它在各种测试中连连拿高分,表现得像是真正理解了视频里发生的事情。但如果告诉你,那些"高分题目"里有一大半根本不需要看视频就能答对——只需要靠猜测、靠听声音、或者靠看一张静止图片——你还会相信这个AI真的看懂视频了吗?

这正是这项研究的出发点。研究团队没有选择"再做一个新的测试集"这条路,而是做了一件更有意思的事:他们像一个侦探一样,把现有的14套视频AI测试卷逐一翻出来仔细审查,结果发现了令人惊讶的规律——超过一半的题目存在"捷径",AI完全可以绕过真正的视频理解来答题。研究团队将这套审查工具命名为"Video-Oasis",并用它对当前视频AI领域的评估体系做了一次彻底的体检。

一、视频测试卷里藏着哪些"作弊通道"

要理解这个问题,先用一个考试的比喻来打底。假设你出了一道历史题:"1971年,IBM推出了哪款打字机?"本来想考学生的历史知识,但如果考卷旁边恰好放了一段介绍IBM打字机的视频,视频里的旁白直接说出了答案,那这道题考的根本不是历史理解,而是"有没有开着音量"。

视频AI的测试卷里,类似的问题比比皆是。研究团队归纳出了四条主要的"捷径通道"。

第一条是"语言猜测"。有些题目问的是"键盘旁边哪个物体最近?"选项是碗、灯、砧板、鼠标——即便不看视频,靠常识也很容易猜到答案是鼠标,因为鼠标是最常和键盘放在一起的东西。AI不需要真正理解任何视频画面,只需要调动语言模型里存储的"常识"就能答对。

第二条是"音频替代"。有些视频里的旁白或对话直接包含了答案。比如问"某款打字机首次发布是哪年?"视频音轨里恰好有人说"这款机器于1971年首次亮相",AI只需要把音频转成文字再找答案,压根不需要理解任何画面。

第三条是"单帧够用"。有些题目只要截取视频中间的一帧静止图片,就足以回答。比如"画面里天气怎么样"——晴天、雨天一眼就能从一张图里看出来,根本不需要看整段视频的动态变化。

第四条是"静态场景"。有些视频内容本身就是一个静止的场景,几乎没有任何时间上的变化,比如对着一个固定的房间场景问"壁炉在楼梯的哪个方向"——这道题在任何一帧都能答,完全不需要时间维度的理解。

研究团队把能通过以上任何一条捷径答对的题目,统称为"捷径题"。接下来的问题是:现有的测试卷里到底有多少这样的捷径题?

二、一次横跨14套测试卷的大审查

为了系统地找出捷径题,研究团队设计了一套名为Video-Oasis的诊断工具,它包含三类检查方式,就像医院体检时会分别检查血液、影像和体能一样,每类检查负责揭示不同类型的问题。

第一类是"视觉依赖检测"。研究团队让AI在三种刻意削弱视觉信息的条件下作答:完全不给任何视频或提示,只给问题和选项(也就是"盲猜模式");把视频的音轨转成文字再交给AI;把视频按固定间隔截成若干帧,为每帧生成文字说明,然后把这些说明拼在一起代替视频。如果AI在任意一种条件下仍然能答对,就说明这道题不需要真正的视觉感知。

第二类是"时间依赖检测"。视频和图片最大的区别在于时间维度——视频是动态的、有先后顺序的。研究团队用三种方式破坏视频的时间结构:只给视频正中间的那一帧;把所有帧的顺序随机打乱;用一个完全不理解时间顺序的图像匹配系统(基于CLIP模型)去找和问题最相关的几帧来作答。如果AI在任意一种时间被破坏的条件下仍然能答对,就说明这道题不需要理解时间顺序。

第三类是"注释质量核查"。因为视频数据量大、内容复杂,很多测试卷在标注答案时本身就可能出错或者不够清晰。研究团队设计了三个检查:一致性检查(让五个不同的AI模型来回答,如果五个模型给出五个不同的答案,说明这道题本身就有歧义);冗余检查(把视频分成八段,如果每一段都能答对,说明这道题不依赖特定时间段的内容,标注可能有问题);敏感性人工核查(对那些"打乱帧顺序后仍答对"的题目,再由人工判断是否真的不需要时间顺序)。

为了确保诊断结论的可靠性,整个审查流程融入了多模型共识机制——只有当多个AI模型都能在削弱条件下答对时,这道题才被认定为捷径题,并额外配有人工复核环节,防止误判。

审查的最终结果令人震惊。在横跨14套视频理解测试卷、总计24416道题的大规模审查中,研究团队发现平均55%的题目是捷径题,也就是说一多半的题不需要真正理解视频就能答对。在放宽认定标准(只要有一个AI模型能绕路答对就算捷径)时,这个比例更是高达92.7%。

更有意思的是,研究团队还发现了一个规律:一套测试卷里捷径题越多,那套测试卷上的得分就越高。换句话说,AI得高分,很可能只是因为"捷径题多",而不是因为它真的看懂了视频。这就像考试成绩好,并不一定是学生真的掌握了知识,而可能是出题人不小心出了太多送分题。

三、去掉捷径之后,AI的真实水平如何

去掉了那55%的捷径题之后,剩下的11033道题组成了Video-Oasis筛选出的"真正挑战集"。这些题涵盖了4938段独特视频,从几秒钟的短片到超过十分钟的长视频都有,而且都经过了严格的多重验证,确实需要对视频画面和时间顺序有深入理解才能作答。

研究团队把这些真正的挑战分成了五个类别,每个类别代表一种视频理解的核心能力。

第一类是细粒度感知,考察AI能否在时间和空间维度上识别细微的视觉变化,比如跟踪一个物体在多个角度下的外观,或者辨认视觉上相似但有细微差别的场景。第二类是空间世界理解,考察AI能否从多个视角合成出对三维空间的认知,比如推断物体之间的相对位置和几何关系。第三类是时间动态与追踪,考察AI能否追踪物体随时间的运动、识别动作序列、理解状态转变,这正是视频理解区别于图片理解的核心所在。第四类是因果与逻辑推理,考察AI能否推断出不直接出现在画面里的隐含原因和意图,比如从一系列事件中推断为什么某件事会发生。第五类是全局叙事理解,考察AI能否把散布在整段视频各处的片段信息整合起来,理解跨越较长时间跨度的故事走向。

接下来,研究团队用这套真正的挑战集,对目前市面上最顶尖的AI系统展开了全面测评。结果又一次令人大开眼界。

在标准4选1的题目里,随机猜测的正确率约为25.6%。测试结果显示,大部分开源视频AI模型的得分只比随机猜测略高一点点,比如Qwen2.5-VL拿到29.2分,Video-R1拿到26.3分,LongViLA-R1拿到28.6分——和蒙着眼睛乱猜几乎没有本质区别。就连来自谷歌、普遍被认为是当前最强大的多模态AI系统Gemini-2.5-Pro,总分也只有46.7分,距离满分还差得很远。在全局叙事理解这个最难的类别上,几乎所有模型都跌到了20%出头,某些模型甚至不如随机猜测。

这个结果非常直白地说明了一件事:当前的视频AI系统,在面对真正需要理解时间和空间的视频问题时,基本上还处于"懵逼"状态。那些在原有测试集上看起来很漂亮的高分,有相当大的水分。

四、什么样的设计能让AI看得更准

既然找到了问题,研究团队也顺势做了一系列实验,探索哪些技术设计能让AI在这些真正的挑战上表现得更好,结论颇为实用。

第一个实验探讨的是"精准定位"的价值。在回答视频问题时,如果AI能精准地找到视频中与问题最相关的片段,而不是机械地扫描整段视频,是否会有帮助?研究团队引入了一种叫做AKS(自适应关键帧采样)的方法,让AI先根据问题挑选出最相关的16帧再作答。结果显示,加入这个精准定位步骤后,AI的总体表现确实有所提升,Eagle2.5从31.5%升至32.9%,Qwen3-VL从27.8%升至30.1%。但提升的幅度并不大。

为了搞清楚这点提升是不是已经到了天花板,研究团队进行了一个"上限实验":给AI直接提供视频中包含答案的确切时间段(也就是人工打了时间标记的那部分),看看在完美定位的情况下AI能达到多高的分数。结果非常明显——在真正挑战集上,完美定位让Eagle2.5的得分从35%大幅跳升到50.8%;而在捷径题上,同样的完美定位带来的提升却很小,从78%只升到80.8%。这证明了一个重要结论:精准的时间定位对于真正需要视频理解的问题来说至关重要,但对于捷径题意义不大,因为那些题本来就不需要找特定的时间段。换句话说,捷径题"随便定位也能对",但真正的挑战题"差一秒都可能答错"。

第二个实验探讨的是"思考深度的灵活性"。当前一些顶尖AI模型具有两种工作模式:一种是快速回答模式,直接给出答案;另一种是深度思考模式,会先在内部进行大量的推理再给出答案。研究团队对比了Qwen3-VL在快速模式(33.8分)、深度思考模式(34.6分)以及一种自适应切换模式VideoAuto-R1(36.8分)下的表现。

自适应切换模式的意思是:AI会根据问题的难度自己决定"要不要深入思考",而不是对所有问题都用同一深度的思考。结果显示,这种灵活切换的方式比固定用深度思考的方式表现更好,说明并不是"越深入思考就越好",而是要"用对地方"。

更有趣的是,研究团队做了一个理想化实验:如果AI每道题都能在"快速模式"和"深度思考模式"之中选择更好的那个答案,得分会是多少?答案是46.2分,几乎和当前最强的Gemini-2.5-Pro(46.7分)持平。这意味着,仅仅通过更聪明地决定"什么时候该认真想想,什么时候直接回答",一个8B参数的小模型就能比肩目前最顶级的商业闭源大模型——这一发现揭示了一个巨大的优化空间,而且这个优化不需要更大的模型,只需要更聪明的"思考策略"。

第三个实验比较了两种主流训练方式的优劣。一种是"监督微调",也就是给AI喂大量标准答案让它学习,这就像传统的填鸭式教育;另一种是"强化学习",让AI通过不断尝试和获得反馈来自我改进,更像是通过实战练习来提高。以Qwen2.5-VL为基础模型,监督微调训练出的Eagle2.5拿到了34.5分,而只用基本问答奖励训练的Video-R1只拿到26.3分,甚至比未经训练的基础模型(29.2分)还要差。这说明强化学习的效果好不好,关键取决于奖励机制怎么设计。而加入了"时间定位"专项奖励的VideoAuto-R1达到了32.7分,介于两者之间,同时在全局叙事理解这个最难的维度上表现特别突出,从21.2%大幅提升到28.6%。

这组对比揭示了一个微妙但重要的结论:监督微调和强化学习并不是非此即彼的竞争关系,而是各有擅长的互补关系。精心设计的长上下文监督微调能显著提升整体的时空推理能力,而带有定位奖励的强化学习则对提升需要整合长段视频信息的全局叙事理解特别有效。

五、这套工具本身是否可靠

面对一套新的诊断工具,自然会有一个合理的疑问:Video-Oasis判定的"捷径题",真的是AI能绕过视频理解来答的题吗?还是说,它错误地把一些"恰好比较简单但仍需视觉理解"的题归入了捷径?

研究团队对此进行了专门的验证。他们用和诊断时不同的AI模型(InternVL-3.5、LongViLA-R1、STAR)对被判定为捷径的题目进行标准模式下的重新测试,发现这些题目的平均正确率高达76%,远高于随机猜测的25.6%。这说明捷径题确实是AI用正常方式也很容易答对的题,Video-Oasis的判断是有效的。

此外,研究团队还验证了Video-Oasis筛出的真正挑战集是否仅仅是"难题集"。他们找出了让三个顶尖模型全部答错的题目(共6609道),和Video-Oasis筛出的挑战集做对比,发现两者只有44.6%的重叠。这意味着Video-Oasis并不只是在挑"难题",而是在用视觉依赖性和时间依赖性这两个专属于视频理解的维度来筛选,这和单纯的"难度筛选"是不同的标准,也更有针对性。

为了保证诊断结果不依赖于特定模型的偏好,研究团队还用多种不同的模型组合重复了整个诊断过程,发现不同模型组合得出的捷径集重叠度均超过87%,说明Video-Oasis的判断结论具有较强的稳健性,不因选用哪几个模型而发生根本性变化。

六、审查过程中还发现了什么意外收获

在整个审查过程中,研究团队的人工核查环节发现了一些有趣的边界案例,值得单独说一说。

有一类案例是"被错误筛出的时间题"。某些题目在打乱帧顺序后AI仍然答对,按照自动化的诊断逻辑这应该算捷径题,但人工审查后发现这些题其实需要时间顺序,比如"棒球裁判投出第二球之后做了什么"——"第二球之后"这个时序关系显然要求视频是按顺序播放的,AI答对可能只是碰巧,并不代表这题不需要时间理解。这类题被人工从捷径集中移回了挑战集。

另一类案例是真正的标注错误。比如有道题问"视频中'person fixes their hair'这个动作发生在什么时候",标注的答案是"贯穿整段视频",但实际上这个动作只出现在视频中段。还有些题目里用到了"棕色头发的男人"这个指代,但画面里实际上有多个棕色头发的男人,根本无法确定是哪一个——这类歧义导致这道题从任何角度都无法可靠地给出正确答案,属于标注质量问题。这些案例被彻底从测试集中剔除,避免污染评估结果。

这些发现说明,视频数据的复杂性使得标注工作本身就比图片或文本标注难得多,当前许多测试集在标注质量上存在不可忽视的隐患,而Video-Oasis的人工核查环节正是专门用来捕捉这类问题的。

说到底,这项研究的核心贡献并不是提出了一个更难的视频测试题库,而是提供了一面照妖镜,专门用来照出"视频AI是否真的理解视频"这个问题的真实答案。过去我们以为AI在视频测试上拿到高分意味着它真的学会了看视频,但这面镜子告诉我们:高分背后很可能藏着大量可以绕路走的捷径,真正需要理解时间和空间的问题,当前最好的AI系统也只比瞎猜强一点点。

这对普通用户意味着什么?如果你正在考虑使用某个视频理解AI工具,光看它在基准测试上的得分是不够的,因为那些分数可能被虚高了。Video-Oasis这套工具是完全开源的,任何人都可以拿来检验自己感兴趣的AI系统在去掉捷径之后的真实水平。

对整个AI研究领域而言,这项研究指出了一个清晰的努力方向:下一代视频AI需要真正掌握时间信息,能精准定位视频中与问题相关的关键片段,还要学会根据问题难度灵活调整自己的思考深度。强化学习的奖励机制设计和长上下文监督训练的结合,则是目前最有潜力的技术路径。

如果这些问题让你对视频AI的现状和未来产生了兴趣,不妨思考这样一个问题:在你日常生活中使用过的视频相关AI功能里,哪些可能只是"看起来很懂视频",哪些才是真正在理解视频内容?这个问题的答案,可能比你预想的更复杂。感兴趣的读者可以通过arXiv:2603.29616查阅完整原文,深入了解研究团队的所有实验细节和数据。

Q&A

Q1:Video-Oasis是用来做什么的?

A:Video-Oasis是由韩国世宗大学与NAVER Cloud开发的一套视频AI评估诊断工具,专门用来检测现有视频理解测试集里是否存在"捷径题",也就是那些不需要真正理解视频就能答对的题目。通过三类检查(视觉依赖、时间依赖、注释质量),它能把测试集里的"注水题"过滤掉,只保留真正需要视频理解能力才能作答的题目。

Q2:为什么视频AI在基准测试上得高分,但实际能力却很有限?

A:因为现有的视频测试集里大约有55%的题目存在捷径,AI可以靠常识猜测、音频内容或静止图片来答对这些题,根本不需要理解视频的时间动态。这导致测试分数虚高,掩盖了AI在真正时空理解上的短板。Video-Oasis去掉这些捷径题后,连最强的Gemini-2.5-Pro总分也只有46.7分,大多数开源模型只比随机猜测略高。

Q3:什么样的训练方式能提升视频AI的真正理解能力?

A:研究发现监督微调和强化学习各有优势,结合使用效果更好。加入时间定位专项奖励的强化学习对提升全局叙事理解特别有效,而精心设计的长上下文监督微调能提升整体时空推理表现。此外,让AI灵活决定"什么时候深入思考"比固定使用深度思考模式效果更好,这一策略让小模型的得分接近顶级商业大模型的水平。

喜欢(0)

上一篇

20.98万元起:吉利银河TT Ultra开启全球预售

20.98万元起:吉利银河TT Ultra开启全球预售

下一篇

2030年我国IPv6活跃用户数预期达9.5亿

2030年我国IPv6活跃用户数预期达9.5亿
猜你喜欢