论文:PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
一句话核心结论
现有多模态大模型很难精准实现视频实时主动安全预警,预警准确率偏低,还普遍存在误报问题,也无法真正预判潜在危险。
它到底研究了啥
研究场景
流式视频主动安全预警:在危险出现、事故发生前的窗口期,依托视频内容及时发出安全提醒,覆盖驾驶、医疗、日常生活、工业生产四大领域。
测试对象
13 款主流多模态大语言模型(MLLMs)。
怎么测的
构建全新数据集 PaSBench-Video,包含 740 段视频,其中 481 段含风险、259 段为安全场景;
对风险视频逐帧标注危险起始、事故发生区间,要求模型按视频时序观察,输出时间精准、内容准确的预警;
综合检测准确率、召回率、误报率等指标开展评测。
测出来啥结果
所有模型在严苛评测指标下得分均未超过 20%,整体表现较差;
模型召回率和误报率高度相关(皮尔逊相关系数 0.64),想要提升危险检测能力,就会大幅增加安全场景的误预警;
不同领域表现差异大:日常生活场景表现相对尚可,驾驶场景极易乱报预警;
现有模型仅能识别表层画面特征,无法推理预判逐步显现的潜在危害。
最后结论
当前多模态模型尚不具备成熟的视频主动安全预警能力,核心短板是无法深度推理潜在危险,单纯依靠现有技术难以胜任全天候精准安全监测工作。
