顶级AI预警成功率不足两成

顶级AI预警成功率不足两成

12分钟 ·
播放数12
·
评论数0

论文:PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

一句话核心结论

现有多模态大模型很难精准实现视频实时主动安全预警,预警准确率偏低,还普遍存在误报问题,也无法真正预判潜在危险。

它到底研究了啥

研究场景

流式视频主动安全预警:在危险出现、事故发生前的窗口期,依托视频内容及时发出安全提醒,覆盖驾驶、医疗、日常生活、工业生产四大领域。

测试对象

13 款主流多模态大语言模型(MLLMs)。

怎么测的

  1. 构建全新数据集 PaSBench-Video,包含 740 段视频,其中 481 段含风险、259 段为安全场景;

  2. 对风险视频逐帧标注危险起始、事故发生区间,要求模型按视频时序观察,输出时间精准、内容准确的预警;

  3. 综合检测准确率、召回率、误报率等指标开展评测。

测出来啥结果

  1. 所有模型在严苛评测指标下得分均未超过 20%,整体表现较差;

  2. 模型召回率和误报率高度相关(皮尔逊相关系数 0.64),想要提升危险检测能力,就会大幅增加安全场景的误预警;

  3. 不同领域表现差异大:日常生活场景表现相对尚可,驾驶场景极易乱报预警;

  4. 现有模型仅能识别表层画面特征,无法推理预判逐步显现的潜在危害。

最后结论

当前多模态模型尚不具备成熟的视频主动安全预警能力,核心短板是无法深度推理潜在危险,单纯依靠现有技术难以胜任全天候精准安全监测工作。