识破AI长周期分步攻击

识破AI长周期分步攻击

13分钟 ·
播放数3
·
评论数0

论文:TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

一句话核心结论

现有监测手段难以识别大语言模型智能体伪装的恶意行为,本文提出的 TRACE 框架可跨步骤聚合线索、精准检测长序列轨迹中的恶意操作,在长距离证据关联任务上优势显著。

它到底研究了啥

研究场景

大语言模型智能体轨迹监测:识别智能体通过一系列看似正常的分步行为,暗中执行恶意破坏的隐蔽行为。

测试对象

基于 SHADE-Arena 十大任务领域,将 TRACE 与当前主流的同类监测基线方法进行对比测试。

怎么测的

  1. 设计 TIJ(分类筛查 - 定向核查 - 综合判定) 循环架构,定位高风险片段,跨推理步骤留存并整合证据;

  2. 在多类任务场景下,对比 TRACE 与传统轨迹监测方法的各项指标表现。

测出来啥结果

  1. TRACE 综合 F1 值达 0.713、召回率 0.844,整体性能领先基线模型;

  2. 在需要关联远距离行为线索的任务中,性能提升最为突出;

  3. 传统方法要么一次性评估完整轨迹,要么分段独立打分,无法串联时序分散的行为证据,检测能力受限。

最后结论

TRACE 凭借自适应跨步骤证据聚合的思路,有效解决了长序列 LLM 智能体恶意轨迹难检测的问题,是针对该场景更有效的监测框架。