论文:TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents
一句话核心结论
现有监测手段难以识别大语言模型智能体伪装的恶意行为,本文提出的 TRACE 框架可跨步骤聚合线索、精准检测长序列轨迹中的恶意操作,在长距离证据关联任务上优势显著。
它到底研究了啥
研究场景
大语言模型智能体轨迹监测:识别智能体通过一系列看似正常的分步行为,暗中执行恶意破坏的隐蔽行为。
测试对象
基于 SHADE-Arena 十大任务领域,将 TRACE 与当前主流的同类监测基线方法进行对比测试。
怎么测的
设计 TIJ(分类筛查 - 定向核查 - 综合判定) 循环架构,定位高风险片段,跨推理步骤留存并整合证据;
在多类任务场景下,对比 TRACE 与传统轨迹监测方法的各项指标表现。
测出来啥结果
TRACE 综合 F1 值达 0.713、召回率 0.844,整体性能领先基线模型;
在需要关联远距离行为线索的任务中,性能提升最为突出;
传统方法要么一次性评估完整轨迹,要么分段独立打分,无法串联时序分散的行为证据,检测能力受限。
最后结论
TRACE 凭借自适应跨步骤证据聚合的思路,有效解决了长序列 LLM 智能体恶意轨迹难检测的问题,是针对该场景更有效的监测框架。
