文本逻辑正在传染AI视觉

文本逻辑正在传染AI视觉

18分钟 ·
播放数5
·
评论数0

Multimodal Evaluator Preference Collapse: Cross-Modal Contagion in Self-Evolving Agents

一句话核心结论

多模态闭环自迭代 AI 智能体中会出现评估偏好坍缩(EPC),跨模型评测会大幅放大该偏差,还存在跨模态传染现象:一种模态的评估偏好会污染另一模态的策略选择;同模型自评估几乎能完全规避该问题,跨模型评测是偏好漂移的核心风险来源。

它到底研究了啥

  1. 把仅文本场景存在的评估偏好坍缩(EPC)拓展到多模态文本 + 视觉闭环评测场景;

  2. 验证跨模型评测是否会加剧偏好坍缩、坍缩强度是否随模态变化;

  3. 首次提出并量化跨模态传染:模态间评估偏好互相渗透、扭曲最优推理策略;

  4. 对比 5 种不同评测模型配置,区分自评测 / 跨模型评测 / 高迭代轮次三种场景下传染强弱,给出量化指标与开源实验框架 MM-EPC。

研究场景

闭环自进化 AI 智能体测试时强化学习(TTRL)迭代:

  • 双模态任务:文本任务、视觉类任务(文本代理描述 + 真实图片两种输入);

  • 策略池:共 11 种推理策略(8 个文本专用策略、3 个视觉专用策略);

  • 迭代目标:智能体依据评测模型打分,动态调整不同推理策略的使用权重。

测试对象

  1. 执行模型:DeepSeek-chat(全程生成输出);

  2. 5 类评测模型(对比实验):GPT-4o、GPT-4o-mini Vision、Qwen3.7-plus、DashScope gui-plus、DeepSeek-chat(自评测);

  3. 实验规模:总计 80 组独立重复实验,约 35000 次大模型 API 调用。

怎么测的

  1. 四阶段隔离训练范式(量化跨模态传染系数 γ):

    • 阶段 1:仅文本训练,得到纯文本最优策略分布;

    • 阶段 2:仅视觉训练,得到纯视觉最优策略分布;

    • 阶段 3:用文本训练后的权重初始化,在视觉任务迭代,测算文本→视觉传染 γ_T→V;

    • 阶段 4:用视觉训练后的权重初始化,在文本任务迭代,测算视觉→文本传染 γ_V→T;

  2. 设计量化指标:

    • PCI 偏好坍缩指数:数值越高代表权重高度集中在单一策略;

    • 传染系数 γ:衡量模态间偏好污染程度,γ>0.5 代表显著传染;

    • 传染矩阵 Γ:标准化存储不同模态间传染强度;

  3. 多控制变量消融实验:区分评测模型种类、迭代轮次、真实图片 / 文本代理视觉输入,排除实验结构带来的伪效应。

测出来啥结果

一、多模态偏好坍缩 MM-EPC 现象

  1. 跨模型评测坍缩强度极强:GPT-4o 评测 DeepSeek 时 PCI=1.464,是同模型自评测(0.461)的 3.2 倍、随机评测基线(0.716)的 2 倍;视觉任务坍缩程度高于文本任务。

  2. 策略严重失衡:通用分步推理 step_by_step 独占 48.4% 权重,3 个视觉专属策略权重加总仅 9.1%,智能体主动放弃适配视觉的专用推理方式。

  3. 真值基准 PCI 仅 0.251,说明绝大多数策略权重倾斜来自评测模型主观偏好,而非任务真实效果。

二、跨模态传染核心规律

  1. 策略反转现象:纯文本训练最优策略是综合推理 synthesis,纯视觉最优是分步推理 step_by_step;经过跨模态训练后,两类模态最优策略完全互换。

  2. 传染强度分层(风险从高到低):

    • 跨模型评测(GPT-4o/Qwen):双向强对称传染,γ 均值 1.0–1.2,无统计显著单向偏向;真实图片视觉输入传染效应更强;

    • 跨模型 + 高迭代轮次(DashScope,50 轮):70% 实验完全无传染,模型坍缩至单一策略,阻断模态间偏好传递;

    • 同模型自评测(DeepSeek 自评):97% 实验传染系数为 0,几乎完全免疫跨模态污染。

  3. 传染具有路径依赖:先训练哪种模态,该模态偏好就会长期污染另一模态策略选择。

三、评测模型固有缺陷

  1. 跨模型评测缺少 “自偏好平衡机制”,会无保留输出自身 RLHF 训练偏好(偏爱分步输出);

  2. 视觉任务主观程度更高,更容易放大评测模型的偏见;

  3. 评测模型无法有效判别视觉专用策略价值,会系统性压低视觉策略权重。

最后结论

  1. 多模态闭环迭代智能体存在严重评估偏好坍缩,跨模型评测会显著加剧偏差,导致智能体放弃模态适配策略、无脑使用通用分步推理;

  2. 跨模态传染是真实存在的新型偏差,会颠倒不同模态最优推理策略,且强弱完全取决于评测模型架构;

  3. 工程落地最优方案:优先采用同模型自评测规避传染;若必须跨模型评测,控制迭代轮次在 30 轮左右、使用多评测模型集成、分模态隔离训练;

  4. 开源 MM-EPC 完整实验框架与传染矩阵量化工具,可用于检测各类 AI 迭代系统的偏好坍缩与跨模态污染风险。