会考试,不等于能上岗:Nature Health揭示医疗大模型的“高分陷阱”?医工学人

会考试,不等于能上岗:Nature Health揭示医疗大模型的“高分陷阱”?

10分钟 ·
播放数4
·
评论数0

会考试,不等于能上岗:Nature Health揭示医疗大模型的“高分陷阱”?

医疗大模型在医学考试斩获高分,是否就意味着能够走进真实临床场景?近期发表于《Nature Health》的一项研究抛出关键警示:当下流行的静态基准测试存在显著 “基准鸿沟”,模型考卷上的亮眼成绩,很可能高估其现实可靠性。

现有多数医疗 AI 评估依托固定题库开展测试,易于横向对比,却脱离真实诊疗环境。临床沟通充满模糊表述、干扰信息、动态变化的病情线索,静态试题无法复刻这类复杂场景;同时公开基准还会被纳入模型优化过程,高分或许只是模型适配题型范式,并非形成稳定医学推理能力。

该研究搭建 DAS 动态自动化红队评估框架,从鲁棒性、隐私保护、公平性、事实准确性四大维度对主流大模型开展压力测试。结果显示,静态测试中答对的试题,经合理上下文扰动后,94% 的正确答案出现偏差;模型还易受诱导泄露健康隐私、受认知暗示改变诊疗建议、生成虚假医学信息。

研究并不否定现有医疗大模型进展,但提醒学界谨慎解读 “模型水平赶超医生” 这类结论。静态榜单仅能反映模型潜力,不能等同于临床可用资质。文章呼吁行业转变评估思路,摒弃一次性考试式测评,建立贯穿研发、上线、迭代全周期的动态安全审计。可靠的医疗 AI,应当经得起持续、多样的现实场景挑战。