Anthropic 最近发布了一项关于 Claude 模型"价值观"的研究:同一个 AI,换一个模型版本,或者换一种语言跟它聊天,回答里透露出的价值倾向会有多大差别?
研究者没有去抽象地讨论"AI 该有什么价值观",而是扎进了 30 多万段 Claude.ai 上的真实对话里。他们先把 Claude 回答中出现的 3000 多种价值表达做了系统梳理,然后像做性格测试一样,把这些庞杂的信号压缩成了四条核心坐标轴。第一条是"顺从 vs 谨慎"——是顺着用户走,还是主动踩刹车提醒风险;第二条是"温暖 vs 严谨"——是多一点人情味和安慰,还是更像个爱挑刺的校对员;第三条是"深度 vs 简洁"——是展开讲透,还是只答你问的;第四条是"坦诚 vs 执行"——是主动承认自己哪里可能搞错,还是直接给你一个能用的答案。
拿这四把尺子量下去,模型之间的"性格差异"就很清楚了。Sonnet 4.6 更像一个热情配合、反应快、愿意帮你把事办完的搭档;Opus 4.7 则截然不同——更谨慎、更严谨、更愿意深挖,也更愿意承认不确定性。而真正让人意外的是语言带来的差异:用阿拉伯语或印地语提问时,Claude 明显更暖、更会肯定人、更有幽默感;换成英语或俄语,它就变得严肃较真,更爱挑战你的假设和纠正细节。荷兰语下的 Claude 更坦诚认错,印尼语下的 Claude 则更偏向直接推进、给出结果。
这些差异从哪来?是训练数据不均衡,还是语言本身的表达习惯不同,还是文化期待在起作用?Anthropic 没有急于下结论。他们认为,关键不是把所有语言调成一模一样,而是搞清楚:哪些价值底线必须全球一致,哪些差异可以、甚至应该保留——以及这些微妙的"性格"差异,会不会悄悄影响用户的信任感、决策质量和使用体验。
原文链接:www.anthropic.com
