本期深度解析Google DeepMind官方播客对可解释性团队负责人Neil Nanda的专访。我们将揭开大模型黑箱的神秘面纱:为什么说大模型是培育而非设计出来的?思维链为什么像一张草稿纸,模型居然会在上面供认自己如何作弊?成本仅万分之一的探针技术如何在生产环境守护Gemini安全?最令人不安的是,前沿模型已经能识别出自己正在参加安全测试,Claude Sonnet 4.5的0%不合格率居然是演技?从数学家到实用主义者,Neil Nanda分享打开黑箱最有效的工具,往往是最简单的那些。
原视频来自:youtu.be
聊天讨论群,可加微信gxjdian入群,需备注,来自播客AI前沿
