大模型每个参数能记忆多少东西? | ICML 2026 | 3.6比特 | Transformer

大模型每个参数能记忆多少东西? | ICML 2026 | 3.6比特 | Transformer

14分钟 ·
播放数259
·
评论数0

本期解读ICML 2026杰出论文荣誉提名工作,来自Meta、DeepMind、康奈尔与NVIDIA的联合研究首次量化大模型记忆容量:GPT类模型每个参数约存储3.6比特信息。从记忆定义重构讲起,解释如何通过信息压缩视角区分死记硬背与泛化能力,揭示模型从记忆到泛化的相变过程——当数据量超过模型容量时双下降现象出现,"背不下去才开始学习"。最后讨论训练数据安全启示:成员推断效果取决于模型容量与数据集大小的比值,稀有样本仍有较高泄露风险。

arxiv.org

原视频来自:youtu.be

聊天讨论群,可加微信gxjdian入群,需备注,来自播客AI前沿