[人人能懂AI前沿] AI的“人性”弱点:当它学会偷懒、后悔与走捷径

[人人能懂AI前沿] AI的“人性”弱点:当它学会偷懒、后悔与走捷径

29分钟 ·
播放数147
·
评论数0

你有没有想过,AI也会“偷懒和稀泥”,甚至在“不后悔”这件事上比我们做得更好?这一期,我们将一起揭开AI的“隐秘角落”,看看最新论文是如何让AI从一个只会算“相似度”的感觉派,变成一个懂得回溯证据链的逻辑派,并揪出它背后那个爱走捷径的“品味导师”的。

00:00:23 AI的学习悖论,从拼图到填词游戏

00:05:09 AI的“相似度陷阱”,为什么它总搞错“和”与“不”?

00:11:07 如何让AI学会“不后悔”?

00:17:01 AI对话,如何揪出每一句话的“祖宗”?

00:22:30 AI的“潜规则”,它在偷偷学什么?

本期介绍的几篇论文:

[CL] The JEPA Paradox in Language: The Geometry of Linguistic Alternatives

[VinUniversity & Mohamed bin Zayed University of Artificial Intelligence]

arxiv.org

---

[CV] Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

[CMU]

arxiv.org

---

[LG] Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex

[MIT]

arxiv.org

---

[CL] Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

[Microsoft Research & University of Toronto]

arxiv.org

---

[LG] What do Reward Models Memorize?

[University of Amsterdam & Google DeepMind]

arxiv.org