[人人能懂AI前沿] 从自发合谋、谄媚顺从到自组织进化

[人人能懂AI前沿] 从自发合谋、谄媚顺从到自组织进化

30分钟 ·
播放数54
·
评论数0

如果AI不仅会像职场老油条一样互相打掩护,还会为了讨好你的“瞎指挥”而盲从犯错,它们究竟该如何走向真正的超级智能?

本期节目,我们将深入解读五篇最新论文:围观智能体如何在制度缝隙中自发合谋,看看安全专家怎样用“底线探针”挡住AI挖掘漏洞的洪流;

我们还会剖析大模型“不敢对用户说不”的谄媚心理,并见证三个独立做错题的AI如何通过自组织协作绝地逆袭;

最后,再揭秘AI如何戴上自律紧箍咒,防止自我进化“刷题刷成书呆子”——准备好刷新对硅基心智的认知了吗?我们马上出发!

00:00:43 算法也懂“人情世故”?当AI学会了互相打掩护

00:07:33 当AI找漏洞比人修漏洞还快,我们该如何守住数字世界的防线?

00:12:11 为什么越聪明的AI,越容易被你的“瞎指挥”带偏?

00:17:56 为什么三个做错题的学生,凑在一起能拿满分?

00:23:57 聪明的AI如何防止自己“刷题刷成书呆子”?

本期介绍的几篇论文:

[AI] Emergent Collusion in Long-Horizon LLM Agent Interaction

[Stanford University & Georgia Tech]

arxiv.org

---

[AI] MobileCybench: Evaluating Agent Vulnerability Discovery via Executable Probes

[Stanford University & UC Berkeley]

arxiv.org

---

[CL] XYEval: Agents say yes to bad advice

[Google DeepMind]

arxiv.org

---

[AI] Self-Organizing Agent Teams Learn to Reason Together

[Stanford University & Together AI]

arxiv.org

---

[LG] RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

[Google Cloud AI Research]

arxiv.org