Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
今天的这篇的主题是:
Agentopia: Long-Term Life Simulation and Learning in Agent Societies
Summary
人类从社会生活中进行学习。利用大语言模型(LLM)驱动的 Agent 来模拟这一过程是一个很有前景的研究方向,由此也衍生出一个自然的问题:LLM 能否从这种模拟的社会经验中学习,从而更好地理解和复刻人类行为?然而,以往的 Agent 社会模拟通常局限在“天”的量级,限制了社会交互的深度与长期成长。
在本文中,我们针对 Agent 社会中的长期生活模拟与 LLM 学习展开研究,旨在实现两个目标:(1)探索终身模拟中涌现出的社会行为;(2)通过数年的模拟社会经验,培养 LLM 的拟人化能力,特别是其在社会生活中的智能水平。
具体而言,我们提出了 Agentopia,这是一个用于多 Agent 社会长期生活模拟的综合框架。在该框架中,100 个 Agent 在 10 个模拟年里自主追求个人成长、建立社会关系,并满足自身的需求与目标。我们定义了用来镜像人类幸福感(well-being)的“生活奖励”(life reward),并利用该奖励通过拒绝采样(rejection sampling)来训练 LLM。
大量实验表明,Agent 表现出了丰富且涌现出的社会行为。此外,基于生活奖励的训练有效提升了底座 LLM 的能力,这不仅改善了 Agent 在模拟中的幸福感,还泛化到了下游的角色扮演基准测试中,带来了 +15.6% 的性能提升。
原文链接:arxiv.org

