【第687期】自我对弈强化学习:30分钟数据教AI像人开车Seventy3

【第687期】自我对弈强化学习:30分钟数据教AI像人开车

22分钟 ·
播放数4
·
评论数0

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

今天的这篇的主题是:

Human-like autonomy emerges from self-play and a pinch of human data

Summary

自我对弈强化学习(Self-play reinforcement learning)近期成为一种无需任何人类数据即可训练驾驶策略的新方法。它利用低成本、大规模的仿真模拟来替代昂贵且大规模的人类驾驶演示。然而,该方法存在一个关键局限:通过纯自我对弈训练出的策略可能会学到有效但异类(alien)的驾驶习惯,与人类的习惯互不兼容。先前的研究尝试通过大量的奖励工程(reward engineering)和领域随机化(domain randomization)来缓解这种行为上的不对齐,但这些做法往往脆弱且耗费人力。

与完全抛弃人类演示不同,我们的方法将人类演示作为一种正则化目标,叠在极简的安全目标达成的奖励之上。正如好汤中的调味香料,我们发现少许人类数据就能起到极大的作用:我们的方法仅使用了 30 分钟的人类演示,比同类模仿学习方法减少了 2500 倍的数据量。由此产生的策略能够与未参与训练的人类轨迹达成协调,且在单块消费级 GPU 上仅需 15 小时即可完成训练。

原文链接:arxiv.org