【第706期】Paper-replication:科学机器学习的编码代理工作流Seventy3

【第706期】Paper-replication:科学机器学习的编码代理工作流

22分钟 ·
播放数3
·
评论数0

今天的这篇的主题是:Coding-agents can replicate scientific machine learning papers

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:seventy3_podcast(加群/投稿论文)

Summary

科学机器学习(Scientific machine learning)论文通常会提出具体的计算主张,例如:相对均方误差小于 5%,或 95% 的预测置信区间覆盖了测试数据。即便仅依靠论文材料,也可以提示编码 Agent 去复现这些主张;然而,提示词本身并不能可靠地记录复现进度,也无法检验生成的证据是否真正支持论文的主张。

为此,我们引入了 Paper-replication:一种将选定的论文主张转化为带有记录证据的“目标”(target)的工作流,并将其实现为一种编码 Agent 技能(coding-agent skill)。该工作流使 Agent 能够记录这些目标、重构论文的方法、运行计算实验、将生成的输出与出处以及论文的主张对比进行关联、记录匹配证据在复现报告中的具体出处,并在完成前通过校验检查。

我们在四篇科学机器学习论文上进行了 12 次独立运行,以此对 Paper-replication 进行了评估。所有 12 个工作区均通过了完成门槛(completion gate),且所有 158 个记录的目标均在报告中得到了匹配覆盖。即便在这些已完成的工作区状态下,多次重复运行在以下方面仍存在差异:论文被拆分为目标的方式、与源论文的数值忠实度、复现耗时、在最终证据被接受前所替换的中间执行次数,以及用于接受证据的规则。Paper-replication 使任务的最终完成依赖于工作区内的证据和校验检查,而非 Agent 本身发送的最终消息。

原文链接:arxiv.org