【第640期】代码即代理框架:构建可执行与可验证的AI系统Seventy3

【第640期】代码即代理框架:构建可执行与可验证的AI系统

23分钟 ·
播放数6
·
评论数0

Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。

如果你想要解读自己的论文,获得更多曝光度。请联系小助手微信:seventy3_podcast 加群。
合作邮箱:zhiwudazhanjiangshi#gmail.com

今天的主题是:

Code as Agent Harness

Summary

最近的大型语言模型(LLMs)在代码理解和生成方面展现出了强大的能力,涵盖了从竞赛编程到仓库级软件工程的广泛领域。在蓬勃发展的智能体(agentic)系统中,代码不再仅仅是一种目标输出,它正越来越多地扮演着智能体推理、行动、环境建模以及基于执行的验证的操作基底。我们从智能体装备(agent harnesses)的角度来界定这一转变,并引入了“代码即智能体装备”(code as agent harness)的概念:这是一种将代码视为智能体基础设施核心的统一视角。

为了系统地研究这一观点,我们围绕三个相互关联的层级展开本次综述。首先,我们研究装备接口,即代码如何将智能体与推理、行动和环境建模连接起来。其次,我们探讨装备机制:用于长周期执行的规划、记忆和工具使用,以及使装备更具可靠性和自适应性的反馈驱动控制与优化。第三,我们讨论如何将装备从单智能体系统扩展到多智能体环境,其中共享的代码产物能够支持多智能体的协同、审查和验证。

在这三个层级之上,我们总结了“代码即智能体装备”的代表性方法和实际应用,涵盖了编码助手、GUI/操作系统自动化、具身智能体、科学发现、个性化与推荐、DevOps 以及企业工作流。我们进一步概述了装备工程面临的开放性挑战,包括最终任务成功率之外的评估、不完全反馈下的验证、无回归的装备改进、跨多智能体的一致共享状态、针对安全关键型行动的人类监管,以及向多模态环境的扩展。

通过将代码作为智能体 AI 的装备,“代码即智能体装备”这一综述为迈向可执行、可验证且具备状态记忆的 AI 智能体系统提供了一条统一的路线图。

原文链接:arxiv.org