#669.如何构建自主、长时程 AI 智能体

#669.如何构建自主、长时程 AI 智能体

69分钟 ·
播放数175
·
评论数0

📝 本期播客简介

本期我们克隆了:知名播客 The MAD Podcast with Matt Turck How to Build Autonomous, Long-Horizon AI Agents | Basis

原内容更新时间:2026-08-06

本期嘉宾是 AI 独角兽公司 Basis 的联合创始人 Mitch Troyanovsky,主持人是 First Mark 合伙人 Matt Turck。Basis 专注于让智能体自主完成复杂的会计工作,比如端到端准备整套纳税申报表。这期节目围绕如何构建长时程自主智能体展开,Mitch 分享了他从编程 Agent 到现实世界应用中的大量实战经验与思考。

对话从 Basis 办公室里一群人对着麦克风轻声细语的有趣场景切入,逐步深入到长时程智能体的核心挑战:如何让 AI 在数小时甚至数天的运行中保持连贯、可靠、可验证。Mitch 提出了"行为规范"(Behavior Specs)这一核心概念,主张不要只依赖结果评估,而要像管理人类员工一样,为智能体定义过程性的行为标准。他还分享了与 Brain Trust 合作开源的项目,以及他对"苦涩的教训"、自我改进、护城河等话题的深刻见解。

👨‍⚕️ 本期嘉宾

Mitch Troyanovsky,Basis 联合创始人。Basis 是一家 AI 独角兽公司,其智能体能够自主运行数小时甚至数天,端到端完成复杂的会计工作,如准备整套纳税申报表。Mitch 是长时程自主智能体领域的顶尖构建者,他的观点在 X(推特)上广受关注,并经常在 Data Driven 等场合发表演讲。他提出的"行为规范"概念和开源项目,正在推动行业对智能体可靠性的重新思考。

⏱️ 时间戳

00:00 开场 & 播客简介

Basis 的轻声细语文化

01:18 人类与不确定性系统打交道的本质

02:07 Matt Turck 介绍本期嘉宾与主题

02:52 为什么对着麦克风轻声细语

长时程智能体的定义与历史

04:56 Basis 是什么:端到端完成会计工作

07:08 什么是长时程智能体

08:58 自主智能体如何端到端处理纳税申报

11:13 从 ReAct 到 Baby AGI 的演进

模型突破与可验证奖励

14:54 推理模型带来的范式转变

16:59 OpenAI 的 Let's Verify Step by Step

18:23 长时程智能体能力每七个月翻一倍

19:39 可验证奖励与编程为何成为首选场景

构建现实世界智能体的挑战

22:14 为什么 Agent 在编程之外会挣扎

23:30 如何定义"好":从人类流程中学习

25:28 数据稀缺与反馈回路长度问题

27:02 一份纳税申报表涉及多少步骤

行为规范:过程优于结果

28:23 为什么不能只依赖结果

30:58 什么是行为规范(Behavior Specs)

32:49 谁来写行为规范:会计师与 ML 研究者的协作

33:48 如何权衡精确性与系统稳定性

评判器与上下文工程

35:59 与 OpenAI 2023 年做法的区别

37:39 如何训练评判器(Judge)

39:31 行为规范的权衡与"第37手"问题

41:56 如何建立 LLM 直觉

开源项目与本体论

45:57 与 Brain Trust 合作开源的项目

49:50 本体论(Ontology)在智能体世界中的位置

53:52 内部文档必须像代码库一样对待

部署智能团队与自我改进

55:35 新岗位:语言架构师与智能体管理者

57:32 部署智能(DI)团队的角色

59:18 自我改进与闭环

01:02:02 模型层面的自我改进与强化学习

护城河与最终建议

01:04:09 对"苦涩的教训"的看法

01:05:23 技术护城河不是真正的护城河

01:07:10 给 AI 开发者的最终建议

🌟 精彩内容

💡 人类早就习惯跟非确定性系统打交道了

Mitch 指出,公司、流程的核心问题,就是如何设计一个系统,让非确定性的实体(人类)协同解决问题。一旦意识到这一点,智能体设计就变得清晰了——我们其实一直在做这件事。

"人类早就习惯跟非确定性系统打交道了,只不过这些系统通常是他们的同事,而不是他们的电脑。"

💡 100 次全对也不代表能泛化到现实世界

Mitch 强调,即使评估集全部通过,也不能保证智能体能在生产环境中可靠工作。就像一个人靠查维基百科答对问题,公司不会雇他一样,智能体也必须遵循正确的过程。

"就算 100 次里 100 次都做对了,如果一个人只是靠查维基百科才做对的,那公司根本不会雇他。所以他们也不该雇我们。"

💡 英文比代码更金贵

Mitch 观察到,很多工程师对代码文件的抽象质量斤斤计较,却对上下文的混乱毫不在意。但实际上,上下文(英文)直接影响运行时的表现,而代码的组织方式并不影响。

"你会看到有人对一段抽象得不够好的代码文件惊慌失措,可他们的上下文简直是一团糟。英文更金贵,因为英文影响性能。代码不影响性能。"

💡 行为规范是规格说明,也是评分标准

Mitch 介绍了"行为规范"(Behavior Specs)的概念:一个 Markdown 文件,写下你希望 Agent 怎么表现。它既是给 Agent 的规格说明,也是评判器打分的标准,更是对齐人类团队的工具。

"你有一个 Markdown 文件,在里面写下你希望 Agent 怎么表现?就这么简单。"

💡 客户买的不是"史上最好的纳税申报",而是信心

Mitch 用"第37手"的比喻说明:即使 AI 能想出比人类更好的方案,客户买的也不是那个。他们买的是稳定可靠、能放心信任的东西,就像对人一样,可以逐步授予更多自主权。

"客户从我们这里买的,不是'这会是史上最好的纳税申报',他们买的是那份信心。"

💡 把上下文工程想成训练数据

Mitch 建议,不要用"写提示词"的心智模型来理解上下文工程,而应把它想成训练数据——只不过你是在运行时训练模型。这改变了你对待上下文质量的态度。

"我喜欢的框架是把它想成训练数据,只不过你是在运行时训练模型。它就是训练数据。"

💡 技术护城河不是真正的护城河

Mitch 直言,Basis 的长期价值不来自任何秘密的强化学习技巧。真正重要的是商业护城河:市场份额、深度嵌入客户、掌握工作流。技术只是暂时的撬动点。

"Basis 的长期终值里,没有任何一部分是来自我们发现了别人没发现的什么秘密强化学习技巧。"

💡 范式没有在变,变的是表层

面对每天都有新发布、看似疯狂变化的 AI 世界,Mitch 建议做第一性原理的决策。把新世界看作像云计算那样的底层范式转变,推演其含义,而不是被表面的变化牵着走。

"事情在变,但范式并没有在变,至少没那么剧烈。所以我觉得真正理解这一点,对在这个世界里做建设,是非常非常关键的。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺;

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight