Cursor为什么不只调用OpenAI了?AI编程工具开始自己训练模型|中文译制版西声东渐 · 译介全球前沿硬科技观点

Cursor为什么不只调用OpenAI了?AI编程工具开始自己训练模型|中文译制版

47分钟 ·
播放数12
·
评论数0

Cursor已经不是只把别人的大模型接进编辑器,而是在训练自己的专用编程模型Composer。这期真正解释的是:当AI应用公司掌握了真实产品场景、用户行为和工具调用数据,它们为什么可能不再只做“模型外壳”,而会把自己的产品经验直接训练进模型。

这期来自红杉Training Data。主持人Sonya Huang对谈Cursor的Federico Cassano和Fireworks的Dmytro Dzhulgakov,聊Composer2背后的训练方式:为什么通用大模型不一定最适合Cursor自己的编程环境,提示词工程的上限在哪里,强化学习如何让模型学会长期调用工具,以及为什么分布式推理基础设施会成为AI应用公司的新门槛。

Federico Cassano是Cursor负责Composer2的研究负责人。Composer2是Cursor面向长期编程任务的智能体编程模型,核心目标不是泛泛聊天,而是在Cursor环境里完成更复杂的软件工程任务。

Dmytro Dzhulgakov来自Fireworks AI,长期从事AI推理和训练基础设施相关工作。这次他参与支持Cursor完成Composer2训练所需的大规模分布式基础设施。

【我们会听到】

- 为什么Cursor要自己训练AI编程模型,而不是只调用OpenAI、Anthropic等通用模型

- 提示词工程能解决什么,又在哪里会碰到天花板

- 强化学习里的rollout到底是什么,为什么它更像一整次Cursor智能体任务执行

- 训练模型时,为什么质量、速度和成本必须一起权衡

- 应用公司是否都会走向“自己训练模型”这一步

- AI编程工具的竞争,为什么可能从产品体验深入到模型和基础设施层

【Shownotes】

00:13 栏目开场:Cursor为什么要自训Composer

01:03 Sonya介绍Cursor与Fireworks两位嘉宾

03:00 为什么通用模型不一定最适合Cursor自己的软件工程环境

06:30 提示词工程的上限,以及产品环境为什么要进入模型训练

10:20 Composer2如何结合中期训练和强化学习

15:20 rollout:一次完整的智能体任务执行,不只是一次模型调用

21:40 分布式强化学习:训练器、推理集群和全球GPU调度

27:30 混合专家模型、浮点误差和路由器重放

32:40 在线强化学习、真实用户反馈和离线模拟

38:20 长任务智能体、上下文压缩和自我总结

42:20 应用公司是否都需要训练自己的模型

45:20 大语言模型当评审、强化学习环境和产品反馈

本期为中文译制版,原节目来自Sequoia Training Data:How Cursor Trained Composer on Fireworks’ Distributed Infrastructure for High-Performance RL。