Cursor已经不是只把别人的大模型接进编辑器,而是在训练自己的专用编程模型Composer。这期真正解释的是:当AI应用公司掌握了真实产品场景、用户行为和工具调用数据,它们为什么可能不再只做“模型外壳”,而会把自己的产品经验直接训练进模型。
这期来自红杉Training Data。主持人Sonya Huang对谈Cursor的Federico Cassano和Fireworks的Dmytro Dzhulgakov,聊Composer2背后的训练方式:为什么通用大模型不一定最适合Cursor自己的编程环境,提示词工程的上限在哪里,强化学习如何让模型学会长期调用工具,以及为什么分布式推理基础设施会成为AI应用公司的新门槛。
Federico Cassano是Cursor负责Composer2的研究负责人。Composer2是Cursor面向长期编程任务的智能体编程模型,核心目标不是泛泛聊天,而是在Cursor环境里完成更复杂的软件工程任务。
Dmytro Dzhulgakov来自Fireworks AI,长期从事AI推理和训练基础设施相关工作。这次他参与支持Cursor完成Composer2训练所需的大规模分布式基础设施。
【我们会听到】
- 为什么Cursor要自己训练AI编程模型,而不是只调用OpenAI、Anthropic等通用模型
- 提示词工程能解决什么,又在哪里会碰到天花板
- 强化学习里的rollout到底是什么,为什么它更像一整次Cursor智能体任务执行
- 训练模型时,为什么质量、速度和成本必须一起权衡
- 应用公司是否都会走向“自己训练模型”这一步
- AI编程工具的竞争,为什么可能从产品体验深入到模型和基础设施层
【Shownotes】
00:13 栏目开场:Cursor为什么要自训Composer
01:03 Sonya介绍Cursor与Fireworks两位嘉宾
03:00 为什么通用模型不一定最适合Cursor自己的软件工程环境
06:30 提示词工程的上限,以及产品环境为什么要进入模型训练
10:20 Composer2如何结合中期训练和强化学习
15:20 rollout:一次完整的智能体任务执行,不只是一次模型调用
21:40 分布式强化学习:训练器、推理集群和全球GPU调度
27:30 混合专家模型、浮点误差和路由器重放
32:40 在线强化学习、真实用户反馈和离线模拟
38:20 长任务智能体、上下文压缩和自我总结
42:20 应用公司是否都需要训练自己的模型
45:20 大语言模型当评审、强化学习环境和产品反馈
本期为中文译制版,原节目来自Sequoia Training Data:How Cursor Trained Composer on Fireworks’ Distributed Infrastructure for High-Performance RL。

