红杉资本近期发起了一个名为「Own Your Intelligence」的系列专题分享,邀请在"企业自建智能"方面实践最多的几家公司,围绕战略理念、模型后训练、强化学习环境与垂直落地四大议题做系统分享。
强化学习底层细节由 Mercor CEO Brendan Foody 拆解。Mercor 是一家以 AI 匹配全球顶尖人才重塑真实工作流的企业。本期他详解了 RL 环境的三要素:业务上下文(世界)、高保真软件克隆(应用)、明确指令与专家评分(任务与验证器),并强调金融、法律等高门槛领域必须依赖顶尖专家设定严苛评分边界,防止模型"奖励黑客"作弊。他预测评测演进的两大方向:处理百小时级的"超长视野任务",以及考察智能体在虚拟办公环境中的协作与社交能力。
视频链接:www.youtube.com
