#735. Jev 模型创始人访谈:为什么我无法在 OpenAI 构建 Jev

#735. Jev 模型创始人访谈:为什么我无法在 OpenAI 构建 Jev

129分钟 ·
播放数439
·
评论数2

📝 本期播客简介

本期我们克隆了:Latent Space · Why We Made Jev — Diogo Almeida, TypeSafe Co-founder & CEO

原内容更新时间:2026-09-21

本期 Latent Space,也就是 Latent Space 播客,主持人 swyx 对话 TypeSafe 联合创始人兼 CEO Diogo,讨论 Jev 发布背后的产品理念、训练方法与软件架构。Jev 被定义为机器原生、系统 1、大型可编程模型:它不是为了与人聊天,而是为了被代码直接消费,并在软件中承担大量细小、可验证的决策。

Diogo 解释了 TypeSafe 为什么把 RLCD 视为新的北极星目标,为什么认为 RLHF 会造成模式丢失、校准失真与智能碎裂,以及为什么可靠性、鲁棒性和单位美元智力比公开基准排名更重要。他还谈到拒绝响应为何可能成为 API 依赖中的类型错误、结构化状态如何取代巨型系统消息,以及如何把 AI 工作流拆成可度量的最小语义单元。

对谈也延伸到暗数据、电脑操作、实时场景和编程 Agent。Diogo 认为,AI 最终不应成为软件里的显眼聊天框,而应像基础设施一样隐入背景;真正的经济变革,不是让 AI 充当主角,而是让已有软件获得此前无法实现的自动化能力。

👤 本期嘉宾

Diogo 是 TypeSafe 联合创始人兼 CEO,此前曾在 OpenAI 工作,参与过 InstructGPT 与指令遵循方向的早期工作。他长期思考一个核心问题:为什么 AI 能解决千禧年大奖难题,却仍然无法稳定自动化大量基础、机械、具有经济价值的工作。离开 OpenAI 后,他与团队围绕机器原生模型、程序在环反馈、可靠性和数据展开多年探索,最终推出 Jev。

Diogo 值得听之处在于,他既熟悉前沿模型训练和后训练,也持续从软件工程师的实际需求出发,质疑聊天机器人、公开刷榜和“AI 同事”等默认范式。他对模型能力参差、数据质量、API 设计和编程 Agent 的讨论,构成了一套从模型底层一直延伸到软件产品的完整判断框架。

⏱️ 时间戳

00:23 开场与发布感受

02:52 Jev与系统1模型

05:41 RLHF与模式丢失

09:47 程序化AI与安全对齐

15:53 为何拒绝公开评测

18:52 《最苦涩的教训》与数据

22:59 RLCD、RLHF与RLVR

26:28 强大AI为何未自动化经济

37:09 可靠性、鲁棒性与确定性

45:00 版本、速度与性价比

50:35 Jev API与编程原语

54:40 用Jev拆解程序任务

1:12:36 SaaS反向末日与软件

1:26:22 电脑操作与主要用例

1:30:59 Jev重塑编程Agent

1:33:06 安全、前沿节奏与RLVR局限

1:38:59 为何不花十亿美元预训练

1:45:10 TypeSafe背后的OpenAI故事

1:51:19 多数NeoLab为何做错AI

1:56:46 编程Agent与多Agent未来

🌟 精彩内容

💡 AI 的问题不是不够聪明,而是缺少正确接口

Diogo 认为,今天的 AI 已经展现出远超预期的抽象与推理能力,但这些能力还没有通过合适的接口进入经济活动。Jev 的目标,就是让代码而不是人,成为模型的直接使用者。

"我们怎么能去解数学里的千禧年大奖难题,却连最基础的工作都还自动化不了?"

💡 RLCD 是面向程序化使用的新北极星

在 Diogo 看来,RLHF 的核心是指令遵循,RLVR 的核心容易滑向刷基准,而 RLCD 关注的是模型在程序化使用中的可靠性。重点不在某个具体算法,而在于为模型选择正确的任务和方向。

"对我们来说,RLCD 就是这个新任务,我不觉得它是行业黑话。"

💡 数据和任务比算力更重要

TypeSafe 更愿意把自己称为数据实验室,而不是模型实验室。Diogo 认为,真正困难的不是单纯扩大模型规模,而是找到正确的任务、构造与任务匹配的数据,并持续修复模型能力参差的部分。

"显然数据远比算力重要,而选对任务、确立北极星目标,才是最难、最重要的事。"

💡 API 里的拒绝响应可能是类型错误

面向聊天产品的安全对齐,可以让模型拒绝用户不应提出的请求;但当模型作为软件依赖运行时,随机拒绝可能让整个系统不可预测。Diogo 区分了安全对齐与能力对齐,并强调 API 更需要按用户意图稳定执行。

"而且拒绝响应明显就像是一个类型错误。"

💡 可靠性不等于确定性

相同输入是否始终得到相同输出,只是确定性问题;真正适合软件的目标,是相似输入得到相似结果,并且模型在不同表达、随机数和上下文变化下保持鲁棒。

"我认为鲁棒性才是大家……更重要的特性。"

💡 把 AI 工作流拆成最小语义单元

与其用一个巨大的系统消息要求模型一次性完成所有事情,不如把任务拆成许多独立、明确、可评测的决策。这样每个行为都能通过代码验证、设置阈值,并沉淀为测试用例。

"我喜欢把东西拆成最小的语义单元。"

💡 结构化状态将取代巨型系统消息

Diogo 认为,软件内部真实存在的是状态、变量、指令和嵌套结构,而不是一串字符串。把所有内容塞进系统消息,类似使用难以维护的全局变量;机器原生模型应直接处理结构化 JSON 和程序状态。

"系统消息就像恶心的全局变量,你把什么东西都往里塞,把所有指令一股脑全放进去。"

💡 AI 最终应该隐入软件背景

在 Diogo 描绘的未来里,AI 不必一直以聊天框或“AI 同事”的形式出现。它会成为软件底层的通用基础设施,嵌入已有产品,自动化那些今天仍由人手工完成、但用户甚至无法想象如何自动化的工作。

"我觉得这个世界应该让人感觉更惬意,而 AI 只要在背后帮着实现这一点就好。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺

展开Show Notes
yikai-
yikai-
3小时前
置顶
最近,我的朋友海风留意到:AI行业的抢人大战,已经从疯狂砸钱抢人转向快速收缩。不少头部团队今年招聘缩量,部分实习生排队等转正,招人也更偏向挖其他大模型公司的成熟人才。
有说法:去年不读博直接冲OpenAI尚有机会,但现在入局这个赛道,机会窗口已经收窄。

想征集AI圈里正在求职、等待实习转正的研究员、工程师的真实感受。如果你有观察、想聊聊或者吐槽,欢迎加她的微信:Focusonblindspots,申请备注:AI抢人。
小小春
小小春
4小时前
沙发