近日,《硅谷坐标》主持人曹卿云与 Fireworks 联合创始人 Benny Chen 陈宇飞进行了一场深度对谈。
一个月前,AI 推理平台 Fireworks 刚刚完成新一轮融资,估值 175 亿美元,NVIDIA、Index、TCV 等参与投资;黄仁勋称它为"AI 界的台积电"。Fireworks 做的是一件定义 AI 落地成本的事:把开源模型,变成企业用得起、用得好的专属智能。
这次对话聊到了开源 vs 闭源的终局、蒸馏之争、垂类与通用模型之战、平台 token 的真实流向、推理优化与定制模型两门生意、与 CSP 云厂的竞合,以及大厂 CapEx 的反向算账。
嘉宾资料:
Benny Chen 陈宇飞
Fireworks AI 联合创始人
前Meta 广告基础设施负责人
UCLA毕业
本集时码 | Show Notes
未来开源 vs 闭源的产业格局
蒸馏 vs 非蒸馏:开源如何保持领先
闭源 SOTA 模型 ARR 增速能否持续 + 分层话语权
Harvey 法律垂类 vs 通用 SOTA 模型
Fireworks 平台 token 增长量应用赛道
估算北美客户在开源模型的总支出
未来六个月北美 token / 支出的趋势
北美客户偏好哪些开源模型
Coding 当前渗透率与 TAM 想象空间
新模型上线,客户 fine-tune 模型会被洗掉吗
企业权衡开源 vs 闭源的因素, 本地部署 vs 云端部署
从 PoC 到生产的关键变量 + eval 的缺口
两门生意:推理优化的空间
硬件配置的优化空间:一个无量纲数
什么样的企业适合定制模型
定制 RL 最耗时花钱的部分
客户模型上线后需不需要「回炉」
Fireworks 核心竞争力:与 CSP 的竞合
RSI 全面自动化后,核心竞争力在哪
未来一两年最大的挑战
大厂 CapEx vs ROI:开源追平叙事的反向思考
📖 英文词汇表
token:模型处理文本的计量单位,也是推理服务的计费单位
ARR:年化经常性收入,衡量订阅类业务规模的核心指标。
run rate:实际用量/按当前速度折算的年化规模。
SOTA:State of the Art,当前最强水平,常代指最强的闭源前沿模型
TAM:市场总规模,即一门生意理论上的天花板
CapEx:资本开支——大厂买卡、建数据中心花的钱
ROI / ROIC:投资回报率 / 投入资本回报率
B2B API:面向企业的模型调用接口
eval / evaluation:评估体系——把"什么叫做得好"写成机器可执行的评分标准;
vibe:凭感觉——与 eval 相对,指没有严格评估、"试一下感觉行就行"的验收方式。
PoC:Proof of Concept,概念验证,即企业上线前的试点项目。
fine-tune:微调——用自己的数据在开源模型基础上继续训练,炼出专属模型。
rebase:换底座——新一代开源模型发布后,把定制工作整体迁移过去。 base model:基础模型,未经任何定制的"原厂"开源模型。
rollout:训练中让模型对同一任务反复试做取样,是强化学习消耗算力的大头。
environment:训练环境/"考场"——让模型练功的模拟工作场景。
reward hacking:钻评分空子——模型没学会干活,却学会了骗过判分器。 harness:任务编排框架——决定什么时候调用哪个模型、怎么拆解任务的"工作流脚手架"。
multi-tenancy:多租户共享——很多客户共用同一批 GPU,摊薄成本。 VPC:专属私有云环境,合规要求高的企业的折中部署方式。
SLA:服务质量承诺(可用性、延迟等指标的合同保证)。
go to market(GTM):市场开拓能力——怎么把东西卖出去。
mindshare:用户心智份额——大家"想到 AI 先想到谁"。
1P:第一方原生服务——直接内嵌在云平台里、用云的账单就能购买。 MLOps:模型从开发、训练到上线运维的全流程。
HBM:高带宽显存,GPU 自带的高速存储仓库。
DRAM / NAND:内存 / 闪存(SSD 的存储介质)。
scale-up / scale-out:机柜内高速互联扩展 / 跨机柜组网扩展——两种把算力做大的路线。
kernel:直接指挥芯片干活的底层代码,写得好坏能差出几成产能。
overfit:本期语境指模型厂商为某家芯片深度定制适配、"绑死"在这家硬件上。
jagged intelligence:偏科的智能——在某个方向极强、其他方向平平。 unhobbling:解除束缚——指让模型摆脱接口限制、直接操作电脑的叙事。 CSP:云服务巨头(亚马逊 AWS、微软 Azure、谷歌云)。
Neocloud:新型算力云——买卡建机房、按小时出租 GPU 的公司。
RSI:递归自我改进——AI 自己改进自己,越改越强的设想。
watershed moment:分水岭时刻。
existential risk:生存性风险——会不会"死掉"级别的风险。
cost neutral:成本打平,不赚不亏。
🏷️ 专有名词解释
Fireworks AI:本期主角,AI 推理与定制平台,估值 175 亿美元,被黄仁勋称为"AI 界的台积电"。
PyTorch:Meta 开源的深度学习框架,全球 AI 研发的主流底座——Fireworks 创始团队正出自这里。
Harvey:法律 AI 独角兽,Fireworks 客户,双方发布过著名的联合研究。 EvenUp:法律科技公司,专注人身伤害案件文书,垂类 AI 代表之一。 Doximity:北美最大的医生端应用,在 Fireworks 上训练医疗深度研究模型。
Heidi:北美以外最大的医疗记录 AI 公司。
Muse / Spark:Meta 新一代模型——Muse 已发布,Spark 官宣将开源(Llama 一脉的延续)。
Nemotron:NVIDIA 的开源模型系列。 Gemma:Google 的开源模型系列。 Llama:Meta 早前的开源模型系列,开源浪潮的奠基者。
Claude Code / Codex:Anthropic 与 OpenAI 的编码智能体产品,闭源编码工具的代表。
Opus / Sonnet:Anthropic Claude 系列的旗舰档与主力档模型。
Luna:头部闭源实验室近期发布的模型(本期语境:与 Sonnet 同期降价)。 Gemini:Google 的旗舰模型系列。
Nexus:Fireworks 面向企业的编码产品。
OpenRouter:模型流量分发平台,其排行榜常被用来观察各模型热度(本期提醒:榜单会被免费流量污染)。
CoreWeave / Nebius:两家新型算力云(Neocloud)代表,前者收购了 RL 创业公司,后者收购了推理优化团队。
Palantir:美国数据软件巨头,以驻场工程师模式帮企业落地 AI,正从应用层切入基础设施之争。
Azure / AWS / GCP:微软、亚马逊、谷歌三大云;Fireworks 与 Azure 合作最深(1P 服务)。
NVIDIA / 黄仁勋:GPU 霸主及其创始人;"AI 界的台积电"即出自黄仁勋对 Fireworks 的评价。
SWE-bench / terminal bench:两个主流编程能力基准测试。
Dwarkesh Patel:硅谷知名科技播客主持人,本期提到他的"黑板教学"那期硬件科普。
General Electric(通用电气):Benny 用来类比"电力普及后,最挣钱的未必是发电者"的历史案例。
"No one gets fired for buying IBM":美国商界老话,"买 IBM 不会被开除"——形容企业采购的保守心态,本期用来解释闭源模型的心智优势。
💬 本期金句
「很多工程师担心失业——能做 eval 的人真的少之又少。把 eval 写好,可能把你工资的三五倍都省出来。」
「把所有人的口味照顾好,和把一个垂类的口味照顾好,是两种完全不同的工作。」
「去年每次新的闭源模型上线,都有很多企业定制模型被洗出去了,但是今年洗出去的很少——这是一个非常积极的信号。」
「开源模型追上来,绝对是 favor infrastructure provider」
#AI #开源模型 #Fireworks #大模型 #LLM #硅谷 #人工智能 #OpenSource #AIInfra #deepseek #GLM #Kimi3 #Qwen

