
硅谷坐标 x FundaAI周默:美股科技公司Q2财报深度拆解:资本开支增速重新超过AI收入7月,美股半导体板块单月蒸发超过1万亿美金。但同一时间,四家大厂继续上调年度资本开支。财报之后,市场给出了完全不同的定价:微软、亚马逊被大幅奖励,Meta 下跌,谷歌先跌后修复。 同样是资本开支花钱,待遇天差地别——这就是本期全部讨论的起点。 三个月前,周默在硅谷坐标留下一个判断:"市场的核心要求,是收入加速追上 CapEx。"这个季度,答案被供应链通胀改写:1GW 数据中心的成本从约350亿美金涨到550-600亿,CapEx 的增长重新跑赢了 AI 收入。本期我们从7月行情的仓位与流动性复盘讲起,把微软、Meta、亚马逊、谷歌四份财报逐一拆开,最后推演明年的算力供需与产业链定价权归属。 嘉宾|周默 · FundaAI创始人 主持|曹卿云 · 硅谷坐标创始人 00:00 开场 01:10 行情复盘:从仓位高位到流动性危机 11:05 微软财报:Copilot 加速与开源模型的 ROI 20:01 Copilot:席位、活跃率还是 Consumption 25:40 Azure 加速的三层来源 30:48 Meta财报:唯一下跌与 CapEx 压力 33:15 扎克伯格为何不卖算力 38:38 AI 对广告的贡献与 Business Agent 46:05 亚马逊财报:AWS 连续五季加速的原因 50:27 AI 拉动传统云:如何定义 AI 收入 55:29 谷歌财报:Gemini 迭代落后的原因 1:03:04 GCP 82% 的成分与 TPU 直销 1:09:20 谷歌广告的分化与 AI Mode 1:14:38 明年算力供需推演 1:19:58 云厂与模型公司的定价权 1:24:13 英伟达财报前瞻 #半导体 #美股 #财报 #微软 #MSFT #META #GOOG #谷歌 #亚马逊 #AMZN #英伟达 #资本开支 #ai
硅谷坐标 × Fireworks 联创 Benny Chen 陈宇飞:开源 vs 闭源 · token 流向与定制模型近日,《硅谷坐标》主持人曹卿云与 Fireworks 联合创始人 Benny Chen 陈宇飞进行了一场深度对谈。 一个月前,AI 推理平台 Fireworks 刚刚完成新一轮融资,估值 175 亿美元,NVIDIA、Index、TCV 等参与投资;黄仁勋称它为"AI 界的台积电"。Fireworks 做的是一件定义 AI 落地成本的事:把开源模型,变成企业用得起、用得好的专属智能。 这次对话聊到了开源 vs 闭源的终局、蒸馏之争、垂类与通用模型之战、平台 token 的真实流向、推理优化与定制模型两门生意、与 CSP 云厂的竞合,以及大厂 CapEx 的反向算账。 嘉宾资料: Benny Chen 陈宇飞 Fireworks AI 联合创始人 前Meta 广告基础设施负责人 UCLA毕业 本集时码 | Show Notes 01:23 未来开源 vs 闭源的产业格局 03:00 蒸馏 vs 非蒸馏:开源如何保持领先 07:00 闭源 SOTA 模型 ARR 增速能否持续 + 分层话语权 07:55 Harvey 法律垂类 vs 通用 SOTA 模型 10:18 Fireworks 平台 token 增长量应用赛道 13:50 估算北美客户在开源模型的总支出 15:36 未来六个月北美 token / 支出的趋势 16:40 北美客户偏好哪些开源模型 17:35 Coding 当前渗透率与 TAM 想象空间 18:50 新模型上线,客户 fine-tune 模型会被洗掉吗 22:11 企业权衡开源 vs 闭源的因素, 本地部署 vs 云端部署 00:00 从 PoC 到生产的关键变量 + eval 的缺口 27:00 两门生意:推理优化的空间 30:50 硬件配置的优化空间:一个无量纲数 33:50 什么样的企业适合定制模型 34:52 定制 RL 最耗时花钱的部分 35:49 客户模型上线后需不需要「回炉」 36:20 Fireworks 核心竞争力:与 CSP 的竞合 40:29 RSI 全面自动化后,核心竞争力在哪 41:16 未来一两年最大的挑战 41:39 大厂 CapEx vs ROI:开源追平叙事的反向思考 📖 英文词汇表 token:模型处理文本的计量单位,也是推理服务的计费单位 ARR:年化经常性收入,衡量订阅类业务规模的核心指标。 run rate:实际用量/按当前速度折算的年化规模。 SOTA:State of the Art,当前最强水平,常代指最强的闭源前沿模型 TAM:市场总规模,即一门生意理论上的天花板 CapEx:资本开支——大厂买卡、建数据中心花的钱 ROI / ROIC:投资回报率 / 投入资本回报率 B2B API:面向企业的模型调用接口 eval / evaluation:评估体系——把"什么叫做得好"写成机器可执行的评分标准; vibe:凭感觉——与 eval 相对,指没有严格评估、"试一下感觉行就行"的验收方式。 PoC:Proof of Concept,概念验证,即企业上线前的试点项目。 fine-tune:微调——用自己的数据在开源模型基础上继续训练,炼出专属模型。 rebase:换底座——新一代开源模型发布后,把定制工作整体迁移过去。 base model:基础模型,未经任何定制的"原厂"开源模型。 rollout:训练中让模型对同一任务反复试做取样,是强化学习消耗算力的大头。 environment:训练环境/"考场"——让模型练功的模拟工作场景。 reward hacking:钻评分空子——模型没学会干活,却学会了骗过判分器。 harness:任务编排框架——决定什么时候调用哪个模型、怎么拆解任务的"工作流脚手架"。 multi-tenancy:多租户共享——很多客户共用同一批 GPU,摊薄成本。 VPC:专属私有云环境,合规要求高的企业的折中部署方式。 SLA:服务质量承诺(可用性、延迟等指标的合同保证)。 go to market(GTM):市场开拓能力——怎么把东西卖出去。 mindshare:用户心智份额——大家"想到 AI 先想到谁"。 1P:第一方原生服务——直接内嵌在云平台里、用云的账单就能购买。 MLOps:模型从开发、训练到上线运维的全流程。 HBM:高带宽显存,GPU 自带的高速存储仓库。 DRAM / NAND:内存 / 闪存(SSD 的存储介质)。 scale-up / scale-out:机柜内高速互联扩展 / 跨机柜组网扩展——两种把算力做大的路线。 kernel:直接指挥芯片干活的底层代码,写得好坏能差出几成产能。 overfit:本期语境指模型厂商为某家芯片深度定制适配、"绑死"在这家硬件上。 jagged intelligence:偏科的智能——在某个方向极强、其他方向平平。 unhobbling:解除束缚——指让模型摆脱接口限制、直接操作电脑的叙事。 CSP:云服务巨头(亚马逊 AWS、微软 Azure、谷歌云)。 Neocloud:新型算力云——买卡建机房、按小时出租 GPU 的公司。 RSI:递归自我改进——AI 自己改进自己,越改越强的设想。 watershed moment:分水岭时刻。 existential risk:生存性风险——会不会"死掉"级别的风险。 cost neutral:成本打平,不赚不亏。 🏷️ 专有名词解释 Fireworks AI:本期主角,AI 推理与定制平台,估值 175 亿美元,被黄仁勋称为"AI 界的台积电"。 PyTorch:Meta 开源的深度学习框架,全球 AI 研发的主流底座——Fireworks 创始团队正出自这里。 Harvey:法律 AI 独角兽,Fireworks 客户,双方发布过著名的联合研究。 EvenUp:法律科技公司,专注人身伤害案件文书,垂类 AI 代表之一。 Doximity:北美最大的医生端应用,在 Fireworks 上训练医疗深度研究模型。 Heidi:北美以外最大的医疗记录 AI 公司。 Muse / Spark:Meta 新一代模型——Muse 已发布,Spark 官宣将开源(Llama 一脉的延续)。 Nemotron:NVIDIA 的开源模型系列。 Gemma:Google 的开源模型系列。 Llama:Meta 早前的开源模型系列,开源浪潮的奠基者。 Claude Code / Codex:Anthropic 与 OpenAI 的编码智能体产品,闭源编码工具的代表。 Opus / Sonnet:Anthropic Claude 系列的旗舰档与主力档模型。 Luna:头部闭源实验室近期发布的模型(本期语境:与 Sonnet 同期降价)。 Gemini:Google 的旗舰模型系列。 Nexus:Fireworks 面向企业的编码产品。 OpenRouter:模型流量分发平台,其排行榜常被用来观察各模型热度(本期提醒:榜单会被免费流量污染)。 CoreWeave / Nebius:两家新型算力云(Neocloud)代表,前者收购了 RL 创业公司,后者收购了推理优化团队。 Palantir:美国数据软件巨头,以驻场工程师模式帮企业落地 AI,正从应用层切入基础设施之争。 Azure / AWS / GCP:微软、亚马逊、谷歌三大云;Fireworks 与 Azure 合作最深(1P 服务)。 NVIDIA / 黄仁勋:GPU 霸主及其创始人;"AI 界的台积电"即出自黄仁勋对 Fireworks 的评价。 SWE-bench / terminal bench:两个主流编程能力基准测试。 Dwarkesh Patel:硅谷知名科技播客主持人,本期提到他的"黑板教学"那期硬件科普。 General Electric(通用电气):Benny 用来类比"电力普及后,最挣钱的未必是发电者"的历史案例。 "No one gets fired for buying IBM":美国商界老话,"买 IBM 不会被开除"——形容企业采购的保守心态,本期用来解释闭源模型的心智优势。 💬 本期金句 「很多工程师担心失业——能做 eval 的人真的少之又少。把 eval 写好,可能把你工资的三五倍都省出来。」 「把所有人的口味照顾好,和把一个垂类的口味照顾好,是两种完全不同的工作。」 「去年每次新的闭源模型上线,都有很多企业定制模型被洗出去了,但是今年洗出去的很少——这是一个非常积极的信号。」 「开源模型追上来,绝对是 favor infrastructure provider」 #AI #开源模型 #Fireworks #大模型 #LLM #硅谷 #人工智能 #OpenSource #AIInfra #deepseek #GLM #Kimi3 #Qwen
硅谷坐标 x Tensormesh 江鋆晨:AI 的记忆-KvCache的三层理解6月下旬,硅谷坐标主持人曹卿云与Tensormesh的联合创始人和CEO江鋆晨探讨了关于“AI记忆和存储”对话。这次对话聊到了推理瓶颈、Prefill/Decode成本拆解、KV Cache 的三层理解、护城河的真实来源、整个产业格局的判断,以及为什么这件被工业界每天接触的事,最前沿的突破却发生在学术界。Tensormesh和它背后的开源项目 LMCache,做的是一件听起来很底层、却可能定义 AI 下一个十年的事:大模型的记忆管理。 本期嘉宾: 江鋆晨 ● Tensormesh和LMCache的联合创始人 ● 芝加哥大学计算机系副教授 ● 清华姚班 ● CMU计算机博士 ● 2017年最佳博士论文 本集时码 Show Notes ● 00:52 AI 推理瓶颈:资源与 workflow 的不对等 ● 02:01 Tensormesh 到底解决哪一个环节 ● 03:20 反直觉的成本真相:贵的不是输出,是输入 ● 07:10 与模型厂cached token 的区别 ● 08:50 KV Cache 的三层理解 ● 11:30 为什么学术界领先工业界 ● 15:10客户画像:拥有共享知识库的企业 ● 20:45与竞争对手的区别 ● 22:00对“压缩”的看法 ● 23:35 多模态时代,KVCache怎么扩展 ● 25:15 存储供给瓶颈看法 ● 25:40 经济账:以存代算 ● 27:00 这个存储周期有什么不同 ● 28:42存储传输速度vs成本 tradeoff ● 30:35 哪个存储层受益最多? ● 32:30 历史的回响:KV Cache 之于 CDN ● 35:50 公司顾问:Ion Stoica和Hui Zhang–Databricks/Spark ● 37:30 Tokenmaxxing和utilization efficiency的机会和挑战 ● 39:57模型格局:大模型像在线视频,不像搜索 ● 41:23 如何看中国模型前景 ● 42:08 如果从Transformer架构换成Mamba ● 43:38 Xai收购Cursor ● 44:22AI 时代的汽油:懂 KV Cache 的人接触不到它,接触得到的人不懂它 一、AI推理瓶颈:资源与 workflow 的不对等 今天整个 AI 推理的环节里,瓶颈到底卡在哪?随着长上下文、Agent、多轮工作流、共享知识库和多模态输入成为真实生产负载,AI推理的约束条件正在从“单次算得出”转向“连续算得起、复用得动、调度得稳”。在这样的负载结构中,模型每处理一次context,都会形成大量内部中间状态KvCache;如果这些状态在请求结束后即被抛弃,那么系统下一次面对相同或相似任务时,只能再次支付完整的prefill成本。于是,问题就从模型层的能力竞争,转变成系统层的记忆治理竞争。谁能更高效地保存、迁移、复用、压缩乃至优化这些中间状态,谁就更有可能同时改写推理成本结构、吞吐表现和服务边界。 他把瓶颈的本质,归结成一句话:"现在的瓶颈说到底,就是资源跟 workflow 的不对等。需要的不仅是改模型、等更好的 GPU,同时也需要软件层面的创新,让这么大的 workflow 在有限的资源上可以跑得好。"Tensormesh,就是那个"软件层面的创新"。 二、Tensormesh 解决的是哪一个环节? "Tensormesh 是一种软件创新的 startup,做大模型的记忆管理。什么叫记忆管理?江鋆晨解释得很具体:大模型每次看到很多文本之后,会形成一个内部的理解,这就是 KV Cache。Tensormesh 这类软件出现之前,这些记忆经常是被 GPU、被模型直接丢掉的——因为模型是 stateless 的,"它一旦看过一次输入、做过一次输出之后,它不会记这些记忆,它把这些记忆就直接丢了。"Tensormesh 和 LMCache 做的事,就是把这些记忆留存下来。任何时候模型再看到类似的输入、同样的 context,就可以把存下来的记忆复用起来。它就不需要占用 GPU 的 memory,可以把它存在 CPU memory 里面,或者存在 SSD 里面,甚至存在 remote S3 这种远端的存储设备里面。下一次用户再问的时候,再把这个 memory load 回 GPU memory。 关键在于,用户问同一个 context 的时间是非常不连续的——今天问一个,过几分钟问一个,甚至明天再问一遍;或者,不同的人需要同样一段记忆来回答他们的问题。"所以你必须得有一个分开的、存储这些记忆的系统,在边上专门帮大模型管理这些记忆,使得它以后可以不停地复用以前的记忆,但又不需要把这些记忆放在 GPU memory 里面。" 这就是 LMCache 这个"分离存储层"存在的理由。 三、一个反直觉的成本真相:贵的不是输出,是输入 当被问到在大模型的报价里,input token 的价格通常很便宜,是 output 的几分之一。这听起来,"省输入"好像创造不了多少价值。但江鋆晨指出,处理一个 input token 和生成一个 output token,背后真正的计算成本其实是差不多的。 在很多真实场景里,input 的长度甚至远比 output 长——input 几万个 token,output 可能几千个,input 长十几倍。"但你如果看时间,用户盯着屏幕的时候,多少时间在等 input 处理,多少时间在等 output 生成?Input 占的时间只有十分之一,可能 90% 时间都在 output 上。" 模型处理 input 的时候可以大规模并行化,"但并行不代表它计算量小,它其实做了很多很多计算。" 如果你去算 FLOPS,input 和 output 在每个 token 上的计算成本是差不多的。prefill 的成本跟 output 在每个 token 上是一样的,甚至整体 prefill 成本会更高。" Output 看起来贵,只是因为它慢——它是线性化生成、没有并行,占的 GPU 时间多。从 provider 的角度,它确实看起来更贵,也有更好的理由去 charge 高价。 "但如果算真的成本,更关键的是,因为模型是 stateless 的,agent 应用和长对话会让 input 不断变长,而 output 不会相应变长。所以 "很多时候 agent application 和 chatbot application,它的输入一段时间之后就会比输出长很多。" 大家看到的定价,很大程度上是 inference provider 在 balance cost,并不是 input 便宜、output 贵真实反映了成本。 换句话说,Tensormesh 专攻的"输入侧",恰恰是成本真正的命门。 四、与其他模型厂商cached token区别,以及KV Cache 的三层理解 当被问到“市面上的大模型其实也提供 cached token——某些 token 被缓存下来,价格比input和output token都便宜很多的"白菜价"。这跟 Tensormesh 做的事,有什么不一样? 江鋆晨的回答,引出了这场对话最核心的部分:他对 KV Cache 的三层理解。 他先讲了 prompt caching 的局限:这些推理服务商提供的 cached token,应用场景其实非常有限——cached token 通常只在 CPU 里存下来,一旦放到更便宜的远端存储,性能会差很多。更大的问题是,他们只是在"优化存储效率",而没有看到 KV Cache 里更深的东西。 "在我们看起来,KV Cache 是未来的大数据。因为 KV 本身并不只是一个存下来可以复用的东西——它里面有非常有用的语义信息。这些语义信息,是现在大家把它 cache 下来时不会去看的。" 由此,他展开了三层理解: 第一层:KV Cache 是一个可以存储下来的黑盒数据。 它是一个 cacheable computer state,状态可以被存起来。但在这一层,大家觉得这个黑盒不能改,只能 as is,存什么用什么。"这一层其实很多工业界公司都在做,这是最基本的一层理解。" 第二层:KV Cache 不是黑盒,是白盒,里面有语义信息。 它代表的是模型自己的注意力(attention)信息。"你如果把 KV Cache 的值稍微改一改,只要不改变它的注意力、不改变它的语义信息,这个 KV Cache 一样可以复用,而且复用可以很好。" 到这一层,你可以改造它的内容、让它变小、做压缩、做 update,使得文本在任何地方都能复用;甚至文本不同但语义差不多时也能复用;他们有些技术,甚至可以让 KV Cache 在不同的模型之间复用。"这些学术界做了很多,但工业界现在很少做。" 第三层,是他认为最有意思的一层。把 KV Cache 的内容做一些改变,改变模型的输出,改变模型的 attention。"模型生成结果,取决于两个东西:模型的权重,和模型生成的 KV Cache。"模型的输出,其实就是模型的权重和模型生成的 KV Cache 当中做一些操作生成的结果。所以只要你可以第二层是改 KV Cache 但不改语义;而第三层,"你可以继续改它的语义,你可以告诉模型 pay more attention to this,pay less attention to that。这种操作,甚至可以让模型的输出变得更准、质量更高。" 这是一条不同于"改模型"和"改 prompt"的全新路径——在模型权重不变、prompt 不变的前提下,直接改写模型对内容的理解。"这些事情,学术界已经开始有人做了,但工业界很少有人理解到这一层。"这也正是他创业的原因之一:"在学术界里,可能大家已经走了很远;但你要影响工业界,你必须得做这样一家公司。" 五、为什么是学术界,而不是工业界 一个很自然的疑问随之而来:KV Cache 是工业界每天都在接触的东西,但最前沿的创新,却是学术界在做。这是为什么? 江鋆晨的回答,藏着这家公司最深的护城河。 "工业界看这种数据,工程师看到系统里产生的数字时,第一反应不是去改它,而是把它当黑盒存起来。而学术界看待这种数据,会想:这数据里面有什么语义信息?" 他说,这件事在当年的大数据时代发生过,AI 时代也会再发生一次。 "AI 时代里最重要、最有意思的数据,就是模型自己的记忆。但工业界看这个东西,看到的是一个黑盒数字;学术界看的,是你可以做什么算法。这其实就是为什么我们一直说 KV Cache 是未来的大数据、是石油——是这个数据本身有价值,而不是把它存下来复用一下的价值,way beyond that。" 那么,工业界很快就会用更多的资源、更多的人力把第二层、第三层做掉吗?他坦率地承认:完全有可能,而且本来以为是明年后年的事,"现在有可能今年年底就会发生,KV Cache 的关注度越来越高了。" 但他依然有信心,因为这是一个做 startup 非常好的机遇——对 KV Cache 三层都能有理解,是非常难的事。 他把这个稀缺性讲得极其透彻: "能做第一层、能做黑盒操作的人,必须是非常好的 back-end infra engineer,能接触到 GPU 才看得到这个数据。但这些人做不了第二层,因为他不知道这个数据里面到底有什么含义。你必须得是做 ML 的人,才能理解这个数据的含义,才能做第二层、第三层。但做第二层、第三层 research 的人,又没有工程的 insights,接触不到真的 KV Cache System。" "在大公司里面,可能一个公司有做这三层的人,但很难把他们放在一起,做成一整套可以把这三层全打通的系统。" 所以护城河,本质上不在技术,而在人才的稀缺性——能同时缝合系统与 ML 这两端的人,本来就极少,而这些人一旦从学校出来,大多去工业界拿很高的工资,纯粹做 model training 去了。 至于大厂会不会很快下场,他引用了 Sam Altman 的一个观点:"小公司做 startup,你有再好的 vision,去跟大公司的 CEO 面前说这个你应该做,他们也不一定做得了——不是因为没有实力,是因为那个人的 attention 分散的地方太多了。" 大公司有很多 priorities,可能有个组在做这个,但过两个月又得做别的。 "而我们是非常少数的 startup 或开源项目,直接只做这一层、只做这一个 vision。" 六、客户:拥有共享知识库的企业--输入端高度重复 谁是 Tensormesh 最典型的客户? 大企业的典型场景是:coding agent、企业内部的 chatbot、internal financial services、legal services。它们的共同点是有大量的 shared knowledge——公司内部有一个 codebase,需要被所有 coding agent 用;有一套 policy documents,需要给所有 chatbot 用;有一批 legal documents,需要给所有 legal chatbot 用。 所以一种非常 common 的 use case,是 across multiple applications——coding、chatbot、RAG、multimodal——它们都有 shared knowledge 作为模型输入的 context。"这种场景,就是对 LMCache 和 Tensormesh 技术最有利的场景。" 他还点出一个更深的价值:很多 best practice,你可以用 human readable 的方式存起来;但"如果你用 model native 的方式存起来,模型可以直接读,这样它就不用每次再处理了。" 而 agent 的兴起,对他们是结构性的利好:"agent 说到底是一个和环境以迭代方式交互的逻辑。你迭代得越多、交互得越多,它产生的 history 就越多;history 越多,模型每次看到的就是 longer and longer context。" 他解释:现在企业里做 AI 的人,基本就两类——train model 的人,和写 agent application 的人。能提高 agent quality、accuracy 的,也就这两类(要么改模型,要么改 prompt)。 "大家没有人去关注的是:在模型已经确定、prompt 也确定的前提下,怎么让这个模型更好地理解这个 prompt?这是所谓提高 quality 的第三条路。这条路现在看的人很少,所以大家根本没意识到这儿有一个 market。" 而能做这件事的人,又要懂 system 又要懂 ML,需要一个团队同时具备极强的 system 能力和极强的 ML 能力。"这种人才是有的,但这些学生一般去了工业界,拿很高的工资,纯粹做 model training 去了。" 七、与竞争对手的区别 现在做 KV Cache 优化的公司不少,方案各异。Tensormesh 的不同在哪? 江鋆晨的回答分两层。第一层是先发与生态:"我们做这个事情比所有人都早——第一个做这方面的 research,第一个做开源,也是最早有 commercial product 出来的。" 在开源生态上,LMCache 在所有类似的努力里 ecosystem support 最好、用的人最多,而且现在已经不只是他们公司在维护,很多公司都在维护它。但他很诚实:"如果纯说系统技术、就做存储 KV Cache 这些事,我们做的东西跟别人功能上没有太大区别。" 真正的区别在第二层:"绝大多数做 KV 优化的公司,所谓优化就是把它存起来,最多做做压缩,也就到这个程度了。很难有公司有能力,把我刚刚说的那些系统优化都打通。" 而要有一套真的系统、真的 artifact 把这件事做好,让很多人顺利用起来、让很多公司以开源形式贡献——"我有信心说,这没有其他公司可以做得那么好。" 未来趋势 说到压缩,他认为压缩肯定会让每一份 KV Cache 的存储需求变小——但这不代表总的存储需求会下降。杰文斯悖论是计算机系统里很早就有的规律——你把系统效率做得越高,需求量可能也越大,甚至超过效率提高的速度。 他举了一个他们认为独有的技术——CacheBlend:"传统上 KV Cache 只能在前缀上做复用。如果复用的 text 不在前缀,这个 KV 就不能复用,因为它不包含和前缀的关系。它需要被 update 一下、改一下之后才能复用,而这个改的过程,就需要计算。" 由此他给出了一个对理解这家公司至关重要的定性: 所以 KV Cache Storage 不仅仅是个 storage,它是个 service——里面是有 smart intelligence 的。你要把内容改一小下,才能让它复用起来。这样的话,这个存储系统里面就需要有计算能力。所以它不仅是一个存储的问题,也是一个计算的问题——这里面就牵扯到,你真的需要懂系统,也需要懂 ML。" 当被问到未来大量多模态数据应该如何存储。他指出,多媒体输入会让"长输入"的情况越来越多,而这又自带大量冗余的语义信息,有很大的压缩空间。他甚至抛出一个 research idea:在视频里,同一个 video 的 480P 和 1080P,算不算同一个 input?它是一个 input,但转成 token 之后长得完全不一样——这里有很多复用的优化空间。 八、经济账:以存代算,与存储的周期 Tensormesh 的商业本质,建立在"算力贵、存储便宜,用存来代算"的逻辑上。可现在存储一直在涨价,GPU 也在涨。这笔账该怎么算? 江鋆晨对存储涨价的判断很清晰:"存储价格贵,是因为供需不太平衡。只要产能上去了,这些 storage 都可以卖得出去,价格就会下来。" 当然不会下得那么快,因为很多存储厂商的订单都已经订到两年之后了——但长期来看,价格是会下来的。 那经济账应该怎么算?他给的框架是:到底应该多少钱花在硬件上,多少钱花在软件上。 "很多优化是发生在软件层面的。与其花更多的钱去买更多 GPU memory、买更多 storage 和更贵的 GPU,不如想想,是不是有软件的方法,可以让你用现在的 GPU 和现在的 memory 做到类似的事情。其实有很大的提高空间。" 这一轮存储周期,会不会不一样?他类比了大数据时代:当年云厂商的 balance sheet,是按"大家过来租一些机器"来想的;但大数据出来之后,需要的存储、算力、use pattern 都完全不一样了。AI 也有一个全新的 usage pattern,和当年的 cloud 不一样,和大数据也不一样。 "有可能存储会一直是个头痛的大问题,也有可能模型会变得越来越多——比如 RL training 会把一个模型变成 30 个版本,那 GPU 的用量反而会更高。所以这些都是 we'll have to see,不是现在可以很直接预测出来的。" 九、一个经典的系统 Tradeoff,与它的例外 把记忆放到更冷、更慢的存储层,会不会让整个推理变慢? 江鋆晨说,这本质上就是一个计算机系统里非常经典的 tradeoff——计算和存储的 tradeoff。传统上,你减少了计算,就需要存更多,速度就会降低。 但大语言模型里,有一个很有意思的例外: "如果你存的地方够快——比如在 CPU 里存,甚至 local SSD 或者 GDS(GPU direct storage)里存——它可以既让你省掉很多 GPU 计算、帮你降本,同时把这些东西取回 GPU 复用的速度,反而比重新计算要快。既帮你降本,又帮你提速,这是非常好的事情。" 当然,如果存到更冷、更远端的设备,loading KV Cache 的时间会变长,在某个点上会出现"省了成本,但延迟有所增加"。不过他观察到,由于 KV Cache 的 size 越来越小(有压缩),"一般只要网速不低于几个 Gigabyte per second,存储 KV Cache 都是有好处的——既减少 cost,也提高速度。" 而"哪一层存储受益最大",他说完全取决于每一层的价格——比如 SSD 如果因为稀缺被推到很高的价格,存 SSD 就不那么经济;但如果模型特别大、KV Cache 特别大,必须存 SSD,那它还是有很大的好处。 那如何保证热的 KV Cache 在快的地方、冷的在慢的地方? "这个问题在学术界很难解决,在一个产品里面也很难解决。你必须得把决定权——KV Cache 存在哪的决定权——给真的 operator、真的用这个系统的人。" 因为如何判断一个 KV Cache 是热是冷、下一秒会被用还是十分钟后被用、是不是每天八点钟都用——这些靠产品本身去猜很难。"你必须得有一个 interface,让真的用这个系统的人,去表达他的 domain knowledge。" 这也是他们 vision 的一部分:不做一套 transparent(透明)的 KV Cache 系统,而是让公司里真正接触系统的人的知识,也能用在把产品变得更好的过程中。 十、历史的回响:KvCache之于CDN "CDN 是 2000 年左右非常火的一个概念。最早、最好的供应商之一叫 Akamai——Akamai 就是当年的 OpenAI,火到这种程度。因为它在互联网刚开始的时候,是一个非常重要的组件。没有它,每个人看网页都得花十秒甚至更长;有了 Akamai,直接半秒钟就给你了。" Akamai 干的事,就是把数据放在用户非常容易接触到、delay 非常低的地方。 "我们一开始说 KV Cache 的时候就在想:是不是应该做一个 CDN for KV Cache?这样模型在需要 KV Cache 的时候,就可以从非常近的一个地方把它挪过来。" 只不过他们后来发现,今天的模型大多还跑在同一个 data center 里。"那我就先在一个 data center 里面,做一个类似 mini CDN 的东西——那其实就跟现在做 KV Cache storage 差不多。" 那未来数据中心之间互相连接、向更大的规模扩张,是不是对他们更利好——他说:"过两三年之后,inference service 可能会变得更分布,尤其是 Edge AI 出来之后更分布。分布式之后,就会需要一套 Internet scale 的 distribution system,那可能就会回到我们两年前说的 knowledge delivery network 的那种感觉。" 为什么现在还都在一个 data center 里?因为对 cost 来说这最省,而且大家对延迟的要求还没那么高——毕竟一开始大家做的都是 chatbot,生成速度够人看就行。"但 Agent 不一样。人是读人生成的东西,而 Agent 生成的东西是给它自己读的——你生成得越快,Agent 跑得越快。" 当对延迟的要求越来越高,大家就会希望把推理硬件放到离终端用户越近的地方。 "那个时候,模型离用户越来越近,模型跟模型之间的距离就会越来越远。现在是所有人在网络的周边,模型和硬件全在中间;但以后,可能就需要一个 Internet 2.0——一个模型之间的 Internet,到那个时候,就会有一种新的 CDN 出来。我们当时可能想得太乐观了,但三年里这件事没有发生,不代表六年、十年不会发生。" 十一、Tokenmaxxing 与 Jevons 悖论 当被问到如何看"token maxxing",江鋆晨坦言公司并没有在做这件事,但他的粗浅理解是:大家对 AI model 的能力有很强的自信,于是把越来越多、越来越复杂的任务都放到 model 上,token 消耗越来越高;甚至 AI 做了个错误的决定,还需要 AI 去 fix,token 用量进一步增加。 "这就像神灯一样,大家觉得搓一搓,什么都能解决。但 some point,大家会意识到这个 cost 并不一定能 justify 它的 benefit——这不代表技术不行,只是需要更好的方法来利用这个技术。" 而这恰恰是很多 agent 公司火起来的原因:它们帮你找出哪些 token、哪些 context 是真正有用的,给工程师更好的界面去 express their intention,从而减少 token 用量。"这些对我们来说,都是好事。""现在大家做 token maxing,都是以野蛮生长的方式去写 agent——模型看过什么、生成什么,就直接放到 context 里面,下次继续让它读。相当于每次问模型:这是你之前看到过的所有东西、说过的所有话,你读一遍,回答新的问题。这真的是非常 naive 的方法,而且非常消耗 token。"很多公司在做 compression,把以前的东西 compact 一下;但很多东西没法压缩,只能让它重复利用。"而你复用,不需要复用所有的东西——这就是我们技术有用的地方之一。" 野蛮生长的时候,大家复用的都是前缀;但聪明一点,会有很多"非前缀"的复用——这正是 CacheBlend 被很多公司感兴趣的原因:它让大家做更有效率的 token maxing,不需要让模型一直把以前所有东西再看一遍。 十二、格局:大模型像在线视频,不像搜索 对大模型的终局,江鋆晨给了一个清晰的判断框架。他说,历史上一种很强、每个人都需要用的技术,最后会有两种商业终局: 第一种,像搜索——谷歌一家独大,其他份额小到多数人都听不到,大公司也都用谷歌。 第二种,像在线视频——YouTube 是最大最好的,但还有 Netflix,还有 HBO、BBC、Hulu 这些叫得上名、也非常重要的视频网站。它们的流量没有 YouTube 大,但很多人都觉得离不开,都是非常成功的商业模式。 "我觉得大模型有可能最后会更像在线视频。会有少数公司非常大、consolidate,但也会有很多 service 需要它自己独立的生存空间,并且也非常重要——它们有自己的生态。" 而这背后,藏着 Tensormesh 的机会:"有很多情况,是不能用第三方闭源模型甚至闭源服务的。比如主权 AI,比如客户信息、商业机密保护得非常好的企业级用户——他们永远需要一套自己可以维护、自己可以控制的软件系统。" 谈到中国模型,他的评价很直接。2025 年的 DeepSeek、2026 年最近智谱的 GLM,表现都很惊艳。背后原因很多,他没有深入展开,但结果是清楚的: "除非有很大的改变,未来几年里面,开源模型可能还是得看国内的开源模型。" 当被问到如果未来换成 Mamba 这种新架构,它产生的"笔记"完全不一样,不一定是 KV Cache影响会怎样?江鋆晨回答 KV Cache其实是一个暂时的名字。它更本质的概念,是 model native data、AI native data。是模型在推理、在运行过程中生成的中间状态,是它自己内部的理解。" "这种数据,在 Mamba 里也有,在 diffusion model 里也有,在以前的 convolutional neural network 里也有——所有 model 都有。只不过在现在这个阶段,Transformer 是最 popular 的 architecture,而 KV Cache 就是 Transformer 的 AI native data。" 他也给了对 Mamba 现状的判断:Mamba 的 intermediate data 是线性的、跟文本长度不直接相关。但 Mamba 现在用得并不多——很多模型只是用 Mamba 的架构去替换中间的某些层。"像千问 3.5,它多数层是 Mamba,但有大概四分之一的层,还是用 full attention、还是 Transformer。所以现在业界的共识,是把一些 Mamba、一些 Transformer 结合起来,做所谓的 hybrid model。" 至于最近 xAI 收购 Cursor,他说这本身就是一个趋势:"推理厂商、agent、底层模型、service provider,大家都在 consolidate,这肯定会发生——就跟当时做 cloud、做 container service、做 big data 一样,一开始百花齐放,但很快大家都会 consolidate。" Cursor 对 xAI 肯定有商业价值,但这只是众多并购里的一个例子。"以后可能每个月、甚至每个礼拜,你都会听到一个比较大的收购。" 尾声:AI时代的汽油 对话的最后,我们抛出了一个比喻,KV Cache 是 AI 时代的汽油。 因为在提炼石油的时候,汽油曾经只是一个副产品,长期被当作废弃的燃料——直到内燃机出现,它才被重视,并成为驱动整个现代工业的核心。 江鋆晨说,这个比喻非常好。绝大多数人看 KV Cache 的时候,知道它就是模型在跑的时候生成的一个 by-product,在 GPU 内部存一会儿之后就丢了。当然,做 ML 的人知道,KV Cache 是非常有意思的信息——但他们接触不到 KV Cache。 "所以现在是,懂 KV Cache 的人接触不到它,接触得到 KV Cache 的人不懂它。但哪天真的有一家公司,把这个价值给挖出来了——那它就从废料变成宝了,就跟汽油一样。" 那么,那个"内燃机时刻"会是什么时候? 他的回答非常自信: "取决于我们公司的发展。"
硅谷坐标 x 喜马拉雅资本常劲:AI时代的价值投资科技迭代日新月异,习惯用十年、二十年的尺度看世界的价值投资者如何看待眼下这场AI浪潮? 带着这个问题,《硅谷坐标》主持人曹卿云对话了喜马拉雅资本副董事长兼 COO 常劲。喜马拉雅资本是长期主义最重要的代表之一:他们践行着巴菲特、芒格的价值投资体系,常年低换手、长期重仓,相信时间与复利的力量。 这场对谈从查理·芒格聊起,延伸到 AI、价值投资、谷歌与英伟达,再到华人公益与下一代教育——给出了一个更冷静、也更适合长期主义者的视角。 时间轴: 01:15 从芒格身上学到的东西:Worldly Wisdom 与多元思维模型 07:15 当下AI时代与历史周期相比的同异 16:00 AI做研究的边界 24:31 AI对价值投资是赋能还是挑战 19:12 AI能否帮人建立芒格式的跨学科思维模式 20:58 13F加仓谷歌公司的原因 25:50 如何看半导体行业的此次周期 27:45 如何看大模型竞争格局 30:15 如何看英伟达生态位 31:05 华人在美生态位 35:00 华人基金会与长期主义 42:40 AI时代如何培养下一代
Neocloud崛起:AI算力基建的"第四朵云"📌 看点简介 本期节目《硅谷坐标》主持人曹卿云对话Valliance璞林资本首席投资官Kenny Zhang,系统拆解近期AI算力赛道连环异动背后的产业逻辑——Anthropic向竞争对手xAI采购算力、CoreWeave合同积压突破990亿美元、谷歌联手黑石成立独立TPU公司,这些信号共同指向一个正在崛起的产业新物种:Neocloud(AI原生云)。一起探讨OpenAI与Anthropic的算力储备路线、Neocloud的估值和护城河、推理与Agent对AI基础设施的最大变量和核心瓶颈如何演绎、下一代存储层的真正赢家等。 嘉宾介绍 Kenny Zhang,Valliance璞林资本首席投资官,长期跟踪全球算力基建与云计算产业演进 ⏱️ 时间戳 00:00 开场:近期算力市场发生了什么? 01:40 从大型机到Neocloud,三次范式切换 06:40 Neocloud存在的三个底层逻辑 12:02 全球AI算力真实地图——OpenAI只占10-15% 14:00 AI Lab采购策略分化 18:40 Neocloud的两个派系——做第四朵云,还是做硬件租赁 27:00 供给端主要玩家解析:CoreWeave、Nebius、FluidStack三大派系 30:20 两种资本打法:CoreWeave高杠杆 vs Nebius低杠杆 35:30 商业模式折旧悖论:GPU会贬值,凭什么借长债 45:00 资本市场最大误区: 990亿积压订单的真相—瀑布型现金流 55:00 微软/CoreWeave/英伟达:三角关系本质 01:03:50 黑石+谷歌TPU Neocloud的战略意图 01:07:26 Neocloud真正的护城河 🌍硅谷坐标 立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 📮 联系我们 硅谷坐标欢迎评论区留言交流,转发支持!长期招聘主持人、研究员、编辑、摄像和后期视频团队。也欢迎加入我们的志愿者团队,参与一线前沿的讨论和采访。我们的志愿者由科技从业人员、专业投资人和媒体团队组成。
硅谷坐标 x FundaAI创始人周默:四大科技公司财报后的AI产业深度观察📌 看点简介 4 月 29 日,谷歌、微软、亚马逊和 Meta 同一时间交出了 2026 年第一季度财报。 表面上看,四家公司业绩几乎都超过市场预期;但资本市场真正关心的问题并不是“赚了多少钱”,而是:AI 这场史无前例的资本开支竞赛,到底还能烧多久?什么时候才能真正转化成收入和利润? 过去几年,四大科技巨头的 AI 投入正在快速吞噬现金流。2023 年,它们的资本开支大约只占运营现金流的 40%;到 2026 年,这个比例预计将接近 90%。四家公司合计资本开支超过 6300 亿美元,AI 基础设施建设正在成为科技史上最大规模的资本再配置之一。 本期《硅谷坐标 Silicon Valley Vector》,我们邀请到 FundaAI 创始人周默,一起拆解谷歌、微软、亚马逊和 Meta 财报背后的 AI 产业账。 从 Google Cloud 增速和 Gemini 生态,到 Microsoft Azure 与 Copilot 的商业化压力;从 AWS 的 AI 基建投入周期,到 Meta 在 Llama、广告系统和超级数据中心上的长期押注;我们试图回答一个核心问题: 当 AI 从技术叙事进入财务报表,四大科技巨头到底是在提前锁定下一个十年的入口,还是正在进入一场越来越昂贵的军备竞赛? ⏱️ 时间戳 00:00:00 开场|科技大厂与半导体的市场分化 00:01:20 估值框架|芯片稀缺与模型高估值 00:06:00 AI支出|本轮开支扩张的核心驱动 00:10:47 AI支出|硬件涨价与 Capex 传导 00:16:38 AI收入|定义差异与质量判断 00:33:36 谷歌|云增长与广告变现改善 00:46:48 微软|失去独家后的竞争基础 00:55:24 微软|Copilot 的变现天花板 00:58:00 亚马逊|AWS 加速的收入与利润逻辑 01:05:02 Meta|广告提效与 AI 长期价值 01:27:06 AI商业化|增量还是替代 01:31:12 结尾|Capex 与 AI 收入缺口收敛 💬 金句预览 “今天花的是建设费,明天收的是租金。数据中心不是消耗品,它是资产。” “创业公司一周就已开始开始做一个很大的迭代了。但是对于一个大公司来说,三周可能PPT到汇报的流程都还没做完。” “模型公司的话语权越来越强,不和你绑定也是必然的趋势。” “以后评价工程师的标准就是:你是原来人力 Coding 编程师的时候几倍?这个倍数可以直接按照 Coding API 的 Consumption 看出来。” “短约价格就像五一假期的酒店价格,最能反映短期供需。” 📖 专业词汇 Capex / Capital Expenditure:资本开支。公司用于建设长期资产的钱,比如数据中心、芯片、服务器、电力、网络设备。本期核心概念。四大科技公司为了 AI 数据中心投入巨额 Capex,市场担心这些投资什么时候变成收入。 Opex / Operating Expense:运营费用。公司日常经营开支,比如人力、销售、研发、行政费用。AI 不只是替代 IT 预算,更大的市场可能是替代企业 Opex,比如客服、工程师、运营岗位。 Neocloud:新型云厂。专门围绕 GPU / AI 计算资源建立的新云服务商。模型公司不一定只找传统云厂,也会找 Neocloud 获取算力。 1P Data Center:第一方数据中心。模型公司自己建设或控制的数据中心。OpenAI 曾有 1P Data Center 计划,但执行难度很高。 3P Rental / Third-party Rental:第三方租赁。通过云厂或其他服务商租用数据中心和算力。大多数模型公司的算力需求转向 3P 租赁。 Inference:推理。模型训练完成后,用模型回答问题、生成内容、处理任务的过程。企业调用 API、用户使用 ChatGPT、广告系统调用模型,都属于推理需求。 Free Cash Flow:自由现金流。公司经营现金流减去资本开支后剩下的钱。Amazon 的例子里,资本开支把自由现金流几乎吃掉,市场担心现金流被 AI 投资压缩。 Operating Cash Flow:经营现金流。公司主营业务实际产生的现金。文稿中提到四大科技公司 Capex 占运营现金流比例越来越高,说明 AI 建设正在吞噬现金流。 ROIC / Return on Invested Capital:投入资本回报率。衡量公司投入的钱能产生多少回报。华尔街问 Meta:1450 亿美元 Capex 到底如何衡量回报?这是市场最关心的问题。 ASIC / Application-specific Integrated Circuit:专用集成电路。为特定任务设计的芯片。TPU、Trainium、Maia、MTIA 都可以放在 ASIC 自研芯片的大框架下理解。 P/E Ratio:市盈率。公司市值相对于净利润的倍数。用来讨论模型公司估值到底贵不贵。周默提到如果从远期利润看,模型公司不一定贵。 Query:搜索查询。用户在搜索框中输入的问题或关键词。Google 很多 Query 过去没有变现,AI 可以理解长 Query 的商业意图。 ARR / Annual Recurring Revenue:年化经常性收入。通常用于 SaaS、API、订阅型业务,把当前收入水平年化。用来衡量 Anthropic、OpenAI、Gemini 等模型公司的商业化速度。 HBM / High Bandwidth Memory:高带宽内存。AI 芯片中非常关键的内存类型。AI 训练和推理需要大量 HBM,内存涨价会推高 Capex。 Incremental Revenue:增量收入。相比之前多出来的收入。用来判断新的 AI 投入是否真正带来额外收入,而不是把原有收入重新贴上 AI 标签。 Backlog:积压订单。已经签约但还没交付、还没确认成收入的合同。云厂的 Backlog 可以反映未来 6 到 12 个月的收入确定性。 RPO / Remaining Performance Obligations:剩余履约义务。公司已经签下但还没有完成交付的合同金额。云业务中非常重要的领先指标,代表未来收入的可见度。 Gross Margin:毛利率。收入扣除直接成本后剩下的比例。云厂租 GPU 和租 TPU 的毛利率不同,自研芯片可以提高毛利率。 Operating Margin:经营利润率。经营利润占收入的比例。AWS、GCP、Azure 的利润率变化,是判断云业务质量的重要指标。 Margin Dilution:利润率稀释。新业务收入虽然增长,但毛利率较低,拉低整体利润率。市场担心 AI 云收入虽然增长,但 GPU 租赁和大客户合同会稀释云厂利润率。 High-quality Revenue:高质量收入。通常指可持续、毛利率高、客户分散、可重复的收入。Anthropic 或 OpenAI 带来的云收入是否高质量,是投资人担心的问题。 Low-quality Revenue:低质量收入。可能依赖单一大客户、毛利率低、议价能力弱的收入。AWS 和 Azure 被市场质疑,部分 AI 收入来自模型公司,可能议价能力不够强。 Bargaining Power:议价能力。产业链中一方对价格、合同、资源分配的控制力。模型公司越来越强,云厂的议价能力可能被削弱。 🗂️ 内容大纲 一、开场:科技大厂与半导体的市场分化 * 同样押注 AI,为什么英伟达和半导体产业链持续跑赢,而微软、Meta、亚马逊等科技大厂却反复承压 * 2026 年 Capex 被市场重新计入估值模型后,大厂自由现金流被显著压缩 * AI 投资的核心矛盾:今天花的是建设费,明天能不能变成持续租金 * 市场真正担心的不是 AI 有没有价值,而是收入加速能不能追上资本开支 二、估值框架:芯片稀缺与模型高估值 * 为什么利润率最高的地方在芯片层,但估值最高的公司却可能是模型公司 * 从 P/E 到 ARR:为什么模型公司的估值要用远期收入和利润率重新理解 * 模型公司正在变成新的“入口”:从 SaaS 时代的公有云,到 AI 时代的模型 API * 云厂角色变化:从直接面对客户的强议价方,变成模型公司的下游基础设施提供者 三、AI 支出:本轮开支扩张的核心驱动 * 这轮 Capex 扩张不是单一军备竞赛,而是经历了多轮需求逻辑切换 * 从数据不足、Coding 爆发,到强化学习和后训练体系跑通,算力需求不断出现新的增长点 * Frontier Labs 收入体量变大后,增速不但没有下降,反而继续加速 * 判断 AI 算力是否过剩,不能只看 Capex,而要看 GPU 租赁价格、交付周期和短约价格 四、AI 支出:硬件涨价与 Capex 传导 * GPU 长约、短约和现货价格如何共同反映真实供需关系 * 为什么短约价格像“节假日酒店价格”,最能体现短期供需紧张 * 存储长协价格上调后,不是一次性影响,而是会传导到未来多个季度的 Capex * AI 数据中心建设成本上升,不只是扩张带来的,也包含芯片、内存、存储等硬件通胀 * 自研芯片的产业意义:把原本付给 Nvidia 的钱,留在云厂自己的利润池里 五、AI 收入:定义差异与质量判断 * “AI 收入”不是一个统一口径,不同公司统计方式完全不同 * 微软:GPU 租赁、OpenAI API、Copilot、Fabric 等产品增量都可能被计入 AI 收入 * 亚马逊:Bedrock、Anthropic API 分成、Trainium、自有 AI 服务共同构成 AI 收入 * 谷歌:GPU、TPU、Gemini、Vertex AI 等构成更完整的 AI 收入闭环 * Meta:AI 对推荐算法、广告转化、Coding 效率的贡献难以单独量化 * 判断 AI 货币化的关键,不是只看披露数字,而是看收入增速、Backlog、RPO 和利润率质量 六、谷歌:云增长与广告变现改善 * GCP 的加速来自 Gemini、TPU 租赁、TPU 直销和 AI 云需求共同推动 * 谷歌的独特优势:同时拥有模型、芯片、云和搜索广告场景 * TPU 的战略价值:更低训练成本、更高云毛利率、更强客户议价能力 * TPU 供不应求的根源:不是需求不足,而是 CoWoS 等先进封装产能限制 * 搜索广告的反常识:Google 仍有大量 Query 过去没有被有效变现 * AI Overview 和 PMax 让长 Query 的商业意图被重新识别,打开新的广告增量空间 七、微软:失去独家后的竞争基础 * OpenAI 不再是微软的独家资产,Azure 的核心差异化正在被重新定价 * 对 OpenAI 来说,进入 AWS 和更多云平台,是获得开发者市场和算力弹性的必然选择 * 对微软来说,分发更多 Anthropic、OpenAI 之外的模型,也符合 Azure AI 平台化方向 * 模型公司话语权增强后,不和任何单一云厂绑定成为必然趋势 * Azure 的未来竞争力,不再只取决于 OpenAI,而取决于它能否成为多模型、多 Agent、多企业工作流的平台 八、微软:Copilot 的变现天花板 * Copilot 从按 Seat 收费走向按 Consumption 收费,是微软 AI 收入的关键变化 * Office Copilot 的渗透率仍然有限,真正的增量可能来自 Copilot Studio * Copilot Studio 的逻辑:企业搭建内部 Agent,用得越多,Token 消耗越大,收入越高 * 但企业 Agent 赛道竞争高度重叠:Copilot Studio、Palantir AIP、Gemini Enterprise、OpenAI、Anthropic 都在进入同一战场 * 微软最大的挑战:它既是云公司,也是全球最大的软件公司,Office 既是护城河,也可能成为 AI 原生转型的包袱 * Agent 时代的速度差异:创业公司一周迭代,大公司三周可能还在 PPT 汇报流程里 九、亚马逊:AWS 加速的收入与利润逻辑 * AWS 从“不被买账”到重新加速,核心在于 Capacity 问题逐步缓解 * 亚马逊像一家硬件属性很强的云公司,希望在数据中心、电力、冷却和自研芯片层面把问题一次性解决 * Bedrock 的增长与 Anthropic 的收入增长高度相关 * Anthropic 的 API 增长,让 AWS 同时获得云收入、模型分发和自研芯片适配机会 * Trainium 的反转:从需要打折推广的芯片,变成供不应求、能够支撑利润率的业务 * AWS 投资模型公司的战略逻辑:锁定算力需求、芯片使用场景和 API 分发份额 十、Meta:广告提效与 AI 长期价值 * Meta 的广告展示量和广告单价同时上涨,背后是产品形态和广告库存结构的变化 * Overlay Ads / Partnership Ads 让 Meta 开始走类似短视频软广的路径 * 推荐算法的 AI 提升是有效的,但贡献通常是小几个点,不是无限放大的收入引擎 * AI 对 Meta 的短期价值:提升推荐、优化广告投放、降低素材制作和客服成本 * AI 对 Meta 的长期价值:通过 Chatbot 和 Search 拿到更多用户意图数据,扩展旅游、汽车等原本更偏 Google 的广告品类 * Meta 大模型的定位不是正面对外挑战 OpenAI,而是更好服务自己的推荐、广告和产品系统 * Meta 股价承压的核心:不是 AI 没效果,而是 Capex 加速和收入加速之间出现错配 十一、AI 商业化:增量还是替代 * 现阶段 AI 的很多商业化来自效率提升和人力替代,而不是完全新增的消费需求 * AI 最大的市场可能不是传统 IT Spending,而是企业更大的 Opex 成本池 * IT Spending 可能只占企业收入 3% 到 4%,但 Opex 可能占 30%,这是更大的替代空间 * Coding 是最先被重塑的领域之一,工程师的评价标准从“会不会写代码”变成“能管理多少 Agent” * AI Coding 让生产力按月迭代,也让用工结构和岗位标准出现不可逆变化 * 长期问题:AI 如果大规模替代人力,就会引出福利、转移支付、AI 裁员税、Token 税等社会再分配议题 十二、结尾:Capex 与 AI 收入缺口收敛 * 当前 AI 收入和 Capex 之间仍有明显缺口,但这个缺口正在缩小 * Capex 是提前为未来数年建设基础设施,而 AI ARR 会随着模型公司和云服务增长持续释放 * 市场从去年担心“Capex 增速远高于收入增速”,转向今年开始看到模型公司 ARR 加速 * 真正的关键指标:Incremental Capex 和 Incremental Revenue 是否越来越接近 * 如果 AI 收入持续加速,市场对巨额 Capex 的担心会逐步减弱 * 最终问题不是“AI 会不会赚钱”,而是“谁能在芯片、云、模型和应用之间拿到最多利润” 🌍硅谷坐标 立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 📮 联系我们 硅谷坐标欢迎评论区留言交流,转发支持!长期招聘主持人、研究员、编辑、摄像和后期视频团队。也欢迎加入我们的志愿者团队,参与一线前沿的讨论和采访。我们的志愿者由科技从业人员、专业投资人和媒体团队组成。
🎙️ 硅谷坐标 EP05 | 全球光互连龙头 TeraHop 副总裁于让尘:AI 光互连的超级周期📌 看点简介 AI 基础设施的真正瓶颈,已经悄悄从"算力"转移到了"通信"。过去三四年,AI 算力增长了 300 倍,而光互连只增长了 30 倍——这 10 倍的 Gap 有一个直接的名字,叫通信墙。打穿这堵墙的关键技术,正在迎来高成长的超级周期。 本期,我们邀请到 TeraHop 副总裁、前中华光电学会主席于让尘(Ryan Yu)博士一起聊聊光互连行业正在经历的这场技术革命和产业格局。 从 Scale Up / Scale Out / Scale Across 的三重互连场景,到可插拔 / NPO / CPO 的三条技术路线;从 NVIDIA 斥资 40 亿美金战投 Lumentum 和 Coherent 背后的垂直绑定信号,到 OFC 上突然爆发的开放标准生态;从谷歌 Ironwood TPU v7 + OCS 构建的"最强大脑",到硅光、薄膜铌酸锂、III-V 族化合物半导体三条重要技术路线的融合演进。 ⏱️ 时间戳 00:00 AI 时代的通信墙 03:05 光互连在 AI 算力中的不可替代性:脑灰质与脑白质 05:48 AI算力集群互连的Scale Up,Scale Out,Scale Across 11:19 光进铜退的经济账 14:09 可插拔 / NPO / CPO 三条技术路线深度拆解 15:25 硅谷大厂的技术选择:谷歌、Meta、亚马逊、英伟达的路线差异 20:58 光方案的技术演进路线 26:10 12.8T的带宽飞跃 27:26 英伟达 40 亿美金战投 Lumentum & Coherent 的产业信号 30:36 OFC多元协议与开放生态 34:55 OCS 光交换 vs 电交换:谷歌 10 年布局与行业机会 42:15 光模块厂商的未来布局 43:36 实现 400G per lane的重要技术路线:硅光 / 薄膜铌酸锂 / EML激光器 45:15 万亿美金级价值链重塑&发展瓶颈 48:44 5-10 年展望 💬 金句预览 "算力过去四五年发展了 300 倍,而 AI 连接只发展了 30 倍。这个差距有 10 倍的 Gap 要去填补,必须整个业内一起来努力。" —— 02:35 "Use copper when you can, use optics when you must.(能用铜就尽量用铜,必须用光就用光。)" —— 11:38 "所有的互连网公司他们是很实际的,他们不会做宗教式的选择。" —— 19:29 "可插拔模块、NPO、CPO——甚至同一个互连网公司,它三项都选,叫做成年人不做选择题。" —— 20:48 "谷歌已经走在最前面 10 年,其他互连网公司还基本是零——这对供应商来讲是一个 Greenfield 机会。" —— 38:10 "哈哈哈,这个很快变成一个万亿级别的问题。" —— 45:15 "大家应该把光互连看作算力的一部分——而不是把算力和互连看作互相争夺资源的两块,而是一个共生、共同成长、共同优化的生态。" —— 49:03 📖 专业词汇 光互连 Optical Interconnect:用光信号替代铜线中的电信号来传输数据。更高带宽、更低延迟、更少能耗。在大模型时代从"数据中心的基础设施配件"上升为"AI 算力架构的核心变量"。 通信墙 Communication Wall:AI 算力增长远远超过互连带宽增长(300x vs 30x)带来的瓶颈——芯片越来越强,但"把它们连成一个系统"的能力增长最慢。今天 AI 集群算力跑不满,很大一部分就损失在这堵墙上。 Scale Up / Scale Out / Scale Across: AI 集群互连的三重场景。Scale Up 是机柜内互连(距离最短、带宽要求最高);Scale Out 是机柜间互连(构建大训练集群);Scale Across 是跨数据中心互连(解决单个数据中心的电力/土地极限)。 可插拔(Pluggable):光模块的经典形态——像 U 盘一样插在交换机上,灵活、易维护、供应链开放。TeraHop 的 12.8T XPO 是目前最具代表性的下一代高速可插拔方案。 LPO(Linear Pluggable Optics):可插拔的"低功耗版本"——把传统可插拔模块里最耗电的 DSP 环节拿掉,保留易维护性,更适合 AI 集群。 NPO(Near-Packaged Optics):近封装光学——光模块往主芯片靠近一步,但还没完全封装在一起。是可插拔和 CPO 之间的中间路线。 CPO(Co-Packaged Optics):共封装光学——把光引擎和主芯片深度封装成一个整体。带宽密度最高、电路径最短(毫米级)、延迟最小,被公认是下一代超大规模 AI 集群的终极形态。英伟达 Rubin 架构首次采用 CPO,被视为光互连近十年来最大架构变革。 OCS(Optical Circuit Switch,光交换机):不同于传统电交换机一站站接收/判断/转发数据包,OCS 直接建立端到端的光路径,让数据沿专用通道通过。功耗低、延迟小、成本优。谷歌用 OCS 构建了 9,216 颗 TPU 的 Ironwood 超级大脑。 Coherent Light(相干光传输):一种高级光调制技术,天然具备放大作用,链路预算更高。与 OCS 是天然搭档——能弥补 OCS 的信号损耗,让光交换方案在未来更高速率下依然跑得动。 硅光 Silicon Photonics:在硅衬底上用半导体工艺(CMOS 兼容)集成光学器件的技术平台。让光器件像芯片一样在 12 英寸晶圆上大规模量产,是过去几年整个光互连行业最重要的底层变化。 TFLN(Thin-Film Lithium Niobate,薄膜铌酸锂):下一代高性能电光调制器的材料平台。可以嫁接到硅光平台上形成混合集成方案。 III-V 族化合物半导体:激光光源的主流材料(InP 系列),代表器件包括 DFB、EML 等。硅本身不发光,所以激光器至今是光互连绕不开的关键组件。 MSA(Multi-Source Agreement):行业多源协议——多家公司共同制定的开放标准,避免被单一供应商绑定。今年 OFC 出现了 LPO MSA、Open CPX MSA、SDM4 MCF 三大新标准,100+ 公司参与。 NVL72 :英伟达最新一代机架式 AI 大脑(72 颗 GPU 通过铜缆互连。 Ironwood(TPU v7):是谷歌 2025 年 4 月发布的 9,216 颗 TPU + OCS 的超级大脑。两条路线的代表作。 光进铜退:随着单通道速率向 200G/400G 迈进,铜缆物理极限(1–2 米)逼近临界点,光互连逐步取代铜互连成为确定性趋势。 脑灰质 vs 脑白质:于博士贯穿全期的类比——灰质是计算(算力),白质是连接(互连)。人类大脑两者比例接近 1:1,而 AI 数据中心今天光互连只占 10–20%。"我们还在猫的阶段。" 🗂️ 内容大纲 一、通信墙:AI 算力 300 倍 vs 光互连 30 倍增长 * 算力、存储、互连:AI 集群发展的三个绕不开的主题 * 3 万美金的 H100 为什么跑不满:互连上的限制最终变成算力上的限制 * 光互连已经不是配件,是必选项 二、三重互连场景:Scale Up / Scale Out / Scale Across * 机柜内、机柜间、跨数据中心——三种距离对应三种解决方案 * Meta 的曼哈顿规模数据中心园区:Scale Across 的极限案例 * 为什么 Scale Up 是光互连的最大增量 * NVL72 逼近铜缆物理极限:光进铜退的拐点 三、Scale Up 技术路线的"成年人不做选择题" * 可插拔 / LPO / NPO / CPO 四条路线的本质差异 * 大厂的真实选择逻辑:没有宗教式的信仰,只有场景化的最优组合 * TeraHop 的策略:"让三条马都在跑" 四、市场信号冲突:GTC 的垂直绑定 vs OFC 的开放爆发 * NVIDIA 40 亿美金战投 Lumentum & Coherent:供应链锁定背后的 CPO 野心 * OFC 开放标准潮:LPO MSA、Open CPX MSA、SDM4 MCF 为何此时密集推出 * 100+ 公司为什么都在推开放生态:大厂不愿被任何人锁死 五、OCS 光交换:谷歌十年布局开启的产业新机会 * 从"每条链路跑多快"到"数据在网络里怎么走" * Ironwood(TPU v7):9,216 颗 TPU + OCS 的最强大脑 * CapitalG 最新加注 Celero Communications:相干光与 OCS 的天然配对 * 电交换不会消失,但 OCS 的比例会持续上升 六、半导体化的必然:材料之争与万亿美金级价值链 * 万亿美金市场的底层共识:朝晶圆级、CMOS 兼容的光电集成走 * 硅光 / TFLN / III-V 三条材料路线的并行演进与相互融合 * 激光器晶圆生态的瓶颈:3 英寸 vs 12 英寸的量级差距 * 量子点激光器 & TSMC COUPE:破局的两个方向 七、5–10 年展望:从"猫"到"人"的演化 * 大脑的演化类比:灰质(算力)和白质(连接)的比例变化 * 今天的 AI 数据中心:我们还在猫的阶段 * 光互连未来还有 5 倍以上的增长空间 八、收尾金句:"把光互连看作算力的一部分"——共生、共同成长、共同优化 🌍硅谷坐标 立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 📮 联系我们 硅谷坐标欢迎评论区留言交流,转发支持!长期招聘主持人、研究员、编辑、摄像和后期视频团队。也欢迎加入我们的志愿者团队,参与一线前沿的讨论和采访。我们的志愿者由科技从业人员、专业投资人和媒体团队组成。
龙虾的记忆—黄东旭谈重写AI Agent 时代的基础设施【本期内容】2026年4月7日,《硅谷坐标》主持人曹卿云专访PingCAP联合创始人兼CTO、资深数据库专家、连续创业者黄东旭。在对话中,我们将深度拆解AI Agent面临的记忆难题、存储新范式,以及Agent带来的基础设施重构与社会的系统性思考。 【本期看点】 01:36 普通人开始"养龙虾",Agent native产品形态正式出现 03:31 三代演进:从Prompt 到Context 再到Harness Engineering 09:15 单体Agent的灾难性失忆与compaction困境 10:28 上下文窗口 vs. 外挂记忆:短期与长期记忆的本质差异 14:38 解决记忆问题的产品哲学怎么记、怎么提取:把大模型本身当评估函数 17:28 Agent时代的数据特点与数据价值 23:31 一虾一库Agent时代数据存储新范式:兼顾安全与成本 27:17 记忆层的商业化路径:从备份订阅到领域专家知识变现 29:14 以Agent为最终使用者的基础设施生态链重构 33:16 向量数据库终局:独立向量数据库将被收敛 34:51 SQL与文件系统:经典接口在Agent时代依然是第一语言 36:25 下一个边界突破:多Agent协同下的Scaling Law 37:54 人与Agent协作的最佳范式 40:04 Agent带来的组织架构冲击:高度碎片化的部落型团队 41:37 上一个时代的软件工程的终结:在变中寻找不变 【关于硅谷坐标 Silicon Valley Vector】 立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 【加入我们】 长期招聘主持人、研究员、编辑、摄像和后期视频团队。也欢迎加入我们的志愿者团队,参与一线前沿的讨论和采访。我们的志愿者由科技从业人员、专业投资人和媒体团队组成。
硅谷坐标 x Jimmy Cheng:GTC回顾-AI时代英伟达的护城河【本期内容】2026年3月23日,《硅谷坐标》主持人曹卿云专访了华美半导体协会副会长、Synopsys新思科技企业战略部技术战略中心负责人、前幕僚长程暨杨(Jimmy Cheng),聚焦GTC重点回顾并拆解Agent时代英伟达的战略格局。 【本期看点】 01:44 GTC大会:OpenClaw引领Agent新纪元 03:55 Agent时代的英伟达护城河 07:28 产业链利润与议价权再分配 10:51 英伟达推动开源模型的考量 12:03 开源对芯片定制化的影响 13:46 推理市场与LPU的崛起 15:17 Agent时代的底层芯片架构(SRAM) 16:10 未来推理芯片市场格局 19:50 Agent时代Synopsys(新思科技)的护城河 22:10 AI会取代芯片硬件工程师吗? 24:09 AI设计芯片的边界 25:52 Physical AI:跨越Sim-to-Real的挑战 【关于硅谷坐标 Silicon Valley Vector】立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 【关注我们】 微信公众号 | B站|小宇宙 | 喜马拉雅 YouTube|Apple Podcasts|Spotify|LinkedIn|X 【加入我们】长期招聘主持人、研究员、编辑、摄像和后期视频团队。也欢迎加入我们的志愿者团队,参与一线前沿的讨论和采访。话题标签#科技 #AI #投资 #硅谷 #硬件 #趋势 #人工智能 #英伟达 #GTC #芯片
硅谷坐标 x 微软战投合伙人:AI时代软件护城河【本期内容】 3 月 12 日,《硅谷坐标》主持人曹卿云在硅谷对话微软战略投资基金 M12 合伙人 Alan Du,聚焦“AI 时代的软件护城河”:哪些软件更易被颠覆?护城河会迁移到哪里?算力投入与回报落差如何理解?Agent 支付与安全将出现哪些结构性变化? 【主持人】 曹卿云|《硅谷坐标》 【采访嘉宾】 Alan Du|M12 投资合伙人(前 PayPal Ventures Partner) 【本期看点】 00:00 开场 & 话题概览 01:10 M12投资策略 07:24 AI软件护城河 18:25 AI泡沫之争 28:42 AI收入和资本开支的落差 35:02 Agent 支付:身份/合规/微支付 41:00 AI能写底层代码吗? 46:45 强监管行业AI落地 50:12 创业建议 【关于硅谷坐标 Silicon Valley Vector】 立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 🌐网站地址:https://www.sv-vector.com ✉️联系我们: team@sv-vector.com 【关注我们】 B站 | 小宇宙 | 微信公众号 | 喜马拉雅 Youtube | Apple Podcast | Spotify | LinkedIn | X 话题标签 #科技 #AI #投资 #硅谷 #软件 #硬件 #趋势
硅谷坐标 x 田渊栋: 解析大模型护城河、记忆存储瓶颈与Agent对社会冲击【本期内容】前Meta AI Director田渊栋在Meta深耕11年,主导了强化学习、大模型推理与长上下文等多项前沿研究,近期刚刚以Co-founder身份开启新的创业旅程。本次对话涵盖大模型竞争、记忆与存储、推理前沿路线、Agents对社会的冲击等议题。 【主播】曹卿云,硅谷坐标Silicon Valley Vector创始人。 【采访嘉宾】田渊栋,CMU机器人学博士。在Meta AI(FAIR)深耕11年,担任研究总监。 【本期看点】 05:10 大模型的护城河:数据,算法,infra,人才 09:00 开源vs闭源模型比较 12:24 大模型有两种记忆:上下文是工作记忆,权重是世界观 20:20 记忆研究的核心难题:从死记硬背到顿悟的跃迁26:16 Context Window没有天花板,需求正在质变 37:39 存储危机:模型训练和推理引发的内存供应链瓶颈36:53 预训练的天花板与强化学习的上界 41:20 推理的未来:隐空间叠加态与并行推理 50:00 小龙虾Agent:一个握有你所有秘密的笨小孩 55:30 Agent时代的社会冲击:洪水已来,大多数人浑然不觉【关于硅谷坐标 Silicon Valley Vector】立足美国硅谷, 聚焦前沿科技与科技投资趋势。在 AI 重新定义人类边界的时代,我们深入科技与资本的第一现场,为全球受众提供准确、深度、独立的专业报道。 【还可以在以下地方找到我们】 B站 | 小宇宙 | 微信公众号 | 喜马拉雅 Youtube | Apple Podcast | Spotify | Linkedin | X 话题标签#科技 #AI #投资 #硅谷 #软件 #硬件 #趋势