Neil Movva:让AI和Token便宜10倍

Neil Movva:让AI和Token便宜10倍

88分钟 ·
播放数86
·
评论数0

在Bayt播客上收听任何播客的中文翻译音频,并查看双语字幕:

安卓:baytfm.com

iOS:apps.apple.com

📝 本期播客简介

本期节目我们翻译了全球顶尖商业访谈播客《Invest Like the Best with Patrick O'Shaughnessy》。本期嘉宾是Sail Research创始人Neil Movva,他与主持人Patrick O'Shaughnessy展开了一场深度对话,彻底剖析了AI基础设施从软件、芯片到电力的全栈优化逻辑。您将听到,决定AI未来成本的关键,并非一味追求更快的实时响应,而是转向后台长时间运行的智能体(Agents)。Movva将详细解释,如何通过“拾荒”策略购买被巨头看衰的芯片与分散电力,重构数据中心架构,从而将AI推理的Token成本降低10倍以上。这场对话完全基于对算力全链路的极致压榨,为您提供一个理解AI普惠化未来的清晰框架。

⚙️ 本期嘉宾

Neil Movva,Sail Research创始人,前英伟达早期工程师。他的职业生涯深耕于GPU内核优化与高性能计算架构,曾亲历张量核心(Tensor Cores)的诞生与演进。他通过独创的“吞吐量优先”推理架构与跨芯片异构调度策略,致力于打破算力垄断,让开源模型与长时智能体得以以极低成本运行。

🌟 精彩内容

🏭 “代币工厂”与后台智能体:从“快”到“省”的范式转移

当前AI市场过度聚焦于低延迟的实时聊天机器人,但Sail瞄准的是后台长时间运行的智能体。在深度研究、网络安全渗透测试等场景中,用户更关心结果而非毫秒级响应。当延迟不再是瓶颈,吞吐量与成本成为核心指标。通过牺牲部分实时性,系统可以最大化GPU批处理效率,实现“最好的延迟就是没有延迟”(早上醒来工作已完成)。

“你越是频繁地提示智能体并等待回复,实际上你就成了决定智能体工作量多少的瓶颈。我们希望智能体能按照更接近人类的时间节奏来运作。”

🔧 全栈压榨:软件内核、异构芯片与KV缓存瓶颈

降低Token成本不能只靠买便宜芯片,必须打通软件、硬件与电力。Sail从底层内核融合、专家并行(MoE)到利用非英伟达芯片(如AMD、TPU)进行套利。对话深入探讨了Transformer架构中注意力机制的KV缓存如何成为内存瓶颈,以及Cerebras等公司通过晶圆级SRAM追求极致带宽的尝试。最终结论是:单一芯片难以兼顾计算与内存,未来将是异构协同与系统级优化的战场。

“GPU上存在一个根本性的权衡:是追求吞吐量还是优化延迟。而大家都选择了延迟优化……我相信这是未来一年我们将看到的最深刻的变化。”

⚡ “拾荒”电力与95%正常运行时间的数据中心

传统数据中心追求99.99%的冗余与稳定性,成本极高。Sail采取“拾荒”策略,主动寻找美国各地分散的、廉价的、甚至依赖间歇性可再生能源的1兆瓦级小型数据中心。通过强大的控制平面调度,Sail能够容忍95%的正常运行时间,将电力成本压至极限,从而为后台任务提供无与伦比的经济效益。

“我们想建世界上最好的钢厂,但会通过小型钢厂来实现,而不是通过大型一体化钢厂。”

📉 逆向看英伟达与开源未来:领先三到六个月的溢价终将消散

Movva对英伟达持短期看好、长期审慎的态度。他指出,从Hopper到Blackwell,能效比提升有限,西方晶圆厂差距并未如传言般巨大。同时,闭源实验室为保持3-6个月的技术领先所收取的高额溢价,在开源模型蒸馏与互联网数据爆炸的背景下难以持久。当Token成本降至可忽略不计,每个人都能构建定制化智能体,AI将真正走向“富足”。

“我觉得要阻止信息或模型能力的扩散,从根本上来说是不可能的。这一定会发生,问题只是速度有多快。”

🌐 播客信息补充

翻译克隆自:Neil Movva - Making AI 10x Cheaper - [Invest Like the Best, EP.488]

本播客AI进行播客音频制作,如果你对翻译和音频质量有任何意见,随时联系我。

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:caiwenshuo

AI推理成本, 智能体Agents, 吞吐量与延迟, 全栈优化, 拾荒策略, 异构芯片, KV缓存, 数据中心架构, 开源与闭源, 英伟达逆向观, 后台长时运行, 代币工厂, 算力套利, 能源与电力, 普惠AI