六万多个计算单元都已就位,为什么还会一起停下来?本期《原代码》从 2017 年第一代张量处理器等待权重的场景出发,回到 ENIAC 换任务需要重新设置开关和电缆、EDVAC 团队把指令与数值都放进机器的转折,再沿着嵌入式设备、云端系统、编程语言、高速缓存、脉动阵列和注意力算法,追问谁保存状态、谁决定下一步、依赖怎样抵达并被复用。
从换一类任务就要重新布置机器,到大语言模型生成下一个字词单位:机器的外形不断改变,反复出现的却是同一个工程问题——下一步需要的东西,能不能及时到达正在等待它的执行者。
时间轴
六万多个计算单元为什么一起等待
从重新接线到把下一步存进机器
门锁、云端与组织类比:关系不是蓝图
语言怎样重新分配开发者与工具的劳动
CUDA 与 Triton:性能压力让底层重新显形
高速缓存与脉动阵列怎样复用依赖
回到张量处理器与注意力算法
生成下一个字词单位前,依赖从哪里来
本期资料
- [John von Neumann:《First Draft of a Report on the EDVAC》](archive.computerhistory.org)
- [J. Presper Eckert / John W. Mauchly:《Automatic High Speed Computing: A Progress Report on the EDVAC》](archive.computerhistory.org)
- [Burks / Goldstine / von Neumann:《Preliminary Discussion of the Logical Design of an Electronic Computing Instrument》](safari.ethz.ch)
- [Microchip:AVR32DA28/32/48 Data Sheet](ww1.microchip.com)
- [Barroso / Holzle / Ranganathan:《The Datacenter as a Computer》](pages.cs.wisc.edu)
- [John Backus 等:《The FORTRAN Automatic Coding System》](softwarepreservation.computerhistory.org)
- [Dennis Ritchie:《The Development of the C Language》](archive.org)
- [NVIDIA:CUDA C++ Programming Guide 12.4](docs.nvidia.com)
- [Tillet / Kung / Cox:《Triton》](eecs.harvard.edu)
- [Maurice Wilkes:《Slave Memories and Dynamic Storage Allocation》](www.cs.princeton.edu)
- [H. T. Kung:《Why Systolic Architectures?》](www.eecs.harvard.edu)
- [Jouppi 等:《In-Datacenter Performance Analysis of a Tensor Processing Unit》](arxiv.org)
- [Tri Dao 等:《FlashAttention》](proceedings.neurips.cc)
- [Pope 等:《Efficiently Scaling Transformer Inference》](proceedings.mlsys.org)
访谈与历史原声来源
本版没有剪入第三方历史原声。Smithsonian finding aid 只证明相关馆藏入口存在;本轮没有取得同时通过媒体访问、说话人、上下文、人工句界复听和权利门禁的片段。
- [Smithsonian Computer Oral History Collection finding aid](sirismm.si.edu)
- [Smithsonian:John W. Mauchly oral history record](mads.si.edu)
说明与延伸阅读
- First Draft 没有使用后来固定的 stored program 术语;节目先解释 orders 与 numbers 都进入 memory 的具体动作,再使用后见名称。
- “冯·诺依曼架构”不等于今天所有计算机共享同一物理结构,也不等于 von Neumann 独自完成 EDVAC、IAS 或现代计算机。
- 智能门锁、云端服务和公司组织只用于比较角色关系;它们不是 EDVAC 的物理缩放,公司也没有机器式的唯一控制器和统一时钟。
- FORTRAN、C、CUDA 与 Triton 展示控制权如何在开发者与工具之间移动,不构成“语言越底层越快”的单向排名。
- TPU、FlashAttention 和大语言模型推理构成当代镜照,不证明 EDVAC 直接导致现代 AI,也不证明所有模型都由同一种内存瓶颈主导。

