078.开源模型拼的不是模型,是推理工程

078.开源模型拼的不是模型,是推理工程

22分钟 ·
播放数31
·
评论数0

本期要点

· 开源模型与闭源模型的能力差距已大幅收窄,真正的壁垒从"模型本身"转移到了"推理工程"。

· 同一个开源模型交给不同供应商去跑,成本结果可能完全不同:差别在引擎选型、请求路由、缓存命中与量化档位。

· 缓存感知路由:把请求送到缓存命中的那批卡上,而不是随机撒——缓存连贯了,命中率和速度才会好。

· 投机解码:小模型先起草、大模型再验证,像资深工程师把活派给初级工程师;仅用通用数据训练草稿模型就能提升约三成。

· 键值缓存是投入产出比最高的一项优化,实测可带来五到十倍加速,代价是显存,因此需要自动卸载到内存再取回。

· 预填充与解码分离:前者吃算力、后者吃内存带宽,拆到两组图形处理器上跑,中间传输键值缓存。

· 托管推理的"第三条路径":用自有数据中心与从芯片到服务的垂直整合,同时换取自建的控制力与托管的省心。