本期要点
· 开源模型与闭源模型的能力差距已大幅收窄,真正的壁垒从"模型本身"转移到了"推理工程"。
· 同一个开源模型交给不同供应商去跑,成本结果可能完全不同:差别在引擎选型、请求路由、缓存命中与量化档位。
· 缓存感知路由:把请求送到缓存命中的那批卡上,而不是随机撒——缓存连贯了,命中率和速度才会好。
· 投机解码:小模型先起草、大模型再验证,像资深工程师把活派给初级工程师;仅用通用数据训练草稿模型就能提升约三成。
· 键值缓存是投入产出比最高的一项优化,实测可带来五到十倍加速,代价是显存,因此需要自动卸载到内存再取回。
· 预填充与解码分离:前者吃算力、后者吃内存带宽,拆到两组图形处理器上跑,中间传输键值缓存。
· 托管推理的"第三条路径":用自有数据中心与从芯片到服务的垂直整合,同时换取自建的控制力与托管的省心。
