Episode: GLM-5.3 Flash:同等智能,1/40 的价格
Duration: approximately 8 minutes
Level: 入门
---
[Mike]: 欢迎来到从零开始学AI!我是 Mike。Sarah,先给你出道脑筋急转弯——什么东西能便宜 40 倍,脑子却一样好?
[Sarah]: 打折季的包包?还是共享充电宝?
[Mike]: 比那更狠。今天的主角是智谱刚发布并开源的 GLM-5.3 Flash,它的规格写作 320B-A18B,320B 总参数,每次只激活 18B,却挤进了全球前沿那一档。
[Sarah]: 等一下,320B-A18B 这个写法我一直没懂。B 是 Billion,十亿,那 A 是什么?
[Mike]: 好,先把这个概念讲透。你可以把大模型想象成一座巨型图书馆,藏书 320B 本。但每次回答问题,管理员只会推开其中 18B 本相关的书架来查资料,剩下的暂时不亮灯。
[Sarah]: 所以总藏书很大,但每次干活只开一小片区域,省电又省时间?
[Mike]: 完全正确。学术上这叫 MoE,混合专家。GLM-5.3 Flash 就是靠这个思路,把能力做上去、把成本压下来。
[Sarah]: 能力怎么证明?不会是自己说的吧?
[Mike]: 看第三方。全球很权威的 Artificial Analysis Intelligence Index,也就是 AA 综合智能指数,它拿到 57 分。
[Sarah]: 57 分算什么水平?
[Mike]: 和 Anthropic 最受欢迎的 Claude Opus 4.8 同分。在智谱自家的 Z.ai Code Bench 体感测试里,编程表现也和 Opus 4.8 相当。也就是说,脑子在同一个段位。
[Sarah]: 脑子同段位,那价格呢?你刚才说的 40 倍怎么来的?
[Mike]: 官方定价:是完整版 GLM-5.3 的 1/10,限时折扣内是 1/20,和 Opus 4.8 比是 1/40。口号就一句:同样智力,1/40 价格,前沿智能第一次不用省着用。
[Sarah]: 同样 57 分,价格 1/40……这已经不是性价比,是把定价表撕了重写。
[Mike]: 而且他们为了证明不是自卖自夸,发布前玩了一招盲测。把模型匿名成 Ox-Alpha,中文社区叫它牛来,放到 OpenCode 和 OpenRouter 上让大家随便用。
[Sarah]: 匿名?就是不告诉大家这是谁家的模型?
[Mike]: 对,无名字无介绍。结果牛来迅速成了当周最受欢迎的模型,双平台调用量都破了纪录。流量有多大?全部由国产芯片扛住的,后面我们再细说。
[Sarah]: 等等先别跳。同样聪明的脑子,怎么做得这么便宜?肯定动了架构吧?
[Mike]: 动了大手术。总参数和上一代 GLM-4.5 差不多,320B 对 355B,几乎没变。但激活参数从 32B 砍到 18B,层数从 92 层减到 45 层,几乎减半。配上全新的 30T Token 多模态预训练数据,以更少的计算实现了更强的效果。
[Sarah]: 层数减半我能理解,像把 92 层大楼压缩成 45 层,但每层更高更能干。可 1M 长上下文不是一直很费钱吗?怎么省的?
[Mike]: 问到核心了。他们做了业界首个稀疏注意力加线性注意力的混合架构。打个比方,线性注意力像用便签记最近几页的重点,递归往下翻很便宜;稀疏注意力像带一个很聪明的索引器,帮你从整本书里把远处相关的那几行拽回来。
[Sarah]: 一个管近处,一个管远处,分工省钱。
[Mike]: 还有个小机关叫 IndexPool。原本索引器要存 4 个缓存向量,它用加权池化压成 1 个,1M 上下文下的延迟和内存直接砍一刀。
[Sarah]: 效果能量化吗?
[Mike]: 能。和完整版 GLM-5.3 比,注意力计算量降了 3.01 倍,KV 缓存大小降了 4.44 倍。每层平均下来,在他们对比的几家里,包括 DeepSeek-V4-Flash 和 Kimi-K3,GLM-5.3 Flash 的单 Token 计算量是最低的。
[Sarah]: 那短板呢?总不能全是优点。
[Mike]: 团队自己也说了,KV 缓存大小仍然略高于 Kimi-K3 和 DeepSeek-V4-Flash,这是下一轮要继续优化的方向。
[Sarah]: 坦诚加分。对了,你刚才说这是 GLM-5 系列首个原生多模态,什么叫原生多模态?会看图不就叫多模态吗?
[Mike]: 重点在原生和用途。他们提出的概念叫视觉编码,不只是看图答题,而是把看的能力嵌进编程里。做前端、游戏、3D 仿真时,最终要交付的是人能看见的界面和世界,所以模型要会自己看、自己改。
[Sarah]: 以前是写完代码跑一下,看报错就改。现在是跑起来看画面,觉得不好看也改?
[Mike]: 对,他们专门搭了一条数据合成流水线,训练模型自己判断何时该看,并用视觉反馈指导下一步。还结合了基于真实用户操作的强化学习,连交互体验好不好都学会了评判。
[Sarah]: 有没有具体成果?别光讲原理。
[Mike]: 有个很震撼的例子:没有任何外部素材,GLM-5.3 Flash 在 Blender 里自主跑了 16 个小时,搭出一套约 400 平方米的专业主厨自宅和测试厨房,几何、材质、光照、空间全部一致,从任何角度看都不穿帮。
[Sarah]: 400 平方米,16 小时手搓一套房?这已经不是写代码,是包工头了。
[Mike]: 在 ZCode 里,它还能把代码、浏览器和图形界面打通,Browser Use Agent 和 Computer Use Agent 协同,很多问题只有渲染出来点一点才暴露。
[Sarah]: 听起来很极客,但对普通打工人有什么用?我只想要一份不丑的 PPT。
[Mike]: 正好,这也是它发力的地方。靠视觉理解,它能把自己生成的 PPTX、PDF、DOCX、XLSX 和预期效果对比,自我检查和美化。还专门为金融和法律做了优化。
[Sarah]: 金融怎么优化?我每周都要看研报。
[Mike]: 金融上能跑全流程:从带来源的研究、到报告生成、再到建模分析,每一步都可追溯。法律上能审合同里的费用、账户和责任条款,按律师习惯批注留痕,还能直接起草函件和诉讼文书,格式就是可交付的。
[Sarah]: 可直接交付这四个字,对加班的人就是救命稻草。
[Mike]: 最让我意外的其实是最后一部分——跑在哪。你猜牛来破纪录那一周,流量跑在什么机器上?
[Sarah]: 不会是国产芯片吧?你刚才埋了个伏笔。
[Mike]: 就是国产芯片集群,用自研高速网络连起来。单张芯片算力和内存相对有限,扛 1M 上下文很吃力,所以他们基于 SGLang 造了专用推理引擎。
[Sarah]: 专用引擎谁造的?不会又是 AI 自己吧?
[Mike]: 被你猜中了。很大一部分是 GLM-5.3 驱动的 infra agent 帮工程师一起造的,帮忙写算子、找瓶颈、改服务栈。模型优化系统,系统承载模型,转起来了。
[Sarah]: 自己给自己造跑道,有点科幻。
[Mike]: 技术栈也很激进:线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存、Layer Split。集群层面用 Encode-Prefill-Decode 分离架构,把编码、预填充和解码拆成独立可扩缩的工作池。
[Sarah]: 说人话,管用吗?
[Mike]: 和同一硬件上的初始基线比,端到端性能提升了 3 倍。单 Token 成本已经和主流英伟达 GPU 相当。也就是说,国产芯片在大规模场景下,真的把前沿模型经济地跑起来了。
[Sarah]: 所以故事变了,不再是谁有最贵的卡,而是谁能把手里的卡用得最聪明。
[Mike]: 而且已经开放了。API 在 BigModel 和 Z.ai 上都能调,chat.z.ai 和智谱清言 App 能直接体验,ZCode、AutoClaw 也都接上了。GLM Coding Plan 还每天限量发 10,000 张体验卡。
[Sarah]: 我印象最深的其实不是 1/40,也不是 57 分。是那间 400 平方米的房子。一个会盯着自己作品说这光不对、这材质假,然后默默改好的模型,第一次让我觉得 AI 有点像手艺人。
[Mike]: 还有那头牛。几周前成千上万人爱上了一个匿名名字,牛来。他们不知道,自己已经在用更便宜的未来了。
[Sarah]: 同样的脑子,更小的账单,再加一头骗过所有人的牛。下期从零开始学AI,我们再一起拆下一个 AI 故事,再见!
[Mike]: 再见!记得去试试 GLM-5.3 Flash,它的 Blog 就在 z.ai/blog/glm-5.3-flash,见见那间它自己盖的房子。
