Episode: DeepSeek V4.1 Flash:更强更快更普惠
Duration: approximately 9 minutes
Level: 入门
---
[Mike]: 欢迎来到从零开始学AI!
[Mike]: Sarah,今天这条新闻有点反常识,系列里最小的模型,先发布了,结果还把一众旗舰都超了。
[Sarah]: 你说的是 DeepSeek V4.1 Flash 吧?我第一眼也愣了,最小尺寸,居然直接对标旗舰水平?
[Mike]: 对,官方说得很清楚,这是全新模型结构系列中的最小尺寸,还自带原生多模态视觉理解能力。
[Sarah]: 先帮零基础听众铺个概念吧,什么叫原生多模态视觉?是不是就是能看图?
[Mike]: 就是这个意思。不用外挂别的工具,它自己就能看懂图片,再跟文字一起理解,一步到位。
[Sarah]: 好,第二个概念,552B 的 MoE 模型。这数字听着吓人,怎么讲才不晕?
[Mike]: 你可以把它想成一个超大公司,总共有 552B 的员工,但每次干活只叫一小拨人出来。
[Sarah]: 哦,MoE 就是专家混合,平时大家轮休,谁对口谁上,这样工资成本就低了?
[Mike]: 太对了。这次更狠,还用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称。
[Sarah]: 不对称是什么意思?输入和输出还不一样大?
[Mike]: 对,输入激活只有 8B,输出激活 16B。就像阅读理解看得飞快,写答案时再认真发力。
[Sarah]: 这个比喻好,眼睛扫得快,落笔才用力。所以成本比同尺寸模型低很多,道理就在这?
[Mike]: 没错,花小钱办大事。而且它还用了新的预训练方式,加更大规模的强化学习后训练。
[Sarah]: 强化学习我熟,就是不断试错、被打分,最后越练越聪明。那成绩单呢?
[Mike]: 在 Agentic Benchmark 上,超过了包括 DeepSeek V4 Pro 在内的一众旗舰模型。
[Sarah]: 等等,Agentic Benchmark 是考什么的?和平时那种问答考试不一样吧?
[Mike]: 不一样,它考的是当 Agent 干活的能力,能不能拆任务、调工具、跑完一整条链路。
[Sarah]: 懂了,不是考背书,是考独立出差。能订票、能报销、能收尾的那种。
[Mike]: 就是这个感觉。所以官方才敢说,能力上限更高,推理速度更快,吞吐更大,还能扩展到更大参数模型。
[Sarah]: 小个头先探路,大个头还在后面。这个系列化发布,听着像先派先锋探探路?
[Mike]: 很像。最小的先验证新结构跑得通,后面直接放大。而且还有个省钱大招,KV Cache 被大幅压缩了。
[Sarah]: KV Cache 又是什么?每次听到缓存我就头大。
[Mike]: 你把它想成草稿纸。模型聊天时,要把前文记在草稿纸上,不然转头就忘。
[Sarah]: Agent 任务特别长,草稿纸岂不是越堆越厚?费用就是这么烧掉的?
[Mike]: 对,尤其缓存命中的费用占比很高。这次和上一代比,对 HBM 的需求减到 1/4,对 SSD 的需求减到 1/8。
[Sarah]: HBM 和 SSD,一个是桌面上的便签,一个是抽屉里的档案箱,对吧?
[Mike]: 很准。便签贵但拿得快,档案箱便宜但慢,两个都省了,Agent 跑长任务就便宜多了。
[Sarah]: 还有个数字更夸张,相对初代模型,KV Cache 已经缩小了 437 倍?
[Mike]: 对,437 倍。你可以理解成,以前要一整面墙贴草稿,现在一张小卡片就记下了。
[Sarah]: 那 API 侧呢?开发者怎么用上?
[Mike]: 已经同步上线 DeepSeek API,原生支持多模态,把模型名称改成 deepseek-flash 就能调用最新的 V4.1 Flash。
[Sarah]: 老用户呢?原来用的 V4 Flash 和 V4 Flash Vision Exp 怎么办?
[Mike]: 那两个旧版本已经下线,出于兼容考虑,deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 会暂时路由到 V4.1 Flash。
[Sarah]: 路由就是自动转接吧?打旧电话,自动转到新前台,体验不断档。
[Mike]: 对。还有个更重要的,V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4 Pro,所以 V4 Pro 要有序下线了。
[Sarah]: 时间点记一下,北京时间 9 月 14 日 之后,到未来 V4.1 Pro 上线之前,访问 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash。
[Mike]: 而且按 V4.1 Flash 单价计费。相当于花旗舰的旧入口,进来坐的是又快又便宜的新车,还按新车票价收钱。
[Sarah]: 腾讯的 WorkBuddy、CodeBuddy 和 OpenCode 作为官方合作伙伴,已经全量接入了,开发者可以直接去用。
[Mike]: 定价这块也调了。得益于架构创新,成本下来了,定价跟着下调,还是峰谷定价。
[Sarah]: 峰谷定价是不是跟电费一样?半夜用电便宜,鼓励大家错峰?
[Mike]: 一模一样。闲时价格是高峰时段的一半,鼓励大家按实际使用情况调整任务时间,新价格 9 月 10 日 开始生效。
[Sarah]: 整理任务的同学可以把批量跑批的活挪到闲时,账单直接打对折,这很实在。
[Mike]: 最后是开源。模型已经放到 HuggingFace 上,论文也一起公开了,全力支持社区做推理适配。
[Sarah]: 地址我念一下吧,huggingface.co 上搜 deepseek-ai 的 DeepSeek-V4.1-Flash,论文也在同一页。
[Mike]: 如果有大规模部署需求,还得有点家底,官方说要 2k 卡 GPU 加存储集群,可以直接联系他们。
[Sarah]: 2k 卡,那是真大户了,普通公司看看就好,重点还是 API 直接用。
[Mike]: 回头看,这次的逻辑特别顺。结构不对称省算力,缓存压缩省内存,峰谷定价省账单,三笔省到一块去了。
[Sarah]: 而且最小的先来,把路铺平。等 V4.1 Pro 上线,估计就是这个新结构的完全体了。
[Mike]: 最有意思的是,以前大家比谁更大,现在是最小的跳出来说,我更快、更强、还更便宜。
[Sarah]: 以后选模型,别先问多大,得先问问,它那张草稿纸是不是已经换成小卡片了。
[Mike]: 哈哈,这个检验标准好。下期 V4.1 Pro 来了,我们再来拆大的那一个,我们下期见!
[Sarah]: 下期见!
