【 𝐊𝐞𝐞𝐩 𝐥𝐞𝐚𝐫𝐧𝐢𝐧𝐠 】
————————————
▄ 大语言模型
豆包推出收费方案,标准版每月68元,高端套餐500元。很多人第一反应:一个聊天软件,凭什么定价这么贵?
另一边,港股两家头部大模型公司走势冰火两重天:
7月13日,智谱(02513.HK)盘中大涨近12%,市值逼近8000亿港元;而MiniMax-W(00100.HK)盘中大跌超13%,市值不足750亿港元。
仅仅7个交易日,7月20日行情直接反转:智谱单日暴跌19.56%,收盘市值仅剩4149亿港元,一周蒸发超3500亿;MiniMax续跌10.6%,市值回落至674亿港元。
截至7月24日,智谱小幅修复至1237港元,市值回升5764亿港元,但较最高点依然腰斩;MiniMax收盘196港元,市值684亿港元,较年内高点跌幅超72%。
同样都是做大模型的,为什么一天之内一家被追捧、一家被抛售,一周后先同步暴跌、再分化修复?
今天三分钟,彻底搞懂大语言模型到底是什么。
先拆开名字,大语言模型,简称LLM,里面三个关键词:大、语言、模型。
“大” 代表训练数据量大、参数规模大、消耗算力多;
“语言” 指它主要处理文字、代码这类符号信息;
“模型” 是它从海量文本数据里学到的一套语言概率运行规律。
说白了,大语言模型就像一个读过亿万份资料的超级预判高手——你说上半句,它推算下半句。
但电脑本身不认识汉字。所以第一步,要把你的提问切割成一个个token,也就是词元。
举个例子,“今天天气不错”会被拆分成「今天」「天气」「不错」,再分别转换成专属数字编号。
模型训练的核心动作看着简单:遮住文本后半段,反复预测下一个token。比如看到“床前明月”,它就要预判下一个词是“光”。预测错了,就调整内部参数,再重新预测。这样的模拟练习要重复成千上万亿次,语法、逻辑、知识关联,最终全部压缩进数百亿甚至上千亿参数里。
可一句话里有几十个词,它怎么分清词汇之间的关联?核心技术叫注意力机制。每生成一个新词,模型都会重新判断前文里哪些信息是重点。
就像开会时,你不会同等听取所有人发言,只会根据当下的问题重点抓取相关内容。
比如你提问“苹果为什么涨价”,它会结合上下文判断,你说的是水果苹果,还是苹果公司。
完成漫长训练后,进入推理阶段。它不是一次性写完整段回答,而是逐个生成token,一边预测一边输出完整答案。
▄ 那大模型是真的听懂理解,还是单纯模仿说话?
更准确地说,它学到了极其复杂的概念关联与语言逻辑,但没有人类真实的生活体验、自我意识。
这也能解释它为什么经常出现 “AI幻觉” :它擅长生成通顺完整的回答,却不会天然保证每一句话都事实准确。就像一个反应极快的考生,遇到不会的题目,也能按答题套路编出一段看起来非常标准的答案。
所以现在主流大模型都会外挂搜索数据库、计算器等工具:模型负责梳理思路、组织语言,外接工具负责查证事实、完成运算。
▄ 基础原理讲完,再回到开头的问题:豆包为什么要收费?
因为模型每读取1个token、生成1个token,背后都要调用GPU芯片完成矩阵运算,任务越长、生成文字越多,算力成本越高。
截至2026年6月,豆包大模型日均token调用量突破180万亿,过去一年调用规模增长超十倍。所以68元、500元的会员套餐,卖的不只是聊天资格,而是更强的模型版本、更高的token额度、能落地完成复杂工作的生产力工具。
资本市场也在算同一笔成本账:智谱发行价116.2港元,盘中最高涨到2980港元;MiniMax从历史高点1330港元回撤幅度超80%。
但不能只拿模型强弱解释股价分化,限售股集中解禁、大额新股配售融资同样会冲击行情。资本真正看重的核心标准是:用户是否愿意付费、企业收入能不能覆盖巨额算力成本。
目前大模型行业主流三种盈利模式:面向普通C端用户售卖会员、面向开发者按token收取API调用费、面向企业客户定制私有化模型服务。
所以判断一家大模型公司价值,不能只看参数榜单、跑分成绩,还要看付费用户规模、客户续费率、收入增速,以及单个token的单位成本能否持续下降。
只有token调用量持续走高、单token成本不断压缩,收入增速跑赢算力成本增速,企业规模越大,盈利能力才会越强。
▄ 一句话总结:
大语言模型依靠token解析语言、依靠参数储存语言规律、依靠概率生成文字回答、依靠算力把AI智能变成可商用服务。
看懂这四层逻辑,你就明白AI为什么能流畅回答问题、为什么偶尔会胡说、为什么技术会持续迭代变强,以及为什么市面上的AI产品,早晚都会开启收费模式。
﹏️定义 / 案例
-
每天一个知识点
𝑨𝒍𝒍 𝒊𝒔 𝒘𝒊𝒍𝒍 ☻

