半小时算力课 No.10 【推荐】用大白话告诉你,大语言模型是怎么工作的?钞能力研究室

半小时算力课 No.10 【推荐】用大白话告诉你,大语言模型是怎么工作的?

29分钟 ·
播放数84
·
评论数0

ChatGPT、Claude、DeepSeek,还有你听过的所有大模型,它们干的事和手机输入法预测下一个词,本质上是同一件事——根据上文,一个词一个词地往后接。

这一集我们把大模型剖开,用一些生活画面讲清它的工作原理:

  • 在 Transformer 出现之前,AI 像个记性很差的人逐字念课文,读到句尾忘了句首;

  • 2017 年谷歌八人团队一篇《Attention Is All You Need》,把研究的楼拆了重盖;

  • 本质原理:一句话进来,先切成乐高(词元),每块换成"意思地图"上的坐标,贴上序号;自注意力让所有词互相打量,像开会时耳朵自动给有用的话调大音量,还同时派好几组脑子分别盯语法、指代和因果;这样叠几十上百层,最后吐出一张概率表,选出下一个词,再像多米诺骨牌一样一直重复,一路接下去。

  • 大模型的本事是海量"完形填空"练出来的,不是被教会的。所以它会一本正经地编造幻觉,也没有真正的自我意识(起码目前的技术路线还没有)——它是一台把"预测下一个词"做到极致规模的统计机器。而规模一大,能力会自己涌现。

下一集我们就讲:为什么参数越多,模型会突然开窍。