主播
节目简介
来源:小宇宙
ChatGPT、Claude、DeepSeek,还有你听过的所有大模型,它们干的事和手机输入法预测下一个词,本质上是同一件事——根据上文,一个词一个词地往后接。
这一集我们把大模型剖开,用一些生活画面讲清它的工作原理:
* 在 Transformer 出现之前,AI 像个记性很差的人逐字念课文,读到句尾忘了句首;
* 2017 年谷歌八人团队一篇《Attention Is All You Need》,把研究的楼拆了重盖;
* 本质原理:一句话进来,先切成乐高(词元),每块换成"意思地图"上的坐标,贴上序号;自注意力让所有词互相打量,像开会时耳朵自动给有用的话调大音量,还同时派好几组脑子分别盯语法、指代和因果;这样叠几十上百层,最后吐出一张概率表,选出下一个词,再像多米诺骨牌一样一直重复,一路接下去。
* 大模型的本事是海量"完形填空"练出来的,不是被教会的。所以它会一本正经地编造幻觉,也没有真正的自我意识(起码目前的技术路线还没有)——它是一台把"预测下一个词"做到极致规模的统计机器。而规模一大,能力会自己涌现。
下一集我们就讲:为什么参数越多,模型会突然开窍。
这一集我们把大模型剖开,用一些生活画面讲清它的工作原理:
* 在 Transformer 出现之前,AI 像个记性很差的人逐字念课文,读到句尾忘了句首;
* 2017 年谷歌八人团队一篇《Attention Is All You Need》,把研究的楼拆了重盖;
* 本质原理:一句话进来,先切成乐高(词元),每块换成"意思地图"上的坐标,贴上序号;自注意力让所有词互相打量,像开会时耳朵自动给有用的话调大音量,还同时派好几组脑子分别盯语法、指代和因果;这样叠几十上百层,最后吐出一张概率表,选出下一个词,再像多米诺骨牌一样一直重复,一路接下去。
* 大模型的本事是海量"完形填空"练出来的,不是被教会的。所以它会一本正经地编造幻觉,也没有真正的自我意识(起码目前的技术路线还没有)——它是一台把"预测下一个词"做到极致规模的统计机器。而规模一大,能力会自己涌现。
下一集我们就讲:为什么参数越多,模型会突然开窍。