别再被AI科普吓到了,陶哲轩说透真相:就用了微积分和矩阵乘法
AI模型其实就靠很少数学撑着,你看那些科普文老爱写得吓人,净整些绕嘴的话。
陶哲轩直接说清楚了,里面核心就微积分加矩阵乘法两样玩意儿。
微积分那部分,简单讲就是在训练时候,反过来根据出错程度调整参数。
模型预测不对,比如猜了个猫是狗,就看误差有多大,然后一步步倒推回去,找出哪个参数该调大调小。
调着调着,模型就学聪明了,下次猜得准点。
这个过程叫梯度下降,你别想复杂,就跟爬山找最低点一样,从高处滚下去,边滚边算坡度最陡的方向,滚到谷底就停。
训练大模型,就是电脑反复这么滚几亿次,把参数磨到合适。
很多人科普时爱扯导数啥的,其实就这套路,原理没啥深奥,关键是算得快,数据海量。
模型参数上亿亿个,你想想,得多少轮调整才行,所以需要强大电脑撑着,但数学本身超基础,高中就够用。
矩阵乘法呢,更直白,模型里参数全堆成大表格,输入数据也变表格,两表格对齐乘加,就能吐出结果。比如你输入一句问话,转成数字表格,跟第一层参数表格一乘,得出中间结果,再乘下一层,层层叠叠到变出回答。
这乘法不是简单一个个数相乘,是行队列,交叉加总。举个小例子,假设两表格,一个2行3列,一个3行2列,第一个表格行元素乘第二个列元素,全加起来,得新表格。模型就是无数这种小计算堆大堆
,速度飞起,因为电脑天生爱干这个。
没必要死磕公式,懂了大致怎么运算,就知道为什么模型能处理文本,生成回复。那些LLM听起来牛,其实智能就这点子,低水平重复堆出来的。你喂海量网文,它学着模仿句式,预测下一个词,猜对多就行。
别被包装蒙了眼,里面没魔法,就大量矩阵运算加微积分调优。
想深挖点,训练分两步,前向就是输入进模型,一路矩阵乘到输出,看准不准。后向用微积分反推,算每个参数贡献多少误差,再小步改它。一次训练看一小批数据,反复来,模型就变强。
矩阵为什么方便,因为语言转数字向量,每个词一个向量,句子就是向量序列,矩阵一乘就能混合同义词啥的,捕捉关系。你输入苹果手机,它知道苹果跟水果或公司相关,就靠这些运算统计出来的。
陶哲轩点这个,是提醒大家,AI牛在工程,数据算力堆积,不是数学天才发明的新宇宙。科普吓人,是因为想显高大上,其实你拿纸笔模拟小模型,三层矩阵加调参,就能跑出玩具版聊天机器人。试试看,输入数字当词,乘几轮表格,调调数,马上懂了。
复杂在规模,亿级参数跑不动家用电脑,但原理一清二楚。
再说矩阵乘在注意力机制里,核心是查有关联,自注意力就俩矩阵乘,算词间权重,再乘值矩阵,得加权输出。听起来花哨,其实表格运算。微积分管着整个优化,别模型卡死,学不到东西。俩东西缺一不可,前者算结果,后者改参数。
LLM聪明在规模,参数多,数据广,运算猛,但底子就这。很多人被唬住,以为得博士才懂,其实周末自学一两天,抓重点就行。用python库试试,numpy矩阵乘,torch梯度降,跑个小时小demo,眼见为实。
那些网文爱吹黑箱神秘,实际拆开,纯计算堆。陶哲轩这么一说,你看那些科普,简单事非要整玄乎。模型预测你下一句,就最近词矩阵乘概率最高那个词,循环生成。调参让概率准,重复训练就好使。
没别的门道,大白话就是大表格反复乘,错就反调数,海量数据砸。
想玩懂,从小网络练手,层层加,微积分手动算梯度,马上亲切。规模上去了,就变大语言模型,牛逼在量变,不是质变。懂这层,AI科普再唬,也稳如老狗。
随便看看:
相关推荐:
网友评论:
推荐使用友言、多说、畅言(需备案后使用)等社会化评论插件








