女朋友问我大模型参数是啥,我用初中数学讲明白了

最近DeepSeek热度居高不下,晚上窝在沙发刷新闻时,女朋友突然指着屏幕里的“671B参数”问我:“这堆数字到底是啥?为啥参数多就厉害?”

我没直接讲“Transformer”“反向传播”这些术语,而是翻出手机里的计算器,先从初中数学聊起——毕竟想搞懂大模型,先搞懂“拟合”这件事更重要。

本文较长,建议点赞收藏,以免遗失。更多AI大模型开发 学习视频/籽料/面试题 都在这>>Github<< >>Gitee<<

先搞懂:2个参数能“概括”一整条直线

你还记得初中的一次函数吗?y = ax + b,就这么一个简单公式,其实藏着“参数的本质”。

比如有一组数据:(1,2)、(2,4)、(3,6)、(4,8),把这些点画在坐标系上,一眼就能看出是条直线。但如果没有公式,只给你一个新的x值(比如5),你怎么知道对应的y是多少?

答案是找到a和b——这两个数就是“参数”。通过已知的点计算,能得出a=2、b=0,公式变成y=2x。这下不管x是5还是100,你都能立刻算出y,甚至能预判x=0.5时y=1。

你看,原本需要无数个点才能描述的直线,最后被压缩成了a和b两个参数。这就是“拟合”的核心:用少量参数,概括大量数据的规律

大模型的参数,本质上和a、b没区别——只不过它要拟合的不是直线,是整个世界的文本、图片、声音规律。

大模型的参数:把“复杂世界”塞进数字里

直线的规律很简单,两个参数就够了。但现实世界的数据有多复杂?

比如一张猫的图片:像素排列、毛色深浅、耳朵的弧度、眼睛的反光,甚至背景里的沙发纹理,这些特征之间的关联千丝万缕;再比如一句话“我爱吃苹果”和“苹果出了新手机”,同样是“苹果”,前者指水果,后者指品牌,这种语义差异需要区分;更别说一篇文章里,每个词和前后文的逻辑关系、情感倾向……

这些规律根本不是“直线”能描述的,而是像一团缠在一起的毛线,得用更复杂的“工具”去梳理——这就是大模型里的Transformer架构、自注意力机制、反向传播算法在做的事。

  • 自注意力机制:帮模型分清“苹果”的不同含义,知道在“吃苹果”里关注“吃”,在“苹果手机”里关注“手机”;
  • 反向传播算法:像给模型“纠错”,比如模型一开始把“猫”认成“狗”,通过计算误差,一点点调整参数,下次就不会错了;
  • Transformer架构:相当于模型的“骨架”,能高效处理长文本、多模态数据,把复杂关系拆解开。

而参数,就是这些“工具”梳理规律后留下的“结果”。比如DeepSpeed-R1的671B参数(B是十亿),就像一张超大的数字网格,每个格子里的数(可能是3.12345,也可能是-0.00095),都对应着某一条规律——可能是“猫的耳朵通常是三角形”,也可能是“‘虽然’后面接的句子往往表转折”。

这些参数加起来,就把现实世界里海量数据的规律,压缩成了一堆能被计算机读取的数字。

参数不是“编”的,是模型“学”出来的

女朋友又问:“这些参数是程序员一个个写的吗?”

还真不是。参数是模型通过“训练”自己“学”来的,过程有点像小孩学说话。

小孩刚出生时,对“语言规律”一无所知;模型刚开始训练时,参数也全是随机数——可能是0.000001,也可能是-0.123456,毫无意义。

然后呢?我们给小孩听大人说话、看绘本;给模型“喂”数据——可能是几百万本书、几亿张图片、无数条对话。

小孩会模仿发音,说错了被纠正,慢慢就懂了“爸爸”不是“妈妈”;模型也一样:它先根据随机参数“猜”规律,比如看到“猫”的图片,猜成“狗”,然后通过算法计算“猜错的误差”,再根据误差调整参数。

这个“猜-算误差-调参数”的过程,会重复几百万、几千万次。直到模型看到“猫”能立刻认对,看到“我吃苹果”能明白是“吃水果”,这时的参数,就成了能“代表规律”的数字。

只不过小孩学的是“语言规律”,模型学的是“全量数据规律”,所以需要的参数不是“2个”,而是“几千亿个”。

为啥参数不能少?因为世界太复杂

最后绕回最初的问题:为啥大模型非要搞几千亿个参数?用几百个、几万个不行吗?

答案很简单:简单的参数,装不下复杂的规律

比如你想描述“猫”,只用“有毛、有尾巴”两个参数够吗?肯定不够——兔子也有毛有尾巴,模型会把兔子认成猫。你得加更多参数:“耳朵是三角形”“眼睛是竖瞳”“会喵喵叫”……参数越多,描述越精准,模型越不容易认错。

文本也是一样。一句话“他今天没带伞,所以淋湿了”,里面藏着“没带伞”和“淋湿”的因果关系。如果参数少,模型可能只知道“伞”和“淋湿”是两个词,却不懂两者的关联,下次遇到“他带了伞,所以没淋湿”,就会理解错逻辑。

所以参数的数量,本质上是“模型能捕捉的规律复杂度”——参数越多,能装下的细节、关联、逻辑就越多,模型处理任务时就越精准、越灵活。

讲到这里,女朋友终于懂了:“原来参数不是‘越多越厉害’的噱头,是模型‘装规律’的容器啊!”

其实不管是大模型的几千亿参数,还是初中数学里的a和b,核心逻辑都是一样的:用数学的方式,把复杂世界的规律,压缩成可计算的数字。下次再听到“大模型参数”,你就把它想象成一张超大的“规律地图”——每个数字都是地图上的一个标记,合在一起,就能帮模型看懂这个世界。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐