神经网络的最小单元叫神经元。它接收若干个输入,每个输入乘上一个"权重"(可以理解为音量大小),求和后输出。所谓学习,本质上就是不断调整这些音量旋钮,让输出越来越接近正确答案。
训练过程可以概括为三步循环:
第3步背后的数学方法叫反向传播,配合一种叫梯度下降的优化算法——可以想象成蒙着眼站在山坡上,每次朝"脚下最低"的方向迈一小步,最终走到谷底。
旋钮(参数)越多,能刻画的规律越复杂,但也越容易"死记硬背"训练数据而非真正理解规律(称为过拟合)。所以需要更多样的数据来约束它,用大量 GPU 并行计算来加速这个调旋钮的过程。训练一个现代大模型,往往需要数千张显卡连续工作数周。
当网络一层叠一层,就叫深度神经网络。低层先识别简单特征(图片里的边缘、文字里的字),中间层组合成部件(轮廓、词组),高层形成概念(物体、语义)。层次越深,能表达的东西越抽象——大语言模型正是这种深层结构在文本上的应用。
← 返回首页