神经网络是怎样学习的

AI工坊 · 基础概念 · 约 5 分钟阅读

一个神经元:像一个调音量旋钮

神经网络的最小单元叫神经元。它接收若干个输入,每个输入乘上一个"权重"(可以理解为音量大小),求和后输出。所谓学习,本质上就是不断调整这些音量旋钮,让输出越来越接近正确答案。

训练:先猜错,再改错

训练过程可以概括为三步循环:

1. 预测:把题目(比如一张猫的图片)喂给网络,得到一个答案;
2. 算误差:和标准答案对比,差多少(比如它猜成了狗,误差就大);
3. 反向调整:从最后一层往前,把每个旋钮朝"能减少误差"的方向拧一点点。
把这三步在海量样本上重复几百万、几十亿次,误差越来越小,模型就"学会"了。

第3步背后的数学方法叫反向传播,配合一种叫梯度下降的优化算法——可以想象成蒙着眼站在山坡上,每次朝"脚下最低"的方向迈一小步,最终走到谷底。

为什么需要那么多数据和算力

旋钮(参数)越多,能刻画的规律越复杂,但也越容易"死记硬背"训练数据而非真正理解规律(称为过拟合)。所以需要更多样的数据来约束它,用大量 GPU 并行计算来加速这个调旋钮的过程。训练一个现代大模型,往往需要数千张显卡连续工作数周。

深度学习"深"在哪

当网络一层叠一层,就叫深度神经网络。低层先识别简单特征(图片里的边缘、文字里的字),中间层组合成部件(轮廓、词组),高层形成概念(物体、语义)。层次越深,能表达的东西越抽象——大语言模型正是这种深层结构在文本上的应用。

← 返回首页