智泊AI--大模型底层逻辑

智泊AI–大模型底层逻辑

1.GPT的含义

  深度学习:指基于深层神经网络模型的机器学习。

  神经网络可视化:TensorFlow Playground

2.神经网络种类

  • 卷积神经网络(CNN):特别适合处理图像,广泛运用于计算机视觉领域。
  • 循环神经网络(RNN):用于处理序列数据,原理是引入了隐状态 h 来对序列数据提取特征,再接着转换为输出,能够记住过去的信息。但是处理的序列不能太长,否则会遗忘。
  • 长短时记忆网络(LSTM):是 RNN 的改进版本,能够更好的捕捉长距离依赖关系,比如语言、视频、股票等需要联系上下文的信息,但是计算效率低,并行计算能力不足,只能说长距离依赖的能力比 RNN 更优,但是依旧是有限的。

  基于上述的类别,Transformer 的出现就得以解决了上述的一系列问题,也是目前大模型的架构基本上都是基于 Transformer 架构。

3.大模型的工作原理

  大模型的工作流程主要如下:

  分词 → 词嵌入 → Transformer 流程 → 最终内容生成

  • 分词器:分词器是在模型训练之前就已经固定下来的。在模型训练之前,会抽取一些特定的样本,去进行分词和词频分析,最终去选定一些特定的字、词、符号去构成最原始的词表。
  • 向量:有方向和大小的量,本质上就是数学中的矩阵——多维数组。向量的维度:一般来说,维度就是数组的长度,也就是向量坐标中指标值的数量。
第一步:分词,得到 token

注意:虽然不同的大模型使用的分词算法是不一样的,但是解析提示词时都是与大模型训练时所采用的分词算法保持一致的。

第二步:词嵌入,将 Token 转化为词向量

注意:向量的维度越大,在参数的数据类型不变的情况下,模型的大小、物理大小、占用的内存等都会变大。需要训练数据就越多,计算损耗的资源就越多,速度就越慢。向量的维度可以理解为对这个 token 的某个特征的计算结果,所以向量的维度越大,能够承载的参数就越多,模型对向量的理解就更充分。

第三步:自注意力机制(开会交流)

  每一个 token 都会根据邻居修改自己的标签,例如「女儿」的交流:

  • 「国王」是我的父亲
  • 「有」表示我被拥有,我不是主语是宾语
  • 「个」是量词,我是一个女儿
  • 「,」表示句子要延续,下文我要被描述

  于是调整向量权重:

第四步:前馈网络(闭门思考)

  每次开完会后,token 会各自去消化会议上学到的知识。「女儿」展开思考(512 → 2048 个想法,一般是四倍维度展开):

  • 想法1:我是公主吗?(+0.6)
  • 想法2:皇室成员特权(+0.5)
  • 想法3:宫廷生活(+0.4)
  • 想法4:但「个」很普通(+0.1)
  • 想法5:可能不是公主,只是国王女儿(+0.3)
  • ……

  最终过滤(ReLU 保留正相关,也被称为激活函数):

  • 保留:皇室关联(0.6)、特权(0.5)
  • 过滤:平民生活(-0.2)设为 0

  总结(2048 → 512 个新认知):

  • 新维度10:女性+0.88(微减,因为作为公主可能用性别去定义会弱)
  • 新维度25:晚辈+0.82(微增,因为说了父亲属性,需要增加辈分考虑)
  • 新维度105:公主关联+0.551(明显增强)
  • 新维度150:被关注度+0.41(知道要被描述)
第五步:Transformer 层(多层交换)

  多次开会,每次关注不同的点,从认知基本身份 → 定位故事角色 → 准备具体描述 → 预测下文发展:

  1. 第一次开会:讨论基本语法——「女儿」发现自己的名词,是「有」的宾语。
  2. 第二次开会:讨论语义关系——「女儿」发现自己有个父亲是国王。
  3. 第三次开会:讨论故事发展——「女儿」发现自己在逗号前面,后续续写需要先被作为主角。
  4. ……
  5. 第十二次开会:理解上下文。

  最终效果:

第六步:基于上下文,生成下一个预测

  模型不是一次性写出整段话,而是一个 token 一个 token 的预测,不断的输出新词,从第三步开始到搭配第六步循环,最终给出内容。

4.模型训练流程

  机器学习:

  1. 提供数据
  2. 创建模型,训练数据
  3. 新数据输入模型,预测结果
机器学习分类
类型 定义
监督学习 人们给机器一大堆标记好的数据
无监督学习 人们给机器一大堆没有分类标记的数据
自监督学习 一种无需人工标注数据的学习方法,通过利用数据本身的结构来生成「标签」,并利用这些生成的标签来训练模型;是一种特殊的无监督学习,介于监督学习和无监督学习之间,是训练大模型采用的一种学习方式
强化学习 一种让 AI 通过不断尝试和与环境互动来学习如何做出最优决策的方法,根据得到的反馈来调整自己的行为策略,逐渐学会哪些行动能带来更多奖励、哪些行动会带来负激励或者惩罚,从而找到最优的行动方式,如 AlphaGo
模型训练三大阶段:
  • 预训练:让模型学习通用知识,使用海量无标注文本(如书籍、网页、代码等),通过自监督学习训练模型。
  • 监督微调(SFT):对基座模型进行微调,让模型能够适用特定任务,最终得到一个有偏好的模型。
  • 强化学习(RLHF):通过引入人类反馈(或者基于人类反馈训练的奖励模型)进一步优化模型的生成质量,使其生成的回答更符合用户的期望和人类的价值观。

  蒸馏:让能力强的大参数模型生成监督的数据,蒸馏出来的模型针对特定的问题能够很好的解答,但是对于没有处理过的数据能力就会缺失。

  Transformer 架构下,影响模型能力最重要的因素就是训练的语料(维度)。


智泊AI--大模型底层逻辑
https://one-null-pointer.github.io/2026/08/13/智泊AI--大模型底层逻辑/
Author
liaoyue
Posted on
August 13, 2026
传送口