智泊AI--Transformer 第一节

智泊AI–Transformer 第一节

1.transformer的整体架构

分词与词嵌入
位置编码

  pos 是 token 在输入序列中的索引。i 由维度逆推得出——例如第 0 维对应 2i=0,第 1 维对应 2i+1=1,以此类推,且维度两两配对。

嵌入层
多头注意力机制

  注意力机制是深度学习中的一种技术,允许模型在处理信息时聚焦于最重要的部分,同时忽略不太相关的信息;它模仿了人类在处理信息时选择性注意的过程。

  即用用户的问题(Query)去和文章中每句话的标签(Key)做相关性匹配,获取匹配度高的 Key,其对应的信息(Value)更重要,我们给予的关注度更高。

层归一化
前馈神经网络(MLP 多层感知机 / 全连接层)
mask掩码注意力机制
解码器的嵌入层

智泊AI--Transformer 第一节
https://one-null-pointer.github.io/2026/08/23/智泊AI--Transformer 第一节/
Author
liaoyue
Posted on
August 23, 2026
传送口