Transformer
Transformer 是一种基于 Self-Attention 的深度学习架构,最早用于机器翻译任务。整体由 Encoder 和 Decoder 两部分组成,Encoder负责理解输入信息,Decoder负责根据Encoder的语义表示生成输出。
首先,输入文本经过Tokenizer转换成Token,然后通过Embedding转换成向量表示,同时加入Position Encoding补充词语的位置信息,因为Transformer本身没有时序结构。
Encoder部分由多个Encoder Block堆叠组成,每个Block主要包含Multi-Head Self-Attention、Add & Norm以及Feed Forward Network三个部分。
在Self-Attention阶段,输入向量X通过三个可学习矩阵WQ、WK、WV分别生成Query、Key、Value,通过计算Q和K的相似度得到不同Token之间的注意力权重,再对V进行加权求和,使每个Token能够融合上下文信息。
Attention之后通过残差连接和LayerNorm稳定训练,然后经过FFN进行特征进一步加工。FFN通常先升维,再通过激活函数进行非线性变换,最后降维回原始隐藏维度。
Encoder最终输出一个包含上下文语义信息的隐藏表示。
Decoder生成阶段,会先通过Masked Self-Attention保证不能看到未来Token,然后通过Cross Attention关注Encoder输出的信息,结合自身已经生成的内容预测下一个Token。
最后Decoder输出经过Linear层映射到词表空间,再通过Softmax得到每个词的概率,选择概率最高的Token作为输出。
上一篇:无
下一篇: 无
相关文章
-
Transformer
Transformer
NEW个对象 2026-07-28