《大模型导论》笔记——Transformer
·
Transformer 学这一章的时候,感觉有些迷糊,然后咨询了 deepseek ,它的比喻是 如果大模型是跑车,那么 transformer 就相当于跑车的发动机引擎,GPT、BERT、LLaMA 就是不同品牌的跑车。
Transformer 是一种深度神经网络模型,它的核心是注意力机制,举个例子来理解“自注意力”:
“苹果公司发布了新的手机,它很受欢迎。”
当模型处理到“它”这个代词时:
RNN 模型可能会因为信息传递的衰减,忘记前面很远的主语是“苹果公司”还是“手机”。
而 Transformer 通过自注意力机制,可以瞬间建立起“它”与“手机”之间的强关联,同时也能微弱地关联到“苹果公司”,从而准确地理解“它”指代的是“手机”。
自注意力机制官方解释就是指在处理序列元素时,每个元素都可以与序列中的其他元素建立关联,而不仅仅依赖于相邻位置的元素。
更多推荐



所有评论(0)