Transformer 学这一章的时候,感觉有些迷糊,然后咨询了 deepseek ,它的比喻是 如果大模型是跑车,那么 transformer 就相当于跑车的发动机引擎,GPT、BERT、LLaMA 就是不同品牌的跑车。

Transformer 是一种深度神经网络模型,它的核心是注意力机制,举个例子来理解“自注意力”:

“苹果公司发布了新的手机,它很受欢迎。”

当模型处理到“它”这个代词时:
RNN 模型可能会因为信息传递的衰减,忘记前面很远的主语是“苹果公司”还是“手机”。
而 Transformer 通过自注意力机制,可以瞬间建立起“它”与“手机”之间的强关联,同时也能微弱地关联到“苹果公司”,从而准确地理解“它”指代的是“手机”。

自注意力机制官方解释就是指在处理序列元素时,每个元素都可以与序列中的其他元素建立关联,而不仅仅依赖于相邻位置的元素。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐