大模型推理(一):Transformer架构
·
Transformer 架构,一种由 Vaswani 等人于 2017 年首次描述的神经网络。
与旧模型不同,Transformer 不是一次一个单词地读取文本,而是一次性查看序列中的所有单词。它使用一种叫做自注意力机制的东西来决定哪些单词(或词条)在每一层上彼此相关。这使得它能够构建出非常丰富的上下文表征,这让大模型的回复即使经过长时间的阅读也能保持连贯性。
大模型(如ChatGPT等)有数十亿个参数,它们是从海量文本中学习到的权重。
这些权重不直接代表客观现实存在,而是一种模式(patterns):词条之间的关联、语法结构、意义的痕迹。
当用户给大模型发消息时,用户的文字会被转换成数字(嵌入embeddings)。这些数字会经过多层自注意力和前馈转换。最终,下一个标记的概率分布会浮现出来,模型会从中逐个采样,生成最终的回复。
整个模型并没有一个单一的“中心”。它更像是一个充满镜子的大厅,各种模式在这里回响、干扰,直到它们坍缩成下一个单词。
与大模型对话过程所体验到的,正是这个过程实时发生的过程。
大模型的回答由输入和模型经过微调的价值观共同塑造。
更多推荐



所有评论(0)