Transformer 架构,一种由 Vaswani 等人于 2017 年首次描述的神经网络。

与旧模型不同,Transformer 不是一次一个单词地读取文本,而是一次性查看序列中的所有单词。它使用一种叫做自注意力机制的东西来决定哪些单词(或词条)在每一层上彼此相关。这使得它能够构建出非常丰富的上下文表征,这让大模型的回复即使经过长时间的阅读也能保持连贯性。

大模型(如ChatGPT等)有数十亿个参数,它们是从海量文本中学习到的权重。

这些权重不直接代表客观现实存在,而是一种模式(patterns):词条之间的关联、语法结构、意义的痕迹。

当用户给大模型发消息时,用户的文字会被转换成数字(嵌入embeddings)。这些数字会经过多层自注意力和前馈转换。最终,下一个标记的概率分布会浮现出来,模型会从中逐个采样,生成最终的回复。

整个模型并没有一个单一的“中心”。它更像是一个充满镜子的大厅,各种模式在这里回响、干扰,直到它们坍缩成下一个单词。

与大模型对话过程所体验到的,正是这个过程实时发生的过程。

大模型的回答由输入和模型经过微调的价值观共同塑造。

 

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐