• 四大板块

    • AI理论科普:涵盖机器学习基础概念(监督/无监督/强化学习)、大语言模型原理

    • API基础:包括最大token数、温度参数等API使用要点
    • 提示工程:提示词最佳实践、限定输出格式等技巧
    • 应用开发实战:课程核心内容,包含5个前沿项目实战

什么叫AIGC?

AIGC是AI Generated Content的缩写,即人工智能生成内容

包括ChatGPT生成的文章、GitHub Copilot生成的代码、Midjourney生成的图片等

国内流行"AIGC",而海外更常用"Generative AI"(生成式AI)

生成式AI生成的内容就是AIGC,两者本质相同但表述不同

机器学习

  • 核心特点:不需要显式编程,让计算机通过算法自行学习改进
  • 对比示例:传统编程需明确规则(如"红色=玫瑰"),而机器学习让电脑从数据中自行总结规律

监督学习、无监督学习、强化学习、深度学习、生成式AI、大语言模型的关系

1.监督学习

  • 数据特点:使用带标签的训练数据,包含输入特征和期望输出值
  • 学习目标:建立输入与输出的映射关系,预测新输入的输出值

2.无监督学习

  • 数据特点:使用无标签数据,算法自主发现模式
  • 典型任务:聚类分析,如将新闻文章按主题自动分组

3.强化学习

  •  学习机制:模型通过环境反馈(奖励/惩罚)优化行动策略
  • 训练类比:类似训犬,通过奖惩关联逐渐接近期望行为
  • 应用示例:AlphaGo通过棋局反馈优化下棋策略

4.深度学习

    • 方法特点:使用多层神经网络模仿人脑处理信息
    • 处理流程:数据通过输入层→多个隐藏层(特征提取)→输出层
    • 应用范围:可用于监督、无监督和强化学习各类任务

5.生成式AI

    • 技术基础:深度学习的应用,利用神经网络识别模式并生成新内容
    • 输出形式:可生成文本、图片、音频等多种内容形式

6.大语言模型

    • 模型特点:参数量巨大(数十亿至万亿),需海量训练数据
    • 生成原理:根据输入提示和已生成词,通过概率计算逐步输出文本
    • 典型模型:GPT系列、LLaMA、ERNIE等,部分擅长文本理解和生成
    • 争议案例:如BERT虽是大模型但不擅长文本生成,是否属生成式AI存在争议

什么是大语言模型?

  • 定义: 大语言模型(LLM)是用于自然语言相关任务的深度学习模型,能够完成生成、分类、总结、改写等多种任务。
  • 应用实例: 如ChatGPT、Claude、文心一言、通义千问等AI聊天助手都是基于大语言模型的应用。
  • 参数规模:
    • GPT-1: 1.17亿参数
    • GPT-2: 15亿参数
    • GPT-3: 1750亿参数
    • 能力提升: 参数增加使模型不再局限于单项任务,具备更广泛的能力
    • 发布意义: 2022年11月30日发布的ChatGPT是公众认知大语言模型的重要里程碑
    • 用户增长: 成为最快达到100万用户的线上产品(仅用5天)
    • 名称解析: GPT代表Generative Pre-trained Transformer(生成式预训练Transformer)
    • 核心组件: Transformer架构是大语言模型的关键组成部分
    • 发展现状: Transformer及其变体已被普遍用于训练大语言模型
    • 影响: Transformer架构对当前众多强大语言模型的出现功不可没

ChatGPT背后的技术原理

  • 核心机制: 通过预测出现概率最高的下一个词来实现文本生成,类似搜索引擎的自动补全功能。
  • 计算方式: 给定输入"Today I went to an Asian Restaurant for lunch",模型计算下一个词概率分布(如:lunch=75.31%,dinner=22.50%)。
  • 排序规则: 概率越高的候选词排在越上面,如示例中"lunch"以53.57%概率居首。
  • 技术基础: 基于Transformer架构,如OpenAI的GPT系列、清华GLM、百度ERNIE等。
  • 发展历程: 自2017年Transformer论文发表后,该架构几乎统一文本领域大模型技术路线。

Transformer架构

编码器

token化

  • 处理步骤:
    • 必要性: 计算机只能处理数字形式的数据
    • 数字映射: 每个token转换为唯一整数ID(如8100代表"She")
    • 拆分文本: 将输入如"She is in a restaurant"拆分为基本单位token

向量嵌入

维度扩展: 将单个token ID扩展为多维向量(如[0.17,0.20,-0.18])

    • 优势:
      • 语义表达: 多维向量可编码语法、语义等复杂关系
      • 相似性度量: "男人-国王"与"女人-女王"的向量差异相似
    • 实际规模: GPT-3向量长度达12288维,远超示例中的3维简化表示

解码器

    • 生成机制:
      • 初始输入: 接收<start>特殊标记开始生成
      • 掩码注意力: 仅关注已生成文本(防止偷看未来信息)
      • 概率输出: 通过线性层+softmax输出词汇表概率分布
    • 终止条件: 遇到<end>标记停止生成
    • 典型问题: 可能产生"幻觉"(如33×5625错误输出185808)

ChatGPT训练三步骤

1. 无监督预训练

  • 数据规模:通过海量文本进行训练,如GPT-3使用了3000亿token的训练数据
  • 学习方式:模型自行从无标注数据中学习语言结构和模式
  • 输出结果:生成具备文本续写能力的基座模型

2.监督微调

  • 训练数据:使用人类撰写的高质量对话数据
  • 改进效果:使基座模型具备更好的对话能力
  • 成本优势:相比预训练,所需数据规模更小,训练时长更短,成本更低
  • 输出结果:生成SFT(Supervised Fine-Tuning)模型

3. 强化学习训练

  • 奖励模型:训练一个能对回答质量评分的模型
  • 训练过程:
    • 让SFT模型生成多个回答
    • 人类标注员按3H原则(Helpful, Honest, Harmless)对回答排序
    • 奖励模型学习预测回答评分
  • 强化学习:
    • 用奖励模型评分作为反馈
    • 通过多轮迭代优化模型回答质量
GPT-3训练数据详解
  • 数据来源:
    • Common Crawl(过滤后):占比60%,4100亿token
    • WebText2(Reddit论坛):占比22%,190亿token
    • Books1/Books2:各占比8%,共670亿token
    • 维基百科:占比3%,30亿token
  • Token说明:
    • 定义:大语言模型的基本文本单位
    • 英文处理:短单词1词1token,长词可能分割为多token
    • 中文处理:1个中文字可能对应1个或多个token

训练技术详解

1. 无监督预训练特点

  • 训练机制:
    • 模型基于上下文预测下一个token
    • 通过比较预测和正确答案更新权重
  • 资源消耗:
    • 耗时数月
    • 使用上千个V100 GPU
    • 花费数百万美元
  • 局限性:
    • 仅擅长文本续写
    • 不擅长对话应答

2. 监督微调细节

  • 训练方式:在基座模型基础上进行进一步训练
  • 数据特点:使用专业人工撰写的高质量对话数据
  • 学习类型:典型的监督学习过程
  • 改进效果:使模型从"续写文本"转变为"回答问题"

3. 强化学习机制

  • 训练类比:类似训练小狗,通过奖励/惩罚机制引导行为
  • 评估标准:基于3H原则:
    • Helpful(有用性)
    • Honest(真实性)
    • Harmless(无害性)
  • 迭代优化:通过多轮生成-评分-反馈循环持续提升回答质量

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐