小白初学AI大模型应用开发丨一
·
-
四大板块
-
AI理论科普:涵盖机器学习基础概念(监督/无监督/强化学习)、大语言模型原理
- API基础:包括最大token数、温度参数等API使用要点
- 提示工程:提示词最佳实践、限定输出格式等技巧
- 应用开发实战:课程核心内容,包含5个前沿项目实战
-
什么叫AIGC?
AIGC是AI Generated Content的缩写,即人工智能生成内容
包括ChatGPT生成的文章、GitHub Copilot生成的代码、Midjourney生成的图片等
国内流行"AIGC",而海外更常用"Generative AI"(生成式AI)
生成式AI生成的内容就是AIGC,两者本质相同但表述不同
机器学习
- 核心特点:不需要显式编程,让计算机通过算法自行学习改进
- 对比示例:传统编程需明确规则(如"红色=玫瑰"),而机器学习让电脑从数据中自行总结规律
监督学习、无监督学习、强化学习、深度学习、生成式AI、大语言模型的关系
1.监督学习
- 数据特点:使用带标签的训练数据,包含输入特征和期望输出值
- 学习目标:建立输入与输出的映射关系,预测新输入的输出值
2.无监督学习
- 数据特点:使用无标签数据,算法自主发现模式
- 典型任务:聚类分析,如将新闻文章按主题自动分组
3.强化学习
- 学习机制:模型通过环境反馈(奖励/惩罚)优化行动策略
- 训练类比:类似训犬,通过奖惩关联逐渐接近期望行为
- 应用示例:AlphaGo通过棋局反馈优化下棋策略
4.深度学习
-
- 方法特点:使用多层神经网络模仿人脑处理信息
- 处理流程:数据通过输入层→多个隐藏层(特征提取)→输出层
- 应用范围:可用于监督、无监督和强化学习各类任务
5.生成式AI
-
- 技术基础:深度学习的应用,利用神经网络识别模式并生成新内容
- 输出形式:可生成文本、图片、音频等多种内容形式
6.大语言模型
-
- 模型特点:参数量巨大(数十亿至万亿),需海量训练数据
- 生成原理:根据输入提示和已生成词,通过概率计算逐步输出文本
- 典型模型:GPT系列、LLaMA、ERNIE等,部分擅长文本理解和生成
- 争议案例:如BERT虽是大模型但不擅长文本生成,是否属生成式AI存在争议
什么是大语言模型?
- 定义: 大语言模型(LLM)是用于自然语言相关任务的深度学习模型,能够完成生成、分类、总结、改写等多种任务。
- 应用实例: 如ChatGPT、Claude、文心一言、通义千问等AI聊天助手都是基于大语言模型的应用。
- 参数规模:
- GPT-1: 1.17亿参数
- GPT-2: 15亿参数
- GPT-3: 1750亿参数
- 能力提升: 参数增加使模型不再局限于单项任务,具备更广泛的能力
- 发布意义: 2022年11月30日发布的ChatGPT是公众认知大语言模型的重要里程碑
- 用户增长: 成为最快达到100万用户的线上产品(仅用5天)
- 名称解析: GPT代表Generative Pre-trained Transformer(生成式预训练Transformer)
- 核心组件: Transformer架构是大语言模型的关键组成部分
- 发展现状: Transformer及其变体已被普遍用于训练大语言模型
- 影响: Transformer架构对当前众多强大语言模型的出现功不可没
ChatGPT背后的技术原理
- 核心机制: 通过预测出现概率最高的下一个词来实现文本生成,类似搜索引擎的自动补全功能。
- 计算方式: 给定输入"Today I went to an Asian Restaurant for lunch",模型计算下一个词概率分布(如:lunch=75.31%,dinner=22.50%)。
- 排序规则: 概率越高的候选词排在越上面,如示例中"lunch"以53.57%概率居首。
- 技术基础: 基于Transformer架构,如OpenAI的GPT系列、清华GLM、百度ERNIE等。
- 发展历程: 自2017年Transformer论文发表后,该架构几乎统一文本领域大模型技术路线。
Transformer架构
编码器
token化
- 处理步骤:
- 必要性: 计算机只能处理数字形式的数据
- 数字映射: 每个token转换为唯一整数ID(如8100代表"She")
- 拆分文本: 将输入如"She is in a restaurant"拆分为基本单位token
向量嵌入
维度扩展: 将单个token ID扩展为多维向量(如[0.17,0.20,-0.18])
-
- 优势:
- 语义表达: 多维向量可编码语法、语义等复杂关系
- 相似性度量: "男人-国王"与"女人-女王"的向量差异相似
- 实际规模: GPT-3向量长度达12288维,远超示例中的3维简化表示
- 优势:
解码器
-
- 生成机制:
- 初始输入: 接收<start>特殊标记开始生成
- 掩码注意力: 仅关注已生成文本(防止偷看未来信息)
- 概率输出: 通过线性层+softmax输出词汇表概率分布
- 终止条件: 遇到<end>标记停止生成
- 典型问题: 可能产生"幻觉"(如33×5625错误输出185808)
- 生成机制:
ChatGPT训练三步骤
1. 无监督预训练
- 数据规模:通过海量文本进行训练,如GPT-3使用了3000亿token的训练数据
- 学习方式:模型自行从无标注数据中学习语言结构和模式
- 输出结果:生成具备文本续写能力的基座模型
2.监督微调
- 训练数据:使用人类撰写的高质量对话数据
- 改进效果:使基座模型具备更好的对话能力
- 成本优势:相比预训练,所需数据规模更小,训练时长更短,成本更低
- 输出结果:生成SFT(Supervised Fine-Tuning)模型
3. 强化学习训练
- 奖励模型:训练一个能对回答质量评分的模型
- 训练过程:
- 让SFT模型生成多个回答
- 人类标注员按3H原则(Helpful, Honest, Harmless)对回答排序
- 奖励模型学习预测回答评分
- 强化学习:
- 用奖励模型评分作为反馈
- 通过多轮迭代优化模型回答质量
GPT-3训练数据详解
- 数据来源:
- Common Crawl(过滤后):占比60%,4100亿token
- WebText2(Reddit论坛):占比22%,190亿token
- Books1/Books2:各占比8%,共670亿token
- 维基百科:占比3%,30亿token
- Token说明:
- 定义:大语言模型的基本文本单位
- 英文处理:短单词1词1token,长词可能分割为多token
- 中文处理:1个中文字可能对应1个或多个token
训练技术详解
1. 无监督预训练特点
- 训练机制:
- 模型基于上下文预测下一个token
- 通过比较预测和正确答案更新权重
- 资源消耗:
- 耗时数月
- 使用上千个V100 GPU
- 花费数百万美元
- 局限性:
- 仅擅长文本续写
- 不擅长对话应答
2. 监督微调细节
- 训练方式:在基座模型基础上进行进一步训练
- 数据特点:使用专业人工撰写的高质量对话数据
- 学习类型:典型的监督学习过程
- 改进效果:使模型从"续写文本"转变为"回答问题"
3. 强化学习机制
- 训练类比:类似训练小狗,通过奖励/惩罚机制引导行为
- 评估标准:基于3H原则:
- Helpful(有用性)
- Honest(真实性)
- Harmless(无害性)
- 迭代优化:通过多轮生成-评分-反馈循环持续提升回答质量
更多推荐


所有评论(0)