1. 深度学习相关职位要求
职位名称 核心能力要求
深度学习应用工程师 1. 掌握机器学习理论与实践技能;
2. 熟悉 CNN 等模型及物体检测 / 图像分类场景;
3. 熟悉 Python 及 PyTorch/TensorFlow 至少一种;
4. 扎实数学 / 编程功底 + 良好团队合作能力
AI 算法工程师 1. 掌握计算机视觉 / 图像处理算法,深入研究 GAN / 扩散模型 / 图像生成 / 多模态等至少一个方向;
2. 熟悉 PyTorch、C++/Python、Linux 开发环境;
3. 学习能力 / 创新思维 / 沟通合作能力强;
4. 优秀问题解决能力 + 自驱力;
5. AIGC 相关产品落地经验优先
2. 人类工业文明的演变(四阶段)
时代 时间节点 关键事件 / 技术
机械化时代 18 世纪末 瓦特发明蒸汽机,工业设备开始发展,开启工业革命核心阶段
电气化时代 19 世纪末 爱迪生发明电灯,电力广泛使用,推动生产生活能源方式变革
信息化时代 20 世纪 50 年代中期 电子信息技术、自动化技术兴起,奠定数字时代基础
人工智能时代 21 世纪(当前) 智能系统普及,AI 技术融入生产生活各领域(如自动驾驶、智能推荐)
3. 人工智能基础概念
  • 人工智能定义:用人工的方法在机器(计算机)上实现的智能;或使机器具有类似于人的智能。
  • 人工智能学科:研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门技术科学。
  • 关键辨析:计算器不具备 AI 属性(无自主学习与类人智能能力)。
4. 生活中的 AI 与机器学习应用
类别 具体案例
智能家居 智能语音闹钟、灯光控制系统
智能出行 自动驾驶
身份识别 人脸识别考勤、指纹 / 人脸识别解锁
消费服务 人脸支付、智能购物(商品详情 / 价格 / 优惠推荐)、智慧医疗、智慧衣帽间
平台服务 商品推荐(淘宝 / 天猫)、智能物流、仓储机器人、短视频推荐(如头条)、搜索排序
工具应用 智能助手、智能语音(小爱 / Siri)、图像编辑 / 智能美图
基础预测 天气好坏判断、西瓜好坏判断
5. 机器学习核心内容
(1)关键组件(四大核心)
  1. 数据:由样本(数据点 / 实例)组成,遵循独立同分布;样本含特征(协变量),如图像数据中单张照片为样本,像素数值为特征;优质数据集需 “量足 + 正确”,典型数据集如 ImageNet(1400 多万张图,2 万多类别)、YouTube-8M(610 万个视频,3862 个类别)。
  2. 模型:调整参数后的程序;深度学习模型由神经网络交织构成,含层层数据转换。
  3. 目标函数:量化模型有效性的 “可优化度量”,常用损失函数(最小化方向):
    • 回归任务(输出数值,如房价预测):平方误差(预测值与实际值差的平方);
    • 分类任务(输出类别,如猫狗识别):最小化错误率(预测与实际不符样本比例)。
  4. 算法:优化目标函数的参数搜索方法,深度学习主流为梯度下降(每步调整参数以减少损失)。
(2)典型训练流程
  1. 随机初始化参数的 “无智能” 模型开始;
  2. 获取带标签的数据样本(如音频片段 +“是否含唤醒词” 标签);
  3. 调整参数,提升模型在样本上的表现;
  4. 重复步骤 2-3,直至模型表现满足需求。
(3)机器学习类型
类型 核心特点 典型任务 / 方向
监督学习 数据含 “特征 - 标签” 对,目标是学习从特征到标签的映射 回归(房价预测,平方误差损失)、分类(二分类:猫狗识别;多分类:手写数字识别;多标签分类:多目标检测)
无监督学习 数据无标签,自主挖掘数据规律 聚类、主成分分析、因果关系与概率图模型、生成对抗网络(GAN)
强化学习 智能体与环境交互(观察→动作→奖励→新一轮循环),离线学习外的 “交互学习” 游戏 AI(如 AlphaGo)、机器人控制
6. 深度学习的发展与成功案例
(1)发展关键条件
  • 数据基础:高速互联网带来海量数据(如 YouTube 视频、照片共享网站);
  • 硬件基础:廉价高质量传感器、廉价数据存储、GPU 普及(提供大规模算力)。
(2)代表性成功案例(按时间 / 领域)
时间 / 领域 案例详情 技术突破意义
2012 年 深度学习首次用于 ImageNet 图像分类,错误率低于 25% 开启深度学习在计算机视觉的大规模应用,后续多数团队错误率降至 25% 以下
2014 年 提出 GAN 网络、Skype 实时语音翻译 GAN 推动生成式 AI 发展,语音翻译突破跨语言实时沟通障碍
2015 年 微软 ResNet(1000 层网络)图像识别准确度超人类、百度深度语音 2 端到端语音识别 突破神经网络层数限制,提升语音识别效率与图像识别精度
2016 年 AlphaGo 战胜专业围棋手、YOLO 实现实时目标检测、可视问答技术 证明 AI 可攻克复杂策略类任务,推动目标检测实用化(实时性)
2017 年 AlphaGo Zero 三天自学会围棋、微软会话语音识别达人类水平、TPU(张量处理单元)引入 实现 “无监督自学习”,语音识别接近人类能力,专用硬件提升 AI 算力
其他领域 机器翻译(Google Translate 优化)、图像描述(自动生成图片文字)、人脸合成、脑机接口(意念控制机器臂) 跨模态技术成熟,AI 融入医疗(Seeing AI 助盲人探索照片)、人机交互(脑机接口)领域
7. 图灵测试
  • 提出者:艾伦・麦席森・图灵(英国数学家、逻辑学家,计算机科学之父人工智能之父);
  • 定义:测试者与被测试者(人 / 机器)隔开,通过键盘等装置随意提问;若多次测试后,机器让平均参与者误判(认为是人类)比例超过 30% ,则机器被认为具有人类智能(出自 1950 年《Computing Machinery and Intelligence》);
  • 相关作品:《模仿游戏》(改编自图灵传记,聚焦其破译德国 “英格玛” 密码、扭转二战战局的经历)。
8. 深度学习框架(PyTorch)
  • 开发主体:Meta AI(原 Facebook)人工智能研究小组;
  • 技术基础:基于 Lua 编写的 Torch 库的 Python 实现;
  • 核心优势:API 设计简洁、优雅、易懂,兼顾学术界与工业界需求;
  • 使用率:2022 年 3 月数据显示,在论文实现中占比67% (3659 个仓库),远超 TensorFlow(8%)等框架;
  • 课程定位:本课程选用的开源学习框架。

4. 关键问题

问题 1:深度学习应用工程师与 AI 算法工程师的核心能力要求有何差异?两者在职业定位上侧重什么?

答案

  • 核心能力差异:
    1. 技术深度与方向:深度学习应用工程师侧重 “应用落地”,需掌握机器学习基础理论、CNN 等模型的使用场景及 PyTorch/TensorFlow 等框架;AI 算法工程师侧重 “算法研发”,需深入研究 GAN / 扩散模型 / 多模态等特定方向,且需熟悉 Linux 开发环境与 C++,AIGC 落地经验优先
    2. 能力侧重:前者更强调 “数学与编程功底 + 团队合作”;后者更强调 “创新思维、问题解决能力与自驱力”。
  • 职业定位侧重:深度学习应用工程师偏向 “将现有深度学习技术转化为实际产品 / 解决方案”;AI 算法工程师偏向 “突破现有技术瓶颈,研发新算法 / 模型,推动深度学习技术前沿发展”。
问题 2:机器学习的关键组件包括哪些?各组件在模型训练中分别扮演什么角色?

答案
机器学习的关键组件包括数据、模型、目标函数、算法,角色如下:

  1. 数据:模型训练的 “原材料”,由含特征的样本组成(遵循独立同分布),优质数据(量足 + 正确)可减少对预设假设的依赖,如 ImageNet 数据集为图像分类模型提供海量训练样本;
  2. 模型:参数调整后的程序,是 “学习的载体”,深度学习模型由神经网络构成,通过层层数据转换实现智能(如语音识别模型通过参数调整识别唤醒词);
  3. 目标函数:“衡量模型优劣的标尺”,常用损失函数(最小化方向),如回归任务用平方误差、分类任务用错误率,指导模型参数调整的方向;
  4. 算法:“优化模型的工具”,主流为梯度下降,通过每步调整参数减少损失,最终使模型在任务上表现达标(如通过梯度下降优化房价预测模型的参数,降低预测误差)。
问题 3:深度学习在图像领域有哪些代表性成功案例?这些案例如何体现深度学习相较于传统技术的优势?

答案

  • 代表性成功案例:
    1. 2012 年 ImageNet 图像分类:首次用深度学习使错误率低于 25%,后续 2017 年 29/38 支团队错误率低于 5%;
    2. 目标检测与分割:如 YOLO 实现 “实时目标检测”,可精准识别图像中多个物体(如标注 “飞机 0.945”“人 0.995” 等);
    3. 图像生成:如 Pix2Pix 可从草图生成图像,NVIDIA 软件能将涂鸦转化为现实风景;
    4. 人脸合成:实现高逼真度的人脸生成,且可用于虚拟交互等场景。
  • 技术优势体现:
    1. 精度更高:传统图像分类技术在 ImageNet 任务中错误率普遍高于 25%,深度学习突破这一瓶颈,甚至超越人类(如微软 ResNet);
    2. 效率更强:YOLO 实现 “实时检测”,解决传统目标检测速度慢的问题,可应用于自动驾驶等对实时性要求高的场景;
    3. 创造力更强:传统技术难以实现 “从无到有” 的图像生成,深度学习通过 GAN/Pix2Pix 等模型,可基于简单输入(草图 / 涂鸦)生成复杂、逼真的图像,拓展了图像技术的应用边界(如设计、艺术创作)。
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐