一、先看方向:深度学习相关岗位需要什么能力?

想进入深度学习领域,先明确岗位需求是关键。PPT 中重点提到两个核心岗位,它们的核心能力要求各有侧重:

深度学习应用工程师

  1. 掌握机器学习相关的理论知识与实践技能,能将理论落地到实际场景;
  2. 熟悉 CNN 等典型深度学习模型的使用场景,同时了解常见的物体检测、图像分类模型;
  3. 精通 Python 编程,且至少熟练掌握 PyTorch、TensorFlow 等主流深度学习框架中的一种;
  4. 具备扎实的数学功底和编程能力,同时拥有良好的团队合作意识,能配合团队推进项目。

AI 算法工程师(偏计算机视觉方向)

  1. 掌握计算机视觉和图像处理的基本算法,以及常用深度学习算法,且在 GAN、扩散模型、图像生成、多模态等至少一个方向有深入研究;
  2. 编程功底扎实,熟悉 PyTorch 等主流深度学习框架,能熟练使用 C++ 或 Python 至少一种编程语言,同时适应 Linux 开发环境;
  3. 学习能力强,有创新思维,能主动推进工作,自驱力足,且能与团队良好沟通协作;
  4. 具备优秀的分析和解决实际问题的能力,若有 AIGC 相关产品落地经验会更有优势。

二、从工业文明演进,看 AI 时代的必然性

深度学习的爆发不是偶然,而是人类工业文明一步步发展的必然结果。PPT 中清晰梳理了四个关键时代,每一个阶段都为 AI 的出现打下了基础:

  1. 机械化时代(18 世纪末):瓦特发明蒸汽机,标志着工业设备开始取代人力,人类正式告别 “纯手工生产”,进入 “机器辅助生产” 的新阶段;
  2. 电气化时代(19 世纪末):爱迪生发明电灯,电力的普及让机器摆脱了地理和动力源的限制,生产效率实现质的飞跃;
  3. 信息化时代(20 世纪 50 年代中期):电子信息技术和自动化技术逐渐成熟,数据开始成为重要的生产要素,为后续 “智能决策” 积累了基础条件;
  4. 人工智能时代(21 世纪至今):智能系统逐渐具备部分 “决策能力”,机器从 “单纯执行指令” 走向 “模拟人类智能”,开始在更多复杂场景中发挥作用。

三、什么是人工智能?先看生活中的 “AI 痕迹”

很多人觉得 AI 很遥远,但其实它早已渗透到日常生活的方方面面。先搞懂两个核心概念,再看具体应用会更清晰:

1. 人工智能的定义

  • 通俗理解:用人工的方法让机器(比如计算机)具备类似于人的智能,能完成一些原本需要人类才能做的判断或决策;
  • 学科定义:人工智能是一门技术科学,主要研究和开发用于模拟、延伸和扩展人类智能的理论、方法、技术以及应用系统。

(小贴士:计算器不是 AI 哦!它只能按照预设的固定指令计算,无法自主学习和调整,不具备 “智能” 的核心特征。)

2. 生活中的 AI 与机器学习

AI 的核心技术是机器学习,很多我们习以为常的场景,背后都藏着机器学习的逻辑:

(1)无处不在的人工智能

从早上起床到晚上休息,AI 几乎贯穿了我们的一天:

  • 早晨:智能语音闹钟按时叫醒,灯光控制系统根据天亮程度自动调节亮度;
  • 通勤:自动驾驶技术在部分区域测试或落地,公司门口的人脸识别考勤机快速完成打卡;
  • 购物:付款时刷脸就能完成支付,APP 首页的商品推荐精准匹配喜好,仓库里的机器人高效分拣快递;
  • 娱乐:短视频平台根据你的浏览记录推送内容,新闻 APP 筛选你感兴趣的资讯,拍照时的智能美图功能自动优化画面;
  • 服务:智能助手(比如小爱、Siri)帮你查天气、设提醒,智慧医疗系统辅助医生诊断,智慧试衣间通过 AI 推荐适合的穿搭。
(2)藏在细节里的机器学习

机器学习就是让机器从 “经验” 中学习规律,比如这些常见场景:

  • 判断 “天气好坏”:机器会收集历史上的温度、湿度、云层厚度等数据,学习 “好天气” 和 “坏天气” 的特征,之后就能根据实时数据预测天气;
  • 判断 “西瓜好坏”:通过大量样本学习 “好西瓜” 的纹路、重量、敲击声等特征,后续就能根据这些信息快速分辨西瓜品质;
  • 语音唤醒(比如小爱同学、Siri):先采集大量音频样本,给 “包含唤醒词” 和 “不包含唤醒词” 的样本打上标签,再设计算法调整参数,找到能精准识别唤醒词的 “最佳参数集”,这样机器听到你喊唤醒词时,就能准确响应。

四、机器学习的核心:4 个关键组件 + 1 个训练逻辑

想理解深度学习,先掌握机器学习的 “底层逻辑” 很重要。PPT 中强调,不管是哪种机器学习问题,都离不开 4 个关键组件,以及一套固定的训练流程。

1. 4 个关键组件:缺一不可

数据(Data)

数据是机器学习的 “原材料”,由一个个 “样本” 组成,每个样本都包含一组 “特征”(比如图像的像素值、西瓜的重量和纹路)。
关键要求有两个:一是样本要 “独立同分布”,避免数据有偏见,影响模型判断;二是要 “量足且质优”,越多高质量的数据,越能让模型学到准确的规律。
常见的知名数据集有:ImageNet(包含 1400 多万张图片,涵盖 2 万多个类别)、COCO(33 万张图片,涉及 80 个对象类别)、LibriSpeech(1000 小时的英语阅读语音数据)。

模型(Model)

模型是数据的 “转换器”,本质上是 “调整参数后的程序”。在深度学习中,模型通常由神经网络层层交织而成,能完成复杂的数据转换 —— 比如把图像的像素值转换成 “这是猫” 或 “这是狗” 的分类结果。

目标函数

目标函数是衡量模型 “好坏” 的 “尺子”,也叫 “损失函数”,核心目标是让损失值最小化。
不同任务对应不同的目标函数:比如回归任务(像预测房价这种输出数值的任务),常用 “平方误差”(即预测值和实际值之差的平方);分类任务(像猫狗识别这种输出类别的任务),常用 “错误率”(即预测错误的样本比例)。

优化算法

优化算法是调整模型参数的 “工具”,深度学习中最常用的是 “梯度下降”。
它的原理很简单:每次调整参数前,先看 “参数微小变动” 会让损失值往哪个方向变化,然后朝着 “能减少损失” 的方向调整参数,一步步找到让损失最小的 “最佳参数”。

2. 典型训练流程:4 步让模型 “从笨到聪明”

  1. 初始化:从一个参数随机的模型开始,这时候的模型几乎没有 “智能”,只能随机输出结果;
  2. 获取数据:找一批带标签的样本(比如 “一段音频 + 这个音频里有没有唤醒词” 的标签);
  3. 调整参数:根据目标函数的结果,调整模型参数,让模型在这批样本上的表现更好;
  4. 重复迭代:不断重复 “获取数据 - 调整参数” 的步骤,直到模型在任务中的表现达到预期(比如唤醒词识别准确率超过 95%)。

五、机器学习的主要类型:从 “有监督” 到 “无监督”

根据数据是否带有 “标签”(也就是 “答案”),机器学习主要分为两类,另外还有一类能和环境互动的 “强化学习”,各自适用不同场景:

1. 监督学习(最常用)

核心逻辑是用 “带标签的样本”(即 “特征 + 答案” 的组合)训练模型,让模型学会 “从输入特征映射到标签” 的规律。
常见的任务有三种:

  • 回归:输出是具体数值,比如预测房价、未来温度,常用平方误差作为损失函数;
  • 分类:输出是具体类别,比如猫狗识别(二分类,只有两个类别)、手写数字识别(多分类,有 10 个类别),常用交叉熵作为损失函数;
  • 多标签分类:一个样本可能对应多个类别,比如多目标检测(一张图里可能同时有猫、狗、汽车)、短视频分类(一个视频可能同时属于 “搞笑” 和 “美食”),这类任务中类别不互斥,能多选多。

此外,监督学习还常用于推荐系统(根据用户历史行为标签,做个性化推荐)和序列问题(比如语音识别、机器翻译,输入和输出都是长度可变的序列)。

2. 无监督学习(无标签数据)

核心逻辑是数据没有 “答案”,让模型自主从数据中发现规律。
常见的任务有:聚类(把相似的样本归为一类,比如给用户分群,找到偏好相似的群体)、主成分分析(简化数据维度,保留关键信息)、生成对抗网络(即 GAN,能生成逼真的图像或音频)。

3. 强化学习(与环境互动)

核心逻辑是 “试错学习”:智能体(比如机器人、AlphaGo)在环境中行动,每次行动后会收到 “奖励”(做对了加分,做错了扣分),然后根据奖励调整策略,逐渐学会能获得最大奖励的行动方式。
最经典的例子就是 AlphaGo:它通过和自己下棋不断试错,最终学会了战胜人类围棋冠军的策略。

六、深度学习的崛起:关键原因 + 震撼案例

深度学习能在近 10 年快速爆发,核心原因是 “数据 + 算力” 的双重突破:21 世纪后,高速互联网让海量数据得以积累,GPU 的普及又让大规模神经网络的训练变得可行,两者结合催生了深度学习的黄金时代。

1. 深度学习的 “高光时刻”

PPT 中用多个案例展现了深度学习的实力,其中不少突破让人印象深刻:

(1)图像分类:从 “不如人” 到 “超越人”

2010 年 ImageNet 图像分类竞赛中,所有团队的错误率都在 25% 以上;到了 2012 年,首个使用深度学习的团队,错误率直接降到 25% 以下,惊艳整个行业;2017 年时,38 支参赛团队中,有 29 支的错误率低于 5%,而人类在这个任务上的错误率约为 5%,意味着深度学习已经超越人类水平。

(2)其他突破领域
  • 目标检测:能实时识别图像中的多个物体,还能给出识别的置信度(比如 “飞机,置信度 0.945”“人,置信度 0.995”);
  • 机器翻译:以 Google Translate 为例,早期翻译结果生硬且语义不准,而用了深度学习后,翻译更流畅,语义也更贴合原意(比如德语句子 “Probleme kann man niemals mit derselben Denkweise losen, durch die sie entstanden sind”,早期翻译为 “No problem can be solved from the same consciousness that they have arisen”,深度学习优化后译为 “Problems can never be solved with the same way of thinking that caused them”,更符合英文表达习惯);
  • 图像描述:能自动生成图像的文字说明,比如看到 “一只小狗坐在沙滩上的爱心图案里” 的画面,模型能准确描述出这个场景;
  • 生成式 AI:NVIDIA 的技术能把粗糙的涂鸦变成逼真的风景图,GAN 模型能合成以假乱真的人脸,这些都展现了深度学习在 “创造” 上的能力。
(3)里程碑事件(2012-2017)

2012 年:谷歌大脑的神经网络通过观看 YouTube 视频,自主识别出了 “猫”,证明了深度学习能从无标签数据中学习;
2014 年:GAN 网络正式提出,为生成式 AI 奠定基础;Skype 实现实时语音翻译,让跨语言沟通更便捷;
2015 年:微软的 ResNet(一个 1000 层的深度神经网络)在图像识别准确率上超过人类;YOLO 算法出现,实现了实时目标检测;
2016 年:AlphaGo 战胜围棋世界冠军李世石,震惊全球,让更多人看到深度学习的潜力;
2017 年:AlphaGo Zero 仅用三天自学围棋,就战胜了初代 AlphaGo;加州允许销售自动驾驶汽车,AI 在交通领域的应用迈出重要一步。

2. 更贴近生活的应用

  • 视障辅助:微软开发的 Seeing AI,能通过语音描述图像内容,让盲人通过触摸和听讲解探索照片;
  • 脑机接口:美国 Smart Cap 公司把脑电图技术集成到棒球帽里,能监测卡车司机的疲劳状态,帮助提高注意力;更先进的脑机接口甚至能让人类用 “意念” 控制机器臂,实现连续、快速的运动;
  • 数字人:比如华智冰,具备一定的交互能力和创作能力,能和人类进行简单沟通,还能生成文字或图像内容。

七、AI 的 “试金石”:图灵测试

想判断机器是否真的有 “智能”,绕不开 “图灵测试”—— 这个由 “计算机科学之父”“人工智能之父” 艾伦・麦席森・图灵在 1950 年提出的测试方法:

  • 测试规则:测试者和被测试者(一个人和一台机器)隔开,测试者通过键盘向被测试者随意提问,不能直接看到或听到对方;
  • 通过标准:进行多次测试后,如果机器能让平均超过 30% 的测试者误判 “它是人”,就认为这台机器具备了人类智能;
  • 相关延伸:有一部名为《模仿游戏》的电影,改编自艾伦・图灵的传记,讲述了他在二战期间协助盟军破译德国密码系统 “英格玛”、扭转战局的故事,也展现了他对人工智能的早期思考。

八、学深度学习,选什么框架?优先 PyTorch

PPT 中对比了主流的深度学习框架,最终给出的建议是 “优先学 PyTorch”,主要原因有三点:

  1. 流行度高:2022 年的统计数据显示,在学术论文的代码实现中,67% 的项目用了 PyTorch,远超 TensorFlow(8%)、JAX(1%)、MXNet(0%)等其他框架,学习后能更轻松地复现论文或参与项目;
  2. 易用性强:PyTorch 的 API 设计简洁、优雅且易懂,对初学者很友好,调试起来也更方便,能减少入门门槛;
  3. 适用范围广:无论是学术研究还是工业界落地,PyTorch 都被广泛使用,它由 Meta AI(原 Facebook 人工智能研究小组)开发,背靠大公司,更新和维护都很稳定,不用担心后续支持问题。
Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐