目录

一、先想明白:我们为啥现在离不开深度学习?—— 从工业文明的脚步说起

二、绕不开的基础:人工智能、机器学习到底是啥?—— 从 “唤醒小爱同学” 说起

三、机器学习的 “四大支柱”:少一个都玩不转

1. 数据:不是越多越好,而是 “对的多” 才好

2. 模型:参数 “旋钮” 拧出来的 “判断规则”

3. 目标函数:给模型 “打分” 的尺子

4. 优化算法:帮模型 “找到最佳旋钮位置” 的方法

四、机器学习的 “常见任务”:原来我们平时用的是这些

1. 监督学习:“给答案” 的学习

2. 其他任务:还有 “不给答案” 和 “试错学习”

五、深度学习为啥现在这么牛?—— 数据和算力的 “双重加持”

六、入门工具选哪个?—— 我为啥先学 PyTorch

七、写在最后:原来深度学习不是 “黑盒子


从生活到技术:我入门深度学习时搞懂的那些核心事儿

      今天花时间啃完了深度学习的基础内容,才发现之前对 “AI” 的理解一直停留在 “好用的工具” 层面 —— 原来背后藏着这么多从生活逻辑延伸来的技术逻辑。整理了一下我觉得最关键的知识点,用自己能看懂的话记下来,也希望能帮到和我一样刚入门的人。

一、先想明白:我们为啥现在离不开深度学习?—— 从工业文明的脚步说起

      最开始老师先带我们回顾了工业文明的变化,一下子就把 “AI 时代” 的位置说清楚了:从 18 世纪末瓦特发明蒸汽机的 “机械化时代”,到 19 世纪末爱迪生电灯带来的 “电气化时代”,再到 20 世纪 50 年代电子技术兴起的 “信息化时代”,现在我们正站在 “人工智能时代” 的路口。

      这不是空泛的 “技术口号”,而是真真切切渗透在生活里的:早上叫我起床的智能语音闹钟、公司门口刷脸的考勤机、导航时提示的 “前方有自动驾驶车辆汇入”、购物时 APP 推的 “你可能喜欢的商品”…… 这些我们习以为常的功能,背后其实都有深度学习在 “工作”。原来 AI 不是 “未来的东西”,而是已经帮我们把生活变便捷的 “老朋友” 了。

二、绕不开的基础:人工智能、机器学习到底是啥?—— 从 “唤醒小爱同学” 说起

      之前总把 “人工智能” 和 “机器学习” 混为一谈,今天才算分清了:
人工智能是 “让机器有类似人的智能”,比如让机器能听、能看、能判断;而机器学习是实现人工智能的 “方法之一”—— 简单说,就是让机器通过 “学习数据” 自己调整 “判断标准”,不用人一步一步写死规则。

      老师举的 “唤醒词识别” 例子特别好懂:比如唤醒小爱同学,首先得收集大量 “包含‘小爱同学’的音频” 和 “不包含的音频”(这就是数据集),然后设计一个 “能判断音频里有没有唤醒词” 的程序 —— 这个程序里有很多 “参数”,像收音机的旋钮一样,调整旋钮就能改变判断结果。所有调整过参数的程序合起来叫 “模型族”,而用数据集找到 “最佳旋钮位置” 的过程,就是 “学习算法”。

      典型的训练过程也很直观:一开始参数是随机的(机器啥也不会),给它一批音频样本(带 “是 / 否” 标签),调整参数让它判断得更准,反复多来几轮,直到它能稳定认出唤醒词 —— 这不就像教小朋友认东西吗?先给例子,再纠正错误,慢慢就会了。

三、机器学习的 “四大支柱”:少一个都玩不转

搞懂了基本逻辑后,发现机器学习有四个核心组件,就像桌子的四条腿,缺一个都站不稳:

1. 数据:不是越多越好,而是 “对的多” 才好

      数据是机器的 “教材”。比如处理图像时,一张照片就是一个样本,每个像素的数值就是 “特征”;处理文本时,一段评论就是一个样本,词语的排列就是特征。老师还提了几个常用的数据集,比如有 33 万张图片的微软 COCO、涵盖 2 万多类别的 ImageNet—— 原来做 AI 项目时,“找对数据集” 和 “收集足够多数据” 一样重要,要是数据本身有偏差(比如只收集了白天的照片,让机器判断夜晚的场景就会出错),再复杂的模型也没用。

2. 模型:参数 “旋钮” 拧出来的 “判断规则”

      模型就是 “调整好参数的程序”。比如判断一张图是不是猫,模型里的参数就像 “判断标准”:“耳朵是不是三角形”“毛是不是长的”…… 深度学习的模型之所以强,是因为它的 “旋钮” 特别多,能处理更复杂的情况(比如不同品种的猫、不同角度的猫),就像一个精密的仪器,能应对更多场景。

3. 目标函数:给模型 “打分” 的尺子

      怎么知道模型好不好用?得有个 “打分标准”,这就是目标函数。比如预测房价时,用 “预测值和实际房价的平方差” 来打分(平方误差),差越小分越高;判断图片是不是猫时,用 “判断错的样本比例” 来打分(错误率),比例越低越好。我们训练模型的目标,就是让这个 “分数” 到最好。

4. 优化算法:帮模型 “找到最佳旋钮位置” 的方法

      有了打分标准,怎么调整参数让分数变好?最常用的就是 “梯度下降”。老师用 “下山” 打比方:假设模型现在在 “山中间”,梯度下降就是 “先看往哪个方向走一步能下山更快”,然后一步步调整,直到走到 “山脚”(分数最低,模型最好)。这一步不用我们手动算,框架会帮我们做,但理解这个逻辑后,就知道模型是 “怎么慢慢变好” 的了。

四、机器学习的 “常见任务”:原来我们平时用的是这些

搞懂了基础组件,再看机器学习的任务类型,就觉得很清晰了:

1. 监督学习:“给答案” 的学习

      最常见的类型,就是给机器 “带答案的样本”。比如:

  • 回归任务:预测房价、预测气温 —— 因为输出是 “具体数值”,就用平方误差打分;
  • 分类任务:猫狗识别、手写数字识别 —— 输出是 “类别”,就用错误率打分;
  • 多标签分类:比如一张图里有猫、狗、树,要同时识别出来 —— 这就是 “多选多”,比如短视频分类、多目标检测都属于这类。

2. 其他任务:还有 “不给答案” 和 “试错学习”

      无监督学习是 “不给答案”,让机器自己找数据里的规律,比如聚类(把相似的样本归为一类);强化学习则是 “试错学习”,比如机器人学走路,走对了(不摔倒)就 “给奖励”,走错了就 “记教训”,慢慢找到最佳路径 ——AlphaGo 下围棋时,其实就是用了强化学习,不断在对弈中调整策略。

五、深度学习为啥现在这么牛?—— 数据和算力的 “双重加持”

老师说,深度学习不是 “突然冒出来的技术”,而是在 21 世纪才爆发的 —— 关键原因有两个:
      一是 “数据多了”:高速互联网、智能手机摄像头、照片共享网站,让我们有了海量的图像、音频、文本数据,机器的 “教材” 变多了;
      二是 “算力够了”:廉价的 GPU(图形处理器)普及,能快速处理复杂的神经网络计算 —— 以前算几天的模型,现在几小时就能搞定。

      也看了很多让人惊艳的案例:ImageNet 图像分类比赛中,2012 年用深度学习的团队第一次把错误率降到 25% 以下,后来越来越多团队跟上,2017 年有 29 个团队错误率低于 5%;AlphaGo 战胜围棋冠军,让大家看到 AI 在复杂决策上的能力;还有 Google 翻译的进步、人脸合成技术、盲人用的 Seeing AI 软件…… 这些案例让我觉得,深度学习不是 “纸上谈兵”,而是真的能解决实际问题的技术。

六、入门工具选哪个?—— 我为啥先学 PyTorch

      最后老师聊到了深度学习框架,对比了几个后,推荐我们从 PyTorch 入手。查了下才知道,PyTorch 是 Meta(原 Facebook)开发的,现在学术界和工业界用得都很多 —— 主要是它的 API 设计得很简洁,比如调参数、建模型的代码不复杂,新手容易上手。看了个数据,2022 年很多论文的实现都用了 PyTorch(占比 67%),比 TensorFlow 多不少,所以决定先把 PyTorch 的基础打牢。

七、写在最后:原来深度学习不是 “黑盒子”

      以前总觉得深度学习是 “高深莫测的黑盒子”,今天学完才发现,它的核心逻辑其实和生活里的 “学习过程” 很像 —— 需要教材(数据)、需要方法(模型)、需要标准(目标函数)、需要优化(学习算法)。接下来打算再深入学 PyTorch 的实操,争取能自己跑一个简单的图像分类模型。

      如果和我一样刚入门,建议先从 “生活中的 AI 例子” 入手,再拆背后的技术逻辑 —— 这样学起来不枯燥,也更容易记住~

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐