如果把机器学习比作“让计算机自己学本领”,那不同的“学习方式”就对应着不同的分类。其中最核心的三大类——监督学习、无监督学习和强化学习,就像三种不同的“训练班”,各自有独特的“教学模式”和“毕业技能”。

监督学习:“有老师批改作业”的学霸班

监督学习的关键词是“有标签”,就像学生做题时每道题都附带着“标准答案”。训练数据里,每个输入(比如一张图片、一段文本)都对应一个明确的“标签”(比如“猫”“垃圾邮件”“房价150万”)。模型的任务就是通过对比自己的“预测答案”和“标准答案”的差距,不断调整“解题思路”,直到能准确从新输入中算出标签。

比如你想让模型识别水果,就给它上千张“苹果+标签‘苹果’”“香蕉+标签‘香蕉’”的图片,它会自己总结出苹果的红圆形、香蕉的黄月牙形等特征,下次看到新水果就能立刻“报出名字”。这种“有监督”的学习,特别适合需要明确结果的任务,比如垃圾邮件过滤、疾病诊断(输入病历数据,输出“患病/健康”标签)。

无监督学习:“自己找规律”的探索班

无监督学习就像给学生一堆“没有答案的素材”,让他们自己找出隐藏的规律。训练数据里只有输入,没有任何标签——比如一堆杂乱的用户购买记录、一组未分类的新闻文本。模型需要像侦探一样,通过分析数据之间的相似性、差异性,自己“归纳总结”出分组或模式。

最常见的例子是超市的“商品聚类”:把购买牛奶的用户和购买面包的用户归为一组,因为他们大概率是“早餐需求人群”;把购买 diapers(尿布)和啤酒的用户归为另一组(这个经典案例曾帮助超市调整货架摆放)。无监督学习不需要人工标注大量数据,擅长发现数据中“人类没注意到的秘密”,比如用户画像划分、异常交易检测(找出和正常交易模式不一样的数据)。

强化学习:“在试错中闯关”的游戏班

强化学习更像“训练机器人闯关”:模型(智能体)在一个环境里(比如游戏场景、机器人工作空间)不断做出动作,每一步动作都会得到“奖励”或“惩罚”(比如游戏得分增加是奖励,撞到障碍物是惩罚)。它的目标不是“记住标准答案”,而是通过无数次试错,学会一套“能拿最多奖励”的“动作策略”。

比如AlphaGo下围棋,就是通过和自己对弈数百万局,每赢一局得到奖励,每输一局得到惩罚,最终学会超越人类的下棋策略;再比如自动驾驶汽车,在模拟环境中不断尝试“刹车”“转弯”,避开障碍物时得奖励,发生碰撞时受惩罚,逐渐掌握安全驾驶的技巧。强化学习的核心是“延迟满足”——有时候为了最终的大奖励,需要先接受小惩罚(比如为了绕开前方拥堵,先多走一段路)。

简单来说,监督学习是“学已知答案”,无监督学习是“找未知规律”,强化学习是“练最优策略”。这三种分类不是互相割裂的,很多复杂的AI系统会把它们结合起来——比如先用无监督学习处理海量无标签数据,再用监督学习微调,最后用强化学习适应动态环境。正是这些不同的“学习模式”,让机器学习能应对从“识别图片”到“控制机器人”的各种复杂任务。

------------伴代码深耕技术、连万物探索物联,我聚焦计算机、物联网与上位机领域,盼同频的你关注,一起交流成长~

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐