如今,企业正大力投入人工智能(AI)与机器学习(ML)领域,但构建在训练阶段和实际应用中均能高效运行的可扩展模型并非企业面临的唯一挑战。由于运营实践不完善,许多模型要么无法投入生产环境,要么在部署后无法创造价值——这凸显了机器学习运维(MLOps)以及构建合适人工智能基础设施的重要性。随着企业加速采用AI技术,对稳健的AI MLOps策略的需求正迅速增长。

在本文中,我们将探讨机器学习运维的定义、其重要性,以及如何构建所需的MLOps基础设施,从而自信地实现模型在生产环境中的规模化应用。

核心要点

  • 设计完善的MLOps基础设施对于AI模型从开发阶段可靠过渡到生产阶段、减少模型故障至关重要。

  • 实施可扩展且安全的MLOps工作流,可加快部署周期、简化协作并优化资源利用。

  • 结构化的治理、监控和自动化机制,有助于满足监管合规要求并支持持续改进。

  • Mirantis k0rdent AI提供可扩展且安全的MLOps基础设施,能简化混合云和多云环境中的部署、监控及生命周期管理流程。

一、什么是MLOps?

机器学习运维(MLOps)通过融合数据科学、DevOps(开发运维)与机器学习,实现了模型开发、部署和维护的标准化。与普遍误解不同,MLOps远不止是一套工具,它是确保模型成功部署的核心学科。随着企业扩大AI应用规模,支持可复现性、可扩展性和效率的结构化机器学习工作流变得尤为重要。

二、稳健的MLOps框架对企业为何至关重要?

AI MLOps已不再是可选项,而是企业必不可少的业务职能。若缺乏强大的框架支撑,企业将面临模型故障、效率低下和合规风险等问题。

主要挑战包括:

  1. AI项目价值实现周期延长:没有标准化的机器学习工作流,模型的训练、测试和部署将耗费更长时间。这会严重延迟成果交付,导致错失机遇并降低投资回报率(ROI)。

  2. 模型部署扩展困难:与自动化流水线相比,手动流水线在处理大规模数据集或多个复杂模型时更易出现瓶颈。

  3. 治理与审计漏洞:若缺乏标准化流程,可追溯性和审计工作将受到影响。当无法全面掌握所有运营情况时,合规问题也会更频繁地出现。

  4. 基础设施与人才资源浪费严重:手动操作会导致计算资源和人力资源的低效利用,而这些资源本可用于更有价值的工作。

  5. 性能漂移风险增加:若工作流中未嵌入系统化监控机制,模型性能下降可能无法及时发现,最终造成严重后果。

三、MLOps流水线的主要组件

构建高效的MLOps流水线需要一个支持可扩展性、可复现性和长期性能的系统。每个组件在打造高效且强大的工作流中都发挥着关键作用。以下是MLOps流水线的核心组件:

1. 数据版本控制与管理

数据版本控制与管理确保机器学习模型所用数据集的可靠性。版本控制可跟踪数据集的变更;数据血缘跟踪则记录数据的采集来源、所经历的转换操作,以及不同人员在不同时间对数据的修改情况。

此外,要满足通用数据保护条例(GDPR)或健康保险流通与责任法案(HIPAA)等行业安全标准的合规要求,通常需要可审计的数据血缘记录和数据保留策略。

2. 模型开发与训练

MLOps流水线强调标准化和协作式的模型开发,以在更短时间内打造更高质量的模型。容器或虚拟环境等标准化环境,确保模型能在所有机器上正常运行;通过自动化数据预处理、特征选择和数据增强流程,可大幅加快开发阶段的进度。

若团队认真跟踪实验结果、超参数、代码版本和数据版本,问题定位也会变得更加容易。

3. 持续集成与持续交付(CI/CD)

CI/CD流水线实现了模型从开发到生产的平稳过渡。模型的自动化测试会在部署前验证其准确性、性能和边缘场景适应性;CI/CD还整合了数据流水线、模型代码和环境配置,为可复现性提供支持。部署自动化可将模型自动推送到生产环境,减少人工操作。

4. 模型监控与重新训练

模型监控包括对准确率、精确率、召回率和延迟等指标的实时跟踪。监控的另一重要内容是漂移检测,即识别模型底层模式的变化。自动化警报和仪表板会及时向团队通知模型性能下降或异常情况。

此外,当模型性能下降时,需定期或按需对模型进行重新训练。

5. 治理与元数据跟踪

治理机制确保合规性、可审计性,并实现模型MLOps全生命周期的可视化。维护日志也是满足众多监管要求的必要条件。基于角色的访问控制(RBAC)仅允许授权用户访问敏感模型或数据。

集中式仪表板可跟踪所有活跃和已归档的模型;模型血缘和元数据则记录每个模型由哪些数据、代码和参数生成。

四、MLOps与AIOps的区别是什么?

MLOps主要支持机器学习生命周期,而AIOps(人工智能运维)则利用AI实现IT运维自动化。MLOps主要由数据科学家和机器学习工程师使用,用于标准化和加快机器学习工作流。

以下是两者的核心区别:

关键维度

MLOps(机器学习运维)

AIOps(人工智能运维)

核心焦点

实现机器学习模型的运营化

实现IT运维的自动化

使用者

数据科学家、机器学习工程师

IT运维团队

核心工具

机器学习框架、CI/CD工具、模型监控工具

监控工具、事件响应工具

输出成果

已部署的高性能模型

稳定的IT环境

AI应用场景

构建、部署和维护模型

检测IT系统中的异常

五、投资MLOps的优势

成熟的MLOps实践能带来多方面优势,如提升效率、增强可扩展性和扩大业务影响力。主要成果包括:

1. 加快实验与部署周期

通过自动化工作流和标准化流程,企业可加快实验进度,并更快地将AI模型部署到生产环境。这能缩短周转时间,让企业及时把握机遇。MLOps从以下方面支持速度提升:

  • 减少延迟:借助自动化流水线,新模型无需人工干预即可完成测试或部署更新。

  • 并行实验:隔离环境使数据科学家能同时运行多个实验。

  • 快速原型开发:标准化的CI/CD工作流加速了模型从开发环境到预生产环境的推广。

  • 快速反馈:更短的反馈循环让企业能充分利用新的数据趋势和业务机会。

2. 提高生产环境中模型的准确性

若缺乏严谨的MLOps流水线,模型从开发环境迁移到生产环境后,准确性可能会下降。随着数据不断变化,企业依赖模型准确性来匹配实际场景需求。MLOps通过以下方式帮助模型实现更高准确性:

  • 持续监控:MLOps工作流会监控数据漂移或概念漂移,以及其他可能预示性能下降的异常情况。

  • 自动化重新训练:当模型性能下降时,自动化重新训练会利用更新后的数据恢复准确性。

  • 模型版本对比:对比当前模型与历史版本,找出能实现最佳性能的配置。

3. 降低基础设施与运维成本

若缺乏自动化,AI管理会导致资源和人力的浪费。MLOps能减少这种浪费、提高效率并降低成本。其显著降低基础设施成本和运维复杂度的原因包括:

  • 高效的计算资源利用:通过自动化扩展,模型仅在需要时消耗计算资源。

  • 基于云的动态扩展:云原生MLOps能在高峰期自动分配GPU(图形处理器)或TPU(张量处理单元),非高峰期则自动缩减资源。

  • 减少手动维护:部署、监控和故障排查所需的人工工程工作量大幅减少。

4. 强化合规性与版本控制

MLOps提高了模型输出的可追溯性和可信度,同时让企业更易满足合规要求。尤其在受监管行业,企业必须能够跟踪并解释每个模型决策。结构化、标准化的机器学习工作流通过以下方式提升合规性和版本控制效果:

  • 端到端可追溯性:每个模型都与其代码、数据和参数相关联。

  • 自动化文档生成:元数据和血缘跟踪会自动生成记录,更易满足行业法规对可解释性、审计日志和可复现性的要求。

  • 版本控制:借助模型和数据集的精确版本,可复现任何实验结果。

5. 提升跨团队可见性与协作

成功的AI工作流需要数据科学团队、DevOps团队和机器学习团队的协同配合,才能打造出可在企业内部部署、监控并获得信任的模型。MLOps通过以下方式促进团队协作:

  • 统一工作流:AI MLOps平台为所有团队集中管理模型代码、数据流水线和部署工作流。

  • 基于角色的访问控制:在保障敏感数据安全的前提下,允许数据科学家、DevOps工程师和机器学习工程师协同工作。

  • 清晰沟通:自动化CI/CD流水线减少了模型和数据传递过程中的沟通误解。

六、AI如何增强MLOps工作流?

MLOps工作流本身已具备强大能力,但通过AI技术可进一步提升其性能。人工智能能为MLOps提供更智能的自动化、更优的优化方案和更具适应性的系统,甚至可实现模型漂移识别、重新训练管理和扩展编排。

AI主要提供以下功能:

  1. AI驱动的模型监控:自动化AI可识别异常输出、离群值或性能下降等潜在问题信号。AI监控还能在故障发生前进行预测,触发主动措施以减轻损失。

  2. 智能重新训练与漂移检测:当输入与输出之间的关系发生变化时,AI可自动对模型进行重新训练。此外,AI还能将当前模型性能与历史阈值对比,判断是否需要重新训练。

  3. 动态CI/CD流水线调优:可自动优先对高价值或高风险模型进行测试或持续部署,同时还能结合资源可用性和历史故障模式提升效率。

  4. 增强型数据标注:AI可自动标注简单案例,而人工专注于复杂或模糊的场景,这大幅减少了大规模数据集标注的人工工作量。

  5. 自适应资源分配:可自动调整资源使用情况,在需求高峰期优先为关键模型分配资源;还能在集群或云区域间自动分配任务,以提高效率。

七、构建企业级AI MLOps基础设施:5个步骤

AI MLOps解决方案已成为企业的战略必需品,但若无合适的实施计划,设计和构建基础设施会面临诸多挑战。从评估准备情况到选择架构和扩展工具,需考虑多个重要因素。以下是帮助你启动项目的高层级概述:

1. 评估当前机器学习成熟度

在采用任何新流程前,关键是要了解企业当前的机器学习工作流。需识别基础设施、团队技能和数据流水线中的差距,以便有针对性地进行升级。可通过以下步骤评估当前状态:

  • 评估现有机器学习流水线:是否存在用于模型开发、测试和部署的现有流水线?模型的版本控制和监控方式是怎样的?

  • 识别基础设施差距:当前的存储、计算和CI/CD系统能否处理大规模机器学习工作负载?

  • 团队准备情况评估:机器学习团队、DevOps团队和数据工程师是否存在技能缺口?

  • 数据质量与可访问性:用于模型训练的数据在质量、完整性和可访问性方面表现如何?

2. 定义治理与访问控制规则

若缺乏适当的治理机制,企业可能会面临合规违规、数据滥用和责任不清等问题。以下步骤对避免此类问题、维持MLOps安全标准至关重要:

  • 明确合规要求:列出企业必须遵守的法规(如GDPR或HIPAA),以及模型需满足的相应要求。

  • 制定访问控制策略:实施基于角色的访问控制(RBAC),限制对数据和模型的访问权限。

  • 保障数据隐私与加密:为满足隐私标准,模型训练和AI推理中使用的所有数据都必须进行加密处理。

3. 选择可扩展的工具与平台

选择合适的工具与平台至关重要,因为这一决策需支持企业增长、与现有系统集成,并保障长期灵活性。

选择工具和平台时,应优先考虑以下因素:

  • 可扩展性与可靠性:确保工具和平台能处理大规模数据集、多节点训练,以及不断增长的模型数量、用户数量和数据量。

  • 云原生与混合部署支持:选择支持本地和云环境的解决方案。

  • 模块化与可扩展性:选择能与当前及未来工作流集成的工具,避免供应商锁定。

4. 建立CI/CD与测试流水线

CI/CD和测试流水线是任何稳健MLOps框架的核心,因为模型需可靠且快速地部署才能创造价值。为此,CI/CD和测试流水线应包含以下内容:

  • 持续交付:将经过验证的模型自动推送到生产环境。

  • 自动化构建与测试:在部署前,自动对模型进行单元测试、性能测试和偏差检查。

  • 基础设施即代码(IaC):标准化部署环境,提高可复现性。

  • 回滚机制:当出现性能问题时,能快速回退到之前的稳定模型版本。

5. 持续监控与迭代优化

模型部署后,必须进行持续监控和改进,以维持性能标准。需通过持续迭代确保模型的准确性、效率和相关性。设置监控时,应重点关注以下方面:

  • 实时性能监控:跟踪准确率、精确率、召回率、延迟和资源利用率等关键指标。

  • 日志记录与可观测性:详细的预测日志、错误日志和系统健康日志,是故障排查的重要依据。

  • 迭代改进:模型需要不断评估、更新和优化,以保持可靠性。

八、选择最佳MLOps工具

选择高效的MLOps工具是构建高效MLOps工作流的关键。企业级工具应支持模块化扩展、与现有团队工作流对齐,并尽可能降低运维成本。

选择MLOps工具时,需考虑以下关键点:

  1. 开放式MLOps架构与可扩展性:工具应能与现有数据存储、流水线和计算资源良好兼容。此外,选择开源AI基础设施可避免供应商锁定,并简化与新技术的集成。

  2. 实验跟踪与元数据支持:确保所选工具能跟踪超参数、数据集版本和实验结果,这在对比不同模型版本时也十分有用。

  3. 可扩展的基础设施集成:工具具备弹性伸缩能力有助于提高成本效率;同时,工具还应支持本地和云环境,以实现最大灵活性。

  4. 内置监控与回滚支持:MLOps监控对于在漂移、异常和故障扩大前发现问题至关重要。若出现性能问题,自动回滚功能可切换到之前的模型版本,确保系统稳定运行。

  5. 与常见机器学习框架的兼容性:优秀的MLOps工具应支持TensorFlow、PyTorch、XGBoost、Scikit-learn和ONNX等格式,方便团队在不同框架间切换。

九、MLOps最佳实践

要实现可持续、安全且可靠的AI运营,需遵循MLOps最佳实践。这些原则围绕可复现性、测试、安全性和治理展开。

以下是四大核心原则的详细说明:

  1. 自动化模型测试与验证测试是确保模型可靠部署的基础,而验证则在模型投入生产前维持其性能标准。自动化这些流程可防止错误并节省时间,尤其应关注以下方面:

  • 单元测试:对数据预处理和模型推理等组件分别进行验证。

  • 偏差与公平性检查:开展伦理AI测试,检测预测结果中的偏差。

  • CI/CD集成:将这些测试自动化整合到MLOps流水线中,避免人工错误。

  1. 实施严格的访问与审计控制AI模型常处理敏感数据,因此安全性至关重要。严格的访问和审计控制会记录所有操作,并仅允许授权用户访问。其核心功能包括:

  • 基于角色的访问控制(RBAC):仅允许特定授权用户访问敏感数据和模型。

  • 数据安全:对传输中和静态数据进行加密,保护敏感信息。

  • 全面审计:跟踪所有模型修改和部署操作。

  1. 构建可复现性与可追溯性机制可复现性能增强对AI模型的信任,而可追溯性则简化合规流程。严谨的可复现性和可追溯性实践,还能帮助快速定位问题根源,这对MLOps工作流至关重要。为确保模型可审计、可调试且具备完全透明度,流水线应包含:

  • 版本控制:为每个模型版本存储对应的代码、数据和超参数,以便审计和回滚。

  • 环境一致性:使用容器或虚拟环境,确保随时可复现实验条件。

  1. 规划持续监控与反馈循环在AI工作流中纳入持续监控和反馈循环也十分重要。持续监控有助于更快发现问题,而反馈循环则能让模型通过实际输入不断改进。为获得理想效果,应重点关注:

  • 实时指标跟踪:持续监控准确率、延迟和资源消耗等关键绩效指标(KPI)。

  • 反馈循环构建:整合人工或系统反馈,为部署后的模型重新训练提供支持。

本文翻译自

https://www.mirantis.com/blog/ai-mlops-building-the-right-infrastructure/,仅供参考学习

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐