什么是 MLOps?

MLOps 指 Machine Learning Operations,也就是机器学习运维。它把类似 DevOps 的实践带入机器学习项目。机器学习模型并不会在数据科学家训练完成后就结束,它还需要版本管理、测试、部署、监控、再训练、治理和持续改进。MLOps 为这个生命周期提供流程和工具。MLOps 最相关的团队通常是数据科学团队、AI 工程团队、平台团队,以及构建 AI 产品的软件团队。典型工作包括收集和准备训练数据、跟踪实验和模型版本、将模型部署到生产环境、监控模型准确性和漂移、在性能下降时重新训练模型、管理审批、治理和合规。

什么是 AIOps?

AIOps 指 Artificial Intelligence for IT Operations,也就是面向 IT 运维的人工智能。它把 AI、机器学习、关联分析和自动化应用到 IT 运维数据中。与关注模型生命周期不同,AIOps 关注运营健康,帮助团队理解服务器、存储、网络、云资源、应用、数据库、中间件、动力环境和业务服务中正在发生什么。AIOps 最相关的团队是 IT 运维团队、基础设施团队、网络运维团队、数据中心团队、SRE 团队,以及负责可用性和服务连续性的 IT 管理者。典型工作包括收集基础设施和应用遥测数据、检测异常和早期预警信号、跨系统关联告警、识别可能根因、在风险影响业务服务前进行预测、减少重复低价值和噪音告警、将事件与业务影响连接起来。

核心区别

理解两者差异的简单方法,是看它们管理的对象。MLOps 问的是:模型是否正常工作?关注模型准确性、漂移、训练数据、部署流水线和 AI 治理。AIOps 问的是:基础设施和服务环境是否健康?关注可用性、故障检测、告警关联、根因分析和业务连续性。

MLOps 和 AIOps 在哪里重叠?

当 AI 系统成为关键业务基础设施的一部分时,MLOps 和 AIOps 会出现重叠。企业可能在生产中运行 AI 推荐引擎、欺诈检测模型或预测性维护模型。MLOps 管理模型本身,AIOps 监控模型所依赖的基础设施和服务。MLOps 检测模型预测准确性下降,AIOps 检测由于 GPU 饱和、存储延迟、网络丢包或硬件部件故障导致的模型服务基础设施变慢。

基础设施团队为什么需要关心?

基础设施团队不需要变成数据科学团队才能从 AI 中受益。但他们需要理解应用内部的 AI 与用于管理运维的 AI 之间有什么不同。AIOps 与基础设施团队的日常工作直接相关,因为它解决的是 IT 团队已经面临的问题:对监控工具过多的痛点、告警太多团队出现告警疲劳的困境、根因分析缓慢的挑战、事件响应依赖人工的现状、物理层和逻辑层之间可视性不足的问题、资产拓扑和服务数据割裂的情况,以及难以证明 IT 对业务连续性影响的压力。

何时需要 MLOps / 何时需要 AIOps

如果组织正在构建、部署或运营生产级机器学习模型,通常需要 MLOps。如果组织管理复杂 IT 基础设施,并希望降低运营风险,通常需要 AIOps。在成熟的数字化组织中,MLOps 和 AIOps 可以相互支撑。MLOps 保持 AI 模型可靠,AIOps 保持模型背后的基础设施可靠。两者合理使用时,团队可以回答两个重要问题:AI 模型是否按预期工作?由 MLOps 回答。AI 服务背后的基础设施是否健康?由 AIOps 回答。用 MLOps 管理 AI 模型,用 AIOps 通过 AI 管理 IT 运维。

要点

随着 AI 成为日常业务运营的一部分,MLOps 和 AIOps 的区分会更重要。两者不应被看作互相竞争的概念,它们解决的是同一个更大挑战中的不同部分:让复杂技术系统更可靠、更容易运营

相关产品