AIOps 业务场景最佳实践

会议室:翰林厅(三楼)
出品人:董善东 博士

监控运维产出的海量数据常受数据质量波动、标注不足和链路上下文信息缺失等问题影响,... 展开 >

专题出品人:董善东 博士

阿里云AIOps架构师

董善东 博士,花名梵登。博士毕业于新加坡国立大学电子计算机系,期间研究方向主要为智能传感系统和信号处理等。阿里云钻石布道师,入选“中国信通院可观测性领域”2023年度专家。

阿里云云原生可观测 AIOps 负责人,负责可观测 AIOps 建设及商业化发展、智能运维大模型的探索等。主导了 ARMS Insights 的关键能力建设,包括构建了 APM 领域的检测和故障定位模型,提升了异常检测的准确率至95%以上,故障定位的准确率至87%以上。带领 ARMS 入选2022“Gartner APM 与可观测”魔力象限,获得2023信通院“根因分析技术”先进级认证等。

地点:翰林厅(三楼)

专题:AIOps 业务场景最佳实践

监控运维产出的海量数据常受数据质量波动、标注不足和链路上下文信息缺失等问题影响,这些挑战为AIOps的应用带来了不小的难题。伴随LLM的崛起,业界对其在多模态数据理解和处理上的能力抱以厚望,期待LLM能优化AIOps在数据理解、关联和交互体验上的表现。

本专题聚焦AIOps在不同业务场景中的实际成效:如何通过AIOps推动可量化的业务价值增长和效率提升?我们诚挚邀请了来自可观测性、监控运维技术等领域的资深专家分享他们的AIOps实战经验。

他们将分享在实际的业务场景中利用AIOps提升业务效能时遇到的难题、挑战、以及他们的解决方案、模型、架构,和取得的可度量的业务价值。此外,我们还将探讨LLM时代下AIOps的创新架构,以及LLM如何为AIOps带来新的变革和潜能。

by 宋东辉

网易云音乐
资深测试开发工程师

在现在的业务中对数据的监控是必不可少的。主要体现在这两个方面:一是数据正确性直接影响服务正确性和算法效果,监控是拦截数据问题的“最后防线”;二是数据问题破坏力和感知时长成正相关,及早感知问题可以最大限度减少破坏。

而大数据监控的痛点也很常见,主要体现在“检测难”“分析难”和“收敛难”这三的层面。

  • 检测“难”:监控覆盖难,表数量大,指标量更是倍数放大,监控覆盖量是很难完成的工作;监控准确难,上游表异动、复杂的业务逻辑、业务变更、业务非规律波动等都在挑战“人工监控规则”准确性。
  • 分析“难”:定位难,业务表本身具有复杂的业务逻辑,告警定位难;追踪难,业务表一般依赖复杂的上游表,这些表大多具有“业务逻辑”背景,“跨业务”追踪问题的壁垒难。
  • 收敛“难”:根据监测难和分析难可知,缺少问题“检测感知”+“分析追踪”的闭环治理,大数据监控收敛难。

基于此,网易云音乐团队的解决方案对症下药:

  • 智能监控的目标是“全业务线自动覆盖,数据问题准确召回”,实现数据问题低人工成本的闭环治理。
  • 智能监控模型方案:以指标历史数据和人工处置结果为训练数据,结合统计模型和监督训练模型设计为融合模型。
  • 指标归因方案:利用数据血缘获取表上下游依赖关系,然后基于贝叶斯和Adtributor模型共同决策指标异动影响因子。
  • 工程化落地方案:辅助验证阶段:以人工监控规则为主,智能监控告警为辅。用智能监控辅助用户分析告警,进而拿到智能监控的效果支撑数据。平台化阶段:“一键监控”实现监控高效覆盖、低误报、高召回,提供“指标归因”能力辅助用户快速定位原因;依靠平台能力回收用户处置结果,实现模型闭环优化!

效果说明这部分,也是我即将在ArchSummit会议上重点介绍的:

  • 项目效果:23H2拦截数据问题比23H1提升46.8%;数据异常召回率83%(23H1召回率70%);核心监控跟进率87%(H1跟进率60%)。
  • AI 监控模型效果:相比人工规则监控,智能监控召回率100%,误报量下降70%以上。
  • 业务影响力:网易云音乐内部试点,推动网易用户使用进行中。

演讲提纲:

  1. AI 浪潮下,云音乐大数据领域的探索方向
  2. 云音乐大数据监控治理的必要性和痛点
  3. 云音乐智能监控方案
  4. 云音乐智能监控工程化落地
  5. 效果收益
  6. 后续规划

听众收益点:

  • 云音乐智能监控的技术细节,具备全业务线复制的可行性
  • 打破层层阻力的工程化落地的方案

by 何碧宏

群核科技
云原生观测/技术专家

准确而快速的根因分析是故障快速恢复的关键,本次演讲将基于酷家乐 SaaS 产品监控的落地经验,介绍全链路监控系统如何帮助大型微服务系统快速根因定位,提高业务监控能力,及其实现原理。

演讲提纲:

  1. 根因分析中遇到的问题
  2. 故障的特征分析
  3. 全链路监控在根因分析中的应用
  4. 全链路监控系统的实现
  5. 系统故障 vs 业务故障
  6. 全链路业务监控系统的实现与应用

听众受益点:

  • 全链路监控系统的实现
  • 如何使用全链路监控系统帮助故障快速根因定位和恢复
  • 如何使用全链路业务监控系统提高业务监控能力

by 孔罗星

字节跳动
Dev Infra-APM 服务端观测平台负责人

经过多年建设,字节内场的观测平台已经成为内部用户日常使用最频繁的系统之一,数万研发、SRE、QA用户对我们提出了极高的要求。作为基础平台,既要做好基础的观测能力建设,也要帮助业务最小化问题发现、排查成本,而字节业务多样,微服务规模庞大,如何在如此复杂的场景下帮助用户及时发现问题、快速排查问题,就成为了巨大的挑战。本次演讲会分享我们解决这些问题的思路。

演讲提纲:

  1. 字节内部观测平台介绍
    • What、Why
    • 业务&架构介绍
    • 内场观测现状
  2. 智能化的前置依赖
    • 海量数据标准化观测数据
    • 全面且准确的元数据
  3. 自动化与智能化的结合
    • 工程实践
    • 基础平台+内置应用
    • 生态集成:报警、飞书、Dashboard
  4. 未来展望
    • AI Everywhere
    • 极致的报警信噪比
    • LLM & Bot Studio的结合与应用

听众受益点:

  • 了解字节内部观测平台的建设历程
  • 了解在庞大微服务体系下做根因分析可能碰到的困难
  • 工程与智能化结合的最佳实践探索

by 陈昆仪 博士

阿里云
高级算法工程师

随着IT系统的复杂性日益增加,运维和监控领域面临的挑战也随之增长。AIOps,已成为解决这些挑战的有力工具,能够帮助自动化和优化监控流程,并显著提高效率。

本次分享是关于阿里云在可观测智能化上的探索与实践,探讨了智能算法在系统异常检测和故障根因定位方面的应用,如推荐告警阈值、时序预测算法、定位异常服务以及分析错误或缓慢的调用链。此外,还将介绍如何利用 LLM 将自然语言自动转换为Prometheus查询语言(PromQL)的技术,简化了查询构建的过程。

演讲提纲:

  1. 智能算法能够解决运维/监控领域的哪些痛点
  2. AIOps for 系统异常检测
    • 如何为不同的指标推荐合适的告警阈值
    • 如何用时序预测算法,实现对波动型指标的实时异常检测
  3. AIOps for 故障根因定位
    • 微服务架构下,如何用算法定位异常服务
    • 如何用算法实现错/慢调用链分析
  4. LLM for 自然语言转 PromQL
  5. AIGC将给可观测带来哪些机遇与挑战

听众受益点:

  1. 学习和了解在可观测AIOps的场景化解决方案
  2. 学习和了解在大模型时代下,如何通过LLM实现自然语言到PromQL的转换

by 张瀚元

腾讯文档
高级工程师

随着产业互联网高速发展,ToB业务模型在整体业务规模中的占比稳步提升。在面对异构多环境下的部署交付、持续运营,如ToC、私有化、SaaS等多业务形态和ARM、X86等不同支撑平台,往往因涉及私有组件协议或开源商业版权问题而导致需要重新技术选型、重复人力投入,同时也给产品后续迭代升级带来诸多困难与挑战。

在此背景下,如何为异构业务提供开箱即用的可观测性能力成为亟待解决的命题。

综合上述ToB业务特性,腾讯文档在可观测性技术选型时,保持BC整体架构一致性,均选用生态良好的开源组件及协议,避免私有化协议及内部组件,避免平台绑定;依赖上层标准,而不依赖底层实现,抽象出数据模型接口,屏蔽不同环境下组件和存储细节,可以快速做到组件平替;通过运营行为GitOps标准化,保障业务运维安全可追溯,提升业务研效;同时通过接入AIOps与智能告警分析,自动针对告警进行根因分析,减小故障定位时间并降低MTTR。

演讲提纲:

  1. C To B 异构多环境业务背景与挑战
  2. 可观测性 ToC标准化建设与ToB私有化部署
  3. AIOps与智能告警赋能业务研效提升
  4. 可观测性在私有化与AIGC领域探索
  5. 未来方向展望

听众受益点:

  • 腾讯文档在C To B业务实践中通过可观测性持续高效运营经验
  • 通过AI辅助可观测性智能告警运维以提升业务整体研效

交通指南

深圳博林天瑞喜来登酒店

Sheraton Shenzhen Nanshan
地址:广东省深圳市南山区留仙大道4088号
如您在购票过程中遇到问题,请扫码咨询票务小助手