监控运维产出的海量数据常受数据质量波动、标注不足和链路上下文信息缺失等问题影响,... 展开 >






董善东 博士,花名梵登。博士毕业于新加坡国立大学电子计算机系,期间研究方向主要为智能传感系统和信号处理等。阿里云钻石布道师,入选“中国信通院可观测性领域”2023年度专家。
阿里云云原生可观测 AIOps 负责人,负责可观测 AIOps 建设及商业化发展、智能运维大模型的探索等。主导了 ARMS Insights 的关键能力建设,包括构建了 APM 领域的检测和故障定位模型,提升了异常检测的准确率至95%以上,故障定位的准确率至87%以上。带领 ARMS 入选2022“Gartner APM 与可观测”魔力象限,获得2023信通院“根因分析技术”先进级认证等。
监控运维产出的海量数据常受数据质量波动、标注不足和链路上下文信息缺失等问题影响,这些挑战为AIOps的应用带来了不小的难题。伴随LLM的崛起,业界对其在多模态数据理解和处理上的能力抱以厚望,期待LLM能优化AIOps在数据理解、关联和交互体验上的表现。
本专题聚焦AIOps在不同业务场景中的实际成效:如何通过AIOps推动可量化的业务价值增长和效率提升?我们诚挚邀请了来自可观测性、监控运维技术等领域的资深专家分享他们的AIOps实战经验。
他们将分享在实际的业务场景中利用AIOps提升业务效能时遇到的难题、挑战、以及他们的解决方案、模型、架构,和取得的可度量的业务价值。此外,我们还将探讨LLM时代下AIOps的创新架构,以及LLM如何为AIOps带来新的变革和潜能。
在现在的业务中对数据的监控是必不可少的。主要体现在这两个方面:一是数据正确性直接影响服务正确性和算法效果,监控是拦截数据问题的“最后防线”;二是数据问题破坏力和感知时长成正相关,及早感知问题可以最大限度减少破坏。
而大数据监控的痛点也很常见,主要体现在“检测难”“分析难”和“收敛难”这三的层面。
基于此,网易云音乐团队的解决方案对症下药:
效果说明这部分,也是我即将在ArchSummit会议上重点介绍的:
演讲提纲:
听众收益点:
准确而快速的根因分析是故障快速恢复的关键,本次演讲将基于酷家乐 SaaS 产品监控的落地经验,介绍全链路监控系统如何帮助大型微服务系统快速根因定位,提高业务监控能力,及其实现原理。
演讲提纲:
听众受益点:
经过多年建设,字节内场的观测平台已经成为内部用户日常使用最频繁的系统之一,数万研发、SRE、QA用户对我们提出了极高的要求。作为基础平台,既要做好基础的观测能力建设,也要帮助业务最小化问题发现、排查成本,而字节业务多样,微服务规模庞大,如何在如此复杂的场景下帮助用户及时发现问题、快速排查问题,就成为了巨大的挑战。本次演讲会分享我们解决这些问题的思路。
演讲提纲:
听众受益点:
随着IT系统的复杂性日益增加,运维和监控领域面临的挑战也随之增长。AIOps,已成为解决这些挑战的有力工具,能够帮助自动化和优化监控流程,并显著提高效率。
本次分享是关于阿里云在可观测智能化上的探索与实践,探讨了智能算法在系统异常检测和故障根因定位方面的应用,如推荐告警阈值、时序预测算法、定位异常服务以及分析错误或缓慢的调用链。此外,还将介绍如何利用 LLM 将自然语言自动转换为Prometheus查询语言(PromQL)的技术,简化了查询构建的过程。
演讲提纲:
听众受益点:
随着产业互联网高速发展,ToB业务模型在整体业务规模中的占比稳步提升。在面对异构多环境下的部署交付、持续运营,如ToC、私有化、SaaS等多业务形态和ARM、X86等不同支撑平台,往往因涉及私有组件协议或开源商业版权问题而导致需要重新技术选型、重复人力投入,同时也给产品后续迭代升级带来诸多困难与挑战。
在此背景下,如何为异构业务提供开箱即用的可观测性能力成为亟待解决的命题。
综合上述ToB业务特性,腾讯文档在可观测性技术选型时,保持BC整体架构一致性,均选用生态良好的开源组件及协议,避免私有化协议及内部组件,避免平台绑定;依赖上层标准,而不依赖底层实现,抽象出数据模型接口,屏蔽不同环境下组件和存储细节,可以快速做到组件平替;通过运营行为GitOps标准化,保障业务运维安全可追溯,提升业务研效;同时通过接入AIOps与智能告警分析,自动针对告警进行根因分析,减小故障定位时间并降低MTTR。
演讲提纲:
听众受益点:
极客时间企业版
极客时间企业版
