数据驱动的智能诊断系统:多智能体系统在生产环境中的技术落地与实践

所属专题:Data+AI / Agent 落地实践

嘉宾 : 赵庆杰 | 阿里云Serverless 基础架构负责人 & AgentRun 产研负责人

会议室 : 中华厅 2

讲师介绍

专题演讲嘉宾:赵庆杰

阿里云Serverless 基础架构负责人 & AgentRun 产研负责人

现任阿里云云原生 Serverless 基础架构负责人&AgentRun 产品研发负责人,专注于 Serverless 架构、AI Agent、平台即服务(PaaS)及大规模分布式系统等核心技术方向。其工作聚焦于构建新一代 Serverless AI 技术平台,旨在通过技术创新降低云原生 AI 应用的开发与运维门槛,推动先进平台能力向更广泛开发者群体普惠化落地。

在加入阿里云之前,曾就职于百度,担任核心 PaaS 平台负责人,主导建设了公司内部规模最大的 PaaS 系统,该平台稳定支撑百度约 80% 的在线业务,在高并发、高可用、弹性伸缩及资源调度等方面积累了深厚实践经验。其在后端分布式系统架构设计、微服务治理及云原生基础设施优化等领域具备扎实的技术功底与丰富的工程落地经验。

目前,在阿里云致力于探索 Serverless 与人工智能技术的深度融合,特别是在 AI Agent 与无服务器计算协同演进的新范式下,推动 PaaS 平台向智能化、自动化和极致弹性方向持续演进。

议题介绍

演讲:数据驱动的智能诊断系统:多智能体系统在生产环境中的技术落地与实践

随着云原生架构与大规模分布式系统的广泛应用,系统复杂性急剧上升,传统基于规则或单点模型的运维诊断手段已难以应对高动态、高维度的生产环境挑战。本演讲将深入剖析阿里云如何构建一套数据驱动的智能诊断系统,通过融合全栈可观测性数据(包括指标、日志、链路与 eBPF 事件)、大语言模型(LLM)推理能力与多智能体协同架构,在真实生产环境中实现端到端的故障感知、根因分析与修复建议生成。

我们将详细介绍系统的核心设计原则:1)角色化智能体分工机制——包括感知 Agent、推理 Agent、验证 Agent 与执行 Agent,各司其职并动态协作;2)数据 - 模型 - 动作闭环——如何将实时运维数据转化为智能体可理解的语义上下文,并驱动自动化决策;3)与现有 SRE 体系的无缝集成——在保障安全合规的前提下,逐步替代人工巡检与告警响应流程。

该系统已在阿里云多个 Serverless 核心产品线(中规模化落地,实测数据显示:平均故障恢复时间(MTTR)降低 40% 以上,无效告警减少 65%,人工干预频次下降 60%。此外,我们还将分享在模型幻觉控制、智能体通信协议设计、冷启动场景优化等方面的工程实践与关键教训。

演讲提纲:

  1. 引言:运维智能化的新挑战
    • 云原生时代系统复杂性激增,传统AIOps方法面临瓶颈
    • 从“单模型辅助”到“多智能体协同”的范式演进必要性
  2. 整体架构设计:构建数据驱动的多智能体诊断系统
    • 系统核心组成:可观测数据层、智能体协调引擎、动作执行层
    • 智能体角色划分:感知Agent(数据采集与异常检测)、推理Agent(根因分析)、验证Agent(假设检验)、执行Agent(修复建议/自动化操作)
    • 数据闭环:指标、日志、链路与eBPF事件如何统一建模为智能体上下文
  3. 关键技术实现
    • 多智能体通信与协作机制:基于任务分解与共识协商的动态工作流
    • LLM与领域知识融合:Prompt工程、工具调用(Tool Use)与幻觉抑制策略
    • 安全与可靠性保障:权限控制、操作审计、人工熔断机制设计
  4. 生产环境落地实践
    • 应用场景:Serverless平台冷启动异常、数据库慢查询风暴、容器集群资源争抢
    • 落地成效:MTTR降低40%+,无效告警减少65%,人工干预下降60%
    • 工程经验:从POC到规模化部署的关键路径、冷启动优化、成本与延迟权衡
  5. 总结与展望

听众收益:

  • 获得企业级智能体系统可靠性建设的方法论框架
  • 掌握多智能体可观测性设计模式与开源工具链集成方案
  • 探讨智能体诊断标准(如 OpenAgentTracing)的演进方向

交通指南

北京石景山万达嘉华酒店

Wanda Realm Beijing
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手