Coding Agent 正在提升软件开发效率,但系统上线后的运行治理仍然高度依赖专家经验。告警分析、故障定位、变更影响、日志排查、Trace 分析和 Runbook 执行,面对的不是静态代码,而是一个持续变化的运行世界。
本次分享将介绍 AI Native SRE Agent 的工程实践:如何融合基础设施、监控指标、日志、Trace/APM、事件、发布、CMDB 与运维知识,构建运行世界的数据基础;如何通过本体、语义层和全景图谱,形成 Agent 可理解、可推理的 Running World Model;如何结合 C4 模型实现运行时架构自动可视化,并支撑架构理解、健康巡检、根因分析、容量规划、变更风控、FinOps 优化等运行治理场景。
同时,分享将介绍 Harness 如何支撑 SRE Agent 的评测、回放、经验沉淀、Skills 复用和持续进化,最终形成一套从运行数据到语义认知、从 Agent 能力到工程闭环的 AI Native SRE 方法论。
演讲提纲
- 从 Coding 到 Running:为什么需要 SRE Agent
- Coding Agent 解决软件开发效率问题。
- SRE Agent 面对的是上线后的运行治理问题。
- 运行阶段的复杂性来自服务依赖、资源变化、监控日志、发布变更和专家经验。
- 核心问题:Agent 如何理解一个持续变化的运行世界?
- 数据层:构建 Running World 的事实基础
- Infra:计算、网络、存储、数据库、容器、云资源。
- Observability:Metrics、Logs、Trace/APM、Events、Alerts。
- Knowledge:团队文档、SOP、Runbook、历史故障、RCA。
- 关键观点:单一数据源无法完成诊断,SRE Agent 需要融合多源运行事实。
- 认知层:让 Agent 建立对运行世界的理解
- 仅有数据并不足以让 Agent 完成诊断,不同系统中的资源、服务、实例、告警和变更往往语义不一致。
- 本部分将介绍如何通过本体、语义层和全景图谱,把分散的运行数据组织成统一的 Running World Model,让 Agent 能够理解系统对象、关系和上下文。
- 核心观点:Agent 缺少的不是更多文档,而是对运行世界的统一语义理解。
- 能力层:SRE Agent 如何参与运行治理
- 当 Agent 建立了对运行世界的理解,它就可以围绕真实运维场景完成连续推理与决策辅助。
- 本部分将介绍 SRE Agent 如何支撑架构可视化、健康巡检、根因分析、容量规划、变更风控、FinOps 优化等典型场景。
- 核心观点:SRE Agent 的价值,不是替人打开更多工具,而是帮助 SRE 在复杂运行上下文中更快形成判断,并持续提升系统治理效率。
- 工程闭环:让 SRE Agent 可落地、可进化
- SRE Agent 面向真实生产环境,不能只依赖一次性的 Prompt 效果,而需要可评测、可回放、可验证。
- 本部分将介绍 Harness 如何通过任务轨迹、工具模拟、沙箱验证、经验沉淀和能力复用,让 Agent 从“能回答”走向“可验证、可复现、可持续优化”。
- 核心观点:Agent 也需要自己的 DevOps。
- 案例:一次线上故障治理闭环
- 最后通过一个线上故障案例,将前面的数据、语义、图谱、架构、诊断和 Harness 串联起来。
- 从一次 CPU 告警开始,展示 Agent 如何理解告警背后的应用、资源、部署和变更,如何结合日志与 Trace 进行分析,如何匹配历史经验和 Runbook,最终形成根因判断和处置建议,并将处理过程沉淀为后续可复用的经验。
听众收益
- 理解 SRE Agent 与 Coding Agent 的关键差异,认识到 SRE Agent 的核心不是简单接入 LLM 和工具,而是建立对运行世界的语义理解。
- 掌握从基础设施、可观测数据和运维知识出发,通过本体、语义层和全景图谱构建 Running World Model 的方法路径。
- 获得 SRE Agent 工程化落地的实践参考,了解如何支撑架构可视化、健康巡检、根因分析、容量规划、变更风控、FinOps 优化等运行治理场景,以及 Harness 驱动的持续进化。