目前负责蚂蚁集团AI基础设施以及大规模Kubernetes集群的稳定性工作。曾就职于搜狗、滴滴和红帽公司,担任架构师及虚拟化工程师。职业生涯中,一直专注于云原生相关技术领域,并热衷于在CNCF技术沙龙、kubecon等活动中分享和学习云原生相关的最佳实践。

目前负责蚂蚁集团AI基础设施以及大规模Kubernetes集群的稳定性工作。曾就职于搜狗、滴滴和红帽公司,担任架构师及虚拟化工程师。职业生涯中,一直专注于云原生相关技术领域,并热衷于在CNCF技术沙龙、kubecon等活动中分享和学习云原生相关的最佳实践。
当前智算节点的异常发现、定位、自愈主要依赖事后和被动式的监控工具,如DCGM-Exporter、Device Plugin等。这些方法虽已成熟,但普遍存在滞后性,无法在异常发生前有效预防,且本质是通算场景的延续,未能充分适应智算任务对节点稳定性更高的敏感度,导致智算业务面临更大的潜在风险。
本次演讲将深入探讨我们在智算节点压测拦截方面的创新实践。我们利用云原生Kubernetes的强大调度能力,将一系列定制化压测任务赋能到节点上线前、节点故障后、节点空闲时以及重点任务运行前等多个关键场景。通过这种全天候、立体化、且可任意组合的检查机制,我们实现了对智算节点的深度异常发现,远超传统监控手段。实践证明,这套压测体系能有效识别并阻断携带隐患的节点直接影响在线业务,最终显著提升智算系统的整体稳定性和业务连续性。
演讲提纲
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

