范式智能(原名第四范式)工程师,系统研发专家。在范式一直关注在 AI Infra 这个方向上,作为主要的负责人之一,参与范式的 GPU 集群的建设。目前是 HAMi 社区的 maintainer 之一,主要的贡献集中于 HAMi 调度器的性能优化和 HAMi-DRA 上,并且参与 HAMi 社区的维护工作。

范式智能(原名第四范式)工程师,系统研发专家。在范式一直关注在 AI Infra 这个方向上,作为主要的负责人之一,参与范式的 GPU 集群的建设。目前是 HAMi 社区的 maintainer 之一,主要的贡献集中于 HAMi 调度器的性能优化和 HAMi-DRA 上,并且参与 HAMi 社区的维护工作。
随着国产算力的发展,算力集群的从单一的 NVIDIA 设备逐步走向有更多不同国产厂商设备构成的异构算力集群,异构算力的管理这个问题逐步浮出水面。HAMi 作为范式参与发起的项目,是范式在异构算力管理上的实践的成果。HAMi 在易用性和管理能力上取得了一个较好的平衡,但是受限于 Kubernetes 的 Device Plugin 本身的缺陷,调度性能和精细化分配的能力面临瓶颈。但是随着 Kubernetes v1.34 将 Dynamic Resource Allocation(DRA) 特性正式推进至 GA,集群设备资源管理从以节点为中心的分配模型,逐步演进为以资源对象为核心的声明式管理模式,相比传统 Device Plugin 接口仅能暴露简单容量信息,DRA 通过引入 ResourceClaim 使设备资源能够在 Pod 创建之前完成表达与约束,为 GPU 等复杂硬件资源的精细化调度提供了新的基础能力。
HAMi-DRA 是 HAMi 社区在 DRA 方向上的最新实践,结合范式自身的异构算力管理实践,HAMi-DRA 能在不牺牲核心调度能力的前提下,将现有 GPU 虚拟化调度体系平滑迁移至 DRA 资源模型。从范式的实践结果来看 HAMi-DRA 在调度性能和精细化管理方面带来了显著的提升。
本次分享将从 Kubernetes 设备资源模型演进的视角出发,向大家介绍范式以及 HAMi 社区在异构设备管理的面临的挑战和实践,同时详细解析 HAMi-DRA 的整体架构设计与关键实现细节,展示如何基于 DRA 构建面向 AI 工作负载的可扩展 GPU 调度方案,并且综合说明在落地 HAMi-DRA 的过程中范式以及社区遇到的挑战。
演讲提纲
1. 背景和动机
2. HAMi 的如何解题
3. Kubernetes DRA 介绍
4. HAMi-DRA 设计和实践
5. 总结和展望
实践痛点
听众收益



微信咨询

电话咨询
微信联系我们

