吴伟,蚂蚁集团高级技术专家,蚂蚁容器调度团队负责人,负责蚂蚁内部通智一体容器平台的资源调度和资源管理。18 年加入蚂蚁以来,经历了云原生资源调度从通算到智算的演进。在通算时代,参与了蚂蚁内部系统 k8s 云原生化的升级改造、CPU 在离线混部、CPU 利用率提升等多个项目;在智算时代,负责蚂蚁 GPU 异构资源编排,正在探索通过训推池化、推理服务弹性、任务优先级抢占、自动化 FO 等技术手段,来提升 XPU 资源使用效率,以更好地服务蚂蚁百灵、阿福、灵光等 AI 业务。
吴伟,蚂蚁集团高级技术专家,蚂蚁容器调度团队负责人,负责蚂蚁内部通智一体容器平台的资源调度和资源管理。18 年加入蚂蚁以来,经历了云原生资源调度从通算到智算的演进。在通算时代,参与了蚂蚁内部系统 k8s 云原生化的升级改造、CPU 在离线混部、CPU 利用率提升等多个项目;在智算时代,负责蚂蚁 GPU 异构资源编排,正在探索通过训推池化、推理服务弹性、任务优先级抢占、自动化 FO 等技术手段,来提升 XPU 资源使用效率,以更好地服务蚂蚁百灵、阿福、灵光等 AI 业务。
大模型时代,训练与推理长期分池运行,训练侧弹性但离线、推理侧固定但在线,两者资源需求呈"潮汐"对立——夜间训练吃满集群、白天推理迎来峰值,导致 GPU 平均利用率较低。蚂蚁集团构建了训推一体智算基础设施,通过"弹性配额—优先级抢占—动态混部"三层调度机制,打破训推资源围墙,实现GPU 集群资源的统一编排。底层基于异构算力池化技术,对NV 和国产化芯片进行统一纳管与 XPU 抽象,支持跨芯片类型的任务调度和热迁移。实践表明,通过统一的资源调度,有效提升了 GPU 资源的使用效率。
本演讲将分享完整的架构设计、潮汐调度策略和异构适配中的踩坑经验。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

