混合场景下大规模 GPU 集群构建与实践

所属专题:大模型基础设施构建

嘉宾 : 星龙 | MiniMax 基础设施负责人

会议室 : 会议室 7+8

讲师介绍

专题演讲嘉宾:星龙

MiniMax 基础设施负责人

长期研究 AI + Infra 领域。在MiniMax 后负责基础设施工作, 包括高性能 AI 基础设施、超大规模预训练训练框架、DevOps 平台及 SRE。曾在旷视负责大规模 GPU 集群稳定性和高性能网络改造,并在百度负责超大规模 Kubernetes 集群混部系统研发。

议题介绍

演讲:混合场景下大规模 GPU 集群构建与实践

当前预训练模型的规模和模型复杂性不断增加,这给基础设施带来了巨大的压力。为了应对这些挑战,构建更大规模的高性能训练集群, 企业往往需要进行全链路的优化,包括算法、硬件架构和系统设计的创新,以提高效率和性能。同时, 高性能算力面对较大的供给压力, 通过混合云的方式来缓解算力不足, 完成成本与灵活性的双收益。

演讲提纲

  1. 硬件基础设施的现状与展望
  2. 预训练场景下的挑战与全链路优化
  3. 混合云场景下的算力挑战

听众收益

  • 了解大模型训练/推理的基础设施构建经验与工程实践

交通指南

北京乐多港万豪酒店

Beijing Marriott Hotel Changping
地址:北京市昌平区南口路29号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手