20 多年的高性能计算(HPC)、人工智能(AI)和云计算专业经验,主导完成 3 座 HPC TOP500 系统、5 座国际云数据中心以及 5 个云服务产品的规划、设计与实施。专注于开创性 HPC、云端和 IT 解决方案的战略开发落地,拥有丰富的从0到1的产品研发经验。

20 多年的高性能计算(HPC)、人工智能(AI)和云计算专业经验,主导完成 3 座 HPC TOP500 系统、5 座国际云数据中心以及 5 个云服务产品的规划、设计与实施。专注于开创性 HPC、云端和 IT 解决方案的战略开发落地,拥有丰富的从0到1的产品研发经验。
随着全球数字化进程的推进,越来越多的企业希望将自己的 AI 应用拓展到海外市场。然而,AI 出海面临诸多挑战,本次演讲重点关注如何突破算力挑战,保障AI训练过程中的GPU集群稳定性。
稳定的 GPU 集群对突破算力挑战至关重要。GPU 集群能并行处理海量数据,其稳定性确保计算持续高效。通过软件架构设计、优质硬件支持及智能监控等,保障集群稳定,释放强大算力。GMI Cloud作为一个基于高稳定性 GPU 集群的云计算平台,已拥有多个AI 应用出海优秀实践。本次演讲将主要介绍 GMI Cloud Cluster Engine、NCP认证、故障预防策略。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

