目前担任贝壳容器引擎团队的负责人。从事过 DevOps 以及服务治理方向的研发和架构的工作,目前主要聚焦于大数据和人工智能领域的基础设施建设,致力于通过容器化手段推动AI技术的落地和创新。

目前担任贝壳容器引擎团队的负责人。从事过 DevOps 以及服务治理方向的研发和架构的工作,目前主要聚焦于大数据和人工智能领域的基础设施建设,致力于通过容器化手段推动AI技术的落地和创新。
随着大模型的广泛应用和种类的增加,企业对 GPU 算力的需求日益增长。然而,GPU 资源的异构性、跨多云及跨地域部署的复杂性,使得资源利用效率面临严峻挑战。企业亟需解决如何高效分配算力资源并提升利用率的问题,以支持大模型的快速发展和业务场景的实际落地。
为应对这一挑战,我们基于云原生技术,以 Kubernetes 为核心,构建了一个支持多租户的一站式机器学习平台。该平台不仅实现了统一的资源调度和存储管理,还能方便用户快速获取多种算力资源,同时支持用户将闲置资源出借以创造额外收益。从技术运营和技术深度两个层面,这一方案全面提升了算力资源的利用效率,为企业提供了强有力的支撑。
本次演讲将从两个方面展开,一是多租户环境下的算力分配策略,二是提升算力利用率的方法。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

