专题演讲嘉宾:张凯

阿里云资深技术专家

负责阿里云容器智算产品研发,多年云计算领域研发经历,深耕云原生技术在企业应用、微服务、AI、大数据、高性能计算等众多场景的落地。带领团队开拓云原生AI领域,创立Fluid、Kube-Queue、GPUShare、Arena等多个相关开源项目。

by 张凯

阿里云
资深技术专家

大模型算法和 AI 工程技术的发展日新月异,同时对 AI 基础设施的规模,效率和稳定性提出更多挑战。本话题将介绍,社区基于 Kubernetes、算力调度、数据编排、可观测、AI 网关和微服务等技术,在构建云原生 AI 基础设施方向的最新进展。并以 LLM 推理负载管理和模型服务化管理为例,讨论如何加速大模型能力高效落地,降低企业生产和使用 AI 的门槛。

演讲提纲:

  1. 大模型对 AI Infra 的挑战,云原生 AI 技术如何发展和应对
  2. 云原生AI Infra的架构和关键技术详解,介绍整体架构和主要技术
    • 大规模GPU集群稳定性提升,如端到端的故障自愈体系
    • 精细化AI算力可观测能力,如GPU监控和实时Profiling技术
    • 高弹性AI数据处理流水线,如统一调度Spark、Ray、Slurm on K8s技术方案
    • 数据缓存和模型冷启动优化,如Fluid数据集编排和访问加速技术
  3. LLM推理生产落地实践,利用云原生技术构建完整的LLM推理服务系统,适配PD分离等分布式推理架构,管理推理服务全生命周期,优化推理性能

听众收益:

  • 了解通如何过优化数据访问速度,提升训练效率与推理服务性能
  • 了解如何通过完善GPU可观测性和自动化故障处理机制,洞察GPU资源效率和AI任务性能的波动,以应对集群稳定性挑战
  • 了解如何围绕新的LLM推理工作负载,构建完整的LLM模型服务架构和技术栈,帮助客户跨越从尝试大模型到生产使用的鸿沟

交通指南

深圳湾万丽酒店

Shenzhen Bay Marriott Hotel
地址:深圳南山区粤海街道高新区社区科技南路18号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手