GLake: 高效透明的大模型显存管理和优化

所属专题:大模型基础设施构建

嘉宾 : 赵军平 | 蚂蚁集团基础智能-AI Infra 异构计算负责人

会议室 : 会议室 7+8

讲师介绍

专题演讲嘉宾:赵军平

蚂蚁集团基础智能-AI Infra 异构计算负责人

蚂蚁集团异构计算负责人,主要负责异构算力集群优化与推理优化 (包括大模型,搜广推等)。有 190+ 中 / 美技术专利,技术领域涉及异构加速,虚拟化,大模型推理优化以及文件系统,企业级存储等。

CCF HPC 和存储专委委员,曾在 NVIDIA GTC, CCF HPCChina,LinuxConf, Hadoop Summit, SNIA SDC,Dell EMC World, DataFun 等做技术分享,同时也是“数据密集型应用系统设计” 译者

议题介绍

演讲:GLake: 高效透明的大模型显存管理和优化

大模型训练和部署需要大量的显存。业界提出了很多方案,如 offloading、PP 并行、量化等,但通常需要修改模型代码或权衡精度损失。我们观察到,框架层如 PyTorch 由于缓存分配器中频繁的 split-merge 操作,带来严重的管理开销即碎片,尤其分布式训练或叠加使用 DeepSpeed、FSDP 时问题更加突出。

我们分享介绍 GLake(ASPLOS24):一种高效、全局的显存优化方案,可无缝接入 PyTorch 框架并显著减少显存碎片。在内部,GLake 基于虚拟 - 物理指针和定制化的策略,对显存进行动态重映射;并支持跨进程、跨卡、跨框架的全局显存池化;可用于大模型训练或推理(与 vLLM PagedAttention 不同)。

GLake 实测训练可节省 34% 显存,训练吞吐提高最高 4 倍,与 DeepSpeed、LoRA 等正交;并优于 PagedAttention。开源地址:https://github.com/intelligent-machine-learning/glake

演讲提纲:

  1. 大模型的显存与传输挑战分析
  2. 现有方案简介
  3. GLake 总体方案
  4. GLake 在大模型训练时的针对性设计和效果对比
  5. 推理时的显存挑战与初步优化
  6. 开源与未来展望

听众收益:

  • 如何系统性分析、优化显存与传输问题:包括硬件与框架能力 / 不足,显存完整生命周期,全局视角的管理与优化包括多卡、多进程、多任务等
  • 不同场景下多种优化手段的优劣,如何合理定位和取舍
  • 探讨未来可能的演进和有趣的软 - 硬结合

交通指南

北京乐多港万豪酒店

Beijing Marriott Hotel Changping
地址:北京市昌平区南口路29号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手