蚂蚁集团异构计算负责人,主要负责异构算力集群优化与推理优化 (包括大模型,搜广推等)。有 190+ 中 / 美技术专利,技术领域涉及异构加速,虚拟化,大模型推理优化以及文件系统,企业级存储等。
CCF HPC 和存储专委委员,曾在 NVIDIA GTC, CCF HPCChina,LinuxConf, Hadoop Summit, SNIA SDC,Dell EMC World, DataFun 等做技术分享,同时也是“数据密集型应用系统设计” 译者

蚂蚁集团异构计算负责人,主要负责异构算力集群优化与推理优化 (包括大模型,搜广推等)。有 190+ 中 / 美技术专利,技术领域涉及异构加速,虚拟化,大模型推理优化以及文件系统,企业级存储等。
CCF HPC 和存储专委委员,曾在 NVIDIA GTC, CCF HPCChina,LinuxConf, Hadoop Summit, SNIA SDC,Dell EMC World, DataFun 等做技术分享,同时也是“数据密集型应用系统设计” 译者
大模型训练和部署需要大量的显存。业界提出了很多方案,如 offloading、PP 并行、量化等,但通常需要修改模型代码或权衡精度损失。我们观察到,框架层如 PyTorch 由于缓存分配器中频繁的 split-merge 操作,带来严重的管理开销即碎片,尤其分布式训练或叠加使用 DeepSpeed、FSDP 时问题更加突出。
我们分享介绍 GLake(ASPLOS24):一种高效、全局的显存优化方案,可无缝接入 PyTorch 框架并显著减少显存碎片。在内部,GLake 基于虚拟 - 物理指针和定制化的策略,对显存进行动态重映射;并支持跨进程、跨卡、跨框架的全局显存池化;可用于大模型训练或推理(与 vLLM PagedAttention 不同)。
GLake 实测训练可节省 34% 显存,训练吞吐提高最高 4 倍,与 DeepSpeed、LoRA 等正交;并优于 PagedAttention。开源地址:https://github.com/intelligent-machine-learning/glake
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

