中山大学博士,在华为长期从事通信协议的研究工作,研究方向覆盖数据中心网络、广域网络、终端无线网络。当前聚焦优化盘古模型训练/推理的通信性能,主导盘古模型在昇腾 950 上的通信算子性能优化。

中山大学博士,在华为长期从事通信协议的研究工作,研究方向覆盖数据中心网络、广域网络、终端无线网络。当前聚焦优化盘古模型训练/推理的通信性能,主导盘古模型在昇腾 950 上的通信算子性能优化。
通信开销是大模型训练和推理中不可忽视的性能瓶颈。在 MoE 模型中,AllToAll 通信占总端到端时间的 30% 以上,是一直以来的优化重点;而 1M 超长上下文场景下,Host to Device 的 KV Cache 传输延迟已成为推理 TTFT 的新“拦路虎”。深度亲和昇腾硬件进行通信优化,才能最大化将昇腾算力潜能转化为模型训练/推理性能提升。
本次分享围绕昇腾平台的两类通信优化展开。第一部分聚焦 MoE 场景下的 AllToAll,通过适配昇腾 950 的网络拓扑和 CCU 通信加速器,在盘古模型的 EP 通信域 AllToAll 上实现了 10% 以上的性能提升。第二部分关注超长序列推理中的 KV Cache 卸载,通过 Omni Cache 高效的 H2D 和 D2H 通信,实现 TTFT 提升 10 %以上。更进一步,我们将展望如何通过昇腾亲和实现最优的通算掩盖,使得通信不再成为暴露在训练/推理端到端时延中的短板。
希望本次分享能为业界其他模型在昇腾平台上优化通信性能提供借鉴,共同繁荣昇腾软件硬件生态。
演讲提纲
1. 大模型的训练/推理在通信方面面临哪些技术挑战?
2. 亲和昇腾硬件,加速 EP 域的 AllToAll
3. 硬件软件双管齐下,加速 H2D(Host to Device)的通信交互
4. 总结和展望
实践痛点
听众收益



微信咨询

电话咨询
微信联系我们

