聚焦于GPU推理加速技术多年,在性能优化、高性能异构计算等方面积累了丰富的经验,目前主要负责混元大语言模型推理加速框架AngelHCF,涉及算子、通信、架构等多方面优化。

聚焦于GPU推理加速技术多年,在性能优化、高性能异构计算等方面积累了丰富的经验,目前主要负责混元大语言模型推理加速框架AngelHCF,涉及算子、通信、架构等多方面优化。
腾讯 AngelHCF 推理加速框架针对混元 LLM 大语言模型做了深度推理优化,结合全新的 Hybrid 模型结构整体上取得了不错的推理成本优势,支撑了元宝线上混元模型上万卡推理。同时,AngelHCF于24 年初即大规模部署上线了万亿 MoE 大模型,针对大规模MoE模型通信特点做了混合切分策略优化,叠加模型压缩、PD 分离等优化手段,显著降低了线上推理成本。本次分享将从不同角度分别介绍腾讯混元推理加速框架 AngelHCF 所做的一些针对性优化,结合全新的Turbos 模型结构,希望能给听众带来一些新的启发。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

