专题演讲嘉宾:向乾彪

腾讯推理架构师

聚焦于GPU推理加速技术多年,在性能优化、高性能异构计算等方面积累了丰富的经验,目前主要负责混元大语言模型推理加速框架AngelHCF,涉及算子、通信、架构等多方面优化。

by 向乾彪

腾讯
推理架构师

腾讯 AngelHCF 推理加速框架针对混元 LLM 大语言模型做了深度推理优化,结合全新的 Hybrid 模型结构整体上取得了不错的推理成本优势,支撑了元宝线上混元模型上万卡推理。同时,AngelHCF于24 年初即大规模部署上线了万亿 MoE 大模型,针对大规模MoE模型通信特点做了混合切分策略优化,叠加模型压缩、PD 分离等优化手段,显著降低了线上推理成本。本次分享将从不同角度分别介绍腾讯混元推理加速框架 AngelHCF 所做的一些针对性优化,结合全新的Turbos 模型结构,希望能给听众带来一些新的启发。

演讲提纲:

  1. 腾讯混元模型 & AngelHCF 推理加速框架概述
  2. 混元 Turbos Hybrid 推理优化
    • Mamba Hybrid 模型的推理优势及收益
    • kernel 精度以及性能调优
    • 显存 & KVCache 优化之路
  3. 超大规模 MoE 模型并行策略优化
    • 各种模型切分策略的优缺点
    • 模型并行融合策略
    • 通信优化
  4. PD 分离部署优化
    • PD 分离部署的优势
    • 请求智能调度策略
    • 计算通信 Overlap
  5. 腾讯混元 & AngelHCF 落地情况和展望

听众收益:

  • 了解混元 Turbos Hybrid 结构带来的性能收益以及推理优化手段
  • 了解大规模 MoE 语言模型推理加速具体方法&实践

交通指南

上海中优城市万豪酒店

Shanghai Marriott Hotel Pudong South
地址:上海市浦东新区沪南公路7688弄1号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手