专题演讲嘉宾:张君

华为高级开发工程师

作为核心开发者参与 AI 框架 (昇思) 的开发,并负责动态图的自动微分以及动静结合模块。目前主要参与大模型推理在昇腾硬件上的相关开发和优化工作,致力于通过优化推理框架、模型算法和算子加速库等层面,进一步提升大模型推理的性能。

by 张君

华为
高级开发工程师

随着大模型技术的快速发展,其在LLM、多模态融合等领域的应用越来越广泛。然而,大模型的高效推理仍然是一个关键挑战,从计算复杂度、内存占用、通信技术等各个技术层面展开,如何在保证性能的同时降低计算成本、提升推理效率成为了关键挑战。

本次演讲将围绕大模型推理优化的技术发展方向,围绕模型层、推理框架层、算子层这3个方面展开,并结合实践案例,阐述相关的技术方案和选型,帮助听众更好地理解和应用大模型推理技术。

演讲提纲:

  1. 大模型推理加速的技术挑战与常用方案
    • 算子融合,如 FA,通算融合
    • 模型量化,如 w8a8 等
    • Attention容量压缩,如 MLA、GQA 等
  2. 技术研究热点:模型层、框架层、算子层
    • 模型层优化
      • 昇腾推理领域加速库ATB
    • 推理框架层优化
      • - 昇腾图编译技术TorchAir
      • - PD分离部署
      • - 动态批处理(Dynamic Batching)、Prefix Cache等
    • 算子层优化
      • 高效融合算子,如MLA算子设计
      • NPU 亲和性编程,充分利用 Cube 和 Vector 计算单元能力
  3. 业务实践:推理优化成功案例
    • 通信融合算子最大化时间掩盖,如 AllGatherMatmul
    • MLAPO大融合算子,加速降低计算耗时
  4. 下一步优化方向
    • PD+大EP 等

听众收益:

  • 了解当前华为昇腾推理技术的优化实践

交通指南

上海中优城市万豪酒店

Shanghai Marriott Hotel Pudong South
地址:上海市浦东新区沪南公路7688弄1号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手