专题演讲嘉宾:李元龙

阿里云技术专家

中山大学博士,大模型技术专家,就职于阿里云。负责大模型在 B 端客户的算法应用场景方案设计实现,落地及优化。具有丰富的 AI,机器学习&优化算法技术研究&生产落地经验,目前专注于各类模型的训练推理技术,结合底层算力技术的研究和优化。

by 李元龙

阿里云
技术专家

本次演讲将带领大家逐层解析大模型推理的核心技术。从模型代码讲解 Transformer 前向传播的核心流程与关键模块设计;框架层解读主流推理引擎(如 vLLM/TensorRT)的加速原理与适用场景;深度学习框架揭示 PyTorch 动态图编译、算子优化等底层支持技术;硬件加速剖析 CUDA 并行计算与内存优化策略;最后结合 GPU 特性分析不同硬件对推理性能的影响规律,提供从代码优化到硬件选型的全链路实践指南,帮助开发者快速构建高效推理方案。

演讲提纲:

  1. 大模型推理技术全景
    • 技术演进脉络
    • 分层技术体系
      • 垂直分层:模型架构层→框架调度层→计算图优化层→硬件指令层
      • 横向协同:算法-框架-硬件的联合优化范式
  2. 模型架构层的推理优化
    • 前沿架构优化技术
      • 动态计算图优化(DeepSeek的Dynamic Token机制)
      • 稀疏激活模式(Mixtral的MoE门控策略)
      • 计算-通信重叠(LLAMA的预取策略)
  3. 推理框架层的加速革命
    • 框架技术矩阵分析
    • 框架选型决策树
  4. 计算图编译层的深度优化
    • Torch2.x编译技术栈
    • 编译实践陷阱
  5. 硬件层的极限压榨
    • CUDA加速范式
    • GPU选型决策模型
  6. 总结与展望

听众收益:

  • 为听众提供简明扼要的推理部署优化指南,使用户快速找到适合自己场景的模型推理部署策略
  • 了解最前沿的推理优化技术和技术局限性

交通指南

上海中优城市万豪酒店

Shanghai Marriott Hotel Pudong South
地址:上海市浦东新区沪南公路7688弄1号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手