专题演讲嘉宾:雷丹

商汤科技系统研究员

长期从事 AI 模型推理研发与优化工作,参与 PPL 推理引擎移动端 GPU 的研发和业务落地。目前主要负责 SensePPL 端侧推理引擎的研发,推动 SenseChat-Lite 手机端部署及多模态模型在智能车舱的应用。

by 雷丹

商汤科技
系统研究员

当前,大模型推理正在向手机、PC、智能汽车等边缘侧和端侧产品渗透。然而,在终端部署 AI 大模型时,仍面临着存储与计算资源、功耗、软件生态等多重挑战。商汤大装置 HPC 团队基于多年的传统 CNN 推理基础设施研发与优化的经验,推出 SensePPL 端侧大模型推理框架。在计算优化、推理框架、Serving Pipeline 等层面进行深度调优,最终取得了业界领先的首字延迟、Decoding 吞吐等端侧性能指标,大幅改善终端大模型落地的交互体验。

演讲提纲:

  1. 端侧大模型推理的机遇与挑战
  2. 端侧推理框架的优化技术
  3. Serving Pipeline 流程优化
  4. SensePPL 应用

听众收益:

  1. 端侧大模型推理的机遇与挑战
  2. Linear与Attention等大模型核心算子在端侧的计算优化方案
  3. 端侧大模型应用的流程优化技巧

交通指南

上海中谷小南国花园酒店

China Grain Hotel
地址:上海市杨浦区佳木斯路777号(近营口路口)
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手