长期从事 AI 模型推理研发与优化工作,参与 PPL 推理引擎移动端 GPU 的研发和业务落地。目前主要负责 SensePPL 端侧推理引擎的研发,推动 SenseChat-Lite 手机端部署及多模态模型在智能车舱的应用。

长期从事 AI 模型推理研发与优化工作,参与 PPL 推理引擎移动端 GPU 的研发和业务落地。目前主要负责 SensePPL 端侧推理引擎的研发,推动 SenseChat-Lite 手机端部署及多模态模型在智能车舱的应用。
当前,大模型推理正在向手机、PC、智能汽车等边缘侧和端侧产品渗透。然而,在终端部署 AI 大模型时,仍面临着存储与计算资源、功耗、软件生态等多重挑战。商汤大装置 HPC 团队基于多年的传统 CNN 推理基础设施研发与优化的经验,推出 SensePPL 端侧大模型推理框架。在计算优化、推理框架、Serving Pipeline 等层面进行深度调优,最终取得了业界领先的首字延迟、Decoding 吞吐等端侧性能指标,大幅改善终端大模型落地的交互体验。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

