专题演讲嘉宾:杨永杰

小米小爱同学端侧 AI 负责人

现任小爱同学端侧AI负责人,曾为华为端侧AI技术专家,一直致力于端侧模型推理相关的技术研究和应用,主导小爱同学全离线链路的构建,并逐步升级到端侧大模型,使得离线小爱同学响应更智能、更迅速。毕业于中山大学。

by 杨永杰

小米
小爱同学端侧 AI 负责人

随着大模型相关技术的迅速发展,端侧大模型也越来越受到重视,端侧部署大模型具有隐私安全高、推理成本低、无网可响应等优点,但端侧面临资源受限的核心挑战,比如算力、内存、内存带宽、CPU等资源,导致大模型难以在端侧商业化落地。本团队通过自研高性能的大模型推理框架克服了资源的限制,实现了端侧大模型在多个业务上商业化落地,最终以极低的资源占用实现业界领先的推理速度(超过 180 toks/s)。

演讲提纲

  1. 端侧大模型推理面临的挑战
  2. 端侧大模型推理架构
    • 小爱同学业务差异化诉求
    • 多业务共享基座架构,支持并发推理
    • 跨硬件平台推理
    • 大模型热更新策略
  3. 端侧大模型高性能推理技术
    • 基于端侧硬件资源限制的优化
    • 大模型低比特量化
    •  CPU高性能计算
    • 高加速比的并行解码策略

4. 端侧大模型未来技术展望

技术实践痛点

  1. 资源有限的情况下,怎么支持多个业务,以及支持多个任务并发
  2. 大模型推理占用带宽高,会导致系统应用卡顿,这里需要做tradeoff

演讲前沿亮点

  1. 有限资源下的高性能推理,达到180toks/s
  2. 支持多业务大模型并发推理

听众收益

  1. 了解到目前端侧大模型部署的挑战
  2. 了解端侧大模型推理的架构
  3. 了解端侧大模型高性能推理技术

交通指南

北京国际会议中心

Beijing International Convention Center
地址:北京市朝阳区北辰东路8号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手