BladeLLM 大模型高性能部署框架

所属专题:大模型推理优化

嘉宾 : 李深 | 阿里云高级算法专家

会议室 : 会议室 4+5

讲师介绍

专题演讲嘉宾:李深

阿里云高级算法专家

阿里云人工智能平台 PAI 模型系统优化 Tech Leader,负责模型压缩和推理优化等方面的引擎框架研发,10 年 AI 基础设施与算法研发经验,带领团队研发推理引擎、模型压缩加速框架等优化方案或技术产品,并在多样的 AI 场景中规模化部署应用。

议题介绍

演讲:BladeLLM 大模型高性能部署框架

大模型在线服务部署在场景特性、资源规模和性能指标等方面对引擎框架等 AI 基础设施建设提出了更高更复杂的要求,阿里云人工智能平台 PAI 基于模型系统优化的技术积累和实践经验,面向大模型场景构建了 BladeLLM 高性能部署框架。BladeLLM 结合量化压缩、AI 编译、高性能算子与调度、以及分布式可扩展性等技术,为大模型在线部署场景提供了多层次联合的极致性能优化方案,并且能兼容大模型主流生态,提供灵活易用的接口,具备规模化生产应用的完备性和可靠性。

演讲提纲:

  1. 大模型服务部署优化的主要挑战
    • 大模型在线服务的场景特性与性能要求
    • 模型规模与长下文规模带来的挑战
    • 模型技术与应用场景演进带来的挑战
  2. BladeLLM 架构与核心优化技术
    • BladeLLM技术架构与主要功能
    • 高性能算子与AI编译优化
    • 模型压缩与算法优化
    • 长上下文优化
  3. 大模型部署技术展望

听众收益:

  • 了解大模型服务部署中的主要瓶颈与技术挑战;
  • 了解大模型部署优化的主要技术手段
  • 了解大模型在线服务的规模化生产部署的实践经验

交通指南

北京乐多港万豪酒店

Beijing Marriott Hotel Changping
地址:北京市昌平区南口路29号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手