专题演讲嘉宾:莫梓峰

InferactvLLM committer

莫梓峰,硕士毕业于中山大学,现就职于 Inferact。

作为 vLLM 多模态部分的几位核心开发者之一,深度参与了vLLM多模态模型的支持与优化特性维护。截至 2026 年 6 月,vLLM 已在 GitHub 上获得 82k star,并被广泛应用于 AWS、Meta、Digital Ocean 等大型厂商的生产环境中。

by 莫梓峰

Inferact
vLLM committer

如今开源大语言模型的迅速发展,随着 Kimi-K2.6、 Qwen3.6 及 cosmos3 等支持原生多模态的大语言模型发布,多模态大语言模型已成为未来发展趋势。

vLLM 作为主流开源推理框架之一,其针对多模态模型结构引发的性能瓶颈,进行了包括 Encoder cache、Encoder DP 及 Encoder Cuda Graph 在内的一系列性能优化,本演讲将深入讲解 vLLM 用于优化多模态模型的关键技术,并展示如何使用最新版本 vLLM 高效部署多模态模型。

演讲大纲

1. vLLM 的核心优化技术

  • PagedAttention
  • Continuous Batching

2. 多模态模型推理在 Continuous Batching 框架下面临的挑战

3. 针对多模态模型的多级缓存设计

  • Encoder cache
  • Processor Cache

4. 针对多模态模型 encoder 的优化

  • ViT DP
  • Encoder Cuda Graph

5. vLLM 的社区生态及其如何面对未来的多模态发展趋势

实践痛点

  • 性能瓶颈在整个推理系统中的转移
  • 开发人员人手严重匮乏

听众收益

  • vLLM 的多项核心优化技术
  • vLLM 的社区生态

交通指南

深圳湾万丽酒店

Shenzhen Bay Marriott Hotel
地址:深圳南山区粤海街道高新区社区科技南路18号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手