千卡级分布式集群上的视觉多模态大模型落地实践

所属专题:多模态大模型创新实践

嘉宾 : 王兆雄 | vivo AI 研究院AI 架构师

会议室 : 中优大宴会厅 1

讲师介绍

专题演讲嘉宾:王兆雄

vivo AI 研究院AI 架构师

曾就职于京东商城和猎豹移动,拥有丰富的大数据分析和游戏服务端研发经验,主导设计并实现了支撑数千万日活用户的轻量级游戏服务端架构。目前在vivo AI研究院任职,负责过vivo手机智慧桌面信息流和全局搜索服务端的推荐与搜索架构,支撑亿级用户。现负责视觉多模态大模型的训练工程,具备千卡级分布式集群上大模型训练的丰富经验,致力于构建高性能、可扩展的AI解决方案。

议题介绍

演讲:千卡级分布式集群上的视觉多模态大模型落地实践

多模态大模型在智能客服、自动驾驶、AIGC 等领域的应用需求不断增长,但其训练工程面临计算、存储、数据处理、分布式通信等多重挑战。特别是在千卡级GPU 训练集群上,如何优化数据加载、提升训练稳定性、突破计算与存储瓶颈,成为AI Infra需要重点攻克的难题。本次演讲将基于LLaVA视觉多模态理解模型和FLUX文生图模型的训练工程实践,详细解析大规模GPU训练集群下的数据存储优化、分布式计算策略、训练容错机制,并探讨如何提升大规模多模态模型的训练效率和稳定性。演讲将重点介绍混合并行训练、数据高效加载、自动容错恢复等技术方案,为业界提供可落地的工程实践经验。

演讲提纲:

  1. 多模态大模型的训练工程挑战
  2. AI Infra 四大优化方向
    • 数据处理优化
    • 模型计算优化
    • 分布式通信优化
    • 训练稳定性建设
  3. 训练工程案例:LLaVA & FLUX
    • 视觉多模态理解模型(LLaVA)的训练优化
    • 文生图 FLUX 结构的训练工程
  4. AI Infra 未来展望

听众收益:

  • 深入理解多模态大模型的训练挑战,尤其是理解模型 vs 生成模型的工程区别
  • 掌握大规模GPU训练集群的优化策略,包括数据处理、并行计算、通信优化
  • 学习如何提升训练稳定性,减少长时间训练中的失败率
  • 借鉴 LLaVA 和 FLUX 训练的实际优化经验,为自身多模态模型训练提供参考

交通指南

上海中优城市万豪酒店

Shanghai Marriott Hotel Pudong South
地址:上海市浦东新区沪南公路7688弄1号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手