曾就职于京东商城和猎豹移动,拥有丰富的大数据分析和游戏服务端研发经验,主导设计并实现了支撑数千万日活用户的轻量级游戏服务端架构。目前在vivo AI研究院任职,负责过vivo手机智慧桌面信息流和全局搜索服务端的推荐与搜索架构,支撑亿级用户。现负责视觉多模态大模型的训练工程,具备千卡级分布式集群上大模型训练的丰富经验,致力于构建高性能、可扩展的AI解决方案。
多模态大模型在智能客服、自动驾驶、AIGC 等领域的应用需求不断增长,但其训练工程面临计算、存储、数据处理、分布式通信等多重挑战。特别是在千卡级GPU 训练集群上,如何优化数据加载、提升训练稳定性、突破计算与存储瓶颈,成为AI Infra需要重点攻克的难题。本次演讲将基于LLaVA视觉多模态理解模型和FLUX文生图模型的训练工程实践,详细解析大规模GPU训练集群下的数据存储优化、分布式计算策略、训练容错机制,并探讨如何提升大规模多模态模型的训练效率和稳定性。演讲将重点介绍混合并行训练、数据高效加载、自动容错恢复等技术方案,为业界提供可落地的工程实践经验。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

