在生产环境里的模型参数和用户数据的数据量越来越多,也越来越大,无论是大模型离线计... 展开 >




于佃海,百度飞桨深度学习平台总架构师,百度集团机器学习TOC主席。2008年从北京大学硕士毕业后加入百度,长期从事从事机器学习、深度学习相关的技术研发和应用工作。目前作为总架构师整体负责飞桨平台架构设计和技术开发,同时负责文心大模型的大规模分布式训练、推理部署等相关工程架构工作。曾主持及参与多项国家科技计划项目课题研究。曾获北京市科学技术进步奖一等奖、中国电子学会科技进步一等奖、世界互联网大会领先科技奖。中国计算机学会授予于佃海2019年CCF杰出工程师奖,以表彰他在机器学习大规模产业应用方面做出的重要贡献。
在生产环境里的模型参数和用户数据的数据量越来越多,也越来越大,无论是大模型离线计算还是在线推理,对资源的需求越来越吃紧,传统的服务对耗时性能也越来越敏感,包括搜推广和传统服务都进一步与大模型结合(一些场景和环节调用),加剧了资源和耗时等性能问题,但 IT 成本需要得到控制,因此性能优化上需要越来越深入去研究,从系统层面的深入到线程协程去扣代码细节,资源上需要进一步统筹GPU/VRAM和CPU/DRAM。
在跨境电商的场景下,有着不同的地域和文化背景,以及多语言的需求,场景比较复杂,业务模型也非常地多样化。同时庞大的市场规模,对模型服务的吞吐量、实时性以及服务成本也提出了很高的要求,如何做好模型服务优化成为一个很重要的话题。本次演讲,我们将从跨境电商的场景出发,与大家交流在模型服务优化方面的一些实践,包括资源管理、任务调度、模型推理等方面。
演讲提纲:
听众收益:
MLPerf 是由图灵奖得主大卫·帕特森(David Patterson)联合谷歌、斯坦福大学、哈佛大学等顶尖学术机构共同发起的国际权威 AI 性能基准测试,被誉为全球 AI 领域的“奥运会”。MLCommons 组织在 2023 年首次推出了 MLPerf 存储基准测试(MLPerf Storage Benchmark),这是首个也是目前唯一一个开源、公开透明的 AI/ML 基准测试,旨在评估存储系统在 ML/AI 工作负载中的表现。这一基准测试为 ML/AI 模型开发者选择存储解决方案提供了权威的参考依据,帮助他们评估合适的存储产品。2024 年 9 月 25 日,最新 MLPerf Storage v1.0 Benchmark 结果(https://mlcommons.org/benchmarks/storage/)发布。本次演讲重点介绍 MLPerf Storage Benchmark 工具是如何模拟 ML/AI 模型,AI 存储要如何优化才能更好的满足 ML/AI 工作负载对性能的要求。
演讲提纲:
听众收益:
随着大模型的广泛应用和种类的增加,企业对 GPU 算力的需求日益增长。然而,GPU 资源的异构性、跨多云及跨地域部署的复杂性,使得资源利用效率面临严峻挑战。企业亟需解决如何高效分配算力资源并提升利用率的问题,以支持大模型的快速发展和业务场景的实际落地。
为应对这一挑战,我们基于云原生技术,以 Kubernetes 为核心,构建了一个支持多租户的一站式机器学习平台。该平台不仅实现了统一的资源调度和存储管理,还能方便用户快速获取多种算力资源,同时支持用户将闲置资源出借以创造额外收益。从技术运营和技术深度两个层面,这一方案全面提升了算力资源的利用效率,为企业提供了强有力的支撑。
本次演讲将从两个方面展开,一是多租户环境下的算力分配策略,二是提升算力利用率的方法。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

