本论坛聚焦于“务实的智算进阶路径”,深入探讨如何在不颠覆... 展开 >



负责在线推荐预估服务的架构规划与治理,涵盖向量检索、在线推理及稳定性体系建设。推动计算与平台基础设施持续升级,构建计算资源管理与调度优化能力;基于云原生技术实现弹性伸缩、服务迁移与自动化恢复,长期稳定支撑核心业务 SLA,并持续提升成本效率与资源利用率。
本论坛聚焦于“务实的智算进阶路径”,深入探讨如何在不颠覆现有技术栈的前提下,构建高效、弹性且低成本的 AI 基础设施。论坛将探讨如何在传统虚拟化与私有云环境中,通过架构微调实现大模型推理与训练的高效运行;分享 GPU 池化与混合云调度的实战案例,彻底解决算力利用率低、波峰成本过高的痛点
大模型时代,训练与推理长期分池运行,训练侧弹性但离线、推理侧固定但在线,两者资源需求呈"潮汐"对立——夜间训练吃满集群、白天推理迎来峰值,导致 GPU 平均利用率较低。蚂蚁集团构建了训推一体智算基础设施,通过"弹性配额—优先级抢占—动态混部"三层调度机制,打破训推资源围墙,实现GPU 集群资源的统一编排。底层基于异构算力池化技术,对NV 和国产化芯片进行统一纳管与 XPU 抽象,支持跨芯片类型的任务调度和热迁移。实践表明,通过统一的资源调度,有效提升了 GPU 资源的使用效率。
本演讲将分享完整的架构设计、潮汐调度策略和异构适配中的踩坑经验。
演讲提纲:
听众收益:
AI时代,大模型训练面临稳定性、效率与成本的三重挑战,而超大规模集群的管理更是难上加难。本次分享将系统解读阿里云人工智能平台PAI的训练服务架构:管理数个超大规模AI训练集群,总规模达数十万张GPU卡。目前该平台已支撑多个行业的大模型训练任务,覆盖不同规模的训练需求与应用场景。
演讲提纲:
听众收益:
随着深度学习推荐模型(DLRM)的广泛应用,推荐系统的算力重心正从以CPU为主全面转向以GPU为主。与此同时,生成式推荐的兴起进一步放大了算力需求,而异构硬件之间增速不均衡的矛盾也愈发突出。传统的资源供给模式已难以兼顾弹性、效率与稳定性,推动推荐系统底层基础设施走向算力池化成为必然选择。
本次演讲将系统阐述快手在推荐系统算力池化方向上的思考与实践。首先,我们将分析池化的三大驱动力:DLRM推动资源重心向GPU转移、生成式推荐带来的算力需求激增,以及异构算力发展节奏不匹配所带来的系统性挑战。
在此基础上,我们将剖析池化落地过程中面临的三组核心矛盾:一是服务分散化与网络传输开销之间的矛盾;二是资源灵活扩展与物理资源紧耦合之间的矛盾;三是资源高效利用与严格隔离及服务稳定性之间的矛盾。这些矛盾构成了池化方案设计的关键约束。
在实践层面,我们将重点介绍快手围绕上述挑战所构建的三项关键技术:面向推荐系统的高性能RDMA互联协议,实现跨节点高效通信;多维度极致CPU卸载,将非核心计算从GPU路径剥离;以及统一智能调度框架,在资源隔离与利用率之间取得精细平衡。
最后,我们将总结池化实践带来的收益,并对未来演进方向进行展望。通过算力池化,快手正以“新基建”支撑“新智能”,为生成式推荐时代的规模化演进奠定坚实的算力基础。新基建”支撑起推荐系统的“新智能”,并为未来更大规模的模型演进提供基础设施层面的无限可能。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

