企业智算架构弹性适配

会议室:源福厅 5
出品人:梁潇

本论坛聚焦于“务实的智算进阶路径”,深入探讨如何在不颠覆... 展开 >

专题出品人:梁潇

快手高级技术总监

负责在线推荐预估服务的架构规划与治理,涵盖向量检索、在线推理及稳定性体系建设。推动计算与平台基础设施持续升级,构建计算资源管理与调度优化能力;基于云原生技术实现弹性伸缩、服务迁移与自动化恢复,长期稳定支撑核心业务 SLA,并持续提升成本效率与资源利用率。

地点:源福厅 5

专题:企业智算架构弹性适配

本论坛聚焦于“务实的智算进阶路径”,深入探讨如何在不颠覆现有技术栈的前提下,构建高效、弹性且低成本的 AI 基础设施。论坛将探讨如何在传统虚拟化与私有云环境中,通过架构微调实现大模型推理与训练的高效运行;分享 GPU 池化与混合云调度的实战案例,彻底解决算力利用率低、波峰成本过高的痛点

by 吴伟

蚂蚁集团
高级技术专家

大模型时代,训练与推理长期分池运行,训练侧弹性但离线、推理侧固定但在线,两者资源需求呈"潮汐"对立——夜间训练吃满集群、白天推理迎来峰值,导致 GPU 平均利用率较低。蚂蚁集团构建了训推一体智算基础设施,通过"弹性配额—优先级抢占—动态混部"三层调度机制,打破训推资源围墙,实现GPU 集群资源的统一编排。底层基于异构算力池化技术,对NV 和国产化芯片进行统一纳管与 XPU 抽象,支持跨芯片类型的任务调度和热迁移。实践表明,通过统一的资源调度,有效提升了 GPU 资源的使用效率。

本演讲将分享完整的架构设计、潮汐调度策略和异构适配中的踩坑经验。

演讲提纲:

  1. 训练推理资源池分离的背景和问题
    • 场景引入:展示一张典型 GPU 集群 24 小时利用率曲线图——训练任务凌晨跑满、推理白天峰值、中间大量空白
    • 核心矛盾:训推分离模式下,两个资源池永远"一个吃不饱、一个在闲置" 
  2. 训推一体解决方案整体介绍
    • 异构算力池化 + 弹性调度
  3. 训推一体关键技术:异构算力池化
    • 统一抽象模型(XPU):将异构资源统一到一套设备资源管理体系
    • 关键能力模块:资源纳管(异构芯片接入、拓扑自动发现)→ 异构调度(同构/混合调度)→ 弹性扩缩(Scale Up/Down 无感)→ 任务热迁移(跨芯片业务无感)
  4. 训推一体关键技术:弹性调度
    • 弹性配额层
    • 优先级抢占层:
      • 优先级设计:P0(在线推理)> P1(交互式推理)> P2/P3(离线训练)
      • 抢占流程:高优先级任务触发 → 低优先级任务 Checkpoint → 资源释放 → 高优先级任务调度 → 负载下降后恢复
    • 动态混部层(潮汐调度)
  5. 蚂蚁集团的实践效果
  6. 总结和展望:跨 AIDC 的训推联邦调度、基于预测的弹性预分配等

听众收益:

  • 可以了解"弹性配额—优先级抢占—动态混部"三层调度架构的完整设计思路,直接应用于自身企业的大模型基础设施规划和建设中,避免从零探索的试错成本
  • 建立 GPU 资源效率优化的数据化认知框架:通过蚂蚁集团的具体实践,听众可以建立一套 GPU 集群效率度量和优化的基准体系,用于评估自身基础设施的改进空间

by 贾珂

阿里云
PAI 训练平台产品负责人

AI时代,大模型训练面临稳定性、效率与成本的三重挑战,而超大规模集群的管理更是难上加难。本次分享将系统解读阿里云人工智能平台PAI的训练服务架构:管理数个超大规模AI训练集群,总规模达数十万张GPU卡。目前该平台已支撑多个行业的大模型训练任务,覆盖不同规模的训练需求与应用场景。

演讲提纲:

  1. PAI平台全景:阿里云PAI 整体设计框架和介绍,"1个构建平台+2大核心服务"架构解析:最佳开发平台 + 超大规模训练 + 推理服务
  2. 云上服务的挑战和设计思路,服务多租户,需要兼具架构设计领先型和使用灵活性。
  3. 超大规模训练的调度,通过多级配额、抢占式调度、竞价实例等机制实现极致性价比。
  4. 超大规模训练的高稳定: 容错训练与自动自愈、秒级模型保存恢复、全链路健康检测与可观测性
  5. 超大规模训练的易用性:深度学习容器化体验;预集成主流框架;一键提交训练任务
  6. 多行业多客户使用场景

听众收益:

  • 可以了解云上大模型商业化产品的深度解析

by 柳嘉强

快手
计算引擎架构负责人

随着深度学习推荐模型(DLRM)的广泛应用,推荐系统的算力重心正从以CPU为主全面转向以GPU为主。与此同时,生成式推荐的兴起进一步放大了算力需求,而异构硬件之间增速不均衡的矛盾也愈发突出。传统的资源供给模式已难以兼顾弹性、效率与稳定性,推动推荐系统底层基础设施走向算力池化成为必然选择。

本次演讲将系统阐述快手在推荐系统算力池化方向上的思考与实践。首先,我们将分析池化的三大驱动力:DLRM推动资源重心向GPU转移、生成式推荐带来的算力需求激增,以及异构算力发展节奏不匹配所带来的系统性挑战。

在此基础上,我们将剖析池化落地过程中面临的三组核心矛盾:一是服务分散化与网络传输开销之间的矛盾;二是资源灵活扩展与物理资源紧耦合之间的矛盾;三是资源高效利用与严格隔离及服务稳定性之间的矛盾。这些矛盾构成了池化方案设计的关键约束。

在实践层面,我们将重点介绍快手围绕上述挑战所构建的三项关键技术:面向推荐系统的高性能RDMA互联协议,实现跨节点高效通信;多维度极致CPU卸载,将非核心计算从GPU路径剥离;以及统一智能调度框架,在资源隔离与利用率之间取得精细平衡。

最后,我们将总结池化实践带来的收益,并对未来演进方向进行展望。通过算力池化,快手正以“新基建”支撑“新智能”,为生成式推荐时代的规模化演进奠定坚实的算力基础。新基建”支撑起推荐系统的“新智能”,并为未来更大规模的模型演进提供基础设施层面的无限可能。

演讲提纲:

  1. 为什么要做池化?
    • 随着 DLRM 的应用,推荐系统资源从以 CPU 为主转向以 GPU 为主
    • 生成式推荐对算力的需求持续增加
    • 异构算力增速不均衡现象持续扩大
  2. 池化面临的挑战
    • 服务分散化与网络传输开销之间的矛盾
    • 资源灵活扩展和物理资源之间不可避免耦合的矛盾
    • 资源高效利用与资源隔离及服务稳定性要求之间的矛盾
  3. 快手池化的实践
    • 面向推荐系统的高性能 RDMA 互联协议
    • 多维度极致 CPU 卸载
    • 统一智能调度框架
  4. 总结与展望

听众收益:

  • 了解推荐系统基建的发展历史和我们认为的演进方向
  • 学习快手在池化过程中的技术经验

交通指南

上海虹桥祥源希尔顿酒店

Hilton Shanghai Hongqiao
地址:上海市红松东路1116号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手