专题演讲嘉宾:陈宇

小红书数据引擎开发工程师

小红书数据引擎团队核心成员,负责 RED-Ray 分布式计算平台的研发与落地。专注 AI 数据基础设施方向,覆盖大规模预训练数据处理、模型离线刷库与近线推理入库等核心场景;主导向 KubeRay 开源社区提出并设计 KubeRay Federation 跨集群联邦方案(kuberay#4561)。在 AI 算力供给与弹性调度方向有丰富的一线实战经验。

by 陈宇

小红书
数据引擎开发工程师

AI 数据生产贯穿模型研发的完整生命周期:模型诞生前,需要大规模准备预训练语料或 SFT 精调数据;模型上线前,需要对存量数据完成批量推理入库;模型上线后,需要对持续产生的增量数据实时推理入库。

这三个阶段对算力的诉求截然不同,没有一种资源供给模式能一劳永逸地满足所有场景。

小红书数据引擎团队以 Ray 为统一引擎底座,基于 Ray 引擎的统一调度能力与丰富的上层框架,覆盖了 AI 数据生产三个阶段截然不同的算力诉求——同一套引擎底座,通过不同的框架组合与资源供给策略,驱动从稳定常驻集群到海量弹性算力的全场景落地。

阶段一 · 训练数据准备: 预训练和 SFT 数据处理链路天然异构——去重依赖大规模 Shuffle,AI 质量打分依赖 GPU 批量推理,多模态内容处理需要高效的格式解析。我们在同一个 Ray 集群上通过 RuntimeEnv 沙箱隔离让 RayDP、Ray Data、Daft、DataJuicer 多种引擎共存协同,持续打磨万核百卡异构Ray集群稳定性。

阶段二 · 模型上线前离线刷库: 存量数据回扫是典型的"来得急、量级大、一次性"需求,但 GPU 资源天然离散在多家云厂商、多个可用区。我们经历了两代方案演进:第一代通过 Virtual Kubelet 将跨 K8s 集群的 CPU 混部资源汇聚为统一算力入口;第二代提出"存算分离"架构,以稳定 CPU 集群承载数据编排,通过 Ray Serve 联邦驱动弹性 GPU 资源完成推理,支持行级重试与断点续推,将原本因资源离散导致的长尾问题大幅收敛。此外,我们正在向 KubeRay 开源社区提出 KubeRay Federation 方案(kuberay#4561)。

阶段三 · 模型上线后近线增量入库: 新笔记、新商品需要分钟级持续入库,流量波动大且需要7*24h运行。我们自研了流批统一引擎 Ray Klein,基于 Chandy-Lamport 快照算法实现精确 Kafka offset 断点恢复,支持一套业务代码在全量批推与近线增量之间无缝切换。

本演讲将以这三个阶段为线索,分享 Ray 引擎如何凭借统一的调度底座,通过不同的框架组合与资源供给策略,覆盖 AI 数据生产全生命周期中截然不同的算力诉求,以及我们在工程实践中形成的核心判断:算力供给模式必须匹配业务阶段的特征,而非用单一模式覆盖所有场景。

演讲提纲:

  1. 一、开篇(为什么一套引擎覆盖三类场景)
    • AI 数据生产分三阶段:训练数据准备(稳定常驻+多引擎协同)、离线刷库(短期爆发+容忍驱逐+跨云)、近线增量入库(持续自适应+精确断点恢复)
    • Ray 的核心价值:统一调度、支持异构资源、上层生态丰富。整体规模:弹性 CPU 上亿核时/月,GPU 百万卡时/月
  2. 二、Ray 底座能力
    • Ray Core:全局资源视图、任意节点发起分布式任务、高性能通信(小数据直传/大数据零拷贝)
    • AutoScaler:按需扩缩容,无需预规划
    • 生态:RayData、RayServe、RayKlein、Daft、RayDP、DataJuicer
  3. 三、训练数据准备(多引擎协同)
    • 挑战:数据来源多样、处理链路复杂、无万能引擎且协同成本高
    • 方案:多引擎统一在 Ray 底座,一个 Python 脚本无缝切换不同引擎
    • 实践:RuntimeEnv 做依赖隔离,本地直连集群开发,大规模集群解决 GCS、调度、日志等稳定性问题
  4. 四、离线刷库(弹性算力)
    • 挑战:任务紧急、规模大、资源碎片化(多云多区 GPU)
    • 痛点:大任务拆分导致长尾严重
    • 演进:
      • Virtual Kubelet 聚合多集群 CPU,支持大规模推理,但扩容和驱逐成本高
      • 存算分离:Serve 化模型算子,用轻量客户端驱动弹性 GPU
      • KubeRay Federation:在框架层实现跨集群统一调度,从根本解决负载不均
  5. 近线增量入库(流式算力)
    • 需求:分钟级处理、7×24运行、弹性扩缩容、精确恢复
    • 方案:自研 Ray Klein
      • 基于分布式一致性快照,实现 Kafka offset 级恢复
      • 数据驱动+反压机制,自动平衡吞吐
      • 全局重启与可观测性完善
      • 一套代码支持流批统一
  6. 总结
    • 训练数据:统一底座+多引擎协同。
    • 离线刷库:VK 解决资源聚合,Federation 解决调度
    • 近线入库:Checkpoint 粒度决定可靠性
    • 核心结论:算力供给模式必须匹配业务阶段,Ray 提供灵活底座支持差异化
    • 后续:推进 Federation、Ray Serverless 化、Daft 多模态规模化落地

听众收益:

  • 了解如何基于 Ray 构建覆盖训练数据处理、离线推理、近线推理的统一算力供给体系
  • 了解 RayDP、Ray Data、Daft、DataJuicer 在真实 PreTrain / SFT 数据处理链路中的选型逻辑与协同方式
  • 获得流批统一引擎 Ray Klein 的设计思路,解决近线与离线场景代码割裂的问题

交通指南

上海虹桥祥源希尔顿酒店

Hilton Shanghai Hongqiao
地址:上海市红松东路1116号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手