在大模型驱动的新一代 AI 应用体系中,数据工程正从"离线分析支撑&q... 展开 >





现任火山引擎数智平台产品总监,10+年大数据产品经验,曾就职于阿里云,目前担任火山引擎数智平台计算引擎负责人,负责AI数据湖服务、EMR、Bytehouse、Flink,同时负责火山引擎记忆解决方案Agent DataLake,为企业级Agent提供新一代数据底座。
在大模型驱动的新一代 AI 应用体系中,数据工程正从"离线分析支撑"走向"在线智能核心",其职责不再局限于数据处理,而是直接参与模型能力构建与智能表现塑造。数据,正在从被动资源演进为 AI 系统中的关键组成模块。
本专题聚焦 AI 原生数据工程 的新一代技术体系,围绕"数据如何定义模型能力"这一核心命题,系统性拆解从训练到推理、从生产到反馈的全链路数据闭环,包括:
本专题将从 AI 工程实践与智能系统架构视角出发,深入探讨 AI 原生数据体系如何支撑下一代大模型应用的规模化落地与持续演进。
当前企业级 AI 应用普遍面临落地瓶颈,核心挑战在于数据多停留于分析与决策阶段,难以直接转化为可执行的业务动作。本演讲提出一个以数据为中心的业务对象智能体平台WinNexO,旨在打通企业智能化从数据到行动的断层,探讨一种面向业务对象的智能体架构设计方法。我们将首先深入剖析企业 Agent 落地的现实挑战,随后系统阐述解决该挑战问题的技术架构设计关键:以多模态数据集成夯实基础,实现结构化和非结构化数据的统一存储;以基于业务对象的语义模型构建认知核心,让智能体真正理解业务;最终依托 AI Agent,实现深度洞察与自动化执行的无缝衔接。最后,结合典型行业实践案例,分析 WinNexO 在推动企业 AI 从“辅助决策”向“自主执行”演进中的技术路径与应用成效。
演讲提纲:
听众收益:
随着大模型应用从单轮问答走向 RAG、Agent 和多模态智能体,数据基础设施正在从传统数据湖演进为 AI 原生的多模态数据湖。传统数据湖更擅长管理结构化数据和离线分析任务,但在 AI 场景中,系统需要同时处理文本、图片、视频、音频、Embedding、标注、特征和索引等多种数据形态。现实落地中,这些数据往往分散在对象存储、Parquet 表、向量数据库、搜索引擎和离线脚本中,造成数据重复、链路割裂、版本难以追溯,也增加了模型实验、检索调优和应用迭代的复杂度。
Lance 正是面向这一变化设计的开放多模态 Lakehouse 格式。它通过高效随机访问、原生向量检索、全文检索、零拷贝 Schema 演进、对象存储适配和数据版本管理等能力,将原始多模态数据、元数据、Embedding、索引和版本统一到同一套开放数据层中。在此基础上,Lance 不仅可以支撑多模态数据湖中的数据治理、混合检索和模型训练,也进一步延伸到 RAG 与 Agent 场景,成为构建“记忆湖”的基础组件。
本次分享将围绕“从数据湖到记忆湖”的实践展开,介绍如何基于 Lance/LanceDB 设计一套面向 AI 应用的数据底座:从多模态数据的统一组织、Embedding 与索引管理、版本回溯,到面向 Agent Memory 的长期记忆存储与检索。分享也会结合实际建设过程中遇到的数据同步、检索性能、数据演进和系统复杂度问题,讨论 Lance 为什么正在从多模态数据湖方案逐步发展为 Agent Infra 的关键基础设施。该方案已在多模态数据管理和智能检索场景中完成验证,能够有效降低跨系统同步成本,提升数据复用、检索迭代和长期记忆构建效率。
演讲提纲:
听众收益:
AI 数据生产贯穿模型研发的完整生命周期:模型诞生前,需要大规模准备预训练语料或 SFT 精调数据;模型上线前,需要对存量数据完成批量推理入库;模型上线后,需要对持续产生的增量数据实时推理入库。
这三个阶段对算力的诉求截然不同,没有一种资源供给模式能一劳永逸地满足所有场景。
小红书数据引擎团队以 Ray 为统一引擎底座,基于 Ray 引擎的统一调度能力与丰富的上层框架,覆盖了 AI 数据生产三个阶段截然不同的算力诉求——同一套引擎底座,通过不同的框架组合与资源供给策略,驱动从稳定常驻集群到海量弹性算力的全场景落地。
阶段一 · 训练数据准备: 预训练和 SFT 数据处理链路天然异构——去重依赖大规模 Shuffle,AI 质量打分依赖 GPU 批量推理,多模态内容处理需要高效的格式解析。我们在同一个 Ray 集群上通过 RuntimeEnv 沙箱隔离让 RayDP、Ray Data、Daft、DataJuicer 多种引擎共存协同,持续打磨万核百卡异构Ray集群稳定性。
阶段二 · 模型上线前离线刷库: 存量数据回扫是典型的"来得急、量级大、一次性"需求,但 GPU 资源天然离散在多家云厂商、多个可用区。我们经历了两代方案演进:第一代通过 Virtual Kubelet 将跨 K8s 集群的 CPU 混部资源汇聚为统一算力入口;第二代提出"存算分离"架构,以稳定 CPU 集群承载数据编排,通过 Ray Serve 联邦驱动弹性 GPU 资源完成推理,支持行级重试与断点续推,将原本因资源离散导致的长尾问题大幅收敛。此外,我们正在向 KubeRay 开源社区提出 KubeRay Federation 方案(kuberay#4561)。
阶段三 · 模型上线后近线增量入库: 新笔记、新商品需要分钟级持续入库,流量波动大且需要7*24h运行。我们自研了流批统一引擎 Ray Klein,基于 Chandy-Lamport 快照算法实现精确 Kafka offset 断点恢复,支持一套业务代码在全量批推与近线增量之间无缝切换。
本演讲将以这三个阶段为线索,分享 Ray 引擎如何凭借统一的调度底座,通过不同的框架组合与资源供给策略,覆盖 AI 数据生产全生命周期中截然不同的算力诉求,以及我们在工程实践中形成的核心判断:算力供给模式必须匹配业务阶段的特征,而非用单一模式覆盖所有场景。
演讲提纲:
听众收益:
问题背景: 传统数据湖信奉“先存后管”,导致大量非结构化数据处于不可视、不可用的“数据沼泽”状态,面临治理溃败与 ROI 难以证明的困境。AI 时代,Agent 应用对数据的需求从单纯“文件”转向可引用的“上下文”。
解决方案: 本次演讲提出从 Data Lake 向 AI 数据湖(Context Lake) 的战略升级。通过构建“湖原生存储底座+统一数据视图(UDV)”,实现非结构化数据的资产化激活,为 AI Pipeline 提供可信的记忆层。
技术细节: 核心依托高性能内置 Catalog 建立“原文-分块-向量”的深度血缘绑定,解决向量不可解释的痛点。结合目录桶技术提升高并发访问性能,并利用 Agent Sandbox实现秒级快照创建,确保 AI 在不污染主线数据的前提下进行安全试错与重切片验证。
实施效果: 该方案显著降低了数据搬迁与冗余成本,实现了“入湖即治理”。实验数据显示,通过目录桶与 S3 over RDMA 优化,可大幅提升 AI 训练数据读取效率;同时,利用统一数据视图,企业可渐进式纳管异构存储,将沉睡数据转化为可量化的 AI 知识资产。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

