专题演讲嘉宾:马进

抖音集团数据引擎开发工程师

长期从事基础软件、数据库和 AI 数据基础设施相关工作,是 Lance 社区核心贡献者及 Maintainer,同时也是 Apache Amoro 项目的 PPMC 成员。曾参与数据库内核、数据平台及第三方平台类产品的设计与研发,在存储引擎、索引、查询优化、数据湖架构、数据治理和平台工程等方向有较多实践经验。目前主要聚焦数据库与 AI Infra 领域,重点关注多模态数据管理、向量检索、Lakehouse 架构以及 Agent 记忆基础设施等技术方向。个人擅长从数据库和数据系统底层视角分析 AI 应用对数据底座的新需求,并结合开源社区与工程实践推动相关技术落地。

by 马进

抖音集团
数据引擎开发工程师

随着大模型应用从单轮问答走向 RAG、Agent 和多模态智能体,数据基础设施正在从传统数据湖演进为 AI 原生的多模态数据湖。传统数据湖更擅长管理结构化数据和离线分析任务,但在 AI 场景中,系统需要同时处理文本、图片、视频、音频、Embedding、标注、特征和索引等多种数据形态。现实落地中,这些数据往往分散在对象存储、Parquet 表、向量数据库、搜索引擎和离线脚本中,造成数据重复、链路割裂、版本难以追溯,也增加了模型实验、检索调优和应用迭代的复杂度。

Lance 正是面向这一变化设计的开放多模态 Lakehouse 格式。它通过高效随机访问、原生向量检索、全文检索、零拷贝 Schema 演进、对象存储适配和数据版本管理等能力,将原始多模态数据、元数据、Embedding、索引和版本统一到同一套开放数据层中。在此基础上,Lance 不仅可以支撑多模态数据湖中的数据治理、混合检索和模型训练,也进一步延伸到 RAG 与 Agent 场景,成为构建“记忆湖”的基础组件。

本次分享将围绕“从数据湖到记忆湖”的实践展开,介绍如何基于 Lance/LanceDB 设计一套面向 AI 应用的数据底座:从多模态数据的统一组织、Embedding 与索引管理、版本回溯,到面向 Agent Memory 的长期记忆存储与检索。分享也会结合实际建设过程中遇到的数据同步、检索性能、数据演进和系统复杂度问题,讨论 Lance 为什么正在从多模态数据湖方案逐步发展为 Agent Infra 的关键基础设施。该方案已在多模态数据管理和智能检索场景中完成验证,能够有效降低跨系统同步成本,提升数据复用、检索迭代和长期记忆构建效率。

演讲提纲:

  1. 从数据湖到记忆湖:AI 原生数据基础设施的演进
    • 传统数据湖的局限性:结构化数据与离线分析的困局
    • AI 场景的多模态数据挑战:形态多样、分散存储、链路割裂
    • 从 RAG 到 Agent:数据基础设施的新诉求
  2. Lance:面向多模态 AI 的开放 Lakehouse 格式
    • 核心能力:高效随机访问、原生向量检索、全文检索
    • Schema 演进与数据版本管理
    • 统一存储层:原始数据、元数据、Embedding、索引一体化
  3. 多模态数据湖的统一组织与管理
    • 多模态数据的采集、处理、统一存储
    • Embedding 与索引管理
    • 数据版本回溯与演进
  4. 面向 Agent Memory 的记忆湖构建
    • 长期记忆存储与检索
    • Agent 场景下的数据底座设计
  5. 落地实践中的挑战与解法
    • 数据同步与检索性能优化
    • 数据演进与系统复杂度控制
    • 跨系统同步成本降低与检索迭代效率提升
  6. 总结与未来展望

听众收益:

  • 深入了解 AI 原生多模态数据湖的设计理念,掌握从传统数据湖到“记忆湖”的演进路径
  • 学会基于 Lance/LanceDB 构建面向 AI 应用的数据底座,打通“多模态数据统一组织 → Embedding 与索引管理 → Agent Memory 存储”全链路
  • 获取数据同步、检索性能、版本演进等落地实践中的关键挑战与解法,降低系统复杂度、提升迭代效率

交通指南

上海虹桥祥源希尔顿酒店

Hilton Shanghai Hongqiao
地址:上海市红松东路1116号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手