随着大模型应用从单轮问答走向 RAG、Agent 和多模态智能体,数据基础设施正在从传统数据湖演进为 AI 原生的多模态数据湖。传统数据湖更擅长管理结构化数据和离线分析任务,但在 AI 场景中,系统需要同时处理文本、图片、视频、音频、Embedding、标注、特征和索引等多种数据形态。现实落地中,这些数据往往分散在对象存储、Parquet 表、向量数据库、搜索引擎和离线脚本中,造成数据重复、链路割裂、版本难以追溯,也增加了模型实验、检索调优和应用迭代的复杂度。
Lance 正是面向这一变化设计的开放多模态 Lakehouse 格式。它通过高效随机访问、原生向量检索、全文检索、零拷贝 Schema 演进、对象存储适配和数据版本管理等能力,将原始多模态数据、元数据、Embedding、索引和版本统一到同一套开放数据层中。在此基础上,Lance 不仅可以支撑多模态数据湖中的数据治理、混合检索和模型训练,也进一步延伸到 RAG 与 Agent 场景,成为构建“记忆湖”的基础组件。
本次分享将围绕“从数据湖到记忆湖”的实践展开,介绍如何基于 Lance/LanceDB 设计一套面向 AI 应用的数据底座:从多模态数据的统一组织、Embedding 与索引管理、版本回溯,到面向 Agent Memory 的长期记忆存储与检索。分享也会结合实际建设过程中遇到的数据同步、检索性能、数据演进和系统复杂度问题,讨论 Lance 为什么正在从多模态数据湖方案逐步发展为 Agent Infra 的关键基础设施。该方案已在多模态数据管理和智能检索场景中完成验证,能够有效降低跨系统同步成本,提升数据复用、检索迭代和长期记忆构建效率。
演讲提纲:
- 从数据湖到记忆湖:AI 原生数据基础设施的演进
- 传统数据湖的局限性:结构化数据与离线分析的困局
- AI 场景的多模态数据挑战:形态多样、分散存储、链路割裂
- 从 RAG 到 Agent:数据基础设施的新诉求
- Lance:面向多模态 AI 的开放 Lakehouse 格式
- 核心能力:高效随机访问、原生向量检索、全文检索
- Schema 演进与数据版本管理
- 统一存储层:原始数据、元数据、Embedding、索引一体化
- 多模态数据湖的统一组织与管理
- 多模态数据的采集、处理、统一存储
- Embedding 与索引管理
- 数据版本回溯与演进
- 面向 Agent Memory 的记忆湖构建
- 长期记忆存储与检索
- Agent 场景下的数据底座设计
- 落地实践中的挑战与解法
- 数据同步与检索性能优化
- 数据演进与系统复杂度控制
- 跨系统同步成本降低与检索迭代效率提升
- 总结与未来展望
听众收益:
- 深入了解 AI 原生多模态数据湖的设计理念,掌握从传统数据湖到“记忆湖”的演进路径
- 学会基于 Lance/LanceDB 构建面向 AI 应用的数据底座,打通“多模态数据统一组织 → Embedding 与索引管理 → Agent Memory 存储”全链路
- 获取数据同步、检索性能、版本演进等落地实践中的关键挑战与解法,降低系统复杂度、提升迭代效率