Apache 会员, Apache Incubator PMC, Mentor of Apache Gravitino, Gluten, HoraeDB 等多个项目 ; 专注于大数据分析和云计算技术。曾任 eBay 全球分析基础架构部大数据高级工程师,IBM 云计算部门架构师等。
在 AI 时代,企业为构建高质量 AI 应用,需要采集和挖掘更多数据,其中包括结构化数据(数据库、数据仓库)、非结构化数据(数据湖、文档库)、历史数据、实时数据等;数据的完整性、准确度对构建 AI 的应用的起到了关键作用。为 AI 用户提供一个统一的数据管理平台,供他们可以更好地发现和使用多源异构数据,包括数据发现、数据语义、数据血缘、数据权限等,并结合企业治理需求,管理好数据生命周期,避免资源浪费和数据外泄等,成为每个企业的现实挑战。
本次分享会为大家介绍企业在 AI 时代所面临的最直接的数据挑战,包括难以高效地管理、获取全域数据,缺乏统一地进行数据治理和权限控制,传统的数据湖体系和 GenAI 框架之间的鸿沟等等。为了应对这些挑战,我们研发了统一元数据湖项目,并做了很多前沿创新,包括:统一的结构化和非结构化数据模型来管理异构数据,统一权限模型来简化多源数据的安全管理,基于 Fileset 概念简化非结构化数据的访问和自动化它们的生命周期管理,在主流框架如 LlamaIndex 的基础上构建下一代企业级 Data Agent 来提升RAG方案等。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

