范斌,Alluxio 创始成员和 VP of Technology。加入 Alluxio 前, 范斌在 Google 从事下一代大规模分布式存储系统的研究与开发。范斌博士毕业于卡内基梅隆大学计算机系,博士期间在分布式系统算法和系统实现等方向发表多篇包括 SIGCOMM、 SOSP、NSDI 等顶级国际会议论文以及多篇专利。

范斌,Alluxio 创始成员和 VP of Technology。加入 Alluxio 前, 范斌在 Google 从事下一代大规模分布式存储系统的研究与开发。范斌博士毕业于卡内基梅隆大学计算机系,博士期间在分布式系统算法和系统实现等方向发表多篇包括 SIGCOMM、 SOSP、NSDI 等顶级国际会议论文以及多篇专利。
在 AWS S3 等云对象存储中将数据存储为 Parquet 文件,不仅在大规模数据湖中非常流行,而且还可作为用于训练和推理的轻量级特征存储,或作为用于检索增强生成(RAG)的文档存储。然而,直接从 S3 查询 PB 到 EB 级规模的数据湖所面对的共同挑战是速度很慢,延迟时间通常从数百毫秒到数秒不等。
此次演讲将介绍如何利用 Alluxio 作为超大规模数据湖上的高性能缓存和加速层,对 Parquet 文件进行查询。在不使用专用硬件,不更改数据格式或对象寻址方案,不从数据湖迁移数据的情况下,Alluxio 如何实现亚毫秒级的首字节时间(TTFB)性能,以及Alluxio 的吞吐量与集群规模的线性扩展。
演讲提纲
听众收益



微信咨询

电话咨询
微信联系我们

