毕业于哈尔滨工业大学,曾就职于腾讯、百度,主要工作方向包括广告系统、模型训练、分布式存储,当前在快手负责分布式存储相关的工作。
毕业于哈尔滨工业大学,曾就职于腾讯、百度,主要工作方向包括广告系统、模型训练、分布式存储,当前在快手负责分布式存储相关的工作。
在当今大数据与人工智能飞速发展的时代,在线 ParameterServer(参数服务器)作为模型推理的核心组件,承担着海量模型参数的存储、更新与同步重任。随着模型规模的持续扩张以及在线请求量的爆炸式增长,传统在线 ParameterServer 逐渐暴露出性能短板。一方面,传统存储引擎在面对高频次的参数读写请求时,存在着数据访问延迟高、并发处理能力不足的问题;另一方面,基于 TCP/IP 协议的网络通信架构,网络带宽利用率低、传输延迟大的问题愈发凸显,成为了在线 ParameterServer 性能提升的又一关键瓶颈。
针对上述挑战,我们的项目团队从存储引擎与网络通信两个核心维度入手,进行了全方位的技术革新。首先是存储引擎的重构,我们通过引入 SIMD 并行计算、内存预取等、按 ttl 分层的精确过期和强制回收方案等技术手段,将存储引擎的极限吞吐提升了 50% 以上;其次,我们通过引入 RDMA 重构了整个通信链路,更是将极限吞吐提升了 270%,同时时延降低到了原来的 1/3。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

