本次演讲将聚焦于 Omni Cache 的 DRAM-Centric KV 管理架构设计。将从一个核心问题出发:如何在长上下文大模型推理中,突破 HBM 容量瓶颈,实现数量级的容量扩展与并发提升?
传统的 PagedAttention 架构将 KV cache 静态预分配在 HBM 中,导致 KV 存储与激活张量竞争有限的显存资源。这种 HBM-Centric 设计在模型参数和上下文长度增长时面临三重困境:容量受限、系统隔离、算法复杂。现有 offload 方案保留 HBM block pool 作为权威存储,未能触及核心矛盾。
Omni Cache 引入 DRAM-Centric 范式:KV cache 驻留 host memory(TB 级),HBM 仅作为瞬态计算缓冲区。通过独立 Memory Manager daemon、两步虚拟地址管理、层级流水线传输三大创新,实现 prefill 容量扩展、decode 并发提升和 KV 容量数量级扩展,同时保持高吞吐量。
演讲提纲:
- 大模型推理的 HBM 资源困境
- PagedAttention 静态预分配导致的 KV 与激活张量资源冲突
- 系统隔离问题:跨实例共享困难、MLA 冗余存储、重启丢失缓存
- 现有 offload 方案的局限性:HBM block pool 权威存储地位未变
- Omni Cache 架构总览
- 核心设计理念:计算与存储解耦,KV buffers vs KV cache 分离
- 单节点架构:Memory Manager daemon 管理共享 host pool,支持多实例共享和崩溃恢复
- 集群级架构:KV Fabric Manager 维护全局 APC radix tree,实现跨节点 KV 共享
- 数据传输:Transfer Engine 负责 H2D/D2H scatter/gather 及跨节点 Remote Read
- 核心创新与工程挑战破解
- 挑战一:Prefill 阶段 HBM 不足 → Per-layer ring buffer 实现逐层释放
- 挑战二:Decode 并发受限 → 选择性区域 host 驻留 + Multi-stage Batch Overlap
- 挑战三:间接寻址开销 → 两步虚拟地址管理消除 block table
- 挑战四:跨节点 KV 共享 → KV Fabric 全局寻址与路由优化
- 挑战五:小粒度传输效率低 → Device-side scatter/gather kernel
- 性能评估与实际效果
- Transfer Engine 传输效率:小粒度和大粒度场景的带宽表现
- Prefill 容量扩展:显著提升最大序列长度,吞吐量与基准持平
- Decode 并发扩展:单请求 HBM 占用大幅降低,并发请求数量显著提升
- 总结展望
听众收益:
- 深入理解长上下文推理的 HBM 瓶颈根源及 DRAM-Centric 架构设计思想
- 掌握计算与存储解耦的关键技术:独立 Memory Manager、两步虚拟地址管理、层级流水线传输
- 了解稀疏注意力模型的内存优化范式:异构访问模式的分层缓冲策略与延迟掩盖技术
- 获取工业级 LLM 推理系统的真实性能数据与工程实践经验