大模型推理优化

会议室:源福厅 6
出品人:刘童璇

聚焦 AI 决策能力的“核心引擎”,探讨如何通过算法压榨... 展开 >

专题出品人:刘童璇

京东零售 智能平台部技术总监

京东零售集团智能平台部算法总监,开源大模型推理引擎xLLM负责人。曾参与了多个深度学习开源框架的工作。主要研究方向大模型推理优化、多模态大模型、生成式推荐等方向,在SC,KDD,MLSYS、AAAI、EMNLP,NAACL,TC、TDPS等会议、期刊发表十余篇论文。

地点:源福厅 6

专题:大模型推理优化

聚焦 AI 决策能力的“核心引擎”,探讨如何通过算法压榨实现智力增量与成本控制的极致平衡。本专题深入解析 Inference-time Scaling Law 的强化学习路径,攻克极致长序列工程下的计算与存储瓶颈,并加速高精度 SLM 向通用硬件渗透,定义 2026 年度企业级推理的最优 ROI 路径。

by Ken Zhang

华为
高级技术专家

本次演讲将聚焦于 Omni Cache 的 DRAM-Centric KV 管理架构设计。将从一个核心问题出发:如何在长上下文大模型推理中,突破 HBM 容量瓶颈,实现数量级的容量扩展与并发提升?

传统的 PagedAttention 架构将 KV cache 静态预分配在 HBM 中,导致 KV 存储与激活张量竞争有限的显存资源。这种 HBM-Centric 设计在模型参数和上下文长度增长时面临三重困境:容量受限、系统隔离、算法复杂。现有 offload 方案保留 HBM block pool 作为权威存储,未能触及核心矛盾。

Omni Cache 引入 DRAM-Centric 范式:KV cache 驻留 host memory(TB 级),HBM 仅作为瞬态计算缓冲区。通过独立 Memory Manager daemon、两步虚拟地址管理、层级流水线传输三大创新,实现 prefill 容量扩展、decode 并发提升和 KV 容量数量级扩展,同时保持高吞吐量。

演讲提纲:

  1. 大模型推理的 HBM 资源困境
    • PagedAttention 静态预分配导致的 KV 与激活张量资源冲突
    • 系统隔离问题:跨实例共享困难、MLA 冗余存储、重启丢失缓存
    • 现有 offload 方案的局限性:HBM block pool 权威存储地位未变
  2. Omni Cache 架构总览
    • 核心设计理念:计算与存储解耦,KV buffers vs KV cache 分离
    • 单节点架构:Memory Manager daemon 管理共享 host pool,支持多实例共享和崩溃恢复
    • 集群级架构:KV Fabric Manager 维护全局 APC radix tree,实现跨节点 KV 共享
    • 数据传输:Transfer Engine 负责 H2D/D2H scatter/gather 及跨节点 Remote Read
  3. 核心创新与工程挑战破解
    • 挑战一:Prefill 阶段 HBM 不足 → Per-layer ring buffer 实现逐层释放
    • 挑战二:Decode 并发受限 → 选择性区域 host 驻留 + Multi-stage Batch Overlap
    • 挑战三:间接寻址开销 → 两步虚拟地址管理消除 block table
    • 挑战四:跨节点 KV 共享 → KV Fabric 全局寻址与路由优化
    • 挑战五:小粒度传输效率低 → Device-side scatter/gather kernel
  4. 性能评估与实际效果
    • Transfer Engine 传输效率:小粒度和大粒度场景的带宽表现
    • Prefill 容量扩展:显著提升最大序列长度,吞吐量与基准持平
    • Decode 并发扩展:单请求 HBM 占用大幅降低,并发请求数量显著提升
  5. 总结展望

听众收益:

  • 深入理解长上下文推理的 HBM 瓶颈根源及 DRAM-Centric 架构设计思想
  • 掌握计算与存储解耦的关键技术:独立 Memory Manager、两步虚拟地址管理、层级流水线传输
  • 了解稀疏注意力模型的内存优化范式:异构访问模式的分层缓冲策略与延迟掩盖技术
  • 获取工业级 LLM 推理系统的真实性能数据与工程实践经验

by 刘方鑫

上海交大
助理教授 & 博士生导师

当前大模型推理受限于非均匀数据分布与同构算力架构的严重错配,导致存储冗余、精度浪费与访存瓶颈。

针对上述问题,本报告提出一套面向大模型推理的跨层协同优化方案。在数据表征层面,通过分布感知的自适应数据编码,降低信息冗余度,实现模型参数的紧凑化与硬件友好型存储;在计算范式层面,重构运算逻辑,引入基于重要性感知的高精度近似计算,以低成本的轻量运算替代非关键数据的高精度运算,有效提升硬件算力利用率;在数据流层面,通过协同编排计算与访存数据流,优化调度策略,减少缓存未命中与流水线阻塞。为构建高效的 AI 算力底座提供了系统性的演进路径。

听众收益:

  • ​学会诊断:从“数据分布与算力错配”角度,定位大模型推理中的存储冗余、精度浪费和访存瓶颈
  • 学会压缩:掌握基于数据分布的自适应编码方法,实现硬件友好的紧凑化存储
  • 学会协同:理解如何通过重要性感知的近似计算和数据流编排,减少缓存未命中与流水线阻塞

by 梁志伟

京东
算法工程师

议题介绍本次演讲将聚焦于xLLM 的投机推理架构设计。将从一个核心问题出发:如何让大模型推理在保证生成质量的前提下,实现数量级的效率提升?

传统的自回归推理如同“逐字思考”,速度存在瓶颈。投机式推理则引入了一个“快速草稿机”(小模型)和一个“权威审核员”(大模型)的协作范式,从根本上改变了推理流程。xLLM 不仅实现了这一范式,更通过一系列创新的系统架构设计,解决了将其投入实际生产时面临的计算、通信、调度等核心挑战。

演讲提纲:

  1. 大模型推理的挑战与投机式推理原理
    • 当前大模型推理的延迟与计算资源矛盾
    • 投机式推理的基本思想:用小模型“草案”引导大模型“验证”的加速范式
  2. xLLM 架构总览
    • 设计目标:面向国产芯片的高性能、高稳定的企业级LLM部署引擎
    • 核心功能介绍:
      • 深度解耦的分布式推理:计算(专家)、调度、KV Cache、数据(输入/输出)的分离,为动态调度提供基础
      • 全局多级KV Cache池:统一的内存抽象,支持跨请求、跨节点的快速缓存访问与复用,是投机候选序列生成与验证的关键
      • 全局智能调度器:具备全局视图,能够协调草稿模型与主模型的执行,并实施严格的SLO保证
  3. 核心创新与工程挑战破解
    •   挑战一:通信与主机开销
    •   问题:中心式验证成为性能瓶颈,数据往返延迟抵消加速收益
    •   解决方案:
      • 逻辑下沉与本地缓存:将验证逻辑从master节点移至分布式子worker节点,减少数据往返
      • 异步流水线调度:让输入准备与模型执行重叠进行,隐藏延迟
    • 挑战二:大规模分布式部署支持
      • 问题:投机推理在大规模集群上的高效运行问题
      • 解决方案:适配DP并行与PD分离,保证每个节点的行为一致
    • 挑战三:不同注意力结构的适配
      • 问题:不同模型的KV cache缓存机制不同
      • 解决方案:动态适配多种注意力变体,保证投机过程的正确性与内存效率
  4. 总结展望

听众收益:

  1. 深入理解投机式推理的工业级实现方案
  2. 掌握构建高性能、可扩展大模型推理系统的关键架构设计思想
  3. 了解工业界在降低大模型服务成本、提升集群效率方面的前沿工程实践与优化技巧

by 马腾

阿里云
高级技术专家

随着大模型应用从单一对话向多智能体(Multi-Agent)协作演进,Agent Memory 的形态正在发生深刻重构。在多智能体系统中,系统提示词、共享的工具描述、多轮交互历史以及智能体间的状态传递,构成了极其庞大的“工作记忆(Working Memory)”。然而,当前主流的推理架构将这些记忆抽象为独立的文本请求,导致在底层的物理计算中,大量重复的上下文正在经历无意义的计算(Prefill),引发严重的显存碎片化与极高的端到端延迟。如何让底层的算力网络真正“感知”并复用高层智能体的记忆状态,已成为突破多系统规模化瓶颈的关键。

本次报告将围绕“记忆感知驱动的多智能体推理优化”展开,重点介绍以 KVCache 为中心的开源大模型服务框架——Mooncake。我们将深入探讨一种全新的视角:将大模型推理引擎中的 KVCache 视作智能体系统最核心的“物理工作记忆”载体。通过打破传统推理中计算与存储的强耦合,Mooncake 实现了 Prefill 与 Decode 的分离式架构(Disaggregated Architecture),并构建了全局共享的 KVCache 池。这种设计使得多智能体在频繁交互与协同工作时,能够通过跨节点的底层张量零拷贝与高效复用,实现记忆的“一次计算、全局共享”。

演讲提纲:

  1. 多智能体时代的记忆挑战
    • 从单一对话到多智能体协作的演进趋势
    • Agent Memory 的构成:系统提示词、工具描述、多轮交互历史、智能体间状态传递
    • 当前推理架构的瓶颈:重复 Prefill 计算、显存碎片化与端到端延迟
  2. 核心视角:KVCache 作为智能体的"物理工作记忆"
    • 重新定义 KVCache 的角色——从推理缓存到记忆载体
    • "一次计算、全局共享"的设计目标
  3. Mooncake:以 KVCache 为中心的开源推理服务框架
    • Prefill 与 Decode 分离式架构(Disaggregated Architecture)
    • 全局共享 KVCache 池的构建
    • 跨节点张量零拷贝与高效复用机制
  4. 多智能体落地的底层技术挑战
    • 基于记忆感知(Memory-aware)的请求调度与路由策略
    • 长短记忆在物理显存中的动态分层与淘汰机制(Eviction)
    • 高并发场景下的吞吐极限优化
  5. 总结与展望
    • Agent Memory 需要下沉至物理推理基础设施
    • 通过底层"记忆流转"释放算力与智能潜能

听众收益:

  • 了解记忆系统和KVCache的无缝结合
  • 了解如何通过推理优化,显著提升Agent性能

交通指南

上海虹桥祥源希尔顿酒店

Hilton Shanghai Hongqiao
地址:上海市红松东路1116号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手