聚焦 AI 决策能力的“核心引擎”,探讨如何通过算法压榨... 展开 >




京东零售集团智能平台部算法总监,开源大模型推理引擎xLLM负责人。曾参与了多个深度学习开源框架的工作。主要研究方向大模型推理优化、多模态大模型、生成式推荐等方向,在SC,KDD,MLSYS、AAAI、EMNLP,NAACL,TC、TDPS等会议、期刊发表十余篇论文。
聚焦 AI 决策能力的“核心引擎”,探讨如何通过算法压榨实现智力增量与成本控制的极致平衡。本专题深入解析 Inference-time Scaling Law 的强化学习路径,攻克极致长序列工程下的计算与存储瓶颈,并加速高精度 SLM 向通用硬件渗透,定义 2026 年度企业级推理的最优 ROI 路径。
本次演讲将聚焦于 Omni Cache 的 DRAM-Centric KV 管理架构设计。将从一个核心问题出发:如何在长上下文大模型推理中,突破 HBM 容量瓶颈,实现数量级的容量扩展与并发提升?
传统的 PagedAttention 架构将 KV cache 静态预分配在 HBM 中,导致 KV 存储与激活张量竞争有限的显存资源。这种 HBM-Centric 设计在模型参数和上下文长度增长时面临三重困境:容量受限、系统隔离、算法复杂。现有 offload 方案保留 HBM block pool 作为权威存储,未能触及核心矛盾。
Omni Cache 引入 DRAM-Centric 范式:KV cache 驻留 host memory(TB 级),HBM 仅作为瞬态计算缓冲区。通过独立 Memory Manager daemon、两步虚拟地址管理、层级流水线传输三大创新,实现 prefill 容量扩展、decode 并发提升和 KV 容量数量级扩展,同时保持高吞吐量。
演讲提纲:
听众收益:
当前大模型推理受限于非均匀数据分布与同构算力架构的严重错配,导致存储冗余、精度浪费与访存瓶颈。
针对上述问题,本报告提出一套面向大模型推理的跨层协同优化方案。在数据表征层面,通过分布感知的自适应数据编码,降低信息冗余度,实现模型参数的紧凑化与硬件友好型存储;在计算范式层面,重构运算逻辑,引入基于重要性感知的高精度近似计算,以低成本的轻量运算替代非关键数据的高精度运算,有效提升硬件算力利用率;在数据流层面,通过协同编排计算与访存数据流,优化调度策略,减少缓存未命中与流水线阻塞。为构建高效的 AI 算力底座提供了系统性的演进路径。
听众收益:
议题介绍本次演讲将聚焦于xLLM 的投机推理架构设计。将从一个核心问题出发:如何让大模型推理在保证生成质量的前提下,实现数量级的效率提升?
传统的自回归推理如同“逐字思考”,速度存在瓶颈。投机式推理则引入了一个“快速草稿机”(小模型)和一个“权威审核员”(大模型)的协作范式,从根本上改变了推理流程。xLLM 不仅实现了这一范式,更通过一系列创新的系统架构设计,解决了将其投入实际生产时面临的计算、通信、调度等核心挑战。
演讲提纲:
听众收益:
随着大模型应用从单一对话向多智能体(Multi-Agent)协作演进,Agent Memory 的形态正在发生深刻重构。在多智能体系统中,系统提示词、共享的工具描述、多轮交互历史以及智能体间的状态传递,构成了极其庞大的“工作记忆(Working Memory)”。然而,当前主流的推理架构将这些记忆抽象为独立的文本请求,导致在底层的物理计算中,大量重复的上下文正在经历无意义的计算(Prefill),引发严重的显存碎片化与极高的端到端延迟。如何让底层的算力网络真正“感知”并复用高层智能体的记忆状态,已成为突破多系统规模化瓶颈的关键。
本次报告将围绕“记忆感知驱动的多智能体推理优化”展开,重点介绍以 KVCache 为中心的开源大模型服务框架——Mooncake。我们将深入探讨一种全新的视角:将大模型推理引擎中的 KVCache 视作智能体系统最核心的“物理工作记忆”载体。通过打破传统推理中计算与存储的强耦合,Mooncake 实现了 Prefill 与 Decode 的分离式架构(Disaggregated Architecture),并构建了全局共享的 KVCache 池。这种设计使得多智能体在频繁交互与协同工作时,能够通过跨节点的底层张量零拷贝与高效复用,实现记忆的“一次计算、全局共享”。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

