专题演讲嘉宾:马腾

阿里云高级技术专家

在阿里云主要大模型软件栈在新硬件环境下国产化的研究工作,并共同创建了大模型开源项目 Mooncake(5K Star)。目前 Mooncake 已经有阿里云 / 清华 / 月之暗面 / 蚂蚁 / 字节 / 趋境科技等多方参与,并且成功接入 vLLM/SGLang/LMDeploy/LMCache 等社区。同时他也是 SGLang, RBG 等社区的 Committer。他在 SOSP, ASPLOS, ATC, SC, INFOCOM, VLDB, TPDS 等顶级会议和期刊上发表论文二十余篇,相关成果授权美国 / 中国专利 10 项。他曾入选 CCF 系统软件专委会优秀博士论文激励计划,担任 PPoPP, FAST, DASFAA, TPDS, ICME, TC, JSC 等国际会议 / 期刊的程序委员会成员和审稿人。

by 马腾

阿里云
高级技术专家

随着大模型应用从单一对话向多智能体(Multi-Agent)协作演进,Agent Memory 的形态正在发生深刻重构。在多智能体系统中,系统提示词、共享的工具描述、多轮交互历史以及智能体间的状态传递,构成了极其庞大的“工作记忆(Working Memory)”。然而,当前主流的推理架构将这些记忆抽象为独立的文本请求,导致在底层的物理计算中,大量重复的上下文正在经历无意义的计算(Prefill),引发严重的显存碎片化与极高的端到端延迟。如何让底层的算力网络真正“感知”并复用高层智能体的记忆状态,已成为突破多系统规模化瓶颈的关键。

本次报告将围绕“记忆感知驱动的多智能体推理优化”展开,重点介绍以 KVCache 为中心的开源大模型服务框架——Mooncake。我们将深入探讨一种全新的视角:将大模型推理引擎中的 KVCache 视作智能体系统最核心的“物理工作记忆”载体。通过打破传统推理中计算与存储的强耦合,Mooncake 实现了 Prefill 与 Decode 的分离式架构(Disaggregated Architecture),并构建了全局共享的 KVCache 池。这种设计使得多智能体在频繁交互与协同工作时,能够通过跨节点的底层张量零拷贝与高效复用,实现记忆的“一次计算、全局共享”。

演讲提纲:

  1. 多智能体时代的记忆挑战
    • 从单一对话到多智能体协作的演进趋势
    • Agent Memory 的构成:系统提示词、工具描述、多轮交互历史、智能体间状态传递
    • 当前推理架构的瓶颈:重复 Prefill 计算、显存碎片化与端到端延迟
  2. 核心视角:KVCache 作为智能体的"物理工作记忆"
    • 重新定义 KVCache 的角色——从推理缓存到记忆载体
    • "一次计算、全局共享"的设计目标
  3. Mooncake:以 KVCache 为中心的开源推理服务框架
    • Prefill 与 Decode 分离式架构(Disaggregated Architecture)
    • 全局共享 KVCache 池的构建
    • 跨节点张量零拷贝与高效复用机制
  4. 多智能体落地的底层技术挑战
    • 基于记忆感知(Memory-aware)的请求调度与路由策略
    • 长短记忆在物理显存中的动态分层与淘汰机制(Eviction)
    • 高并发场景下的吞吐极限优化
  5. 总结与展望
    • Agent Memory 需要下沉至物理推理基础设施
    • 通过底层"记忆流转"释放算力与智能潜能

听众收益:

  • 了解记忆系统和KVCache的无缝结合
  • 了解如何通过推理优化,显著提升Agent性能

交通指南

上海虹桥祥源希尔顿酒店

Hilton Shanghai Hongqiao
地址:上海市红松东路1116号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手