毕业于北京大学。研究聚焦于系统与算法的联合优化,以及高效推理和训练方法的探索,涵盖多个前沿领域,包括动态稀疏注意力机制(如 MInference 和 RetrievalAttention)、KV 缓存优化(SCBench)、提示压缩(LLMLingua)、稀疏推理(PIT)、推测性解码、模型压缩、神经架构搜索和高效微调等。在 ICLR、NeurIPS、SOSP、ACL、EMNLP、ICCV 等国际顶级会议上发表了数十篇高水平论文,并以领域主席和审稿人的身份积极参与学术社区的建设和服务。
长上下文大语言模型推动了众多下游应用的发展,但也带来了计算和内存效率方面的重大挑战。为了应对这些挑战,围绕KV缓存的长上下文推理优化方法应运而生。然而,现有的基准测试通常仅关注单请求场景,忽视了KV缓存在实际使用中的完整生命周期。这一疏漏尤为关键,因为KV缓存复用已在LLM推理框架中被广泛采用,例如vLLM和SGLang,同时也得到了OpenAI、微软、谷歌、Anthropic、Deepseek等LLM提供商的支持。
为填补这一空白,我们提出了SCBench,一个全面的基准测试工具,从KV缓存为中心的视角评估长上下文方法。并且在本次演讲中首先会对目前主流的推理优化方法进行梳理,其次以KV缓存为中心梳理和介绍各类高效长文本方法:1)KV缓存生成,2)KV缓存压缩,3)KV缓存检索,4)KV缓存加载。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

