拥有清华大学硕士学位,目前任职于京东零售 AI Infra 方向,专注于 LLM 推理优化、投机推理、生成式推荐及端智能等方向的研究与应用。作为 xLLM 项目的 Core Maintainer,参与了项目从 0 到 1 的开发,负责多个核心组件的研发,为京东零售全场景 LLM 在线服务提供底层支持。同时深度参与端智能项目,主导关键算法与架构设计,相关成果已在京东 APP 内稳定运行,覆盖海量用户场景。致力于通过技术创新,推动大模型与智能系统在超大规模业务中的落地与实践。

拥有清华大学硕士学位,目前任职于京东零售 AI Infra 方向,专注于 LLM 推理优化、投机推理、生成式推荐及端智能等方向的研究与应用。作为 xLLM 项目的 Core Maintainer,参与了项目从 0 到 1 的开发,负责多个核心组件的研发,为京东零售全场景 LLM 在线服务提供底层支持。同时深度参与端智能项目,主导关键算法与架构设计,相关成果已在京东 APP 内稳定运行,覆盖海量用户场景。致力于通过技术创新,推动大模型与智能系统在超大规模业务中的落地与实践。
议题介绍本次演讲将聚焦于xLLM 的投机推理架构设计。将从一个核心问题出发:如何让大模型推理在保证生成质量的前提下,实现数量级的效率提升?
传统的自回归推理如同“逐字思考”,速度存在瓶颈。投机式推理则引入了一个“快速草稿机”(小模型)和一个“权威审核员”(大模型)的协作范式,从根本上改变了推理流程。xLLM 不仅实现了这一范式,更通过一系列创新的系统架构设计,解决了将其投入实际生产时面临的计算、通信、调度等核心挑战。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

