随着大模型从能力探索走向规模化应用,长上下文、多模态交互和 Agent 工作流带... 展开 >

鲁浩楠,现任 OPPO 大模型算法部负责人。本科毕业于中国科学技术大学,博士毕业于香港中文大学,曾任欧洲核子研究中心访问学者、华为高级算法研究员。目前负责公司系统级 AI 产品的端云算法研发工作,致力于多模态理解与生成,AI 智能体系统,大模型轻量化及端侧化等领域的应用交付与算法研究。他带领团队在公司内端云场景中落地多项核心业务,同时也在AAAI、SIGGRAPH、ECCV、ICCV、ACL、NeurIPS、ICLR、ACMMM等高水平国际会议上发表多篇论文。
随着大模型从能力探索走向规模化应用,长上下文、多模态交互和 Agent 工作流带来了新的性能、成本与工程挑战。本专题聚焦大模型效率工程与 Agent 系统实践,围绕推理优化、上下文管理、模型压缩、智能体运行架构及业务落地等方向,分享算法与系统协同设计经验,探索如何构建高效、可靠、可规模化演进的 AI 系统。
2026 年,多模态大模型正从“被动感知”走向“主动执行”,而不断增长的上下文长度与生成成本,使“效率”成为其规模化落地的核心瓶颈。本次分享围绕面向多模态理解与生成的高效推理,介绍团队在大模型“算法—系统协同设计”上的最新进展:高效注意力方面,覆盖支撑长上下文的稀疏 / 线性注意力;高效记忆方面,介绍基于 KV-cache 压缩与缓存管理的显存优化;高效解码方面,分享近期并行解码策略。在此基础上,串联多模态大模型(Agent)在理解、生成等核心能力上的实践;并进一步简单介绍面向视频生成对齐的高效扩散强化学习,以及在交互式世界模型评测上的探索。最后分享对高效基础模型未来走向的思考,包括agentic loop等。
演讲提纲
实践场景说明:
这样的技术在实践过程中有哪些痛点?
听众收益
2026 年上半年,AI 行业出现了一个新共识:模型能力够了,但模型不认识用户。OpenAI / Anthropic / Google 同时上线持久记忆,Letta / Mem0 / Zep / Hark 四家创业公司合计吸金 $110M+——记忆正在从大模型的可选配件,变成独立的基础设施层。与此同时,Apple M 系列芯片、NVIDIA RTX Spark 和 Jetson Thor 的发布,使消费级设备首次具备了本地运行多模态大模型的能力。
本次分享以端侧多模态记忆层的工程实践为主线,拆解模型自研、推理架构重造、知识图谱记忆系统三层技术栈的构建过程,以及在此过程中积累的核心经验——多模型协同调度、异构芯片适配、记忆的结构化存储与语义检索。核心不单讲算法优化,更讲记忆层作为一种新基础设施的工程解法。
演讲提纲
听众收益
随着端侧多模态场景扩展与长上下文需求增长,端侧大模型在 prefill / decoding 时延、工程链路复杂度、模型迭代周期上面临多重约束。本次分享围绕 OPPO 端侧化全栈实践,介绍以 QAT 量化感知训练 为核心的协同训练体系,覆盖稀疏化压缩、长上下文 Cache Eviction、解码加速训练,并结合 QALFT 自动化工程化 与 0 阶端侧训练,打通从模型压缩、编译部署到垂域落地与本地个性化的完整链路。
演讲提纲
这样的技术在实践过程中有哪些痛点?
听众收益
大模型 Agent 走向商业规模化落地,面临的已不只是"回答质量"问题,而是低时延、高并发、动态知识实时性、算力成本与长期效果可演进的多重约束。快手生活服务、电商、商业化和直播场景中,商品信息、优惠规则和交易链路高度实时,传统大模型方案直接上线,往往在时延、幻觉和成本上遇到瓶颈。
本次分享以"高并发、高变化场景下的大模型高效推理"为主线,结合快手商业互动 Agent 的落地实践,探讨如何在真实业务约束下构建稳定、低成本、可规模化的商业 Agent 系统:通过动态知识更新策略与知识自裁机制解决商业场景下的知识冲突问题,将知识变更和知识溯源前移至推理阶段实现实时更新;通过用户模拟与停滞检测实现Agent自进化,避免 Agent 在动态环境中越用越退化;在模型优化阶段引入自适应混合步度归因算法,解决多轮对话的长期收益归因难题。本次分享更关注算法与系统的协同设计,探讨如何把模型能力转化为稳定、低成本、可规模化的商业基础设施,并沉淀出可迁移的 Agent 效率工程方法论。
演讲提纲
实践中的痛点与取舍
听众收益



微信咨询

电话咨询
领取往期热门演讲视频

