随着端侧多模态场景扩展与长上下文需求增长,端侧大模型在 prefill / decoding 时延、工程链路复杂度、模型迭代周期上面临多重约束。本次分享围绕 OPPO 端侧化全栈实践,介绍以 QAT 量化感知训练 为核心的协同训练体系,覆盖稀疏化压缩、长上下文 Cache Eviction、解码加速训练,并结合 QALFT 自动化工程化 与 0 阶端侧训练,打通从模型压缩、编译部署到垂域落地与本地个性化的完整链路。
演讲提纲
- 端侧大模型的核心挑战
- 推理效率瓶颈:长上下文场景下,prefill 与 decoding 时延显著上升
- 工程链路复杂:端侧化涉及 训练压缩 → 量化校准 → 编译部署 → 业务集成,链路长、协作成本高
- 模型迭代与个性化难覆盖:端侧模型版本迭代周期长,难以快速响应业务变化,用户个性化需求很难满足
- 多模态大模型端侧化工程实践:全栈链路设计
- 端侧化系统架构:打通模型压缩 → 编解码加速 → 编译部署 → 应用集成 → 端侧个性化迭代的全链路技术栈
- 技术建设
- 模块化 QAT 训练架构
- 将 sparse 训练、Eviction-aware QAT、解码加速训练等能力模块化接入同一训练框架
- 支持从 prefill 到 decoding 的全链路协同优化,而非单点优化
- QALFT 工程化架构:自动化交付
- 工程化痛点:端侧大模型落地常面临 PTQ 量化 + QALFT 微调 流程复杂、平台差异大、人工环节多
- QALFT自动化流水线:覆盖数据准备 → PTQ/QAT → QALFT → 精度校验 → 性能 profiling等全链路环节,支持 MTK、高通等多硬件平台的统一训练与差异化输出
- 端侧训练:0 阶优化
- 利用稀疏扰动等技术显著提升0阶优化性能
- 在隐私约束下,完成用户侧轻量适配,满足用户个性化需求,同时避免重成本端侧模型迭代
- 应用场景与展望
- 应用场景
- 垂域业务交付:端侧模型覆盖10余垂域场景业务
- 端侧化SOP快速复制:支持端侧Agent能力快速迭代
- 未来展望
- 更长上下文下的高效注意力与 KV Cache 管理
- 更低存储与带宽开销,比如低比特量化训练等
- 端侧多模态理解与 Agent 规划能力的统一优化
- 结语
- 端侧大模型的规模化落地,依赖 算法、工程、系统 三者的协同共振:以 QAT 协同训练打通模型压缩、长上下文与解码加速;以 QALFT 自动化缩短跨平台交付周期;以 0 阶端侧训练 满足个性化与隐私需求。面向更长上下文、更低功耗与更高隐私的端侧智能,关键不在单点突破,而在全链路工程化能力的持续升级。
这样的技术在实践过程中有哪些痛点?
- 成本高(端侧算力、存储与带宽预算紧张,长上下文推理成本陡增)
- 量化与效果之间的权衡(BPV极致压缩对 IO 与精度的双重约束)
- 多片商、多平台适配复杂度高
- Cache Eviction、投机解码与训练目标的对齐难度大
听众收益
- 算法融合系统(混合注意力架构 + 量化感知训练 + Cache Eviction + 投机解码端到端协同)
- 端侧训练的高性能实践
- 端侧 Agent 系统架构实践