10年人工智能、搜推等工作经验,丰富的AI人工智能和大数据的产品研发经历,实施与落地多个大型的政企类项目。目前负责阿里云行业大模型智算产品的研发,打造大模型相关的大规模数据处理、高性能分布式并行训练和推理等核心技术,加速推动大模型落地应用。

10年人工智能、搜推等工作经验,丰富的AI人工智能和大数据的产品研发经历,实施与落地多个大型的政企类项目。目前负责阿里云行业大模型智算产品的研发,打造大模型相关的大规模数据处理、高性能分布式并行训练和推理等核心技术,加速推动大模型落地应用。
模型量化通过降低权重精度减少计算量与内存占用,加速推理过程并降低能耗,对于提升大模型在资源受限设备上的部署效率至关重要。以往 PTQ 量化方法忽略不同层权重对量化精度的敏感性,且在超低比特量化下(2-3位)精度损失严重,论文针对这两个问题,提出 AMLQ( Adaptive Mixed precision and Low-rank Quantization error reconstruction) 量化方法,极大减少模型量化的精度损失,并提高推理速度。量化方案详情可参考:https://openreview.net/pdf?id=T5pGDydMkS
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

