负责蔚来语音信号处理、语音识别、DMS/OMS视觉算法和多模态大模型等技术研发和交付工作。从事AI人机交互算法研发十余年,在语音交互算法、音视频结合的多模态算法方面有丰富的研发经验。目前专注于基于端侧多模态大模型的新一代智能座舱交互系统的研发工作。

负责蔚来语音信号处理、语音识别、DMS/OMS视觉算法和多模态大模型等技术研发和交付工作。从事AI人机交互算法研发十余年,在语音交互算法、音视频结合的多模态算法方面有丰富的研发经验。目前专注于基于端侧多模态大模型的新一代智能座舱交互系统的研发工作。
从2023年6月开始,蔚来座舱智能化团队开始研发面向智能座舱应用场景的多模态大模型的技术预研工作,经过1年多的系统搭建、数据集构建和训练部署方案的实践,取得了一些技术进展和一定的多模态大模型的应用认知。分享包括对于车载场景的算法适配的训练流程、数据采集筛选和清洗方法、多分辨率以及多VIT encoder的模型改进方法、端侧部署的具体实践情况。同时作为多模态模型的一部分也会简要介绍在语音大模型方面的一些最新进展。本次分享主要涉及多模态大模型技术落地车载场景的业务实践和技术挑战。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

