研究方向聚焦计算机视觉与人工智能领域,涵盖生成式AI、目标检测、图像分割、人体关键点估计、人体动作识别及三维重建等方向。2014 年于南洋理工大学(NTU)获得博士学位,师从黄俊松教授(Prof. Junsong Yuan)。此前曾在腾讯担任研究总监四年,并在旷视科(Face++)工作五年。

研究方向聚焦计算机视觉与人工智能领域,涵盖生成式AI、目标检测、图像分割、人体关键点估计、人体动作识别及三维重建等方向。2014 年于南洋理工大学(NTU)获得博士学位,师从黄俊松教授(Prof. Junsong Yuan)。此前曾在腾讯担任研究总监四年,并在旷视科(Face++)工作五年。
随着以 Next-token prediction 为代表的大模型技术迅猛发展,其应用已从单一语言模型快速拓展至多模态领域。本次分享将以语言模型为切入点,系统介绍多模态场景下生成与理解技术的演进脉络,重点围绕语音、图像两大模态,探讨前沿多模态模型的架构设计思路,并展望未来核心研究方向。
演讲提纲:
听众收益:
了解多模态生成和理解的前沿进展



微信咨询

电话咨询
微信联系我们

