毕业于北京大学计算机系,曾就职于网易互动娱乐事业部,从事广告算法研究,参与了第一代广告算法平台的搭建。目前就职于 BIGO,从事计算机视觉、自然语言处理等技术的研究和落地,研究成果应用于公司全球各个业务线中,其中审核技术已经成熟并提供 ToB 服务。
在算法领域,不同模态的数据例如图片、语音、自然语言处理,在很长的时间里都是相互独立的,例如独立的数据集、模型结构、预训练模型、训练过程等。近年来有越来越多的工作开始研究“多模态”模型,例如推荐系统里把图像、语言等特征信息与用户行为信息进行融合,OpenAI 更是推出了图像-文本联合训练模型 CLIP。
本次演讲首先简单介绍多模态模型技术的一些典型工作及,然后结合 BIGO 中的内容安全中图片审核的业务场景,阐述如何利用大规模业务数据进行多模态模型的训练,以满足多种审核场景的需求。最后讲总结实践过程多模态模型优点、遇到的问题、以及未来改进的一些想法。
演讲提纲:
你将获得:了解如何最大限度的利用海量图像、语音、文本数据,来解决业务难题。



电话咨询