目前是智源人工智能研究院数据研究组的负责人,曾负责 FlagAI 这一开源项目,还主导开发了悟道天鹰(Aquila)系列语言大模型、AltCLIP/AltDiffusion 多语言多模态系列模型,以及 Infinity Instruct/MM 千万指令数据集系列以及 CCI3.0 中文语料库等重要项目。在人工智能领域的顶级学术会议和国际学术期刊上发表了多篇论文。目前,正专注于基于大模型的数据合成技术的研究与应用,致力于推动该领域的技术进步和创新。

目前是智源人工智能研究院数据研究组的负责人,曾负责 FlagAI 这一开源项目,还主导开发了悟道天鹰(Aquila)系列语言大模型、AltCLIP/AltDiffusion 多语言多模态系列模型,以及 Infinity Instruct/MM 千万指令数据集系列以及 CCI3.0 中文语料库等重要项目。在人工智能领域的顶级学术会议和国际学术期刊上发表了多篇论文。目前,正专注于基于大模型的数据合成技术的研究与应用,致力于推动该领域的技术进步和创新。
Aquila-VL-2B 是 2B 级别 SOTA 的多模态模型。该模型基于 Llava-onevision 的训练思路,引入多分辨率来提升对图像内容的理解。在本次分享中,主要介绍了模型数据集的构建和处理过程,包括多种数据来源数据的格式统一以及数据选择,针对弱项的数据合成等。此外,还讨论了对训练效率和框架的提升,在 FlagScale 框架上实现了相对 Deepspeed 训练效率 1.7 倍的提升。Aquila-VL-2B 的创新之处在于系统化的构建了多模态模型的数据,训练以及评测的 pipline。
演讲提纲:
听众收益:



微信咨询

电话咨询
领取往期热门演讲视频

