专题演讲嘉宾:刘广

智源研究院技术经理

目前是智源人工智能研究院数据研究组的负责人,曾负责 FlagAI 这一开源项目,还主导开发了悟道天鹰(Aquila)系列语言大模型、AltCLIP/AltDiffusion 多语言多模态系列模型,以及 Infinity Instruct/MM 千万指令数据集系列以及 CCI3.0 中文语料库等重要项目。在人工智能领域的顶级学术会议和国际学术期刊上发表了多篇论文。目前,正专注于基于大模型的数据合成技术的研究与应用,致力于推动该领域的技术进步和创新。

by 刘广

智源研究院
技术经理

Aquila-VL-2B 是 2B 级别 SOTA 的多模态模型。该模型基于 Llava-onevision 的训练思路,引入多分辨率来提升对图像内容的理解。在本次分享中,主要介绍了模型数据集的构建和处理过程,包括多种数据来源数据的格式统一以及数据选择,针对弱项的数据合成等。此外,还讨论了对训练效率和框架的提升,在 FlagScale 框架上实现了相对 Deepspeed 训练效率 1.7 倍的提升。Aquila-VL-2B 的创新之处在于系统化的构建了多模态模型的数据,训练以及评测的 pipline。

演讲提纲:

  1. 多模态模型挑战 
    • 缺乏大规模高质量开源数据 
  2. Aquila-VL-2B效果 
    • SOTA性能展示 
    • 推理能力分析
  3. 流程概览 
    • 架构与思路 
    • 训练关键步骤
  4. 数据处理 
    • 格式统一与数据选择 
    • 数据合成技术
  5. 模型训练 
    • 多分辨率理解 
    • 训练效率提升
  6. 效果评估 
    • 量化评估方法 
  7. 总结与展望

听众收益:

  • 多模态数据集构建以及数据合成的先进方法
  • SOT A多模态模型的训练方法

交通指南

北京丰大国际大酒店

Beijing Fengda International Hotel
地址:北京市大兴区荣华中路20号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手