大规模预训练模型进展

会议室:宴会厅B
出品人:张伟(览图)博士

BERT、GPT等大规模预训练模型近来取得了巨大成功,在 AI 领域获得了大量关... 展开 >

专题出品人:张伟(览图)博士

前阿里巴巴资深算法专家

张伟(览图),博士毕业于新加坡国立大学。前阿里巴巴业务平台资深算法专家,阿里巴巴商品知识图谱负责人,负责业务中台数据智能部门,是中文信息学会语言与知识计算委员会委员。曾任职新加坡资讯通信研究院研究员。研究领域:知识图谱、自然语言处理,机器学习等。论文发表在 AAAI、EMNLP、IJCAI、WWW 等顶级学术会议,同时担任 TACL 杂志常驻审稿人。

地点:宴会厅B

专题:大规模预训练模型进展

BERT、GPT等大规模预训练模型近来取得了巨大成功,在 AI 领域获得了大量关注,由于其复杂的预训练目标和庞大的模型参数,大规模预训练模型可以有效的从大量标记和未标记的数据中捕获知识。本专题将介绍预训练模型在语言、视觉、语音和多模态方面的最新进展,分享在自然语言理解、计算机视觉以及语音语义等领域的实践案例。

by 封江涛

字节跳动
AILab 研究员

文本生成是自然语言处理的重要方向之一,很多关键的下游任务包括机器翻译,人机对话,自动问答等都依赖文本生成技术。当前主流的文本生成模型主要遵循自左至右的生成范式,并使用Transformer 来参数化,在实践中取得了不错的效果。但是自左至右的自回归式生成会带来每个位置生成时互相等待,效率下降的问题。为此有研究者提出了并行(非自回归)文本生成技术,在损失生成准确率的前提下大大提高了生成的效率。

本次演讲将介绍字节跳动在大规模文本生成技术方面的探索,深入讨论高效且不损失精度的并行文本生成技术是否可行,并且尝试从理论和实践两个角度给出一些初步结果。

演讲提纲

  1. 背景介绍:自回归生成 vs 并行生成
  2. Glancing Transformer 具体内容介绍
  3. GLAT 在 WMT21 中的表现
  4. GLAT 在火山翻译的上线情况

你将获得:

  1. 了解生成模型的前沿进展
  2. 熟悉并行生成模型的理论和实践
  3. 了解在大规模线上系统中并行生成模型的具体效果以及应用场景

by 张杰

阿里巴巴
高级技术专家

最近,阿里巴巴并联合清华大学等共同开发了全球最大规模的中文多模态预训练模型 M6(MultiModality-to-MultiModality Multitask Mega-transformer)。模型参数超1万亿规模,借助 PAI 自研的分布式训练框架 Whale,首次2天内在496 GPU卡上完成M6模型1亿图文样本的预训练。

相比于非纯文本或者纯图像预训练模型,多模态预训练模型数据挑战更大、模型训练难度更高、下游覆盖的应用场景更广泛。从学术研究的角度来讲,跨模态的理解和生成和人类认知也有着千丝万缕的联系(语义对齐、语言/视觉控制),对其更加深入的研究或许能使我们往AGI的路上向前再迈一小步。而从业界的视角来讲,多模态预训练模型不仅可以应对文本和图像各自领域的任务,还可以用于大量需要跨模态理解&生成的应用场景,而这些场景在阿里复杂的生态体系中,往往蕴藏着不可忽视的商业价值。我们可以借助m6模型的通用知识基础,让下游业务能使用较少的样本数,来达到比较好的业务效果。

工程训练框架方面,万亿多模态预训练模型的提出对于当前的深度学习框架提出来很多挑战。这些挑战包括模型计算效率的挑战、模型分布式训练性能的挑战、数据IO的挑战、模型训练收敛性的挑战等。针对这些挑战,PAI团队自研Whale分布式训练框架,在多个方面进行了深度优化。从而可以帮助千亿、万亿多模态预训练模型能够快速迭代训练。Whale分布式训练框架基于Graph IR,针对数据并行、模型并行、流水并行、混合并行等多种并行模型进行了统一架构设计,并对用户提供并行策略原语,用户在仅仅添加几行API调用的情况下就可以实现丰富的分布式并行策略。同时Whale中实现了包括自动Gradient Checkpointing、Optimizer峰值显存优化、通信分组和线程池技术、混合精度、编译优化等优化技术。算法同学不需要修改模型代码,只需添加简单几行的API调用就可以快速构建高效的分布式训练任务。

演讲提纲:

  1. Whale 分布式训练框架介绍
  2. 借助 Whale 高效训练超大规模模型的方法
  3. 超大规模模型预训练的挑战
  4. 解决思路:
    • 对于超大规模模型 M6,采用 Whale 的数据并行+模型并行的分布式策略进行训练
    • 结合MoE 结构来优化超大模型对算力的需求,并通过计算、显存、通信优化来提高分布式训练效率
  5. 经验总结

你将获得:

  1. 了解深度学习各种并行训练模式;
  2. 了解超大规模模型预训练的挑战和解决方案;
  3. 了解 M6 模型和高效分布式训练方法。

by 陈德健

BIGO
Aestron安思创 / AI算法架构师

在算法领域,不同模态的数据例如图片、语音、自然语言处理,在很长的时间里都是相互独立的,例如独立的数据集、模型结构、预训练模型、训练过程等。近年来有越来越多的工作开始研究“多模态”模型,例如推荐系统里把图像、语言等特征信息与用户行为信息进行融合,OpenAI 更是推出了图像-文本联合训练模型 CLIP。

本次演讲首先简单介绍多模态模型技术的一些典型工作及,然后结合 BIGO 中的内容安全中图片审核的业务场景,阐述如何利用大规模业务数据进行多模态模型的训练,以满足多种审核场景的需求。最后讲总结实践过程多模态模型优点、遇到的问题、以及未来改进的一些想法。

演讲提纲:

  1. 多模态技术典型工作介绍
  2. 内容安全的应用场景与挑战
  3. 多模态模型在内容安全中的训练方法简介
  4. 多模态模型总结及未来工作展望

你将获得:了解如何最大限度的利用海量图像、语音、文本数据,来解决业务难题。

  • 电话咨询

    联系电话:+86 13269078023
在报名过程中如有任何问题,欢迎微信扫描二维码联系我们的票务经理