From Imitation to Emergence:The Journey of Alignment for LLMs

所属专题:大模型训练

嘉宾 : 阎栋 | 百川智能强化学习负责人

会议室 : 会议室 4+5

讲师介绍

专题演讲嘉宾:阎栋

百川智能强化学习负责人

博士毕业于清华大学计算机系。主要从事决策算法 / 系统和大语言模型对齐方面的研究。在算法方面,提出了通过奖励分配机制连接无模型和基于模型的强化学习算法的求解框架。在系统方面,作为架构师设计的强化学习编程框架“天授”,在 Github 获得超过 7.4k 星标 /1.1k 二次开发。在 ICLR、ICML、IJCAI、AAAI、JMLR、Pattern Recognition 等会议 / 期刊发表论文十余篇。带领团队基于 RLHF 增强的大语言模型 Baichuan3,在 4 月份的 Superclue 评测中荣获国内第一。

议题介绍

地点:会议室 4+5
所属专题:大模型训练

演讲:From Imitation to Emergence:The Journey of Alignment for LLMs

大语言模型的对齐技术在过去两年中迅速发展。除了 InstructGPT 所采用的 Supervised Fine Tuning 和 Reinforcement Learning with Human Feedback 方式之外,Rejection Sampling、Direct Preference Optimization、Identity-Preference Optimization 等方法纷纷涌现,为各种目标和条件下的行业落地提供了丰富的工具。但想要用好这些对齐工具,不仅需要对了解各种方法的底层数学原理,而且需要辅以坚实的工程支持。本次分享从对齐技术的理论图景开始,深入对齐技术的工程实践进行讨论,以展望对齐技术的未来收尾。通过对对齐技术全景式的回顾和讨论,帮助听众了解对齐技术的挑战并在业务场景落地。

演讲提纲:

  1. Theoretical Landscape of Alignment
  2. Practical Data-Centric Process
  3. Scaleable Oversight and Beyond

听众收益:

  • 了解大语言模型对齐技术的全景和最新前沿
  • 了解百川智能在RLHF技术上的落地实践

交通指南

北京乐多港万豪酒店

Beijing Marriott Hotel Changping
地址:北京市昌平区南口路29号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

微信联系我们

如您在购票过程中遇到问题,请扫码咨询票务小助手