博士毕业于清华大学计算机系。主要从事决策算法 / 系统和大语言模型对齐方面的研究。在算法方面,提出了通过奖励分配机制连接无模型和基于模型的强化学习算法的求解框架。在系统方面,作为架构师设计的强化学习编程框架“天授”,在 Github 获得超过 7.4k 星标 /1.1k 二次开发。在 ICLR、ICML、IJCAI、AAAI、JMLR、Pattern Recognition 等会议 / 期刊发表论文十余篇。带领团队基于 RLHF 增强的大语言模型 Baichuan3,在 4 月份的 Superclue 评测中荣获国内第一。





