阿里巴巴算法专家,主要从事大模型相关的算法研究及训练工作,对于强化学习在大模型中的应用有多年研究及实际工作经验。参与过阿里巴巴多个大模型的人类反馈强化学习,推理模型的算法设计及实际训练,了解超大规模强化学习系统设计,对于大规模大语言模型的算法及系统协同设计有一定积累。

阿里巴巴算法专家,主要从事大模型相关的算法研究及训练工作,对于强化学习在大模型中的应用有多年研究及实际工作经验。参与过阿里巴巴多个大模型的人类反馈强化学习,推理模型的算法设计及实际训练,了解超大规模强化学习系统设计,对于大规模大语言模型的算法及系统协同设计有一定积累。
强化学习作为推动大语言模型进一步提升智能程度的手段,一直是大语言模型训练环节中最核心且复杂的环节。其中的复杂度不仅仅体现在其算法方面,也体现在其系统的整体要求上,本次分享从传统的 RLHF 系统开始,结合算法实践展示出 RL 系统的现状及发展脉络。通过具体的实践,与从业者共同探讨未来超大规模 RL 的发展方向,分享内容既包括理论基础,也包含业界实践,最后开源生态及社区共建也会涉及。
演讲提纲:
理论基础
传统系统架构
发展脉络
核心算法挑战
实践案例
系统架构升级
阿里巴巴、字节等的业界实践
系统规模化
理论开放问题
从 RLHF 到超大规模 RL 系统,技术演进需算法创新、工程极致与生态协作三者共振。未来的智能突破,或许始于今日的开源开放与跨领域共创。
您认为,这样的技术在实践过程中有哪些痛点?
成本高
您的演讲有哪些前沿亮点?
算法融合系统



微信咨询

电话咨询
微信联系我们

