智谱大模型训练基础设施落地实践

所属专题:大模型智算与开发落地实践

嘉宾 : 曾奥涵 | 智谱 AI GLM 模型预训练 & 基础设施负责人

会议室 : 百乐园

讲师介绍

专题演讲嘉宾:曾奥涵

智谱 AI GLM 模型预训练 & 基础设施负责人

基础设施方面,领导构建了智谱多云混合体系下的大模型训练基础设施及机器学习平台。模型方面,作为技术负责人领导了 GLM-130B、ChatGLM、GLM-4 (All Tools)、GLM-4-Plus 等模型及系统的研发,相关产品上线于智谱清言(ChatGLM.cn)及大模型开放平台(BigModel.cn)上。主导开源了 ChatGLM-6B/ChatGLM2-6B/ChatGLM3-6B/GLM-4-9B/GLM-4-Voice 等模型,在开源社区 Hugging Face 上获得了超过一千万的下载量。

议题介绍

演讲:智谱大模型训练基础设施落地实践

智谱 GLM 技术团队专注于面向通用人工智能(AGI)的基础模型研发,早在 2022 年就训练并开源了媲美 GPT-3 性能的中英双语预训练模型 GLM-130B,后续发布的 ChatGLM 开源模型系列在 Hugging Face 社区上获得了超过一千万的下载量;2024 年 8 月,GLM 团队发布的旗舰模型 GLM-4-Plus 在 9 月的 SuperBench 大模型评测中位列世界前三。

智谱这些模型展现出来的卓越性能离不开海量互联网数据和算力训练。与此同时,大语言模型的兴起给训练基础设施带来全新的挑战,包括对算力、大规模数据处理量、复杂的系统管理等需求。针对自身的特定需求,我们从零开始构建了一套大模型原生的训练基础设施。针对大规模训练稳定性、多算力集群数据流转、平台易用性等进行了一些优化,本次演讲将分享平台构建中的经验与心得体会。

演讲提纲:

  1. 大模型时代的算力需求和平台特征 
    • 算力基础设施概述
    • 大模型训练流程介绍
    • 现有开源工具对比
  2. GLM 训练基础设施的挑战与演进历程
    • 易用性挑战
    • 资源管理挑战
    • 多云异构挑战
  3. 大模型原生训练基础设施的系统设计
    • 核心功能抽象
    • 核心资产抽象
    • 训练稳定性保障措施
    • 多云架构下存储的复杂度管理 
  4. 总结展望

听众收益:

  • 了解构建大模型原生基础设施的关键技术和挑战

交通指南

北京丰大国际大酒店

Beijing Fengda International Hotel
地址:北京市大兴区荣华中路20号
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手