大模型推理是指利用深度学习等技术构建的大模型进行数据处理和分析的过程,特别是在自... 展开 >





阿里云人工智能平台 PAI 负责人,主攻大规模分布式训练加速、编译优化、大数据计算、分布式系统等技术工程建设和性能优化。具有 18 年的系统架构设计及研发经验,并在国际一流 ODSI、NSDI、SIGMOD 会议上多次发表论文。原微软大数据平台组的核心成员,曾在微软亚洲研究院和微软美国工作 10 年。
大模型推理是指利用深度学习等技术构建的大模型进行数据处理和分析的过程,特别是在自然语言处理(NLP)领域,通过训练算法让大模型在海量数据中进行有效的文本处理和分析。随着人工智能技术的发展,大模型推理在多个领域展现出广泛的应用潜力,如智能客服、信贷审批过程中的业务智能化程度提升等。
为了提高大模型推理的效率和性能,业界采取了多种优化技术。这些技术主要包括计算加速、模型压缩、混合精度训练、分布式训练等。计算加速主要通过改进算法和硬件利用率来实现,旨在让模型“算得更快”,而不影响输出质量。模型压缩则是通过改变模型结构,减少部分计算来达到优化目的。此外,混合精度训练和分布式训练等技术也被广泛应用于大模型的训练和推理过程中,以提高训练速度和效率,本专题邀请技术专家为你分享他们的大模型推理加速的经验。
自 OpenAI 发布 ChatGPT 起,大语言模型的惊艳效果吸引了越来越多的人和资本关注到该领域,近年模型本身的参数量和序列长度也呈指数级增长,要面对的算力瓶颈问题接踵而至。本次分享将结合大模型的的算力需求和模型结构,详细介绍零一万物在构建 Yi 模型在线推理服务过程中所运用的优化技术手段,并就此展开讨论。
演讲提纲:
听众收益:
大模型在线服务部署在场景特性、资源规模和性能指标等方面对引擎框架等 AI 基础设施建设提出了更高更复杂的要求,阿里云人工智能平台 PAI 基于模型系统优化的技术积累和实践经验,面向大模型场景构建了 BladeLLM 高性能部署框架。BladeLLM 结合量化压缩、AI 编译、高性能算子与调度、以及分布式可扩展性等技术,为大模型在线部署场景提供了多层次联合的极致性能优化方案,并且能兼容大模型主流生态,提供灵活易用的接口,具备规模化生产应用的完备性和可靠性。
演讲提纲:
听众收益:
演讲提纲:
随着生成式 AI 的快速发展,模型的规模在逐步增大,其结构也从 Dense 向 MoE 进化。经过 1~2 年的发展,国产大模型都取得了不错的效果。接下来就到了大模型落地应用产生工业价值的时候,这时大模型应用的性能、吞吐、成本逐步成为大家关注的焦点。腾讯太极机器学习平台常年关注 AI 模型高效落地应用,我们在大模型领域研发了 Angel-HCF 推理框架和 Angel-SNIP 压缩框架,为混元文生文、文生图、文生视频、多模态等 AI 生成领域提供全方位的优化支撑,助力腾讯混元大模型在公司内全面铺开应用。
演讲提纲:
听众收益:



微信咨询

电话咨询
微信联系我们

