面向多种算力平台的大模型量化推理优化技术

所属专题:大模型推理优化与边缘 AI 部署

嘉宾 : 汤雄超 | 清程极智 CEO

会议室 : 汉宫 + 明宫

讲师介绍

专题演讲嘉宾:汤雄超

清程极智 CEO

2019年博士毕业于清华计算机系。主要研究领域为性能分析及性能优化、并行计算、异构计算、集群资源调度等。发表CCF-A类论文十余篇,申请发明专利十余项。

议题介绍

演讲:面向多种算力平台的大模型量化推理优化技术

在大模型加速落地的同时,异构算力和精度演进让推理在性能、成本以及国产算力适配上压力陡增。本演讲聚焦「量化推理 + 多算力平台适配」,介绍赤兔如何通过「算法 + 引擎 + 算子」联合优化及 Soft Float8→软 FP4 等技术,在国产 GPU/NPU/CPU 上实现通用高效推理。

演讲提纲:

  1. 行业背景与核心挑战
    • 大模型时代的算力需求爆发与多样性算力平台现状
    • 大模型推理在多算力平台上面临的性能、成本、适配性痛点
      • 硬件异构化(GPU、NPU、DCU、CPU 并存)
      • 精度与性能的平衡(FP16 → FP8 → FP4)
      • 推理系统复杂化与工程门槛高
  2. 核心概念解析:量化推理与多算力平台适配
    • 大模型量化推理技术定义(如INT8、INT4等)
    • 主流算力平台的架构差异与对量化推理的技术要求
  3. 赤兔量化推理优化技术
    • 赤兔的起点:构建「国产算力 + 国产引擎 + 国产模型」闭环
      • 背景:海外主流推理引擎(vLLM、SGLang、Ollama)高度依赖 NVIDIA 生态,国产算力适配困难。
      • 赤兔选择从「联合优化」出发
        • 算法 + 推理引擎 + 算子 联合优化,突破 CUDA native 限制
        • 支持昇腾、沐曦、海光、鲲鹏、燧原等多平台
      • “m×n 优化爆炸” 到 “m+n 复用” 的设计
    • FP8 原生支持到多平台软 FP4 扩展
      • 赤兔 Soft Float8 在线转换机制
      • FP8 方案扩展至 FP4
  4. 赤兔推理引擎的技术架构与创新点
    • 面向多算力平台的模块化设计:算力抽象层、量化优化层、推理执行层
    • 量化推理优化的核心技术路径优势
  5. 跨平台优化与工程设计
    • Layout as a Type
    • 融合算子分发机制
    • 混合 KV Cache 管理
    • 多并行模式支持(EP+DP+TP+PP)
  6. 典型场景与行业应用案例
  7. 未来方向

听众收益:

  1. 全面了解大模型量化推理在多算力平台上的趋势与技术要点,弄清楚 FP8/FP4、异构算力等对性能、成本、适配性的真实影响
  2. 获得一套可迁移的工程优化思路,借鉴赤兔在「算法 + 引擎 + 算子」联合优化、Soft Float8 / FP4 以及多并行模式上的实践

交通指南

北京石景山万达嘉华酒店

Wanda Realm Beijing
地址:北京市石景山区石景山路甲18号院
  • 微信咨询

  • 电话咨询

    联系电话:13269078023

领取往期热门演讲视频

领取往期热门演讲视频二维码
如您在购票过程中遇到问题,请扫码咨询票务小助手