在大模型加速落地的同时,异构算力和精度演进让推理在性能、成本以及国产算力适配上压力陡增。本演讲聚焦「量化推理 + 多算力平台适配」,介绍赤兔如何通过「算法 + 引擎 + 算子」联合优化及 Soft Float8→软 FP4 等技术,在国产 GPU/NPU/CPU 上实现通用高效推理。
演讲提纲:
- 行业背景与核心挑战
- 大模型时代的算力需求爆发与多样性算力平台现状
- 大模型推理在多算力平台上面临的性能、成本、适配性痛点
- 硬件异构化(GPU、NPU、DCU、CPU 并存)
- 精度与性能的平衡(FP16 → FP8 → FP4)
- 推理系统复杂化与工程门槛高
- 核心概念解析:量化推理与多算力平台适配
- 大模型量化推理技术定义(如INT8、INT4等)
- 主流算力平台的架构差异与对量化推理的技术要求
- 赤兔量化推理优化技术
- 赤兔的起点:构建「国产算力 + 国产引擎 + 国产模型」闭环
- 背景:海外主流推理引擎(vLLM、SGLang、Ollama)高度依赖 NVIDIA 生态,国产算力适配困难。
- 赤兔选择从「联合优化」出发
- 算法 + 推理引擎 + 算子 联合优化,突破 CUDA native 限制
- 支持昇腾、沐曦、海光、鲲鹏、燧原等多平台
- “m×n 优化爆炸” 到 “m+n 复用” 的设计
- FP8 原生支持到多平台软 FP4 扩展
- 赤兔 Soft Float8 在线转换机制
- FP8 方案扩展至 FP4
- 赤兔推理引擎的技术架构与创新点
- 面向多算力平台的模块化设计:算力抽象层、量化优化层、推理执行层
- 量化推理优化的核心技术路径优势
- 跨平台优化与工程设计
- Layout as a Type
- 融合算子分发机制
- 混合 KV Cache 管理
- 多并行模式支持(EP+DP+TP+PP)
- 典型场景与行业应用案例
- 未来方向
听众收益:
- 全面了解大模型量化推理在多算力平台上的趋势与技术要点,弄清楚 FP8/FP4、异构算力等对性能、成本、适配性的真实影响
- 获得一套可迁移的工程优化思路,借鉴赤兔在「算法 + 引擎 + 算子」联合优化、Soft Float8 / FP4 以及多并行模式上的实践