Skip to content

Latest commit

 

History

History
51 lines (30 loc) · 2.96 KB

File metadata and controls

51 lines (30 loc) · 2.96 KB

GEMM

词条类别:量化基础概念(量化模式)
英文名称:GEMM(General Matrix Multiply)
应用领域:线性层计算、推理加速

1. 概述

GEMM(General Matrix Multiply,通用矩阵乘法)即矩阵乘 $C=A\times B$,是 Transformer 中占比最高的一类基本运算。除线性层的 $Y=X\cdot W$ 外,Flash Attention 中的 $QK^{\top}$ 与注意力加权 $PV$ 同样是矩阵乘,都会归结为 GEMM。量化使 GEMM 能以整数/低精度输入运行,是量化的主要计算收益来源。


2. 词条介绍

2.1 定义

GEMM 是 $C=A\times B$ 形式的通用矩阵乘法。Transformer 里至少两类计算会归结为 GEMM:一类是线性层,例如 Q/K/V 投影、注意力输出投影和 MLP 各层的 $Y=X\cdot W$;另一类是注意力内部的矩阵乘,例如 FA 量化 所覆盖的 $QK^{\top}$ 与注意力加权 $PV$。因此 GEMM 并不等同于线性层,线性层只是 GEMM 的一种应用。

2.2 整数 GEMM

整数 GEMM(Integer GEMM)指输入为低精度整数,并在低精度整数域进行乘累加的矩阵乘运算,例如输入为 INT8 或 INT4。权重与激活都量化成整数后,全程整数计算,结果再乘回 scale 还原。整数 GEMM 可调用专用低精度算子,是量化的主要计算收益来源。

若只有一侧量化(如 W8A16 静态量化),则需把整数反量化回浮点再做浮点 GEMM,没有整数 GEMM 的加速。

2.3 与量化的关系

  • 前提是量化与反量化:权重与激活都量化成整数,才能进入整数域计算。
  • 数据类型的选取(INT8、FP8、MXFP8/MXFP4)决定整数/低精度 GEMM 的硬件算子与精度表现。

3. 关联流程


4. 关联词条


5. 参考文档

  1. 《量化模式》