1. INT8 量化(对称/非对称)与 FP16/BF16 训练的精度差异是什么,量化误差如何用校准集评估?
INT8 量化(对称/非对称)与 FP16/BF16 训练的精度差异是什么?量化误差如何用校准集评估?
- 对称与非对称 INT8 量化的原理与差异
- 量化与低精度运算的精度差异
- 校准集评估量化误差的方法
INT8 量化用于推理,把权重/激活从 FP32 映射到 8 位整数。对称量化用 scale = max/127 映射到 [-127,127],零点为 0;非对称量化用 scale=(max-min)/255 并引入零点 z,能更好表示分布偏斜的数据、减少量化误差。FP16/BF16 是训练用的低精度浮点,保留动态范围与相对精度,精度损失远小于 INT8。量化误差用校准集(代表性输入子集)评估:前向比较量化前后输出(如 KL 散度、cosine 相似度、误差分布),选择最小化误差的 scale/zp,或评估量化后模型的精度/损失坍缩。INT8 精度下降主要来自尾数信息丢失与分布范围截断,非对称量化对非对称分布更友好。
对称量化适合零中心对称分布,非对称量化通过零点覆盖偏斜分布,减量化误差;校准集用于在真实数据分布上衡量量化对输出/精度的破坏,是量化参数选择与效果评估的核心。