Definition
Representing model weights or activations with lower numerical precision to reduce memory, storage, or inference cost.
Distinguish it from nearby terms
Quantization changes numerical representation; distillation trains a different model to imitate behavior.
Check your understanding
Lower precision can trade small quality losses for major deployment efficiency gains.