INT8 quantisation
AIINT8 quantisation: Storing model weights, and sometimes activations, as 8-bit integers instead of 16- or 32-bit numbers, cutting memory use with little loss of accuracy.
INT8 quantisation: Storing model weights, and sometimes activations, as 8-bit integers instead of 16- or 32-bit numbers, cutting memory use with little loss of accuracy.