Volver a Aprende/Infraestructura
Reducción de la precisión numérica de un modelo para disminuir memoria y acelerar inferencia, con pérdida controlada de calidad.
Un modelo se distribuye con cierta precisión numérica por parámetro. La cuantización reduce esa precisión —por ejemplo de 16 bits a 4 bits— con lo que el modelo ocupa menos memoria y ejecuta más rápido.
La contrapartida es una posible pérdida de calidad, que depende del modelo, de la técnica y de la tarea. Dos implementaciones del mismo modelo con cuantizaciones distintas pueden comportarse de forma muy diferente.
Por eso la cuantización es una variable de diseño, no un detalle: forma parte de la decisión de si un modelo determinado es viable en un hardware determinado.