Quantization (AI)

IA & ML · Abismo

Una técnica de compresión de modelos que reduce la precision de los pesos (p. ej., de 16-bit a 4-bit) para disminuir el tamano del modelo y el costo de inferencia mientras preserva la mayor parte de la calidad. Tres formatos dominantes en 2024-2025: GGUF (formato flexible CPU/GPU para llama.cpp), GPTQ (cuantizacion post-entrenamiento optimizada para GPU) y AWQ (cuantizacion de pesos consciente de activaciones). Todos mantienen la calidad dentro de ~6% de la precision completa a 4-bit.

Términos relacionados