Quantization (AI)

IA & ML · Abismo

Uma técnica de compressão de modelos que reduz a precisao dos pesos (por exemplo, de 16 bits para 4 bits) para diminuir o tamanho do modelo e o custo de inferencia, preservando a maior parte da qualidade. Tres formatos dominantes em 2024-2025: GGUF (formato flexivel CPU/GPU para llama.cpp), GPTQ (quantizacao pos-treinamento otimizada para GPU) e AWQ (quantizacao de pesos ciente da ativacao). Todos mantem qualidade dentro de ~6% da precisao total em 4 bits.

Termos relacionados