Inference

IA & ML · Profundo

El proceso de ejecutar un modelo entrenado sobre nuevas entradas para generar predicciones o salidas. La inferencia es la fase de 'uso' (vs. entrenamiento). El costo de inferencia depende del tamano del modelo, el conteo de tokens de entrada/salida y el hardware (GPUs/TPUs). Los proveedores de API (Anthropic, OpenAI) cobran por token de inferencia. La inferencia en dispositivo (llama.cpp, GGUF) se ejecuta localmente sin llamadas a API.

Términos relacionados