Inference
IA & ML · Profundo
O processo de executar um modelo treinado em novas entradas para gerar predicoes ou saidas. Inferencia e a fase de 'uso' (vs. treinamento). O custo de inferencia depende do tamanho do modelo, contagem de tokens de entrada/saida e hardware (GPUs/TPUs). Provedores de API (Anthropic, OpenAI) cobram por token pela inferencia. Inferencia local (llama.cpp, GGUF) roda localmente sem chamadas de API.