DPO (Direct Preference Optimization)
IA & ML · Abismo
Uma alternativa simplificada ao RLHF que alinha saidas de LLMs com preferencias humanas sem treinar um modelo de recompensa separado ou usar aprendizado por reforco. DPO otimiza diretamente uma politica usando pares de saidas preferidas e não-preferidas, tornando-o computacionalmente mais barato e mais estavel que o pipeline multi-estagio do RLHF. Amplamente adotado em 2024-2025 para fine-tuning de modelos open-source.