DPO (Direct Preference Optimization)

IA & ML · Abismo

Una alternativa simplificada a RLHF que alinea las salidas del LLM con las preferencias humanas sin entrenar un modelo de recompensa separado ni usar aprendizaje por refuerzo. DPO optimiza directamente una politica usando pares de salidas preferidas y no preferidas, haciendolo computacionalmente más barato y estable que el pipeline multi-etapa de RLHF. Ampliamente adoptado en 2024-2025 para el ajuste fino de modelos de código abierto.

Términos relacionados