RLHF (Reinforcement Learning from Human Feedback)
IA & ML · Abismo
Una técnica de entrenamiento que alinea las salidas de los LLM con las preferencias humanas. Proceso: (1) entrenar un modelo de recompensa a partir de comparaciones humanas de salidas, (2) usar aprendizaje por refuerzo (PPO) para optimizar el LLM contra el modelo de recompensa. RLHF hace que los modelos sean más utiles, inofensivos y honestos. Usado por Claude, ChatGPT y otros asistentes. Las alternativas incluyen DPO (Optimización Directa de Preferencias) y Constitutional AI.