RLHF (Reinforcement Learning from Human Feedback)

IA & ML · Abismo

Uma técnica de treinamento que alinha as saidas de LLMs com preferencias humanas. Processo: (1) treinar um modelo de recompensa a partir de comparacoes humanas de saidas, (2) usar aprendizado por reforco (PPO) para otimizar o LLM contra o modelo de recompensa. RLHF torna os modelos mais uteis, inofensivos e honestos. Usado por Claude, ChatGPT e outros assistentes. Alternativas incluem DPO (Direct Preference Optimization) e Constitutional AI.

Termos relacionados