AI Alignment

IA & ML · Profundo

La práctica de asegurar que los sistemas de IA se comporten de acuerdo con las intenciones y valores humanos: ser utiles, inofensivos y honestos. La alineacion abarca tecnicas de tiempo de entrenamiento (RLHF, Constitutional AI, DPO), salvaguardas en tiempo de inferencia y evaluacion mediante red teaming. A medida que los modelos se vuelven más capaces, la alineacion se vuelve critica para prevenir la generación de contenido danino o la manipulación por actores maliciosos.

Términos relacionados