AI Alignment
IA & ML · Profundo
A prática de garantir que sistemas de IA se comportem de acordo com intencoes e valores humanos — sendo uteis, inofensivos e honestos. Alinhamento engloba tecnicas de tempo de treinamento (RLHF, Constitutional AI, DPO), guardrails de tempo de inferencia e avaliacao por meio de red teaming. A medida que os modelos se tornam mais capazes, o alinhamento torna-se critico para prevenir geracao de conteudo nocivo ou manipulação por atores maliciosos.