Reasoning Model
IA & ML · Profundo
Uma classe de LLMs treinados com aprendizado por reforco para gerar raciocinio interno passo a passo (chain-of-thought) antes de produzir uma resposta final, permitindo desempenho superior em tarefas complexas de matematica, programacao e lógica. Pioneirado pelo o1 da OpenAI (setembro de 2024) e seguido por o3, DeepSeek-R1 e o modo de pensamento estendido do Claude. Diferente de LLMs padrao que respondem diretamente, modelos de raciocinio produzem um CoT interno de comprimento variavel, permitindo computação controlavel no momento da inferencia.