Reasoning Model
IA & ML · Profundo
Una clase de LLMs entrenados con aprendizaje por refuerzo para generar una cadena de pensamiento interna paso a paso antes de producir una respuesta final, logrando un rendimiento superior en tareas complejas de matematicas, programacion y lógica. Pionero con o1 de OpenAI (septiembre 2024), seguido por o3, DeepSeek-R1 y el modo de pensamiento extendido de Claude. A diferencia de los LLM estandar que responden directamente, los modelos de razonamiento producen un CoT interno de longitud variable, permitiendo computo controlable en tiempo de inferencia.