Os modelos de razoamento son sistemas de linguaxe optimizados para resolver problemas mediante pasos intermedios explícitos, en lugar de xerar unha resposta directa a partir da mera predición do seguinte token. Antes de responder, dedican tempo de cómputo a "pensar": descompoñen o problema, exploran alternativas e verifican resultados. Exemplos coñecidos son a serie o1/o3 de OpenAI, DeepSeek-R1 ou Claude nos seus modos de razoamento estendido.
A súa importancia reside no salto de rendemento que ofrecen en tarefas que esixen lóxica encadeada: matemáticas, programación, demostracións ou planificación complexa. Adoitan adestrarse con técnicas de aprendizaxe por reforzo que premian as cadeas de razoamento correctas, non só a resposta final. Isto permítelles autocorrixirse durante o proceso.
Un matiz práctico relevante:
- Consomen máis tempo e tokens, o que encarece cada consulta.
- Non sempre compensan en tarefas sinxelas, onde un modelo convencional responde igual de ben e máis rápido.
Convén reservalos para problemas nos que o razoamento estruturado achegue unha vantaxe clara fronte ao custo engadido.