Reasoning-Modelle sind Sprachsysteme, die darauf optimiert sind, Probleme durch explizite Zwischenschritte zu lösen, anstatt eine direkte Antwort allein auf Basis der Vorhersage des nächsten Tokens zu generieren. Bevor sie antworten, wenden sie Rechenzeit zum „Nachdenken“ auf: Sie zerlegen das Problem, explorieren Alternativen und verifizieren Ergebnisse. Bekannte Beispiele sind die o1/o3-Serie von OpenAI, DeepSeek-R1 oder Claude in ihren erweiterten Reasoning-Modi.
Ihre Bedeutung liegt in dem Leistungssprung, den sie bei Aufgaben bieten, die eine verkettete Logik erfordern: Mathematik, Programmierung, Beweisführungen oder komplexe Planung. Sie werden üblicherweise mit Techniken des bestärkenden Lernens trainiert, die korrekte Argumentationsketten belohnen und nicht nur die endgültige Antwort. Dies ermöglicht es ihnen, sich während des Prozesses selbst zu korrigieren.
Eine relevante praktische Nuance:
- Sie verbrauchen mehr Zeit und Tokens, was jede Abfrage verteuert.
- Bei einfachen Aufgaben, bei denen ein herkömmliches Modell ebenso gut und schneller antwortet, lohnen sie sich nicht immer.
Es empfiehlt sich, sie für Probleme zu reservieren, bei denen strukturiertes Denken einen klaren Vorteil gegenüber den Zusatzkosten bietet.