Das Wichtigste in Kürze
Reasoning-Modelle denken vor der Antwort. Sie erzeugen interne Zwischenschritte, bevor sie antworten. Das verbessert mehrstufige Aufgaben und kostet dafür Tokens und Zeit.
Die Denktiefe ist heute ein Regler, kein eigenes Modell. Anthropic steuert sie über den Parameter effort in fünf Stufen, OpenAI über reasoning.effort, Google über thinking_level. Stand September 2026 ist das Nachdenken bei den Spitzenmodellen aller drei Anbieter standardmäßig aktiv.
Denk-Tokens werden als Ausgabe abgerechnet. OpenAI weist darauf ausdrücklich hin, Google formuliert es als Summe aus Ausgabe- und Denk-Tokens. Eine kurze Antwort kann deshalb ein Vielfaches kosten.
Mehr Nachdenken ist nicht immer besser. Die Arbeit „When More Thinking Hurts" (arXiv, 12. April 2026) zeigt, dass Modelle bei längeren Denkketten bereits korrekte Zwischenantworten wieder verwerfen.
Die sichtbare Denkspur ist kein Nachweis. In einer Untersuchung von Anthropic (3. April 2025) nannte Claude 3.7 Sonnet einen genutzten Hinweis nur in 25 % der Fälle, DeepSeek R1 in 39 %.
Reasoning-Modelle, im Marketing meist „Thinking Models" genannt, sind 2026 kein Sonderfall mehr. Bei den Spitzenmodellen von Anthropic, OpenAI und Google ist das Nachdenken vor der Antwort eingebaut und lässt sich nur noch in der Tiefe steuern. Für Unternehmen verschiebt das die Frage: Es geht nicht mehr darum, ob man ein Reasoning-Modell einkauft, sondern darum, wo sich der Aufwand lohnt und wo er nur Geld und Antwortzeit kostet.
Die Bitkom-KI-Studie vom 14. September 2026 zeigt, wie groß der Handlungsdruck ist: 57 % der Unternehmen ab 20 Beschäftigten setzen KI ein, aber niemand schöpft das Potenzial nach eigener Einschätzung voll aus, 59 % nach eigener Aussage gar nicht (Bitkom). Dieser Leitfaden ordnet ein, was Reasoning technisch und wirtschaftlich bedeutet, wo die Forschung vor zu viel Nachdenken warnt und wie Sie die Entscheidung je Anwendungsfall treffen.
Was sind Reasoning-Modelle?
Ein Reasoning-Modell ist ein Sprachmodell, das vor der eigentlichen Antwort eine Kette von Zwischenschritten erzeugt, sie intern bewertet und sich dabei korrigieren kann. In der Forschung heißt dieser Zwischenschritt Chain-of-Thought, in den Produkten je nach Hersteller „Thinking", „Extended Thinking" oder „Reasoning Effort".
Technisch verschiebt Reasoning Rechenaufwand vom Training in die Anwendung: Das Modell rechnet pro Frage länger. Als Anwender sehen Sie davon entweder eine kurze Zusammenfassung der Denkschritte oder gar nichts. Die Antwort wirkt nur sorgfältiger.
Drei Punkte werden in der Debatte regelmäßig verwechselt.
Mehr Rechenzeit pro Anfrage
Das Modell denkt länger und löst dadurch Aufgaben, an denen es ohne Denkschritte scheitert. Bezahlt wird diese Zeit in Tokens.
Eine eigene Modellgattung
Reasoning ist eine Trainings- und Anwendungsstrategie auf bestehenden Architekturen. Aus einem schwachen Modell wird dadurch kein starkes.
Sichtbare Denkschritte sind ein Beweis
Die angezeigte Denkspur entspricht nicht zwingend dem, was intern tatsächlich passiert ist. Sie ist eine Erklärung, kein Nachweis.
Wie steuern die Anbieter die Denktiefe?
Über einen Parameter je Anfrage: Anthropic nennt ihn effort, OpenAI reasoning.effort und Google thinking_level. Sie geben damit vor, wie viel Aufwand das Modell treiben darf, und zahlen den Unterschied in Tokens.
Die folgende Übersicht nennt die Stufen, wie sie in den Anbieter-Dokumentationen stehen (Stand: September 2026).
| Anbieter | Regler | Stufen und Standard | Besonderheit |
|---|---|---|---|
| Anthropic | effort |
low, medium, high, xhigh, max; Standard ist high | Der Regler wirkt auf alle Ausgabe-Tokens, auch auf Werkzeugaufrufe. Beim Spitzenmodell Claude Fable 5.1 ist das Nachdenken dauerhaft aktiv |
| OpenAI | reasoning.effort |
none, minimal, low, medium, high, xhigh, max; medium ist der ausgewogene Standard | GPT-6 Astra lässt sich nicht mehr ganz abschalten: none führt zu einem Fehler |
thinking_level |
minimal, low, medium, high; Gemini 3.8 Flash startet bei medium, die Pro-Vorschau bei high | Die Modelle denken dynamisch und passen den Aufwand selbst an die Aufgabe an | |
| DeepSeek | Betriebsart je Anfrage | Nachdenken an oder aus, beim Flash-Modell mit Nachdenken als Standard | Eine eigene Reasoning-Baureihe gibt es nicht mehr, das Nachdenken steckt im Modell |
Quellen: Anthropic Effort-Parameter, OpenAI Reasoning Guide, Gemini Thinking, DeepSeek Preisliste, abgerufen am 14. September 2026. Welche Modellversionen aktuell sind und was sie kosten, steht im LLM-Vergleich 2026.
Zwei Dinge folgen daraus für die Praxis. Erstens: Wer 2026 noch separate Reasoning-Modelle beschafft, kauft eine Architektur von 2025. Zweitens: Der Regler gehört in die Anwendung, nicht in die Hand jedes einzelnen Nutzers. Sonst läuft die Standardanfrage auf der höchsten Stufe, und niemand merkt es, bis die Rechnung kommt.
Wann hilft Reasoning und wann schadet es?
Reasoning hilft bei mehrstufigen Aufgaben mit nachvollziehbarer Logik und schadet bei einfachen Abfragen, weil es Kosten, Antwortzeit und in ungünstigen Fällen sogar Fehler erhöht. Die Arbeit „When More Thinking Hurts" (arXiv, eingereicht am 12. April 2026) beschreibt den Effekt so: Modelle zeigen Überdenken, bei dem längeres Nachdenken damit einhergeht, dass zuvor korrekte Antworten wieder verworfen werden (arXiv 2604.10739). Die Autoren zeigen außerdem, dass die sinnvolle Denklänge mit der Schwierigkeit der Aufgabe schwankt, ein einheitliches Budget für alle Anfragen also Geld verbrennt.
Auch die Anbieter selbst sind zurückhaltend. OpenAI schreibt, der Aufwandsregler sei ein Feinjustierer und nicht der Hauptweg, um Qualität zu retten. Google empfiehlt für einfache Faktenabfragen ausdrücklich eine niedrige Stufe. Daraus ergibt sich eine Heuristik, die sich in Projekten bewährt hat.
| Aufgabentyp | Warum | Empfehlung |
|---|---|---|
| Mehrstufige Analyse, Entscheidungsvorlage, Vertrags- und Angebotsprüfung | Das Modell muss Bedingungen gegeneinander abwägen und Widersprüche finden. Genau dafür sind die Denkschritte gemacht. | Hohe Stufe |
| Programmieren, Umbau und Migration von Code | Lange Arbeitsketten mit Werkzeugaufrufen. Die Anbieter empfehlen hier selbst die höheren Stufen. | Hohe Stufe |
| Agenten mit mehreren Werkzeugen, etwa über MCP | Planen, Werkzeuge koordinieren, Zwischenergebnisse bewerten: Das Nachdenken zahlt sich in der Planungsqualität aus. | Mittlere bis hohe Stufe |
| Fragen an interne Dokumente und Wissensspeicher | Hier entscheidet die Qualität der Suche, nicht die Denktiefe. Mehr Nachdenken macht die Antwort selten richtiger. | Niedrige Stufe, dafür bessere Suche |
| Standardantworten im Service, Klassifizierung, Weiterleitung | Gleiche Qualität zu einem Bruchteil der Kosten und deutlich schneller. | Ohne Reasoning |
| Erstentwürfe, Brainstorming, Textvarianten | Längeres Nachdenken macht Texte oft formaler, selten besser. | Ohne Reasoning |
Die unbequeme Folgerung: Die meisten täglichen Anfragen in einem Unternehmen brauchen kein tiefes Nachdenken. Für „Fasse diese E-Mail zusammen" ist die höchste Stufe des teuersten Modells die falsche Antwort. Prüfen Sie das mit eigenen Fällen, statt es zu glauben: Lassen Sie dieselben zwanzig Anfragen auf zwei Stufen laufen und vergleichen Sie Ergebnis, Dauer und Kosten.
Was kostet Reasoning im Betrieb?
Deutlich mehr, als die Preisliste vermuten lässt, weil die Denk-Tokens als Ausgabe zählen. OpenAI schreibt in der Dokumentation, dass Reasoning-Tokens nicht sichtbar sind, aber Platz im Kontext belegen und als Ausgabe abgerechnet werden. Google formuliert den Antwortpreis als Summe aus Ausgabe- und Denk-Tokens und weist darauf hin, dass die vollständigen Denk-Tokens berechnet werden, obwohl nur eine Zusammenfassung zurückkommt.
Ausgabe ist bei allen Anbietern die teure Seite. Stand September 2026 kostet eine Million Ausgabe-Tokens bei einem Arbeitspferd wie Claude Sonnet 5 10 $, bei GPT-5.6 Terra 12 $, beim Spitzenmodell Claude Fable 5.1 oder GPT-6 Astra dagegen 50 $ (Anthropic, OpenAI). Wer also Nachdenken global aktiviert und dabei auf die Spitzenstufe wechselt, verschiebt zwei Kostenfaktoren gleichzeitig nach oben: mehr Ausgabe-Tokens je Anfrage und ein Vielfaches je Token.
Drei Stellschrauben halten das im Rahmen:
- Stufe je Anwendungsfall festlegen, nicht plattformweit. Ein Vertragscheck darf tief denken, die Serviceantwort nicht.
- Ausgabelänge begrenzen und Zwischenspeicher nutzen. Wiederkehrende Anleitungen und Dokumente im Prompt kosten mit Zwischenspeicher einen Bruchteil.
- Kosten je Anwendungsfall messen, nicht je Abteilung. Ein unerwartet hoher Reasoning-Anteil ist fast immer ein Hinweis auf eine falsch gesetzte Voreinstellung. Wie Sie das aufsetzen, steht im Leitfaden zu Token-Kosten und FinOps für KI.
Was verlangt die KI-Verordnung bei Reasoning-Modellen?
Die KI-Verordnung kennt keine eigene Kategorie für Reasoning-Modelle. Relevant sind zwei Ebenen: die Pflichten für Anbieter von Modellen mit allgemeinem Verwendungszweck, die seit dem 2. August 2025 gelten und in Kapitel V der Verordnung stehen (Art. 51 ff.), sowie die Pflichten für Hochrisiko-Anwendungen. Letztere treffen Betreiber erst später als ursprünglich geplant: Für eigenständige Systeme nach Anhang III gelten sie ab dem 2. Dezember 2027.
Anhang III nennt acht Bereiche, darunter Beschäftigung und Personalmanagement, die Bewertung der Kreditwürdigkeit als Zugang zu wesentlichen Dienstleistungen, kritische Infrastruktur und Bildung. Wer dort ein Modell einsetzt, braucht unter anderem menschliche Aufsicht (Art. 14), Robustheit und Genauigkeit (Art. 15), Protokollierung (Art. 12), ein Risikomanagement (Art. 9) und Anforderungen an die Datenqualität (Art. 10).
Denkspur ist keine Begründung
Reasoning wirkt auf den ersten Blick wie eine Erklärhilfe für Audits. Genau da liegt das Risiko: In einer eigenen Untersuchung von Anthropic (3. April 2025) nannte Claude 3.7 Sonnet einen im Test eingespielten Hinweis nur in 25 % der Fälle in seiner sichtbaren Denkspur, DeepSeek R1 in 39 %.
Wer die Denkspur im Audit als Beweis anführt, dass eine Entscheidung sauber zustande kam, baut ein Risiko auf. Behandeln Sie sie als zusätzlichen Hinweis und bauen Sie echte Nachweise daneben: Protokolle von Eingabe und Ausgabe, Prüfschritte durch Menschen, Stichproben. Diese Einordnung ersetzt keine Rechtsberatung.
Routing statt Modellwahl: die strategische Antwort
Wenn ein Teil der Anfragen tiefes Nachdenken braucht und der größere Teil nicht, ist die Antwort keine Modellentscheidung, sondern eine Zuordnungsregel. Statt einen Standard für alles zu setzen, definieren Sie je Anwendungsfall, welches Modell und welche Denkstufe zum Einsatz kommen.
Ein belastbares Setup besteht aus vier Bausteinen:
- Einordnung der Anfrage, idealerweise durch ein kleines, schnelles Modell als Vorfilter.
- Kostenrahmen je Anwendungsfall, damit ein Ausreißer auffällt, bevor er zur Rechnung wird.
- Ausweichpfad, wenn ein Anbieter langsam antwortet oder ausfällt.
- Protokollierung mit Kennzeichnung je Anwendungsfall, damit Sie nachher wissen, welcher Fall auf welchem Modell lief.
Wie Sie das ohne Abhängigkeit von einem einzigen Anbieter aufbauen, beschreibt der Leitfaden zur Multi-Modell-Strategie. Wie Sie die Qualität dauerhaft messen, statt sie zu vermuten, steht im Leitfaden zu Evaluation und Beobachtbarkeit.
Wie Plotdesk Reasoning im Unternehmen einordnet
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand. Für Reasoning heißt das: Im Model Garden stehen mehr als 100 Modellvarianten aus zehn Provider-Typen bereit, und Sie geben pro Team, Gruppe und Anwendung frei, welche davon genutzt werden dürfen. Damit lässt sich das teure Spitzenmodell gezielt dort öffnen, wo es sich rechnet, während der Alltag auf einem Arbeitspferd läuft.
Nutzungs- und Kostenanalysen zeigen je Bereich, wie viel Ausgabe tatsächlich anfällt. Für welche Anwendungsfälle sich eine hohe Denkstufe lohnt, klären wir gemeinsam in der KI-Potenzialanalyse und belegen es im Proof of Value mit Ihren eigenen Daten. Plotdesk läuft dabei als dedizierte Instanz in der EU oder im eigenen Tenant; Rollen, mehr als 40 Berechtigungen und Audit-Logs halten fest, wer welches Modell nutzen darf.
Fünf Schritte für Entscheider
Ob sich Reasoning in Ihrem Unternehmen lohnt, klären Sie in fünf Schritten: Fälle auflisten, Eignung markieren, mit eigenen Anfragen messen, Voreinstellungen festlegen und regelmäßig nachsehen.
Anwendungsfälle auflisten
Notieren Sie die zwanzig wichtigsten Fälle, die heute oder demnächst produktiv laufen, mit typischer Eingabelänge, Komplexität und Datenklasse. Diese Liste ist die Grundlage für alles Weitere.
Eignung markieren
Ordnen Sie jeden Fall nach der Heuristik oben ein. Steht bei mehr als der Hälfte „hohe Stufe", ist die Liste vermutlich zu optimistisch. Schauen Sie dann noch einmal kritisch darauf.
Eigene Prüfstrecke aufbauen
Sammeln Sie je Fall fünf bis fünfzehn echte Anfragen mit einer gewünschten Antwort. Diese Sammlung sagt über Ihre Anwendung mehr aus als öffentliche Benchmarks, weil sie Ihre Sprache und Ihre Ansprüche misst.
Voreinstellungen festlegen
Legen Sie je Fall ein Standardmodell mit niedriger bis mittlerer Denkstufe fest und ein Spitzenmodell als Eskalation. Konkrete Modellnamen und Preise finden Sie im LLM-Vergleich mit Stand-Datum.
Monatlich nachsehen
Messen Sie je Anwendungsfall Modellverteilung, Kosten, Antwortzeit und, wo möglich, Ergebnisqualität. Ein unerwartet hoher Reasoning-Anteil ist meist ein Zuordnungsfehler, kein Bedarf.
Häufige Fragen zu Reasoning-Modellen
Was unterscheidet ein Reasoning-Modell von einem normalen Sprachmodell?
Reichen Standardmodelle nicht für alles?
Wie stark steigen die Kosten durch Reasoning?
Kann ich Reasoning-Modelle DSGVO-konform nutzen?
Taugt die sichtbare Denkspur als Nachweis für Audits?
Wer sollte im Unternehmen darüber entscheiden?
Fazit: Reasoning ist ein Werkzeug, keine Strategie
Reasoning-Modelle sind ein verlässlicher Baustein moderner KI-Plattformen, mit klaren Stärken bei mehrstufiger Argumentation, agentischen Abläufen und komplexen Prüfungen. Sie sind aber eben ein Baustein und keine Strategie.
Wer die Technik ernst nimmt, ohne dem Marketing zu folgen, baut keine Strategie um ein einzelnes Spitzenmodell, sondern eine Architektur mit klarer Liste der Anwendungsfälle, sauberer Zuordnung von Aufgabe zu Modell, ehrlicher Messung und einer Governance, die auch dann noch trägt, wenn in sechs Monaten das nächste Modell mit dem nächsten Namen erscheint. Die Denktiefe ist dann das, was sie sein sollte: eine Einstellung, die Sie bewusst setzen.