Der Beitrag behandelt Optimierungen bei Extended Thinking (auch Reasoning oder Chain-of-Thought genannt), einem Ansatz, bei dem KI-Modelle ihre Überlegungen explizit aufschreiben, bevor sie antworten. Typischerweise ist dieses Vorgehen sehr token-intensiv und damit kostspielig. Die Arbeit zeigt Methoden auf, um dasselbe Reasoning-Verhalten mit deutlich weniger Token zu erreichen – das spart Rechenzeit und Kosten. Dies ist relevant für alle, die große Sprachmodelle produktiv einsetzen, da Effizienz-Gewinne direkt auf die Betriebskosten durchschlagen.