Unternehmen droht bei generativer KI ein neuer Kostenfaktor: Sie bezahlen wiederholt für Kontext, den ihre KI oft gar nicht braucht.
Mit der Verbreitung von KI-Agenten wird das Problem größer, denn Agenten laden, analysieren und reichen Kontext über viele Schritte hinweg weiter – nicht nur einmal pro Prompt. KI und Datenanalyse-Experte Prof. Michael Berthold zeigt auf, was diese Problematik verursacht und wie Unternehmen vorgehen können, um KI effizienter zu nutzen.
Eine Microsoft-Research-Studie zum Tokenverbrauch bei Coding-Aufgaben zeigt, wie groß der Effekt ist: Agentische Aufgaben verbrauchen bis zu 1.000-mal mehr Tokens als klassisches Code Reasoning, getrieben vor allem durch Input- statt Output-Tokens – und mehr Tokens führen dabei nicht automatisch zu besseren Ergebnissen. Eine zweite Studie zu agentischen Softwareentwicklungsaufgaben findet Ähnliches und spricht von einer „Communication Tax”: Agenten reichen vorhandene Informationen immer wieder weiter, statt sie zu verdichten.
Große Context-Windows sind kein Freifahrtschein
Ein großes Context-Window verführt dazu, einfach alles hineinzugeben – das komplette Repository, die Dokumentensammlung, den gesamten Gesprächsverlauf. Für einen einzelnen Aufruf mag das funktionieren; in einem produktiven Agentensystem wird daraus schnell ein gewaltiger Kostenblock: Ein Repository mit 500.000 Tokens, das bei 10.000 Interaktionen wiederholt in den Kontext gelangt, sind Milliarden verarbeitete Tokens – auch wenn sich am Repository nichts geändert hat.
Es geht dabei nicht nur um Geld: Laut der bekannten „Lost in the Middle”-Untersuchung von Liu et al. nutzen Sprachmodelle relevante Informationen in langen Kontexten nicht gleichmäßig gut; liegt sie in der Mitte eines langen Inputs, sinkt die Trefferqualität spürbar. Auch Anthropic beschreibt Kontext inzwischen als begrenzte Ressource und empfiehlt, möglichst wenige, aber informationsreiche Tokens bereitzustellen – mehr Kontext ist nicht automatisch mehr Intelligenz, sondern oft einfach mehr Ballast.
Der sinnvollere Ansatz: Verdichtung statt nur Retrieval
Unternehmen brauchen deshalb nicht mehr Kontext, sondern besser vorbereiteten Kontext. Retrieval-Augmented Generation (RAG) ist ein erster Filter: Es sucht anhand einer Anfrage passende Inhalte, statt alle Dokumente in den Kontext zu geben. Doch RAG filtert nur Rohmaterial – liefert es zehn Dokumente à 20.000 Tokens, landen trotzdem 200.000 Tokens im Kontext, in Variationen wiederholt bei jedem ähnlichen Aufruf.
Der nächste Schritt ist deshalb Verdichtung oder Abstraktion: Aus großem Rohmaterial wird einmal eine kompakte Essenz erzeugt, die danach wiederholt in den Kontext wandert. Die KI entscheidet anhand dieser Essenz, welche Details sie tatsächlich braucht – etwa welche Komponenten es gibt, wie sie zusammenhängen, welche Teile relevant sind – und lädt erst dann konkrete Dateien oder Dokumente.
Context Engineering: Kontext wird zur Infrastruktur
Anthropic definiert Context Engineering als die systematische Zusammenstellung und Pflege der Informationen, die ein Modell während der Inferenz erhält – nicht nur der Prompt zählt, sondern der gesamte Zustand, den ein Agent sieht. Die Leitregel: Der beste Kontext ist nicht der größtmögliche, sondern der kleinste mit gerade noch ausreichend Informationen für die nächste Entscheidung.
Ein Semantic Layer beantwortet die Frage “Was ist das?” und beschreibt Begriffe, Typen und deren Bedeutung – etwa, dass verschiedene Bezeichnungen dasselbe Geschäftskonzept meinen. Ein Knowledge Graph beantwortet die Frage “Womit hängt es zusammen?” und bildet Beziehungen zwischen Entitäten ab: Ein Service nutzt eine API, eine Komponente hängt von einer anderen ab. Beides erzeugt eine kompaktere, für die KI nützlichere Struktur als die rohen Originaldaten oder -dokumente.
Bei Programmcode übernimmt diese Rolle der Context Compiler: Ein Coding-Agent muss nicht bei jedem Schritt das gesamte Repository lesen, er braucht zunächst eine Landkarte – Architektur, Module, Abhängigkeiten, APIs, Datenflüsse. Der Compiler erzeugt diese Essenz einmal; die KI navigiert danach darüber, statt Rohdaten immer wieder neu zu kopieren. Ändert sich das Repository nicht, bleibt die Essenz stabil und die aufwendige Analyse muss nicht wiederholt werden.
Kontext wird hierarchisch
Daraus ergibt sich eine hierarchische Struktur: oben eine sehr kompakte Zusammenfassung, darunter detailliertere Zusammenfassungen einzelner Bereiche, erst ganz unten die vollständigen Rohdaten. Eine KI arbeitet sich schrittweise vor, statt bei jeder Anfrage direkt in die Rohdaten einzusteigen – und diese Hierarchie kann zunehmend von einer KI selbst erzeugt werden: teure Verarbeitung einmal, günstige Nutzung tausendfach.
Das gleiche Prinzip gilt für Skills, die Essenzschicht für Werkzeuge und Handlungswissen: Ein Agent muss nicht permanent alle Tool-Details kennen – ein Skill vermittelt zunächst, wann eine Fähigkeit relevant ist, Details wie genau das Tool verwendet werden kann, folgen erst bei Bedarf.
Die neue Optimierungsfrage
„Die KI-Branche hat lange auf immer größere Context-Windows optimiert – ein wichtiger Fortschritt. Für Unternehmen darf die Fenstergröße aber nicht selbst zum Ziel werden: Ein Context-Window ist kein kostenloser Speicher, sondern eine wiederholt zu verarbeitende Ressource, und wer einen Agenten mit riesigen Mengen Rohmaterial füttert, zahlt möglicherweise Milliarden Tokens für Informationen, die er nie oder nur selten braucht“, betont Michael Berthold.
Die entscheidende Frage ist deshalb nicht mehr: „Wie viele Tokens passen in den Kontext?“, sondern: „Wie wenig Kontext braucht die KI, um selbst zu entscheiden, welche Information sie als Nächstes benötigt?” Das ist der Kern von Context Engineering: nicht möglichst viel Rohmaterial vorlegen, sondern vorverarbeitete Hintergrundinformationen liefern, die die Navigation durch dieses Rohmaterial ermöglichen – idealerweise einmal erzeugt, danach vielfach wiederverwendet.