Der steigende Einsatz künstlicher Intelligenz lässt den Energiebedarf von Rechenzentren deutlich wachsen.
KI-Rechenzentren müssen Energie effizienter in Rechenleistung umwandeln

Laut Bitkom könnte die für KI eingesetzte Rechenzentrumskapazität in Deutschland bis 2030 von derzeit rund 530 MW auf etwa 2.020 MW steigen und damit rund 40 Prozent der gesamten Kapazität ausmachen.
Damit wird nicht nur der absolute Stromverbrauch zu einer Herausforderung. Für Betreiber stellt sich zunehmend die Frage, wie viel nutzbare KI-Rechenleistung sich aus einer begrenzten Strommenge gewinnen lässt. KAYTUS, ein Anbieter von KI-Infrastruktur, sieht deshalb einen stärkeren Fokus auf das Zusammenspiel von Rechenleistung, Energieversorgung und Kühlung.
Vom Server zum vernetzten Rack
Mit modernen KI-Systemen verändert sich die Infrastruktur. Bei Rack-Scale-Systemen wie dem im Ausgangsmaterial genannten GB300 NVL72 arbeiten GPUs, CPUs, Hochgeschwindigkeitsnetzwerke, Stromversorgung und Flüssigkeitskühlung eng zusammen. Eine Veränderung der Rechenlast wirkt sich dadurch unmittelbar auf Strombedarf und Wärmeentwicklung aus.
Eine isolierte Betrachtung einzelner Komponenten reicht unter diesen Bedingungen nur noch eingeschränkt aus. Entscheidend ist vielmehr, wie die verschiedenen Ressourcen auf Rack- und Cluster-Ebene zusammenspielen. Werden einzelne Knoten überlastet, während andere Kapazitäten ungenutzt bleiben, kann dies die Effizienz des gesamten Systems beeinträchtigen.
Auch die bisher getrennte Betrachtung von IT- und Kühlinfrastruktur erschwert eine solche Gesamtbewertung. Für ein effizientes Management müssen Betriebsdaten aus beiden Bereichen zusammengeführt werden.
Mehr Rechenleistung aus vorhandener Energie
Ein zentraler Ansatz besteht darin, nicht allein den Stromverbrauch zu reduzieren, sondern die tatsächlich nutzbare Rechenleistung pro Megawatt zu erhöhen. Dafür benötigen Betreiber einen Überblick über die Auslastung ihrer Infrastruktur.
Dazu gehören unter anderem GPU- und CPU-Auslastung, Speichernutzung, Netzwerkbandbreite, Festplattenaktivität und die aktuelle Leistungsaufnahme. Werden diese Werte kontinuierlich erfasst, lassen sich ungenutzte Ressourcen und überlastete Knoten leichter identifizieren.
Auf dieser Grundlage können Workloads beispielsweise auf weniger ausgelastete GPU-Knoten verteilt oder Aufgaben in Zeiten mit geringerer Systemauslastung verschoben werden. Schwellenwerte für die Auslastung können dabei als Grundlage für automatische Warnungen dienen.
Eine weitere Möglichkeit ist die Verknüpfung von Rechenleistung und Energieverbrauch. Eine solche Analyse kann zeigen, welche Hardware tatsächlich zur benötigten Leistung beiträgt und damit auch Entscheidungen über die Erweiterung von Clustern oder die Verteilung von Workloads unterstützen.
Kühlung muss auf wechselnde Lasten reagieren
Neben der Rechenleistung spielt die Wärmeabfuhr eine entscheidende Rolle. Gerade beim Training großer Sprachmodelle können sich die Rechenlasten innerhalb kurzer Zeit stark verändern. Ein System kann dadurch schnell von geringer Auslastung in eine hohe Last wechseln.
Konventionelle Flüssigkühlungen mit konstanten Durchflussmengen und Pumpendrehzahlen können auf solche Schwankungen nur begrenzt reagieren. Wird unabhängig von der tatsächlichen Rechenlast kontinuierlich mit maximaler Kühlleistung gearbeitet, entsteht zusätzlicher Energiebedarf.
Eine lastabhängige Kühlung kann die Leistung dagegen an den tatsächlichen Wärmebedarf anpassen. Dadurch lässt sich der Energieverbrauch der Pumpen und Kühleinheiten reduzieren, ohne die notwendige Kühlleistung bei hoher Last einzuschränken.
Infrastruktur wird zum Gesamtsystem
Für Betreiber von KI-Rechenzentren verschiebt sich damit der Maßstab für Energieeffizienz. Entscheidend ist nicht allein, wie wenig Strom einzelne Komponenten verbrauchen, sondern wie effizient die gesamte Infrastruktur diesen Strom in nutzbare Rechenleistung umsetzt.
Darren Cox, General Manager for Europe bei KAYTUS, beschreibt die Herausforderung so: „Für KI-Rechenzentren geht die Herausforderung über die bloße Reduzierung des Stromverbrauchs einzelner Geräte hinaus. Vielmehr müssen Betreiber die Umwandlung immer begrenzterer Stromkapazitäten in nutzbare Workloads für Training, Inferenz und Hochleistungsrechnen maximieren – trotz begrenzter Netzkapazitäten, gestaffelter Strompreise und strengerer Nachhaltigkeitsanforderungen.“
Damit rücken einheitliches Infrastrukturmanagement und eine dynamische Steuerung von Rechenleistung und Kühlung stärker in den Mittelpunkt. Für den weiteren Ausbau von KI-Rechenzentren dürfte neben der verfügbaren Strommenge somit auch entscheidend sein, wie effizient vorhandene Energie tatsächlich in Rechenleistung umgesetzt wird.
(red/KAYTUS)







