heise+ | GPU-Scheduling mit Kubernetes

https://www.heise.de/rss/heise-atom.xml Hits: 9
Summary

GPU-Scheduling mit Kubernetes Probleme mit unterschiedlicher Hardware Das Erbe des Device-Plugins Capability statt Abzählen Kueue: Die Schicht über dem Scheduler Kueue, KAI oder Volcano? Vom Training zur Inferenz: llm-d Was 2026 noch fehlt Artikel in iX 8/2026 lesen Sprachmodelle per API einzukaufen ist bequem. Wer jedoch Trainingsdaten und geistiges Eigentum im Haus halten muss oder die Tokenkosten hoher Inferenzvolumina scheut, betreibt seine GPUs selbst. Das reicht vom Feintunen von Modellen in der Pharmabranche, im Finanzwesen und in der Industrie bis zur selbst gehosteten Inferenz mit Open-Weight-Modellen. Läuft der Cluster auf eigener Hardware, entscheidet das Scheduling über die Rechnung. Am deutlichsten zeigt sich das auf geteilten Plattformen, auf denen mehrere Teams um dieselben Karten konkurrieren, etwa in größeren Unternehmen, Forschungsverbünden oder Behörden. Eine einzelne H100 kostet im Einkauf 25.000 bis 40.000 Euro. Im üblicherweise in US-Dollar quotierten Mietmarkt liegt der On-Demand-Preis (Stand Frühjahr 2026) meist zwischen 2 und 4 US-Dollar pro GPU-Stunde, in der Spitze bei 7 bis 9 US-Dollar und vereinzelt darüber. Solche Karten sind in geteilten Produktionsclustern oft nur zu einem Bruchteil ausgelastet, auch über mehrere Clustergenerationen hinweg. Die Mehrheit der Tasks fordert weniger als eine ganze GPU an – womit sich die klassische Herangehensweise von Kubernetes schwertat. Seit Kubernetes 1.34 macht Dynamic Resource Allocation (DRA) gemischte GPUs im Cluster sauber adressierbar und löst das Device-Plugin-Framework ab.Auf der KubeCon EU 2026 spendete Nvidia seine GPU-DRA-Treiber an die CNCF, Google veröffentlichte sein TPU-Pendant als Open Source.Kueue ordnet konkurrierende Jobs in Warteschlangen, llm-d trennt die Phasen der Inferenz.Zusammen mit DRA bilden Kueue und llm-d einen Stack, mit dem mehrere Teams in einem Cluster mit gemischter Hardware ressourcenorientiert und fair zusammenarbeiten können. Für den Kubernetes-Scheduler war eine...

First seen: 2026-07-23 07:57

Last seen: 2026-07-23 16:05