Warum Standardeinstellungen GPU-Leistung verschenken

Die meisten Modelle laufen mit den Einstellungen, mit denen sie installiert wurden. Warum das selten zur eigenen Hardware passt und wie man den Unterschied sauber misst.

2–3 Minuten

Deutsche Technologie Manufakturen

Im Rechenzentrum läuft KI meistens so, wie sie eingerichtet wurde. Serving-Engine installieren, Modell laden, die voreingestellten Werte übernehmen. Es funktioniert, die Antworten kommen. Ob die GPUs dabei ihr Bestes geben, prüft im Alltag kaum jemand. Dafür fehlt schlicht die Zeit.

Das ist verständlich. Aber es heißt auch: Viele Anlagen arbeiten mit Einstellungen, die nie für genau diese Hardware, dieses Modell und diese Last gedacht waren.

Warum Herstellerempfehlungen selten passen

Empfehlungen von Herstellern und Projekten müssen auf sehr vielen Systemen funktionieren. Sie sind ein sicherer Mittelweg, kein Optimum. Sie kennen weder Ihre GPU-Generation und deren Speicher noch Ihr Modell oder Ihr Lastprofil.

Und das Lastprofil macht einen großen Unterschied. Viele kurze Chatanfragen verhalten sich anders als wenige lange Dokumente. Spitzen am Vormittag anders als gleichmäßige Last über den Tag. Eine Einstellung, die im einen Fall gut ist, kann im anderen bremsen.

Die wichtigsten Stellschrauben

  • Batching: Wie viele Anfragen eine GPU gleichzeitig rechnet. Mehr Anfragen auf einmal erhöhen den Durchsatz, können aber die Antwortzeit verlängern.
  • Rechengenauigkeit: Formate wie FP16, FP8 oder INT4. Weniger Genauigkeit spart Speicher und Zeit, kann aber die Qualität der Antworten verschlechtern.
  • Verteilung über GPUs: Ein Modell kann auf mehrere GPUs verteilt werden. Das verkürzt oft die Antwortzeit, kostet aber Abstimmung zwischen den Karten.
  • Speicheraufteilung: Wie viel Platz für Zwischenergebnisse langer Anfragen reserviert wird. Zu wenig bremst, zu viel verschenkt Kapazität.
  • Warteschlange: In welcher Reihenfolge und in welchen Paketen Anfragen abgearbeitet werden.

Diese Stellschrauben hängen voneinander ab. Was einzeln hilft, kann zusammen schaden. Genau deshalb reicht es nicht, an einer Stelle zu drehen und auf das Beste zu hoffen.

Messen statt raten

Bevor wir etwas ändern, frieren wir die aktuelle Konfiguration ein und messen sie unter realistischer Last. Dieser Ausgangswert wird gesichert. Danach ändern wir immer nur eine Stellschraube und messen erneut.

Gemessen wird nicht nur der Durchsatz. Genauso wichtig sind die Antwortzeit, und zwar auch die der langsamsten Anfragen, der Energiebedarf je Antwort und die Qualität. Für die Qualität stellen wir vor und nach jeder Änderung dieselben Prüffragen. Was die Prüfung nicht besteht, fliegt raus, egal wie schnell es ist.

Was am Ende herauskommt

Am Ende steht eine dokumentierte Konfiguration je Modell und GPU, mit Ausgangswert, Endwert und den Rohdaten jeder Messung. Jede Änderung lässt sich zurückdrehen. Erst auf dieser Grundlage lohnt die Frage, ob neue Hardware wirklich nötig ist.

Wie groß der Unterschied bei Ihnen ist, kann niemand vorher seriös sagen. Das zeigt erst die Messung. Wenn Sie wissen wollen, wo Ihre GPUs stehen, sprechen Sie uns an. Mehr zum Vorgehen finden Sie auf der Seite Rechenzentrums-Optimierung.

Zurück zum Fachblog

Fachblog

Mehr aus der Praxis.

Worum geht es bei Ihnen?

Schildern Sie kurz die Aufgabe und welche Unterlagen oder welche Hardware es dazu gibt. Wir sagen Ihnen, ob sich eine digitale Fachassistenz oder eine Optimierung lohnt.