Du hast Dir eine DGX Spark hingestellt, ein starkes Modell heruntergeladen – und dann fühlt sich der Chat zäh an, sobald zwei oder drei Kolleg:innen gleichzeitig damit arbeiten. Genau hier liegt der Denkfehler: Das beste Modell nützt Dir nichts, wenn die falsche Software es ausführt. Auf derselben Maschine, mit demselben Modell und denselben Testfällen haben wir drei Inferenz-Engines gegeneinander gemessen – und die Unterschiede sind größer, als Du vermutest.
Warum die Engine über Deine Wartezeit entscheidet
Eine Inferenz-Engine ist die Software zwischen Deinem Modell und den Anfragen Deiner Nutzer. Sie lädt die Gewichte, teilt die Arbeit auf die GPU auf, verwaltet den Zwischenspeicher und entscheidet, wie mehrere Anfragen gleichzeitig abgearbeitet werden. Genau dort entsteht die Wartezeit, die Deine Anwender spüren – nicht im Modell selbst.
Drei Werte solltest Du dabei im Blick haben:
- Zeit bis zum ersten Zeichen: Wie lange es dauert, bis die Antwort überhaupt beginnt. Das entscheidet über das Gefühl von „schnell“ oder „hängt“.
- Durchsatz beim Schreiben: Wie viele Token pro Sekunde danach fließen.
- Anfragen pro Sekunde unter Last: Der Wert, der im Mehrbenutzer-Betrieb wirklich zählt – und der am häufigsten verschwiegen wird.
Unsere Messung: gleiche Maschine, gleiches Modell
Wir haben auf einer DGX Spark dasselbe Modell mit denselben Testfällen durch alle drei Engines geschickt. Das Ergebnis war eindeutig:
- vLLM mit NVFP4-Quantisierung: 0,10 Sekunden bis zum ersten Zeichen, rund 74 Token/s und 6,3 Anfragen pro Sekunde bei acht parallelen Nutzern. Sieger in jeder Disziplin.
- Ollama: 0,43 Sekunden bis zum ersten Zeichen, etwa 76 Token/s – aber nur 2,1 Anfragen pro Sekunde unter Last. Bei Anfrage-Spitzen bricht die Wartezeit auf über drei Sekunden ein.
- SGLang: konnte das NVFP4-Format unseres Modells schlicht nicht laden. Mit dem größeren FP8-Format liest die Engine pro Wort rund 50 Prozent mehr Daten – und wird auf dieser Hardware langsamer als Ollama.
Die ehrliche Einordnung: Ollama ist zum Ausprobieren großartig. Du installierst es, lädst ein Modell, legst los – für einen einzelnen Nutzer am Schreibtisch völlig ausreichend. Sobald aber mehrere Personen gleichzeitig auf Deine lokale KI zugreifen, führt an vLLM derzeit kein Weg vorbei.
Was Du aus den Zahlen für Deinen Alltag ableitest
- Für Einzelnutzer und Tests reicht der bequeme Weg – teste zuerst, entscheide später.
- Für Teams ab zwei parallelen Nutzern ist der Durchsatz unter Last das entscheidende Kriterium, nicht die Spitzen-Token-Zahl.
- Prüfe vor der Engine-Wahl, welches Quantisierungsformat Dein Wunschmodell mitbringt. Passt es nicht zur Engine, hilft Dir die schönste Benchmark-Tabelle nichts.
Was wir beim Umstieg selbst lernen mussten
Eine Engine umzustellen ist kein Knopfdruck. Wir haben auf dem Weg dorthin ein paar Erfahrungen gesammelt, die Dir viel Zeit sparen:
- Kaltstart: Ein Serverstart dauerte anfangs über sechs Minuten. Mit einem schnelleren Gewichte-Ladeformat haben wir das Laden von 146 auf 14 Sekunden gedrückt.
- Prefix-Caching: Der Server merkt sich wiederkehrende Prompt-Anfänge. Bei unseren Chat-Anfragen sank die Wartezeit dadurch von 1,7 Sekunden auf 0,34 Sekunden.
- Tuning-Rezepte kritisch prüfen: Zwei beworbene Turbo-Features haben wir nach der Messung wieder abgeschaltet, weil sie unter realer Last Durchsatz kosteten statt brachten. Rezepte aus dem Netz ersetzen keine eigene Messung.
- Aliasnamen statt Code-Änderungen: Ein Engine-Wechsel heißt, dass alle angebundenen Dienste mitmüssen. Wir haben das über Modell-Aliasnamen gelöst – die Anwendungen kennen nur den Alias, dahinter lässt sich das Modell tauschen, ohne eine Zeile Code anzufassen.
Genau diese Erfahrung – messen, umstellen, Fallstricke kennen – bieten wir als Dienstleistung an, damit Du sie nicht selbst sammeln musst. Wenn Du wissen willst, wie wir lokale KI im Mittelstand betreiben, lohnt ein Blick in unseren Beitrag zu On-Premise-KI in der Praxis.
Warum sich das Messen trotzdem lohnt
Keine Benchmark-Tabelle aus dem Netz ersetzt Deine eigene Umgebung. Modell, Quantisierung, Hardware-Revision und die Art Deiner Anfragen entscheiden gemeinsam über das Ergebnis. Wir testen deshalb jedes Modell unter identischen Bedingungen mit einem festen Schema – so wie wir es in unserem Artikel zur Modellwahl durch Testen statt Raten beschreiben. Wer nur einmal misst und danach nie wieder, verschenkt Leistung, die bereits bezahlt ist.
Dein nächster Schritt
Wenn Du eine eigene KI im Haus betreiben willst, begleiten wir Dich von der Hardware bis zum laufenden Betrieb. Als kompakte Basis empfehlen wir die Lenovo ThinkStation PGX GB10 mit NVIDIA GB10 Grace Blackwell Superchip, 128 GB LPDDR5X und 1 TB NVMe-SSD. Bevor Du Dich festlegst, kannst Du die Hardware bei uns testen oder mieten – so siehst Du schwarz auf weiß, welche Engine zu Deinem Team passt, bevor Du investierst.
Jetzt entdecken und Dein On-Premise-Setup planen – wir begleiten Dich von der ersten Messung bis zum stabilen Betrieb. Melde Dich einfach bei unserem Team, wir sind direkt am Telefon für Dich da.
Aktuelles rund um KI-Hardware und Inferenz
Ollama, vLLM oder SGLang? Das Engine-Duell auf Deiner DGX Spark
Das beste Modell nützt Dir nichts, wenn die falsche Software es ausführt. Wir haben auf einer DGX Spark drei Inferenz-Engines mit demselben Modell gemessen – und zeigen Dir, welche Werte wirklich zählen.
weiterlesenKann Dein KI-Modell wirklich Werkzeuge bedienen? Unser Test mit 29 Fallen
Jeder spricht von KI-Agenten. Doch ob ein Modell im richtigen Moment das richtige Werkzeug wählt, zeigt kein Datenblatt – sondern nur ein Test mit echten Aufgaben. Wir haben 29 Fallen gestellt und messen, was dabei herauskommt.
weiterlesenNemotron 3.5 Lightning im Härtetest: Warum das bewährte Modell gewinnt
NVIDIA veröffentlicht Nemotron 3.5 Lightning, drei Tage später läuft es bei uns auf einer DGX Spark gegen unser Produktivmodell. Das Ergebnis: Im Schnellmodus erfindet das neue Modell in 7 von 16 Chat-Fällen Fakten – unser Modell in keinem. Ein Praxisbericht über Messen statt Nachbeten.
weiterlesenKI-Server inklusive: Was der SideKick-Server in TeamDavid für Dich bedeutet
Mit dem Rollout steckt der datenschutzkonforme KI-Server SideKick direkt in jeder TeamDavid-Installation mit sitecare. Wir zeigen Dir, was das im Alltag bringt, wie Du ihn aktivierst und warum Deine Daten dabei in Europa bleiben.
weiterlesenKI im eigenen Haus: Warum feste Kosten langfristig günstiger sind
Lokale KI auf eigener Hardware macht Deine Kosten planbar: keine Token-Preise, kein Speicherpreis-Risiko, volle Kontrolle. So rechnest Du es durch.
weiterlesenZehnter Windows-Zero-Day: Was das für Deine IT-Sicherheit bedeutet
Ein anonymer Sicherheitsforscher veröffentlicht immer neue Windows-Lücken – teils live ausgenutzt. Wir ordnen ein, was das für Unternehmen heißt und wann ein Systemwechsel sinnvoll ist.
weiterlesen