Ein Tag auf eigener Hardware: Warum wir neue KI-Modelle erst testen, bevor sie zu Dir kommen

Ein Tag auf eigener Hardware: Warum wir neue KI-Modelle erst testen, bevor sie zu Dir kommen

Es gibt diese Momente, in denen eine Ankündigung so gut klingt, dass man sie am liebsten sofort übernehmen möchte: neue Architektur, effizienter als alles bisher, und überhaupt ein Durchbruch. Genau so ein Kandidat landete bei uns auf dem Tisch – ein Modell mit rund 30 Milliarden Parametern von einem großen Anbieter, beworben als besonders ressourcenschonend. Statt ihn direkt in den Kundenkontakt zu lassen, haben wir ihn einen Tag lang auf unserer eigenen Testmaschine gegen unser bewährtes Produktivmodell antreten lassen. Nach diesem Tag war die Sache entschieden – und zwar nicht knapp.

Warum ein einziger Messtag mehr wert ist als jede Hochglanz-Ankündigung

Der Unterschied zwischen „klingt gut“ und „funktioniert bei Dir“ ist messbar. Nicht in Benchmarks, die auf fremden Servern mit fremden Daten entstehen, sondern auf der Hardware, die bei Dir im Haus steht, mit den Anfragen, die Deine Kundinnen und Kunden tatsächlich stellen. Genau deshalb haben wir unsere Testmaschine fest im Haus – und genau deshalb ist der folgende Vergleich so aufschlussreich.

Die Zahlen, die für sich sprechen

  • Zeit bis zum ersten Zeichen: 24,6 Sekunden beim Kandidaten – gegen 0,10 Sekunden bei unserem Produktivmodell. Das ist keine Optimierungsfrage, das ist im Kundenchat schlicht unbenutzbar.
  • Last unter vier gleichzeitigen Anfragen: 0,12 Anfragen pro Sekunde gegen 4,95. Ein Faktor von rund 40 – und vier parallele Anfragen sind in einem normalen Arbeitstag nichts Besonderes.
  • Leere Antworten: 6 von 24 Antworten kamen komplett leer zurück, weil das Modell sein gesamtes Antwortbudget im internen Nachdenken verbrauchte. Dieses Nachdenken ließ sich mit keinem der vier getesteten Schalter abstellen.
  • Agentischer Werkzeugtest (18 Fälle mit echten Werkzeug-Schemas): unser Modell 18 von 18 richtig bei 1,7 Sekunden je Fall – der Kandidat 11 von 18 bei 39,2 Sekunden je Fall. Einmal erfand er sogar einen Werkzeugnamen, den es überhaupt nicht gibt.
  • Bonus-Befund: Die beworbene Mixture-of-Experts-Architektur war bei näherem Hinsehen keine – das Modell rechnet bei jedem Wort mit allen Parametern. Marketing und Modellkarte widersprachen sich.

Wichtig dabei: Es geht hier nicht darum, ein Modell schlechtzureden. Neue Modelle erscheinen im Wochentakt, und die meisten sind für den jeweils eigenen Zweck einfach die falschen. Das ist völlig normal. Man muss es nur vorher wissen – und nicht erst, wenn die ersten genervten Nachfragen im Postfach liegen.

Was das für Deine eigene KI-Entscheidung bedeutet

Wenn Du KI im Unternehmen einsetzt – ob im Kundenchat, in der Rechnungsprüfung oder in der internen Wissenssuche – dann entscheidet nicht die Ankündigung über den Nutzen, sondern die Antwortzeit auf Deiner Hardware mit Deinen Daten. Wer keine eigene Testmaschine hat, findet solche K.-o.-Kriterien erst nach dem Rollout. Im schlimmsten Fall durch verärgerte Kunden, die auf eine Antwort warten, die nie kommt.

So gehst Du beim Modellwechsel vor

  • Echte Fälle statt Demos: Nimm 15 bis 20 typische Anfragen aus Deinem Alltag und lass beide Modelle dieselben Aufgaben lösen.
  • Latenz messen, nicht schätzen: Zeit bis zum ersten Zeichen und Durchsatz unter paralleler Last sind die zwei Zahlen, die im Betrieb wirklich zählen.
  • Werkzeuge mitprüfen: Sobald Dein Assistent auf Systeme zugreift, gehört ein Werkzeugtest dazu – inklusive der Frage, ob er Namen erfindet, die es nicht gibt.
  • Abbruchkriterien vorher festlegen: Definiere, was ein Modell auf keinen Fall dürfen darf – und verwirf es, wenn es das tut, egal wie gut die Ankündigung war.
  • Auf derselben Maschine vergleichen: Ein Wechsel auf andere Hardware verfälscht jedes Ergebnis. Bleib bei der Umgebung, in der das Modell später laufen soll.

Warum sich eine eigene Testmaschine rechnet

Eine Maschine, auf der Du Modelle gefahrlos ausprobieren kannst, ist kein Luxus, sondern Deine Versicherung gegen teure Fehlentscheidungen. Du testest, ohne Deinen Produktivbetrieb anzufassen, Du siehst die Zahlen, bevor Du sie Deinen Mitarbeitenden zumutest – und Du kannst jede neue Ankündigung gelassen prüfen, statt ihr hinterherzulaufen.

Wenn Du magst, zeigen wir Dir in unserem Showroom in Recklinghausen, wie so ein Testtag konkret aussieht – und wie Du Modelle auf Deiner eigenen Hardware vergleichst. Auf Wunsch stellen wir Dir ein Testgerät zur Verfügung, damit Du den Kandidaten Deiner Wahl selbst durchmessen kannst, bevor Du Dich entscheidest. Wie wir generell an Modellwahl herangehen, liest Du in KI-Modellwahl: Warum wir testen statt raten – und warum feste Kosten im eigenen Haus langfristig günstiger sind als jede Cloud-Rechnung, steht in KI im eigenen Haus: Warum feste Kosten langfristig günstiger sind.

Fazit: Ein Tag Messen schlägt Wochen Produktionsschmerz

Die Lehre aus diesem Test ist methodisch, nicht hämisch: Neue Modelle erscheinen ständig, die meisten passen nicht zu Deinem Zweck, und das ist kein Drama – solange Du es vorher herausfindest. Ein Messtag auf echter Hardware hat uns Wochen Ärger erspart. Genau diesen Messtag bekommst Du bei uns: Wir messen Deinen Modell-Kandidaten auf Deiner Hardware durch und sagen Dir ehrlich, ob er zu Deinem Anwendungsfall passt. Sprich uns einfach an – wir schauen gemeinsam auf Deine Zahlen, bevor Du irgendetwas umstellst.

Aktuelles rund um lokale KI