Kann Dein KI-Modell wirklich Werkzeuge bedienen? Unser Test mit 29 Fallen

Kann Dein KI-Modell wirklich Werkzeuge bedienen? Unser Test mit 29 Fallen

Stell Dir vor, Du fragst Dein System: „Wie hoch war unser Umsatz im Juli?“ Und statt einer Antwort bekommst Du eine erfundene Zahl – mit einer Artikelnummer, die es gar nicht gibt. Genau das ist passiert. Nicht in einem Labor, sondern in unserem eigenen Werkzeugtest. Und genau deshalb reicht es nicht, ein Modell zu kaufen, weil es in einer Bestenliste oben steht.

Ein KI-Agent ist mehr als ein Textgenerator. Er soll im richtigen Moment die richtige Datenbankabfrage auslösen, die richtige Suche starten, den richtigen Ablauf wählen. Ob er das zuverlässig tut, ist keine Glaubensfrage. Es ist eine Messfrage. Wir haben dafür einen eigenen Test gebaut, der auf unserer DGX-Spark-Maschine gegen die echten Auswertungswerkzeuge unseres Warenwirtschaftssystems läuft.

Was ein Agent können muss – und was nicht

Ein Modell, das nur schön formuliert, ist kein Agent. Es wird erst dann nützlich, wenn es erkennt: Diese Frage beantworte ich nicht selbst, sondern ich rufe ein Werkzeug auf. Klingt einfach, ist es nicht. Denn die eigentliche Schwierigkeit liegt nicht im Rechnen, sondern in der Auswahl.

  • Direktwahl: Bei „Wie hoch war unser Umsatz im Juli?“ muss das Modell das Umsatz-Werkzeug nehmen – nicht selbst herumrechnen.
  • Verwechslungsfallen: Einzelkunde oder Gesamtfirma? Einkauf oder Verkauf? Rangliste oder Einzelwert? Ähnlich klingende Werkzeuge, nur eines ist richtig.
  • Mehrstufige Ketten: Erst den Kunden per Name suchen, dann mit der gefundenen Nummer den Umsatz holen. Die Nummer zu raten ist der Klassiker unter den KI-Fehlern.
  • Ehrlichkeit: Bei „Wie wird das Wetter morgen?“ muss das Modell passen – nicht ein Werkzeug erfinden, das es nicht gibt.
  • Keine Ausreden: Wenn kein Werkzeug aufgerufen wird, darf trotzdem keine Antwort erfunden werden.

29 Fallen statt einer freundlichen Demo

Eine Demo zeigt, was ein Modell im besten Fall kann. Ein Test zeigt, was es im schlechtesten Fall tut. Deshalb haben wir bewusst Fallen eingebaut: Fragen, die oberflächlich gleich klingen, aber unterschiedliche Werkzeuge verlangen. Fragen mit Zwischenschritten. Fragen, bei denen die einzig richtige Antwort lautet: „Dafür habe ich kein Werkzeug.“

Genau daran ist ein Kandidat spektakulär gescheitert. Statt zuzugeben, dass ihm das passende Werkzeug fehlt, erfand er komplette Verkaufszahlen samt Artikelnummern. Für ein Unternehmen ist das der gefährlichste Fehler überhaupt – nicht weil er laut ist, sondern weil er plausibel aussieht.

Was wir konkret messen

  • Wie oft wird das richtige Werkzeug gewählt?
  • Wie oft wird eine mehrstufige Kette korrekt abgearbeitet?
  • Wie oft wird ehrlich gepasst, statt zu raten?
  • Wie verändert sich das Ergebnis, wenn mehrere Anfragen gleichzeitig laufen?
  • Wie stark schwankt die Antwortzeit je Schritt?

Die Zahlen, die wirklich zählen

Unser Produktivmodell erreicht 98,9 Prozent korrekte Werkzeugwahl über 87 Testdurchläufe. Das ist kein Marketingwert, das ist ein Messwert. Der spannendste Nebenbefund: Schaltet man den Nachdenk-Modus des Modells ein, steigt die Quote von rund 90 auf praktisch 100 Prozent – für den Preis von etwa einer auf drei Sekunden je Schritt.

Solche Stellschrauben findest Du nur durch Messen, nicht durch Lesen. Genau hier entscheidet sich, ob Dein KI-Projekt wirtschaftlich wird. Ein Modell, das doppelt so schnell antwortet, aber in einem Viertel der Fälle leer bleibt oder Werkzeugnamen erfindet, ist im Echtbetrieb teurer als das langsamere, das zuverlässig arbeitet. Und wenn die Leistung an eine Grenze stößt, lässt sich unsere Testmaschine per Kabel mit einer zweiten verbinden – auch das ist eine Frage, die man vorher beantworten kann, nicht nachher.

Warum Du das vor dem Projekt wissen willst

Agentische KI ist messbar. Wer Dir einen KI-Agenten verkauft, ohne Dir solche Zahlen zu zeigen, verkauft Dir ein Bauchgefühl. Der Unterschied liegt nicht in der Präsentation, sondern in der Methodik: feste Testfälle, gleiche Bedingungen, vergleichbare Ergebnisse.

Wenn Du wissen willst, wie Dein Modell auf Deine Aufgaben reagiert, kannst Du das testen lassen – auf unserer Maschine, mit Deinen Fällen. Du erhältst eine Empfehlung mit konkreten Zahlen: welches Modell, welche Hardware, welche Antwortzeiten, welche Fehlerquote. So weißt Du vor der Investition, ob sich Dein Vorhaben lohnt. Wie wir dabei grundsätzlich vorgehen, beschreiben wir in KI-Modellwahl: Warum wir testen statt raten, und was das für Deine IT bedeutet, liest Du in KI im eigenen Haus: Warum feste Kosten langfristig günstiger sind.

Du willst nicht nur wissen, ob Dein Modell Werkzeuge bedient, sondern auch, ob es auf Deiner Hardware läuft? Wir zeigen Dir die Testmaschine im Einsatz und führen sie Dir im Showroom in Recklinghausen nach Termin vor. Und wenn Du unsicher bist, ob sich der Aufwand lohnt, drucken wir Dir gern eine Musterauswertung Deiner eigenen Fälle – teste zuerst, entscheide später.

Aktuelles rund um KI & Automatisierung