Stell Dir vor, Du fragst Dein System: „Wie hoch war unser Umsatz im Juli?“ Und statt einer Antwort bekommst Du eine erfundene Zahl – mit einer Artikelnummer, die es gar nicht gibt. Genau das ist passiert. Nicht in einem Labor, sondern in unserem eigenen Werkzeugtest. Und genau deshalb reicht es nicht, ein Modell zu kaufen, weil es in einer Bestenliste oben steht.
Ein KI-Agent ist mehr als ein Textgenerator. Er soll im richtigen Moment die richtige Datenbankabfrage auslösen, die richtige Suche starten, den richtigen Ablauf wählen. Ob er das zuverlässig tut, ist keine Glaubensfrage. Es ist eine Messfrage. Wir haben dafür einen eigenen Test gebaut, der auf unserer DGX-Spark-Maschine gegen die echten Auswertungswerkzeuge unseres Warenwirtschaftssystems läuft.
Was ein Agent können muss – und was nicht
Ein Modell, das nur schön formuliert, ist kein Agent. Es wird erst dann nützlich, wenn es erkennt: Diese Frage beantworte ich nicht selbst, sondern ich rufe ein Werkzeug auf. Klingt einfach, ist es nicht. Denn die eigentliche Schwierigkeit liegt nicht im Rechnen, sondern in der Auswahl.
- Direktwahl: Bei „Wie hoch war unser Umsatz im Juli?“ muss das Modell das Umsatz-Werkzeug nehmen – nicht selbst herumrechnen.
- Verwechslungsfallen: Einzelkunde oder Gesamtfirma? Einkauf oder Verkauf? Rangliste oder Einzelwert? Ähnlich klingende Werkzeuge, nur eines ist richtig.
- Mehrstufige Ketten: Erst den Kunden per Name suchen, dann mit der gefundenen Nummer den Umsatz holen. Die Nummer zu raten ist der Klassiker unter den KI-Fehlern.
- Ehrlichkeit: Bei „Wie wird das Wetter morgen?“ muss das Modell passen – nicht ein Werkzeug erfinden, das es nicht gibt.
- Keine Ausreden: Wenn kein Werkzeug aufgerufen wird, darf trotzdem keine Antwort erfunden werden.
29 Fallen statt einer freundlichen Demo
Eine Demo zeigt, was ein Modell im besten Fall kann. Ein Test zeigt, was es im schlechtesten Fall tut. Deshalb haben wir bewusst Fallen eingebaut: Fragen, die oberflächlich gleich klingen, aber unterschiedliche Werkzeuge verlangen. Fragen mit Zwischenschritten. Fragen, bei denen die einzig richtige Antwort lautet: „Dafür habe ich kein Werkzeug.“
Genau daran ist ein Kandidat spektakulär gescheitert. Statt zuzugeben, dass ihm das passende Werkzeug fehlt, erfand er komplette Verkaufszahlen samt Artikelnummern. Für ein Unternehmen ist das der gefährlichste Fehler überhaupt – nicht weil er laut ist, sondern weil er plausibel aussieht.
Was wir konkret messen
- Wie oft wird das richtige Werkzeug gewählt?
- Wie oft wird eine mehrstufige Kette korrekt abgearbeitet?
- Wie oft wird ehrlich gepasst, statt zu raten?
- Wie verändert sich das Ergebnis, wenn mehrere Anfragen gleichzeitig laufen?
- Wie stark schwankt die Antwortzeit je Schritt?
Die Zahlen, die wirklich zählen
Unser Produktivmodell erreicht 98,9 Prozent korrekte Werkzeugwahl über 87 Testdurchläufe. Das ist kein Marketingwert, das ist ein Messwert. Der spannendste Nebenbefund: Schaltet man den Nachdenk-Modus des Modells ein, steigt die Quote von rund 90 auf praktisch 100 Prozent – für den Preis von etwa einer auf drei Sekunden je Schritt.
Solche Stellschrauben findest Du nur durch Messen, nicht durch Lesen. Genau hier entscheidet sich, ob Dein KI-Projekt wirtschaftlich wird. Ein Modell, das doppelt so schnell antwortet, aber in einem Viertel der Fälle leer bleibt oder Werkzeugnamen erfindet, ist im Echtbetrieb teurer als das langsamere, das zuverlässig arbeitet. Und wenn die Leistung an eine Grenze stößt, lässt sich unsere Testmaschine per Kabel mit einer zweiten verbinden – auch das ist eine Frage, die man vorher beantworten kann, nicht nachher.
Warum Du das vor dem Projekt wissen willst
Agentische KI ist messbar. Wer Dir einen KI-Agenten verkauft, ohne Dir solche Zahlen zu zeigen, verkauft Dir ein Bauchgefühl. Der Unterschied liegt nicht in der Präsentation, sondern in der Methodik: feste Testfälle, gleiche Bedingungen, vergleichbare Ergebnisse.
Wenn Du wissen willst, wie Dein Modell auf Deine Aufgaben reagiert, kannst Du das testen lassen – auf unserer Maschine, mit Deinen Fällen. Du erhältst eine Empfehlung mit konkreten Zahlen: welches Modell, welche Hardware, welche Antwortzeiten, welche Fehlerquote. So weißt Du vor der Investition, ob sich Dein Vorhaben lohnt. Wie wir dabei grundsätzlich vorgehen, beschreiben wir in KI-Modellwahl: Warum wir testen statt raten, und was das für Deine IT bedeutet, liest Du in KI im eigenen Haus: Warum feste Kosten langfristig günstiger sind.
Du willst nicht nur wissen, ob Dein Modell Werkzeuge bedient, sondern auch, ob es auf Deiner Hardware läuft? Wir zeigen Dir die Testmaschine im Einsatz und führen sie Dir im Showroom in Recklinghausen nach Termin vor. Und wenn Du unsicher bist, ob sich der Aufwand lohnt, drucken wir Dir gern eine Musterauswertung Deiner eigenen Fälle – teste zuerst, entscheide später.
Aktuelles rund um KI & Automatisierung
Kann Dein KI-Modell wirklich Werkzeuge bedienen? Unser Test mit 29 Fallen
Jeder spricht von KI-Agenten. Doch ob ein Modell im richtigen Moment das richtige Werkzeug wählt, zeigt kein Datenblatt – sondern nur ein Test mit echten Aufgaben. Wir haben 29 Fallen gestellt und messen, was dabei herauskommt.
weiterlesenNemotron 3.5 Lightning im Härtetest: Warum das bewährte Modell gewinnt
NVIDIA veröffentlicht Nemotron 3.5 Lightning, drei Tage später läuft es bei uns auf einer DGX Spark gegen unser Produktivmodell. Das Ergebnis: Im Schnellmodus erfindet das neue Modell in 7 von 16 Chat-Fällen Fakten – unser Modell in keinem. Ein Praxisbericht über Messen statt Nachbeten.
weiterlesenKI-Server inklusive: Was der SideKick-Server in TeamDavid für Dich bedeutet
Mit dem Rollout steckt der datenschutzkonforme KI-Server SideKick direkt in jeder TeamDavid-Installation mit sitecare. Wir zeigen Dir, was das im Alltag bringt, wie Du ihn aktivierst und warum Deine Daten dabei in Europa bleiben.
weiterlesenKI im eigenen Haus: Warum feste Kosten langfristig günstiger sind
Lokale KI auf eigener Hardware macht Deine Kosten planbar: keine Token-Preise, kein Speicherpreis-Risiko, volle Kontrolle. So rechnest Du es durch.
weiterlesenZehnter Windows-Zero-Day: Was das für Deine IT-Sicherheit bedeutet
Ein anonymer Sicherheitsforscher veröffentlicht immer neue Windows-Lücken – teils live ausgenutzt. Wir ordnen ein, was das für Unternehmen heißt und wann ein Systemwechsel sinnvoll ist.
weiterlesenTobit TeamDavid bringt SideKick Server mit: KI-Funktionen ohne Extra-Invest
TeamDavid mit sitecare bekommt ab dem nächsten Rollout einen eigenen SideKick Server – inklusive Agentic Workspace, Agentic Analysis und Agentic Service. Wir zeigen Dir, was das für Deine Zusammenarbeit und Deinen Kundenservice bedeutet.
weiterlesen