Stell Dir vor, Deine Eingangsrechnungen wandern morgens automatisch auf einen Tisch – und am Nachmittag liegt nur noch das auf dem Schreibtisch, was wirklich eine Entscheidung braucht. Genau so läuft Rechnungsprüfung mit KI bei uns im Betrieb. Aber die spannende Frage steckt eine Ebene tiefer: Wie kommt die KI eigentlich an die Zahlen auf dem Beleg? Liest sie das Bild der Rechnung direkt – oder holt sie erst per OCR den Text heraus und strukturiert ihn dann mit einem Sprachmodell? Wir haben beide Wege auf unserer eigenen Hardware gegeneinander gemessen, mit echten, anonymisierten Belegen aus unserem Alltag.
Zwei Wege zum selben Ziel – und ein großer Unterschied
Eine Rechnungsprüfung heißt konkret: Beträge, Positionen und Bestellbezug erkennen und gegen die eigene Bestellung halten. Dafür gibt es zwei Architekturen, die in der Praxis völlig unterschiedlich performen.
Weg 1: Das Bild-Modell liest direkt
Ein multimodales Modell bekommt das Foto oder den Scan der Rechnung und liefert die strukturierten Felder. Kein Zwischenschritt, keine Textextraktion – das Modell „sieht“ das Layout mit.
Weg 2: Erst OCR, dann Text-Modell
Ein OCR-Spezialist zieht den Text aus dem Beleg, ein Sprachmodell sortiert und interpretiert ihn anschließend. Klassisch, verbreitet – und in unseren Messungen überraschend schwach.
Unsere Messwerte: dieselben 75 Testrechnungen
Wir haben beide Pipelines auf unserer DGX Spark mit identischem Testmaterial laufen lassen. Hier die Ergebnisse:
- Bild direkt, unser Produktivmodell: 91,4 % Genauigkeit bei 4,3 Sekunden je Rechnung.
- Bild direkt, spezialisiertes 12-Mrd.-Vision-Modell: 98,1 % – der Genauigkeits-Champion, aber mit 12,9 Sekunden dreimal langsamer.
- Zweistufig (OCR + Text-Modell), Kandidat A: 84,3 % bei 18,9 Sekunden.
- Zweistufig, Kandidat B: 71,0 % bei 24,5 Sekunden.
Beide OCR-Ketten waren also langsamer und schlechter als der direkte Weg. Der Grund ist einleuchtend: Die Zwischenstufe kostet Zeit und verliert Layout-Information. Wo auf der Rechnung eine Zahl steht, ist oft die halbe Bedeutung – OCR wirft genau das weg.
Ein dritter OCR-Spezialist kam mit 89,3 % nahe heran. Es lohnt sich also, Kandidaten einzeln zu messen, statt eine Architektur pauschal abzuschreiben.
Was die Praxis daraus macht
Für uns ist die Sache klar: Wir fahren die Rechnungsprüfung mit direktem Bild-Einlesen und lassen den Menschen die markierten Abweichungen prüfen. Die KI prüft vor, der Mensch entscheidet – Abweichungen werden markiert, nicht automatisch gebucht. Und alles läuft im eigenen Haus: Keine Rechnung verlässt das Netzwerk Richtung Cloud-Anbieter.
Zwei Details aus unseren Messungen solltest Du kennen:
- Die Engine zählt mit: Dasselbe Vision-Modell erreichte auf einer Ausführungs-Engine 95,7 %, auf einer anderen nur 20–50 % – bei doppelter Laufzeit. Wer nur das Modell testet und die Engine wechselt, testet neu.
- Mehr Framework heißt nicht mehr Genauigkeit: Ein groß beworbenes Dokumenten-KI-Framework lag gegen unsere schlanke, deterministische PDF-Textextraktion im Endergebnis hinten (82,3 % gegen 85,5 %) und lieferte als Einziges nicht bei allen Dateien ein Ergebnis. Auf kleineren Testmengen lag das Framework zweimal knapp vorn. Die Reihenfolge ist knapper, als eine Einzelzahl suggeriert.
So findest Du den richtigen Weg für Deine Belege
Die Architekturfrage hat keine pauschale Antwort. Sie hängt von Deiner Belegqualität und Deiner Aufgabe ab. Diese Punkte helfen Dir bei der Entscheidung:
- Belegqualität prüfen: Sind Deine Rechnungen überwiegend saubere PDFs oder gemischte Scans und Fotos? Layout-Treue spricht für den direkten Bild-Weg.
- Mehrere Läufe, gleiche Testmenge: Eine Einzelmessung täuscht. Erst mehrere Durchläufe mit identischem Material zeigen, was stabil ist.
- Zwischenstufe hinterfragen: OCR ist kein Selbstzweck. Wenn Dein Modell das Bild direkt lesen kann, spare Dir den Umweg.
- Mensch bleibt im Loop: Lass Abweichungen markieren statt automatisch buchen – das schafft Vertrauen und Sicherheit.
Genau dafür haben wir unser Vergleichswerkzeug gebaut: Jedes Modell läuft unter denselben Bedingungen, die Ergebnisse sind direkt vergleichbar. Das ist keine Meinung, sondern Messung. Wie wir dabei vorgehen, haben wir in KI-Modellwahl: Warum wir testen statt raten beschrieben. Und wenn Du wissen willst, was KI bei uns täglich im Backoffice bewegt, schau in KI im Backoffice.
Du willst selbst auf eigener Hardware loslegen? Die Lenovo ThinkStation PGX GB10 mit 128 GB ist genau die Klasse Maschine, auf der solche Messungen laufen – kompakt, lokal, ohne Cloud. Damit Du das nicht blind entscheiden musst, zeigen wir Dir die Modelle gern vorher im Showroom in Recklinghausen und stellen Dir ein Testgerät zur Verfügung – so siehst Du am eigenen Belegbestand, was wirklich geht.
Fragen zur Rechnungsprüfung mit KI? Melde Dich.
Schick uns nach Absprache einen Stapel typischer Belege – wir messen, was bei Dir erreichbar ist. Hier erreichst Du unser Team direkt – ohne Warteschleife, mit einem Menschen am Telefon.
Aktuelles rund um KI & Automatisierung
Rechnungsprüfung mit KI: Bild direkt lesen oder erst OCR?
Wir haben auf unserer DGX Spark beide Wege gemessen: Bild-Modell direkt gegen zweistufige OCR-Pipeline. Die Zahlen überraschen – und ändern, wie Du Deine Belege prüfst.
weiterlesenEin Tag auf eigener Hardware: Warum wir neue KI-Modelle erst testen, bevor sie zu Dir kommen
Ein groß angekündigter 30-Milliarden-Kandidat trat gegen unser Produktivmodell an – nach einem Messtag war klar: unbrauchbar für den Kundenchat. Was Du daraus für Deine eigene KI-Entscheidung mitnimmst.
weiterlesenOllama, vLLM oder SGLang? Das Engine-Duell auf Deiner DGX Spark
Das beste Modell nützt Dir nichts, wenn die falsche Software es ausführt. Wir haben auf einer DGX Spark drei Inferenz-Engines mit demselben Modell gemessen – und zeigen Dir, welche Werte wirklich zählen.
weiterlesenKann Dein KI-Modell wirklich Werkzeuge bedienen? Unser Test mit 29 Fallen
Jeder spricht von KI-Agenten. Doch ob ein Modell im richtigen Moment das richtige Werkzeug wählt, zeigt kein Datenblatt – sondern nur ein Test mit echten Aufgaben. Wir haben 29 Fallen gestellt und messen, was dabei herauskommt.
weiterlesenNemotron 3.5 Lightning im Härtetest: Warum das bewährte Modell gewinnt
NVIDIA veröffentlicht Nemotron 3.5 Lightning, drei Tage später läuft es bei uns auf einer DGX Spark gegen unser Produktivmodell. Das Ergebnis: Im Schnellmodus erfindet das neue Modell in 7 von 16 Chat-Fällen Fakten – unser Modell in keinem. Ein Praxisbericht über Messen statt Nachbeten.
weiterlesenKI-Server inklusive: Was der SideKick-Server in TeamDavid für Dich bedeutet
Mit dem Rollout steckt der datenschutzkonforme KI-Server SideKick direkt in jeder TeamDavid-Installation mit sitecare. Wir zeigen Dir, was das im Alltag bringt, wie Du ihn aktivierst und warum Deine Daten dabei in Europa bleiben.
weiterlesen